Tag

#on-device-ai

ニュース

重要度: 高 Google 開発者向け更新 / ローカルAI・Web推論

LiteRT.js, Google's high performance Web AI Inference

2026-07-09 / 掲載更新: 2026/07/12 10:43 JST / 関連製品: LiteRT.js, LiteRT, Google AI Edge, WebGPU, WebNN, XNNPACK, AI Edge Quantizer, LiteRT Torch

短い要約
GoogleはLiteRTのJavaScriptバインディングであるLiteRT.jsを発表しました。 Webブラウザ内で.tfliteモデルをローカル実行し、プライバシー、低遅延、サーバーコスト削減を狙うWeb AI推論基盤です。
詳細
LiteRT.jsは、JavaScript/TypeScriptのWebアプリからブラウザ内でML/AIモデルをクライアント側実行するための新しいLiteRTバインディングです。 既存の.tfliteモデルをモバイル/デスクトップのWebブラウザへ展開でき、TensorFlow.jsにおける.tflite対応の発展形として位置づけられています。 推論基盤はWebAssemblyとLiteRTスタックを使い、CPUではXNNPACK、GPUではML Drift/WebGPU、今後はWebNN経由のNPU利用も見込まれます。 初期リリースではLiteRT.jsのnpmパッケージとデモが提供され、テキスト生成、物体検出、音声処理などのオンデバイスWeb AI用途を想定しています。 ローカル実行により、サーバー推論コストの削減、低遅延、プライバシー向上を狙えるため、WebアプリでAI機能を配布する開発者に関係します。 PyTorchモデルはLiteRT TorchでLiteRTへ変換でき、AI Edge Quantizerによる量子化も利用可能です。 記事内ではAPI移行期限、破壊的変更、有料/無料条件、日本での提供可否は明記されていません。
公式ソースを読む
重要度: 中 Microsoft 開発者・端末向け更新 / Copilot+ PCローカルAIコンポーネント

Windows AI components release information: 2026-06-23 updates

2026-06-23 / 掲載更新: 2026/06/26 07:24 JST / 関連製品: Windows AI components, Copilot+ PCs, Execution Provider, Settings Model, Image Transform, Image Processing, Phi Silica, Image Search, Semantic Analysis, Content Extraction

短い要約
MicrosoftはCopilot+ PC向けWindows AI componentsの2026-06-23更新を公開しました。 Execution Provider 2.2606系、Phi SilicaやImage Processingなどの1.2605.856.0系コンポーネントがKB単位で更新されています。
詳細
Windows AI componentsは、Copilot+ PC上でAIモデルをローカル実行するための基盤コンポーネントです。 今回の一覧では、Execution Provider 2.2606.1.0/2.2606.3.0、Settings Model 1.2605.856.0、Image Transform 1.2605.856.0、Image Processing 1.2605.856.0、Phi Silica 1.2605.856.0などが2026-06-23付で追加されています。 Image Search、Semantic Analysis、Content Extractionも1.2605.856.0として同日更新に含まれます。 対象はCopilot+ PC利用者、WindowsローカルAI機能、オンデバイスAIアプリや端末管理に関わる開発者・IT管理者です。 詳細な修正内容やインストール条件は各KB記事で確認する形式です。Microsoft 365 CopilotやCopilot Studioの機能追加ではなく、Windows端末側のAI実行基盤の更新です。 無料/有料、個人/法人、日本での個別提供条件、APIの破壊的変更はこの一覧ページでは示されていません。
公式ソースを読む
重要度: 高 Google ローカルLLM / オープンモデル / 開発者向け更新

DiffusionGemma: The Developer Guide

2026-06-10 / 関連製品: DiffusionGemma, Gemma 4, vLLM, Hugging Face Transformers, MLX, Google Cloud Model Garden

短い要約
Googleが、トークンを逐次生成せず256トークンのブロックを並列に反復修正する実験的モデルDiffusionGemmaの開発者ガイドを公開しました。 26B MoEのうち推論時に3.8Bパラメータを活性化し、量子化すれば18GB VRAM以内でのローカル実行を想定しています。
詳細
DiffusionGemmaはGemma 4の26B MoE基盤を使い、256トークン単位の拡散・デノイジングで文章を並列生成します。双方向注意により、生成途中で前の誤りを修正できる点が通常の自己回帰モデルとの違いです。 Googleによる測定では、RTX 5090で毎秒700トークン超、NVIDIA H100 1基で毎秒1,000トークン超とされ、GPU上で最大4倍の高速化をうたっています。 モデルは26Bですが推論時の活性パラメータは3.8Bで、量子化構成では18GB VRAM以内を想定しています。RTX 4090/5090などの消費者向けGPUからHopper、Blackwellまで対象です。 重みはHugging FaceでApache 2.0ライセンスとして公開され、vLLMのOpenAI互換ローカルサーバー、Hugging Face Transformers、SGLang、MLXに対応します。公式ファインチューニングレシピも公開されています。 Google Cloud Model GardenとNVIDIA NIMでも展開できます。記事ではOllama、LM Studio、llama.cppへの対応は明記されていません。 Google AI StudioやGemini APIでの提供は示されておらず、ダウンロード可能な実験的オープンモデルとしての提供が中心です。 通常のGemma利用規約ではなく、公開されたDiffusionGemma重みについて記事はApache 2.0ライセンスと明記しています。
公式ソースを読む
重要度: 高 Google Local LLM / Model Optimization

Optimizing model compression, mobile and laptop efficiency with QAT

2026-06-05 / 関連製品: Gemma 4, Gemma 4 QAT, Google AI Edge, LiteRT

短い要約
GoogleはGemma 4向けの量子化対応トレーニング(QAT)モデルを紹介し、モバイルやノートPCでのローカル推論を効率化する方向を示しました。Gemma系をローカルLLMとして使う場合、モデルサイズと実行効率に直接関係する更新です。
詳細
QATは、量子化後の精度低下を抑えるために、学習段階から低ビット推論を想定するモデル最適化手法です。今回の更新はGemma 4をモバイル、ノートPC、オンデバイス環境で動かす開発者に関係します。ローカル実行可否は、対象モデルサイズ、端末メモリ、ランタイム、量子化形式に依存しますが、Google AI EdgeやLiteRT系のオンデバイス推論に向けた流れが明確です。APIの破壊的変更ではなく、ローカル/エッジでの推論効率を高めるモデル提供・最適化の情報です。商用利用や利用条件はGemmaの公式利用規約に従う必要があります。
公式ソースを読む
重要度: 高 Google Local LLM / Developer / Google AI Edge

Bringing Gemma 4 12B to your Laptop: Unlocking Local Agentic Workflows with Google AI Edge

2026-06-03 / 関連製品: Gemma 4 12B, Google AI Edge, LiteRT, local LLM

短い要約
GoogleはGemma 4 12BをノートPC上で動かし、ローカルのエージェント型ワークフローに使う開発者向け情報を公開しました。GemmaをAPIではなく手元の端末で動かしたい場合に重要です。
詳細
Gemma 4 12Bは、GoogleのオープンモデルGemma系の12B規模モデルです。記事はGoogle AI Edgeを使って、ローカルPC上でエージェント型ワークフローを構築する方向を示しています。ローカル実行は端末メモリ、アクセラレータ、量子化、推論ランタイムに依存し、クラウドAPIのように常に同じ環境で動くわけではありません。Google AI Studio/APIの更新というより、オンデバイス/ローカルLLM実行の開発者向け導線です。商用利用や再配布はGemma公式利用規約の確認が必要です。Ollama、LM Studio、llama.cpp、MLX、vLLMなど既存ローカルLLMツールとの比較検証にも関係します。
公式ソースを読む