Tag

#local-llm

ニュース

重要度: 高 Google 開発者向け更新 / ローカルAI・Web推論

LiteRT.js, Google's high performance Web AI Inference

2026-07-09 / 掲載更新: 2026/07/12 10:43 JST / 関連製品: LiteRT.js, LiteRT, Google AI Edge, WebGPU, WebNN, XNNPACK, AI Edge Quantizer, LiteRT Torch

短い要約
GoogleはLiteRTのJavaScriptバインディングであるLiteRT.jsを発表しました。 Webブラウザ内で.tfliteモデルをローカル実行し、プライバシー、低遅延、サーバーコスト削減を狙うWeb AI推論基盤です。
詳細
LiteRT.jsは、JavaScript/TypeScriptのWebアプリからブラウザ内でML/AIモデルをクライアント側実行するための新しいLiteRTバインディングです。 既存の.tfliteモデルをモバイル/デスクトップのWebブラウザへ展開でき、TensorFlow.jsにおける.tflite対応の発展形として位置づけられています。 推論基盤はWebAssemblyとLiteRTスタックを使い、CPUではXNNPACK、GPUではML Drift/WebGPU、今後はWebNN経由のNPU利用も見込まれます。 初期リリースではLiteRT.jsのnpmパッケージとデモが提供され、テキスト生成、物体検出、音声処理などのオンデバイスWeb AI用途を想定しています。 ローカル実行により、サーバー推論コストの削減、低遅延、プライバシー向上を狙えるため、WebアプリでAI機能を配布する開発者に関係します。 PyTorchモデルはLiteRT TorchでLiteRTへ変換でき、AI Edge Quantizerによる量子化も利用可能です。 記事内ではAPI移行期限、破壊的変更、有料/無料条件、日本での提供可否は明記されていません。
公式ソースを読む
重要度: 中 Google 開発者向け事例 / エージェント・エッジAI

Bridging the Domain Gap: AI Race Coach built with Antigravity and Gemini

2026-07-08 / 掲載更新: 2026/07/12 10:42 JST / 関連製品: Antigravity, Gemini API, Agent Development Kit, Gemma 4, Google Cloud Platform, Jetpack Compose, Text-to-Speech

短い要約
Google Developers Blogは、AntigravityとGeminiで構築したリアルタイムAI Race Coach事例を公開しました。 レースカーのテレメトリを処理し、Gemma 4のローカル推論とGemini APIのクラウド推論を組み合わせて運転助言を出す構成です。
詳細
Google Developer ExpertsがSonoma Racewayで構築した事例で、レース中のドライバーに即時で実行可能な助言を返すAIコーチを扱っています。 Antigravityがステートフルなオーケストレーションと車両テレメトリ取り込みを担い、ADK、Pythonバックエンド、Jetpack Composeの車載ダッシュボードを組み合わせています。 Gemini APIは走行後のドライバーモデリングやクラウド推論に使われ、Gemma 4はゼロレイテンシーのオフライン音声コーチング用エッジ推論としてローカル実行されています。 物理法則とリアルタイム検証に基づく設計を通じて、高速・高リスク領域で生成AIの信頼性を確保する実装例になっています。 製品の一般提供開始や料金、地域条件、SDK移行期限、破壊的変更はこの記事では示されていません。
公式ソースを読む
重要度: 高 Google ローカルLLM / オープンモデル / 開発者向け更新

DiffusionGemma: The Developer Guide

2026-06-10 / 関連製品: DiffusionGemma, Gemma 4, vLLM, Hugging Face Transformers, MLX, Google Cloud Model Garden

短い要約
Googleが、トークンを逐次生成せず256トークンのブロックを並列に反復修正する実験的モデルDiffusionGemmaの開発者ガイドを公開しました。 26B MoEのうち推論時に3.8Bパラメータを活性化し、量子化すれば18GB VRAM以内でのローカル実行を想定しています。
詳細
DiffusionGemmaはGemma 4の26B MoE基盤を使い、256トークン単位の拡散・デノイジングで文章を並列生成します。双方向注意により、生成途中で前の誤りを修正できる点が通常の自己回帰モデルとの違いです。 Googleによる測定では、RTX 5090で毎秒700トークン超、NVIDIA H100 1基で毎秒1,000トークン超とされ、GPU上で最大4倍の高速化をうたっています。 モデルは26Bですが推論時の活性パラメータは3.8Bで、量子化構成では18GB VRAM以内を想定しています。RTX 4090/5090などの消費者向けGPUからHopper、Blackwellまで対象です。 重みはHugging FaceでApache 2.0ライセンスとして公開され、vLLMのOpenAI互換ローカルサーバー、Hugging Face Transformers、SGLang、MLXに対応します。公式ファインチューニングレシピも公開されています。 Google Cloud Model GardenとNVIDIA NIMでも展開できます。記事ではOllama、LM Studio、llama.cppへの対応は明記されていません。 Google AI StudioやGemini APIでの提供は示されておらず、ダウンロード可能な実験的オープンモデルとしての提供が中心です。 通常のGemma利用規約ではなく、公開されたDiffusionGemma重みについて記事はApache 2.0ライセンスと明記しています。
公式ソースを読む
重要度: 高 Google Local LLM / Model Optimization

Optimizing model compression, mobile and laptop efficiency with QAT

2026-06-05 / 関連製品: Gemma 4, Gemma 4 QAT, Google AI Edge, LiteRT

短い要約
GoogleはGemma 4向けの量子化対応トレーニング(QAT)モデルを紹介し、モバイルやノートPCでのローカル推論を効率化する方向を示しました。Gemma系をローカルLLMとして使う場合、モデルサイズと実行効率に直接関係する更新です。
詳細
QATは、量子化後の精度低下を抑えるために、学習段階から低ビット推論を想定するモデル最適化手法です。今回の更新はGemma 4をモバイル、ノートPC、オンデバイス環境で動かす開発者に関係します。ローカル実行可否は、対象モデルサイズ、端末メモリ、ランタイム、量子化形式に依存しますが、Google AI EdgeやLiteRT系のオンデバイス推論に向けた流れが明確です。APIの破壊的変更ではなく、ローカル/エッジでの推論効率を高めるモデル提供・最適化の情報です。商用利用や利用条件はGemmaの公式利用規約に従う必要があります。
公式ソースを読む
重要度: 高 Google Local LLM / Developer / Google AI Edge

Bringing Gemma 4 12B to your Laptop: Unlocking Local Agentic Workflows with Google AI Edge

2026-06-03 / 関連製品: Gemma 4 12B, Google AI Edge, LiteRT, local LLM

短い要約
GoogleはGemma 4 12BをノートPC上で動かし、ローカルのエージェント型ワークフローに使う開発者向け情報を公開しました。GemmaをAPIではなく手元の端末で動かしたい場合に重要です。
詳細
Gemma 4 12Bは、GoogleのオープンモデルGemma系の12B規模モデルです。記事はGoogle AI Edgeを使って、ローカルPC上でエージェント型ワークフローを構築する方向を示しています。ローカル実行は端末メモリ、アクセラレータ、量子化、推論ランタイムに依存し、クラウドAPIのように常に同じ環境で動くわけではありません。Google AI Studio/APIの更新というより、オンデバイス/ローカルLLM実行の開発者向け導線です。商用利用や再配布はGemma公式利用規約の確認が必要です。Ollama、LM Studio、llama.cpp、MLX、vLLMなど既存ローカルLLMツールとの比較検証にも関係します。
公式ソースを読む