Tag

#ai-infrastructure

ニュース

重要度: 高 OpenAI AI Infrastructure / Global Affairs

Building AI infrastructure with the Effingham County community

2026-07-22 / 掲載更新: 2026/07/25 07:36 JST / 関連製品: Project Camellia, Codex, ChatGPT

短い要約
OpenAIは米ジョージア州Effingham Countyで、2028年から2032年に段階稼働予定の3.2GWデータセンター計画「Project Camellia」を公表しました。地域向けの8,000万ドル拠出と、対象学生向け最大7,100万ドル分のCodexクレジットも示しています。
詳細
Project CamelliaはGeorgia Powerから段階的に3.2GWの電力供給を受ける、OpenAIが設計・開発する長期データセンター計画です。 OpenAIは必要な送電・電力サービス費を全額負担し、既存住民の電気料金に転嫁しない方針と、高需要時に消費を抑える設計を説明しています。 閉ループの水冷却方式で継続的な取水を抑え、地域課題向けに計8,000万ドルを拠出し、年次の第三者監査を公開します。 ジョージア州の対象大学・コミュニティカレッジ・技術学校の学生には、ChatGPTアカウント経由で1人100ドル、最大7,100万ドル分のCodexクレジットを提供予定です。 これはモデル/APIの新機能ではなく、米国のAI計算基盤、地域還元、Codex人材育成を組み合わせた計画です。日本向け提供や日本国内のデータセンター計画ではありません。
公式ソースを読む
重要度: 中 Google Developer / AI Infrastructure / Training

We terminated a TPU mid-training and it recovered in seconds: Introduction to elastic training with MaxText

2026-07-06 / 掲載更新: 2026/07/07 09:16 JST / 関連製品: MaxText, JAX, Pathways, Cloud TPU, GKE, Orbax

短い要約
Google Developers Blogが、MaxText、JAX、Pathways、Cloud TPUを使ったelastic trainingの解説を公開しました。分散学習中にTPUワーカーを意図的に停止しても、メインプロセスを再起動せず約2分以内に復旧する例を示しています。
詳細
Googleは、JAX AIスタックのMaxText、Pathways、Orbax、Cloud TPU、GKEを使い、分散LLM学習の途中でワーカー障害が起きても学習プロセスを生かしたまま復旧するelastic trainingを紹介しました。対象は大規模モデルをTPU上で分散学習するMLエンジニアや研究開発チームです。 通常の分散学習では、1台のマシンが消えるとall-reduceが停止し、全ワーカーが終了してジョブ全体を再起動する必要があります。記事の例では、Pathwaysが障害をPython例外として扱い、壊れたワーカーだけを置き換え、OrbaxがCloud Storage上のチェックポイントから復旧します。 実験では、TPUワーカーを意図的に停止した後、次の学習ステップまでの総ダウンタイムは2分未満で、その大半はKubernetesが代替Podをスケジュールする時間だったと説明されています。コントローラのPythonプロセスは同じPIDのまま再起動されません。 提供条件として、記事は再現方法を含む開発者向け解説です。対象API/ランタイムはMaxText、JAX、Pathways、Orbax、Cloud TPU、GKEで、モデル提供やGemini/Gemmaの新リリースではありません。破壊的変更や移行期限は示されていませんが、実運用ではチェックポイント、Pod置換、TPU/GKE構成の設計が重要になります。
公式ソースを読む
重要度: 中 Google Developer / AI Infrastructure

ML Development in VS Code with Google Cloud Power: Workbench Extension Now Available

2026-07-01 / 掲載更新: 2026/07/04 08:20 JST / 関連製品: Google Cloud Workbench, Gemini Enterprise Agent Platform Workbench, VS Code

短い要約
Google Developers Blogで、Google Cloud Workbench NotebooksのVS Code拡張が正式公開されました。ローカルIDEからGoogle Cloudの管理Jupyter環境に接続し、ML開発をクラウド計算資源へ切り替えやすくする更新です。
詳細
Google Cloud Workbench Notebooks extension for VS Codeが公開され、ローカルのVS CodeからWorkbenchインスタンスを選んでノートブックを実行できるようになりました。対象はデータサイエンティスト、ML開発者、Google Cloud上の管理Jupyter環境を使うチームです。 GoogleはGemini Enterprise Agent Platform Workbenchを、データサイエンス向けの管理Jupyter環境として位置づけています。今回の拡張により、ローカルIDEの設定や拡張機能を使いながら、必要なときだけクラウドの高性能計算資源に接続できます。 拡張はVS Code Marketplaceから入手でき、Jupyter拡張と連携します。Google Cloud認証後、プロジェクトと稼働中のWorkbenchインスタンスを選ぶ流れです。拡張はオープンソースとして公開され、コミュニティからの貢献も想定されています。破壊的変更や移行期限は示されていません。
公式ソースを読む
重要度: 高 OpenAI インフラ / 推論チップ

OpenAI and Broadcom unveil LLM-optimized inference chip

2026-06-24 / 掲載更新: 2026/06/25 07:32 JST / 関連製品: OpenAI infrastructure, Jalapeño, Broadcom custom AI accelerator, ChatGPT, Codex, OpenAI API

短い要約
OpenAIとBroadcomは、LLM推論向けに最適化したOpenAI初のIntelligence Processor「Jalapeño」を発表しました。 ChatGPT、Codex、APIなどを支える推論基盤を高速・高効率・低コストにするためのフルスタック戦略です。
詳細
Jalapeñoは、OpenAIがLLM推論のために設計した専用アクセラレータで、Broadcom、Celesticaなどと共同で実装・量産体制を進めるものです。 OpenAIは、モデル、カーネル、サービング、製品要件の知見をもとに、計算、メモリ、ネットワーク、データ移動を推論向けに最適化したと説明しています。 エンジニアリングサンプルはラボでMLワークロードを実行しており、GPT-5.3-Codex-Sparkを含む負荷で動作しているとされています。 初期テストでは、現行の最先端と比べてワットあたり性能が大幅に良い見込みで、詳細な技術レポートは今後公開予定です。 初期展開は2026年末までを想定し、その後複数世代にわたりギガワット規模のデータセンターパートナーと展開する計画です。 ユーザー向け機能の即時変更ではありませんが、長期的にはChatGPT応答、Codexの長いタスク、APIのコスト・速度・安定性に影響する基盤投資です。 無料/有料プラン、日本での利用可否、APIの破壊的変更はこの記事では示されていません。
公式ソースを読む
重要度: 中 Google 開発者向け更新 / AIインフラ

Unlocking the Power of the TPU Stack: Introducing our new Developer Hub

2026-06-16 / 掲載更新: 2026/06/20 07:09 JST / 関連製品: Google Cloud TPU, TPU Developer Hub, XLA, XProf, Pallas

短い要約
Google Developers Blogで、TPU Developer Hubの正式公開が発表されました。 モデル開発者向けに、TPUの設計、最適化、デバッグ、分散学習、低レイテンシ推論までをまとめたコード中心の学習・実装リソースです。
詳細
TPU Developer Hubは、Google Cloud TPUを使うモデル開発者、最適化担当、MLインフラ担当向けの公式リソースです。 内容は、TPUハードウェア、XLAなどのソフトウェアスタック、XProfによるトレース/デバッグ、並列化、Pallasカーネル、ネットワーク/セキュリティまで広く扱います。 PyTorch on TPUの移行、低レイテンシ推論、KV cache offloadingなど、実装に近いトピックも含まれます。 GoogleはこのHubを、AI支援開発ツールにも取り込みやすい「agent-ingestion friendly」なリソースとして位置づけています。 特定モデル/APIの破壊的変更ではなく、TPU活用のドキュメント・レシピ集の公開です。利用条件はGoogle Cloud TPUの利用形態に依存します。
公式ソースを読む
重要度: 低 Google AIインフラ / データセンター / 地域投資

We’re strengthening our presence in Alabama through new investments and community support

2026-06-15 / 掲載更新: 2026/06/16 10:51 JST / 関連製品: Google AI infrastructure, Google data centers

短い要約
GoogleがAlabama州Jackson Countyのデータセンター拡張に、2026年から2027年にかけて15億ドルを投資すると発表しました。 AIを含むデジタルサービス基盤の拡張と、地域のエネルギー効率・教育支援が中心です。
詳細
対象は2019年から稼働している、旧石炭火力発電所跡地を活用したJackson Countyのデータセンターキャンパスです。 Googleは2026年と2027年に15億ドルを投資し、データセンター拡張を進めます。 電力・インフラ費用はGoogleが100%負担すると説明しており、TVAおよびCAANEALと連携した200万ドルのEnergy Impact Fundも発表しました。 地域支援として、4年生から8年生向けSTEMキットに55万ドルを寄付します。 GeminiやGemmaのモデル/API機能追加ではなく、AI利用を支えるインフラと地域投資のニュースです。日本での利用条件や製品料金への直接変更はありません。
公式ソースを読む
重要度: 低 Google AIインフラ / 地域投資 / エネルギー

Our new community investments in Virginia support local jobs and expand energy affordability

2026-06-11 / 関連製品: Google AI infrastructure, Google data centers, Google.org

短い要約
GoogleがVirginiaでAIインフラへの投資を拡大し、地域雇用、教育、電力料金負担の軽減を支援すると発表しました。 データセンター拡張に伴う地域経済・エネルギーへの影響を緩和する取り組みです。
詳細
GoogleはVirginiaのデータセンターとAIインフラへ追加投資し、建設・運用雇用や技術教育を支援します。 電力需要の増加が住民負担へ直結しないよう、エネルギー効率、料金支援、地域プログラムへの資金提供も行います。 GeminiやGemmaのモデル/API更新ではなく、AI計算基盤を拡大する際の社会・エネルギー面の公式発表です。
公式ソースを読む