Jalapenoの初期ベンチマークでAI推論の速度と効率を公表
OpenAIは初の自社推論チップJalapenoについて、公開ベンチマークで高い電力効率と低遅延を示したと発表しました。
年内にOpenAIの計算基盤へ展開を始め、次世代チップも開発中です。
JalapenoはGPT-OSS 120B、DeepSeek R1、Kimi K2.5で、比較対象よりピーク時のAI処理量/ワットが1.5-1.9倍、エンドツーエンド遅延が1.7-3.6分の1だったとしています。
チップ、メモリ、ネットワーク、サービングソフトウェアを推論ワークロード向けに共同設計し、対話型エージェントで重要なprefillとdecodeの両方を最適化します。
OpenAIはCodexとGPT-Astraを用い、当初計画に無かった3つのオープンウェイトモデルを2か月で高性能化したとも説明しています。
年内の自社基盤への展開開始が予定され、Gen 2は開発中、Gen 3も設計段階です。外部アクセラレータの利用は継続します。
API仕様や利用プランに対する破壊的変更の発表ではありませんが、低遅延な推論とエージェントの提供コストに影響する基盤更新です。