Scaling Agentic RL: High-Throughput Agentic Training with Tunix
Googleは、ツール利用型LLMエージェントの強化学習後学習を効率化するJAXネイティブライブラリTunixを紹介しました。非同期ロールアウトと生産者・消費者パイプラインでTPUの待機時間を減らす設計です。
Tunixは、ネットワークI/Oやツール実行待ちの間にも別のエージェント軌跡を処理し、TPUの稼働率を維持します。
可変長の軌跡を継続的に学習器へ流すため、同期バッチの待ち時間を抑えます。
vLLM-TPUとSGLang-Jaxの非同期推論に対応し、カスタムのオープンソース環境を組み込む抽象化と継続的なRL指標プロファイリングを提供します。
Gemini APIの新エンドポイントではなく、TPU上でエージェントRLを訓練する開発者向けの基盤更新です。
ローカルLLM実行向けではなく、分散学習とGoogle TPU環境を前提としています。