Driving the Agent Quality Flywheel from Your Coding Agent
Google Developers Blogは、エージェント品質改善のための「Agent Quality Flywheel」を、コーディングエージェントから実行できる開発者向けスキルとして紹介しました。評価データ準備、推論、採点、失敗分析、最適化を反復する流れを自動化します。
この更新は、プロンプト変更が本当に品質を改善したか、別のケースを壊していないかを検証する開発者向け手法です。既存のOpenTelemetry traces、手作りケース、合成シナリオから評価データを作り、エージェントを実行してトレースを生成します。採点ではGoogleのadaptive AutoRatersまたは独自メトリクスを利用し、失敗クラスタを分析して改善対象を絞ります。AutoRatersはGoogle DeepMindとの協力で開発されたと説明されています。対象は本番エージェントを継続改善する開発チームで、特定APIの移行期限や破壊的変更は示されていません。