GPT-Red: Unlocking Self-Improvement for Robustness
OpenAIは、プロンプトインジェクションなどを自動探索する内部専用レッドチームモデルGPT-Redを発表しました。
+GPT-Redによる敵対的学習をGPT-5.6へ組み込み、最難関の直接プロンプトインジェクション評価で失敗を大幅に減らしたとしています。
GPT-Redは自己対戦型の強化学習で、攻撃モデルと防御側LLMを同時に訓練し、現実的なツール・ブラウザ・ローカルファイルの脅威環境で脆弱性を探索します。
+OpenAIはGPT-Redを外部提供せず、生成した攻撃を後続の本番モデル訓練に利用すると説明しています。GPT-Red自体はAPI、ChatGPT、Codexの利用者へ公開されません。
+GPT-5.6にはこの敵対的データを組み込み、4か月前の最高性能本番モデル比で、最難関の直接プロンプトインジェクション評価の失敗が6分の1になったとしています。
+GPT-Redは、Codex CLIエージェントを対象にしたデータ流出シナリオでも、通常のGPT-5.5ベースラインより効果的かつトークン効率よく攻撃を見つけたと報告しています。
+新しいAPIモデル、料金、プラン、移行期限、破壊的変更はありません。開発者にとっては、エージェントの外部データ接続で残るプロンプトインジェクション対策を、モデル側の訓練とアプリ側の多層防御の両方で継続する必要があるという示唆です。