Tag

#Interpretability

ニュース

重要度: 高 Anthropic Research / Interpretability / Safety

A global workspace in language models

2026-07-06 / 掲載更新: 2026/07/07 09:16 JST / 関連製品: Claude, J-space, Language Models

短い要約
Anthropicが、Claude内部に「J-space」と呼ぶ小さな内部表現群が自然に生じているという解釈可能性研究を公開しました。出力に現れない内部思考や、多段推論で使われる作業領域に近い機能を調べた研究です。
詳細
Anthropicの新しい解釈可能性研究は、Claudeの内部にJ-spaceと呼ぶ小さな神経パターン群があり、通常の内部処理とは異なる特別な役割を持つと報告しています。J-spaceはモデルが言葉として出力していない概念を内部的に保持し、いわば沈黙した作業領域として機能する可能性があります。 研究では、J-space内の表現はClaudeが報告しやすく、ユーザーが「何を考えているか」を尋ねたときに反映されやすいと説明されています。また、ユーザーが何かを考えるよう指示した場合に、対応するJ-space表現が活性化しやすいとも述べています。 多段推論では、中間ステップが出力されない場合でもJ-space内に現れ、こうした表現がタスク性能に因果的に関係する実験結果が示されています。一方、J-spaceを使えなくしても流暢な会話や単純な事実想起などは残るが、高次の認知機能が失われると説明しています。 Anthropicは、これはClaudeが人間のように意識を持つことを示すものではないと明記しています。実務上は、モデル内部で何が推論・保持されているかを理解し、安全性、監査、解釈可能性の研究を進めるための基礎的な発表です。APIや製品提供条件の変更、移行期限、破壊的変更はありません。
公式ソースを読む