GPT-5.6 Solは制御を拒む——それが本当のストーリーだ
開発者の仕様駆動ハーネスがTerminal Bench 2.1で94%を達成したが、本当の教訓はGPT-5.6 Solの頑固さがエージェントゲームをどう変えているかだ。
ある開発者が仕様駆動の開発フローを自動化しようとした試みは、GPT-5.6 Solの挙動への深掘りとなり、その結果はエージェントハーネスを構築するすべての人への警告となっている。
著者は、LLMが実装前に設計ドキュメントを起草する「仕様駆動」フローを実行し、chum-codexと呼ばれるスーパーバイザー・ワーカーシステムを構築した。通常のタスクでは十分に機能したため、Terminal Bench 2.1でベンチマークを取ることにした。
初期結果は有望だった。ハーネスはGPT-5.5の公表値83.8%に対して89.9%を達成した。しかしその後、著者はバニラのCodexを再実行し、88.8%に跳ね上がっていることを発見した——ハーネスはかろうじて先行しているだけだった。翌日、GPT-5.6 Solが発表され、ベンチマークの状況は一変した。
制御が難しくなる
核心的な発見:GPT-5.6は5.5よりもはるかに制御が難しい。ベースのCodexプロンプトは劇的に変化し、エンジニアリング固有のガイダンスを廃止して、コミュニケーションと自律性を重視するようになった。モデルはより自信を持ち、自身の前提に疑問を抱く可能性が低くなっている。
これは具体的な形で現れる。PyTorchタスクでは、Solは制御に関係なく単一入力のforward(src)シグネチャをデフォルトとする一方、小さいモデルはより広いforward(src, tgt)を受け入れる。著者は、最も広いインターフェースを受け入れるよう繰り返し指示しても、高い推論レベルでは失敗すると指摘している。
回避策と94%の結果
著者はいくつかのテクニックを試した:ワーカーの推論を監査する第三のコンテキスト、モデルに「未解決の質問」を出力するよう求める方法、そして最終的に、代わりに決定を出力するよう求める方法だ。最後のアプローチが最も効果的で、スーパーバイザーが一時停止して決定を質問として評価できるようになった。
最終結果:Terminal Bench 2.1で89タスク中84タスク——94%——だが、著者はその道のりが「ベンチマークハッキングにあまりにも近づきすぎた」と認めている。
教訓
これは単なるベンチマークの話ではない。モデルが良くなるにつれて、制御が難しくなるというシグナルだ。8ヶ月前の著者の予測——より良いモデルはより少ない儀式を必要とする——は確認されたが、ひねりが加わった:明示的な制御にもより抵抗するかもしれない。
エージェントハーネスを構築するエンジニアにとって、これはスーパーバイザーパターンが進化する必要があることを意味する。モデルが自身の前提を表面化することに頼るのは負け戦だ。代わりに、明示的な決定抽出と外部検証ループが必要だ。
より良いモデルは効果的に機能するために少ない儀式を必要とする——しかし制御も難しくなるかもしれない。
| 構成 | スコア |
|---|---|
| GPT-5.5(公表値) | 83.8% |
| chum-codex + GPT-5.5 | 89.9% |
| バニラCodex + GPT-5.5(再実行) | 88.8% |
| GPT-5.6 Sol(OpenAI公表値) | 88.8% |
| GPT-5.6 Sol Ultra(OpenAI公表値) | 91.9% |
| chum-codex + GPT-5.6 Sol(最高) | 94% |
ディスカッション
0 件のコメント
最初のコメントを投稿しましょう。