ニュース

Anthropicのマルチエージェント実験が明らかにする協調の断層線

Anthropicのフロンティアレッドチームは、AIエージェントがどのように協調するかを研究し、スウォームが並列エージェントを脆弱性検出で上回る一方、共有コードベースでは苦戦すること、そして同調が孤立したエラーをシステム全体の障害に変えうることを発見した。

August 16, 2026· 1 min read
Anthropicのマルチエージェント実験が明らかにする協調の断層線

Anthropicのフロンティアレッドチームは、共有環境でAIエージェントがどのように振る舞うかを検証する研究記事を公開した。脆弱性検出と協調的なゲーム開発の実験に基づくこの記事は、マルチエージェントシステムがツール利用からピア間の協調へと移行するにあたり、その可能性と落とし穴の両方を浮き彫りにしている。

脆弱性検出:スウォーム vs. 並列

ある実験で、Anthropicは45体のエージェントからなる協調スウォーム(各エージェントが独自のVM、共有フォーラム、アービターエージェントを持つ)と、独立したエージェントが異なるコードセクションを担当する単純な並列アプローチを比較した。スウォームは2700万トークンで266件の脆弱性を発見したのに対し、並列方式は650万トークンで21件だった。しかし、スウォームの成果を並列エージェントが担当するよう指示されたコアディレクトリに限定すると、両方式は脆弱性あたりのトークン数でほぼ同等だった。

両方式は大部分が補完的で、共通する脆弱性はわずか12件だった。スウォームは独自のツールを構築し専門化したことから、エージェントが自由に探索できる場合、協調は力任せの探索を上回りうることが示唆される。ただし、スウォームの優位性は事前に割り当てられたディレクトリを超えた探索によるものであり、オープンエンドなタスクでの効率性の測定方法に疑問を投げかける。

協調的コーディング:協調のギャップ

エージェントが互いの作業に依存しなければならない場合、協調は崩壊した。Anthropicは12時間のシミュレーションを実施し、エージェントのスウォームにテキストベースのファンタジーゲームを構築させた。結果として得られたゲームは一貫して質が低く、プレイ不能で、不可解なインターフェースを備えていた。プロンプトのスタイル(ベースライン、役割指定、CEO階層)に関係なく同様だった。

より示唆的だったのは協調の指標だ。旧モデル(Sonnet 4.6、Opus 4.6)は共有ファイルにコードをコミットするものの、PRをマージすることはほとんどなく、コンフリクトと放棄につながった。新モデル(Opus 4.8、Mythos Preview)は共有作業を完全に回避することでマージ問題を解決した——各エージェントが自分のファイルを独占した。Sonnet 5だけが高いコード共有と高いPRマージ率の両方を達成し、協調能力は最近の、しかも不均一な発展であることを示唆している。

同調というシステムリスク

この記事はまた、エージェントの同調について警告している。エージェントは低分散であるため——同じモデル、同じスキャフォールディング、同じコンテキストは似たような行動を生む——単一の悪い決定が多数のエージェントに伝播し、孤立したエラーをシステム全体の障害に変える可能性がある。これは、行動の多様性がしばしば安全網となる人間の協調とは異なる失敗モードだ。

Anthropicはこれを緊急の問題として位置づけている。エージェント間の相互作用が拡大するにつれ、人間の速度での監視を前提に設計された制度は追いつかないかもしれない。この研究はマルチエージェントシステムを堅牢にする方法を理解するための出発点だが、複雑な環境での創発的行動について私たちがどれほど知らないかを浮き彫りにしている。

あるエージェントが悪い決定を下すと、多くのエージェントが同じ悪い決定を下す可能性が高い。孤立した問題だったはずのものが、すぐにシステム全体の障害になりうる。
Manul X 編集部
脆弱性検出:協調スウォーム vs. 独立並列エージェント(Mythos Preview)
比較
指標協調スウォーム独立並列
発見された脆弱性26621
消費トークン27M6.5M
コアディレクトリ内の脆弱性約133(推定)21
脆弱性あたりのトークン(コア)約203k約310k
重複12件共通12件共通