GitHub Copilotのエージェントハーネス:同じモデル、より少ないトークン
GitHubのエージェントハーネスは、モデルベンダーのツールと同等のタスク解決率を達成しながら、消費トークンが少なく、20以上のモデルをサポートする。真の勝者は、ロックインなしの選択肢だ。

GitHubは、CopilotエージェントハーネスとClaude CodeやCodex CLIなどのモデルネイティブハーネスを比較したベンチマーク結果を公開した。見出しはこうだ:同じモデル、同じタスク、しかし消費トークンは少なく、解決率は犠牲にしない。
ハーネスは、Copilot CLI、Copilotアプリ、Copilotコードレビューの背後にある共有ランタイムだ。一度改善すれば、すべての表面が恩恵を受ける。GitHubは、SWE-bench Verified、SWE-bench Pro、SkillsBench、TerminalBench、および内部のWindowsコンテナベンチマークの5つのベンチマークを、Claude Sonnet 4.6、Claude Opus 4.7、GPT-5.4、GPT-5.5で実行した。
トークン効率が際立っている。ほとんどの構成で、GitHubのハーネスはモデルベンダー自身のハーネスよりも少ないトークンを使用し、同等のタスク完了率を達成した。解決率の差は確率的ノイズの範囲内であり、実質的に同等だった。
GitHubはまた、TerminalBench 2.0のコスト対解決率の散布図を公開した。Copilotハーネスのマーカーは、同じモデルの競合他社と比較して、同じかより良い象限(左上)に位置している。GPTモデルが最高の価値を提供し、Claude Opusがプレミアム価格で最高の解決率を達成する。ハーネスを使用すると、どちらかを選択するか、自動モデル選択に任せることができる。
マルチモデルのストーリーが真の差別化要因だ。ハーネスは、GPT、Claude、Gemini、MAIファミリーにわたる20以上のモデルをサポートし、オープンソースまたはローカルモデル用の独自キーも持ち込める。モデルベンダーのハーネスではそれができない。また、Rubber Duckのようなクロスモデル批評機能も可能にする。これは、あるモデルが別のモデルの出力をレビューするものだ。
これは実用的なアプローチだ:一つのモデルにすべてを賭けず、トークンを無駄にせず、結果を犠牲にしない。ベンチマークは単なる一つのシグナルだが、方向性は明確だ。
ディスカッション
0 件のコメント
最初のコメントを投稿しましょう。