Grok 4.6がSpaceXAIをフロンティアに押し戻す、しかも安い
SpaceXAIのGrok 4.6はArtificial Analysis Intelligence Indexで61点を獲得し、GPT-5.6 Solに並び、Anthropicに次ぐ成績。価格は競合を下回り、エージェントタスクで優れた性能を発揮。

SpaceXAIのGrok 4.6が登場し、再び有力な競争相手となった。Artificial Analysis Intelligence Indexで61点を獲得し、Grok 4.5から5ポイント、Grok 4.3から23ポイントのジャンプアップ。これでフロンティアクラブに確実に名を連ね、GPT-5.6 Sol(max)と並び、Claude Opus 5(63)とClaude Fable 5(62)に次ぐ位置だ。入力/出力トークンあたり$2/$6という価格設定のモデルとしては、これは大きな意味を持つ。
エージェント性能がハイライト
Grok 4.6は静的推論だけでなく、エージェントが実際に動作する場面で輝く。GDPval-AA v2ではElo 1753でClaude Opus 5に次ぎ、Claude Fable 5やQwen3.8 Maxと統計的に同格。τ³-Bankingでは50.7%(Qwen3.8 Maxの51.3%に次ぐトップ2)、Terminal-Bench v2.1では88.4%で、ターミナルベースのタスクでリーダーに並ぶ。ナレッジワーク、カスタマーサービス、ターミナル利用を同時にこれほど高い水準でこなすモデルは珍しい。
パターンを破るコスト効率
フロンティアで価格を世代間で据え置くのは稀だ。Grok 4.6はGrok 4.5の$2/$6価格を維持しつつ、Claude Opus 5($5/$25)やGPT-5.6 Sol($5/$30)といった競合はプレミアムを課している。タスクあたりのコストは$0.84でKimi K3と同じだが、知能はより高く、コスト対性能のパレートフロンティアに位置する。推論中心のワークロードでは出力トークン価格が支配的で、Grok 4.6はその点で競合を4〜5倍下回る。
長期タスクでの効率性
長期エージェントナレッジワークのプライベートベンチマークAA-Briefcaseで、Grok 4.6はElo 1577でデビュー—Fable 5クラス、Claude Opus 5ファミリーに次ぐ。しかし本当のストーリーは効率性だ:約53ターンと約0.5B入力トークンでタスクを完了するのに対し、Claude Opus 5(max)は約103ターンと約2.0Bトークン。長期タスクはコンテキストが急速に蓄積するため、入力トークンを4分の1しか使わないモデルは、トークン単価を超えたコスト優位性を持つ。
コンテキストウィンドウは500kトークンのまま、キャッシュヒット価格は1Mトークンあたり$0.3から$0.5に上昇—全体の価値提案を損なわない小幅な値上げだ。
Grok 4.6は、フロンティアが単なる生の知能ではなく、予算を燃やさずに仕事をこなすことにあると再認識させる。SpaceXAIがゲームに戻り、価格戦争も持ち込んでいる。
Grok 4.6は価格据え置きの$2/$6でIntelligence Indexを5ポイント向上—知能の向上に価格上昇が伴うのが常のフロンティアでは珍しい動きだ。
| モデル | Intelligence Index | 価格(入力/出力 1Mあたり) | タスクあたりコスト | GDPval-AA Elo |
|---|---|---|---|---|
| Claude Opus 5 (max) | 63 | $5/$25 | — | トップ |
| Claude Fable 5 (max, fallback) | 62 | — | — | — |
| Grok 4.6 | 61 | $2/$6 | $0.84 | 1753 |
| GPT-5.6 Sol (max) | 61 | $5/$30 | — | — |
| Kimi K3 | ~60 | — | $0.84 | — |
ディスカッション
0 件のコメント
最初のコメントを投稿しましょう。