ニュース

InceptionのMercury 2.5:拡散LLMが毎秒1,100トークンを達成、フロンティア級の品質を主張

Inception Labsが拡散ベースのLLMであるMercury 2.5をリリース。Mercury 2比で品質が40%向上し、毎秒1,107トークンのスループット、主流モデルを下回る価格設定を実現。音声エージェントやコーディングサブエージェントなど、レイテンシ重視のワークロードをターゲットにしている。

September 8, 2026· 1 min read
InceptionのMercury 2.5:拡散LLMが毎秒1,100トークンを達成、フロンティア級の品質を主張

Inception Labsは、拡散ベースの言語モデルの後継となるMercury 2.5をリリースした。同社は、Mercury 2と比較して知能が40%向上し、低レイテンシかつ低コストのサービスプロファイルを維持していると主張している。この数字が本当なら、これはこれまでに訓練された最大の拡散LLMであり、速度がボトルネックとなる本番ワークロードを正確に狙ったものだ。

新機能

Mercury 2.5は前モデルと同じ拡散アーキテクチャに基づいているが、トレーニングループは本番環境からのフィードバックを用いて磨き上げられている。Inceptionによると、顧客の障害や評価の改善が、ベンチマーク追従だけでなく、この向上を牽引したという。主な仕様は以下の通り:

  • 品質:Mercury 2比で40%向上し、GPT-5.6 Luna (Low)、Gemini 3.5 Flash-Lite、Claude Haiku 4.5などのコスト最適化されたフロンティアモデルに匹敵。
  • 速度:広く入手可能なNVIDIA GPU上で毎秒1,107トークン。
  • コンテキスト:260Kトークン。
  • 価格:入力100万トークンあたり$0.20、出力100万トークンあたり$0.75。ローンチプロモーションで80%オフとなり、それぞれ$0.04と$0.15に。
  • 機能:調整可能な推論、並列ツール呼び出し、スキーマ準拠のJSON出力。

この価格設定は攻撃的だ。フル価格でもほとんどのフロンティアAPIを下回り、ローンチ割引により高ボリュームのワークロードには迷わず選べるものとなっている。

本番環境での実証ポイント

Inceptionは単にスペックシートを出しているわけではない。それを裏付ける実際の導入実績がある。

音声エージェント

AI電話エージェントを構築するOpenCallは、Mercuryに切り替えた後、モデルの応答レイテンシの中央値が約170msになったと報告している。P99は数分から1秒に、P50は0.4秒から0.2秒未満に改善された。音声にとって、レイテンシこそが製品そのものだ。自然な会話とぎこちない間の違いを生む。

コーディングサブエージェント

Augment Codeは、コンテキスト圧縮とモデルルーティングにMercuryを使用している。品質を維持しながら、レイテンシを82%(150秒から27秒)、コストを90%削減した。ツール検索の要約は1秒未満で返されるようになった。

これらは、レイテンシが複合的に影響するワークロードだ。ユーザーリクエストごとに数十回のモデル呼び出しがあり、それぞれが合計に加算される。Mercuryの速度は、これを負債から機能へと変える。

新ツール:Mercury VoiceとRouter

Inceptionはまた、2つの新製品をプレビューした:

  • Mercury Voice:音声エージェント向けに最適化されたdLLMで、最初のトークンまでの時間が170ms未満。
  • Mercury Router:dLLMを使用してプロンプトを理解し、品質、速度、コストのトレードオフに基づいて最適なモデル(オープンまたはクローズド)にルーティングする。

どちらもプレビュー段階であり、Inceptionが単なるモデル販売から推論オーケストレーションレイヤーへの進出を目指していることを示している。

利用可能性

Mercury 2.5は、Inception API、Baseten、OpenRouterを通じて利用可能だ。エンタープライズ顧客は、専用キャパシティ、自動スケーリング、コンプライアンス管理、構成可能なデータ保持を利用できる。

拡散アプローチは依然として型にはまらないものだ(ほとんどのLLMは自己回帰型)が、Inceptionは速度が勝つと賭けている。このような数字を見ると、反論するのは難しい。

音声において、レイテンシはインフラの詳細ではない。それは発信者が聞く間なのだ。
Manul X 編集部
Mercury 2.5 vs. Mercury 2
比較
機能Mercury 2Mercury 2.5
知能ベースライン+40%
速度(トークン/秒)指定なし1,107
コンテキストウィンドウ指定なし260K
入力100万トークンあたりの価格指定なし$0.20(ローンチ時$0.04)
出力100万トークンあたりの価格指定なし$0.75(ローンチ時$0.15)