Inceptionが9月8日、拡散モデルを土台にした大規模言語モデル「Mercury 2.5」を公開しました。生成速度は毎秒1,107トークン、前世代のMercury 2から知能面で40パーセントの向上をうたっています。速さを看板にしてきたシリーズが、品質でも低コスト帯の主力モデルに肩を並べにきた形です。

トークンを1つずつではなく、まとめて置く

多くの大規模言語モデルは、文章を先頭から1トークンずつ順番に生成します。Inceptionが手がけるMercuryシリーズはこの前提を外していて、画像生成でおなじみの拡散という手法を言語に持ち込み、粗い下書きを並列に書き換えながら仕上げていきます。トークンを待ち行列で処理しない分、GPUが遊ぶ時間が減り、同じハードウェアでも応答が速く返ってくるという理屈です。

同社はMercury 2.5について、市販されている拡散型LLMの中で最も能力が高く、これまでに訓練された拡散言語モデルとしても最大規模だと説明しています。特別なアクセラレータを前提にしているわけではなく、広く出回っているNVIDIAのGPU上でこの速度が出るとしている点も、導入のしやすさに効いてきます。

速度はそのまま、品質だけを積み増した

公開された数字を並べると、性格がはっきりします。生成速度は毎秒1,107トークン、コンテキスト長は260,000トークン。知能はMercury 2から40パーセント改善し、GPT-5.6 Luna(Low)やGemini 3.5 Flash-Lite、Claude Haiku 4.5といった低コスト帯の最新モデルと同等の水準に位置づけられています。

価格は100万トークンあたり入力0.20ドル(約31円)、出力0.75ドル(約115円)です。公開当初は80パーセント引きが適用され、入力0.04ドル(約6円)、出力0.15ドル(約23円)で試せます。機能面では、推論の深さを調整できるチューナブルな思考、複数のツールを同時に呼び出す並列ツールコール、スキーマに沿ったJSON出力が加わりました。

※1ドル153円換算

Inceptionはこの改良を、ベンチマークではなく実運用から引き出したと述べています。Mercury 2の公開以降、利用量は1桁上のスケールに伸び、検索や音声、コーディングといった遅延に敏感な用途で使われてきました。そこで拾った失敗事例と顧客の指摘を評価軸に落とし込み、訓練を絞り込んだ結果が今回のモデルだという整理です。NVIDIAの担当者も、新しいアーキテクチャが実運用に耐える段階まで短期間で成熟したとコメントしています。

効いてくるのは、モデルを何度も呼ぶ場面

速度の価値が出るのは、1回の応答の見た目よりも、裏で何十回とモデルを呼ぶ処理です。検索エージェントを例にすると、1件のリクエストで検索計画の作成、クエリの書き換え、結果の並べ替え、事実の構造化、要約、答えの検証といった呼び出しが連鎖します。ここが遅いと、利用者が待てる時間の中に収まりません。

音声では遅延がそのまま無言の間になります。電話応対のAIエージェントを手がけるOpenCallでは、Mercuryへの切り替えで応答遅延の中央値が170ミリ秒前後まで下がったとされています。同社は、最も遅い部類の応答が数分から1秒程度に、中央値も0.4秒から0.2秒未満に改善したと述べています。

コーディング支援も似た構造です。Augment Codeは文脈の圧縮、モデルのルーティング、MCPのツール検索にMercuryを使っており、圧縮処理を移した結果、所要時間が約150秒から27秒へと82パーセント短縮し、コストは90パーセント下がったと説明しています。ツール検索の要約は1秒以内に返るとのことです。

音声特化とルーターも同時にプレビュー

Mercury 2.5と合わせて、2つの派生モデルがプレビュー公開されました。1つは音声エージェント向けに最適化した「Mercury Voice」で、最初のトークンが返るまでの時間を170ミリ秒未満に抑えます。もう1つは「Mercury Router」で、届いたプロンプトを拡散モデル側で解釈し、品質と速度とコストのバランスが最も良いモデルへ振り分ける役割を担います。振り分け先はオープンなモデルとクローズドなモデルの両方が対象です。

Mercuryシリーズは自社のAPIに加えて、BasetenとOpenRouterから利用できます。APIはOpenAI互換で、既存のコードから差し替えやすい形です。企業向けには専有キャパシティやオートスケール、データ保持期間の設定といった条件が用意されています。Inceptionは次のモデルの訓練にすでに着手しており、自社最大規模になる見込みだと明かしています。

まとめ

Mercury 2.5は、速度と価格の水準を維持したまま知能を40パーセント押し上げた拡散型LLMです。毎秒1,107トークン、コンテキスト260,000トークン、100万トークンあたり入力0.20ドルという構成で、低コスト帯の最新モデルと同じ土俵に立ちました。1回のやり取りの裏で何十回もモデルを呼ぶ検索や音声、コーディングの補助処理では、この速さと安さが積み上がってそのまま体験の差になります。拡散という選択が速度のための妥協ではなくなりつつあることを、今回の数字は示しています。