Liquid AIが、自社の言語モデル「LFM2.5」シリーズ向けにドラフトモデル「DSpark」を公開しました。投機的デコードを使って、生成される文章を一切変えないまま、GPUで最大3.18倍、MacBook上で最大2.87倍の速度を引き出すという内容です。重みはHugging Faceで公開され、llama.cppとSGLangは公開初日から対応しています。
そもそも投機的デコードは何を速くしているのか
大規模言語モデルが1文字ずつ答えを吐き出す工程は、計算そのものよりも、メモリからモデルの重みを読み出す時間に足を引っ張られます。これはNVIDIA H100のような高性能GPUでも、MacBookやスマートフォンのような手元の機器でも変わりません。1トークン出すたびに巨大な重みを読み直しているので、演算器は待ち時間の方が長いわけです。
投機的デコードは、この待ち時間を分け合う発想です。まず小さくて軽いドラフトモデルに続きを何トークンか予想させ、本体のモデルはそれらをまとめて1回の推論で答え合わせします。当たっていればまとめて採用し、外れたところからは本体が引き取る。重みの読み出し1回あたりに確定するトークン数が増えるので、体感速度が上がるという仕組みです。
重要なのは、貪欲法での出力が理屈のうえで元と同じになる点です。ドラフトの提案は本体の分布と一致したときだけ採用され、外れれば本体が出したはずのトークンに置き換わります。したがってベンチマークの正答率は変化しません。速度だけを買える改良だと考えると分かりやすいと思います。
DSparkが足した3つの仕組み
DSpark自体は2026年に発表された手法で、既存のEAGLE-3やDFlashといった系譜の延長にあります。中身は3つの部品の組み合わせです。
1つ目は、本体モデルから受け取った文脈情報をもとに、ブロック単位で一気に候補トークン分の内部状態とロジットを吐き出す並列バックボーンです。2つ目は、隣り合うトークン同士をマルコフ連鎖として扱う軽量な逐次ヘッドで、直前に選ばれたトークンと矛盾しない続きへ確率を寄せます。並列に予想するだけだと後ろの位置ほど当たらなくなるので、そこに依存関係を戻して採用率を持ち上げる役割です。
3つ目が、確信度に応じて検証量を調整するヘッドです。それぞれのドラフトトークンについて採用される確率を予測し、確かめるコストに見合わない末尾は切り落とします。ハードウェアの空き具合を見ながら検証する長さを変えられる、という点が実装上の工夫にあたります。
公開されたドラフトモデルは、5層構成でブロックサイズ9、パラメータ数はそれぞれ3億程度と小ぶりです。学習と条件出しの実験はすべてAMDのハードウェア上で、Liquid AI自前の学習基盤を使って行われたと明かされています。
速さの幅は「当たり具合」で決まる
数字は対象モデルと処理内容でかなり振れます。計測はH100 80GBをSGLangで、MacBook側はM4 Max搭載機をllama.cppとMetalで動かし、いずれもバッチサイズ1、温度0という条件です。評価にはMATH500、GSM8K、HumanEval、MBPP、MT-Benchが使われています。
主力の2.6Bモデルでは、GPUでも端末側でも軒並み改善し、MacBookでの生成速度は毎秒140トークン前後という水準に届いています。これは多くのクラウド型商用モデルの応答速度を上回る領域で、手元で完結させる動機としては分かりやすい部分です。
一方で1.2Bモデルは推論を挟まないタイプということもあり、データセットによって採用率のばらつきが大きく、速度向上の幅は最大で52パーセントも上下します。8B-A1Bはさらに事情が複雑で、GPUでは平均2.54倍まで伸びるものの、端末側では18パーセント改善に留まりました。llama.cppのMetalバックエンドにおけるMoE実装が現状の制約になっているうえ、複数トークンをまとめて検証すると、その分だけ多くのエキスパートが起動して重みの転送量が増えてしまうためです。開発元はこの数字を隠さず公表し、今後の課題としています。
効くのは待たされる場面
速度向上がいちばん体感につながる用途として挙げられているのが、ツールを呼び出しながら進むエージェント的な処理です。この手の処理では、モデルがツールを呼ぶ前に毎回考え込み、その間ずっと利用者は待つことになります。
関数呼び出しの評価データセットBFCLを使った測定では、複数のツールを扱う様々な場面を通して、応答までの時間が平均57パーセント短くなったとされています。待ち時間が半分以下になるかどうかは、端末上でエージェントを常用できるかの分かれ目になります。2.6Bモデルを最初の実用的なオンデバイス向けエージェントモデルにする、という開発元の狙いも、この文脈で読むと筋が通っています。
手元で動かすには
ドラフトモデルはHugging Faceで公開されており、Safetensors形式のほかGGUF形式も用意されています。GGUFはllama.cppでの端末推論向け、SGLangはGPUを使った本番運用向けという住み分けです。統合部分はいずれも本家のリポジトリに取り込まれているため、特別なフォークを追いかける必要はありません。ただしMetal周りは実験的なカーネルを前提とした計測なので、公開時点の数字をそのまま再現できるかは環境次第でしょう。
重みは制限なくダウンロードして微調整や配布ができる形で提供され、1.2B、2.6B、8B-A1Bの3サイズから、精度と容量の兼ね合いで選ぶ設計になっています。
まとめ
DSparkは、出力を変えずに推論速度だけを引き上げるドラフトモデルです。GPUで最大3.18倍、MacBookで最大2.87倍という数字が示された一方、伸び幅はドラフトの当たり具合次第で大きく変わり、MoE構成の8Bモデルでは端末側の恩恵がまだ限定的です。とはいえ、関数呼び出しの待ち時間が平均57パーセント縮むという結果は、手元で動くエージェントの実用性を一段引き上げるものだと言えます。
