Alibabaのモデル開発チームQwenが、オープンウェイトのAIモデル「Qwen3.8-Flash-Next」を日本時間の2026年8月26日に公開しました。総パラメータ1,250億に対して1トークンあたり動くのは60億だけという構成で、次期「Qwen4」に向けた新しい仕組みが4つ先行して入っています。Hugging FaceとModelScopeからすでにダウンロードできます。
総パラメータ1,250億、実際に動くのは60億
Qwen3.8-Flash-Nextは、テキストのほかに画像と動画も扱えるMoE(Mixture-of-Experts、混合エキスパート)型のモデルです。MoEは内部を役割の違う小さなネットワークの集まりに分けておき、入力ごとに必要な分だけを起動して計算量を抑えます。表記の「125B-A6B」は、総パラメータが1,250億でアクティブパラメータが60億という意味です。
これとは別に、510億パラメータ分のN-gram埋め込みを持ちます。コンテキスト長は標準で26万2,144トークン、拡張時は100万トークンまで伸ばせます。
Opus 4.6や27B版との比較
Qwenが公開したベンチマーク結果では、Anthropicの「Claude Opus 4.6(Max)」との比較で、ソフトウェア開発を測るSWE-bench Proが62.5パーセント(Opus 4.6は53.4パーセント)、長時間の事務作業を扱うCoWorkBenchが73.9パーセント(同68.2パーセント)、職務タスクのJobBenchが55.7パーセント(同36.6パーセント)と、いずれも上回りました。
自社の上位モデルで総パラメータ3,970億の「Qwen3.7-Plus」に対しても多くの項目で上回っており、しかも学習コストは約9分の1で済んだとされています。
ローカルAIの定番になっている「Qwen3.8-27B」との比較も興味深いところです。27Bは270億パラメータすべてが動くDense(高密度)型で、対するQwen3.8-Flash-Nextは60億しか動かしません。それでも言語と視覚を合わせた22項目で同等以上、うち21項目で上回ったと報告されています。SWE-bench Proは62.5パーセント対61.7パーセントとわずかな差ですが、JobBenchでは55.7パーセント対33.4パーセントと大きく開きました。
なお、これらの数値はQwenが自ら公表したもので、第三者による独立検証ではありません。読み方にはその前提を置いておく必要があります。
Qwen4を先取りした4つの新機構
少ないアクティブパラメータでこれだけ動く理由として、Qwenは4つの設計変更を挙げています。
1つ目はアテンション(文脈のどこに注目するかを決める仕組み)の構成です。4層ごとに、文脈を圧縮して覚える「Gated DeltaNet」を3層、重要なブロックだけを選んで読み返す「Qwen Sparse Attention」を1層という組み合わせにしました。キャッシュ命中率90パーセント・100万トークン入力の条件で、プリフィル処理量はQwen3.7-Plusの8.6倍に達します。
2つ目は「Gated Residual」で、各層の入力を深い層まで素通しで届ける経路を1本から4本に増やし、それぞれの読み書き量をゲートで動的に制御します。初期の情報が深い層まで薄まりにくくなり、学習も安定するとしています。
3つ目が前述のN-gram埋め込みです。直前の数トークンの並びから対応するベクトルを引く参照表を、本体とは別に510億パラメータ分持ちます。表を引くだけなのでトークンあたりの計算量はほとんど増えません。
4つ目は学習時のパラメータ更新を効率化する新手法「Muon」で、少ない手順で学習が進みます。学習コストが約9分の1になったという数字は、ここが効いています。
51BをRAMに置ける設計が効く
手元でモデルを動かす人にとって効くのは、N-gram埋め込みの510億パラメータ分をVRAMではなくRAMに置ける点です。通常、VRAMに収まらないパラメータはRAMからGPUへ都度転送するため速度が大きく落ちます。8GBのGPUで35Bクラスを動かす実行環境「FreeToken」が話題になったのもこの壁を越えたからですが、あちらはNVIDIA製GPUを前提とした実行環境側の工夫でした。
Qwen3.8-Flash-Nextは、RAMに置いて先読みする前提でモデル側から設計されているため、特定のGPU環境に縛られません。サーバー向けの対応環境としてQwenが挙げているのは、推論フレームワークの「SGLang」「vLLM」「TokenSpeed」です。ローカル向けには「llama.cpp」の対応も案内されていますが、この先読みまで実装されているかは現時点では分かっていません。
ライセンスと商用版の料金
ライセンスは「Qwen Community License 1.0」で、商用利用を含めて原則無償です。ただし、MaaS事業を営む場合や、AIコーディング・オフィス支援を主目的とする製品を提供する場合は別途契約が必要になります。また、月間アクティブユーザーが1億人を超える製品、または月間売上が2,000万ドル(約32億円)を超える製品では、UI上にモデル名の表示が求められます。
製品版にあたる「Qwen3.8-Flash」は、近くQwenCloudのAPI経由で提供される予定です。料金は100万トークンあたり入力0.16ドル(約25円)、出力0.47ドル(約75円)と案内されています。
※1ドル159円換算
まとめ
Qwen3.8-Flash-Nextは、次期Qwen4の設計を先行公開したような位置づけのモデルです。アクティブパラメータ60億という軽さでOpus 4.6級のスコアを出し、重い部分をRAMに逃がして特定GPUに依存しない構成にしたところが要点になります。llama.cppでの先読み対応が固まれば、手元のPCで動かせるモデルの選択肢はさらに広がりそうです。
