Alibaba傘下のQwenチームが、最上位の大規模言語モデル「Qwen3.8-Max」の一般提供を8月3日に始めました。総パラメータ数は2.4兆に達しますが、注目したいのは規模そのものより、人間が一度も口を挟まないまま16日間コードを書き続けたという運用時間の長さです。来週にはこのモデルと小型版のウェイトが公開される予定で、オープン化の流れも一段と速くなっています。
2.4兆のうち実際に動くのは950億
Qwen3.8-Maxは、トークンを1つ生成するたびに必要な専門家ネットワークだけを選んで動かすMoE(Mixture-of-Experts)構成を採っています。総パラメータは2.4兆ですが、推論時にアクティブになるのは950億にとどまります。巨大なモデルが抱える知識量を保ったまま、応答のたびにかかる計算量と待ち時間を抑える狙いです。
扱えるコンテキストは最大100万トークン規模で、内訳は通常時の最大入力が約99万1000トークン、思考モードを有効にすると約98万3000トークン、最大出力が13万1000トークンとされています。テキストだけでなく画像と動画もそのまま理解でき、スクリーンショットからウェブサイトを組み立てるような使い方も想定されています。
空のフォルダから16日間、誰も見ていない状態で
Qwenチームが前面に出しているのが、人間の介入なしでソフトウェア開発を続ける能力です。空のフォルダから始めて約16日間の完全自律運用を行なった結果、担当したリポジトリには265件のコミット、127件のプルリクエスト、151件のIssueが積み上がりました。単発のコード生成ではなく、自分で課題を見つけて直し、機能を足していく作業が2週間以上続いた形になります。
長時間の自律稼働は前世代のQwen3.7-Maxでも35時間規模が話題になっていた領域で、そこから桁が1つ上がった格好です。
論文を再現したうえで、元の手法を上回った
研究タスクの検証も公開されています。題材は、大規模言語モデルの学習データからモデルが判断に迷いやすい例を選び出す手法を扱った論文です。Qwen3.8-Maxに与えられたのは論文とGPUだけで、データ処理も学習も評価も、コードと実験環境をゼロから組む必要がありました。
作業時間は約125時間、書いたコードは約7600行、操作回数は1100回を超え、GPUでの学習は33回に及びました。最初の約37時間で論文の主要な6つの結果を再現し、残る約88時間は仮説を立てて実装し、実験して分析し、また試すというループを4ラウンド繰り返しています。検証した改善案は18件で、最終的に独自の選択手法にたどり着き、数学ベンチマークのAIME24で再現値の49.58パーセントを52.29パーセントへ、2.71ポイント押し上げたと報告されました。
人間との直接対決も行なわれています。Alibaba Cloudが開いたマルチモーダル対話意図認識のコンテストに参加させたところ、24時間以内に自力で分類システムを構築し、45回の提出を経て正解率を0.600から0.853まで引き上げました。参加526チームのうち458チームを上回り、上位13パーセントに入っています[1]。
365日のEC運営シミュレーションでは資金が4.16倍に
経験から学べるかどうかを見るため、Alibaba傘下のTaobaoとTmallの匿名化データを土台にした365日間のEC運営シミュレーションでも試しています。初期資金10万元(約230万円)は41万6252元(約960万円)まで増え、リターンは4.16倍。2位のGLM 5.2を38パーセント、前世代のQwen3.7-Maxを152パーセント上回りました。
面白いのは伸びた理由で、2000回を超えるやり取りを通じて同じ仕入れ先との交渉の仕方を少しずつ変え、仕入れ価格を継続的に下げていったと説明されています。過去のやり取りを踏まえて戦略を組み替えられるかどうかが、長期タスクでの差になっているようです。
ベンチマークは得意と不得意がはっきり出た
公開されたスコアを見ると、強い分野と弱い分野の差はかなり明確です。Terminal-Bench 2.1は86.6で、Claude Fable 5とClaude Opus 4.8の84.6を上回った一方、GPT-5.6 Solの88.8には届きませんでした。論文再現を測るPaperBenchは93.0、指示追従のIFBenchは82.8で、いずれもClaude Fable 5を超えています。
逆にSWE-bench Proは67.7、FrontierSWEは73.5でClaude Fable 5に及ばず、Humanity's Last Examは43.6、Toolathlon Verifiedは72.5と伸び悩みました。既存コードの修正や複雑なツール利用は、まだ差を詰め切れていない領域と言えます。前世代比では、DeepSWE 1.1が21.6から56.6、JobBenchが31.3から53.4へと大きく動きました。画像や文書まわりではRealWorldQAが88.0、MMMU-Proが82.3、OmniDocBench 1.5が92.1という数字が並びます。
なおQwenチームは、強化学習の環境と計算資源を同時に広げることで、社内と公開の各ベンチマークのスコアが一貫して伸び続けたと説明しています[1]。
価格と、来週予定されているウェイト公開
Qwen3.8-MaxはQwen ChatやAlibaba CloudのModel Studioなどから利用できます。API料金は入力が100万トークンあたり2ドル(約310円)、出力が100万トークンあたり6ドル(約940円)、キャッシュ済みの入力が100万トークンあたり0.25ドル(約40円)です。関数呼び出し、構造化出力、バッチ処理、プレフィックス補完、ファインチューニングに対応し、Responses API経由ではコード実行やウェブ検索、ウェブページからの情報抽出、画像検索といった組み込みツールも使えます。
そして来週には、Qwen3.8-Max本体に加えて270億パラメータの「Qwen3.8-27B」のウェイトが公開される予定です。2.4兆パラメータのモデルを自前で動かすにはデータセンター級の環境が要りますが、270億なら手元のGPUでも現実的な範囲に入ります。Moonshot AIが2.8兆パラメータの「Kimi K3」を公開した直後という時期でもあり、フロンティア級モデルをオープンウェイトで出す競争は当面続きそうです。
※1ドル157円、1元23円換算(2026年8月5日時点)
まとめ
Qwen3.8-Maxは、2.4兆パラメータのうち950億をアクティブにするMoE構成で、最大100万トークンのコンテキストを扱えるマルチモーダルモデルです。16日間の無人開発、125時間かけた論文の再現と改良、365日のEC運営で4.16倍という結果は、単発の応答品質ではなく作業を続ける力を示す指標としてまとめられています。ベンチマークでは既存コードの修正や複雑なツール利用に課題が残るものの、来週のウェイト公開でこの水準のモデルが手元に降りてくるかどうかが、次の焦点になりそうです。
参考リンク
- [1] Qwen公式ブログ「Qwen3.8-Max」 https://qwen.ai/blog?id=qwen3.8
- [2] QwenCloud モデルページ「Qwen3.8-Max」 https://www.qwencloud.com/models/qwen3.8-max
