Alibabaが、最上位モデル「Qwen3.8-Max」の更新版となる「Qwen3.8-Max-0902」を公開しました。2.4兆パラメータの土台と100万トークンの文脈長はそのままに、コーディングと共同作業型のエージェント用途に絞って追加学習を施したスナップショットです。API価格は入力100万トークンあたり2ドル(約320円)、出力6ドル(約960円)で変わらず、フロントエンド開発のリーダーボード「Code Arena: WebDev」では1,691ポイントで首位に立ちました。

8月の初版から1か月で「置き換え」型の更新

Qwen3.8-Maxは8月に正式提供が始まったばかりのモデルで、今回の0902版はそれを同じ名前・同じ価格のまま中身だけ入れ替える形の更新です。APIのモデルIDは「qwen3.8-max-0902」で、日付入りの別名「qwen3.8-max-2026-09-02」も用意されています。日付付きのIDを指定しておけば、今後さらに新しいスナップショットが出ても呼び出し先が勝手に変わらない、という運用がしやすくなります。

Alibabaは今回の更新を「Coding & Cowork」に向けた追加の事後学習と説明しています。つまり、モデルの規模や構造を変えるのではなく、コードを書く力と、複数のツールを使い分けながら仕事を最後までやり切る力に狙いを定めて鍛え直した、ということです。

何が良くなったのか

公式のモデルページでは、改善点が大きく3つに整理されています。

コーディングでは、単発の関数を書くような作業よりも、プロジェクト全体に手を入れるような規模の大きい案件や、人が付きっきりで見ていなくても長時間にわたって自律的に開発を進める用途を意識した強化が入りました。

共同作業型エージェントの面では、複数のツールを組み合わせて呼び出す場面での落ち着きが増し、タスクを最初から最後まで通して完了させる性能が上がったとしています。

画像の理解も見直され、グラフの読み取り、文書の構造解析、一般的な視覚認識の各分野で精度と安定性が向上したと説明されています。入力は画像・テキスト・動画に対応し、出力はテキストです。

Alibabaが公表した比較表を見ると、伸びが特に目立つのは前の版で弱点だった項目です。ターミナル上でエージェントとして作業する「TerminalBench 3.0」は11.3から29.0へ、ブラックボックスのプログラムを再現する「ProgramBench」は10.5から28.0へと、いずれも2倍以上に跳ね上がりました。職務タスクを扱う「JobBench」も53.4から64.0へ約10ポイント上がっています。

一方で、同じ表の中でAnthropicの「Claude Opus 5」と並べると、エージェント型コーディングやオフィス作業系の多くの項目ではOpus 5がなお上回っています。0902版が先頭に立っているのは、リポジトリ全体を理解して質問に答える「SWE-Atlas QnA」(66.3)や、SaaSの業務フローを自動化する「Automation Bench」(50.8)、視覚推論系の一部といった項目です。なお比較表に含まれる一部のベンチマークはAlibabaの自社製で、他社モデルのスコアは公表値を集めたものである点には注意が必要です。

Code Arenaで首位、ただし価格は据え置き

外部の評価では、実際のウェブ開発課題で人が出力を見比べて順位を付ける「Code Arena: WebDev」で、0902版が1,691ポイントを獲得して総合1位に入りました。運営元のArenaによると、Claude Opus 5(Max)を3ポイント、Kimi K3(Max)を17ポイント上回り、前のQwen3.8-Maxからは22ポイントの上積みです。

これだけの更新でありながら、API価格は変わっていません。QwenCloud上の料金は入力100万トークンあたり2ドル(約320円)、出力6ドル(約960円)で、暗黙キャッシュにヒットした入力は0.25ドル(約40円)、明示キャッシュの読み出しは0.17ドル(約27円)、明示キャッシュの作成は2.5ドル(約400円)です。同じリポジトリや文書一式を毎ターン読み直すような長時間のエージェント処理では、このキャッシュ料金のほうが実際のコストを左右します。

※1ドル160円換算(2026年9月1日の終値ベース)

上限値も前の版から引き継がれています。最大入力は99万1,000トークン(思考モード時は98万3,000トークン)、最大出力は13万1,000トークン、推論に使えるトークンは最大26万2,000で、文脈長は100万トークンです。レート制限は1分あたり100万トークン、1万5,000リクエストとなっています。コードインタープリタ、ウェブ検索、ウェブ抽出、画像検索といった組み込みツールや、思考モード、関数呼び出し、構造化出力、バッチ処理、ファインチューニングといった機能もそのまま使えます。

使い方は「モデルIDを変えるだけ」

既存のQwen3.8-Maxユーザーにとっては、乗り換えの手間はほとんどありません。QwenCloudのAPIはOpenAI互換の形式で提供されており、モデル名を「qwen3.8-max-0902」に書き換えるだけで切り替えられます。思考モードは追加パラメータで有効にできます。

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)

completion = client.chat.completions.create(
    model="qwen3.8-max-0902",
    messages=[{"role": "user", "content": "Who are you"}],
    extra_body={"enable_thinking": True},
    stream=True,
)

QwenCloud以外の経路も早くも整いつつあり、VercelのAI Gatewayでは「alibaba/qwen3.8-max-0902」として提供が始まっています。同社のコーディングエージェント向け設定を使えば、Claude CodeやCodexなどのツールからこのモデルを呼び出すことも可能です。

気になる点

今回の発表で触れられていないこともあります。ひとつは重みの公開で、0902版はQwenCloudのAPI経由での提供が案内されているのみで、ダウンロードして自前で動かせるかどうかは明言されていません。もうひとつは、Alibabaの比較表がAnthropicの「Claude Fable 5」や「Claude Opus 5」を相手にしている点で、ほぼ同じタイミングで登場した「Claude Fable 5.1」との比較は含まれていません。数値を引用する際は、こうした前提を頭に入れておくのがよさそうです。

まとめ

Qwen3.8-Max-0902は、Alibabaの最上位モデルをコーディングと共同作業型のエージェント用途に向けて鍛え直したスナップショットです。2.4兆パラメータ、100万トークンの文脈長、入力2ドル・出力6ドルの価格はいずれも据え置きのまま、前の版で弱かったエージェント型コーディングの指標が大きく改善し、Code Arena: WebDevでは首位に立ちました。既存ユーザーはモデルIDを変えるだけで移行できる一方、最上位の閉鎖モデルとの差や重み公開の有無など、見極めるべき点も残っています。