Alibaba が、自社の大規模言語モデル群「Qwen」の最新版「Qwen3.7-Plus」を公開しました。テキストに加えて画像・動画・スクリーンショットまで扱えるマルチモーダル対応が最大の特徴で、数週間前に出たばかりのテキスト専用モデル「Qwen3.7-Max」より入力コストを大きく抑えています。一方で、これまでのQwenを支えてきたオープンソース路線とは異なり、API経由でのみ使える商用ライセンスでの提供となります。低価格と画面操作の強さを両立させたエージェント向けモデルとして、開発の現場でどう位置づくのかが注目されます。
テキストから動画・画面まで扱うマルチモーダル設計
Qwen3.7-Plus が前モデルと大きく違うのは、入力として受け付ける情報の幅です。テキストだけだったQwen3.7-Maxに対し、今回のモデルは画像・動画・スクリーンショットをそのまま読み込めます。パソコンの画面を見て、どこを操作すべきかを判断し、コードを書いて実行するところまでを1つのエージェントの流れの中でこなす設計です。
提供形態は、Alibaba Cloud のモデル基盤「Model Studio」(中国国内向けの名称は Bailian)のAPIと、対話サービス「Qwen Chat」を通じたものになります。視覚的なインターフェースの解釈、コマンドの実行、コード生成を同時に進められるため、画面操作をともなう定型業務やデータ処理の自動化を任せやすいモデルといえます。
100万トークンの文脈と「思考の保持」
Qwen3.7-Plus は最大100万トークンという広いコンテキストウィンドウを備えています。これは大まかにいって2,000ページ分の文章に相当する量で、巨大なコードベースをまるごと読み込ませ、依存関係を把握させたうえで作業に入らせる、といった使い方が想定されています。このうち最大25万6,000トークンを、モデル内部の思考(チェーン・オブ・ソート)のために割り当てられる点も特徴です。
長い手順の作業でエージェントが抱えやすい弱点に、途中で文脈を見失う「状態の劣化」があります。Qwen3.7-Plus は、APIに用意された「preserve_thinking」という仕組みで、内部の思考のまとまりを会話のターンをまたいで保持し、これを抑え込もうとしています。直前の判断の根拠を忘れたり、履歴を無駄に再計算したりせずに、当初の筋道を保ったまま多段階の作業を続けられるという考え方です。
こうした「推論の状態を保つ」発想は、いまや主要なAI各社に共通するものになっています。Anthropic は同種の機能を「Extended Thinking」と呼び、最新の Claude Opus 4.8 などで提供しています。OpenAI も GPT-5.5 で、暗号化した推論内容を次のやり取りに引き継ぐ方式を採っています。Alibaba の preserve_thinking も、こうした多段階推論の標準的な土台を自社の用語で実装したものと位置づけられます。
ベンチマークでの実力
公開された指標を見ると、Qwen3.7-Plus は画面操作やエージェント系のタスクで強みを見せています。端末上でコードを安全に繰り返し実行する能力を測る「Terminal Bench 2.0-Terminus」では70.3を記録し、DeepSeek-V4-Pro Max の67.9や Gemini 3.1 Pro の63.5を上回りました。画面の要素を正確に捉える力を評価する「ScreenSpot Pro」では79.0に達し、GPT-5.4(67.4)や Claude Opus 4.6(49.5)を大きく引き離しています。
ただし、すべての分野で最上位というわけではありません。総合的な能力では、Claude Opus 4.6 や GPT-5.4 といった米国勢の主力モデルに及ばない項目も多いとされています。画面操作やエージェント用途に的を絞れば光るものの、あらゆる場面で最先端を置き換えるモデルではない、という見方が実態に近いでしょう。なお、これらの数値はモデル提供側が公表したものである点は、念のため押さえておきたいところです。
料金体系とエンタープライズでの使いどころ
Qwen3.7-Plus が注目される最大の理由は価格です。標準的な入力処理は100万トークンあたり0.40ドル(約64円)、出力は100万トークンあたり1.60ドル(約256円)に設定されています。さらに、巨大なコードリポジトリや定型のUIキットなど、何度参照しても内容が変わらないデータを明示的にキャッシュした場合、2回目以降の読み込みは100万トークンあたり0.04ドル(約6円)まで下がります。※1ドル160円換算
エージェントが大量のコードや画面の履歴を繰り返し参照する用途では、利用料が膨らみやすいのが悩みどころでした。Qwen3.7-Plus は、こうした高頻度・多段階の処理を現実的なコストで回せるよう、料金をきめ細かく刻んでいます。APIは OpenAI 互換の形式を採っているため、既存の仕組みからの乗り換えに必要な改修も小さく済みます。高価な汎用フラッグシップモデルを定型作業に充てる代わりに、こうした処理をQwen3.7-Plusに振り分ける、という使い分けが想定されています。
オープンソースからの方針転換という論点
導入を検討する企業にとって見過ごせないのが、ライセンスの位置づけです。これまでのQwenは、モデルの重み(ウェイト)をオープンソースで公開し、自社環境に取り込んで使える点が支持を集めてきました。米国の Airbnb のように、オープンなQwenを業務に活用してきた利用者も少なくありません。
しかしQwen3.7-Plus は、Alibaba Cloud のクラウドAPI経由でのみ使える商用モデルとして提供されます。重みをダウンロードして、外部と切り離した社内のデータセンターで動かすことはできません。すべての処理は Alibaba Cloud の海外拠点(開発者向け資料ではシンガポールの拠点が示されています)を経由します。医療や防衛など、データの所在に厳しい制約がある業種では、外部APIを通すことが自社の要件に合うのかを個別に確かめる必要があります。
もっとも、クラウドAPIで完結することは利点にもなります。社内に大規模なGPUクラスタを用意して維持する負担を負わずに済むためです。手元で動かす自由と引き換えに、運用の手間を肩代わりしてもらう構図といえます。
まとめ
Qwen3.7-Plus は、テキスト・画像・動画・画面を扱えるマルチモーダル対応と、100万トークンの広い文脈、そして低価格を組み合わせた、エージェント用途向けの新モデルです。画面操作や端末でのコード実行といった分野ではベンチマークで強さを見せる一方、総合力では米国勢の主力モデルに及ばない面もあります。最大の論点は、オープンソース路線から商用API専用へと舵を切った点です。自社環境での運用を求めるか、低コストでの自動化を優先するか。導入の判断は、この方針転換をどう受け止めるかにかかっているといえそうです。
