中国Alibaba傘下の生成AIブランド「Qwen」の開発チームが、新しい画像生成・編集モデル「Qwen-Image-2.1」を無償の研究利用ライセンスで公開しました。パラメータ数7Bという軽量な設計ながら、透明背景を持つ画像の生成・編集や、最大10枚の参照画像を使った編集に対応しているのが特徴です。
生成も編集も1つのモデルでこなす7B設計
Qwen-Image-2.1は、7Bパラメータの画像生成部分と、画像・言語処理を担う80億パラメータの「Qwen3-VL」を組み合わせた構成になっています。内部には32層からなるDiT(Diffusion Transformer)構造を採用し、テキストと画像の情報を1つの系列として扱う仕組みや、注目範囲を用途に応じて切り替える仕組みを組み込むことで、複雑な指示にも対応しやすくしているといいます。テキストから画像を生成する機能では、2048×2048ピクセルを基準に、最大2752×1536ピクセルまで7種類のアスペクト比に対応します。編集機能では、最大10枚の参照画像を使い、人物の同一性を保ったまま姿勢や背景を変更したり、画像の一部分だけを指定して書き換えたりする使い方ができるとしています。背景を透明にしたRGBA画像を直接生成・編集できる点も特徴で、テキストと参照画像の情報を一度計算した結果を使い回す仕組みにより、処理の効率化も図られています。
独自ベンチマークでは「Nano Banana 2.0」超えを主張
Alibabaが独自に構築した評価指標「Qwen-Image-Bench」では、Qwen-Image-2.1が60.28点を記録し、Googleの画像生成モデル「Nano Banana 2.0」の59.82点を上回ったとしています。公開されているオープンウェイトモデルの中では最高水準の性能であり、OpenAIやMetaが提供する画像生成モデルとも比肩する結果になったとAlibabaは主張しています。ただし、この数値は自社が設計したベンチマークによるものであり、第三者による客観的な検証はまだ広くは行われていません。
商用利用には別ライセンスが必要、対応環境も充実
Qwen-Image-2.1は「Qwenリサーチライセンス」のもとで公開されており、研究や評価目的での利用は無償ですが、商用利用にはAlibabaとの別途契約が必要です。生成した画像そのものの権利はライセンスの対象外で、利用者に帰属するとされています。モデルはHugging FaceやModelScope、GitHubから入手でき、Diffusers、ComfyUI、vLLM-Omni、SGLang、LightX2Vといった主要なツールにすでに対応済みです。動作には24GB以上のVRAMを搭載したGPUが目安となり、NVIDIA製に加えてAMDのROCm環境や、FlagOSを介した複数のチッププラットフォームでも動作するとしています。日本語を含む多言語のプロンプトにも対応しており、国内の開発者やクリエイターの間でも試用が広がっています。
まとめ
Alibabaは2026年9月、画像生成・編集モデル「Qwen-Image-2.1」を無償の研究ライセンスで公開しました。7Bという軽量な構成でありながら、透明背景の生成や複数枚の参照画像を使った編集に対応し、独自ベンチマークでは大手他社のモデルを上回ると主張しています。商用利用には別途ライセンスが必要なものの、オープンウェイトモデルとして手元の環境で試せる点は、画像生成AIを開発に組み込みたい企業や個人にとって選択肢を広げるものとなりそうです。
