中國阿里巴巴旗下生成式AI品牌「通義千問(Qwen)」團隊發布了新一代圖像生成與編輯模型「Qwen-Image-2.1」,並以免費的研究授權條款公開。該模型參數規模僅為7B,卻支援生成與編輯帶透明背景的圖像,還能根據最多十張參考圖像進行編輯,功能相當完整。

7B架構兼顧生成與編輯

Qwen-Image-2.1由7B參數的圖像生成模組,與負責圖文理解的80億參數視覺語言模型「Qwen3-VL」組合而成。模型內部採用32層擴散變換器(DiT)架構,將文字與圖像資訊視為同一序列處理,並配備可依任務切換注意力範圍的機制,使其更容易理解複雜指令。在文字生成圖像方面,模型以2048×2048像素為基準解析度,最高支援2752×1536像素等七種畫面比例。編輯功能可接受最多十張參考圖像,能在保持人物身分一致的前提下更改姿勢或背景,也能僅指定圖像中的某個區域進行局部重繪。該模型還能直接生成與編輯帶原生透明色版的RGBA圖像,並透過重複利用文字與參考圖像的運算結果來提升處理效率。

阿里巴巴稱基準測試超越Google「Nano Banana 2.0」

在阿里巴巴自行建立的評測體系「Qwen-Image-Bench」中,Qwen-Image-2.1獲得60.28分,略微超過Google圖像生成模型「Nano Banana 2.0」的59.82分。阿里巴巴表示,這項成績使該模型在現有開源權重模型中處於最高水準,效能可與OpenAI、Meta的圖像生成模型相媲美。不過,這些數據來自阿里巴巴自行設計的基準測試,目前尚未獲得廣泛的第三方獨立驗證。

商用需另行取得授權,主流工具已完成相容

Qwen-Image-2.1基於「通義千問研究授權協議」發布,研究與評測用途可免費使用,但商用需另與阿里巴巴簽訂協議。據介紹,使用該模型生成的圖像本身之權利歸使用者所有,不受授權條款約束。模型可從Hugging Face、魔搭社群(ModelScope)及GitHub取得,目前已相容Diffusers、ComfyUI、vLLM-Omni、SGLang、LightX2V等主流工具。本機運行大致需要顯示卡記憶體24GB以上的GPU,除NVIDIA顯示卡外,還可透過FlagOS在AMD的ROCm環境及其他多種晶片平台上運行。該模型支援包括日語在內的多語言提示詞,已有日本的開發者與創作者開始試用。

總結

2026年9月,阿里巴巴以免費研究授權發布了圖像生成與編輯模型「Qwen-Image-2.1」。該模型雖然僅有7B的輕量級架構,卻支援透明背景生成與多參考圖編輯,阿里巴巴還宣稱其自測基準超越了多家大廠的同類模型。儘管商用仍需另行取得授權,但作為可在本機環境試用的開源權重模型,這無疑為希望將圖像生成AI導入自身產品的企業與個人提供了新的選擇。