中国阿里巴巴旗下生成式AI品牌「通义千问(Qwen)」团队发布了新一代图像生成与编辑模型「Qwen-Image-2.1」,并以免费的研究许可证公开。该模型参数规模仅为7B,却支持生成和编辑带透明背景的图像,还能基于最多十张参考图像进行编辑,功能相当全面。
7B架构兼顾生成与编辑
Qwen-Image-2.1由7B参数的图像生成模块,与负责图文理解的80亿参数视觉语言模型「Qwen3-VL」组合而成。模型内部采用32层扩散变换器(DiT)结构,将文本与图像信息作为同一序列处理,并配备可根据任务切换注意力范围的机制,使其更容易理解复杂指令。在文生图方面,模型以2048×2048像素为基准分辨率,最高支持2752×1536像素等七种画面比例。编辑功能可接受最多十张参考图像,能在保持人物身份一致的前提下更改姿势或背景,也可以仅指定图像中的某个区域进行局部重绘。该模型还能直接生成和编辑带原生透明通道的RGBA图像,并通过复用文本与参考图像的计算结果来提升处理效率。
阿里巴巴称基准测试超越谷歌「Nano Banana 2.0」
在阿里巴巴自行搭建的评测体系「Qwen-Image-Bench」中,Qwen-Image-2.1获得60.28分,略微超过谷歌图像生成模型「Nano Banana 2.0」的59.82分。阿里巴巴表示,这一成绩使该模型在现有开源权重模型中处于最高水准,性能可与OpenAI、Meta的图像生成模型相媲美。不过,这些数据来自阿里巴巴自行设计的基准测试,目前尚未得到广泛的第三方独立验证。
商用需另行授权,主流工具已完成适配
Qwen-Image-2.1基于「通义千问研究许可协议」发布,研究与评测用途可免费使用,但商用需要与阿里巴巴另行签订协议。据介绍,使用该模型生成的图像本身的权利归用户所有,不受许可协议约束。模型可从Hugging Face、魔搭社区(ModelScope)及GitHub获取,目前已适配Diffusers、ComfyUI、vLLM-Omni、SGLang、LightX2V等主流工具。本地运行大致需要显存24GB以上的GPU,除英伟达显卡外,还可通过FlagOS在AMD的ROCm环境及其他多种芯片平台上运行。该模型支持包括日语在内的多语言提示词,已有日本的开发者和创作者开始试用。
总结
2026年9月,阿里巴巴以免费研究许可证发布了图像生成与编辑模型「Qwen-Image-2.1」。该模型虽然只有7B的轻量级架构,却支持透明背景生成与多参考图编辑,阿里巴巴还声称其自测基准超过了多家大厂的同类模型。尽管商用仍需另行授权,但作为可在本地环境试用的开源权重模型,这无疑为希望将图像生成AI融入自身产品的企业和个人提供了新的选择。
