阿里巴巴的AI研究团队Qwen于2026年6月16日发布了用于驱动机器人的基础模型套件「Qwen-Robot Suite」。该套件由阿里巴巴旗下的通义实验室开发,包含负责移动到目的地的「Qwen-RobotNav」、负责操控机械臂的「Qwen-RobotManip」,以及理解周围环境并预判后续变化的「Qwen-RobotWorld」三款模型。这标志着AI正从处理文字的聊天机器人,向在现实世界中驱动实体的物理AI迈进。
继语言模型之后,迈向「拥有身体的AI」
此前,生成式AI的主战场一直是处理文字和图像的软件领域。Qwen-Robot Suite将这项技术带入物理空间,目标是让机器人能够完成「移动」「抓取物体」「理解环境」这三项基本动作。阿里巴巴将其定位为机器在物理世界中行动所需的一整套软件基础,其特点在于提供了不绑定于某一台特定机器人的通用底座。
三款模型各司其职,但组合使用时可以贯通完成一连串流程,例如「接收指令后移动到目的地,找到目标物并进行操作」。能够以语言指令为起点行动,是它与传统机器人控制的最大区别。
Qwen-RobotNav是引导机器人抵达目的地的导航模型。它以同时处理视觉与语言的Qwen3-VL为基础,使用1560万条数据进行训练。值得关注的是,它将遵循指令移动、按指定地点移动、搜索目标物、追踪目标以及自动驾驶这五种性质不同的任务,统一由一个模型来承担。
在衡量性能的基准测试中也给出了具体数字。在贴近真实环境、按语言指令移动的VLN-CE RxR测试中,它取得了76.5%的成功率;在评估持续追踪目标能力的EVT-Bench测试中,达到了90%的追踪精度。这是一款即使身处首次到访的场所,也力求能够依据自然语言指令行动的模型。
Qwen-RobotManip 跨越结构不同的机械臂进行操控
Qwen-RobotManip是负责用机械臂抓取和移动物体的模型。它以Qwen3.5-4B为底座,结合公开的机器人数据集与人类作业视频,使用约3万8100小时的数据进行训练。不依赖仅靠自家机体采集的专用数据,而是利用广泛流通的数据来实现规模化,是其在开发上的一处巧思。
机械臂因厂商和产品不同,在关节数量、臂长以及驱动方式上各不相同。这种机型间的差异,一直是复用同一操作模型的障碍。Qwen-RobotManip的设计可以跨越结构不同的机械臂,在评估桌面作业的RoboChallenge Table30-v1中位居榜首,据介绍较以往方法提升了20%。
Qwen-RobotWorld 行动之前先预判「接下来会怎样」
三款模型中最具挑战性的,是充当世界模型的Qwen-RobotWorld。它会在机器人实际开始动作之前,对「这一环境接下来会如何变化」进行模拟和预测。它借助视觉语言模型用语言描述周围环境,并能够跨越移动、驾驶、操作等场景,预见在物理上合乎逻辑的未来走向。
应用示例包括:根据人手作业的视频生成机械臂的动作,以及从一条指令出发,生成在时间和空间两方面都保持一致的多角度影像。能够事先在脑海中描绘出行动的结果,是安全且高效地驱动物理AI的重要基础。
先面向企业试点提供,中国厂商的物理AI竞争提速
Qwen-Robot Suite目前处于通过阿里云面向部分企业客户的试点提供阶段。阿里巴巴希望让这三款模型成为各类机器人可以共用的底座,有报道将这一举措评价为意在打造「机器人领域的安卓」。在语言模型上一路领先的中国大型科技企业,似乎也在现实世界中驱动实体的机器人领域不断增强存在感。
面向机器人的基础模型,是全球企业和研究机构竞相开发的领域。由一家公司将移动、操作、预测这些主要功能一并呈现,意义不容小觑。接下来值得关注的,是兼容的机器人和实际落地案例今后能扩展到何种程度。
总结
2026年6月16日,阿里巴巴旗下的Qwen发布了面向机器人的基础模型套件「Qwen-Robot Suite」。它由负责移动的Qwen-RobotNav、负责机械臂操作的Qwen-RobotManip,以及负责预测的世界模型Qwen-RobotWorld三大支柱构成,力求贯通完成从语言指令到一连串动作的全过程。各模型还给出了具体的基准成绩,目前正通过阿里云面向企业试点提供。这是一则标志着AI主战场正从聊天机器人转向现实世界的发布。
