小米发布了新一代大语言模型系列MiMo-V2.6。该系列以参数规模超过万亿的旗舰版Pro为核心,同时提供多种规格,所有版本的权重均以宽松的MIT许可证免费开放。第三方机构的评测显示,该模型在开源权重模型中位居榜首,以相对有限的训练成本实现了较高水平的性能,因此受到广泛关注。

四款模型,共享同一套能力

该系列的核心是MiMo-V2.6-Pro,总参数量超过一万亿,采用混合专家(MoE)架构,推理时仅激活其中一小部分参数。轻量版MiMo-V2.6-Flash的总参数量为数千亿规模,相比Pro计算负担更轻。

此外,小米还发布了面向企业托管环境、响应速度更快的Pro-UltraSpeed版本(输出速度最高提升20倍),以及面向研究用途、参数量不足百亿的蒸馏模型。Pro、Flash及Pro-UltraSpeed均支持100万令牌的上下文窗口,并可接收文本、图像、音频和视频作为输入,不过目前输出仅限文本。

内部采用专家路由架构,并支持图像理解

Pro的内部结构由数十层Transformer模块组成,其中包含数百个路由专家,每个令牌仅激活其中少数几个。该模型还配备了用于加速生成的推测解码机制,以及专门处理图像输入的视觉编码器。

其注意力机制结合了仅关注局部范围的滑动窗口注意力,以及少量能够纵览全文的全局注意力层。在部署方面,小米表示以全精度运行Pro大约需要8块高端GPU,而Flash所需数量约为一半,这为企业自行部署提供了参考。

公开训练成本,凸显性价比优势

MiMo-V2.6备受关注的一点,是其相对较低的训练成本。小米表示,此次针对代码编写、通用智能体任务、视觉推理以及网络安全等多个领域,统一进行了一次大规模强化学习训练,总花费约为350万美元(约合5.53亿日元)。训练过程中采用了一种高效的强化学习算法,通过并行且异步的方式大规模采样提示词,充分利用计算资源。小米还采取了直播训练过程这一较为罕见的做法。

※按1美元约合158日元换算(截至2026年9月25日)

在第三方机构发布的综合智能指数排行榜中,Pro在开源权重模型中获得了最高分。其单任务推理成本也控制在1美元以内,体现出性能与成本之间的良好平衡。

多项基准测试逼近行业顶尖水平

在具体的技术基准测试中,该模型同样表现不俗。在软件开发能力、智能体任务处理以及命令行操作等多项评测中,Pro的表现均优于轻量版Flash,两者都展现出了可实际应用的水平。在涉及复杂文件操作以及安全相关的评测中,得分也相对较高。

不过也有报道指出,与海外顶尖闭源模型相比,Pro在部分指标上仍有若干差距。尽管如此,考虑到其权重完全开放且训练成本相对较低,MiMo-V2.6依然凭借性能与开放性的结合,确立了自己独特的市场地位。

提供渠道多样,按令牌量计费

MiMo-V2.6的权重已在Hugging Face上以MIT许可证发布,允许研究及商业用途使用。除此之外,该模型还可通过小米自有API以及多个第三方AI平台使用,方便开发者根据自身环境灵活选择接入方式。

通过第三方平台使用时,Pro的输入价格为每百万令牌不到1美元,输出价格与之相当。更轻量的Flash价格更为低廉,而追求速度的Pro-UltraSpeed则相应地价格更高。部分开发者工具还在发布初期推出了限时免费使用Flash模型的活动。

总结

小米此次发布的MiMo-V2.6系列,最大的亮点在于以约350万美元的训练成本,免费开源了达到万亿参数级别的模型,并采用了宽松的MIT许可证。该模型在第三方评测中获得了开源权重模型的最高分,展现出较强的性能实力,同时提供从权重直接下载到多种API接入在内的丰富使用方式。尽管在部分指标上仍略逊于海外顶尖闭源模型,但凭借较低的开发成本与具有竞争力的价格,MiMo-V2.6有望在日趋激烈的开源AI模型竞争中成为一个具有吸引力的选择。

参考来源
https://datanorth.ai/news/xiaomi-releases-mimo-v2-6-pro-and-flash