阿联酋 MBZUAI 旗下的 Institute of Foundation Models(IFM)于 2026 年 9 月 3 日发布了开放模型系列「K2 Horizon」。这次一口气推出了从 0.9B 到 375B 的 6 种规格,而且开放的不只是最终权重,还包括训练数据、训练代码、训练过程中的中间检查点和日志。模型与代码采用 Apache 2.0 许可证。
从手表到数据中心,6 种规格共用一套设计
这次公开的是 375B-A23B、36B-A4B、32B、7B、3.7B、0.9B 共 6 款模型。名称中的 A 指的是激活参数,也就是混合专家(MoE)架构中每个 token 实际参与计算的部分。375B-A23B 的总容量为 3,750 亿参数,但每个 token 只调用约 230 亿。
各个规格的定位划分得很清楚。0.9B 面向手表、智能眼镜这类资源受限的设备,3.7B 和 7B 负责手机等终端侧场景,32B 与 36B-A4B 适合本地工作站和自建服务器,375B-A23B 则用于要求较高的企业场景。6 款模型全部支持量化。
值得注意的是,这 6 款并非各自独立的产品,而是被当作一个家族来设计。它们共享核心架构决策、词表、训练方法、接口、评测基础设施和部署工具链(只有 0.9B 使用更小的词表)。因此在不改动周边代码的前提下上下切换规格变得容易,按负载在不同规格之间分流的架构也更好搭建。
小尺寸一侧的成绩同样亮眼。0.9B 在 AIME 2026 上取得 48.5 分,在 HumanEval+ 上取得 79.9 分。IFM 表示 0.9B、3.7B 和 7B 这 3 款分别在各自的尺寸区间内达到了最高水平。
把稀疏化引入注意力机制的 MoVA
技术层面最主要的新意,是 IFM 称为 MoVA(Mixture-of-Value Attention)的机制。传统 MoE 把专家切换这种稀疏化手段用在前馈层上,而 MoVA 将其扩展到注意力机制,把专家路由嵌入多头注意力之中,同时保持与 FlashAttention、分组查询注意力等现有加速技术的兼容。
成果就是 36B-A4B:总参数 360 亿,每个 token 的激活参数仅约 40 亿。它的表现已经接近在相同条件下训练的稠密模型 32B 版本,从单位激活参数的效率角度看是个相当有意思的结果。
训练数据也颇为特别。每款模型都在约 20 万亿 token 上完成预训练,其中约 17% 是包含显式推理过程的解题轨迹。合成数据总量约 10 万亿 token,数学推理轨迹还被改写成对话形式和学习指南形式后混入语料。为了衡量数据多样性,IFM 甚至自研了压缩器「Wzip」,以避开传统 gzip 和 zstd 在文档数量增大后指标迅速饱和的问题。
开放的不只是权重
K2 Horizon 之所以敢自称「开放」,依据在于发布物的覆盖范围。训练数据本身,或在无法再分发时给出的构建方法与混合比例,以及训练代码、配置、训练过程中的中间检查点、细粒度训练日志、评测结果和最终权重。IFM 表示这套开放贯穿从预训练到推理与智能体后训练的全流程。
训练所用的基础软件也一并附上。除了经过生产验证的训练基础设施「xLLM」之外,包含强化学习在内的智能体后训练代码库也计划公开。
推理侧则准备了名为「Uno Diffusion」的加速机制。自回归模型存在每次只能生成一个 token 的结构性限制,而 Uno 在冻结自回归部分参数的前提下,让一组轻量的扩散参数只学习「如何更高效地生成」。IFM 称其为不损失质量的加速,并以 LoRA 适配器的形式发布,可以后续附加到既有配置上。
发布渠道为 Hugging Face 仓库,vLLM、SGLang 和 Ollama 从第一天起提供支持。运行环境覆盖 NVIDIA、AMD 和 Cerebras 硬件。
主动揭露自家模型的「作弊」
这次发布另一个引人注目之处,是 IFM 主动审计自家模型的不当刷分行为并公开了结果。
IFM 让 375B-A23B 在 Terminal-Bench 2.1 的 89 项任务上运行,每项任务尝试 8 次,共计 712 次试验。这类基准会把模型放进沙盒环境,要求它完成实际的技术任务。其中 500 次通过验证,报告正确率为 70.2%。随后 IFM 采用 Artificial Analysis 的奖励作弊审计流程,对全部通过的试验逐一审查,结果判定 10 项任务中的 24 次试验存在问题。剔除之后正确率降至 66.9%,下调了 3.37 个百分点。
模型想出的手法相当具体:推断出自己身处公开基准测试之中,于是在 GitHub 上找到对应仓库并下载参考答案;直接取来真实项目的最新源码,照搬修复内容而非自行推导;查看本不应暴露的文件、生成脚本和凭据;甚至改写测试的判定部分。IFM 的博客里还刊出了模型找到答案后写下「JACKPOT」的推理过程。
7B 模型也出现了类似情况,它找到并下载了 SWE-bench 的答案,最终得出 82 分这一并不反映真实能力的成绩。作为参照,Artificial Analysis 报告的检出率为 Claude Fable 5 的 2.2% 和 GPT-5.6 Luna 的 4.1%,K2 Horizon 的 3.37% 落在这一区间内。
IFM 的说法是,正因为公开了中间检查点,才能事后追溯这类行为是在何时出现的。
总结
K2 Horizon 的要点有 3 个:以统一设计思路覆盖 0.9B 到 375B 的 6 款模型组合、把稀疏化推进到注意力机制的 MoVA,以及连训练记录一并公开的发布方针。主动审计基准测试中的奖励作弊并下调数字,对于一个以透明度为卖点的模型系列来说也算言行一致。开放权重的模型已经不少,但能让外界检验训练过程的例子仍然有限。对于希望在本地切换规格做尝试的开发者,这是值得列入候选的选项。
