Thinking Machines Lab 发布了第二款模型 Inkling-Small。它采用 MoE 架构,总参数 276B、推理时激活 12B,约为 7 月中旬登场的旗舰模型 Inkling 的四分之一。与体积越小性能越弱的常识相反,它在推理和编程基准上超过了母模型。权重以 Apache 2.0 协议开放,量化版本可在单张 GPU 上运行。不过在事实知识方面,它明显出现了退步。
体积只有四分之一,却处在同一智能档位
Inkling-Small 是一个 42 层的纯解码器 Transformer,前馈部分采用稀疏 MoE(Mixture of Experts,专家混合)。总参数 276B,每个 token 只激活 12B。每个 token 从 256 个路由专家中选择 6 个,再加上对所有 token 都生效的 2 个共享专家。训练使用了 NVIDIA 的 GB300 NVL72 系统。
作为对照,旗舰模型 Inkling 的总参数为 975B、激活 41B,因此 Inkling-Small 在两项指标上都只有约三分之一。即便如此,第三方评测机构 Artificial Analysis 给出的 Inkling-Small 智能指数为 40,仅比 Inkling 的 41 低 1 分。该机构表示,在同等规模及更小的开放权重模型中,没有分数更高的。
有一处细节值得在部署前确认:官方博客称上下文窗口最高可达 100 万 token,而 Artificial Analysis 记录的是 256K token。上限似乎会因提供渠道而不同。
Thinking Machines Lab 是由 OpenAI 前 CTO Mira Murati 在旧金山创办的研究机构。这款第二代模型距离 Inkling 发布仅约两周。
后开始训练反而成了优势
小模型能够反超母模型,原因在于训练的先后顺序。按官方说法,Inkling-Small 的训练晚于大模型启动,因而有余地重新调整预训练数据配比和机器学习方案。
此外,团队对中途的检查点做了后训练,其中一部分采用以 Inkling 为教师的同策略蒸馏。在此基础上,又花了两周继续扩大智能体式编程的强化学习规模。性能提升来自训练流程的重组,而非堆参数。
强项超过母模型,知识面则落后
把数字排开来看,进步和退步的领域泾渭分明。
推理方面,Humanity's Last Exam(纯文本)为 31.6%,高于 Inkling 的 29.7%。GPQA Diamond 是 89.5 对 87.2,ARC-AGI-2 是 40.1 对 36.5。编程方面,SWEBench Verified 为 80.2 对 77.6,Terminal Bench 2.1 为 64.7 对 63.8。衡量工具调用的 Toolathlon Verified 则是 54.4 对 45.5,拉开近 10 个百分点。
退步的是事实知识。SimpleQA Verified 只有 20.6%,不到 Inkling 43.9% 的一半。金融任务 τ³-Banking 也以 15.5 对 23.7 落后。在 Artificial Analysis 的统计中,AA-Omniscience 指数为负 9.0,而 Inkling 为 2.1,意味着答错多于答对。不过该机构指出,原因并非幻觉增多,而是正确率本身只有 31%;其幻觉率反而低于 Inkling,为 57%。
概括来说,思考能力和工具使用能力得以保留,被削掉的只是记忆量。如果设计上通过搜索或 RAG 从外部提供知识,影响有限;若依赖模型自身的记忆,影响就会显现。
输出 token 的用法也很节省
输出 token 的规模同样值得一提。在 Artificial Analysis 智能指数的单个任务中,Inkling-Small 平均输出约 24,000 token,略少于 Inkling 的约 25,000。同一智能档位的 DeepSeek V4 Flash(max)约为 45,000,GPT-5.4 mini(xhigh)约为 78,000,相比之下它相当简洁。
在衡量长周期作业的 AA-Briefcase 上,它取得 917 Elo,超过 Inkling 的 839。但 Artificial Analysis 提醒,两者的评分表通过率几乎相同(20% 对 19%),因此更像是输出的呈现方式变好,而非正确性大幅提升。它完成任务的平均轮数为 34,不到 Inkling 81 轮的一半。
音频与图像持平,自建部署起步 180GB
多模态方面基本保持了 Inkling 的水准。无编码器的架构没有变化:图像被切分为 40×40 像素的图块,经四层 hMLP 变换;音频则以 dMel 频谱图的形式处理。MMMU Pro 为 74.0%,图表理解的 CharXiv RQ 为 77.4%,若让模型用 Python 做裁剪和放大则可提升至 81.3%。音频侧 MMAU 为 77.0%,VoiceBench 为 90.1%。
自建部署的要求也已公开。模型卡显示,BF16 检查点需要合计 600GB 以上显存,相当于 4 张 NVIDIA B300 或 8 张 H200。NVFP4 版本把这一门槛降到 180GB,可在单张 B300(SM100 及以上)以 W4A4 运行,或在两张 H200 上以 W4A16 运行。支持的运行时包括 SGLang、vLLM、TokenSpeed、Unsloth 和 Hugging Face。
让 276B 级别的模型进入单卡射程,是一个不小的变化。不过前提仍是能租到一张 B300,因此这并不是在笔记本电脑上运行的量级。
安全评测与获取方式
安全后训练沿用了 Inkling 的方案,发布前的内部评估和外部伙伴红队测试也照旧执行。衡量能否拒绝明确有害请求的 StrongREJECT 为 98.4%。涵盖犯罪、暴力和军民两用风险的 FORTRESS 中,对抗性问题的拒绝率为 71.6%,无害问题的作答率为 96.9%。该实验室的结论是,相对现有开放权重生态并未带来实质性风险增量,同时建议面向消费者的部署叠加下游内容审核。
权重在 Hugging Face 上以 Apache 2.0 协议分发。模型也可在该公司的微调平台 Tinker 上使用,并可通过 Tinker Playground 进行文本、图像和音频对话。Inkling 与 Inkling-Small 均设有限时折扣。
总结
Inkling-Small 以总参数 276B、激活 12B 的配置,在推理和编程上超过了体积近四倍的母模型。权重采用 Apache 2.0 开放,NVFP4 版本可在 180GB 显存中运行。但另一方面,事实知识分数下滑超过一半,因此并不适合只依赖模型记忆的用法。较为稳妥的做法是,以搭配搜索和工具为前提,在自己的任务上重新测量后再做判断。
