Inception 于 9 月 8 日发布了 Mercury 2.5,这是一款以扩散方式而非传统逐字生成为基础的大语言模型。其生成速度达到每秒 1,107 个 token,官方称智能水平较 Mercury 2 提升 40%。这个一直以速度作为招牌的系列,如今在质量上也开始与成本优化型前沿模型正面较量。
不是一个个吐字,而是并行落子
多数大语言模型都是从头到尾一个 token 接一个 token 地生成文本。Mercury 系列放弃了这个前提,把图像生成中常见的扩散方法搬到语言上:模型先给出一份粗略草稿,再并行改写其中的 token,直到结果收敛。由于 token 不需要排队逐个产出,GPU 的空转时间减少,同样的硬件也能更快返回结果。
Inception 表示,Mercury 2.5 是目前市面上能力最强的扩散式大语言模型,据其所知也是迄今训练规模最大的扩散语言模型。这一速度是在广泛供应的英伟达 GPU 上测得的,而非依赖某种专用加速器,这一点对实际部署很关键。
服务成本不变,能力单独加码
公开的数据说明了它的定位。生成速度为每秒 1,107 个 token,上下文长度为 260,000 个 token。智能水平较 Mercury 2 提升 40%,与 GPT-5.6 Luna(Low)、Gemini 3.5 Flash-Lite、Claude Haiku 4.5 等成本优化型前沿模型处于同一水平。
价格方面,每 100 万输入 token 为 0.20 美元(约 31 日元),每 100 万输出 token 为 0.75 美元(约 115 日元)。发布期间享 80% 折扣,输入降至 0.04 美元(约 6 日元),输出降至 0.15 美元(约 23 日元)。新增能力包括可调节的推理深度、并行工具调用,以及符合 schema 的 JSON 输出。
※1 美元 = 153 日元
Inception 称,这一轮改进来自实际生产环境而非刷榜。自 Mercury 2 上线以来,其使用量增长了一个数量级以上,覆盖搜索、语音、编程等对延迟敏感的场景。团队把客户反馈和真实的失败案例纳入评测集,并据此收窄训练方向。英伟达方面也评论说,这次发布体现了新架构成熟为可投入生产的系统的速度之快。
真正见效的,是反复调用模型的环节
速度的价值不在于一次可见的回答,而在于其背后隐藏的数十次模型调用。一次搜索请求可能触发一连串工作:制定检索计划、改写查询、对结果重排序、结构化事实、总结来源、校验答案。任何一环变慢,整体就会超出用户愿意等待的时间。
在语音场景中,延迟就是通话者听到的沉默。开发 AI 电话客服的 OpenCall 切换到 Mercury 后,模型响应延迟的中位数降至 170 毫秒左右。该公司表示,最慢的那部分响应从数分钟降到约 1 秒,中位数也从 0.4 秒降至 0.2 秒以内。
编程助手同理。Augment Code 将 Mercury 用于上下文压缩、模型路由和 MCP 工具检索。把压缩环节迁过去之后,耗时从约 150 秒降至 27 秒,缩短 82%,成本下降 90%。工具检索的摘要可在 1 秒内返回。
Mercury Voice 与 Mercury Router 同步预览
与 Mercury 2.5 一同亮相的还有两款衍生模型。Mercury Voice 面向语音智能体优化,首个 token 的返回时间控制在 170 毫秒以内。Mercury Router 则用扩散模型理解收到的提示词,再把任务分派给质量、速度与成本组合最优的模型,候选范围同时包含开源与闭源模型。
Mercury 系列除了自家 API,还可通过 Baseten 和 OpenRouter 调用。其 API 兼容 OpenAI 接口,现有代码几乎无需改动即可切换。企业部署还提供专用容量、自动扩缩容、合规控制以及可配置的数据保留策略。Inception 已经启动了下一款模型的训练,称其将是自家规模最大的一款。
总结
Mercury 2.5 在保持前代速度与价格结构的前提下,把智能水平提升了 40%。每秒 1,107 个 token、260,000 token 上下文、每 100 万输入 token 0.20 美元的组合,让它站上了成本优化型前沿模型的同一条起跑线。在搜索、语音以及编程助手的辅助调用中,一次交互往往扇出为数十次模型调用,这里的速度与价格会不断累积,最终变成体验上的差距。这次的数据说明,选择扩散不再意味着为吞吐牺牲质量。
