8 月 13 日,OpenAI 抢先公开了新的服务层级 Ultrafast,它能让公司最强的模型 GPT-5.6 Sol 以最高 14 倍于标准处理的速度运行[1]。该层级首先在 OpenAI API 中提供,推理由 Cerebras 的芯片承担。输出速度可达每秒 750 个词元,而模型的智能水平与标准层级完全一致[1][2]。

速度与智能的取舍不再成立

此前若需要实时响应,通常只能切换到更小或更专用的模型[1]。前沿模型足够聪明,但用户必须等待,这一认知已经根深蒂固。

Ultrafast 指向了另一个方向。OpenAI 将其定位为提升单位时间内完成的有效工作量[1]。当速度不再以牺牲智能为代价,AI 就能进入业务中对时间最敏感的环节,一些原本无法成立的工作也随之成为可能[1]。

Cerebras 方面也强调了这一点。该公司首席执行官兼联合创始人 Andrew Feldman 表示,运行在 Ultrafast 上的 GPT-5.6 Sol 证明速度与智能不再互相排斥[2]。OpenAI 负责 Compute Strategy 与 GPT-Infra 的副总裁 Sachin Katti 也说明,公司正在探索当客户能以显著更低的延迟获得最强模型的智能时,究竟会带来什么新可能[2]。

支撑每秒 750 词元的晶圆级引擎

速度的来源是 Cerebras 的 Wafer-Scale Engine 架构[2]。整片晶圆作为单颗芯片使用,片上集成 44 GB SRAM,使模型权重在推理过程中始终驻留在芯片内部[2]。

基于 GPU 的推理必须在片上内存与片外存储之间反复搬运权重,这一内存带宽瓶颈限制了前沿模型的推理速度[2]。把权重留在片内就消除了这一约束。最终结果是在保持 GPT-5.6 Sol 完整智能的前提下,输出速度提升至每秒 750 个词元[1][2]。

Cerebras 还给出了对比数据。以 Artificial Analysis 公布的 Anthropic 模型输出速度为基准,Ultrafast 比 Fast 模式下的 Claude Opus 4.8 快 5 倍,比 Claude Fable 5 快 11 倍[2]。

基准测试中,3 天的计算量压缩到 11 小时

面向真实工作的基准测试把这一差距变成了具体数字。

在涵盖研究生水平化学、经济学与文学的 2,500 道题目测试 Humanity's Last Exam 中,GPT-5.6 Sol Ultrafast 用 11 小时出头完成了全部题目[2]。同一题库下 Claude Fable 5 需要超过 3 天的连续计算,也就是说 Ultrafast 以接近 7 倍的速度达到了相当的准确率[2]。

在汇集法律文书起草、财务模型搭建、工程报告撰写等高经济价值知识工作的 GDP-Val 上,Ultrafast 在不损失质量的前提下实现了端到端 5.6 倍的提速[2]。其关注点并非基准分数本身,而是达成同样成果所需的时间。

面向那些等不起的工作

OpenAI 列举了几个 Ultrafast 有望发挥作用的具体场景[1]。

在故障响应与可靠性领域,当关键系统宕机时,模型会比对应用日志、近期代码变更与工程师报告,在故障仍在持续期间锁定可能原因并协助准备修复方案[1]。在金融研究与安全领域,它能在行情仍在变化时分析市场信号、评估交易并识别可疑活动[1]。

在客户支持与语音场景中,目标是即便答案需要跨越多个步骤或系统,也能不中断对话、当场解决复杂问题[1]。在电商场景中,它会在顾客尚在犹豫时回答商品问题、查询库存、调整推荐并解决结算卡顿,赶在犹豫变成弃单之前完成处理[1]。

在实时研究与实验方面,过去需要跑一整夜的处理可以变成交互式的工作会话[1]。团队测试想法、查看结果、调整方案、再跑一次实验,整个流程不会被打断[1]。

OpenAI 内部已用于故障处理与调研

在 OpenAI 内部,一组开发者一直在测试运行于 Ultrafast 的 GPT-5.6 Sol,以了解哪些工作流能从可实时应答的前沿智能中受益[1]。

故障响应就是其中之一。警报触发时,系统与证据都仍在变化。团队用它读取日志、分析追踪数据、梳理沟通记录、找出下一步需要确认的检查项,并协助准备或验证修复方案,全程保持 Sol 的智能水平且耗时大幅缩短[1]。从观察到信号、验证假设到决定下一步行动之间的延迟被压缩,而判断与部署的责任仍由工程师承担[1]。

在调研工作中,团队用它检索知识源、查询数据,并跨已连接工具收集、整理和总结信息[1]。过去晚上批量启动实验、次日早上查看结果的常见做法,正在收敛为工作日内可以多次迭代的循环[1]。

目前为限量预览,价格与正式开放时间未公布

GPT-5.6 Sol Ultrafast 目前仅以限量预览形式向部分客户开放[1][2]。OpenAI 正与编程、电商、金融研究、客户支持等领域的企业合作,在真实生产环境中研究这些条件,再决定如何扩大部署[1]。

随着算力容量增长,开放范围会逐步扩大,但本次公告未提及价格体系与正式开放时间[1]。由于这是新增的速度层级,与标准层级之间的价差如何设定,将直接影响企业能否真正把它嵌入业务流程。

总结

OpenAI 公开了 Ultrafast 限量预览,可让 GPT-5.6 Sol 以最高 14 倍于标准处理的速度运行。推理由 Cerebras 的 Wafer-Scale Engine 承担,通过将模型权重保存在 44 GB 片上 SRAM 中消除内存带宽瓶颈,实现每秒 750 个词元的输出。在 Humanity's Last Exam 中,原本需要 3 天以上的处理被压缩到 11 小时出头,GDP-Val 也在不损失质量的情况下确认了 5.6 倍提速。目前仅面向部分客户提供限量预览,价格与正式开放时间尚未公布。

来源: https://openai.com/index/previewing-ultrafast

来源: https://investors.cerebras.ai/news-releases/news-release-details/cerebras-powers-ultrafast-mode-openais-gpt-56-sol