OpenAI于7月9日开始正式提供新的大语言模型系列「GPT-5.6」。该系列由三款模型组成:旗舰级的「Sol」、面向日常工作的「Terra」,以及低价高速的「Luna」,并将陆续覆盖ChatGPT、面向企业的ChatGPT Work、编程助手「Codex」以及面向开发者的API。此次正式提供是在上月底以来的限定预览之后进行的,在通过美国政府部门的审查后,更大范围的使用得以放开。下面梳理三款模型的差异,以及官方公布的性能与价格要点。
按用途选择的三款模型
GPT-5.6采用性能与价格各异的三档结构。最高端的「Sol」是旗舰模型,力求在编程、检索、文档制作、网络安全乃至科学领域等广泛任务中取得最高水准的结果。中端的「Terra」定位为均衡地处理日常业务,最低端的「Luna」则适合追求响应速度快、成本低的场景。
据OpenAI介绍,Sol能够以比以往前沿模型更少的token(处理文本的最小单位)取得同等或更佳的成果,从而提高了每一美元支出所带来的性能。与其把一款聪明的巨型模型当作万能工具使用,不如根据工作的轻重来分别选用模型——这正是此次的设计思路。
基准测试展现的性能
作为性能佐证,OpenAI公布了若干指标。在衡量长时间专业工作完成能力的「Agents' Last Exam」中,Sol取得53.6%,比Anthropic的「Claude Fable 5」高出13.1个百分点。中端的Terra也以大幅更低的成本超过Fable 5,而低端的Luna在编程任务上超过Claude Opus 4.8,成本却仅约为其四分之一。
不过,这些数值均由OpenAI自行公布。实际使用体验会随任务和条件而变化,因此结合第三方验证来看待较为妥当。
面向开发者新增的机制
面向开发者,新增了能更快完成复杂工作的功能。重头戏是名为「ultra」的设置,它让四个智能体(agent)并行运行,分工协作应对课题。
另一项是可在API上使用的「Programmatic Tool Calling」。它不再逐次把外部工具调用返回给开发者,而是让模型当场编写并运行轻量程序,用以协调多个工具、筛选中间结果。由于减少了往返交互,多步骤的自动化更易于构建。同时还提供了处理多个智能体的新测试版功能,开发者可自行搭建相当于ultra的协同。
网络能力的增强及随之而来的限制
GPT-5.6被称为迄今网络安全能力最强的版本,在衡量可被攻击程度的指标「ExploitBench2」中取得73.5%。
强大也是一把双刃剑。OpenAI计划通过名为「Trusted Access for Cyber」的框架,收紧对网络能力最强模型的访问权限。相关用户须在9月1日前启用采用硬件密钥的「Advanced Account Security」,否则将无法继续使用这些模型。这是为了保护能力强大的模型免遭滥用或账户被盗,而要求使用方也具备一定的安全设置。
延伸到文档制作的适用范围
在编程之外,官方强调文档制作的质量有所提升。GPT-5.6能够从作为范本的一组幻灯片中读取版式、字体、间距、配色、幻灯片母版规则等「设计范式」,并将其一致地套用到新的资料上,使演示文稿、文档和电子表格的成品更为规整。
此外,其操作屏幕的「计算机操作」能力也有所提高,模型可对自己生成的结果进行检查,在最终提交前重新发现视觉或功能上的问题。
提供范围与价格
GPT-5.6系列将用24小时向全球陆续推出。API价格按每100万token设定:Sol为输入5美元(约810日元)、输出30美元(约4,860日元);Terra为输入2.50美元(约405日元)、输出15美元(约2,430日元);Luna为输入1美元(约162日元)、输出6美元(约970日元)。可使用的范围因ChatGPT、ChatGPT Work、Codex、API等套餐而异。
※1美元 = 162日元(截至2026年7月10日)
另外,关于旗舰Sol,官方还计划在专用芯片厂商Cerebras的硬件上提供每秒最高750token的高速方案,预计将进一步拓展到重视响应速度的用途。
总结
GPT-5.6的特点在于提供方式的转变——从把一款模型当作万能工具,转向根据工作的轻重在Sol、Terra、Luna之间分别选用。基准数值均为自家公布,不宜全盘相信,但此次发布把编程、文档制作和网络领域的实力与价格的兼顾摆在了前台。并行智能体、程序化的工具调用等面向开发者的机制,在实际业务中究竟能发挥多大作用尚待观察,第三方验证与一线的使用方式将成为关注焦点。
