由前 OpenAI 研究员迪奥戈·阿尔梅达领导的 TypeSafe AI,于当地时间 9 月 15 日发布了新的模型类别「System One Models」以及该类别的首个模型「Jev」。它的设计相当决绝:完全不生成文字,只按照事先定义好的结构返回判断,端到端响应时间落在 0.07 秒到 0.5 秒之间。早期访问的申请也在同日开放。
不是聊天的延伸,而是在软件内部使用的判断
阿尔梅达表示,过去 4 年他一直在思考一个问题:模型在对话上早已超越人类,为什么自动化却没有随之到来。他在 OpenAI 参与过让模型遵循指令、与人对话的方法研究,这些成果构成了 ChatGPT 的基础。即便如此,他逐渐不再相信 AGI 就在聊天的下一站,于是用 2 年时间在隐形状态下转向了另一个方向。
由此得出的答案是名为 System One Models 的新模型分类。名称取自丹尼尔·卡尼曼的《思考,快与慢》,对应书中快速直觉的系统 1 与缓慢审慎的系统 2 之分。现有的 LLM 更偏向系统 2 的角色,而这一类别则彻底转向高速、结构化的判断。
首个模型 Jev 的名字来自经济学家威廉·斯坦利·杰文斯。这一命名呼应蒸汽机效率提升反而推高煤炭需求的悖论,寄托了这样一种判断:智能的单价每下降一个数量级,用途就会扩大若干个数量级。
放弃文字,换来类型保证与置信度
Jev 设计中最决绝的一点,是决定不输出字符串。常见的 LLM 逐个生成 token,累积起来成为聊天回复或代码。Jev 则按照事先定义的 schema,把可选项与概率并行地一次性输出。TypeSafe AI 把它描述为一种函数调用:输入非结构化的状态,输出带类型的概率判断。
在这种形态下,输出越出 schema 在原理上不会发生。工具调用里混进不存在的函数名、本该是数值的字段里塞进一段文字,这类事故就此消失。此外,每一个判断都附带经过校准的置信度。TypeSafe AI 的问题意识是:即使一个任务模型能解对 95%,如果它无法主动申报剩下的 5%,这个任务就无法交给自动化。
训练方法也是专门打造的。它没有采用以人类偏好为奖励的 RLHF,也没有采用以可验证答案为奖励的 RLVR,而是使用以概率诚实度为奖励的 RLCD(Reinforcement Learning for Calibrated Decisions)。设想的用途包括分类、路由、抽取与打分,也就是手写 if 语句容易变得脆弱的那些环节。为 LLM 的输出打分、或作为护栏使用,也被列入其中。
每百万输入 token 0.042 美元,输出免费
价格水平与既有模型完全不在同一个刻度上。Jev 的输入价格为每百万 token 0.042 美元(约 6 日元),输出 token 免费。TypeSafe AI 解释说,之所以标为 0 美元,是因为便宜到不值得计量。按该公司的对比,现有 LLM 的输入价格为每百万 token 0.20 美元(约 31 日元)到 10 美元(约 1,550 日元),输出大致是输入的 5 倍。
※1 美元 = 155 日元
低价的依据在于输出方式本身被改写了。放弃逐个吐出 token 的处理、改为并行一次完成,硬件因此不必空转。该公司把这种替换形容为与 Transformer 取代 RNN 同一类型的更替。
响应 0.07 到 0.5 秒,快到能玩 DOOM
速度差距更为极端。据 TypeSafe AI 的说法,前沿 LLM 的端到端响应需要 3 秒到 329 秒,而 Jev 在 0.07 秒到 0.5 秒内返回。前者用于和人对话尚可,一旦嵌入代码,等待时间就直接成了瓶颈。
作为直观的演示,该公司公开了让 Jev 玩经典游戏 DOOM 的视频。它每秒发出约 10 次查询,玩上 1 小时的费用约为 7 美元(约 1,090 日元)。负责这个演示的工程师原本担心每秒 10 次的频率,团队其他成员却认为比想象中便宜。需要说明的是,Jev 判断依据的并非游戏画面图像,而是结构化的游戏状态数据。
另一个演示是从一篇 Wikipedia 条目出发,只沿着途中遇到的链接到达另一篇条目。每一步都可能要在数百到数千个链接中做选择,因此除了速度之外,在选项极多时不会凭空造出不存在的链接这一优势同样关键。该公司注明,这个演示中各模型都运行在不开启推理的高速模式下,因此速度差距相对温和。
193 倍这个数字该怎么读
官方网站标出的 193.6 倍更快、444.6 倍更省,来自该公司新构建的工作流评测。做法是给每个模型同样的工作流,再以最昂贵的外部模型的预测作为基准概率进行比较。基准取 GPT-6 Astra 与 Fable 5.1 的平均值,TypeSafe AI 也自行承认,这种取法会对 OpenAI 与 Anthropic 的模型有利。
这种坦率贯穿全文。工作流由该公司自己的模型能力团队搭建,因此可能残留偏差;速度测量是从位于美国西海岸的笔记本电脑上执行的;价格是否被补贴,只能靠长期才能证明。类型错误 0% 这个数值也不是实测,而是因为 schema 匹配有保证,所以理论上可以标为 0。
反过来看,这里展示的优势全部出自该公司的自我评测,尚无第三方复现。虽然公开的评测站点可以追溯细节,但 193 倍更宜理解为条件齐备时的上限,而不是实际业务中能直接拿到的数值。
总结
TypeSafe AI 发布的 Jev 舍弃了文本生成,只返回结构化判断,走向了与既有 LLM 不同的方向。每百万输入 token 0.042 美元且输出免费、响应 0.07 秒到 0.5 秒、原理上不会产出 schema 之外的内容,这些是它并列的特征。193.6 倍更快的数字基于自我评测,但「为在代码内部使用而设计模型」这一思路本身,看起来很可能扩散到其他阵营。早期访问正在受理登记,等待名单的邀约也在陆续推进。
