由埃隆·马斯克掌舵的 xAI 于 2026 年 6 月 28 日,把新一代大语言模型 Grok 4.5 作为仅面向内部的私测,投放到 SpaceX 与特斯拉。该模型基于全新设计的基础模型 V9,规模扩展到 1.5 万亿参数。xAI 表示,内部评测显示其性能已逼近、甚至可能超过 Anthropic 的顶级模型 Opus。目前,公司先在自家集团内部进行实地验证,随后才会更大范围地发布。

1.5 万亿参数,基于全新基础模型 V9

Grok 4.5 最引人注目的,是 1.5 万亿参数的规模。2026 年 5 月下旬登场的上一代 Grok 4.4 约为 1 万亿参数,因此这次相当于增加了约 50%,而且只用了大约一个月就完成了这一扩展。

模型的底座采用了 xAI 所称的全新基础模型 V9。它与目前在 X 上运行的小型模型采用不同的设计,从中可以看出 xAI 打算基于这一基座陆续推出衍生模型。在如此短的时间里不断叠加代际的开发节奏,对竞争对手来说也难以忽视。

强化编程能力的关键是「Cursor」数据

Grok 4.5 的另一个特点,是把代码编辑工具 Cursor 的使用数据纳入了辅助训练。Cursor 是深受开发者欢迎的 AI 代码编辑器,其海量的真实工作记录中,包含了大量实际的编程流程、调试步骤以及设计判断。用这类数据加以训练,目的是提升模型在编程和技术推理方面的准确度。

此外,xAI 还叠加了通过强化学习(借助试错来改进回答的方法)进行的持续调优,以及对其所称 Grok Build 机制的更新。

为什么先在 SpaceX 与特斯拉试用

在公开发布之前,先把模型投放到 SpaceX 与特斯拉两家公司的一线,是有考量的。两家公司都处在硬件设计、软件与实时决策紧密交织的业务之中。火箭轨道计算、车辆软件开发等远比公开基准测试更难的实务,每天都在发生。

这样的一线,为 xAI 提供了竞争对手难以复制的验证环境。相比许多 AI 公司用公开基准测试和模拟任务来衡量性能,xAI 拥有在自家集团真实运营数据上打磨模型的优势。

「逼近 Opus」的说法仍有待验证

在性能方面,马斯克基于内部评测表示,模型「逼近、甚至可能超过 Opus」。不过,这一说法完全建立在 SpaceX 与特斯拉内部的评测之上,截至 7 月上旬,尚未公布任何第三方独立基准测试结果。一些提前试用早期版本的开发者称其「使用感受与 Opus 相似」,但这同样只是个人观感。要判断其真实实力,还需等待公开的评测指标或系统卡(system card)。

接下来:每月一款新模型与 Grok 5

xAI 为 2026 年下半年制定了相当激进的路线图。据称,在年底之前,公司将以每月一款的节奏,推出从零开始重新训练的新基础模型。更远一些,据传目标规模在 6 万亿到 10 万亿参数之间的 Grok 5,已在名为 Colossus 2 的大型算力基座上进行训练。

每月一次的迭代能否直接转化为性能的持续累积,目前仍是一个没有答案的问题。即便如此,这种开发速度本身,几乎必然会让各家 AI 公司的竞争进一步提速。

总结

Grok 4.5 是 xAI 的最新模型,基于全新基础模型 V9 扩展到 1.5 万亿参数,并借助 Cursor 数据强化了编程能力。它正在 SpaceX 与特斯拉内部进行实地验证,而所谓「逼近 Opus」的性能仍有待独立评测的检验。加上每月发布新模型以及雄心勃勃的 Grok 5 计划,这都是在展望 2026 年下半年 AI 竞争走向时不容错过的动向。