xAI 在当地时间 6 月 28 日开始向旗下的 SpaceX 与特斯拉提供新款 AI 助手「Grok 4.5」的私有测试版。其核心采用了一款全新的、拥有 1.5 万亿参数的基础模型(可作为多种用途底座的大规模模型)「V9」。埃隆·马斯克表示「早期评测显示其性能接近、甚至可能超过 Anthropic 的顶级模型 Opus」,但该模型尚未对外公开,也没有第三方对此进行验证。与之一同披露的「每月从零训练并推出一款全新基础模型」的计划也引发关注。
1.5 万亿参数的新基础模型「V9」
支撑 Grok 4.5 的 V9,是 xAI 的第九代基础模型,其预训练(用海量数据打造模型底座的过程)已于 5 月 26 日完成。参数量为 1.5 万亿,是目前在 X 和特斯拉车辆上量产运行的「v8-small」(5000 亿)的 3 倍。
不过,规模扩大并不能直接决定性能。据称在 V9 中,代码开发工具 Cursor 的工作数据并非在预训练的最初阶段加入,而是在其后的补充学习阶段才加入。xAI 的工程师也承认「这不如从最初训练就纳入的效果好」,并说明下一款 2 万亿参数的模型将在预训练阶段就纳入 Cursor 的数据。换言之,刚刚进入测试的 Grok 4.5 可能带有其后继模型正着力解决的结构性短板。
V9 针对 NVIDIA 的 Blackwell 世代 GPU 进行了优化,并在 xAI 位于田纳西州孟菲斯的大规模算力基础设施「Colossus」上完成训练。据称即便在私有测试期间,强化学习(通过反复试错提升性能的方法)仍在持续改进该模型。
「接近 Opus」仅基于内部评测
马斯克的说法中值得注意的一点是,其依据的评测全部在内部进行。承担测试的 SpaceX 与特斯拉,均隶属于如今拥有 xAI 的同一家 SpaceX corporation,之间并不存在独立的第三方。
此外,xAI 并未将现有世代的 Grok 提交给任何主流的第三方基准测试。在 AI 业界,开发方的自报数值与外部实测值之间存在偏差的情况屡有报道,某款模型的开发方曾在一项难题测试中宣称 50%,而独立研究者的实测仅为 29.4%。
比较的对象本身也在变动。在由独立机构汇总 9 项评测算出的「Artificial Analysis Intelligence Index」中,目前由 Claude Fable 5、Claude Opus 4.8 等 Claude 系模型占据前列,Grok 并未上榜。在衡量编程能力的「SWE-bench Verified」中,运行于 Opus 4.7 之上的 Claude Code 取得了 87.6%,而 xAI 的旧款模型为 70.8%。V9 相较旧款模型确有进步,但只要既未公开也未提交基准测试,「接近 Opus」就仍是一个无法验证的说法。
为何 SpaceX 与特斯拉优先
Grok 4.5 在面向公众之前先交由内部使用,其背后是企业结构的变化。SpaceX 于 2026 年 2 月收购了 xAI,将火箭企业与 AI 研究机构合并为一个整体,合计估值达 1.25 万亿美元(约 201 万亿日元)。※1 美元 = 161 日元(截至 2026 年 7 月 3 日)
这场合并为模型开发带来了特殊的循环。多数 AI 企业依靠公开基准测试和模拟任务来检验模型,而 SpaceX 与特斯拉产生的是实务本身的负荷——卫星的轨道计算、车辆的制造流程、数千名工程师编写的软件。其意图正是从中获取标准化考试分数无法衡量的信息。
然而,这并不是普通用户可以使用的产品。开发者所用的公开 API 目前仍运行着以「v8-small」为底座的 Grok 4.3,而这正是马斯克本人此前评价为「存在诸多根本性缺陷」的模型。放在 SpaceX 现场的模型,与通过 API 可用的模型,二者的差距在参数量上约为 1 万亿。
每月推出全新基础模型的计划
本次发布中不容忽视的,或许不是测试本身,而是其中埋藏的计划。xAI 表示,将在 2026 年底前每月推出「从零重新训练」的全新基础模型,而非现有模型的升级版。
软件每月更新并不稀奇,但基础模型的每月更新则是另一回事。训练一款基础模型需耗费数亿美元级别的费用,并需依次经历预训练、监督微调、强化学习等工序。若真要每月运转一次,这将成为一项关于 Colossus 算力的、前所未有的主张。
对开发者而言,这还会带来与性能无关的另一重烦恼。若在评测并将某款模型整合进产品之后,每隔 30 天就出现一款新模型,那么迁移的成本与精力便不容忽视。快速的更新节奏,反而可能让开发者的选型变得更加困难。
与收购 Cursor 的关系
xAI 的举动也与其对代码开发工具 Cursor 的收购交织在一起。这项与开发方 Anysphere 达成的交易,是一笔总额 600 亿美元(约 9.7 万亿日元)的全股票交易,于 2026 年 6 月签署,预计在第三季度内完成。一旦实现,xAI 将获得 Cursor 的工作数据,以及超过 100 万开发者的使用基础。
不过,当下的制约在于时间。Cursor 此前一直保持着能够同时处理 Anthropic 的 Claude、OpenAI 的 GPT 以及自家 Composer 等多款模型的「模型无关」姿态。在合并完成、V9 系模型进入公开 API 之前,这些选择预计将维持不变。
总结
Grok 4.5 是一款采用 xAI 迄今最大基础模型 V9 的雄心之作,但其真实面貌仍有诸多隐藏。它止步于 SpaceX 与特斯拉的私有测试,未给出公开发布的时间,也未接受任何第三方基准测试。而且普通用户真正能接触到的公开 API,仍运行着开发方自己承认存在缺陷的旧款模型。「接近 Opus」的性能说法是否属实,只能等待公开发布与独立评测。倘若每月从零推出新模型的计划得以实现,将改写业界的速度感;但就目前而言,被宣称的性能与手中可用的性能之间,仍横亘着 1 万亿参数的鸿沟。
