xAI 于2026年9月21日发布了最新版人工智能模型「Grok 4.7」。这款新模型着力提升了在编程、专业知识工作以及需要数小时才能完成的复杂推理任务上的表现,同时代币单价维持在与上一版本相同的水平。新模型已迅速部署到开发工具和自家应用等多项服务中,在与竞品模型的基准测试对比中也展现出稳步提升。
基础模型规模扩大,训练数据更加丰富
Grok 4.7 的基础模型参数量达到约2.1万亿,较上一版本的1.5万亿增长约四成。据悉,本次训练采用了长时间、多阶段的强化学习方式,使用了需要数小时才能解决的高难度问题,重点提升了模型的自我校验能力和长上下文处理能力。此外,训练数据中还加入了该公司航天业务积累的工程记录,据称有助于提升模型在处理涉及物理系统的问题时的表现。
价格体系维持不变:每100万输入代币2美元(约318日元),每100万输出代币6美元(约954日元)。同时还提供响应更快的高级方案,输出速度提升一倍,价格也相应提升一倍。
编程与专业领域基准测试稳步提升
在性能方面,Grok 4.7 在多项编程能力评测中取得了明显进步。某软件开发任务评测指标从65.2%提升至71.0%,另一项指标也从40%出头提升至46.3%,超过了部分GPT系列模型。终端操作评测指标更是从20%左右大幅提升至38.0%。电气工程领域评测达到64.0%,法律类AI代理评测也提升至19.6%,均较上一版本有所进步。
在面向企业的智能体评测中,Grok 4.7 也取得了超过100分的显著提升。不过,在部分评测维度上,该模型仍略逊于其他厂商的顶尖模型,显示出各前沿模型之间的竞争依然十分胶着。开发方表示,将在后续推出的新版本中继续提升性能。
安全机制全面升级,拓展至开发工具与车载助手
此次更新还对安全机制进行了全面升级。在生物安全相关评测中,该模型取得了60%左右的分数;在网络安全相关的内部测试中,据称在不影响正当安全研究用途的前提下,拦截了九成以上的危险用途提示词。部分安全领域合作伙伴还将受邀获得用于防御性研究的红队测试工具。
新模型的应用范围也十分广泛:用户无需排队即可通过开发工具和API使用该模型,同时该模型也已集成到专属应用、社交平台以及车载语音助手等现有服务中。
总结
xAI 发布的「Grok 4.7」通过扩大基础模型规模、丰富训练数据,提升了在编程和专业知识工作方面的表现。价格维持在与上一版本相同的水平,同时多项基准测试成绩均有提升,预计将在从开发工具到车载助手等广泛场景中得到应用。随着后续新版本的陆续推出,AI 开发领域的竞争走向值得持续关注。
※为汇率换算参考:1美元=159日元(截至2026年9月25日)
