OpenAI 于 9 月 11 日发布了 Cognition 的应用案例,该公司是自主软件工程师 Devin 的开发方[1]。接入 GPT-6 Astra 之后,Devin 会自行测试它写出的代码,并附上记录运行过程的录像,以及一份说明检查了哪些项目、哪些区域尚未验证的报告。目的是减少人工逐行查看代码的工作量。

让写代码的一方顺带把测试做完

Cognition 是 Devin 的开发方,用户涵盖大型银行到技术型初创公司。该公司表示,随着工程团队写出的代码越来越多,审查这些成果本身反而成了负担[1]。生成的速度越快,验证就越跟不上。

正因如此,GPT-6 Astra 的特性引起了他们的注意。Cognition 联合创始人 Walden Yan 表示,Astra 最显著的进步在于能够测试自己的成果,并证明其运行结果符合预期[1]。这里看重的不是写代码的速度,而是模型能否自行拿出成果可以跑通的证据。

录下运行过程,并主动申报未覆盖的范围

官方介绍的一个实例是对 iPhone 游戏 Otter Run 的测试。Devin 借助 Astra 验证这款游戏,返回在模拟器中运行的录像,同时给出一份报告,列明通过的检查项以及仍未触及的区域[1]。

这两份材料的作用并不相同。录像展示应用实际的运行表现,报告则用文字说明测试覆盖到了哪一步。工程师把两者对照起来看,就能在不逐行追踪代码的前提下,掌握实际行为与剩余的确认事项[1]。

效果不止体现在开发环节。当客户发来故障截图时,团队可以直接通过 Astra 把截图交给 Devin,拿回修复后的结果截图。Yan 表示,这一流程让面向客户的回复快了很多[1]。

覆盖 Devin 本体、CLI 与桌面端

Cognition 正在把 Astra 推广到整条产品线。除了作为核心的云端智能体之外,该公司表示也在用它改进 CLI 和桌面产品[1]。根据 Cognition 自己的公告,Astra 已经可以在 Devin Desktop 和 Devin CLI 中使用,在 Devin Cloud 中则作为多模型组合的一部分运行[2]。

自研基准的数据也已公开。在按质量与可合并性对真实工程任务打分的专有基准 FrontierCode 1.1 中,GPT-6 Astra 取得 64.5 分,超过 Claude Fable 5.1 的 63.6 分,与居首的 Claude Fable 5(64.9 分)相差 0.4 分,而成本低 64%[2]。

Cognition 还提到,如果只看驱动 Devin 测试功能的场景,Astra 在其内部测试基准上达到了最高水平。生成的测试更为全面,报告更清晰,视频证据也更便于使用[2]。

审查的形态会不会改变

Cognition 想要重塑的是审查流程本身。如果 Devin 能够自行测试,并把结果作为证据提交,工程师就可以在大幅减少人工阅读代码的情况下评估改动[1]。Yan 也表示,随着时间推移,需要人工查看的代码会变少,最终能够交付的成果则会增加[1]。

不过,这件事完全取决于证据本身的质量。如果测试覆盖不足,录像和报告就会退化成让人误以为已经确认过的材料。设计上主动申报未验证区域,看得出是有意规避这个陷阱。至于在实际工作中能信任到什么程度,还需要使用方自己去衡量。

总结

Cognition 把 GPT-6 Astra 接入 Devin 的测试功能,让智能体返回运行录像与覆盖范围报告这一组材料。在 FrontierCode 1.1 上,该模型与 Claude Fable 5 仅差 0.4 分,成本却低 64%,并且据称在内部测试基准上达到最高水平。面对写代码越来越快、验证却越来越堵的局面,这一案例给出的解法是把拿出证据的一侧交给模型。

[1] 来源:https://openai.com/index/cognition-devin-testing-with-astra

[2] 来源:https://devin.ai/blog/gpt-6-astra