OpenAI 於 9 月 11 日公開了 Cognition 的應用案例,該公司正是自主軟體工程師 Devin 的開發商[1]。導入 GPT-6 Astra 之後,Devin 會自行測試寫出來的程式碼,並附上記錄執行過程的影片,以及一份說明檢查了哪些項目、哪些範圍尚未驗證的報告。目的在於減少人工逐行檢視程式碼的負擔。
讓寫程式的一方順手把測試做完
Cognition 是 Devin 的開發商,使用者橫跨大型銀行到技術型新創公司。該公司表示,隨著工程團隊產出的程式碼愈來愈多,審查這些成果本身反而成了負擔[1]。產出速度愈快,驗證就愈跟不上。
正因如此,GPT-6 Astra 的特性引起了他們的注意。Cognition 共同創辦人 Walden Yan 指出,Astra 最明顯的進步在於能夠測試自己的成果,並證明其運作符合預期[1]。這裡看重的並非寫程式的速度,而是模型能否自行提出成果確實可以運作的證據。
錄下執行過程,並主動申報未涵蓋的範圍
官方介紹的一個實例,是針對 iPhone 遊戲 Otter Run 進行的測試。Devin 透過 Astra 驗證這款遊戲,回傳在模擬器上執行的錄影,同時附上一份報告,列出通過的檢查項目以及仍未觸及的範圍[1]。
這兩份材料的角色並不相同。錄影呈現應用程式實際的運作狀況,報告則以文字說明測試涵蓋到哪個程度。工程師把兩者對照來看,就能在不逐行追蹤程式碼的前提下,掌握實際行為與剩餘的待確認事項[1]。
效益不只出現在開發階段。當客戶傳來問題的螢幕截圖時,團隊可以直接透過 Astra 把截圖交給 Devin,取回修正後的結果截圖。Yan 表示,這套流程讓回覆客戶的速度快了許多[1]。
橫跨 Devin 本體、CLI 與桌面版
Cognition 正把 Astra 推展到整條產品線。除了作為核心的雲端代理之外,該公司表示也用它改良 CLI 與桌面產品[1]。依照 Cognition 自己的公告,Astra 已可在 Devin Desktop 與 Devin CLI 使用,在 Devin Cloud 中則是作為多模型組合的一部分運作[2]。
自家基準的數據同樣已經公開。在以品質與可合併性為真實工程任務評分的專有基準 FrontierCode 1.1 中,GPT-6 Astra 取得 64.5 分,勝過 Claude Fable 5.1 的 63.6 分,與居首的 Claude Fable 5(64.9 分)相差 0.4 分,成本卻低 64%[2]。
Cognition 另外提到,若只看驅動 Devin 測試功能的場景,Astra 在其內部測試基準上達到了最高水準。產生的測試更為完整,報告更清楚,影片佐證也更容易運用[2]。
審查的形態會不會改變
Cognition 著眼的是審查流程本身的重組。如果 Devin 能夠自行測試,並把結果當成證據提出,工程師就能在大幅減少人工閱讀程式碼的情況下評估變更[1]。Yan 也表示,隨著時間推移,需要親自檢視的程式碼會變少,最終能夠交付的成果則會增加[1]。
不過,這件事終究取決於證據本身的品質。若測試涵蓋範圍不足,錄影與報告就會淪為讓人誤以為已經確認過的材料。設計上主動申報未驗證範圍,看得出是刻意避開這個陷阱。至於在實務上能信任到什麼程度,仍得由使用方自行衡量。
總結
Cognition 把 GPT-6 Astra 導入 Devin 的測試功能,讓代理回傳執行錄影與涵蓋範圍報告這一組材料。在 FrontierCode 1.1 上,該模型與 Claude Fable 5 僅差 0.4 分,成本卻低 64%,並且據稱在內部測試基準上達到最高水準。面對寫程式愈來愈快、驗證卻愈來愈塞的局面,這個案例提出的解法,是把提出證據的一側交給模型。
[1] 來源:https://openai.com/index/cognition-devin-testing-with-astra
