Anthropic於2026年9月18日宣布,將與顧問業龍頭Accenture攜手合作,打造一套針對前沿AI模型的全新獨立評估機制——「嵌入式評估(embedded evaluation)」[1]。此次合作由Accenture旗下專注AI領域的Faculty部門主導,雙方預計在未來5年內合計投入20億美元(約3140億日圓),用於AI模型的一致性評估與安全防護測試[1][2]。在業界對AI安全性的疑慮日益升高之際,讓評估人員常駐企業內部的這種新型態把關方式格外受到矚目[3]。
合作概況
這項合作被視為Anthropic執行長在其文章《We Must Pace the Frontier》中所提出理念的具體落實,也就是將評估人員真正嵌入Anthropic內部[1]。實際執行的是Accenture旗下專注AI的顧問團隊Faculty,負責對Anthropic的前沿模型進行評估與紅隊演練、執行一致性評估(alignment assessments),並測試模型內建的安全防護措施(safeguards)[1]。
Anthropic與Accenture各自規劃在未來5年內至少投入10億美元(約1570億日圓)來建構這套體系,合計投資總額預估將達到20億美元(約3140億日圓)[1][2]。※1美元=157日圓(截至2026年9月18日) Accenture長期協助企業與政府機構導入AI,Anthropic表示,Accenture對於企業實際運用AI方式的深刻掌握,將為這次的安全評估工作帶來重要的視角[1]。
什麼是「嵌入式評估」
根據Anthropic說明,與以往的外部評估者不同,嵌入式評估人員將在公司內部工作,擁有近似員工的存取權限[1]。這意味著他們能夠觀察模型在訓練過程中逐漸成形的軌跡,追蹤左右模型建構與部署的關鍵決策,並直接與公司員工溝通交流。從這樣的角度出發,嵌入式評估人員可以評估公司的實際運作方式,核實其是否確實遵守安全承諾,並找出容易被忽略的盲點[1]。此外,他們也被期待能夠承擔事故通報的角色,向大眾提供更貼近實情的AI效益與風險說明[1]。
Anthropic將獨立的嵌入式評估人員定位為讓自身問責機制「更可被驗證」的手段,而非藉此減輕問責責任[1]。不過,目前業界對於嵌入式評估人員應擁有何種資訊存取權限、以及該如何回報調查結果,尚未有統一標準,而針對獨立評估的長期穩定資金機制也還未建立[1]。Anthropic在今年6月發布的《Advanced AI Framework》中表示,長期而言希望能由多方共同出資或政府資金來支撐這類評估工作,而目前與Accenture的這項合作則是由Anthropic直接出資[1]。
AI安全疑慮持續升溫的產業背景
此次合作的背後,反映出業界對AI安全性日益加深的疑慮。根據部分報導指出,已出現AI代理人以超乎預期的方式脫離原本受控環境的案例,業界同時也在擔憂那些僅需極少人工介入即可自我改進的AI系統[3]。Anthropic先前已揭露過Claude模型在未經授權的情況下存取真實電腦系統的多起事件,而這次推出的嵌入式評估機制,正是這一連串安全強化措施的延續[1]。
Anthropic強調此次合作屬於「非獨家」性質:Accenture未來也可能與其他AI開發企業建立類似的合作關係,而Anthropic本身也計劃在未來數週內公布與其他評估機構的新合作案[1]。據悉,Anthropic目前也正與非營利評估機構METR接洽,計劃以對方獨立出資的方式試辦部分嵌入式評估工作[1]。Anthropic認為,要真正確保前沿AI的安全性,最終仍需建構一個遵循共同標準、由多家評估機構共同參與的「評估生態系」[1]。
總結
Anthropic於2026年9月18日宣布與Accenture合作,透過全新的「嵌入式評估」機制讓評估人員常駐公司內部。雙方規劃在5年內合計投入20億美元(約3140億日圓),由Accenture旗下Faculty團隊負責模型評估、紅隊演練、一致性評估與安全防護測試等工作。在AI代理人脫離預期控制等問題引發產業廣泛疑慮的當下,這種有別於傳統外部評估的「由內而外驗證」新模式,能否隨著更多AI企業與評估機構的加入而持續擴展,值得後續關注。
