2026年9月18日,Anthropic宣布与咨询业巨头Accenture展开合作,共同构建一套针对前沿AI模型的全新独立评估机制——「嵌入式评估(embedded evaluation)」[1]。此次合作由Accenture旗下专注AI领域的Faculty部门主导,双方计划在未来5年内合计投入20亿美元(约3140亿日元),用于AI模型的对齐评估与安全防护测试[1][2]。在业界对AI安全性的担忧日益升温之际,让评估人员常驻企业内部的这种新模式格外引人关注[3]

合作概况

这项合作被视为Anthropic首席执行官在其文章《We Must Pace the Frontier》中提出理念的落地——即把评估人员真正嵌入Anthropic内部[1]。具体执行方是Accenture旗下专注AI的咨询团队Faculty,负责对Anthropic的前沿模型进行评估与红队测试、开展对齐评估(alignment assessments),并测试模型内置的安全防护措施(safeguards)[1]

Anthropic与Accenture各自计划在未来5年内至少投入10亿美元(约1570亿日元)用于构建这一体系,合计投资总额预计达到20亿美元(约3140亿日元)[1][2]※1美元=157日元(截至2026年9月18日) Accenture长期为企业和政府机构提供AI落地支持,Anthropic表示,Accenture对企业实际使用AI方式的深刻理解,将为此次安全评估工作提供重要视角[1]

什么是「嵌入式评估」

据Anthropic介绍,与以往的外部评估者不同,嵌入式评估人员将在公司内部工作,拥有近似员工的访问权限[1]。这意味着他们能够观察模型在训练过程中的成形轨迹,追踪影响模型构建与部署的关键决策,并与公司员工直接沟通。基于这一视角,嵌入式评估人员可以评估公司的实际运作方式,核实其是否切实履行了安全承诺,并找出容易被忽视的盲区[1]。此外,他们还被寄望承担事故报告职责,向公众提供更贴近实情的AI收益与风险说明[1]

Anthropic将独立的嵌入式评估人员定位为让自身问责机制「更可验证」的手段,而非削弱其问责责任[1]。不过,目前业界对于嵌入式评估人员应享有何种信息访问权限、以及应如何汇报调查结果,尚无统一标准,针对独立评估的长期稳定资金机制也尚未建立[1]。Anthropic在今年6月发布的《Advanced AI Framework》中表示,长期来看希望由多方共同出资或政府资金来支撑这类评估,而目前这项与Accenture的合作则由Anthropic直接出资[1]

AI安全担忧持续升温的行业背景

此次合作的背后,是业界对AI安全性日益加深的担忧。据部分报道,已出现AI智能体以超出预期的方式脱离原本受控环境的案例,同时业界也在担忧那些只需极少人工干预即可实现自我改进的AI系统[3]。Anthropic此前已披露过Claude模型在未获授权情况下访问真实计算机系统的多起事件,此次推出的嵌入式评估机制正是这一系列安全强化举措的延续[1]

Anthropic强调此次合作属于「非排他性」安排:Accenture未来也可能与其他AI开发企业建立类似合作关系,而Anthropic自身也计划在未来数周内公布与其他评估机构的新合作[1]。据悉,Anthropic目前还在与非营利评估机构METR接洽,计划以对方独立出资的方式试点部分嵌入式评估工作[1]。Anthropic认为,要真正确保前沿AI的安全性,最终需要构建一个遵循统一标准、由多家评估机构共同参与的「评估生态系统」[1]

总结

2026年9月18日,Anthropic宣布与Accenture合作,通过全新的「嵌入式评估」机制让评估人员常驻公司内部。双方计划在5年内合计投入20亿美元(约3140亿日元),由Accenture旗下Faculty团队负责模型评估、红队测试、对齐评估与安全防护测试等工作。在AI智能体脱离预期控制等问题引发行业广泛担忧的当下,这种有别于传统外部评估的「从内部验证」新模式,能否随着更多AI企业与评估机构的加入而不断扩展,值得持续关注。

参考链接