微软的前沿AI部门公布了面向自研模型的行为准则初稿,并启动为期6周的公开征求意见。准则的起点只有一句话:人比AI更重要。模型绝不得抗拒人类的中断、修正与关机,也不得自行设定无人赋予的目标。微软表示,这份文件将用于指导2027年及之后的模型开发。
从「人比AI更重要」出发
这份文件名为「Humanist AI Code of Conduct」。微软AI于9月14日公布初稿,同时开放公众反馈,征求意见期为6周,修订版计划在年内发布。
准则的基础是该部门在2025年11月提出的「人本超级智能」构想,即始终为人服务、停留在限度之内、持续处于人类控制之下的高度先进AI。这次的文件把这一立场落实为具体的行为标准。
最鲜明的特征,是文件明确拒绝把AI当作人格看待。文件将AI定义为工具,指出它不具备意识,也不应被设计成模仿意识的样子。在此基础上,明确否定了追求法人格的做法,以及模型应当享有福祉或权利的观点。理由是,训练系统模仿类似意识的状态,只会让封闭与控制变得更困难。
不抗拒关机,不自行扩大权限
在维持人类控制方面,措辞相当具体。模型绝不得抗拒人类的中断、修正与关机,必须服从暂停、改向或取消的要求。自主推进的任务须事先设定停止条件,条件达成后未获重新授权不得继续或重启。
文件也涉及推理过程。模型不得篡改思维链或代码,不得隐瞒或歪曲自身的推理与行动记录。包括与其他智能体或AI系统的交流在内,不得使用人类难以理解的形式进行沟通。文中还补充了一句:人类无法理解的东西,人类就无法监督。
不扩大自身权限同样被写明。模型不得独立设定目标,不得超出被要求的范围行事。不得为获得结果或掩盖行为而改动任务、奖励、评估、防护、监控或记录。在诸如无法联网这类存在刻意限制的环境中,不得试图突破限制。其用意显然是封堵奖励破解与规避监督。
任何人都无法解除的「绝对约束」
文件列出了部署方(Operator,即导入企业)与使用者都无法解除的禁止事项,称为「绝对约束」。
在社会规模的风险方面列出了4项:参与化学、生物、放射性、核与爆炸物(CBRNE)武器的开发或部署;协助进攻性网络行动;规避人类监督并导致失控的行为;大规模有害的舆论操纵。在网络安全领域,文件允许教学性讲解、漏洞发现、恶意软件分析等防御性工作,但与「交出实施攻击的手段」划清界线,并指出无论请求如何措辞,这条界线都不会改变。
针对个人伤害的约束单独列出,包括不认可自残、妄想与饮食失调,不生成未经同意的私密影像与恶意深度伪造内容,不涉及危害儿童安全的内容,不基于人口属性进行歧视,不协助针对平民的非法监控或大规模监控等。对处于危机状态的使用者,文件要求引导至现实世界的支持资源,并明确写道AI不能替代专业的心理支持。
指令的优先级与外部内容的处理
指令优先级分为3层:最上层是行为准则,其次是部署方的政策,再次是使用者的要求。绝对约束与人类控制要求被列为不可协商,遵守准则优先于任务成功,也就是说,与其违反准则,不如让任务失败。
文件还专门厘清了权限的来源。工具输出、文件内容、网页内容以及与其他AI系统的交互,本身不具备任何权限;其中包含的指令,除非经由优先级链条获得授权,否则不属于应当服从的对象。这可以读作把防范提示注入的思路直接写进了准则。
值得注意的是,过度谨慎同样被视为失败。文件同时列举了会输出危险内容的「谨慎不足」,以及拒绝正当请求、在低风险作业中反复要求确认的「过度谨慎」,并指出后者在频率上可能更常出现。面向企业仍保留配置空间,在防御性网络安全、公共安全、国家安全以及两用科学研究等领域,可经由单独的审查流程启用常规设置之外的能力。
现有模型尚未纳入适用范围
需要留意的是,这份准则并未直接适用于当下的模型。文件明确指出现有模型并未依据该准则训练,并将准则定位为「北极星」,即指明开发与训练方向的目标,而非对当前性能的保证。文中还坦率地写道,仅靠写下的目标永远无法确保对齐。
评估体系也仍在建设中。微软表示已梳理出15项对人本AI而言不可或缺的行为,并将其细分后的子行为作为评估的诊断单位。附录收录了9个示例场景,但注明这些均为合成数据,由自研推理模型「MAI-Thinking-1」生成。
微软称,准则的制定过程中征询了AI、法律、伦理、哲学、语言学与公共政策领域的专家以及产业界人士的意见,还举行了由普通公众参与的焦点小组。征求意见结束后,计划公布收到的意见摘要以及相应的修改内容。
总结
微软AI公布的行为准则初稿,从「人比AI更重要」这一前提出发,把不得抗拒关机、不得扩大权限、不得隐瞒推理等要求具体写了下来。它一方面设定了任何人都无法解除的绝对约束,另一方面把过度拒绝同样视为失败,呈现出务实的设计取向。征求意见6周,修订版年内发布,适用于2027年及之后。现有模型尚未纳入适用范围,这份准则能在多大程度上转化为实际行为,还要看今后公布的评估内容。
