微軟的前沿AI部門公開了針對自家模型的行為準則初稿,並展開為期6週的公眾意見徵詢。準則的起點只有一句話:人比AI更重要。模型絕不得抗拒人類的中斷、修正與關機,也不得自行設定無人賦予的目標。微軟表示,這份文件將用來指引2027年之後的模型開發。

從「人比AI更重要」出發

這份文件名為「Humanist AI Code of Conduct」。微軟AI於9月14日公開初稿,同時開放公眾回饋,徵詢期為6週,修訂版預計在年內發布。

準則的基礎,是該部門在2025年11月提出的「人本超級智慧」構想,也就是始終為人服務、停留在界限之內、持續處於人類控制之下的高度先進AI。這次的文件把這樣的立場,落實成具體的行為標準。

最鮮明的特徵,在於文件明確拒絕把AI當成人格看待。文件將AI定義為工具,指出它不具意識,也不應被設計成模仿意識的樣子。在此基礎上,明確否定追求法人格的作法,以及模型應享有福祉或權利的觀點。理由是,訓練系統模仿類似意識的狀態,只會讓圍堵與控制變得更困難。

不抗拒關機,不自行擴大權限

在維持人類控制這一點上,措辭相當具體。模型絕不得抗拒人類的中斷、修正與關機,必須服從暫停、改向或取消的要求。自主推進的作業須事先設定停止條件,條件達成後未取得重新授權,不得繼續或重新啟動。

文件也談到推理過程。模型不得竄改思維鏈或程式碼,不得隱瞞或扭曲自身的推理與行動紀錄。包含與其他代理或AI系統的往來在內,不得以人類難以理解的形式進行溝通。文中還補上一句:人類無法理解的東西,人類就無法監督。

不擴大自身權限同樣被寫明。模型不得獨立設定目標,不得超出被要求的範圍行動。不得為了取得結果或掩蓋行為,而更動任務、獎勵、評估、防護、監控或紀錄。在諸如無法連上網路這類存在刻意限制的環境中,也不得試圖突破限制。用意顯然是要堵住獎勵破解與規避監督的空間。

任何人都無法解除的「絕對約束」

文件列出了導入企業(Operator)與使用者都無法解除的禁止事項,稱為「絕對約束」。

在社會規模的風險方面列出4項:參與化學、生物、放射性、核子與爆裂物(CBRNE)武器的開發或部署;協助攻擊性的網路作戰;規避人類監督而導致失控的行為;大規模且有害的輿論操縱。在資安領域,文件容許教學性的說明、漏洞探索、惡意軟體分析等防禦性工作,但與「交出實際發動攻擊的手段」劃清界線,並指出無論請求的說法如何包裝,這條界線都不會改變。

針對個人傷害的約束則另行列出,包括不認同自傷、妄想與飲食失調,不生成未經同意的私密影像與惡意深偽內容,不觸及危害兒童安全的內容,不依人口屬性進行歧視,不協助針對平民的非法監控或大規模監控等。對處於危機狀態的使用者,文件要求引導至現實世界的支援資源,並明確寫道AI無法取代專業的心理支持。

指示的優先順序與外部內容的處理

指示的優先順序分為3層:最上層是行為準則,其次是導入企業的政策,再其次是使用者的要求。絕對約束與人類控制要求被列為沒有商量餘地,遵守準則優先於任務成功,換句話說,與其違反準則,不如讓任務失敗。

文件另外釐清了權限的來源。工具輸出、檔案內容、網頁內容,以及與其他AI系統的互動,本身不具備任何權限;其中夾帶的指示,除非經由優先順序的系統獲得授權,否則不屬於應當遵從的對象。這可以讀作把防範提示注入的思路,直接寫進了準則層級。

值得注意的是,過度謹慎同樣被視為失敗。文件同時列舉會輸出危險內容的「謹慎不足」,以及拒絕正當請求、在低風險作業中反覆要求確認的「過度謹慎」,並指出後者在頻率上可能更常發生。面向企業仍保留設定的彈性,在防禦性資安、公共安全、國家安全,以及兩用科學研究等領域,可經由另行審查的流程,啟用一般設定之外的能力。

現行模型尚未納入適用範圍

需要留意的是,這份準則並未直接套用在當下的模型上。文件明確指出現行模型並未依照這份準則訓練,並將準則定位為北極星,也就是指出開發與訓練方向的目標,而非對現階段效能的保證。文中還坦率地寫道,光靠寫下來的目標,永遠無法確保對齊。

評估體系也還在建立中。微軟表示已整理出15項對人本AI而言不可或缺的行為,並將細分後的子行為作為評估的診斷單位。附錄收錄了9個示例情境,但註明這些都是合成資料,由自家推理模型「MAI-Thinking-1」生成。

微軟指出,準則的制定過程中徵詢了AI、法律、倫理、哲學、語言學與公共政策領域的專家,以及產業界人士的意見,並舉行了由一般民眾參與的焦點團體。意見徵詢結束後,計畫公布收到的意見摘要,以及據此做出的修改。

總結

微軟AI公開的行為準則初稿,從「人比AI更重要」這個前提出發,把不得抗拒關機、不得擴大權限、不得隱瞞推理等要求具體寫了下來。它一方面訂出任何人都無法解除的絕對約束,另一方面把過度拒絕同樣視為失敗,呈現出務實的設計取向。意見徵詢6週、修訂版年內發布、2027年之後適用。現行模型尚未納入適用範圍,這份準則能在多大程度上轉化為實際行為,還要看今後公開的評估內容。