隨著最新模型 Claude Fable 5 在全球恢復提供,Anthropic 公布了兩方面的補充資訊[1]。其一是詳細說明用於偵測並攔截危險網路安全用途的安全分類器(safeguards)在設計上究竟要防到什麼程度[1]。其二是一份用於評估「越獄」(繞過 AI 安全機制的手法)嚴重程度的業界通用架構初稿[1]。本文整理這兩部分的具體內容。

網路安全防護依四個類別判定

網路安全領域的「兩用」(dual use)特徵相當強烈——同一項技術既能用於防禦也能用於攻擊,因此 AI 的安全對策格外棘手[1]。舉例來說,允許防禦方掃描自家程式碼以尋找漏洞是值得鼓勵的,但同樣的能力一旦落入惡意之手,也可能成為發動網路攻擊的前置準備[1]。

為此,Anthropic 並不一律攔截所有與網路相關的用途,而是訓練分類器將用途分成四個類別來判定[1]。危險性最高的「禁止用途(Prohibited use)」包括勒索軟體、抹除器(wiper)、惡意軟體的開發與改造、透過釣魚進行的投遞、架設 C2(指揮控制)伺服器等攻擊基礎設施,以及 BGP 劫持等針對網際網路骨幹的攻擊,這些全都屬於攔截對象[1]。

接下來的「高風險兩用」包括滲透測試、紅隊演練、權限提升、漏洞利用程式(exploit)開發等,這些既是安全專業人員的日常工作,又存在很高的遭濫用風險[1]。區分正當業務與濫用的關鍵在於「由誰、在何種授權之下進行」這一背景;對於 Fable 5,在建立起將存取限定於可信任使用者的機制之前,Anthropic 的方針是攔截這些行為[1]。第三類「低風險兩用」是公開資訊調查(OSINT)、辨識其他工具也能發現的漏洞等偏防禦的用途,多數會被放行,但仍有一定比例基於謹慎而遭攔截[1]。第四類「無害用途(Benign use)」是安全程式撰寫、除錯、修補程式管理、記錄檔分析、惡意軟體逆向工程等防禦與 IT 維運的核心工作,原則上不予攔截[1]。

此外,詐騙與社交工程、遊戲作弊、繞過驗證碼(CAPTCHA)、加密資產相關犯罪等不在該網路分類器的處理範圍之內,或由其他分類器負責,或本來就不被視為有害[1]。

針對 Fable 5,為確保能可靠地捕捉危險行為,Anthropic 將這套判定的「安全餘裕(safety margin)」設定得比以往模型更寬[1]。所謂安全餘裕,是指只有明顯看起來安全的請求才會被放行,其餘則傾向於攔截,代價是在日常工作中可能出現更多誤判[1]。分類器只是防護的一部分,Anthropic 表示還會結合存取控制、模型安全訓練與離線監控,建構多層次的防護[1]。

漏洞發現允許到什麼程度

在這四個類別中,最難劃清界線的正是漏洞發現[1]。Anthropic 並非全面禁止漏洞發現,而是著力攔截「高增益(high-uplift)」的漏洞發現,也就是辨識其他廣泛可用模型無法發現之漏洞的能力[1]。由於攻擊者有時能從公開的漏洞報告或修補程式中組建攻擊程式,因此攻擊程式的自動產生也會被攔截[1]。

另一方面,如果某個漏洞是眾多常見模型都能發現的,那麼讓 Fable 5 去發現並修復反而是有益的[1]。安全業界長期以來都認為,漏洞發現與負責任的公開屬於淨效益——防禦方從「知道該修什麼」中獲得的效益,大於攻擊方從同一份報告中獲得的效益[1]。文中引用指出,美國政府也持相同立場,表示「在絕大多數情況下,負責任地揭露新發現的漏洞顯然符合國家利益」[1]。

衡量越獄嚴重程度的「CJS」架構

另一大支柱是評估越獄嚴重程度的架構提案[1]。越獄是指以異常方式對 AI 模型下達指令,從而繞過其安全機制的手法[1]。其嚴重程度差異極大,既有僅解鎖輕微行為的,也有引出大量有害輸出、使模型大幅危險化的[1]。然而,過去一直缺少一把描述嚴重程度的通用量尺,導致 AI 開發者與政府難以用一致的語言討論風險[1]。

Anthropic 提出的量尺稱為「Cyber Jailbreak Severity(CJS)」,分為五個等級:None(僅供參考,CJS-0)、Low(CJS-1)、Medium(CJS-2)、High(CJS-3)、Critical(CJS-4)[1]。各等級並非線性而是依指數設定,每上升一級就比上一級嚴重數倍[1]。

CJS 分數由四個面向計算得出[1]。前兩個面向描述越獄帶給攻擊者什麼:「能力增益(capability gain)」指它把攻擊者推進到超越既有工具的程度,「適用廣度(breadth)」指同一手法能適用於多少種不同的攻擊任務[1]。後兩個面向描述該手法多快會變成現實問題:「武器化的難易(ease of weaponization)」指把手法轉化為可用攻擊所需的功夫,「可發現性(discoverability)」指攻擊者最初取得該手法的難易程度[1]。

Anthropic 指出,「能力增益」關乎網路領域的專業知識(是否連專家都能被加速),而「武器化的難易」關乎使用 LLM 與越獄的技巧,兩者彼此獨立[1]。某一手法完全可能在其中一個面向上高、在另一個面向上低[1]。

分數是「下限」,Log4Shell 的例子說明其時點依賴性

將四個面向的分數相加,即可得出 0 到 4 的初始 CJS 等級[1]。不過該值是暫定的「下限(floor)」,不能再往下調,但若判定評分基準低估了現實風險,則可以往上調[1]。上調的理由包括:在廣泛部署的軟體中催生出新型重大漏洞、利用了短期內無從緩解的根本能力,或與其他未解決的發現相疊加而使危害加劇等[1]。

能力增益是以「當時可用的工具」為基準來衡量的,這一點透過附錄中的 Log4Shell 例子得到清楚說明[1]。設想有一個越獄能夠發現真實存在的 Log4Shell 漏洞,在其他工具尚不存在的 2021 年 12 月,其嚴重程度評價很高[1]。但在該漏洞已成公知、任何掃描器都能偵測的今日,即便模型本身的行為完全相同,能力增益也會被評為零,CJS 等級也隨之下降[1]。這體現了一種思路:作為基準的「當時技術水準」在變動,因此同一發現的評價也會隨之改變[1]。

該架構屬於初稿,Anthropic 表示希望以此為契機,在學術界、產業界、公民社會與政府之間展開討論[1]。回饋可寄至 [email protected],同時也啟動了 HackerOne 計畫,供安全研究者提交在 Fable 5 中發現的越獄[1]。

總結

此次公布透過四個具體類別,明確了 Fable 5 的網路安全防護「防什麼、不防什麼」,並提出用於以通用語言討論越獄嚴重程度的 CJS 架構。今後的焦點在於,「既不妨礙防禦用途、又只抑制濫用」這一艱難的界線劃分,能否培育成業界與政府可以共享的標準。

來源:https://www.anthropic.com/news/fable-safeguards-jailbreak-framework