Anthropic 更新了 Claude Fable 5 在生物學領域的安全防護[1]。該公司表示,在自家測試中,生物學相關提問被轉交給能力較弱模型的「回退」情形減少了約 85%。過去連健康與學習類的一般問題都會被擋下,如今總算回到可用的水準。

為什麼幾乎所有生物學提問都被擋下

Fable 5 上線時,幾乎所有生物學相關的請求都處於被阻擋的狀態,Anthropic 說這是刻意的選擇,而非疏失[1]。

原因出在模型本身的能力。依該公司的評估,Fable 5 在部分高度複雜的生物學任務上已超越專家水準,在另一些任務上則能提供實務層面的支援[1]。對開發新療法的研究者來說,這是相當有力的夥伴,但同樣的能力也可能協助惡意人士製造生物武器。Anthropic 直言,Fable 5 有可能為這類人提供在其他任何地方都取得不到的能力[1]。

棘手的地方在於,有益用途與有害用途本來就難以區分。研究某種疾病的療法,有時必須處理引發該疾病的危險物質。Anthropic 舉的例子是活性疫苗,研究人員必須培養自己想要預防的同一種病原體[1]。降血壓藥物卡托普利同樣是從分離蛇毒中會讓人血壓驟降的成分開始的[1]。

這種模糊性也方便了想隱藏意圖的一方,危險作業可以被包裝成一般研究。Anthropic 引用美國情報體系 2026 年度威脅評估,指出合成生物學與基因組編輯的進展可能帶來新型生物威脅,並提到多個國家行為者可能仍維持著攻擊性的生物與化學武器計畫[1]。

因此該公司選擇在生物學入口幾乎全關的狀態下發布模型,先讓其他領域的使用者用得到。大量誤判是事先算進去的代價,理由是這總比把全面開放往後推數週甚至數個月要好[1]。

重寫分類器的「憲法」

Fable 5 的生物學防護由安全分類器負責,這是一種較小的自動判定系統,用來偵測模型是否被要求執行受保護的生物學任務,或產生有害輸出[1]。一旦觸發,請求會被轉交給 Opus 5,後者不具備與 Fable 5 相同等級的生物學能力,因此對惡意使用者的幫助有限。使用者看到的「回退」就是這個轉交動作。

要做出精準的分類器並不容易。它必須學會受保護內容與允許內容之間的界線,同時壓低誤判與漏判,還得能抵擋越獄式的繞過嘗試[1]。Anthropic 在資安領域也運作著同類分類器,並曾公開說明其運作方式[2]。

這次調整的核心,是分類器的憲法,也就是區分受保護內容與允許內容的規則集[1]。Anthropic 花了數週重寫這套規則,把良性用途逐項明確劃出,並向公司內外多位專家徵詢意見。接著依新規則重新產生訓練資料並重訓分類器,確認它仍會對有害與兩用研究內容觸發,同時放行範圍更廣的良性請求[1]。

放寬了什麼,界線又停在哪裡

實際使用上,變化最明顯的是日常健康與教育類提問。判讀檢驗數值、理解症狀、以學習為目的了解生物學等情境,觸發回退的情況會大幅減少[1]。醫療從業人員在臨床任務上,也能從 Fable 5 得到更多支援。

包含非生物學原因在內的回退總量預期同樣下降。Anthropic 估算,Claude.ai 約減少 67%,Cowork 減少 55%,Claude Code 減少 17%,Claude Platform 減少 7%[1]。各產品之間差距明顯,與生物學類提問原本所佔比例不同有關。

另一方面,沒有放寬的領域也寫得很清楚。被判定為兩用的請求,包括病毒學、毒理學與分子設計,仍會回退到 Opus 5[1]。換句話說,在專業生物學研究與新藥開發的場景中,Fable 5 目前仍無法直接派上用場。Anthropic 表示,將透過對通過審核的研究者開放前沿模型的可信存取管道,來補上這段落差[1]。

該公司也明說,源自安全餘裕的誤判不會完全消失[1]。即使是風險極低的請求,只要落在分類器的安全邊界內,仍有被觸發的可能。

總結

Anthropic 藉由重寫分類器憲法,調整了 Claude Fable 5 的生物學防護,讓生物學相關的回退減少約 85%。判讀檢驗數值、學習生物學等日常用途中,被轉交給較弱模型的情況將明顯減少。不過病毒學、毒理學與分子設計仍在範圍之外,研究用途的全面開放還要等可信存取管道就位。這是一個以具體數字呈現的案例:先基於安全考量把入口收窄,再依真實資料與專家意見逐步放開。

來源 [1] https://www.anthropic.com/news/improving-fable-5-s-biology-safeguards

來源 [2] https://www.anthropic.com/news/fable-safeguards-jailbreak-framework