Anthropic 於 2026 年 7 月 24 日(美國時間)推出對話 AI「Claude」的新模型 Claude Opus 5[1]。該公司表示,這款模型以其頂級模型 Claude Fable 5 一半的成本,達到接近後者的智慧,並在程式設計與知識工作的評測中創下新的最高水準。Opus 5 成為個人取向的 Claude Max 方案的新預設模型,並自推出當天起在所有平台上線[1]。
以更低成本達到接近 Fable 5 的智慧
Anthropic 將 Claude Opus 5 定位為「可日常使用的高效能模型」。據該公司說明,它在與上一代 Opus 4.8 相同價格的前提下大幅提升效能,並透過「思考投入」(effort)設定,讓使用者在優先追求智慧,或節省 token 以換取更快、更低成本的結果之間自由取捨[1]。
在衡量程式設計與知識工作的 Frontier-Bench、GDPval-AA 等評測中,Opus 5 達到新的最高水準。不過該公司也明確指出,在網路安全類任務上,它仍不及自家的 Mythos 5 模型[1]。將擅長與不擅長的領域分開說明,是這次發布的一項特點。
主要基準測試普遍領先
Anthropic 也公布了具體數據[1]。在評估軟體開發的 Frontier-Bench v0.1 中,Opus 5 將 Opus 4.8 的效能提升 2 倍以上,同時反而降低了單一任務的成本。在程式碼編輯的 CursorBench 3.2 中,最大 effort 時與 Fable 5 巔峰效能的差距控制在 0.5% 以內,而單一任務的成本僅為一半。
在衡量解決全新問題能力的 ARC-AGI 3 中,Opus 5 取得次佳模型 3 倍的分數。在檢視能否從頭到尾完成業務任務的 Zapier AutomationBench 中,它在相同成本下達到次佳模型約 1.5 倍的成功率,即使在最低 effort 設定下,也比其他任何模型完成更多任務。在衡量電腦操作能力的 OSWorld 2.0 中,它在各個成本區間都超越其他模型,並以約三分之一的成本超越 Fable 5 的最佳成績[1]。
一邊自我驗證一邊推進工作
Anthropic 表示,Opus 5 擅長驗證自己的工作,並鍥而不捨地改進直到成功[1]。在某項評測中,任務要求依據機械零件的圖面以程式重建 3D 模型,但模型並未獲得直接檢視圖面的手段;Opus 5 於是自行撰寫影像辨識流程,從原始像素中讀取幾何形狀並還原出零件。此外,在一款廣泛使用的套件管理工具的瑕疵中,它找出了社群修補程式所遺漏的根本原因[1]。
在科學研究領域也有進展。Opus 5 在各項生命科學評測中均勝過 Opus 4.8,在依據光譜資料推斷分子結構的有機化學任務中,依內部基準高出 10.2 個百分點,在蛋白質相關任務中高出 7.7 個百分點[1]。
安全性「最為對齊」,網路攻擊能力被刻意抑制
Anthropic 也公布了安全性評估結果。該公司將 Opus 5 稱為「至今最為對齊(alignment)的模型」,指其對行為準則「Constitution」的遵循程度高於 Opus 4.8、Sonnet 5 與 Fable 5,對欺騙性行為以及被誘導濫用的抵抗力也最強[1]。
與此同時,可能帶來風險的能力被刻意抑制。在生物學研究與攻擊性網路能力方面,它不及 Mythos 5,該公司表示在訓練階段刻意避開了網路攻擊類任務。Opus 5 在發現漏洞的能力上已接近 Mythos 5,但在將漏洞轉化為實際威脅的利用能力上仍相差甚遠[1]。作為安全機制的分類器預計介入頻率比 Fable 5 低約 85%,在允許原始碼漏洞排查的同時,會攔截滲透測試與攻擊程式碼的產生[1]。
提供方式與價格
Claude Opus 5 自推出當天起可在所有平台使用。價格為每百萬 token 輸入 5 美元(約 820 日圓)、輸出 25 美元(約 4,100 日圓),與 Opus 4.8 相同[1]。開發者可在 Claude API 上以 claude-opus-5 呼叫,同時也提供執行速度約 2.5 倍的 Fast mode,價格為基礎價的 2 倍[1]。
※1 美元 = 164 日圓(截至 2026 年 7 月 24 日)
這次也新增了 2 項 beta 功能。在 Claude Platform 上,開發者現在可以在對話過程中切換可用工具而不會使提示快取失效;在 API 上,則可使用將被安全分類器攔截的請求自動改由其他模型處理的「自動回退」功能[1]。
總結
Claude Opus 5 是一款主打「以半價獲得接近頂級 Fable 5 智慧」的新模型。它在眾多基準測試中展現最高水準,同時刻意將網路攻擊、進階生物學研究等可能帶來風險的能力壓制在 Mythos 5 之下,並強調了高度的對齊性。在價格與 Opus 4.8 相同的同時提升效能,可說是一次意在打磨 Claude 日常主力模型的舉措。
