Anthropic 發表了專為智慧代理(agent)用途打造的新語言模型「Claude Sonnet 5」[1]。它在制定計畫、使用瀏覽器與終端機等工具,以及自主推進任務方面的能力大幅提升,能以更實惠的價格完成不久前還需要更大、更昂貴模型才能勝任的工作[1]。本文整理其效能、價格以及安全評估的重點。
逼近 Opus 4.8,超越 Sonnet 4.6
Anthropic 表示,智慧代理型 AI(自主判斷並推進工作的 AI)的浪潮正是從「Sonnet 級」模型開始的[1]。Claude Sonnet 3.5、3.6、3.7 是最早在程式設計與工具操作上展現出強大實力的一批模型[1]。不過,近來能力提升的主力一直集中在更高階的「Opus 級」[1]。
這次的 Sonnet 5 意在縮小這項差距[1]。其效能逼近高階的 Claude Opus 4.8,價格卻獲得了控制[1]。與上一代 Sonnet 4.6 相比,它在推理、工具操作、程式設計、知識工作等智慧代理效能的關鍵環節上都有穩步改進[1]。
Anthropic 透過衡量智慧代理檢索的「BrowseComp」與衡量電腦操作的「OSWorld-Verified」兩項評測進行比較[1]。在這些指標上,Sonnet 5 明顯優於 Sonnet 4.6;在需要最高精準度的情境中,Opus 4.8 仍是較合適的選擇,但 Sonnet 5 以更低價格提供了比以往更高品質的選項[1]。在 Sonnet 5 與 Opus 4.8 之間,使用者可調整「effort(投入處理的程度)」,以找到成本與效能的最佳平衡[1]。
早期合作夥伴的評價
Anthropic 也介紹了在發表前進行試用的合作企業的回饋[1]。共同之處在於其自主性:「能把以往 Sonnet 會中途停下的複雜任務做到底」「不用特意要求也會檢查自己的輸出」[1]。
例如,開發服務商 Lovable 稱讚它能夠清晰且一致地拒絕不安全的請求[1]。法律領域的 Eve 表示,它在原告方法律任務上性價比很高,因此遷移決定變得容易;資料分析平台 ClickHouse 則回報,它能以更精簡的步驟更快得出答案[1]。在保險業務中使用電腦操作智慧代理的 Pace 也提到,它能穩定且迅速地選擇正確的操作[1]。
安全評估結果
Anthropic 公開了部署前安全評估的結果[1]。整體而言,Sonnet 5 相較 Sonnet 4.6 有所改進,對惡意請求的拒絕以及對提示注入(試圖挾持模型指令的攻擊)的抵抗力都有所增強[1]。陳述不實內容的幻覺,以及過度迎合使用者的諂媚傾向,比例也都有所下降[1]。
另一方面,與更強的 Opus 4.8 等相比,它在部分不當行為上的比例略高[1]。在網路安全方面,Anthropic 說明 Sonnet 5 並未刻意訓練,在利用軟體漏洞等危險任務上的能力遠遜於高階模型[1]。不過,由於其能力較上一代略有提升,因此在提供時預設開啟了能即時偵測並阻斷危險使用的網路安全防護[1]。詳細的評估結果彙整在「Claude Sonnet 5 System Card」中[1]。
提供範圍與價格
Claude Sonnet 5 自發表當天起即可在所有方案中使用[1]。它成為免費方案與 Pro 方案的預設模型,Max、Team、Enterprise 各類使用者也都可使用[1]。它可在 Claude Code 與 Claude Platform 上使用,透過 API 可以「claude-sonnet-5」呼叫[1]。
作為開幕紀念價,截至 2026 年 8 月 31 日,每百萬輸入 token 為 2 美元(約 320 日圓),每百萬輸出 token 為 10 美元(約 1,620 日圓)[1]。該期間結束後將轉為標準價格,輸入 3 美元(約 490 日圓)、輸出 15 美元(約 2,430 日圓)[1]。※1 美元 = 162 日圓(截至 2026 年 7 月 1 日)
此外,Sonnet 5 採用了新的斷詞器(tokenizer,將文字切分為 token 的機制),因此相同的輸入可能會對應到以往 1.0~1.35 倍的 token 數[1]。開幕價的設定是為了即便考量這項變化,遷移的成本也大致維持不變[1]。同時,Chat、Cowork、Claude Code、Claude Platform 各項服務的速率限制(單位時間內的使用上限)也都有所提高[1]。
總結
Claude Sonnet 5 是一款重視智慧代理用途的模型,目標是以更低價格提供逼近高階 Opus 4.8 的效能。除了在推理、程式設計、工具操作上的改進外,它在安全評估中也較上一代有所進步;不過,開幕期結束後價格會上漲,以及斷詞器變更帶來的實際成本感受,都是使用前值得確認的地方。
