2026年8月,Anthropic的內部工程團隊花了兩週時間集中優化claude.ai網頁版與Claude桌面應用程式的反應速度,最終讓多項關鍵操作的平均速度提升了3.1倍(幾何平均值)。值得注意的是,從找出效能瓶頸到撰寫修正程式碼,大部分工作都是由AI模型Claude自己完成的。

兩週合併3000多項變更,各項關鍵指標全面提升

團隊挑選了涵蓋整體使用量95%的四種典型使用情境,並持續追蹤13項指標。結果顯示,claude.ai的首次載入時間從約3085毫秒降至550毫秒,Claude Code的啟動時間從837毫秒降至347毫秒,Claude Cowork的載入時間則從2566毫秒降至728毫秒。這兩週內合併的變更超過3000項,且沒有任何一項引發影響使用者的故障或回退。

一個Slack頻道搞定全部流程,Claude包辦從測量到修正的所有工作

整個專案在同一個Slack頻道中推進,尖峰時段同時進行的討論串超過150個。團隊使用的是透過Claude Tag測試版提供的內部研究模型,其能力大致相當於Opus 5.5。人類工程師負責設定目標、做出技術判斷並給出最終核准,至於定位瓶頸、建立基準測試、撰寫修正程式碼、送出提取請求,以及上線後的效果觀察,則大多由Claude獨立完成。

由於實際執行時間(掛鐘時間)容易受測試環境影響而波動,不適合作為優化目標,團隊因此改以CPU指令數等可重現性較高的數值作為衡量基準。舉例來說,在組裝訊息清單的處理邏輯中,將指令數削減48%後,實際處理時間縮短了78%,等於提速4倍以上。團隊還建立了自動偵測機制,一旦某項變更導致指令數回升就會被擋下,確保已經取得的優化成果不會悄悄流失。

元兇竟是破折號:字元編碼分支帶來的隱性負擔

在排查細節問題時,團隊也有一些意外發現。程式碼區塊的語法高亮剛渲染完成時,畫面會短暫卡頓一下,追查後發現罪魁禍首是破折號與彎引號這類超出基本拉丁字元範圍的符號。只要文字中出現這類字元,瀏覽器的JavaScript引擎就會將整段回覆內容以雙位元組形式儲存,導致語法高亮所用的正規表示式處理被迫走上更慢的路徑。僅用約20行程式碼的修正,就把首次語法高亮渲染的耗時從約1秒縮短到0.35秒左右。

除此之外,團隊還將側邊欄的重新渲染工作量削減了九成,透過調整某個CSS選擇器消除了數十毫秒等級的延遲,並清除了每天多達數十萬次的隱藏頁面重新載入,這些不起眼的細節改善最終共同帶來了明顯的體感提升。

約200個功能開關保障發布安全

風險較高的變更會先放在短期生效的功能開關之後,依照員工內部、小範圍使用者、全體使用者的順序分階段推送。兩週內新增的功能開關約有200個,到專案結束時已有半數以上被移除。所有變更在上線前都需要經過自動審查,並至少獲得一名工程師的人工確認。涉及畫面版面的共用元件,還會在14種不同的螢幕尺寸下進行測試,確保顯示偏差控制在1個像素以內。

總結

這次兩週衝刺被視為一家AI公司讓自家AI模型在一項出了名瑣碎的任務——提升自家產品的反應速度——上真正發揮作用,並在短時間內取得可量化成果的案例。人類負責設定方向與最終把關,AI則承擔測量、實作與監控的全部流程,這種分工方式也為軟體開發領域今後能在多大程度上放手讓AI代理人自主工作,提供了一個值得參考的樣本。