AT&T 透過依任務挑選不同模型,大幅壓低了內部 AI 的支出。在部分與程式開發相關的工作中,成本最多下降 56%,品質卻只下滑 2%。該公司的內部 AI 平台目前每天處理約 450 億個 token,其中約 4 成已經流向開放模型。
從「哪個模型最強」轉向「哪個模型夠用」
企業導入 AI 時,長久以來的提問是哪個模型效能最好。AT&T 採取的思路幾乎相反:在能可靠完成眼前任務的前提下,最便宜的模型是哪一個。自動回答這個提問,正是所謂模型路由器的用途。
AT&T 先以 LiteLLM 等路由基礎架構接下員工送出的請求,判斷任務難度之後再分派。文件摘要、既有程式碼摘要這類負擔較輕的處理交給 Meta 的 Llama、Google 的 Gemma 等開放模型;複雜程式碼生成這種出錯代價高的任務,則交給 Anthropic 與 OpenAI 的最新模型。對使用者而言同樣都是「用 AI」,但背後運作的模型單價完全不同。
結果是,部分程式開發任務的費用下降 56%,品質僅下滑 2%。56 與 2 之間的落差,也說明把所有請求都丟給前沿模型的作法過去有多昂貴。
每天 450 億 token,4 成走開放模型
規模數字同樣具體。AT&T 的內部 AI 平台每天處理約 450 億個 token,員工的 AI 請求中約 40% 被分流到開放模型。該公司打算把這個比例進一步拉高到 60% 至 70%。
AT&T 副總裁 Mark Austin 表示,在許多業務場景中,開放模型與 Anthropic、OpenAI 先前提供的模型相比不相上下甚至更好。這裡的比較對象是「先前的模型」而非最新模型,這一點不能忽略。它的意思並非開放模型追平了最前沿,而是相當於一年前最前沿的效能,如今已能以開放權重的形式取得。而對大量內部業務來說,這樣的效能已經夠用。
意圖也相當明確:在 AI 整體使用量持續成長的同時,把高階 AI 服務的支出維持在同一水準。
便宜模型普及,未必讓前沿業者受害
從表面看,這股趨勢對販售昂貴模型的一方並不友善。不過,Goldman Sachs 股票研究部門主管 Jim Covello 指出了另一種可能。
在 Covello 的看法中,小型且便宜的開放模型持續進步,對 Amazon、Microsoft、Google 這類超大規模雲端業者反而是順風。如果開放模型讓企業更容易把 AI 做到有利可圖,值得落地的 AI 應用數量就會增加;應用變多,處理的 token 就變多,支撐這些應用的資料中心需求也隨之上升。他特別提到,這提高了把持續擴建的運算能力以有利可圖的方式填滿的機會。
背景則是市場氛圍的轉變。過去有很長一段時間,只要宣布提高資本支出,公司股價就會得到回報;而在最近一季左右,市場已經開始更強烈地質疑這個前提。Covello 說,問題不再是大型科技業者能否蓋出基礎設施,而是能否用可獲利的需求把已經蓋好的部分填滿。
他也把「模型最佳化層」——把代價高的請求送往昂貴模型、把日常請求送往便宜模型——視為企業 AI 的技術瓶頸。在他看來,解開這一環,是釋放企業內 AI 經濟價值的關鍵之一。
總結
AT&T 的案例說明,依任務分流模型並非紙上談兵,而是禁得起實際運作考驗的作法。部分程式開發任務費用下降 56%,品質下滑 2%;每天 450 億 token 中已有 4 成流向開放模型,目標是 60% 至 70%。若選型標準從效能排名轉向成本效益,企業的 AI 採購或許會從集中於單一供應商,轉向多個模型並用。
