美國AI新創公司PrismML於2026年9月17日(當地時間)發表了270億參數的多模態AI模型「Bonsai 2 27B」。該公司採用自行研發的三值量化技術,將模型體積壓縮至原本的約九分之一,同時保留了98.2%的基準測試效能。這代表筆記型電腦、電競等級顯示卡等本機硬體,也有機會運行高效能的AI代理人(agent)。

僅用三個數值表示權重的壓縮方式

PrismML以Alibaba開發的「Qwen3.8 27B」為基礎,將每個權重僅以−1、0、+1三個數值表示。原本以16位元儲存的權重被壓縮至平均1.76位元,使這個270億參數的模型體積縮小到5.9GB。此方案讓每128個權重共用一組16位元的縮放係數,並在量化前對每1,024個權重為一組執行哈達瑪旋轉(Hadamard rotation)處理,以降低精確度的損失。整個模型中僅約2,600萬個參數(約占總量的0.1%)保留較高精確度,主要集中在遞迴狀態相關路徑與正規化權重上。負責影像辨識的視覺模組約4.7億參數,以獨立的0.63GB檔案形式提供。

從基準測試看效能下降幅度

在20項基準測試中,未壓縮的Qwen3.8 27B平均得分為85.4分,而Bonsai 2 27B得分為83.9分,效能保留率達98.2%。分領域來看,數學保留99.5%、程式撰寫保留99.3%、指令遵循保留101.7%,幾乎沒有下降;涉及工具呼叫的代理人任務保留97.3%;而Terminal-Bench、SWE-bench Verified等需要連續執行多個步驟的長程任務,保留率則降至約75%左右。與同樣壓縮至約7.3GB、平均得分75.2的既有量化方案「IQ2_XXS」相比,Bonsai 2 27B在檢驗高階數學能力的AIME26,以及程式撰寫能力的LiveCodeBench上明顯勝出,顯示這並非單純的體積壓縮,而是對既有壓縮方法的一次實質提升。

支援的硬體與運作速度

Bonsai 2 27B同時支援NVIDIA顯示卡的CUDA環境,以及Apple晶片的MLX環境。根據介紹,其推論速度在GeForce RTX 5090上可達每秒142.5個token,RTX 4090上為每秒96.7個token,針對資料中心的NVIDIA L4則為每秒32.1個token;在Apple晶片方面,M5 Max為每秒46.8個token,M5 Pro為每秒27.7個token。作為參考基準,運行此模型建議筆電記憶體不低於16GB,或顯示卡VRAM不低於24GB。由於採用了專有的壓縮封裝格式,此模型無法直接在標準版llama.cpp上運行,須使用PrismML發布的專用分支版本,或針對Apple裝置的專用MLX實作。官方也提供了可直接在瀏覽器中體驗的WebGPU展示版。模型採用Apache 2.0授權發布,權重已在Hugging Face上公開。

邁向不依賴雲端的AI應用

Bonsai 2 27B主要鎖定對網路環境或隱私有較高要求的場景,例如程式撰寫輔助代理人、電腦操作自動化,以及無法對外流出的企業文件分析等。PrismML創辦人暨執行長Babak Hassibi表示,上一代「Bonsai 27B」已證明強大的模型不必侷限於雲端基礎架構,而這次的新模型則將此理念更進一步。擔任公司顧問的加州大學柏克萊分校(UC Berkeley)教授Ion Stoica也評論指出,在體積大幅縮減的同時,模型能力的下降卻如此有限,令人印象深刻。第一代「Bonsai 27B」在本次發表約兩個月前推出,當時的效能保留率約為95%,代表新一代模型在此基礎上又有進一步提升。

總結

PrismML此次發表的「Bonsai 2 27B」,將一個270億參數的AI模型壓縮至5.9GB,同時保留了98.2%的效能。儘管在長程、複雜的代理人任務上仍存在一定差距,但在程式撰寫、數學與指令遵循等方面幾乎看不出效能下降。不依賴雲端運算資源、在本機電腦上運行高效能AI模型的趨勢,未來有望進一步擴大。