美国AI初创公司PrismML于2026年9月17日(当地时间)发布了270亿参数的多模态AI模型「Bonsai 2 27B」。该公司采用自研的三值量化技术,将模型体积压缩至原来的约九分之一,同时保留了98.2%的基准测试性能。这意味着笔记本电脑、游戏本级显卡等本地硬件也有望运行高性能的AI智能体。

只用三个数值表示权重的压缩方法

PrismML以阿里巴巴(Alibaba)开发的「Qwen3.8 27B」为基础,将每个权重仅用−1、0、+1三个数值表示。原本以16比特存储的权重被压缩至平均1.76比特,使这个270亿参数的模型体积缩小到5.9GB。该方案让每128个权重共享一个16比特的缩放系数,并在量化前对每1,024个权重为一组执行哈达玛旋转处理,以降低精度损失。整个模型中仅约2,600万个参数(约占总量的0.1%)保留较高精度,主要集中在循环状态相关路径和归一化权重上。负责图像识别的视觉模块约4.7亿参数,以单独的0.63GB文件形式提供。

从基准测试看性能损失幅度

在20项基准测试中,未压缩的Qwen3.8 27B平均得分为85.4分,而Bonsai 2 27B得分为83.9分,性能保留率为98.2%。分领域来看,数学保留99.5%,编程保留99.3%,指令遵循保留101.7%,几乎没有下降;涉及工具调用的智能体任务保留97.3%;而Terminal-Bench、SWE-bench Verified等需要连续执行多步骤的长程任务,保留率则降至约75%左右。与同样压缩至约7.3GB、平均得分75.2的现有量化方案「IQ2_XXS」相比,Bonsai 2 27B在考察高阶数学能力的AIME26和编程能力的LiveCodeBench上明显更优,显示出这并非简单的体积压缩,而是对既有压缩方法的一次实质性提升。

支持的硬件与运行速度

Bonsai 2 27B同时支持NVIDIA GPU的CUDA环境和Apple芯片的MLX环境。据介绍,其推理速度在GeForce RTX 5090上可达每秒142.5个词元(token),RTX 4090上为每秒96.7个词元,面向数据中心的NVIDIA L4上为每秒32.1个词元;在苹果芯片方面,M5 Max为每秒46.8个词元,M5 Pro为每秒27.7个词元。作为参考标准,运行该模型建议笔记本电脑内存不低于16GB,或显卡显存不低于24GB。由于采用了专有的压缩打包格式,该模型无法直接在标准版llama.cpp上运行,需要使用PrismML发布的专用分支版本,或面向苹果设备的专用MLX实现。官方还提供了可直接在浏览器中体验的WebGPU演示。模型采用Apache 2.0许可证发布,权重已在Hugging Face上公开。

迈向不依赖云端的AI应用

Bonsai 2 27B主要面向对网络环境或隐私有较高要求的场景,例如编程辅助智能体、电脑操作自动化,以及无法外发的企业文档分析等。PrismML创始人兼首席执行官Babak Hassibi表示,上一代「Bonsai 27B」已经证明强大的模型不必局限于云端基础设施,而这次的新模型则将这一理念进一步推进。担任公司顾问的加州大学伯克利分校(UC Berkeley)教授Ion Stoica也评价称,在体积大幅缩减的同时,模型能力的下降却如此有限,令人印象深刻。第一代「Bonsai 27B」在本次发布约两个月前推出,当时的性能保留率约为95%,这意味着新一代模型在此基础上又实现了进一步提升。

总结

PrismML此次发布的「Bonsai 2 27B」将一个270亿参数的AI模型压缩至5.9GB,同时保留了98.2%的性能。尽管在长程、复杂的智能体任务上仍存在一定差距,但在编程、数学和指令遵循等方面几乎看不出性能下降。不依赖云端计算资源、在本地电脑上运行高性能AI模型的趋势,今后有望进一步扩大。