在本地运行大语言模型(LLM)的工具「Ollama」发布了最新版本 0.30[1]。它通过开源推理引擎「llama.cpp」支持 GGUF 格式的模型,可运行的模型与硬件范围比以往更广[1]。在英伟达平台上,处理速度最高提升 20%;同时用于调用 GPU 的 Vulkan 默认启用,AMD 与 Intel 设备也无需额外设置即可使用 GPU[1]。
英伟达平台最高提速 20%,Vulkan 扩大 GPU 支持范围
在 0.30 版本中,英伟达硬件上的处理速度最高提升了 20%[1]。这得益于英伟达与 llama.cpp 开发团队所做的优化[1]。该数值的测量方法,是将 Gemma 4 26B 模型转换为 Q4_K_M 格式(一种使模型更轻量的量化方式)后,在英伟达 RTX 5090 上运行得出的[1]。
与此同时,面向 GPU 的跨平台技术 Vulkan 现已默认启用[1]。借此,GPU 加速的适用范围扩大到了 AMD 与 Intel 设备[1]。用户无需再像以往那样另行安装厂商专属的库,更多人可以在初始状态下直接用 GPU 运行模型[1]。可以说,能够尝试本地 AI 的硬件范围又进一步拓宽了。
GGUF 支持让模型选择更丰富
0.30 的核心,是对 GGUF 格式的支持[1]。GGUF 是 llama.cpp 原生处理的模型文件格式,支持该格式后,可以直接运行的 GGUF 生态模型范围随之扩大[1]。具体而言,新增涵盖了 LFM、Prism 等模型系列,以及 Unsloth 发布的微调模型等[1]。需要说明的是,此次支持并非取代为苹果芯片(Apple silicon)准备的 MLX 引擎,而是对其进行补充以拓宽兼容范围[1]。
官方还给出了运行 Hugging Face 等平台所发布 GGUF 模型的步骤[1]。首先,下载 GGUF 文件,或包含 GGUF 文件的目录[1]。接着,准备一个写有指向该路径的 FROM 命令的 Modelfile(模型的配置文件)[1]。
FROM ./my-model.Q4_K_M.gguf
之后,用以下命令创建并运行模型[1]。
ollama create -f Modelfile my-model
ollama run my-model
与编程智能体协同
如果模型支持工具调用(调用外部工具来执行处理的功能),该能力在 Ollama 上同样可以沿用[1]。借此,可以用一条命令将模型与你常用的编程智能体或个人助手组合使用[1]。
例如,与 Claude Code 组合使用时,按如下方式指定[1]。
ollama launch claude --model my-model
Hermes Agent 的情况如下[1]。
ollama launch hermes --model my-model
OpenClaw 则按如下方式运行[1]。
ollama launch openclaw --model my-model
想确认某个 GGUF 文件是否支持工具调用,可以使用 ollama show 命令[1]。如果显示的信息中包含 tools 项,便是支持工具调用的标志[1]。
ollama show my-model
在此次更新中,Ollama 向开发 llama.cpp 的 Georgi Gerganov 及维护团队,以及在 GGML 生态中致力于性能优化的英伟达、AMD、高通、Intel 等硬件合作伙伴致谢[1]。
总结
Ollama 0.30 通过经由 llama.cpp 的 GGUF 支持,大幅拓宽了所支持的模型与硬件范围。在英伟达平台上处理速度最高提升 20%,而 Vulkan 的默认启用让 AMD 与 Intel 设备也能在无需额外设置的情况下使用 GPU。GGUF 模型可经由 Modelfile 引入,支持工具调用的模型还能用一条命令与 Claude Code、OpenClaw 等编程智能体协同。这将进一步拓宽在自有硬件上运行本地 AI 的选择。
来源:https://ollama.com/blog/improved-performance-and-model-support-with-gguf
