在本機端運行大型語言模型(LLM)的工具「Ollama」發布了最新版本 0.30[1]。它透過開源推論引擎「llama.cpp」支援 GGUF 格式的模型,可運行的模型與硬體範圍比以往更廣[1]。在 NVIDIA 平台上,處理速度最高提升 20%;同時用於驅動 GPU 的 Vulkan 預設啟用,AMD 與 Intel 裝置也無需額外設定即可使用 GPU[1]。
NVIDIA 平台最高提速 20%,Vulkan 擴大 GPU 支援範圍
在 0.30 版本中,NVIDIA 硬體上的處理速度最高提升了 20%[1]。這得益於 NVIDIA 與 llama.cpp 開發團隊所做的最佳化[1]。該數值的量測方式,是將 Gemma 4 26B 模型轉換為 Q4_K_M 格式(一種讓模型更輕量的量化方式)後,在 NVIDIA RTX 5090 上運行而得[1]。
與此同時,針對 GPU 的跨平台技術 Vulkan 現已預設啟用[1]。藉此,GPU 加速的適用範圍擴大到了 AMD 與 Intel 裝置[1]。使用者不必再像以往那樣另行安裝廠商專屬的函式庫,更多人可以在初始狀態下直接以 GPU 運行模型[1]。可以說,能夠嘗試本機 AI 的硬體範圍又進一步拓展了。
GGUF 支援讓模型選擇更豐富
0.30 的核心,是對 GGUF 格式的支援[1]。GGUF 是 llama.cpp 原生處理的模型檔案格式,支援該格式後,可直接運行的 GGUF 生態系模型範圍也隨之擴大[1]。具體而言,新增涵蓋了 LFM、Prism 等模型系列,以及 Unsloth 發布的微調(fine-tuning)模型等[1]。要說明的是,此次支援並非取代為 Apple 晶片(Apple silicon)準備的 MLX 引擎,而是加以補充以拓展相容範圍[1]。
官方也提供了運行 Hugging Face 等平台所發布 GGUF 模型的步驟[1]。首先,下載 GGUF 檔案,或包含 GGUF 檔案的目錄[1]。接著,準備一個寫有指向該路徑之 FROM 命令的 Modelfile(模型的設定檔)[1]。
FROM ./my-model.Q4_K_M.gguf
之後,以下列命令建立並運行模型[1]。
ollama create -f Modelfile my-model
ollama run my-model
與程式設計代理的協作
若模型支援工具呼叫(呼叫外部工具來執行處理的功能),該能力在 Ollama 上同樣可以沿用[1]。藉此,可以用一行命令將模型與你慣用的程式設計代理(coding agent)或個人助理組合使用[1]。
舉例來說,要與 Claude Code 組合使用時,按下列方式指定[1]。
ollama launch claude --model my-model
Hermes Agent 的情況如下[1]。
ollama launch hermes --model my-model
OpenClaw 則按下列方式運行[1]。
ollama launch openclaw --model my-model
想確認某個 GGUF 檔案是否支援工具呼叫,可以使用 ollama show 命令[1]。若顯示的資訊中包含 tools 項目,即是支援工具呼叫的標記[1]。
ollama show my-model
在此次更新中,Ollama 向開發 llama.cpp 的 Georgi Gerganov 及維護團隊,以及在 GGML 生態系中致力於效能最佳化的 NVIDIA、AMD、Qualcomm、Intel 等硬體合作夥伴致謝[1]。
總結
Ollama 0.30 透過經由 llama.cpp 的 GGUF 支援,大幅拓展了所支援的模型與硬體範圍。在 NVIDIA 平台上處理速度最高提升 20%,而 Vulkan 的預設啟用讓 AMD 與 Intel 裝置也能在無需額外設定的情況下使用 GPU。GGUF 模型可經由 Modelfile 匯入,支援工具呼叫的模型還能以一行命令與 Claude Code、OpenClaw 等程式設計代理協作。這將進一步拓展在自有硬體上運行本機 AI 的選擇。
來源:https://ollama.com/blog/improved-performance-and-model-support-with-gguf
