ローカルで大規模言語モデル(LLM)を動かすツール「Ollama」が、最新版となる0.30を公開しました[1]。オープンソースの推論エンジン「llama.cpp」を通じてGGUF形式のモデルに対応し、これまでよりも幅広いモデルとハードウェアで動かせるようになりました[1]。NVIDIA環境では処理速度が最大20パーセント向上したほか、GPUを使うための仕組みであるVulkanが既定で有効になり、AMDやIntelの機器でも追加設定なしでGPUを活用できます[1]。

NVIDIA環境で最大20パーセント高速に、Vulkanで対応GPUも拡大

今回の0.30では、NVIDIAのハードウェアでの処理速度が最大20パーセント速くなりました[1]。これはNVIDIAとllama.cppの開発チームが手がけた最適化を取り込んだ成果とされています[1]。速度の測定には、Gemma 4 26BモデルをQ4_K_M形式(モデルを軽量化する量子化の一種)に変換したものを、NVIDIA RTX 5090上で動かして確認したと説明されています[1]。

あわせて、クロスプラットフォームのGPU向け技術であるVulkanが既定で有効になりました[1]。これにより、GPUによる高速化の対象がAMDやIntelの機器にも広がります[1]。これまでのようにメーカー固有のライブラリを別途入れなくても、より多くの利用者が初期状態のままGPUでモデルを動かせるようになりました[1]。手元の機材を選ばずにローカルAIを試せる範囲が、一段と広がったと言えそうです。

GGUF対応でモデルの選択肢が広がる

0.30の中心となるのが、GGUF形式への対応です[1]。GGUFはllama.cppが標準で扱うモデルファイル形式で、これに対応したことでGGUFエコシステムのモデルをそのまま動かせる範囲が広がりました[1]。具体的には、LFMやPrismといったモデルファミリーに加えて、Unslothが公開する微調整(ファインチューニング)済みモデルなどが対象に含まれます[1]。なお今回の対応は、Apple Silicon向けに用意されているMLXエンジンを置き換えるものではなく、それを補完して対応の幅を広げる位置づけです[1]。

Hugging Faceなどで配布されているGGUFモデルを動かす手順も示されています[1]。まずGGUFファイル、またはGGUFファイルを含むディレクトリをダウンロードします[1]。次に、そのパスを指すFROM命令を書いたModelfile(モデルの設定ファイル)を用意します[1]。

FROM ./my-model.Q4_K_M.gguf

あとは、次のコマンドでモデルを作成して実行します[1]。

ollama create -f Modelfile my-model
ollama run my-model

コーディングエージェントとの連携

モデルがツール呼び出し(外部ツールを呼び出して処理させる機能)に対応している場合、その機能はOllama上でもそのまま使えます[1]。これにより、普段使っているコーディングエージェントや個人向けアシスタントと、1つのコマンドで組み合わせられます[1]。

たとえばClaude Codeと組み合わせる場合は、次のように指定します[1]。

ollama launch claude --model my-model

Hermes Agentの場合は次の通りです[1]。

ollama launch hermes --model my-model

OpenClawの場合は次のように実行します[1]。

ollama launch openclaw --model my-model

使いたいGGUFファイルがツール呼び出しに対応しているかどうかは、ollama showコマンドで確認できます[1]。表示される情報の中にtoolsの項目があれば、ツール呼び出しに対応しているという目印です[1]。

ollama show my-model

Ollamaは今回の対応にあたり、llama.cppを手がけるGeorgi Gerganov氏とメンテナー陣に加え、GGMLエコシステムでの性能最適化に取り組んだNVIDIA、AMD、Qualcomm、Intelといったハードウェアパートナーへの謝辞を述べています[1]。

まとめ

Ollama 0.30は、llama.cppを通じたGGUF対応によって、対応するモデルとハードウェアの幅を大きく広げたアップデートです。NVIDIA環境では処理速度が最大20パーセント向上し、Vulkanの既定有効化でAMDやIntelの機器でも追加設定なしにGPUを使えるようになりました。GGUFモデルはModelfileを介して取り込め、ツール呼び出しに対応したモデルならClaude CodeやOpenClawなどのコーディングエージェントと1コマンドで連携できます。手元の機材でローカルAIを動かす選択肢を、さらに広げる一歩になりそうです。

出典:https://ollama.com/blog/improved-performance-and-model-support-with-gguf