Ollama 於 2026 年 9 月 29 日宣布,支援以 TypeSafe 的 Jev API 為基礎的「決策模型」[1]。使用者只要把文字與一組具名問題送給本機執行的模型,就能在一次請求中取得所有問題的答案。Ollama 表示不需額外費用,在本機執行也能降低延遲。此功能需要 Ollama 0.35 或更新版本。

專注於「判斷」而非文字生成的新 API

這類模型不會產生長篇文字,而是針對輸入的狀態(state)回答具名問題。Ollama 列出的適用情境包括工單分流、模型路由,以及內容或安全性審核等需要快速判斷的工作[1]。

使用時,將文字傳送到 Ollama 0.35 新增的 /v1/systemone 端點即可。可一次指定多個問題,並在一次回應中取得全部答案[1]。

本機執行,單次判斷僅 91 毫秒

由於請求不必經過網路,延遲很低。根據 Ollama 的說明,9B 規模的模型 nimble 在搭載 M5 Max 的裝置上於本機執行小精靈示範時,單次判斷平均耗時 91 毫秒,足以應付玩遊戲或即時處理內容[1]。

目前提供的 3 個模型

目前可用的模型如下[1]。

  • nimble:由 Bespoke Labs 開發的開源 9B 參數決策模型
  • tev1:Together AI 推出的實驗性 4B 決策模型
  • tev1:0.8b:Together AI 推出的實驗性 0.8B 決策模型

Ollama 表示未來還會推出更多決策模型,其中包括由 Ollama 雲端提供的模型[1]。

使用方式

首先將 Ollama 更新到最新版本,接著下載 nimble 等決策模型。

ollama pull nimble

可以透過 curl 或 TypeSafe 官方 Python SDK 傳送請求。使用 uv 或 pip 安裝 SDK,並設定 TYPESAFE_BASE_URL 等環境變數[1]。

uv add typesafe-sdk # or: pip install typesafe-sdk
export TYPESAFE_BASE_URL=http://localhost:11434
export TYPESAFE_API_KEY=ollama
export TYPESAFE_DEFAULT_MODEL=nimble

在官方範例中,針對「我被重複扣款了,請退還多收的款項」這張工單,同時提出三個問題:應由哪個團隊處理(choice)、客戶是否明確要求退款(noul)、緊急程度如何(score)。回答附有機率與信心值,這張工單被判定由 billing 團隊處理,退款需求的機率為 0.997[1]。

後續計畫

Ollama 將這次更新稱為決策模型支援的第一批發布。後續計畫包括透過 MLX 在 Apple Silicon 上進一步提速,以及推出專精於不同類型判斷的更多模型[1]。

總結

Ollama 的決策模型不讓大型語言模型寫文章,而是在本機以低成本快速完成分類、分流等判斷。對於希望在自己的電腦上完成工單分流或審核前置處理的開發者來說,又多了一個容易嘗試的選擇。

出典:https://ollama.com/blog/ollama-now-supports-jev-style-decision-models