Ollama 于 2026 年 9 月 29 日宣布,支持基于 TypeSafe 的 Jev API 的“决策模型”[1]。用户只需将文本和一组命名问题发送给本机运行的模型,即可在一次请求中获得所有问题的回答。Ollama 表示无需额外费用,本地运行还能降低延迟。该功能需要 Ollama 0.35 或更高版本。
专注于“判断”而非文本生成的新 API
这类模型并不生成长文,而是针对输入的状态(state)回答命名问题。Ollama 列举的适用场景包括工单分流、模型路由,以及内容或安全审核等需要快速判断的任务[1]。
使用时,向 Ollama 0.35 新增的 /v1/systemone 端点发送文本即可。可以一次指定多个问题,并在一次响应中获得全部答案[1]。
本地运行,单次判断仅 91 毫秒
由于请求无需经过网络,延迟很低。据 Ollama 介绍,9B 规模的模型 nimble 在搭载 M5 Max 的设备上本地运行吃豆人演示时,单次判断平均耗时 91 毫秒,足以支持玩游戏或实时处理内容[1]。
目前提供的 3 个模型
目前可用的模型如下[1]。
- nimble:由 Bespoke Labs 开发的开源 9B 参数决策模型
- tev1:Together AI 推出的实验性 4B 决策模型
- tev1:0.8b:Together AI 推出的实验性 0.8B 决策模型
Ollama 表示后续还会推出更多决策模型,其中包括由 Ollama 云端提供的模型[1]。
使用方法
首先将 Ollama 升级到最新版本,然后下载 nimble 等决策模型。
ollama pull nimble
可以通过 curl 或 TypeSafe 官方 Python SDK 发送请求。使用 uv 或 pip 安装 SDK,并设置 TYPESAFE_BASE_URL 等环境变量[1]。
uv add typesafe-sdk # or: pip install typesafe-sdk
export TYPESAFE_BASE_URL=http://localhost:11434
export TYPESAFE_API_KEY=ollama
export TYPESAFE_DEFAULT_MODEL=nimble
在官方示例中,针对“我被重复扣款了,请退还多收的款项”这张工单,同时提出三个问题:应由哪个团队处理(choice)、客户是否明确要求退款(noul)、紧急程度如何(score)。回答附带概率和置信度,该工单被判定为由 billing 团队处理,退款诉求的概率为 0.997[1]。
后续计划
Ollama 将此次更新称为决策模型支持的第一批发布。后续计划包括借助 MLX 在 Apple Silicon 上进一步提速,以及推出专注于不同类型判断的更多模型[1]。
总结
Ollama 的决策模型不让大模型写文章,而是在本地以低成本快速完成分类、分流等判断。对于希望在本机完成工单分流或审核前置处理的开发者来说,又多了一个易于尝试的选择。
出典:https://ollama.com/blog/ollama-now-supports-jev-style-decision-models
