Ollamaは2026年9月29日、TypeSafeのJev APIをベースにした「デシジョンモデル」への対応を発表しました[1]。テキストと複数の質問を1回のリクエストで送ると、手元のマシン上で動くモデルがまとめて回答を返す仕組みです。追加費用はなく、ローカル実行ならではの低遅延も特徴とされています。Ollama 0.35以降の新エンドポイントで利用できます。
文章生成ではなく「判断」に特化した新APIです
今回追加されたのは、長文を生成するのではなく、入力された状態(state)に対して名前付きの質問に答えるタイプのモデルです。Ollamaは用途として、チケットの振り分け、モデルのルーティング、コンテンツや安全性のモデレーションといった「素早い判断」が求められる場面を挙げています[1]。
利用するには、Ollama 0.35以降で追加された新しい/v1/systemoneエンドポイントにテキストを送ります。質問は複数まとめて指定でき、1回のリクエストですべてに回答が返ってきます[1]。
ローカル実行で1回あたり91msの判定速度
ネットワークを経由しないため、判定の遅延が小さい点が大きな売りです。Ollamaによると、9Bクラスのモデル「nimble」は、M5 Maxを搭載したマシンでパックマンを操作するデモにおいて、1回の判定に平均91ミリ秒でした。ゲームのプレイやリアルタイムのコンテンツ処理に使える速さだと説明しています[1]。
利用できる3つのモデル
現時点で提供されるのは次の3モデルです[1]。
- nimble:Bespoke Labsが開発したオープンソースの9Bパラメータ判断モデル
- tev1:Together AIによる実験的な4Bの判断モデル
- tev1:0.8b:Together AIによる実験的な0.8Bの判断モデル
今後もデシジョンモデルは追加される予定で、Ollamaのクラウドで提供されるモデルも含まれるとしています[1]。
使い方は3ステップ
まずOllamaを最新版にアップデートし、nimbleなどのモデルを取得します。
ollama pull nimble
リクエストはcurlのほか、TypeSafe公式のPython SDKからも送れます。SDKのインストールはuvまたはpipで行い、環境変数にTYPESAFE_BASE_URLなどを設定します[1]。
uv add typesafe-sdk # or: pip install typesafe-sdk
export TYPESAFE_BASE_URL=http://localhost:11434
export TYPESAFE_API_KEY=ollama
export TYPESAFE_DEFAULT_MODEL=nimble
公式の例では、「二重に請求されたので返金してほしい」というチケットに対し、担当チーム(choice)、返金の明示的な要望の有無(noul)、緊急度(score)の3つを同時に質問しています。回答は確率と信頼度つきで返り、このチケットは担当チームが「billing」、返金要望の確率が0.997と判定されました[1]。
今後の予定
Ollamaは今回を「デシジョンモデル対応の第一弾」と位置づけています。今後はApple SiliconでMLXを使った高速化や、さまざまな種類の判断に特化したモデルの追加を予定しています[1]。
まとめ
Ollamaのデシジョンモデル対応は、LLMに文章を書かせるのではなく、分類や振り分けといった判断だけを素早く低コストでこなす使い方をローカル環境で手軽にするものです。問い合わせ対応やモデレーションの前段処理などを手元で完結させたい開発者にとって、試しやすい選択肢が増えました。
出典:https://ollama.com/blog/ollama-now-supports-jev-style-decision-models
