Perplexityは2026年10月1日、文章を書かずに選択肢ごとの確率だけを返す判断専用モデル「pplx-decider-v1-27b」を公開しました。同じ日に、このモデルを使ったホスト型の「Decisions API」も提供を始めています。重みはHugging FaceでApache 2.0ライセンスのもと配布されており、自前のGPUでも動かせます。

返ってくるのは文章ではなく確率

問い合わせの振り分けや、投稿が緊急かどうかの判定のように、答えの候補があらかじめ決まっている処理では、チャット型のAIに長い文章を書かせる必要はありません。Decisions APIはこの点に着目した仕組みで、入力した内容と質問に対して、型のついた確率を返します。

質問の種類は、はい・いいえを問う形式と、選択肢から選ぶ形式が基本です。公式ドキュメントには、評価基準ごとに点数を付ける形式も載っています。入力には文章やJSONのほか、画像も使えます。たとえば、サポート窓口に届いた問い合わせを「請求」「技術サポート」「営業」のどこへ回すかを、確率つきで判定するといった使い方です。

モデルの中身

pplx-decider-v1-27bは、Alibabaの「Qwen3.8-27B」を土台に追加学習した約260億パラメータのマルチモーダルモデルです。モデル本体のほかに、判断結果を読み出す小さな出力部分(readout)が付属します。扱える入力は最大でおよそ26万トークンで、長い問い合わせ履歴にスクリーンショットを添えるような使い方も想定されています。

ただし、手元で動かすには相応の環境が必要です。モデルカードでは、Python 3.12以降と、重み約49GiBに加えて作業用のメモリを確保できるCUDA対応GPUが求められています。「オープンだから無料で気軽に動く」わけではなく、GPUの費用は別に見込む必要があります。

料金と性能

ホスト型のDecisions APIの料金は、入力100万トークンあたり0.04ドル(約6円)で、出力は無料です。判断用途では出力が短いため、課金の中心は入力側になります。Perplexityの経営陣は、この単価をさらに下げていく考えを示しています。※1ドル158円換算(2026年10月2日時点)

性能は、Perplexityが公開した11種類のベンチマークの平均で85.71パーセントでした。比較対象のTypeSafe AI製「Jev」は84.51パーセント、土台のQwen3.8-27Bは74.76パーセントです。RAGTruth(回答が根拠に忠実かの検証)では88.80対77.27と大きく上回りました。

一方で、WinoGrandeやBBH、TruthfulQAの2択版といった常識推論や誠実さを問う項目では、Jevが上回っています。平均点だけを見るのではなく、自社の用途がどちらの傾向に近いかで評価が分かれそうです。なお、これらの数値はPerplexity自身が公開したもので、APIを通じて測定されています。手元の重みで同じ結果になるとは限らないため、採用前に自社データでの検証が欠かせません。

広がる判断専用モデルの選択肢

判断専用モデルは、ここ数日で選択肢が一気に増えました。OpenAIのDecisions API、CloudflareのClef、AmazonのStrands Decider 2Bに続き、Perplexityも参入した形です。ただし、仕組みはそれぞれ異なります。Jevは文章を出力できない設計ですが、pplx-deciderは通常の言語モデルに判断用の出力部分を足した構成で、文章を出せない保証があるわけではありません。「生成できないこと」を安全面の根拠にしたい場合は、この違いに注意が必要です。

まとめ

pplx-decider-v1-27bは、仕分けや判定といった決まった枠の処理を、低コストなAPIか、Apache 2.0の重みで任せられるモデルです。ホスト型を選ぶか、自前運用にするか、どの提供元を組み合わせるかは、用途の性質と運用コストで決まっていきます。判断専用モデルが、AIエージェントの内部で使い分けられる部品として定着するかが、今後の焦点です。