Mistralが、AIモデル自身に文書を探させて読ませる検索基盤「Agentic Search」を2026年8月20日に公開しました。1回の検索結果だけで答えさせる従来のRAGをやめ、モデルが自分で検索をやり直し、文書を開き、必要なページまで移動して確かめる仕組みです。金融文書のベンチマークでは正答率が26.7パーセントから86パーセントへ上がったと報告されています。
1回の検索で終わらせない
従来のRAG(検索拡張生成)は、質問文で索引を1回引き、上位に並んだテキストの断片をモデルに渡して答えさせる作り方でした。答えが上位の断片に含まれていれば十分に機能しますが、数百ページの契約書や有価証券報告書のように、必要な数値が特定の表や脚注、条項に埋まっている文書では簡単に行き詰まります。モデルは最初に渡された断片だけで答えるしかなく、情報が足りないと気づいても別の文書を探しにいけないからです。
Agentic Searchは、この1回きりの取得を繰り返しのループに置き換えます。モデルはまず検索し、結果を見て足りないと判断したら検索し直し、有望な文書を開いて中を移動し、該当箇所を読む、という手順を必要なだけ回します。索引は「どの文書が関係しそうか」を絞るところまでを担当し、その先のどこをどこまで掘るかはモデルが決める分担になります。
モデルに渡される5つの道具
Agentic Searchがモデルに与えるのは、ファイル操作に近い5つの機能です。既存の索引から関連文書を探す search、特定の文書を開く open、ページやセクションなど文書内の位置へ移動する navigate、その位置の内容を取り出す read、開いた文書の中で語やパターンを探す grep の5つで構成されています。
この5つを組み合わせて、検索して、結果を吟味して、掘って、必要なら新しい問いを立て直す、という一連の流れを作ります。すでに見た断片を次の検索から外せるため、同じ結果を何度も引き当てて空回りすることも避けられます。
Mistralによれば、これらの道具はモデル側のファインチューニングや専用の学習を必要としません。Mistral製のモデルでも他社モデルでも同じように動くため、モデルの推論能力が上がれば、索引の作り方を変えなくても検索の質が付いてくる構造になります。チャンク分割の設計で検索精度の上限が決まってしまう、という従来の悩みどころに対する回答と言えます。
SEC提出書類5万3,900ページでの結果
Mistralは、Mistral Medium 3.5とZ.aiのGLM-5.2という大小2つのモデルで、Search Toolkitの初期設定のまま検証しています。ベンチマーク向けの調整は加えていないとのことです。
1つ目はFinanceBenchで、10-K・10-Q・8-KといったSEC提出書類368件、平均147ページ、合計およそ5万3,900ページに対する150問を扱います。1回きりのRAGから、モデルが自分で検索を繰り返せるループへ変えただけで、正答率はMistral Medium 3.5で47.3ポイント、GLM-5.2で52.6ポイント上がりました。どちらもおよそ3倍の改善です。
そこへ open・navigate・read・grep の移動系を足すと、正答率はさらにMistral Medium 3.5で8.7ポイント、GLM-5.2で6.7ポイント伸びます。全体としては26.7パーセントから86パーセントへ、という数字が示されています。
精度が上がってトークンが減る
興味深いのは、正答率が上がった分だけコストが増えるわけではない点です。移動系の道具を足した完全なループは、検索を繰り返すだけのループよりトークン消費が少なく、Mistral Medium 3.5で23.9パーセント、GLM-5.2で33.7パーセント減っています。広く検索し直す試行が、狙った場所への移動に置き換わるためです。
待ち時間も同じ方向に動きます。FinanceBenchでの応答時間は、p90が255秒から154秒へ、平均が108秒から71秒へ短くなりました。Mistralは、狙い撃ちの移動によってp90レイテンシーを最大39.6パーセント削減できるとしています。
スキャンPDFの表も読ませる
2つ目の検証はOfficeQA Proです。米国財務省が発行してきたTreasury Bulletin 696件、およそ8万9,000ページを対象にした、スキャン済みで表が多いPDFの集まりで、答えが数値として検証できる133問を使っています。
ここではGLM-5.2が6.3パーセントから51.9パーセントへ、45.6ポイントの改善を記録しました。Mistral Medium 3.5でも27.1ポイント伸びています。移動系を足したことによる上積みはMistral Medium 3.5で7.5ポイント、GLM-5.2で8.3ポイントで、同時にやり取りの回数も最大7.0パーセント減りました。
Mistralは、同じGLM-5.2でも周辺の道具立てによって結果が変わる点にも触れています。Kimiの調査ではGLM-5.2のOfficeQA Proのスコアが41.4パーセントとされており、Mistralの環境で測った51.9パーセントとは10.5ポイントの差が出ています。モデルの素の能力だけでなく、検索の足回りをどう組むかが成績を左右するという主張です。
なお、これらの数値はいずれもMistral自身が公表したもので、第三者による独立検証ではありません。数字の読み方には、その前提を置いておく必要があります。
手元の環境に置いたまま使える
Agentic Searchは、取り込み・埋め込み・索引・検索の各部品をまとめたMistral Search Toolkitから利用します。パーサー、チャンク分割の方針、埋め込みモデル、抽出器を選んでパイプラインを組め、索引付けとランキングはVespaのスキーマと関連度プロファイルで調整できます。クエリの書き換えやリランキング、ハイブリッド検索の追加も可能です。
検索用の道具はMCP(Model Context Protocol)経由でエージェントに渡せます。索引はVespaとDockerによる自社運用でも、マネージドのバックエンドでも動かせるため、機密性の高いデータを隔離されたクラウドやオンプレミスに置いたまま扱えるのが売りです。
パイプラインを自分で組みたくない場合は、Mistral StudioとVibeのLibrariesに組み込まれた状態でそのまま使えます。試すだけならGitHubで公開されているSearch Starter Appが手軽で、既定の設定で手元にローカル索引を作り、自分の文書群でAgentic Searchの挙動を確かめられます。
まとめ
Agentic Searchは、検索をモデルの外側の前処理から、モデルが回す作業の一部へ移す提案です。検索を繰り返せるようにするだけで正答率が3倍近くになり、そこへ文書内を移動する道具を足すと精度が上がってトークンと待ち時間が減る、という結果が示されました。数値はMistral自身の計測ですが、長い文書を扱う社内向けAIで成果が出ていない場合、モデルを大きくするより検索の足回りを見直したほうが早い、という示唆としては十分に読み応えがあります。
