Mistral 在 2026 年 8 月 20 日推出檢索層 Agentic Search,讓 AI 模型自己動手翻找文件。它不再只靠一次檢索的結果作答,而是允許模型重新搜尋、開啟檔案、移動到需要的頁面並核對原文。在金融文件的基準測試中,正確率從 26.7% 提升到了 86%。

不再停在一次檢索

傳統的 RAG(檢索增強生成)以問題查詢索引一次,把排在前面的文字片段交給模型作答。若答案剛好落在那些片段裡,這種做法夠用。但面對數百頁的合約或年度財報,所需的數字往往藏在某張表格、某個註腳或某條條款中,一次檢索就會走不下去。模型只能依據拿到的片段回答,即使察覺資訊不足,也無法轉向別處尋找。

Agentic Search 把這種一次性的取得換成了迴圈。模型先檢索,檢視結果,判斷不足就重新檢索,開啟看起來有希望的文件,在其中移動,讀取相關段落,依需要反覆進行。索引仍負責篩出可能相關的文件,至於要往哪裡挖、挖到多深,則交由模型決定。

交到模型手上的五項工具

Agentic Search 提供給模型的,是五項近似檔案操作的能力:search 透過既有索引找出相關文件,open 開啟指定文件,navigate 移動到文件內的頁面、章節或特定區域,read 取出該位置的內容,grep 則在已開啟的文件中尋找詞彙或樣式。

五者組合起來,就構成了檢索、判讀、深入,必要時重新提問的完整流程。已經看過的片段可以從後續檢索中排除,因此不會反覆命中相同結果而空轉。

Mistral 表示,這些工具不需要對模型進行微調,也不需要專門訓練。無論搭配 Mistral 自家模型或第三方模型都能同樣運作,因此隨著模型推理能力提升,不必更動索引結構,檢索品質也會跟著提高。這正好回應了一個常見的困擾:分塊策略往往悄悄決定了檢索精度的上限。

5 萬 3,900 頁 SEC 文件上的成績

Mistral 以大小不同的兩個模型進行驗證,分別是 Mistral Medium 3.5 與 Z.ai 的 GLM-5.2,採用 Search Toolkit 的預設設定,未針對基準做任何調校。

第一項是 FinanceBench,涵蓋 368 份 SEC 文件中的 150 道題目,包含 10-K、10-Q、8-K,平均每份 147 頁,合計約 5 萬 3,900 頁。光是從一次性 RAG 改成允許模型自行反覆檢索的迴圈,正確率在 Mistral Medium 3.5 上提升了 47.3 個百分點,在 GLM-5.2 上提升了 52.6 個百分點,兩者都接近三倍的改善。

再加入 open、navigate、read、grep 這些移動類工具後,正確率又分別提升 8.7 個百分點與 6.7 個百分點。整體而言,Mistral 給出的結果是從 26.7% 提升到 86%。

正確率提高,token 反而變少

值得注意的是,正確率的提升並未伴隨同等的成本上升。加入移動類工具的完整迴圈,比只做檢索的迴圈消耗更少 token,Mistral Medium 3.5 減少 23.9%,GLM-5.2 減少 33.7%,原因是反覆的廣泛檢索被精準的移動所取代。

等待時間也朝同一方向變化。在 FinanceBench 上,p90 從 255 秒降到 154 秒,平均值從 108 秒降到 71 秒。Mistral 指出,有針對性的移動最多可讓 p90 延遲降低 39.6%。

讀懂掃描 PDF 裡的表格

第二項驗證是 OfficeQA Pro,取材自美國財政部歷年發行的 696 份 Treasury Bulletin,約 8 萬 9,000 頁,全是表格密集的掃描版 PDF。Mistral 使用了答案可用數值驗證的 133 道 pro 子集題目。

GLM-5.2 從 6.3% 提升到 51.9%,提高了 45.6 個百分點,Mistral Medium 3.5 也提高了 27.1 個百分點。加入移動類工具後又分別增加 7.5 個與 8.3 個百分點,同時往返的輪次最多減少 7.0%。

Mistral 也提到,同一個模型在不同的周邊工具配置下,成績並不相同。根據 Kimi 的研究,GLM-5.2 在 OfficeQA Pro 上的分數為 41.4%,比 Mistral 自家環境測得的 51.9% 低了 10.5 個百分點。其主張是,模型本身的能力只是一部分,檢索的底層如何搭建同樣左右成績。

要留意的是,上述數字全部出自 Mistral 自己的量測,並非第三方獨立驗證,解讀時應把這個前提放在心上。

可以留在自家環境內執行

Agentic Search 透過 Mistral Search Toolkit 使用,這套工具集打包了擷取、嵌入、索引與檢索等元件。可自行挑選解析器、分塊策略、嵌入模型與抽取器來組建管線,索引與排序則透過 Vespa 的 schema 與相關性設定檔調整,也能追加查詢改寫、重新排序與混合檢索。

檢索工具可透過 MCP(Model Context Protocol)提供給代理程式使用。索引既能以 Vespa 搭配 Docker 自行架設,也能交給託管後端,因此機密資料可以留在隔離的雲端環境或內部機房中,這正是它主打的賣點。

不想自己組建管線的團隊,可以直接使用已整合進 Mistral Studio 與 Vibe 的 Libraries。若只是想先試試看,GitHub 上公開的 Search Starter App 最為方便,它會以預設設定在本機建立索引,讓你在自己的文件集上觀察 Agentic Search 的實際運作。

總結

Agentic Search 提出的思路,是把檢索從模型外側的前處理,移進模型本身的工作流程之中。單是讓模型能夠反覆檢索,正確率就接近提升三倍;再加上在文件內部移動的工具,精度進一步提高,token 消耗與等待時間反而下降。這些數字來自 Mistral 自家的量測,但對於內部 AI 在長文件上遲遲交不出成果的團隊來說,它足以說明一件事:與其換上更大的模型,不如先重新檢視檢索的底層架構。