Mistral 于 2026 年 8 月 20 日发布了检索层 Agentic Search,让 AI 模型自己去翻找文档。它不再依赖一次检索的结果作答,而是允许模型重新搜索、打开文件、跳转到需要的页面并核对原文。在金融文档基准测试中,正确率从 26.7% 提升到了 86%。
不再止步于一次检索
传统的 RAG(检索增强生成)只用问题查询一次索引,把排在前面的文本片段交给模型作答。如果答案正好落在这些片段里,这套做法足够用。但面对数百页的合同或年度财报,需要的数字往往埋在某张表格、某条脚注或某个条款中,一次检索就会卡住。模型只能依据拿到的片段回答,即使意识到信息不足,也无法去别处寻找。
Agentic Search 把这一次性的检索改成了循环。模型先检索,审视结果,发现不够就重新检索,打开有希望的文档,在其内部移动,读取相关段落,按需要反复执行。索引依旧负责筛出可能相关的文档,而往哪里挖、挖到多深则由模型决定。
交给模型的五个工具
Agentic Search 提供给模型的是五个类似文件操作的能力:search 通过已有索引找出相关文档,open 打开指定文档,navigate 跳转到文档内的页面、章节或特定区域,read 取出该位置的内容,grep 在已打开的文档中查找词语或模式。
五者组合起来,就构成了检索、判断、深入、必要时重新提问的完整流程。已经看过的片段可以从后续检索中排除,避免反复命中同样的结果而空转。
Mistral 表示,这些工具不需要对模型做微调,也不需要针对性训练。无论是 Mistral 自家模型还是第三方模型都能同样运行,因此随着模型推理能力提升,无需改动索引结构,检索质量也会跟着提高。这正好回应了一个常见困扰:分块策略往往悄悄决定了检索精度的上限。
5.39 万页 SEC 文件上的表现
Mistral 使用了大小不同的两个模型进行验证,分别是 Mistral Medium 3.5 和 Z.ai 的 GLM-5.2,采用 Search Toolkit 的默认配置,未针对基准做任何调优。
第一项是 FinanceBench,覆盖 368 份 SEC 文件中的 150 道题目,包括 10-K、10-Q、8-K,平均每份 147 页,合计约 5.39 万页。仅仅从一次性 RAG 换成允许模型自主重复检索的循环,正确率在 Mistral Medium 3.5 上提高了 47.3 个百分点,在 GLM-5.2 上提高了 52.6 个百分点,两者都接近三倍的改善。
再加入 open、navigate、read、grep 这些导航工具后,正确率又分别提高了 8.7 个百分点和 6.7 个百分点。整体来看,Mistral 给出的结果是从 26.7% 提升到 86%。
正确率提高的同时 token 反而下降
值得注意的是,正确率的提升并没有带来同等的成本上涨。加入导航工具的完整循环比只做检索的循环消耗更少的 token,Mistral Medium 3.5 减少 23.9%,GLM-5.2 减少 33.7%,因为反复的宽泛检索被精准的跳转取代了。
响应时间也朝同一方向变化。在 FinanceBench 上,p90 从 255 秒降到 154 秒,平均值从 108 秒降到 71 秒。Mistral 称,有针对性的导航最多可将 p90 延迟降低 39.6%。
读懂扫描 PDF 中的表格
第二项验证是 OfficeQA Pro,取材于美国财政部历年发布的 696 份 Treasury Bulletin,约 8.9 万页,全部是表格密集的扫描版 PDF。Mistral 使用了答案可数值验证的 133 道 pro 子集题目。
GLM-5.2 从 6.3% 提升到 51.9%,提高了 45.6 个百分点,Mistral Medium 3.5 也提高了 27.1 个百分点。加入导航工具后又分别增加 7.5 个和 8.3 个百分点,同时交互轮次最多减少 7.0%。
Mistral 还指出,同一个模型在不同的周边工具下结果并不相同。据 Kimi 的研究,GLM-5.2 在 OfficeQA Pro 上的成绩为 41.4%,比 Mistral 自家测得的 51.9% 低了 10.5 个百分点。其主张是,模型本身的能力只是一部分,检索链路如何搭建同样影响成绩。
需要说明的是,上述数据均出自 Mistral 自己的测试,而非第三方独立评测,解读时应把这一前提考虑进去。
可以留在自有环境内运行
Agentic Search 通过 Mistral Search Toolkit 使用,该工具集打包了摄取、嵌入、索引和检索各个组件。可以自行选择解析器、分块策略、嵌入模型和抽取器来搭建管线,索引与排序则通过 Vespa 的 schema 和相关性配置进行调整,还能追加查询改写、重排序和混合检索。
检索工具可以通过 MCP(Model Context Protocol)暴露给智能体。索引既能用 Vespa 加 Docker 自行部署,也能交给托管后端,因此敏感数据可以留在隔离的云环境或本地机房中,这是它主打的卖点。
不想自己搭建管线的团队,可以直接使用已经集成进 Mistral Studio 和 Vibe 的 Libraries。若只是想先试一试,GitHub 上公开的 Search Starter App 最为便捷,它会用默认配置在本地建立索引,让你在自己的文档集上观察 Agentic Search 的实际表现。
总结
Agentic Search 提出的思路,是把检索从模型之外的预处理环节,挪进模型自身的工作流程里。仅仅让模型能够反复检索,正确率就接近提升三倍;再加上在文档内部移动的工具,精度进一步提高,token 消耗和等待时间反而下降。这些数字来自 Mistral 自己的测量,但对于内部 AI 在长文档上迟迟出不了成果的团队来说,它足以说明一件事:与其换更大的模型,不如先重新审视检索链路。
