接入 Mistral Agentic Search 前,先把它当作待验收组件,不要直接替换现有单次 RAG。该产品于 2026-08-20 发布,让模型在文档索引上反复检索,并在候选文档内定位、读取和核验信息。截至 2026-08-21,官方入口包括 Mistral Search Toolkit,以及 Studio 和 Vibe 中的 Libraries;官方发布没有交代套餐、地区和价格。Search Toolkit 的更新记录(changelog)将 0.0.8 记为技术预览(tech preview),当前列出的 0.0.9 仍有破坏性变更(breaking changes),上线前必须重新核对版本、账户可用性和商业条件。
如果查询只是从短文档里找一个明确字段,或要高并发返回相关段落,继续使用单次检索增强生成(retrieval-augmented generation,RAG)。只有当答案散在长文档、表格、脚注或多个来源中,而且输出必须给出可复查位置时,才值得测试 Agentic Search。“利用现有索引”也有前提:当前后端必须能接入 Search Toolkit,并保留文档身份、权限元数据和稳定位置。
验收时固定语料快照、索引配置和模型,依次比较单次 RAG、多步 search、完整导航三条路径。每条路径都记录任务通过率、证据可复查性、每个成功任务成本和第 90 百分位(p90)延迟;完整导航没有稳定提高真实任务通过率,或无法回到原文位置时,就不要扩大路由范围。
一张表决定查询走单次 RAG 还是 Agentic Search
Mistral 官方发布把短文档直接查找、高吞吐关键词或语义检索、来源位置已知的简单问题列为单次索引检索场景;长文档、多来源、表格和必须验证证据的问题才是 Agentic Search 的目标范围。
| 真实查询特征 | 默认路径 | 升级或停止条件 |
|---|---|---|
| 答案通常在前几个检索片段里 | 单次 RAG | 只有固定评测集频繁漏掉正确段落时才增加搜索轮次 |
| 文档短、结构稳定,字段位置已知 | 单次 RAG 或结构化查询 | 不要为可直接定位的字段引入智能体工具循环 |
| 高频返回相关段落,不要求综合结论 | 索引检索 | 以召回、延迟和吞吐为主,不让模型继续打开整份文档 |
| 答案藏在长报告的表格、条款、图注或脚注 | Agentic Search | 必须输出文档、页码或稳定位置;找不到就返回证据不足 |
| 需要比较多份合同、财报或技术规范 | Agentic Search | 工具轨迹应覆盖所有必需来源,缺一份就不生成最终判断 |
| 问题需要多次改写查询才能找到证据 | Agentic Search | 限制搜索轮次和可访问文档范围,达到上限后转人工 |
先按查询类型分流,不要把整个知识库一次性切换。单次 RAG 可以继续处理容易回答的流量,Agentic Search 只接收已证明需要文档内导航或跨来源核验的问题。
search、open、navigate、read、grep 各管一步
Mistral 的发布说明列出五个工具。它们不是五种同义搜索,而是把“找到候选文档”和“在文档里验证答案”拆开:
| 工具 | 作用 | 评测时要检查 |
|---|---|---|
search |
用现有索引找候选文档 | 查询是否逐步收窄,是否反复返回同一批无关结果 |
open |
打开某一份候选文档 | 是否选中了正确版本、日期和权限范围 |
navigate |
跳到页、章节或文档区域 | 位置是否稳定,扫描 PDF 的页码是否与原件一致 |
read |
读取当前位置的内容 | 是否保留表头、单位、脚注和上下文,而非只截一个数字 |
grep |
在已打开文档中定位文本模式 | 关键词变化、光学字符识别(OCR)错字或同名字段会不会造成漏检 |
Mistral 的发布说明只列出工具能力,没有承诺它们会自动继承现有文档权限。把权限校验当作接入方的验收条件:search 只能返回当前用户有权访问的候选文档,open 和 read 也要再次检查权限;不能因为索引命中,就让后续工具绕过租户、部门或项目边界。
在同一索引上跑单次 RAG、多步 search 和完整导航
Mistral 说明,Agentic Search 可以接在现有索引之上,也不要求针对某个模型做微调;这不等于任意索引都能直接接入。当前 Search Index 文档列出的内置后端是 Vespa,其他后端通过自定义向量存储接入。评测前先确认适配器能返回正文、文档身份、稳定位置和权限元数据,再固定语料快照、索引配置、模型版本和评分规则,只改变模型可调用的检索工具。
| 路径 | 允许的工具 | 要回答的问题 |
|---|---|---|
| A:单次 RAG 基线 | 一次索引检索,然后回答 | 当前系统究竟在哪些查询上失败 |
| B:多步搜索 | 允许模型重复调用 search |
查询改写和重试是否找回了漏掉的文档 |
| C:完整导航 | search 加 open、navigate、read、grep |
文档内定位是否进一步提高正确率并减少无效搜索 |
同一索引至少要保存语料快照、索引配置哈希、文档身份规则和位置规则。不要同时改分块、嵌入模型、排序器和生成模型,否则无法判断改进来自 Agentic Search 还是索引重建。三条路径跑完后,再单独评估解析器、分块、混合检索或重排序。
固定评测问题必须带答案和证据位置
优先从现有搜索失败、人工复核记录和用户追问中整理评测问题,不要随机生成一批“看起来像业务”的问题。每条问题都要有人工确认的答案、必需来源和证据位置;无法建立标准答案的问题放到探索集,不进入上线门槛。
下面是字段示意,不代表任何真实业务的测试结果。run_repetitions: 3 只是小规模试跑的起点,不是通用统计门槛;正式评测要按风险和样本量决定重复次数。
query_id: contract-renewal-notice-period
corpus_snapshot: contracts-2026-08-21
index_config_hash: sha256:<index-config-hash>
model_id: <explicit-model-id>
harness_version: <commit-or-release>
scorer_version: <rubric-version>
tool_budget: search=4, open=3, read=6
run_repetitions: 3
question: 比较当前合同与上一版合同的自动续约通知期限。
required_sources: 当前合同、上一版合同
expected_evidence: 两份合同中“续约与终止”条款的页码和原文
answer_rule: 分别给出期限、版本日期和差异;缺少任一来源时返回证据不足
forbidden_behavior: 只引用一份合同就推断另一份;省略单位;把扫描识别结果当作已核验原文
同一条问题要在 A、B、C 三条路径上重复运行,并记录:
| 记录项 | 通过条件 |
|---|---|
| 运行配置 | 数据与索引版本、模型与工具设置、运行框架与评分器版本都可复查 |
| 最终答案 | 符合人工确认的答案规则;数字、日期和单位一致 |
| 证据完整性 | 覆盖全部必需来源,并给出可重新打开的位置 |
| 检索轨迹 | 没有越权文档、无效循环或遗漏的必需来源 |
| 停止行为 | 找不到证据、工具报错或达到轮次上限时不猜答案 |
| 重复运行 | 三条路径使用相同重复次数,并报告通过率和失败分布 |
| 资源消耗 | 记录模型、OCR/嵌入、检索工具和基础设施费用,以及平均和 p90 延迟 |
只有最终答案和证据同时通过,才算成功任务。Agentic Search 找到了正确数字,却引用了错误版本或无法复查的页面,仍应判失败。每条路径的成本统一换算成“该路径全部运行费用 ÷ 该路径成功任务数”;样本不足以稳定计算 p90 时,直接列每次延迟和样本数,不给出看似精确的尾部指标。
FinanceBench 和 OfficeQA Pro 只能帮助选择评测题型
Mistral 在 2026-08-20 公布的结果来自默认 Search Toolkit 配置、未做针对性调优,并测试 Mistral Medium 3.5 与 GLM-5.2。它能说明多步搜索和文档导航在长、密集、表格型材料上有潜力,不能直接换算成企业知识库的预期提升。
| 官方评测 | 文档与问题 | Mistral 公布的结果 | 适合加入自有评测的题型 |
|---|---|---|---|
| FinanceBench | 368 份美国证券交易委员会文件,150 个问题,平均约 147 页 | 从单次 RAG 到多步 search,两款模型分别增加 47.3 和 52.6 个百分点;加入导航工具后再增加 8.7 和 6.7 个百分点 |
长财报、跨章节数字、需要反复改写查询 |
| FinanceBench 资源消耗 | 同一评测 | 完整导航相对只用多步 search,两款模型的词元分别减少 23.9% 和 33.7%;整体 p90 从 255 秒降到 154 秒,平均延迟从 108 秒降到 71 秒 |
同时记录质量、成本和尾部延迟,不只数工具调用 |
| OfficeQA Pro | 696 份美国财政部公报,133 个高难问题,约 8.9 万页扫描与表格型 PDF | GLM-5.2 完整路径达到 51.9%,比单次 RAG 高 45.6 个百分点;Mistral Medium 3.5 高 27.1 个百分点 | OCR 文档、跨表格计算、可核验数字答案 |
发布页摘要还给出 FinanceBench 从 26.7% 到 86% 的一组整体结果。上述数字都是 Mistral 官方发布中的供应商评测;公告正文没有提供逐题输出、评分器提示词或完整运行产物,不能当作独立复现。复跑公共基准时,要固定 FinanceBench 数据版本、OfficeQA Pro 数据与评分器版本和运行框架提交。你自己的语料如果主要是短问答页、干净网页或固定字段,结果可能完全不同;这类流量应保留单次 RAG。
处理敏感文档时,逐层核对隔离边界
Mistral 表示,Search Toolkit 的开放模块可在云端或本地部署,并能利用现有索引;“本地索引”不等于整个处理链都留在本地。官方 Quickstart在本地运行 Vespa,但示例中的嵌入仍使用 Mistral API。上线前按摄取、检索、推理和日志四组画出数据流,逐项确认存储位置、服务商、保留时间和访问角色。
至少验证下面四个边界:
- 文档权限在
search、open和read每一步都执行,不只在聊天入口检查一次。 - 检索日志不保存无关正文、个人信息或跨租户片段;调试日志也按同一规则处理。
- 按 OWASP RAG 安全建议把文档内容当作不可信数据;文档里的指令不能修改工具权限、系统提示或答案规则。
- 模型找不到已授权证据时返回“证据不足”,不能自动扩到未批准的数据源或公网搜索。
只要任一步无法说明数据去了哪里、谁能读取或多久删除,就先停在测试环境。需要严格隔离时,应先验证本地解析、索引和推理链路,再决定是否使用云端组件。
灰度时同时保留简单、复杂和人工三条出口
上线后的查询路由不应只有“单次 RAG”和“Agentic Search”两个结果。简单问题走单次 RAG;已在固定评测集证明需要多步导航的问题走 Agentic Search;证据不足、权限冲突、工具失败或达到搜索上限的问题转人工或明确拒答。
扩大灰度前核对这些结果:
- 复杂查询的答案与证据通过率高于单次 RAG 基线
- 简单查询没有因误路由增加每个成功任务成本和尾部延迟
- 每次回答都能回放文档、位置和工具顺序;用户撤权或删除文档后,索引和工具访问会同步失效
- Agentic Search 不可用时,系统会回退到单次 RAG 或证据不足,而不是跳过检索直接回答
任一高风险查询出现越权文档、错误版本或无证据结论,就暂停该查询类别的 Agentic Search 路由。修正权限、索引或答案规则并重跑同一评测集后,再恢复灰度。
接入前的三个具体问题
现有索引需要全部重建吗?
不一定。Mistral 说明,Agentic Search 可以在现有索引之上运行;当前 Search Index 文档内置支持 Vespa,其他后端需要实现自定义向量存储接口。只有现有适配器能返回正文、文档身份、稳定位置和权限元数据时,才先用原索引做三路径对照。文件解析、分块、表格或扫描件识别已经丢失关键信息,或者后端无法提供这些字段时,就要补适配器、迁移或重建索引。
一定要微调模型吗?
不需要。Mistral 表示,五个检索工具不依赖模型微调或专用训练。实际可用性仍取决于模型能否正确选工具、遵守轮次限制并输出稳定证据位置,这些都要用自己的问题验证。
最快从哪里开始试?
Mistral 官方发布推荐 Search Starter App。它是一个 Copier 项目模板,本地试跑需要带 uv 的 Python 3.12+ 环境、Docker/Vespa 和 Mistral API Key;默认配置适合先验证摄取、检索和工具轨迹,不代表生产配置。想在 Studio 或 Vibe 内直接使用时可选 Libraries;要接入现有智能体、工作流或客户部署时,再评估 Search Toolkit 的版本、后端适配和商业条件。