Firecrawl 于 8 月 20 日发布了专为编程 AI 打造的检索基础设施「Developer Index」。它将 README、Issue、拉取请求以及外部文档等超过 7,000 万件产物统一建立索引,针对自然语言提问返回带命中片段的结果。同时,该公司还公开了衡量开发者检索质量的开放基准「DevDex」。

智能体要找的不是网页

编程 AI 的工具调用有很大一部分花在了找东西上。最典型的有三类:实现某个想法的代码仓库、解答疑问的文档页面,以及讨论并修复了某个缺陷的 Issue 或拉取请求。

麻烦在于,这三类内容分散在 GitHub、文档站点和各种讨论串里。现有检索大多依赖词面匹配,难免漏掉内容。Firecrawl 指出,若想把一个 README 连同相关 Issue 和近期拉取请求一并取回,往往要调用 50 次以上的接口。

该公司列举的用户画像也很具体:代替终端用户排查后端故障的智能体产品、希望把内部与外部仓库整合成单一检索层的团队,以及需要公开开发文档、代码、Issue 和拉取请求作为训练与评测数据的前沿实验室。它们都卡在同一个缺口上。

索引的是产物,不是代码

Developer Index 收录了超过 7,000 万件产物,包括 README、拉取请求、Issue、OpenAPI 规范、技能文件以及外部技术文档。更新持续进行,大部分数据源每天刷新。

主要仓库的 Issue 和拉取请求会连同其关联产物一起收录。README 覆盖范围广泛的公开仓库,外部文档则收录了类似 Stripe 那样结构规整的资料。每件产物还带有星标数、许可证、类型等元数据。

该索引不保存代码,也不是通用的网页检索接口。Firecrawl 划清了界线:这是围绕编程智能体产出与消费的产物而组织的检索层。

两种调用方式,无需 API 密钥即可试用

用法很直接。发送自然语言提问,就会得到排序后的开发者结果以及命中的片段。片段以 Markdown 形式返回,表格和代码块的结构不会被破坏,智能体无需二次抓取即可直接判断。

入口有两个:只返回开发者来源的专用端点,以及在常规检索中指定开发者类别。返回结果带有稳定的 ID,通过前缀即可判断它是文档、Issue、拉取请求还是 README。

通过 API 可以按类型、仓库、来源、语言、主题、许可证和最低星标数等条件筛选,还提供只检索技能文件的设置。不过这些筛选条件仅限 API。在 CLI 与 MCP 上,智能体不带筛选条件时表现反而更好,因此 Firecrawl 有意没有开放。

试用无需 API 密钥,注册密钥后速率上限会放宽。计费为每 10 条结果 2 个信用点,不足部分向上取整。

npx -y firecrawl-cli@latest setup developer-index

提供形式涵盖 API、CLI、MCP 和各类 SDK,可以直接接入已经在用的框架,包括 Codex、Claude Code 和 Grok Build。

同时给出了衡量精度的尺子

更值得注意的是,Firecrawl 同时公开了评测基准「DevDex」。其出发点是:现有检索基准并未反映智能体在写代码时真正会查的内容。

内容为 1,179 条开发者检索查询,分为仓库发现、文档查询、Issue 与拉取请求排障三条赛道。评分采用考察正确产物是否出现在前 10 条中的 Recall@10,以及计入排名的 MRR@10。判定依据固定答案机械执行,并设有剔除机制,把仅凭预训练知识就能回答的问题排除在外。各家在统一条件下运行,驱动模型为 Claude Opus 4.8,每次运行只启用一个检索工具。

结果如下:Developer Index 综合得分 0.63。未指定类别的 Firecrawl 检索为 0.58,Parallel 为 0.57,Mintlify 与 Exa 为 0.54,模型自带的网页检索为 0.45,Context7 为 0.17。

按赛道拆分则能看出长短。Developer Index 在 Issue 与拉取请求赛道以 0.66 领先,文档查询为 0.47,与 Context7 基本持平。而仓库发现只有 0.76,不敌 Parallel 的 0.82 和 Firecrawl 检索的 0.78。专攻文档的 Context7 在仓库发现上仅 0.01,Issue 相关为 0.03,覆盖面之窄直接反映在数字上。

Firecrawl 已将一半数据集与评测执行环境开源,让其他团队能在同一标准下衡量自家系统。

总结

Developer Index 的思路,是把编程 AI 需要的素材以「产物」而非「网页」的形式提供出来。7,000 万件以上的索引每天刷新,并附带命中片段返回,目标直指减少智能体的往返次数。它在综合得分上居首,但在仓库发现赛道让位于同行,具体用途仍需权衡取舍。加上主动公开基准这一点,这次发布显示开发者检索终于进入了可以横向比较的阶段。