Firecrawlが8月20日、コーディングAI専用の検索基盤「Developer Index」を公開しました。README、Issue、プルリクエスト、外部ドキュメントなど7,000万件を超える成果物をまとめて索引化し、自然文の質問に対して該当箇所つきで返します。あわせて、開発者向け検索の精度を測る公開ベンチマーク「DevDex」も同時に出しています。
エージェントが探しているのはページではない
コーディングAIがツール呼び出しに費やす時間の多くは、探し物に消えます。求めている機能を実装しているリポジトリ、疑問に答えてくれるドキュメントのページ、そのバグが議論されて直されたIssueやプルリクエスト。この3つが代表格です。
やっかいなのは、それらがGitHub、ドキュメントサイト、掲示板的なスレッドに散らばっていることです。既存の検索は語句の一致で拾う方式が中心で、取りこぼしも出ます。READMEとひもづくIssue、直近のプルリクエストまでそろえようとすると、APIを50回以上たたく羽目になる、とFirecrawlは指摘しています。
同社が挙げる利用者の顔ぶれも具体的です。利用者に代わってバックエンドの不具合を追うエージェント型の製品、社内外のリポジトリを1つの検索層にまとめたい事業者、そして学習・評価用のデータとして公開ドキュメントやコードを必要とするフロンティアの研究所。いずれも同じ穴に落ちていた、という整理になります。
索引しているのはコードではなく「成果物」
Developer Indexが抱えているのは7,000万件を超える成果物です。内訳はREADME、プルリクエスト、Issue、OpenAPI仕様、スキル、そして外部の技術ドキュメント。更新は継続的に走り、大半のソースは毎日更新されます。
主要リポジトリのIssueとプルリクエストは、ひもづく関連物ごと取り込まれます。READMEは公開リポジトリを幅広く対象にし、外部ドキュメントはStripeのような整った形式のものが入っています。各成果物にはスター数、ライセンス、種別といったメタデータも付きます。
コードそのものは保存していません。汎用のWeb検索でもありません。エージェントが作ったり読んだりする成果物に的を絞った検索層である、という線引きがはっきり示されています。
呼び出し方は2通り、APIキーなしでも試せる
使い方は素直です。自然文の質問を投げると、順位づけされた開発者向けの結果と、一致した箇所の抜粋が返ります。抜粋はMarkdownのまま返るため、表やコードブロックの構造が崩れません。エージェントは追加の取得をせずにそのまま判断へ進めます。
入り口は2つあります。開発者向けの結果だけを返す専用エンドポイントと、通常の検索にカテゴリー指定を付ける方法です。返ってくる結果には安定したIDが付き、接頭辞を見ればドキュメント、Issue、プルリクエスト、READMEのどれなのかが判別できます。
API経由なら、種別、リポジトリ、ソース、言語、トピック、ライセンス、最低スター数といった条件で絞り込めます。スキルのファイルだけを対象にする指定も用意されています。ただしこれらの絞り込みはAPI限定です。CLIやMCP経由ではエージェントの成績がむしろ落ちるため、意図的に露出させていないとのことです。
試すだけならAPIキーは不要で、キーを登録すると上限が緩みます。料金は結果10件あたり2クレジット、端数は切り上げです。
npx -y firecrawl-cli@latest setup developer-index
提供形態はAPI、CLI、MCP、各種SDK。CodexやClaude Code、Grok Buildなど、すでに動かしているハーネスへそのまま差し込めるとしています。
精度を測る物差しも一緒に出した
興味深いのは、Firecrawlが評価用のベンチマーク「DevDex」を同時に公開した点です。既存の検索ベンチマークはエージェントが実際にコードを書きながら調べる内容を反映していない、という問題意識から作られています。
中身は1,179件の開発者向け検索クエリで、リポジトリ探索、ドキュメント参照、Issueとプルリクエストからのバグ追跡という3つのトラックに分かれます。採点は上位10件に正解が入っているかを見るRecall@10と、順位を加味したMRR@10。判定は決められた正解に対して機械的に行い、事前学習の知識だけで答えられてしまう問いは除外する仕組みも入っています。比較条件はそろえてあり、動かすモデルはClaude Opus 4.8、1回の実行につき検索ツールは1つだけです。
結果は次の通りです。Developer Indexの総合スコアは0.63。カテゴリー指定なしのFirecrawl検索が0.58、Parallelが0.57、MintlifyとExaが0.54と続き、モデル標準のWeb検索は0.45、Context7は0.17でした。
トラック別に見ると得意不得意が出ます。IssueとプルリクエストではDeveloper Indexが0.66で首位、ドキュメント参照は0.47でContext7と実質同点です。一方でリポジトリ探索は0.76にとどまり、Parallelの0.82とFirecrawl検索の0.78に及びませんでした。ドキュメント特化のContext7はリポジトリ探索が0.01、Issue関連が0.03と、守備範囲の狭さがそのまま数字に出ています。
Firecrawlはデータセットの半分と評価用の実行環境をオープンソースとして公開しており、他社が自前の検索を同じ土俵で測れるようにしています。
まとめ
Developer Indexは、コーディングAIが必要とする素材を「Webページ」ではなく「成果物」として持たせる試みです。7,000万件超の索引を毎日更新し、抜粋つきで返す設計は、エージェントの往復回数をそのまま減らしにいく発想と言えます。総合スコアで首位に立った一方、リポジトリ探索では他社に譲る結果も出ており、用途によって使い分けが要りそうです。ベンチマークを自分から公開した点も含め、開発者向け検索がようやく比較可能な領域に入ってきたことを示す発表でした。
