フランスのMistral AIが、文書解析モデルの新版「OCR 4」を公開しました。単に文字を読み取るだけでなく、ページ上のどこに何があるかを座標付きで返し、見出しや表、数式といった種類まで判別して文書をまるごと構造化する点が今回の核心です。170言語に対応し、機密文書を社外に出せない企業向けに自社サーバーだけで動かせる提供形態も用意しました。料金は1,000ページあたり4ドル(約640円)からです。

「テキストにする」から「構造を取り出す」へ

OCR(光学文字認識)はこれまで、紙やPDFの中身をきれいな文章や表に変換することを主な役割としてきました。OCR 4はここから一歩踏み込み、文書を1つの意味の地図として扱います。具体的には、段落や図といったブロックごとに画面上の位置を示すバウンディングボックス(対象を囲む座標枠)を付け、それぞれを見出し・表・数式・署名・ヘッダーといった種類に分類し、さらにページ単位と単語単位で「どれくらい確からしいか」という信頼度スコアを返します。

Mistralによれば、利用者から最も要望が多かったのがこのバウンディングボックスでした。位置情報がないと、抽出した数字や文言が元の文書のどこから来たのかをたどれません。検索拡張生成(RAG。外部資料を参照して回答を組み立てる仕組み)や監査が絡む業務では、「この数値の出どころはどこか」を後から追跡できることが欠かせず、その弱点を埋める狙いがあります。ブロックの種類分けも実務に直結します。表と判定された部分は数値処理の流れへ、署名と判定された部分は黒塗りなどの処理へと、用途別に自動で振り分けやすくなるためです。信頼度スコアは、確信の低い箇所だけを人の確認に回し、高い箇所は自動で通すといった運用を後押しします。

こうした機能自体は目新しいものではありませんが、別途レイアウト解析の工程を組まなくてもOCRの出力としてそのまま得られる点が、企業の開発負担を軽くします。OCR 4は約15か月で4世代目にあたり、Mistralが文書分野に力を入れてきたことがうかがえます。

対応言語・提供形態・料金

OCR 4は10の言語グループにまたがる170言語に対応し、PDFやDOC、PPT、OpenDocument形式を受け付けます。提供はMistralのAPIのほか、Mistral Studio内のDocument AI、Amazon SageMaker、Microsoft Foundryを通じて始まり、Snowflakeでの対応も近く加わる予定です。

料金は1,000ページあたり4ドル(約640円)で、まとめて処理するバッチ向けの割引を使うと2ドル(約320円)まで下がります。この水準なら、10万ページの社内文書を一括でデータ化しても費用は200ドル(約3万2,000円)ほどに収まる計算で、大規模な電子化を現実的な予算で進めやすくなります。あわせて、モデル一式を1つのコンテナにまとめ、自社の設備の中だけで動かせる構成も用意されました。海外の事業者が運用するクラウドに機密文書を預けたくない、規制の厳しい業種を主な対象として打ち出しています。

※為替レート(2026年6月25日時点):1米ドル=161円、1ユーロ=185円

性能評価と、その読み方

Mistralは、12言語以上・600件超の実文書を使った人手による比較評価で、OCR 4が競合に対し平均72パーセントの勝率を得たとしています。自動指標でも、公開ベンチマークのOlmOCRBenchで85.20、OmniDocBenchで93.07を記録したと説明します。

注目したいのは、Mistral自身がこれらの数値の扱いに慎重な姿勢を示している点です。同社は採点時に見つかった問題、たとえば正解データ側の誤りや、意味は同じでも書き方が違う数式が不一致と判定される事例などを公開し、総合スコアは厳密な順位ではなく「おおよその傾向」として受け取るべきだと述べています。製品発表の場で自社に不利な情報まで明かすのは珍しい対応です。実際、公開ベンチマークの順位表ではOCR 4が3位前後で、Chandra OCR 2のようなオープンなモデルが上位に並ぶ場面もあります。導入を検討する企業にとって大切なのは、順位表の数字よりも、自社の文書・言語・予算・処理速度の条件で誤りが最も少ないのはどれか、という観点です。

早期に試した企業からは好意的な声も出ています。金融分野のあるAI企業は、図表の多いデータで同等の精度を保ちつつ、費用を約8分の1、応答の遅れを約17分の1に抑えられたと報告しています。知的財産管理の企業も、従来サービスに比べ1ページあたりの処理が約4倍速いとしています。いずれも提供企業側の説明であり、最終的な実力は各社が自前の文書で確かめる必要があります。

「主権AI」を軸にした競争

自社サーバーで完結できる提供形態は、Mistralが掲げる「主権AI」、つまりデータや基盤を自国・自社の管理下に置く考え方を製品として形にしたものです。背景には、米国の輸出管理を理由に大手のAIモデルが海外の利用者に対して突然使えなくなる、という出来事が報じられたこともあり、提供元の都合で機能を止められないことを重視する企業の関心が高まっています。欧州ではAI規制の罰則規定が8月に発効する予定で、こうした流れも追い風になりそうです。

競合は厚みを増しています。発表の前日にはBaiduが、長い文書を分割せず一度に読み取れる軽量なオープンモデルを無償で公開しました。このほかGoogle、Amazon、Microsoftの文書解析サービスや、ABBYYのような専業ベンダー、さらに多くのオープンモデルがひしめきます。市場調査では、文書処理の市場規模は約44億ドル(約7,100億円)で、2030年まで年率33パーセント超の成長が見込まれています。Mistralは約1,000人規模の会社で、巨額の資金を集める米国勢と正面から張り合うのは容易ではありません。それでも、主権性・構造化・業務自動化を軸にした企業向けの一式で欧州の需要を取り込む戦略を進めており、報道では評価額約200億ユーロ(約3兆7,000億円)での新たな資金調達も取り沙汰されています。OCR 4は、その入り口に位置づけられる一手といえます。

まとめ

Mistralの「OCR 4」は、文字を読むだけでなく、位置・種類・信頼度を添えて文書を構造化する文書解析モデルです。170言語に対応し、自社サーバーで完結できる提供形態と1,000ページ4ドル(バッチで2ドル)という料金で、企業の文書活用を後押しします。一方で、ベンチマークの数値はMistral自身が慎重に扱うよう促しており、競合も多いだけに、最終的な評価は各社が自前のデータで検証してこそ定まります。文書AIの土俵で、主権性と構造化を武器にどこまで存在感を高められるかが見どころです。