Thomson Reutersが8月24日、自社で開発した初の大規模言語モデル「Thomson」を発表しました。ゼロから巨大なモデルを作るのではなく、オープンソースの基盤モデルに4,000万ドル分の人材と計算資源を投じ、法務・税務の領域へ深く特化させたという構成です。最初の配置先は、法務向けAIアシスタント「CoCounsel Legal」の文書レビュー機能になります。
規模ではなく特化にお金を使う
フロンティアモデルを名乗る水準に到達するには、数十億ドルの計算資源と何年もかけたインフラ投資が要る、というのがここ数年の共通認識でした。Thomson Reutersが選んだのはその手前で分岐する道です。強力なオープンソースの基盤モデルを起点にし、そこへ4,000万ドル(約64億円)を人材と計算資源に投じて、必要な仕事に必要な知能だけを載せました。
結果として手に入ったのは、同社が完全に所有し制御できるモデルであり、しかも一般的なフロンティアモデルのような重い推論コストを抱えません。一部報道では、最終的な訓練ラン自体にかかった費用は45万ドル(約7,200万円)程度だったとも伝えられています。総投資額と実際の訓練コストの差が、この作り方の性格をよく表しています。
※1ドル159円換算(2026年8月26日時点)
同社CTOのJoel Hron氏は、AI業界が長らく規模を答えとして扱ってきたと述べたうえで、強い土台から始めて重要な仕事のために深く特化させれば、高い能力と大幅に高い効率を両立でき、しかも完全に自社の管理下に置けると説明しています。専門職向けAIの経済性が変わる、という言い方をしています。
何を学ばせたかが差を作る
Thomsonが他と違うのは、出発点ではなくその後の工程です。Westlaw、Practical Law、Checkpoint、そしてReutersが積み上げてきた数十年分の独自コンテンツを素材に、中間訓練と事後訓練の最新手法を重ねています。訓練目標の設計から最終評価まで、数百人の分野専門家が工程に組み込まれました。
出てきた変化は2つの方向に現れています。1つは指示追従で、複数の条件が絡む専門的な指示を正確に実行する能力が基盤モデルから明確に上がりました。もう1つは密度の高いドメイン固有の文書を読み解く力で、こちらはさらに大きな伸びを見せています。難しい専門作業ほど必要になる、細かいニュアンスを含んだ推論の部分です。
ここには1つの反論が含まれています。汎用モデルが十分に賢ければ、あとは正しいコンテンツを渡すだけで専門家水準に届くはずだ、という考え方は広く共有されています。Thomson Reutersの初期結果はそうではないと示唆しており、強い土台に独自の訓練と人間の専門知識を重ねると、コンテンツへのアクセスだけでは届かない上積みが出るとしています。
なお、訓練に使われたのは同社コンテンツの10パーセント未満にとどまります。次にやることは単純にデータを増やすことではなく、特化のさせ方そのものを掘り下げていくことだと説明されています。
小型版はオープンウェイトで公開
発表に先立ち、Thomson Reutersは法学とAIの研究者にモデルを開放して直接評価を受けています。今後も外部への提供を続け、検証と改良に充てるとしています。あわせて、Thomsonの小型版をHugging Face上でオープンウェイトモデルとして公開し、学術・非商用の用途で使えるようにしました。
評価に加わったワシントン大学ロースクールのJonathan H. Choi氏は、法人税の授業で学生から出た難しめの質問を使い、ChatGPTとClaudeを相手に比較したと述べています。3つのモデルはいずれも正しく答えたものの、全体としてはThomsonの回答を好んだとのことです。特に、条文解説書へのリンクが付くことで回答の透明性が上がり、法務作業で使いやすくなった点を挙げています。
Queen's Conflict Analytics LabとCornell Legal AI Labを率いるSamuel Dahan教授は、引用の質が主要なフロンティアモデルと概ね互角だったと評価しました。カナダ向けの設定を与えずにカナダの労働法の質問で試した場合でも、その水準を保ったとしています。CEOのSteve Hasker氏も、初期評価では幅広いタスクで最新のフロンティアモデルと同等の位置に付けていると述べています。
最初の実装先はCoCounselの表形式分析
Thomsonが最初に組み込まれるのは、CoCounsel LegalのTabular Analysisです。大量の構造化された文書をレビューする工程で、目的に合わせて作られたモデルの利点がそのまま数字に出やすい領域だと位置付けられています。次のリリースから、法律事務所と企業法務部が利用できるようになります。
CoCounsel Legal自体はマルチモデル設計を維持します。Thomsonが明確に有利な場面ではThomsonを、それ以外では他社の主力モデルを使い分ける形です。今後は法務・税務のポートフォリオ全体へThomson系のモデルを広げ、ソブリンAIの選択肢も追加していく計画が示されています。
背景にあるのは、モデルがどう訓練され、どんな挙動と偏りを内側に抱え、どこで動き、自分たちの情報がどう守られるのかという問いです。専門職ほどこの点に敏感になっており、同社は顧客データを明示的な同意なしに訓練へ使わないと明言しています。能力そのものの競争から、検証できるかどうかの競争へ移るという読みが、この発表の土台にあります。
まとめ
Thomson Reutersが自社LLM「Thomson」を公開しました。オープンソース基盤に4,000万ドルの特化投資を重ねる作り方で、指示追従と専門文書の読解に的を絞って伸ばしています。小型版はHugging Faceで学術・非商用向けに公開され、外部の研究者による検証も進行中です。手持ちのデータのまだ10パーセント未満しか使っていないという点を踏まえると、専門領域に特化したモデルが汎用フロンティアモデルとどこまで差を付けられるのか、これから数字で見えてくることになりそうです。
