Thomson Reuters 於 8 月 24 日發表自行開發的首個大型語言模型 Thomson。它並非從零打造一個龐大的模型,而是以開源基礎模型為起點,投入價值 4,000 萬美元的人才與運算資源,讓它在法律與稅務領域深度專業化。首個導入場景,是該公司針對法律專業人士推出的 AI 助理 CoCounsel Legal 中的文件審閱功能。

把預算花在專業化而非規模

過去幾年業界形成的共識是,要達到前沿模型的水準,需要數十億美元的運算資源與多年的基礎建設投入。Thomson Reuters 在這條路的前段就選擇了岔路。公司以強大的開源基礎模型為起點,把 4,000 萬美元(約 64 億日圓)投入人才與運算資源,只為真正重要的工作補上所需的智慧。

最後得到的是一個由公司完全擁有並掌控的模型,而且不必背負典型前沿模型那種沉重的推論成本。有報導指出,最終一輪訓練本身的花費約為 45 萬美元(約 7,200 萬日圓)。總投入與實際訓練成本之間的落差,相當能說明這種做法的性格。

※1 美元 = 159 日圓(截至 2026 年 8 月 26 日)

公司技術長 Joel Hron 表示,AI 產業長期以來把規模當成答案,而從穩固的基礎出發、針對真正重要的工作做深度專業化,可以同時取得高能力與高出許多的效率,並且完全掌握在自己手中。他把這稱為專業領域 AI 經濟結構的改變。

教了什麼才是差異所在

Thomson 的不同之處不在起點,而在起點之後的工序。以 Westlaw、Practical Law、Checkpoint 以及 Reuters 數十年累積的專有內容為素材,疊加目前最先進的中期訓練與後期訓練手法。從訓練目標的設計到最終評估,數百位領域專家被納入整個流程。

變化出現在兩個方向。其一是指令遵循,模型執行多重條件專業指令的準確度明顯超越基礎模型。其二是解讀高密度的領域專有文件,這方面的提升幅度更大,正是最困難的專業工作所需要的細膩推理能力。

這裡包含了一個反駁。業界普遍認為,只要通用模型夠聰明,接下來只需給它正確的內容,就能達到專家水準。Thomson Reuters 的早期結果給出了不同的答案:在穩固的基礎上疊加專有訓練與人類專業知識,能帶來單靠內容存取無法取得的增益。

值得一提的是,目前用於訓練的內容還不到公司自有內容的 10%。下一步的工作被描述為並非單純增加資料,而是繼續深挖專業化本身的方式。

小型版以開放權重釋出

在正式發表之前,Thomson Reuters 已向法學與 AI 領域的學者開放模型,接受直接評估。公司表示今後會持續向外部提供模型,用於驗證與後續改良。同時,Thomson 的小型版已作為開放權重模型在 Hugging Face 釋出,供學術與非商業用途使用。

參與評估的華盛頓大學法學院 Jonathan H. Choi 表示,他挑選了公司稅課程上學生提出的一些較難問題,與 ChatGPT 和 Claude 進行比較。三個模型都給出了正確答案,但他整體上更偏好 Thomson 的回覆,並特別提到回覆中附帶的法律專著連結提高了透明度,在法律工作中更為實用。

主持 Queen's Conflict Analytics Lab 與 Cornell Legal AI Lab 的 Samuel Dahan 教授認為,Thomson 的引用品質與主流前沿模型大致相當。即便在未設定加拿大專屬情境的狀況下測試加拿大勞動法問題,這個水準依然維持。執行長 Steve Hasker 也表示,早期評估顯示 Thomson 在多類任務上已與最新的前沿模型處於同一水平。

首個導入場景是 CoCounsel 的表格化分析

Thomson 首先被嵌入 CoCounsel Legal 的 Tabular Analysis。大批量結構化文件的審閱,被認為正是專用模型優勢最容易直接轉化為數字的領域。從下一個版本開始,律師事務所與企業法務部門即可使用。

CoCounsel Legal 本身仍維持多模型設計。在 Thomson 明顯占優的場景使用 Thomson,其餘場景則交給其他廠商的主力模型。接下來的計畫,是把 Thomson 系列模型擴展到法律與稅務的整個產品組合,並陸續加入主權 AI 選項。

這一切背後是一組問題:模型是如何訓練的,內部帶著什麼樣的行為與偏誤,在哪裡運行,以及自己的資訊如何受到保護。專業人士對這些點越來越敏感,公司明確表示未經明確同意不會將客戶資料用於訓練。這次發表的判斷基礎在於,競爭正從原始能力轉向結果能否被驗證。

總結

Thomson Reuters 發表了自研大型語言模型 Thomson。做法是在開源基礎模型之上疊加 4,000 萬美元的專業化投入,重點提升指令遵循與專業文件的解讀能力。小型版已在 Hugging Face 面向學術與非商業用途釋出,外部研究者的驗證也在進行中。考量到目前使用的資料還不到自有內容的 10%,領域專業化模型究竟能與通用前沿模型拉開多大差距,應該很快就會在數字上顯現出來。