Thomson Reuters 于 8 月 24 日发布了自主研发的首个大语言模型 Thomson。它并非从零开始训练一个庞大的模型,而是以开源基础模型为起点,投入价值 4000 万美元的人才与算力,让它在法律和税务领域深度专业化。首个落地场景是该公司面向法律专业人士的 AI 助手 CoCounsel Legal 中的文档审阅功能。

把钱花在专业化而不是规模上

过去几年业界形成的共识是,要达到前沿模型的水准,需要数十亿美元的算力和多年的基础设施投入。Thomson Reuters 在这条路的前段就选择了分岔。公司以一个强大的开源基础模型为起点,把 4000 万美元(约 64 亿日元)投向人才和算力,只为真正重要的工作补上所需的智能。

最终得到的是一个由公司完全拥有并掌控的模型,而且不必背负典型前沿模型那样沉重的推理成本。有报道称,最终一轮训练本身的花费约为 45 万美元(约 7200 万日元)。总投入与实际训练成本之间的差距,很能说明这种做法的性格。

※1 美元 = 159 日元(截至 2026 年 8 月 26 日)

公司首席技术官 Joel Hron 表示,AI 行业长期以来把规模当作答案,而从一个坚实的基础出发、为真正重要的工作做深度专业化,可以同时获得高能力与高得多的效率,并且完全处在自己的掌控之下。他把这称为专业领域 AI 经济账的改变。

教了什么才是差别所在

Thomson 的不同之处不在起点,而在起点之后的工序。以 Westlaw、Practical Law、Checkpoint 以及 Reuters 数十年积累的专有内容为素材,叠加了当前最先进的中期训练与后期训练方法。从训练目标的设计到最终评估,数百位领域专家被纳入整个流程。

变化体现在两个方向上。其一是指令遵循,模型执行多条件专业指令的准确度明显高于基础模型。其二是解读高密度的领域专有文档,这方面的提升幅度更大,正是最困难的专业任务所需要的细腻推理能力。

这里包含了一个反驳。业界普遍认为,只要通用模型足够聪明,接下来只需给它正确的内容,就能达到专家水准。Thomson Reuters 的早期结果给出了不同的答案:在坚实的基础上叠加专有训练与人类专业知识,能带来仅靠内容访问无法获得的增量。

值得一提的是,目前用于训练的内容还不到公司自有内容的 10%。下一步的工作被描述为并非简单地增加数据,而是继续深挖专业化本身的方式。

小型版以开放权重发布

在正式发布之前,Thomson Reuters 已向法学与 AI 领域的学者开放模型,接受直接评估。公司表示今后会继续向外部提供模型,用于验证与后续改进。与此同时,Thomson 的小型版已作为开放权重模型在 Hugging Face 发布,供学术与非商业用途使用。

参与评估的华盛顿大学法学院 Jonathan H. Choi 表示,他选取了公司税课程上学生提出的一些较难问题,与 ChatGPT 和 Claude 做了对比。三个模型都给出了正确答案,但他整体上更偏好 Thomson 的回复,尤其提到回复中附带的法律专著链接提高了透明度,在法律工作中更实用。

主持 Queen's Conflict Analytics Lab 与 Cornell Legal AI Lab 的 Samuel Dahan 教授认为,Thomson 的引用质量与主流前沿模型大体相当。即便在未设置加拿大专属场景的情况下测试加拿大劳动法问题,这一水准依然保持。首席执行官 Steve Hasker 也表示,早期评估显示 Thomson 在多类任务上已与最新的前沿模型处于同一水平。

首个落地场景是 CoCounsel 的表格化分析

Thomson 首先被嵌入 CoCounsel Legal 的 Tabular Analysis。大批量结构化文档的审阅,被认为正是专用模型优势最容易直接转化为数字的领域。从下一个版本开始,律师事务所与企业法务部门即可使用。

CoCounsel Legal 本身仍维持多模型设计。在 Thomson 明显占优的场景使用 Thomson,其余场景交给其他厂商的主力模型。接下来的计划是把 Thomson 系列模型扩展到法律与税务的整个产品组合,并陆续加入主权 AI 选项。

这一切背后是一组问题:模型是如何训练的,内部带着怎样的行为与偏见,运行在哪里,以及自己的信息如何得到保护。专业人士对这些点越来越敏感,公司明确表示未经明确同意不会将客户数据用于训练。这次发布的判断基础在于,竞争正从原始能力转向结果能否被验证。

总结

Thomson Reuters 发布了自研大语言模型 Thomson。做法是在开源基础模型之上叠加 4000 万美元的专业化投入,重点提升指令遵循与专业文档的解读能力。小型版已在 Hugging Face 面向学术与非商业用途发布,外部研究者的验证也在进行中。考虑到目前使用的数据还不到自有内容的 10%,领域专业化模型究竟能与通用前沿模型拉开多大差距,应该很快就会在数字上显现出来。