内容提要
汤森路透开发自有AI模型Thomson,基于开源基础,投入约4000万美元,利用其法律、税务等专有数据训练,而非从零构建。该模型旨在提升专业准确性,减少幻觉,并已用于CoCounsel Legal的表格分析功能。公司强调结合检索验证,确保答案可追溯,但承认无法保证完全无误。此策略展示了企业选择性拥有AI堆栈层的可能性。
延伸解读
混合策略:自研与租用并行
汤森路透并未完全放弃前沿模型,而是在产品中同时使用自研Thomson和Anthropic的Claude。这种混合策略表明,企业可以根据任务需求选择最合适的模型:对于需要专业数据训练的特定功能(如表格分析),使用自研模型;对于其他任务,则继续依赖外部模型。这反映了AI应用中的一种务实趋势,即不追求全面自研,而是有选择地拥有AI堆栈的某些层。
专业数据与领域微调的价值
Thomson模型的开发基于开源基础,投入约4000万美元进行训练,重点是利用汤森路透数十年积累的专有内容(如Westlaw、Practical Law)进行进一步训练,而非从零预训练。这种方法使得模型在专业领域(如法律、税务)的准确性上更具优势,同时减少了幻觉现象。对于拥有大量专有数据的企业而言,这是一种成本效益较高的选择,无需花费数十亿美元自建基础模型。
不确定性处理与可追溯性
Thomson模型被特别训练为在不确定时主动标记,而不是强行给出自信的答案,以减少幻觉和谄媚行为。此外,模型结合检索机制,将回答锚定在可查证的专业来源上,但公司承认并非所有输出都能逐行追溯。这种设计强调了在专业工作中,AI的可靠性和可验证性比迎合用户更重要,但最终仍需专业人士进行核实。
Q&A
汤森路透为什么开发自己的AI模型Thomson?
汤森路透开发自有AI模型Thomson,是为了在法律、税务和合规等专业领域获得更高的准确性和可控性,减少幻觉,并利用其专有数据(如Westlaw、Practical Law等)进行训练,以提升专业工作的质量。
Thomson模型是如何训练的?
Thomson模型并非从零开始构建,而是基于现有的开源基础模型,投入约4000万美元,使用汤森路透数十年积累的专有内容(如Westlaw、Practical Law、Checkpoint和Reuters)进行进一步训练,并邀请了数百名领域专家参与评估和反馈。
Thomson模型与Anthropic的模型在汤森路透产品中如何分工?
汤森路透的CoCounsel Legal产品基于Anthropic的Claude Agent SDK构建,而Thomson模型则用于特定功能,如CoCounsel Legal中的表格分析(Tabular Analysis),该功能可以处理多达10,000个文档并回答100个问题。Thomson模型在这些特定任务中作为默认模型,而Anthropic的模型则用于更广泛的代理功能。
Thomson模型如何减少幻觉并提高准确性?
Thomson模型经过专门训练,能够识别不确定性并主动标记,而不是强行给出听起来自信的答案。此外,它结合了检索机制,可以从Westlaw和Practical Law等权威来源获取信息,确保回答有据可查,从而减少幻觉和错误。
Thomson模型在基准测试中的表现如何?
根据汤森路透发布的对比,Thomson模型在七个报告类别中的三个类别中表现优于Gemini 3.1 Pro、Claude Opus 4.8和GPT-5.5,包括PRBench Legal Hard、指令遵循综合和长上下文。但在其他类别中,如Stanford LegalBench和推理综合,Gemini 3.1 Pro得分更高;Claude Opus 4.8在Harvey Legal Agent Benchmark和编码方面领先。
汤森路透如何确保Thomson模型的输出可追溯?
汤森路透表示,Thomson的许多输出可以连接到特定的Westlaw或Practical Law来源,但并非每个输出都能逐行追溯到确切的法规或裁决。公司强调,Thomson的设计使其推理在可能的情况下可检查,最终验证由使用它的专业人士完成。
汤森路透对AI模型的所有权策略是什么?
汤森路透的策略是选择性拥有AI堆栈的某些层。他们利用自己的专有数据和领域专业知识,在内部构建模型(如Thomson),同时在其他地方使用第三方模型(如Anthropic的Claude)。这种策略允许他们在拥有数据优势的领域进行投资,而在其他领域则利用现成的模型。