汤森路透 8 月 24 日宣布推出 Thomson,公司第一个完全自有自控的大模型。做法是从一个开源底座出发,用 mid-training 和 post-training 技术接着训,训练投入 4000 万美元,含人才和算力。公司拿这个数字对比前沿实验室通常的数十亿美元开销。
语料来自 Westlaw、Practical Law、Checkpoint 和路透社几十年积累的专有内容,数百名领域专家从训练目标设计一直参与到最终评估。有一个数字写得比较克制,迄今只用了不到 10% 的自有内容存量。
第一个落地场景是 CoCounsel Legal 里的 Tabular Analysis,用于大批量结构化文档审阅,将在后续版本推给律所和企业法务。CoCounsel Legal 保持多模型策略,别家模型在哪块更强就继续用哪家,后面会向法律和税务产品线铺开。
治理承诺列了几条,不经明确同意不拿客户数据训练,并按公司自定的 Fiduciary-Grade AI 标准构建。一个小尺寸的开源权重版本已经放上 Hugging Face,供学术和非商业用途,法律与 AI 学者拿到了发布前访问权。
CTO Joel Hron 说行业多年来把规模当作答案,更大的模型、更多算力、更多钱,而这套做法改变了专业 AI 的经济账。华盛顿大学法学院的 Jonathan H. Choi 用公司税课程的难题对比了 ChatGPT、Claude 和 Thomson,三者答案都对,他总体更偏好 Thomson 的回答,理由是给了专著链接。皇后大学的 Samuel Dahan 在加拿大雇佣法问题上认为其引用质量与领先的前沿模型大体相当。
公告全文没有任何具体基准分数,只说改善了指令遵循和对密集专业材料的处理,评测细节被推给了底座模型的技术报告。