返回快讯列表
行业动态

汤森路透自研模型 Thomson 发布,称训练只花了 4000 万美元

汤森路透 8 月 24 日在多伦多宣布推出首个自研大模型 Thomson,从开源底座出发训练,投入 4000 万美元,目前只用了不到 10% 的自有内容存量。

汤森路透 8 月 24 日宣布推出 Thomson,公司第一个完全自有自控的大模型。做法是从一个开源底座出发,用 mid-training 和 post-training 技术接着训,训练投入 4000 万美元,含人才和算力。公司拿这个数字对比前沿实验室通常的数十亿美元开销。

语料来自 Westlaw、Practical Law、Checkpoint 和路透社几十年积累的专有内容,数百名领域专家从训练目标设计一直参与到最终评估。有一个数字写得比较克制,迄今只用了不到 10% 的自有内容存量。

第一个落地场景是 CoCounsel Legal 里的 Tabular Analysis,用于大批量结构化文档审阅,将在后续版本推给律所和企业法务。CoCounsel Legal 保持多模型策略,别家模型在哪块更强就继续用哪家,后面会向法律和税务产品线铺开。

治理承诺列了几条,不经明确同意不拿客户数据训练,并按公司自定的 Fiduciary-Grade AI 标准构建。一个小尺寸的开源权重版本已经放上 Hugging Face,供学术和非商业用途,法律与 AI 学者拿到了发布前访问权。

CTO Joel Hron 说行业多年来把规模当作答案,更大的模型、更多算力、更多钱,而这套做法改变了专业 AI 的经济账。华盛顿大学法学院的 Jonathan H. Choi 用公司税课程的难题对比了 ChatGPTClaude 和 Thomson,三者答案都对,他总体更偏好 Thomson 的回答,理由是给了专著链接。皇后大学的 Samuel Dahan 在加拿大雇佣法问题上认为其引用质量与领先的前沿模型大体相当。

公告全文没有任何具体基准分数,只说改善了指令遵循和对密集专业材料的处理,评测细节被推给了底座模型的技术报告。

更多快讯