美联社 9 月 21 日报道,盖茨基金会召集 Anthropic、Google、OpenAI Foundation 以及企业、慈善机构和语言项目等 60 个组织,推动更能代表少数语言使用者的数据集与 AI 工具。联盟希望协调已有工作,让更多没有被主流模型覆盖的社区能够使用 AI。
合作方提出的目标是在五年内触达超过 30 亿人。盖茨基金会首席执行官 Mark Suzman 表示,AI 的人道主义应用需要继续推进,同时也要面对网络安全、儿童发展和监管等问题。这个目标来自基金会公告,仍属于长期倡议,不代表这些人已经获得同等质量的产品服务。
语言数据项目的难点不只在于收集文本,还包括许可、隐私、方言差异、评测标准和社区治理。对于模型开发者而言,公开数据规模增长并不能自动解决低资源语言的安全、事实性和文化语境问题,最终还要看本地研究者是否能参与定义数据和评测。