HuggingFaceBio 10 月 8 日开放 Carbon-A 模型及 Carbon Annotation Database,用 AI 帮助定位基因组中的蛋白质编码区域。Carbon-A 有 12 亿参数,支持 98,304 碱基对上下文,在 DNA 两条链上输出核苷酸级预测。
本次数据库收录 48,167 个基因组组装结果,覆盖 22,617 个分类单元和约 27 万亿碱基对,包含 5.66 亿个预测编码位点。每项预测关联基因组坐标、重建编码序列、翻译后的蛋白序列与置信度,研究人员可据此筛选候选区域,也可直接运行公开模型处理自己的物种。
团队与 ActiveSite、加州大学圣迭戈分校合作,用猫、仓鼠、鸡和拟南芥的 RNA 实验资料检查部分预测。结果支持了一些参考数据库尚未记录的转录结构,但这还不能证明所有候选区域都会产生蛋白质,更不能直接确定蛋白功能。后续仍需要翻译证据、蛋白质检测和针对性的功能实验。