返回快讯列表
大模型前沿

李飞飞的 World Labs 放出 Atlas,一张图生成一分钟 1440p 并还原成 3D

World Labs 9 月 1 日发布 Atlas,原生处理文本、图像、视频和 3D 的世界模型,相机路径当几何输入喂进去,最长生成一分钟 1440p,可输出点云与高斯泼溅。

World Labs 在 9 月 1 日发布 Atlas,他们叫它面向空间智能的全模态世界模型,从零开始预训练,原生处理文本、图像、视频和 3D。

架构是多模态自回归扩散 transformer,具体说是 rectified flow。输入全部锚定到三维位置上,构成他们称为空间上下文的东西。这个混血身份带来一个实际好处,自回归那一半用得上大模型服务的 KV 缓存和分离式部署,扩散那一半用得上蒸馏和无分类器引导。

能力上,相机路径当作几何输入喂进去,提示词里不写,最长生成一分钟 1440p 视频。演示视频用一到六张输入图加手工设计的相机轨迹做出来。三维那边可以写成点云或高斯泼溅,后者正是 Marble 在用的表示。官方说两三张图就够得到可信的重建,空间上下文能装一百多张。

对比数据分两块。相机可控生成那块给的是第三方人类评分员的偏好率,Atlas 对 MiniMax H3 是 75%,对 Gemini Omni Flash 81%,对 Happy Horse 1.1 是 86%,对 FLUX 3 是 93%,对 Seedance 2.5 是 94%。这里有个口径要看清楚,基线模型没有原生相机输入,拿到的是文字描述的相机路径,Atlas 用的是自己的原生格式。三维重建那块给了七个数据集的点图误差,Atlas 平均 25.3,排在后面的 Pi3X 是 28.7。

现在只有早期访问,填表申请,合作伙伴限定,没有公开定价、API 和时间表。World Labs 说 Atlas 会驱动后续版本的 Marble。

更多快讯