Reka 在 10 月 5 日发布 Rho-1 研究预览,称它是从头训练的 19B omni-reasoning 模型。与把文本模型、视觉模型、视频生成器和动作执行器串在一起的 Agent 管线不同,Rho-1 把文本、图像、视频和机器人动作都作为同一上下文中的 token 来处理。
官方演示先让模型生成海边灯塔图片,再给灯塔加框、把画面做成无人机靠近的视频,最后要求把天气改成暴雪且保持镜头运动不变。连续操作展示了模型记住前面结果并对已有媒体做修改的思路。
这是研究预览,不能与成熟的视频编辑产品直接等量比较。页面给出的样例主要证明交互链路,而不是覆盖各种分辨率、镜头和人物的成片质量。对创作团队来说,Rho-1 的价值在于探索统一多模态 Agent;真正采用前仍需等接口、额度、延迟和商业授权信息明确。