返回快讯列表
大模型前沿

OneStreamer 用主动字幕记忆连接实时视频理解和响应

论文提出 4B 流式视频模型,将持续生成的事件记录与近期视觉窗口结合,在八项流式视频基准上报告领先结果。

OneStreamer 论文研究的是一个实时视频 Agent 的核心难题:系统必须在不知道未来问题的情况下记录有用证据,又要及时回应当前请求。作者提出 Proactive Hierarchical Caption Memory,让模型给已经发生的事件生成带时间信息的细节字幕与摘要,再把这些记录作为后续回答的事实记忆。

模型同时使用 Proactive State Transition Learning,减少大量“继续等待”的重复状态,并在输出锚点保留训练信号。作者还构造了 OneStreamer-1M 数据集,包含超过 100 万条流式视频交互记录。公开的 4B 模型在八个流式视频理解基准上超过文中比较的方法。

它的价值不在于把完整视频无限塞进上下文,而是把过去观察压缩成可复用的事件记录,避免每次回答都重新读取全部视觉特征。当前结果来自论文实验,数据覆盖和实时延迟仍需在实际摄像头、会议或直播场景中单独测量。

更多快讯