OneStreamer 论文研究的是一个实时视频 Agent 的核心难题:系统必须在不知道未来问题的情况下记录有用证据,又要及时回应当前请求。作者提出 Proactive Hierarchical Caption Memory,让模型给已经发生的事件生成带时间信息的细节字幕与摘要,再把这些记录作为后续回答的事实记忆。
模型同时使用 Proactive State Transition Learning,减少大量“继续等待”的重复状态,并在输出锚点保留训练信号。作者还构造了 OneStreamer-1M 数据集,包含超过 100 万条流式视频交互记录。公开的 4B 模型在八个流式视频理解基准上超过文中比较的方法。
它的价值不在于把完整视频无限塞进上下文,而是把过去观察压缩成可复用的事件记录,避免每次回答都重新读取全部视觉特征。当前结果来自论文实验,数据覆盖和实时延迟仍需在实际摄像头、会议或直播场景中单独测量。