研究路径

视频生成与世界模型

研究视频生成走向世界模型所需的条件:空间控制、长时时间一致性、持久状态与以行动为条件的预测。

English

核心问题

能够生成合理视频片段的模型,与能够维护状态并稳定预测未来观测的世界模型之间,还缺少哪些能力?

视频生成为时序建模提供了具体试验,但视觉真实感本身不能证明模型已经形成世界模型。用于预测或规划的模型还需要跨时间维护状态,表示行动怎样影响状态转移,并在未来观测不确定时表达不确定性。

与图像生成相比,视频生成必须建模跨时间依赖。人物与物体的身份、空间布局、运动和事件顺序都需要在连续帧中保持一致。序列变长后,短视频中不明显的外观漂移、几何不一致和缺乏前序状态支持的运动会持续积累。

大规模训练能够提高数据覆盖,但数据规模本身不能定义世界模型。世界建模还需要持久的状态表示、以可能行动为条件的预测,以及用真实观测到的状态转移进行评价。这条路径中的论文分别研究一致监督、可控生成、长时上下文、持久重建和后训练,它们是相关前提,但没有任何单篇论文被描述为已经解决完整问题。

让视觉增强与语言监督保持一致

IcoCap 通过把图像语义复合进视频内容来改变视频描述样本的内容密度,再使用 Visual-Semantic Guided Captioning 调整复合输入对应的描述学习。这里的监督原则很具体:当数据增强改变了输入的语义内容,目标也必须随之调整。

控制空间构图并扩展时间上下文

VAST 与 FreeLong 处理文本到视频生成的两个不同限制。VAST 在合成前加入包含人体姿态和物体布局的故事板,提供显式空间条件;FreeLong 保留预训练短视频扩散模型,在去噪过程中改变时序特征融合,以平衡长序列中的低频全局一致性与高频局部细节。

在生成与重建之间维护状态

TeleWorld 将视频生成、动态 4D 重建和持久记忆连接起来。生成观测更新重建状态,该状态再作为后续合成的条件。与孤立视频生成不同,某一步的误差会改变后续步骤使用的状态,因此状态一致性成为显式的系统问题。

使用多类反馈优化生成过程

视频后训练通常同时使用画面质量、文本对齐、运动和时间一致性等反馈。TeleBoost 区分监督、强化学习和偏好细化阶段;TaRoS 在训练中调整不同奖励分量的影响;OTCA 在去噪步骤和目标之间分配结果信用;RATS 则根据相对奖励质量调整教师指导。这些方法在既定奖励下改进视觉生成器,但本身并不提供以行动为条件的世界建模。

把预测模型连接到具身系统

Embodied Brains 路线图讨论预测之外的系统要求:预测模型需要连接工具与控制器,在物理环境中执行,验证实际状态转移,并将经过验证的交互数据重新用于训练。这是面向未来的系统联系,不是视频生成论文已经验证的实验结果。

这条路径主张什么,又不主张什么

可控或时间一致的视频生成不足以证明模型适合用于规划。这样的世界模型还需要预测以行动为条件的状态转移、表达不确定性,并在状态和环境变化时保持准确。TeleWorld 加入了持久重建,但持久表示仍不等同于具身智能体。这条路径只说明论文之间的技术联系,不为它们虚构共同架构或评测协议。

开放问题

开放问题包括:怎样在同一预测模型中表示状态与行动,怎样校准长轨迹预测的不确定性,以及怎样区分模型生成的观测与外部世界的测量结果。闭环系统还需要验证执行后的状态转移是否符合预测,再决定能否将该轨迹重新用于训练。

阅读并引用论文

本页用于连接多项合作研究,不替代单篇论文。请通过各论文规范记录核对证据、原始来源并下载引用。