From World Action Models to Embodied Brains: A Roadmap for Open-World Physical Intelligence
这篇路线图把 World Action Models 放入更完整的物理智能系统:embodied brain 比较候选干预,physical harness 通过工具和控制器将请求落地,共享 contracts 连接异构组件,经过验证的交互再转化为后训练经验。
按年份浏览论文。每篇论文页面包含摘要、简要解读、Related Work 定位、参考来源和引用下载。
这篇路线图把 World Action Models 放入更完整的物理智能系统:embodied brain 比较候选干预,physical harness 通过工具和控制器将请求落地,共享 contracts 连接异构组件,经过验证的交互再转化为后训练经验。
TeleBoost 把视频后训练视为分阶段、受稳定性约束的系统:串联 supervised policy shaping、reward-driven RL 与 preference refinement,并针对高昂 rollout、时间累积错误和不确定反馈进行诊断。
这篇综述系统整理图像、视频与 3D/4D 生成中的 reinforcement learning,并把 RL 视为连接不可微目标、偏好反馈、时间结构和高层目标的通用优化接口,而不仅是某种 fine-tuning 算法。
ViPO 把每个生成样本的单一标量 reward 转换为空间和时间结构化的像素级 advantage map,利用预训练视觉特征把 GRPO 更新集中到感知上重要的区域,同时保留标准训练流程。
RATS 把轨迹蒸馏与偏好反馈结合起来:horizon matching 在关键去噪阶段对齐 teacher 与 student,reward-aware gate 只在 teacher 的奖励表现更好时加强指导。
TaRoS v4 针对 video GRPO 中的 reward hacking 与饱和:用 component-level performance assessment 和 intra-group sparsity 组织多维反馈,并自适应降低已经饱和的 reward component 权重。
OTCA 不再把一个标量 reward 平均传给所有去噪步,而是同时回答两个问题:轨迹中的哪些 step 更重要,以及每个阶段应该强调哪些 reward objective。
BPGO 不把所有视觉 reward score 视为同样可信,而是用 semantic prior 同时锚定组间 trust allocation 与组内 renormalization,使 GRPO 强调置信反馈并抑制歧义信号。
LaxMotion 不使用直接 3D pose 监督,而是把 3D motion 学习为对全局轨迹与单目 2D 运动学线索的一致解释,再以视角一致、朝向连贯和结构稳定的正则进行约束。
TeleWorld 在视频生成和 4D 重建之间形成闭环:生成流持续写入时空表示,这个持久状态再指导后续生成;Macro-from-Micro Planning 与蒸馏用于支持长时和低延迟合成。
Uni-Inter 用 Unified Interactive Volume 统一表示人—人、人—物和人—场景交互,并逐关节进行概率式动作预测,让一个 task-agnostic 模型能够推理异构和复合交互上下文。
InterSyn 不把单人动作与多人交互视为彼此独立的任务:INS 从第一人称交互视角联合合成两类行为,REC 再细化角色之间的相对协调与同步。
VAST 是两阶段的 Video-As-Storyboard-from-Text 框架:StoryForge 将文本变成人体姿态与物体布局明确的 storyboard,VisionForge 再把这一结构规划生成视频。
MHEM 的全称是 Moderate Hard Example Modulation:它为调制损失定义条件,强调有信息量的困难样本,同时避免极端样本的影响不断增大并被细粒度分类器直接记忆。
AntEval 通过多 Agent 交互框架和两个定量指标评估 LLM agent 的社交互动能力:Information Exchanging Precision(IEP)与 Interaction Expressiveness Gap(IEG)。
IcoCap 改变视频 captioner 看到的内容密度:Image-Video Compounding Strategy(ICS)把简洁图像语义复合进视频样本,Visual-Semantic Guided Captioning(VGC)再让 caption supervision 适应复合内容中的歧义。
FreeLong 无需额外训练,在去噪过程中融合全局视频特征的低频部分与局部子序列特征的高频部分,使预训练短视频 diffusion model 同时兼顾长时全局一致性和局部时空细节。
MAAL 用单阶段 autoencoder pipeline 学习 3D articulated object affordance,其中 MultiModal Energized Encoder 联合建模物体几何、机器人动作及其交互,并只需要少量 positive sample。
SEEG 先用 DEcoupled Mining module 分离节奏相关与语义相关信息,再通过 Semantic Energizing Module 和 semantic prompter,使生成的 co-speech gesture 不只对齐语音节奏,也表达相应语义。
ELP 把 linear probing 放进训练过程:周期性重置的分类器在 detached feature 上学习并衡量当前可分性,ELP-SR 再利用 probe 与主分类器之间的差异自适应调整样本正则。
论文以 Attention Fusion Network 强调判别区域,并通过 Food-Ingredient Joint Learning module 与 balance focal loss 联合学习菜品类别和食材,以缓解 ingredient imbalance。
该方法包含 raindrop→streak 和 streak→raindrop 两条互补级联分支,以 attention 融合输出,用 neural architecture search 搜索去雨模块,并提出真实世界 RainDS 数据集。
VrR-VG 剪除仅凭非视觉统计就能预测的关系,从 Visual Genome 构建更强调视觉证据的 scene-graph 数据集,并联合编码实例、属性与关系来学习表示。