VrR-VG: Refocusing Visually-Relevant Relationships
VrR-VG 用不读取图像的关系预测器暴露数据捷径,强调性能必须结合模型实际使用的信息进行判断。
研究路径
研究奖励有效性、不确定性与信用分配怎样决定视觉生成模型后训练的可靠性。
核心问题
视觉后训练能够直接优化预训练损失没有完整表达的画面质量、语义对齐、运动和偏好目标。它是否可靠取决于三个问题:奖励是否测量了预期属性,奖励不确定性怎样影响更新,以及信用怎样分配到样本、区域、时间步和不同目标。
预训练在固定数据集上优化似然、重建或相关替代目标。视觉后训练则采样生成结果或去噪轨迹,使用奖励模型或偏好信号进行评价,再让生成器朝更高分的方向更新。它改变了优化目标,但不会自动产生一个能够从外部环境持续学习的智能体。
核心困难在于奖励模型只是有误差的测量工具。一个标量分数可能混合多个目标,在陌生提示上可能不可靠,也不能直接说明结果由哪个区域或哪个去噪步骤造成。近期工作分别研究这些失效来源:奖励粒度、不确定性感知加权、多目标动态调整、时间信用分配、高效生成,以及完整训练管线中的系统集成。
VrR-VG、ELP、MHEM 和 IcoCap 面向不同训练设置,但建立了同一条诊断原则:基准准确率可能依赖数据捷径,分类器置信度可能不同于特征可分性,困难样本损失可能促进记忆,数据增强后标签也可能与输入不一致。任何信号都需要结合其产生方式解释。
VrR-VG 用不读取图像的关系预测器暴露数据捷径,强调性能必须结合模型实际使用的信息进行判断。
ELP 反复重置读取分离特征的分类器,把表示质量与持续分类头在训练中积累的置信度区分开。
MHEM 对困难样本的强调强度设置边界,在保留有效学习压力的同时防止极端样本长期支配梯度。
IcoCap 表明视觉输入改变后文本监督也需要同步调整,是把目标构造视为学习系统组成部分的早期例子。
视觉生成需要评价文本对齐、感知质量、运动一致性和人类偏好等属性,而似然或重建损失只能覆盖其中一部分。后训练为这些属性引入奖励,但每个奖励的有效范围都受到训练数据、模型假设和校准方式限制。因此,奖励设计与奖励评价始终是优化问题的一部分。
ViPO 与 BPGO 处理样本级 GRPO 奖励的两个不同局限。ViPO 利用感知特征将相对优势分配到空间或时空区域;BPGO 使用语义先验,根据奖励置信度重新加权比较。ViPO 改变更新作用的位置,BPGO 改变不确定比较对更新的贡献。
ViPO 使用感知特征把样本级 GRPO 优势转化为空间或时空优势,改变优化更新作用的位置。
BPGO 使用语义先验调整组间与组内奖励比较的权重,降低不确定比较对参数更新的影响。
TaRoS 在奖励分量冲突、组内区分较弱或训练中出现饱和时,调整多个奖励分量的影响。OTCA 则将最终奖励分解到不同去噪时间步,并沿轨迹分配多个目标。前者处理复合奖励怎样随优化过程变化,后者处理结果级奖励怎样分配给中间决策。
TaRoS 在比较变得稀疏、目标发生冲突或奖励分量随训练饱和时,动态改变各分量的影响。
OTCA 沿去噪时间分解最终奖励责任,并把多个目标分配到它们最有信息量的生成阶段。
RATS 根据相对奖励质量决定少步学生何时遵循多步教师,将偏好优化与轨迹蒸馏连接起来。TeleBoost 处理的是另一层问题:把监督策略塑形、奖励驱动强化学习和偏好细化组织为分阶段视频后训练管线,再由诊断与训练基础设施支持稳定训练。
RATS 根据教师与学生的相对奖励质量调整轨迹指导,把偏好对齐与高效少步生成连接起来。
TeleBoost 将监督塑形、奖励驱动强化学习、偏好细化、诊断和系统约束放入统一的分阶段后训练管线。
这里的可信不意味着奖励模型对所有提示都正确,也不意味着归因到某个区域或时间步的信用就是真实的因果贡献。这些方法规定的是在特定图像和视频训练设置中怎样加权或分配现有奖励。结论仍取决于奖励模型覆盖范围、提示分布、生成器架构,以及评价是否使用独立于训练奖励的证据。
开放问题包括:怎样在分布变化下校准奖励不确定性,怎样在汇总指标上升时仍能发现奖励投机,以及怎样跨不同生成器架构比较过程级信用。面向部署,还需要研究经过验证的结果应如何更新奖励模型、生成器和评价协议,同时避免三者共同强化同一种偏差。
本页用于连接多项合作研究,不替代单篇论文。请通过各论文规范记录核对证据、原始来源并下载引用。