研究路径

可信视觉生成后训练

研究奖励有效性、不确定性与信用分配怎样决定视觉生成模型后训练的可靠性。

English

核心问题

当奖励不完整、不确定,或粒度过粗而无法指出生成过程中的哪些部分需要改变时,应该怎样更新视觉生成模型?

视觉后训练能够直接优化预训练损失没有完整表达的画面质量、语义对齐、运动和偏好目标。它是否可靠取决于三个问题:奖励是否测量了预期属性,奖励不确定性怎样影响更新,以及信用怎样分配到样本、区域、时间步和不同目标。

预训练在固定数据集上优化似然、重建或相关替代目标。视觉后训练则采样生成结果或去噪轨迹,使用奖励模型或偏好信号进行评价,再让生成器朝更高分的方向更新。它改变了优化目标,但不会自动产生一个能够从外部环境持续学习的智能体。

核心困难在于奖励模型只是有误差的测量工具。一个标量分数可能混合多个目标,在陌生提示上可能不可靠,也不能直接说明结果由哪个区域或哪个去噪步骤造成。近期工作分别研究这些失效来源:奖励粒度、不确定性感知加权、多目标动态调整、时间信用分配、高效生成,以及完整训练管线中的系统集成。

区分训练信号与目标能力

VrR-VG、ELP、MHEM 和 IcoCap 面向不同训练设置,但建立了同一条诊断原则:基准准确率可能依赖数据捷径,分类器置信度可能不同于特征可分性,困难样本损失可能促进记忆,数据增强后标签也可能与输入不一致。任何信号都需要结合其产生方式解释。

定义优化目标及其有效范围

视觉生成需要评价文本对齐、感知质量、运动一致性和人类偏好等属性,而似然或重建损失只能覆盖其中一部分。后训练为这些属性引入奖励,但每个奖励的有效范围都受到训练数据、模型假设和校准方式限制。因此,奖励设计与奖励评价始终是优化问题的一部分。

表示空间信用与奖励不确定性

ViPO 与 BPGO 处理样本级 GRPO 奖励的两个不同局限。ViPO 利用感知特征将相对优势分配到空间或时空区域;BPGO 使用语义先验,根据奖励置信度重新加权比较。ViPO 改变更新作用的位置,BPGO 改变不确定比较对更新的贡献。

动态调整多类奖励并分配时间信用

TaRoS 在奖励分量冲突、组内区分较弱或训练中出现饱和时,调整多个奖励分量的影响。OTCA 则将最终奖励分解到不同去噪时间步,并沿轨迹分配多个目标。前者处理复合奖励怎样随优化过程变化,后者处理结果级奖励怎样分配给中间决策。

将奖励训练扩展到高效模型和完整管线

RATS 根据相对奖励质量决定少步学生何时遵循多步教师,将偏好优化与轨迹蒸馏连接起来。TeleBoost 处理的是另一层问题:把监督策略塑形、奖励驱动强化学习和偏好细化组织为分阶段视频后训练管线,再由诊断与训练基础设施支持稳定训练。

这里所说的可信意味着什么

这里的可信不意味着奖励模型对所有提示都正确,也不意味着归因到某个区域或时间步的信用就是真实的因果贡献。这些方法规定的是在特定图像和视频训练设置中怎样加权或分配现有奖励。结论仍取决于奖励模型覆盖范围、提示分布、生成器架构,以及评价是否使用独立于训练奖励的证据。

开放问题

开放问题包括:怎样在分布变化下校准奖励不确定性,怎样在汇总指标上升时仍能发现奖励投机,以及怎样跨不同生成器架构比较过程级信用。面向部署,还需要研究经过验证的结果应如何更新奖励模型、生成器和评价协议,同时避免三者共同强化同一种偏差。

阅读并引用论文

本页用于连接多项合作研究,不替代单篇论文。请通过各论文规范记录核对证据、原始来源并下载引用。