01
研究地图
研究方向
AI 系统需要表示哪些信息,才能泛化到训练分布之外?完成预训练后,新的证据又应该怎样更新系统?
现代视觉模型的能力广度在很大程度上来自对数据、模型容量与计算规模的扩展。这一路线十分有效,但学习过程仍受部署前已收集信息的约束。模型可以泛化到单个训练样本之外,但离线训练本身并没有规定:当预测失败时,系统应当获取什么新证据。我的研究关注的正是离线数据上的泛化与持续适应之间的缺口。这个问题在我的工作中逐步展开:表示能否泛化到训练样本之外;表示能否进一步包含与任务相关的关系和时序状态;以及模型能否在预训练后利用不完美的奖励或偏好反馈继续改进。
后训练让模型开始从对自身输出的评价中学习,但这还不是交互学习:提示与评价器仍然预先确定,模型输出也不会改变外部环境。我的长期目标是闭合预测、行动与观测之间的循环。智能体应当评价候选行动,观测由行动产生的状态转移,再利用结果更新模型或策略。数字环境适合大规模研究记忆、工具调用、探索与持续适应;物理环境则引入几何、动力学、不确定性与安全约束。下面三条路径研究的是从经验中学习所需要的不同条件,而不是同一架构中的组成模块。
一条更长的脉络
从固定数据集到反馈驱动的学习
前三个主题扩展模型表示的内容:可判别特征、与任务相关的语义和持久场景状态。第四个主题改变优化设置,让模型从对生成结果的评价中学习。这一演进连接的是研究问题,而不是模型架构,也不暗示直接的技术继承关系。
02
03
04
长期方向
从后训练到通过交互学习
基于奖励模型的后训练是一座重要桥梁,但它仍受预先定义的提示、生成模型和评价器约束。交互学习改变了数据来源:智能体的行动会影响未来观测,由此产生的状态转移成为新的训练证据。我关注这一问题的两类互补场景。数字环境支持可扩展的执行、工具调用与长期交互;物理环境则检验预测和策略在几何、动力学、不确定性与安全约束下是否仍然有效。
数字环境:能够长期学习的持久智能体
AntEval 评价多智能体协作中的信息交换与意图表达,而不只关注最终任务是否成功。更早的 Tachikuma 项目促使我关注能够保留经验、使用工具、修正计划并跨任务适应的持久数字智能体。开放问题包括长期记忆、探索、课程生成、持续学习,以及分布变化下对交互过程的评价。
物理环境:从真实世界的行动后果中学习
物理智能体需要判断行动是否可行,与人物和物体协调,并在几何与动力学约束下执行。MAAL 研究动作条件可供性,InterSyn 研究多人协调,Uni-Inter 表示多类交互场景。Embodied Brains 路线图进一步把这些模型与状态估计、工具和控制器、执行及验证连接起来。更长期的问题是怎样把观测到的状态转移转化为可复用的训练经验。
长期共同问题是形成完整的行动—观测—学习闭环。智能体需要估计当前状态、选择行动、观测状态转移,再根据经过验证的结果更新模型或策略。数字智能体适合研究大规模持续适应,物理智能体则检验这些原则在真实动力学和安全约束下是否仍然成立。解决这一闭环对应着更通用 AI 的一项具体要求:不只依赖固定训练语料,而是能够通过交互获得并修正知识。
当前研究路径
三条研究方向
每条路径分别定义一组具体的建模、学习与评价问题。
01
视频生成与世界模型
能够生成合理视频片段的模型,与能够维护状态并稳定预测未来观测的世界模型之间,还缺少哪些能力?
研究视频生成走向世界模型所需的条件:空间控制、长时时间一致性、持久状态与以行动为条件的预测。
IcoCap · VAST 1.0 · FreeLong · TeleWorld · TeleBoost · TaRoS · …
查看这条路径02
可信视觉生成后训练
当奖励不完整、不确定,或粒度过粗而无法指出生成过程中的哪些部分需要改变时,应该怎样更新视觉生成模型?
研究奖励有效性、不确定性与信用分配怎样决定视觉生成模型后训练的可靠性。
VrR-VG · ELP · MHEM · IcoCap · ViPO · BPGO · …
查看这条路径03
语义动作与具身交互
需要怎样的表示与评价标准,才能让生成动作表达预期语义、满足物理可行性,并与其他实体协调?
研究动作生成怎样在人–人、人–物和人–场景交互中满足语义、关系与物理约束。
SEEG · MAAL · InterSyn · Uni-Inter · LaxMotion · AntEval · …
查看这条路径共同方法论
不把代理指标当成真实能力
在这些任务中,训练和评价信号都只是目标能力的代理。准确率可能来自数据集捷径,分类器置信度可能来自记忆,标量奖励也可能掩盖生成质量在什么位置或阶段发生变化。共同问题是:信号测量了什么,何时不再可靠,以及它应该以多大强度影响参数更新。
视觉证据,而不是数据捷径
VrR-VG 检查关系模型究竟使用了图像证据,还是仅凭物体类别和几何位置进行猜测。通过刻意移除像素信息,它把数据捷径诊断纳入数据集构建,而不是把基准准确率直接等同于视觉推理能力。
泛化能力,而不只是置信度或难度
ELP 比较主分类器与在分离特征上训练、周期性重置的线性探针,从而区分分类器积累的置信度与当前特征可分性。MHEM 则限制极难训练样本的影响,避免模型主要记忆这些样本而没有形成可泛化的判别能力。
输入改变后,监督也必须改变
IcoCap 将图像—视频复合与视觉语义引导的描述学习结合起来。视觉内容改变后,原始描述可能不再准确对应输入,因此数据增强和目标构造需要被共同设计。
交互过程,而不只是最终结果
AntEval 将任务完成与信息交换、意图表达分开评价。多智能体系统可能完成任务,却只交换了很少与任务相关的信息,因此除最终结果之外,还需要评价交互过程。
可用的反馈,而不只是一个最终分数
近期视觉后训练工作研究样本级标量奖励的不同局限。ViPO 将更新信号分配到空间或时空区域,BPGO 根据奖励置信度调整比较权重,TaRoS 在训练中动态调整多个奖励分量,OTCA 则在去噪步骤与目标之间分配信用。TeleBoost 将多类信号整合进带有诊断机制的分阶段管线。
早期与相邻工作
早期的真实场景去雨与细粒度食物识别工作分别涉及数据覆盖、局部视觉证据、联合监督和鲁棒性。这些经验影响了我处理视觉学习问题的方式,但它们不是当前三条路径的直接技术前身。
Removing Raindrops and Rain Streaks in One Go
该工作通过互补的恢复顺序和真实混合雨数据集处理复合退化,体现了在网络结构与数据覆盖方面的经验;这里不把它描述为生成模型对齐的直接前身。
Food and Ingredient Joint Learning for Fine-Grained Recognition
该项目通过区域注意力、食物—食材联合预测和不平衡感知损失学习局部语义证据。其监督设计经验仍有参考价值,但应用与评估范围明确属于细粒度食物识别。
Research Notes 为部分论文提供更长的英文解读。只有在逐篇完成作者审阅后,路径页才会公开显示对应入口;在此之前,规范的论文记录仍是查阅摘要、书目信息、证据概述和引用下载的公开来源。