SEEG: Semantic Energized Co-speech Gesture Generation
SEEG 在伴随语音手势中区分节奏与语义线索,说明动作同步并不自动等同于具有交流意义。
研究路径
研究动作生成怎样在人–人、人–物和人–场景交互中满足语义、关系与物理约束。
核心问题
这条路径研究交互动作的三项要求:语音与手势之间的语义对齐,身体与物体之间以行动为条件的可供性,以及人物、物体和场景之间的协调。随后进一步讨论怎样评价生成交互,并将其连接到可执行的具身系统。
伴随语音的手势可以符合节奏,却没有表达语音中的语义;模型可以识别物体部件,但提出的接触位置和动作并不可行;两段动作分别看都合理,放在一起却缺乏协调。这些失效来源不同,但都说明动作质量取决于交互上下文,而不只取决于运动学。
这些论文因此研究动作所受的不同条件约束。SEEG 使用语音语义,MAAL 以物体状态、接触和机器人动作作为可供性条件,InterSyn 与 Uni-Inter 建模多实体协调,LaxMotion 研究有利于三维动作泛化的监督方式。AntEval 与 Embodied Brains 路线图再把讨论从生成扩展到过程评价、执行与验证。
SEEG 在伴随语音手势生成中分离节奏信息与语义信息。Decoupled Mining 模块分别学习两类信息,Semantic Energizing Module 则加入语义表达监督。因此,该方法将语义内容作为独立评价目标,而不假设手势与语音节奏同步就已经足够。
SEEG 在伴随语音手势中区分节奏与语义线索,说明动作同步并不自动等同于具有交流意义。
MAAL 将关节物体可供性建模为物体几何、关节状态、接触位置与候选机器人动作之间的关系。模型不会为可见部件分配固定行动标签,而是在当前物体与行动条件下估计兼容交互的多模态分布。
MAAL 将关节物体可供性建模为几何、物体状态、接触位置和候选机器人动作之间的兼容关系,而不只是外观。
InterSyn 联合学习单人和多人动作,并进一步优化参与者之间的相对协调。Uni-Inter 将人物、物体和场景编码进 Unified Interactive Volume,在共享空间表示中预测动作。两种方法覆盖范围不同,但都通过实体之间的关系建模交互,而不是分别生成互不相关的动作序列。
InterSyn 联合学习单人和多人动态,并进一步优化相对协调,使个体动作与相互时序不再被视为彼此割裂的问题。
Uni-Inter 把人物、物体和场景映射到共享语义占据体,使一个合成框架能够在三类交互环境之间复用空间知识。
LaxMotion 移除直接 3D 姿态回归,改为从全局轨迹、单目 2D 运动学线索和结构正则中学习。论文检验精确坐标目标是否会鼓励模型拟合固定训练模式,以及放宽监督能否改善分布变化下的动作生成。
LaxMotion 移除直接 3D 姿态回归,转而使用轨迹、单目线索和结构正则,重新审视精确标签是否总能带来更好泛化。
AntEval 在语言多智能体交互中分别评价任务完成、信息交换和意图表达。Embodied Brains 路线图讨论物理世界中的对应系统问题:模型输出需要转化为工具或控制器请求,执行结果需要根据状态变化进行验证,经过验证的轨迹也需要通过明确接口才能重新用于学习。
AntEval 将任务完成与信息交换、意图表达分开评价,说明成功结果本身不能证明智能体进行了有效沟通。
Embodied Brains 路线图将预测模型连接到物理执行层、共享契约、验证和经验复用,为落地交互定义系统方向。
这些论文共同关注依赖上下文的有效性:动作是否表达预期语义,是否兼容物体状态与候选行动,是否在多个实体之间协调,以及执行后是否成功。它们没有共同输出空间或评价协议。SEEG 生成伴随语音手势,MAAL 估计可供性,Uni-Inter 生成三维交互动作,AntEval 评价语言智能体。这样的组织定义的是研究议题,不是同一类模型。
仍有两个主要缺口。表示模型需要把语义意图和空间上下文连接到可执行行动,同时表达接触与动力学的不确定性;评价则需要超越离线动作质量,检验交互能否执行,失败究竟来自感知、预测、规划还是控制,以及经过验证的结果能否跨不同身体、任务和环境迁移。
本页用于连接多项合作研究,不替代单篇论文。请通过各论文规范记录核对证据、原始来源并下载引用。