GENERATIVE POLICY LEARNING

生成式策略

围绕机器人策略学习中的轨迹建模与生成,探索新的 Behavior Cloning 方法与 Offline RL 数据增强。

FLOW MATCHINGOFFLINE RLTRAJECTORY
TRAJECTORY → POLICY

用更有效的轨迹,
学习更好的策略。

工作包含策略建模方法与轨迹级数据增强两个方向。

METHOD A

Drifting-based BC

在 Flow Matching Behavior Cloning 基础上提出新方法,改善轨迹建模与生成。

METHOD B

轨迹级数据增强

面向 Offline RL 设计轨迹压缩与增强方法。

PROCESS

关键帧重建

识别可加速片段,进行关键帧提取与重建。

GOAL

学习效率

目标是在不降低任务成功率的前提下提高策略学习效率。

STATUS

相关工作已投递 NeurIPS 2026。