以下是论文的核心:
使用T-shirt folding的例子,可以是:
大量多任务机器人示范
│
▼
训练通用进度评估器 Vpre
│
▼
训练可接受 positive/negative 条件的 πpre
│
▼
T-shirt 人类示范
│
├──训练 T-shirt value V⁰
│
└──训练初始折衣 policy π⁰
│
▼
π⁰ 自主折 300 次
│
成功、失败、快速、缓慢、恢复数据
│
▼
Demonstrations + π⁰ rollouts 全部加入 Dshirt
│
▼
从 Vpre 重新训练 V¹
│
▼
为所有动作计算 positive / negative advantage
│
▼
从 πpre 重新训练 π¹
│
▼
π¹ 再自主折 300 次
│
▼
Demonstrations + π⁰数据 + π¹数据
│
▼
训练 V² 和 π²
个人认为recap做的事情就是利用RL去发现错误,然后一步一步筛选数据,可能是一种data filtering的工作?