本质上就是多了一段“回到机械臂的in-distribution区域”,那么需要明确的是:“什么是in-distribution”的数据?
作者做了一些可视化的方法:
还有几点:
- 对于dagger类型的,作者刻意“Terminate after intervention. After an intervention concludes, we terminate the entire episode.” 因此需要多次迭代采集更新。因此later的subtask会在之后的轮数中被采集到。
- 每次采集数据后,会将所有数据做并集,==这里推测每次迭代的policy都是从base ckpt开始训练,而非从上一轮的policy==
← Home · All Readings