RISE: Self-Improving Robot Policy with Compositional World Model

RISE   2026   2602.11075  
arXiv Code Project

以下的这张图能非常好说明RISE和其他工作的区别 具体的算法可以理解为:

使用真实数据:
    训练 Dynamics Model
    训练 Progress + TD Value Model
    warm-up advantage-conditioned policy

重复:
    从真实离线数据取初始状态 o

    要求当前 rollout policy 在最高 advantage 条件下提出动作 a

    Dynamics Model:
        根据 o 和 a 生成未来多视角画面 ô

    Value Model:
        比较 V(ô) 与 V(o)
        计算实际 advantage Â
        将 Â 离散为 bin ẑ

    保存 imagined sample:
        (o, a, ẑ)

    最多把 ô 再作为下一轮输入一次

    使用:
        imagined samples + real offline samples
    更新 behavior policy

    用 EMA 将 behavior policy 更新到 rollout policy

==但是我有一个问题:为什么RISE会比RECAP更好?== 现在来看不好说,因为这里的RECAP baseline很可能没有迭代式增加数据。



← Home · All Readings