π∗0.6: a VLA That Learns From Experience

pi*06   2025   2511.14759  
arXiv Code Project

以下是论文的核心: 使用T-shirt folding的例子,可以是:

大量多任务机器人示范
        │
        ▼
训练通用进度评估器 Vpre
        │
        ▼
训练可接受 positive/negative 条件的 πpre
        │
        ▼
T-shirt 人类示范
        │
        ├──训练 T-shirt value V⁰
        │
        └──训练初始折衣 policy π⁰
                    │
                    ▼
            π⁰ 自主折 300 次
                    │
       成功、失败、快速、缓慢、恢复数据
                    │
                    ▼
 Demonstrations + π⁰ rollouts 全部加入 Dshirt
                    │
                    ▼
       从 Vpre 重新训练 V¹
                    │
                    ▼
 为所有动作计算 positive / negative advantage
                    │
                    ▼
       从 πpre 重新训练 π¹
                    │
                    ▼
            π¹ 再自主折 300 次
                    │
                    ▼
 Demonstrations + π⁰数据 + π¹数据
                    │
                    ▼
             训练 V² 和 π²

个人认为recap做的事情就是利用RL去发现错误,然后一步一步筛选数据,可能是一种data filtering的工作?



← Home · All Readings