pi0: A Vision-Language-Action Flow Model for General Robot Control

pi0   2024   2410.24164  
arXiv Code Project
Overview

pi0基本确立了之后VLA的几个重要的内容:

  1. pre-training + post training两个阶段训练的scheme
  2. 确立action expert的flow matching/diffusion process for continuous action outputs.
  3. 论文证明pre-training有效果
  4. 论文也论证了引入VLM从而有的“language instructions following”的特性,这也应该是为之后的subtask的生成做准备。
    Pipeline

    具体的attention mask为:

  Prefix State Action
Prefix 1 0 0
State 1 1 0
Action 1 1 1


← Home · All Readings