动作轨迹没有改变,只是针对1) temporal consistency; 2) multi-view consistency 两个层面进行的数据增强。增强只是针对背景和无关物体,不改变机械臂和对应的交互物体。 文中一大核心的”visual identity prompting”就是给【scene setup】中的语言描述提供对应的视觉特征的。
← Home · All Readings