PosA-VLA: Enhancing Action Generation via Pose-Conditioned Anchor Attention

PosA-VLA   2025   2512.03724  
arXiv Code Project

作者遇到的问题是: 那么一个解决方案就是通过supervised learning监督网络使其能够attend到正确的区域。作者因此提出了Task-relevant anchorEnd-effector anchor两个anchor。

此时,提取出的高激活正样本索引集 $\Omega^+$ 的长度为 0。算法就会判定当前帧的 Task-relevant 信号不可用(Unavailable),并使用 Zero-padding 将对应的特征屏蔽掉。

总结来说: 在路程上,模型通过“上帝视角”预先拿到了这趟行程的终点 3D 坐标,并在每一帧把它投影成 2D 高斯图来教导模型:“不管你现在在哪,你的眼睛得一直盯着这个投影位置”。如果视野里确实看不到,就不给监督(Zero-padding),防止模型学乱。

问题:

这个方法其实已经限制死pick-and-place的任务了,像叠衣服这类non-rigid的task,这样的anchor map其实并不容易获取。



← Home · All Readings