作者遇到的问题是:
那么一个解决方案就是通过supervised learning监督网络使其能够attend到正确的区域。作者因此提出了Task-relevant anchor 和 End-effector anchor两个anchor。
一个很简单的问题:task-relevant是通过夹爪开合程度来判断的,那么在机械臂“去往路途中”,怎么给监督信号? Gemini: Task-relevant anchor 在“路程上”是持续存在并提供监督信号的,它的本质是将“未来的交互点”在“当前的时间步”进行了动态投影。 具体机制如下:
“A signal is considered available only if the length of $\Omega^+$ is greater than zero; otherwise, the corresponding embedding is replaced with zero-padding…“ 如果在时间步 $t$,“固定的 3D 目标坐标 $P_{target}$” 投影到了 2D 图像的边界之外(即目标不在视野内),那么生成的 $F_f^{task}$ 就是一张全 0 的空白图。
此时,提取出的高激活正样本索引集 $\Omega^+$ 的长度为 0。算法就会判定当前帧的 Task-relevant 信号不可用(Unavailable),并使用 Zero-padding 将对应的特征屏蔽掉。
总结来说: 在路程上,模型通过“上帝视角”预先拿到了这趟行程的终点 3D 坐标,并在每一帧把它投影成 2D 高斯图来教导模型:“不管你现在在哪,你的眼睛得一直盯着这个投影位置”。如果视野里确实看不到,就不给监督(Zero-padding),防止模型学乱。
这个方法其实已经限制死pick-and-place的任务了,像叠衣服这类non-rigid的task,这样的anchor map其实并不容易获取。