数据生成: 在 simulation 中 rollout VLA policy。对每个 state $s_t$,VLA 生成 action sequence $A_{t:t+H-1}$($H=5\sim10$)。为增加 coverage,施加 jitter(随机噪声扰动)和 beam variants(beam search 生成多候选),形成多样化的 $(s_t, A_{t:t+H-1})$ 对。 标签生成(Model-based Checker): 使用已知的 robot URDF link meshes + FCL (Flexible Collision Library) 做 mesh 间距离查询,沿 H 步 rollout 判定:
在真实机器人上闭环部署,用物理信号重新标注:
双分支输入:
``` VLA proposal → Eϕ 评估 risk r̂_t
├─ r̂_t ≤ τ↓ → 执行(soft gate: α = clip(1 - r̂/τ↑, 0, 1) 缩放速度)
└─ r̂_t > τ↑ → Block → Recovery:
| min_A Eϕ(s_t, A) + λ | A | ² |
(projected gradient descent, joint/velocity limits 下)
→ 连续 K cycle 内 r̂ ≤ τ↓ → 恢复 VLA
```
Recovery 的核心:$E_\phi$ 既是 predictor 也是 objective——对 action 求导,沿 $\nabla_A E_\phi$ 方向搜索安全替代动作。Hysteresis($\tau_\downarrow < \tau_\uparrow$)防止 chattering。
$E_\phi$ 的训练数据来自 特定 VLA 在该机器人平台上的 rollout + jitter。这带来两个后果:
Recovery 用梯度下降解 $\min_A E_\phi(s_t, A) + \lambda|A|^2$。问题是:梯度优化可能走到 $E_\phi$ 训练分布之外的动作空间区域。 $E_\phi$ 的 training distribution 是”VLA 输出 + jitter 半径”,而梯度下降不受此约束——$E_\phi$ 在 OOD 区域的预测可能极不可靠(neural network 对 OOD 样本容易给出过度自信的判断)。论文对此没有分析。
论文对双臂的特殊处理止步于 input/output 维度($q_t = (q_t^L, q_t^R)$,检测 inter-arm + arm-object 碰撞),没有在网络架构或 safety mechanism 中融入双臂的结构化 inductive bias(如双 kinematic chain 的关系建模、臂间优先级协调等)。方法移植到单臂做环境碰撞 avoidance 需要的改动很小。