VLASH: Real-Time VLAs via Future-State-Aware Asynchronous Inference

VLASH   2025   2512.01031  
arXiv Code Project

这个overview挺有趣的: 但是这也引出了一个新的问题:我们应该如何进行训练?training-time RTC可以并行化的原因是它只修改attention mask,但这篇论文需要对数据进行扩充: 对每个原始样本
$(O_t,; S_t,; A_{t+k},; L)$ 构造多个 temporal offset:
$(O_t,; S_{t+\delta},; A_{t+\delta+\delta+k},; L),$
$\quad \delta=0,\dots,\Delta_{\max}.$
训练时 ($S_{t+\delta}$) 直接取 demonstration 中的真实 future state。 同一个 (O_t,L) 只编码一次,并共享给所有 offset branch: $[O_t,L,;(S_t,A_t),;(S_{t+1},A_{t+1}),\dots]$
不同 offset branch:

本质上:用同一张“旧”图像配不同 future state / future action,迫使模型真正利用 robot state,并以共享视觉计算的方式高效实现多 offset 训练。



← Home · All Readings