Robot Policy Readings

A browsable mirror of the policy_readings Obsidian vault, grouped by topic.

Robot Policy Readings

A browsable mirror of the policy_readings Obsidian vault. Notes are grouped by topic; the tables below follow the vault’s Dataview views.

Policy (6)

TitleAliasYeararXivTagsLinksNeed Revisit
Action-to-Action Flow Matching A2A 2026 2602.07322 Inference arXiv Code Opt
Robo3R: Enhancing Robotic Manipulation with Accurate Feed-Forward 3D Reconstruction Robo3R 2026 2602.10101 arXiv Code Opt
Static In, Dynamic Out: Counterfactual Action Augmentation for Moving Object Manipulation SIDO 2026 2607.27890 arXiv Code Opt
Why Does Action Chunking Improve Behavioral Cloning Performance in Robotic Control? Delayed-AC 2026 2608.02547 arXiv Code Opt
Track2Act: Predicting Point Tracks from Internet Videos Enables Generalizable Robot Manipulation Track2Act 2024 2405.01527 arXiv Code Opt
Action Chunking with Transformers ACT 2023 2304.13705 manipulation arXiv Code Opt

VLA (29)

TitleAliasYeararXivTagsLinksNeed Revisit
ARM: Advantage Reward Modeling for Long-Horizon Manipulation ARM 2026 2604.03037 arXiv Code Opt
Action-Sketcher: From Reasoning to Action via Visual Sketches for Long-Horizon Robotic Manipulation Action-Sketcher 2026 2601.01618 arXiv Code Opt
COFREEVLA: COLLISION-FREE DUAL-ARM MANIPULATION VIA VISION-LANGUAGE-ACTION MODEL AND RISK ESTIMATION CoFreeVLA 2026 2601.21712 manipulation, Collision arXiv Code Opt
Fast-dVLA: Accelerating Discrete Diffusion VLA to Real-Time Performance Fast-dVLA 2026 2603.25661 arXiv Code Opt
LA4VLA: Learning to Act without Seeing via Language-Action Pretraining LA4VLA 2026 2606.27295 arXiv Code Opt
MEM: Multi-Scale Embodied Memory for Vision Language Action Models pi-mem 2026 2603.03596 arXiv Code Opt
PriorVLA: Prior-Preserving Adaptation for Vision-Language-Action Models PriorVLA 2026 2605.10925 arXiv Code Opt
REAL-TIME ROBOT EXECUTION WITH MASKED ACTION CHUNKING REMAC 2026 2601.20130 Inference, manipulation arXiv Code Opt
Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models GFM&VLA 2026 2605.24642 arXiv Code Opt
X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining X-Tokenizer 2026 2606.14752 arXiv Code Opt
π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities pi0.7 2026 2604 arXiv Code Opt
χ0: Resource-Aware Robust Manipulation via Taming Distributional Inconsistencies kai0 2026 2602.09021 arXiv Code Opt
AimBot: A Simple Auxiliary Visual Cue to Enhance Spatial Awareness of Visuomotor Policies AimBot 2025 2508.08113 manipulation arXiv Code Opt
FAST: Efficient Action Tokenization for Vision-Language-Action Models pi-FAST 2025 2501.09747 manipulation arXiv Code Opt
GR-RL: Going Dexterous and Precise for Long-Horizon Robotic Manipulation GR-RL 2025 2512.01801 RL, manipulation arXiv Code Opt
GR00T N1: An Open Foundation Model for Generalist Humanoid Robots GR00T N1 2025 2503.14734 manipulation arXiv Code Opt
Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy OC-VLA 2025 2508.13103 manipulation arXiv Code Opt
PosA-VLA: Enhancing Action Generation via Pose-Conditioned Anchor Attention PosA-VLA 2025 2512.03724 manipulation arXiv Code Opt
ROSA: Harnessing Robot States for Vision-Language and Action Alignment ROSA 2025 2506.13679 manipulation arXiv Code Opt
Real-Time Execution of Action Chunking Flow Policies RTC 2025 2506.07339 Inference, manipulation arXiv Code Opt
SEM: Enhancing Spatial Understanding for Robust Robot Manipulation SEM 2025 2505.16196 manipulation arXiv Code Opt
SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics SmolVLA 2025 2506.01844 manipulation arXiv Code Opt
VLASH: Real-Time VLAs via Future-State-Aware Asynchronous Inference VLASH 2025 2512.01031 Inference, manipulation arXiv Code Opt
VLSA: Vision-Language-Action Models with Plug-and-Play Safety Constraint Layer VLSA 2025 2512.11891 Collision, manipulation arXiv Code Opt
pi0.5: a Vision-Language-Action Model with Open-World Generalization pi0.5 2025 2504.16054 manipulation arXiv Code Opt
π∗0.6: a VLA That Learns From Experience pi*06 2025 2511.14759 RL, manipulation arXiv Code Opt
OpenVLA: An Open-Source Vision-Language-Action Model OpenVLA 2024 2406.09246 manipulation arXiv Code Opt
TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation TinyVLA 2024 2409.12514 manipulation arXiv Code Opt
pi0: A Vision-Language-Action Flow Model for General Robot Control pi0 2024 2410.24164 manipulation arXiv Code Opt

World-Model (10)

TitleAliasYeararXivTagsLinksNeed Revisit
AHA-WAM:Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing AHA-WAM 2026 2606.09811 arXiv Code Opt
Being-H0.7: A Latent World-Action Model from Egocentric Videos Being-H0.7 2026 2605.00078 arXiv Code Opt
Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning cosmos-policy 2026 2601.16163 manipulation arXiv Code Opt
FACT: Failure-Aware Causal Training for World-Action Models FACT 2026 2608.10232 arXiv Code Opt
Fast-WAM: Do World Action Models Need Test-time Future Imagination? Fast-WAM 2026 2603.16666 manipulation arXiv Code Opt
From Imagined Futures to Executable Actions: Mixture of Latent Actions forRobot Manipulation MoLA 2026 2605.12167 arXiv Code Opt
MotionWAM: Towards Foundation World Action Models for Real-Time Humanoid Loco-Manipulation MotionWAM 2026 2606.09215 arXiv Code Opt
ViVa: A Video-Generative Value Model for Robot Reinforcement Learning ViVa 2026 2604.08168 arXiv Code Opt
WALL-WM: Carving World Action Modeling at the Event Joints WALL-WM 2026 2606.01955 arXiv Code Opt
When to Trust Imagination: Adaptive Action Execution for World Action Models FFDC 2026 2605.06222 arXiv Code Opt

Data (13)

TitleAliasYeararXivTagsLinksNeed Revisit
EgoRecovery: Acquiring Failure Recovery Ability Through Human Recovery Demonstration EgoRecovery 2026 2607.19745 Human-data arXiv Code Opt
EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data EgoScale 2026 2602.16710 arXiv Code Opt
HELP: HUMAN-EFFICIENT LARGE-SCALE ROBOT POST-TRAINING WITH ROLLOUT SEGMENTATION HELP 2026 2607.09776 human-in-the-loop arXiv Code Opt
RISE: Self-Improving Robot Policy with Compositional World Model RISE 2026 2602.11075 RL arXiv Code Opt
RoboVIP: Multi-View Video Generation with Visual Identity Prompting Augments Robot Manipulation RoboVIP 2026 2601.05241 Aug arXiv Code Opt
STEAM: Self-Supervised Temporal Ensemble Advantage Modeling for Real-World Robot Learning STEAM 2026 2606.29834 arXiv Code Opt
WM-DAgger: Enabling Efficient Data Aggregation for Imitation Learning with World Models WM-DAgger 2026 2604.11351 Aug arXiv Code Opt
CLASS: Contrastive Learning via Action Sequence Supervision for Robot Manipulation CLASS 2025 2508.01600 contrastive-learn arXiv Code Opt
Contrastive Representation Regularization for Vision-Language-Action Models RS-CL 2025 2510.01711 contrastive-learn arXiv Code Opt
Diagnose, Correct, and Learn from Manipulation Failures via Visual Symbols ViFailback 2025 2512.02787 Benchmark arXiv Code Opt
RaC: Robot Learning for Long-Horizon Tasks by Scaling Recovery and Correction RaC 2025 2509.07953 human-in-the-loop arXiv Code Opt
SELF-IMPROVING VISION-LANGUAGE-ACTION MODELS WITH DATA GENERATION VIA RESIDUAL RL PLD 2025 2511.00091 RL arXiv Code Opt
EgoMimic: Scaling Imitation Learning via Egocentric Video EgoMimic 2024 2410.24221 arXiv Code Opt


← Home · All Readings