Robotic Policy Evaluation

Momentum

23 papers in the last four weeks, up 283% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 70

All topics
CardsList
  1. The Robot Is Not Its Description: GaugeBench for Representation Robustness in Morphology-Aware Policies

    Oct 6, 2026Rahath Malladi, Arshia Sangwan, Rajesh K. Gupta +1Robotic Policy EvaluationCross-Embodiment Robot Learning

  2. Inspect Robots: Evaluating the Capabilities and Safety of Embodied AI

    Oct 5, 2026Christopher Leet, Achu Menon, Sravanthi Machcha +12AI Agent EvaluationRobotic Policy Evaluation

  3. Code Owns the Simulation, Jev Owns the Evaluation

    Oct 1, 2026Yaodong Yang, Hongyao Tang, Yi Ma +4AI Agent EvaluationRobotic Policy Evaluation

  4. Looking Back to Move Forward: Temporal Verification for Generative Robot Policies

    Sep 30, 2026Haoxuan Wang, Wayne Wu, Yan Yan +1Robot Policy LearningRobotic Policy Evaluation

  5. WorldLine: Action-Driven Visual Simulation for Robotic Manipulation

    Sep 29, 2026Shenghe Zheng, Wenbo Li, Jiyao Zhang +4Action-Conditioned Video GenerationWorld Models for Robotics

  6. LIBERO-MAX: Do Robot Policies Adapt When the World Changes?

    Sep 29, 2026Yunbei Zhang, Zijian Jin, Yuanzhe Liu +14Robot Policy AdaptationRobotics Simulation

  7. Natural State-Prediction Accuracy can Hide Weak Controlled Responsiveness in VLA Readouts

    Sep 28, 2026Hyungjoon Kim, Wonbin Son, Mi Young Lee +2Robotic Policy EvaluationVision-Language-Action Models

  8. CodeActionBench: Evaluating Agentic Code-as-Policy for Embodied Manipulation

    Sep 27, 2026Yiheng Lyu, Xueying Jiang, Wenhao Li +2Robotic Policy EvaluationRobotic Manipulation

  9. RoboRecover: Benchmarking Robot Policy Recovery under Execution Deviations

    Sep 24, 2026Yang Li, Chen Zhao, Zhuoran Wang +5Robotic Policy EvaluationRobot Manipulation Benchmarks

  10. Robots That Take Initiative: A Framework for Building and Evaluating Proactive Robots

    Sep 24, 2026Maithili Patel, Sonia ChernovaHuman-in-the-Loop EvaluationRobotic Policy Evaluation

  11. Beyond End-Task Success: How to Audit Visual Experience Retrieval in Robotics

    Sep 22, 2026Eshika Pathak, Leela KrishnaRobotic Policy EvaluationRobot Learning

  12. RoboFollow: Unveiling the Instruction Following Mirage in Embodied Agents

    Sep 22, 2026Chang Guo, Yukun Xie, Bohan Tan +6Language-Conditioned Robot ManipulationRobotic Policy Evaluation

  13. IndustrialVLA-Bench: A Traceable Multi-Axis Evaluation of Open Robot Policy Models

    Sep 22, 2026Yiqi Wang, Zhifeng Rao, Jiaqi Zhang +7Robotic Policy EvaluationVision-Language-Action Models

  14. An Unexpected Robot Policy: Early Evaluations of GPT-6 Astra on RoboDojo and Beyond

    Sep 21, 2026Wenbo Zhang, Kaixuan Wang, Yutao Ouyang +9Language-Conditioned Robot ManipulationGeneralization in Robotic Manipulation

  15. From Rollout to Reset: A Graph-Based Harness for Autonomous Long-Horizon Manipulation Evaluation

    Sep 16, 2026Jing Jiang, Yue Yang, Xinkai Jiang +3Long-Horizon Robotic ManipulationRobotic Policy Evaluation

  16. Intrinsic Robot Rewarding: Reusing VLA Representations for Autonomous Evaluation and Policy Improvement

    Sep 15, 2026Tobias Schaffer, Mohab Elkhayat, Daniela Nicklas +2RL for RoboticsIntrinsic Reward Methods

  17. The Neverwhere Visual Parkour Benchmark Suite

    Sep 14, 2026Ziyu Chen, Henghui Bao, Haoran Chang +123D Gaussian SplattingRobotic Policy Evaluation

  18. No Free Checker: A Survey of Verifiers for Robot Policies

    Sep 10, 2026Yang Wan, Xihang Yue, Zhirui Liu +7Robotic Policy EvaluationFormal Verification

  19. Monkey See, Can Monkey Do? A Benchmark for Evaluating Robot Skill Learning by Observation

    Sep 8, 2026Weiwei Gu, Anmol Gupta, Anant Sah +5Long-Horizon Robotic ManipulationRobot Skill Learning

  20. R2S-Eval: Robot Evaluation with Real-to-Sim Calibration via Vision-Language Models

    Sep 3, 2026Yidi Wang, Feixiang Ruan, Ruoqu Chen +4Robotic Policy Evaluation

  21. Does Imitation Learning Preserve Temporal Robustness in Dexterous Manipulation? An Expert-Learner Comparison Across Task Execution Speeds

    Sep 1, 2026Clinton Enwerem, John S. Baras, Calin BeltaContact-Rich Robotic ManipulationRobotic Policy Evaluation

  22. AM-Bench: A Modular Simulation Suite and Benchmark for Aerial Manipulation Policy Learning

    Sep 1, 2026Yutong Wang, Dongjae Lee, Xiaofeng Guo +9Robotics SimulationRobotic Policy Evaluation

  23. Behavior-Skill: A Fine-Grained Benchmark for Evaluating Vision-Language-Action Policies in Long-Horizon Tasks

    Aug 31, 2026Chunyun Ma, Lun Luo, Xingjian Luo +7Long-Horizon Robotic ManipulationMobile Manipulation

  24. RoboSynChallenge: Mastering Real-World Dexterity via Generalizing Synthesized Manipulation Skills

    Aug 12, 2026Runyi Zhao, Ruixin Wu, Chengkun Li +15Sim-to-Real TransferGeneralization in Robotic Manipulation