Trajectory-Level Credit

Latest papers 83

All topics
CardsList
  1. Asynchronous LLM Post-Training: Group-Mass Capping and Convergence Analysis

    Oct 1, 2026Qijia He, Ruinan Jin, Jun Luo +2ConvergenceTrajectory-Level Credit

  2. PRICE the Action Chunks: Physical Relational Credit Assignment for Embodied Reinforcement Learning

    Sep 30, 2026Yangang Zou, Jiajun Lu, Weitao Zhou +6Offline Reinforcement LearningCredit Assignment

  3. Credit-Guided Policy Improvement for Test-time Adaptive Vision-Language Navigation

    Sep 29, 2026Yang Li, Sijia Zhang, Yihan Li +4Vision-Language NavigationTrajectory-Level Credit

  4. VLALight: A Vision-Language-Action Model for Traffic Signal Control

    Sep 29, 2026Pan Zhang, Siqi Lai, Kemu Dong +1Traffic Signal ControlTraffic

  5. Trajectory-Level Mode Guidance for Controllable Diffusion-Based Multi-Robot Motion Planning

    Sep 29, 2026Tianyou Yu, Shengze Cai, Chao XuDiffusion PlanningMulti-Robot Motion Planning

  6. Before the Token Commits: Trajectory-Level Benchmarking of Visual Hallucinations in Diffusion VLMs

    Sep 28, 2026Yadong Wang, Siping Yue, Yu Tian +2Large Language Model HallucinationVisual Hallucinations

  7. MarsLab: A Martian Rover Simulator for Planetary Rover Autonomous Navigation

    Sep 28, 2026Hoyun Kim, Beomsu Kim, Giseop KimAutonomous Surface VehiclesTerrain

  8. VABench: Measuring Embodied Spatial Intelligence through Visual Demonstrations, Active Perception, and Metric Control

    Sep 17, 2026Zhongbo Zhang, Jiayi Jin, Yifan Wang +4Embodied Artificial IntelligenceTrajectory-Level Credit

  9. The Mirage of Calibrated Confidence: Trajectory-Independence of Verbalized Confidence in Vision-Language Models

    Sep 16, 2026Jisoo Yang, Jaeho Han, Trung X. Pham +1Confidence EstimationTrajectory-Level Credit

  10. AeroCopilotBench: Safety-Gated Evaluation of LLM Agents on Aircraft Emergency Procedures in an Executable Cockpit

    Aug 17, 2026Yuchen Yuan, Zhenghuang Wu, Yuangan Li +2PilotLarge Language Model Agents

  11. Temporal GRPO: Beyond Trajectory-Level Credit in Vision-Language-Action Reinforcement Learning

    Aug 13, 2026Yao Zhou, Hang Gao, Fengge Wu +2Offline Reinforcement LearningTrajectory-Level Credit

  12. Redistribution-based Cost Inference Improves Sparse Safe Offline RL

    Aug 12, 2026Ebenezer Gelo, Geraud Nangue Tasse, Steven James +1Model-Based Reinforcement LearningTrajectory-Level Credit

  13. Language-Structured Relational Q-Learning for Threat-Aware Control in Safety-Critical Driving

    Aug 11, 2026Aditya Humnabadkar, Huaizhong Zhang, Ardhendu BeheraQ-LearningTrajectory-Level Credit

  14. DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models

    Aug 10, 2026Mingfeng Lin, Chengfei Cai, Lin Xu +2Trajectory-Level CreditDegradation

  15. How Much, Then Where: Credit-Conserving Action-to-Token Allocation for Multi-Turn Agent Reinforcement Learning

    Aug 7, 2026Lichao Ma, Yang Sun, Shuaitao Zhao +9Credit AssignmentStep-Level Credit

  16. Routing Is Least Learnable Where It Is Most Valuable: Bounds on Representation Routing for Web Agents

    Aug 6, 2026Jiaming Wei, Zekun Wu, Adriano Koshiyama +1Web AgentsStrategic Agents

  17. Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs

    Aug 3, 2026Zixuan Huang, Yang Zhou, Kaixuan Wang +7Autonomous DrivingTrajectory-Level Credit

  18. HindSearch: Trajectory-Level Hindsight Critique for Search-Augmented Reinforcement Learning

    Aug 3, 2026Haowei Liu, Jiamian Wang, Hsin-Tai Wu +2HindsightSearch Agents

  19. Outcome-Confounded Local Supervision in On-Policy Distillation

    Jul 26, 2026Guoqing MaTeacherTrajectory-Level Credit

  20. Rewarding Better Thinking for LLM Preference Alignment

    Jul 22, 2026Xubo Liu, Wenya Guo, Ruxue Yan +2Preference AlignmentTrajectory-Level Credit

  21. HiLLTS: Zero-Shot Hierarchical LLM-Guided Traffic Signal Control for Sustainable Transportation

    Jul 17, 2026Yue Ding, Tendai Mukande, Mingming LiuTraffic Signal ControlCongestion

  22. AdvNav: Behavior-Guided Black-Box Adversarial Attacks on Vision-Language Navigation

    Jul 13, 2026Chenyang Li, Kaige Li, Zeyu Jiang +1Vision-Language NavigationBlack-Box Adversarial Attacks

  23. EvoCUA-1.5: Online Reinforcement Learning for Multi-turn Computer-Use Agents

    Jul 7, 2026Mianqiu Huang, Taofeng Xue, Chong Peng +12Computer-Use AgentsOffline Reinforcement Learning

  24. A Large-Language-Model Supported Personalized Driving Framework for Lane Change in Highway Scenarios

    Jun 30, 2026Dong Bi, Yongqi Zhao, Paul Kovacevic +4Human DrivingAutomated Vehicles

  25. SWE-Router: Routing in Multi-turn Agentic Software Engineering Tasks

    Jun 30, 2026Seongho Son, Sangwoong Yoon, Jiahua Tang +3Large Language Model RoutingSoftware Engineering

  26. PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF

    Jun 29, 2026Doo Hwan Hwang, Kee-Eung KimReinforcement Learning From Human FeedbackCritic-Free Reinforcement Learning

  27. HumanMoveVQA: Can Video MLLMs reason about human movement in videos?

    Jun 26, 2026Pulkit Gera, Faegheh Sardari, Asmar Nadeem +4Fine-Grained Video UnderstandingHuman Motion

  28. RouterVLA: Turning Smoke Tests into Supervision for Heterogeneous VLA Selection

    Jun 25, 2026Xingyu Ren, Chugang Yi, Ge Ma +1Trajectory-Level CreditDestination-Only Scoring

  29. ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning

    Jun 23, 2026Wenyang Hu, Junxiang Jia, Zhen Shu +3Verifiable RewardsTrajectory-Level Credit

  30. Drowning in Routine: Signal Dilution in Multi-Turn Agent Training

    Jun 20, 2026Yann Pernot, Vi RetaultTrajectory-Level Credit

  31. Towards Understanding the Power and Limits of the Muon Optimizer: A River-Valley Perspective

    Jun 19, 2026Tianqi Shen, Jinji Yang, Runze Shi +3MuonAdam

  32. PAWS: Preference Learning with Advantage-Weighted Segments

    Jun 10, 2026Aleksandar Taranovic, Onur Celik, Niklas Freymuth +6Preference LearningTrajectory-Level Credit

  33. TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance

    Jun 5, 2026Duc Tri Tran, Trung Thanh Nguyen, Vijay John +2Video SurveillanceMulti-Object Tracking

  34. TRACE: Trajectory Reasoning through Adaptive Cross-Step Evidence Aggregation for LLM Agents

    Jun 5, 2026Vijitha Mittapalli, Shreyaa Jayant Dani, Satya Srujana Pilli +7TracesTrajectory-Level Credit

  35. StainFlow: Entity-Stain Tracking and Evidence Linking for Process Rewards in GUI Agents

    Jun 5, 2026Haojie Hao, Longkun Hao, Yihang Lou +8Process Reward ModelGraphical User Interface Agents

  36. Fix the Mind, Not the Move: Interpretable AI Assistance via Knowledge-Gap Localization

    Jun 4, 2026Ayano Hiranaka, Ya-Chuan Hsu, Stefanos Nikolaidis +2Student MisconceptionsTrajectory-Level Credit

  37. MMG2Skill: Can Agents Distill In-the-Wild Guides into Self-Evolving Skills?

    Jun 1, 2026Xinyu Che, Junqi Xiong, Yunfei Ge +10Skill EvolutionSkills

  38. CARVE: Certified Affordable Repair of Vetoed Maneuvers via Envelopes for Interactive Driving

    May 31, 2026Yifan WangHuman DrivingReachability

  39. BraveGuard: From Open-World Threats to Safer Computer-Use Agents

    May 31, 2026Yunhao Feng, Xiaohu Du, Xinhao Deng +13LLM Defense MechanismsComputer-Use Agents

  40. DriveMA: Driving Vision-Language-Action Models with verifiable Meta-Actions

    May 29, 2026Weicheng Zheng, Yixin Huang, Qiao Sun +2Diffusion-Based Vision-Language-ActionsDrives

  41. DiffCrossGait: Trajectory-Level Alignment for 2D-3D Cross-Modal Gait Recognition via Latent Diffusion

    May 29, 2026Zhiyang Lu, Ming ChengGait RecognitionCross-Modal

  42. On Distributional Reinforcement Learning in Chaotic Dynamical Systems

    May 28, 2026James Rudd-Jones, Mirco Musolesi, María Pérez-OrtizDistributional Reinforcement LearningChaos

  43. Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling

    May 28, 2026Yuchen Liu, Yingjie Feng, Lixiong Qin +5Credit AssignmentAgentic Reinforcement Learning

  44. LiteCoder-Terminal: Scaling Long-Horizon Terminal Environments for Learning Language Agents

    May 28, 2026Xiaoxuan Peng, Kaiqi Zhang, Xinyu Lu +5Synthetic EnvironmentsEnvironment

  45. Honest Lying: Understanding Memory Confabulation in Reflexive Agents

    May 28, 2026Prakhar Dixit, Sadia Kamal, Tim OatesReflectionsConfabulation

  46. RECTOR: Priority-Aware Rule-Based Reranking for Compliance-Aware Autonomous Driving Trajectory Selection

    May 24, 2026Hadi Hajieghrary, Benedikt Walter, Chaitanya Shinde +2Waymo Open Motion DatasetTrajectory-Level Credit

  47. SAM: State-Adaptive Memory for Long-Horizon Reasoning Agent

    May 23, 2026Yuyang Hu, Hongjin Qian, Shuting Wang +5Long-Horizon AgentsLong-Horizon Task Planning