Reasoning Trajectory

Momentum

8 papers in the last four weeks, up 33% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 60

All topics
CardsList
  1. When Reasoning Helps Action: Monitoring and Steering Chain-of-Thought in Vision-Language-Action Policies

    Sep 30, 2026Sathwik Karnik, Joseph JR. Lee, Aryaman Gupta +1Reasoning TrajectoryChain-of-Thought Reasoning

  2. Interpreting Reasoning of Large Language Models via Partial Information Decomposition

    Sep 30, 2026Barproda Halder, Qiuyi Zhang, Sanghamitra DuttaLarge Reasoning ModelsReasoning Trajectory

  3. TAEC: Trajectory-Aware Evidence Coordination for Multi-Step Visual RAG

    Sep 29, 2026Yalun Wu, Bingzhou Wang, Boyang Wang +5Visual EvidenceMultimodal Retrieval Augmented Generation

  4. Interactive-Policy Distillation with Bidirectional Propose-and-Verify

    Sep 29, 2026Shutong Wu, Xiwen Chen, Brendan Rappazzo +4Efficient On-Policy DistillationTeacher

  5. Schema-Anchored Latent Reasoning for Semantic Parsing-Based Knowledge Base Question Answering

    Sep 17, 2026Guangze Gao, Zixuan Li, Sikui Zhang +5Efficient Latent ReasoningSparql

  6. Anchoring What Matters: A Dual-Level Learning Framework for Visually-Grounded Multimodal Reasoning

    Sep 16, 2026Xinxin Song, Siyuan Li, Tingxiong Xiao +1Recent Vision-Language ModelsReinforcement Learning With Verifiable Reward

  7. Beyond Generation and Accuracy: Diagnosing and Enhancing Visual Chain-of-Thought for Geometry Problem Solving

    Sep 11, 2026Zhitong Dong, Jicai Pan, Yingguo Gao +3Visual ReasoningGeogs-Slam

  8. FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience

    Sep 3, 2026Zixun Huang, Kishan Panaganti, Haitao Mi +1Reinforcement Learning With Verifiable RewardReasoning Trajectory

  9. Geometry of Divergence: Tracking Hidden-State Trajectories for Adaptive Multi-Turn Reasoning

    Aug 31, 2026Jie Liang, Zhengxin Yu, Hamid Nasiri +1Reasoning TrajectoryMulti-Turn Interactions

  10. Learning to Reason and Use Tools through Unsupervised Fine-Tuning in Task-Oriented Dialog Systems

    Aug 31, 2026Markel Ferro, Oier Lopez de LacalleLLM Reasoning StrategiesSupervised Finetuning

  11. AutoCRAT: Within-trajectory Joint Control of Stochasticity and Compute for LLM Reasoning

    Aug 30, 2026Hanjun Luo, Qiushi Liu, Jingya Zhang +8LLM Reasoning StrategiesAutoregressive Language Models

  12. CRAFT: LLM-Based Iterative Refinement for Temporal Reasoning over Clinical Narratives

    Aug 13, 2026Chengyang He, Tahreem Arif, Marko Zivkovic +3Temporal ReasoningPatient Trajectories

  13. Tree-of-Ideas: Automated Research Ideation via Cross-Trajectory Reasoning over Scholarly Evolution

    Aug 11, 2026Xun Li, Yiying Yang, Pengtao Li +8Scientific IdeationResearch Automation

  14. Branch2Skill: Efficient Skill Evolution Through Reasoning Trees

    Aug 9, 2026Yanwei Ren, Haotian Zhang, Likang Xiao +5Skill EvolutionReasoning Trajectory

  15. ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning

    Aug 4, 2026Jinhe Bi, Chennan Zhou, Zengjie Jin +10Reasoning TrajectoryLarge Language Model Reinforcement Learning

  16. TRAM: Enhancing Multimodal Reasoning with Trajectory-Derived Auxiliary Memory

    Aug 3, 2026Kang Liu, Zijing Wang, Yongkang Liu +5Multimodal ReasoningReasoning Trajectory

  17. OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

    Jul 30, 2026Qiushi Sun, Kanzhi Cheng, Yian Wang +20Progress Reward ModelingLarge Language Model Judges

  18. TRACTA: Benchmarking Temporal Reasoning over Semantic Trajectories

    Jul 24, 2026Michael Romei De Socio, Gian Luca Pozzato, Alessio MerloTemporal ReasoningNeuro-Symbolic Framework

  19. REFACT: Adaptive Fact Restatement for Compact and Faithful Chain-of-Thought Reasoning

    Jul 23, 2026Zhensheng Jin, Xin Dai, Zhenghao Liu +5LLM Reasoning StrategiesLong-Context Reasoning

  20. TREK: Distill to Explore, Reinforce to Refine

    Jul 6, 2026Yuanda Xu, Zhengze Zhou, Kayhan Behdin +10Repair-Based Group-Relative Policy OptimizationReasoning Trajectory

  21. Do Vision-Language-Action Models Mean What They Say? On the Role of Faithfulness in Embodied Reasoning

    Jul 6, 2026Matthew Foutter, Matteo Cercola, Lena Wild +4Reasoning TrajectoryFaithfulness

  22. Invariant Reasoning Directions in Latent Trajectories of Language Models

    Jun 28, 2026Arun Vignesh Malarkkan, Manan Roy Choudhury, Utkarsh Byahut +3Reasoning TrajectoryLatent Trajectories

  23. Search for Truth from Reasoning: A Dynamic Representation Editing Framework for Steering LLM Trajectories

    Jun 26, 2026Tianlong Wang, Yuhang Wang, Weibin Liao +5LLM Reasoning StrategiesReasoning Trajectory

  24. OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning

    Jun 24, 2026Wenxuan Jiang, Zining Fan, Zijian Zhang +6LLM Reasoning StrategiesLarge Language Model Reinforcement Learning

  25. Only Ask What You Don't Know: Grounded Delta Planning for Efficient Multi-step RAG

    Jun 21, 2026Wei-Chieh Chou, Xuanjun Chen, Jian-Ren Lin +3Action-Conditioned PlanningReasoning Trajectory

  26. STRIDE: Strategic Trajectory Reasoning via Discriminative Estimation for Verifiable Reinforcement Learning

    Jun 14, 2026Qinjian Zhao, Zhihao Dou, Dinggen Zhang +10Reinforcement Learning With Verifiable RewardVerifiable Rewards

  27. Forecasting Future Behavior as a Learning Task

    Jun 9, 2026Mosh Levy, Yoav Goldberg, Asa Cooper SticklandLarge Language Model ForecastingReasoning Trajectory

  28. Geometric Latent Reasoning Induces Shorter Generations in LLMs

    Jun 1, 2026Shashi Kumar, Yacouba Kaloga, Petr Motlicek +2Efficient Latent ReasoningReasoning Trajectory

  29. LARK: Learnability-Grounded Trajectory Selection for Efficient Reasoning Distillation

    May 28, 2026Tianrun Yu, Kaixiang Zhao, Chih-Chun Chen +5Reasoning TrajectoryLearnability

  30. ProSR: Process-Shaped Spatial Reasoning for Reliable Chain-of-Thought in VLMs

    May 25, 2026Jiangyang Li, Cong Wan, Changjie Wu +8Spatial ReasoningReasoning Trajectory

  31. Boosting Inference with Guided Reasoning: Stochastic Exploration for Recursive Models

    May 24, 2026Andrew Corbett, Archit Sood, Anna Tzatzopoulou +2Recursive ModelsReasoning Trajectory

  32. Better, Faster: Harnessing Self-Improvement in Large Reasoning Models

    May 24, 2026Qihuang Zhong, Liang Ding, Juhua Liu +3Large Reasoning ModelsReasoning Trajectory

  33. Test-Time Deep Thinking to Explore Implicit Rules

    May 24, 2026Wentong Chen, Xin Cong, Zhong Zhang +8Agentic ReasoningReasoning Trajectory

  34. PathCal: State-Aware Reflection-Marker Calibration for Efficient Reasoning

    May 21, 2026Lingyu Jiang, Zirui Li, Shuo Xing +6Reasoning TrajectoryChain-of-Thought Reasoning

  35. On the Cost and Benefit of Chain of Thought: A Learning-Theoretic Perspective

    May 20, 2026Yue Zhang, Zhiyi Dong, Tommaso Cesari +1Reasoning TrajectoryThoughts

  36. TIER: Trajectory-Invariant Execution Rewards for Multi-Step Tool Composition

    May 16, 2026Anay Kulkarni, ChiaEn Lu, Dheeraj Mekala +3Multi-Turn Reinforcement LearningReasoning Trajectory

  37. How to Interpret Agent Behavior

    May 13, 2026Jie Gao, Kaiser Sun, Jen-tse Huang +8Agent Behavior ModelingRuntime

  38. Retrieval is Cheap, Show Me the Code: Executable Multi-Hop Reasoning for Retrieval-Augmented Generation

    May 13, 2026Jiashuo Sun, Jimeng Shi, Yixuan Xie +10Multi-Hop ReasoningReasoning Trajectory

  39. Latency Analysis and Optimization of Alpamayo 1 via Efficient Trajectory Generation

    May 9, 2026Yunseong Jeon, Namcheol Lee, Yoonsu Lee +4Reasoning TrajectoryInference Latency

  40. Self-ReSET: Learning to Self-Recover from Unsafe Reasoning Trajectories

    May 9, 2026Dongcheng Zhang, Yi Zhang, Yuxin Chen +3Reasoning Trajectory

  41. Internalizing Safety Understanding in Large Reasoning Models via Verification

    May 9, 2026Yi Zhang, Yuxin Chen, Leheng Sheng +4Safety ClaimsLarge Reasoning Models

  42. How You Begin is How You Reason: Driving Exploration in RLVR via Prefix-Tuned Priors

    May 9, 2026Yifan Xu, Junren Chen, Yifan ChenReinforcement Learning With Verifiable RewardVerifiable Rewards

  43. AgentPSO: Evolving Agent Reasoning Skill via Multi-agent Particle Swarm Optimization

    May 9, 2026Hyunmin Hwang, Jaemin Kim, Choonghan Kim +2Multi-Agent ReasoningReasoning Benchmark

  44. Measuring Black-Box Confidence via Reasoning Trajectories: Geometry, Coverage, and Verbalization

    May 7, 2026Marc Boubnovski Martell, Josefa Lia Stoisser, Kaspar Märtens +4Reasoning BenchmarkReasoning Trajectory

  45. RAG over Thinking Traces Can Improve Reasoning Tasks

    May 5, 2026Negar Arabzadeh, Wenjie Ma, Sewon Min +1Reasoning TracesReasoning Trajectory

  46. Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning

    Apr 30, 2026Shijin Gong, Kai Ye, Jin Zhu +3Large Language Model Reinforcement LearningLLM Reasoning Strategies

  47. Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning

    Apr 27, 2026Zhicheng Zhang, Wentao Gu, Weicheng Wang +5Audio-Visual ReasoningOmni-Modal

  48. MultiDx: A Multi-Source Knowledge Integration Framework towards Diagnostic Reasoning

    Apr 27, 2026Yimin Deng, Zhenxi Lin, Yejing Wang +9Clinical Reasoning TrainingDiagnosis

  49. LegalDrill: Diagnosis-Driven Synthesis for Legal Reasoning in Small Language Models

    Apr 26, 2026Tianchun Li, Haochen Liu, Vishwa Pardeshi +5Legal Reasoning TasksLLM Reasoning Strategies

  50. AI scientists produce results without reasoning scientifically

    Apr 20, 2026Martiño Ríos-García, Nawaf Alampara, Chandan Gupta +5Artificial Intelligence ScientistsLLM Reasoning Strategies

  51. Targeted Exploration via Unified Entropy Control for Reinforcement Learning

    Apr 16, 2026Chen Wang, Lai Wei, Yanzhi Zhang +5Large Language Model Reinforcement LearningReasoning Trajectory

  52. Watch the Model Think: On-Policy Extraction of Activation Steering Vectors

    Feb 15, 2026Xuanbo Su, Yingfang Zhang, Hao Luo +3Linear Activation SteeringReasoning Trajectory

  53. What If We Allocate Test-Time Compute Adaptively?

    Feb 1, 2026Ahsan Bilal, Ahmed Mohsin, Muhammad Umer +4Test-Time ScalingEfficient Inference