LLM Reasoning Strategies

Latest papers 797

All topics
CardsList
  1. PHRBench: A Behavioral Evaluation of Post-Hallucination Reasoning in LLMs

    Oct 7, 2026Linghao Meng, Feng He, Xuan Yang +5LLM Reasoning Strategies

  2. Bridge Routing Heads: Where Multilingual Multi-hop Reasoning Lives in LLMs

    Oct 7, 2026Seunghan Kim, Minyeong Choe, Hyunil Kim +1LLM Reasoning Strategies

  3. Which Language Should a Skeleton Speak? Language Choices in Multilingual Reasoning

    Oct 7, 2026HyeonSeok Lim, SeungWoo Song, Inho Won +3LLM Reasoning Strategies

  4. U-Space: Uncovering When and Why Uncertainty Arises in Language Models

    Oct 6, 2026Tobias Braun, Nils Loose, Alexander Herzog +4Large Language Model UncertaintyLLM Reasoning Strategies

  5. COMPASS: Finding Where Reasoning Lives in Language Models

    Oct 5, 2026Pratyay Dutta, Kowshik Thopalli, Vivek NarayanaswamyLLM Reasoning Strategies

  6. Learning without Overwriting: A Theory of Self-Distillation and Supervised Fine-Tuning in Continual Reasoning

    Oct 4, 2026Shinichi Uemura, Taiji SuzukiUnsupervised On-Policy Self-DistillationSupervised Finetuning

  7. The Missing Primitive: Diagnosing and Repairing Mathematical Reasoning in Large Language Models

    Oct 1, 2026Shuo Xing, Zilin Dai, Chengyuan Qian +7Mathematical ReasoningLLM Reasoning Strategies

  8. On Language Drift during RLVR Post-Training

    Oct 1, 2026Michael Sullivan, Alexander KollerLarge Language Model Reinforcement LearningLLM Reasoning Strategies

  9. A rubric landscape for evaluating clinical reasoning in large language models: what exists, what is missing, and what needs to be combined

    Oct 1, 2026Zhangshu Joshua Jiang, Zina Ibrahim, James T. TeoClinical Reasoning TrainingLLM Reasoning Strategies

  10. Learning to Ask: Information Acquisition for SLM-LLM Collaboration, under a budget

    Oct 1, 2026Yongjun Kim, Xiaoxiao Li, Jaeho LeeLLM Reasoning StrategiesCollaboration

  11. Probe with Participation Trophies: Random-Reward RL as a Probe of LLM Capability

    Oct 1, 2026Yu Mao, Lei Yu, Zining Zhu +6Large Language Model Reinforcement LearningLLM Reasoning Strategies

  12. ReHoPER: Receding-Horizon Planning for Enhanced Reasoning

    Oct 1, 2026Saeed Ahmadnia, Cornelia CarageaLLM Reasoning StrategiesLarge Language Model Planning

  13. Ontology-Grounded, Reasoner-Verified Benchmarks for Evaluating LLM Reasoning in Scientific AI

    Sep 30, 2026Nishtha N. Vaidya, Stephan Grimm, Thomas Hubauer +1Reasoning BenchmarkLLM Reasoning Strategies

  14. Can LLMs Reason Over Long Horizons? An Empirical Evaluation of Context Strategies for Longitudinal Clinical Reasoning

    Sep 30, 2026Taye Akinrele, Noorbakhsh Amiri Golilarz, Subash Neupane +2LLM Reasoning StrategiesEfficient Long-Context Inference

  15. Can Computation from Earlier Problems Help LLMs Solve New Ones?

    Sep 30, 2026Jipei He, Wenhui Tan, Xiaoyi Yu +4LLM Reasoning StrategiesReplay

  16. ANI: Adaptive Numerical Injection for Unifying Semantic and Arithmetic Representations in Numerical Reasoning

    Sep 30, 2026Jinsung Jeon, Seung-won HwangLLM Reasoning StrategiesBehavioral Embeddings

  17. Targeted Retrieval, Compact Representations: How CoT Reasoning Improves Long-Context Counting

    Sep 30, 2026Liang Twist Shan, Tianyu Hu, Hao Yan +1LLM Reasoning StrategiesLong-Context Reasoning

  18. Diversity Combining for Multi-Path LLM Reasoning

    Sep 30, 2026Guangsheng Yu, Litianyi Zhang, Qin Wang +5Reasoning PathsLLM Reasoning Strategies

  19. StateTree: Enhancing Long-Term Dialogue Reasoning via Reinforcement Learning

    Sep 30, 2026Naen Xu, Wanqing Cui, Yibo Hu +5LLM Reasoning StrategiesDialogue Benchmarks

  20. Provable Test-Time Scaling for Beam Search in LLM Reasoning

    Sep 29, 2026Qijia He, Yu Huang, Yuan Cheng +2Beam SearchLLM Reasoning Strategies

  21. ArgGYM: A Procedural, Engine-Verified Benchmark for Structured Defeasible Reasoning

    Sep 29, 2026İbrahim Ethem Deveci, Funda Tan Çalık, Barış Deniz Sağlam +1Reasoning BenchmarkLLM Reasoning Strategies

  22. Probability is Not Enough: Exploring and Counting Divergent Tokens for Reasoning Uncertainty Quantification in LLMs

    Sep 29, 2026Feiyang Li, Shengjing Liu, Qi Zhan +7Large Language Model UncertaintyConfidence Calibration

  23. Diagnosing and Improving Probabilistic Reasoning in Large Language Models

    Sep 29, 2026Huaman Sun, Dingcheng Wang, Jason Hartline +1LLM Reasoning StrategiesProbabilistic Model

  24. Overcoming Scaling Limits in On-Policy Self-Distillation for LLM Reasoning

    Sep 29, 2026Md. Ismail Hossain, Humaira Kousar, Isidora Chara TourniUnsupervised On-Policy Self-DistillationLLM Reasoning Strategies

  25. A Proposed Rubric for Evaluating Expressed Clinical Reasoning in Large Language Model Responses

    Sep 29, 2026Zhangshu Joshua Jiang, Zina Ibrahim, James T. TeoRubricsTask-Specific Rubrics

  26. Learning to Prove, Not Just to Answer: Reinforcement Learning from Formal Verification for Natural-Language Logical Reasoning

    Sep 29, 2026Qili Zhang, Qianren Mao, Hanze Cai +11LLM Reasoning StrategiesReasoning Benchmark

  27. What Does Post-Training Change in Multilingual Reasoning?

    Sep 29, 2026Hongyang Li, Xiao Li, Caesar Wu +2Multilingual Language ModelsLLM Reasoning Strategies

  28. ACTR: Aligning Thoughts and Responses for Multilingual Safety in Reasoning LLMs

    Sep 29, 2026Xianhui Zhang, Jian Yu, Chengyu Xie +6Multilingual SafetyLarge Language Model Safety

  29. CoEM: Empowering Long-Context Reasoning with Commit-on-Evidence Memory

    Sep 29, 2026Jingguang Li, Yebo Wu, Zuyi Guo +7Long-Context ReasoningLLM Reasoning Strategies

  30. An RL View of OPD: Least Square Policy Distillation for Sample-Efficient LLM Reasoning

    Sep 28, 2026Shangzhe Li, Yuxiao Yang, Tianrun Yu +4LLM Reasoning StrategiesOffline Reinforcement Learning

  31. Frontier Learning: Training LLM Reasoners at the Edge of Capability

    Sep 28, 2026Robin Faro, Shyam Sundhar Ramesh, Ilija Bogunovic +1LLM Reasoning StrategiesPost-Training

  32. MemoReason: Evaluating the Effect of Parametric Memory on Contextual Reasoning in LLMs

    Sep 28, 2026Zineddine Tighidet, Andrea Mogini, Jiali Mei +2LLM Reasoning StrategiesContextual Reasoning

  33. Rewarding Novel Deductions: Solver-guided Process Supervision for Logical Reasoning

    Sep 28, 2026Muhammad Asif Ali, Wenqing Wang, Huan Wang +1LLM Reasoning StrategiesReasoning Benchmark

  34. RGDT-Bench: Benchmarking LLM Reasoning for Rule-Governed Decisions and Their Justifications

    Sep 28, 2026Jianpeng Zhao, Haihua Xu, Haoyang Zhang +7Reasoning BenchmarkLLM Reasoning Strategies

  35. When Words Fall Short: Iterative Synergy Between Verbalized Reasoning and Hidden Features for LLM Confidence Estimation

    Sep 28, 2026Yekun Xu, Ante Wang, Jingyi Ren +3Confidence EstimationLarge Language Model Policy Optimization

  36. Direct Self-Evolving Optimization: Evolving LLMs without Challenger Training

    Sep 28, 2026Yuyang Deng, Yu Wang, Jiayun WangOn-Policy Self-EvolutionLLM Reasoning Strategies

  37. Learning to Optimize through Solver-Grounded Self-Play

    Sep 28, 2026Xia Jiang, Yaoxin Wu, Chenyu Zhou +3Optimization ModelingSelf-Play

  38. DISCO: Distributed Long Context Scaling with Grounding-Reasoning Disaggregation

    Sep 27, 2026Guanzheng Chen, Viet Dac Lai, Subhojyoti Mukherjee +5Efficient Long-Context InferenceLLM Reasoning Strategies

  39. Not Too Hard, Not Too Easy: Learning from Intermediate States for LLM Structured Reasoning

    Sep 27, 2026Hongbo Chen, Guohua Lu, Ting Dang +1LLM Reasoning StrategiesIntermediate States

  40. SAGE: Mitigating Long-Horizon Reasoning Biases via Topological Guidance

    Sep 24, 2026Xinyue Zeng, Jiawei Zhang, Yujun Yan +1LLM Reasoning StrategiesLong-Horizon Task Planning

  41. Prefilling the Reasoning Channel: Output-Prefix Attacks on Reasoning LLMs

    Sep 24, 2026Lukáš Brůna, Robert Bridges, Adam EkLLM Reasoning StrategiesAttacker Large Language Model

  42. Can LLMs Reason About Runtime Behavior? A Repository-Level Dynamic Benchmark

    Sep 23, 2026Hamed Taherkhani, Mohammad Abdollahi, Melika Sepidband +3Large Language Model BenchmarksLLM Reasoning Strategies

  43. DCRL: Decoupling and Coupling Reinforcement Learning via Policy-Reward Manifold Alignment

    Sep 23, 2026Henan Sun, Zehua Li, Haitao Hu +4Large Language Model Reinforcement LearningOffline Reinforcement Learning

  44. LEGO: Synergizing Expert GraphRAG and Expert Chain-of-Thought for Legal Reasoning

    Sep 22, 2026Qingjing Chen, Junkai Zhang, Shaochun Wang +7Legal Reasoning TasksLLM Reasoning Strategies

  45. Beyond Repeated Sampling: Learning Search Policies for LLM Reasoning

    Sep 22, 2026Ismail Labiad, Matthieu Kowalski, Marc Schoenauer +2LLM Reasoning StrategiesReasoning Skills

  46. Ladders of Thought: A Self-Evolving Curriculum of Progressively Simplified Reasoning Traces

    Sep 22, 2026Minghui Liu, Thomas Magelinski, Dehao Yuan +2LLM Reasoning StrategiesThoughts

  47. Rollout Efficiency in Reinforcement Learning for Reasoning Large Language Models: A Taxonomy and Future Directions

    Sep 21, 2026Niloofar Gholipour, Marcos Assuncao, Gursimran Singh +8Large Language Model Reinforcement LearningRollout

  48. PetriBench: Benchmarking LLM Reasoning over Dynamic State Spaces

    Sep 17, 2026Pyrros Koussios, Benjamin Jäger, John Hua Yao +3Reasoning BenchmarkLLM Reasoning Strategies

  49. Voice of Reason: Reinforcement Learning for Spoken Math

    Sep 16, 2026Timothée Weisselberger, Edouard Graves, Alexandre DéfossezSpeech Language ModelsMathematical Reasoning Benchmarks

  50. STRETCH the Boundaries: A Unified Self-Taught Framework for Progressive LLM Evolution

    Sep 16, 2026Yajie Yu, Mark Lee, Yue FengLLM Reasoning StrategiesEvolutionary Optimization Methods

  51. Attention Dispersion as a Diagnostic Signal for Hallucination in Large Language Models

    Sep 16, 2026Shardul P. More, Tanuja S. PawarLarge Language Model HallucinationLLM Reasoning Strategies