LLM Reasoning

LLM: Large Language Model

Momentum

68 papers in the last four weeks, up 143% on the four weeks before. 0.7% of all new papers.

Jul 13Week of Sep 28

Latest papers 650

All topics
CardsList
  1. Graph Evidence Is Not Enough: Diagnosing Native Decoder Use in Graph-Augmented LLMs

    Aug 31, 2026Xiaoyu Guo, Pengcheng Chen, Jiong Yu +3LLM Reasoning with GraphsLLM Reasoning

  2. When LLM Meets Tree Search: A Systematic View of Inference as Search in Large Language Models

    Aug 31, 2026Jiaqi Wei, Xiang Zhang, Yuejin Yang +10Inference-Time SearchInference-Time Scaling

  3. Answer Probing-Guided Search for Diverse Solution Exploration of LLMs

    Aug 31, 2026Yi Fang, Que Shen, Chengpeng Li +6Language Model ProbingLLM Reasoning

  4. Beyond Surface Forms: Symbolic Edits as a Test for Logical Reasoning with LLMs

    Aug 31, 2026Ramya Keerthy Thatikonda, Wray Buntine, Ehsan ShareghiLogical ReasoningLLM Evaluation

  5. AutoCRAT: Within-trajectory Joint Control of Stochasticity and Compute for LLM Reasoning

    Aug 30, 2026Hanjun Luo, Qiushi Liu, Jingya Zhang +8Adaptive InferenceLLM Inference Acceleration

  6. ACTD: Anchor-Based Cross-Tokenizer Distillation with Residual Regularization

    Aug 30, 2026Huiyi Zhang, Zijian Li, Xiaocheng Feng +4Cross-Tokenizer Knowledge DistillationCross-Architecture Knowledge Distillation

  7. DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data

    Aug 13, 2026Peter Schneider-Kamp, Jacob Nielsen, Gianluca Barmina +2Language ModelingLLM Training

  8. TsuGO: Probing Search Efficiency in LLM Reasoning via Go Life-and-Death Problems

    Aug 13, 2026Shunwen Bai, Ziping Ma, Chaoyang Zhang +4LLM EvaluationInference-Time Search

  9. Who Thinks Best Depends on How Long You Let Them: Budget-Dependent Rankings in LLM Evaluation

    Aug 12, 2026Rodrigo Guedes de Souza, Alison R. PanissonLLM EvaluationLanguage Model Generation Evaluation

  10. The Deliberative Deficit: An Empirical Critique of LLMs in Democratic Discourse

    Aug 10, 2026Maurice FlechtnerLLM EvaluationMulti-Agent Debate

  11. Consilience for Verifier-Free Test-Time Scaling

    Aug 10, 2026Lecheng Kong, Like Hui, Haitao Mao +1Inference-Time SearchTest-Time Scaling

  12. Avalon-ToM-Bench: Evaluating Fine-Grained Theory of Mind via Asymmetric Game Mechanics

    Aug 10, 2026Yen-Shan Chen, Yu Chian Duan, Chih-En Kuo +2LLM EvaluationTheory of Mind

  13. Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast

    Aug 9, 2026Jiaxin Guo, Yanwei Yue, Xuanbo Fan +2Self-Training for Language ModelsLanguage Model Distillation

  14. Matching Supervision to the Student's Learning Capacity: A Unified Framework for On-Policy Self-Distillation

    Aug 8, 2026Yongkang Yang, Zhezheng Hao, Hong Zhang +8On-Policy Self-DistillationLanguage Model Distillation

  15. Think Deep, Speak Once: Relit, A Recursive Latent Implicit Transformer Framework

    Aug 8, 2026Abhishek Panwar, Maheep Singh, Saksham BansalContinuous Latent ReasoningEfficient Language Model Inference

  16. Adaptive Supervised Anchoring for On-Policy Self-Distillation

    Aug 8, 2026Meilin Yang, Zixuan Ding, Jianhao Nie +5Supervised Fine-TuningOn-Policy Self-Distillation

  17. When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines

    Aug 7, 2026Yiyao Zhang, Diksha Goel, Hussain Ahmad +2LLM-as-a-JudgeLLM Reliability

  18. DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models

    Aug 6, 2026ZhiYan Hou, Xinyu Tang, Hongyan An +9On-Policy Self-DistillationRL for Language Model Reasoning

  19. Reasoning Errors Have a Region and a Direction in the Residual-Stream Trajectory of LLMs

    Aug 6, 2026Hamed Damirchi, Ignacio Meza De la Jara, Damith Ranasinghe +2Language Model Error DetectionLLM Interpretability

  20. Refining Over Resampling: Test-Time Self-Correction for LLM Reasoning

    Aug 6, 2026Ahsan Bilal, Muhammad Ahmed Mohsin, Muhammad Umer +4Numerical Reasoning in Language ModelsLLM Self-Correction

  21. Reasoning Core: Designing Broad Procedural Data for Completion-Supervised Reasoning Training

    Aug 5, 2026Damien Sileo, Valentin Lacombe, Dimitri KachlerSupervised Fine-TuningSynthetic Data Generation for Language Models

  22. Protoreasoning in Tiny Transformers

    Aug 5, 2026Eduardo Valle, Fergal ReidCoT ReasoningOOD Generalization

  23. When Absence Is Evidence: Evaluating Completeness-Sensitive Negative Reasoning in Large Language Models

    Aug 5, 2026Byoungjae Min, Kennedy Edemacu, Sae-Hong Cho +3LLM EvaluationLLM Grounding

  24. OmniRouting: A Semantic-Coupled Multimodal Benchmark for Constraint-Aware Spatial Reasoning in PCB Routing

    Aug 5, 2026Taiting Lu, Kaiyuan Lin, Ziwei Dong +18Benchmark DesignElectronic Design Automation