Reasoning Evaluation

Momentum

1 paper in the last four weeks, against 1 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 35

All topics
CardsList
  1. REALHOP: Rethinking Multi-Hop Reasoning Evaluation via Behavioral Auditing

    Sep 29, 2026Jiawen Tao, Xiaokun Yuan, Yaoming Li +4Multi-Hop QAReasoning Evaluation

  2. Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning

    Aug 5, 2026Yinghui He, Ling Yang, Jiarui Liu +6LLM EvaluationReasoning Evaluation

  3. Does Accuracy Equal Evidence? Reasoning Faithfulness under KV Cache Compression

    Aug 3, 2026Mengting Ai, Jingrui He, Yue GuoCoT FaithfulnessReasoning Evaluation

  4. A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models

    Jul 28, 2026Vivek Shukla, Varun Shukla, Atul +2CoT FaithfulnessMathematical Reasoning Benchmarks

  5. Reference-Free Evaluation of Reasoning in Open-Ended Question Answering

    Jul 22, 2026Guneet Singh Kohli, Yuxiang Zhou, Michael Sejr Schlichtkrull +2LLM-as-a-JudgeReasoning Evaluation

  6. TRACE: An Operational Reasoning Schema for Auditable Agentic Commitments

    Jul 14, 2026Edward Y. Chang, Emily J. ChangData ProvenanceReasoning Evaluation

  7. Can We Trust LLM's Logic? Quantifying Uncertainty, Coherence, and Robustness via a Graph-Based Framework

    Jul 9, 2026Riccardo Revalor, Jalees Rehman, Debjit PalCoT FaithfulnessLLM Reasoning with Graphs

  8. Position: Correct Answer, Wrong Mechanism -- When AI Scientists Defend General Claims Their Own Data Contradicts

    Jun 22, 2026Steven Young EuligAI Agent ReliabilityReasoning Evaluation

  9. CulMind: Benchmarking Multimodal Understanding and Reasoning in Chinese Cultural Heritage

    Jun 19, 2026Zhangwei Cao, Shuhan Fan, Yuting Wei +5Benchmark ConstructionReasoning Evaluation

  10. Beyond Accuracy: Measuring Logical Compliance of Predictive Models

    Jun 18, 2026Guillaume Olivier Delplanque, Pierre Genevès, Nabil Layaïda +1Reasoning Evaluation

  11. AudioProcessBench: Benchmark for Identifying Process Errors in Audio-Grounded Reasoning

    Jun 7, 2026Xiangyu Zhao, Junyu Yan, Yaling Shen +7Audio-Language Model EvaluationReasoning Evaluation

  12. Thinking Past the Answer: Evaluating Harmful Overthinking in Large Reasoning Models

    Jun 1, 2026Simone Caldarella, Davide Talon, Rahaf Aljundi +2LLM EvaluationOverthinking in Language Models

  13. An Enigma of Artificial Reason: Investigating the Production-Evaluation Gap in Large Reasoning Models

    May 31, 2026Mingzhong Sun, Teresa Yeo, Armando Solar-Lezama +1Reasoning EvaluationLLM Interpretability

  14. ProvMind: Provenance-grounded reasoning for materials synthesis

    May 27, 2026Yiming Zhang, Ryo Tamura, Koji TsudaReasoning EvaluationMaterials Science

  15. The Shape of Overthinking: Backtracking Bursts in Long Reasoning Traces

    May 27, 2026Navid Rezazadeh, Arash Gholami DavoodiReasoning EvaluationEfficient Language Model Inference

  16. Composition Collapse: Stable Factual Knowledge Does Not Imply Compositional Reasoning

    May 26, 2026Zhe Yu, Wenpeng Xing, Yunzhao Wei +4Compositional ReasoningReasoning Evaluation

  17. Reasoning-Trace Collapse: Evaluating the Loss of Explicit Reasoning During Fine-Tuning

    May 20, 2026Lukas Twist, Helen Yannakoudakis, Jie M. ZhangSupervised Fine-TuningReasoning Evaluation

  18. Strikingness-Aware Evaluation for Temporal Knowledge Graph Reasoning

    May 13, 2026Rikui Huang, Shengzhe Zhang, Wei WeiReasoning EvaluationTemporal Link Prediction

  19. Measuring AI Reasoning: A Guide for Researchers

    May 4, 2026Munachiso Samuel Nwadike, Zangir Iklassov, Kareem Ali +2Reasoning EvaluationLLM Reasoning

  20. ISAAC: Auditing Causal Reasoning in Deep Models for Drug-Target Interaction

    May 3, 2026Barbara Tarantino, Sun Kim, Yijingxiu Lu +1Reasoning EvaluationCausal Interpretability

  21. Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks

    Apr 21, 2026Jing Jin, Hao Liu, Yan Bai +9Reasoning EvaluationMultimodal Reasoning

  22. STaD: Scaffolded Task Design for Identifying Compositional Skill Gaps in LLMs

    Apr 20, 2026Sungeun An, Swanand Ravindra Kadhe, Shailja Thakur +2LLM EvaluationReasoning Evaluation

  23. A Very Big Video Reasoning Suite

    Feb 23, 2026Maijunxian Wang, Ruisi Wang, Juyi Lin +53Reasoning EvaluationVideo Reasoning

  24. Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation

    Feb 10, 2026Pei-Chi Pan, Yingbin Liang, Sen LinReward ModelingReward Hacking

  25. AMVICC: A Novel Benchmark for Cross-Modal Failure Mode Profiling for VLMs and IGMs

    Jan 20, 2026Aahana Basappa, Pranay Goel, Anusri Karra +3Reasoning EvaluationMultimodal Large Language Models

  26. StatEval: A Comprehensive Benchmark for Large Language Models in Statistics

    Oct 10, 2025Yuchen Lu, Run Yang, Yichen Zhang +6LLM EvaluationReasoning Evaluation

  27. Who Benchmarks the Benchmarks? Towards Comprehensive Evaluation of Commonsense Reasoning Benchmarks

    Apr 10, 2025Pavel Chizhov, Anton Changalidis, Vishnu Prasad Vijaya Kumar +4Benchmark AuditingReasoning Evaluation