Reasoning Benchmark

Latest papers 216

All topics
CardsList
  1. Ontology-Grounded, Reasoner-Verified Benchmarks for Evaluating LLM Reasoning in Scientific AI

    Sep 30, 2026Nishtha N. Vaidya, Stephan Grimm, Thomas Hubauer +1Reasoning BenchmarkLLM Reasoning Strategies

  2. MatrixReward: Reward from Rubric Matrix for Open-Ended Generation

    Sep 30, 2026Zihan Shen, Qi Liu, Zixuan Yang +4Reward SignalReasoning Benchmark

  3. ArgGYM: A Procedural, Engine-Verified Benchmark for Structured Defeasible Reasoning

    Sep 29, 2026İbrahim Ethem Deveci, Funda Tan Çalık, Barış Deniz Sağlam +1Reasoning BenchmarkLLM Reasoning Strategies

  4. Learning to Prove, Not Just to Answer: Reinforcement Learning from Formal Verification for Natural-Language Logical Reasoning

    Sep 29, 2026Qili Zhang, Qianren Mao, Hanze Cai +11LLM Reasoning StrategiesReasoning Benchmark

  5. REALHOP: Rethinking Multi-Hop Reasoning Evaluation via Behavioral Auditing

    Sep 29, 2026Jiawen Tao, Xiaokun Yuan, Yaoming Li +4Multi-Hop ReasoningReasoning Benchmark

  6. MoRE: Scaling mixture of experts with hardware-aware low-rank routing

    Sep 28, 2026Honam Wong, Surbhi Goel, Enric Boix-AdseràExpertsLarge Language Model Routing

  7. Reward-Aligned Reweighting for On-Policy Distillation

    Sep 28, 2026Haofeng Xu, Junwei Su, Lansong Diao +2ReweightingProcess-Level Supervision

  8. MemoReason: Evaluating the Effect of Parametric Memory on Contextual Reasoning in LLMs

    Sep 28, 2026Zineddine Tighidet, Andrea Mogini, Jiali Mei +2LLM Reasoning StrategiesContextual Reasoning

  9. Token-Disentangled Latent Test-Time Scaling for Vision-Language Reasoning

    Sep 28, 2026Hao-Xuan Ma, Yihao Liu, Yutao Sun +8Compact Latent Sensor TokensMultimodal Large Language Models

  10. Prompted Identity Degrades Cooperation in Multi-Agent LLM Systems

    Sep 28, 2026Xavier Del Giudice, Alessio Palma, Matteo Migliarini +2Multi-Agent Large Language Model SystemsCoalition Formation

  11. Rewarding Novel Deductions: Solver-guided Process Supervision for Logical Reasoning

    Sep 28, 2026Muhammad Asif Ali, Wenqing Wang, Huan Wang +1LLM Reasoning StrategiesReasoning Benchmark

  12. MechReasoner: A Simulator and Benchmark for Mechanistic Reasoning in Qualitative Physics

    Sep 28, 2026Danilo Gusicuma, André FreitasReasoning BenchmarkUser Simulation

  13. RGDT-Bench: Benchmarking LLM Reasoning for Rule-Governed Decisions and Their Justifications

    Sep 28, 2026Jianpeng Zhao, Haihua Xu, Haoyang Zhang +7Reasoning BenchmarkLLM Reasoning Strategies

  14. TeacherGRPO: Closing the Capacity Gap in Reasoning Distillation via Teacher Alignment

    Sep 27, 2026Zhenyu Lei, Zihan Chen, Yaochen Zhu +5Teacher-Student DistillationTeacher

  15. Towards Efficient Reasoning: Learning Causal Shortcuts for Diffusion Language Models

    Sep 23, 2026Dian Jin, Kairong Han, Baohong Li +5Diffusion Language ModelsCausal Attention

  16. A Distributional Optimisation Perspective on Combining Models in Deep Learning

    Sep 21, 2026Congye Wang, Yan Lin, Zheyang Shen +2Decentralized OptimizationEnsemble

  17. Tool-Augmented On-Policy Distillation for LLM Domain Adaptation in Sequence-Based Omics Tasks

    Sep 20, 2026Jie Ying, Zhefan Wang, Zihong Chen +11Multi-Omic IntegrationReasoning Benchmark

  18. UnifiedPlayers: Enhance Tool-Integrated Reasoning in Agentic Reinforcement Learning

    Sep 17, 2026Wenjie Liao, Liangjie Zhao, Zehong CaoAgentic Reinforcement LearningReasoning Benchmark

  19. PetriBench: Benchmarking LLM Reasoning over Dynamic State Spaces

    Sep 17, 2026Pyrros Koussios, Benjamin Jäger, John Hua Yao +3Reasoning BenchmarkLLM Reasoning Strategies

  20. LLM-as-an-Improver: Turning Verification into Better Candidates

    Sep 17, 2026Akiyoshi Tomihari, Yuma IchikawaCode GenerationReasoning Benchmark

  21. Fallacy Benchmarks Measure Scheme Recognition, Not Fallacy Detection

    Sep 16, 2026Navyansh Singh, Animesh Pathak, Aarav SinghLogical FallaciesFalse-Negative Rate

  22. WFM: Wiki Foundation Model for Complex Agentic Reasoning

    Sep 16, 2026Junnan Dong, Linhao Luo, Senlei Zhang +9Long-Term Agent MemoryGraph Representations

  23. ToMAS: A Pilot Failure-Grounded Theory-of-Mind Benchmark from Multi-Agent LLM Failures

    Sep 15, 2026Muhammad Ashar Ishfaq, Glaucia MeloMulti-Agent Large Language Model SystemsLarge Language Models Fail

  24. Quantifying Logical Consistency in Transformers via Query-Key Alignment

    Sep 10, 2026Eduard Tulchinskii, Anastasia Voznyuk, Laida Kushnareva +4LLM Reasoning StrategiesReasoning Benchmark

  25. Proof-Carrying Cognition: Closing the Verification Gap with Reality-Settled Reward

    Sep 9, 2026Eshwar Reddy M, Sourav KarmakarReasoning BenchmarkSelf-Verification

  26. CRISP: Cliff-awaRe Input-adaptive Sparse Prefilling with Structural-Mass-Motivated Routing

    Sep 1, 2026Huu Huy Nguyen, Chien Van Nguyen, Franck Dernoncourt +4Dynamic Sparse AttentionLLM Inference Optimization

  27. Wrong Prediction, Right Answer: Recovering Evidence from Collapsed LLM Sequence Scores

    Aug 31, 2026Qiyao Yan, Chenpeng Wang, Liangming PanLLM Reasoning StrategiesReasoning Benchmark

  28. SocialReasonBench: A Video-QA Benchmark for Social Reasoning with Counterfactual Narrative Videos

    Aug 31, 2026Zheyu Huang, Zijing Shi, Haozhe Luo +4Social ReasoningReasoning Benchmark

  29. LCoT-GV: Graph Attention Networks for Verifying Long Reasoning Chains in Large Language Models

    Aug 31, 2026Bérénice Jaulmes, Mehwish AlamReasoning GraphsReasoning Chain

  30. EVAR: Evidence-Validated Hypothesis Admission for Budget-Aware Narrative Reasoning

    Aug 30, 2026Peilin Liu, Zhiquan Ji, Jinglong PingLLM Reasoning StrategiesEvidence-Grounded Questions

  31. Reconstructing the Right Episode: Evaluating Interleaved Conversational Memory Beyond Long Context

    Aug 26, 2026Zhexi Feng, Ruiyi Zhang, Yongbo Yang +1Conversational MemoryReasoning Benchmark

  32. SPADE: Self-Play in Adaptive Synthetic Executable Environments

    Aug 19, 2026Bo Liu, Simon Yu, Yiding Jiang +15Synthetic EnvironmentsSelf-Play

  33. From Answers to Policies: Efficient In-Context Learning System through Emulating Expert Investigation

    Aug 17, 2026Minh-Ha Nguyen, Ngoc-Ngo Quang Tran, Thuy Dung Nguyen +1Large Language Model Policy OptimizationIn-Context Learning

  34. TsuGO: Probing Search Efficiency in LLM Reasoning via Go Life-and-Death Problems

    Aug 13, 2026Shunwen Bai, Ziping Ma, Chaoyang Zhang +4LLM Reasoning StrategiesReasoning Benchmark

  35. AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses

    Aug 12, 2026Cheng Qian, Wenting Zhao, Liangwei Yang +6Inference-TimeReasoning Benchmark

  36. VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies

    Aug 12, 2026Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder +6Agentic BenchmarksReasoning Benchmark

  37. Who Thinks Best Depends on How Long You Let Them: Budget-Dependent Rankings in LLM Evaluation

    Aug 12, 2026Rodrigo Guedes de Souza, Alison R. PanissonLarge Language Model EvaluationReasoning Benchmark

  38. Beyond Solvability: Task Learnability as a Static Prior for LLM RL Post-Training

    Aug 10, 2026Ting Zhou, Zhenqing Ling, Daoyuan Chen +4Reasoning BenchmarkPost-Training

  39. Matching Supervision to the Student's Learning Capacity: A Unified Framework for On-Policy Self-Distillation

    Aug 8, 2026Yongkang Yang, Zhezheng Hao, Hong Zhang +8Unsupervised On-Policy Self-DistillationTeacher

  40. CoBa: Cost-Effective Test-Time Scaling via Compute-Balanced Routing

    Aug 7, 2026Yan Zhou, Yue Ouyang, Kaiyang Zheng +1Test-Time ScalingTest Time

  41. Reasoning Errors Have a Region and a Direction in the Residual-Stream Trajectory of LLMs

    Aug 6, 2026Hamed Damirchi, Ignacio Meza De la Jara, Damith Ranasinghe +2Reasoning ErrorsReasoning Benchmark

  42. Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility

    Aug 4, 2026Mohsen Hariri, Weicong Chen, Nahal Shahini +11Test-Time ScalingInference-Time

  43. KnowHal: A Knowledge-Driven Benchmark for Comprehensive Multimodal Hallucination Evaluation

    Aug 4, 2026Ruihan Li, Jiyang Tan, Kailin Jiang +5Citation HallucinationMultimodal Large Language Models

  44. MoEGen: Mixture-of-Experts for Instance-Adaptive LoRA Generation

    Aug 4, 2026Yiming Zeng, Lei Lu, Zexin Li +10Mixture-Of-Experts Large Language ModelsMixture-Of-Experts

  45. Reachability Is Not Realization: Tracing the Sources of LLM Benchmark Gains

    Aug 4, 2026Yanchao Li, Wanhao Liu, Jiaqing Xie +4Reasoning BenchmarkPossibilities

  46. Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR

    Aug 4, 2026Yongshi Ye, Liang Zhang, Yidong Chen +2Reinforcement Learning With Verifiable RewardRepair-Based Group-Relative Policy Optimization

  47. Unified Multi-Dimensional Benchmark for Complex Graph Reasoning in Large Language Models

    Aug 2, 2026Fali Wang, Ali Al-Lawati, Iliyas Bektas +5Reasoning BenchmarkMulti-Turn Benchmark

  48. Knowledge before Reasoning: EC-Reason-Bench, a Training-Free Diagnostic Benchmark for LLM Enzyme Classification

    Jul 29, 2026Linyu Li, Zhi Jin, Yichi Zhang +6Reasoning BenchmarkDiagnostic Benchmark

  49. Reason Popper-ly: Patching In-Context Reasoning with Inductive Logic Programming

    Jul 25, 2026Zirong Chen, Meiyi MaReasoning ChainReasoning Benchmark

  50. Frustratingly Simple Black-Box Adaptation of Language Models via Logit Bias

    Jul 24, 2026Ofek I. Cohen, Lior Shani, Aviv Rosenberg +3Large Language Model AdaptationLogit Lens