CoT Evaluation

CoT: Chain-of-Thought

Momentum

1 paper in the last four weeks, against 2 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 15

All topics
CardsList
  1. Correct Answers, Invalid Traces: What Verifiable Grade-School Math Reveals About Chain-of-Thought Traces

    Sep 29, 2026Ratish Puduppully, Pranabendu Misra, Paarth Iyer +3Faithfulness of Language Model ExplanationsCoT Evaluation

  2. Legibility is Not Interpretability: Comparing Judged and Actual Importance in Chain-Of-Thought Reasoning

    Sep 3, 2026Kevin Du, Alexander Hoyle, Laura Ruis +1CoT FaithfulnessProcess Reward Models

  3. Beyond Polarization: The Generative Constraint of Chain-of-Thought in Pointwise Reranking

    Aug 31, 2026Xiaoyang Chen, Jie Liu, Haijin Liang +5Learning to RankCoT Evaluation

  4. Two Regimes of Chain-of-Thought Unfaithfulness: Behavioral Detection Fails Where Models Are Wrong

    Jul 26, 2026Suramya R. Angdembay, Dikshant Aryal, Nick RahimiCoT FaithfulnessCoT Evaluation

  5. RusFinChain: A Russian Benchmark for Verifiable Chain-of-Thought Reasoning in Finance with Fuzzy-Aligned Evaluation

    Jul 1, 2026M. K. ArabovLogical ReasoningLLM Evaluation

  6. Beyond Accuracy: Measuring Bias Acknowledgment in Chain-of-Thought Reasoning for Responsible AI Evaluation

    Jun 13, 2026Xian Sun, Wei Gao, Yingshuo Wang +9Language Model Generation EvaluationCoT Evaluation

  7. TRACE: Toulmin-based Reasoning Assessment through Constructive Elements for LLM CoT Evaluation

    May 28, 2026Yundong Kim, Heyoung YangLLM EvaluationLanguage Model Generation Evaluation

  8. ReasonOps: Operator Segmentation for LLM Reasoning Traces

    May 28, 2026Daniel Lee, Owen Queen, James ZouCoT EvaluationCoT Reasoning

  9. Better Accuracies, Worse Reasoning: A Step-Level Audit of Medical Chain-of-Thought Distillation

    May 27, 2026Zhaoyang Jiang, Xuanqi Peng, Fei Teng +5CoT DistillationCoT Evaluation

  10. When Reasoning Traces Become Performative: Step-Level Evidence that Chain-of-Thought Is an Imperfect Oversight Channel

    May 12, 2026Wenkai Li, Fan Yang, Ananya Hazarika +2CoT FaithfulnessLLM Auditing

  11. Latency-Response Theory Model: Evaluating Large Language Models via Response Accuracy and Chain-of-Thought Length

    Dec 7, 2025Zhiyu Xu, Jia Liu, Yixin Wang +1LLM EvaluationLatent Variable Models