Faithful Explanation

Momentum

2 papers in the last four weeks, against 1 the four weeks before. 0.0% of all new papers.

Jul 6Week of Sep 21

Latest papers 20

All topics
CardsList
  1. Emergent Unfaithfulness: How Alignment Training Causes Language Models to Silently Override Task Faithfulness

    Sep 30, 2026Pardis Sadat Zahraei, Janvijay Singh, Gokhan Tur +1Large Language Model AlignmentFaithfulness

  2. AUDITPLAN: Commit, Then Answer for Auditable Safety Alignment

    Sep 16, 2026Sai Sri Pushpa Jampani, Kshitij Mishra, Asif EkbalSafety AlignmentModel Auditing

  3. SymDiag: Explainable Diagnosis for LLM Reasoning via Neuro-Symbolic Verification

    Aug 9, 2026Wenyao Cui, Huaping Zhang, Yongyi Huang +6LLM Reasoning StrategiesNeuro-Symbolic Framework

  4. Two Regimes of Chain-of-Thought Unfaithfulness: Behavioral Detection Fails Where Models Are Wrong

    Jul 26, 2026Suramya R. Angdembay, Dikshant Aryal, Nick RahimiFaithful ExplanationModel Auditing

  5. On Improving Faithfulness of Podcasts from Documents

    Jul 24, 2026Soumya Dutta, Tejas Indulal Dhamecha, Pannaga ShivaswamyExplanation FaithfulnessFaithfulness

  6. Naming the Concepts Classifiers Rely On: Language-Anchored Decomposition for Faithful Explanation

    Jul 8, 2026Ahsan Habib Akash, Dipkamal Bhusal, Stacey Jones +3Gradient-Weighted Class Activation MappingFaithful Explanation

  7. Does Role Specialization Matter for Explanation Faithfulness in Mixture-of-Experts?

    Jun 28, 2026Yeji Kim, Housam Babiker, Mi-Young Kim +1Mixture-Of-ExpertsFaithful Explanation

  8. Demystifying Variance in Circuit Discovery of LLMs

    Jun 15, 2026Frank Zhengqing Wu, Francesco Tonin, Volkan CevherMechanistic InterpretabilityCircuits

  9. Faithful Action-unit Causal Reasoning for Counterfactually Faithful Emotion Explanations

    Jun 14, 2026Van Thong Huynh, Hong Hai Nguyen, Thuy Pham +2Faithful ExplanationFree-Form Textual Rationales

  10. When the Chain of Thought Knows Better: Failure Modes in Multi-Turn Reasoning Models

    Jun 9, 2026Sai Kartheek Reddy Kasu, Nils Lukas, Samuele PoppiFaithful ExplanationLatent Failure Patterns

  11. OCC-RAG: Optimal Cognitive Core for Faithful Question Answering

    May 30, 2026Maksim Savkin, Mikhail Goncharov, Alexander Gambashidze +7Multi-Hop ReasoningLLM Reasoning Strategies

  12. Measuring Cross-Modal Synergy: A Benchmark for VLM Explainability

    May 21, 2026Joël Roman Ky, Salah Ghamizi, Maxime CordyCross-ModalUnimodal Metrics

  13. SAM-Sode: Towards Faithful Explanations for Tiny Bacteria Detection

    May 20, 2026Wanying Tan, Shuo Yan, Dazhi Huang +7Bacterial Colony CountingInterpretability

  14. B-cos GNNs: Faithful Explanations through Dynamic Linearity

    May 19, 2026Joschka Groß, Mohammad Shaique Solanki, Verena WolfExplainabilityGraph Neural Networks

  15. Step-wise Rubric Rewards for LLM Reasoning

    May 17, 2026Weichu Xie, Haozhe Zhao, Wenpu Liu +15Reinforcement Learning With Verifiable RewardRubric-Based Scoring

  16. Beyond Solver Verdicts: Generative Reward Models for Autoformalization

    Date pendingVikash Singh, Debargha Ganguly, Aman Goel +5Formal VerificationEquivalence