Explanation Consistency Score

Momentum

3 papers in the last four weeks, against 1 the four weeks before. 0.0% of all new papers.

Jul 6Week of Sep 21

Latest papers 17

All topics
CardsList
  1. PhyProbe: Rethinking Physical Consistency Evaluation in Generated Videos

    Sep 29, 2026Max Ku, Jiaojiao Fan, Zekun Hao +5Explanation Consistency ScoreSpatial Encoding

  2. Certified Against Which Oracle? Execution Labels Set the Reported Risk of Conformal Abstention for Text-to-SQL

    Sep 22, 2026Jiamiao Liu, Dewen Qiao, Yu Zhang +1OraclesText-To-Sql

  3. Principia: Relational Physics Tests for Video Models

    Sep 3, 2026Varun Varma Thozhiyoor, Shivam Tripathi, Venkatesh Babu Radhakrishnan +1Generative Video ModelsPhysics-Aware Models

  4. Measuring consistency via ensemble margin and local prediction variability: Auditing decision systems in the presence of predictive multiplicity

    Sep 1, 2026Sinjini Banerjee, Tim Marrinan, Anand D. SarwateEnsembleModel Evaluation

  5. Consistency Has a Computable Blind Spot: A Commutation Theory of Label-Free Reliability for Vision-Language Figure Reading

    Aug 6, 2026Rasul Khanbayov, Hasan KurbanExplanation Consistency ScoreBlind Spots

  6. CaricHarmony: Contrastive Diffusion Paths for Identity-Preserving Caricature Synthesis

    Jun 11, 2026Dongyu Wang, Dar-Yen Chen, Yi-Zhe SongSketchesDiffusion Models

  7. Detecting Unfaithful Chain-of-Thought via Circuit-Guided Internal-External Discrepancy

    May 25, 2026Xu Shen, Zhen Tan, Song Wang +4Reasoning TracesExplanation Consistency Score

  8. Do Image-Text Metrics Respect Semantic Invariances?

    May 23, 2026Amit Agarwal, Hitesh Laxmichand Patel, Meizhu Liu +9Image-Text AlignmentExplanation Consistency Score

  9. Enhancing Deep Neural Network Reliability with Refinement and Calibration

    May 22, 2026Ramya Hebbalaguppe, Ajay Shastry, Soumya Suvra Ghosal +1RecalibrationLoss Function

  10. Instruction Lens Score: Your Instruction Contributes a Powerful Object Hallucination Detector for Multimodal Large Language Models

    May 12, 2026Runhe Lai, Xinhua Lu, Yanqi Wu +3Citation Hallucination DetectionObject Hallucination

  11. A Semantic-Sampling Framework for Evaluating Calibration in Open-Ended Question Answering

    May 8, 2026Zhanliang Wang, Jiancong Xiao, Ruochen Jin +3Confidence EstimationLarge Language Model Evaluation

  12. Can You Break RLVER? Probing Adversarial Robustness of RL-Trained Empathetic Agents

    May 8, 2026Deeraj S K, Sadhana Devarajan, Krishna Mehra +1EmpathyReinforcement Learning With Verifiable Reward

  13. Beyond Accuracy: Policy Invariance as a Reliability Test for LLM Safety Judges

    May 7, 2026Shihao Weng, Yang Feng, Xiaofei XieLlm-As-A-JudgeJudges

  14. Generating Individual Travel Diaries Using Large Language Models Informed by Census and Land-Use Data

    Sep 7, 2025Sepehr Golrokh Amin, Devin Rhoads, Fatemeh Fakhrmoosavi +2JourneyUser Simulation

  15. TrendFact: A Benchmark Towards Hotspot Perception in Automatic Fact-Checking

    Oct 19, 2024Xiaocheng Zhang, Xi Wang, Yifei Lu +5Fact-CheckingExplanation Consistency Score