Model Interpretability

Recent momentum

+38%

22 papers in the last 28 days · 0.4% of indexed attention

Twelve weeks of publication activity for this topic as it is defined today.

Weekly history

Recent digests

What was published in this topic, kept on the site without email delivery.

Period ending 2026-09-21

9 new papers

A weekly snapshot of new work published in Model Interpretability.

Period ending 2026-09-14

8 new papers

A weekly snapshot of new work published in Model Interpretability.

Period ending 2026-09-07

5 new papers

A weekly snapshot of new work published in Model Interpretability.

269 papers

Latest in Model Interpretability

  1. Noisy-Channel Minimum Bayes Risk Decoding

    Jul 6, 2026Yusuke Sakai, Hidetaka Kamigaito, Taro WatanabeChannel ModelingBayesian

  2. Caption Bottleneck Models

    Jul 1, 2026Seref Baris Cagliyan, Umut Ozdemir, Merve Tapli +1Concept Bottleneck ModelsModel Interpretability

  3. Partition-Guided Distance Saliency: Bridging Decision and Objective Spaces in Many-Objective Optimization

    Jun 29, 2026Cláudio Lúcio do Val Lopes, Flávio Vinícius Cruzeiro Martins, Elizabeth Fialho WannerMulti-Objective OptimizationSaliency

  4. Interpreting Latent CoT Reasoning as Dynamical Systems

    Jun 20, 2026Sabari Iyyappan Duraipandian, Shreya Sanjay Boyane, Manju Nagesh +3Efficient Latent ReasoningModel Interpretability

  5. Comparing Linear Probes with Mahalanobis Cosine Similarity

    Jun 17, 2026Zhuofan Josh Ying, Peter Hase, Nikolaus KriegeskorteCosine SimilarityModel Interpretability