Interpretability in RL

RL: Reinforcement Learning

Momentum

3 papers in the last four weeks, with none the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 41

All topics
CardsList
  1. Temporally Interpretable Differentiable Decision Trees

    Oct 7, 2026Eisuke Hirota, Aarav Sane, Rohan PalejaInterpretable MLInterpretability in RL

  2. Towards the Automatic Synthesis of Interpretable Chess Tactics

    Oct 6, 2026Abhijeet Krishnan, Chris MartensGame-Playing AgentsChess

  3. Learning Explainable Representations of Complex Game-playing Strategies

    Oct 6, 2026Abhijeet Krishnan, Colin M. Potts, Arnav Jhala +3Game-Playing AgentsProgram Synthesis

  4. Strategic Multi-Agent Learning for Interpretable Action Valuation of All Players in Football

    Oct 5, 2026Kenjiro Ide, Taiga Someya, Kohei Kawaguchi +1Sequential Decision MakingInterpretability in RL

  5. Escaping Local Views: Discovering Latent Concepts for Interpretable Multi-Agent Reinforcement Learning

    Sep 28, 2026Yijie Sun, Sanquan Sun, Yanda Zhu +3Reinforcement LearningPartially Observable RL

  6. Learning and interpreting policies for simultaneous entanglement requests in quantum networks

    Sep 24, 2026Leon Rode, Sumeet Khatri, Supartha PodderInterpretability in RL

  7. Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training

    Aug 8, 2026Binwen Tan, Jingchao Wang, Dengzhe Hou +6RL for Language Model ReasoningMulti-Task RL

  8. Interpretable reinforcement learning with decision-tree pruning

    Aug 7, 2026Mark Leon Ringer, Michel TokicInterpretability in RL

  9. Does Latent Context Help? A Controlled Evaluation of Inverse Reinforcement Learning in Arctic Shipping

    Aug 6, 2026Vaishnav Vaidheeswaran, Dilith Jayakody, Biruk Ambaw +3Reinforcement LearningMeta-Reinforcement Learning

  10. dtControl2+ε\varepsilon: Trading Optimality for Explainability in MDPs via Decision Trees

    Jul 28, 2026Tereza Kinská, Jan Křetínský, Tobias Meggendorfer +2Markov Decision ProcessesMarkov Models

  11. SPOTting the Future: Lookahead Explanations for Deep Reinforcement Learning

    Jul 28, 2026Tamar Gozlan, Claudia V. GoldmanInterpretable MLInterpretability in RL

  12. Interpretable GOHR Agents via Sparse Autoencoders

    Jul 27, 2026Shiwei Tan, Yusong Zhao, Weiyi Qin +6Transformer InterpretabilitySparse Autoencoders

  13. Explainable Reinforcement Learning via Physics-Aware Policy Distillation

    Jul 27, 2026Shaker Al-Tamari, Waled KadourRL ControlInterpretability in RL

  14. Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning

    Jul 26, 2026Minh Vu, Konstantinos SlavakisGaussian Mixture ModelsInterpretability in RL

  15. Explainable Reinforcement Learning for assisting Air Traffic Controllers

    Jul 24, 2026Anduel Mehmeti, Gabriella Gigante, Salvatore VenticinqueReinforcement LearningIntelligent Transportation Systems

  16. Emergent Compositional Skills in Mixture-of-Experts VLAs

    Jul 22, 2026Shlok Shah, Rhiaan Jhaveri, Tharun Kumar Tiruppali Kalidoss +3Robot Policy LearningRobot Skill Learning

  17. Explaining Reinforcement Learning Agents via Inductive Logic Programming

    Jul 15, 2026Celeste Veronese, Edoardo Zorzi, Daniele Meli +1Interpretability in RLExplainability Evaluation

  18. ORCAID: Oblique Rule-Based Continuous-Action Interpretation for Deep RL Policies

    Jul 8, 2026Ignacio D. Lopez-Miguel, Ezio Bartocci, Thomas Eiter +1Reinforcement LearningInterpretable ML

  19. Explainable Reinforcement Learning for Adaptive Traffic Signal Control

    Jul 4, 2026Dickens Kwesiga, Nishu Choudhary, Angshuman Guin +1Reinforcement LearningTraffic Signal Control

  20. What Probing Reveals about Autonomous Driving: Linking Internal Prediction Errors to Ego Planning

    Jun 30, 2026Hyeonchang Jeon, Kyungbeom Kim, Eugene Vinitsky +1Autonomous Driving Safety EvaluationAutonomous Driving Planning

  21. Hierarchical Reinforcement Learning in StarCraft Micromanagement with Influence Maps and Cluster-based Scripts

    Jun 29, 2026Chunhui Bai, Changhe Li, Dequan Li +2Hierarchical RLSparse-Reward RL

  22. SAT-RTS: A systematic framework for tactical knowledge extraction and visualization-based analysis in real-time strategy games

    Jun 29, 2026Chunhui Bai, Changhe Li, Yuqiang Li +2Game-Playing AgentsInterpretability in RL

  23. Reward-Conditioned Attention: How Reward Design Shapes What Autonomous Driving Agents See

    Jun 23, 2026Mohamed Benabdelouahad, Ahmed Djalal Hacini, Nadir Farhi +1Reward ShapingRL for Autonomous Driving

  24. Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback

    Jun 23, 2026Andreas Chouliaras, Luke Connolly, Dimitris ChatzpoulosReward ModelingHuman-in-the-Loop AI

  25. Objective-Behavior Alignment: Diagnostics for MORL Policy Selection

    Jun 19, 2026Antonio Mone, Zuzanna Osika, Florian Felten +4Multi-Objective Reinforcement LearningReinforcement Learning

  26. Learning Explicit Behavioral Models with Adaptive Questions and World-Model Probes

    Jun 5, 2026Hikaru Shindo, Yu Deng, Teng Cao +5Reinforcement LearningWorld Models

  27. Explainably Safe Reinforcement Learning

    Jun 3, 2026Sabine Rieder, Stefan Pranger, Debraj Chakraborty +2Reinforcement LearningInterpretability in RL

  28. Explainable Data-driven Deep Reinforcement Learning Methods for Optimal Energy Management in Buildings

    Jun 1, 2026Hallah Shahid Butt, Qiong Huang, Gökhan Demirel +6RL ControlReinforcement Learning