LLM Auditing

LLM: Large Language Model

Momentum

59 papers in the last four weeks, up 79% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 453

All topics
CardsList
  1. When AI reviews science: Can we trust the referee?

    Apr 26, 2026Jialiang Wang, Yuchen Liu, Hang Xu +7LLM AuditingAdversarial Attacks on LLMs

  2. Do Prompt-Elicited Trajectories Reflect Training-Time Reward Hacking? A Systematic Study on Monitoring Trainig-Time Reward Hacking in Code Generation

    Apr 26, 2026Lichen Li, Hengguang Zhou, Yijun Liang +2RL for Code GenerationReward Hacking

  3. PermaFrost-Attack: Stealth Pretraining Seeding(SPS) for planting Logic Landmines During LLM Training

    Apr 23, 2026Harsh Kumar, Rahul Maity, Tanmay Joshi +4Language Model PretrainingLLM Backdoor Attacks

  4. Spontaneous Persuasion: An Audit of Model Persuasiveness in Everyday Conversations

    Apr 23, 2026Nalin Poungpeth, Nicholas Clark, Tanu MitraLLM AuditingHuman-AI Interaction

  5. PrivUn: Unveiling Latent Ripple Effects and Shallow Forgetting in Privacy Unlearning

    Apr 23, 2026Xiaoyi Chen, Haoyuan Wang, Siyuan Tang +4LLM AuditingPrivacy Leakage in Language Models

  6. Reliability Auditing for Downstream LLM tasks in Psychiatry: LLM-Generated Hospitalization Risk Scores

    Apr 23, 2026Shevya Panda, Shinjini Bose, Ananya JoshiPrompt SensitivityLLM Auditing

  7. Measuring Opinion Bias and Sycophancy via LLM-based Persuasion

    Apr 23, 2026Rodrigo Nogueira, Giovana Kerche Bonás, Thales Sales Almeida +7LLM SycophancyLLM Auditing

  8. Propensity Inference: Environmental Contributors to LLM Behaviour

    Apr 22, 2026Olli Järviniemi, Oliver Makins, Jacob Merizian +2LLM AlignmentLLM Auditing

  9. Behavioral Consistency and Transparency Analysis on Large Language Model API Gateways

    Apr 22, 2026Guanjie Lin, Yinxin Wan, Shichao Pei +3LLM AuditingBlack-Box Model Auditing

  10. Breaking Bad: Interpretability-Based Safety Audits of State-of-the-Art LLMs

    Apr 22, 2026Krishiv Agarwal, Ramneet Kaur, Colin Samplawski +6Language Model Safety EvaluationLLM Auditing

  11. Whose Story Gets Told? Positionality and Bias in LLM Summaries of Life Narratives

    Apr 22, 2026Melanie Subbiah, Haaris Mian, Nicholas Deas +3Gender Bias in Language ModelsLLM Auditing

  12. Detecting Data Contamination in Large Language Models

    Apr 21, 2026Juliusz Janicki, Savvas Chamezopoulos, Evangelos Kanoulas +1Membership Inference AttacksLLM Auditing

  13. Auditing LLMs for Algorithmic Fairness in Casenote-Augmented Tabular Prediction

    Apr 21, 2026Xiao Qi Lee, Ezinne Nwankwo, Angela ZhouLLM AuditingAlgorithmic Fairness

  14. An Empirical Study of Multi-Generation Sampling for Jailbreak Detection in Large Language Models

    Apr 20, 2026Hanrui Luo, Shreyank N GowdaLanguage Model Safety EvaluationLLM Auditing

  15. Beyond Indistinguishability: Measuring Extraction Risk in LLM APIs

    Apr 20, 2026Ruixuan Liu, David Evans, Li XiongLLM AuditingPrivacy Leakage in Language Models

  16. ABLE: Representing and Mapping LLMs via Attribution-Based Large-model Embedding

    Apr 20, 2026Zirui Wang, Yusen Hou, Shaofeng Liang +4LLM AuditingLanguage Model Fingerprinting

  17. AIRA: AI-Induced Risk Audit: A Structured Inspection Framework for AI-Generated Code

    Apr 19, 2026William M. ParrisLLM AuditingStatic Code Analysis

  18. Auditing Support Strategies in LLMs through Grounded Multi-Turn Social Simulation

    Apr 18, 2026Michelle Star, Andrew Aquilina, Yu-Ru LinLLM EvaluationEmotional Support Conversation

  19. One Mask to Rule Them All: On Hidden Facts after Editing and How to Find Them

    Apr 18, 2026Ali Holmov, Paul Youssef, Nandi Schoots +1Knowledge EditingTransformer Interpretability

  20. Introspection Adapters: Training LLMs to Report Their Learned Behaviors

    Apr 18, 2026Keshav Shenoy, Li Yang, Abhay Sheshadri +4LLM AuditingLanguage Model Introspection