LLM Auditing

LLM: Large Language Model

Momentum

59 papers in the last four weeks, up 79% on the four weeks before. 0.6% of all new papers.

Jul 13Week of Sep 28

Latest papers 453

All topics
CardsList
  1. Alignment Plausibility: A New Standard for Assuring AI in Healthcare

    Jul 8, 2026Gwydion Williams, Sara Zannone, Bilal A MateenLLM AlignmentHealthcare

  2. Online Data Selection Is Implicit Alignment

    Jul 8, 2026Aoxiong Zeng, Yuxin Yang, Xiangquan YangSupervised Fine-TuningLLM Alignment

  3. Auto-DSM Under the Lens: A Black-Box Evaluation Framework for LLM-Based DSM Generation

    Jul 7, 2026Niels Potters, Theo HofmanLLM EvaluationLLM Auditing

  4. Faithfulness to Refusal: A Causal Audit of Neuron Selectors

    Jul 6, 2026Ananth Eswar, Pratinav Seth, Utsav Avaiya +1Transformer InterpretabilityFeature Attribution

  5. Curated retrieval versus open web search in public AI information services: a coverage-trust trade-off

    Jul 6, 2026Hafsteinn Einarsson, Hafsteinn Birgir Einarsson, Jón Gunnar Ólafsson +1LLM AuditingRAG Evaluation

  6. Detecting Answer-Driven Reasoning in LLM-Based Educational Tutors via Truncated Chain-of-Thought Auditing

    Jul 6, 2026Bonan Shen, Dingyan Shang, Youting Wang +1CoT FaithfulnessIntelligent Tutoring Systems

  7. Revealing Hidden Model Behaviors with Task-Specific Self-Reports

    Jul 3, 2026Taras Kutsyk, Bartosz ZielińskiLLM AuditingLanguage Model Introspection

  8. Reading Between the Dots: Decoding Hidden Computation across Filler Tokens

    Jul 3, 2026Kaley Brauer, Claudio Mayrink Verdun, Samuel MarksLLM AuditingLLM Interpretability

  9. Behind the Refusal: Determining Guardrail Activation via Behavioral Monitoring

    Jul 2, 2026William Hackett, Peter GarraghanLLM AuditingLLM Guardrails

  10. AIriskEval-edu: New Dataset for Risk Assessment in AI-mediated K-12 Educational Explanations

    Jul 2, 2026Javier Irigoyen, Roberto Daza, Francisco Jurado +5LLM Safety BenchmarksLLM Auditing

  11. Distill to Detect: Exposing Stealth Biases in LLMs through Cartridge Distillation

    Jul 1, 2026Shayan Talaei, Abhinav Chinta, Devvrit Khatri +3LLM AuditingLanguage Model Distillation

  12. Auditing Forgetting in Limited Memory Language Models

    Jul 1, 2026Arya Raeesi, Hanna RoedMemory-Augmented Language ModelsLLM Auditing

  13. The Moving Target: A Longitudinal Audit of Trustworthiness Drift Across Twelve Checkpoints of Open-Source Chat LLMs

    Jul 1, 2026Zhichao Fan, Yanhang Li, Zexin Zhuang +2LLM Safety BenchmarksLLM Evaluation

  14. Probing Stylistic Appropriation using Large Language Models: An Evaluation Framework for Copyright Infringement under EU Law

    Jun 30, 2026Noah Scharrenberg, Chang SunLLM-as-a-JudgeLLM Auditing

  15. Probe Choice Changes Canary-Memorization Verdicts: Three Post-Hoc Disagreement Case Studies in a Text-Dominant LoRA-Tuned Autoregressive Testbed

    Jun 30, 2026Zhichao Fan, Zexin Zhuang, Yanhang LiMemorization in Language ModelsLLM Auditing

  16. SrDetection: A Self-Referential Framework for Data Leakage Detection in Code Large Language Models

    Jun 29, 2026Shuaimin Li, Liyang Fan, Zeyang Li +9LLM EvaluationLLM Auditing

  17. Fuzzing Large Language Models to Elicit Hidden Behaviours

    Jun 28, 2026Mohammed Abu Baker, Lakshmi Babu-SaheerLLM Backdoor AttacksLLM Auditing

  18. LLMography: Transforming Human-AI Conversations into Traceability, Oversight, and Auditability Indicators

    Jun 28, 2026Mohammed BousmahLLM AuditingHuman Oversight of AI

  19. When Summaries Distort Decisions: Information Fidelity in LLM-Compressed Financial Analysis

    Jun 28, 2026Hoyoung Lee, Suhwan Park, Seunghan Lee +15LLM CompressionLLM Auditing

  20. Auditing Framing-Sensitive Behavioral Instability in Large Language Models for Mental Health Interactions

    Jun 25, 2026Abla Bedoui, Ashley L. Greene, Mohammed CherkaouiPrompt SensitivityLLM Auditing

  21. Empirical Software Engineering TerraProbe: A Layered-Oracle Framework for Detecting Deceptive Fixes in LLM-Assisted Terraform

    Jun 25, 2026Manar Alsaid, Chimdumebi Nebolisa, Faris AbbasLLM EvaluationAutomated Program Repair