Language Model Auditing

Latest papers 110

All topics
CardsList
  1. LegalHalluLens: Typed Hallucination Auditing and Calibrated Multi-Agent Debate for Trustworthy Legal AI

    Jun 16, 2026Lalit Yadav, Akshaj GurugubelliLLM Hallucination MitigationMulti-Agent Debate

  2. A Computational Audit of Demographic Association Encoding in ClinicalBERT Language Predictions

    Jun 12, 2026Kehinde Temitayo SoetanLanguage Model Bias EvaluationDemographic Bias in Language Models

  3. Detecting undisclosed LLM-generated content in parliamentary texts

    Jun 12, 2026Minerva Suvanto, Andrea McGlinchey, Peter J. Barclay +1AI-Generated Text DetectionAI Governance

  4. Measurement Under Selection: Decoy-Calibrated Failure Audits for Language Models

    Jun 8, 2026Vyzantinos Repantis, Ameya Gawde, Harshvardhan SinghLLM EvaluationLanguage Model Error Detection

  5. Cheap Reward Hacking Detection

    Jun 8, 2026Iván Belenky, Joaquín Itria, Steven JohnsReward HackingLanguage Model Auditing

  6. Building Comparative Motivation Profiles with Instrumental Interventions

    Jun 6, 2026David Vella Zarb, Rustem Turtayev, Taywon Min +2LLM Safety EvaluationCausal Interventions in Language Models

  7. LCAM: A Framework for Diagnosing Interactional Alignment Failures in Con-versational AI

    Jun 6, 2026Manuele Reani, Hongyu TianLLM AlignmentLLM Safety Alignment

  8. Epistemic Injustice in Language Models: An Audit of Pretraining Filters and Guardrails

    Jun 4, 2026Marco Antonio Stranisci, A Pranav, Rossana Damiano +2LLM GuardrailsTraining Data Curation

  9. Self-Commitment Latency: A Reward-Free Probe for Prompted Implicit Hacking

    Jun 4, 2026Bonan Shen, Youting Wang, Dingyan Shang +1Reward HackingLanguage Model Probing

  10. Where Do Deep-Research Agents Go Wrong? Span-Level Error Localization in Agent Trajectories

    Jun 1, 2026Jiaming Wang, Ziteng Feng, Jiangtao Wu +8Agent Failure AnalysisDeep Research Agents

  11. Emergent Languages in Populations of Language Model Agents: From Token Efficiency to Oversight Evasion

    May 29, 2026Stine Lyngsø Beltoft, William Brach, Federico Torrielli +5LLM SecurityLLM Safety

  12. Gram: Assessing sabotage propensities via automated alignment auditing

    May 28, 2026David Lindner, Victoria Krakovna, Sebastian FarquharAI Coding AgentsAI Agent Auditing

  13. An Empirical Audit of k-NAF Budget Accounting for Anchored Decoding

    May 27, 2026J. VijayavallabhConstrained DecodingLanguage Model Auditing

  14. QUACK: Questioning, Understanding, and Auditing Communicated Knowledge in Multimodal Social Deduction Agents

    May 26, 2026Ye Yuan, Rui Song, Weien Li +12Social Deduction GamesLLM Agent Evaluation

  15. Reading the Finetuning Prior: Verbatim Content Recovery via Contrastive Decoding Diffing

    May 25, 2026Michał Brzozowski, Zuzanna Dubanowska, Enrico Cassano +1Language Model FingerprintingPrivacy Leakage in Language Models

  16. ContextEcho: A Benchmark for Persona Drift in Long Agentic-Coding Sessions

    May 22, 2026Xianzhong Ding, Yangyang Yu, Changwei Liu +1Tool-Augmented Language Model AgentsAI Coding Agents

  17. Reading Task Failure Off the Activations: A Sparse-Feature Audit of GPT-2 Small on Indirect Object Identification

    May 21, 2026Mahdi NasermoghadasiTransformer InterpretabilitySparse Autoencoders

  18. Lost in Interpretation: The Plausibility-Faithfulness Trade-off in Cross-Lingual Explanations

    May 19, 2026Somnath Banerjee, Pranav Jha, Rima Hazra +1Multilingual Language Model EvaluationFaithfulness of Language Model Explanations

  19. TEMPO: Temporal Enforcement via Mode-Separated Policy Optimization for Trustworthy LLM Backtesting

    May 13, 2026Zeyu Zhang, Bradly C. StadieLLM EvaluationRL for Language Model Reasoning

  20. Targeted Tests for LLM Reasoning: An Audit-Constrained Protocol

    May 12, 2026Hongmin LiPrompt SensitivityLanguage Model Robustness