Language Model Auditing

Latest papers 110

All topics
CardsList
  1. Whose Voice Survives the Summary? A Voice-Retention Audit of LLM Employee Listening

    Sep 30, 2026Thilo Tamme, Anton Hantel, Bijan Khosrawi-RadText SummarizationSummarization Evaluation

  2. Selecting The Most Informative Tokens in Natural Language Autoencoders

    Sep 29, 2026Federico Torrielli, Gianluca Barmina, Andrea Blasi Núñez +4LLM AuditingAutoencoders

  3. Louder, Longer, Livelier: Acoustic Shortcuts and Underspecified Rationales in Speech LLM Judges

    Sep 29, 2026Mingyue Huo, Shivam Mehta, Bhavin Jawade +2LLM-as-a-JudgeSpeech Quality Assessment

  4. Language Models Are "Insecure" Reporters

    Sep 28, 2026Jenny Y. Huang, Jiameng Fan, Ahmed Imtiaz Humayun +5Language Model Safety EvaluationDeception in Language Models

  5. Auditing Proxy-Based Validation Across Text Spans

    Sep 22, 2026Daein Weon, Dong Ho KangBenchmark ValidityAutomated Evaluation

  6. FineWeb-CLaR: Culture, Language, and Region Annotations for Benchmark-Aligned Corpus Auditing

    Sep 21, 2026Yusser Al Ghussin, Eva Gavaller, Cristina España-Bonet +2Multilingual Language Model EvaluationLLM Auditing

  7. Competence-Preserving Resume Perturbations Expose Presentation Sensitivity in LLM Screening

    Sep 15, 2026Qiangju Chen, Yang XiaoLLM EvaluationLanguage Model Robustness

  8. More than half of recent astronomy papers are written with language-model assistance

    Sep 11, 2026Serat M. Saad, Yuan-Sen TingLanguage Model Auditing

  9. Watermarks Without Verification: AI Text Watermarking After the EU AI Act

    Sep 10, 2026Alexander Nemecek, Vipin Chaudhary, Erman AydayText WatermarkingAI Accountability

  10. The Audit Decides the Verdict: Instrument Effects Rival Demographic Bias in LLM Decision Audits

    Sep 8, 2026Siddharth Vohra, Manikandan RavikiranLanguage Model Bias EvaluationDemographic Bias in Language Models

  11. When Models Defer to Wrong Answers: A Robustness Audit of Source-Attributed Cues in Multiple-Choice QA

    Sep 8, 2026Manikandan Ravikiran, Siddharth VohraMultiple-Choice Question AnsweringLLM Reliability

  12. Harness-agnostic detection and immunization of reward hacking in self-evolving language models

    Sep 7, 2026Rongxin Yang, Yang Liu, Shang Luo +10Reward HackingLanguage Model Self-Improvement

  13. Does the Selected Object Reach the Reader? Auditing Identity Handoffs in Grounded Language-Model Pipelines

    Sep 4, 2026Siddharth Vohra, Runmin Jiang, Xiaomo Li +1Question AnsweringRAG Evaluation

  14. Influence Is Not Authority: When Causal Guardrail Signals Make Legitimate Tool Use Look Like an Attack in Tool-Using LLM Agents

    Aug 30, 2026Tanzim Ahad, Ismail Hossain, Md Jahangir Alam +3LLM GuardrailsLLM Agent Security

  15. When Explanations Betray Backdoors: Black-Box Auditing for Language Model Classifiers

    Aug 12, 2026Yang Liu, Ran ZouLLM Backdoor AttacksBackdoor Detection

  16. AI Guardrail Survival under Single-Cycle Agentic Self-Summarization

    Aug 11, 2026Ted Kwartler, Alan Aqrawi, Arian AbbasiLLM GuardrailsLLM Safety Evaluation