Language Model Auditing

Latest papers 110

All topics
CardsList
  1. Measuring the Tokenization Premium: A Cost Audit for Underserved Language Communities

    Aug 10, 2026Avijit Roy, Proma Roy, Hrishitva PatelAlgorithmic FairnessToken Efficiency

  2. Mind the Hook: Source-Level Auditing of Privacy Defenses in Retrieval-Augmented Generation

    Aug 10, 2026Yanhang Li, Zhichao Fan, Zexin ZhuangRetrieval-Augmented GenerationRAG Security

  3. Why AI Detection Fails for Academic Integrity

    Aug 6, 2026Jonathan A. Karr, Grigorii Khvatskii, Ting Hua +1AI-Generated Text DetectionLanguage Model Auditing

  4. Auditing Data Provenance in LLM Fine-tuning via Intrinsic Distributional Fingerprints

    Aug 3, 2026Zirui Huang, Yunlong Mao, Wei Tong +3Language Model FingerprintingTraining Data Attribution

  5. Auditing Medical Vision-Language Models on Chest Radiographs: Estimating Reference Agreement Across Institutions

    Aug 1, 2026Pengyang Yu, Yiou Wang, Zhongping Dong +3Chest X-Ray ClassificationMedical VLMs

  6. AIriskEval-edu Demo: Auditing of Pedagogical Risks in Educational Explanations

    Jul 28, 2026Javier Irigoyen, Roberto Daza, Francisco Jurado +5Generative AI in EducationExplainability Evaluation

  7. Learning to Detect UI Principle Violations via Reinforcement Learning

    Jul 22, 2026Nishi Mehta, Swathi Alse, Himani Kumawat +2Automated EvaluationLanguage Model Auditing

  8. Measuring Reward-Seeking via Contrastive Belief Updates

    Jul 21, 2026Axel Højmark, Jérémy Scheurer, Evgenia Nitishinskaya +5RL for Language ModelsLLM Alignment

  9. Traccia: An OpenTelemetry-Based Governance Platform for AI Systems

    Jul 15, 2026Nutan Kumar Naik, Aditya Kumar Saroj, Vijay Prasad Poudel +2AI AccountabilityAI Agent Monitoring

  10. TRACE: An Operational Reasoning Schema for Auditable Agentic Commitments

    Jul 14, 2026Edward Y. Chang, Emily J. ChangData ProvenanceReasoning Evaluation

  11. Creativity, honesty and designed forgetting emerge in small hyperbolic language models

    Jul 10, 2026Kwan Soo Shin, In Seok Kang, Yunkyung MinLLM SycophancyMemory-Augmented Language Models

  12. NL-PAC: Specification Ambiguity and Certified Minimax Risk Floors in LLM-Mediated Supervision

    Jul 9, 2026Berkay AnahtarciLLM EvaluationPartial Identification

  13. Token-Flow Firewall: Semantic Runtime Auditing for Persistent AI Agents

    Jul 9, 2026Puji Wang, Yingchen Zhang, Ruqing Zhang +2AI Agent SecurityAI Agent Monitoring

  14. Beyond Static Rules: Automated Discovery of Latent Vulnerabilities in Text-to-SQL

    Jul 4, 2026Hanqing Wang, Yongdong Chi, Jian Yang +4LLM SecurityText-to-SQL

  15. When Aggregate Alignment Misleads: Auditing Policy Repair Without Per-State Expert Actions

    Jul 3, 2026Peiying Zhu, Sidi ChangLLM Agent EvaluationPolicy Evaluation

  16. Defeat Devices in AI Systems

    Jun 27, 2026Emilio FerraraDeception in Language ModelsAI Safety Evaluation

  17. Black-Box Forensics for Conversational LLM Agents

    Jun 21, 2026Isadora White, Yasaman Jafari, Taylor Berg-KirkpatrickLanguage Model FingerprintingLLM Agent Security

  18. Channel Location Constrains the Auditability of Subliminal Learning

    Jun 20, 2026Tamas MadlSubliminal LearningLanguage Model Distillation

  19. Towards Understanding and Measuring COGNITIVE ATROPHY in LLM Behaviour

    Jun 16, 2026Abeer Badawi, Moyosoreoluwa Olatosi, Negin Baghbanzadeh +5Emotional Support ConversationMental Health