Language Model Auditing

Latest papers 110

All topics
CardsList
  1. Benchmarking LLM-Based Static Analysis for Secure Smart Contract Development: Reliability, Limitations, and Potential Hybrid Solutions

    May 11, 2026Stefan-Claudiu Susan, Andrei Arusoaie, Dorel LucanuLLM EvaluationSoftware Vulnerability Detection

  2. Can You Keep a Secret? Involuntary Information Leakage in Language Model Writing

    May 11, 2026Ari Holtzman, Peter WestData LeakagePrivacy Leakage in Language Models

  3. SCALE-LoRA: Auditing Post-Retrieval LoRA Composition with Residual Merging and View Reliability

    May 2, 2026Shuaipeng Zhou, Yu ZhangUncertainty QuantificationAdapter Tuning

  4. Semia: Auditing Agent Skills via Constraint-Guided Representation Synthesis

    May 1, 2026Hongbo Wen, Ying Li, Hanzhi Liu +4AI Agent AuditingStatic Code Analysis

  5. Political Bias Audits of LLMs Capture Sycophancy to the Inferred Auditor

    Apr 30, 2026Petter Törnberg, Michelle SchimmelLLM SycophancyPolitical Bias in Language Models

  6. Structured Security Auditing and Robustness Enhancement for Untrusted Agent Skills

    Apr 28, 2026Lijia Lv, Xuehai Tang, Jie Wen +2AI Agent AuditingAI Agent Security

  7. What Makes a Good AI Review? Concern-Level Diagnostics for AI Peer Review

    Apr 21, 2026Ming JinAutomated Peer ReviewGenerative AI Evaluation

  8. Semantic Needles in Document Haystacks: Sensitivity Testing of LLM-as-a-Judge Similarity Scoring

    Apr 20, 2026Sinan G. Aksoy, Alexandra A. Sabrio, Erik VonKaenel +1Semantic Textual SimilarityLLM-as-a-Judge

  9. An Empirical Study of Multi-Generation Sampling for Jailbreak Detection in Large Language Models

    Apr 20, 2026Hanrui Luo, Shreyank N GowdaLanguage Model Safety EvaluationLLM Auditing

  10. Catching The Correct Answer Trap: Characterising AI Tutor Blind Spots When Analysing Student Reasoning

    Apr 20, 2026Moiz Imran, Sahan BulathwelaIntelligent Tutoring SystemsEducational Assessment

  11. Rater State Bias in RLHF Preference Data: An Audit Framework

    Apr 14, 2026Elena Kopteva, Vitaliy Hlynianyi-ZhukHuman Preference EvaluationHuman-in-the-Loop Annotation

  12. AuditBench: Evaluating Alignment Auditing Techniques on Models with Hidden Behaviors

    Feb 26, 2026Abhay Sheshadri, Aidan Ewart, Elias Kempf +8Benchmark AuditingAI Agent Evaluation