Language Model Bias Evaluation

Latest papers 321

All topics
CardsList
  1. AI-Mediated Communication Can Steer Collective Opinion

    May 15, 2026Stratis Tsirtsis, Kai Rawal, Chris Russell +2Opinion DynamicsLLM Auditing

  2. Faithful or Fabricated? A Causal Framework for Rationalization Bias in LLM Judges

    May 13, 2026Riya Tapwal, Abhishek Kumar, Carsten MapleLLM-as-a-JudgeFaithfulness of Language Model Explanations

  3. Just Ask for a Table: A Thirty-Token User Prompt Defeats Sponsored Recommendations in Twelve LLMs

    May 12, 2026Andreas Maier, Jeta Sopa, Gozde Gul Sahin +2LLM AuditingLLM Prompting

  4. Pretraining Exposure Explains Popularity Judgments in Large Language Models

    May 12, 2026Jamshid Mozafari, Bhawna Piryani, Adam JatowtLanguage Model PretrainingLanguage Model Bias Evaluation

  5. GKnow: Measuring the Entanglement of Gender Bias and Factual Gender

    May 12, 2026Leonor Veloso, Hinrich SchützeGender Bias in Language ModelsLLM Interpretability

  6. Simulating Eating Disorder Patients with LLMs: Evaluating Psychological Persona Stability in Multi-Turn Conversations

    May 12, 2026Jennifer Haase, Jana Gonnermann-Müller, See Heng Yim +3Persona ConsistencyPersonality Modeling in Language Models

  7. Auditing Multimodal LLM Raters: Central Tendency Bias in Clinical Ordinal Scoring

    May 11, 2026Jiaqing Zhang, Sandeep Elluri, Bhanu Cherukuvada +7LLM AuditingMultimodal Large Language Models

  8. Navigating the Sea of LLM Evaluation: Investigating Bias in Toxicity Benchmarks

    May 11, 2026Regina Gugg, Selina Niederländer, Andreas Stöckl +1Language Model Safety EvaluationLanguage Model Bias Evaluation

  9. StereoTales: A Multilingual Framework for Open-Ended Stereotype Discovery in LLMs

    May 11, 2026Pierre Le Jeune, Étienne Duchesne, Weixuan Xiao +4Open-Ended GenerationMultilingual Language Model Evaluation

  10. BiAxisAudit: A Novel Framework to Evaluate LLM Bias Across Prompt Sensitivity and Response-Layer Divergence

    May 9, 2026Jialing Gan, Junhao Dong, Songze LiPrompt SensitivityLLM Auditing

  11. Political Plasticity: An Analysis of Ideological Adaptability in Large Language Models

    May 8, 2026Bruno Bianchi, Diego Tiscornia, Matias Travizano +1Political Bias in Language ModelsLanguage Model Bias Evaluation

  12. CyBiasBench: Benchmarking Bias in LLM Agents for Cyber-Attack Scenarios

    May 8, 2026Taein Lim, Seongyong Ju, Munhyeok Kim +2AI Agent Security BenchmarksLLMs for Cybersecurity

  13. Is She Even Relevant? When BERT Ignores Explicit Gender Cues

    May 8, 2026Jonas Klein, Chiara Manna, Eva VanmassenhoveLanguage Model PretrainingGender Bias in Language Models

  14. Prompt Engineering Strategies for LLM-based Qualitative Coding of Psychological Safety in Software Engineering Communities: A Controlled Empirical Study

    May 8, 2026Moaath Alshaikh, Tasneem Alshaher, Ricardo Vieira +7Software EngineeringLLM Evaluation

  15. MultiSoc-4D: A Benchmark for Diagnosing Instruction-Induced Label Collapse in Closed-Set LLM Annotation of Bengali Social Media

    May 7, 2026Souvik Pramanik, S. M. Riaz Rahman Antu, Shak Mohammad Abyad +2LLM EvaluationLLM-Assisted Annotation

  16. Are LLMs Ready for Conflict Monitoring? Empirical Evidence from West Africa

    May 5, 2026Hoffmann Muki, Olukunle OwolabiText ClassificationAdversarial Robustness of Language Models

  17. EQUITRIAGE: A Fairness Audit of Gender Bias in LLM-Based Emergency Department Triage

    May 5, 2026Richard J. Young, Alice M. MatthewsGender Bias in Language ModelsClinical Triage

  18. TriBench-Ko: Evaluating LLM Risks in Judicial Workflows

    May 5, 2026Haesung Lee, Gyubin Choi, Eun-Ju Lee +5LLM EvaluationLanguage Model Safety Evaluation

  19. Measuring and Mitigating Bias in Code Generated by Large Language Models

    May 5, 2026Yuxi Chen, Yutian Tang, Timothy StorerAlgorithmic BiasLanguage Model Bias Evaluation

  20. Moral Sensitivity in LLMs: A Tiered Evaluation of Contextual Bias via Behavioral Profiling and Mechanistic Interpretability

    May 4, 2026Yash Aggarwal, Atmika Gorti, Vinija Jain +3Moral Reasoning in Language ModelsSocial Bias in Language Models

  21. Do Large Language Models Plan Answer Positions? Position Bias in Multiple-Choice Question Generation

    May 3, 2026Xuemei Tang, Xufeng Duan, Zhenguang G. CaiLanguage Model Bias EvaluationPosition Bias

  22. Are LLMs More Skeptical of Entertainment News?

    May 3, 2026Huiqian LaiFake News DetectionText Classification

  23. Auditing demographic bias in AI-based emergency police dispatch: a cross-lingual evaluation of eleven large language models

    May 2, 2026William Guey, Wei Zhang, Pierrick Bougault +4Multilingual Language Model EvaluationLLM Auditing