Language Model Bias Evaluation

Latest papers 321

All topics
CardsList
  1. Persona Conditioning as an Assessor-Sensitivity Probe for LLM-Based IR Evaluation

    Aug 11, 2026Samaneh Mohtadi, Pietro Bernardelle, Joel Mackenzie +1LLM EvaluationLLM-as-a-Judge

  2. Same Question, Different Answer? Measuring and Mitigating Prompt Privilege for Equitable AI Access

    Aug 9, 2026Lier Jin, Lan Hu, Binqi Shen +2Language Model Bias EvaluationPrompt Optimization

  3. Are LLMs Positionally Consistent Ordinal Classifiers? A Systematic Evaluation

    Aug 9, 2026Yu Wang, Zhe Zhou, Menglin Liu +1Language Model Bias EvaluationClassification

  4. Fair on the Surface? Benchmarking Hidden-Output Fairness Gaps in LLM Recommenders

    Aug 8, 2026Chan Aristella Lu, Arya Fayyazi, Junhao Zhang +6LLM AuditingLanguage Model Bias Evaluation

  5. Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation

    Aug 7, 2026Sahil Pardasani, Madhusudan SinghLLM EvaluationLLM-as-a-Judge

  6. People Are Not Just Their Countries. Disentangling Social Determinants of LLM Value Alignment Across Europe

    Aug 7, 2026Maria-Louisa Wightman, Guillaume Bied, Tijl De BieLLM AlignmentComputational Social Science

  7. Confirming Our Biases? Evaluating the Capabilities, Risks, and Societal Impact of Large Language Models

    Aug 7, 2026Mudar Adas, Polina Tsvilodub, Michael Franke +1Prompt SensitivityLLM Sycophancy

  8. Critical Acclaim Orientation in Large Language Models: Evidence from Film Preference Elicitation

    Aug 7, 2026Jonghyun Jee, Aaron ShawLLM EvaluationCultural Bias in Language Models

  9. Calibrating WEAT Against Anisotropy: ZCA Whitening as a Geometric Pre-Processing Step for Embedding Association Tests

    Aug 7, 2026Seitaro Ono, Senna Ross, Jun SaikiNeural Representation GeometryText Embedding Evaluation

  10. Poli-Bias: Understanding and Measuring Large Language Model Biases in International Political Conflicts

    Aug 6, 2026Massi-Nissa Abboud, Aladin Djuhera, Elena Cabrio +1LLM SycophancyLLM Auditing

  11. LangChoiceBench: Measuring and Explaining Programming-Language Choice in LLMs

    Aug 6, 2026Lukas Twist, Twm Stone, Helen Yannakoudakis +1LLM EvaluationLanguage Model Bias Evaluation

  12. The Fairness Collapse Phenomenon: Bias Amplification in Language Models Trained on Synthetic Data

    Aug 4, 2026Irina Proskurina, Antoine Gourru, Julien VelcinSynthetic Data PretrainingSelf-Training for Language Models

  13. Unequal Verdicts: Investigating Gender Bias in LLM-Based Fake News Detection

    Aug 4, 2026Razieh Chalehchaleh, Reza Farahbakhsh, Noel CrespiGender Bias in Language ModelsFake News Detection

  14. TreeProbe : A Tibetan Medicine Benchmark for Cultural Bias in LLMs

    Aug 1, 2026Jin Zhang, Linyu Li, Weili Jiang +7Cultural Bias in Language ModelsLanguage Model Bias Evaluation

  15. From Minds to Models: The Intersection of Psychology and LLM Behaviours

    Jul 30, 2026Oliver Guidetti, Reza RyanSocial Bias in Language ModelsImplicit Bias

  16. Same Facts, Different Diagnosis: Measuring and Mitigating Narrative Anchoring in Clinical Language Models

    Jul 29, 2026Prabhjot Singh, Pritam Deka, Vijay ChennareddySocial Bias in Language ModelsClinical Reasoning

  17. Evaluating Regional Bias in LLMs From Abstract Stereotype to Concrete Social Decision-Making

    Jul 29, 2026Jiayuan Di, Haoyi Yang, Yufei Luo +2Social Bias in Language ModelsCultural Bias in Language Models

  18. OptimismBench: Forecasting Bias and the Alignment Effect in Language Model Judgment

    Jul 29, 2026Seonglae Cho, Adriano KoshiyamaLLM AlignmentLanguage Model Bias Evaluation

  19. Symphony of Bias: Exploring Gender Associations with Musical Instruments in Multimodal LLMs

    Jul 29, 2026Farhan Farsi, Shayan Bali, Mohammad Heydari Rad +2Gender Bias in Language ModelsMultimodal Large Language Models