Social Bias in Language Models

Latest papers 126

All topics
CardsList
  1. The Missing Minimal Pair: Stereotype Evaluation in LLMs

    Oct 6, 2026Nataliya Stepanova, Ivan Titov, Emily Allaway +1Multilingual Language Model EvaluationSocial Bias in Language Models

  2. Latent space bias directions in LLMs capture confidence, not fairness

    Oct 6, 2026Stephanie Buttigieg, Maeve Madigan, Parameswaran Kamalaruban +1Debiased MLLanguage Model Steering

  3. FORGE: Verification-Gated Behavioral Repair for Generative Language Models

    Oct 4, 2026Hsin-Ling Hsu, Min-Yu Chen, Nai-Chia Chen +3Social Bias in Language ModelsLLM Safety

  4. Acmite: Mitigating Gender Bias in LLMs through Concept-Guided Mutual Information

    Oct 1, 2026Tian Lan, Xiaoqing Cheng, Han Zhang +1Gender Bias in Language ModelsDebiased ML

  5. LLMs Trust Their Own: Identity-Dependent Conformity in Multi-Agent Systems

    Sep 27, 2026Liron Soffer, Ravid Shwartz-Ziv, Chen ShaniNormative Conformity in Language ModelsSocial Bias in Language Models

  6. Some Dialects Are More Equal Than Others: Non-Prestigious Arabic Dialectal Bias in LLMs

    Sep 21, 2026Mai Mohamed Eida, Ryan Dolan, Paul de Nijs +1Arabic NLPSocial Bias in Language Models

  7. DyMT-ESB: Dynamic Multi-Turn Evaluation of Social Bias in User-LLM Interactions

    Sep 16, 2026Rem Hida, Masahiro Kaneko, Daisuke Oba +2Social Bias in Language ModelsMulti-Turn Dialogue Evaluation

  8. Bias Amplification in Multi-Agent Network: How Biased Agents Shape Opinions and Rhetoric

    Sep 16, 2026Omran Berjawi, Giuseppe Fenza, Rida KhatounOpinion DynamicsSocial Bias in Language Models

  9. One Example Is Enough to Pass Fairness Benchmarks: Rethinking Fairness Evaluation for Aligned LLMs

    Sep 14, 2026Naihao Deng, Samee Arif, Shuaichen Chang +2LLM EvaluationLLM Alignment

  10. When Noise Fabricates Bias: The Fragility of LLM-as-a-Judge Bias Measurement under Noisy Text

    Sep 10, 2026DongHyun Ryu, Jaehyeok Lee, YeongJun Hwang +1LLM-as-a-JudgeSocial Bias in Language Models

  11. Reference-Based Bias Detection in LLMs via Relative Representations of Hidden States

    Sep 9, 2026Marek Jeliński, Jan Dubiński, Maciej Chrabaszcz +1LLM AuditingSocial Bias in Language Models

  12. Deep and shallow biases in language models

    Sep 9, 2026An Vo, Vy Tuong Dang, Khai-Nguyen Nguyen +4Social Bias in Language ModelsLanguage Model Bias Evaluation

  13. Tracing Stereotypes from Representation to Output in Multilingual LLMs

    Sep 8, 2026Ariun-Erdene Tumurchuluun, Yusser Al Ghussin, Pinzhen Chen +2Multilingual Language ModelsSocial Bias in Language Models

  14. WinoQueer-NL: Assessing Bias in Dutch Language Models toward LGBTQ+ Identities

    Sep 2, 2026Jiska Beuk, Gerasimos SpanakisSocial Bias in Language ModelsLanguage Model Bias Evaluation

  15. SDARE-Bench: Evaluating Large Language Models on Conversational Stigma Detection and Response in Dyadic and Group Dialogue

    Sep 1, 2026Stephanie Fong, Yiwen Jiang, Zimu Wang +12LLM Safety BenchmarksSocial Bias in Language Models

  16. LLM-as-a-Demographic: Whom Sociodemographic Prompting Helps, and Whom It Hurts

    Aug 31, 2026Daniela Occhipinti, Andrea Piergentili, Marco GueriniLLM-as-a-JudgeLLM Prompting

  17. Evaluating and Mitigating Anti-LGBTQ Biases in German and Multilingual Language Models

    Aug 31, 2026Melina Morch, Daniel BraunMultilingual Language Model EvaluationSocial Bias in Language Models

  18. Hidden Threat in Synthetic Data: Covert Targeted Bias Injection through Benign Text

    Aug 31, 2026Minkyung Cho, Jihyo Kim, SeungWoo Song +4Social Bias in Language ModelsLLM Security

  19. Benevolent Bias in Multi-Turn Human-Agent Dialogue

    Aug 29, 2026Qianqi Liu, Jin Huang, Fethiye Irmak Dogan +1Social Bias in Language ModelsAlgorithmic Bias

  20. It's How You Ask: Gender-Associated Linguistic Bias in LLMs

    Aug 13, 2026Katherine Van Koevering, Anjalie FieldGender Bias in Language ModelsSocial Bias in Language Models

  21. From Values to Benchmarks: Evaluating Large Language Models for Governmental Use in Dutch

    Aug 10, 2026Laurens Samson, Iva Gornishka, Gossa Lô +2Multilingual Language Model EvaluationLLM Evaluation

  22. The Fairness Collapse Phenomenon: Bias Amplification in Language Models Trained on Synthetic Data

    Aug 4, 2026Irina Proskurina, Antoine Gourru, Julien VelcinSynthetic Data PretrainingSelf-Training for Language Models

  23. Emergence of Biased Consensus in Multi-Agent LLM Debates

    Aug 3, 2026Maya OkawaOpinion DynamicsSocial Bias in Language Models

  24. A Heuristic Perspective on Debiasing Language Models

    Aug 1, 2026Tian Lan, Yemin Wang, Chuancheng Shi +6Social Bias in Language ModelsCultural Bias in Language Models