Social Bias in Language Models

Latest papers 126

All topics
CardsList
  1. STEREODISCO: Discovering Stereotypicality in LLMs

    Jul 30, 2026Farane Jalali Farahani, Corina Dima, Mojtaba Nayyeri +2Social Bias in Language ModelsRepresentation Geometry in Language Models

  2. From Minds to Models: The Intersection of Psychology and LLM Behaviours

    Jul 30, 2026Oliver Guidetti, Reza RyanSocial Bias in Language ModelsImplicit Bias

  3. Same Facts, Different Diagnosis: Measuring and Mitigating Narrative Anchoring in Clinical Language Models

    Jul 29, 2026Prabhjot Singh, Pritam Deka, Vijay ChennareddySocial Bias in Language ModelsClinical Reasoning

  4. Evaluating Regional Bias in LLMs From Abstract Stereotype to Concrete Social Decision-Making

    Jul 29, 2026Jiayuan Di, Haoyi Yang, Yufei Luo +2Social Bias in Language ModelsCultural Bias in Language Models

  5. QuantiBias: Benchmarking Quantization-Induced Bias in LLMs

    Jul 23, 2026Emilio FerraraOpen-Ended GenerationLLM Quantization

  6. AutoJourn: Multi-Perspective Summarisation, Bias Detection and Bias Neutralisation for LLM-Generated News in Automated Journalism

    Jul 21, 2026Himel Ghosh, Ahmed Mosharafa, Georg GrohSocial Bias in Language ModelsText Summarization

  7. The Misclassification of Autistic Writing as AI-Generated

    Jul 16, 2026Summer Chambers, Matthew C. KelleyAI-Generated Text DetectionSocial Bias in Language Models

  8. When Debiasing Backfires: Counterintuitive Side Effects of Preprocessing-Based Stereotype Mitigation

    Jul 8, 2026Yahan Zheng, John Guerrerio, Soroush Vosoughi +1Debiased MLSocial Bias in Language Models

  9. Scalable and Culturally Specific Stereotype Dataset Construction via Human-LLM Collaboration

    Jul 8, 2026Weicheng Ma, John Guerrerio, Soroush VosoughiMultilingual Language Model EvaluationSocial Bias in Language Models

  10. LLMs Silently Correct African American English: Auditing and Mitigating Dialect Bias via Activation Steering

    Jul 7, 2026Huan Wu, Ali Emami, Muhammad Furquan Hassan +5Language Model SteeringSocial Bias in Language Models

  11. Can LLMs Hire Fairly? Racial Bias in Resume Screening

    Jun 27, 2026Zhenyu Gao, Wenxi Jiang, Yutong YanGender Bias in Language ModelsSocial Bias in Language Models

  12. To Compare, or Not to Compare: On Methodological Practices in Evaluating Social Bias

    Jun 23, 2026Federico Marcuzzi, Xuefei Ning, Roy Schwartz +1Pairwise ComparisonLLM Auditing

  13. UnBias-Plus: Detect, Explain, and Rewrite Bias

    Jun 22, 2026Ahmed Y. Radwan, Ahmed ElKady, Sindhuja Chaduvula +3Explainable Artificial IntelligenceSocial Bias in Language Models

  14. Same question, different history: language, national identity, and credit in large language models

    Jun 22, 2026William Guey, Pierrick Bougault, Wei Zhang +2Social Bias in Language ModelsCultural Bias in Language Models

  15. StylisticBias: A Few Human Visual Cues Drive Most Social Biases in MLLMs

    Jun 18, 2026Shaghayegh Kolli, Timo Cavelius, Nafiseh Nikeghbal +2Social Bias in Language ModelsMultimodal Large Language Models

  16. The Wrong Kind of Right: Quantifying and Localizing Misfired Alignment in LLMs

    Jun 17, 2026Naihao Deng, Yiming Feng, Chimaobi Okite +4LLM GroundingLLM Alignment

  17. Evaluating Second-Order Bias of LLMs Through Epistemic Entitlement

    Jun 16, 2026Ramaravind Kommiya Mothilal, Terry Jingchen Zhang, Raiyan Ahmed +3LLM-as-a-JudgeSocial Bias in Language Models

  18. MIRAGE: Auditing Anti-Muslim Bias in Frontier LLMs Across Reasoning, Agentic, and Time-Coupled Conditions

    Jun 15, 2026Noor Islam S. Mohammad, Tamim SheikhLLM Safety BenchmarksLLM Auditing

  19. A Mechanistic Understanding of Pronoun Fidelity in LLMs

    Jun 15, 2026Katharina Trinley, Jesujoba O. Alabi, Dietrich Klakow +1Social Bias in Language ModelsLLM Interpretability

  20. Equity with Efficiency: An Empirical Study of Tokenizers for Multilingual Large Language Models

    Jun 13, 2026Kieron Seven Jun Wei Lee, Muhammad Reza Qorib, Andrew Ivan Soegeng +1Multilingual Language ModelsSocial Bias in Language Models

  21. Beyond Third-Person Audits: Situated Interaction Auditing for User-Centered LLM Bias Research

    Jun 10, 2026Andrés Abeliuk, Cinthia Sanchez Macias, Valentina Alarcón +2Gender Bias in Language ModelsSocial Bias in Language Models

  22. It Takes One to Bias Them All: Breaking Bad with One-Shot GRPO

    Jun 9, 2026Naihao Deng, Yilun Zhu, Naichen Shi +2LLM AlignmentSocial Bias in Language Models

  23. Neutrality Bites: Gender Representation in AI-Generated Animal Stories

    Jun 6, 2026Imani Finkley, Yuanxi Li, Melanie WalshGender Bias in Language ModelsSocial Bias in Language Models

  24. What Does Debiasing Really Remove? A Geometric Study of PCA-Based Gender Debiasing in Word Embeddings

    Jun 6, 2026Alexey Kresin, Tchifou M. Dieffi, Tomer CaspiNeural Representation GeometryWord Embeddings

  25. The Geography of Algorithmic Judgment: LLM Intermediaries, Place Identity, and Racial Steering in Housing Search

    Jun 4, 2026Hana Samad, Trung Lam, Christoph Mügge-Durum +1LLM AuditingSocial Bias in Language Models