Language Model Bias Evaluation

Latest papers 321

All topics
CardsList
  1. Not Your Typical Sycophant: The Elusive Nature of Sycophancy in Large Language Models

    Jan 21, 2026Shahar Ben-Natan, Oren TsurLLM EvaluationLLM Sycophancy

  2. A Scalable Entity-Based Framework for Auditing Bias in Large Language Models

    Jan 18, 2026Akram Elbouanani, Aboubacar Tuo, Adrian PopescuLLM AuditingPolitical Bias in Language Models

  3. Preserving Fairness and Safety in Quantized LLMs Through Critical Weight Protection

    Jan 17, 2026Muhammad Alif Al Hakim, Alfan Farizki Wicaksono, Fajri KotoLLM QuantizationMultilingual Language Model Evaluation

  4. Behavioral Coherence: A Method for Sensitive-Domain LLM Evaluation

    Dec 15, 2025Anika Sharma, Malavika Mampally, Chidaksh Ravuru +2Language Model Bias EvaluationDemographic Bias in Language Models

  5. Evaluating Implicit Biases in LLM Reasoning through Logic Grid Puzzles

    Nov 8, 2025Fatima Jahara, Mark Dredze, Sharon LevyGender Bias in Language ModelsLanguage Model Bias Evaluation

  6. Adaptive Generation of Bias-Eliciting Questions for LLMs

    Oct 14, 2025Robin Staab, Jasper Dekoninck, Maximilian Baader +1Social Bias in Language ModelsLanguage Model Bias Evaluation

  7. Camellia: Benchmarking Cultural Biases in LLMs for Asian Languages

    Oct 6, 2025Tarek Naous, Anagha Savit, Carlos Rafael Catalan +17Multilingual Language Model EvaluationCultural Bias in Language Models

  8. Breaking the Mirror: Activation-Based Mitigation of Self-Preference in LLM Evaluators

    Sep 3, 2025Dani Roytburg, Matthew Bozoukov, Matthew Nguyen +3LLM-as-a-JudgeLanguage Model Steering

  9. Political Ideology Shifts in Large Language Models

    Aug 22, 2025Pietro Bernardelle, Stefano Civelli, Leon Fröhling +3Political Bias in Language ModelsLanguage Model Bias Evaluation

  10. BiasGym: A Simple and Generalizable Framework for Analyzing and Removing Biases through Injection

    Aug 12, 2025Sekh Mainul Islam, Nadav Borenstein, Siddhesh Milind Pawar +3Social Bias in Language ModelsLLM Interpretability

  11. FairCoder: Probing LLM Bias in High-Stakes Decision Making via Coding Tasks

    Jan 9, 2025Yongkang Du, Jen-tse Huang, Jieyu Zhao +1Social Bias in Language ModelsAlgorithmic Fairness

  12. BTBR: A Bayesian-Theory-Driven Probabilistic-Fuzzy Framework for Implicit Bias Removal in Large Language Models

    Aug 20, 2024Yongxin Deng, Xiaoyu Tan, Jing Pan +3Social Bias in Language ModelsLanguage Model Bias Evaluation

  13. GPTBIAS: A Comprehensive Framework for Evaluating Bias in Large Language Models

    Dec 11, 2023Jiaxu Zhao, Meng Fang, Shirui Pan +2Language Model Bias EvaluationAutomated Evaluation

  14. Alignment Reduces Expressed but Not Encoded Gender Bias: A Unified Framework and Study

    Date pendingNour Bouchouchi, Thibault Laugel, Xavier Renard +3Gender Bias in Language ModelsLLM Alignment

  15. Left-Branching Transformers Excel at Right-Branching Languages: Data Shapes Word Order Preferences in Language Models

    Date pendingVarvara Arzt, Allan Hanbury, Terra BlevinsMultilingual Language ModelsDecoder-Only Language Models