Language Model Generation Evaluation

Latest papers 209

All topics
CardsList
  1. BLAST: Benchmarking LLMs with ASP-based Structured Testing

    Apr 24, 2026Manuel Alejandro Borroto Santana, Erica Coppolillo, Francesco Calimeri +3Logic ProgrammingLLM Evaluation

  2. Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models

    Apr 23, 2026Mohammed Safi Ur Rahman Khan, Sanjay Suryanarayanan, Tushar Anand +1VLM EvaluationVLM Robustness

  3. HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing

    Apr 21, 2026Andrew Zhuoer Feng, Cunxiang Wang, Yu Luo +7LLM EvaluationLLM-as-a-Judge

  4. Beyond One Output: Visualizing and Comparing Distributions of Language Model Generations

    Apr 20, 2026Emily Reif, Claire Yang, Jared Hwang +3Open-Ended GenerationData Visualization

  5. VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech

    Apr 19, 2026Yi-Cheng Lin, Yusuke Hirota, Sung-Feng Huang +1Audio-Language Model EvaluationGender Bias in Language Models

  6. Configuration Over Selection: Hyperparameter Sensitivity Exceeds Model Differences in Open-Source LLMs for RTL Generation

    Apr 18, 2026Minghao Shao, Zeng Wang, Weimin Fu +5LLM EvaluationLanguage Model Generation Evaluation

  7. IUQ: Interrogative Uncertainty Quantification for Long-Form Large Language Model Generation

    Apr 16, 2026Haozhi Fan, Jinhao Duan, Kaidi XuUncertainty QuantificationLanguage Model Generation Evaluation

  8. Polyglot Teachers: Evaluating Language Models for Multilingual Synthetic Data Generation

    Apr 13, 2026Lester James V. Miranda, Ivan Vulić, Anna KorhonenSupervised Fine-TuningMultilingual Language Models

  9. Persona Matters: Effects of Activation Steering on Short Answer Generation and Scoring

    Apr 8, 2026Yongchao Wu, Aron HenrikssonOpen-Ended GenerationLanguage Model Steering

  10. ACES: Who Tests the Tests? Leave-One-Out AUC Consistency for Code Generation

    Apr 5, 2026Hui Sun, Yun-Ji Zhang, Zheng Xie +4Language Model Generation EvaluationCode Generation Evaluation

  11. When Perplexity Lies: Generation-Focused Distillation of Hybrid Sequence Models

    Mar 27, 2026Juan Gabriel Kostelec, Qinghai GuoLLM Inference EfficiencyLLM Evaluation

  12. SpreadsheetArena: Decomposing Preference in LLM Generation of Spreadsheet Workbooks

    Feb 16, 2026Srivatsa Kundurthy, Clara Na, Michael Handley +5LLM EvaluationLanguage Model Generation Evaluation

  13. CARE: Confounder-Aware Aggregation for Reliable LLM Evaluation

    Feb 9, 2026Jitian Zhao, Changho Shin, Tzu-Heng Huang +2LLM EvaluationLLM-as-a-Judge

  14. Are LLM Evaluators Really Narcissists? Sanity Checking Self-Preference Evaluations

    Jan 30, 2026Dani Roytburg, Matthew Bozoukov, Matthew Nguyen +3LLM-as-a-JudgeLanguage Model Generation Evaluation

  15. Quantifying the Effect of Test Set Contamination on Generative Evaluations

    Jan 7, 2026Rylan Schaeffer, Joshua Kazdan, Baber Abbasi +8Language Model Generation EvaluationBenchmark Contamination

  16. Sequential Bayesian Evaluation of Large Language Model Behavior

    Nov 4, 2025Saatvik Kher, Shang Wu, Rachel Longjohn +2LLM EvaluationLanguage Model Generation Evaluation

  17. Artificial Hivemind: The Open-Ended Homogeneity of Language Models (and Beyond)

    Oct 27, 2025Liwei Jiang, Yuanjun Chai, Margaret Li +7Open-Ended GenerationLLM Evaluation

  18. Towards AI-Assisted Research Writing: Benchmarking LLMs for AI/ML Introduction Generation

    Aug 19, 2025Krishna Garg, Firoz Shaik, Sambaran Bandyopadhyay +1LLM EvaluationLanguage Model Generation Evaluation

  19. Evaluating Style-Personalized Text Generation: Challenges and Directions

    Aug 8, 2025Anubhav Jangra, Bahareh Sarrafzadeh, Silviu Cucerzan +2LLM-as-a-JudgeLanguage Model Generation Evaluation

  20. R3: Robust Rubric-Agnostic Reward Models

    May 19, 2025David Anugraha, Zilu Tang, Lester James V. Miranda +5Reward ModelingLLM Evaluation

  21. SAGE: A Search-AuGmented Evaluation of Large Language Models on Free-Form QA

    Apr 10, 2025Sher Badshah, Ali Emami, Hassan SajjadLLM EvaluationLanguage Model Generation Evaluation