Language Model Generation Evaluation

Latest papers 209

All topics
CardsList
  1. Dimension-Level Intent Fidelity Evaluation for Large Language Models: Evidence from Structured Prompt Ablation

    May 14, 2026GAng PengMultilingual Language Model EvaluationLLM Evaluation

  2. NodeSynth: Socially Aligned Synthetic Data for AI Evaluation

    May 14, 2026Qazi Mamunur Rashid, Xuan Yang, Zhengzhe Yang +5Language Model Generation EvaluationLanguage Model Safety Evaluation

  3. DiffScore: Text Evaluation Beyond Autoregressive Likelihood

    May 12, 2026Wen Lai, Yingli Shen, Dingnan Jin +4LLM EvaluationLanguage Model Generation Evaluation

  4. LLARS: Enabling Domain Expert & Developer Collaboration for LLM Prompting, Generation and Evaluation

    May 11, 2026Philipp Steigerwald, Mara Stieler, Jennifer Burghardt +2Language Model Generation EvaluationLLM Prompting

  5. StereoTales: A Multilingual Framework for Open-Ended Stereotype Discovery in LLMs

    May 11, 2026Pierre Le Jeune, Étienne Duchesne, Weixuan Xiao +4Open-Ended GenerationMultilingual Language Model Evaluation

  6. Active Testing of Large Language Models via Approximate Neyman Allocation

    May 11, 2026Zeli Liu, Jiancheng Zhang, Cong Liu +1LLM EvaluationLanguage Model Generation Evaluation

  7. NARRA-Gym for Evaluating Interactive Narrative Agents

    May 8, 2026Yue Huang, Yuchen Ma, Jiayi Ye +14Language Model Generation EvaluationInteractive Storytelling

  8. Beyond Fixed Benchmarks and Worst-Case Attacks: Dynamic Boundary Evaluation for Language Models

    May 7, 2026Haoxiang Wang, Da Yu, Huishuai ZhangLLM EvaluationLanguage Model Generation Evaluation

  9. Automatically Finding and Validating Unexpected Side-Effects of Interventions on Language Models

    May 6, 2026Quintin Pope, Ajay Hayagreeve Balaji, Jacques Thibodeau +1Language Model Generation EvaluationLLM Auditing

  10. StoryAlign: Evaluating and Training Reward Models for Story Generation

    May 6, 2026Haotian Xia, Hao Peng, Yunjia Qi +4Reward ModelingLanguage Model Generation Evaluation

  11. DoGMaTiQ: Automated Generation of Question-and-Answer Nuggets for Report Evaluation

    May 6, 2026Bryan Li, William Walden, Yu Hou +6Language Model Generation EvaluationRAG Evaluation

  12. EvoLM: Self-Evolving Language Models through Co-Evolved Discriminative Rubrics

    May 5, 2026Shuyue Stella Li, Rui Xin, Teng Xiao +8RL for Language ModelsLLM Evaluation

  13. Beating the Style Detector: Three Hours of Agentic Research on the AI-Text Arms Race

    May 4, 2026Andreas Maier, Moritz Zaiss, Siming BayerAI-Generated Text DetectionLanguage Model Generation Evaluation

  14. A multilingual hallucination benchmark: MultiWikiQHalluA

    May 4, 2026Freja Thoresen, Dan Saattrup SmartMultilingual Language ModelsMultilingual Language Model Evaluation

  15. Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese

    May 2, 2026Roseval Malaquias Junior, Giovana Kerche Bonás, Thales Sales Almeida +6LLM EvaluationLLM-as-a-Judge

  16. From Coarse to Fine: Benchmarking and Reward Modeling for Writing-Centric Generation Tasks

    Apr 30, 2026Qingyu Ren, Tianjun Pan, Xingzhou Chen +1Reward ModelingRL for Language Models

  17. MGTEVAL: An Interactive Platform for Systemtic Evaluation of Machine-Generated Text Detectors

    Apr 28, 2026Yuanfan Li, Qi Zhou, Chengzhengxu Li +5AI-Generated Text DetectionLanguage Model Generation Evaluation

  18. LongSumEval: Question-Answering Based Evaluation and Feedback-Driven Refinement for Long Document Summarization

    Apr 28, 2026Huyen Nguyen, Haoxuan Zhang, Yang Zhang +2Language Model Generation EvaluationFactual Consistency Evaluation

  19. JudgeSense: A Benchmark for Prompt Sensitivity in LLM-as-a-Judge Systems

    Apr 26, 2026Rohith Reddy Bellibatlu, Edward Raff, Wenbin ZhangLLM EvaluationLLM-as-a-Judge