Generative AI Evaluation

Latest papers 211

All topics
CardsList
  1. Illusions of the Gold Standard: A Large-scale Analysis of Human Evaluation Protocols for Long-form Text Generation

    Jun 6, 2026Katelyn Xiaoying Mei, Yi-Li Hsu, Minjoon Choi +5Human-in-the-Loop EvaluationScientific Reproducibility

  2. 'Your AI Text is not Mine': Redefining and Evaluating AI-generated Text Detection under Realistic Assumptions

    Jun 3, 2026Nils Dycke, Marina Sakharova, Nico Daheim +1AI-Generated Text DetectionGenerative AI Evaluation

  3. A Systematic Analysis of Linguistic Features in AI-Generated Text Detection Across Domains and Models

    Jun 2, 2026Yassir El Attar, Esra Dönmez, Maximilian Maurer +1AI-Generated Text DetectionStylometry

  4. SenseJudge: Human-Centric Preference-Driven Judgment Framework

    Jun 2, 2026Rui Li, Junfeng Liu, Xiangwen Kong +2LLM EvaluationLLM-as-a-Judge

  5. AnyAudio-Judge: A Dynamic Rubric-Based Benchmark and Evaluator for Audio Instruction Following

    Jun 2, 2026Haitao Li, Tian Tan, Yuguang Yang +2Audio-Language Model EvaluationLLM-as-a-Judge

  6. LL-Bench: Rethinking Low-Level Vision Evaluation in the Era of Large-Scale Generative Models

    Jun 1, 2026Lu Liu, Huiyu Duan, Chenxin Zhu +6Image RestorationImage Quality Assessment

  7. "I've Seen How This Goes": Characterizing Diversity via Progressive Conditional Surprise

    Jun 1, 2026Matthew Khoriaty, David Williams-King, Shi FengDiverse Text GenerationGenerative AI Evaluation

  8. Child-directed speech facilitates production, not comprehension, in BabyLMs

    May 31, 2026Bastian Bunzeck, Sina ZarrießLanguage Model PretrainingLLM Evaluation

  9. Temporally-Aligned Evaluation for Audio-Driven Talking Head Generation

    May 31, 2026Zhicheng Zhang, Lei Wang, Yu Zhang +1Talking Head GenerationAudio-Driven Facial Animation

  10. RWGBench: Evaluating Scholarly Positioning in Related Work Generation

    May 30, 2026Anzhe Xie, Weihang Su, Jiaxin Mao +4LLM EvaluationAutomated Evaluation

  11. Industrializing Prediction-Powered Inference: The GLIDE Library for Reliable GenAI and Agentic Systems Evaluation

    May 29, 2026Grégoire Martinon, Ibrahim Merad, Mohammed RakiLLM-Assisted AnnotationLLM Agent Evaluation

  12. A Persona-Based Evaluation Framework for Pluralistic Alignment in Generative AI

    May 29, 2026Atahan KaragozLLM AlignmentPersona Consistency

  13. Conformal Reliability: A New Evaluation Metric for Conditional Generation

    May 29, 2026Yachen Gao, Xinwei Sun, Yikai Wang +4Uncertainty QuantificationConformal Prediction

  14. Generative Models and Statistical Validation

    May 28, 2026Sascha Diefenbacher, Sofia Palacios Schweitzer, Gregor KasieczkaGenerative ModelingDensity Estimation

  15. Temporal Stability and Few-Shot Prompting in Math Task Assessment

    May 28, 2026Danielle S. Fox, Brenda L. Robles, Elizabeth DiPietro Brovey +1Generative AI in EducationFew-Shot Prompting

  16. The Cases LJP Never Sees: Prosecution Decision Prediction for More Complete Criminal Liability Assessment

    May 27, 2026Junyu Lu, Qi Wei, Peishuo Zheng +6AI-Assisted Decision MakingLegal Reasoning

  17. GRADE: Generalizable Reasoning-Aware Dialogue Evaluation for AI Tutors

    May 27, 2026Parth Bhalerao, Jeromy Chang, David Chou +1Intelligent Tutoring SystemsLow-Rank Adaptation

  18. GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human

    May 26, 2026Yihang Lin, Yunze Gao, Zeyang Lin +3Benchmark DesignHuman-in-the-Loop Evaluation

  19. Plans for Evaluating Structured Generative Search Summaries

    May 26, 2026Tetsuya Sakai, Jina Lee, Hanpei Fang +1Language Model Generation EvaluationSummarization Evaluation

  20. AI-Assisted Systematization for Evaluating GenAI Systems

    May 25, 2026Dhruv Agarwal, Emily Sheng, Chad Atalla +6Generative AI Evaluation

  21. NLG Evaluation: Past, Present, Future

    May 22, 2026Ehud ReiterLLM EvaluationLanguage Model Generation Evaluation

  22. EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation

    May 22, 2026Songlin Yang, Haobin Zhong, Ruilin Zhang +23VLM EvaluationVideo Quality Assessment

  23. UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment

    May 22, 2026Yuanyuan Wang, Dongchao Yang, Yayue Deng +4Reward ModelingSpeech Generation Evaluation