Generative AI Evaluation

Latest papers 211

All topics
CardsList
  1. SenseJudge: Human-Centric Preference-Driven Judgment Framework

    Jun 2, 2026Rui Li, Junfeng Liu, Xiangwen Kong +2LLM EvaluationLLM-as-a-Judge

  2. AnyAudio-Judge: A Dynamic Rubric-Based Benchmark and Evaluator for Audio Instruction Following

    Jun 2, 2026Haitao Li, Tian Tan, Yuguang Yang +2Audio-Language Model EvaluationLLM-as-a-Judge

  3. LL-Bench: Rethinking Low-Level Vision Evaluation in the Era of Large-Scale Generative Models

    Jun 1, 2026Lu Liu, Huiyu Duan, Chenxin Zhu +6Image RestorationImage Quality Assessment

  4. "I've Seen How This Goes": Characterizing Diversity via Progressive Conditional Surprise

    Jun 1, 2026Matthew Khoriaty, David Williams-King, Shi FengDiverse Text GenerationGenerative AI Evaluation

  5. Child-directed speech facilitates production, not comprehension, in BabyLMs

    May 31, 2026Bastian Bunzeck, Sina ZarrießLanguage Model PretrainingLLM Evaluation

  6. Temporally-Aligned Evaluation for Audio-Driven Talking Head Generation

    May 31, 2026Zhicheng Zhang, Lei Wang, Yu Zhang +1Talking Head GenerationAudio-Driven Facial Animation

  7. RWGBench: Evaluating Scholarly Positioning in Related Work Generation

    May 30, 2026Anzhe Xie, Weihang Su, Jiaxin Mao +4LLM EvaluationAutomated Evaluation

  8. Industrializing Prediction-Powered Inference: The GLIDE Library for Reliable GenAI and Agentic Systems Evaluation

    May 29, 2026Grégoire Martinon, Ibrahim Merad, Mohammed RakiLLM-Assisted AnnotationLLM Agent Evaluation

  9. A Persona-Based Evaluation Framework for Pluralistic Alignment in Generative AI

    May 29, 2026Atahan KaragozLLM AlignmentPersona Consistency

  10. Conformal Reliability: A New Evaluation Metric for Conditional Generation

    May 29, 2026Yachen Gao, Xinwei Sun, Yikai Wang +4Uncertainty QuantificationConformal Prediction

  11. Generative Models and Statistical Validation

    May 28, 2026Sascha Diefenbacher, Sofia Palacios Schweitzer, Gregor KasieczkaGenerative ModelingDensity Estimation

  12. Temporal Stability and Few-Shot Prompting in Math Task Assessment

    May 28, 2026Danielle S. Fox, Brenda L. Robles, Elizabeth DiPietro Brovey +1Generative AI in EducationFew-Shot Prompting

  13. The Cases LJP Never Sees: Prosecution Decision Prediction for More Complete Criminal Liability Assessment

    May 27, 2026Junyu Lu, Qi Wei, Peishuo Zheng +6AI-Assisted Decision MakingLegal Reasoning

  14. GRADE: Generalizable Reasoning-Aware Dialogue Evaluation for AI Tutors

    May 27, 2026Parth Bhalerao, Jeromy Chang, David Chou +1Intelligent Tutoring SystemsLow-Rank Adaptation

  15. GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human

    May 26, 2026Yihang Lin, Yunze Gao, Zeyang Lin +3Benchmark DesignHuman-in-the-Loop Evaluation

  16. Plans for Evaluating Structured Generative Search Summaries

    May 26, 2026Tetsuya Sakai, Jina Lee, Hanpei Fang +1Language Model Generation EvaluationSummarization Evaluation

  17. AI-Assisted Systematization for Evaluating GenAI Systems

    May 25, 2026Dhruv Agarwal, Emily Sheng, Chad Atalla +6Generative AI Evaluation

  18. NLG Evaluation: Past, Present, Future

    May 22, 2026Ehud ReiterLLM EvaluationLanguage Model Generation Evaluation

  19. EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation

    May 22, 2026Songlin Yang, Haobin Zhong, Ruilin Zhang +23VLM EvaluationVideo Quality Assessment

  20. UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment

    May 22, 2026Yuanyuan Wang, Dongchao Yang, Yayue Deng +4Reward ModelingSpeech Generation Evaluation

  21. Hidden Human-Like Nature of Machine-Generated Texts: Theory and Detection Enhancement

    May 22, 2026Chenwang Wu, Yiu-ming Cheung, Bo Han +1AI-Generated Text DetectionGenerative AI Evaluation

  22. Verifiable Provenance and Watermarking for Generative AI: An Evidentiary Framework for International Operational Law and Domestic Courts

    May 20, 2026Gustav Olaf Yunus Laitinen-Fredriksson Lundström-Imanov, Nurana AbdullayevaData ProvenanceDigital Forensics