Generative AI Evaluation

Latest papers 211

All topics
CardsList
  1. When Reasoning Supervision Hurts: TTCW-Based Long-Form Literary Review Generation

    May 19, 2026Jinlong Liu, Mohammed Bahja, Mark LeeSupervised Fine-TuningCreativity Assessment

  2. How Far Are We From True Auto-Research?

    May 18, 2026Zhengxin Zhang, Ning Wang, Sainyam Galhotra +1LLM Agent EvaluationAI Agent Benchmarks

  3. QQJ: Quantifying Qualitative Judgment for Scalable and Human-Aligned Evaluation of Generative AI

    May 17, 2026Marjan Veysi, Pirooz Shamsinejadbabaki, Mohammad Zare +1LLM-as-a-JudgeHuman-in-the-Loop Evaluation

  4. PromptDecipher: Supporting AI Tutor Authoring Through Editable Simulated Interactions

    May 15, 2026Miina Koyama, Ruiwei Xiao, John StamperIntelligent Tutoring SystemsLLM Prompting

  5. Defining Cultural Capabilities for AI Evaluation: A Taxonomy Grounded in Intercultural Communication Theory

    May 15, 2026Isar Nejadgholi, Masoud Kianpour, Krishnapriya Vishnubhotla +1Cultural AlignmentGenerative AI Evaluation

  6. Unsteady Metrics and Benchmarking Cultures of AI Model Builders

    May 13, 2026Stefan Baack, Christo Buschek, Maty BohacekLLM EvaluationBenchmark Design

  7. AI-Generated Slides: Are They Good? Can Students Tell?

    May 13, 2026Juho Leinonen, Lisa Zhang, Arto HellasGenerative AI in EducationGenerative AI Evaluation

  8. Beyond Text Prompts: Visual-to-Visual Generation as A Unified Paradigm

    May 12, 2026Yaofang Liu, Kangning Cui, Meng Chu +7Vision-Language ModelsConditional Image Generation

  9. Read, Grep, and Synthesize: Diagnosing Cross-Domain Seed Exposure for LLM Research Ideation

    May 12, 2026Yunju Choi, Min SongResearch Idea GenerationLarge Language Model-Guided Scientific Discovery

  10. Measuring Five-Nines Reliability: Sample-Efficient LLM Evaluation in Saturated Benchmarks

    May 11, 2026Eungyeup Kim, Chenchen Gu, Vashisth Tiwari +1LLM EvaluationLLM Reliability

  11. Grounded Satirical Generation with RAG

    May 11, 2026Oona Itkonen, Yuxin Su, Linyao Du +1Grounded Text GenerationText Generation

  12. Useful for Exploration, Risky for Precision: Evaluating AI Tools in Academic Research

    May 11, 2026Anthea Dathe, Kiran Hoffmann, Aline MangoldAI-Assisted Scientific ResearchScientific Reproducibility

  13. Active Testing of Large Language Models via Approximate Neyman Allocation

    May 11, 2026Zeli Liu, Jiancheng Zhang, Cong Liu +1LLM EvaluationLanguage Model Generation Evaluation

  14. Measuring What Matters: Benchmarking Generative, Multimodal, and Agentic AI in Healthcare

    May 8, 2026Prasanna Desikan, Harshit Rajgarhia, Shivali Dalmia +1HealthcareBenchmark Design

  15. Measuring and Mitigating the Distributional Gap Between Real and Simulated User Behaviors

    May 8, 2026Shuhaib Mehri, Philippe Laban, Sumuk Shashidhar +4Human Behavior SimulationUser Simulation

  16. Uneven Evolution of Cognition Across Generations of Generative AI Models

    May 7, 2026Isaac Galatzer-Levy, Daniel McDuff, Xin Liu +1Cognitive ModelingMultimodal Model Evaluation

  17. MIND: Monge Inception Distance for Generative Models Evaluation

    May 7, 2026Quentin Berthet, Yu-Han Wu, Clement Crepy +3Image Generation EvaluationSliced Wasserstein Distance

  18. Ex Ante Evaluation of AI-Induced Idea Diversity Collapse

    May 7, 2026Nafis Saami Azad, Raiyan Abdul BatenLLM EvaluationComputational Creativity

  19. SEQUOR: A Multi-Turn Benchmark for Realistic Constraint Following

    May 7, 2026Beatriz Canaverde, Duarte M. Alves, José Pombal +2Instruction FollowingGenerative AI Evaluation

  20. Logical Consistency as a Bridge: Improving LLM Hallucination Detection via Label Constraint Modeling between Responses and Self-Judgments

    May 5, 2026Hao Mi, Qiang Sheng, Shaofei Wang +7Hallucination in Language ModelsLLM Hallucination Detection

  21. Scale-Aware Adversarial Analysis: A Diagnostic for Generative AI in Multiscale Complex Systems

    May 1, 2026Mengke Zhao, Guang-Xing Li, Duo Xu +1Generative ModelingGenerative AI Evaluation

  22. Visual Generation in the New Era: An Evolution from Atomic Mapping to Agentic World Modeling

    Apr 30, 2026Keming Wu, Zuhao Yang, Kaichen Zhang +24World ModelsGenerative Modeling

  23. The False Resonance: A Critical Examination of Emotion Embedding Similarity for Speech Generation Evaluation

    Apr 29, 2026Yun-Shao Tsai, Yi-Cheng Lin, Huang-Cheng Chou +5TTS SynthesisSpeech Generation Evaluation