Generative AI Evaluation

Latest papers 211

All topics
CardsList
  1. GameCommBench: A Unified Benchmark and Type-Aware Evaluation for AI-Generated Game Commentary

    Oct 8, 2026Qirui Zheng, Zhengteng Lin, Yunyi Xiao +7Generative AI Evaluation

  2. Do Generative Priors Align with Human Naturalness Perception?

    Oct 7, 2026Taiki FukiageGenerative ModelingGenerative AI Evaluation

  3. Sample-Optimal Estimation of the Fréchet Inception Distance

    Oct 5, 2026Ziyun Chen, Jerry Li, Kevin Tian +1Generative AI Evaluation

  4. The GenAI4IDN Benchmark 3.0 - a Public Tool to Assess Generative AI Tools for the Design of Interactive Digital Narratives

    Oct 4, 2026Hartmut Koenitz, Jonathan Barbara, Mirjam Palosaari EladhariInteractive StorytellingGenerative AI Evaluation

  5. More Claims, Less Evidence: Bounded Verification of AI-Generated Digital Knowledge Artifacts

    Oct 4, 2026Feliks Bańka, Jarosław A. ChudziakClaim VerificationAutomated Fact-Checking

  6. When Verifiable Counts Depend on Wording: Auditing Wording Robustness in Instruction Following

    Oct 4, 2026Qishi Zhan, Seoyeon Jang, Zihan Dong +3LLM EvaluationInstruction Following

  7. Verifiable, Articulable, and Tacit Components of Preference

    Oct 2, 2026Alexander Spangher, Sheldon S. Huang, Andreas Haupt +4Human Preference ModelingPreference Learning

  8. Evaluating Physical Consistency and Plausibility in Generative Scenario Models for Autonomous Driving

    Oct 1, 2026Manasa Mariam Mammen, Zafer Kayatas, Stefan WagnerAutonomous Driving Safety EvaluationAutonomous Driving Scenario Generation

  9. Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers

    Sep 30, 2026Yerim Oh, Young-Jun Lee, Jaewoo Ahn +2AI-Generated Text DetectionScientific Reasoning in Language Models

  10. A Shared Taste for Model-Written Text: The Generator-by-Selector Matrices of "AI-AI Bias" Show No Detectable Own-Model Premium

    Sep 30, 2026Dmitrij ŻatuchinLLM EvaluationLanguage Model Bias Evaluation

  11. Can Generative AI Automate Data Extraction for Meta-Analysis? A Case Study on Intercropping Research

    Sep 28, 2026Zehao Lu, Xingguo Xiong, Wopke van der Werf +2Multi-Agent LLM SystemsLLM Information Extraction

  12. Investigating Human--AI Discrepancies via Multiple-Solution Problems

    Sep 28, 2026Zihao Wang, Francesco Insulla, Andrea MontanariGenerative AI EvaluationLLM Reasoning

  13. Coherence-Aware Distributional Evaluation of Open-Ended Text Generation

    Sep 28, 2026Jinnuo Liu, Junhao Zhu, Weifeng Jiang +2Language Model Generation EvaluationGenerative AI Evaluation

  14. Reference-Based Analysis of Coherence and Diversity in Open-Ended Text Generation

    Sep 23, 2026Esteban Garcés AriasOpen-Ended GenerationLanguage Model Generation Evaluation

  15. Seeing Is Not Perceiving: When Synthetic Consumers Can and Cannot Pretest Visual Marketing

    Sep 22, 2026Yi-Lin Tsai, Yung-Hsiu, LaiHuman Oversight of AIGenerative AI Evaluation

  16. A Latent Distribution Perspective on Evaluating and Improving Latent Generative Models

    Sep 21, 2026Xianghong Fang, Wenjie Shu, Tongda Xu +3Distribution ShiftGenerative AI Evaluation

  17. EnterpriseVal: Quantifying the Efficacy, Reliability and Value of Generative AI in the Enterprise

    Sep 18, 2026Abbas Raza Ali, Muhammad Ajmal Siddiqui, Moona ZahidHuman-in-the-Loop EvaluationLLM Reliability

  18. Edustories: A Collection of Real-world Case Studies from Classroom Practices

    Sep 17, 2026Michal Štefánik, Jan Nehyba, Jirina Karasova +4AI in EducationEducational Data Mining

  19. Reporting Practice Matters: The Impact of Reference Choice on Chest X-ray Report Evaluation

    Sep 16, 2026Daniel P. Jeong, Charles Q. Li, Hossein Hosseiny +5Radiology Report GenerationGenerative AI Evaluation

  20. "If I Had to Buy Just ONE: Galaxy S26 Ultra": Auditing AI-Generated Product Recommendations

    Sep 16, 2026Lucas G. Uberti-Bona Marin, Thales Bertaglia, Giovanni Astante +5Language Model Bias EvaluationLarge Language Model-Based Recommendation

  21. I code or AI code: A comparative evaluation of AI-rated scores in classroom observations

    Sep 16, 2026Y. Fong, J. Xiang, T. Y. D. Chan +2LLM-as-a-JudgeEducational Assessment

  22. Issue Bias in Generative AI Writing Assistance: Political Issues and LLMs in the Swedish 2026 Election

    Sep 14, 2026Bastiaan Bruinsma, Annika Fredén, Paul Röttger +2Political Discourse AnalysisPolitical Bias in Language Models

  23. Watermarks Without Verification: AI Text Watermarking After the EU AI Act

    Sep 10, 2026Alexander Nemecek, Vipin Chaudhary, Erman AydayText WatermarkingAI Accountability