Generative AI Evaluation

Latest papers 211

All topics
CardsList
  1. Auditing Generalization in AI-Generated Video Detection: A Six-Control Protocol and the VidAudit Toolkit

    Jun 30, 2026Mert Onur Cakiroglu, Zhihe Lu, Mehmet Dalkilic +1Benchmark AuditingOOD Generalization

  2. The Human Creativity Benchmark

    Jun 29, 2026Aspen Hopkins, Allison Nulty, Alexandria Minetti +2Human Preference EvaluationCreativity Assessment

  3. HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data

    Jun 29, 2026Xinrui Ruan, Zhenyu Zhao, Waverly Wei +4Human-in-the-Loop EvaluationGenerative AI Evaluation

  4. Can MLLMs Critique Like Humans? Evaluating Open-Ended Aesthetic Reasoning in Multimodal Large Language Models

    Jun 29, 2026Sajjad Ghiasvand, Maryam Amirizaniani, Haniyeh Ehsani Oskouie +2Language Model Generation EvaluationMultimodal Reasoning

  5. DysLexLens: A Low-Resource LLM Framework for Analysing Dyslexic Learners Insights from Online Forums

    Jun 26, 2026Dana Rezazadegan, Atie Kia, Phongpadid Nandavong +6Social Media AnalysisGenerative AI Evaluation

  6. PixJail: Self-Evolving Paper-to-Pipeline Reproduction for Text-to-Image Jailbreak Evaluation

    Jun 23, 2026Leyi Sheng, Han Sun, Zhen Sun +4AI Safety EvaluationMultimodal Jailbreak Attacks

  7. Substitution-Based Analysis of Structural Novelty for Generative Models of Materials

    Jun 22, 2026Masahiro Negishi, Aron WalshMemorization in Generative ModelsCrystal Structure Generation

  8. Generative Responsible AI Data Evaluation Schema (GRAIDES) for AI Assurance in Local Government

    Jun 18, 2026Ethan Knights, Christopher Conlan, Temilorun Gbolahan +2AI AssuranceGenerative AI Evaluation

  9. X+Slides: Benchmarking Audience-Conditioned Slide Generation

    Jun 17, 2026Haodong Chen, Xuanhe Zhou, Wei Zhou +6Evidence-Grounded GenerationConditional Generation

  10. First Proof Second Batch

    Jun 16, 2026Mohammed Abouzaid, Nikhil Srivastava, Rachel Ward +1Mathematical Reasoning BenchmarksLLM Mathematical Reasoning

  11. LongWebBench: Evaluating Structural and Functional Webpage Generation in Long-Horizon Settings

    Jun 16, 2026Yi Zhao, Zhen Yang, Mengpan Chen +5VLM EvaluationWeb Application Generation

  12. Statistical Foundations of LLM-based A/B Testing: A Surrogacy Framework for Human Causal Inference

    Jun 15, 2026Joel Persson, Mårten Schultzberg, Sebastian AnkargrenSurrogate ModelingA/b Testing

  13. TuneJury: An Open Metric for Improving Music Generation Preference Alignment

    Jun 15, 2026Yonghyun Kim, Junwon Lee, Haiwen Xia +5Text-to-Music GenerationMusic Generation Evaluation

  14. Stable Menus of Public Goods: AI-Enabled Progress

    Jun 15, 2026Sara FishAI-Assisted Scientific ResearchHuman-AI Collaboration

  15. Rethinking Scaffolding in LLM Tutors: The Interactional Mismatch Between Benchmarks and Real-World Deployments

    Jun 14, 2026Alexandra Neagu, Jeffrey T. H. Wong, Marcus Messer +2Intelligent Tutoring SystemsAI in Education

  16. Characterizing Cultural Localization in AI-Generated Stories

    Jun 12, 2026Shaily Bhatt, Supriti Vijay, Jeremiah Milbauer +1Cultural Bias in Language ModelsLanguage Model Bias Evaluation

  17. LessonBench-V1: A Benchmark Dataset for Evaluating AI Lesson Generation Agents

    Jun 12, 2026Ravidu Suien Rammuni Silva, Ahmad Lotfi, Isibor Kennedy Ihianle +2Educational AssessmentGenerative AI in Education

  18. Humor Style Drives Laughter, Topic Shapes Acceptability: Evaluating Bilingual Personal and Political Robot-Delivered AI Jokes

    Jun 11, 2026Anna-Maria Velentza, Anne-Gwenn BosserHuman Preference EvaluationHuman-Robot Interaction

  19. GENIE: A Fine-Grained Measure for Novelty

    Jun 11, 2026Ramya Namuduri, Manya Wadhwa, Anshun Asher Zheng +2LLM EvaluationLanguage Model Generation Evaluation

  20. Sensitivity Analysis of Generative Spatial Audio Metrics: A Study on Responsiveness, Smoothness, and Symmetry

    Jun 10, 2026Purnima Kamath, Adrian S. Roman, Koichi Saito +2Automated EvaluationSpatial Audio

  21. Gaming AI-Assisted Peer Reviews Poses New Risks to the Scientific Community

    Jun 8, 2026Lin Li, Qi Zhang, Xander Davies +2Adversarial AttacksAdversarial Attacks on LLMs

  22. Assessing Sample Quality in Conditional Generation under Compositional Shift

    Jun 8, 2026Berker Demirel, Valentino Maiorca, Marco Fumero +2Distribution ShiftConditional Generation

  23. UXBench: Benchmarking User Experience in AI Assistants

    Jun 8, 2026Mengze Hong, Xia Zeng, Zeyang Lei +13LLM EvaluationUser Preference Modeling

  24. Correct Looks Better: Pairwise Comparisons Reveal Accuracy Rankings

    Jun 8, 2026Mina Remeli, Moritz HardtPairwise ComparisonLLM-as-a-Judge

  25. Illusions of the Gold Standard: A Large-scale Analysis of Human Evaluation Protocols for Long-form Text Generation

    Jun 6, 2026Katelyn Xiaoying Mei, Yi-Li Hsu, Minjoon Choi +5Human-in-the-Loop EvaluationScientific Reproducibility

  26. 'Your AI Text is not Mine': Redefining and Evaluating AI-generated Text Detection under Realistic Assumptions

    Jun 3, 2026Nils Dycke, Marina Sakharova, Nico Daheim +1AI-Generated Text DetectionGenerative AI Evaluation

  27. A Systematic Analysis of Linguistic Features in AI-Generated Text Detection Across Domains and Models

    Jun 2, 2026Yassir El Attar, Esra Dönmez, Maximilian Maurer +1AI-Generated Text DetectionStylometry