Generative AI Evaluation

Latest papers 211

All topics
CardsList
  1. Human diversity fuels collective creativity that large language models cannot simulate or sustain

    Jul 29, 2026Mengchen Dong, Hiromu YakuraComputational CreativityDiverse Text Generation

  2. Contextualized Counterspeech Can Be More Persuasive Than Generic Counterspeech

    Jul 28, 2026Lorenzo Cima, Alessio Miaschi, Amaury Trujillo +3Personalized Text GenerationText Generation

  3. Characterizing Human-Likeness in AI Generated Poetry: A Zero-shot Classification Study

    Jul 28, 2026A. N. Biswas, T. Tabassum, A. A. Shohid +4AI-Generated Text DetectionGenerative AI Evaluation

  4. Preliminary Guidelines for Using and Evaluating GenAI Tools to Support Systematic Literature Reviews

    Jul 27, 2026Barbara Kitchenham, Sebastián Pizard, Lech Madeyski +3LLM EvaluationHuman-in-the-Loop Evaluation

  5. Design Theater: Evaluating the Gap Between User-Facing Design Reasoning and Implementation in Generative UI Tools

    Jul 24, 2026Kashif Imteyaz, Kaif Imteyaz, Nakul Rajpal +3Web Application GenerationGenerative AI Evaluation

  6. How Well Can AI Generate Backlogs from App Mockups?

    Jul 24, 2026Andrea Lezcano Airaldi, Lourdes Romera, Walid MaalejRequirements EngineeringPrompt Engineering

  7. Evaluating and Mitigating the Misguidance Effect of Buggy Code in LLM-Generated Unit Tests

    Jul 24, 2026Junda Zhao, Shurui Zhou, Eldan CohenLLM PromptingAutomated Test Generation

  8. Back to Back with a Copy: A Computational Analysis of AI-Generated Visual Contemporary Art Pastiches

    Jul 22, 2026Anca Dinu, Andreiana Mihail, Andra-Maria Florescu +2StylometryImage Generation Evaluation

  9. ReqGenX: An Empirical Study of Atomic Decomposition, Artifact Regeneration, and Reconstruction for Legacy SRS Documents

    Jul 18, 2026Ragib Shahariar Ayon, Rayed Fahmi, Sumon Biswas +1Requirements EngineeringSynthetic Data Generation

  10. HEDGEHOG: Hierarchical Evaluation of Drug Generators Through Rigorous Filtration

    Jul 14, 2026Daria A. Ryabchenko, Pavel Gurevich, Shamil Kadyrov +5Molecular GenerationGenerative AI Evaluation

  11. GEIS: A Generation-Evaluation-Improvement Loop of Agent Skills for Long-Form Article Generation

    Jul 13, 2026Jiale Zhang, Juntao Hu, Zhijian OuLong-Form Document GenerationLLM Agent Self-Improvement

  12. Optimization Is Not All You Need

    Jul 13, 2026Minh Hua, Rita RaleyLLM AlignmentAI Governance

  13. A Production-Oriented Framework for Evaluation of SFX Generation

    Jul 10, 2026Mélodie Desbos, Yara Bahram, Eric Granger +1Speech Generation EvaluationAudio Editing

  14. Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models

    Jul 10, 2026Yijie Qian, Juncheng Wang, Chao Xu +6Audio-Video GenerationGroup Relative Policy Optimization

  15. Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows

    Jul 7, 2026Tianyang Liu, Canwen Xu, Fangyu Lei +6Text-to-SQLRelational Databases

  16. AI for Cultural Heritage Textiles: Fine-Tuned Latent Diffusion for Novel Ulos Motif Synthesis

    Jul 6, 2026Humasak Tommy Argo Simanjuntak, Jesika Purba, Sitogab Girsang +4Latent Diffusion ModelsImage Generation

  17. AIriskEval-edu: New Dataset for Risk Assessment in AI-mediated K-12 Educational Explanations

    Jul 2, 2026Javier Irigoyen, Roberto Daza, Francisco Jurado +5LLM Safety BenchmarksLLM Auditing

  18. KathaTrace: Diagnosing Semantic Trajectory Collapse in Generated Visual Narratives

    Jul 1, 2026Jamuna S. Murthy, Amin Karimi Monsefi, Rajiv RamnathGenerative AI Evaluation

  19. AGC-Bench: Measuring Artificial General Creativity

    Jul 1, 2026Roger Beaty, Vijeta Deshpande, Clin K. Y. Lai +9Creativity AssessmentLLM Evaluation