Generative AI Evaluation

Latest papers 211

All topics
CardsList
  1. Context operations to architecture modelling output from large language models and evaluation criteria for their use in systems engineering design

    Sep 9, 2026Vinicius Kaster Marini, Petter KrusSoftware EngineeringModel-Based Systems Engineering

  2. A Systematic Evaluation of Molecule Generation Models for De Novo Drug Design: From Benchmarks to Practical Insights

    Sep 9, 2026Xinrui Xu, Xueer Wang, Dan Luo +2Structure-Based Drug DesignMolecular Generation

  3. Does task decomposition improve automatic NLG evaluation?

    Sep 1, 2026Sebastian Steindl, Nikos Voskarides, Alberto Gasparin +1LLM EvaluationLLM-as-a-Judge

  4. Sources of Truth: A Multi-Platform, Multilingual Audit of Citations in AI Mental Health Information Queries

    Aug 31, 2026Phuong Anh Nguyen, Jill Noorily, Matthew Flathers +7LLM EvaluationLLM Auditing

  5. Autoresearch for Marketplace Catalogs: From Legacy Forms to AI-Native Matching

    Aug 31, 2026Kartik Ravisankar, Hojat Abdolanezhad, Daniel Capo +3User Preference ModelingGenerative AI Evaluation

  6. ReDeck: Step-Level Render-Grounded Refinement for Document-to-Slide Generation

    Aug 31, 2026Muzhao Tian, Zezi Zeng, Yifan Yang +14LLM Self-RefinementGenerative AI Evaluation

  7. Process-Constituted Intelligence: A Shared Criterion for Humans and Machines

    Aug 17, 2026Michael J. Richardson, Ayeh Alhasan, Cassandra Crone +5Human-Centered AIGenerative AI Evaluation

  8. LOB-ID: Evaluating Synthetic Market Data by Inception Distances

    Aug 13, 2026Andreea Bacalum, Zhuohan Wang, Ollie Olby +2Quantitative FinanceSynthetic Data Evaluation

  9. DashArena: Benchmarking LLMs on Interactive Analytic Dashboard Generation

    Aug 11, 2026Xiaotong Wang, Dazhen DengData VisualizationLLM-as-a-Judge

  10. Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models

    Aug 10, 2026Shulin Tian, Ziqi Huang, Fan Zhang +3Tool-Augmented Language Model AgentsAI Agent Evaluation

  11. How People Evaluate AI-, Expert-, and Peer-Style Financial Advice

    Aug 10, 2026Aryan Ramchandra Kapadia, Eshwar Chandrasekharan, Koustuv SahaHuman-AI InteractionHuman-AI Decision Making

  12. AI Evaluation Should Measure Verification Cost, Not Correctness Alone

    Aug 9, 2026Viviana Crescitelli, Generoso Immediato, Fabio Persia +1Language Model Generation EvaluationGenerative AI Evaluation

  13. Recipes for Creativity: Iterative Generation and Evaluation in Large Language Models

    Aug 7, 2026Rens Anderson, Tessa Verhoef, Amirhossein ZohrehvandCreativity AssessmentLLM Evaluation

  14. MMAG: A Multi-Control Mixed Audio Generation Benchmark

    Aug 7, 2026Zihao Zheng, Xuenan Xu, Jiahao Mei +5Speech Generation EvaluationAudio Generation

  15. Schema-Guided Hierarchical Information Extraction and Semantic Evaluation Using Generative AI

    Aug 6, 2026Modhurita Mitra, Jan-Willem Versteeg, Maarten D. Schermer +3Document Information ExtractionAutomated Evaluation

  16. Epistemic Trustworthiness in Generative AI: A Normative Framework for Warranted Reliance in High-Stakes Workflows

    Aug 6, 2026Nimisha Karnatak, Max Van Kleek, Nigel ShadboltTrust in AIResponsible AI

  17. Kathleen Writes: Autoregressive Generation and Data Scaling Without Attention

    Aug 5, 2026George FountzoulasLanguage Model Generation EvaluationAutoregressive Language Modeling

  18. InvFlowFD: Reference-Free and Background-Set-Free Perceptual Music Quality Metric with Flow Matching Inversion

    Aug 4, 2026Alon Ziv, Harel Pogoda, Yossi AdiMusic Generation EvaluationMusic Generation

  19. AI-Assisted Peer Review Across Research Communities: From Reviewer AI Policies to LLM Review Quality

    Aug 4, 2026Alexander M. Fichtl, Lukas Ellinger, Josefin Kelber +2LLM EvaluationScholarly Peer Review

  20. Cross-cultural evaluation of taste-sound correspondences in AI-generated music

    Aug 4, 2026Matteo Spanio, Massimiliano Zampini, Luisa Torri +5Text-to-Music GenerationGenerative AI Evaluation

  21. CraftAlign: Feature-Grounded Evaluation and Revision Guidance for AI Stories

    Aug 2, 2026Yang Yang, Boyun Xu, Shaofeng Liang +5AI-Generated Text DetectionLanguage Model Generation Evaluation

  22. Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation

    Aug 1, 2026Xianhao Zhou, Jianghao WuSpeech Generation EvaluationTTS Evaluation

  23. Beyond a Single Judge: The Evidence-Grounded, Social-Weighted Persona Panel for Generative UI Evaluation

    Jul 30, 2026Zheng Wu, Yibo Luo, Pu Zhang +2Human Preference EvaluationLLM-as-a-Judge

  24. Evaluating and Pricing Advertisements in AI-Generated Responses

    Jul 30, 2026John L. Turner-Smith, Zimeng Huang, Yuhan Fu +2Mechanism DesignOnline Advertising