LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. Benchmarking LLMs on the Massive Sound Embedding Benchmark (MSEB)

    May 6, 2026Cyril Allauzen, Tom Bagby, Georg Heigold +2Audio-Language Model EvaluationLLM Evaluation

  2. CANDI: Contextual Alignment for Niche Domains Question Answering

    May 6, 2026Megha Chakraborty, Darssan L. Eswaramoorthi, Het Riteshkumar Shah +5LLM EvaluationLLM Grounding

  3. Deployment-Relevant Alignment Cannot Be Inferred from Model-Level Evaluation Alone

    May 6, 2026Varad Vishwarupe, Nigel Shadbolt, Marina Jirotka +1LLM EvaluationLLM Alignment

  4. From Memorization to Creation: Evaluating the Cognitive Depth of LLM-Generated Educational Questions

    May 6, 2026Xiaolong Wang, Zhe Zhao, Song Lai +5LLM EvaluationLLM Prompting

  5. Evaluating Advanced Prompting on Gemini Flash for Multi-Hop Biomedical QA

    May 5, 2026Ahmed Bajaber, Mohammed AlliheediMulti-Hop QALLM Evaluation

  6. Towards Self-Referential Analytic Assessment: A Profile-Based Approach to L2 Writing Evaluation with LLMs

    May 5, 2026Stefano Bannò, Kate Knill, Mark GalesLLM EvaluationAutomated Essay Scoring

  7. Not All That Is Fluent Is Factual: Investigating Hallucinations of Large Language Models in Academic Writing

    May 5, 2026Humam Khan, Md Tabrez Nafis, Shahab Saquib Sohail +2LLM EvaluationLLM Prompting

  8. Frontier Lag: A Bibliometric Audit of Capability Misrepresentation in Academic AI Evaluation

    May 5, 2026David Gringras, Misha SalahshoorLLM EvaluationLLM Auditing

  9. The Counterexample Game: Iterated Conceptual Analysis and Repair in Language Models

    May 5, 2026Daniel Drucker, Kyle MahowaldLLM Self-CorrectionLLM Evaluation

  10. EvoLM: Self-Evolving Language Models through Co-Evolved Discriminative Rubrics

    May 5, 2026Shuyue Stella Li, Rui Xin, Teng Xiao +8RL for Language ModelsLLM Evaluation

  11. MCJudgeBench: A Benchmark for Constraint-Level Judge Evaluation in Multi-Constraint Instruction Following

    May 5, 2026Jaeyun Lee, Junyoung Koh, Zeynel Tok +2LLM EvaluationLLM-as-a-Judge

  12. TriBench-Ko: Evaluating LLM Risks in Judicial Workflows

    May 5, 2026Haesung Lee, Gyubin Choi, Eun-Ju Lee +5LLM EvaluationLanguage Model Safety Evaluation

  13. PatRe: A Full-Stage Office Action and Rebuttal Generation Benchmark for Patent Examination

    May 5, 2026Qiyao Wang, Xinyi Chen, Longze Chen +4LLM EvaluationLegal Document Analysis

  14. Revisiting Graph-Tokenizing Large Language Models: A Systematic Evaluation of Graph Token Understanding

    May 5, 2026Zhongjian Zhang, Yue Yu, Mengmei Zhang +3LLM EvaluationLLM Reasoning with Graphs

  15. Revisiting the Travel Planning Capabilities of Large Language Models

    May 5, 2026Bo-Wen Zhang, Jin Ye, Peng-Yu Hua +4LLM Self-CorrectionLLM Evaluation

  16. Benchmarking Local Language Models for Social Robots using Edge Devices

    May 4, 2026Dorian Lamouille, Matevž B. Zorec, Farnaz Baksh +1LLM EvaluationOn-Device Language Model Inference

  17. Evaluating Reasoning Models for Queries with Presuppositions

    May 4, 2026Rose Sathyanathan, Kinshuk Vasisht, Danish PruthiLLM EvaluationLanguage Model Robustness

  18. SemEval-2026 Task 7: Everyday Knowledge Across Diverse Languages and Cultures

    May 4, 2026Nedjma Ousidhoum, Junho Myung, Carla Perez-Almendros +27Multilingual Language Model EvaluationLLM Evaluation

  19. When Correct Isn't Usable: Improving Structured Output Reliability in Small Language Models

    May 4, 2026Cosimo Galeone, Minsu Park, Giuseppe Ettorre +1LLM EvaluationLLM Prompting

  20. Complexity Horizons of Compressed Models in Analog Circuit Analysis

    May 4, 2026Pacome Simon MbonimpaLLM EvaluationLLM Compression

  21. Submodular Benchmark Selection

    May 4, 2026Alexander SmolaSubmodular OptimizationLLM Evaluation

  22. CLaC at SemEval-2026 Task 6: Response Clarity Detection in Political Discourse

    May 4, 2026Nawar Turk, Lucas Miquet-Westphal, Leila KosseimLLM EvaluationLanguage Model Ensembles