LLM Evaluation

LLM: Large Language Model

Latest papers 1,631

All topics
CardsList
  1. Evaluating Criterion-Conditioned Behaviour of Large Language Models in Content Moderation

    Sep 3, 2026Danting Zhang, Bei Peng, Robert LoftinLLM Safety BenchmarksLLM Evaluation

  2. To What Extent Do Large Language Models Understand Bangla Idioms?

    Sep 3, 2026Mousumi Akter, Md. Faiyaz Abdullah Sayeedi, Nurul Labib Sayeedi +1LLM EvaluationPragmatic Reasoning in Language Models

  3. Chiaroscuro for Emotions: A Contrastive Emotion Benchmark Grounded in Appraisal Theory

    Sep 3, 2026Divyesh Bommana, Mohammad Saim, Tianyu JiangLLM EvaluationClassification

  4. FrameBench:A Language Understanding Benchmark Based on Frame Semantics

    Sep 3, 2026Chihiro Yano, Ryohei SasanoMultilingual Language Model EvaluationLLM Evaluation

  5. The Analyst in the Prompt: Role, Retrieval, and Memory Biases in LLM Financial Analysis

    Sep 2, 2026Ahmed Asaad, Amr Mohamed, Yang Zhang +1LLM EvaluationLLM Auditing

  6. SHELF: A Synthetic Harness for Multi-Task Bibliographic Benchmarking

    Sep 2, 2026Michael J. BommaritoLLM EvaluationLibrary and Information Science

  7. User Feedback Provides a Unique Signal that LLMs Can not Detect

    Sep 2, 2026Shachar Don-Yehiya, Leshem Choshen, Omri AbendLLM EvaluationRL from Human Feedback

  8. How Output Format Confounds Data Quality and Capability in Instruction Tuning

    Sep 2, 2026Chengguang Gan, Hanjun Wei, Yunhao Liang +3LLM EvaluationInstruction Tuning

  9. Benchmarking Language Models for Statistical Problem Formulation

    Sep 2, 2026Chen Wang, Junzhe Zhao, Xin Cong +2LLM Evaluation

  10. Accurate in space, unreliable in time: how LLMs represent national cultural change

    Sep 1, 2026Yalda Daryani, Miranda Bogen, Madeleine I. G. DaeppLLM EvaluationCultural Evolution

  11. VakyArth: Evaluating Pragmatic Competence in LLMs across Indic Languages

    Sep 1, 2026Usneek Singh, Poorvaja Veera Balaji Kumar, Parth Nanda +4Multilingual Language Model EvaluationLLM Evaluation

  12. CHARM: Character Hallucination for Multicultural Role Play Benchmark

    Sep 1, 2026Sunkyung Han, Nahyeon Park, Gaeun Seo +2LLM EvaluationLarge Language Model-Based Role-Play Simulation

  13. LLMPEDIA: Browsing, Verifying, and Comparing the Parametric Encyclopedic Knowledge of LLMs

    Sep 1, 2026Muhammed Saeed, Simon RazniewskiLLM EvaluationLLM Auditing

  14. Does task decomposition improve automatic NLG evaluation?

    Sep 1, 2026Sebastian Steindl, Nikos Voskarides, Alberto Gasparin +1LLM EvaluationLLM-as-a-Judge

  15. EDRAC: Benchmarking Arabic Dialect Reading Comprehension

    Sep 1, 2026Noor Abo Mokh, Kirill Chirkunov, Teresa Lynn +15LLM EvaluationArabic NLP

  16. Embedded Conditional Independence Tests for Large Language Model Generated Text with an Application to German Parliament Speeches

    Sep 1, 2026Marco Simnacher, Georg Keilbar, Benjamin König +2LLM EvaluationPrivacy Leakage in Language Models

  17. VIBE-Bench: Evaluating Personalized Large Language Models When Profiles Don't Mean Preferences

    Sep 1, 2026Yiwen Jiang, Yang Deng, Stephanie Fong +9LLM EvaluationLLM Personalization

  18. RPCBench: A Benchmark for Proactive Premise Critique in LLM-based Recommendation

    Sep 1, 2026Zhongru Chen, Yuan Wu, Yi ChangLLM EvaluationLarge Language Model-Based Recommendation

  19. Towards a Reliable and Practical Eval Pipeline

    Sep 1, 2026Emma Thuong Nguyen, Abhishek GhoseLLM EvaluationLLM-as-a-Judge

  20. Can Large Language Models Forecast What Researchers Study Next?

    Sep 1, 2026Fenghai Li, Zihan Tang, Haofei Yu +2LLM EvaluationForecasting Benchmarks

  21. Value Over Language Model: Detecting Original Contribution in Writing

    Sep 1, 2026Vibhhu Sharma, Thorsten Joachims, Sarah DeanLLM EvaluationAI-Generated Text Detection

  22. Triple-Bottom-Line Sustainability of Language Models for Edge AI: A Comparison Between SLMs and Quantized LLMs

    Sep 1, 2026Jainil Dharmil ShahLLM QuantizationLLM Evaluation

  23. SciTrue: Reliable Scientific Claim Validation with Frontier and Open Language Models at the NTCIR SciClaimEval Task

    Sep 1, 2026Qiming Bao, Neşet Özkan Tan, Siyuan Wang +1Document UnderstandingLLM Evaluation

  24. Predicting Program Exit Code with LLMs and Programming Language Semantics

    Sep 1, 2026Lara Marinov, Aditya Thimmaiah, Jayanth Srinivasa +2LLM EvaluationCode Language Models

  25. Aligned but Flattened: Analyzing the Trade-off between Cultural Alignment and Diversity in LLMs

    Sep 1, 2026Jingshen Zhang, Shaoyang Xu, Wenxuan ZhangLLM EvaluationCultural Alignment

  26. Sources of Truth: A Multi-Platform, Multilingual Audit of Citations in AI Mental Health Information Queries

    Aug 31, 2026Phuong Anh Nguyen, Jill Noorily, Matthew Flathers +7LLM EvaluationLLM Auditing