LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. Detection Without Correction: A Two-Parameter Decomposition of Multi-Stage LLM Pipelines

    May 26, 2026Prashanti Nilayam, Kiran Ramanna, Prashil TumbadeLLM Self-CorrectionLLM Evaluation

  2. MATCHA: Matching Text via Contrastive Semantic Alignment

    May 26, 2026Siran Li, Ece Sena Etoglu, Carsten Eickhoff +1LLM EvaluationSemantic Textual Similarity

  3. Probing Cultural Awareness in LLMs: A Case Study of Cross-Culture Aesthetic Stylistics

    May 26, 2026Jiashuo Wang, Fenggang Yu, Jian Wang +6LLM EvaluationText Generation

  4. It's Not Always Sycophancy: Measuring LLM Conformity as a Function of Epistemic Uncertainty

    May 26, 2026Kevin H. Guo, Chao Yan, Avinash Baidya +5LLM EvaluationLLM Sycophancy

  5. Lost in Sampling: Assessing Lexical Reachability in LLMs via the Word Coverage Score (WCS)

    May 26, 2026Samer Awad, Javier Conde, Carlos Arriaga +3LLM EvaluationLanguage Model Decoding

  6. Attribute-Based Diagnosis of LLM Alignment with Hate Speech Annotations

    May 26, 2026Mohammad Amine Jradi, Faeze Ghorbanpour, Alexander FraserLLM EvaluationLLM Alignment

  7. Evaluating the Relevance of Uncertainty Estimators for LLM Hallucination

    May 26, 2026Yedidia Agnimo, Anna Korba, Annabelle Blangero +2LLM EvaluationHallucination in Language Models

  8. PersLitEval: Fine-grained Benchmark and Evaluation of LLMs on Persian Literature Questions

    May 26, 2026Ruhallah Niazi, Faeze Ghorbanpour, Alexander FraserLLM EvaluationQuestion Answering

  9. Beyond Questions: Evaluating What Large Language Models (Actually) Know

    May 26, 2026Luca Giordano, Simon RazniewskiLLM EvaluationFactual Knowledge in Language Models

  10. AssertLLM2: A Comprehensive LLM Benchmark for Assertion Generation from Design Specifications

    May 26, 2026Yuchao Wu, Wenji Fang, Jing Wang +3Formal Hardware VerificationLLM Evaluation

  11. Quality Without Usefulness: LLM-Generated XAI Narratives as Trust Heuristics Rather Than Decision Aids

    May 26, 2026Fabian Lukassen, Jan Herrmann, Christoph Weisser +3LLM EvaluationExplainable Artificial Intelligence

  12. Evaluating Interactive Reasoning in Large Language Models: A Hierarchical Benchmark with Executable Games

    May 26, 2026Mingyuan Fan, Weiguang Han, Daixin Wang +3LLM EvaluationAI Agent Benchmarks

  13. PRISM: A Multi-Dimensional Benchmark for Evaluating LLM Peer Reviewers

    May 26, 2026Ngoc Phan Phuoc Loc, Toan Huynh La Viet, Thanh Tran Khanh +8LLM EvaluationScholarly Peer Review

  14. Memory Architectures for Multi-Turn Text-to-SQL: A Benchmark and Empirical Study

    May 25, 2026Ravi Kumar Tummalapenta, Suman AddankiLLM EvaluationText-to-SQL

  15. OmniToM: Benchmarking Theory of Mind in LLMs via Explicit Belief Modeling

    May 25, 2026Adam Bawatneh, Sagar Sapkota, Amrit Singh Bedi +2LLM EvaluationTheory of Mind

  16. Can LLMs Introspect? A Reality Check

    May 25, 2026Shashwat Singh, Tal Linzen, Shauli RavfogelLLM EvaluationLLM Interpretability

  17. Automated Benchmark Auditing for AI Agents and Large Language Models

    May 25, 2026Junlin Wang, Federico Bianchi, Shang Zhu +4LLM EvaluationBenchmark Auditing

  18. StakeBench: Evaluating Language Understanding Grounded in Market Commitment

    May 25, 2026Yunhua Pei, Jingyu Hu, Yiwei Shi +3LLM EvaluationForecasting Benchmarks

  19. Causal methods for LLM development and evaluation

    May 25, 2026Dennis Frauen, Marie Brockschmidt, Konstantin Hess +10LLM EvaluationCausal Inference

  20. Causal Tongue-Tie: LLMs Can Encode Causal Direction, But Their Yes/No Outputs Fail to Express

    May 25, 2026Ziyi Ding, Xiao-Ping ZhangLLM EvaluationCausal Reasoning in Language Models

  21. Efficient Benchmarking Is Just Feature Selection and Multiple Regression

    May 25, 2026Sam Bowyer, Acyr Locatelli, Kris CaoLLM EvaluationFeature Selection

  22. StreamProfileBench: A Benchmark for Fine-Grained User Profile Inference in Real-World Streaming Scenarios

    May 25, 2026Sizhe Wang, Feiyu Duan, Juelin Wang +2LLM EvaluationUser Modeling

  23. Simulating Human Memory with Language Models

    May 25, 2026Qihan Wang, Nicholas Tomlin, Michael Hu +2LLM EvaluationMemory-Augmented Language Models

  24. Toward a Benchmark for Controllable Simulation of Imperfect Students with Large Language Models

    May 25, 2026Alexander Apartsin, Omri Sason, Yehudit ApersteinLLM EvaluationLanguage Model-Based Control

  25. Agreement Metrics for LLM-as-Judge Evaluation: What to Report and Why

    May 25, 2026Delip Rao, Chris Callison-BurchInter-Rater ReliabilityLLM Evaluation

  26. A Universal Cliff and a Design Fingerprint: Cross-Section Defect Detection Under LLM Orchestration

    May 25, 2026Hiroki FukuiMulti-Agent LLM SystemsLLM Evaluation

  27. LLM-as-a-Reviewer: Benchmarking Their Ability, Divergence, and Prompt Injection Resistance as Paper Reviewers

    May 25, 2026Lingyao Li, Junjie Xiong, Changjia Zhu +5LLM EvaluationLLM-as-a-Judge