LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. Evaluation of LLMs for Mathematical Formalization in Lean

    Jun 4, 2026Tyson Klingner, Drew Bladek, Escher Crawford +6LLM EvaluationLean Theorem Proving

  2. Exploring LLMs for South Asian Music Understanding and Generation

    Jun 3, 2026Faria Binte Kader, Mohtasim Hadi Rafi, Shah Wasif Sajjad +1Music Generation EvaluationLLM Evaluation

  3. Self-Evaluation Is Already There: Eliciting Latent Judge Calibration in Base LLMs with Minimal Data

    Jun 3, 2026XiuYu Zhang, Yi Shan, Junfeng Fang +1LLM EvaluationLLM-as-a-Judge

  4. Knowledge Index of Noah's Ark

    Jun 3, 2026Sheng Jin, Minghao Liu, Yunze Xiao +24LLM EvaluationHuman-in-the-Loop Annotation

  5. Large Language Models in K-12 Education: Alignment with State Curriculum Standards and Student Personas

    Jun 3, 2026Lisa Korver, Tomo Lazovich, Sherief RedaLLM EvaluationAI in Education

  6. FALSIFYBENCH: Evaluating Inductive Reasoning in LLMs with Rule Discovery Games

    Jun 3, 2026Leonardo Bertolazzi, Katya Tentori, Raffaella BernardiLLM EvaluationAI Agent Benchmarks

  7. Revisiting Vul-RAG: Reproducibility and Replicability of RAG-based Vulnerability Detection with Open-Weight Models

    Jun 3, 2026Sabrina Kaniewski, Fabian Schmidt, Tobias HeerRetrieval-Augmented GenerationLLM Evaluation

  8. Self-Evolving Deep Research via Joint Generation and Evaluation

    Jun 3, 2026Han Zhu, Chengkun Cai, Yuanfeng Song +3LLM EvaluationLLM Agent Training

  9. SANE Schema-aware Natural-language Evaluation of Biological Data

    Jun 3, 2026Rolf Gattung, Martin Krueger, Markus ReischlLLM EvaluationLLM Grounding

  10. Do Large Language Models Have Emotions?

    Jun 3, 2026Amit Goldenberg, James J. GrossLLM EvaluationLLM Interpretability

  11. FailureScope: Cross-Regime Behavioral Diagnosis of Language Model Weaknesses

    Jun 3, 2026Nicholas SabanLLM EvaluationAgent Evaluation

  12. Thinking Through Signs: PEEL as a Semiotic Scaffolding for Epistemically Accountable AI-Enabled Research

    Jun 2, 2026Clarisse de Souza, Gabriel Barbosa, Simone Diniz Junqueira Barbosa +3LLM EvaluationAI Accountability

  13. Discourse-Role Labels as Presentation-Time Variables for Context Use in Language Models

    Jun 2, 2026Jianguo Zhu, Xiangmei Li, Wenjie LiuPrompt SensitivityLLM Evaluation

  14. Language Models Compare Quantities Using Number-specific and Unit-specific Heuristics

    Jun 2, 2026Mutsumi Sasaki, Go kamoda, Ryosuke Takahashi +4Numerical Reasoning in Language ModelsLLM Evaluation

  15. Reasoning Structure of Large Language Models

    Jun 2, 2026Frédéric Berdoz, Luca A. Lanzendörfer, Fabian Farestam +1Logical ReasoningLLM Evaluation

  16. From Answers to States: Verifiable Process-Level Evaluation of Chemical Reasoning in Large Language Models

    Jun 2, 2026Hongyu Guo, Hao Li, He Cao +2LLM EvaluationLLM Reasoning

  17. CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks

    Jun 2, 2026Alexander Apartsin, Yehudit ApersteinModel SelectionLLM Evaluation

  18. Evaluating LLMs' Effectiveness on Real-World Consumer Device Repair Questions

    Jun 2, 2026Atm Mizanur Rahman, Md Arid Hasan, Syed Ishtiaque Ahmed +1Multilingual Language Model EvaluationLLM Evaluation

  19. Beyond Ideal Instruction: A Comprehensive Framework for Evaluating LLMs in Realistic Interactions

    Jun 2, 2026Xuan Yang, Hao Xu, Tingfeng Hui +4LLM EvaluationTool-Use Evaluation

  20. Beyond "To whom it may concern": Tailoring Machine Translation to Audience and Intent

    Jun 2, 2026Raphael Merx, Ekaterina Vylomova, Trevor CohnLLM EvaluationMachine Translation

  21. When RLHF Fails: A Mechanistic Taxonomy of Reward Hacking, Collapse, and Evaluator Gaming

    Jun 2, 2026Zelalem Abahana, David Evans, Satish Mahadevan Srinivasan +1Reward HackingLLM Evaluation

  22. SenseJudge: Human-Centric Preference-Driven Judgment Framework

    Jun 2, 2026Rui Li, Junfeng Liu, Xiangwen Kong +2LLM EvaluationLLM-as-a-Judge

  23. Fully Automated Identification of Lexical Alignment and Preference-Stage Shifts in Large Language Models

    Jun 2, 2026Thomas Stephan Juzek, Xiaoyang Ming, Jose A. HernandezLLM EvaluationLLM Alignment

  24. Rethinking Molecular Text Representations for LLMs: An Empirical Study

    Jun 2, 2026Arun Raja, Garrett M. Morris, Kian Ming A. ChaiLLM EvaluationMolecular Generation

  25. TriEval: A Resource-Efficient Pipeline for LLM Bias, Toxicity, and Truthfulness Assessment

    Jun 2, 2026Akshatha Srikantha, Manpreet Singh, Yash Jajoo +1LLM EvaluationLanguage Model Safety Evaluation

  26. Pretraining Language Models on Historical Text

    Jun 2, 2026Xiaoxi Luo, Zachary Shinnick, Niclas Griesshaber +5Language Model PretrainingLLM Evaluation