LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. Cutting LLM Evaluation Costs with SySRs: A Bandit Algorithm that Provably Exploits Model Similarity

    Jun 5, 2026Zifan Lyu, Chahine Nejma, Tobias Wegel +2Model SelectionMulti-Armed Bandits

  2. Sycophantic Praise: Evaluating Excessive Praise in Language Models

    Jun 5, 2026Daniel Vennemeyer, Phan Anh Duong, Meryl Ye +2LLM EvaluationLLM Sycophancy

  3. The Masked Advantage: Uncovering Local-Language Access to Cultural Knowledge in LLMs

    Jun 5, 2026Yang Zhang, Xiao Fei, Amr Mohamed +6Multilingual Language Model EvaluationLLM Evaluation

  4. Phun-Bench: Evaluating LLMs on Phonological Understanding in Chinese

    Jun 5, 2026Xing Yue, Yongliang Shen, Weiming LuLLM Evaluation

  5. Think Fast: Estimating No-CoT Task-Completion Time Horizons of Frontier AI Models

    Jun 5, 2026Dewi Gould, Francis Rhys Ward, Anders Cairns Woodruff +18LLM EvaluationAI Safety Evaluation

  6. Beyond Rubrics: Exploration-Guided Evaluation Skills for Reward Modeling

    Jun 5, 2026Xing Yue, Linjuan Wu, Daoxin Zhang +2Reward ModelingLLM Evaluation

  7. Adversarial Robustness of Activation Steering in Large Language Models

    Jun 5, 2026Kien Le, Thai LeLLM EvaluationLanguage Model Steering

  8. OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios

    Jun 5, 2026Xinyi Li, Zhen Fang, Yongxin Deng +12LLM EvaluationHallucination Detection

  9. From Sampled Outcomes to Capability Distributions: Rethinking Supervision for LLM Routing

    Jun 5, 2026Guannan Lai, Haoran Hu, Long Chen +2LLM EvaluationLLM Routing

  10. ThinkBooster: A Unified Framework for Seamless Test-Time Scaling of LLM Reasoning

    Jun 5, 2026Vladislav Smirnov, Chieu Nguyen, Sergey Senichev +14LLM EvaluationTest-Time Scaling

  11. Explain Like I'm 5 or Whatever I Choose: Evaluating the Interactive Potential of Language Model Responses

    Jun 5, 2026Indu Panigrahi, Tal AugustLLM EvaluationLanguage Model Generation Evaluation

  12. When Better Codebooks Are Not Enough: Predictive Performance and Behavioral Reliability in LLM Political Event Coding

    Jun 4, 2026Zixian He, Bharath Raahul Murugesan, Patrick Brandt +1LLM EvaluationLLM-Assisted Annotation

  13. Evaluating LLM Usage for Efficient and Explainable Numerical and Classified Implicit Sentiment Analysis of Product Desirability

    Jun 4, 2026Sherri Weitl-Harms, John HastingsLLM EvaluationSentiment Analysis

  14. RECAP: Regression Evaluation for Continual Adaptation of Prompts

    Jun 4, 2026Harsh Deshpande, Kushal Chawla, Sangwoo Cho +2Continual Learning for LLMsLLM Evaluation

  15. UnpredictaBench: A Benchmark for Evaluating Distributional Randomness in LLMs

    Jun 4, 2026Amirhossein Abaskohi, Amirhossein Dabiriaghdam, Liang Luo +4LLM EvaluationLanguage Model Generation Evaluation

  16. Re-Centering Humans in LLM Personalization

    Jun 4, 2026Lechen Zhang, Jiarui Liu, Tal AugustHuman Preference EvaluationLLM Evaluation

  17. Benchmark Everything Everywhere All at Once

    Jun 4, 2026Shiyun Xiong, Dongming Wu, Peiwen Sun +5LLM EvaluationBenchmark Design

  18. A Komi-Yazva--Russian Parallel Corpus and Evaluation Protocol for Zero- and Few-Shot LLM Translation

    Jun 4, 2026Petr ParshakovLLM EvaluationLow-Resource MT

  19. Decomposing Factual Sycophancy in Language Models: How Size and Instruction Tuning Shape Robustness

    Jun 4, 2026Victor De Marez, Luna De Bruyne, Walter DaelemansLLM EvaluationLLM Sycophancy

  20. FOXGLOVE: Understanding Goal-Oriented and Anchored Writing Feedback from Experts and LLMs on Argumentative Essays

    Jun 4, 2026Yijun Liu, Yifan Song, John Gallagher +2LLM Evaluation

  21. Dense Contexts Are Hard Contexts: Lexical Density Limits Effective Context in LLMs

    Jun 4, 2026Giovanni Dettori, Matteo Boffa, Danilo Giordano +2Long-Context RetrievalLLM Evaluation

  22. RedditPersona: A Modular Framework for Community-Conditioned LLM Adaptation from Reddit

    Jun 4, 2026Amirhossein Ghaffari, Ali Goodarzi, Huong Nguyen +3LLM EvaluationLLM Fine-Tuning

  23. Entity tracking emerges in sub-billion parameter language models and exceeds human performance in naturalistic narratives

    Jun 4, 2026Karolina Drożdż, Micha HeilbronLLM EvaluationLanguage Model Scaling Laws

  24. Analysis of the Neglect-Zero Effect in Large Language Models

    Jun 4, 2026Jin Tanaka, Daiki Matsuoka, Ryoma Kumon +1Logical ReasoningLLM Evaluation

  25. Benchmarks in Leipzig

    Jun 4, 2026Andrei Balakin, Miklós Bóna, Marie-Charlotte Brandenburg +45Mathematical Reasoning BenchmarksLLM Evaluation

  26. Elmes*: Automated Construction of Fine-Grained Evaluation Rubrics for Large Language Models in Long-Tail Educational Scenarios

    Jun 4, 2026Tao Liu, Ye Lu, Ruohua Zhang +4LLM EvaluationLLM-as-a-Judge

  27. Can LLMs Write Correct TLA+ Specifications? Evaluating Natural-Language-to-TLA+ Generation

    Jun 4, 2026Arslan Bisharat, Brian Ortiz, Eric Spencer +5LLM EvaluationFormal Verification