LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. GENSTRAT: Toward a Science of Strategic Reasoning in Large Language Models

    May 22, 2026Vartan Shadarevian, Kia Ghods, Alex Kenich +1LLM EvaluationImperfect-Information Games

  2. Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks

    May 22, 2026Chuyifei Zhang, Hongyu Cui, Xiaowen Huang +1LLM EvaluationLong-Context Language Model Evaluation

  3. Breaking the Chains of Probability: Neutrosophic Logic as a New Framework for Epistemic Uncertainty in Large Language Models

    May 22, 2026Maikel Yelandi Leyva-Vázquez, Florentin SmarandacheLLM EvaluationKnowledge Conflicts in Language Models

  4. The Efficiency Frontier: A Unified Framework for Cost-Performance Optimization in LLM Context Management

    May 21, 2026Binqi Shen, Lier Jin, Hanyu Cai +2LLM EvaluationCost-Aware Inference

  5. Decomposing and Measuring Evaluation Awareness

    May 21, 2026Changling Li, Terry Jingchen Zhang, Jie Zhang +4LLM EvaluationLanguage Model Safety Evaluation

  6. Can AI Guess What You Know? Performance Comparison of Large Language Models for Human Domain Knowledge Estimation From Communication Logs

    May 21, 2026Ko Watanabe, Shoya IshimaruLLM EvaluationExpert Routing

  7. Evaluating Commercial AI Chatbots as News Intermediaries

    May 21, 2026Mirac Suzgun, Emily Shen, Federico Bianchi +5LLM EvaluationQuestion Answering

  8. More Context, Larger Models, or Moral Knowledge? A Systematic Study of Schwartz Value Detection in Political Texts

    May 21, 2026Víctor Yeste, Paolo RossoLLM EvaluationKnowledge Augmentation for Language Models

  9. SWE-Mutation: Can LLMs Generate Reliable Test Suites in Software Engineering?

    May 21, 2026Yuxuan Sun, Yuze Zhao, Yufeng Wang +6LLM EvaluationAutomated Software Testing

  10. Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements

    May 21, 2026Ryo Kanazawa, Koyo Hidaka, Teppei Miyamoto +9LLM EvaluationBenchmark Construction

  11. The Illusion of Reasoning: Exposing Evasive Data Contamination in LLMs via Zero-CoT Truncation

    May 21, 2026Yifan Lan, Yuanpu Cao, Hanyu Wang +2LLM EvaluationLLM Auditing

  12. HIDBench: Benchmarking Large Language Models for Host-Based Intrusion Detection

    May 20, 2026Danyu Sun, Jinghuai Zhang, Yuan Tian +1LLM EvaluationCybersecurity

  13. RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator

    May 20, 2026Zhenwei Tang, Zhaoyan Liu, Rasa Hosseinzadeh +3LLM EvaluationPairwise Comparison

  14. AttuneBench: A Conversation-Based Benchmark for LLM Emotional Intelligence

    May 20, 2026Kate M. Lubrano, Faisal Sayed, Ankita Rathod +4LLM EvaluationEmotion Recognition in Conversations

  15. Text Analytics Evaluation Framework: A Case Study on LLMs and Social Media

    May 20, 2026Yuefeng Shi, Nedjma Ousidhoum, Jose Camacho-ColladosNumerical Reasoning in Language ModelsSocial Media Analysis

  16. GradeLegal: Automated Grading for German Legal Cases

    May 20, 2026Abdullah Al Zubaer, Lorenz Wendlinger, Simon Alexander Nonn +2LLM EvaluationAutomated Grading

  17. APM: Evaluating Style Personalization in LLMs with Arbitrary Preference Mappings

    May 20, 2026Philipp Spohn, Leander Girrbach, Zeynep AkataLLM EvaluationLLM Personalization

  18. Provable Joint Decontamination for Benchmarking Multiple Large Language Models

    May 20, 2026Zhenlong Liu, Hao Zeng, Hongxin WeiLLM EvaluationBenchmark Contamination

  19. PlanningBench: Generating Scalable and Verifiable Planning Data for Evaluating and Training Large Language Models

    May 20, 2026Ziliang Zhao, Zenan Xu, Shuting Wang +7LLM EvaluationLLM Planning

  20. Findings of the Counter Turing Test: AI-Generated Text Detection

    May 20, 2026Rajarshi Roy, Gurpreet Singh, Ashhar Aziz +16LLM EvaluationAI-Generated Text Detection

  21. Do as I Say, Not as I Do: Instruction-Induction Conflict in LLMs

    May 19, 2026Carolina Camassa, Derek ShillerLLM EvaluationLanguage Model Self-Assessment

  22. When Reasoning Supervision Hurts: TTCW-Based Long-Form Literary Review Generation

    May 19, 2026Jinlong Liu, Mohammed Bahja, Mark LeeSupervised Fine-TuningCreativity Assessment

  23. Less Back-and-Forth: A Comparative Study of Structured Prompting

    May 19, 2026Saurav Ghosh, Gabriella Polach, Abdou SowLLM EvaluationStructured Prompting

  24. MixRea: Benchmarking Explicit-Implicit Reasoning in Large Language Models

    May 19, 2026Yuanqing Cai, Ziyi Huang, Minhao Liu +3LLM EvaluationLLM Prompting