LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. TRACES: A Benchmark for Epistemic Reliability in Scientific Reasoning by LLMs

    Aug 11, 2026Valentin Rodionov, Shamil AssylbekovLLM EvaluationLLM Reliability

  2. Mapping and Measuring the Behavioral Evolution of Large Language Models

    Aug 11, 2026Dong Qiao, Chris Ding, Jicong FanLLM EvaluationRepresentation Geometry in Language Models

  3. Chemically Meaningful Textualization Enables Explainable Validation of Metal-Organic Frameworks by Large Language Models

    Aug 11, 2026Guobin Zhao, Xiao-Yan LiLLM EvaluationLLM Interpretability

  4. SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information

    Aug 11, 2026Junjie Ye, Zhuohui Sheng, Shaofan Liu +12LLM EvaluationAI Agent Benchmarks

  5. Every Token Counts: Exact Likert-Scale Distributions for Measuring LLM Attitudes and Biases

    Aug 11, 2026Davood Wadi, Mohsen Ghodrat, Matthew PhilpLLM EvaluationCultural Bias in Language Models

  6. From Reasoning Depth to Reasoning Breadth: Evaluating Multi-Point Associative Reasoning in Large Language Models

    Aug 11, 2026Si'an Xie, Jiaxun Liu, Biao Yang +4LLM EvaluationMulti-Hop Reasoning

  7. How Robust Are LLMs to Vietnamese Dialects?

    Aug 11, 2026Minh Tran, Trinh Chau, Thanh-Nhan Le +4LLM EvaluationLanguage Model Robustness

  8. Persona Conditioning as an Assessor-Sensitivity Probe for LLM-Based IR Evaluation

    Aug 11, 2026Samaneh Mohtadi, Pietro Bernardelle, Joel Mackenzie +1LLM EvaluationLLM-as-a-Judge

  9. Is This Your Final Answer? Cross-Contextual Consistency as a Measure of LLM Credibility

    Aug 10, 2026Siyang Wu, Yibo Jiang, Bryon AragamPrompt SensitivityLLM Evaluation

  10. Toward Human Rights Benchmarking for LLMs: A Pilot Methodology

    Aug 10, 2026Savannah Thais, Wm. Matthew Kennedy, Abhigyan Acherjee +3LLM EvaluationMoral Reasoning in Language Models

  11. The Deliberative Deficit: An Empirical Critique of LLMs in Democratic Discourse

    Aug 10, 2026Maurice FlechtnerLLM EvaluationMulti-Agent Debate

  12. From Values to Benchmarks: Evaluating Large Language Models for Governmental Use in Dutch

    Aug 10, 2026Laurens Samson, Iva Gornishka, Gossa Lô +2Multilingual Language Model EvaluationLLM Evaluation

  13. Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness

    Aug 10, 2026Tadanobu Chuyo Kamijo, Ori Rottenstreich, Javier Conde +2LLM EvaluationLanguage Model Robustness

  14. How Do Large Language Models Judge Social Attraction? Evidence from Theory-Grounded Persona Ratings Across Multiple LLMs and Humans

    Aug 10, 2026Hasan Mahmud, Khawaja Abaid Ullah, Mohammad Javad Khojasteh +2Human Preference EvaluationGender Bias in Language Models

  15. Avalon-ToM-Bench: Evaluating Fine-Grained Theory of Mind via Asymmetric Game Mechanics

    Aug 10, 2026Yen-Shan Chen, Yu Chian Duan, Chih-En Kuo +2LLM EvaluationTheory of Mind

  16. ELBench: A Multi-Dimensional Benchmark for Education-Facing Large Language Models

    Aug 10, 2026Yilin Jiang, Xiaorong Zhu, Fei Tan +9LLM Safety BenchmarksLLM Evaluation

  17. TCS-BENCH: Benchmarking State-of-the-Art Generative AI Theoretical Computer Science Research Ability

    Aug 10, 2026Vincent Cohen-Addad, Dimitris Paparas, Ernest van Wijland +13LLM EvaluationAutomated Theorem Proving

  18. LexKairos: Benchmarking Legal Temporal Capabilities in LLMs

    Aug 10, 2026Chenyang Li, Zejia Feng, Yuqin Huang +2Legal NLPLLM Evaluation

  19. How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review

    Aug 10, 2026Ming Li, Chenguang Wang, Xirui Li +5Reward HackingLLM Evaluation

  20. Math-Vision Diagrams: A Comprehensive Benchmark for Evaluating LLM Mathematical Diagram Generation Capabilities

    Aug 9, 2026Harish Kashyap, Kiran Byadarhaly, Sriram Chakaravarthy +2LLM EvaluationT2I Generation Evaluation

  21. PROSLEX: A Novel Dataset for Expert-Annotated Legal Statute Prediction for Indian Judiciary

    Aug 9, 2026Subinay Adhikary, Upal Bhattacharya, Vivek Kumar Singh +6Legal NLPLLM Evaluation

  22. PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling

    Aug 9, 2026Dongjie Xu, Julius, Hanchi Dong +6LLM EvaluationTool-Use Evaluation

  23. Can Open-Weight Models Compete on Financial Text Comprehension?

    Aug 9, 2026Jan SpörerLLM EvaluationFinancial QA

  24. Time Present and Time Past: Benchmarking Large Language Models on Temporally Evolving Document Understanding

    Aug 9, 2026Mahbub E Sobhani, Md. Faiyaz Abdullah Sayeedi, Fahmid Hasan Chowdhury +4LLM EvaluationDocument QA

  25. Exploring LLM Capabilities for Situational Understanding and COLREG compliance on real-world maritime navigation scenarios

    Aug 8, 2026Julius Wirbel, P. Nicholas Hansen, Line K. H. Clemmensen +1LLM Evaluation

  26. Opportunity Is Not Realizability: Selection-Valid Diagnostics for Multi-LLM Routing

    Aug 8, 2026Ibne Farabi Shihab, Abu Sa-Adat Mohamed Moon-Im Al Ahsan, Md Najmus SwaqeebModel SelectionLLM Evaluation

  27. Focus particles and scalar inferences across humans and language models

    Aug 8, 2026Catherine M. Brousse, Nelu D. RadpourLLM EvaluationPragmatic Reasoning in Language Models