LLM Evaluation

LLM: Large Language Model

Latest papers 1,610

All topics
CardsList
  1. Ontology-Grounded, Reasoner-Verified Benchmarks for Evaluating LLM Reasoning in Scientific AI

    Sep 30, 2026Nishtha N. Vaidya, Stephan Grimm, Thomas Hubauer +1LLM EvaluationSynthetic Benchmark Generation

  2. On the (In)effectiveness of AMR Augmentation for Large Language Models

    Sep 30, 2026Hoa Quynh Nhung Nguyen, Jacopo Staiano, Michael SullivanLLM EvaluationKnowledge Augmentation for Language Models

  3. Benchmarking Prompt Optimization of Large Language Models With Chess

    Sep 30, 2026Timothée Lesort, Alejandra López de Aberasturi Gómez, Tristan Karch +4LLM EvaluationAutomatic Prompt Optimization

  4. ArchitectureIQ: On the Measure of Training Intuition

    Sep 30, 2026Zirui Ren, Shaoyang Guo, Chencheng Tang +9Model SelectionLLM Evaluation

  5. LLM-as-a-Judge for Low-Resource Languages: Adapting Ragas and Comparative Ranking for Romanian

    Sep 30, 2026Claudiu Creanga, Liviu P. DinuLLM EvaluationLLM-as-a-Judge

  6. Who Owns That? Evaluating Ownership Intuitions in Large Language Models

    Sep 30, 2026Xizhi Xiao, Yue Wu, Shan Xu +1LLM Evaluation

  7. RAIM: Robust Aggregation of Inexpensive Models for Hallucination Detection

    Sep 30, 2026Elia Onofri, Roberto Di PietroLLM EvaluationLLM-as-a-Judge

  8. A Shared Taste for Model-Written Text: The Generator-by-Selector Matrices of "AI-AI Bias" Show No Detectable Own-Model Premium

    Sep 30, 2026Dmitrij ŻatuchinLLM EvaluationLanguage Model Bias Evaluation

  9. Right Answers, Costly Models: The Efficiency Gap in LLM-based Optimization Modeling

    Sep 30, 2026Zhong Li, Xin Huang, Jinhui Wan +6LLM EvaluationLarge Language Model-Guided Optimization

  10. Where MLLMs Fail and Why: Causal Task Decomposition for Capability Failure Diagnosis

    Sep 30, 2026Xia Hu, Brian Potetz, Chun-Ta Lu +6LLM EvaluationCounterfactual Evaluation of VLMs

  11. More Choices, Fewer Decisions: Ordinal-Scale Bias in JEV-like Direct-Decision Models

    Sep 30, 2026Tianxiang Gao, Jinzhe Li, Zhiyuan Li +2LLM EvaluationOrdinal Regression

  12. StreamDecisionBench: Evaluating Decisions in Force on Evolving Language Streams

    Sep 29, 2026Jhen-Ke Lin, Chung Chun WangLLM EvaluationLLM Inference

  13. Benchmarking System One decision models against trained classifiers and language models for automated decision gates

    Sep 29, 2026Amir Rafe, Subasish DasLLM Decision-MakingLLM Evaluation

  14. ArgGYM: A Procedural, Engine-Verified Benchmark for Structured Defeasible Reasoning

    Sep 29, 2026İbrahim Ethem Deveci, Funda Tan Çalık, Barış Deniz Sağlam +1LLM EvaluationRL for Language Model Reasoning

  15. Halluscoring 2026: The first shared task on llms hallucination detection and answer verification

    Sep 29, 2026Aisha Alansari, Abdessalam Bouchekif, Ahmed Hasanaath +9LLM EvaluationLLM Answer Verification

  16. CARAT: Do Materials LLMs Reason or Recite?

    Sep 29, 2026Jiajun Wu, Jian Yang, Zixiang Ni +2LLM EvaluationLLM Grounding

  17. Evaluating and Benchmarking the System One Model Jev

    Sep 29, 2026Tobias Deußer, Lorenz Sparrenberg, Rafet SifaMultilingual Language Model EvaluationLLM Evaluation

  18. Complexity-Aware Evaluation of LLM Comprehension

    Sep 29, 2026Ali Mohammadi Esfahani, Nafiseh Kahani, Samuel A. AjilaSoftware EngineeringLLM Evaluation

  19. DatalogBench: Evaluating Large Language Models on Text-to-Datalog Synthesis

    Sep 29, 2026Yuan Li, Hanyun Jiang, Guowei Tian +2LLM EvaluationLLM-Based Program Synthesis

  20. CRJudgeBench: Can AI Detect Plausible but Invalid Code Reviews?

    Sep 29, 2026Yue Pan, Jiawei Li, Ziyuan Zhang +2LLM EvaluationLLM-as-a-Judge

  21. From Judgment Quality to Downstream Utility: Rethinking LLM-as-a-Judge for Open-Ended Tasks

    Sep 29, 2026Zheng Zhang, Lufei Li, Xinyue Tan +4LLM EvaluationLLM-as-a-Judge

  22. CypherTurn: A Multi-Turn Benchmark for Conversational Text-to-Cypher Evaluation and the Autonomy Divergence

    Sep 29, 2026Yuzhe Zhang, Weijie Zhu, Haolin Yang +5LLM EvaluationText-to-Cypher

  23. Dating the Model: Hidden Dates in System Prompts Affect LLM Evaluation

    Sep 29, 2026Mario Sanz-Guerrero, Minh Duc Bui, Manuel Mager +1LLM EvaluationLanguage Model Generation Evaluation

  24. JudgeProfile: Understanding and Steering Subjectivity in LLM Judges

    Sep 29, 2026Qi Cao, Kangning Liu, Xuan Kan +10Human Preference EvaluationLLM Evaluation

  25. Large-scale factor analysis shows machine intelligence is only partially interpretable

    Sep 29, 2026Faiz Ghifari Haznitrama, Afrizal Hasbi Azizy, Faeyza Rishad ArdiLLM Evaluation

  26. OTROPE: Optimal Transport-based Robust Off-policy Evaluation for Large Language Models

    Sep 28, 2026Liner Xiang, Wenbo Zhang, Hengrui CaiLLM EvaluationOff-Policy Evaluation

  27. Population Fidelity: Evaluating Population Representativeness in LLMs

    Sep 28, 2026Neemias B. da Silva, Martin Lukk, Ali Sutani +5LLM EvaluationLLM Fine-Tuning

  28. ScAn-Bench: Evaluating Scaling Analysis Methodology

    Sep 28, 2026Artin Sermaxhaj, Nastaran Alipour, Donat Sinani +4VLM EvaluationLLM Evaluation

  29. Can LLMs Value the Right Evidence? Evidence-Value Misalignment in Dynamic Medical Diagnosis

    Sep 28, 2026Kehua Feng, Yunsheng Lu, Yitong Qiao +5LLM EvaluationEvidence-Grounded Reasoning

  30. AraDynFact: Dynamic Evaluation of Factual Knowledge in Arabic

    Sep 28, 2026Ignacio Iacobacci, Faroq Altam, Zhaozhi Qian +1LLM EvaluationArabic NLP

  31. AwarenessBench: Assessing Cognitive Capabilities of Language Models

    Sep 28, 2026Xiaojian Li, Rongwu Xu, Tianyun Zhang +9LLM EvaluationEvaluation Awareness in Language Models

  32. How Well Can LLMs Simulate Real Learner Evaluations of Educational Feedback?

    Sep 28, 2026Momoka Furuhashi, Kouta Nakayama, Takashi Kodama +2LLM EvaluationLarge Language Model-Based Social Simulation

  33. Large Language Models for Automated Cross-Domain Machine Learning Task Type Identification: A Benchmark Dataset and Evaluation

    Sep 28, 2026Petros Tsialis, Steffen Limmer, Tobias Rodemann +1LLM EvaluationTabular ML

  34. MemoReason: Evaluating the Effect of Parametric Memory on Contextual Reasoning in LLMs

    Sep 28, 2026Zineddine Tighidet, Andrea Mogini, Jiali Mei +2LLM EvaluationMemorization in Language Models

  35. Measuring Collapse and Correction in Homogeneous-Panel LLM Debate

    Sep 28, 2026Xin Li, Mengbing Liu, Chau YuenLLM EvaluationLLM Auditing

  36. VEX-Bench: Benchmarking Verification Complexity of LLM-Generated Misinformation

    Sep 28, 2026Hanxun Huang, Yutao Wu, Qizhou Wang +9LLM EvaluationFake News Detection

  37. Pass or Fail? Evaluating LLMs on Two Greek Examination Benchmarks

    Sep 28, 2026Panagiota Kyriazi, Eleni Kasoura, Prokopis ProkopidisMultilingual Language Model EvaluationPrompt Sensitivity

  38. TQTS-Bench: A Multi-Syntax Benchmark for Text-to-Query over Time-Series Databases

    Sep 28, 2026Fei Lyu, Zhiyi Peng, Jiaming Liu +5LLM EvaluationTime Series QA

  39. Using LLMs to Detect LLM-Generated Texts: A Cross-Generation Analysis

    Sep 28, 2026Haiyue Yuan, Jie Guo, Weidong Qiu +3LLM EvaluationAI-Generated Text Detection

  40. SleuthBench: Benchmarking Statistical LLM Evaluation Using Tabular Hidden Signals

    Sep 28, 2026Jingyun Jia, Antoine Remond-Tiedrez, Aaron Alvarez +3LLM EvaluationAI Agent Benchmarks

  41. Do System One Decisions Add Up? A Study of Probabilistic Coherence

    Sep 27, 2026Saman Sarker JoyLLM EvaluationClassification

  42. The Effects of Incremental Instruction Delivery on Language-Model Creative Writing

    Sep 27, 2026Anshuman Singh, Abrar Eyasir, Haseeb Yaqoob +1LLM EvaluationLLM Prompting

  43. From Granular Revision Operations to Meaningful Revision Units: Evaluating LLMs for Revision Boundary Detection

    Sep 27, 2026Yu Tian, Andrew Potter, Katerina Christhilf +4LLM Evaluation

  44. One Model Is Not a Crowd: Multi-LLM and Aspect-Conditioned Diverse Comment Generation

    Sep 27, 2026Nafis Irtiza Tripto, Delvin Ce Zhang, Mahjabin Nahar +1LLM EvaluationControllable Text Generation

  45. E-CONAN (Entailment, CONtradition And Neutral) Diagnostics Dataset Investigating Linguistic Phenomena in Arabic Natural Language Understanding

    Sep 27, 2026Khloud AL Jallad, Nada Ghneim, Ghaida RebdawiLLM EvaluationArabic NLP

  46. LLM4Trust: Exploring the Capabilities of Large Language Models for Trust Evaluation

    Sep 27, 2026Jie Wang, Yanbo Sun, Zheng Yan +2LLM EvaluationTrust in AI

  47. MetaBench-Harness: Unlocking End-to-End Optimization of Benchmark Harnesses

    Sep 27, 2026Xuanjun Chen, Hua-Hsuan Chen, Wei-Chung Lu +3LLM EvaluationBenchmark Design

  48. Knowing Is Not Choosing: What Explicit Verification Adds Beyond Generative Preference

    Sep 27, 2026Yilong Li, Chengpo Yan, Aayan Arish +1LLM EvaluationLLM Answer Verification

  49. LLM Judge Validation Under Sparse Overlap: From Inference to Design

    Sep 25, 2026Junxuan Li, Arko Mukherjee, Soumyabrata PalInter-Rater ReliabilityLLM Evaluation