LLM Evaluation

LLM: Large Language Model

Latest papers 1,631

All topics
CardsList
  1. Ontology-Grounded, Reasoner-Verified Benchmarks for Evaluating LLM Reasoning in Scientific AI

    Sep 30, 2026Nishtha N. Vaidya, Stephan Grimm, Thomas Hubauer +1LLM EvaluationSynthetic Benchmark Generation

  2. On the (In)effectiveness of AMR Augmentation for Large Language Models

    Sep 30, 2026Hoa Quynh Nhung Nguyen, Jacopo Staiano, Michael SullivanLLM EvaluationKnowledge Augmentation for Language Models

  3. Benchmarking Prompt Optimization of Large Language Models With Chess

    Sep 30, 2026Timothée Lesort, Alejandra López de Aberasturi Gómez, Tristan Karch +4LLM EvaluationAutomatic Prompt Optimization

  4. ArchitectureIQ: On the Measure of Training Intuition

    Sep 30, 2026Zirui Ren, Shaoyang Guo, Chencheng Tang +9Model SelectionLLM Evaluation

  5. LLM-as-a-Judge for Low-Resource Languages: Adapting Ragas and Comparative Ranking for Romanian

    Sep 30, 2026Claudiu Creanga, Liviu P. DinuLLM EvaluationLLM-as-a-Judge

  6. Who Owns That? Evaluating Ownership Intuitions in Large Language Models

    Sep 30, 2026Xizhi Xiao, Yue Wu, Shan Xu +1LLM Evaluation

  7. RAIM: Robust Aggregation of Inexpensive Models for Hallucination Detection

    Sep 30, 2026Elia Onofri, Roberto Di PietroLLM EvaluationLLM-as-a-Judge

  8. A Shared Taste for Model-Written Text: The Generator-by-Selector Matrices of "AI-AI Bias" Show No Detectable Own-Model Premium

    Sep 30, 2026Dmitrij ŻatuchinLLM EvaluationLanguage Model Bias Evaluation

  9. Right Answers, Costly Models: The Efficiency Gap in LLM-based Optimization Modeling

    Sep 30, 2026Zhong Li, Xin Huang, Jinhui Wan +6LLM EvaluationLarge Language Model-Guided Optimization

  10. Where MLLMs Fail and Why: Causal Task Decomposition for Capability Failure Diagnosis

    Sep 30, 2026Xia Hu, Brian Potetz, Chun-Ta Lu +6LLM EvaluationCounterfactual Evaluation of VLMs

  11. More Choices, Fewer Decisions: Ordinal-Scale Bias in JEV-like Direct-Decision Models

    Sep 30, 2026Tianxiang Gao, Jinzhe Li, Zhiyuan Li +2LLM EvaluationOrdinal Regression

  12. StreamDecisionBench: Evaluating Decisions in Force on Evolving Language Streams

    Sep 29, 2026Jhen-Ke Lin, Chung Chun WangLLM EvaluationLLM Inference

  13. Benchmarking System One decision models against trained classifiers and language models for automated decision gates

    Sep 29, 2026Amir Rafe, Subasish DasLLM Decision-MakingLLM Evaluation

  14. ArgGYM: A Procedural, Engine-Verified Benchmark for Structured Defeasible Reasoning

    Sep 29, 2026İbrahim Ethem Deveci, Funda Tan Çalık, Barış Deniz Sağlam +1LLM EvaluationRL for Language Model Reasoning

  15. Halluscoring 2026: The first shared task on llms hallucination detection and answer verification

    Sep 29, 2026Aisha Alansari, Abdessalam Bouchekif, Ahmed Hasanaath +9LLM EvaluationLLM Answer Verification

  16. CARAT: Do Materials LLMs Reason or Recite?

    Sep 29, 2026Jiajun Wu, Jian Yang, Zixiang Ni +2LLM EvaluationLLM Grounding

  17. Evaluating and Benchmarking the System One Model Jev

    Sep 29, 2026Tobias Deußer, Lorenz Sparrenberg, Rafet SifaMultilingual Language Model EvaluationLLM Evaluation

  18. Complexity-Aware Evaluation of LLM Comprehension

    Sep 29, 2026Ali Mohammadi Esfahani, Nafiseh Kahani, Samuel A. AjilaSoftware EngineeringLLM Evaluation

  19. DatalogBench: Evaluating Large Language Models on Text-to-Datalog Synthesis

    Sep 29, 2026Yuan Li, Hanyun Jiang, Guowei Tian +2LLM EvaluationLLM-Based Program Synthesis

  20. CRJudgeBench: Can AI Detect Plausible but Invalid Code Reviews?

    Sep 29, 2026Yue Pan, Jiawei Li, Ziyuan Zhang +2LLM EvaluationLLM-as-a-Judge

  21. From Judgment Quality to Downstream Utility: Rethinking LLM-as-a-Judge for Open-Ended Tasks

    Sep 29, 2026Zheng Zhang, Lufei Li, Xinyue Tan +4LLM EvaluationLLM-as-a-Judge

  22. CypherTurn: A Multi-Turn Benchmark for Conversational Text-to-Cypher Evaluation and the Autonomy Divergence

    Sep 29, 2026Yuzhe Zhang, Weijie Zhu, Haolin Yang +5LLM EvaluationText-to-Cypher

  23. Dating the Model: Hidden Dates in System Prompts Affect LLM Evaluation

    Sep 29, 2026Mario Sanz-Guerrero, Minh Duc Bui, Manuel Mager +1LLM EvaluationLanguage Model Generation Evaluation

  24. JudgeProfile: Understanding and Steering Subjectivity in LLM Judges

    Sep 29, 2026Qi Cao, Kangning Liu, Xuan Kan +10Human Preference EvaluationLLM Evaluation

  25. Large-scale factor analysis shows machine intelligence is only partially interpretable

    Sep 29, 2026Faiz Ghifari Haznitrama, Afrizal Hasbi Azizy, Faeyza Rishad ArdiLLM Evaluation

  26. OTROPE: Optimal Transport-based Robust Off-policy Evaluation for Large Language Models

    Sep 28, 2026Liner Xiang, Wenbo Zhang, Hengrui CaiLLM EvaluationOff-Policy Evaluation

  27. Population Fidelity: Evaluating Population Representativeness in LLMs

    Sep 28, 2026Neemias B. da Silva, Martin Lukk, Ali Sutani +5LLM EvaluationLLM Fine-Tuning

  28. ScAn-Bench: Evaluating Scaling Analysis Methodology

    Sep 28, 2026Artin Sermaxhaj, Nastaran Alipour, Donat Sinani +4VLM EvaluationLLM Evaluation