LLM Evaluation

LLM: Large Language Model

Latest papers 1,631

All topics
CardsList
  1. Mask-Proof: An LLM-based Automated Data Curation Pipeline on Mathematical Proofs

    Jun 13, 2026Jierui Zhang, Siyuan Tan, Xinhang Li +8Mathematical Reasoning BenchmarksLLM Evaluation

  2. PACUTE: Phonology-, Affix-, and Character-level Understanding of Tokens for Filipino

    Jun 13, 2026Jann Railey Montalan, David Demitri Africa, Jimson Paulo Layacan +3LLM EvaluationLanguage Modeling

  3. Data-Centric Benchmarking of Exploit Generation in LLMs: Understanding the Impact of Fine-Tuning

    Jun 13, 2026Yiwei Chen, Lichi Li, Kai Cheung +2LLM EvaluationLLM Fine-Tuning

  4. Towards Verifiable Agentic Data Science: Solving Irregular TSQA Via Tool-Grounded Reasoning

    Jun 13, 2026Sanhorn Chen, Xiaoyang Chen, Boyu Liu +1Irregular Time-Series ModelingLLM Evaluation

  5. TriAdReview: Triangular Adversarial Review Architecture for Multi-Model Technical Document Generation

    Jun 13, 2026Zhiqiang Zhou, Junliang Dai, Xu LingMulti-Agent LLM SystemsLLM Evaluation

  6. FactoryLLM: A Safe and Open-Source AI Playground for Evaluating LLMs in Smart Factories

    Jun 12, 2026Yash Pulse, Yong-Bin Kang, Abhik Banerjee +2ManufacturingLLM Evaluation

  7. Simulating Students' Java Programming Errors with Large Language Models

    Jun 12, 2026Ali Keramati, Jie Cao, Iman Mohammadi +2LLM EvaluationProgramming Education

  8. LLMs Contain Multitudes: How Deployment Context Reshapes Model-Level Preferences and Values

    Jun 11, 2026Filip Trhlik, Aoife O'Flynn, Angela Yu +2LLM EvaluationLanguage Model Bias Evaluation

  9. DLawBench: Evaluating LLMs Through Multi-Turn Legal Consultation

    Jun 11, 2026Li Zhang, Yuzhen Shi, Yiran Hu +15LLM EvaluationLegal QA

  10. QIAS 2026: Overview of the Shared Task on Islamic Inheritance Reasoning

    Jun 11, 2026Abdessalam Bouchekif, Somaya Eltanbouly, Samer Rashwani +5LLM EvaluationLegal Reasoning

  11. SupraBench: A Benchmark for Supramolecular Chemistry

    Jun 11, 2026Tianyi Ma, Yijun Ma, Zehong Wang +6LLM EvaluationMolecular Property Prediction

  12. Which Models Perform Better in Inheritance Reasoning?

    Jun 11, 2026Mohammed Amine Mouhoub, Chahinez BouchekifLLM EvaluationLLM Reliability

  13. Evaluating Pluralism in LLMs through Latent Perspectives

    Jun 11, 2026Laura Majer, Jan Šnajder, Martin TutekLLM EvaluationLLM Alignment

  14. VHDLSuite: Unified Pipeline for LLM VHDL Generation with Data Synthesis and Evaluation

    Jun 11, 2026Yijun Shen, Minghao Shao, Yichen Zhao +4LLM EvaluationCode Generation

  15. SICI: A Semantic-Pragmatic Complexity Index Reveals Regime Shifts in LLM Stance Detection

    Jun 11, 2026Fuqiang Niu, Bowen ZhangLLM EvaluationStance Detection

  16. MÖVE: A Holistic LLM Benchmark for the German Public Sector

    Jun 11, 2026Camilla Dalerci, Thilo Michael, Robin Schaefer +1Multilingual Language Model EvaluationLLM Evaluation

  17. The Emergence of Autonomous Penetration Capabilities in Large Language Model-Powered AI Systems

    Jun 11, 2026Jiaqi Luo, Jiarun Dai, Zhile Chen +8LLM EvaluationAI Agent Security Benchmarks

  18. SciR: A Controllable Benchmark for Scientific Reasoning in LLMs

    Jun 11, 2026Pierre Beckmann, Marco Valentino, Andre FreitasLLM EvaluationScientific Reasoning

  19. GENIE: A Fine-Grained Measure for Novelty

    Jun 11, 2026Ramya Namuduri, Manya Wadhwa, Anshun Asher Zheng +2LLM EvaluationLanguage Model Generation Evaluation

  20. Constrained Semantic Decompression in LLMs through Persian Proverb-Conditioned Story Generation

    Jun 10, 2026Zahra Habibzadeh, Paria Khoshtab, Amir Mesbah +1LLM EvaluationLLM Grounding

  21. Measuring Semantic Progress in Multi-turn Dialogue via Information Gain

    Jun 10, 2026Paul He, Shiva Kasiviswanathan, Dominik JanzingLLM EvaluationMulti-Turn Dialogue Evaluation

  22. Reassessing High-Performing LLMs on Polish Medical Exams: True Competence or Bias-Driven Performance?

    Jun 10, 2026Antoni Lasik, Jakub Pokrywka, Łukasz Grzybowski +7LLM EvaluationLLM Reliability