LLM Evaluation

LLM: Large Language Model

Latest papers 1,631

All topics
CardsList
  1. Towards AI-Assisted Research Writing: Benchmarking LLMs for AI/ML Introduction Generation

    Aug 19, 2025Krishna Garg, Firoz Shaik, Sambaran Bandyopadhyay +1LLM EvaluationLanguage Model Generation Evaluation

  2. Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings

    Aug 16, 2025Jenny Y. Huang, Yunyi Shen, Dennis Wei +1Pairwise Preference LearningLLM Evaluation

  3. Rule2Text: A Framework for Generating and Evaluating Natural Language Explanations of Knowledge Graph Rules

    Aug 14, 2025Nasim Shirvani-Mahdavi, Chengkai LiLLM EvaluationExplainability Evaluation

  4. Post-training for Efficient Communication via Convention Formation

    Aug 8, 2025Yilun Hua, Evan Wang, Yoav ArtziLLM EvaluationLLM Post-Training

  5. Are AI Coders Snitches? An Empirical Study of Pretraining Data Detection on Code Large Language Models

    Jul 23, 2025Tianlin Li, Yunxiang Wei, Zhiming Li +5LLM EvaluationCode Language Models

  6. IDRBench: Understanding the Capability of Large Language Models on Interdisciplinary Research

    Jul 21, 2025Yuanhao Shen, Daniel Xavier de Sousa, Ricardo Marçal +2LLM EvaluationLarge Language Model-Guided Scientific Discovery

  7. FusionFactory: Fusing LLM Capabilities with Multi-LLM Log Data

    Jul 14, 2025Tao Feng, Haozhen Zhang, Zijie Lei +5LLM EvaluationLLM Routing

  8. Detoxify: A framework for abusive text transformation using LLMs

    Jul 14, 2025Rohitash Chandra, Jiyong Choi, Jayesh SonawaneLLM Evaluation

  9. LLM-Based Social Simulations Require a Boundary

    Jun 24, 2025Zengqing Wu, Run Peng, Takayuki Ito +2LLM EvaluationHuman Behavior Simulation

  10. Measuring Intent Comprehension in LLMs

    Jun 19, 2025Nadav Kunievsky, James A. EvansPrompt SensitivityLLM Evaluation

  11. SocialMaze: A Benchmark for Evaluating and Enhancing Social Reasoning in Large Language Models in Complex Social Environments

    May 29, 2025Zixiang Xu, Yanbo Wang, Yue Huang +13LLM EvaluationAI Agent Benchmarks

  12. PBEBench: A Multi-Step Programming by Examples Reasoning Benchmark inspired by Historical Linguistics

    May 29, 2025Atharva Naik, Prakam, Yash Mathur +6Logical ReasoningLLM Evaluation

  13. R3: Robust Rubric-Agnostic Reward Models

    May 19, 2025David Anugraha, Zilu Tang, Lester James V. Miranda +5Reward ModelingLLM Evaluation

  14. Can LLM-based Financial Investing Strategies Outperform the Market in Long Run?

    May 11, 2025Weixian Waylon Li, Hyeonjun Kim, Mihai Cucuringu +1LLM EvaluationQuantitative Finance

  15. The Sparse Frontier: Sparse Attention Trade-offs in Transformer LLMs

    Apr 24, 2025Piotr Nawrot, Robert Li, Renjie Huang +3Transformer InferenceLLM Evaluation

  16. Evaluating LLMs on Chinese Topic Constructions: A Research Proposal Inspired by Tian et al. (2024)

    Apr 21, 2025Xiaodong YangLLM EvaluationLanguage Model Probing

  17. DMind Benchmark: Toward a Holistic Assessment of LLM Capabilities across the Web3 Domain

    Apr 18, 2025Enhao Huang, Pengyu Sun, Shuxun Wang +13LLM EvaluationSoftware Vulnerability Detection

  18. SAGE: A Search-AuGmented Evaluation of Large Language Models on Free-Form QA

    Apr 10, 2025Sher Badshah, Ali Emami, Hassan SajjadLLM EvaluationLanguage Model Generation Evaluation

  19. No Free Labels: Limitations of LLM-as-a-Judge Without Human Grounding

    Mar 7, 2025Michael Krumdick, Charles Lovering, Varshini Reddy +2LLM EvaluationLLM-as-a-Judge

  20. Large Language Models for Cryptocurrency Transaction Analysis: A Bitcoin Case Study

    Jan 30, 2025Yuchen Lei, Yuexin Xiang, Rafael Dowsley +5LLM EvaluationLLMs for Cybersecurity

  21. Compound-QA: A Benchmark for Evaluating LLMs on Compound Questions

    Nov 15, 2024Yutao Hou, Yajing Luo, Zhiwen Ruan +4Multi-Hop QALLM Evaluation

  22. Growing a Tail: Increasing Output Diversity in Large Language Models

    Nov 5, 2024Michal Shur-Ofry, Bar Horowitz-Amsalem, Adir Rahamim +1LLM EvaluationLLM Prompting

  23. CausalBN-Bench: A Comprehensive Benchmark for Causal Learning Capability of LLMs

    Apr 9, 2024Yu Zhou, Xingyu Wu, Jibin Wu +2LLM EvaluationCausal Discovery

  24. Limits of LLM Text Detectors in Education

    Date pendingLukas Gehring, Benjamin Paa\ssenLLM EvaluationAI-Generated Text Detection