LLM Evaluation

LLM: Large Language Model

Latest papers 1,631

All topics
CardsList
  1. The PIMMUR Principles: Ensuring Validity in Collective Behavior of LLM Societies

    Date pendingJiaxu Zhou, Jen-tse Huang, Xuhui Zhou +5LLM EvaluationLLM Auditing

  2. KoSimpleQA: A Korean Factuality Benchmark with an Analysis of Reasoning LLMs

    Date pendingDonghyeon Ko, Kyubyung Chae, Yeguk Jin +6Multilingual Language Model EvaluationLLM Evaluation

  3. Measuring Pragmatic Influence in Large Language Model Instructions

    Date pendingYilin Geng, Omri Abend, Eduard Hovy +1LLM EvaluationLLM Prompting

  4. Evaluating LLM-Simulated Conversations in Modeling Inconsistent and Uncollaborative Behaviors in Human Social Interaction

    Date pendingRyo Kamoi, Ameya Godbole, Binglin Zhou +5LLM EvaluationHuman Behavior Simulation

  5. Inverse Turing Bench: Evaluating Language Models as Judges of Human vs. AI Dialogue

    Date pendingWilliam Hager, Ishika Rathi, Masum Hasan +1LLM EvaluationAI-Generated Text Detection

  6. Efficient Adaptation of LLMs for Hate Speech Detection in Low-Resource Languages: A Comparative Study on Roman Urdu

    Date pendingToneema Zubair, Muhammad Junaid Asif, Faisal Kamiran +2LLM EvaluationHate Speech Detection

  7. Ordinary, Reasonable Chatbots: Do AI Models Track Human Legal Judgments?

    Date pendingNirav Patel, Emily Wenger, Christopher BuccafuscoLLM EvaluationDemographic Bias in Language Models

  8. Accuracy is Not Enough: A Divergence-Based Approach to Evaluate Fidelity Loss in Quantized LLMs

    Date pendingShahzeb Qamar, Lorenz Sparrenberg, Christian Bauckhage +5LLM QuantizationLLM Evaluation

  9. Limitations of Automated Simulatability: LLM Simulators Can Bypass Explanations

    Date pendingAntonin Poché, Fanny Jourdan, Nils Feldhus +6LLM EvaluationAutomated Evaluation