LLM Evaluation

LLM: Large Language Model

Latest papers 1,631

All topics
CardsList
  1. PTXBench: Benchmarking and Adapting LLMs for GPU Kernel Optimization with Architecture-specific PTX

    Aug 18, 2026Genghan Zhang, Yixin Dong, Chengze Fan +4LLM EvaluationGPU Kernel Optimization

  2. Beyond Local Accuracy: A Protocol-Level Identifiability Audit for Controlled LLM Reasoning Evaluation

    Aug 13, 2026Junhao Luo, Ning Huang, Ziqi Sha +2LLM EvaluationLLM Auditing

  3. TsuGO: Probing Search Efficiency in LLM Reasoning via Go Life-and-Death Problems

    Aug 13, 2026Shunwen Bai, Ziping Ma, Chaoyang Zhang +4LLM EvaluationInference-Time Search

  4. LigBench: A Unified and Human-Aligned Benchmark for LLM-based Research Idea Generation

    Aug 13, 2026Chenrun Wang, Mingxuan Zhu, Tiancheng Huang +6LLM EvaluationBenchmark Design

  5. The Embedder's Dilemma: LLMs Are Better, but at What Cost?

    Aug 13, 2026Adnan El Assadi, Niklas Muennighoff, Jinhyuk LeeLLM Inference EfficiencyLLM Evaluation

  6. Jagged Judges: Epistemic Stability Under Silence, Pressure, and Persistence

    Aug 12, 2026Justin Zhao, Himaghna Bhattacharjee, Hannah Korevaar +2LLM EvaluationLLM-as-a-Judge

  7. Novels generated by language models show compressed formal variation

    Aug 12, 2026Mehdy Sedaghat Payam, Justin QuinnLLM EvaluationLong-Form Document Generation

  8. NetlistBench: Evaluating LLM Reliability in SPICE Netlist Recognition and Manipulation

    Aug 12, 2026Jiarui Ma, Jianghan Wang, Yuheng Ma +2LLM EvaluationBenchmark Design

  9. Who Thinks Best Depends on How Long You Let Them: Budget-Dependent Rankings in LLM Evaluation

    Aug 12, 2026Rodrigo Guedes de Souza, Alison R. PanissonLLM EvaluationLanguage Model Generation Evaluation

  10. RealisticTritonBench: A Benchmark for Triton-Kernel Generation in Real-World AI Frameworks

    Aug 12, 2026Jinjun Huang, Zhongzhen Wen, Tongtong Xu +3LLM EvaluationGPU Kernel Generation

  11. Benchmark-Based Comparative Assessment of Publicly Benchmarked Indian Foundation Models: A Capability and Evaluation-Maturity Framework

    Aug 12, 2026Avinash Agarwal, Vridhi JainLLM Evaluation

  12. The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance

    Aug 12, 2026Shailja Thakur, Sungeun An, Chad DeLuca +1Prompt SensitivityLLM Evaluation

  13. TRACES: A Benchmark for Epistemic Reliability in Scientific Reasoning by LLMs

    Aug 11, 2026Valentin Rodionov, Shamil AssylbekovLLM EvaluationLLM Reliability

  14. Mapping and Measuring the Behavioral Evolution of Large Language Models

    Aug 11, 2026Dong Qiao, Chris Ding, Jicong FanLLM EvaluationRepresentation Geometry in Language Models

  15. Chemically Meaningful Textualization Enables Explainable Validation of Metal-Organic Frameworks by Large Language Models

    Aug 11, 2026Guobin Zhao, Xiao-Yan LiLLM EvaluationLLM Interpretability

  16. SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information

    Aug 11, 2026Junjie Ye, Zhuohui Sheng, Shaofan Liu +12LLM EvaluationAI Agent Benchmarks

  17. Every Token Counts: Exact Likert-Scale Distributions for Measuring LLM Attitudes and Biases

    Aug 11, 2026Davood Wadi, Mohsen Ghodrat, Matthew PhilpLLM EvaluationCultural Bias in Language Models

  18. From Reasoning Depth to Reasoning Breadth: Evaluating Multi-Point Associative Reasoning in Large Language Models

    Aug 11, 2026Si'an Xie, Jiaxun Liu, Biao Yang +4LLM EvaluationMulti-Hop Reasoning

  19. How Robust Are LLMs to Vietnamese Dialects?

    Aug 11, 2026Minh Tran, Trinh Chau, Thanh-Nhan Le +4LLM EvaluationLanguage Model Robustness

  20. Persona Conditioning as an Assessor-Sensitivity Probe for LLM-Based IR Evaluation

    Aug 11, 2026Samaneh Mohtadi, Pietro Bernardelle, Joel Mackenzie +1LLM EvaluationLLM-as-a-Judge

  21. Is This Your Final Answer? Cross-Contextual Consistency as a Measure of LLM Credibility

    Aug 10, 2026Siyang Wu, Yibo Jiang, Bryon AragamPrompt SensitivityLLM Evaluation

  22. Toward Human Rights Benchmarking for LLMs: A Pilot Methodology

    Aug 10, 2026Savannah Thais, Wm. Matthew Kennedy, Abhigyan Acherjee +3LLM EvaluationMoral Reasoning in Language Models

  23. The Deliberative Deficit: An Empirical Critique of LLMs in Democratic Discourse

    Aug 10, 2026Maurice FlechtnerLLM EvaluationMulti-Agent Debate

  24. From Values to Benchmarks: Evaluating Large Language Models for Governmental Use in Dutch

    Aug 10, 2026Laurens Samson, Iva Gornishka, Gossa Lô +2Multilingual Language Model EvaluationLLM Evaluation