Language Model Generation Evaluation

Latest papers 209

All topics
CardsList
  1. Document-Level Text Simplification in Estonian Using Large Language Models

    Oct 7, 2026Meeri-Ly Muru, Eduard BarbuLow-Resource Language ProcessingLanguage Model Generation Evaluation

  2. What pass@k Cannot Measure: Evaluating Diversity and Capability Retention after Post-Training

    Oct 5, 2026Subham Rath, Raj Dandekar, Rajat Dandekar +1LLM EvaluationLanguage Model Generation Evaluation

  3. SOL: Measuring Gaps between Text Distributions by Double Sliced Wasserstein Metrics

    Oct 5, 2026Gregor Kornhardt, Moritz Piening, Jannis Chemseddine +1Non-Autoregressive Text GenerationLanguage Model Generation Evaluation

  4. Generalization Is Stability, Not Accuracy: Multi-Axis Evaluation of LLMs

    Oct 1, 2026Nagham Omar, Mahmoud Jabarin, Maya Rozenshtein +3Prompt SensitivityLLM Evaluation

  5. Beyond Leaderboards: Tokenomics of Agentic Small Language Model Ensembles

    Oct 1, 2026Alexei N. Skurikhin, Emily M. Taylor, Nathan A. DeBardelebenLLM Inference EfficiencyLanguage Model Generation Evaluation

  6. LLM-as-a-Judge for Low-Resource Languages: Adapting Ragas and Comparative Ranking for Romanian

    Sep 30, 2026Claudiu Creanga, Liviu P. DinuLLM EvaluationLLM-as-a-Judge

  7. Mubric: Mutation Testing-Guided Rubric Generation for LLM Evaluation

    Sep 29, 2026Jiayuxuan Yang, Jie M. Zhang, Yiling Lou +1Language Model Generation EvaluationRubric-Based Evaluation

  8. Dating the Model: Hidden Dates in System Prompts Affect LLM Evaluation

    Sep 29, 2026Mario Sanz-Guerrero, Minh Duc Bui, Manuel Mager +1LLM EvaluationLanguage Model Generation Evaluation

  9. Generating Edit-Inducing Questions for AI Research Manuscripts

    Sep 29, 2026Sebastian Joseph, Zichao Wang, Jennifer Healey +3Text GenerationLanguage Model Generation Evaluation

  10. Coherence-Aware Distributional Evaluation of Open-Ended Text Generation

    Sep 28, 2026Jinnuo Liu, Junhao Zhu, Weifeng Jiang +2Language Model Generation EvaluationGenerative AI Evaluation

  11. MISHAP-Bench: A Hallucination Benchmark for Large Audio-Language Models

    Sep 27, 2026Zhi Wen Soi, Giulio Segalini, Jian-Jia Chen +1Audio-Language Model EvaluationAudio-Language Model Hallucination Detection

  12. Knowing Is Not Choosing: What Explicit Verification Adds Beyond Generative Preference

    Sep 27, 2026Yilong Li, Chengpo Yan, Aayan Arish +1LLM EvaluationLLM Answer Verification

  13. Two Emojis of Difference: What Multilingual Affective Generation Benchmarks Actually Measure

    Sep 24, 2026Fardeen Sadab, Adib SakhawatMultilingual Language Model EvaluationLanguage Model Generation Evaluation

  14. Likelihood Ranking doesn't Scale Like Prompting in LLMs

    Sep 24, 2026Alessandro Bondielli, Lucia Passaro, Davide Bacciu +1LLM EvaluationLanguage Model Generation Evaluation

  15. Reference-Based Analysis of Coherence and Diversity in Open-Ended Text Generation

    Sep 23, 2026Esteban Garcés AriasOpen-Ended GenerationLanguage Model Generation Evaluation

  16. Speculative Evaluation of Stochastic LLMs

    Sep 23, 2026Qianli Shen, Xiang Li, Ruomeng Ding +3LLM EvaluationLanguage Model Generation Evaluation

  17. Recognized but Not Produced: A Generation Benchmark for Culturally Specific Kinship Terms

    Sep 22, 2026Sahil Pardasani, Madhusudan SinghMultilingual Language Model EvaluationLanguage Model Generation Evaluation

  18. JEV-as-a-Judge: Accept When Confident, Escalate When Unsure

    Sep 22, 2026Yubo Li, Yidi Miao, Ramayya Krishnan +1LLM-as-a-JudgeLanguage Model Generation Evaluation

  19. Efficient Cost-Aware LLM Evaluation via Bayesian Bandit Gittins Indices

    Sep 22, 2026Qian Xie, Yueli He, Nairen CaoMulti-Armed BanditsLLM Evaluation

  20. Made in Hungary: Comments on the performance of generative language models

    Sep 16, 2026Mátyás Osváth, Enikő Héja, Noémi Ligeti-NagyLLM EvaluationLanguage Model Generation Evaluation

  21. A Calibrated Instrument for Measuring How Inference Optimizations Affect Output Quality

    Sep 16, 2026Jerry KaplanLLM QuantizationLLM Evaluation