Long-Context Language Model Evaluation

Latest papers 31

All topics
CardsList
  1. Can LLMs Reason Over Long Horizons? An Empirical Evaluation of Context Strategies for Longitudinal Clinical Reasoning

    Sep 30, 2026Taye Akinrele, Noorbakhsh Amiri Golilarz, Subash Neupane +2Long-Context Language Model EvaluationClinical Reasoning

  2. LongHarness Bench: Stress-Testing Language Model Harnesses for Long-Context Reasoning

    Sep 29, 2026Quang Hieu Pham, Thuy Duong Nguyen, Jocelyn Qiaochu Chen +1Long-Context Language Model EvaluationLong-Context Language Model Inference

  3. The Model Knows When to Stop: Training-Free Early Stopping for Long-Context Reading

    Sep 28, 2026Muath Alyobi, Mohamed Eltahir, Almoayyad Abuljdail +3Early StoppingLong-Context Language Model Evaluation

  4. No More Free Lunch: Corpus Task Complexity Matters as Corpora Grow

    Sep 24, 2026Prasann Singhal, Amanda Bertsch, Jacob Steinhardt +1Long-Context Language Model EvaluationLLM Reasoning

  5. MWE-ECL: Recoverable Long-Range Context Does Not Always Override Local Lexical Priors

    Sep 23, 2026Wei He, Aline Villavicencio, Rodrigo Wilkens +1Multilingual Language Model EvaluationLong-Context Language Model Evaluation

  6. The Sirens' Song: When Proximal Background Context Overshadows Distant Evidence

    Sep 22, 2026Xiaoyu Yang, Jie Lu, Wei Duan +1Long-Context Language Model EvaluationEvidence Retrieval

  7. Tasks over Application Manuals: Revealing Gaps in Long-Horizon Procedural Reasoning for Language Models

    Sep 14, 2026Utkarsh Soni, Syed Shariyar Murtaza, Yifan Nie +2Long-Context Language Model Evaluation

  8. Do New Attention Mechanisms Actually Fix Attention Sinks at Million-Token Context?

    Sep 8, 2026Sara Rizwan, Samaanah Abdus SalamLong-Context Language Model EvaluationLong-Context Language Modeling

  9. Separating Stream Stability from Long-Term Recall in Language Models

    Sep 7, 2026Peipei Cao, Xin Zhang, Jie Tang +3Memory-Augmented Language ModelsLong-Context Language Model Evaluation

  10. Polish ModernBERT: The Long and Short of Polish Language Understanding

    Sep 1, 2026Michał Perełkiewicz, Sławomir Dadas, Rafał Poświata +1Language Model PretrainingLong-Context Language Model Evaluation

  11. LongGuard: Mechanistic Analysis and Training-Free Mitigation of Long-Context Failure in Safety Guardrails

    Aug 27, 2026Ziyang Chen, Xing Wu, Songlin HuLanguage Model Safety EvaluationLong-Context Language Model Evaluation

  12. Efficient Sequential Evaluation of Large Language Models

    Jul 19, 2026Chia-Yu Hsu, Shubhanshu ShekharLLM EvaluationConfidence Estimation in Language Models

  13. Logit-Contribution Scoring Identifies Non-Literal Retrieval Heads

    Jul 1, 2026Aryo Pradipta Gema, Beatrice Alex, Pasquale MinerviniLong-Context RetrievalAttention Head Analysis

  14. TriggerBench: Investigating Prospective Memory for Large Language Models

    Jun 22, 2026Tianhua Zhang, Xinjiang Wang, Qianxi Zhang +6LLM EvaluationLong-Context Language Model Evaluation

  15. A Large-Scale Multi-Dimensional Empirical Study of LLMs for Conversation Summarization

    Jun 14, 2026Weixiao Zhou, Gengyao Li, Xianfu Cheng +3LLM EvaluationLong-Context Language Model Evaluation

  16. ATLAS: All-round Testing of Long-context Abilities across Scales

    May 27, 2026Deli Huang, Cunguang Wang, Hongyin Tang +15LLM EvaluationBenchmark Construction

  17. Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks

    May 22, 2026Chuyifei Zhang, Hongyu Cui, Xiaowen Huang +1LLM EvaluationLong-Context Language Model Evaluation

  18. Gavel: Agent Meets Checklist for Evaluating LLMs on Long-Context Legal Summarization

    Jan 7, 2026Yao Dou, Benjamin Mamut, Wei XuLegal NLPLLM Evaluation