Long-Context Language Modeling

Latest papers 112

All topics
CardsList
  1. FlashCP: Load-Balanced Communication-Efficient Context Parallelism for LLM Training

    Jun 7, 2026Zheng Wang, Eric Liu, Linan Jiang +5Communication-Efficient Distributed TrainingLong-Context Language Modeling

  2. Dense Contexts Are Hard Contexts: Lexical Density Limits Effective Context in LLMs

    Jun 4, 2026Giovanni Dettori, Matteo Boffa, Danilo Giordano +2Long-Context RetrievalLLM Evaluation

  3. Forget Attention: Importance-Aware Attention Is All You Need

    Jun 1, 2026Suhyeong Shin, Yeongwook YangSoftmax AttentionLong-Context Language Modeling

  4. Blurry Window Attention

    May 31, 2026Axel Laborieux, Christos Sourmpis, Juan Gabriel Kostelec +1Long-Context Language ModelingLinear Attention

  5. Don't Read Everything: A Curvature-Conditioned Query for Linear Attention

    May 31, 2026Dong Le, Thong Nguyen, Cong-Duy Nguyen +1In-Context RetrievalLong-Context Language Modeling

  6. GRKV: Global Regression for Training-Free KV Cache Compression in Long-Context LLMs

    May 29, 2026Junjie Peng, You Wu, Haoyi Wu +4KV CachingLong-Context Language Modeling

  7. Moment-KV: Momentum-Based Decode-Time KV Cache Compression for Long Generation

    May 28, 2026Soumyadeep Jana, Sagar Nishad, Sanasam Ranbir SinghKV CachingLong-Context Language Modeling

  8. Why Can't They Remember? Uncovering Representation and Retrieval Bottlenecks in Multi-Turn Acoustic Memory

    May 26, 2026Yang Xiao, Siyi Wang, Han Yin +4Audio-Language Model EvaluationMemorization in Language Models

  9. NestedKV: Nested Memory Routing for Long-Context KV Cache Compression

    May 26, 2026Hong Chen, Xiang Liu, Yubo Gao +5KV CachingLong-Context Language Modeling

  10. Lngram: N-gram Conditional Memory in Latent Space

    May 24, 2026Yunao Zheng, Guoyang Xia, Xiaojie Wang +1Memory-Augmented Language ModelsLong-Context Language Modeling

  11. Interdomain Attention: Beyond Token-Level Key-Value Memory

    May 23, 2026Naoki Kiyohara, Harrison Bo Hua Zhu, Riccardo El Hassanin +4Self-AttentionLong-Context Language Modeling

  12. Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention

    May 19, 2026Wenhu Zhang, Yiming Wu, Huanyu Wang +6Self-AttentionLong-Context Language Modeling

  13. Elastic-dLLM: Position Preserving Context Compression and Augmentation of Diffusion LLMs

    May 18, 2026Junyi Wu, Tianchen Zhao, Shaoqiu Zhang +3Masked Diffusion ModelsLong-Context Language Modeling

  14. RoPE Distinguishes Neither Positions Nor Tokens in Long Contexts, Provably

    May 15, 2026Yufeng Du, Phillip Harris, Minyang Tian +5Rotary Positional EmbeddingsSelf-Attention

  15. EndPrompt: Efficient Long-Context Extension via Terminal Anchoring

    May 14, 2026Han Tian, Luxuan Chen, Xinran Chen +10Long-Context Language ModelingLLM Fine-Tuning

  16. A Hierarchical Language Model with Predictable Scaling Laws and Provable Benefits of Reasoning

    May 13, 2026Jason Gaitonde, Frederic Koehler, Elchanan Mossel +2Long-Context Language ModelingLanguage Model Scaling Laws

  17. Phasor Memory Networks: Stable Backpropagation Through Time for Scalable Explicit Memory

    May 13, 2026Sungwoo Goo, Hwi-yeol Yun, Sangkeun JungMemory-Augmented Neural NetworksMemory-Augmented Language Models

  18. Training-Inference Consistent Segmented Execution for Long-Context LLMs

    May 12, 2026Xianpeng Shang, Jiang Li, Zehua Duo +2Self-AttentionLong-Context Language Modeling

  19. Where Does Long-Context Supervision Actually Go? Effective-Context Exposure Balancing

    May 11, 2026Jinchang Zhu, Jindong Li, Chengyu Zou +4Long-Context Language ModelingAdaptive Loss Weighting

  20. Remember to Forget: Gated Adaptive Positional Encoding

    May 11, 2026Riccardo Ali, Alessio Borgi, Mario Severino +2Rotary Positional EmbeddingsSelf-Attention

  21. Positional LSH: Binary Block Matrix Approximation for Attention with Linear Biases

    May 10, 2026Daniel Wolfson, Tal WagnerSelf-AttentionLong-Context Language Modeling

  22. VORT: Adaptive Power-Law Memory for NLP Transformers

    May 9, 2026Nabil MlaikiMemory-Augmented Language ModelsTransformer

  23. Kaczmarz Linear Attention

    May 9, 2026Jiaxuan Zou, Ruifeng Ren, Yong LiuLong-Context Language ModelingRecurrent Transformers