Long-Context Language Modeling

Latest papers 112

All topics
CardsList
  1. Mechanics of Long-Context Hybrid Models Part 1.1: From Hybrid Attention to Hybrid Position

    Oct 7, 2026Xiaoran Liu, Ziwei He, Xipeng QiuLong-Context Language ModelingHybrid Attention

  2. Balancing Memory Pathways: Analyzing and Improving Memory Utilization in Hybrid LMs

    Oct 5, 2026Hyunji Lee, Joykirat Singh, Zaid Khan +5Long-Context Language ModelingRecurrent Transformers

  3. Domain adaptation of Russian ModernBERT for long legal documents

    Oct 5, 2026I. Litvak, D. Gvozdetsky, F. Lashkin +7Language Model PretrainingLegal NLP

  4. Learning to Learn a Language

    Oct 5, 2026Lennart Carstens-Behrens, Holger FröhlichLanguage Model PretrainingMeta-Learning

  5. HLA: Expressive Hybrid Linear Attention via Chunk-Wise Dynamic Mixing

    Oct 5, 2026Zhuokun Chen, Xi Lin, Xiyu Wu +3Long-Context Language ModelingLinear Attention

  6. Retrieval Capacity of Self-Attention Under Competition

    Sep 29, 2026Timur Mudarisov, Mikhail Burtsev, Radu StateSelf-AttentionLong-Context Language Modeling

  7. ARC-KV: Amortizing Anchor Search for Reconstruction-Based KV Cache Compaction

    Sep 29, 2026Zheyu Shen, Guanhua Wang, Dezhan Tu +5Long-Context Language ModelingKV-Cache Management

  8. MS-GLA: Multi-Scale Gated Linear Attention for Addressing Representational Bottlenecks via Multi-Temporal Resolution

    Sep 28, 2026Prasoon Dev, Anirudh Sankar, Vasudeva VarmaLong-Context Language ModelingGated Attention

  9. RoPE is Dead, Long Live RoPE: Towards Scalable Data-aware Positional Encodings

    Sep 28, 2026Jarod Lévy, Mathurin Videau, Jad Yehya +3Rotary Positional EmbeddingsLong-Context Language Modeling

  10. GSM: Efficient Language Modeling with Shared Global State

    Sep 27, 2026Yunao Zheng, Bin Wen, Xiaojie Wang +12Long-Context Language Model InferenceLong-Context Language Modeling

  11. Log-Depth Recurrent Language Modeling

    Sep 23, 2026Yiqin Wang, Nuri Cingillioglu, Charles PertLong-Context Language ModelingAutoregressive Language Modeling

  12. SAS: Simple Attention Sparsification via End-to-End Optimization of Context Ranking

    Sep 14, 2026Zhiwei Li, Lei Zhu, Hao Gu +6Long-Context Language ModelingSparse Attention

  13. Do New Attention Mechanisms Actually Fix Attention Sinks at Million-Token Context?

    Sep 8, 2026Sara Rizwan, Samaanah Abdus SalamLong-Context Language Model EvaluationLong-Context Language Modeling

  14. CEDAR: Error-Bounded Residual Routing for Efficient Long-Context Attention

    Sep 7, 2026Siyu Li, Dong Wang, Jie Zhou +3Long-Context Language ModelingEfficient Attention

  15. BASP: Communication-Efficient Batch-Aware Sequence Parallelism for LLM Training

    Sep 2, 2026Bigyan Ghimire, Jon C. CalhounCommunication-Efficient Distributed TrainingLong-Context Language Modeling

  16. Language Models Can Control Their Own Attention

    Sep 2, 2026Namgyu Ho, Huzama Ahmad, Woosung Koh +3Efficient Language Model InferenceLong-Context Language Modeling

  17. Polish ModernBERT: The Long and Short of Polish Language Understanding

    Sep 1, 2026Michał Perełkiewicz, Sławomir Dadas, Rafał Poświata +1Language Model PretrainingLong-Context Language Model Evaluation

  18. A.X K2 Technical Report

    Aug 31, 2026Cheolseung Baek, Dhammiko Arya, Eunki Kim +40Mixture-of-Experts Language ModelsLong-Context Language Modeling

  19. Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge

    Aug 12, 2026Arda Uzunoglu, Benjamin Van Durme, Daniel KhashabiLong-Context Language ModelingFactual Knowledge in Language Models

  20. Cracks in the Foundation: Seemingly Minor Architectural Choices Impact Long Context Extension

    Aug 10, 2026Amanda Bertsch, Luca Soldaini, Matthew R. Gormley +4TransformerLong-Context Language Modeling

  21. Motif 3: Technical Report

    Aug 10, 2026Junghwan Lim, Joon Son Chung, Sungmin Lee +24Mixture-of-Experts Language ModelsLong-Context Language Modeling

  22. OctoLong: Mid-Training On Cross-Repository Code Contexts Enhances Long-Context Modeling

    Aug 5, 2026Indraneil Paul, Falko Helm, Goran Glavaš +1Software EngineeringLong-Context Language Modeling

  23. Training-Free Hashing-Based Attention via Binary Principal Components

    Aug 5, 2026Daohai Yu, Zhanpeng Zeng, Keyu Chen +6Long-Context Language ModelingLLM Inference Acceleration

  24. Mamba with Hierarchical Memory: Solving Representation Bottleneck in Long Sequence Modeling

    Aug 3, 2026Qinwen Wang, Jieping Luo, Aoxiang Qin +5Long-Context RetrievalMemory-Augmented Neural Networks

  25. DART: Decoded Attention over Recurrent States for Efficient Long-Context Sequence Modeling

    Aug 3, 2026Yixiao Qian, Song Chen, Pengkai Wang +3Memory-Augmented Language ModelsKV Caching

  26. Learning What to Remember: Test-Time Training via Context Distillation

    Aug 3, 2026Zixuan Wang, Xingyu Dang, Rui-Jie Zhu +4Continual Learning for LLMsLong-Context Language Modeling

  27. Mergeable Model-Side Aggregation States for Long-Context Language Models

    Jul 29, 2026Dachuan Song, Junyu Yin, Zechen Hu +1Numerical Reasoning in Language ModelsLong-Context Language Modeling