Long-Context Language Modeling

Latest papers 112

All topics
CardsList
  1. Raven: High-Recall Sequence Modeling with Sparse Memory Routing

    Jul 28, 2026Arshia Afzal, Aviv Bick, Eric P. Xing +2Memory-Augmented Language ModelsLong-Context Language Modeling

  2. Parameter-free Adaptive Sparse Attention via Compression-Based Content Selection

    Jul 23, 2026Debarshi Kundu, Swaroop Ghosh, Vasant HonavarLong-Context Language ModelingSparse Attention

  3. Extending LLM Context via Associative Recurrent Memory

    Jul 13, 2026Gleb Kuzmin, Ivan Rodkin, Aydar Bulatov +8Memory-Augmented Language ModelsLong-Context Language Modeling

  4. Self-Guided Test-Time Training for Long-Context LLMs

    Jul 10, 2026Xinyu Zhu, Zhe Xu, Xiaohan Wei +10Long-Context Language ModelingTest-Time Training

  5. Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling

    Jul 3, 2026Xiang Hu, Xinyu Wei, Hao Gu +10Long-Context Language Model InferenceLong-Context Language Modeling

  6. BamiBERT: A New BERT-based Language Model for Vietnamese

    Jul 2, 2026Dat Quoc Nguyen, Thinh Pham, Chi Tran +1Language Model PretrainingTransformer

  7. MATCH: Modulating Attention via In-Context Retrieval for Long-Context Transformers

    Jun 29, 2026Linrui Ma, Chun Hei Lo, Xinyu Wang +12In-Context RetrievalLong-Context Language Modeling

  8. Flexformer: Flexible Linear Transformer with Learnable Attention Kernel

    Jun 26, 2026Haoran Zhang, Feng ZhouFourier Feature EmbeddingsLong-Context Language Modeling

  9. Mitigating Position Bias in Transformers via Layer-Specific Positional Embedding Scaling

    Jun 26, 2026Changze Lv, Zhenghua Wang, Yiran Ding +9Rotary Positional EmbeddingsLong-Context Language Modeling

  10. Erase-then-Delta Attention: Decoupling Erase and Write Addresses in Delta-Rule Linear Attention

    Jun 25, 2026Xiao Li, Chengruidong Zhang, Hao Luo +15Memory-Augmented Language ModelsLong-Context Language Modeling

  11. Test-Time Training with Next-Token Prediction

    Jun 19, 2026Xuan Ouyang, Zefan Cai, Junjie HuLong-Context Language ModelingNext-Token Prediction

  12. The Stanford EDGAR Filings Dataset: Reconstructing U.S. Corporate and Financial Disclosures into Layout-Faithful and Token-Efficient Pretraining Data

    Jun 16, 2026Nick Bettencourt, Xiaowei Ding, Kay GieseckeDocument UnderstandingLong-Context Language Modeling

  13. Mixtures of Subspaces for Bandwidth Efficient Context Parallel Training

    Jun 15, 2026Sameera Ramasinghe, Ajanthan Thalaiyasingam, Hadi Mohaghegh Dolatabadi +5Communication-Efficient Distributed TrainingLong-Context Language Modeling

  14. Long-Context Modeling via GSS-Transformer Hybrid Architecture with Learnable Mixing

    Jun 15, 2026Kuzey Torlak, Hüseyin Arda Arslan, Anıl Dervişoğlu +2Long-Context Language ModelingState Space Models

  15. Knowledge Graph Enhanced Memory-Augmented Retrieval for Long Context Modeling

    Jun 12, 2026Ghadir Alselwi, Basem Suleiman, Hao Xue +4Memory-Augmented Language ModelsKnowledge Augmentation for Language Models

  16. MiniMax Sparse Attention

    Jun 11, 2026Xunhao Lai, Weiqi Xu, Yufeng Yang +14GPU Kernel OptimizationLong-Context Language Modeling

  17. Continual LLM Upcycling: A Predictor-Gated Bank-Wise Sparsity Training Recipe for Dense-to-Sparse LLMs

    Jun 9, 2026Ruixuan Huang, Jinyuan Shi, Hantao Huang +5Continual Learning for LLMsLLM Compression

  18. Dynamic Linear Attention

    Jun 9, 2026Xin Wang, Hui Shen, Boyuan Zheng +7Long-Context Language ModelingLinear Attention