Sparse Attention

Momentum

24 papers in the last four weeks, up 200% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 160

All topics
CardsList
  1. Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling

    Jul 3, 2026Xiang Hu, Xinyu Wei, Hao Gu +10Long-Context Language Model InferenceLong-Context Language Modeling

  2. Can Language Models Actually Retrieve In-Context? Drowning in Documents at Million Token Scale

    Jul 1, 2026Siddharth Gollapudi, Nilesh Gupta, Prasann Singhal +1In-Context RetrievalLength Generalization

  3. RaBitQCache: Rotated Binary Quantization for KVCache in Long Context LLM Inference

    Jun 30, 2026Wenhao Li, Jinhao Dong, Hailin Zhang +3KV CachingLong-Context Language Model Inference

  4. Dual Sparse Aggregation Transformer for Multispectral Object Detection

    Jun 30, 2026Wencong Wu, Xiuwei Zhang, Hanlin Yin +2Multispectral Object DetectionDetection Transformer

  5. Hierarchical Global Attention (HGA)

    Jun 29, 2026Woernle Frank, Fedosov Vladimir, Grinenko ArtemiyKV-Cache OffloadingLong-Context Modeling

  6. Predict, Reuse, and Repair: Accelerating Dynamic Sparse Attention for Long-Context LLM Decoding

    Jun 29, 2026Tianyu Wang, Gourav Rattihalli, Aditya Dhakal +4Long-Context Language Model InferenceLLM Inference Acceleration

  7. MATCH: Modulating Attention via In-Context Retrieval for Long-Context Transformers

    Jun 29, 2026Linrui Ma, Chun Hei Lo, Xinyu Wang +12In-Context RetrievalLong-Context Language Modeling

  8. LCG: Long-Context Consistent Image Generation with Sparse Relational Attention

    Jun 24, 2026Zihao Wang, Yijia Xu, Haoze Zheng +3T2I GenerationImage Generation

  9. Chorus II: Cross-Request Sparsity Reuse for Efficient Image-to-Video Generation

    Jun 23, 2026Hao Liu, Chenghuan Huang, Hao Liu +6Image-to-Video GenerationVideo Diffusion Models

  10. VSANet: View-aware Sparse Attention Network for Light Field Image Denoising

    Jun 23, 2026Gargi Panda, Soumitra Kundu, Saumik Bhattacharya +1Sparse AttentionImage Denoising

  11. Dustin: Draft-Augmented Sparse Verification for Efficient Long-Context Generation with Speculative Decoding

    Jun 23, 2026WenHung Lee, Jian-Jia Chen, Xiaolin Lin +6Long-Context Language Model InferenceKV-Cache Management

  12. ScalingAttention: Discovering Intrinsic Sparse Attention Topology for Video Diffusion Transformers

    Jun 22, 2026Ruiliang Zhou, Xuecheng Wu, Kang He +6Video Diffusion ModelsDiffusion Transformer

  13. ConSA: Controllable Sparsity in Hybrid Attention via Learnable Allocation

    Jun 16, 2026Yao Chen, Yinqi Yang, Junyuan Shang +6LLM Inference AccelerationSparse Attention

  14. MiniMax Sparse Attention

    Jun 11, 2026Xunhao Lai, Weiqi Xu, Yufeng Yang +14GPU Kernel OptimizationLong-Context Language Modeling

  15. From Rigid to Dynamic: Entropy-Guided Adaptive Inference for Long-Context LLMs

    Jun 8, 2026Zhanchao Xu, Haoyang Li, Qingfa Xiao +4Long-Context Language Model InferenceLLM Inference Acceleration

  16. SIFT: Selective-Index For Fast Compute of RAG Prefill by Exploiting Attention Invariance

    Jun 8, 2026Rya Sanovar, Srikant Bharadwaj, Hritvik Taneja +1Retrieval-Augmented GenerationLLM Inference Acceleration

  17. FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention

    Jun 8, 2026Yan Wang, Qifan Zhang, Jiachen Yu +12KV CachingLong-Context Language Model Inference

  18. Sparrow: Sparse Rollout for Stable and Efficient Long-context RL of Large Language Models

    Jun 7, 2026Yang Zhou, Ranajoy Sadhukhan, Zhaofeng Sun +7RL for Language Model ReasoningSparse Attention

  19. You Only Index Once: Cross-Layer Sparse Attention with Shared Routing

    Jun 4, 2026Yutao Sun, Yanqi Zhang, Li Dong +2Long-Context Language Model InferenceKV-Cache Management

  20. Vortex: Efficient and Programmable Sparse Attention Serving for AI Agents

    Jun 4, 2026Zhuoming Chen, Xinrui Zhong, Qilong Feng +5LLM ServingLLM Inference Acceleration

  21. SparDA: Sparse Decoupled Attention for Efficient Long-Context LLM Inference

    Jun 3, 2026Yaosheng Fu, Guangxuan Xiao, Xin Dong +2KV-Cache OffloadingLong-Context Language Model Inference

  22. LVSA: Training-Free Sparse Attention for Long Video Diffusion

    May 29, 2026Gael Glorian, Ioannis Lamprou, Zhen Zhang +2Video Diffusion ModelsLong-Horizon Video Generation

  23. OmniMem: Scalable and Adaptive Memory Retrieval for Long Video Generation

    May 28, 2026Lin Zhao, Yushu Wu, Yifan Gong +2KV CachingLong Video Generation