Dynamic Sparse Attention

Momentum

18 papers in the last four weeks, up 157% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 123

All topics
CardsList
  1. MWOP: Modality-aware Width-wise Operation Pruning for Efficient MLLMs

    Oct 1, 2026Xudong Wang, Hao Wu, Haozhe Hu +5Visual Token PruningLarge Language Model Compression

  2. HHR: Hierarchical Hash Retrieval for Efficient LLM Generation

    Oct 1, 2026Lianjun Liu, Tiantian Zheng, You Huang +5LLM Inference OptimizationDynamic Sparse Attention

  3. SparLeak: Privacy Leakage from Sparse Attention in LLM Inference on Shared GPUs

    Sep 30, 2026Fahao Chen, Linkang Du, Jinhao Zhou +2Dynamic Sparse AttentionLLM Inference Optimization

  4. SANTA++: Sampling Attention through Representative Keys

    Sep 28, 2026Kyle Lee, Christian Z. Pratt, Ruoyu Fang +4Dynamic Sparse AttentionBounded-Memory

  5. ReSS: Residual-Restoring Sparse Attention for 3D Vision Transformers

    Sep 28, 2026Yongsung Kim, Jaehoon Lee, Minjun Park +3Visual Geometry Grounded TransformerDynamic Sparse Attention

  6. WorldAttention: An Efficient Attention Architecture for Interactive Video World Models

    Sep 28, 2026Zeyu Zhang, Jinyuan Mao, Dakai An +6Video World ModelsDynamic Sparse Attention

  7. Where Activation Sparsity and KV-Cache Sparsity Cross in LLM Decoding

    Sep 27, 2026Jungseob Lee, Seungyoon Lee, Seongtae Hong +2Dynamic Sparse AttentionLarge Language Model Decoding

  8. PQ-HSA: Reusing Product-Quantized Scores for Hybrid Sparse-Approximate Attention

    Sep 27, 2026Kunming Shao, Jierun Chen, Yanli Wang +4Dynamic Sparse AttentionKey-Value Cache Quantization

  9. CompKV: Compensation-Aware KV Selection for Long-Context LLM Inference

    Sep 22, 2026Zhen Huang, Ruizhe Yao, Danyi Liu +8Dynamic Sparse AttentionLLM Inference Optimization

  10. Understanding and Exploiting Diagonal Attention Sparsity in Autoregressive Image Generation

    Sep 17, 2026Daeun Kim, Junwha Hong, Changhun Oh +3Autoregressive Image GenerationDynamic Sparse Attention

  11. SAS: Simple Attention Sparsification via End-to-End Optimization of Context Ranking

    Sep 14, 2026Zhiwei Li, Lei Zhu, Hao Gu +6Dynamic Sparse AttentionBlock Sparse Flash Attention

  12. RouteRelay: Event-Triggered Cross-Layer Route Reuse for Efficient Dynamic Sparse Attention

    Sep 7, 2026Bin Li, Sisi Liu, Chenyang Hu +3Dynamic Sparse AttentionCross-Layer Interactions

  13. CEDAR: Error-Bounded Residual Routing for Efficient Long-Context Attention

    Sep 7, 2026Siyu Li, Dong Wang, Jie Zhou +3Dynamic Sparse AttentionEfficient Long-Context Inference

  14. CRISP: Cliff-awaRe Input-adaptive Sparse Prefilling with Structural-Mass-Motivated Routing

    Sep 1, 2026Huu Huy Nguyen, Chien Van Nguyen, Franck Dernoncourt +4Dynamic Sparse AttentionLLM Inference Optimization

  15. Event-Driven Language Models with Sparse Neural Activity for Neuromorphic Hardware

    Aug 31, 2026Simon Richter, Ruhai Lin, Jason Yik +4Dynamic Sparse AttentionNeuromorphic Computing

  16. Learning how to Forget: Fine-tuning for Long-Context Sparse Attention

    Aug 20, 2026Matthias Seeger, Zeyu Zhang, Vihang Patil +2Dynamic Sparse AttentionEfficient Long-Context Inference

  17. Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry

    Aug 7, 2026Yehan Yang, Junyuan Shang, Yang Li +3Dynamic Sparse AttentionLLM Inference Optimization

  18. Training-Free Hashing-Based Attention via Binary Principal Components

    Aug 5, 2026Daohai Yu, Zhanpeng Zeng, Keyu Chen +6Dynamic Sparse AttentionBlock Sparse Flash Attention

  19. SPADE: An Input-Adaptive Sparse Attention Engine for Fast Video Diffusion Models Inference

    Aug 4, 2026Shanghao Liu, Renze Chen, Size Zheng +4Dynamic Sparse AttentionSparsity

  20. Understanding Sparse Attention Selectivity in Long-Context Foundation Models via Counterfactual Evaluation

    Aug 3, 2026Xingyu Ren, Youran Sun, Chugang Yi +1Dynamic Sparse AttentionBlock Sparse Flash Attention

  21. Celty: SpMspV GPU Kernel and SIMT Co-Design for Efficient Dual-Sparse LLM Inference

    Aug 2, 2026Ruokai Yin, Priyadarshini PandaLLM Inference OptimizationDynamic Sparse Attention

  22. A Sparse Glimpse of the Whole: Train-Free Self-Speculative Decoding

    Jul 30, 2026Yuesong Liu, Yuan Zeng, Min Lyu +3Speculative DecodingSelf-Speculative

  23. Recall Before You Rank: Similarity-Guided Top-KK Reuse for Efficient Long-Context Attention

    Jul 30, 2026Wenshuai Yao, Wenyong Zhou, Hanyong Shao +5Dynamic Sparse AttentionTop-K

  24. At-the-Roofline Sparse Tensor Contractions on Vector Processors for Transformer Inference

    Jul 28, 2026Bowen Wang, Chi Zhang, Diyou Shen +3Dynamic Sparse AttentionVectorization

  25. CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention

    Jul 28, 2026Yufei Xue, Lin Niu, Hong Liu +6Dynamic Sparse AttentionEfficient Long-Context Inference

  26. Neuromorphic Diffusion Language Models: Addressing Compute and Memory Bottlenecks via Sparsity and Block Denoising

    Jul 24, 2026Dengyu Wu, Clement Ruah, Jiechen Chen +2Diffusion Language ModelsLLM Inference Optimization

  27. Unified Static-Dynamic Pruning for Efficient LLM Inference

    Jul 24, 2026Jinhyeok Kim, Yejoon Lee, Jaeyoung DoLLM Inference OptimizationDynamic Sparse Attention

  28. RIS-Kernel: A Model-Agnostic Architecture for Long-Context LLM Inference via Sparse Attention

    Jul 24, 2026Anderson R. SantosDynamic Sparse AttentionLLM Inference Optimization

  29. Parameter-free Adaptive Sparse Attention via Compression-Based Content Selection

    Jul 23, 2026Debarshi Kundu, Swaroop Ghosh, Vasant HonavarDynamic Sparse AttentionEfficient Long-Context Inference

  30. Adaptive Depth Sparse Framework: Similarity-Driven Resource Allocation for Pre-Trained LLMs

    Jul 23, 2026Yidu Wu, Xiang Wang, Kejie Zhao +3LLM Inference OptimizationDynamic Sparse Attention

  31. FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video Generation

    Jul 17, 2026Hao Liu, Chenghuan Huang, Ye Huang +7Dynamic Sparse AttentionSpatio-Temporal Attention

  32. LiteTopK: Exploiting the Curse of Dimensionality for a Fused Indexer-TopK Kernel in Long-Context Sparse Attention

    Jul 13, 2026Ziqi Yin, Jianyang Gao, Peiqi Yin +2Dynamic Sparse AttentionTop-K

  33. COBS: Cumulant Order Block Sparse Attention

    Jul 10, 2026Alexander Tian, Aditya Ghai, Sanjit Neelam +2Dynamic Sparse AttentionDeepseek

  34. SAF3R: Dynamic Sparse Attention for Feed-Forward 3D Reconstruction Transformers

    Jul 3, 2026Jianing Deng, Yuanzhe Li, Jialu Wang +4Feed-Forward 3D ReconstructionDynamic Sparse Attention

  35. Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling

    Jul 3, 2026Xiang Hu, Xinyu Wei, Hao Gu +10Efficient Long-Context InferenceDynamic Sparse Attention

  36. Can Language Models Actually Retrieve In-Context? Drowning in Documents at Million Token Scale

    Jul 1, 2026Siddharth Gollapudi, Nilesh Gupta, Prasann Singhal +1In-ContextText Corpora

  37. MosaicKV: Serving Long-Context LLM with Dynamic Two-D KV Cache Compression

    Jul 1, 2026Sheng Qiang, Ruiwei Chen, Yinpeng Wu +5Key-Value Cache CompressionLarge Language Model Compression

  38. RaBitQCache: Rotated Binary Quantization for KVCache in Long Context LLM Inference

    Jun 30, 2026Wenhao Li, Jinhao Dong, Hailin Zhang +3LLM Inference OptimizationDynamic Sparse Attention

  39. Predict, Reuse, and Repair: Accelerating Dynamic Sparse Attention for Long-Context LLM Decoding

    Jun 29, 2026Tianyu Wang, Gourav Rattihalli, Aditya Dhakal +4Dynamic Sparse AttentionLarge Language Model Decoding

  40. MATCH: Modulating Attention via In-Context Retrieval for Long-Context Transformers

    Jun 29, 2026Linrui Ma, Chun Hei Lo, Xinyu Wang +12Efficient Long-Context InferenceDynamic Sparse Attention

  41. VSANet: View-aware Sparse Attention Network for Light Field Image Denoising

    Jun 23, 2026Gargi Panda, Soumitra Kundu, Saumik Bhattacharya +1Sparse-ViewIterative Denoising Methods

  42. ScalingAttention: Discovering Intrinsic Sparse Attention Topology for Video Diffusion Transformers

    Jun 22, 2026Ruiliang Zhou, Xuecheng Wu, Kang He +6Dynamic Sparse AttentionDiffusion Transformers

  43. ConSA: Controllable Sparsity in Hybrid Attention via Learnable Allocation

    Jun 16, 2026Yao Chen, Yinqi Yang, Junyuan Shang +6Dynamic Sparse AttentionSparsity