Kimi Delta Attention

Momentum

10 papers in the last four weeks, up 67% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 66

All topics
CardsList
  1. HLA: Expressive Hybrid Linear Attention via Chunk-Wise Dynamic Mixing

    Oct 5, 2026Zhuokun Chen, Xi Lin, Xiyu Wu +3Kimi Delta AttentionEfficient Long-Context Inference

  2. Switching Linear Attention

    Sep 30, 2026Hyun Dong Lee, Xavier Gonzalez, Nicolas Zucchet +3Kimi Delta AttentionLinear Attention

  3. STEPQuant: When and Where Errors Matter in Delta-Rule Recurrent State Quantization

    Sep 29, 2026Bingchen Yao, Haobo Xu, Haokun Lin +6Recurrent StateKimi Delta Attention

  4. LeapQuant: Efficient Linear Attention with Accurate Recurrent State Quantization

    Sep 29, 2026Yi Pan, Haocheng Xi, Kan Zhu +10Large Language Model QuantizationKimi Delta Attention

  5. Quasi Linear Kernel Attention with Infinite Capacity

    Sep 28, 2026Nicolaj Rux, Johannes Hertrich, Sebastian NeumayerKimi Delta AttentionKernel Method

  6. Just Let Linear States Forget the Distant Past: Prefix Caching via Suffix Replay for Hybrid LLMs

    Sep 27, 2026Yirui Liu, Ruoling Qi, Xuaner Wu +6Kimi Delta AttentionCache

  7. DeltaS: Reading the Gated Linear Attention State for KV Cache Eviction in Streaming Video

    Sep 23, 2026Taeyoun Kwon, Seungjin Kim, Hyeonyu Kim +1Kimi Delta AttentionLinear Attention

  8. OneLA: Scaling Linear-Attention Decoding to Large Beams in Generative Recommendation

    Sep 14, 2026Xiangrui Yang, Cheng Peng, Yunfeng Zhao +9Kimi Delta AttentionLinear Attention

  9. Kalman Delta Networks: Uncertainty-aware Associative Memory

    Sep 7, 2026Ngoc Bui, Tinglin Huang, Rex YingKimi Delta AttentionLinear Attention

  10. DASC: Decay-Aware State Compression for Hybrid Linear-Attention Serving

    Aug 31, 2026Yanqi Yu, Pingwei Sun, Jianchao Tan +4Kimi Delta AttentionRecurrent State

  11. Tail-Replay: Escaping the Curse of Linear Attention in Prefix Caching for Hybrid LLMs

    Aug 31, 2026Yirui Liu, Ruoling Qi, Xuaner Wu +2Kimi Delta AttentionLinear Attention

  12. CateKV: On Sequential Consistency for Long-Context LLM Inference Acceleration

    Aug 31, 2026Haoyun Jiang, Haolin Li, Jianwei Zhang +7Efficient Long-Context InferenceLLM Inference Optimization

  13. Sliding-window beats linear attention

    Aug 28, 2026Alexia Jolicoeur-Martineau, Rhea Sanjay Sukthanker, Pashmina Cameron +1Kimi Delta AttentionLarge Language Model Memory

  14. MixFormer: Linear Transformer with Mixture of Memory Experts

    Aug 10, 2026Yu Guo, Lei DuanKimi Delta AttentionEfficient Long-Context Inference

  15. Linearized 2-Simplicial Attention

    Aug 10, 2026Aritra Das, Dhruman Gupta, Debayan GuptaKimi Delta Attention

  16. Retrofitting Linear Attention into Diffusion Language Models

    Aug 6, 2026Jinha Kim, Younghun Roh, Jaeyeon KimDiffusion Language ModelsKimi Delta Attention

  17. DART: Decoded Attention over Recurrent States for Efficient Long-Context Sequence Modeling

    Aug 3, 2026Yixiao Qian, Song Chen, Pengkai Wang +3Recurrent StateKimi Delta Attention

  18. DeltaFlow: Noise-Adaptive Bidirectional Gated Delta Networks for Embedded Language Flows

    Aug 2, 2026Guangfu Guo, Xiaoqian Lu, Linsey Pang +4Diffusion Language ModelsKimi Delta Attention

  19. LinearKV: One Cached State Suffices for Position-Independent Caching in Hybrid LLMs

    Jul 31, 2026Yirui Liu, Ruoling Qi, Longwen Wang +5Kimi Delta AttentionKey-Value Cache

  20. Raven: High-Recall Sequence Modeling with Sparse Memory Routing

    Jul 28, 2026Arshia Afzal, Aviv Bick, Eric P. Xing +2Sequence ModelingKimi Delta Attention

  21. Kernelized Linear Attention: Breaking the Capacity Wall with Symmetric Cones

    Jul 19, 2026Ayoub Ghriss, Sourav ChakrabortyKimi Delta AttentionLinear Attention

  22. SpecLA: Efficient Speculative Decoding for Linear-Attention Models

    Jul 18, 2026Zhibin Wang, Xuying Han, Zhaohua Yang +5Speculative DecodingKimi Delta Attention

  23. Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing

    Jul 8, 2026Tommaso Cerruti, Tim Rieder, George Rowlands +2Kimi Delta AttentionLinear Attention

  24. The Key to Going Linear: Analysis-Driven Transformer Linearization

    Jul 8, 2026Anna Kuzina, Paul N. Whatmough, Babak Ehteshami BejnordiKimi Delta AttentionTransformer Architectures

  25. Sparse Delta Memory: Scaling the State of Linear RNNs through Sparsity

    Jul 8, 2026Loïc Cabannes, Pierre-Emmanuel Mazaré, Gergely Szilvasy +6Kimi Delta AttentionEfficient Long-Context Inference

  26. SAFE-DiT: Semantics-Aware Fast-path Execution for High-Resolution Diffusion Transformers

    Jun 28, 2026Xuanhua Yin, Yuxuan Jia, Chuanzhi Xu +1Diffusion TransformersSpatio-Temporal Attention

  27. Erase-then-Delta Attention: Decoupling Erase and Write Addresses in Delta-Rule Linear Attention

    Jun 25, 2026Xiao Li, Chengruidong Zhang, Hao Luo +15Kimi Delta AttentionRecurrent Model

  28. Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning

    Jun 10, 2026Kai Liu, Peijie Dong, Xinchen Xie +5Mathematical Reasoning BenchmarksLarge Language Model Reinforcement Learning

  29. Dynamic Linear Attention

    Jun 9, 2026Xin Wang, Hui Shen, Boyuan Zheng +7Kimi Delta AttentionEfficient Long-Context Inference

  30. Q-Delta: Beyond Key-Value Associative State Evolution

    Jun 7, 2026Sumin Park, Seojin Kim, Noseong ParkKimi Delta AttentionRecurrent State

  31. When Good Enough Is Optimal: Multiplication-Only Matrix Inversion Approximation for Quantized Gated DeltaNet

    Jun 4, 2026Luoming Zhang, Yuwei Ren, Kui Zhang +7Matrix MultiplicationKimi Delta Attention

  32. SinkRec: Mitigating Semantic State Sink in Long Sequence Recommendation with Memory-Conditioned Gated Delta Networks

    Jun 3, 2026Zhuang Zhuang, Zhipeng Wei, Ji Dai +4Recurrent StateKimi Delta Attention

  33. Don't Read Everything: A Curvature-Conditioned Query for Linear Attention

    May 31, 2026Dong Le, Thong Nguyen, Cong-Duy Nguyen +1Kimi Delta AttentionLinear Attention

  34. Parallax: Parameterized Local Linear Attention for Language Modeling

    May 27, 2026Yifei Zuo, Dhruv Pai, Zhichen Zeng +3Kimi Delta AttentionLanguage Modeling

  35. Approaching I/O-optimality for Approximate Attention

    May 22, 2026Pál András Papp, Aleksandros Sobczyk, Anastasios ZouziasKimi Delta AttentionMatrix Multiplication

  36. Tensor Cache: Eviction-conditioned Associative Memory for Transformers

    May 21, 2026Kabir Swain, Sijie Han, Daniel Karl I. Weidele +2CacheKimi Delta Attention

  37. Fast and Stable Triangular Inversion for Delta-Rule Linear Transformers

    May 20, 2026Aleksandros Sobczyk, Gioele Gottardo, Christos K. Matzoros +4Kimi Delta AttentionMatrix Multiplication

  38. LT2: Linear-Time Looped Transformers

    May 20, 2026Chunyuan Deng, Yizhe Zhang, Rui-Jie Zhu +4Kimi Delta AttentionTransformer Architectures

  39. KVBuffer: IO-aware Serving for Linear Attention

    May 18, 2026Longwei Zou, Lin ZhongKimi Delta AttentionDepthweave-Kv

  40. Provably Shorter Scratchpads in Hybrid DeltaNet-Attention Decoders

    May 15, 2026Tomasz SteiferKimi Delta AttentionGated Deltanet

  41. OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention

    May 13, 2026Chenyu Zhou, Hongpei Li, Yuerou Liu +3Kimi Delta AttentionLinear Attention

  42. The Routing and Filtering Structure of Attention

    May 12, 2026Shafayeth Jamil, Rehan KapadiaKimi Delta AttentionDecomposition

  43. δδ-mem: Efficient Online Memory for Large Language Models

    May 12, 2026Jingdi Lei, Di Zhang, Junxian Li +7Peak MemoryEfficient Long-Context Inference

  44. Variational Linear Attention: Stable Associative Memory for Long-Context Transformers

    May 11, 2026Vishal Pandey, Gopal SinghKimi Delta AttentionLinear Attention

  45. Kaczmarz Linear Attention

    May 9, 2026Jiaxuan Zou, Ruifeng Ren, Yong LiuKimi Delta AttentionRecurrent Model

  46. Adaptive Memory Decay for Log-Linear Attention

    May 7, 2026Yaxita Amin, Helen Zichen Li, Mengfan Zhang +1Kimi Delta AttentionMultilayer Perceptrons

  47. MDN: Parallelizing Stepwise Momentum for Delta Linear Attention

    May 7, 2026Yulong Huang, Xiang Liu, Hongxiang Huang +5Kimi Delta AttentionLinear Attention

  48. ELSA: Exact Linear-Scan Attention for Fast and Memory-Light Vision Transformers

    Apr 26, 2026Chih-Chung Hsu, Xin-Di Ma, Wo-Ting Liao +1Kimi Delta AttentionGumbel-Softmax Relaxation