Attention Sinks

Momentum

6 papers in the last four weeks, up 50% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 42

All topics
CardsList
  1. Spectral Geometry of Attention: From Information Routing to Uncertainty

    Oct 5, 2026Giulio Viganò, Simone Melzi, Maks OvsjanikovAttention Head AnalysisAttention Sinks

  2. The Life Cycle of a Massive Activation: Stochastic Birth, Weight-Decay-Driven Growth, and Competitive Consolidation

    Sep 30, 2026S. Aaron McClendon, Jorge Gallego-Feliciano, Antonios SaravanosWeight DecayAttention Sinks

  3. Global Ranks Survive, Selected Heads Shift: BOS-Sink Topology under 4-bit Weight-Only Quantization

    Sep 20, 2026Kuanlin Chen, Chen-Wei Kuo, Cheng-En OuAttention Head Analysis4-Bit Quantization

  4. ValueDiff: Value-Geometric KV Cache Eviction for Sink-Suppressed LLMs

    Sep 20, 2026Junyoung Park, Jungwook Choi, Mingu LeeLLM Inference EfficiencyKV-Cache Eviction

  5. It's Not RoPE that Creates Sinks: The Role of Self-Concentration and Value-Non-Mixing in Attention

    Sep 8, 2026Raito Kiya, Satoki Ohashi, Kosuke Sato +6Self-AttentionAttention Sinks

  6. Do New Attention Mechanisms Actually Fix Attention Sinks at Million-Token Context?

    Sep 8, 2026Sara Rizwan, Samaanah Abdus SalamLong-Context Language Model EvaluationLong-Context Language Modeling

  7. Separating Stream Stability from Long-Term Recall in Language Models

    Sep 7, 2026Peipei Cao, Xin Zhang, Jie Tang +3Memory-Augmented Language ModelsLong-Context Language Model Evaluation

  8. SinkPruner: Sink-Free Visual Token Pruning for Multimodal Large Language Models

    Sep 1, 2026Shiyu Li, Zi-Yuan Hu, Shijia Huang +3Efficient VLM InferenceMultimodal Large Language Models

  9. Text Capability Loss in Vision-Language Adaptation: An Attention-Sink Diagnosis

    Sep 1, 2026Minsik Choi, Geewook Kim, Young Geun KimVision-Language ModelsVLM Adaptation

  10. Sliding-window beats linear attention

    Aug 28, 2026Alexia Jolicoeur-Martineau, Rhea Sanjay Sukthanker, Pashmina Cameron +1KV CachingLLM Inference Acceleration

  11. Hybrid Gated Attention

    Aug 12, 2026Zekun Zhou, Ruobing Xie, Lanrui Wang +1Low-Rank Matrix DecompositionGated Attention

  12. Disentangling Semantic Attention from Structural Bias in the Attention Manifold

    Jul 27, 2026Pengkun Jiao, Bin Zhu, Jingjing Chen +1Object Hallucination in VLMsMultimodal Large Language Models

  13. Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers

    Jul 21, 2026Maohua Li, Qirui Li, Yanke Zhou +10Transformer InterpretabilityDiffusion Transformer

  14. VisReflect: Latent Visual Reflection for Fine-Grained Perception in Long Visual Context

    Jun 29, 2026Xiaoqian Shen, Mohamed ElhoseinyEfficient VLM InferenceAttention Sinks

  15. All Routes Lead to Collapse

    Jun 21, 2026K. R. BalasubramanianRepresentation CollapseAttention Sinks

  16. A Unifying View of Attention Sinks: From Mechanisms to Architectural Interventions

    Jun 6, 2026Lukas Fesser*, Mozes Jacobs*, Thomas Fel* +2Transformer InterpretabilityVision Transformer

  17. Where does Absolute Position come from in decoder-only Transformers?

    Jun 4, 2026Valeria Ruscio, Umberto Nanni, Fabrizio SilvestriRotary Positional EmbeddingsTransformer Interpretability

  18. When Graph Tokens Sink: A Mechanistic Analysis of Graph Language Models

    Jun 2, 2026Ding Zhang, Runtao Zhou, Wenqing Zheng +3LLM InterpretabilityMechanistic Interpretability

  19. Massive Spikes in LLMs are Bias Vectors: Mechanistic Uncovering and Spike-Free Quantization

    Jun 1, 2026Yung-Chin Chen, Chung Peng Lee, Ze-Wei Liou +1LLM QuantizationActivation Outliers

  20. Contribution Weights: A Geometrical Analysis of Self-Attention Transformers

    May 29, 2026Harry Jake Cunningham, Nicola Muca CironeTransformer InterpretabilityFeature Attribution

  21. Addressing Exacerbated Attention Sink for Source-Free Cross-Domain Few-Shot Learning

    May 25, 2026Shuai Yi, Yixiong Zou, Yuhua Li +1Source-Free Domain AdaptationFew-Shot Domain Adaptation

  22. ASAP: Attention Sink Anchored Pruning

    May 21, 2026Jaehyuk Lee, Hanyoung Kim, Yanggee Kim +1Self-AttentionEfficient ViTs

  23. DySink: Dynamic Frame Sinks for Autoregressive Long Video Generation

    May 20, 2026Bo Ye, Xinyu Cui, Jian Zhao +2Long-Horizon Video GenerationMemory-Augmented Video Generation

  24. Attention Sinks and Outliers in Attention Residuals

    May 18, 2026Haozheng Luo, Haoran Dai, Shaoyang Zhang +10LLM QuantizationAttention Residual Connections

  25. SLASH the Sink: Sharpening Structural Attention Inside LLMs

    May 11, 2026Yiming Liu, Bin Lu, Xinbing Wang +2LLM Reasoning with GraphsLLM Interpretability

  26. FocuSFT: Bilevel Optimization for Dilution-Aware Long-Context Fine-Tuning

    May 11, 2026Zehua Pei, Hui-Ling Zhen, Xianzhi Yu +3Supervised Fine-TuningSelf-Attention

  27. Attention Sinks in Diffusion Transformers: A Causal Analysis

    May 10, 2026Fangzheng Wu, Brian SummaTransformer InterpretabilityDiffusion Transformer

  28. A Single Layer to Explain Them All:Understanding Massive Activations in Large Language Models

    May 8, 2026Zeru Shi, Zhenting Wang, Fan Yang +2LLM InterpretabilityAttention Sinks

  29. Sink vs. diagonal patterns as mechanisms for attention switch and oversmoothing prevention

    May 8, 2026Peter Súkeník, Cristina López Amado, Christoph H. Lampert +1Self-AttentionTransformer Attention

  30. The Structural Origin of Attention Sink: Variance Discrepancy, Super Neurons, and Dimension Disparity

    May 7, 2026Siquan Li, Kaiqi Jiang, Jiacheng Sun +1Self-AttentionAttention Sinks

  31. Sink-Token-Aware Pruning for Fine-Grained Video Understanding in Efficient Video LLMs

    Apr 22, 2026Kibum Kim, Jiwan Kim, Kyle Min +4Efficient VLM InferenceAttention Sinks

  32. SinkRouter: Sink-Aware Routing for Efficient Long-Context Decoding in Large Language and Multimodal Models

    Apr 18, 2026Junnan Liu, Xinyan Liu, Peifeng Gao +4GPU AccelerationSelf-Attention

  33. When Sinks Help or Hurt: Unified Framework for Attention Sink in Large Vision-Language Models

    Apr 1, 2026Jiho Choi, Jaemin Kim, Sanghwan Kim +2Large Vision-Language ModelsVLM Interpretability

  34. Threshold Differential Attention for Sink-Free, Ultra-Sparse, and Non-Dispersive Language Modeling

    Jan 17, 2026Xingyue Huang, Xueying Ding, Mingxuan Ju +3Self-AttentionLong-Context Language Modeling

  35. Garbage Attention in Large Language Models: BOS Sink Heads and Sink-aware Pruning

    Jan 11, 2026Jaewon Sok, Jewon Yeom, Seonghyeon Park +2LLM PruningAttention Head Analysis

  36. RefAM: Attention Magnets for Zero-Shot Referral Segmentation

    Sep 26, 2025Anna Kukleva, Enis Simsar, Alessio Tonioni +4Zero-Shot LearningImage Segmentation