Multi-Head Attention

Momentum

7 papers in the last four weeks, up 17% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 49

All topics
CardsList
  1. Let the Heads Talk: Beyond Diagonal Graph Attention

    Oct 1, 2026Riccardo Ali, Alessio Borgi, Mario Severino +4Multi-Head AttentionInterleaved Graph Attention

  2. Attention Function as an Intrinsic Inductive Bias: How Models' Behavior Diverges in Novel Contexts

    Sep 30, 2026Dong Gyun Kang, Megha Thukral, Kwangsoo KimTransformer AttentionDynamic Attention

  3. QuantMLA: Function-Aligned Dual-Path Quantization for Low-Bit MLA KV Caching

    Sep 29, 2026Zunhai Su, Yuxuan Sun, Jianchao Tan +5Key-Value Cache QuantizationMulti-Head Attention

  4. QTrans: A Quantum Transformer for Sentiment Classification

    Sep 14, 2026Ren-Xin Zhao, Xinjie Huang, Yahong Liu +4Hybrid Quantum-Classical PipelineSentiment

  5. BioSync: Transformer-Based Cross-Modal Fusion for a Multimodal Physiological Digital Biomarker

    Sep 7, 2026Seyed Mahmoud Sajjadi MohammadabadiPhysiological SignalsBiomarker

  6. RedKnot-MLA: Multi-Head Offline-Online Reuse for DeepSeek-V4 Long-Context Serving

    Sep 7, 2026Yang Liu, Zhaokai Luo, Huayi Jin +10Multi-Head AttentionDeepseek

  7. The Head Complexity of Boolean Functions in Single-Layer Attention

    Sep 3, 2026Rajmohan Rajaraman, Ravi Sundaram, Amanuel TesfayeMulti-Head AttentionStructural Complexity

  8. Toward a First-Principles Update Geometry for the Language-Model Head

    Aug 23, 2026Aditya Somasundaram, Charles Guille-Escuret, Alexander Moreno +2Spectral NormMulti-Head Attention

  9. Matrix Zonotopic Attention: A Context-Adaptive Value Projection for Set Transformers

    Aug 5, 2026Zhen Zhang, Amr AlanwarMulti-Head AttentionTransformer Architectures

  10. Attention-based representations for multi-task computation

    Aug 4, 2026Daniel Hsu, Mingyue XuMulti-Head AttentionMulti--Task Learning

  11. Provably Learning Multi-Head Attention with Queries

    Aug 4, 2026Sunyeop Kim, Insung Kim, Jian GuoMulti-Head AttentionRectified Linear Unit

  12. Beyond KV Reconstruction: Functional Reconstruction for MLA Draft Models in Speculative Decoding

    Jul 29, 2026Weiye Shi, Fanxu Meng, Muhan ZhangSpeculative DecodingLLM Inference Optimization

  13. Through the Bottleneck: How Multi-head Latent Attention Separates Content from Position in Language Models

    Jul 25, 2026Dhruvil S, Fenil Sojitra, Ravirajsinh ChauhanMulti-Head AttentionDeepseek

  14. Beyond Parallel Tracking: Interactive Multi-Feature Fusion Drives Semantic Reconstruction from Non-invasive Brain Recordings

    Jul 13, 2026Boda Xiao, Xiran Xu, Songyi Li +4Neural RecordingsDirect Feature Fusion

  15. From Self-Attention to Connection Laplacian: A Unified Operator View of Transformers

    Jul 12, 2026Binbin Lin, Wei Chen, Yalun Li +3Transformer AttentionLinear Attention

  16. Dual Sparse Aggregation Transformer for Multispectral Object Detection

    Jun 30, 2026Wencong Wu, Xiuwei Zhang, Hanlin Yin +2Detection TransformerFeature Pyramid

  17. Learning the Koopman Operator using Attention Free Transformers

    Jun 22, 2026Mohammed Nagdi, Evangelos-Marios Nikolados, Alexey Yermakov +3Koopman OperatorLatent Dynamics

  18. Conservation Laws for Modern Neural Architectures

    Jun 16, 2026Viet-Hoang Tran, Vinh Khanh Bui, Tan Lai Ngoc +3OverparameterizationGradient

  19. Reconfigurable Computing Challenge: Transformer for Jet Tagging on Versal AI Engines

    Jun 16, 2026Gram Koski, Sean Lipps, Zhenghua Ma +2Transformer ArchitecturesReconfiguration

  20. QK-Normed MLA: QK normalization without full key caching

    Jun 15, 2026Yizhou Han, Yao Zhao, Jun Zhou +2Multi-Head AttentionBatch Normalization

  21. 3D Oral Modelling with Improved Vertex Distribution Using Matching-Based Learning

    Jun 6, 2026Jihun Cho, Soo-Yeon Jeong, Eun-Jeong Bae +1Occlusal ConstraintMobilenetv2

  22. Leaf Spectral Reflectance Prediction Using Multi-Head Attention Neural Networks

    May 31, 2026Parastoo Farajpoor, Alireza Pourreza, Mohammadreza Narimani +2ReflectanceCanopy

  23. TriLens: Per-Layer Logit-Lens Entropy for White-Box Hallucination Detection

    May 31, 2026Bohan Yang, Yijun Gong, Zhi Zhang +3Citation Hallucination DetectionHallucination Detection

  24. VideoMLA: Low-Rank Latent KV Cache for Minute-Scale Autoregressive Video Diffusion

    May 28, 2026Hidir Yesiltepe, Jiazhen Hu, Tuna Han Salih Meral +4Multi-Head AttentionKey-Value Cache

  25. Hurwitz Quaternion Multiplicative Quantization for KV Cache Compression

    May 26, 2026Kabir Swain, Sijie Han, Daniel Karl I. Weidele +3Key-Value Cache QuantizationKey-Value Cache Compression

  26. Multi-Head Attention as Ensemble Nadaraya-Watson Estimation: Variance Reduction, Decorrelation, and Optimal Head Diversity

    May 18, 2026Ernest FokouéMulti-Head AttentionIntrinsic Dimensionality

  27. On the global convergence of gradient descent for wide shallow models with bounded nonlinearities

    May 11, 2026Romain Petit, Clarice Poon, Gabriel PeyréGradient DescentFlat Minima

  28. A Game Theoretic Free Energy Analysis of Higher Order Synergy in Attention Heads of Large Language Models

    May 10, 2026Djamel BouchaffraMulti-Head AttentionFree Energy Principle

  29. When and Why Grouping Attention Heads Accelerates Muon Optimization

    May 9, 2026Hongtao Zhang, Wenjie Zhou, Wei Chen +1Multi-Head AttentionMuon

  30. Revisiting Transformer Layer Parameterization Through Causal Energy Minimization

    May 8, 2026Jin Xu, Camille Couturier, Victor Rühle +2Transformer ArchitecturesMulti-Head Attention

  31. Deepfake Audio Detection Using Self-supervised Fusion Representations

    May 5, 2026Khalid Zaman, Qixuan Huang, Muhammad Uzair +1Audio UnderstandingSelf-Supervised Representations

  32. Rank, Head-Channel Non-Identifiability, and Symmetry Breaking: A Precise Analysis of Representational Collapse in Transformers

    Apr 26, 2026Giansalvo CirrincioneMulti-Head AttentionTransformer Architectures

  33. Expressivity of Transformers: A Tropical Geometry Perspective

    Apr 16, 2026Ye Su, Yong LiuTransformer AttentionMulti-Head Attention

  34. FGAA-FPN: Foreground-Guided Angle-Aware Feature Pyramid Network for Oriented Object Detection

    Feb 11, 2026Jialin MaFeature PyramidObject Detection