Long-Context VLMs

VLM: Vision-Language Model

Momentum

6 papers in the last four weeks, against 2 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 19

All topics
CardsList
  1. ReMem: Streaming Video Understanding With Long Context Retention

    Oct 5, 2026Li Yiheng, He Xu, Wang Shaobo +2Memory-Augmented VLMsStreaming Video Understanding

  2. FocusVTC: Efficient and High-Performance Visual Text Compression with Adaptive Resolution

    Sep 29, 2026FangZhi Zhong, Xuerui Qiu, Yuqi Pan +4Efficient VLM InferenceVLM Reasoning

  3. PREM: Prefix-Steered Recurrent Memory for Long-Video Understanding

    Sep 20, 2026Siru Zhong, Qiongyan Wang, Xiaohui Lv +5Memory-Augmented VLMsRecurrent Neural Networks

  4. Video-HolmesV2: Can MLLMs Reason with Spatio-Temporal Audio-Visual Evidence in Long Videos?

    Sep 15, 2026Zhaoyang Wei, Zipeng Wang, Yushe Cao +10Audio-Visual UnderstandingVideo-Language Model Evaluation

  5. LongEarth-R1: Benchmarking and Aligning Vision-Language Models for Long-Horizon Earth Observation Reasoning

    Aug 13, 2026Yupan Ding, Jing Xiao, Zhenyuan Zhang +4Remote Sensing Image UnderstandingRemote Sensing VQA

  6. VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling

    Aug 9, 2026Yuqi Zhang, Cheng Chen, Yuyu Guo +6Vision-Language ModelsEfficient VLM Inference

  7. Linear Multi-Timescale Retention as a Memory-Efficient Vision-Language Bridge

    Aug 3, 2026Ashfak Yeafi, Mehedi Hasan, Md Khairul IslamMemory-Augmented VLMsVision-Language Models

  8. ReToken: Improving Long-Context VLMs with Visual Retrieval Token

    Jul 30, 2026Yao Xiao, Reuben Tan, Zhen Zhu +3Vision-Language ModelsVision-Language Retrieval

  9. HyFL-CLIP: Hyperbolic Fine-Tuning of CLIP for Robust Long-Context Understanding

    Jul 1, 2026Ji Ha Jang, Hayeon Kim, Chulwon Lee +2VLM RobustnessVision-Language Models

  10. Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models

    May 26, 2026Aaron Branson Cigres Li, Zhaowei Wang, Yu Zhao +9Vision-Language ModelsVLM Interpretability

  11. MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models

    May 14, 2026Xiyu Ren, Zhaowei Wang, Yiming Du +11VLM EvaluationMemory-Augmented VLMs

  12. Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context

    May 13, 2026Zhaowei Wang, Lishu Luo, Haodong Duan +9Visual Question AnsweringVision-Language Models