Visual Document Retrieval

Latest papers 46

All topics
CardsList
  1. Front-to-Back: Benchmarking Vision-Language Models for Asymmetric Cross-View Vehicle Re-Identification

    Sep 30, 2026Moseli Mots'oehli, Thulani BabeliRe-IdentificationVisual Document Retrieval

  2. Action Conditioned Bisimulation For GUI Agent Memory

    Sep 30, 2026Hongbo Zhang, Liuyang Song, Quanquan Li +3Graphical User Interface AgentsMerge

  3. ColNanoVDR: Document-Free Query Distillation for Multi-Vector Visual Document Retrieval via Optimal Transport

    Sep 28, 2026Zhuchenyang Liu, Ziyi Wang, Yao Zhang +1Visual Document RetrievalRetrievers

  4. Beyond Accuracy: Robustness, Cost, and Governance Trade-offs for Vision-Language Models in Templated Document Extraction

    Sep 14, 2026Kushal Patel, Pushkal Shrivastava, Mackenzie Lees +4Recent Vision-Language ModelsVisual Document Retrieval

  5. Search-to-World: Evaluation of 3D World Delivery from User Request through Web Search

    Sep 7, 2026Zixiao Gu, Yabo Chen, Xunzhi Xiang +53D WorldAgentic Framework

  6. Query-Aware Token Budgeting for Efficient Late-Interaction Visual Document Retrieval

    Sep 7, 2026PS Rishi, Rajeev Ranjan Dwivedi, Vinod K KurmiVisual Document RetrievalGlobal Average Pooling

  7. Lot Machine: Multimodal Lot Extraction from Auction Catalogs

    Aug 31, 2026Mathias Zinnen, Alisha Mund, Sabine Lang +3CatalogsExtraction

  8. Spatial Matryoshka Training for Multi-Granularity Visual Document Retrieval

    Aug 30, 2026Trishan Singha Roy, Arkadeep Acharya, Vishwajeet Kumar +2Multimodal RetrievalVisual Document Retrieval

  9. DistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student Distillation

    Aug 11, 2026Zhuchenyang Liu, Ziyi Wang, Yao Zhang +1Visual Document RetrievalMultimodal Retrieval

  10. InSight-doc: Agentic Visual Perception for Long-Document Understanding

    Aug 11, 2026Kaican Li, Weiyan Xie, Lewei Yao +4Visual Document RetrievalRecent Vision-Language Models

  11. AnchorFold: A Focus-Then-Fold Framework via Recursive Attention Propagation for Efficient Multi-Vector Visual Document Retrieval

    Aug 9, 2026Haoyu Zuo, Yibo Yan, Xin Zou +4Visual Document RetrievalVisual Embeddings

  12. Locating Failure in Multi-Page Visually Rich Document Understanding: An Empirical Attribution

    Aug 8, 2026Lewei Xu, Yihao Ding, Zihan Xu +5Visual Document RetrievalDocument

  13. KoVRE: Training an Efficient Embedding Model for Korean Visual Document Retrieval

    Aug 2, 2026Yongbin Choi, Gyuho Shim, Youngjoon JangVisual Document RetrievalSingle Pass

  14. VaRS-Doc: Interpretation-Aware Variant Representations via Latent Self-Probing for Visual Document Retrieval

    Aug 2, 2026Haocheng Wang, Tongkun Guan, Wei Shen +1Visual Document RetrievalMultimodal Retrieval

  15. HierDoc: Hierarchical Page-to-Region Evidence Routing for Long-Document Visual Question Answering

    Jul 31, 2026Rongjian Gu, Wengang Zhou, Junyu Xiong +4Visual Document RetrievalAnswer

  16. Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models

    Jul 22, 2026Huafu Li, Guo Chen, Jia Xia +5Visual Document RetrievalRecent Vision-Language Models

  17. MonkeyOCRv2: A Visual-Text Foundation Model for Document AI

    Jul 13, 2026Yuliang Liu, Zhang Li, Ziyang Zhang +11Lingdt-Vl-OcrVisual Document Retrieval

  18. SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding

    Jul 11, 2026Abhigya Verma, Khyati Mahajan, Amit Kumar Saha +4Visual Document RetrievalLong-Context Reasoning

  19. HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better

    Jul 6, 2026Gengluo Li, Xingyu Wan, Shangpin Peng +20Lingdt-Vl-OcrRecent Vision-Language Models

  20. Hierarchical Evidence-Driven Reasoning for Long Document Understanding

    Jul 6, 2026Junyu Xiong, Yonghui Wang, Rongjian Gu +4Multimodal Retrieval Augmented GenerationVisual Document Retrieval

  21. Multimodal Graph RAG for Long-range Visually Rich Document Understanding

    Jun 27, 2026Yi-Cheng Wang, Chu-Song ChenVisual Document RetrievalMultimodal Retrieval Augmented Generation

  22. Invoice Haystack: Benchmarking Document Retrieval and Visual Question Answering Under Strong Visual Homogeneity

    Jun 24, 2026Heethanjan Kanagalingam, Thenukan Pathmanathan, Mokeeshan Vathanakumar +3Visual Document RetrievalKnowledge-Based Visual Question Answering

  23. LightSTAR: Efficient Visual Document Retrieval via Lightweight Selection with Vision-Adaptive Refinement

    Jun 22, 2026Tongkun Guan, Haocheng Wang, Wei Shen +1Visual Document RetrievalMultimodal Retrieval

  24. MM-Matryoshka: Towards Budget-Elastic Visual Document Retrieval via a 2D Multimodal Matryoshka Training Framework

    Jun 3, 2026Haowen Xiang, Yibo Yan, Jiahao Huo +4Visual Document RetrievalMultimodal Retrieval

  25. PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation

    Jun 1, 2026Yichuan Wang, Zhifei Li, Zirui Wang +5Visual Document RetrievalMultimodal Retrieval Augmented Generation

  26. Inference-Free Multimodal Learned Sparse Retrieval for Production-Scale Visual Document Search

    May 29, 2026Gyu-Hwung Cho, Youngjune Lee, Kiyoon Jeong +5Visual Document RetrievalMultimodal Retrieval

  27. Page image classifier fine-tuned on century-spanning archives of scanned documents for further content-specific processing

    May 25, 2026Kateryna Lutsai, Dana Křivánková, Pavel Straňák +1Image ClassificationOptical Character Recognition

  28. Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval

    May 23, 2026Hao Sun, Yingyan Hou, Jiayan Guo +4Visual Document RetrievalMultimodal Retrieval

  29. Structured Layout Priors for Robust Out-of-Distribution Visual Document Understanding

    May 19, 2026Peter El Hachem, Ahmed Nassar, A. Said Gurbuz +2Visual Document RetrievalDocument Parsing

  30. Beyond Bag-of-Patches: Learning Global Layout via Textual Supervision for Late-Interaction Visual Document Retrieval

    May 8, 2026Pascal Tilli, Mohsen MesgarVisual Document RetrievalVisual Embeddings

  31. PlotPick: AI-powered batch extraction of numerical data from scientific figures

    May 7, 2026Tommy CarstensenScientific FigureChart

  32. ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction

    Apr 26, 2026Zichun Guo, Yuling Shi, Wenhao Zeng +6Visual Document RetrievalMultimodal Large Language Models

  33. Unlocking Multimodal Document Intelligence: From Current Triumphs to Future Frontiers of Visual Document Retrieval

    Feb 23, 2026Yibo Yan, Jiahao Huo, Guanbo Feng +12Visual Document RetrievalMultimodal Documents

  34. CausalEmbed: Auto-Regressive Multi-Vector Generation in Latent Space for Visual Document Embedding

    Jan 29, 2026Jiahao Huo, Yu Huang, Yibo Yan +7Visual Document RetrievalMultimodal Embeddings