Document Image Understanding

Momentum

7 papers in the last four weeks, level with the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 92

All topics
CardsList
  1. Structured Layout Priors for Robust Out-of-Distribution Visual Document Understanding

    May 19, 2026Peter El Hachem, Ahmed Nassar, A. Said Gurbuz +2VLM RobustnessLLM Prompting

  2. How Do Document Parsers Break? Auditing Structural Vulnerability in Document Intelligence

    May 19, 2026Yue Chen, Yihao Wang, Ziyi Tang +2Document ParsingDocument Layout Analysis

  3. FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing

    May 17, 2026Zihan Tang, Leqi Shen, Hui Chen +7Visual AttentionEfficient VLM Inference

  4. Chronicles-OCR: A Cross-Temporal Perception Benchmark for the Evolutionary Trajectory of Chinese Characters

    May 12, 2026Gengluo Li, Shangpin Peng, Xingyu Wan +16VLM EvaluationVLM Robustness

  5. Field-Localized Forgery Detection for Digital Identity Documents

    May 9, 2026Abhishek Kumar, Riya Tapwal, Carsten Maple +1Image Forgery DetectionDigital Image Forensics

  6. How Far Is Document Parsing from Solved? PureDocBench: A Source-Traceable Benchmark across Clean, Degraded, and Real-World Settings

    May 8, 2026Zhiheng Li, Zongyang Ma, Jiaxian Chen +12Document ParsingDocument Image Understanding

  7. Chain of Evidence: Pixel-Level Visual Attribution for Iterative Retrieval-Augmented Generation

    May 2, 2026Peiyang Liu, Ziqiang Cui, Xi Wang +2Retrieval-Augmented GenerationVision-Language Grounding

  8. RTPrune: Reading-Twice Inspired Token Pruning for Efficient DeepSeek-OCR Inference

    May 1, 2026Ben Wan, Yan Feng, Zihan Tang +4Efficient VLM InferenceOptical Character Recognition

  9. Revealing the Impact of Visual Text Style on Attribute-based Descriptions Produced by Large Visual Language Models

    Apr 30, 2026Xiaomeng Wang, Martha Larson, Zhengyu ZhaoVLM EvaluationVision-Language Models

  10. ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction

    Apr 26, 2026Zichun Guo, Yuling Shi, Wenhao Zeng +6Image ReconstructionMultimodal Large Language Models

  11. Different Strokes for Different Folks: Writer Identification for Historical Arabic Manuscripts

    Apr 24, 2026Hamza A. Abushahla, Ariel Justine N. Panopio, Layth Al-Khairulla +1Document UnderstandingHistorical Document Analysis

  12. DocPrune:Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning

    Apr 24, 2026Joonmyung Choi, Sanghyeok Lee, Jongha Kim +4Efficient VLM InferenceDocument QA

  13. iDocV2: Leveraging Self-Supervision and Open-Set Detection for Improving Pattern Spotting in Historical Documents

    Apr 17, 2026Jose M. Saavedra, Crhistopher Stears, Marcelo Pizarro +2Historical Document AnalysisVisual Document Retrieval

  14. DenTab: A Dataset for Table Recognition and Visual QA on Real-World Dental Estimates

    Apr 17, 2026Laziz Hamdi, Amine Tamasna, Thierry PaquetTable QATable Structure Recognition

  15. TableSeq: Unified Generation of Structure, Content, and Layout

    Apr 17, 2026Laziz Hamdi, Amine Tamasna, Pascal Boisson +1Table Structure RecognitionMulti-Token Prediction

  16. Real5-OmniDocBench: A Full-Scale Physical Reconstruction Benchmark for Robust Document Parsing in the Wild

    Mar 4, 2026Changda Zhou, Ziyue Gao, Xueqing Wang +4VLM EvaluationDocument Parsing

  17. HSD: Training-Free Acceleration for Document Parsing Vision-Language Models with Hierarchical Speculative Decoding

    Feb 13, 2026Wenhui Liao, Hongliang Li, Pengyu Xie +15Efficient VLM InferenceSpeculative Decoding

  18. Counterfeit Answers: Adversarial Forgery against OCR-Free Document Visual Question Answering

    Dec 4, 2025Marco Pintore, Maura Pintor, Dimosthenis Karatzas +1Visual Question AnsweringVLM Robustness

  19. MedRepBench: A Comprehensive Benchmark for Medical Report Interpretation

    Aug 21, 2025Fangxin Shang, Yuan Xia, Dalu Yang +2VLM EvaluationHealthcare