Document Image Understanding

Momentum

7 papers in the last four weeks, level with the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 92

All topics
CardsList
  1. PlotGround: Grounding Plot Digitization in Real Scientific Figures and Their Source Data

    Oct 5, 2026Yaohui Zhang, Binxu Li, Haoyi Duan +7Scientific VisualizationChart QA

  2. Color Independent Word Segmentation From Transcribed Bangla Passages

    Oct 1, 2026Faias Satter, Noor Masrur, Sk. Md. Masudul AhsanOptical Character RecognitionDocument Image Understanding

  3. Unapologetically Distributed: A Call for Decentralized Document Analysis

    Sep 30, 2026Adrià Molina, Oriol Ramos Terrades, Josep LladósOOD GeneralizationDecentralized Learning

  4. Xiaomi-OCR-0 Technical Report

    Sep 28, 2026Xin Chen, Anan Du, Feng Feng +7Vision-Language ModelsDocument Parsing

  5. Mind the Gaps: A Curated Benchmark for Form Field Detection

    Sep 20, 2026Iheb Brini, Omar Moured, Hamza Gbada +1Document Layout AnalysisDocument Image Understanding

  6. EMBLEM: Enhancing Multi-script Table Detection through Masking

    Sep 8, 2026Dhruv Kudale, Udhay Brahmi, Ganesh RamakrishnanTable Structure RecognitionDocument Image Understanding

  7. When Superpixels Fail on Documents: A Study of Segmentation for LIME Explanations

    Sep 7, 2026Quentin Telnoff, Emanuela Boros, Mickaël Coustaty +3Explainable Artificial IntelligenceExplainable Image Classification

  8. KhatianDoc: A Human-Verified Benchmark Diagnosing Multimodal LLM Failure on Bengali Legal Land Records

    Sep 3, 2026Tasmiad Hasan, Arafat Zaman Ratul, Sarker Sadman Saalim +3Legal Document AnalysisLegal QA

  9. Jina-OCR-v1: Efficient Document Parsing with Speculative Decoding and Dense Verifiable Rewards

    Sep 2, 2026Alejandro Barón García, Feng Wang, Emilia Garcia Casademont +1Efficient VLM InferenceSpeculative Decoding

  10. Beyond Blind Compliance: Benchmarking Task Verification in OCR Reasoning

    Aug 31, 2026Yue Zhou, Yuan Wu, Yi ChangVLM EvaluationLarge Vision-Language Models

  11. OCR-MetaReasoning Benchmark: Evaluating the Meta-Reasoning Ability of MLLMs in Text-Rich Image Understanding

    Aug 31, 2026Gengxu Li, Yuan Wu, Yi ChangVisual ReasoningMultimodal Reasoning

  12. Lot Machine: Multimodal Lot Extraction from Auction Catalogs

    Aug 31, 2026Mathias Zinnen, Alisha Mund, Sabine Lang +3VLM EvaluationDocument Image Understanding

  13. InSight-doc: Agentic Visual Perception for Long-Document Understanding

    Aug 11, 2026Kaican Li, Weiyan Xie, Lewei Yao +4Document UnderstandingVisual Question Answering

  14. From Diagnosis to Correction: Benchmarking and Improving Real-World Table Parsing

    Aug 10, 2026Jutao Xiao, Yuan Qu, Dongsheng Ma +7Table Structure RecognitionDocument Image Understanding

  15. Locating Failure in Multi-Page Visually Rich Document Understanding: An Empirical Attribution

    Aug 8, 2026Lewei Xu, Yihao Ding, Zihan Xu +5Document UnderstandingMultimodal Reasoning

  16. Q-CueGraph: Query-Conditioned Visual Evidence Graphs for Multimodal Reasoning

    Aug 5, 2026Pengcheng Pan, Xinfang ZhangVisual Question AnsweringEfficient VLM Inference

  17. Thinking with Anchors: Grounded and Efficient Document Reasoning

    Aug 5, 2026Sichen Zhu, Yuchen Zhu, Wenzhuo Xu +13Vision-Language GroundingDocument Layout Analysis

  18. ERUnderstand: Evaluating Vision-Language Models on Structured ER Diagrams

    Jul 27, 2026Ali Ansari, Yasmin Mohammadi, Farnoush Nili +3VLM EvaluationDocument Image Understanding

  19. Khondo: A Multimodal Benchmark for Document Packet Splitting of Bangla Forms

    Jul 23, 2026Abu Tyeb Azad, Fahim Ahmed, Ishita Sur Apan +7Document ChunkingMultilingual VLM Evaluation

  20. Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models

    Jul 22, 2026Huafu Li, Guo Chen, Jia Xia +5Large Vision-Language ModelsDocument Image Understanding

  21. Handwritten and Printed Text Segmentation via Region-Aware Human-Writing Descriptor Engineering

    Jul 17, 2026Zhixian Lu, Jianwei Zhang, Lei Zhang +5Document Image Understanding

  22. Towards Hierarchical Structure Understanding of Newspaper Images

    Jul 16, 2026William Mocaër, Solène Tarride, Thomas Constum +7Document Layout AnalysisDocument Image Understanding

  23. OvisOCR2 Technical Report

    Jul 15, 2026Shiyin Lu, Yinglun Li, Yu Xia +10Document ParsingOptical Character Recognition

  24. MonkeyOCRv2: A Visual-Text Foundation Model for Document AI

    Jul 13, 2026Yuliang Liu, Zhang Li, Ziyang Zhang +11Document ParsingMultimodal Foundation Models

  25. SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding

    Jul 11, 2026Abhigya Verma, Khyati Mahajan, Amit Kumar Saha +4VLM EvaluationVision-Language Models

  26. TextileNet: Towards Zero-shot Text-style Segmentation of Manuscripts

    Jul 10, 2026Anguelos Nicolaou, Antonella Ambrosio, Desiree Di Donato +1Visual Representation LearningAuthorship Attribution

  27. OmniMapBench: Benchmarking Visual-Centric Reasoning on Diverse Map Documents

    Jul 10, 2026Yang Chen, Yunwen Li, Yufan Shen +6VLM EvaluationDocument Understanding

  28. LEGATO 2: Toward Multimodal Sheet Music Recognition and Understanding

    Jul 7, 2026Guang Yang, Brian Siyuan Zheng, Victoria Ebert +1Optical Music RecognitionAutomatic Music Transcription

  29. HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better

    Jul 6, 2026Gengluo Li, Xingyu Wan, Shangpin Peng +20Vision-Language ModelsEfficient VLM Inference

  30. ClinOCR-Bench: A Comprehensive Clinical Scanned Document Dataset for Optical Character Recognition Model Evaluation

    Jul 4, 2026Enshuo Hsu, Jin Zhou, Kirk RobertsVLM EvaluationOptical Character Recognition

  31. A Vision Based System for Guided and Collaborative Reconstruction of Fragmented Documents

    Jul 3, 2026Oliver Krumpek, Diana LeoHuman-Robot CollaborationCultural Heritage

  32. SINA: A Fully Automated Circuit Schematic Image to Netlist Generator Using Artificial Intelligence

    Jul 2, 2026Saoud Aldowaish, Yashwanth Karumanchi, Kai-Chen Chiang +4Electronic Design AutomationDocument Image Understanding

  33. DEMUN: Fast and accurate discovery of music notation in very large collections

    Jun 30, 2026Vojtěch Dvořák, Filip Bím, Jiří Mayer +5Optical Music RecognitionVisual Document Retrieval

  34. Multimodal Graph RAG for Long-range Visually Rich Document Understanding

    Jun 27, 2026Yi-Cheng Wang, Chu-Song ChenMultimodal RAGVisual Question Answering

  35. Joint Transcription and Decryption of Images of Encrypted Handwritten Documents: A Comparison with the Traditional Pipeline

    Jun 26, 2026Marino Oliveros-Blanco, Lei Kang, Alicia Fornés +1Optical Character RecognitionDocument Image Understanding

  36. An LMM for Precisely Grounding Elements in Documents

    Jun 23, 2026Yijian Lu, Chuangxin Zhao, Kai Sun +3Visual ReasoningLarge Vision-Language Models

  37. DR-Mamba: Automatic Inference-Time Domain Adaptation for Document Image Binarization via Sample-Conditioned Detail-Background Suppression

    Jun 21, 2026Sheng-Wei Chan, Jen-Shiun ChiangMambaTest-Time Adaptation

  38. Text region detection in historical astronomical diagrams

    Jun 14, 2026Zeynep Sonat Baltacı, Raphaël Baena, Fei Meng +4Document UnderstandingHistorical Document Analysis

  39. IndustryBench-MIPU: Benchmarking Multi-Image Attribute Value Extraction for Industrial Products

    Jun 12, 2026Haonan Qi, Jin Cao, Yongqi Zhang +9Multimodal Large Language ModelsMultimodal Model Evaluation

  40. ParseFixer: An Agentic Framework for Document Parsing via Selective Multimodal Correction

    Jun 10, 2026LeKai Yu, Hao Liu, Kun Wang +4Document ParsingDocument Layout Analysis

  41. ERN-Net : Evolving Reason Node-Net for Document Binarization

    Jun 10, 2026Hsin-Jui Pan, Sheng-Wei Chan, Jen-Shiung ChiangConvolutional Neural NetworksDocument Image Understanding

  42. MUDIDI: A Two-Stage Framework for Multilingual Dictionary Digitization with Language Models

    Jun 8, 2026David Setiawan, Temuulen Khishigsuren, Milind Agarwal +3Low-Resource Language ProcessingOptical Character Recognition

  43. Intelligent Character Recognition of Handwritten Forms with Deep Neural Networks

    Jun 7, 2026Hartwig GrabowskiOptical Character RecognitionDocument Image Understanding

  44. DeepMine-Mamba: Mitigating Information Dilution in Mamba-Based State Space Models for Document Image Binarization

    Jun 7, 2026Sheng-Wei Chan, Yung-Che Wang, Hsin-Jui Pan +2MambaDocument Image Understanding

  45. End-to-End Text Line Detection and Ordering

    Jun 2, 2026Benjamin KiesslingDocument Layout AnalysisDocument Image Understanding

  46. Dr. DocBench: A Comprehensive Benchmark for Expert-Level and Difficult Document Parsing

    May 31, 2026Minglai Yang, Xinyan Velocity Yu, Pengyuan Li +22VLM EvaluationDocument Parsing

  47. HakushoBench: A Japanese Chart and Table VQA Benchmark from Governmental White Papers

    May 31, 2026Issa Sugiura, Shuhei Kurita, Yusuke Oda +1VLM EvaluationData Visualization

  48. ABot-OCR Technical Report

    May 27, 2026Kaitao Jiang, Ruiyan Gong, Xiaolong Cheng +3Vision-Language ModelsDocument Parsing

  49. Page image classifier fine-tuned on century-spanning archives of scanned documents for further content-specific processing

    May 25, 2026Kateryna Lutsai, Dana Křivánková, Pavel Straňák +1Document UnderstandingHistorical Document Analysis

  50. FastTab: A Fast Table Recognizer with a Tiny Recursive Module and 1D Transformers

    May 21, 2026Laziz Hamdi, Amine Tamasna, Pascal Boisson +1Table Structure RecognitionDocument Image Understanding

  51. MPDocBench-Parse: Benchmarking Practical Multi-page Document Parsing

    May 21, 2026Bangbang Zhou, Hangdi Xing, Yifan Chen +8Document ParsingDocument Layout Analysis