Document Information Extraction

Momentum

34 papers in the last four weeks, up 89% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 189

All topics
CardsList
  1. CVE-TTP KG: Knowledge Graph Linking Software Vulnerabilities to Attack Behaviors

    Jun 30, 2026Swati Yadav, Dincy R. Arikkat, Basant Agarwal +3KG ConstructionCyber Threat Intelligence

  2. Research Entity Extraction and Topic Detection from UKRI Grant Proposals

    Jun 29, 2026Xingran Ruan, Angelo Salatino, Rosa Filgueira +4AI-Assisted Scientific ResearchDocument Information Extraction

  3. Making Multimodal LLMs Reliable Chart Data Extractors: A Benchmark and Training Framework

    Jun 29, 2026Yuchen He, Peizhi Ying, Liqi Cheng +4Document Information ExtractionMultimodal Large Language Models

  4. Extracting Knowledge from an Arabic-English Machine-Readable Dictionary Using Information Extraction

    Jun 26, 2026Diaa M. Fayed, Aly A. Fahmy, Mohsen A. Rashwan +1Arabic NLPDocument Information Extraction

  5. LLM-Based Examination of Eligibility Criteria from Securities Prospectuses at the German Central Bank

    Jun 25, 2026Serhii Hamotskyi, Akash Kumar Gautam, Christian HänigFinancial ServicesLegal NLP

  6. Utilizing Cognitive Signals Generated during Human Reading to Enhance Keyphrase Extraction from Microblogs

    Jun 25, 2026Xinyi Yan, Yingyi Zhang, Chengzhi ZhangDocument Information ExtractionMultimodal Learning

  7. Extracting Problem and Method Sentence from Scientific Papers: A Context-enhanced Transformer Using Formulaic Expression Desensitization

    Jun 25, 2026Yingyi Zhang, Chengzhi ZhangData AugmentationDocument Information Extraction

  8. Overview of HIPE-2026: Person-Place Relation Extraction from Multilingual Historical Texts

    Jun 24, 2026Juri Opitz, Maud Ehrmann, Corina Raclé +3Relation ExtractionHistorical Document Analysis

  9. AI-PAVE-Br: Leveraging Large Language Models for Enhanced Product Attribute Value Extraction through a Golden Set Approach

    Jun 23, 2026Murilo Gazzola, Hugo Gobato Souto, Samuel Silva +4Document Information ExtractionLLM Information Extraction

  10. AutoSpecNER: A Fine-Grained Named Entity Recognition Dataset for Vehicle Specification Extraction

    Jun 23, 2026Jordan Lee, Filippos Ventirozos, Abdirahman Abdullahm +3Named Entity RecognitionDocument Information Extraction

  11. Building Agent Harnesses for Scientific Curation from Multimodal Sources

    Jun 19, 2026Sheng Zhang, Qin Liu, Renqian Luo +9Document Information ExtractionScientific Workflow Automation

  12. Source-Grounded Data Generation for Text-to-JSON Learning

    Jun 18, 2026Sunghee Ahn, Guijin Son, Youngjae YuGrounded Text GenerationSynthetic Data Generation

  13. Toten: A Knowledge-Based System For Structure-Preserving Representation Of Physical Quantities And Technical Notation In Brazilian Portuguese

    Jun 17, 2026Antonio de Sousa Leitão Filho, Allan Kardec Duailibe Barros Filho, Fabrício Saul Lima. Selby Mykael Lima dos Santos +1Document Information Extraction

  14. Agents-K1: Towards Agent-native Knowledge Orchestration

    Jun 11, 2026Zongsheng Cao, Bihao Zhan, Jinxin Shi +23KG ConstructionAI for Science

  15. LEDGER: A Long-Context Benchmark of Corporate Annual Reports for Grounded Financial Retrieval and Extraction

    Jun 11, 2026Charles Moslonka, Amaury de Vitry, Arthur Garnier +2Long-Context RetrievalDocument Information Extraction

  16. AAbAAC: An Annotated Corpus for Autoimmunity Information Extraction

    Jun 11, 2026Fabien Maury, Solène Grosdidier, Maud de Dieuleveult +1Named Entity RecognitionDocument Information Extraction

  17. eCREAM-MedCorpus A Large-Scale Corpus of Clinical Notes for Italian

    Jun 10, 2026Tiziano Labruna, Guido Bertolini, Pietro Ferrazzi +1Document Information ExtractionClinical Information Extraction

  18. Notes2Skills: From Lab Notebooks to Certainty-Aware Scientific Agent Skills

    Jun 10, 2026Shi Liu, Jiayao Chen, Chengwei Qin +3AI for ScienceDocument Information Extraction

  19. Attention Expansion: Enhancing Keyphrase Extraction from Long Documents with Attention-Augmented Contextualized Embeddings

    Jun 9, 2026Roberto Martínez-Cruz, Alvaro J. López-López, José PortelaDocument Information ExtractionLong-Context Modeling

  20. ChartLens: A Dual-Branch Framework for Chart Data Correction and Factual Summary Refinement

    Jun 9, 2026Hao Liu, Ruping Cao, Kun Wang +4Document Information ExtractionChart Data Extraction

  21. How Small Can You Go? LoRA Fine-Tuning 270M-8B Models for Merchant Information Extraction in Financial Transactions

    Jun 6, 2026Donghao Huang, Tomas Drietomsky, Benjamin Barrett +1Financial ServicesMemory-Efficient Fine-Tuning

  22. HKJudge: A Legal Discourse-Annotated Corpus for Interpreting What Courts Find, How They Reason, and What They Rule

    Jun 4, 2026Xi Xuan, Wenxin Zhang, Yufei Zhou +2Legal NLPDocument Information Extraction

  23. Benchmarking Open-Source Layout Detection Models for Data Snapshot Extraction from Institutional Documents

    Jun 4, 2026AJ Carl P. Dy, Aivin V. SolatorioDocument Information ExtractionDocument Layout Analysis

  24. EURO-5K: When Does Domain Pretraining Matter? Benchmarking Transformers for EU Reporting Obligation Extraction

    Jun 2, 2026Marios Koniaris, Vasileios Kotronis, Eugenia Giannini +1Language Model PretrainingLegal NLP

  25. An NLP-Driven Framework for Curriculum-Labor Market Alignment: Schema-Constrained LLM Extraction, ESCO-Anchored Semantic Matching, and Multi-Dimensional Gap Quantification

    Jun 1, 2026Sherzod Turaev, Mary John, Mamoun Awad +2Document Information ExtractionLLM Information Extraction

  26. Construction of Historical Knowledge Graphs Based on BERT and Graph Neural Networks

    Jun 1, 2026Ping Li, Bartlomiej BrzozkaKG ConstructionHistorical Document Analysis