Text Corpora

Latest papers 605

All topics
CardsList
  1. Advancing automatic speech recognition using feature fusion with self-supervised learning features: A case study on Fearless Steps Apollo corpus

    Apr 24, 2026Szu-Jui Chen, John H. L. HansenSelf-Supervised Speech ModelsSelf-Supervised Learning

  2. TexOCR: Advancing Document OCR Models for Compilable Page-to-LaTeX Reconstruction

    Apr 24, 2026Chengye Wang, Lin Fu, Zexi Kuang +1Lingdt-Vl-OcrOptical Character Recognition

  3. Fixation Sequences as Time Series: A Topological Approach to Dyslexia Detection

    Apr 23, 2026Marius Huber, David R. Reich, Lena A. JägerPersistent HomologyTopology

  4. Job Skill Extraction via LLM-Centric Multi-Module Framework

    Apr 23, 2026Guojing Li, Zichuan Fu, Junyi Li +8JobsText Corpora

  5. DiariZen Explained: A Tutorial for the Open Source State-of-the-Art Speaker Diarization Pipeline

    Apr 23, 2026Nikhil RaghavSpeaker DiarizationSpeaker

  6. A Large-Scale, Cross-Disciplinary Corpus of Systematic Reviews

    Apr 23, 2026Pierre Achkar, Tim Gollub, Arno Simons +2Systematic ReviewOpenalex Metadata

  7. Global Offshore Wind Infrastructure: Deployment and Operational Dynamics from Dense Sentinel-1 Time Series

    Apr 22, 2026Thorsten Hoeser, Felix Bachofer, Claudia KuenzerOffshore Wind TurbineSynthetic Aperture Radar

  8. ORPHEAS: A Cross-Lingual Greek-English Embedding Model for Retrieval-Augmented Generation

    Apr 22, 2026Ioannis E. Livieris, Athanasios Koursaris, Alexandra Apostolopoulou +2GreekMultilingual Language Models

  9. Deja Vu at Scale: Paraphrase-Robust Detection of Duplicate Gherkin Steps in Behaviour-Driven Software Testing with Sentence-Transformer Embeddings and a 1.1M-Step Open Benchmark

    Apr 22, 2026Ali Hassaan Mughal, Noor Fatima, Muhammad BilalText CorporaRepetition

  10. Commonsense Knowledge with Negation: A Resource to Enhance Negation Understanding

    Apr 21, 2026Zijie Wang, MohammadHossein Rezaei, Farzana Rashid +1NegationNatural Language

  11. 'The Order in the Horse's Heart': A Case Study in LLM-Assisted Stylometry for the Discovery of Biblical Allusion in Modern Literary Fiction

    Apr 21, 2026Ewan CameronLiteratureStylometric

  12. Detoxification for LLM: From Dataset Itself

    Apr 21, 2026Wei Shao, Yihang Wang, Gaoyu Zhu +4DetoxificationToxicity

  13. BhashaSutra: A Task-Centric Unified Survey of Indian NLP Datasets, Corpora, and Resources

    Apr 20, 2026Raghvendra Kumar, Devankar Raj, Sriparna SahaIndian LanguagesNatural Language Datasets

  14. CodePivot: Bootstrapping Multilingual Transpilation in LLMs via Reinforcement Learning without Parallel Corpora

    Apr 20, 2026Shangyu Li, Juyong Jiang, Meibo Ren +7Code GenerationText Corpora

  15. Heterogeneity in Formal Linguistic Competence of Language Models: Is Data the Real Bottleneck?

    Apr 20, 2026H S V N S Kowndinya Renduchintala, Sumit BhatiaLarge Language Models FailLinguistics

  16. TeleEmbedBench: A Multi-Corpus Embedding Benchmark for RAG in Telecommunications

    Apr 20, 2026Pranshav Gajjar, Vijay K ShahMobile NetworksEmbedder

  17. Community-Specific Slang and Entity Detection via Semantic Shift in Fine-Tuned Language Models

    Apr 19, 2026Julia Kruk, Sanchita Porwal, Amitrajit Bhattacharjee +1Large Language Model Fine-TuningText Corpora

  18. Matlas: A Semantic Search Engine for Mathematics

    Apr 19, 2026Haocheng Ju, Leheng Chen, Peihao Wu +2Research-Level MathematicsScholar Information Database

  19. Jupiter-N Technical Report

    Apr 19, 2026George DraysonTechnical ReportText Corpora

  20. IYKYK (But AI Doesn't): Automated Content Moderation Does Not Capture Communities' Heterogeneous Attitudes Towards Reclaimed Language

    Apr 17, 2026Christina Chance, Rebecca Pattichis, Arjun Subramonian +4Hate SpeechContent Moderation

  21. DR3^{3}-Eval: Towards Realistic and Reproducible Deep Research Evaluation

    Apr 16, 2026Qianqian Xie, Qingheng Xiong, He Zhu +16Deep ResearchMulti-Dimensional Evaluation

  22. Hardening x402: PII-Safe Agentic Payments via Pre-Execution Metadata Filtering

    Apr 13, 2026Vladimir StantchevPayment NetworksMetadata

  23. DIA-HARM: Dialectal Disparities in Harmful Content Detection Across 50 English Dialects

    Apr 7, 2026Jason Lucas, Matt Murtagh, Ali Al-Lawati +3DialectsMultilingual Benchmark

  24. Chronos: The AI Co-Historian

    Apr 4, 2026Lorenz Hufe, Niclas Griesshaber, Gavin Greif +2HistoryResearch Automation

  25. OpenResearcher: A Fully Open Pipeline for Long-Horizon Deep Research Trajectory Synthesis

    Mar 17, 2026Zhuofeng Li, Dongfu Jiang, Xueguang Ma +7Deep ResearchSynthetic Task

  26. Indirect Question Answering in English, German and Bavarian: A Challenging Task for High- and Low-Resource Languages Alike

    Mar 16, 2026Miriam Winkler, Verena Blaschke, Barbara PlankLow-Resource LanguagesNatural Language Processing

  27. Naïve PAINE: Lightweight Text-to-Image Generation Improvement with Prompt Evaluation

    Mar 12, 2026Joong Ho Kim, Nicholas Thai, Souhardya Saha Dip +2Text-To-ImageGenerative Quality

  28. SiDiaC-v.2.0: Sinhala Diachronic Corpus Version 2.0

    Mar 11, 2026Nevidu Jayatilleke, Nisansa de Silva, Uthpala Nimanthi +3Indian LanguagesText Corpora

  29. EPIC-EuroParl-UdS: Information-Theoretic Perspectives on Translation and Interpreting

    Mar 10, 2026Maria Kunilovskaya, Christina PollkläsenerText CorporaLinguistics

  30. Supporting Workflow Reproducibility by Linking Bioinformatics Tools across Papers and Executable Code

    Mar 9, 2026Clémence Sebe, Olivier Ferret, Aurélie Névéol +3BioinformaticsAgentic Workflow Design

  31. When Spoof Detectors Travel: Evaluation Across 66 Languages in the Low-Resource Language Spoofing Corpus

    Mar 2, 2026Kirill Borodin, Vasiliy Kudryavtsev, Maxim Maslov +2SpoofingMultilingual Automatic Speech Recognition

  32. OSF: On Pre-training and Scaling of Sleep Foundation Models

    Feb 27, 2026Zitao Shuai, Zongzhe Xu, David Yang +2SleepPretraining

  33. PRIMA: Pre-training with Risk-integrated Image-Metadata Alignment for Medical Diagnosis via LLM

    Feb 26, 2026Yiqing Wang, Chunming He, Ming-Chen Lu +4Multimodal Clinical DataMultimodal Pretraining

  34. MixSarc: A Bangla-English Code-Mixed Corpus for Implicit Meaning Identification

    Feb 25, 2026Kazi Samin Yasar Alam, Md Tanbir Chowdhury, Tamim Ahmed +2BanglaHumor

  35. Corpus Prevalence of Multiple-Choice Question Options

    Feb 19, 2026Leonidas Zotos, Hedderik van Rijn, Malvina NissimMultiple-Choice QuestionsText Corpora

  36. FineInstructions: Scaling Synthetic Instructions to Pre-Training Scale

    Jan 29, 2026Ajay Patel, Colin Raffel, Chris Callison-BurchPretrainingInstruction

  37. Human Values in a Single Sentence: Moral Presence, Hierarchies, and Transformer Ensembles on the Schwartz Continuum

    Jan 20, 2026Víctor Yeste, Paolo RossoHuman ValuesMoral Reasoning

  38. Paid Voices vs. Public Feeds: Interpretable Cross-Platform Theme-Based Analysis of Climate Discourse

    Jan 19, 2026Samantha Sudhoff, Pranav Perumal, Zhaoqing Wu +1DiscourseModel Discovery

  39. Thunder-KoNUBench: A Corpus-Aligned Benchmark for Korean Negation Understanding

    Jan 8, 2026Sungmok Jung, Yeonkyoung So, Joonhak Lee +3NegationText Corpora

  40. Quantifying the Effect of Test Set Contamination on Generative Evaluations

    Jan 7, 2026Rylan Schaeffer, Joshua Kazdan, Baber Abbasi +8Large Language Model EvaluationMemorization

  41. SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment

    Nov 3, 2025Xinyu Mao, Junsi Li, Haoji Zhang +2Cross-Modal AlignmentMultimodal Large Language Models

  42. WELD: The First Naturalistic Long-Period Small-Team Workplace Emotion Dataset for Ubiquitous Affective Computing

    Oct 17, 2025Xiao SunAffective ComputingLongitudinal Data

  43. Iterative Topic Taxonomy Induction with LLMs: A Case Study of Electoral Advertising

    Oct 16, 2025Alexander Brady, Tunazzina IslamTopic ModelingPolitical Discourse

  44. ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis

    Oct 12, 2025Mohammad Javad Ranjbar Kalahroodi, Heshaam Faili, Azadeh ShakeryText-To-Speech SynthesisSpeech Synthesis

  45. PlantExpertVQA: A Visual Question Answering Dataset for Benchmarking Vision-Language Models in Plant Science

    Aug 23, 2025Syed Nazmus Sakib, Nafiul Haque, Mohammad Zabed Hossain +1Leaf Disease ClassificationVision Datasets

  46. Balalaika: Data-Centric, Prosody-Aware Annotation Pipeline for Russian Speech

    Jul 17, 2025Kirill Borodin, Nikita Vasiliev, Vasiliy Kudryavtsev +3ProsodyAutomatic Speech Recognition

  47. Enabling automatic transcription of child-centered audio recordings from real-world environments

    Jun 13, 2025Daniil Kocharov, Azarias Galama, Okko RäsänenTranscriptTranscription

  48. ANVIL: Anomaly-based Vulnerability Identification without Labelled Training Data

    Aug 28, 2024Weizhou Wang, Eric Liu, Xiangyu Guo +3Vulnerable CodeAnomaly Score

  49. FlashBack: Efficient Retrieval-Augmented Language Modeling for Fast Inference

    May 7, 2024Runheng Liu, Xingchen Xiao, Heyan Huang +2LLM Inference OptimizationFast Inference

  50. All Entities are Not Created Equal: Examining the Long Tail for Ultra-Fine Entity Typing

    Date pendingAdvait Deshmukh, Ashwin Umadi, Dananjay Srinivas +1EntitiesLarge Language Model Pretraining