Text Corpora

Latest papers 605

All topics
CardsList
  1. The ÌròyìnSpeech Text Corpus: 24,905 Curated Yorùbá Sentences for Speech and Language Technology

    Oct 4, 2026Kola Tubosun, Aanuoluwapo Aremu, Tolulope Ogunremi +2Text Corpora

  2. Code-Switching Spoken Language Identification as Multi-Label Set Prediction

    Oct 1, 2026Shunsuke Mitsumori, Matthew Wiesner, Shigeo Morishima +1Code-SwitchingMultilingual Automatic Speech Recognition

  3. Sentence Specificity Scores for Collaborative Technical Documentation: A Domain-Transfer Study

    Oct 1, 2026Rocker D'Antonio, Thomas Benton Townsend, Dimitrios Michael ManiasDocumentationText Corpora

  4. A Matched-Budget Audit Framework for Recaptioned Image-Text Supervision Distributions

    Oct 1, 2026Giyeong Oh, Junghun Park, Yuhan Bae +1Video CaptioningText-To-Image

  5. Balalaika-Longform: A Russian Speech Corpus for Continuous Long-Form Text-to-Speech

    Sep 30, 2026Nikita Vasiliev, Kirill Borodin, Vasilii Kudryavtsev +2Text CorporaSynthesis

  6. Collapse, Not Invariance: Diagnosing Auxiliary Objectives in Speech Anti-Spoofing

    Sep 30, 2026Ksenia Lysikova, Kirill Borodin, Maxim Maslov +1SpoofingCross-Entropy Losses

  7. Consensus and Factual Dynamics in Large Populations of Interacting Language Models

    Sep 30, 2026Emanuele Ricco, Elia Onofri, Vincenzo Sammartino +1Large Language Model DecisionsLanguage Modeling

  8. Recovering Off-Policy Supervision for Speculative Decoding

    Sep 30, 2026Jungseob Lee, Chanjun Park, Sugyeong Eo +1Speculative DecodingDrafts

  9. Retrieval-Augmented Skill Optimization via Cross-Harness Adaptation

    Sep 29, 2026Jaewon Chu, Ji Soo Lee, Jihwan Park +8SkillsAgentic Optimization

  10. Generated Query Expansion Still Helps Strong Sparse Retrieval: A Controlled Study with SPLADE-v3

    Sep 29, 2026Ryan C. Barron, Cade W. Trotter, Maksim E. Eren +3Retrieval LayerText Corpora

  11. It's All Training: A Fully Synthetic Single-Stage Recipe for LLMs

    Sep 29, 2026Pierre-Carl Langlais, Pieter Delobelle, Yannick Detrois +7Synthetic Training DataSynthetic Data

  12. CompOrca: Corpus-Scale Compliance Labelling of Instruction-Tuning Data

    Sep 29, 2026Philipp E. Glass, Alina MironComplianceRefusals

  13. KUPAS MASTER: Distilling the Tacit Expertise of Master Practitioners into Agent-Ready Experience Corpora

    Sep 29, 2026Changmian Wang, Yuchao Ma, Xuchao Lu +13Expert DemonstrationsText Corpora

  14. Follow the Entities: A Corpus Map for Agentic Search

    Sep 29, 2026Soyeong Jeong, Sujay Kumar Jauhar, Sung Ju Hwang +1Agentic SearchText Corpora

  15. ReDimNet2+: Multi-Corpus Data Scaling for Robust Speaker Verification

    Sep 29, 2026Kirill Borodin, Vasilii Kudryavtsev, Maxim Maslov +1Automatic Speaker VerificationSpeaker

  16. InterBias-SV: Compound Conditions in Speaker Verification

    Sep 29, 2026Kamel Kamel, Hridoy Sankar Dutta, Keshav Sood +1Automatic Speaker VerificationEqual Error Rate

  17. Quantization Enables Private Dense Retrieval against Malicious Service Providers

    Sep 28, 2026Louis Tremblay Thibault, Sofiane Azogagh, Marc-Olivier Killijian +1Retrieval LayerPrivacy

  18. OpenWhistle: A Large-Scale Longitudinal Dataset and Benchmark of Bottlenose Dolphin Vocalizations

    Sep 28, 2026Faadil Mustun, Chiara Semenzin, Roberto Dessi +7Passive Acoustic MonitoringAnimal Vocalizations

  19. UNBIND: UNlearning By INference-time Directional Steering for Code LLMs

    Sep 28, 2026Zhengyang Shan, Jiayun Xin, Yanjun Lin +7Large Language Model UnlearningExact Unlearning

  20. Certified Selective Automation of LLM Agent Evaluation

    Sep 28, 2026Chengguang Gan, Yunhao Liang, Qinghao Zhang +1Agentic EvaluationsAutomated

  21. ReScraper: Unified Scraping and Cleaning of Web Data for Effective LLM Pretraining

    Sep 28, 2026Zichun Yu, Jiarui Yan, Shlok Sanghvi +2Agentic CrawlersData-Curation

  22. TableSeek: Structure-Preserving Agentic Evidence Seeking over Heterogeneous Table Corpora

    Sep 28, 2026Jiaming Tian, Liyao Li, Wentao Ye +5RetrieversAgentic Search

  23. ARCH-B: Architectural Representation, Comprehension and Hierarchy Benchmark

    Sep 28, 2026Kieran Sagar Parikh, Jose Luis Garcia del Castillo y LopezMultimodal BenchmarksBuilding Information Modeling

  24. SlopBench: How Well Can We Rank Language Models by Slop? A Multi-Domain Benchmark of Repetitive AI Writing

    Sep 27, 2026Dhruv Roongta, Harsha Gaddipati, Anh Tuan HuynhLanguage Model ComputesText Corpora

  25. BaatCheet: A Multilingual Corpus for Dialogue Translation in Indian Languages

    Sep 27, 2026Priyanka Dasari, Yuvrajsinh D. Bodana, Vandan Mujadia +3Translation QualityMultilingual Benchmark

  26. Structured Sparse Memory for Recurrent Reasoning

    Sep 27, 2026Zixuan Zhao, Samuel Wheeler, Neil Getty +3Text CorporaData Augmentation

  27. Pretrained ASR Pseudo-labeling for Noisy Police Audio

    Sep 24, 2026Kaavya Chaparala, Su Huang, Stephen L. Morgan +2High Confidence Pseudo-LabelsAutomatic Speech Recognition

  28. A Native-Reference Phone-Class Geometry for Second-Language Pronunciation Analysis

    Sep 24, 2026Tina Raissi, Nhan Phan, Chenxiao Wang +1Pronunciation AssessmentProficiency

  29. Benchmarking and Domain Adaptation of Automatic Speech Recognition (ASR) for Adolescent Health Communication in Ghanaian Languages

    Sep 24, 2026Stephen E. Moore, Akwasi Asare, Mich-Seth Owusu +3Automatic Speech RecognitionDomain Adaptation

  30. YODAS v3: Over 1 Million Hours of High-Bandwidth, Stereophonic, Multilingual Speech

    Sep 24, 2026William Chen, Shinnosuke Takamichi, Sayaka Shiota +3Multilingual Automatic Speech RecognitionText Corpora

  31. No More Free Lunch: Corpus Task Complexity Matters as Corpora Grow

    Sep 24, 2026Prasann Singhal, Amanda Bertsch, Jacob Steinhardt +1Text Corpora

  32. BanglaKontho: Closing the Long-Form Gap in Bangla Text-to-Speech

    Sep 24, 2026Mizbaul Haque MarufFlow-Matching Text-To-SpeechBangla

  33. TraceGuard: Adaptive Multimodal Poison Filtering through Cross-Feature Rank Agreement

    Sep 24, 2026Haoyang Li, Yaxin Xiao, Linyan Dai +5Text CorporaTraces

  34. COILD: An Indic-Centric Parallel Corpus and Benchmark for Machine Translation Across Indian Languages

    Sep 23, 2026Kshetrimayum Boynao Singh, Nitin Kumar Mishra, Palash Pratim Dutta +22Indian LanguagesMachine Translation

  35. Technical Manual for Toolkit for Confidence-Corpus Consistency, Corpus Absorption and Rule Learning via Fine-Tuning on a Fabricated Corpus

    Sep 23, 2026José Luciano Verçosa Marques, Frederico Jorge Heitmann, Daniel Omar Perez +3Large Language Model ReliabilityText Corpora

  36. Benchmarking Argumentative Behaviour of LLMs: A Study of Defences Against Character Attacks

    Sep 23, 2026Ewelina Gajewska, Katarzyna Budzynska, Jaroslaw ChudziakLarge Language Model DecisionsArgumentation Frameworks

  37. ThaiTrees: Thai Syntactic Dependency Trees Across Domains

    Sep 23, 2026Attapol T. Rutherford, Papatchol ThientongSyntactic StructureText Corpora

  38. EviStreams: Human-in-the-Loop AI Data Extraction for Systematic Reviews in Medicine

    Sep 23, 2026Sai Karthik Kosuri, Ankita Shashikant Bhosale, Michael Glick +2Systematic ReviewExtraction

  39. Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms

    Sep 23, 2026Xinjie Shen, Wei Fan, Xudong Guo +5Data Generation PipelinesLong-Horizon Task Planning

  40. Quantifying the Occult: A Comparative Study of Hindu and Buddhist Deities Using Machine Learning Methods

    Sep 22, 2026Ankit BhattacharjeeBodhiCross-Architecture Generalization

  41. The Illinois Social Attitudes Aggregate Corpus (ISAAC): An Open Tool and Reproducible Pipeline for Analyzing Social Group Discourse at Scale

    Sep 22, 2026Babak Hemmatian, Sarah Hadjarab, Jessica Chen +1Text CorporaDemographics

  42. Math Reasoning in LLMs is Organized by Approach, Not Topic

    Sep 22, 2026Sajad Goudarzi, Samaneh Zamanifard, Moloud Nasiri +1Mathematical Reasoning BenchmarksLarge Language Model Tool Use

  43. A retrospective analysis on the use of LLMs to study infant syntax learning

    Sep 22, 2026Hélie Bazin, Anouk Barberousse, François YvonSyntactic StructureSyntax

  44. Layout-Guided Masking for GROBID: Lightweight Structural Gains in Large-Scale Scientific PDF Ingestion

    Sep 22, 2026Luca Foppiano, Sana Khamassi, Vipul GuptaDocument ParsingUnnormalized Probability Densities

  45. TransBERT: A Framework for Synthetic Translation in Domain-Specific Language Modeling

    Sep 22, 2026Julien Knafou, Luc Mottin, Anaïs Mottaz +2Natural Language ProcessingText Corpora

  46. Domain-Adaptive Pretraining Enhances Water Treatment Semantic Representation for Large-Scale Structured Literature Mining

    Sep 22, 2026Mudi Zhai, Ruihong Qiu, Qingyun Zeng +3Information ExtractionBert-Based Models

  47. RAG-NAROK: Retrieval-Aware Knowledge Corpus Poisoning in RAG with Source-specific Refutation

    Sep 21, 2026Abdullahil Kafi, Alvi Ataur KhalilPoisoningAttacker Large Language Model

  48. Mining Legal Arguments in U.S. Corporate Case Law

    Sep 21, 2026Luis Brena, William Jurayj, Gregory Deyesu +3Text CorporaEntailment

  49. FineWeb-CLaR: Culture, Language, and Region Annotations for Benchmark-Aligned Corpus Auditing

    Sep 21, 2026Yusser Al Ghussin, Eva Gavaller, Cristina España-Bonet +2Cultural AwarenessText Corpora

  50. The Copy Ceiling: An Input-Exposure Control for Ontology-Grounded Generation over Curated Corpora

    Sep 21, 2026John J. O'HareText CorporaExposure

  51. Structure Before Sampling: Community-Aware Core-Set Selection for Data-Efficient Text-to-Speech

    Sep 21, 2026Mizbaul Haque Maruf, Muhammad Nur YanhaonaGrapheme-To-PhonemeText Corpora

  52. Simpler Methods Work Better for L1 Penalized Logistic Models and Large Datasets

    Sep 21, 2026Edward Raff, James HoltSpectral NormSolvers

  53. MR-SPITE: Accelerating Multi-Robot Conflict Scans via Hierarchical Swept-Volume Approximations

    Sep 20, 2026Marta Markowicz, James Motes, Marco Morales +1Multi-Robot SystemsCollision Prediction