Natural Language Datasets

Latest papers 60

All topics
CardsList
  1. Scalable, Transferable Meta-network for Data Selection Requires a Different Loss (and Why the Obvious Choice is Problematic)

    Oct 1, 2026Zilin Du, Bowen Yang, Boyang Albert LiNatural Language DatasetsTraining Data

  2. It's All Training: A Fully Synthetic Single-Stage Recipe for LLMs

    Sep 29, 2026Pierre-Carl Langlais, Pieter Delobelle, Yannick Detrois +7Synthetic Training DataSynthetic Data

  3. From Normative Frameworks to Alignment Data: Constructing and Evaluating SFT and Preference Data

    Sep 28, 2026Husrev Taha Sencar, Rezart Beka, Danish Naeem +6Large Language Model AlignmentSocial Norms

  4. ParsHate: A Benchmark Dataset for Hate and Target Detection in Persian

    Sep 14, 2026Zahra Bokaei, Walid Magdy, Bonnie WebberHate Speech DetectionHate Speech

  5. Does task decomposition improve automatic NLG evaluation?

    Sep 1, 2026Sebastian Steindl, Nikos Voskarides, Alberto Gasparin +1Llm-As-A-JudgeNatural Language Datasets

  6. Token Distribution versus Data Volume: Domain Balancing in Multi-Domain Meeting Summarisation

    Aug 16, 2026Ashima Sood, Bryan Gardiner, Joan CondellBalanced LearningNatural Language Datasets

  7. ViTOED: A Dataset for Target-Oriented Emotion Detection on Vietnamese Social Media Texts

    Aug 13, 2026Chanh Vo, Son T. Luu, Ngan Luu-Thuy NguyenEmotion RecognitionNatural Language Datasets

  8. Selecting Open-Weight Language Models for Zero-Shot Intent Classification: A Systematic Evaluation of 41 Models

    Jul 29, 2026Parishruthi Ganesh, Gerry Dozier, Cheryl SealsInstruction-Tuned ModelsNatural Language Datasets

  9. DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data

    Jul 27, 2026Zhen Huang, Yikun Wang, Shijie Xia +1Data-CurationPretraining

  10. IKS-Instruct: A 24,000-Example Multilingual Dataset for Teaching Language Models Indian Knowledge Systems

    Jul 25, 2026Shwetha Singaravelu, Gayathri Muruganantham, Lakshmi Rajendran +1Natural Language DatasetsInstruction

  11. SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark

    Jul 20, 2026Sania Bano, Shahzad Ahmad, Santosh Kumar Vipparthi +2Emotion RecognitionMultimodal Dataset

  12. Can Transformers Really Do It All? On the Compatibility of Inductive Biases Across Tasks

    Jul 20, 2026Damien Teney, Liangze Jiang, Hemanth Saratchandran +1Transformer ArchitecturesInductive Bias

  13. Exploring Post-Training Alignment of Small Language Models for Biomedical Data-to-Text Generation: A Case Study of Medication Leaflet

    Jul 15, 2026Xi Yang, Guodong Liu, Chuqin Li +10Large Language Model AlignmentBiomedical Text

  14. Data-Efficient Adaptation of LLMs via Attention Head Reweighting

    Jul 15, 2026Tuomas Oikarinen, Zixiao Chen, Charlotte Siska +3Parameter-Efficient AdaptationNatural Language Datasets

  15. Learning to Fine-tune Foundation Models under Resource Limitations

    Jul 12, 2026Thomas Tsouparopoulos, Iordanis KoutsopoulosContinual Fine-TuningWireless Foundation Models

  16. PLURAL: A Global Dataset for Value Alignment

    Jul 9, 2026Dhruv Agarwal, Anya Shukla, Tanya Goyal +1Preference DatasetsPluralistic Alignment

  17. SalAngaBhava: A Sinhala Market Dataset for Aspect-based Sentiment Analysis

    Jul 6, 2026Lakshani Galwatta, Nisansa de Silva, Sarangi Aththanayake +1Natural Language DatasetsIndian Languages

  18. When Reranking Hurts: Uncertainty-Based Gating for Few-Shot Reranking

    Jun 30, 2026Orian Dabod, Amir DN Cohen, Gabriel StanovskyRerankingNatural Language Datasets

  19. Improving Large-Scale Weakly Supervised ASR by Filtering and Selection

    Jun 27, 2026Kohei Matsuura, Masato MimuraAutomatic Speech RecognitionCharacter Error Rate

  20. ToxiREX: A Dataset on Toxic REasoning in ConteXt

    Jun 26, 2026Stefan F. Schouten, Ilia Markov, Piek VossenHarmful LanguageToxicity

  21. L3Cube-MahaPOS: A Marathi Part-of-Speech Tagging Dataset and BERT Models

    Jun 23, 2026Hariom Ingle, Ronit Ghode, Ishwari Gondkar +2Natural Language DatasetsTagging

  22. Evaluating and Preserving Lexical Stress in English-to-Chinese Speech-to-Speech Translation

    Jun 13, 2026Yuchen Song, Xi Chen, Mingze Li +1Speech TranslationTranslation Quality

  23. AudioDER: A Deduplication-Enhanced Reasoning Dataset for Post-Training Large Audio-Language Models

    Jun 12, 2026Hui Geng, Yi Su, Han Yin +7Large Audio Language ModelsTable Reasoning Datasets

  24. The Culture Funnel: You Can't Align What isn't in the Data

    Jun 11, 2026Ananya Sahu, Mehrnaz Mofakhami, Daniel D'Souza +3Cultural AwarenessLarge Language Model Alignment

  25. System Report for CCL25-Eval Task 5: New Dataset and LoRA-Fine-Tuned Qwen2.5

    Jun 10, 2026Haotao XiePoetryNatural Language Datasets

  26. AgriGov: A Structured Multilingual Dataset Curation for Indian Government Schemes for Farmers

    Jun 6, 2026Mohsina Bilal, Gopakumar GNatural Language DatasetsIndian Languages

  27. ACAT: A Collaborative Platform for Efficient Aspect-Based Sentiment Dataset Annotation

    Jun 2, 2026Ana-Maria Luisa Mocanu, Ciprian-Octavian Truica, Elena-Simona ApostolSentimentInter-Annotator Agreement

  28. KletterMix: Climbing Toward High-Quality German Pretraining Data

    Jun 2, 2026Maurice Kraus, Ruben Härle, Sebastian Sztwiertnia +4Natural Language DatasetsLarge Language Model Pretraining

  29. ClinicalMC: A Benchmark for Multi-Course Clinical Decision-Making with Large Language Models

    Jun 2, 2026Ruihui Hou, Siyi Zhu, Ziyue Huai +4Multimodal Clinical DataNatural Language Datasets

  30. Translating Classical Poetry into Modern Prose

    Jun 1, 2026Chalamalasetti Kranti, Sowmya VajjalaPoetryNatural Language Datasets

  31. Demystifying Data Organization for Enhanced LLM Training

    May 28, 2026Yalun Dai, Yangyu Huang, Tongshen Yang +8Large Language Model TrainingData-Curation

  32. VLMs May Not Globally Enhance Human Alignment over LLMs During Natural Reading

    May 27, 2026Jinzhou Wu, Zhengwu Ma, Jixing Li +2Vision-Language Foundation ModelsNatural Language Datasets

  33. How Human-Like Are Large Language Models? A Register-Aware Linguistic Evaluation Framework

    May 22, 2026Björn Nieth, Marianna Gracheva, Michaela Mahlberg +2Large Language Model EvaluationLinguistics

  34. A Scalable Tool for Measuring Manner and Result Verbs in Developmental Language Research

    May 15, 2026Divyesh Pratap Singh, Dakshesh Gusain, Federica Bulgarelli +4Language AcquisitionNatural Language Datasets

  35. LLMs as annotators of credibility assessment in Danish asylum decisions: evaluating classification performance and errors beyond aggregated metrics

    May 13, 2026Galadrielle Humblot-Renaux, Mohammad N. S. Jahromi, Rohat Bakuri-Jørgensen +7Large Language Model AnnotationsCredibility

  36. Can Language Models Analyze Data? Evaluating Large Language Models for Question Answering over Datasets

    May 11, 2026Andreas Xenofontos, Pavlos FafaliosTable Reasoning DatasetsNatural Language Datasets

  37. Generating training datasets for legal chatbots in Korean

    May 8, 2026Changhoe Hwang, Jee-Sun Nam, Eric LaporteChatbotsNatural Language Datasets

  38. Automatic Reflection Level Classification in Hungarian Student Essays

    May 4, 2026Zsolt Csibi, Mónika Sándor, Mónika Serfőző +2Automated Essay ScoringNatural Language Datasets

  39. SiNFluD: Creating and Evaluating Figurative Language Dataset for Sindhi

    May 2, 2026Wazir Ali, Adeeb Noor, Saifullah TumraniNatural Language DatasetsMetaphors

  40. SCARV: Structure-Constrained Aggregation for Stable Sample Ranking in Redundant NLP Datasets

    May 1, 2026Xu Zheng, Feiyu Wu, Linhong Wu +2Natural Language Datasets

  41. Progressing beyond Art Masterpieces or Touristic Clichés: how to assess your LLMs for cultural alignment?

    Apr 28, 2026António Branco, João Silva, Nuno Marques +10Cultural AwarenessLarge Language Model Alignment

  42. Programming with Data: Test-Driven Data Engineering for Self-Improving LLMs from Raw Corpora

    Apr 27, 2026Chenkai Pan, Xinglong Xu, Yuhang Xu +6Training DataNatural Language Datasets

  43. Chinese-SkillSpan: A Span-Level Dataset for ESCO-Aligned Competency Extraction from Chinese Job Ads

    Apr 24, 2026Guojing Li, Zichuan Fu, Junyi Li +6JobsNamed-Entity Recognition

  44. Why are all LLMs Obsessed with Japanese Culture? On the Hidden Cultural and Regional Biases of LLMs

    Apr 23, 2026Joseba Fernandez de Landa, Carla Perez-Almendros, Jose Camacho-ColladosLarge Language Model BiasNatural Language Datasets

  45. CHASM: Unveiling Covert Advertisements on Chinese Social Media

    Apr 22, 2026Jingyi Zheng, Tianyi Hu, Yule Liu +5Social Media PostsContent Moderation

  46. AlignCultura: Towards Culturally Aligned Large Language Models?

    Apr 21, 2026Gautam Siddharth Kashyap, Mark Dras, Usman NaseemCultural AwarenessLarge Language Model Alignment

  47. BhashaSutra: A Task-Centric Unified Survey of Indian NLP Datasets, Corpora, and Resources

    Apr 20, 2026Raghvendra Kumar, Devankar Raj, Sriparna SahaIndian LanguagesNatural Language Datasets

  48. Not All Subjectivity Is the Same! Defining Desiderata for the Evaluation of Subjectivity in NLP

    Mar 30, 2026Urja Khurana, Michiel van der Meer, Enrico Liscio +2SubjectivityDesiderata

  49. Deriving Neural Scaling Laws from the statistics of natural language

    Feb 7, 2026Francesco Cagnetta, Allan Raventós, Surya Ganguli +1Scaling LawsNext-Token Distribution

  50. The Role of Dataset Linguistic Structure in the Cultural Awareness of Large Language Models

    Feb 1, 2026Reem I. Masoud, Chen Feng, Shunta Asano +3Natural Language DatasetsCultural Awareness

  51. LuxIT: A Luxembourgish Instruction Tuning Dataset from Monolingual Seed Data

    Oct 28, 2025Julian Valline, Cedric Lothritz, Siwen Guo +1Multimodal Continual Instruction TuningNatural Language Datasets

  52. Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining

    Oct 1, 2025Thiziri Nait Saada, Louis Bethune, Michal Klein +3PretrainingNatural Language Datasets

  53. ToxSyn-PT: A Synthetic Fine-Grained Dataset of Minority-Targeted Toxic Language in Portuguese

    Jun 11, 2025Iago Alves Brito, Julia Soares Dollis, Fernanda Bufon Farber +2Hate Speech DetectionNatural Language Datasets

  54. Common Corpus: The Largest Collection of Ethical Data for LLM Pre-Training

    Jun 2, 2025Pierre-Carl Langlais, Pavel Chizhov, Catherine Arnett +7Natural Language DatasetsLarge Language Model Pretraining

  55. Transferring Natural Language Datasets Between Languages Using Large Language Models for Modern Decision Support and Sci-Tech Analytical Systems

    Oct 17, 2024Dmitrii Popov, Egor Terentev, Danil Serenko +2Natural Language DatasetsBert-Based Models

  56. Which Demographics do LLMs Default to During Annotation?

    Oct 11, 2024Johannes Schäfer, Aidan Combs, Christopher Bagdon +9Large Language Model AnnotationsLarge Language Model Bias

  57. A Survey of Intent Classification and Slot-Filling Datasets for Task-Oriented Dialog

    Jul 26, 2022Stefan Larson, Kevin LeachNatural Language DatasetsBenchmark Datasets

  58. AtlasNLP: A Country-Aware Atlas of Dataset Representation in NLP

    Date pendingJoan Nwatu, Tsedeniya Solomon Amare, Longju Bai +17Natural Language DatasetsLegal Natural Language Processing Benchmarks