Training Data

Momentum

28 papers in the last four weeks, up 180% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 149

All topics
CardsList
  1. Scalable, Transferable Meta-network for Data Selection Requires a Different Loss (and Why the Obvious Choice is Problematic)

    Oct 1, 2026Zilin Du, Bowen Yang, Boyang Albert LiNatural Language DatasetsTraining Data

  2. SAGE: Similarity-Based Cleaning of Poisoned Training Data from Verified Examples

    Oct 1, 2026Chaeeun Han, Soodeh Atefi, Yevgeniy Vorobeychik +1PoisoningTraining Data

  3. AutoGUIWorld: Image Generators as Visual World Models for GUI Agent

    Oct 1, 2026Cheng Yang, Yifan Wu, Yutao Huang +18Visual GenerationAction Generation

  4. Comparison of techniques for fine-tuning open-weight models for entity extraction from radiology reports

    Sep 30, 2026Aawez Mansuri, Kush Mehta, Mohammadreza Chavoshi +10Radiology Report GenerationModel Fine-Tuning

  5. Less is more: error-distance scaling relation for data-efficient kilometer-scale downscaling of extreme heat

    Sep 30, 2026Ahmed Marey, Henry Lu, Abhishek Gaur +6Dynamical DownscalingClimate

  6. Client and Training Data Selection for Computationally Efficient Synchronized Federated Learning

    Sep 30, 2026Muzaffer Citir, Hiroki Nishikawa, Sangyoung ParkFederated LearningTraining Data

  7. After a Decade: Bringing Shadow Removal into the Real World with Agentic Training Data

    Sep 29, 2026Shilin Hu, Jingyi Xu, Dimitris Samaras +1Diverse Occlusion-And-Revelation ScenariosTraining Data

  8. Memorize, Adapt, Ignore: Diagnosing Robot Learning Mechanisms under Training Data Variation

    Sep 29, 2026Ke Zhang, Danica J. Sutherland, Chao LiuScalable Robot LearningImitation Learning

  9. It's All Training: A Fully Synthetic Single-Stage Recipe for LLMs

    Sep 29, 2026Pierre-Carl Langlais, Pieter Delobelle, Yannick Detrois +7Synthetic Training DataSynthetic Data

  10. Recursive LLM Degradation in Biomedical Question Answering: A Cross-Generation Study

    Sep 28, 2026Bibek Bhandari, Kshitij LingthepBiomedical TextSynthetic Data

  11. Curating Merchant-Matching Training Data with Two Confidence-Gated Local LLM Judges

    Sep 27, 2026Donghao Huang, Jinling Pei, Zhaoxia WangJudgesTraining Data

  12. ShapeLex: Decoupling Local Shape Symbolization and Global Scale Modeling for Text-Controlled Time Series Generation

    Sep 21, 2026Subo Wei, Jianqi Gao, Mingyan Fan +3Time-Series GenerationText Generation

  13. Alignment Forecasting: Predicting Misalignment From Training Data

    Sep 19, 2026Chen Yueh-Han, Bruce W. Lee, Ilia Sucholutsky +1Large Language Model AlignmentMisalignment Persona

  14. TouchSight: Bare-Handed Tactile Prediction from Egocentric Video via Generative Visual Augmentation

    Sep 17, 2026Danyan Zhou, Jinxuan Lu, Jiawei Lin +3TactileEgocentric Vision

  15. QUALS: Corpus Equilibrium for Universal Forecasting via Pattern Quantization and Learnability Synchronization

    Sep 17, 2026Yujie Li, Zezhi Shao, Chengqing Yu +7Zero-Shot ForecastingPretraining

  16. OPEN-1B: A Fully Auditable Training Run

    Sep 15, 2026John Donaghy, Brian Wilcox, Oğuzhan Ersoy +6ReproducibilityTraining Data

  17. ReMova: Fine-tuning LLMs for English to Belarusian translation

    Sep 14, 2026Mikita Pilinka, Aliaksandr Kliujeŭ, David Samuel +1Neural Machine TranslationLarge Language Model Fine-Tuning

  18. SynthSentry: Detecting Synthetic Data Contamination in Language Model Training Data

    Sep 14, 2026Praveen Kumar Myakala, Ravichandra Namburi, Sowmya Keragodu Jayaramu +1Synthetic DataTraining Data

  19. Combining Synthetic and Real Data for Low-Resource Historical OCR: A Manchu Case Study

    Sep 11, 2026Yan Hon Michael Chung, Hanlin WangOptical Character RecognitionHistorical Manuscripts

  20. Empirical Evaluation of Data Poisoning Attacks in Supervised Learning

    Sep 10, 2026Toshif Khan, Muhammad AbusaqerPoisoningTraining Data

  21. ActReview: Rebuttal-Guided Training Data and Rubric Rewards for Actionable Peer Review Generation

    Sep 8, 2026Yiling Ma, Yilun Zhao, Sihong Wu +3Peer ReviewReviewer

  22. Compensating for Scarce Historical Images in Cross-Domain Cultural Heritage Retrieval Using Synthetic Aging

    Sep 8, 2026Marcin Iwanowski, Adam Mazgaj, Ferdynand Gorski +1Synthetic-To-Real Domain GapCultural Heritage

  23. zScore-N: A Neural Network for On-Chain Wallet Reputation Scoring

    Sep 8, 2026Girish G N, Ashutosh Sahoo, Akshay SP +2ReputationScores

  24. Attributing Cohen's d: Training Data Attribution for Disease-Related Effects in Normative Age Biomarkers

    Sep 7, 2026Jakob Snel, Marc-Andre SchulzVascular AgeCohort

  25. From Zero to Hero: An Open LLM Ecosystem for Armenian

    Sep 3, 2026Erik Arakelyan, Khatun Avetisyan, Meri Davtyan +5Large Language Model Tool UseText Corpora

  26. Tail-Likelihood Reinforcement Learning

    Sep 2, 2026Shrinivas Ramasubramanian, Daman Arora, Fahim Tajwar +11Offline Reinforcement LearningTraining Data

  27. Test-Time Logit Prompting for Source-Free Missing Modality Adaptation

    Sep 2, 2026Taixi Chen, Nancy GuoVision-Language Model AdaptationLogit Lens

  28. Probing Factual Knowledge Transfer with Training Data Interventions

    Sep 1, 2026Romina Oji, Marc Braun, Marcel Bollmann +2Multilingual Language ModelsLarge Language Model Pretraining

  29. LLM Post-Training as Brownfield Maintenance: An Industrial Perspective on Dataware Engineering

    Aug 31, 2026Gopi Krishnan Rajbahadur, Amir M. Ebrahimi, Boyuan Chen +1Post-TrainingTraining Data

  30. Transformer-Based Flow Shop Scheduling Using MILP-Generated Training Data

    Aug 30, 2026Roderich WallrathJob Shop SchedulingOperations Research

  31. Learned, Then Lost: A Measured Single-Example Counterfactual in Pre-training

    Aug 19, 2026Zachary Speck, Asa ShepardTraining DataBatch

  32. Measuring Task-Agnostic Training Data Influence Across Language Model Pretraining

    Aug 13, 2026Yuto Nishida, Hirokazu Kiyomaru, Yusuke Oda +6Large Language Model PretrainingTraining Data

  33. Agentic Instruction Data Selection: Let DataMaster Interpret Your Intent

    Aug 11, 2026Fanqi Zhou, Qiaosheng Chen, Zixian Huang +1Alignment-Aware SelectionData Science Agents

  34. TokenPrint: A Calibrated Token-Space Fingerprint for Language-Model Provenance

    Aug 8, 2026Yuqi Wu, Shengming Zhao, Jie ChenLanguage ModelingFingerprint

  35. Meta-Task: Turning Terminal Task Synthesis into a Terminal Task for Scalable Agent Training

    Jul 30, 2026Zhihong Pan, Jiyuan He, Kai Zhang +5Synthetic TaskAgentic Benchmarks

  36. Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation

    Jul 21, 2026Amber Yijia Zheng, Lu Liu, Raymond A. Yeh +1Text-To-Video Generation ModelVideo Dataset

  37. PPL-Factory: Task-Aware and Budget-Aware Data Selection from Language Modeling to Reasoning

    Jul 20, 2026Hang Zhang, Warren J. GrossLarge Language Model Fine-TuningLanguage Modeling

  38. Bridging the Information Gap: Semantic Densification and Hindsight Distillation for Cold-Start Prediction

    Jul 19, 2026Hao Duong Le, Yifei Gao, Huan Li +4Cold-StartDataset Distillation

  39. Analytical study of the optimal combination of binary classifiers based on classifiers-induced partitioning of the training set

    Jul 16, 2026Jean-Marc Brossier, Olivier LafitteClassifierEmpirical Risk Minimization

  40. Reducing information dependency does not cause training data privacy. Adversarially non-robust features do

    Jul 14, 2026Rasmus Torp, Shailen K. Smith, Adam BreuerPrivacyTraining Data

  41. Data Safety: Synthetic Data Quality Analysis Using CIFAKE Dataset

    Jul 13, 2026Kuniko Paxton, Amila Akagić, Koorosh Aslansefat +2Synthetic Image DetectionSynthetic Data

  42. Requential Coding: Pushing the Limits of Model Compression with Self-Generated Training Data

    Jul 13, 2026Shikai Qiu, Marc Finzi, Yujia Zheng +2Data Compression MethodsCodebooks

  43. What You Train Is What You Get: Gender Bias, Training Composition, and Post-Hoc Mitigation in Audio Deepfake Detection

    Jul 10, 2026Aishwarya R. Fursule, Vamshi Nallaguntla, Shruti Kshirsagar +1Audio Deepfake DetectionAudio Understanding

  44. FedCVESA: Taking Away Training Data in Federated Learning via Correlation Value Encoding and Segmented Aggregation

    Jul 8, 2026Chongkai Li, Bang Zhang, Wenjian LuoFederated LearningTraining Data

  45. TriA Pipeline: A Large-Scale Automatic Audio Annotation Pipeline For Audio Classification In Specific Scenarios

    Jul 7, 2026Hong Lyu, Mingru Yang, Qianhua He +3Training Data

  46. WARP: Weight-Space Analysis for Recovering Training Data Portfolios

    Jul 2, 2026Tzu-Heng Huang, Aditya Goyal, John Cooper +1Weight-SpaceTraining Data

  47. UT-AISTimprt submission for ICME 2026 Grand Challenge on Academic Text-to-Music Generation

    Jul 2, 2026Shunsuke Yoshida, Yu-Hua Chen, Satoru FukayamaText-To-MusicTraining Data

  48. How to Allocate Your Tokens? Scaling Laws with Training Steps and Batch Size

    Jul 1, 2026Fabian SchaippScaling LawsBatch

  49. Watermarking for Proprietary Dataset Protection

    Jul 1, 2026John Kirchenbauer, Brian R. Bartoldson, Bhavya Kailkhura +1Membership InferenceWatermarking