Cross-Entropy Losses

Momentum

18 papers in the last four weeks, up 260% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 102

All topics
CardsList
  1. Cut Binary Cross Entropy: Efficient Large-Vocabulary Loss and Gradient Kernels for Sequential Recommendation

    Oct 4, 2026Yaoyiran Li, Haowen Ning, Mohamed HammadCross-Entropy Losses

  2. Stochastic Rounding in Low-Precision Transformer Inference: A Variable-Precision Emulation Study of a Small GPT-2

    Oct 1, 2026Yohan Chatelain, Pablo de Oliveira CastroFull-Precision PerformanceLanguage Model Perplexity

  3. No Model Required: Text Entropy Rate Filtering Mitigates Iterative Fine-Tuning Collapse

    Oct 1, 2026Lewis MitchellCollapseToken-Level Entropy

  4. Cross-entropy optimization with prioritized constraints

    Oct 1, 2026Francisco Roldan Sanchez, Pau de las Heras Molins, David Fridovich-Keil +1Constrained OptimizationPrioritization

  5. In CEM, a World Model Is Also a Proposal Mechanism

    Oct 1, 2026Oliver Obst, Frieder StolzenburgModel SelectionWorld Models

  6. Collapse, Not Invariance: Diagnosing Auxiliary Objectives in Speech Anti-Spoofing

    Sep 30, 2026Ksenia Lysikova, Kirill Borodin, Maxim Maslov +1SpoofingCross-Entropy Losses

  7. Cross-Entropy Guided Routing in Mixture-of-Experts Large Language Models

    Sep 29, 2026Yury Nahshan, Nati Daniel, Jacob Goldberger +1Mixture-Of-Experts Large Language ModelsMixture-Of-Experts Architectures

  8. BV Loss: Block Verification-Aware Loss for Block Diffusion Speculative Decoding

    Sep 28, 2026Suyoung Kim, Jahyun Koo, Hyeonjin Kim +5Block-Diffusion DrafterDiffusion Language Models

  9. Information-Theoretic Analysis of Next-Token Prediction under Markovian Data

    Sep 28, 2026Masoud Kavian, Abdellatif Zaidi, Milad SefidgaranNext-Token PredictionInformation-Theoretic Limits

  10. MaskCoFT: Masked Co-Adaptive Fine-Tuning for Memory-Efficient MoE Inference

    Sep 28, 2026Junfeng Wu, Zehao Fan, Hadjer Benmeziane +3Mixture-Of-ExpertsParameter-Efficient Fine-Tuning Methods

  11. Direct Optimization of Generators for Search in Automated Theorem Proving

    Sep 22, 2026Adam Ousherovitch, Ambuj TewariTheorem ProvingCross-Entropy Losses

  12. Align, Integrate, and Fire: Efficient Token-Level Alignment for Zero-Shot SpeechLLMs

    Sep 16, 2026Abderrahmane Issam, Yusuf Can Semerci, Jan Scholtes +1Speech Language ModelsAcoustic Latent Space

  13. Learning Sign Language Recognition under Label Noise: A Study of Noise-Robust Losses for Isolated and Continuous Settings

    Sep 14, 2026Akihisa Shitara, Yoichi OchiaiSign Language TranslationLoss Function

  14. Adaptive Margin Ordinal Loss: Penalizing Center-Class Hedging in Ordinal Classification

    Sep 12, 2026Manisha KandelLoss FunctionCross-Entropy Losses

  15. Rebalancing Token Importance in Language Models with TF-IDF Weighted Cross-Entropy Loss

    Sep 10, 2026Zhijian Li, Stefan Larson, Kevin LeachLarge Language Model MemoryTerm Frequency-Inverse Document Frequency

  16. Which Tokens Should SFT Actually Learn? A Token-Trimming Perspective on Mathematical Reasoning

    Sep 9, 2026Yaning Jia, Chunhui Zhang, Wenxuan Xu +3Supervised FinetuningMathematical Reasoning Benchmarks

  17. SGD in Multiclass Logistic Regression: Sequential Learning and Scaling Laws

    Sep 7, 2026Konstantinos Christopher Tsiolis, Denny Wu, Christos Thrampoulidis +1Logistic RegressionMulticlass Classification

  18. AlphaRAD: Grounded Zero-Shot Classification in Chest Radiology via αα-Corrected Binary Cross Entropy and Factorized Latent Supervision

    Sep 1, 2026Jianzhong You, Yuan Gao, Chris McIntoshChest X-RayMedical Vision-Language Models

  19. Beyond Global Realism: Virtual Try-On Evaluation and Optimization with Dimension-wise Garment Fidelity Assessment

    Aug 30, 2026Kaidong Zhang, Yukang Ding, Xiaoyu Liu +1Virtual Try-OnGarments

  20. Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation

    Aug 10, 2026Yubo Jiang, Fengying Xie, Zhiguo Jiang +1Unsupervised On-Policy Self-DistillationDataset Distillation

  21. No Unique Minimizer, No Problem: On the Consistency of Robust Neural Classifiers

    Aug 9, 2026Subhabrata Majumdar, Anand Deo, Partha Pratim Saha +1Empirical Risk MinimizationCross-Entropy Losses

  22. Adaptive Supervised Anchoring for On-Policy Self-Distillation

    Aug 8, 2026Meilin Yang, Zixuan Ding, Jianhao Nie +5Unsupervised On-Policy Self-DistillationProcess-Level Supervision

  23. Multivariate Time Series Forecasting needs Cross Variable Loss

    Aug 6, 2026Kuiye Ding, Yifan Hu, Hanchen Wang +1Multivariate Time Series ForecastingForecasting Backbone

  24. MedJudgeRAG: Option-Wise Evidence Judgment with Dynamic Knowledge Graphs for Medical MCQA

    Jul 24, 2026Seongwon Seo, Seung Hwan Cho, Young-Min KimHievi-RagClinical Reasoning Training

  25. Context-weighted Discrete Flow Matching

    Jul 23, 2026Daniil Cherniavskii, Daniel Severo, Karen UllrichGenerative Flow NetworksGenerative Models

  26. Loss Landscape Topology Reveals Why Simple Baselines are Competitive at 3D Point Cloud Segmentation Under Class Imbalance

    Jul 23, 2026Antonis Savva, Christos Kyrkou, Theocharis TheocharidesPoint CloudsInteractive 3D Segmentation

  27. Subjective Risk Decomposition: A New View for Uncertainty Quantification

    Jul 16, 2026Raghad Alamri, Michele Caprio, Gavin BrownUncertainty QuantificationUncertainty

  28. Conservation Laws for Diffusion Models

    Jul 11, 2026Ziv Aharoni, Henry D. PfisterCross-Entropy LossesDiffusion Models

  29. Similarity search generalisation in contrastive learning with InfoNCE loss

    Jul 10, 2026Nick WhiteleyContrastive LearningText Embeddings

  30. Ensemble Diversity Optimization for Subjective Supervision

    Jul 9, 2026Xia Cui, Ziyi Huang, N. R. AbeynayakeEnsembleCross-Entropy Losses

  31. PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction

    Jul 9, 2026Wanyi Ning, Wei Zhou, Yingpeng Li +3Target Speaker ExtractionSpeaker Similarity

  32. Asymmetric Focal Loss Improves Graph Neural Network Prediction of Drug-Drug Interactions

    Jul 8, 2026Faranak Hatami, Mousa MoradiAbsorption, Distribution, Metabolism, And ExcretionDrug-Drug Interactions

  33. Enhanced Seam Segmentation for Automated Welding Robot in Construction Through Transfer Learning: Addressing Limitations of Bilateral Segmentation Network

    Jul 7, 2026Keonvin Park, Yong Ann Voeurn, Hyeokjun Kweon +1Transfer LearningConstruction

  34. Comparison of Loss Functions for Robust Deep Learning-based Echocardiography Segmentation when Learning with Partially Labelled Data from Multiple Domains

    Jul 6, 2026Iman Islam, Esther Puyol-Antón, Bram Ruijsink +2EchocardiographyLoss Function

  35. Spec-AUF: Accept-Until-Fail Training under Train-Inference Misalignment for Masked Block Drafters

    Jul 2, 2026Tianjian Yang, Meng LiDrafterSpeculative Decoding

  36. Radial Suppression Accelerates Algorithmic Generalization: A Geometric Analysis of Delayed Generalization

    Jun 30, 2026Srijan Tiwari, Aditya Chauhan, Manjot SinghCross-Entropy Losses

  37. LiteMatch: Lightweight Zero-Shot Stereo Matching via Cost Volume Stabilization

    Jun 30, 2026Md Raqib Khan, Santosh Kumar Vipparthi, Subrahmanyam MuralaStereo MatchingZero-Shot

  38. Deep Neural Networks with Ordinal Loss for Medical Applications

    Jun 24, 2026Tal Dvora, Rotem Haba, Gonen SingerCross-Entropy LossesMedical Image Classification

  39. What Does the Weight Norm Control in Grokking? Logit-Scale Mediation under Cross-Entropy

    Jun 16, 2026Truong Xuan KhanhGrokkingWeight Decay

  40. DIFF-ERO: A Conformance-Aware Loss for Deep Learning in Process Mining

    Jun 12, 2026Johannes De Smedt, Jari Peeperkorn, Artem Polyvyanyy +1Cross-Entropy LossesDeep Learning

  41. A Stationary (and Therefore Compatible) Representation is All You Need

    Jun 10, 2026Niccolò Biondi, Federico Pernici, Simone Ricci +1Representation LearningRepresentation Space

  42. Audio-Visual Exchange-Aware Token Pruning for Efficient Audio-Visual Captioning

    Jun 9, 2026Zihan Meng, Dexiang Hong, Weidong Chen +3Visual Token PruningAudio-Visual Reasoning

  43. Constrained Paraphrase Consistency for LLM Hallucination Detection

    Jun 6, 2026Shanshan Lin, Dongsheng Hong, Sibo Ju +3Large Language Model HallucinationCitation Hallucination Detection

  44. Test-Time Trajectory Optimization for Autonomous Driving

    Jun 5, 2026Yihong Xu, Eloi Zablocki, Yuan Yin +4Autonomous DrivingRobust Trajectory

  45. Deciphering Two Training Clocks in Grokking via Deep Linear Network Theory with Conditional ReLU Reduction

    Jun 4, 2026Hu Tan, Kuo Gai, Shihua ZhangDeep NetworkRectified Linear Unit

  46. Reinforcement Learning from Rich Feedback with Distributional DAgger

    Jun 3, 2026Rishabh Agrawal, Jacob Fein-Ashley, Paria RashidinejadDistributional Reinforcement LearningReinforcement Learning With Verifiable Reward

  47. Tree-Based Formalization of Multi-Agent Complementarity in Human-AI Interactions

    Jun 3, 2026Andrea FerrarioHuman-Ai CollaborationComplementarity

  48. QuBLAST: A Framework for Quantizing Large Language Models with Block-Level Compression Approach and Activation Scaling Strategy

    Jun 3, 2026Pasindu Wickramasinghe, Achyuta Muthuvelan, Rachmad Vidya Wicaksana Putra +2Large Language Model QuantizationCross-Entropy Losses

  49. ROBUST-WT: Robust Uncertainty-aware Segmentation Transform via Whitening and Training Enhancements

    Jun 2, 2026Aqsa Naseer, Maryam Bibi, Syeda Samiya Urooj +1Semi-Supervised Medical Image SegmentationWhitening

  50. RRISE: Robust Radius Inference via a Surrogate Estimator

    Jun 1, 2026Jong-Ik Park, Shreyas Chaudhari, Carlee Joe-Wong +1SmoothingMachine Learning Surrogates

  51. The Representation-Rationalizability Tradeoff in Reward Learning

    May 29, 2026Jing Dong, Yaoliang Yu, Pascal PourpartReinforcement Learning From Human FeedbackReward Functions

  52. Convergence Theory for Iterative LLM-Based Neural Architecture Search: A Parametric Cross-Entropy Framework with Closed-Form Proxy Reliability

    May 28, 2026Santosh Premi Adhikari, Radu Timofte, Dmitry IgnatovNeural Architecture SearchIterative

  53. Parallel Adaptive Multi-Objective Evolutionary Learning of Discretized Bayesian Network Classifiers for Clinical Data

    May 27, 2026Damy M. F. Ha, Thalea Schlender, Yvette M. van der Linden +2Bayesian NetworksClassifier