Language Model Perplexity

Latest papers 30

All topics
CardsList
  1. Stochastic Rounding in Low-Precision Transformer Inference: A Variable-Precision Emulation Study of a Small GPT-2

    Oct 1, 2026Yohan Chatelain, Pablo de Oliveira CastroFull-Precision PerformanceLanguage Model Perplexity

  2. Lasting Effects of Abstract Pretraining Beyond Perplexity

    Sep 30, 2026Zachary Shinnick, Hemanth Saratchandran, Damien Teney +1Large Language Model PretrainingPretraining

  3. JARQ: Joint Alternating Refinement for Quantization

    Sep 29, 2026Xinyu Wang, Sicheng Lyu, Xiao-Wen ChangPost-Training QuantizationLanguage Model Perplexity

  4. GroupMask: Layer-Adaptive Group-wise Sparsity for Semi-Structured LLM Pruning

    Sep 27, 2026Zhengao Li, Shuoqiu Li, Xiaofang Zhang +7Unstructured PruningLarge Language Model Compression

  5. Temporal Taxation Compounds Under Post-Training Compression of Whisper Models

    Sep 23, 2026Srishti Ginjala, Eric Fosler-Lussier, Christopher W. Myers +1Whisper-Large-V3Character Error Rate

  6. Per-Matrix Optimality Is Not Enough: Three-Level Optimization for Low-Rank LLM Compression

    Sep 14, 2026Huicheng Zhang, Xiyao Feng, Ze-Tong Li +6Large Language Model CompressionSingular Value Decomposition

  7. Psychosis involves a deficit of information compression in connected speech

    Sep 14, 2026Samuele Vallisa, Claudio Palominos, Rui He +6LinguisticsSurprisal

  8. Parallelism Strategy Chaining for Fast Training Convergence

    Sep 7, 2026Minchul Kang, Changyong Shin, Younghun Go +4Large Language Model TrainingLanguage Model Perplexity

  9. Beyond the Capability Boundary: Zeroth-Order Optimization for Self-Evolving LLM Agents

    Aug 10, 2026Bingzhen Liu, Xiaomeng Fan, Yuwei Wu +4Self-EvolutionLarge Language Model Agents

  10. CurveFP: Co-Designing Numerical Representation and Product Arithmetic for Language Models

    Aug 8, 2026Ye QiaoFull-Precision PerformanceTask Arithmetic

  11. Evaluating Federated Pre-Training: On the Reliability of Downstream Fine-Tuning and Intrinsic Evaluation

    Jul 20, 2026Claudia Grosser, Maike Heuer, Denis Krompass +1PretrainingHeterogeneous Federated Learning

  12. Revisiting the Relation Between Language Model Perplexity and ASR Word Error Rate for Modern End-to-End Speech Recognition

    Jul 6, 2026Mohammad Zeineldeen, Albert Zeyer, Haoran Zhang +3Automatic Speech RecognitionLanguage Model Perplexity

  13. Low Perplexity is Repetition: A One-Dimensional Self-Conditioning Attractor in Continuous Diffusion LMs

    Jul 1, 2026Shuai Zhang, Zijie Chen, Hongliang He +2Diffusion Language ModelsLanguage Model Perplexity

  14. When transformers learn "impossible" languages, what do they learn?

    Jun 29, 2026Ram Janarthan, Coleman Haley, Sharon GoldwaterLanguage ModelingLarge Language Models Fail

  15. Displacement Is Not Direction: Evaluating Fidelity Metrics for Quantized LLM Deployment

    Jun 17, 2026Miloš Nikolić, Ali Hadi Zadeh, Enrique Torres Sanchez +1Large Language Model QuantizationKullback-Leibler Divergence

  16. Beyond Perplexity: A Geometric and Spectral Study of Low-Rank Pre-Training

    May 13, 2026Namrata Shivagunde, Vijeta Deshpande, Sherin Muckatira +1Low-Rank StructureLanguage Model Perplexity

  17. Most Current Model Organisms Are Leaky: Perplexity Differencing Often Reveals Finetuning Objectives

    May 1, 2026Mohammed Abu Baker, Luca Baroni, Dan WilhelmLarge Language Model SafetyModel Fine-Tuning

  18. Rethinking Layer Redundancy: Calibration Matters More Than Search in LLM Depth Pruning

    Apr 27, 2026Minkyu Kim, Vincent-Daniel Yun, Youngrae Kim +3Language Model PerplexityLayer-Wise

  19. Neural Continuous-Time Markov Chain: Discrete Diffusion via Decoupled Jump Timing and Direction

    Apr 17, 2026Jingyuan Li, Xiaoyi Jiang, Fukang Wen +5Diffusion ModelsLanguage Model Perplexity