Efficient Language Model Inference

Latest papers 206

All topics
CardsList
  1. BLADE: Boundary-Expanded and Layer-Adaptive Dynamic Exit for Efficient LLM Reasoning

    Jul 31, 2026Keshu Fu, Keqin Peng, Jun Bai +6Efficient Language Model ReasoningEfficient Language Model Inference

  2. DIRECT: Direct Decoding for Efficient and Aligned Sequence Labeling with Large Language Models

    Jul 29, 2026Yilei Wang, Jiaxin Gan, Kexuan Zhang +3LLM AlignmentLLM Information Extraction

  3. Test-Time Scaling via Error Localization

    Jul 23, 2026Rajiv Shailesh Chitale, Rahul Madhavan, Taneesh Gupta +2Test-Time ScalingEfficient Language Model Inference

  4. Efficient Chain-of-Modality Reasoning via Progressive Compression for Spoken Language Models

    Jul 22, 2026Pengchao Feng, Chao-Hong Tan, Qian Chen +3Efficient Language Model ReasoningSpeech Language Models

  5. LatentMT: Machine Translation with Latent Reasoning

    Jul 21, 2026Wei-Rui Chen, Samar M. Magdy, Chiyu Zhang +3Low-Resource MTEfficient Language Model Inference

  6. AoA: Theorem Proving Agent over Abstract Syntax Tree of Redesigned Language

    Jul 17, 2026Qiyuan Xu, Joshua Ong Jun Leang, Renxi Wang +4Automated Theorem ProvingInteractive Theorem Proving

  7. OS-Pruner: Pruning Chains-of-Thought of Reasoning Models via Optimal Stopping

    Jul 13, 2026Mohammed Ehab, Aymane El Gadarri, Vivek F. Farias +2Overthinking in Language ModelsSequential Decision Making

  8. CHASE: Cache-Hole-Adapted Skip Exit for Looped State-Space Language Models

    Jul 11, 2026Zhenxuan Yu, Takeshi Kojima, Yutaka Matsuo +1Efficient Language Model InferenceLLM Reasoning

  9. A Sovereign, Open-Source Foundation Model for German and English

    Jul 10, 2026The Soofi-Team, :, Benedikt Droste +29Language Model PretrainingMultilingual Language Models

  10. SQuaD-SQL: Efficient Text-to-SQL with Small Language Models via LLM-Guided Knowledge Distillation

    Jul 9, 2026Wangyu Wu, Xiaojian Lin, Rong Fu +4Small Language ModelsText-to-SQL

  11. Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding

    Jul 7, 2026Yonggan Fu, Lexington Whalen, Abhinav Garg +23Autoregressive DiffusionAutoregressive Language Modeling

  12. Don't Wait to Reply: Towards Responsive yet Thoughtful Dialogue through Proactive Thinking

    Jul 3, 2026Ante Wang, Jiaqi Fu, Xuanyi Chen +4Efficient Language Model InferenceText Generation

  13. Program-as-Weights: A Programming Paradigm for Fuzzy Functions

    Jul 2, 2026Wentao Zhang, Liliana Hotsko, Woojeong Kim +3LLM-Based Program SynthesisEfficient Language Model Inference

  14. CAT: Confidence-Adaptive Thinking for Efficient Reasoning of Large Reasoning Models

    Jul 1, 2026Qizhi Jiang, Shuo Wang, Pei Ke +2Overthinking in Language ModelsEfficient Language Model Inference

  15. Bridging the Gap Between Latent and Explicit Reasoning with Looped Transformers

    Jun 30, 2026Ying Fan, Anej Svete, Kangwook LeeCoT ReasoningRecurrent Transformers

  16. FlexiSLM: A Spoken Language Model with Dynamic and Controllable Frame Rates

    Jun 30, 2026Jiaqi Li, Chaoren Wang, Xiaohai Tian +9Speech ProcessingSpeech Language Models

  17. When Does Learning to Stop Help? A Cost-Aware Study of Early Exits in Reasoning Models

    Jun 29, 2026Zhe Dong, Fang Qin, Manish ShahEarly StoppingCost-Aware Inference

  18. Why Struggle with Continuous Latents? Interpretable Discrete Latent Reasoning via Rendered Compression

    Jun 29, 2026Shuochen Chang, Qingyang Liu, Shaobo Wang +8LLM InterpretabilityEfficient Language Model Reasoning

  19. EpiKV: Epiphany-Aware KV Cache Eviction Without the Attention Matrix

    Jun 25, 2026Steven Kolawole, Virginia SmithKV CachingKV-Cache Eviction

  20. Efficient and Trainable Language Model Test-Time Scaling via Local Branch Routing

    Jun 24, 2026Yutong Yin, Mingyu Jin, Jin Pan +12RL for Language Model ReasoningTest-Time Scaling

  21. Posterior Refinement: Fast Language Generation via Any-Order Flow Maps

    Jun 23, 2026Manan Agarwal, Sheel Shah, Chanhyuk Lee +6Non-Autoregressive Text GenerationGenerative Flow Networks