Efficient Language Model Inference

Latest papers 206

All topics
CardsList
  1. CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression

    Jun 23, 2026Morayo Danielle Adeyemi, Ryan A. Rossi, Franck DernoncourtLLM EvaluationLLM Compression

  2. Self-Compacting Language Model Agents

    Jun 22, 2026Tianjian Li, Jingyu Zhang, William Jurayj +5Efficient Language Model InferenceMetacognition in Language Models

  3. DART: Draft-Agreement Routing for Training-Free Adaptive Thinking Budgets in Hybrid Reasoning Models

    Jun 22, 2026Jungseob Lee, Seongtae Hong, Seungjun Lee +7LLM RoutingEfficient Language Model Inference

  4. EnerInfer: Energy-Aware On-Device LLM Inference

    Jun 22, 2026Bohua Zou, Nian Liu, Binqi Sun +6On-Device Language Model InferenceLLM Inference Acceleration

  5. When Compression Helps and When It Hurts: Condition-Aware Analysis of Chain-of-Thought Distillation

    Jun 19, 2026Siyang Lyu, Xinghao Chen, Zhijing Sun +3Model CompressionCoT Distillation

  6. ADaPT: Token-Level Decoupling for Efficient Large Reasoning Models

    Jun 18, 2026Tingyun Li, Zishang Jiang, Jinyi Han +8Inference-Time OptimizationRL for Language Model Reasoning

  7. Large Language Models Do Not Always Need Readable Language

    Jun 18, 2026Jiayi Zhu, Haoxuan Peng, Junxi Wang +3Efficient Language Model Inference

  8. Diffusion Language Models: An Experimental Analysis

    Jun 17, 2026Thomas Bertolani, Davide Bucciarelli, Leonardo Zini +2Diffusion Language Model InferenceDiffusion Language Model Decoding

  9. Stop When Further Reasoning Won't Help: Attention-State Adaptive Generation in Reasoning Models

    Jun 13, 2026Jiakai Li, Ke Qin, Rongzheng Wang +4Efficient Language Model InferenceLLM Reasoning

  10. Beyond the Commitment Boundary: Probing Epiphenomenal Chain-of-Thought in Large Reasoning Models

    Jun 11, 2026Daniel Scalena, Sara Candussio, Luca Bortolussi +3CoT FaithfulnessLLM Interpretability

  11. Adaptive Multi-Resolution Procedural Knowledge Compression for Large Language Models

    Jun 10, 2026Changyue Wang, Weihang Su, Qingyao Ai +5LLM CompressionEfficient Language Model Inference

  12. Express Language Modeling

    Jun 9, 2026Albert Gong, Annabelle Michael Carrell, Raaz Dwivedi +1Long-Context Language Model InferenceAttention Mechanisms

  13. Q-Delta: Beyond Key-Value Associative State Evolution

    Jun 7, 2026Sumin Park, Seojin Kim, Noseong ParkLinear AttentionDelta-Rule Linear Attention

  14. How Small Can You Go? LoRA Fine-Tuning 270M-8B Models for Merchant Information Extraction in Financial Transactions

    Jun 6, 2026Donghao Huang, Tomas Drietomsky, Benjamin Barrett +1Financial ServicesMemory-Efficient Fine-Tuning

  15. Sparsely gated tiny linear experts

    Jun 5, 2026Simon SchugTransformer FFNsMixture-of-Experts Language Models

  16. DyCon: Dynamic Reasoning Control via Evolving Difficulty Modeling

    Jun 5, 2026Tengyao Tu, Yulin Li, Hui-Ling Zhen +6Overthinking in Language ModelsEfficient Language Model Reasoning

  17. Latent Reasoning with Normalizing Flows

    Jun 4, 2026Guancheng Tu, Xiangjun Fu, Suhao Yu +5Normalizing FlowsContinuous Latent Reasoning

  18. Domain-Adapted Small Language Models with Hybrid Post-Processing: Achieving Cost-Efficient, Low-Latency Multi-Label Structured Prediction via LoRA Fine-Tuning on Scarce Data

    Jun 4, 2026Srinivasan Manoharan, Dilipkumar Nallusamy, Sachin Kumar +1Multi-Label ClassificationSmall Language Models

  19. Imbuing Large Language Models with Bidirectional Logic for Robust Chain Repair

    Jun 3, 2026Zehua Cheng, Wei Dai, Jiahao Sun +1LLM Self-CorrectionSymbolic Reasoning

  20. SharedRequest: Privacy-Preserving Model-Agnostic Inference for Large Language Models

    Jun 3, 2026Peihua Mai, Xuanrong Gao, Youlong Ding +3Privacy-Preserving Language ModelsLLM Inference

  21. SMADE-IE: Sparse Multi-Agent Framework with Evidence-Driven Debate for Zero-Shot Information Extraction

    Jun 3, 2026Kenfeng Huang, Yi Cai, Xin Wu +2Multi-Agent LLM SystemsMulti-Agent Debate

  22. LazyAttention: Efficient Retrieval-Augmented Generation with Deferred Positional Encoding

    Jun 3, 2026Haocheng Xia, Mihir Pamnani, Hanxi Fang +2Retrieval-Augmented GenerationKV Caching

  23. Agentic Chain-of-Thought Steering for Efficient and Controllable LLM Reasoning

    Jun 2, 2026Yu Xia, Zhouhang Xie, Xin Xu +4Language Model SteeringCoT Reasoning

  24. HybridThinker: Efficient Chain-of-Thought Reasoning via Compressed Memory and Transient Thought Steps

    Jun 2, 2026Xin Liu, Runsong Zhao, Xinyu Liu +8Memory-Augmented Language ModelsEfficient Language Model Reasoning

  25. ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning

    Jun 2, 2026Ziyan Liu, Xueda Shen, Yuzhe Gu +7Efficient Language Model ReasoningPreference Optimization

  26. Adaptive Latent Agentic Reasoning

    Jun 1, 2026Dongwon Jung, Peng Shi, Yi Zhang +2Agentic ReasoningLLM Agents