Efficient Language Model Inference

Latest papers 206

All topics
CardsList
  1. Attention Routing Stabilizes Early: Working-Set Inference for Recurrent Language Models

    Sep 23, 2026Ke Wan, Chen ChenLong-Context Language Model InferenceRecurrent Transformers

  2. Universal Fractal Natural Language Decision Map: Real-Time Edge Triage Across Heterogeneous Domains

    Sep 21, 2026Volkan Dağlı, Zerrin Dağlı, Dağhan DağlıOn-Device Language Model InferenceEfficient Language Model Inference

  3. When2Think: Learning When and How Much to Reason

    Sep 17, 2026Jaejun Shim, HyunJin Kim, Young Jin Kim +1Overthinking in Language ModelsRL for Language Model Reasoning

  4. Dynamic Semantic Compression for Efficient Latent-Space Inference in Large Language Models

    Sep 14, 2026Peipei Li, Dongsen Zhang, Yuchen Liu +1LLM CompressionLLM Inference

  5. Stable Answers, Unfinished Reasoning: Why Self-Consensus Is Not a Safe Early-Exit Signal

    Sep 9, 2026Yunxiang Mo, Donghao Zhao, Hejia GengEarly StoppingLLM Reliability

  6. TEFM: Token-Efficient Faithful Modeling for Structured Data

    Sep 9, 2026Zhichao Hou, Lingdao Sha, Xueyu Mao +3LLM InterpretabilityTabular Classification

  7. A*-Thought-V2: Efficient Latent Reasoning via Geometric Dynamics of LLM

    Sep 7, 2026Xiaoang Xu, Siyuan Liu, Shuo Wang +13Efficient Language Model ReasoningContinuous Latent Reasoning

  8. </think> Doesn't Stop Reasoning: Analysis of Spurious CoT Termination

    Sep 3, 2026Seunghee Koh, Sungjae Choi, Minchan Kwon +2CoT ReasoningEfficient Language Model Reasoning

  9. LeanStream: A Speculate-and-Refine Streaming Framework for Efficient on-Device LLM Inference

    Sep 2, 2026Renyuan Liu, Yuyang Leng, Kaiyan Liu +7LLM Inference EfficiencyOn-Device Language Model Inference

  10. Language Models Can Control Their Own Attention

    Sep 2, 2026Namgyu Ho, Huzama Ahmad, Woosung Koh +3Efficient Language Model InferenceLong-Context Language Modeling

  11. How Do Prompt Variations Affect Energy Consumption in On-Device LLMs?

    Sep 1, 2026Wei Hu, Xiaolong Tu, Dawei Chen +3LLM Inference EfficiencyOn-Device Language Model Inference

  12. HEAT: Faster Fully Homomorphic Inference via Approximations-Weights Co-Adaptation

    Sep 1, 2026Alessandro Zirilli, Davide Marincione, Evgenios M. Kornaropoulos +2Privacy-Preserving Language ModelsHomomorphic Encryption

  13. HSRM: Hidden-State Reward Models for Test-Time Verification

    Aug 31, 2026Xianzhi Li, Xiaodan ZhuLLM Answer VerificationEfficient Language Model Reasoning

  14. EVAR: Evidence-Validated Hypothesis Admission for Budget-Aware Narrative Reasoning

    Aug 30, 2026Peilin Liu, Zhiquan Ji, Jinglong PingEvidence-Grounded ReasoningLLM Reliability

  15. Ask Self, Ask Others: Relation Is All You Need

    Aug 20, 2026Yuting Ge, Pengju Yang, Mingkai NieSelf-AttentionDecoder-Only Language Models

  16. From Answers to Policies: Efficient In-Context Learning System through Emulating Expert Investigation

    Aug 17, 2026Minh-Ha Nguyen, Ngoc-Ngo Quang Tran, Thuy Dung Nguyen +1In-Context LearningIn-Context RL

  17. Towards Efficient Reasoning in LLM-Based Recommender Systems via Model Merging

    Aug 11, 2026Linh Dieu Le, Tong Chen, Shazia Sadiq +3LLM CompressionLarge Language Model-Based Recommendation

  18. Can We Optimize the Performance-Carbon Emission Break-Even Point?: The Quest for Greener LLMs

    Aug 9, 2026Sourav Das, Tanmay Joshi, Kripabandhu GhoshFine-TuningLLM Fine-Tuning

  19. Think Deep, Speak Once: Relit, A Recursive Latent Implicit Transformer Framework

    Aug 8, 2026Abhishek Panwar, Maheep Singh, Saksham BansalContinuous Latent ReasoningEfficient Language Model Inference

  20. Thought-Level Beam Search for Reasoning

    Aug 8, 2026Lijie Yang, Hongyin Luo, Jiawei Zhao +2Inference-Time SearchEfficient Language Model Reasoning

  21. Distilling Reasoning Traces into Advisory Prompts for Software Engineering Tasks

    Aug 1, 2026Faizan Faisal, Prem Devanbu, Toufique AhmedReasoning DistillationLLM Prompting

  22. Translation with Thought: Difficulty-Adaptive Reasoning via Reinforcement Learning for Multi-Domain Machine Translation

    Jul 31, 2026Yongshi Ye, Biao Fu, Chongxuan Huang +2RL for Language Model ReasoningEfficient Language Model Inference