Efficient Language Model Inference

Latest papers 206

All topics
CardsList
  1. Judging in Latent Space: Efficient Generative Reward Modeling via Semantics-Preserving Compression

    Oct 7, 2026Mingqing Yuan, Xiaobo Liang, Junwei Yang +5Reward ModelingLLM-as-a-Judge

  2. Readout Stability in Prefill-Only Decision Models:Zero-Label Prediction and Inference-Time Compute Allocation

    Oct 6, 2026Ran Li, Lei ChenInference-Time Compute AllocationEfficient Language Model Inference

  3. SearchJev: A Fast and Calibrated System-1 Model for Search Agents

    Oct 4, 2026Congfeng Cao, Lipeng Zuo, Konstantinos Papakostas +6Soft-Label LearningProbability Calibration

  4. AURAL: Adaptive Latent Reasoning with Joint Chunk for Speech Language Models

    Oct 1, 2026Yuxiang Wang, Kunyu Feng, Yuancheng Wang +12RL for Language Model ReasoningAudio Reasoning

  5. ReSolve: Reusing Candidate Reasoning through Selective Generative Moderation

    Oct 1, 2026Bangji Yang, Jiajun Fan, Hongba Ma +6Efficient Language Model ReasoningInference-Time Compute Allocation

  6. JevSpawn: Adaptive Agentic Inference through Compositional Action Spaces

    Sep 30, 2026Haoyang Su, Weiran HuangEfficient Language Model InferenceLLM Agent Planning

  7. Recovering Off-Policy Supervision for Speculative Decoding

    Sep 30, 2026Jungseob Lee, Chanjun Park, Sugyeong Eo +1Speculative DecodingEfficient Language Model Inference

  8. HARISSA: Inference-Time Self-Checks for Efficient and Safe Local Language Model Deployment

    Sep 29, 2026Kenan Alkiek, Moontae Lee, David Jurgens +1On-Device Language Model InferenceSelective Prediction

  9. S3S^3: Spectral Null-Space Swap Makes Reasoning Models Efficient

    Sep 29, 2026Hongbo Ma, Sansheng Cao, Jiajun Fan +2Efficient Language Model ReasoningModel Merging

  10. Can a Cacheable Decision Model Follow Rules?

    Sep 29, 2026Dushyant Rajput, Nirdesh Chauhan, Siddharth KosarajuLLM Inference AccelerationLLM Decision-Making

  11. MetaCtrl: Your Large Language Models Can Reason Better and More Concisely with a Metacognitive Controller

    Sep 29, 2026Zhibin Wen, Tao Han, Lei Bai +2RL for Language Model ReasoningEfficient Language Model Reasoning

  12. Chinese-Jev: Bringing System One Model to Chinese-Language Tasks

    Sep 29, 2026Zexiao Wang, Zihao Zhang, Xudong Wang +5LLM Decision-MakingEfficient Language Model Inference

  13. IronLLM: Forging Compact Edge-Native Language Models for Real-Time Embodied Intelligence

    Sep 29, 2026Changdi Yang, Fengquan Jiao, Haochih Lin +14Multi-Token PredictionOn-Device Language Model Inference

  14. Draft in Parallel, Condition Through Depth: Adjacent Causal Injection for Speculative Decoding

    Sep 28, 2026Haohui Zhang, Keyu Chen, Haocheng Sun +4Speculative DecodingLLM Inference Acceleration

  15. Telescopic Language Models

    Sep 28, 2026Zhilin Guo, Boqiao Zhang, Hakan Aktas +14Language ModelingEfficient Language Model Inference

  16. TokenCast: Forecasting Token Consumption During LLM Agent Execution

    Sep 28, 2026Chaoqian Ouyang, Ling Yue, Libin Zheng +7Cost-Aware InferenceEfficient Language Model Inference

  17. QuantaSpike: Short-Window Spike-Driven Quantization for Large Language Models

    Sep 28, 2026Bang Hu, Guowei Zhu, Changze Lv +4LLM QuantizationSpiking Neural Networks

  18. On the Token Value Inequality in Efficient Reasoning

    Sep 27, 2026Runjia Zeng, Hang Hua, Yiyang Liu +5RL for Language Model ReasoningEfficient Language Model Reasoning

  19. GSM: Efficient Language Modeling with Shared Global State

    Sep 27, 2026Yunao Zheng, Bin Wen, Xiaojie Wang +12Long-Context Language Model InferenceLong-Context Language Modeling

  20. Same Scores, Different Decisions: Evaluating JEV and Language Models for Legal Document Understanding

    Sep 23, 2026Fan Zhang, Yankai Chen, Zhuohan Xie +11LLM EvaluationEfficient Language Model Inference