Efficient Language Model Inference

Latest papers 206

All topics
CardsList
  1. Geometric Latent Reasoning Induces Shorter Generations in LLMs

    Jun 1, 2026Shashi Kumar, Yacouba Kaloga, Petr Motlicek +2Efficient Language Model ReasoningContinuous Latent Reasoning

  2. PortBERT: Navigating the Depths of Portuguese Language Models

    Jun 1, 2026Raphael Scheible-Schmitt, Henry He, Armando B. MendesLanguage Model PretrainingEfficient Language Model Training

  3. Unveiling the Entropy Dynamics of Chain-of-Thought Reasoning

    Jun 1, 2026Ting Xu, Xu He, Yupu Lu +4CoT ReasoningTest-Time Scaling

  4. ProbeScale: Probing Analysis to Optimize Neural Scaling Laws for Efficient Small Language Model Inference

    Jun 1, 2026Sourav DasSmall Language ModelsEfficient Language Model Inference

  5. Semantic Triplet Restoration: A Novel Protocol for Hierarchical Table Understanding in Large Language Models

    May 29, 2026Yibin Zhao, Fangxin Shang, Dingrui Yang +1Table QATable Structure Recognition

  6. Trading Complexity for Expressivity Through Structured Generalized Linear Token Mixing

    May 29, 2026Erwan Fagnou, Paul Caillon, Blaise Delattre +1Transformer ExpressivityAutoregressive Language Modeling

  7. SLAT: Segment-Level Adaptive Trimming for Efficient CoT Reasoning

    May 29, 2026Jian Yao, Xiongcai Luo, Ran Cheng +1RL for Language Model ReasoningEfficient Language Model Inference

  8. Teaching Language Models to Check Grounded Claim Factuality with Human Test-Taking Strategies

    May 28, 2026Yuxuan Ye, Raul Santos-Rodriguez, Edwin SimpsonLLM GroundingClaim Verification

  9. DynaGraph: Lightweight Multi-Model Interaction Framework via Dynamic Topological Reconfiguration

    May 28, 2026Yanxing Guo, Zihao Zheng, Fangzhou Wu +4Multi-Agent LLM SystemsLLM Routing

  10. Rubric-Guided Process Reward for Stepwise Model Routing

    May 28, 2026Shenghao Ye, Yu Guo, Zhengheng Li +2Process Reward ModelsRL for Language Model Reasoning

  11. Robust and Efficient Guardrails with Latent Reasoning

    May 27, 2026Siddharth Sai, Xiaofei Wen, Muhao ChenLLM GuardrailsContent Moderation

  12. HRBench: Benchmarking and Understanding Thinking-Mode Switch Strategies in Hybrid-Reasoning LLMs

    May 27, 2026Yansong Ning, Mianpeng Liu, Jingwen Ye +2LLM EvaluationAdaptive Inference

  13. CIRF: Tokenizing Chain-of-Thoughts into Reusable Functional Units for Efficient Latent Reasoning in Large Language Models

    May 27, 2026Yukyung Lee, Yumeng Shen, Jinhyeong Park +2CoT ReasoningEfficient Language Model Reasoning

  14. PrunePath: Towards Highly Structured Sparse Language Models

    May 27, 2026Zhexuan Gu, Zixun Fu, Yancheng YuanMixture-of-Experts PruningLLM Pruning

  15. Self-Consistency via Marginal Sharpening

    May 27, 2026Aleksei Arzhantsev, Otmane Sakhi, Nicolas ChopinEfficient Language Model ReasoningReasoning Consistency in Language Models

  16. The Shape of Overthinking: Backtracking Bursts in Long Reasoning Traces

    May 27, 2026Navid Rezazadeh, Arash Gholami DavoodiReasoning EvaluationEfficient Language Model Inference

  17. Decision-Making with Lightweight Confidence-Aware Language Model for Autonomous Driving

    May 25, 2026Ruoyu Yao, Ruiguo Zhong, Pei Liu +3Confidence Estimation in Language ModelsLanguage Model Distillation

  18. RAGe: A Retrieval-Augmented Generation Evaluation Framework

    May 23, 2026Larissa Guder, João Pedro de Moura, Arthur Accorsi +5Retrieval-Augmented GenerationRAG Evaluation

  19. OnePred: Next-Query Prediction via Recursive Intent Memory in Multi-Turn Conversations

    May 22, 2026Jiangwang Chen, Bowen Zhang, Zixin Song +4Long-Term Conversational MemoryEfficient Language Model Inference

  20. PathCal: State-Aware Reflection-Marker Calibration for Efficient Reasoning

    May 21, 2026Lingyu Jiang, Zirui Li, Shuo Xing +6Efficient Language Model ReasoningEfficient Language Model Inference

  21. Single-Pass, Depth-Selective Reading for Multi-Aspect Sentiment Analysis

    May 20, 2026Yan Xia, Zhuangzhuang Pan, Amirrudin Kamsin +1Aspect-Based Sentiment AnalysisEfficient Language Model Inference

  22. Distributional Alignment as a Criterion for Designing Task Vectors in In-Context Learning

    May 20, 2026Jihoon Kwon, Jiwon Choi, Jy-yong SohnTask VectorsDistribution Matching

  23. When Do LLMs Reason? A Dynamical Systems View via Entropy Phase Transitions

    May 20, 2026Wei Xia, Haoqing Wang, Zhi-Hong Deng +1Language Model DecodingCoT Reasoning

  24. CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic Reasoning

    May 19, 2026Dachuan Shi, Hanlin Zhu, Xiangchi Yuan +4Agentic ReasoningEfficient Language Model Inference

  25. Flash PD-SSM: Memory-Optimized Structured Sparse State-Space Models

    May 18, 2026Aleksandar Terzić, Francesco Carzaniga, Nicolas Menet +4Efficient Language Model InferenceSequence Modeling

  26. SNLP: Layer-Parallel Inference via Structured Newton Corrections

    May 18, 2026Ligong Han, Kai Xu, Hao Wang +1Transformer InferenceParallel Decoding

  27. Stop When Reasoning Converges: Semantic-Preserving Early Exit for Reasoning Models

    May 17, 2026Dehai Min, Giovanni Vaccarino, Huiyi Chen +3Early StoppingCoT Reasoning