Efficient Inference

Momentum

9 papers in the last four weeks, against 1 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 61

All topics
CardsList
  1. ReSolve: Reusing Candidate Reasoning through Selective Generative Moderation

    Oct 1, 2026Bangji Yang, Jiajun Fan, Hongba Ma +6CandidateEfficient Inference

  2. AgentPerfBench: A Benchmarking and Evaluation Suite for Inference Performance of Agentic LLMs

    Sep 28, 2026Cheuk Hang Lau, Zeyu Cao, Kevin Wong Cheuk Yin +6Agentic BenchmarksAgentic Inference

  3. The Free Inference Dimension: Complexity Measure for Zero-Collision Navigation under Hypothesis Mixtures

    Sep 15, 2026Luiz Carlos Castro Guedes, Edward Hermann HaeuslerCollision-Free TrajectoriesProbabilistic Inference

  4. LCAP: Population-Informed Latent Chip Adaptation from Few Output Probes for Photonic Neural Networks

    Sep 15, 2026Tianyu Gao, Guantian ZhengParameter-Efficient AdaptationEfficient Inference

  5. Attention Quantization for Tabular Foundation Models

    Sep 14, 2026Jonas M. Kübler, Benjamin Jäger, Klemens Flöge +2Tabular Foundation ModelsKey-Value Cache Quantization

  6. Self-Orchestrating Language Models: Leveraging Semantic Dependence for Efficient Inference

    Sep 13, 2026Tian JinLLM Inference OptimizationAutoregressive Language Models

  7. Depth-adaptive Inference of Looped Language Models via Continuous Depth Batching

    Aug 10, 2026Kristian Schwethelm, Daniel Rueckert, Georgios KaissisEfficient Inference

  8. BnBERT-iPET: Sparse Few-Shot Language Modeling for Bengali via Lottery Ticket Pruning

    Aug 5, 2026Sajib Hossain, Md Kamrus Samad, Anan Ghosh +2Bert-Based ModelsBangla

  9. Gecko: Fast Private Inference via Secure Public Encoder Offloading

    Aug 3, 2026Cheng'an Wei, Kai Chen, Yue Zhao +2Neural Network InferenceEfficient Inference

  10. Are All Tokens Necessary for Visual Place Recognition? An Empirical Study of Token Reduction for Efficient Inference

    Jul 17, 2026Tong Jin, Yunpeng Liu, Shuyu Hu +4Visual Place RecognitionVision Transformer

  11. ROSA: A Robotics Foundation Model Serving System for Robot Factories

    Jul 1, 2026Wenqi Jiang, Jason Clemons, Rowland O'Flaherty +5Cpu-Gpu Hybrid DesignsEfficient Inference

  12. KernelSight-LM: A Kernel-Level LLM Inference Simulator

    Jun 26, 2026Xiteng Yao, Taeho Kim, Hengzhi Pei +7LLM Inference OptimizationEfficient Inference

  13. MemoryWAM: Efficient World Action Modeling with Persistent Memory

    Jun 18, 2026Sizhe Yang, Juncheng Mu, Tianming Wei +8Efficient World-Action ModelWorld Models

  14. FEnc2^2: Unifying Data Packing for Efficient Private Inference via Convolution and Architecture-Aware Fragment Encoding

    Jun 15, 2026Ran Ran, Zhaoting Gong, Nuo Xu +3Homomorphic EncryptionNeural Network Inference

  15. AVIS: Adaptive Test-Time Scaling for Vision-Language Models

    Jun 10, 2026Ahmadreza Jeddi, Minh Ngoc Le, Amirhossein Kazerouni +8Fast InferenceEfficient Inference

  16. Multi-task LLMs for Bug Classification: Efficient Inference with Auxiliary Decoding Heads

    Jun 8, 2026Nikolai RozanovBug DetectionCode Generation

  17. OctoT2I: A Self-Evolving Agentic Text-to-Image Router

    Jun 1, 2026Xu Jiang, Bin Chen, Gehui Li +3Text-To-ImageText-To-Video Generation Model

  18. EvoCut: Multi-Layer Evolution-Aware Visual Token Compression for Efficient Large Vision-Language Models

    Jun 1, 2026Hongyu Lu, Feng Zhang, Wenwei Jin +5Token CompressionVision Encoders

  19. MURMUR: An Efficient Inference System for Long-Form ASR

    May 31, 2026Wei-Tzu Lee, Keisuke Kamahori, Baris KasikciAutomatic Speech RecognitionEfficient Long-Context Inference

  20. Efficient Test-time Inference for Generative Planning Models with OCL Search

    May 30, 2026Robert Gieselmann, Mihai Samson, Federico Pecora +1Classical PlanningEfficient Inference

  21. Bridging Maximum Likelihood and Optimal Transport for Efficient Inference and Model Selection in Stochastic Block Models

    May 27, 2026Simon Queric, Cédric Vincent-Cuaz, Charles Bouveyron +1Maximum LikelihoodModel Selection

  22. Semiparametrically Efficient Inference for Kernel Measures of Noise Heterogeneity

    May 26, 2026Jakub Wornbard, Zikai Shen, Dimitri Meunier +1HeteroskedasticityMultiplicative Gamma Noise

  23. Boosting Inference with Guided Reasoning: Stochastic Exploration for Recursive Models

    May 24, 2026Andrew Corbett, Archit Sood, Anna Tzatzopoulou +2Recursive ModelsReasoning Trajectory

  24. Your Embedding Model is SMARTer Than You Think

    May 24, 2026Jianrui Zhang, Hyun Jung Lee, Sukanta Ganguly +3Multimodal RetrievalContrastive Learning

  25. Can AI Guess What You Know? Performance Comparison of Large Language Models for Human Domain Knowledge Estimation From Communication Logs

    May 21, 2026Ko Watanabe, Shoya IshimaruEfficient Inference

  26. TIDE: Efficient and Lossless MoE Diffusion LLM Inference with I/O-aware Expert Offload

    May 19, 2026Zhiben Chen, Youpeng Zhao, Yang Sui +2Efficient InferenceDiffusion Language Models

  27. PSD: Pushing the Pareto Frontier of Diffusion LLMs via Parallel Speculative Decoding

    May 15, 2026Shengyin Sun, Yiming Li, Renxi Liu +7Diffusion Language ModelsSpeculative Decoding

  28. PreFT: Prefill-only finetuning for efficient inference

    May 14, 2026Andrew Lanpouthakoun, Aryaman Arora, Zhengxuan Wu +4Parameter-Efficient Fine-Tuning MethodsPrefill

  29. Efficient LLM Reasoning via Variational Posterior Guidance with Efficiency Awareness

    May 10, 2026Zizhao Chen, Yuying Li, Siting Lin +1LLM Reasoning StrategiesEfficient Inference

  30. HCInfer: An Efficient Inference System via Error Compensation for Resource-Constrained Devices

    May 7, 2026Shen Xu, Xiangwen Zhuge, Zhe Xu +3Efficient InferenceSampling Bias Compensation

  31. Budgeted LoRA: Distillation as Structured Compute Allocation for Efficient Inference

    May 5, 2026Mohammed Sabry, Anya BelzEfficient InferenceInference Cost

  32. Exact and Approximate Algorithms for Polytree Learning

    May 5, 2026Juha Harviainen, Frank Sommer, Manuel SorgeBayesian NetworksApproximation Algorithms

  33. When Less is Enough: Efficient Inference via Collaborative Reasoning

    May 1, 2026Yilei Chen, Sharut Gupta, Yannis Paschalidis +2Efficient InferenceProbabilistic Inference

  34. DARE: Diffusion Language Model Activation Reuse for Efficient Inference

    May 1, 2026Natalia Frumkin, Bokun Wang, Hung-Yueh Chiang +3Diffusion Language ModelsEfficient Inference

  35. Understanding Scattered Forest Search: A Version-Space Perspective on Multi-Turn Program Correction

    Apr 27, 2026Yuto Tanaka, Issei SatoEfficient InferenceIterative Refinement

  36. Reasoning Primitives in Hybrid and Non-Hybrid LLMs: Do Architectural Differences Yield Advantages in State-Tracking and Recall?

    Apr 23, 2026Shivam Rawat, Lucie Flek, Florian Mai +1LLM Reasoning StrategiesSearch-Augmented Reasoning

  37. Efficient Test-Time Inference via Deterministic Exploration of Truncated Decoding Trees

    Apr 22, 2026Xueyan Li, Johannes Zenn, Ekaterina Fadeeva +3Efficient InferenceReasoning Traces

  38. DeInfer: Efficient Parallel Inferencing for Decomposed Large Language Models

    Apr 20, 2026You-Liang Huang, Xinhao Huang, Chengxi Liao +1LLM Inference OptimizationEfficient Inference

  39. SecureRouter: Encrypted Routing for Efficient Secure Inference

    Apr 16, 2026Yukuan Zhang, Mengxin Zheng, Qian LouNeural Network InferenceEfficient Inference

  40. DEEP-GAP: Deep-learning Evaluation of Execution Parallelism in GPU Architectural Performance

    Apr 16, 2026Kathiravan PalaniappanNvidiaEfficient Inference

  41. Beyond Memorization: Distinguishing Between Pattern-Based and Epistemic Reasoning in LLMs Using Epistemic Puzzles

    Mar 22, 2026Adi Gabay, Gabriel Stanovsky, Liat PeterfreundEpistemic AsymmetryEpistemology

  42. A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs

    Feb 23, 2026Zijie Liu, Jie Peng, Jinhao Duan +7Load BalancingLLM Inference Optimization

  43. Beyond Tokens: Semantic-Aware Speculative Decoding for Efficient Inference by Probing Internal States

    Feb 3, 2026Ximing Dong, Shaowei Wang, Dayi Lin +2Speculative DecodingEfficient Inference

  44. What If We Allocate Test-Time Compute Adaptively?

    Feb 1, 2026Ahsan Bilal, Ahmed Mohsin, Muhammad Umer +4Test-Time ScalingEfficient Inference

  45. DAGGER: Distractor-Aware Graph Generation for Executable Reasoning in Math Problems

    Jan 11, 2026Zabir Al Nazi, Shubhashis Roy Dipta, Sudipta KarMathematical ReasoningMath Problems

  46. Entropy-Aware Token Rejection for Improving Speculative Decoding

    Dec 29, 2025Tiancheng Su, Meicong Zhang, Guoxiu HeSpeculative DecodingToken-Level Entropy

  47. Fine-Tune, Then Rectify

    Nov 23, 2025Zikun Ye, Jinglong Zhao, Lei WangModel Fine-TuningReweighting