Fast Inference

Momentum

8 papers in the last four weeks, up 60% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 101

All topics
CardsList
  1. Dual-Stream Simultaneous Translation via 2D Grid Attention

    Sep 28, 2026Yu Pu, Wei-Qiang ZhangBidirectionalFast Inference

  2. RAVEL: Asynchronous Rolling Inference for Flow-Based Vision-Language-Action Models

    Sep 28, 2026Yuhan Chen, Ke Yu, Pengfei Liu +3Flow-Matching Vision-Language-ActionInference Latency

  3. ReSync: Re-Aligning the Two Clocks of Asynchronous World-Action Models

    Sep 27, 2026Xi Lin, Feihong Zhang, Yulong Shi +6Recent World-Action ModelsWorld Models

  4. FoldQuantVLA: Native Low-Bit Quantization of Vision-Language-Action Models via Consistent Folding

    Sep 21, 2026Hung T. Ho, Khanh D. Nguyen, Quang D. Nguyen +5Post-Training QuantizationFast Inference

  5. FASA: Feedback-Aware Sampling Adaptation for Efficient Diffusion-Based VLA Models

    Sep 16, 2026Yuchen Han, Jianhan Wu, Xiaoyang Qu +3Diffusion-Based Vision-Language-ActionsAdaptive Sampling

  6. rMuscle: Robotic Muscle Memory for Efficient Vision-Language-Action Model Inference

    Sep 16, 2026Kaijun Zhou, Zhiyang Li, Le Chen +1Embodied Artificial IntelligenceFast Inference

  7. Temporal Self-Distillation: Faster Inference in Discrete Diffusion Language Models

    Sep 14, 2026Shijian Xu, Andrea Miele, Metod Jazbec +3Diffusion Language ModelsFast Inference

  8. OCR-MetaReasoning Benchmark: Evaluating the Meta-Reasoning Ability of MLLMs in Text-Rich Image Understanding

    Aug 31, 2026Gengxu Li, Yuan Wu, Yi ChangMultimodal Large Language ModelsReasoning Skills

  9. APEX: Adaptive Expert Prefetching for Memory-Efficient Edge MoE Inference

    Aug 12, 2026Alish Kanani, Layan Badawi, Umit Y. OgrasMixture-Of-Expert InferenceMixture-Of-Experts

  10. How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems

    Aug 8, 2026Henri Vanhuynegem, Weitao Xu, Yiran Shen +1Recent Vision-Language ModelsQwen3

  11. Robust and Efficient Motion Reasoning for Privacy-Aware Classroom Incident Recognition

    Aug 5, 2026Paritosh Parmar, Landy Lan, Hong Yang +2Open-Vocabulary Action RecognitionFast Inference

  12. CascadeLUT: Information-Ordered Streaming Inference for Bandwidth-Constrained FPGAs

    Aug 1, 2026Oliver Cassidy, Marta Andronic, George A. ConstantinidesField-Programmable Gate ArraysFast Inference

  13. Towards Autonomous Aircraft Surveillance from Nanosatellites through On-Board Inference and Generative Data Augmentation

    Jul 30, 2026Antonio Delgado-Rosa, David Muñoz-Valero, Enrique Adrian Villarrubia-Martin +1Multiple Satellite SystemsUnmanned Aerial Vehicle Detection

  14. Driving up Inference Energy on SNNs: Per-Sample and Universal Sponge Attacks

    Jul 30, 2026Spyridon Raptis, Haralampos-G. StratigopoulosSpiking Neural NetworksTime-To-First-Spike

  15. Ripple: Real-Time Streaming Audio-Video Generation With Cross-Modal Recurrent Memory

    Jul 29, 2026Yanbo Ding, Zhizhi Guo, Quanyue Song +4Audio-Video GenerationReal-Time Systems

  16. WHTMix: Efficient Stereo Depth Estimation via Walsh-Hadamard Token Mixing

    Jul 28, 2026Prathyush Sajith, Emadeldeen Hamdan, Ahmet Enis CetinStereo MatchingStereo

  17. A Motion-Aware Vector Quantization Framework with Centroid Reuse for Efficient VLA Inference

    Jul 27, 2026Zhuoran Song, Haozhe Jiang, Chunyu Qi +4Fast InferenceResidual Vector Quantization

  18. LoRA for Gender-Inclusive Rewriting and Activation Steering for Counter-Narrative Generation

    Jul 25, 2026Akhil Rajeev P, Manoj Balaji JLinear Activation SteeringGender

  19. Sparse by Command: Task-Conditional Compute Skipping for Multi-Task Inference Accelerators

    Jul 24, 2026Afzal Ahmad, Gaoyu Mao, Shoubo Hu +4Fast InferenceSparsity

  20. How Fast Can Reward Models Score? A Systems Study of C++ and PyTorch Inference Runtimes for RLHF

    Jul 22, 2026Venkata Naga Sai Vishnu Rohit Pulipaka, Anish Katta, Deva Rohit Reddy PeddireddyDestination-Only ScoringFast Inference

  21. Wavefront Parallelization for Efficient Learned Image Compression

    Jul 21, 2026Shimon Murai, Fangzheng Lin, Kasidis Arunruangsirilert +1Learned Image CompressionAutoregressive Image Generation

  22. FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications

    Jul 20, 2026Krish Agarwal, Zhuoming Chen, Yanyuan Qin +3FlashMultimodal Agents

  23. NIFA: Nonlinear IMC enhanced FPGA for efficient ML inference

    Jul 16, 2026Jiajun Hu, Ruthwik Reddy Sunketa, Lei Zhao +3In-Memory ComputingField-Programmable Gate Arrays

  24. Jetson-PI: Towards Onboard Real-Time Robot Control via Foresight-Aligned Asynchronous Inference

    Jul 14, 2026Zebin Yang, Qi Wang, Yunhe Wang +6Fast InferenceNvidia Jetson Orin Nano

  25. MobileSAM2: Lightweight Segment Anything for Spatial Intelligence

    Jul 14, 2026Kai Jiang, Jiaxing Huang, Jingyi Zhang +5Knowledge DistillationMobilenetv2

  26. Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots

    Jul 2, 2026Ling Xu, Chuyu Han, Borui Li +6Embodied Artificial IntelligenceFast Inference

  27. HARD-KV: Head-Adaptive Regularization for Decoding-time KV Compression

    Jun 27, 2026Yuxuan Yang, Feiyang Ren, Bowen Zeng +4Key-Value Cache CompressionLLM Inference Optimization

  28. SpikeVLA: Vision-Language-Action Models with Spiking Neural Networks

    Jun 26, 2026Ruiqi Song, Dujun Nie, Siyu Teng +7Diffusion-Based Vision-Language-ActionsFast Inference

  29. Dual Distribution Estimation for Zero-shot Noisy Test-Time Adaptation with VLMs

    Jun 24, 2026Wenjie Zhu, Yabin Zhang, Liang Xu +3Out-Of-Distribution DetectionVision-Language Model Adaptation

  30. Start Right, Arrive Right: Asynchronous Execution via Initial Noise Selection

    Jun 18, 2026Trong-Bao Ho, Quang-Tan Nguyen, Thien-Loc Ha +7Action ChunksRobot Policies

  31. Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance

    Jun 17, 2026Kangsheng Duan, Ziyang Xu, Wenyu Liu +3InpaintingFast Inference

  32. STREAM: Multi-Tier LLM Inference Middleware with Dual-Channel HPC Token Streaming

    Jun 11, 2026Anas Nassar, Steve Mohr, Leonard Apanasevich +1LLM Inference OptimizationFast Inference

  33. Real-Time Execution with Autoregressive Policies

    Jun 11, 2026Sangkyu Lee, Seohyeon Park, Tackgeun You +4Fast InferenceReal-Time Systems

  34. ViT-FREE: Efficient Face Recognition via Early Exiting and Synthetic Adaptation

    Jun 10, 2026Tahar Chettaoui, Guray Ozgur, Eduarda Caldeira +2Face Recognition ModelVision Transformer

  35. Battery detection of XRay images using transfer learning

    Jun 10, 2026Nermeen Abou Baker, David Rohrschneider, Uwe HandmannLithium-Ion BatteriesYolo26

  36. Fast Speech Foundation Model Distillation Using Interleaved Stacking

    Jun 10, 2026Eungbeom Kim, Kyogu LeeFast InferenceSpeech Language Models

  37. AVIS: Adaptive Test-Time Scaling for Vision-Language Models

    Jun 10, 2026Ahmadreza Jeddi, Minh Ngoc Le, Amirhossein Kazerouni +8Fast InferenceEfficient Inference

  38. Bridged SBI: Correcting Biased Low-Fidelity Posteriors for Cost-Efficient High-Fidelity Inference

    Jun 8, 2026Gahee Kim, Yuki Kadokawa, Sandro M. Alcantara Tacora +5High-FidelityFast Inference

  39. vla.cpp: A Unified Inference Runtime for Vision-Language-Action Models

    Jun 6, 2026Khanh D. Nguyen, Hung T. Ho, Chinh T. Nguyen +5Vision-Language-Action FrameworkFast Inference

  40. Multilingual Detection of Alzheimer's Disease from Speech: A Cross-Linguistic Transfer Learning Approach

    Jun 4, 2026Nadine Yasser Abdelhalim, Emmanuel Akinrintoyo, Nicole SalomonsMultilingual Language ModelsCross-Lingual Transfer

  41. Audio Interaction Model

    Jun 3, 2026Zhifei Xie, Zihang Liu, Ze An +8Audio UnderstandingAutomatic Speech Recognition

  42. X-Stream: Exploring MLLMs as Multiplexers for Multi-Stream Understanding

    Jun 1, 2026Peiwen Sun, Xudong Lu, Huadai Liu +10StreamingMultimodal Large Language Models

  43. VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies

    May 28, 2026Mingjian Gao, Wenqiao Zhang, Yuqian Yuan +9Latent Visual ReasoningVisual Reasoning

  44. ESAM++: Efficient Online 3D Perception on the Edge

    May 28, 2026Qin Liu, Lavisha Aggarwal, Saptarashmi Bandyopadhyay +43D PerceptionFast Inference

  45. PrunePath: Towards Highly Structured Sparse Language Models

    May 27, 2026Zhexuan Gu, Zixun Fu, Yancheng YuanUnstructured PruningSparsity

  46. RT-Lynx: Putting the GEMM Sparsity In a Right Way for Diffusion Models

    May 26, 2026Xing Cong, Hanlin Tang, Kan Liu +3Diffusion TransformersDiffusion Models

  47. Do Language Models Need Sleep? Offline Recurrence for Improved Online Inference

    May 25, 2026Sangyun Lee, Sean McLeish, Tom Goldstein +1LLM Inference OptimizationFast Inference