Inference Latency

Momentum

11 papers in the last four weeks, up 83% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 100

All topics
CardsList
  1. Learning via Self-Consistency for Diffusion-based Video Reasoning

    Sep 29, 2026Zhenghao Ni, Weimin Qiu, Meng TangVideo GenerationSelf-Consistency

  2. Reactive Real-Time Flow Policies via Asynchronous Distribution Alignment

    Sep 29, 2026Moritz Zoellner, Reece O'Mahoney, Ioannis Havoutis +1Asynchronous ExecutionRobot Policies

  3. RAVEL: Asynchronous Rolling Inference for Flow-Based Vision-Language-Action Models

    Sep 28, 2026Yuhan Chen, Ke Yu, Pengfei Liu +3Flow-Matching Vision-Language-ActionInference Latency

  4. GHOST-Q: Towards Studying Grounding Hallucinations Overlooked Under Same-score TradeOffs in Quantized VLMS

    Sep 24, 2026Saim Rehman, Muhammad ShafiqueCitation Hallucination DetectionHallucination Mitigation

  5. RAMP: Robust Adaptive Mixed-Precision Quantization for Edge CPU Vision Models

    Sep 23, 2026David Población-Criado, Dario Garcia-Gasulla, Eduardo QuinonesMixed-Precision QuantizationNeural Network Inference

  6. NS-ATTENTION: Newton-Schulz Transformations of Attention Outputs in Vision Transformers

    Sep 23, 2026Xiaohe Jiang, Guoqiang Zhang, Tianjin Huang +1Transformer AttentionLinear Attention

  7. T-LoopFormer: Token-Level Elastic-Depth Looped Transformers for Latent Reasoning With Dynamic Routing

    Sep 14, 2026Mingqian Yu, Wenpeng Zhang, Peilin ZhaoTransformer ArchitecturesInference Latency

  8. TRACE: Trajectory-robust Admission with Evidence Ordering for Efficient GUI Agents

    Sep 9, 2026Yuhao Wang, Mu Qiao, Xindong Zhang +3Visual Token PruningTraces

  9. MetaKV: Adaptive KV Cache Compression for Constrained LLM Inference

    Sep 7, 2026Michael Wang, Keith Li, Roozbeh BostandoostKey-Value Cache CompressionLLM Inference Optimization

  10. Para-Pipe: Exploiting Hierarchical Operator Parallelism of ML Computational Graphs on SoCs

    Sep 3, 2026Yujie Zhang, Huiying Lan, Ehsan Aghapour +5Chip DesignInference Latency

  11. Preference Shapes Relevance: Cross-component Hierarchical Semantic Alignment for Personalized Generative Retrieval

    Aug 31, 2026Gaoming Zhang, Angqing Jiang, Jianchun Song +4Hierarchical Semantic AlignmentPersonalization

  12. PRIME: Mitigating Subgroup Optimization Competition in Shared CTR Top Networks with Plug-in Residual Input-Conditioned Mixture of Expert

    Aug 31, 2026Heng Yao, Siyun Hou, Tianying Liu +8Click-Through Rate PredictionSubspace

  13. InSight-doc: Agentic Visual Perception for Long-Document Understanding

    Aug 11, 2026Kaican Li, Weiyan Xie, Lewei Yao +4Visual Document RetrievalRecent Vision-Language Models

  14. The Parser Already Knows: Lightweight Bias Correction in Constrained Decoding

    Aug 10, 2026Işıl Özgü, Yaoxuan Wu, Guy Van den Broeck +1Constrained DecodingCorrection

  15. ScaleSense: Cost-Intelligent Scaling Framework via Learned Resource Estimation in Alibaba AnalyticDB

    Aug 8, 2026Yifan Wu, Yuhan Li, Zhenhua Wang +6Rate ScalingCloud

  16. Bimanual Manipulation Within an 8 GB Budget: Zero-Copy Sensing and Quantized ACT on an Entry-Level Jetson

    Aug 4, 2026Ekansh Singh, Eva Samuel, Alessandra Reneau +2Nvidia Jetson Orin NanoBimanual Manipulation

  17. OrEdge: Efficient Multi-Modal Anomaly Detection in Distributed Software Systems via Orthogonal-Domain Learning

    Jul 31, 2026Amr M. Zaki, Farhoud Jafari Kaleibar, Honggeun Ji +2Multimodal Anomaly DetectionDistributed Optimization

  18. A Cost-Effective Multimodal LLM Reasoning Framework for Question Answering over Irregular Clinical Time Series

    Jul 28, 2026Frank Nie, Ethan B Liu, Yuan Zhu +2Time SeriesInference Latency

  19. UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling

    Jul 27, 2026Zhipeng Bao, Zhen Zhu, Nupur Kumari +4Autoregressive Image GenerationVisual Generation

  20. MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation

    Jul 26, 2026Yuqi Liu, Shengju Qian, Tianyuan Qu +5Vision-Language NavigationDiffusion-Based Vision-Language-Actions

  21. Think at 5 Hz, Act at 20 Hz: Asynchronous Fast-Slow Vision-Language-Action Inference for Closed-Loop Driving

    Jul 17, 2026Yun Li, Jiachen Gong, Simon Thompson +7Diffusion-Based Vision-Language-ActionsInference Latency

  22. Learning Latency-Aware Orchestration for Multi-Agent Systems

    Jul 15, 2026Xi Shi, Mengxin Zheng, Qian LouModel-Based Multi-Agent SystemsInference Latency

  23. Jetson-PI: Towards Onboard Real-Time Robot Control via Foresight-Aligned Asynchronous Inference

    Jul 14, 2026Zebin Yang, Qi Wang, Yunhe Wang +6Fast InferenceNvidia Jetson Orin Nano

  24. Reducing Temporal Redundancy for Efficient Vision-Language-Action Inference

    Jul 14, 2026Yuzhou Wu, Yuxin Zheng, Muchun Niu +6Diffusion-Based Vision-Language-ActionsVision-Language-Action Framework

  25. DynaFilter: Cloud-driven Dynamic Filtering for Satellite Edge Intelligence

    Jul 11, 2026Ziyang Zhang, Jie Liu, Luca MottolaIntelligent EdgeEdge Platforms

  26. IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation

    Jul 10, 2026Yiting Wang, Jingyi Zhang, Wenhu Zhang +4Classifier-Free GuidanceFew-Step Distillation

  27. EvoLP: Self-Evolving Latency Predictor for Model Compression in Real-Time Edge Systems

    Jul 10, 2026Shuo Huai, Hao Kong, Shiqing Li +5Edge DevicesInference Latency

  28. Context-Aware Force Estimation for Deformable Tool Manipulation in Robotic Environmental Swabbing via Few-Shot Continual Adaptation

    Jul 8, 2026Siavash Mahmoudi, Chaitainya Kuppar Reddy, Yang Tian +1Ground Reaction ForcesDeformable Linear Objects

  29. Reasoning-aware Speculative Decoding for Efficient Vision-Language-Action Models in Autonomous Driving

    Jun 30, 2026Anh Dung Dinh, Simon Khan, Flora SalimDiffusion-Based Vision-Language-ActionsAutonomous Driving

  30. LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation

    Jun 26, 2026Nicolas Baumann, Liam Boyle, Pu Deng +5Vision-Language NavigationObject Goal Navigation

  31. Action ControlNet: A Lightweight Delay-Aware Adapter for Smooth Asynchronous Control in Vision-Language-Action Models

    Jun 24, 2026Tiecheng Guo, Meng GuoAction GenerationRobotic Manipulation

  32. Lite Any Stereo V2: Faster and Stronger Efficient Zero-Shot Stereo Matching

    Jun 23, 2026Junpeng Jing, Ronglai Zuo, Zhelun Shen +5Stereo MatchingStereo

  33. PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models

    Jun 21, 2026Xianghui Wang, Feng Chen, Wenbo Zhang +4Inference LatencyRobotic Manipulation

  34. Error-Aware TF-IDF Retrieval-Augmented Generation for ASR Error Correction

    Jun 19, 2026Mohammad Aref Jafari-RaddaniAutomatic Speech RecognitionGrapheme-To-Phoneme

  35. Turning music identification into a neural forward pass

    Jun 15, 2026Muhammad Taimoor Haseeb, Ahmad Hammoudeh, Gus XiaMusic Structure AnalysisNeural Audio

  36. RAID: Semantic Graph Diffusion for True Cold-Start and Cross-Lingual Forecasting

    Jun 15, 2026Arunkumar V, Manoranjan Gandhudi, Gangadharan G. R. +2Wireless Foundation ModelsLatent Prediction

  37. Focus When Necessary: Adaptive Routing and Collaborative Grounding for Training-Free Visual Grounding

    Jun 15, 2026Yifan Wang, Peiming Li, Shiyu Li +5Weak Visual GroundingMultimodal Large Language Models

  38. Budget-Constrained Step-Level Diffusion Caching

    Jun 11, 2026Mingkun Lei, Tong Zhao, Liangyu Yuan +1Diffusion ModelsCache

  39. Reliability of Probabilistic Emulation of Physical Systems

    Jun 11, 2026Sam F. Greenbury, Radka Jersakova, Paolo Conti +4Probabilistic ForecastingEmulators

  40. Fast Speech Foundation Model Distillation Using Interleaved Stacking

    Jun 10, 2026Eungbeom Kim, Kyogu LeeFast InferenceSpeech Language Models

  41. Efficient-WAM: A 1B-Parameter World-Action Model with Low-Cost Future Imagination

    Jun 8, 2026Jiajun Li, Tiecheng Guo, Yifan Ye +9Efficient World-Action ModelFaster-Wam

  42. Efficient Traffic Prediction at Scale: A Systematic Study of STGCN Architectural Depth

    Jun 8, 2026Soban Nasir Lone, Mohamed Abouelela, Taeyoung Yu +2Accurate Traffic ForecastingTemporal Graph Neural Networks

  43. NTILC: Neural Tool Invocation via Learned Compression

    Jun 4, 2026Andrew Krikorian, Yayuan Li, Jason J. CorsoTool InvocationLarge Language Model Tool Use

  44. Resonant Context Anchoring: Decoupling Attention Routing and Signal Gain at Inference Time

    Jun 1, 2026Mingkuan Zhao, Yide Gao, Wentao Hu +6LLM Inference OptimizationInference-Time

  45. WaveFilter: Enhancing the Long-Context Capability of Diffusion LLMs via Wavelet-Guided KV Cache Filtering

    May 30, 2026Jinnan Yang, Yan Wang, Zhen Bi +5Efficient Long-Context InferenceKey-Value Cache

  46. Where to Refine, When to Stop: Rethinking Redundancy via Latent Discrepancy for Efficient Visual Autoregressive Generation

    May 29, 2026Changwang Mei, Peisong Wang, Zekun Li +7Autoregressive Image GenerationVisual Autoregressive Models

  47. BitTP: The Lightweight Trajectory Prediction Model with BitLLM for Edge-Devices

    May 28, 2026Mincheol Kang, Hyunjin Lim, Bomin Kang +1Large Language Model QuantizationEgo-Trajectory Prediction

  48. PILOT: A Data-Free Continual Learning Approach for Real-Time Semantic Segmentation via Boundary Guidance

    May 26, 2026Yujing Zhou, Prashant Shekhar, Thomas Yang +1Efficient Semantic SegmentationReplay-Based Continual Learning