On-Device Language Model Inference

Latest papers 111

All topics
CardsList
  1. AgentStop: Terminating Local AI Agents Early to Save Energy in Consumer Devices

    May 1, 2026Dzung Pham, Kleomenis Katevas, Ali Shahin Shamsabadi +1LLM Inference EfficiencyOn-Device Language Model Inference

  2. DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference

    Apr 29, 2026Bodon Jeong, Hongsu Byun, Youngjae Kim +4On-Device Language Model InferenceKV-Cache Offloading

  3. AHASD: Asynchronous Heterogeneous Architecture for LLM Adaptive Drafting Speculative Decoding on Mobile Devices

    Apr 28, 2026Ma Zirui, Fan Zhihua, Li Wenxing +4Compute-in-MemoryOn-Device Language Model Inference

  4. Less is More: Lightweight Prompt Compression for Question Answering Applications on Edge Devices

    Apr 27, 2026Zihuai Xu, Ruofei Hou, Yang Xu +3Retrieval-Augmented GenerationOn-Device Language Model Inference

  5. BitRL: Reinforcement Learning with 1-bit Quantized Language Models for Resource-Constrained Edge Deployment

    Apr 27, 2026Md. Ashiq Ul Islam Sajid, Mohammad Sakib Mahmood, Md. Tareq Hasan +3LLM QuantizationRL for Language Models

  6. Cloud to Edge: Benchmarking LLM Inference On Hardware-Accelerated Single-Board Computers

    Apr 24, 2026Harri Renney, Fouad Trad, Michael Mattarock +1AI Accelerator InferenceOn-Device Language Model Inference

  7. Multilinguality at the Edge: Developing Language Models for the Global South

    Apr 23, 2026Lester James V. Miranda, Songbo Hu, Roi Reichart +1Multilingual Language ModelsOn-Device Language Model Inference

  8. SparKV: Overhead-Aware KV Cache Loading for Efficient On-Device LLM Inference

    Apr 23, 2026Hongyao Liu, Liuqun Zhai, Junyi Wang +3On-Device Language Model InferenceKV-Cache Offloading

  9. Micro Language Models Enable Instant Responses

    Apr 21, 2026Wen Cheng, Tuochao Chen, Karim Helwani +3On-Device Language Model InferenceSmall Language Models

  10. Toward Zero-Egress Psychiatric AI: On-Device LLM Deployment for Privacy-Preserving Mental Health Decision Support

    Apr 20, 2026Eranga Bandara, Asanga Gunaratna, Ross Gore +9On-Device Language Model InferencePrivacy-Preserving Language Models

  11. Unlocking the Edge deployment and ondevice acceleration of multi-LoRA enabled one-for-all foundational LLM

    Apr 20, 2026Sravanth Kodavanti, Sowmya Vajrala, Srinivas Miriyala +13On-Device Language Model InferenceLLM Inference

  12. FlexServe: A Fast and Secure LLM Serving System for Mobile Devices with Flexible Resource Isolation

    Mar 10, 2026Yinpeng Wu, Yitong Chen, Lixiang Wang +3LLM ServingOn-Device Language Model Inference

  13. Arapai: An Offline-First LLM Architecture for Adaptive Learning in Low-Connectivity Environments

    Feb 14, 2026Joseph Walusimbi, Ann Move Oguti, Joshua Benjamin Ssentongo +1On-Device Language Model InferenceIntelligent Tutoring Systems

  14. Intelligence per Watt: Measuring Intelligence Efficiency of Local AI

    Nov 11, 2025Jon Saad-Falcon, Avanika Narayan, Hakki Orhun Akengin +12LLM Inference EfficiencyAI Accelerator Inference

  15. OpenPhone: Mobile Agentic Foundation Models

    Oct 24, 2025Yangqin Jiang, Chao HuangOn-Device Language Model InferenceGUI Agents

  16. K-Merge: Online Continual Merging of Adapters for On-device Large Language Models

    Oct 15, 2025Donald Shenaj, Ondrej Bohdal, Taha Ceritli +3Continual Learning for LLMsOn-Device Language Model Inference

  17. Prima.cpp: Fast 30-70B LLM Inference on Heterogeneous and Low-Resource Home Clusters

    Apr 7, 2025Zonghang Li, Tao Li, Wenjiao Feng +8On-Device Language Model InferenceLLM Inference

  18. FlexQuant: Elastic Quantization Framework for Locally Hosted LLM on Edge Devices

    Jan 13, 2025Yuji Chai, Mujin Kwun, David Brooks +1LLM QuantizationOn-Device Language Model Inference