On-Device Language Model Inference

Latest papers 111

All topics
CardsList
  1. FlexServe: A Fast and Secure LLM Serving System for Mobile Devices with Flexible Resource Isolation

    Jun 22, 2026Yinpeng Wu, Yitong Chen, Lixiang Wang +3LLM ServingOn-Device Language Model Inference

  2. EnerInfer: Energy-Aware On-Device LLM Inference

    Jun 22, 2026Bohua Zou, Nian Liu, Binqi Sun +6On-Device Language Model InferenceLLM Inference Acceleration

  3. Enabling Cloud-Level Accuracy in Edge AI through IoT Data Preprocessing

    Jun 21, 2026Aygün Varol, Katarzyna Kołodziej, Łukasz Sobczak +5On-Device Language Model InferenceLLM Prompting

  4. Does Mixture-of-Experts Actually Help Inference on Consumer and Edge Hardware? An Empirical Study

    Jun 19, 2026Alfarizy Alfarizy, Hung Truong Thanh Nguyen, René Richard +2LLM Inference EfficiencyOn-Device Language Model Inference

  5. Efficient On-Device Diffusion LLM Inference with Mobile NPU

    Jun 11, 2026Tuowei Wang, Yanfan Sun, Ju RenAI Accelerator InferenceOn-Device Language Model Inference

  6. TileFuse: A Fused Mixed-Precision Kernel Library for Efficient Quantized LLM Inference on AMD NPUs

    Jun 9, 2026Wesley Pang, Gregory Hyegang Jun, Feiyang Liu +1Mixed-Precision QuantizationLLM Quantization

  7. Achieving Cloud-Grade SLOs for Local Mixture-of-Experts Inference through CPU-GPU Hybrid Design

    Jun 9, 2026Wenxin Wang, Yule Hou, Yu Ji +2Expert ParallelismOn-Device Language Model Inference

  8. Distilling Safe LLM Systems via Soft Prompts for On Device Settings

    Jun 8, 2026Motasem Alfarra, Cristina Pinneri, Dana Kianfar +2On-Device Language Model InferenceLLM Safety Alignment

  9. Multi-SPIN: Multi-Access Speculative Inference for Cooperative Token Generation at the Edge

    Jun 3, 2026Haotian Zheng, Zhanwei Wang, Mingyao Cui +3On-Device Language Model InferenceEdge Computing

  10. Operator Fusion for LLM Inference on the Tensix Architecture

    Jun 3, 2026Qingbo Wu, Ke Li, Wenzhu Wang +3Efficient Transformer InferenceAI Accelerator Inference

  11. LLM Compression with Jointly Optimizing Architectural and Quantization choices

    Jun 2, 2026Hoang-Loc La, Truong-Thanh Le, Amir Taherkordi +1Mixed-Precision QuantizationLLM Quantization

  12. When Cloud Agents Meet Device Agents: Lessons from Hybrid Multi-Agent Systems

    May 28, 2026Corrado Rainone, Davide Belli, Bence Major +1Multi-Agent LLM SystemsOn-Device Language Model Inference

  13. Dense2MoE: Pushing the Pareto Frontier of On-Device LLMs via Unified Pruning and Upcycling

    May 26, 2026Fengfa Li, Hongjin Ji, Yifeng Ding +2Mixture-of-Experts PruningLLM Pruning

  14. When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference

    May 22, 2026Pu Li, Jiawen Qi, Qinyu ChenAI Accelerator InferenceOn-Device Language Model Inference

  15. LLMForge: Multi-Backend Hardware-Aware Neural Architecture Search with Infinite-Head Attention for Edge Language Models

    May 17, 2026Xinting Jiang, Junyi Luo, Ruichen Qi +4On-Device Language Model InferenceHardware-Aware NAS

  16. OpenJarvis: Personal AI, On Personal Devices

    May 16, 2026Jon Saad-Falcon, Avanika Narayan, Robby Manihani +10On-Device Language Model InferenceLLM Agents

  17. Lever: Speculative LLM Inference on Smartphones

    May 16, 2026Tuowei Wang, Fengzu Li, Yanfan Sun +2On-Device Language Model InferenceLLM Inference

  18. CR^2: Cost-Aware Risk-Controlled Routing for Wireless Device-Edge LLM Inference

    May 12, 2026Nan Xue, Shengkang Chen, Zhiyong Chen +4On-Device Language Model InferenceLLM Inference

  19. CATS: Cascaded Adaptive Tree Speculation for Memory-Limited LLM Inference Acceleration

    May 11, 2026Yuning Han, Yangchenchen Jin, Dylan Zhao +1On-Device Language Model InferenceMemory-Efficient Inference

  20. Agent-X: Full Pipeline Acceleration of On-device AI Agents

    May 11, 2026Jinha Chung, Byeongjun Shin, Jiin Kim +1LLM Inference EfficiencyOn-Device Language Model Inference

  21. GELATO: Generative Entropy- and Lyapunov-based Adaptive Token Offloading for Device-Edge Speculative LLM Inference

    May 11, 2026Zengzipeng Tang, Yuxuan Sun, Wei Chen +2On-Device Language Model InferenceEdge Computing

  22. Large Language Models over Networks: Collaborative Intelligence under Resource Constraints

    May 9, 2026Liangqi Yuan, Wenzhi Fang, Shiqiang Wang +2LLM Inference EfficiencyOn-Device Language Model Inference

  23. Benchmarking Local Language Models for Social Robots using Edge Devices

    May 4, 2026Dorian Lamouille, Matevž B. Zorec, Farnaz Baksh +1LLM EvaluationOn-Device Language Model Inference