On-Device Language Model Inference

Latest papers 111

All topics
CardsList
  1. AIR-LLM: Broadcasting AI Weights over Radio for Memory-Free Edge LLM Inference via RF Computing

    Sep 30, 2026Zhihui Gao, Tingjun Chen, Dirk EnglundOn-Device Language Model InferenceLLM Inference Acceleration

  2. HARISSA: Inference-Time Self-Checks for Efficient and Safe Local Language Model Deployment

    Sep 29, 2026Kenan Alkiek, Moontae Lee, David Jurgens +1On-Device Language Model InferenceSelective Prediction

  3. AS2^2D: Accelerating On-Demand Audio Understanding on Mobile Devices

    Sep 29, 2026Yunzhe Li, Kyoungjun Park, Hongzi Zhu +1On-Device Language Model InferenceLanguage Model Decoding

  4. IronLLM: Forging Compact Edge-Native Language Models for Real-Time Embodied Intelligence

    Sep 29, 2026Changdi Yang, Fengquan Jiao, Haochih Lin +14Multi-Token PredictionOn-Device Language Model Inference

  5. Dynamic Flow, Static Graph: KV Cache Reuse for Efficient LLM Serving on Mobile NPUs

    Sep 28, 2026Zhengxiang Huang, Shengheng Chen, Chaoyue Niu +6AI Accelerator InferenceOn-Device Language Model Inference

  6. OmniTide: Co-Designing Algorithms and Systems for Efficient On-Device Omni-LLM Streaming

    Sep 28, 2026Zongshang Shen, Wangsong Yin, Daliang Xu +2Efficient Multimodal InferenceOn-Device Language Model Inference

  7. Optimizing the Phi-2 Small Language Model for Real-time Chatbot Applications Using Parameter-Efficient Fine-Tuning (PEFT) with QLoRA Quantization

    Sep 27, 2026PhanTan Khanh Nguyen, Ashfaq Ali Shafin, Khandaker Mamun AhmedOn-Device Language Model InferenceSmall Language Models

  8. Universal Fractal Natural Language Decision Map: Real-Time Edge Triage Across Heterogeneous Domains

    Sep 21, 2026Volkan Dağlı, Zerrin Dağlı, Dağhan DağlıOn-Device Language Model InferenceEfficient Language Model Inference

  9. LoRA-generating hypernetworks for efficient on-device LLM generative personalization

    Sep 21, 2026Sean Augenstein, Li Ding, Jihwan Lee +2On-Device Language Model InferenceLow-Rank Adaptation

  10. Efficient LLM Distillation for Bangladesh Legal Context: A Smartphone-Compatible Retrieval-Augmented Generation Model

    Sep 21, 2026MD. Nafis Kamal, Mahadi Hasan Fahim, Talha Ridwan +4Retrieval-Augmented GenerationLegal NLP

  11. ARID: A Deployable Edge AI System for Structured Information Extraction from Industrial Maintenance Work Orders

    Sep 20, 2026Kuanlin Chen, Chen-Wei KuoOn-Device Language Model InferenceDocument Information Extraction

  12. TierKV: Long-Context On-Device LLMs via Predictive Multi-Tier KV Caching

    Sep 18, 2026Zhihao Shu, Md Musfiqur Rahman Sanim, Jie Hu +4On-Device Language Model InferenceLong-Context Language Model Inference

  13. The Battery Price of edge AI: A study of the Environmental Impact of LLM Inference on Mobile Devices

    Sep 14, 2026Édouard Guégain, Tristan CoignionOn-Device Language Model InferenceEnergy-Efficient ML

  14. On-Device Language Models for Privacy-Preserving Stress Prediction: A Multimodal Evaluation on Mobile Health

    Sep 14, 2026Ibukunoluwa Soyebo, Alyssa Donawa, Rodrigo Aguilar Barrios +2On-Device Language Model InferencePrivacy-Preserving Language Models

  15. From Fixed Keys to Readable Schemas: Small Language Models for Vehicle Agent Function Calls

    Sep 10, 2026Hamed Jafarzadeh Asl, Yuanhao Yu, Vahid Partovi NiaLLM Inference EfficiencyOn-Device Language Model Inference

  16. Diffusion Language Models for Mobile Edge Agentic AI: Foundations, Applications, and Challenges

    Sep 7, 2026Chenqi Li, Minghui Min, Dusit Niyato +1On-Device Language Model InferenceDiffusion Language Model Inference

  17. LeanStream: A Speculate-and-Refine Streaming Framework for Efficient on-Device LLM Inference

    Sep 2, 2026Renyuan Liu, Yuyang Leng, Kaiyan Liu +7LLM Inference EfficiencyOn-Device Language Model Inference

  18. How Do Prompt Variations Affect Energy Consumption in On-Device LLMs?

    Sep 1, 2026Wei Hu, Xiaolong Tu, Dawei Chen +3LLM Inference EfficiencyOn-Device Language Model Inference

  19. mzCache: On-Device LLM Memory Management under Multitasking

    Sep 1, 2026Hongseung Yu, Minsung Kim, Jongseok Park +1On-Device Language Model InferenceMemory-Efficient Inference

  20. Triple-Bottom-Line Sustainability of Language Models for Edge AI: A Comparison Between SLMs and Quantized LLMs

    Sep 1, 2026Jainil Dharmil ShahLLM QuantizationLLM Evaluation