On-Device Language Model Inference

Latest papers 111

All topics
CardsList
  1. Enhancing Virtual Agents through SLMs and Edge-Computing: An Exploratory Evaluation of Think and Memory Processes

    Aug 13, 2026Aimilios Hadjiliasi, Louis NisiotisCognitive Architectures for AI AgentsOn-Device Language Model Inference

  2. MemSpec: Memory-Aware Runtime for Adaptive Draft Scheduling in Speculative Decoding on Edge Devices

    Aug 11, 2026Eunjeong Kim, Yeong Jun Jeon, Myeonggyun HanOn-Device Language Model InferenceLLM Inference Scheduling

  3. GRASP: Reinforcing Language Model Anonymizers with Group Relative Policy Optimization

    Aug 6, 2026Sajjad Ghiasvand, Nader SehatbakhshOn-Device Language Model InferencePrivacy-Preserving Language Models

  4. Energy- and Memory-Efficient PEFT Methods for Personalized On-Device SLMs on Consumer GPUs

    Aug 5, 2026Kuanysh Akhmetzhanov, Jurn-Gyu ParkFine-TuningOn-Device Language Model Inference

  5. Structured Memory for Edge Language Models: Persistent Context and Corpus Retrieval via O(1) SSM State Injection

    Aug 3, 2026Anusha Madan Gopal, Aras Pirbadian, Kristofor D. Carlson +2Retrieval-Augmented GenerationOn-Device Language Model Inference

  6. Profiling Lightweight Large Language Models

    Jul 23, 2026Tomohiro Harada, Enrique Alba, Gabriel LuqueLLM Inference EfficiencyLLM Evaluation

  7. BaseRT: Advancing Best-in-Class LLM Inference with Apple M5 Neural Accelerators

    Jul 21, 2026Fabian Waschkowski, Prabod Rathnayaka, Lukas WesemannAI Accelerator InferenceOn-Device Language Model Inference

  8. SelectInfer: Selective Neuron Loading and Computation for On-Device LLMs

    Jul 20, 2026Huzaifa Shaaban Kabakibo, Eric Schniedermeyer, Artem Burchanow +1On-Device Language Model InferenceMemory-Efficient Inference

  9. AdaHome: An Adaptive Smart Home Assistant using Local Small Language Models

    Jul 20, 2026Eu Jin Lim, Zhaoxing Li, Sebastian SteinAdaptive InferenceOn-Device Language Model Inference

  10. SmartRAG: Native Graph-Based RAG for Mobile Device

    Jul 16, 2026Zhihan Jiang, Meng Li, Shenghao Liu +5Named Entity RecognitionOn-Device Language Model Inference

  11. Automated Tensor Scheduling for Hybrid CPU-GPU LLM Inference on Consumer Devices

    Jul 11, 2026Yangyijian Liu, Hongyi Ye, Mingyang Li +1On-Device Language Model InferenceLLM Inference Scheduling

  12. Is Your NPU Ready for LLMs? Dissecting the Hidden Efficiency Bottlenecks in Mobile LLM Inference

    Jul 6, 2026Guanyu Cai, Ruiming Tian, Lang Yang +4LLM Inference EfficiencyAI Accelerator Inference

  13. STELLA: Efficient Sensor-to-LLM Translation for On-Device Human Activity Recognition

    Jul 3, 2026Nirhoshan Sivaroopan, Albert Zomaya, Kanchana ThilakarathnaOn-Device Language Model InferenceHuman Activity Recognition

  14. BaseRT: Best-in-Class LLM Inference on Apple Silicon via Native Metal

    Jul 1, 2026Prabod Rathnayaka, Fabian Waschkowski, Lukas WesemannAI Accelerator InferenceOn-Device Language Model Inference

  15. Little Brains, Big Feats: Exploring Compact Language Models

    Jun 29, 2026Dari Baturova, Elena Bruches, Ivan Chernov +3Retrieval-Augmented GenerationOn-Device Language Model Inference

  16. Cascaded Multi-Granularity Pruning for On-Device LLM Inference in Industrial IoT

    Jun 25, 2026Jinghan Wang, Yanjun Chen, Wei Zhang +3LLM PruningOn-Device Language Model Inference