Egocentric Video Understanding

Latest papers 140

All topics
CardsList
  1. Hand-4DGS: Feed-Forward 3D Gaussian Splatting for 4D Hand Reconstruction from Egocentric Videos

    Jun 17, 2026Jeongmin Bae, Seoha Kim, Marc Pollefeys +33D Gaussian Splatting4D Reconstruction

  2. EgoCS-400K: An Egocentric Gameplay Dataset for World Models

    Jun 16, 2026Rongjin Guo, Dong Liang, Yuhao Liu +4World Model LearningEgocentric Video Understanding

  3. Divide, Deliberate, Decide: A Multi-Agent Framework for Fine-Grained Egocentric Action Recognition

    Jun 16, 2026Alessandro Sottovia, Alessandro Torcinovich, Oswald LanzZero-Shot LearningMulti-Agent Debate

  4. From Frames to Temporal Graphs: In-Context Egocentric Action Recognition with Vision-Language Models

    Jun 13, 2026Bessie Dominguez-Dager, Francisco Gomez-Donoso, Miguel Cazorla +3Egocentric Video UnderstandingIn-Context Learning

  5. Keep It in Mind: User Centric Continual Spatial Intelligence Reasoning in Egocentric Video Streams

    Jun 13, 2026Yun Wang, Junbin Xiao, Han Lyu +6Spatial Reasoning BenchmarksStreaming Video Understanding

  6. Rethinking RAG in Long Videos: What to Retrieve and How to Use It?

    Jun 11, 2026Yuho Lee, Jisu Shin, Nicole Hee-Yeon Kim +5Multimodal RAGEgocentric Video Understanding

  7. Objects Before Words: Object-First Inductive Biases for Grounding Language in Child-View Video

    Jun 11, 2026Sathira Silva, Abrham Kahsay Gebreselasie, Muhammad Umer Sheikh +3Object-Centric Representation LearningEgocentric Video Understanding

  8. Reason, Then Re-reason: Cross-view Revisiting Improves Spatial Reasoning

    Jun 10, 2026Chaofan Ma, Zhenjie Mao, Yuhuan Yang +5Visual Spatial Reasoning3D Spatial Reasoning

  9. Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models

    Jun 8, 2026Danya Li, Xiang Su, Yan Feng +1Pedestrian Intention PredictionVLM Adaptation

  10. EgoAERO: Learning Dexterous Manipulation from a Single Egocentric Video without Object Assets

    Jun 6, 2026Yichen Niu, Haoran Lv, Xinrui Zhang +12Contact-Rich Robotic ManipulationEgocentric Video Understanding

  11. EgoPressDiff: Multimodal Video Diffusion for Egocentric UV-Domain Hand-Pressure Estimation

    Jun 5, 2026Yuan Zeng, Zilue Gao, Yujia Shi +3Video Diffusion ModelsTactile Sensing

  12. ActiveMimic: Egocentric Video Pretraining with Active Perception

    Jun 4, 2026Xingyao Lin, Guojin Zhong, Tianyi Lu +4Active PerceptionActive Vision for Robot Manipulation

  13. Continual Visual and Verbal Learning Through a Child's Egocentric Input

    Jun 3, 2026Xiaoyang Jiang, Yanlai Yang, Kenneth A. Norman +2Egocentric Video UnderstandingReplay-Based Continual Learning

  14. Plan, Watch, Recover: A Benchmark and Architectures for Proactive Procedural Assistance

    Jun 3, 2026Kaustav Kundu, Ritvik Shrivastava, Maxim Arap +13LLM PlanningEgocentric Video Understanding

  15. VLESA: Vision-Language Embodied Safety Agent for Human Activity Monitoring

    Jun 2, 2026Hanjiang Hu, Yiyuan Pan, Jiaxing Li +5Egocentric Video UnderstandingAI Agent Safety

  16. OVO-S-Bench: A Hierarchical Benchmark for Streaming Spatial Intelligence in Multimodal LLMs

    Jun 2, 2026Yifei Li, Pengyiang Liu, Yuhang Zang +4Spatial Reasoning BenchmarksSpatiotemporal Reasoning

  17. Hand Trajectory Fusion for Egocentric Natural Language Query Grounding

    Jun 1, 2026Enmin Zhong, Carlos R. del-Blanco, Fernando Jaureguizar +1Temporal Video GroundingEgocentric Video Understanding

  18. Understanding-Enhanced Model Collaboration for Long-Tailed Egocentric Mistake Detection

    Jun 1, 2026Boyu Han, Qianqian Xu, Shilong Bao +3Egocentric Video UnderstandingTemporal Video Understanding

  19. CASTLE2026 Team WDL Technical Report

    May 30, 2026Zhengyang Li, Zhenglin Du, Yi Wen +3Multimodal RAGEgocentric Video QA

  20. Ego-METAS: Egocentric online Multimodal Energy-efficient Temporal Action Segmentation benchmark

    May 29, 2026Maria Santos-Villafranca, Jesus Bermudez-cameo, Alejandro Perez-Yus +2Temporal Action SegmentationEnergy-Efficient ML

  21. EGOSTREAM: A Diagnostic Benchmark for Streaming Episodic Memory in Egocentric Vision

    May 29, 2026Rosario Forte, Giuseppe Lando, Antonino FurnariVLM EvaluationStreaming Video Understanding

  22. Reflective Dialogue between Teacher and Solver Agents for Video Question Answering

    May 27, 2026Takuya Murakawa, Toru TamakiVLM AdaptationVideo QA