Open-Vocabulary Action Recognition

Latest papers 72

All topics
CardsList
  1. HuC-VideoMAE: Human-Centric Video Masked Autoencoding from synthetic data

    Oct 6, 2026Ricardo Pizarro, Roberto Valle, José M. Buenaposada +2Open-Vocabulary Action Recognition

  2. Beyond Binary Preferences: Graded Preference Optimization for Limb-Motion Captioning

    Sep 29, 2026Yanan Wang, Tingsong Li, Kaixun Jiang +3Video CaptioningOpen-Vocabulary Action Recognition

  3. RoboChrono: A Real Robot Benchmark for Streaming Task Understanding

    Sep 29, 2026Yuzhou Wu, Longteng Fan, Zimeng Li +22Robotic ManipulationRobot Systems

  4. Functional Hand Type Prior for 3D Hand Pose Estimation and Action Recognition from Egocentric View Monocular Videos

    Sep 28, 2026Wonseok Roh, Seung Hyun Lee, Won Jeong Ryoo +53D HandOpen-Vocabulary Action Recognition

  5. When Visual Quality Misleads: Intent Recognition under Rendered Avatar Distortions

    Sep 23, 2026Ning-Hsuan Chang, Kai-Siang Ma, Yu-Chih ChenVisual FidelityOpen-Vocabulary Action Recognition

  6. Can Vision-Language Models Judge Olympic Diving? From Reasoning to Scores in Zero-Shot Action Quality Assessment

    Sep 16, 2026Henry O. Velesaca, David Freire-Obregon, Luigi Miranda +1AthleticismOpen-Vocabulary Action Recognition

  7. SoftRerank: Hierarchical Soft Fusion with Candidate-Label Reranking for Long-Tailed Micro-Action Recognition

    Sep 8, 2026Yichi Zhang, Zhichao Xia, Yanjun Chi +6Open-Vocabulary Action RecognitionFine-Grained Video Understanding

  8. Fine-Grained Action Recognition with Cross-Attentive Latent Sparse Experts

    Aug 13, 2026Imtiaz Ul Hassan, Tasweer Ahmad, Nik Bessis +1Open-Vocabulary Action RecognitionLatent Motion

  9. Attention from Action, for Action: Emergent Visual Bottlenecks for Policy Learning

    Aug 13, 2026Zheyu Zhuang, Ruiyu Wang, Nick Heppert +4Visuomotor PolicyOpen-Vocabulary Action Recognition

  10. CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition

    Aug 7, 2026Novendra Setyawan, Chi-Chia Sun, Mao-Hsiu Hsu +3Open-Vocabulary Action RecognitionEdge Devices

  11. Robust and Efficient Motion Reasoning for Privacy-Aware Classroom Incident Recognition

    Aug 5, 2026Paritosh Parmar, Landy Lan, Hong Yang +2Open-Vocabulary Action RecognitionFast Inference

  12. Privacy-Preserving Action Recognition: Taxonomy, Methods, and Privacy-Utility Trade-offs

    Aug 5, 2026Sareer Ul Amin, Muhammad Ayaz, Muhammad Munsif +1Open-Vocabulary Action RecognitionPrivacy-Utility Trade-Offs

  13. RSC-GestureNet: Reliability-Aware Selective Causal Recognition of Chinese Traffic Police Gestures

    Aug 3, 2026Cheng Li, Renjun Gao, Boyi FuTraffic Sign RecognitionHand Gesture Recognition

  14. RF-HOI: Recognize Human-Object Interaction with Radio Frequency Signals

    Jul 31, 2026Lihao Wang, Linlu Gao, Jiacan Yu +5Human Activity RecognitionMulti-Modal Sensing

  15. Knowledge-guided Disentanglement with Atomic Actions for Action Recognition

    Jul 28, 2026Tianci Wu, Siqi Cao, Guangming Zhu +6Open-Vocabulary Action RecognitionFine-Grained Video Understanding

  16. Test-Time Adaptation via Dual Distillation for Videos Under Severe Distribution Shifts

    Jul 27, 2026André Sacilotti, Samuel Felipe dos Santos, Jurandy AlmeidaTest-Time AdaptationOpen-Vocabulary Action Recognition

  17. AUCH-Net: Action Unit-Based Consistency-Aware Hypergraph Network for Cross-Domain Few-Shot Facial Expression Recognition

    Jul 23, 2026Xinhan Qiu, Yan Yan, Rui Zhu +2Facial Expression RecognitionOpen-Vocabulary Action Recognition

  18. MoAKE: Toward Unified All-in-One Action Quality Assessment via Mixture of Action Knowledge Experts

    Jul 22, 2026Huangbiao Xu, Huanqi Wu, Xiao Ke +3Open-Vocabulary Action RecognitionMixtures

  19. Classifying daily activities needs posture, reconstructing them needs motion

    Jul 14, 2026Arefeh Farahmandi, Gunnar BlohmLatent MotionOpen-Vocabulary Action Recognition

  20. Temporal Feature Distillation for Label-Efficient Precise Event Spotting in Sports Videos

    Jul 13, 2026Hao Xu, Xinyu Wei, Sam Wells +1Open-Vocabulary Action RecognitionDataset Distillation

  21. Compositional Context Fine-Tuning Vision-Language Model for Complex Assembly Action Understanding from Videos

    Jul 12, 2026Hao Zheng, Jinyi Huang, Tiantian Zheng +2Diffusion-Based Vision-Language-ActionsOpen-Vocabulary Action Recognition

  22. Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?

    Jul 9, 2026Masatoshi Tateno, Alexandros Stergiou, Risa Shinoda +2Hand-Object Interaction DetectionEgocentric Video

  23. EgoPolice: A Benchmark for Egocentric Video Understanding in High-Stakes Police Body-Worn Camera Footage

    Jul 7, 2026Max Gonzalez Saez-Diez, Jihoon Chung, Adam D. Wolsky +5PolicingEgocentric Video

  24. SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments

    Jul 6, 2026Suryanarayana Reddy Yarrabothula, Manisha Chawla, Kunal Sinha +5Open-Vocabulary Action RecognitionIndustrial

  25. A Multi-Task Deep Learning Framework for Real-Time Intelligent Video Surveillance with Temporal Event Validation

    Jul 3, 2026Estera Dumitru, Stelian SpînuVideo SurveillanceOpen-Vocabulary Action Recognition

  26. Identifying the Unknown: Prompt-Free Open Vocabulary Anomaly Recognition for Robot-Object Interaction

    Jun 25, 2026Philipp Allgeuer, Jan-Gerrit Habekost, Stefan WermterOpen-VocabularyRobotic Perception

  27. KidRisk: Benchmark Dataset for Children Dangerous Action Recognition

    Jun 24, 2026Minh-Kha Nguyen, Trung-Hieu Do, Kim Anh Phung +3Open-Vocabulary Action RecognitionBenchmark Datasets

  28. Modality-Aware Out-of-Distribution Detection for Multi-Modal Action Recognition

    Jun 23, 2026Lars Doorenbos, Duc Manh Vu, Serdar Ozsoy +1Out-Of-Distribution DetectionOpen-Vocabulary Action Recognition

  29. LUMINA-26: Low-Light Understanding for Modeling and Interpreting Night-time Actions

    Jun 22, 2026Aman Kumar Pandey, Anil Singh PariharLow-Light ImagesOpen-Vocabulary Action Recognition

  30. Gen2Balance: Generative Balancing for Long-Tailed Video Action Recognition

    Jun 21, 2026Prajwal Gatti, Simon Jenni, Fabian Caba Heilbron +1Open-Vocabulary Action RecognitionBalance

  31. Gold Points Sniper: Self-guided Visual Reasoning in VLM for Fine-grained Action Understanding

    Jun 21, 2026Haodi Liu, Xinhang Yang, Kunda Yan +3Fine-Grained ActionsOpen-Vocabulary Action Recognition

  32. LEViL: Label-Efficient Video Learning via Zero-Shot Distillation over VLM-Generated Pseudo-Label Spaces

    Jun 19, 2026Aslı ÇelikOpen-Vocabulary Action RecognitionVision-Language Model Adaptation

  33. Robust Zero-Shot Generalization for Open-Vocabulary Action Recognition via Task Arithmetic

    Jun 17, 2026Francesca Morandi, Omayma Moussadek, Federico Venturini +5Open-Vocabulary Action RecognitionZero-Shot

  34. Divide, Deliberate, Decide: A Multi-Agent Framework for Fine-Grained Egocentric Action Recognition

    Jun 16, 2026Alessandro Sottovia, Alessandro Torcinovich, Oswald LanzOpen-Vocabulary Action RecognitionEgocentric Video

  35. MamBOA: State-Space Architecture for Video Recognition

    Jun 13, 2026Mustafa Bora ÇelikOpen-Vocabulary Action RecognitionFine-Grained Video Understanding

  36. OR-Action: Multi-Role Video Understanding with Fine-Grained Actions

    Jun 11, 2026Felix Tristram, Ege Özsoy, Christian Benz +3Open-Vocabulary Action RecognitionFine-Grained Actions

  37. TrAction: Action Recognition with Sparse Trajectories

    Jun 2, 2026Jan F. Meier, Felix B. Mueller, Alexander Ecker +1Open-Vocabulary Action RecognitionSingle Trajectory

  38. CLANE: Continual Learning of Actions on Neuromorphic Hardware from Event Cameras

    May 27, 2026Elvin Hajizada, Michael Neumeier, Edward Paxon Frady +4Neuromorphic ComputingOpen-Vocabulary Action Recognition

  39. UAV-OVO: Out-of-Viewpoint Generalization in UAV Action Recognition

    May 25, 2026Yu Xia, Zhengbo Zhang, Shuaihu Zhang +1Drone DetectionOpen-Vocabulary Action Recognition

  40. Cross-Modal Action Recognition in Egocentric Video Using Mamba: Integrating RGB and Hand Skeleton Streams via CLS Token Fusion Strategies

    May 23, 2026Juan Ignacio Bustos Gorostegui, Maria Elena BuemiOpen-Vocabulary Action Recognition3D Hand

  41. Cross-Domain Human Action Recognition from Multiview Motion and Textual Descriptions

    May 21, 2026Yannick Porto, Renato Martins, Thomas Chalumeau +1Open-Vocabulary Action RecognitionHuman Activity Recognition

  42. Seeing Through Fog: Towards Fog-Invariant Action Recognition

    May 20, 2026Enqi Liu, Liyuan Pan, Zhi Gao +2Open-Vocabulary Action RecognitionFog

  43. Lens Privacy Sealing: A New Benchmark and Method for Physical Privacy-Preserving Action Recognition

    May 19, 2026Mengyuan Liu, Ziyi Wang, Peiming Li +1Video SurveillanceOpen-Vocabulary Action Recognition

  44. Return of Frustratingly Easy Unsupervised Video Domain Adaptation

    May 19, 2026Pengfei Wei, Yiqun Sun, Zhiqiang Xu +2Domain AdaptationOpen-Vocabulary Action Recognition

  45. AI-Assisted Competency Assessment from Egocentric Video in Simulation-Based Nursing Education

    May 16, 2026Hanchen David Wang, Yilin Liu, Madison J. Lee +4CompetenceSimulated Patients

  46. STAR: Semantic-Temporal Adaptive Representation Learning for Few-Shot Action Recognition

    May 13, 2026Hongli Liu, Yu Wang, Shengjie ZhaoOpen-Vocabulary Action RecognitionPhotometric Supervision

  47. Task-Oriented Communication for Human Action Understanding via Edge-Cloud Co-Inference

    May 8, 2026Jingyi Liu, Cheng Yuan, Lijun He +2Edge PlatformsOpen-Vocabulary Action Recognition

  48. CFE-PPAR: Compression-friendly encryption for privacy-preserving action recognition leveraging video transformers

    May 7, 2026Haiwei Lin, Shoko Imaizumi, Hitoshi KiyaOpen-Vocabulary Action RecognitionVideo Compression

  49. VideoNet: A Large-Scale Dataset for Domain-Specific Action Recognition

    May 4, 2026Tanush Yadav, Mohammadreza Salehi, Jae Sung Park +6Open-Vocabulary Action RecognitionVideo Understanding

  50. CEZSAR: A Contrastive Embedding Method for Zero-Shot Action Recognition

    May 1, 2026Valter Estevam, Rayson Laroca, Helio Pedrini +1Open-Vocabulary Action RecognitionContrastive Learning

  51. High-Speed Vision Improves Zero-Shot Semantic Understanding of Human Actions

    May 1, 2026Yongpeng Cao, Yuji YamakawaOpen-Vocabulary Action RecognitionFine-Grained Video Understanding

  52. SASI: Leveraging Sub-Action Semantics for Robust Early Action Recognition in Human-Robot Interaction

    Apr 30, 2026Yongpeng Cao, Masahiro Hirano, Hyuno Kim +1Open-Vocabulary Action RecognitionHuman-Robot Interaction

  53. Student Classroom Behavior Recognition Based on Improved YOLOv8s

    Apr 30, 2026Xiang Gao, Shuai HangYolo26Open-Vocabulary Action Recognition