Fine-Grained Video Understanding

Latest papers 174

All topics
CardsList
  1. Multi-proposal Collaboration and Multi-task Training for Weakly-supervised Video Moment Retrieval

    May 14, 2026Bolin Zhang, Chao Yang, Bin Jiang +2Fine-Grained Video UnderstandingNeural Mask Estimation

  2. Beyond VMAF: Towards Application-Specific Metrics for Teleoperation Video

    May 13, 2026Ines Trautmannsheimer, Richard Grauberger, Frank DiermeyerVideo QualityFine-Grained Video Understanding

  3. DiffST: Spatiotemporal-Aware Diffusion for Real-World Space-Time Video Super-Resolution

    May 13, 2026Zheng Chen, Ruofan Yang, Jin Han +5Video Diffusion ModelsReal-World Image Super-Resolution

  4. Is Video Anomaly Detection Misframed? Evidence from LLM-Based and Multi-Scene Models

    May 12, 2026Furkan Mumcu, Michael J. Jones, Anoop Cherian +1Training-Free Video Anomaly DetectionFine-Grained Video Understanding

  5. MMVIAD: Multi-view Multi-task Video Understanding for Industrial Anomaly Detection

    May 11, 2026Xiran Zhao, Jing Jin, Yan Bai +6Multimodal Industrial Anomaly DetectionTraining-Free Video Anomaly Detection

  6. VVitCutLER: Towards Unsupervised Object Detection and Segmentation in Videos

    May 11, 2026Zhijing Lu, Khurram Azeem Hashmi, Didier Stricker +1Video Object SegmentationFine-Grained Video Understanding

  7. EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing

    May 9, 2026Huilai Li, Xiaomeng Di, Ying Xing +3Audio-Visual ReasoningFine-Grained Video Understanding

  8. SphereVAD: Training-Free Video Anomaly Detection via Geodesic Inference on the Unit Hypersphere

    May 8, 2026Chao Huang, Penfei Wei, Wei Wang +5Training-Free Video Anomaly DetectionFine-Grained Video Understanding

  9. Tracing the Arrow of Time: Diagnosing Temporal Information Flow in Video-LLMs

    May 8, 2026Peitao Han, Fei Cheng, Lis K. Pereira +2Fine-Grained Video UnderstandingSpatial Encoding

  10. Task-Oriented Communication for Human Action Understanding via Edge-Cloud Co-Inference

    May 8, 2026Jingyi Liu, Cheng Yuan, Lijun He +2Edge PlatformsOpen-Vocabulary Action Recognition

  11. Towards multi-modal forgery representation learning for AI-generated video detection and localization

    May 8, 2026Dat Le, Khoa Nguyen, Xin Wang +1Ai-Generated Video DetectionFine-Grained Video Understanding

  12. LookWhen? Fast Video Recognition by Learning When, Where, and What to Compute

    May 7, 2026Ali Salamatian, Anthony Fuller, Pritam Sarkar +3Fine-Grained Video UnderstandingComputational Cost

  13. Event-Causal RAG: A Retrieval-Augmented Generation Framework for Long Video Reasoning in Complex Scenarios

    May 7, 2026Peizheng Yan, Yu Zhao, Liang Xie +3Video UnderstandingFine-Grained Video Understanding

  14. Revisiting Uncertainty: On Evidential Learning for Partially Relevant Video Retrieval

    May 7, 2026Jun Li, Peifeng Lai, Xuhang Lou +5Fine-Grained Video UnderstandingMultimodal Retrieval

  15. VISTA: Video Interaction Spatio-Temporal Analysis Benchmark

    May 2, 2026Alejandro Aparcedo, Akash Kumar, Aaryan Garg +5Fine-Grained Video UnderstandingSpatio-Temporal Reasoning

  16. High-Speed Vision Improves Zero-Shot Semantic Understanding of Human Actions

    May 1, 2026Yongpeng Cao, Yuji YamakawaOpen-Vocabulary Action RecognitionFine-Grained Video Understanding

  17. Scaling Video Understanding via Compact Latent Multi-Agent Collaboration

    May 1, 2026Kerui Chen, Jinglu Wang, Jianrong Zhang +3Fine-Grained Video UnderstandingMultimodal Large Language Models

  18. PKS4\text{PKS}^4:Parallel Kinematic Selective State Space Scanners for Efficient Video Understanding

    Apr 29, 2026Lingjie Zeng, Hailun Zhang, Xiwen Wang +1Spatio-Temporal AttentionVision State Space Models

  19. HOI-aware Adaptive Network for Weakly-supervised Action Segmentation

    Apr 29, 2026Runzhong Zhang, Suchen Wang, Yueqi Duan +3Temporal Action SegmentationFine-Grained Video Understanding

  20. DualFact+: A Multimodal Fact Verification Framework for Procedural Video Understanding

    Apr 28, 2026Cennet Oguz, Yasser Hamidullah, Josef van Genabith +1Fine-Grained Video UnderstandingReference-Guided Multimodal In-Context Verification

  21. A Heterogeneous Two-Stream Framework for Video Action Recognition with Comparative Fusion Analysis

    Apr 25, 2026Md. Afzalur Rahaman, Tahmid RahmanOpen-Vocabulary Action RecognitionDual-Stream

  22. EmoTrans: A Benchmark for Understanding, Reasoning, and Predicting Emotion Transitions in Multimodal LLMs

    Apr 25, 2026He Hu, Tengjin Weng, Zebang Cheng +5Emotion RecognitionMultimodal Large Language Models

  23. One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition

    Apr 25, 2026Balaji Darur, Amanmeet Garg, Makarand TapaswiFine-Grained Video UnderstandingVideo Dataset

  24. All Eyes on the Workflow: Automated and Efficient Event Discovery from Video Streams

    Apr 24, 2026Marco Pegoraro, Jonas Seng, Dustin Heller +2Fine-Grained Video UnderstandingStreaming Video

  25. Efficient Logic Gate Networks for Video Copy Detection

    Apr 23, 2026Katarzyna FojcikAi-Generated Video DetectionDifferentiable Logic Gate Networks

  26. Temporal Prototyping and Hierarchical Alignment for Unsupervised Video-based Visible-Infrared Person Re-Identification

    Apr 23, 2026Zhiyong Li, Wei Jiang, Haojie Liu +3Re-IdentificationFine-Grained Video Understanding

  27. Micro-DualNet: Dual-Path Spatio-Temporal Network for Micro-Action Recognition

    Apr 22, 2026Naga VS Raviteja Chappa, Evangelos Sariyanidi, Lisa Yankowitz +4Fine-Grained Video UnderstandingSpatio-Temporal Network

  28. Exploring High-Order Self-Similarity for Video Understanding

    Apr 22, 2026Manjin Kim, Heeseung Kwon, Karteek Alahari +1Fine-Grained Video UnderstandingVideo Understanding

  29. Sink-Token-Aware Pruning for Fine-Grained Video Understanding in Efficient Video LLMs

    Apr 22, 2026Kibum Kim, Jiwan Kim, Kyle Min +4Visual Token PruningVideo Understanding

  30. A Computational Model of Message Sensation Value in Short Video Multimodal Features that Predicts Sensory and Behavioral Engagement

    Apr 21, 2026Haoning Xue, Jingwen Zhang, Xiaohui Wang +2Short Video BurstsSensory Feedback

  31. MOSA: Motion-Guided Semantic Alignment for Dynamic Scene Graph Generation

    Apr 21, 2026Xuejiao Wang, Bohao Zhang, Changbo Wang +1Spatio-Temporal Scene GraphsFine-Grained Video Understanding

  32. ReTrack: Evidence-Driven Dual-Stream Directional Anchor Calibration Network for Composed Video Retrieval

    Apr 20, 2026Zixu Li, Yupeng Hu, Zhiwei Chen +4Fine-Grained Video UnderstandingDual-Stream

  33. Frequency-guided Multi-level Reasoning for Scene Graph Generation in Video

    Apr 19, 2026Chenxing Li, Yiping Duan, Xiaoming TaoFine-Grained Video Understanding

  34. Motion-Guided Semantic Alignment with Negative Prompts for Zero-Shot Video Action Recognition

    Apr 18, 2026Yiming Wang, Frederick W. B. Li, Jingyun WangOpen-Vocabulary Action RecognitionZero-Shot

  35. Watching Movies Like a Human: Egocentric Emotion Understanding for Embodied Companions

    Apr 17, 2026Ze Dong, Hao Shi, Zejia Gao +3Emotion RecognitionTraining-Set Long-Tail Motions

  36. Causal Bootstrapped Alignment for Unsupervised Video-Based Visible-Infrared Person Re-Identification

    Apr 17, 2026Shuang Li, Jiaxu Leng, Changjiang Kuang +3Re-IdentificationFine-Grained Video Understanding

  37. RASR: Retrieval-Augmented Semantic Reasoning for Fake News Video Detection

    Apr 8, 2026Hui Li, Peien Ding, Jun Li +5Fake News DetectionFine-Grained Video Understanding

  38. AViS-Mamba: Adaptive Visual Steering of Audio State-Space Dynamics for Violence Detection

    Apr 2, 2026Damith Chamalke Senadeera, Dimitrios Kollias, Gregory SlabaughAudio-Visual ReasoningFine-Grained Video Understanding

  39. Spiking Patches: Asynchronous, Sparse, and Efficient Tokens for Event Cameras

    Oct 30, 2025Christoffer Koo Øhrstrøm, Ronja Güldenring, Lazaros NalpantidisSpatial TokensFine-Grained Video Understanding

  40. evMLP: An Efficient Event-Driven MLP Architecture for Vision

    Jul 2, 2025Zhentan ZhengFine-Grained Video UnderstandingVideo Dataset

  41. FuseMamba-VD: Dual Branch VideoMamba with Gated Class Token Fusion for Violence Detection

    May 23, 2025Damith Chamalke Senadeera, Muhammad Awais, Shibo Li +2Fine-Grained Video UnderstandingViolence Detection

  42. Hierarchical Relation-augmented Representation Generalization for Few-shot Action Recognition

    Apr 14, 2025Hongyu Qu, Ling Xing, Jiachao Zhang +3Open-Vocabulary Action RecognitionFine-Grained Video Understanding

  43. End-to-End Facial Expression Detection in Long Videos

    Apr 10, 2025Yini Fang, Alec F. Diallo, Frederic Jumelle +1Facial Expression RecognitionEmotion Recognition

  44. From My View to Yours: Learning Egocentric Cues from Exocentric Video using Privileged Egocentric Supervision

    Jan 10, 2025Dominick Reilly, Manish Kumar Govind, Le Xue +1Egocentric VideoEgocentric Vision

  45. XOV-Action: Towards Generalizable Open-Vocabulary Action Recognition

    Mar 3, 2024Kun-Yu Lin, Henghui Ding, Jia-Run Du +6Open-Vocabulary Action RecognitionFine-Grained Video Understanding

  46. Learning to Visually Connect Actions and their Effects

    Jan 19, 2024Paritosh Parmar, Eric Peh, Basura FernandoFine-Grained Video UnderstandingSelf-Supervised Learning