Fine-Grained Video Understanding

Latest papers 174

All topics
CardsList
  1. Multi-Label Perceptual Bug Detection in Video Games using Deep Learning on Gameplay Footage

    Oct 6, 2026Nahian Rifaat, Felix Morosov, Loutfouz ZamanFine-Grained Video Understanding

  2. MacJEPA: Missingness-Robust Audio-Visual Recognition from Untrimmed Egocentric Videos

    Oct 6, 2026Souptik Sen, Zahra AhmadiFine-Grained Video UnderstandingVideo Joint Embedding Predictive Architecture

  3. Joint Class-Time Learning for Video Classification with Multi-Instance Partial-Label Learning

    Oct 5, 2026Lingyu Shen, Wei Tang, Fakhri Karray +1Fine-Grained Video Understanding

  4. Controllable Multi-label Video Safety Detection via Adaptive Tversky Policy Optimization

    Oct 1, 2026Guangyu Yang, Jingbiao Mei, Mingsheng Sun +5Fine-Grained Video UnderstandingFrictive Policy Optimization

  5. Cog-VADU: A Training-Free Cognitive Reasoning Framework for Video Anomaly Detection and Understanding

    Oct 1, 2026Mohd Ubaid Wani, Sara Atito, Josef Kittler +1Training-Free Video Anomaly DetectionFine-Grained Video Understanding

  6. Can We Anticipate Violence? Multimodal Learning from Pre-Incident Behavioral Cues

    Sep 30, 2026Sindhuja Penchala, Mohammed Yusuf Mujawar, Noorbakhsh Amiri Golilarz +2Fine-Grained Video UnderstandingViolence Detection

  7. TSMD: Temporal-Stream Modality Dropout for Robust Video Highlight Detection

    Sep 30, 2026Bo-Yuan Cheng, Kuan-Yu Chen, Po-Han Huang +2Fine-Grained Video UnderstandingAi-Generated Video Detection

  8. Does Local Video Understanding Transfer Across Encounters? The EgoGears Benchmark

    Sep 29, 2026Yuedong Tan, Lei Qi, Yu Liu +13Egocentric VideoFine-Grained Video Understanding

  9. AffectReveal: Event-Grounded Emotion Recognition Beyond Visual Appearances

    Sep 29, 2026Yihao Qian, Runhao Zeng, Sicheng Zhao +3Emotion RecognitionFine-Grained Video Understanding

  10. W2Rep: Learning Visual Representations by Watching the World Change

    Sep 28, 2026Wen Huang, Hang Guo, Jiarui Yang +3Fine-Grained Video UnderstandingVision Encoders

  11. When Should the Count Change? Learning State Maintenance for Causal Video Counting

    Sep 28, 2026Pengyiang Liu, Dongyue Lyu, Junbo Niu +3Fine-Grained Video UnderstandingVision State Space Models

  12. Groupwise Selective State-Space Filtering for Accurate and Streaming Action Boundary Detection

    Sep 27, 2026Mustafa Bora ÇelikTemporal Action LocalizationFine-Grained Video Understanding

  13. Cross-modal Translation via Conditional Latent Denoising for Video Deepfake Detection

    Sep 27, 2026Xinzhe Li, Youzhi Tu, Kong Aik LeeDeepfake DetectionAi-Generated Video Detection

  14. LAYERSCOPE: A Layerwise Characterization of Video and Multimodal Learned Representations

    Sep 23, 2026Sandra Arcos-Holzinger, Debashish Chakraborty, Rohita Mocharla +7Multimodal RepresentationsFine-Grained Video Understanding

  15. Prompt, Probe, Train, or Annotate? Single-camera sports video understanding in amateur settings

    Sep 23, 2026Sai Varun Kodathala, Prashanth Pollishetty, Jaylen CargillFine-Grained Video UnderstandingAthleticism

  16. Action-Slot: Structured Action-Centric Representation Learning for Multi-Agent Atomic Activity Understanding

    Sep 21, 2026Yu-Ho Chang, Chi-Hsi Kung, Yi-Hsuan Tsai +1Object-Centric RepresentationsFine-Grained Video Understanding

  17. Video-STLayout Pre-training

    Sep 21, 2026Akash Abdu Jyothi, Greg MoriFine-Grained Video UnderstandingVision Encoders

  18. PROVIA: Procedure State Tracking for Online Mistake Detection in Egocentric Videos

    Sep 17, 2026Di Wen, Kailun Yang, Jimmy Weissert +7Egocentric VideoFine-Grained Video Understanding

  19. E-AVI: Evidence-Grounded Multimodal Assessment for Automated Video Interviews

    Sep 17, 2026Haoshen Wang, Dongbo Che, Zeyi Xie +3Multimodal EvaluationFine-Grained Video Understanding

  20. Divide and Conquer: Mixture-of-Bottleneck Experts in Informative Ordinal Space for Video-based Multimodal Sentiment Analysis

    Sep 16, 2026Ronghao Lin, Qiaolin He, Zefeng Lu +5Multimodal Sentiment AnalysisMultimodal Deep Learning

  21. Semantic-Aware Neural Video Codec for Error-Resilient Low-Latency Transmission

    Sep 14, 2026Matin Mortaheb, Homa Esfahanizadeh, Jinfeng Du +1Video CompressionFine-Grained Video Understanding

  22. Zero-shot video highlight detection based on text descriptions and synthetic images

    Sep 13, 2026Michal Byra, Alberto Presta, Grzegorz Stefanski +1Ai-Generated Video DetectionFine-Grained Video Understanding

  23. Beyond Similarity: Foundation Models as an Efficient Backbone for Training-Free Composed Video Retrieval

    Sep 9, 2026Dmitry Demidov, Muhammad Zaigham Zaheer, Omkar Thawakar +2Fine-Grained Video UnderstandingMultimodal Retrieval

  24. EgoSIS: From Factorized Visual Ego-Transitions to Motion-Canonical Spatial Evidence for UAV Reasoning

    Sep 8, 2026Jingpu Yang, Fengxian Ji, Mingxuan Cui +4Motion-Based PerceptionFine-Grained Video Understanding

  25. SoftRerank: Hierarchical Soft Fusion with Candidate-Label Reranking for Long-Tailed Micro-Action Recognition

    Sep 8, 2026Yichi Zhang, Zhichao Xia, Yanjun Chi +6Open-Vocabulary Action RecognitionFine-Grained Video Understanding

  26. Boundary Voting Network for Ambiguity-Aware Timestamp-Supervised Action Segmentation

    Sep 8, 2026Runzhong Zhang, Yueqi Duan, Yang Chen +4Temporal Action SegmentationFine-Grained Video Understanding

  27. Temporal Self-Distillation: Learning Visual State Tracking in Videos Without Supervision

    Sep 3, 2026Shravan Venkatraman, Wenshuai Zhao, Mohammad Hassan Vali +1Fine-Grained Video UnderstandingState-Tracking

  28. Real-Time Video Anomaly Detection Using YOLO Pose Estimation and CLIP-Based Semantic Scoring

    Aug 31, 2026Vanodhya G. Warnasooriya, Amir Hajian, Watchara Ruangsang +1Training-Free Video Anomaly DetectionYolo26

  29. TraVEL: Trajectory-Guided Video Embedding Learning for Driving-Video Retrieval

    Aug 13, 2026Yi-Chung Chen, Philip Jacobson, Tom Lampo +6Fine-Grained Video UnderstandingVisual Embeddings

  30. UniTraffic-Agent: Unified Traffic Video Reasoning for AI City Challenge 2026 Track 3 with Two Out-of-Domain Evaluations

    Aug 13, 2026Peng Li, Qianqian Xu, Shilong Bao +2Intelligent TransportationFine-Grained Video Understanding

  31. TD-VAD: Breaking Visual Dependence in Video Anomaly Detection with Text-Driven Learning

    Aug 12, 2026Shuangqing Zhang, Lei-Lei Ma, Zhao Wang +5Training-Free Video Anomaly DetectionFine-Grained Video Understanding

  32. Beyond Hazard Resemblance: Contrastive Event Adjudication for Training-Free Video Anomaly Detection

    Aug 10, 2026Wenti Yin, Xiang Wang, Huaxin Zhang +4Training-Free Video Anomaly DetectionFine-Grained Video Understanding

  33. Agreement-Based Audio-Visual Segmentation:Champion Report for the MeViS-Audio Track in the 8th LSVOS Challenge

    Aug 10, 2026Yiwen Ren, Jianing Liu, Yingxin Wang +4Video Object SegmentationFine-Grained Video Understanding

  34. Glance, Scrutinize, and Think: Advancing Video Anomaly Detection from Training-Free to Agentic Reasoning

    Aug 7, 2026Shibo Gao, Peipei Yang, Xu-Yao Zhang +1Training-Free Video Anomaly DetectionFine-Grained Video Understanding

  35. MuST-VAD: Mutual Structured Learning for Video Anomaly Detection

    Aug 7, 2026Satoshi Hashimoto, Hitoshi Nishimura, Mori KurokawaTraining-Free Video Anomaly DetectionFine-Grained Video Understanding

  36. Entity-Aware Sequence Transduction for Player-Centric Ball Action Spotting

    Aug 3, 2026Ruifeng Wang, Di Yang, Jiangtao WangTemporal Action LocalizationTemporal Attention

  37. HyperClaim: Fine-Grained Cross-Modal Hypergraph Reasoning for Video Misinformation Detection

    Jul 30, 2026Xiangbo Wang, Jiasheng Zhang, Xingtong Yu +2Fine-Grained Video UnderstandingAuthenticity

  38. ENCORE: Event-Assisted Complementary Motion Refinement for Learned Video Compression

    Jul 30, 2026Shuhan Ye, Hongbin Yu, Chenqi Kong +4Video CompressionFine-Grained Video Understanding

  39. Knowledge-Guided Multimodal Reasoning over Interacting Streams for Video-Level Ambivalence and Hesitancy Recognition

    Jul 28, 2026Podakanti Satyajith Chary, Barath Parthiban, Pranesh Velmurugan +2Cross-Modal ConflictsFine-Grained Video Understanding

  40. Knowledge-guided Disentanglement with Atomic Actions for Action Recognition

    Jul 28, 2026Tianci Wu, Siqi Cao, Guangming Zhu +6Open-Vocabulary Action RecognitionFine-Grained Video Understanding

  41. BasketEvent: Understanding Who Did What and When in Basketball Videos

    Jul 23, 2026Yu Zhang, Jiayuan Rao, Haoning Wu +1Fine-Grained Video Understanding

  42. Distribution-Alignment Bridge for Uncertainty-Aware Text-to-Video Retrieval

    Jul 23, 2026Kyeongmo Chae, Jihoon Lee, Sangtae AhnFine-Grained Video UnderstandingCross-Modal Alignment

  43. Sidewalk Moments: Are Richer Representations Always More Human-Aligned? Evidence from City-Walk Videos

    Jul 23, 2026Liu Liu, Freya Huying Tan, Fábio DuarteFine-Grained Video UnderstandingUrban Environments

  44. TOM-GS: Editable Video Representation via Temporal Opacity Modulation of Static 3D Gaussians

    Jul 21, 2026Marek Lisowski, Łukasz Smoliński, Kornel Howil +33D GaussianDynamic 3D Gaussian Splatting

  45. Context-structured Video Anomaly Detection with Large Vision-Language Models

    Jul 21, 2026Dongjun Kim, Changjae Oh, Andrea Cavallaro +1Training-Free Video Anomaly DetectionFine-Grained Video Understanding

  46. Sparse Evidence Can Suffice: Agentic Evidence Seeking for Multimodal Video Misinformation Detection

    Jul 20, 2026Haochen Zhao, Yongxiu Xu, Xinkui Lin +6Misinformation DetectionFine-Grained Video Understanding

  47. VLA-ReID: Video-Level Association for Re-Identification in Multi-Object Tracking with Highly Similar Objects

    Jul 19, 2026Yanrong Qin, Xiaoyan Cao, Yao YaoMulti-Object TrackingRe-Identification

  48. VideoSEMA: a scalable and efficient Mamba-like attention for video understanding

    Jul 16, 2026Nhat Thanh Tran, Fanghui Xue andShuai Zhang, Jiancheng Lyu +3Fine-Grained Video UnderstandingSpatio-Temporal Attention

  49. CF-Net: Conflict Fusion with Speaker Normalisation and Certainty Weighting for Ambivalence/Hesitancy Recognition

    Jul 15, 2026Tung Hung Bui, Hong Hai Nguyen, Van Thong HuynhCross-Modal ConflictsMultimodal Deep Learning

  50. RainDancer: RGB-Event Video Deraining with Rain-Oriented Spiking Dynamics

    Jul 15, 2026Kui Jiang, Runzhe Li, Zhaocheng Yu +3RgbtVideo Restoration