Video Representation Learning

Latest papers 87

All topics
CardsList
  1. The TIME Machine: On The Power of Motion for Efficient Perception

    May 21, 2026Mantas Skackauskas, Xinyue Hao, Laura Sevilla-LaraRepresentation LearningVideo Representation Learning

  2. Seeing Through Fog: Towards Fog-Invariant Action Recognition

    May 20, 2026Enqi Liu, Liyuan Pan, Zhi Gao +2Video Action RecognitionVideo Representation Learning

  3. Towards Data-Efficient Video Pre-training with Frozen Image Foundation Models

    May 18, 2026Svetlana Orlova, Niccolò Cavagnero, Gijs DubbelmanStreaming Video UnderstandingVision Foundation Model Adaptation

  4. Latent Video Prediction for World Modeling: An Evaluation Uncovering Intriguing Favorable Evidence

    May 15, 2026Ali J Alrasheed, Aryan Yazdan Parast, Basim Azam +2Video Representation LearningVideo Prediction

  5. STAR: Semantic-Temporal Adaptive Representation Learning for Few-Shot Action Recognition

    May 13, 2026Hongli Liu, Yu Wang, Shengjie ZhaoCross-Modal Representation LearningFew-Shot Learning

  6. Contrastive Learning under Noisy Temporal Self-Supervision for Colonoscopy Videos

    May 12, 2026Luca Parolari, Pietro Gori, Lamberto Ballan +2Contrastive LearningEndoscopy

  7. Hi-GaTA: Hierarchical Gated Temporal Aggregation Adapter for Surgical Video Report Generation

    May 11, 2026Kedi Sun, Chaohui Dang, Yue Feng +3Surgical Video UnderstandingVideo Representation Learning

  8. Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation

    May 9, 2026Yang Xiao, Huiyuan Chen, Kaiyuan Deng +5Video Representation LearningEmbedding Compression

  9. LookWhen? Fast Video Recognition by Learning When, Where, and What to Compute

    May 7, 2026Ali Salamatian, Anthony Fuller, Pritam Sarkar +3Efficient ViTsVideo Action Recognition

  10. HumanNet: Scaling Human-centric Video Learning to One Million Hours

    May 7, 2026Yufan Deng, Daquan ZhouHuman Activity RecognitionCross-Embodiment Robot Learning

  11. Video Generation with Predictive Latents

    May 4, 2026Yian Zhao, Feng Wang, Qiushan Guo +4Variational AutoencodersPredictive Coding

  12. TRIMMER: A New Paradigm for Video Summarization through Self-Supervised Reinforcement Learning

    May 3, 2026Pritam Mishra, Coloma Ballester, Dimosthenis KaratzasReinforcement LearningVideo Summarization

  13. Featurising Pixels from Dynamic 3D Scenes with Linear In-Context Learners

    Apr 29, 2026Nikita Araslanov, Martin Sundermeyer, Hidenobu Matsuki +2Video Representation Learning3D Scene Understanding

  14. Micro-Expression-Aware Avatar Fingerprinting via Inter-Frame Feature Differencing

    Apr 25, 2026Masoumeh Chapariniya, Jean-Marc Odobez, Volker Dellwo +1Biometric IdentificationVideo Representation Learning

  15. Efficient Logic Gate Networks for Video Copy Detection

    Apr 23, 2026Katarzyna FojcikEfficient Neural Network InferenceVideo Representation Learning

  16. Temporal Prototyping and Hierarchical Alignment for Unsupervised Video-based Visible-Infrared Person Re-Identification

    Apr 23, 2026Zhiyong Li, Wei Jiang, Haojie Liu +3Prototype LearningVideo Representation Learning

  17. Motion-Guided Semantic Alignment with Negative Prompts for Zero-Shot Video Action Recognition

    Apr 18, 2026Yiming Wang, Frederick W. B. Li, Jingyun WangRepresentation LearningVideo Action Recognition

  18. GTASA: Ground Truth Annotations for Spatiotemporal Analysis, Evaluation and Training of Video Models

    Apr 12, 2026Nicolae Cudlenco, Mihai Masala, Marius LeordeanuSynthetic Data GenerationVideo Representation Learning

  19. LRConv-NeRV: Low Rank Convolution for Efficient Neural Video Compression

    Mar 18, 2026Tamer ShanablehVideo Representation LearningNeural Video Compression

  20. Xray-Visual Models: Scaling Vision models on Industry Scale Data

    Feb 18, 2026Shlok Mishra, Tsung-Yu Lin, Linda Wang +24Vision Foundation ModelsMultimodal Pretraining

  21. SurgMotion: A Video-Native Foundation Model for Universal Understanding of Surgical Videos

    Feb 5, 2026Jinlin Wu, Felix Holm, Chuxi Chen +18Joint-Embedding Predictive ArchitectureSurgical Video Understanding

  22. Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End Driving

    Jan 29, 2026Linhan Wang, Zichong Yang, Chen Bai +6End-to-End Autonomous DrivingJoint-Embedding Predictive Architecture

  23. FedVideoMAE: Efficient Federated Video Moderation with Differential Privacy and Secure Aggregation

    Dec 21, 2025Ziyuan Tao, Chuanzhi Xu, Sandaru Jayawardana +4Federated Learning AggregationVideo Content Moderation

  24. Structured-Noise Masked Modeling for Video, Audio and Beyond

    Mar 20, 2025Aritra Bhowmik, Carlos Hinojosa, Fida Mohammad Thoker +2Audio Representation LearningVideo Representation Learning