Video Dataset

Latest papers 103

All topics
CardsList
  1. Revisiting Ground-Truth Synthesis from High-Speed Video: Exact Validity Conditions and an Audited Consumer Capture Corpus

    Oct 4, 2026Abdullah Al Shafi, Sumaiya Rahim SumaMotion BlurVideo Restoration

  2. BossouChimpanzee: Long-term Chimpanzee Video Dataset

    Oct 4, 2026Daniel Schofield, Susana Carvalho, Vladimir Iashin +10Video Dataset

  3. AVSD-Scenes: A Dataset for Audio-Visual Description of Urban Scenes

    Oct 1, 2026Dhanunjaya Varma Devalraju, Arshdeep Singh, Mark D. PlumbleyAudio-Visual ReasoningMultimodal Dataset

  4. Fusing Visual and Textual Representations via Multi-layer Fusing Transformers for Vietnamese Visual Question Answering

    Oct 1, 2026Cong Phu Nguyen, Huy Tien Nguyen, Tung LeKnowledge-Based Visual Question AnsweringVideo Dataset

  5. I Have a Stream: Making Self-Supervised Learning Work on Continuous Video

    Sep 30, 2026Ivan Martinović, Lukas Knobel, Yuki M. AsanoSelf-Supervised LearningVideo Dataset

  6. Comparative study of adapting pre-trained models for driving behavior video captioning

    Sep 30, 2026Sayak Mallick, Philipp Geiger, Augustin KelavaAutonomous DrivingVision-Language Model Adaptation

  7. AVIO: Learning to Add and Remove Sounding Objects in Audiovisual Scenes

    Sep 29, 2026Weihan Xu, Kan Jen Cheng, Koichi Saito +8Audio-Visual ConsistencyVideo Object Removal

  8. High Dynamic Range Video Reconstruction from Single-Exposure Raw Sequences

    Sep 23, 2026Tao Zhang, Peixian Su, Xingyu Gao +6High Dynamic RangeVideo Restoration

  9. TReViS: Temporal Repetition Structure Aware Video Synthesis for Self-supervised Repetitive Action Counting

    Sep 21, 2026Fanqi Yu, Shengming Ma, Stefano Fiorini +4Video DatasetSelf-Supervised Learning

  10. ERCPMP-Gx: Endoscopic Image and Video Dataset for Morphological, Histopathological, and Genomic Characterization of Colorectal Polyposis

    Sep 17, 2026Zahra Ghaffari, Massih Bahar, Mojgan Forootan +2Polyp SegmentationColorectal Cancer

  11. Kairos: A Dataset for Fine-Grained Video-Language Modeling over Space, Time, and Dynamics

    Sep 8, 2026Ruibo Ming, Lei Sun, Deheng Zhang +8Video-Language ModelsVideo Dataset

  12. SynthGait-19K: A Physically Grounded Synthetic Video Dataset for Gait Parameter Estimation

    Sep 8, 2026Soroush Mehraban, Xin Lei Lin, Vida Adeli +5Gait AnalysisTraining-Set Long-Tail Motions

  13. SapiensID 2.0: Aligning Human Recognition Foundation Models with Human Perception

    Aug 11, 2026Yiyang Su, Jie Zhu, Feng Liu +2Re-IdentificationGait Recognition

  14. Sekai2: From World Exploration to Interactive World Modeling

    Aug 10, 2026Kang He, Wenshuo Peng, Zihui Gao +3Video World ModelsVideo Dataset

  15. MirrorWorld: Taming Video Diffusion Models for Mirror Reflection Generation

    Aug 7, 2026Youjun Zhao, Alex Warren, Gary K. L. Tam +1Video Diffusion ModelsVideo Dataset

  16. Cooking beyond Frames: A Stereo Event Camera Dataset in the Kitchen

    Aug 5, 2026Chengming Feng, Hesam Araghi, Liming Zheng +4Human Activity RecognitionVideo Dataset

  17. A Low-Cost Hybrid Reservoir Computing Model for Isolated Sign Language Video Recognition

    Aug 4, 2026Nitin Kumar Singh, Arie Rachmad Syulistyo, Yuichiro Tanaka +1Sign Language TranslationReservoir Computing

  18. GraphVid: Interactive Graph-Controllable Video Generation

    Jul 23, 2026Vedant Shah, Onkar Susladkar, Tushar Prakash +5Video DatasetHuman Motion Generation

  19. Vera: Identity-Faithful Human Subject-to-Video Generation

    Jul 22, 2026Yulong Xu, Xinyue Liu, Shujuan Li +6Video Dataset

  20. Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation

    Jul 21, 2026Amber Yijia Zheng, Lu Liu, Raymond A. Yeh +1Text-To-Video Generation ModelVideo Dataset

  21. Continual Video-MLLM Adaptation over Evolving Domains

    Jul 21, 2026Rui Cheng, Meixing Shi, Yuxiang Cai +3Vision-Language Model AdaptationDomain Adaptation

  22. Music-to-Dance Generation via Atomic Movements

    Jul 15, 2026Xinhao Cai, Yixuan Sun, Minghang Zheng +4DuetHuman Motion Generation

  23. AU-Guided Synthetic Video Generation for Micro-Expression Recognition

    Jul 12, 2026Pei-Sze Tan, Sailaja Rajanala, Yee-Fan Tan +2Video DatasetVideo Generation

  24. Compositional Context Fine-Tuning Vision-Language Model for Complex Assembly Action Understanding from Videos

    Jul 12, 2026Hao Zheng, Jinyi Huang, Tiantian Zheng +2Diffusion-Based Vision-Language-ActionsOpen-Vocabulary Action Recognition

  25. InterPet4D: A Multimodal 4D Human-Pet Interaction Dataset for Pet Motion Generation

    Jul 11, 2026Yichen Peng, Jyun-Ting Song, Chen-Chieh Liao +3Training-Set Long-Tail MotionsMultimodal Dataset

  26. OpenCoF: Learning to Reason Through Video Generation

    Jul 9, 2026Xinyan Chen, Ziyu Guo, Renrui Zhang +2Video GenerationVideo Understanding

  27. VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness

    Jul 9, 2026Iulia-Maria Udrea, Alexandra Diaconu, Bogdan AlexeHigh Confidence Pseudo-LabelsVideo Dataset

  28. Evaluating the Effect of Frame Rate in Sequence-Based Classification of Autism-Related Self-Stimulatory Hand Idiosyncrasies

    Jul 8, 2026Raunak Mondal, Peter WashingtonAutism Spectrum DisorderSelf-Supervised Learning

  29. InFlux++: Real and Synthetic Data for Estimating Dynamic Camera Intrinsics

    Jul 6, 2026Erich Liang, Caleb Kha-Uong, Chinmaya Saran +5Camera IntrinsicsCamera

  30. Conversational Human Audio-visual Talking Dialogue Generation

    Jul 2, 2026Junhao Song, Lluis Guasch, Xilin He +8Conversational DatasetsAudio-Video Generation

  31. NeoMap: Training-free Novel-View Synthesis from Single Images and Videos

    Jul 2, 2026Jinxi Li, Tianyi Zhang, Yafei Yang +4Novel View SynthesisVideo Dataset

  32. Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing

    Jun 29, 2026Sen Liang, Cong Wang, Zhentao Yu +8Video EditingVideo Dataset

  33. OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data

    Jun 29, 2026Kaixing Yang, Jiashu Zhu, Xulong Tang +8DuetVideo Dataset

  34. Computer Vision for MOBA Analytics: A Dataset and Baseline for Visibility Analysis in Dota 2

    Jun 25, 2026Ricardo da Rocha Carvalho, Eloísa Oliveira, Luiz Bernardo Martins Kummer +2VisibilityMotion-Based Perception

  35. FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset

    Jun 24, 2026Sunshiyu Wang, Alexander LerchVideo DatasetArt

  36. SurgAtlas: A Large-Scale Surgical Video-Language Dataset with 2,391 Hours of Open and Minimally Invasive Surgery

    Jun 24, 2026Filippos Bellos, Andre S. Gala-Garza, Miaowei Wang +8Surgical VideosSurgery

  37. SignNet-1M: Large-Scale Multilingual Sign Language Video Dataset with Downstream Benchmarks

    Jun 23, 2026Zhewen He, Junyi Hu, Haomian Huang +3Video DatasetMotion

  38. Zero-Shot Vision-Language Models for Classroom Engagement Recognition: A Benchmark Study of Prompt Sensitivity and Cross-Dataset Generalization

    Jun 20, 2026Aman Goyal, Kshama Nitin Shah, Kemmannu Vineet Venkatesh RaoClassroomsVideo Dataset

  39. GIM-ENDO: A Multimodal Endoscopic Image and Video Dataset for Gastric Intestinal Metaplasia Morphology and Pathology

    Jun 18, 2026Mojgan Forootan, Mahziar Setayeshfar, Ali Darvishi +2Colorectal CancerColonoscopy

  40. XmoPipe: A Pipeline for Large-Scale In-the-Wild Human Motion Dataset Construction

    Jun 17, 2026Nathan Salazar, Emmanuel Dellandréa, Mathieu Lefort +1Training-Set Long-Tail MotionsVideo Dataset

  41. ActWorld: From Explorable to Interactive World Model via Action-Aware Memory

    Jun 16, 2026Zhexiao Xiong, Yizhi Song, Hao Kang +11Video World ModelsMany Worlds

  42. Revealing Artifacts via Noise Amplification: A Novel Perspective for AI-Generated Video Detection

    Jun 15, 2026Renxi Cheng, Jie Gui, Hongsong WangAi-Generated Video DetectionGenerative Video Models

  43. Multi-view feature High-order Fusion for Space Weak Object Detection and Segmentation

    Jun 13, 2026Weilong Guo, Yuhan Sun, Shengyang LiCross-View FusionFeature Pyramid

  44. EvTexture++: Event-Driven Texture Enhancement for Video Super-Resolution

    Jun 11, 2026Dachun Kai, Jiayao Lu, Yueyi Zhang +1Image EnhancementTexture

  45. A Large Scale Open-Source Image and Video Dataset for Robust Wildfire Detection and Classification

    Jun 8, 2026Emadeldeen Hamdan, Yingyi Luo, B. Ugur Toreyin +4Wildfire DetectionWildfire

  46. Streaming Interventions: Can Video Large Language Models Correct Mistakes as They Occur?

    Jun 8, 2026Apratim Bhattacharyya, Shweta Mahajan, Sanjay Haresh +5Large Language Models FailInstruction-Tuned Models

  47. CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning

    Jun 8, 2026Penghui Yang, Long Xing, Xiaoyi Dong +10Video CaptioningVideo Dataset

  48. Detecting Temporally Localized Manipulations in Authentic Video Streams

    Jun 5, 2026Okan Umur, Ali Emre Güşlü, Ibrahim DelibasogluAi-Generated Video DetectionDeepfake Detection

  49. Beyond Universality: The GCC-FER Dataset and Culture-Aware Adaptation for Dynamic Facial Expression Recognition

    Jun 5, 2026Sonalika Singh, Jyotirindra Dandapat, Avishi Razdan +3Facial Expression RecognitionVideo Dataset

  50. What Matters When Cotraining Robot Manipulation Policies on Everyday Human Videos?

    Jun 4, 2026Richard Li, Aditya Prakash, Andrew Wen +3Robotic Manipulation PoliciesRobot Systems

  51. StoryVideoQA: Scaling Deep Video Understanding with a Large-Scale, Multi-Genre and Auto-Generated Dataset

    Jun 4, 2026Zhengqian Wu, Zhixian Liu, Aodong Chen +6Long Video Question AnsweringVideo Dataset

  52. 4D Reconstruction from Sparse Dynamic Cameras

    Jun 3, 2026Kazuki Ozeki, Shun Kenney, Yuto Shibata +64D ReconstructionMonocular Video

  53. JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation

    Jun 2, 2026Yinan Chen, Chuming Lin, Zhennan Chen +12Video EditingVideo Dataset

  54. Cohort-Scale Neural Atlases of Ultrasound Video

    May 30, 2026Zhuorui Zhang, Roger Pallarès-López, Xuan Wu +2Clinical Ultrasound DatasetAnatomy

  55. ST-ColoNet: Spatio-Temporal Colon Segment Recognition via Hybrid Attention and Edge-Guided Feature Learning

    May 27, 2026Crystal Cai, Ziyi Wang, Zhengjie Zhang +3Polyp SegmentationColonoscopy