Video Captioning

Momentum

6 papers in the last four weeks, up 20% on the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 41

All topics
CardsList
  1. Beyond Anonymous Captions: Grounding Character Identity in Video Captioning and Question Answering

    Oct 7, 2026Anas Filali Razzouki, Killian Steunou, Khalil Guetari +3Video CaptioningVideo QA

  2. Comparative study of adapting pre-trained models for driving behavior video captioning

    Sep 30, 2026Sayak Mallick, Philipp Geiger, Augustin KelavaVLM AdaptationAutonomous Driving

  3. Causal-EVC: Breaking Emotional Spurious Causality via Spatiotemporal Grounding and Counterfactual Intervention

    Sep 29, 2026Cheng Ye, Weidong Chen, Peipei Song +1Video CaptioningMultimodal Emotion Recognition

  4. Beyond Binary Preferences: Graded Preference Optimization for Limb-Motion Captioning

    Sep 29, 2026Yanan Wang, Tingsong Li, Kaixun Jiang +3Direct Preference OptimizationVideo-Language Model Evaluation

  5. BodyCam-VQA: Enhanced Body-Worn Camera Video Captioning via Multimodal Reasoning and Probe Question Generation

    Sep 9, 2026Karish Gupta, Matthew Alex, Alex Li +6Video QAMultimodal Reasoning

  6. A Reverse Sign Language Dictionary: Open-Vocabulary Sign Recognition from Continuous Signing via Video Captioning and Description Retrieval

    Sep 3, 2026Santiago Poveda-Gutiérrez, Hideki Nakayama, Mayumi BonoVideo CaptioningVision-Language Retrieval

  7. StrAD: A Streaming Method and Benchmark for Audio Description Generation for Long-form Videos

    Aug 12, 2026Julian Spravil, Sebastian Houben, Sven BehnkeVideo Captioning

  8. Watching Synthetic Videos: Aligning Cross-modal Representations with Visual Synthesis for Zero-shot Video Captioning

    Aug 11, 2026Liangyu Fu, Junbo Wang, Yuke Li +3Video CaptioningVision-Language Alignment

  9. REFRAMED: Towards Realistic Audio Description Generation for Movies

    Aug 10, 2026Igor Sterner, Mirella Lapata, Alex Lascarides +1Video Captioning

  10. CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models

    Aug 5, 2026Mukhtiar Ali, Harsh Dubey, Sugam Mishra +1Video-Language Model EvaluationVideo Captioning

  11. Adaptive Emotional Video Captioning via Affective Heterogeneous Graph Reasoning and Multi-task Joint Learning

    Jul 31, 2026Junbo Wang, Liangyu Fu, Yuke Li +2Video CaptioningEmotion Representation in Language Models

  12. RefCaptioner: Multi-Reference Image-Grounded Video Captioning

    Jul 30, 2026Tengfei Liu, Yang Shi, Yuran Wang +16Video CaptioningVision-Language Grounding

  13. ProCap: Prominence-guided Object Rectification for Faithful and Comprehensive Video Captioning

    Jul 23, 2026Debjyoti Das Adhikary, Aritra Hazra, Partha Pratim ChakrabartiVideo CaptioningVision-Language Grounding

  14. PercepCap: Video Captioner with Structured Spatio-Temporal Perception

    Jul 22, 2026Yifan Xu, Zihao Wang, Zhixiao Wang +6Video CaptioningTemporal Video Understanding

  15. VEGAS: Human-Aligned Video Caption Evaluation via Gaze

    Jul 9, 2026Shenghui Chen, Po-han Li, Ximeng Sun +5Video Captioning

  16. Claim-Level Rubric Rewards for Video Caption Reinforcement Learning

    Jul 6, 2026Mingqi Gao, Hongyuan Dong, Yifei Chen +6Reward ModelingVideo Captioning

  17. Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning

    Jul 3, 2026Wenzheng Zeng, Siyi Jiao, Chen Gao +2Temporal Video GroundingVideo Captioning

  18. Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning

    Jul 2, 2026Chen Zhao, Jiajun Ma, Qilong Huang +6Audio-Visual UnderstandingVideo Captioning

  19. MotionAtlas: Detailed Region Captioning for Motion-Centric Videos

    Jun 28, 2026Weisong Liu, Haochen Wang, Kuan Gao +8Video CaptioningVideo-Language Models

  20. CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning

    Jun 23, 2026Xinyu Mao, Yuhui Zeng, Xiaokun Liu +6Video CaptioningVideo-Language Models

  21. CapRiCorn-1K: A Comprehensive Benchmark for Video Captioning and Subject Referential Consistency Across Temporal Scales

    Jun 20, 2026Xinlong Chen, Jiafu Tang, Yue Ding +12Video Captioning

  22. CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning

    Jun 8, 2026Penghui Yang, Long Xing, Xiaoyi Dong +10Image CaptioningMultimodal Pretraining

  23. OmniCap-IF: Benchmarking and Improving Instruction Following Abilities for Omni-Video Captioning

    Jun 7, 2026Jiahao Wang, An Ping, Yanghai Wang +13Video CaptioningMultimodal Generation

  24. Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction

    Jun 7, 2026Weidong Chen, Cheng Ye, Zhendong Mao +3Relation ExtractionVideo Captioning

  25. PEEK: Picking Essential frames via Efficient Knowledge distillation

    May 29, 2026Killian Steunou, Anas Filali Razzouki, Khalil Guetari +2Efficient VLM InferenceVideo Captioning