Captions

Momentum

3 papers in the last four weeks, down 25% on the four weeks before. 0.0% of all new papers.

Jul 6Week of Sep 21

Latest papers 26

All topics
CardsList
  1. PANORAMA: Panoptic Grounded Captioning via Mask Proposal Selection

    Sep 16, 2026Sara Pieri, Evangelos Kazakos, Shizhe Chen +2Panoptic SegmentationImage Difference Captioning

  2. A Reverse Sign Language Dictionary: Open-Vocabulary Sign Recognition from Continuous Signing via Video Captioning and Description Retrieval

    Sep 3, 2026Santiago Poveda-Gutiérrez, Hideki Nakayama, Mayumi BonoSign Language TranslationSign

  3. CAPEval: A Decoupled Caption Evaluation across Understanding and Generation

    Aug 3, 2026Zhipeng Liu, Haochen Wang, Zhaoxiang ZhangCaptionsMultimodal Understanding

  4. Entity-Faithful Repair of Synthetic Supervision for Zero-Shot Image Captioning

    Aug 2, 2026Zhiyue Liu, Wenkai Zhou, Jian Qin +1Image Difference CaptioningImage-Text Alignment

  5. Holo-Captioning: Toward the Text Equivalent of 3D Scenes

    Jul 3, 2026Kun-Yu Lin, Chengke Bu, Zhenguo Li +13D Scene Understanding3D Generation

  6. Rigel: Self-Distilled Score Adaptation for Image and Video Captioning Evaluation

    Jun 29, 2026Shuitsu Koyama, Kazuki Matsuda, Yuiga Wada +3CaptionsVideo Captioning

  7. GAVEL: Grounded Caption Error Verification and Localization

    Jun 25, 2026Zixian Gao, Atsushi Hashimoto, Kuniaki SaitoImage-Text PairsCaptions

  8. ATCCaps: A Call-Sign-Aware Speech Dataset for Air Traffic Control Recognition

    Jun 21, 2026Dongdong Li, Jianwei Song, Jianwei Wang +1Automatic Speech Recognition EvaluationCaptions

  9. Bagpiper-Edit: Zero-Shot Open-Ended Audio Editing via Rich-Caption

    Jun 19, 2026Xun Gong, Jinchuan Tian, Haoran Wang +3Audio EditingText-To-Audio

  10. Frames2LoRA: Parametric Video Internalization for Vision-Language Models

    Jun 3, 2026Manan Suri, Sarvesh Baskar, Dinesh ManochaMulti-LoraCaptions

  11. CodecCap: High-Fidelity Codec-Inspired Residual Modeling for Dense Video Captioning

    May 26, 2026Zihan Lin, Songhe Deng, Shuwei He +6Video CaptioningCaptions

  12. MinhwaNet: Faithful but Insufficient Object Grounding in Korean Folk Painting

    May 26, 2026Joonhyung BaeArtCaptions

  13. BEiTScore: Reference-free Image Captioning Evaluation with an Efficient Cross-Encoder Model

    May 20, 2026Gonçalo Gomes, Bruno Martins, Chrysoula ZervaImage Difference CaptioningCaptions

  14. Query-Dependent Use of Generated Descriptions for Reliable Visual Question Answering

    May 3, 2026Zeshang Li, Shuoyang ZhangCaptionsAI Trustworthiness

  15. One Single Hub Text Breaks CLIP: Identifying Vulnerabilities in Cross-Modal Encoders via Hubness

    Apr 30, 2026Hiroyuki Deguchi, Katsuki Chousa, Yusuke SakaiCross-ModalCaptions

  16. CANVAS: Captioning Art with Narrative Visual-Audio AI Systems

    Apr 30, 2026Vignesh NagarajanVideo CaptioningCaptions

  17. VLM Judges Can Rank but Cannot Score: Task-Dependent Uncertainty in Multimodal Evaluation

    Apr 28, 2026Divake Kumar, Sina Tayebati, Devashri Naik +2Multimodal EvaluationLarge Language Model Judges

  18. Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions

    Feb 5, 2026Jinchuan Tian, Haoran Wang, Bo-Hao Su +14Audio UnderstandingNeural Audio

  19. Aligning Audio Captions with Human Preferences

    Sep 18, 2025Kartik Hegde, Rehana Mahfuz, Yinyi Guo +1Video CaptioningCaptions