Multimodal Reward Modeling

Momentum

5 papers in the last four weeks, against 2 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 59

All topics
CardsList
  1. MT-EditFlow: Reinforcement Learning for Multi-Turn Image Editing with Flow Matching

    Jun 1, 2026Jiahui Huang, Yasi Zhang, Tianyu Chen +6Multimodal Reward ModelingRL for Generative Models

  2. MuPHI: Learning Implicit Multimodal Harm Reasoning via Semantically Grounded Reward Optimization

    May 28, 2026Anisha Saha, Varsha Suresh, Teodora Kamova +3VLM RobustnessMultimodal Reasoning

  3. Refining Multidimensional Video Reward Models via Disentangled Influence Functions

    May 27, 2026Muyao Wang, Zeke Xie, Hideki NakayamaReward ModelingTraining Data Selection

  4. VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning

    May 27, 2026Xingyu Lu, Jinpeng Wang, Yi-Fan Zhang +13Image CaptioningObject Hallucination in VLMs

  5. DyCoRM: Dynamic Criterion-Aware Reward Modeling for Text-to-Image Generation

    May 25, 2026Jiaying Qian, Ziheng Jia, Qian Zhang +5Reward ModelingT2I Generation

  6. From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models

    May 22, 2026Christian Gumbsch, Leonardo Barcellona, Lennard Schünemann +7RL for RoboticsMultimodal Reward Modeling

  7. DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification

    May 10, 2026Rui Liu, Dian Yu, Zhenwen Liang +6Multimodal Large Language ModelsMultimodal Reward Modeling

  8. ProcVLM: Learning Procedure-Grounded Progress Rewards for Robotic Manipulation

    May 9, 2026Youhe Feng, Hansen Shi, Haoyang Li +7Long-Horizon Robotic ManipulationMultimodal Reward Modeling

  9. RewardHarness: Self-Evolving Agentic Post-Training

    May 9, 2026Yuxuan Zhang, Penghui Du, Bo Li +11Reward ModelingImage Editing Evaluation

  10. Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria

    May 8, 2026Juanxi Tian, Fengyuan Liu, Jiaming Han +6Policy OptimizationMultimodal Reward Modeling

  11. Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models

    May 8, 2026Yuancheng Wei, Linli Yao, Lei Li +4Reward ModelingMultimodal Reward Modeling

  12. ReasonEdit: Towards Interpretable Image Editing Evaluation via Reinforcement Learning

    May 8, 2026Honghua Chen, Zitong Xu, Huiyu Duan +3Image Editing EvaluationText-Guided Image Editing

  13. Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling

    May 7, 2026Yuan Wang, Ouxiang Li, Yulong Xu +8Reward ModelingMultimodal Reward Modeling

  14. RoboAlign-R1: Distilled Multimodal Reward Alignment for Robot Video World Models

    May 5, 2026Hao Wu, Yuqi Li, Yuan Gao +10Multimodal Reward ModelingWorld Model Evaluation

  15. ProMMSearchAgent: A Generalizable Multimodal Search Agent Trained with Process-Oriented Rewards

    Apr 22, 2026Wentao Yan, Shengqin Wang, Huichi Zhou +4Multimodal IRProcess Reward Models

  16. DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling

    Apr 21, 2026Zhihong Zhang, Jie Zhao, Xiaojian Huang +5Multimodal Reward ModelingPreference Learning

  17. Lost in Translation: Do LVLM Judges Generalize Across Languages?

    Apr 21, 2026Md Tahmid Rahman Laskar, Mohammed Saidul Islam, Mir Tafseer Nayeem +5VLM EvaluationMultilingual VLM Evaluation

  18. DriveVLM-RL: Neuroscience-Inspired Reinforcement Learning with Vision-Language Models for Safe and Deployable Autonomous Driving

    Mar 18, 2026Zilin Huang, Zihao Sheng, Zhengyang Wan +4VLMs for Autonomous DrivingLLM-Guided RL

  19. Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models

    Feb 7, 2026Yankai Yang, Yancheng Long, Hongyang Wei +12Reward ModelingMultimodal Reward Modeling

  20. Omni-RRM: Advancing Omni Reward Modeling via Automatic Rubric-Grounded Preference Synthesis

    Jan 31, 2026Zicheng Kong, Dehua Ma, Zhenbo Xu +9Reward ModelingRL for Language Models

  21. Understanding Reward Hacking in Text-to-Image Reinforcement Learning

    Jan 6, 2026Yunqi Hong, Kuei-Chun Kao, Hengguang Zhou +1Reward HackingMultimodal Reward Modeling

  22. RubricRL: Simple Generalizable Rewards for Text-to-Image Generation

    Nov 25, 2025Xuelu Feng, Yunsheng Li, Ziyu Wan +4Reward ModelingT2I Generation

  23. Rethinking Reward Signals in Video GRPO: When Scores Become Targets

    Nov 24, 2025Rui Li, Yuanzhi Liang, Ziqi Ni +3Reward HackingRL for Video Generation

  24. SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models

    Oct 14, 2025Weiyang Jin, Yuwei Niu, Jiaqi Liao +4Unified Multimodal ModelsT2I Generation

  25. GUI-PRA: Process Reward Agent for GUI Tasks

    Sep 27, 2025Tao Xiong, Xavier Hu, Yurun Chen +6Process Reward ModelsGUI Agents