Multimodal Reward Modeling

Momentum

5 papers in the last four weeks, against 2 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 59

All topics
CardsList
  1. Think Before You Score: Thinking Reward Model for Visual Generation

    Sep 29, 2026Xuehai Bai, Zhenchen Tang, Yang Shi +9Reward ModelingMultimodal Reward Modeling

  2. SkillRubric: Co-Evolving Actor Guidance and Evaluator Rubrics for Multimodal Agents

    Sep 28, 2026Bingqing Jiang, Guoxi Zhang, Jasper Wang +7Multimodal Reward ModelingRubric-Based RL

  3. ARS: Agentic Reward System for Robot Learning

    Sep 28, 2026Sheng Hu, Weiyi Lu, Lingbing Zeng +5RL for RoboticsProcess Reward Models

  4. Diffusion Reward Models

    Sep 27, 2026Xiangyang Wang, Bingxiang He, Zeyuan Liu +13Reward ModelingMultimodal Reward Modeling

  5. RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling

    Sep 19, 2026Zhenchen Tang, Yang Li, Songlin Yang +6Reward ModelingMultimodal Reward Modeling

  6. WorldReward: Reward Modeling for Camera-Conditioned World Models

    Sep 3, 2026Yibin Wang, Zehan Wang, Junshu Tang +13Reward ModelingCamera-Conditioned Video Generation

  7. RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance

    Aug 10, 2026Dongchi Huang, Hongyin Zhang, Bohan Hou +11Reward ModelingRobot Foundation Models

  8. TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models

    Aug 9, 2026Yidong Wang, Yan Zhan, Ziteng Feng +16Reward ModelingPairwise Preference Evaluation

  9. Evaluation-Verification Reward for Consistent Multi-Reference Image Editing

    Jul 31, 2026Yingmao Miao, Pengfei Zhang, Xiaochen Lv +5Image Editing EvaluationMultimodal Reward Modeling

  10. OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

    Jul 30, 2026Qiushi Sun, Kanzhi Cheng, Yian Wang +20VLM EvaluationComputer-Use Agent Benchmarks

  11. DenseReward: Dense Reward Learning via Failure Synthesis for Robotic Manipulation

    Jul 14, 2026Yu Fang, Wanxi Dong, Jiaqi Liu +7RL for RoboticsReward Modeling

  12. Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation

    Jul 13, 2026Runhui Huang, Qihui Zhang, Zhe Liu +3T2I GenerationMultimodal Reward Modeling

  13. Multimodal Reward Hacking in Reinforcement Learning

    Jul 10, 2026Jiayu Yao, Yiwei Wang, Anmeng Zhang +5Multimodal Large Language ModelsMultimodal Reward Modeling

  14. CoRe: Combined Rewards with Vision-Language Model Feedback for Preference-Aligned Reinforcement Learning

    Jul 2, 2026Hexian Ni, Tao Lu, Yinghao CaiRobotic RLMultimodal Reward Modeling

  15. VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning

    Jul 1, 2026Kuan-Chen Chen, Winston Chen, Wei-Fang Sun +1Multimodal Reward ModelingReward Design for RL

  16. Vision-Language Procedural Reasoning for Context-Aware Reward Modeling of Robotic Endovascular Guidewire Navigation

    Jun 29, 2026Wentong Tian, Jiyuan Zhao, Tianliang Yao +4RL for RoboticsRobotic Endovascular Intervention

  17. DiT-Reward: Generative Representations for Text-to-Image Reward Modeling

    Jun 22, 2026Yuanming Yang, Guoqing Ma, Bo Wang +5Representation LearningDiffusion Transformer

  18. Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views

    Jun 22, 2026Jiho Choi, Seonho Lee, Seojeong Park +1Visual Question AnsweringActive Perception

  19. Reasoning as Intersection: Consensus-Frame Alignment for Visual Focus in Video-MLLMs

    Jun 16, 2026Chengwen Liu, Zhe Huang, Jisheng Dang +3Multimodal Reward ModelingVideo Reasoning

  20. MathVis-Fine: Aligning Visual Supervision with Necessity via Progressive Dependency-Guided Training for Multimodal Mathematical Reasoning

    Jun 16, 2026Wanshi Xu, Haokun Zhao, Haidong Yuan +2Multimodal ReasoningMultimodal Reward Modeling

  21. CORA: Analyzing and bridging thinking-answer gap in Multimodal RLVR via Consistency-Oriented Reasoning Alignment

    Jun 12, 2026Jiayue Cao, Zhicong Lu, Xuehan Sun +6Multimodal Reward ModelingVLM Reasoning

  22. HPSv3++: Scaling Reward Models Across the Full Spectrum of Diffusion Model Capabilities

    Jun 12, 2026Yijun Liu, Jie Huang, Zeyue Xue +5Diffusion Model AlignmentMultimodal Reward Modeling

  23. SARM2: Multi-Task Stage Aware Reward Modeling for Self Improving Robotic Manipulation

    Jun 9, 2026Qianzhong Chen, Hau Zheng, Justin Yu +8RL for RoboticsReward Modeling

  24. Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions

    Jun 8, 2026Xin Jin, Huanqia Cai, Zhen Li +9Reward ModelingReasoning Distillation

  25. Improving Multimodal Reasoning via Worst Dimension Optimization

    Jun 5, 2026Haocheng Lv, Huaping Zhang, Qiuchi Li +2Process Reward ModelsMultimodal Reasoning

  26. MT-EditFlow: Reinforcement Learning for Multi-Turn Image Editing with Flow Matching

    Jun 1, 2026Jiahui Huang, Yasi Zhang, Tianyu Chen +6Multimodal Reward ModelingRL for Generative Models

  27. MuPHI: Learning Implicit Multimodal Harm Reasoning via Semantically Grounded Reward Optimization

    May 28, 2026Anisha Saha, Varsha Suresh, Teodora Kamova +3VLM RobustnessMultimodal Reasoning

  28. Refining Multidimensional Video Reward Models via Disentangled Influence Functions

    May 27, 2026Muyao Wang, Zeke Xie, Hideki NakayamaReward ModelingTraining Data Selection

  29. VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning

    May 27, 2026Xingyu Lu, Jinpeng Wang, Yi-Fan Zhang +13Image CaptioningObject Hallucination in VLMs

  30. DyCoRM: Dynamic Criterion-Aware Reward Modeling for Text-to-Image Generation

    May 25, 2026Jiaying Qian, Ziheng Jia, Qian Zhang +5Reward ModelingT2I Generation

  31. From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models

    May 22, 2026Christian Gumbsch, Leonardo Barcellona, Lennard Schünemann +7RL for RoboticsMultimodal Reward Modeling

  32. DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification

    May 10, 2026Rui Liu, Dian Yu, Zhenwen Liang +6Multimodal Large Language ModelsMultimodal Reward Modeling

  33. ProcVLM: Learning Procedure-Grounded Progress Rewards for Robotic Manipulation

    May 9, 2026Youhe Feng, Hansen Shi, Haoyang Li +7Long-Horizon Robotic ManipulationMultimodal Reward Modeling

  34. RewardHarness: Self-Evolving Agentic Post-Training

    May 9, 2026Yuxuan Zhang, Penghui Du, Bo Li +11Reward ModelingImage Editing Evaluation

  35. Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria

    May 8, 2026Juanxi Tian, Fengyuan Liu, Jiaming Han +6Policy OptimizationMultimodal Reward Modeling

  36. Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models

    May 8, 2026Yuancheng Wei, Linli Yao, Lei Li +4Reward ModelingMultimodal Reward Modeling

  37. ReasonEdit: Towards Interpretable Image Editing Evaluation via Reinforcement Learning

    May 8, 2026Honghua Chen, Zitong Xu, Huiyu Duan +3Image Editing EvaluationText-Guided Image Editing

  38. Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling

    May 7, 2026Yuan Wang, Ouxiang Li, Yulong Xu +8Reward ModelingMultimodal Reward Modeling

  39. RoboAlign-R1: Distilled Multimodal Reward Alignment for Robot Video World Models

    May 5, 2026Hao Wu, Yuqi Li, Yuan Gao +10Multimodal Reward ModelingWorld Model Evaluation

  40. ProMMSearchAgent: A Generalizable Multimodal Search Agent Trained with Process-Oriented Rewards

    Apr 22, 2026Wentao Yan, Shengqin Wang, Huichi Zhou +4Multimodal IRProcess Reward Models

  41. DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling

    Apr 21, 2026Zhihong Zhang, Jie Zhao, Xiaojian Huang +5Multimodal Reward ModelingPreference Learning

  42. Lost in Translation: Do LVLM Judges Generalize Across Languages?

    Apr 21, 2026Md Tahmid Rahman Laskar, Mohammed Saidul Islam, Mir Tafseer Nayeem +5VLM EvaluationMultilingual VLM Evaluation

  43. DriveVLM-RL: Neuroscience-Inspired Reinforcement Learning with Vision-Language Models for Safe and Deployable Autonomous Driving

    Mar 18, 2026Zilin Huang, Zihao Sheng, Zhengyang Wan +4VLMs for Autonomous DrivingLLM-Guided RL

  44. Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models

    Feb 7, 2026Yankai Yang, Yancheng Long, Hongyang Wei +12Reward ModelingMultimodal Reward Modeling

  45. Omni-RRM: Advancing Omni Reward Modeling via Automatic Rubric-Grounded Preference Synthesis

    Jan 31, 2026Zicheng Kong, Dehua Ma, Zhenbo Xu +9Reward ModelingRL for Language Models

  46. Understanding Reward Hacking in Text-to-Image Reinforcement Learning

    Jan 6, 2026Yunqi Hong, Kuei-Chun Kao, Hengguang Zhou +1Reward HackingMultimodal Reward Modeling

  47. RubricRL: Simple Generalizable Rewards for Text-to-Image Generation

    Nov 25, 2025Xuelu Feng, Yunsheng Li, Ziyu Wan +4Reward ModelingT2I Generation

  48. Rethinking Reward Signals in Video GRPO: When Scores Become Targets

    Nov 24, 2025Rui Li, Yuanzhi Liang, Ziqi Ni +3Reward HackingRL for Video Generation

  49. SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models

    Oct 14, 2025Weiyang Jin, Yuwei Niu, Jiaqi Liao +4Unified Multimodal ModelsT2I Generation

  50. GUI-PRA: Process Reward Agent for GUI Tasks

    Sep 27, 2025Tao Xiong, Xavier Hu, Yurun Chen +6Process Reward ModelsGUI Agents