Response-Level Rewards

Momentum

2 papers in the last four weeks, against 2 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 23

All topics
CardsList
  1. MeanFlowAdvantage: Stable Reward Fine-Tuning for Few-Step Average-Velocity Generators

    Sep 29, 2026Haocheng Tang, Tianchi Xie, Xingqiao LinMeanflowGenerative Flow Networks

  2. From Soft Targets to Reward Signals: How Assignment and Reward Objectives Interact

    Sep 28, 2026Jiangtao Lin, Bangyang Wei, Siyi Liu +2Response-Level RewardsReward Signal

  3. Co-Evolving Actor-Conditioned Critics for Non-Verifiable Generation

    Aug 31, 2026Jinyoung Kim, Muhammad Khalifa, Lajanugen Logeswaran +4CritiqueCritic

  4. It's a matter of timescale: non-linear utility in successor features and multi-objective planning and learning

    Aug 26, 2026Liam P. H. Mertens, Lucas N. Alegre, Florent Delgrange +3Multi-Objective Reinforcement LearningSuccessor Representations

  5. A Mean-Field Framework for Inference-Time Distributional Control of Diffusion Models

    Aug 9, 2026Samuel Howard, Nikolas NüskenDiffusion SamplingInference-Time Steering

  6. AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward

    Aug 7, 2026Mingyang Wu, Kaituo Feng, Bohao Li +3Response-Level Rewards

  7. Post-Training at the Edge of Detectability: A Game-Theoretic Approach to Fine-Tuning

    Jul 29, 2026Keegan Harris, Brian W. Lee, Ian Waudby-Smith +3Reinforcement Fine-TuningModel Fine-Tuning

  8. Reward Valuation in Large Language Models: Causal Induction of Anhedonia

    Jul 7, 2026Melika Honarmand, Samin Mahdipour Aghabagher, Martin SchrimpfResponse-Level RewardsIntrinsic Motivation

  9. Many Voices, One Reward: Multi-Role Rubric Generation for LLM Judging and Reward Modeling

    Jul 2, 2026Dazhi Fu, Jiuding Yang, Yiwen Guo +1Task-Specific RubricsProgress Reward Modeling

  10. UniCoder: Unified Visual-to-Code Generation via Symbolic Rewards and Reference-Guided Code Optimization

    Jun 30, 2026Yaozhi Zheng, Yilei Jiang, Manyuan Zhang +5Image-To-Code GenerationVisual Generation

  11. The Verification Horizon: No Silver Bullet for Coding Agent Rewards

    Jun 24, 2026Binghai Wang, Chenlong Zhang, Dayiheng Liu +10Coding AgentsResponse-Level Rewards

  12. Reinforcement Learning for Computer-Use Agents with Autonomous Evaluation

    Jun 23, 2026Marta Sumyk, Oleksandr KosovanGraphical User Interface AgentsComputer-Use Agents

  13. GIFT: LLM-Guided State-Reward Interface for Financial Reinforcement Learning

    Jun 7, 2026Yanyan Wu, Boyi Zhang, Yanlin Liu +10Large Language Model Reinforcement LearningOffline Reinforcement Learning

  14. SAW: Stage-Aware Dynamic Weighting for Multi-Objective Reinforcement Learning in Large Language Models

    Jun 5, 2026Yuchen He, Baolong Bi, Shenghua Liu +7Multi-Objective Reinforcement LearningLarge Language Model Reinforcement Learning

  15. Plan Before Search: Search Agents Need Plan

    May 27, 2026Zhipeng Qian, Zihan Liang, Yufei Ma +7Large Language Model PlanningSearch Agents

  16. DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards

    May 20, 2026Kaiyi Zhang, Wei Wu, Yankai LinReinforcement Learning With Verifiable RewardCredit Assignment

  17. X-SYNTH: Beyond Retrieval -- Enterprise Context Synthesis from Observed Digital Human Attention

    May 15, 2026Guruprasad Raghavan, George Nychis, Rohan Narayana MurthyContext-AwarenessSynthesizer

  18. Region-Constrained Group Relative Policy Optimization for Flow-Based Image Editing

    Apr 10, 2026Zhuohan Ouyang, Zhe Qian, Wenhuo Cui +1Image EditingRepair-Based Group-Relative Policy Optimization

  19. Explicit Credit Assignment through Local Rewards and Dependence Graphs in Multi-Agent Reinforcement Learning

    Jan 29, 2026Bang Giang Le, Viet Cuong TaMulti-Agent Reinforcement LearningCredit Assignment