Credit Assignment

Momentum

32 papers in the last four weeks, up 146% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 171

All topics
CardsList
  1. SCAD: Structured Credit Assignment and Distillation for Long-Horizon Agents

    Oct 2, 2026Shangyang Wu, Shuai Zhao, Ziyue Zhu +3Long-Horizon AgentsCredit Assignment

  2. My FAULT: Self-Diagnosis as Credit Assignment in Self-Evolving Agentic Reinforcement Learning

    Oct 1, 2026Yihua Zhu, Qianying Liu, Weixu Qiao +10Credit AssignmentAgentic Reinforcement Learning

  3. SHARPO: Segment-Level Credit Assignment for Agentic Reinforcement Learning

    Sep 30, 2026Xinchen Du, Zhengze Zhou, Wenhui Zhu +4Agentic Reinforcement LearningCredit Assignment

  4. Semifactual Credit-Augmented Policy Optimization

    Sep 30, 2026Junshu Pan, Zhizhang Fu, Shulin Huang +5Credit AssignmentToken-Level Uncertainty

  5. Trust the Critic More

    Sep 30, 2026Kaiyue Wen, Luke Bailey, Arvind Mahankali +1Critic-Free Reinforcement LearningLarge Language Model Reinforcement Learning

  6. PRICE the Action Chunks: Physical Relational Credit Assignment for Embodied Reinforcement Learning

    Sep 30, 2026Yangang Zou, Jiajun Lu, Weitao Zhou +6Offline Reinforcement LearningCredit Assignment

  7. EvoSteer: Online Self-Evolving Graph Orchestration via Reference-Anchored Credit Assignment

    Sep 29, 2026Mingda Zhang, Hanwen Zhang, Qiang Huang +5Self-EvolutionOrchestration

  8. SCA: Spatial Credit Assignment for Reinforcement Learning of GUI Agents

    Sep 29, 2026Shengtian Yang, Ziyu Xiong, Kaibing Yang +6Credit AssignmentGroup-Based Reinforcement Learning

  9. SIPO: Unifying Reinforcement Learning with On-Policy Self-Distillation

    Sep 29, 2026Zhenrui Yue, Huimin Zeng, Yueqi Wang +8Unsupervised On-Policy Self-DistillationReinforcement Learning With Verifiable Reward

  10. Visual sensitivity is not claim retractability: persistence-aware credit assignment for multimodal reinforcement learning

    Sep 29, 2026Zhongan Bi, Kepeng Lin, Xuanang Gao +2Multimodal Reasoning BenchmarksVisual Evidence

  11. Targeting Pivotal Decisions for Credit Assignment in Agentic Reinforcement Learning

    Sep 28, 2026Dongwon Jung, Hemanth Neelgund Ramesh, Yifan Wang +7Credit AssignmentAgentic Reinforcement Learning

  12. From Experience to Expertise: Adoption-Aware Memory Learning for Data-Scarce NPU Kernel Synthesis

    Sep 28, 2026Longxiao Fan, Tao Zhang, Han Yan +5Neural Processing UnitsCross-Task Knowledge Transfer

  13. Beyond Saying Less: Fine-Grained Alignment for Informative and Faithful Vision-Language Models

    Sep 28, 2026Xingming Long, Jie Zhang, Yuecong Min +2Large Language Model HallucinationVisual Hallucinations

  14. ASCT: Attentive Search over Counterfactual Trees for Credit Assignment in Agentic Reinforcement Learning

    Sep 28, 2026Yang Li, Jinhan Yang, hai liu +8Agentic Reinforcement LearningCredit Assignment

  15. GraphHCA: Closed-Form Hindsight Credit Assignment for Long-Horizon LLM Agents

    Sep 28, 2026Haodong Zhu, Yangyang Ren, Changbai Li +4Group-Based Reinforcement LearningCredit Assignment

  16. Can We Trust the Teacher? Decoupled Credit Direction-Magnitude for Self-Distillation

    Sep 28, 2026Yugu Li, Zehong Cao, Peizhen Li +3Credit AssignmentTeacher

  17. Dr.Credit: Rubric-Grounded Process Credit Assignment for Deep Research Agents

    Sep 28, 2026Yingjian Zhu, Zhenyi Wang, Jiaxin Guo +6Credit AssignmentProcess Reward Model

  18. R2^2 Flow: Recursive Self-Improvement via Recursive Skill Evolution

    Sep 27, 2026Mingda Zhang, Qiang Huang, Yanjin Li +4Skill EvolutionRecursive Self-Improvement

  19. Beyond Timestamps: Decision-Aligned On-Policy Distillation for Long-Horizon Agents

    Sep 27, 2026Mingju Chen, Can Lv, Jinrong Liu +3Credit AssignmentLong-Horizon Agents

  20. Agentic Multi-Turn Reasoning: A Fairness Approach

    Sep 27, 2026Thanh-Dat Truong, Sankalp Pandey, Hugh Churchill +3Agentic BenchmarksCredit Assignment

  21. From Interests to Semantic IDs: Retrieval-Grounded Credit Assignment for Generative Recommendation

    Sep 24, 2026Mengdan Zhu, Yufan Zhao, Yao Zhao +5Sequential RecommendationCredit Assignment

  22. SLCA-GRPO: Resolving Cross-Segment Credit Misattribution in Tool-Calling RL

    Sep 24, 2026Yan Zhan, Shaobo Liu, Qiunan Liu +7Credit AssignmentFlow-Grpo

  23. Generative Query Suggestion via Intent Coverage and Query-Level Credit Assignment

    Sep 16, 2026Xinpeng Liu, Lu Ma, Jiayi Qiao +6QueriesData Generation

  24. Beyond Token-Local Imitation: Reward-Compatible Temporal Credit Assignment for On-Policy Distillation

    Sep 15, 2026Shiqi Liu, Zeyu He, Letian Tao +9Credit AssignmentKullback-Leibler Divergence

  25. Granularity-Adaptive Credit Assignment for Long-Horizon LLM Agent Reinforcement Learning

    Sep 11, 2026Taoran Liang, Yang Liu, Shang Luo +10Credit AssignmentLarge Language Model Agents

  26. What Does Multi-Harness RL Learn? Credit Assignment and Portability in Coding Agents

    Sep 7, 2026Chenqian Le, Jiayi Cheng, Qijia He +3Credit AssignmentCoding Agents

  27. VERPO: Verified Evidence Regularized Policy Optimization

    Sep 5, 2026Haijiang Li, Chengyu Lv, Yi Zhang +8Reinforcement Learning With Verifiable RewardToken-Level Supervision

  28. TIGPO: Temporal Instance-Graph Policy Optimization for Long-Horizon LLM Agents

    Sep 3, 2026Jinwei GanCredit Assignment

  29. Dense Process Supervision for Search Agents via Fact Utility Estimation

    Sep 1, 2026Rongzhi Zhu, Xiangyu Liu, Yi Liu +7Process Reward ModelCredit Assignment

  30. Rubric-to-Code Credit Assignment for Reinforcement Learning

    Aug 28, 2026Rui Jin, Jikai Chen, Yihan Chen +6Code GenerationCredit Assignment

  31. HiDiffTIR: Hierarchical Difficulty-Aware Policy Optimization for Multi-Turn Tool-Integrated Reasoning

    Aug 22, 2026Yucan Guo, Xiaohan Wang, Miao Su +8Multi-Turn InteractionsCredit Assignment

  32. RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training

    Aug 19, 2026Yugu Li, Zehong Cao, Jianglin Qiao +1Agentic Reinforcement LearningFrictive Policy Optimization

  33. Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM Agents

    Aug 13, 2026Zechuan Wang, Siyuan Lu, Hongxuan Zhang +3Credit AssignmentReinforcement Learning With Verifiable Reward

  34. HCGRec: Hint-Conditioned Generative Recommendation with Semantic IDs

    Aug 12, 2026Kangning Zhang, Haotian Fang, Xukun Luo +6Sequential RecommendationCode Completion

  35. Governing Agentic AI in FinTech

    Aug 11, 2026Henry HanArtificial Intelligence GovernanceBanking

  36. VidForensics-M1: Meta-Detection Reinforcement Learning with Verifiable Temporal Grounding for AI-Generated Video Forensics

    Aug 11, 2026Bowei Liu, Zheng Lu, Yuhan Bian +8Ai-Generated Video DetectionForgeries

  37. Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization

    Aug 10, 2026Wenxiao Zhao, Shu Wang, Ying Nian WuBacktranslation Augmented Direct Preference OptimizationCredit Assignment

  38. Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning

    Aug 8, 2026Yifu Huo, Shunjie Xing, Chenglong Wang +8Agentic Reinforcement LearningCredit Assignment

  39. CODS: Iterative Bellman-Residual Data Selection for Reusable Offline Reinforcement Learning

    Aug 7, 2026Ibne Farabi Shihab, Sanjeda Akter, Abu Sa-Adat Mohamed Moon-Im Al Ahsan +2Model-Based Reinforcement LearningOffline Reinforcement Learning

  40. DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training

    Aug 7, 2026Xucong Wang, Zhe Zhao, Liheng Yu +3Reinforcement Learning With Verifiable RewardCritic-Free Reinforcement Learning

  41. How Much, Then Where: Credit-Conserving Action-to-Token Allocation for Multi-Turn Agent Reinforcement Learning

    Aug 7, 2026Lichao Ma, Yang Sun, Shuaitao Zhao +9Credit AssignmentStep-Level Credit

  42. Gated-BEPO: Confidence-Gated Bellman Credit Assignment for Large Language Model Agents

    Aug 7, 2026Hongxi Yan, Ziyue Huang, Shichao Fan +1Credit AssignmentLarge Language Model Agents

  43. AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning

    Aug 6, 2026Zi-Han Wang, Zhengxi Lu, Zhiyuan Yao +10Agentic Reinforcement LearningUnsupervised On-Policy Self-Distillation

  44. Agentic Reinforcement Learning with Self-Distilled Reward Shaping

    Aug 4, 2026Ranxu Zhang, Guinan Chen, Chenshaodong +5Agentic Reinforcement LearningPotential-Based Reward Shaping

  45. LoCA: Forward-Only LLM Tuning after One-Shot Calibration with Local Credit Assignment

    Aug 4, 2026Linhan Xia, Rui Liu, Zhaofeng Zhang +3Multi-LoraPer-Node Correction

  46. GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning

    Aug 3, 2026Zhaoxin Yu, Qi Shen, Hengli Li +4Efficient Latent ReasoningCredit Assignment

  47. Shared Prefixes, Better Credit: Adaptive Routing for Multi-Agent Reasoning

    Aug 3, 2026Yiqing Liu, Zihao Wang, Hantao Yao +2Multi-Agent ReasoningCredit Assignment

  48. Latent Thought Credit: Multi-Answer Credit Assignment for Latent Reasoning

    Aug 3, 2026Xuyang Zhao, Liting Zhang, Zichen Xu +4Latent ThoughtsCredit Assignment

  49. BiCAA: Bidirectional Credit Assignment for Search-Augmented Agent

    Aug 2, 2026Yibin Huang, Bin Xu, Hailong Cao +1Search AgentsSearch-Augmented Reasoning