智能体强化学习中的信用分配
TECH

智能体强化学习中的信用分配

40+
Signals

战略概览

  • 01.
    六篇论文——SPADER、T2SPO、SHARPO、PhGPO、ProVer和DARS——各自提出了一种不同的机制,用于在智能体强化学习中实现步骤级或片段级的信用分配,均对GRPO将整个轨迹级别的优势均匀应用于每个token的做法进行了优化或替代。
  • 02.
    ProVer(提交于2026年9月28日)、SHARPO与T2SPO(均提交于2026年9月30日)以及DARS(2026年10月1日)在四天内密集发布,且均独立地针对相同的两个基准测试ALFWorld和WebShop;而SPADER(多答案问答)和PhGPO(工具规划)早在数月前就已指出同样的均匀优势问题。
  • 03.
    每篇论文采用不同的机制进行轨迹级别以下的信用分配:基于决策步的同行比较(SPADER)、使用TabPFN回归器估计距离成功剩余距离(T2SPO)、利用教师-学生对数概率差距限定片段乘数(SHARPO)、受蚁群启发的费洛蒙轨迹复用(PhGPO)、由智能体裁判提议并验证关键决策片段(ProVer),以及基于依赖图的谓词奖励塑形(DARS)。
  • 04.
    各论文报告的基线提升幅度较大,但衡量方式各异:SHARPO报告在Qwen2.5-7B-Instruct上,相比GRPO在ALFWorld上提升+14.32分,在WebShop上提升+9.11分;ProVer报告在两个Qwen3.5规模下相比GRPO相对提升9.91%和7.12%;DARS报告在ALFWorld上相比GiGPO最高提升10分。

一个两年前的算法终于遇到了极限

自DeepSeekMath在2024年初引入以来[7],GRPO一直是默认的无评论家(critic-free)强化学习方法,并被用于训练DeepSeek-R1 [8]。其核心技巧——用组相对基线替代学习到的价值函数——在单轮推理任务(如数学题)中表现良好,因为这类任务只有一个最终答案对应一个奖励。但当研究人员将其应用于长视野智能体场景时——例如点击浏览网页商店、在模拟房屋中导航、跨数十步链式调用工具——这一技巧便失效了。ProVer明确指出了问题所在:GRPO“将轨迹级别的优势均匀分配给所有策略token,无法区分关键决策与无关紧要的操作,模糊了哪些中间决策真正促成了成功”[3]。

值得注意的是时间线。PhGPO [5]和 SPADER [6]在2026年早些时候就已分别在工具规划和多答案问答任务中指出了这一缺陷并提出了修正。随后,在更紧凑的四天窗口期(2026年9月28日至10月1日),又有四个独立团队几乎同时针对相同的两个具身/网络基准得出了相同诊断:ProVer于9月28日提交 [3],SHARPO与T2SPO于9月30日提交 [1][2],DARS于10月1日提交 [4]。这种密集涌现表明,这并非单一突破,而是整个领域几乎在同一时间撞上了同一堵墙的信号。

六种不同隐喻,同一个共同诊断

这一研究集群引人注目的不仅是六个团队一致认为GRPO的信用分配过于粗糙,更在于他们修复方式的巨大差异。SPADER通过决策步对齐并行 rollout,并基于同行回报估计优势,同时加入奖励以突出稀有发现而非冗余结果 [6]。T2SPO借用预训练的TabPFN回归器,通过上下文刷新新轨迹但无需重新训练,来估计每个动作使智能体接近成功的程度 [2]。SHARPO计算每个面向环境的片段内的师生对数概率差距,并将其转化为GRPO优势上的有界乘数 [1]。PhGPO借鉴蚁群隐喻,将历史上成功的工具转换模式视为可复用的‘费洛蒙’[5]。ProVer将判断权交给一个LLM裁判,该裁判先提出关键片段,再通过终端成功率实证检验该提议后才予以信任 [3]。DARS构建任务谓词的依赖图,并根据图中被破坏的前提条件的距离来塑造信用分配 [4]。

DARS自身的表述揭示了这一点的重要性:‘仅有最终成功/失败奖励时,失败episode中的每一步总未来奖励都为零,即使它实际上取得了进展’[4]。这并非假设性担忧——相关对长视野智能体轨迹的分析发现,一旦轨迹延长至约100步,每动作的信噪比相比单轮推理RL大约退化100倍 [9]。六种不同工具包——同行比较、回归、蒸馏差距、费洛蒙记忆、裁判验证、图论——在短短几个月内都被指向了同一个统计问题。

大数字,不同标尺

这些 headline 结果确实显著。SHARPO在ALFWorld上比GRPO提升14.32个百分点,在WebShop上提升9.11个百分点,使用Qwen2.5-7B-Instruct [1]。ProVer在Qwen3.5-2B上提升9.91%,在Qwen3.5-4B上提升7.12%,平均涵盖ALFWorld、WebShop和SearchQA [3]。DARS报告最高提升10个百分点,但其对比基线不同(GiGPO而非GRPO),且仅限于ALFWorld [4]。将这三个事实并列,人们自然想排序比较。但这种冲动应被克制:单位不一致(绝对百分点 vs 相对百分比提升),基线不同(GRPO vs GiGPO),模型家族与规模也不同(Qwen2.5-7B vs Qwen3.5-2B/4B vs DARS未披露的1.5B–8B范围)。将这些数字堆叠在一张柱状图中,会暗示一场实验本无意决出的竞赛,因此这里将其视为分别报告的结果,而非排名比较。

这些论文所追逐的根本低效性在其他地方也有体现,进一步证明其真实性,尽管幅度尚未标准化。一项相关的基于图的信用分配分析发现,失败轨迹中约22%的步骤代表真实进展,而成功轨迹中约65.3%的步骤并未实际促成结果——另一个名称相似但不同的方法GraphGPO报告,对于15亿参数模型,相比GRPO平均成功率达14.85%的增益 [10]。现有材料中,六篇核心论文均未完全解决其改进带来的额外训练成本:T2SPO的回归器需每轮刷新,ProVer的裁判需验证采样过程,PhGPO需维护持久费洛蒙记忆,DARS需为每项任务构建依赖图。任何评估这些方法用于生产用途的人都应将工程开销与基准提升一并权衡。

需求远超这六篇论文

这并非局限于六篇arXiv论文的孤立学术好奇。ProVer的具体方法——由裁判提议关注位置,rollout决定分配多少信用——已被至少一位广受关注的ML研究评论者用通俗语言解释过,凸显出从业者希望简化并理解这一机制,而不仅仅是发表。与此同时,完全独立的团队也在为同一问题独立提出自己的密集信用分配技巧:一个团队推广了一种在长视野任务上比标准GRPO训练效率指数级提升的方法,另一个团队则直接在机器学习研究论坛发帖,提出用于在代码和问答基准上评估的多智能体系统的对比信用归因。

这些相邻努力不属于本文分析的六篇论文集群,不应与之混淆——但它们的存在强化了核心观察。长视野智能体RL中的信用分配不是一个实验室或一篇论文悄悄解决的问题;它已成为足够多人撞上的瓶颈,以至于解决方案正从多个方向同时涌现,评审不一、基准不一,尚无统一排行榜告诉从业者哪种方法在其原论文之外真正泛化最佳。

历史背景

GRPO(组相对策略优化)作为PPO的一种无评论家变体被引入,通过组得分估计基线,后来成为训练DeepSeek-R1-Zero和DeepSeek-R1的强化学习算法。
PhGPO(arXiv:2602.13691)提出受蚁群启发的费洛蒙轨迹复用方法,用于长视野工具规划;后被接受为NeurIPS 2026海报。
SPADER(arXiv:2606.00593)引入逐步行同行优势和多样性感知探索奖励,用于多答案问答智能体。
ProVer(arXiv:2609.36178)提交,报告在Qwen3.5-2B和Qwen3.5-4B上相比GRPO分别取得9.91%和7.12%的相对提升,涵盖ALFWorld、WebShop和SearchQA。
SHARPO(arXiv:2610.00838)和T2SPO(arXiv:2610.00388)同日提交,分别独立提出基于片段和轨迹推导的步骤级信用信号,并在基于Qwen2.5的模型上于ALFWorld和WebShop进行评估。
DARS(arXiv:2610.01207)提交,提出基于依赖图的步骤信用分配,并报告在ALFWorld上相比GiGPO最高提升10个百分点的成功率。

关键关系图

关键玩家
主题

智能体强化学习中的信用分配

SH

SHARPO authors (Xinchen Du, Zhengze Zhou, Wenhui Zhu, Han Yu, Sen Na, Rohit Jain, Alborz Geramifard)

提出针对GRPO的分段级信用重加权方案,通过教师-学生对数概率差距计算有界分段乘数来调整优势函数。

PR

ProVer authors (Dongwon Jung, Hemanth Neelgund Ramesh, Yifan Wang, Xiaomin Li, Yuexing Hao, Yu Hu, Muhao Chen, Varun Chandrasekaran, Andrzej Banburski-Fahey, Jaron Lanier)

开发了评判加验证的方法,在两个Qwen3.5规模上相比GRPO分别报告了9.91%和7.12%的相对提升,是该类方法中受到较多关注的成果之一。

SP

SPADER authors (Qiming Shi, Zhaolu Kang, Yunfan Zhou, Di Weng, Yingcai Wu)

该团队是此集群中唯一将步骤级信用分配应用于多答案问答和检索式工具使用的团队,而非用于具身智能体或网页购物代理,从而拓宽了该研究方向的应用范围,超越了ALFWorld/WebShop的范畴。

PH

PhGPO authors (Yu Li, Guangfeng Cai, Shengtian Yang, Han Luo, Shuo Han, Xu He, Dong Li, Lei Feng)

他们基于信息素的长视野工具规划方法已被NeurIPS 2026接收为海报论文,获得了同行评审会议的认可,而本集群其他五项仅发布于arXiv的工作目前尚无此类认证。

DA

DARS authors (Ziyi Chen, Yan Zhang, Jianhui Wei, Daoan Zhang, Zuozhu Liu)

将DARS定位为可组合的奖励塑形层,旨在叠加在GiGPO、AEPO和ARPO等现有方法之上,而非完全取代它们,这对已投入特定基线且不愿彻底替换的团队具有重要意义。

事实来源

10 条引用
  1. [1] SHARPO: Segment-Level Credit Assignment for Agentic Reinforcement Learning
  2. [2] T2SPO: Trajectory-to-Step Policy Optimization for Agentic Reinforcement Learning
  3. [3] Fixing GRPO's credit assignment problem without evaluating every step
  4. [4] Dependency-Aware Reward Shaping for Agentic Reinforcement Learning
  5. [5] PhGPO: Pheromone-Guided Policy Optimization for Long-Horizon Tool Planning
  6. [6] SPADER: Step-wise Peer Advantage with Diversity-Aware Exploration Rewards for Multi-Answer Question Answering
  7. [7] DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
  8. [8] DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
  9. [9] From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models
  10. [10] Beyond Trajectory-Level Attribution: Graph-Based Credit Assignment for Agentic Reinforcement Learning

来源文章

Top 5

THE SIGNAL.

Analysts
The Crowd

“Good paper on credit assignment for agent RL. The main finding is that you want an LLM judge to choose where to check a trajectory, and the rollouts to decide how much credit that step gets. GRPO gives every token in a trajectory the same advantage, so the training signal cannot tell the decisive step from the rest. ProVer has a judge compare successful and failed rollouts and name the segment it thinks caused the difference. It then samples continuations from just before and just after that segment and uses the change in success rate as the segment's advantage. Across ALFWorld, WebShop and SearchQA, this gives relative improvements over GRPO of 9.91% for Qwen3.5-2B and 7.12% for Qwen3.5-4B. It still helps when the judge is a smaller model. Paper: arxiv.org/abs/2609.36178 Chat with Paper: academy.dair.ai/papers/targeti”

@@omarsar091

“I've written a blog post about our new method Progressive Point Matching, a simple approach to dense credit assignment for LLM RL. We improve training efficiency exponentially over standard GRPO on long-horizon tasks! prestonfu.com/notes/ppm”

@@preston_fu239

“CANTANTE: Optimizing Agentic Systems via Contrastive Credit Attribution [R]”

@u/finitearth8

“Fixing GRPO's credit assignment problem without evaluating every step”

@u/TheStartupChime1
Broadcast
GRPO - Group Relative Policy Optimization - How DeepSeek trains reasoning models

GRPO - Group Relative Policy Optimization - How DeepSeek trains reasoning models

Proximal Policy Optimization (PPO) & Group Relative Policy Optimization (GRPO) | Paper Explained

Proximal Policy Optimization (PPO) & Group Relative Policy Optimization (GRPO) | Paper Explained

Agentic Reinforcement Learning | Hands on Reinforcement Learning

Agentic Reinforcement Learning | Hands on Reinforcement Learning

智能体强化学习中的信用分配 — AI 新闻 | Agentic Brew