一个两年前的算法终于遇到了极限
自DeepSeekMath在2024年初引入以来[7],GRPO一直是默认的无评论家(critic-free)强化学习方法,并被用于训练DeepSeek-R1 [8]。其核心技巧——用组相对基线替代学习到的价值函数——在单轮推理任务(如数学题)中表现良好,因为这类任务只有一个最终答案对应一个奖励。但当研究人员将其应用于长视野智能体场景时——例如点击浏览网页商店、在模拟房屋中导航、跨数十步链式调用工具——这一技巧便失效了。ProVer明确指出了问题所在:GRPO“将轨迹级别的优势均匀分配给所有策略token,无法区分关键决策与无关紧要的操作,模糊了哪些中间决策真正促成了成功”[3]。
值得注意的是时间线。PhGPO [5]和 SPADER [6]在2026年早些时候就已分别在工具规划和多答案问答任务中指出了这一缺陷并提出了修正。随后,在更紧凑的四天窗口期(2026年9月28日至10月1日),又有四个独立团队几乎同时针对相同的两个具身/网络基准得出了相同诊断:ProVer于9月28日提交 [3],SHARPO与T2SPO于9月30日提交 [1][2],DARS于10月1日提交 [4]。这种密集涌现表明,这并非单一突破,而是整个领域几乎在同一时间撞上了同一堵墙的信号。


