针对工具调用智能体在 GRPO 强化学习中将整条轨迹标量优势均摊导致梯度噪声污染工具调用的结构性缺陷,北大等团队提出 SLCA-GRPO。通过架构段级优势解耦、Schema 引导模拟器 (SGLS) 与分层奖励机制,无需额外重采样即彻底隔绝文本与工具区段的噪声传递,在 7B 模型上实现 τ²-Bench +9.15% 提升与 BFCL +1.36% 提升。
核心要点速览 (Key Takeaways)
- ✓解决 CSCM 奖励污染:针对现有 GRPO 盲目将轨迹总标量优势回传给所有 Token 导致的跨段误归因(CSCM),首次在单次 rollout 组内实现结构段级优势解耦。
- ✓分层奖励与无害探索:配套提出 Schema 引导的 LLM 模拟器(SGLS)和分层奖励(HierR),将执行优势精确导向工具 Token,偏好优势导向文本 Token,无需调用昂贵真实 API。
- ✓全方位跑分与降本:在 7B 参数基座上相比标准 GRPO、ToolPO 和 RLTR,域内提升 +2.53%,伯克利函数调用榜(BFCL)提升 +1.36%,复杂双层 τ²-Bench 大涨 +9.15%,且显著降低冗余调用成本。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察