在大语言模型与代码智能体后训练(Post-Training)中,在线强化学习(RL)与同策略蒸馏(On-Policy Distillation)会产生海量的自生成执行轨迹(Self-Generated Rollouts)。然而由于策略网络快速迭代,这些耗费巨额算力采样的历史经验往往被直接当成“陈旧废弃数据”丢弃。联合研究团队指出:历史轨迹中不仅包含模型最新策略已丧失的多样化探索路径,也混杂了死循环、废弃尝试与低级错误。为此,团队推出 ROSS 框架(通过选择性监督从自生成轨迹中再学习):完整保留历史长程轨迹作为输入上下文,但仅针对模型生成的关键有效延续段施加损失计算。在 Qwen3.6-35B-A3B 上,完全无需增加任何新的采样计算,仅通过离线 SFT 重训历史经验,就使六项 MOPD 权威基准平均分从 58.40% 跃升至 62.20%,SWE-bench Verified 端到端解决率由 64.20% 暴涨至 68.40%,展现出零额外采样成本下挖掘数据富矿的惊人潜力。
核心要点速览 (Key Takeaways)
- ✓历史陈旧经验变废为宝:打破 RL 训练中“一旦策略迭代历史采样轨迹即无用”的固有陈规,首次提出通过选择性监督在离线阶段充分榨取历史轨迹的行为价值。
- ✓选择性监督精准剔除探索噪声:保留长程轨迹的前序状态作为上下文输入,但严格过滤掉死循环与语法报错等失败动作,仅对通向正确解的关键延续子句计算梯度损失。
- ✓SWE-bench Verified 68.40% 零新采样跃迁:在开源旗舰 Qwen3.6-35B-A3B 上实测,在未消耗任何额外 GPU 采样算力的前提下,SWE-bench Verified 解决率从 64.20% 狂飙至 68.40%(净增 +4.20%),MOPD 六基准均分提升 3.8 个百分点。
阅读完核心要点?进一步了解模型实力与实际开销
7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察