在大语言模型与代码智能体后训练(Post-Training)中,在线强化学习(RL)与同策略蒸馏(On-Policy Distillation)会产生海量的自生成执行轨迹(Self-Generated Rollouts)。然而由于策略网络快速迭代,这些耗费巨额算力采样的历史经验往往被直接当成“陈旧废弃数据”丢弃。联合研究团队指出:历史轨迹中不仅包含模型最新策略已丧失的多样化探索路径,也混杂了死循环、废弃尝试与低级错误。为此,团队推出 ROSS 框架(通过选择性监督从自生成轨迹中再学习):完整保留历史长程轨迹作为输入上下文,但仅针对模型生成的关键有效延续段施加损失计算。在 Qwen3.6-35B-A3B 上,完全无需增加任何新的采样计算,仅通过离线 SFT 重训历史经验,就使六项 MOPD 权威基准平均分从 58.40% 跃升至 62.20%,SWE-bench Verified 端到端解决率由 64.20% 暴涨至 68.40%,展现出零额外采样成本下挖掘数据富矿的惊人潜力。

核心要点速览 (Key Takeaways)

  • ✓历史陈旧经验变废为宝:打破 RL 训练中“一旦策略迭代历史采样轨迹即无用”的固有陈规,首次提出通过选择性监督在离线阶段充分榨取历史轨迹的行为价值。
  • ✓选择性监督精准剔除探索噪声:保留长程轨迹的前序状态作为上下文输入,但严格过滤掉死循环与语法报错等失败动作,仅对通向正确解的关键延续子句计算梯度损失。
  • ✓SWE-bench Verified 68.40% 零新采样跃迁:在开源旗舰 Qwen3.6-35B-A3B 上实测,在未消耗任何额外 GPU 采样算力的前提下,SWE-bench Verified 解决率从 64.20% 狂飙至 68.40%(净增 +4.20%),MOPD 六基准均分提升 3.8 个百分点。
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

🔬

深度技术解析与实战评估

核心背景与行业痛点 以 DeepSeek-R1 与 SWE-bench 顶级智能体为代表的后训练(Post-Training)技术栈中,在线强化学习(PPO/GRPO)与同策略蒸馏(On-Policy Distillation)成为提升模型逻辑推理与真实工程修复能力的标配。然而,工业界在训练集群中面临极其高昂的计算浪费: 1. 海量采样数据的“单次抛弃”:强化学习采样阶段消耗了成千上万卡时的 GPU 算力。然而在传统 RL 理论中,随着策略参数 $\theta$ 的梯度更新,前几代策略采样的轨迹被视为分布偏移(Off-Policy)的“过期垃圾”,在完成单次梯度反向传播后即被永久丢弃; 2. 纯粹离线 SFT 的噪声污染:若直接将历史轨迹用于监督微调(SFT),轨迹中包含的早期探索错误、死循环脚本与冗余环境交互会导致模型严重模仿坏行为,破坏推理鲁棒性。 ### 架构亮点与底层机制 联合研究团队推出了突破性的 ROSS(Relearning from Self-Generated Rollouts through Selective Supervision) 框架: 1. 完整上下文感知与局部掩码隔离:保留历史多轮交互的完整真实上下文(环境返回、编译报错、终端输出),使模型具备身临其境的长程时序感知,但仅对经过后验验证的高质量子段计算 Cross-Entropy 损失; 2. 细粒度语义筛选准则(Selective Masking):基于动作完成度、测试用例回归通过率以及跨轮次一致性打分,精准剔除试错中的回滚代码与无效探测,确保监督信号的纯粹性; 3. 闭环免采样二次提炼:无需额外启动分布式仿真环境进行昂贵的新采样,直接在集群离线存储的历史 Buffer 上执行 SFT,极大节约了企业级集群的电费与算力开销。 ### 权威 Benchmark 与实测跑分对比 - SWE-bench Verified 飙升至 68.40%:在最具权威的真实 GitHub 工业级软件工程基准 SWE-bench Verified 上,将开源旗舰 Qwen3.6-35B-A3B 接入 ROSS 后,解决率从 64.20% 狂拉至 68.40%(净提升 +4.20%); - 多教师同策略蒸馏 MOPD 六项基准跃升:涵盖复杂高阶数学、代码生成与多轮复杂指令遵循的 MOPD 综合评测均分从 58.40% 跃迁至 62.20%(提升 3.8%); - 零新采样算力成本:实验严格控制变量证明,该性能增益完全来源于对已沉淀历史 Rollout 数据的重新结构化提炼,计算成本仅为重新运行一轮在线 RL 的不到 1/15。 ### 开发者实战落地与开箱指南 - 技术论文收录:理论推导与严格收敛性证明详见 arXiv:2609.35954; - 企业级 Coding Agent 训练落地:对于正在训练自有代码智能体的团队,强烈建议在本地或云端对象存储中持久化保留所有 RL Rollout 轨迹。在在线 RL 收敛后,使用 ROSS 的选择性掩码进行最后一轮离线 SFT “固化淬火”,通常可无成本收获数个百分点的能力增益; - 通用扩展:该方法亦可无缝扩展至数学定理推导与具身控制等依赖昂贵仿真采样的复杂智能体场景。