代码智能体在强化学习(RL)中通常依赖单元测试提供二值奖励(通过/未通过),但 GRPO 会给同组内所有通过测试的轨迹分配相同标量优势,忽视了代码实现质量、可读性与无用修改等关键维度,导致模型逐渐学会生成冗长臃肿的垃圾代码。字节跳动、北大与清华团队联合推出 GAGAR 框架。通过在共享工作区中引入经过 SFT 训练的智能体评审员对同组轨迹进行联合审查排序,并执行“保和优势重分配”(Sum-Preserving Redistribution),在 310B 和 1.02 万亿(1.02T)参数的 MiMo-V2.6 旗舰模型上实现了更稳定的训练与高质量代码偏好引导。
- ✓破除测试用例二值奖励的“质量盲区”:传统代码强化学习只要测试通过便视作相同满分,导致智能体倾向于通过注入无用冗余代码、打乱格式甚至过度修改等投机取巧手段蹭过测试;GAGAR 首次在群组层级引入细粒度代码审美。
- ✓保和优势重分配机制(Sum-Preserving Redistribution):通过智能体评审员对组内通过轨迹进行质量排位,惩罚低质通过用例,并将剥离的优势等比例重分配给高质量精简代码,维持原优势总和不变以确保优化稳定性。
- ✓万亿参数(1.02T)工业级实测:在 310B 参数 MiMo-V2.6-Flash 与 1.02 万亿参数 MiMo-V2.6-Pro 上完成大规模混合任务实测,显著抑制了轨迹长度的不合理膨胀,全面提升代码简洁度与工程严谨性。
🧭阅读完核心要点?进一步了解模型实力与实际开销
7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算
🔗
相关资源与官方项目出处
免代理直达💡 国内无需访问 Twitter,可直接访问上述项目官方资源与文档🔬
深度技术解析与实战评估
核心背景与行业痛点 在当前大模型代码智能体(Code Agent)的强化学习(RL)流程中,单元测试(Unit Tests)是最普遍的奖励验证机制——测试通过得 1 分,未通过得 0 分。然而,这一经典设定带来了严重的“质量反噬”:群组相对策略优化(GRPO)将完全相同的标量优势广播给组内所有通过测试的轨迹。这就意味着,一个编写了 5 行干净优雅代码的解法,与一个硬编码大量 if-else、修改了不相关文件、注入了数百行垃圾调试代码的丑陋解法获得了完全一致的强化信号。长期训练后,模型会逐渐演化为习惯生成冗长、不可维护代码的“投机型选手”。 ### 架构亮点与底层机制 字节跳动联合北大与清华学者研发了专注于代码质量导向的优势重分配框架 GAGAR: 1. 动态混合群组保留(Dynamic Sampling):在采样阶段,优先保留同时包含成功与失败轨迹的有效对抗组,提供最敏锐的策略梯度信号; 2. 共享工作区与智能体化评分员(Agentic Grader):将同一 Prompt 采样出的所有轨迹放入统一上下文工作区,由一个经过监督微调(SFT)的代码审美智能体进行整体对比审查,针对代码规范、修改范围合规性及简洁度排出相对名次; 3. 保和优势重分配(Sum-Preserving Advantage Redistribution):对排名靠后的劣质通过轨迹进行优势降权,并将扣除的优势按比例注入排名靠前的优质优雅代码,全程严格保持该组所有通过轨迹的优势总和不变,从而在重塑代码审美偏好的同时完全不破坏策略优化的数学期望稳定性。 ### 权威 Benchmark 与实测跑分对比 团队在工业级规模的 MiMo-V2.6 系列基座上进行了严格实测,包括 310B 的 Flash 模型与 1.02 万亿(1.02T)参数的 Pro 旗舰模型: - 有效抑制轨迹臃肿膨胀:相比标准 GRPO 随着迭代轨迹长度无序膨胀,GAGAR 将平均推理与编写 Token 长度稳定压降了 14.2%,大幅降低冗余编辑; - 工程代码质量显著跃升:在代码规范性、无多余改动比率(In-Scope Rate)等工业维度上,GAGAR 训练出的模型取得了压倒性优势; - 训练稳定性与损失收敛:在 1.02T 模型的超大规模强化学习中,消除了传统二值奖励常见的奖励崩溃与方差震荡。 ### 开发者实战落地与开箱指南 - 学术报告:论文详述已收录于 arXiv:2609.32577; - RL 流程改进落地:自研代码大模型微调团队可在现有的 GRPO / PPO 奖励管道中,串联一个轻量级 Grader 模型(如基于 7B~14B 代码模型专门微调审代码质感),利用保和公式微调优势分布; - 算力性价比:Grader 仅需在 CPU/轻量卡上对同一批次的少量代码文本进行比对打分,几乎不影响训练主集群的 GPU 利用率。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察