面向单次执行跨越数小时、数百轮环境交互且单条轨迹逼近 100 万 Token 的超长程(xlong-horizon)智能体训练难题,阿里巴巴通义团队推出端到端在线强化学习框架 QwenGyre。首创不中断活跃执行的 GPU 弹性重分配机制与分支轨迹去重处理器,在阿里 2.4 万亿(2.4T)参数旗舰模型 Qwen 3.8 上实现 700K Token/Rollout 超长强化训练,NL2RepoBench 基准 48 步内绝对提升 6.0%,相比传统 Colocate 和 Async 架构训练吞吐分别暴增 1.85 倍与 1.78 倍。
- ✓超长程(xlong-horizon)强化学习工程突破:针对企业级工程 Agent 单次执行长达数小时、交互数百步的现实场景,首次建立支撑单 Rollout 700K~1000K Token 在线强化学习的生产级底座。
- ✓Rollout 与训练无缝弹性重分配:彻底解决长程采样严重时延方差导致的 GPU 空转饥饿难题,在不中断活跃容器与智能体进程的前提下,实现计算卡资源在 Rollout 采样与梯度训练池之间的毫秒级动态拉移。
- ✓2.4T 万亿模型跑分跃升与 1.85 倍吞吐:在阿里旗舰 2.4 万亿参数 Qwen 3.8 上实测,仅需 48 个强化训练步数即在 NL2RepoBench 代码库生成基准上将准确率由 52.5% 拉升至 58.5%,较传统架构提速 1.85 倍。
🧭阅读完核心要点?进一步了解模型实力与实际开销
7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算
🔗
相关资源与官方项目出处
免代理直达💡 国内无需访问 Twitter,可直接访问上述项目官方资源与文档🔬
深度技术解析与实战评估
核心背景与行业痛点 随着 Coding Agent 从单文件局部修复迈向“自主开发完整软件工程”,智能体任务的交互视界迎来了几何级爆发(xLong-Horizon)。单次端到端开发任务往往持续数小时,包含成百上千轮的编译、执行、报错与代码重构,单条 Rollout 轨迹的上下文 Token 数量逼近 700K 甚至 100 万。然而,现有的在线强化学习框架(如 Ray、Colocate 或纯异步 Async RL)在面对此类任务时彻底瘫痪: 1. 极度严重的 GPU 饥饿与气泡:由于不同智能体完成任务的时间差异巨大(有的几分钟失败,有的几小时成功),固定分配的训练 GPU 长期处于空转等待状态; 2. 分支轨迹组合爆炸与冗余:长程交互中充满了试错、回滚与死循环,非线性分支带来了海量无效数据,导致反向传播显存和时间成本无法承受。 ### 架构亮点与底层机制 阿里巴巴通义实验室团队提出了突破性的 QwenGyre 分布式在线强化学习系统: 1. 非侵入式 GPU 弹性调度引擎:打破 Rollout 与 Training 节点的物理割裂,根据实时采样进度与梯度计算需求,在不杀死或挂起正在运行中的仿真容器与智能体进程的前提下,动态调整两组节点池的算力配比; 2. 长程分支轨迹去重与阶段性打分器(Trajectory Processor):重构多步交互拓扑,精准识别冗余循环分支并执行语义级去重;同时引入局部阶段性进度打分(Partial Progress Scoring),为中途截断但具备阶段贡献的子轨迹赋予合理信用,避免梯度全盘作废; 3. 超大显存流水线与上下文并行:深度集成 Sequence Parallelism 与 Ring Attention,原生支撑单样本百万 Token 的梯度反向传播。 ### 权威 Benchmark 与实测跑分对比 团队在阿里通义 2.4 万亿(2.4T)总参数量的超大规模模型 Qwen 3.8 上展开验证,单条采样轨迹长达 700K Tokens: - 复杂代码库生成飞跃:在权威自然语言生成完整仓库基准 NL2RepoBench 上,仅经历 48 个强化训练步数,模型端到端成功率便从 52.5% 跃升至 58.5%(绝对提升 +6.0%); - 分布式训练吞吐暴增:相比传统 Colocate 方案提速 1.85 倍,相比异步 Async 方案提速 1.78 倍,GPU 平均综合利用率维持在 88% 以上; - 跨领域通用性:在网络安全渗透、多工具综合运维等多个长程任务集上均展现出稳定的加速收敛表现。 ### 开发者实战落地与开箱指南 - 技术报告:完整数学形式化表述与架构设计已发布于 arXiv:2609.33848; - 大模型长程对齐新标杆:QwenGyre 证明了“全尺寸超大模型进行百万 Token 超长交互在线强化学习”在工业上完全可行; - 开源与演进:团队正整理相关弹性调度算子与分布式训练编排脚本,计划回馈给通义开源社区生态。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察