亚马逊人工智能研发团队(Amazon AI,@awscloud)在 Hugging Face 与 ArXiv 正式公开了《Rufus-Air: An Open LLM Post-Training Recipe》(arXiv: 2609.29421)。面对前沿工业级大模型后训练流水线高度封闭、依赖未公开的内部教师模型蒸馏与昂贵人工标注的困局,亚马逊团队全面公开了基于智谱 GLM-4.5-Air-Base(106B 总参数、12B 激活的 MoE 架构)的八阶段全串行后训练完整配方(涵盖 SFT、数学推理 RL、编码 RL、指令对齐 RL、通用智能体、编程智能体、检索智能体与 RLHF)。所有训练流程均采用完全公开的开源组件与公开数据集,综合评测成绩全面超越智谱官方发行的 GLM-4.5-Air 权重。

核心要点速览 (Key Takeaways)

  • ✓首个针对百亿级激活 MoE 架构(106B-A12B)完全开源、可端到端复现的八阶段工业后训练配方。
  • ✓全流程零私有数据、零闭源大模型黑盒蒸馏,纯粹依靠开源高质量数据集与程序化可验证奖励函数驱动。
  • ✓确立了“奖励可信度递进(Reward Reliability Ordering)”原则:从确定性硬校验逐步演进至大模型裁判微调。
  • ✓综合基准全面超越智谱官方微调版 GLM-4.5-Air,在复杂多轮 Agent 编程与深搜任务上成功率提升 21.8%。
  • ✓完整训练阶段编排配置、奖励函数代码与分布式训练基础设施文档已在 Hugging Face 全面公开。
🔬

深度技术解析与实战评估

核心背景与行业痛点 随着强化学习后训练(Post-Training RL,如 DeepSeek R1 范式)成为提升大模型推理与 Agent 工具调用能力的核心引擎,开源社区与中小企业面临着严峻的“后训练黑盒壁垒”:绝大多数商业闭源或权重开放模型均未公开其后训练的具体阶段顺序、数据配比、奖励函数设计与分布式工程细节;许多团队试图复现强化学习时,往往因奖励黑客攻击(Reward Hacking)或多任务灾难性遗忘而频繁遭遇模型坍塌。 ### 架构亮点与底层机制 亚马逊团队在 Rufus-Air 中确立了一套严谨且可无缝复现的八阶段全串行后训练流水线: 1. 奖励可靠性递进原则(Reward Reliability Ordering):流水线严格按照“信号确定性”由高到低排序——优先通过单元测试与数学证明等硬确定性奖励(Hard Verifiable Rewards)训练推理与编码内核,再平滑过渡至指令遵循与智能体工具交互,最后使用 RLHF 进行软性对齐,彻底杜绝策略漂移; 2. 动态难度过滤机制(Difficulty Filtering):在 Reasoning RL 与 Coding RL 阶段,自动剔除模型过早解决(无学习增益)与超纲无法求解的样本,将训练 Prompt 严格收敛于高信息增益的生产力区间; 3. 三阶专项 Agent 强化学习:分别构建通用环境操作(General Agent)、终端代码重构(Coding Agent)与多步网络深搜(Search Agent)三大独立微调阶段,专项注入长程多步规划能力。 ### 权威 Benchmark 与实测跑分对比 在跨越通用常识、数学代码以及复杂 Agent 交互的权威基准测试中: - Rufus-Air 较智谱官方发行的 GLM-4.5-Air 模型,在 SWE-bench Verified 编码修复评测中得分提升了 14.2%; - 在复杂工具调用与长程智能体基准(Tau-Bench 与 AgentBench)中,任务端到端达成率提升了 21.8%; - 在 MATH-500 与 AIME 竞赛数学基准上,推理准确率分别达到 84.6% 与 52.4%,达到同等 12B 激活规模开源模型的顶尖水平。 ### 开发者实战落地与开箱指南 大模型后训练工程师与科研团队可按以下方式落地: - 查阅论文获取八阶段完整的超参数矩阵、学习率衰减曲线与奖励函数 Python 代码; - 基于开源框架(如 vLLM、Megatron-LM 或 Ray)直接挂载公开开源数据集复现训练链路; - 国内开发者可直接在 Hugging Face 论文专区下载评估评测脚本与对齐检查点配置文件。