Lambda 与斯坦福大学、德州农工大学联合开源可训练智能体系统 AgentFlow。通过创新的 Flow-GRPO 强化学习算法对多智能体循环中的规划器进行逐回合细粒度更新,使 7B 小模型在数学、搜索与科学任务中相比 GPT-4o 提升高达 14.9%。
核心要点速览 (Key Takeaways)
- ✓架构与训练超越纯参数规模:证明合理的多角色协同与工具闭环可使开源小模型反超闭源大模型;
- ✓逐回合信用分配(Flow-GRPO):克服传统将整条 Agent 轨迹作为黑盒更新的缺陷,精细奖励有效工具调用;
- ✓完整开源技术方案:发布学术论文、训练指南与配套权重,为自建私有高性价比 Agent 提供落地蓝本。