Reflection AI 于 10 月 5 日发布 Beam:稀疏 MoE,总参 501B、每 token 激活 23B,面向编码、推理与 Agent 任务。预训练 23.8T token,后接在 10.5K 张 GB300 上跑满 4 周、超过 1 亿条 rollout 的高算力强化学习,上下文 1M。官方称其编码与 Agent 能力可比 GLM 5.2、逼近 Qwen 3.8-Max,推理分数与 GLM-5.2 相当但推理算力少 3–4 倍。目前处于最终红队阶段,仅开放早期申请,权重、技术报告与模型卡将于本月以 Apache 2.0 发布。
核心要点速览
- ✓规模:稀疏 MoE 总参 501B / 激活 23B,52 层,局部+全局交错注意力,上下文 1M token(官方博客)
- ✓官方自报分数:SWE-bench Verified 80.9、Terminal Bench v2.1 80.1、MCP Atlas 78.7、GPQA Diamond 90.5、AIME 2026 97.8、HLE(无工具)36.2
- ✓RL 规模:10.5K 张 NVIDIA GB300 训练 4 周,超 1 亿条 rollout、最长 256K 上下文,约 13 亿个沙箱,近 100 万个训练环境
- ✓效率:推理类基准与 GLM-5.2 相当,但推理算力少 3–4 倍;提供 reasoning effort 参数调节长度与效果
- ✓发布节奏:目前红队测试中,早期申请 开放;本月放出 Apache 2.0 权重、技术报告与微调/评测全栈

开发者 3 秒速决决策指标
把技术选型换算成你的开发预算
29+ 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
过去一年开源权重前沿几乎被 DeepSeek、Qwen、智谱 GLM、Kimi 等中国模型包揽,西方能拿来私有部署、可商用改造的大模型选择有限。成立两年的 Reflection AI 在 10 月 5 日的 官方博客 中发布首个开源权重模型 Beam,定位为企业编码与 Agent 场景的「主力工作模型」,核心卖点不是绝对最强,而是同等能力下更省推理算力。
架构亮点与底层机制
Beam 是稀疏 MoE:总参 501B、每 token 激活 23B,52 层,采用局部/全局交错注意力、细粒度路由专家,在 DeepSeek 无辅助损失负载均衡 基础上加入专家偏置的余弦衰减与序列级均衡,最忙专家负载仅 1.04 倍。预训练 23.8T token,6,144 张 GB300 NVL72 不到 4 周完成;中期训练把上下文扩到 1M。后训练是重头戏:10.5K 张 GB300 跑 4 周全异步 RL,超 1 亿条 rollout,权重落到推理集群中位数约 12 秒,即使落后 107 个版本(约一天)的样本也能稳定学习。安全侧单独训练对齐教师,再用多教师在线蒸馏(MOPD)合并,并采用 deliberative alignment。
权威 Benchmark 与实测跑分对比
以下均为 Reflection 自报、尚无独立复现:SWE-bench Verified 80.9、SWE-bench Multilingual 78.0、Terminal Bench v2.1 80.1(GLM 5.2 为 81.0、Kimi K3 为 88.3)、MCP Atlas 78.7、GPQA Diamond 90.5、AIME 2026 97.8、HLE 无工具 36.2(Kimi K3 为 46.9)。官方坦言 Kimi K3 等更大模型在原始能力上仍领先,Beam 的优势在于推理类任务达到 GLM-5.2 水平却少用 3–4 倍推理算力。
开发者实战落地与开箱指南
目前 Beam 仍在最终红队与评测阶段,只能通过 Reflection 平台 申请早期访问;官方承诺本月以 Apache 2.0 放出权重、技术报告、模型卡以及运行/评测/微调全栈,并与主流开源推理库和 Agent harness 集成。博客演示中 Beam 接入 OpenCode 自主调研 Unsloth 文档,为 Gemma-4 写出 Text2SQL 微调 notebook。text-only 模型,可用 reasoning effort 参数在成本与效果间切换;想自托管的团队可先评估 23B 激活参数所需的显存与多卡切分方案。
即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察