开发者 3 秒速决决策指标
蚂蚁集团 InclusionAI 于 2026-09-30 公布 Ling-3.1-flash:约 560B 总参、每 token 激活约 25B 的混合推理 MoE,设计上下文最高 1M(试用/网关当前多暴露 256K–262K)。权重尚未上 Hugging Face;Vercel AI Gateway 与 OpenCode Zen 提供限时免费(至约 2026-10-13)。厂商自报含 SWE-Pro 65.39、Terminal-Bench 4.0 40.40、CyberGym 87.90——均未独立复现。
核心要点速览 (Key Takeaways)
- ✓规模:约 560B 总参 / 25B 激活(对比 Ling-3.0-flash 的 124B/5.1B);设计最高 1M 上下文,试用期/网关当前常见 256K–262K
- ✓架构(官方摘要):提高线性 Attention 比例——7 层 KDA : 1 层 Gated MLA;512 路由专家选 8 + 1 共享专家
- ✓厂商基准(未独立复现):SWE-Pro 65.39、Terminal-Bench 4.0 40.40、CyberGym 87.90、BrowseComp 91.67;对标表含 DeepSeek-V4.1-Flash / GLM 5.3 flash 等
- ✓可用性:Vercel AI Gateway
inclusionai/ling-3.1-flash/-free(Novita),免费到约 10/13;OpenCode Zenling-3.1-flash-free - ✓风险:权重未开源;免费通道可能用于改进模型(勿喂专有代码);HealthBench 等分数带「AQ 环境」脚注
阅读完核心要点?进一步了解模型实力与实际开销
7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
Flash 档位正在「变胖」:开发者既要 agent/coding 长程稳定性,又要可控的每 token 算力。蚂蚁 InclusionAI 在 Ling-3.0-flash(124B/5.1B)之后,于 2026-09-30 公布 Ling-3.1-flash——约 560B 总参、每 token 激活约 25B,定位通用智能体、搜索、办公与软件开发。关键现状:产品/网关可调用,权重未开源;官方开发者文档页(ant-ling.com 截至 9/23)尚未写入 3.1 条目。对大陆读者,可先走 Vercel AI Gateway 或 OpenCode Zen 的限时免费通道做自测,而不是等「假想中的 HF 权重」。
架构亮点与底层机制
官方摘要延续混合线性路线,并提高线性 Attention 层比例:约 7 层 KDA 配 1 层 Gated MLA;MoE 侧为 512 个路由专家中选 8 个,外加 1 个共享专家。相对 3.0-flash,总参与激活量约升至 4–5×,稀疏比仍约 1:22。上下文设计最高 1M,但试用期与第三方路由当前多暴露 256K–262K(Vercel 列 262,144 in / 32,768 out)。混合推理(可想/可不想)面向工具调用与长任务历史;不要把 3.0-flash 的 MIT 权重部署手册直接套到 3.1。
权威 Benchmark 与实测跑分对比
下表数字均来自厂商发布图/二次报道,Artificial Analysis 等第三方榜在发稿时多未收录——请当方向性主张,勿当独立复现结论。常见引用:SWE-Pro 65.39(表中高于 DeepSeek-V4.1-Flash 56.77、GLM 5.3 flash 63.06)、Terminal-Bench 4.0 40.40、CyberGym 87.90(紧贴 DeepSeek flash 88.10)、BrowseComp 91.67;DeepSWE / Terminal-Bench 2.1 等则落后 DeepSeek flash。HLE 约 37.44。HealthBench Professional 65.35 带「在 AQ 环境评估」脚注,不可当作临床认证。Vercel 路由侧曾列约 3.1s 延迟、88 tok/s(Novita,随负载变)。
开发者实战落地与开箱指南
- 网关试用:
inclusionai/ling-3.1-flash或inclusionai/ling-3.1-flash-free(免费期结束前者可能转计费、后者停服)——见 Vercel Changelog 2026-09-30。 - 编码 Agent:
npx vercel ai-gateway setup后在 Claude Code / Codex / fx 的/model选择 Ling 3.1 Flash;或 OpenCode Zen 模型 IDling-3.1-flash-free(文档)。 - 隐私:免费期可能用于改进模型——勿投专有代码/客户数据;生产等付费条款与 retention 明确后再接。
- 自测协议:用同一仓库任务对比你现网 flash(如 DeepSeek-V4.1-Flash / GLM 5.3 Flash),记完成率而非单看厂商柱状图。
- 开源预期:官方称试用后计划开源并放开更大窗口;在 inclusionAI / HF 出现 3.1 仓库与许可证前,按托管模型规划容量。

讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察