10 月 7 日 Windows 发布会上,微软把 MAI-Code-1.1-Flash(137B 总参数 / 6.8B 激活 MoE、256K 上下文)以约 3.3 bit 量化跑在 RTX Spark PC 上,端侧 SWE-Bench Verified 70.80%、Terminal-Bench 2.1 66.29%;GitHub HydraFusion 将在 10 月下旬以实验预览让 Copilot 自动把任务分给本地或云端模型,本地调用不收推理费。MXC 智能体沙箱同日 GA。

核心要点速览

  • ✓端侧跑分:SWE-Bench Verified 70.80%(云端原版 72.6%),Terminal-Bench 2.1 66.29%(云端 62.9%);同测 GPT-OSS-120B 仅 32.0% / 23.6%(Microsoft Command Line)
  • ✓资源:约 3.3 bit 混合精度量化 + DFlash2 投机解码,256K 上下文峰值内存 75.5GB;64K / 128K 上下文预填充 923.5 / 769.8 tok/s
  • ✓路由:HydraFusion 本地+云端混合路由 10 月下旬以实验预览进入 Copilot app、Copilot CLI 与 VS Code,本地调用不收推理费(Windows Blog)
  • ✓现在就能用:Copilot CLI 1.0.94-0 起 /model 可发现本机 Ollama 模型(需支持工具调用与流式)(GitHub Changelog)
  • ✓安全:MXC 智能体容器在 Windows 11 GA,Codex、Copilot、OpenClaw、LM Studio 等已支持,Claude Code、Hermes Agent 等将跟进
微软把 137B 编程模型搬上本地:MAI-Code-1.1-Flash 端侧版 SWE-Bench Verified 70.8%,GitHub Copilot 将自动在本地与云端间路由
🖼️要闻配图
点击全屏高清查看
🧭

把技术选型换算成你的开发预算

40 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟

🔬

深度技术解析与实战评估

核心背景与行业痛点

编程 Agent 的 Token 账单越跑越高,而大量补全、重构类子任务并不需要最贵的云端模型。10 月 7 日微软在 Windows 发布会 提出“混合智能”:能在本地跑的任务就放本地,需要前沿能力再上云,本地调用不计推理费。

架构亮点与底层机制

MAI-Code-1.1-Flash 是 137B 总参数、6.8B 激活的 MoE 编程模型。端侧版采用约 3.3 bit 混合精度量化(体积缩小近 80%)+ DFlash2 滑窗投机解码,运行在 Windows ARM64 的 llama.cpp CUDA 运行时上,保留 256K 上下文。GitHub HydraFusion 编排器会按性能、成本、延迟自动决定任务走本地还是云端;工具执行则由 MXC 容器按策略隔离文件、网络与凭据。

权威 Benchmark 与实测跑分对比

微软 10 月 5 日在 Surface Laptop Ultra 上实测:SWE-Bench Verified 端侧 70.80%(云端 72.6%),Terminal-Bench 2.1 端侧 66.29%(云端 62.9%),同环境 GPT-OSS-120B 为 32.0% / 23.6%。256K 上下文峰值内存 75.5GB,64K / 128K 预填充 923.5 / 769.8 tok/s。以上为厂商自测,尚无第三方复现。

开发者实战落地与开箱指南

现在即可:升级 Copilot CLI 到 1.0.94-0,用 /model 发现本机 Ollama 模型(需支持工具调用与流式),离线需显式设 COPILOT_OFFLINE=true,详见 GitHub Changelog。自动路由 10 月下旬以实验预览进入 Copilot app、CLI 与 VS Code;端侧 MAI 模型面向 RTX Spark 等大内存 PC,内存不足 128GB 的机器先用 Ollama 路线。

实战指南准备好将技术转化为生产力?

即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。