开发者 3 秒速决决策指标
开源 C++ 推理引擎 Strata 让 125B 参数(激活 6B)的 Qwen3.8-Flash-Next 在 12GB 显存游戏卡 + 32–64GB 内存的普通 PC 上运行,并在本机提供 OpenAI / Anthropic / Responses 兼容 API,可直接接入 Claude Code 与 Codex CLI。项目 GitHub 已超 1 万 star,登上 Hacker News 前排(507 分)。
核心要点速览
- ✓规模:Qwen3.8-Flash-Next 总参 125B、激活 6B(512 专家、每 token 10 路由 + 1 共享),原生 262K 上下文(模型卡)
- ✓实测速度:RTX 5070 12GB + 64GB 内存,Q2_0 生成约 94 tok/s、32K 提示读入约 2,650 tok/s;AMD RX 9070 XT 约 60 tok/s(DETAILS.md)
- ✓门槛:12GB 显存 + 32GB 内存起步,模型下载约 70GB;Coder 版裁掉一半专家,作者称保留完整模型约 91% 的 SWE-bench Verified 得分
- ✓接入:本机
" target="_blank" rel="noopener noreferrer" class="news-link text-cyan-600 dark:text-cyan-400 font-semibold hover:underline">http://127.0.0.1:8080/v1,兼容 OpenAI、Anthropic /v1/messages` 与 Responses API,另带 MCP 服务器 - ✓热度:GitHub 约 10.7k star、946 fork,MIT 许可,v0.1.39 于 10 月 4 日发布
Claude Code 高频使用:比较订阅额度与 API 账单
29+ 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
阿里通义的 Qwen3.8-Flash-Next 是 125B 参数的 MoE 模型,按常规需要服务器级显存才能跑。对想在本地跑编码智能体、又不愿把代码发到云端的开发者来说,这一直是门槛。开源项目 Strata 把它搬到了普通游戏 PC 上,10 月 4 日登上 Hacker News 前排(507 分),GitHub 已约 1.07 万 star。
架构亮点与底层机制
模型总参 125B,但每个 token 只激活约 6B(512 个专家,路由 10 个加 1 个共享)。Strata 利用这一点:把常用专家缓存在显存,其余放在内存,并按对话自适应在内存和显存之间换入换出。长上下文时 KV 缓存驻留内存、只把注意力要读的部分放进显存(KV streaming),腾出空间缓存更多专家。另有 4-bit / K8V4 混合 KV、投机解码草稿头,以及内存不足时从 SSD 映射专家的低内存模式。
权威 Benchmark 与实测跑分对比
以下为项目在 DETAILS.md 公布的自测数据:RTX 5070(12GB)+ 64GB 内存,Q2_0 生成约 94 tok/s、32K 提示读入约 2,650 tok/s;IQ3_S 约 53 tok/s;Coder 版约 55 tok/s。AMD RX 9070 XT 上 Q2_0 约 60 tok/s。作者估计 RTX 3090 可达 100–140 tok/s,但这只是估算,未实测。Coder 版裁掉一半专家,作者自称保留完整模型约 91% 的 SWE-bench Verified 得分,暂无第三方复现。
开发者实战落地与开箱指南
需要 12GB 以上显存的 NVIDIA RTX 20–50 系或部分 AMD 显卡、32GB 以上内存和约 80GB 磁盘。Windows 双击 START-HERE.bat,Linux 运行 ./setup.sh,安装器按内存推荐量化档位(32GB 选 Coder,64GB 推荐 IQ2_XS)。启动后把 OpenAI 兼容地址设为 http://127.0.0.1:8080/v1;Claude Code 设 ANTHROPIC_BASE_URL=http://127.0.0.1:8080,Codex CLI 走 /v1/responses。也可让编码助手按 AI_SETUP.md 自动安装,或通过 MCP 服务器 控制启停。
即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察