开源 C++ 推理引擎 Strata 让 125B 参数(激活 6B)的 Qwen3.8-Flash-Next 在 12GB 显存游戏卡 + 32–64GB 内存的普通 PC 上运行,并在本机提供 OpenAI / Anthropic / Responses 兼容 API,可直接接入 Claude Code 与 Codex CLI。项目 GitHub 已超 1 万 star,登上 Hacker News 前排(507 分)。

核心要点速览

🧭

Claude Code 高频使用:比较订阅额度与 API 账单

29+ 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟

🔬

深度技术解析与实战评估

核心背景与行业痛点

阿里通义的 Qwen3.8-Flash-Next 是 125B 参数的 MoE 模型,按常规需要服务器级显存才能跑。对想在本地跑编码智能体、又不愿把代码发到云端的开发者来说,这一直是门槛。开源项目 Strata 把它搬到了普通游戏 PC 上,10 月 4 日登上 Hacker News 前排(507 分),GitHub 已约 1.07 万 star。

架构亮点与底层机制

模型总参 125B,但每个 token 只激活约 6B(512 个专家,路由 10 个加 1 个共享)。Strata 利用这一点:把常用专家缓存在显存,其余放在内存,并按对话自适应在内存和显存之间换入换出。长上下文时 KV 缓存驻留内存、只把注意力要读的部分放进显存(KV streaming),腾出空间缓存更多专家。另有 4-bit / K8V4 混合 KV、投机解码草稿头,以及内存不足时从 SSD 映射专家的低内存模式。

权威 Benchmark 与实测跑分对比

以下为项目在 DETAILS.md 公布的自测数据:RTX 5070(12GB)+ 64GB 内存,Q2_0 生成约 94 tok/s、32K 提示读入约 2,650 tok/s;IQ3_S 约 53 tok/s;Coder 版约 55 tok/s。AMD RX 9070 XT 上 Q2_0 约 60 tok/s。作者估计 RTX 3090 可达 100–140 tok/s,但这只是估算,未实测。Coder 版裁掉一半专家,作者自称保留完整模型约 91% 的 SWE-bench Verified 得分,暂无第三方复现。

开发者实战落地与开箱指南

需要 12GB 以上显存的 NVIDIA RTX 20–50 系或部分 AMD 显卡、32GB 以上内存和约 80GB 磁盘。Windows 双击 START-HERE.bat,Linux 运行 ./setup.sh,安装器按内存推荐量化档位(32GB 选 Coder,64GB 推荐 IQ2_XS)。启动后把 OpenAI 兼容地址设为 http://127.0.0.1:8080/v1;Claude Code 设 ANTHROPIC_BASE_URL=http://127.0.0.1:8080,Codex CLI 走 /v1/responses。也可让编码助手按 AI_SETUP.md 自动安装,或通过 MCP 服务器 控制启停。

实战指南准备好将技术转化为生产力?

即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。