@Brjen 团队在一块 RTX 3090(24GB)上花一周对比本地编码智能体配置,胜出组合为 Qwen3.8-27B Unsloth UD-Q4_K_XL + llama.cpp(65k 上下文、q8 KV、原生 MTP depth 2、全 GPU)。真实多步编码跑分约 59 tok/s(45k 上下文时约 46 tok/s),并通过嵌套工具 JSON、修失败测试与正确 unified diff 等门槛;认为 Q3 不可靠、更高量化挤占上下文,Flash-Next 需卸载反而不稳。
核心要点速览 (Key Takeaways)
- ✓胜出:Qwen3.8-27B UD-Q4_K_XL + llama.cpp,65k 上下文与 MTP,全在 3090 GPU。
- ✓多步编码约 59 tok/s;通过工具 JSON、修测与正确 diff 等实用门槛。
- ✓Q3/过重量化与需卸载的 Flash-Next 在 24GB 上不如该组合稳。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察