ggml-org 于 10 月 5 日发布 llama.cpp v0.6.0 稳定版(上一版 v0.5.0 为 9 月 23 日)。本版把 GLM-5.3-Flash(GLM5-Next,320B 图文混合 MoE)支持带进正式版,Qwen4Exp 加入 MTP 投机解码(DGX Spark 上解码约 1.5 倍),引入支持 token/embedding 混合批次的 llama_batch_ext 与 llama_process() 新 API,并为 Apple GPU 新增小批量 MMA 矩阵乘内核(投机/批量解码场景最高约 3 倍),ggml 升级到 v0.26.0。会话格式版本号同时升级,旧会话文件需注意兼容。

核心要点速览

  • ✓新模型:GLM-5.3-Flash(GLM5-Next,320B KDA/DSA 混合图文 MoE,#27773)、Clef 图文决策模型、Ling 3.0 VL、LFM2.5-Encoder
  • ✓提速:Qwen4Exp MTP 投机解码在 DGX Spark 上解码约 1.5 倍;Metal 小批量 MMA 矩阵乘最高约 3 倍(#29869)
  • ✓API:新增 llama_batch_ext + llama_process(),单批次混合 token 与 embedding(#24669);server 已迁移
  • ✓兼容性:LLAMA_SESSION_VERSION 升至 11、LLAMA_STATE_SEQ_VERSION 升至 4,旧的会话/状态文件需重新生成
  • ✓Server:/v1/models 返回输入输出模态;/v1/embeddings 接受图像/音频/视频类型输入;新增 /v1/systemone 决策模型接口
🧭

把技术选型换算成你的开发预算

29+ 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟

🔬

深度技术解析与实战评估

核心背景与行业痛点

本地推理圈过去一个月最关心的是 GLM-5.3-Flash 能否在 llama.cpp 主线稳定运行——此前大家依赖第三方 GGUF 和分支补丁。llama.cpp v0.6.0 是 9 月 23 日 v0.5.0 之后的下一个稳定标签,把这些支持一次打包进正式版,同时修整了投机解码与 Apple 设备性能。

架构亮点与底层机制

最大的底层变化是新的 llama_batch_ext 批处理 API 与 llama_process():同一批次可以混合原始 token 与 embedding,并为 MTP、deepstack 类模型携带每 token 的「状态 embedding」(#24669),server、mtmd 和投机解码都已迁移。模型侧加入 GLM-5.3-Flash(320B KDA/DSA 混合注意力、mHC 与 MoE,#27773)以及 Qwen4Exp 的 MTP 投机解码;还新增模型驱动的 W4A4(NVFP4/MXFP4)矩阵乘路径,ggml 升级到 v0.26.0。

权威 Benchmark 与实测跑分对比

官方发布说明给出两组数字:Qwen4Exp 的 MTP 投机解码在 DGX Spark 上解码约 1.5 倍;Metal 新的小批量 MMA 矩阵乘内核在投机与批量解码场景下最高约 3 倍(#29869)。GLM-5.3-Flash 本身的 tokens/s 未在说明里给出,需要自行实测。

开发者实战落地与开箱指南

从 Releases 页面 下载预编译包或拉取标签重新编译即可。升级前注意:会话格式升到 LLAMA_SESSION_VERSION 11,保存过的会话和状态文件需要重新生成;调用 C API 的项目要迁移到 llama_batch_ext。Server 用户会发现 /v1/models 现在会返回输入输出模态,/v1/embeddings 可接受图像/音频/视频输入。

实战指南准备好将技术转化为生产力?

即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。