ggml-org 于 2026-09-23 发布 llama.cpp v0.5.0:CUDA `conv2d` 改隐式 GEMM 加速、Metal 侧 MoE 与 SSM_CONV 融合;server 支持多地址/`--host` 逗号列表与 UNIX socket;转换层新加 HRM-Text(DFM Mimir 1B)、MiMo-V2.6、HunyuanOCR(DFlash),并捆绑 ggml 0.25.0。

核心要点速览 (Key Takeaways)

  • ✓发布:v0.5.0(2026-09-23),相对站内既有 v0.4.1 为大版本跃迁
  • ✓性能:CUDA `conv2d` 隐式 GEMM(#29135);Metal MoE + SSM_CONV fusion(#28948);MTP drafting 启用 CUDA graphs(#28549)
  • ✓模型:HRM-Text / DFM Mimir 1B、MiMo-V2.6 转换、HunyuanOCR DFlash、Qwen4Exp hyper-connection + sparse FA、Nemotron MTP/H 扩展
  • ✓Server:`--host` 支持逗号分隔 TCP 与 UNIX socket(#28690);function-call 输出可带 `input_image`;router 驱逐竞态修复
  • ✓API:`llama_adapter_lora_init_from_file_ptr()`;采样参数可走环境变量;`llama-bench --version`
🔬

深度技术解析与实战评估

核心背景与行业痛点

本地与边缘侧推理要同时吃满 NVIDIA CUDA 与 Apple Silicon,还要跟上新视觉、MoE 与 OCR 架构。开发者痛点集中在:conv2d/MoE 内核偏慢拖累多模态吞吐、单 --host 难以同时绑定多网卡与 UNIX socket、新模型权重转换脚本滞后导致无法本地验证。ggml-org 在 llama.cpp v0.5.0(2026-09-23)把后端性能、模型覆盖与 server/router 稳健性一并推进,并捆绑 ggml 0.25.0。

架构亮点与底层机制

CUDA 路径用隐式 GEMM 加速 conv2d(#29135);Metal 增加 MoE 与 SSM_CONV 融合(#28948);MTP drafting 打开 CUDA graphs。Server 允许 --host 逗号分隔多地址与 UNIX socket,function-call 输出可带 input_image。转换/架构侧新增 HRM-Text(DFM Mimir 1B)、MiMo-V2.6、HunyuanOCR(DFlash)、Qwen4Exp hyper-connection 与 sparse flash attention,并扩展 Nemotron MTP/H。API 增加自 FILE* 加载 LoRA,采样温度/top-p/min-p 可走环境变量,llama-bench 新增 --version。

权威 Benchmark 与实测跑分对比

官方 changelog 未贴统一 tok/s 对比表,只列出内核与融合优化 PR 编号。请在目标 GPU/Metal 上用本机 llama-bench --version 复跑,勿臆造相对 v0.4.1 的百分比。多模态侧修复了 SigLIP 高低宽图 bucket 越界等正确性项,属于稳定性而非榜单跃迁。

开发者实战落地与开箱指南

  • 拉取:Release v0.5.0 或源码 git checkout v0.5.0 后按平台编译。

  • Server:尝试 --host 0.0.0.0,127.0.0.1,/tmp/llama.sock 多绑定;核对 router 子进程不再继承 log/API key 文件。

  • 新模型:按仓库 docs 走 MiMo-V2.6 / HunyuanOCR / Mimir 转换脚本后再量化部署。

  • 仓库与站点:github.com/ggml-org/llama.cpp、llama.app。