ggml-org 于 2026-09-23 发布 llama.cpp v0.5.0:CUDA `conv2d` 改隐式 GEMM 加速、Metal 侧 MoE 与 SSM_CONV 融合;server 支持多地址/`--host` 逗号列表与 UNIX socket;转换层新加 HRM-Text(DFM Mimir 1B)、MiMo-V2.6、HunyuanOCR(DFlash),并捆绑 ggml 0.25.0。
核心要点速览 (Key Takeaways)
- ✓发布:v0.5.0(2026-09-23),相对站内既有 v0.4.1 为大版本跃迁
- ✓性能:CUDA `conv2d` 隐式 GEMM(#29135);Metal MoE + SSM_CONV fusion(#28948);MTP drafting 启用 CUDA graphs(#28549)
- ✓模型:HRM-Text / DFM Mimir 1B、MiMo-V2.6 转换、HunyuanOCR DFlash、Qwen4Exp hyper-connection + sparse FA、Nemotron MTP/H 扩展
- ✓Server:`--host` 支持逗号分隔 TCP 与 UNIX socket(#28690);function-call 输出可带 `input_image`;router 驱逐竞态修复
- ✓API:`llama_adapter_lora_init_from_file_ptr()`;采样参数可走环境变量;`llama-bench --version`
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
本地与边缘侧推理要同时吃满 NVIDIA CUDA 与 Apple Silicon,还要跟上新视觉、MoE 与 OCR 架构。开发者痛点集中在:conv2d/MoE 内核偏慢拖累多模态吞吐、单 --host 难以同时绑定多网卡与 UNIX socket、新模型权重转换脚本滞后导致无法本地验证。ggml-org 在 llama.cpp v0.5.0(2026-09-23)把后端性能、模型覆盖与 server/router 稳健性一并推进,并捆绑 ggml 0.25.0。
架构亮点与底层机制
CUDA 路径用隐式 GEMM 加速 conv2d(#29135);Metal 增加 MoE 与 SSM_CONV 融合(#28948);MTP drafting 打开 CUDA graphs。Server 允许 --host 逗号分隔多地址与 UNIX socket,function-call 输出可带 input_image。转换/架构侧新增 HRM-Text(DFM Mimir 1B)、MiMo-V2.6、HunyuanOCR(DFlash)、Qwen4Exp hyper-connection 与 sparse flash attention,并扩展 Nemotron MTP/H。API 增加自 FILE* 加载 LoRA,采样温度/top-p/min-p 可走环境变量,llama-bench 新增 --version。
权威 Benchmark 与实测跑分对比
官方 changelog 未贴统一 tok/s 对比表,只列出内核与融合优化 PR 编号。请在目标 GPU/Metal 上用本机 llama-bench --version 复跑,勿臆造相对 v0.4.1 的百分比。多模态侧修复了 SigLIP 高低宽图 bucket 越界等正确性项,属于稳定性而非榜单跃迁。
开发者实战落地与开箱指南
git checkout v0.5.0 后按平台编译。--host 0.0.0.0,127.0.0.1,/tmp/llama.sock 多绑定;核对 router 子进程不再继承 log/API key 文件。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察