Inco AI 发布开源本地推理引擎 Splash,面向 Apple 硅与 Qwen3.8-27B 等型号优化。官方称在 M5 Max MacBook Pro 上可达约 144 tok/s,解码速度约为 Ollama 的 3 倍、oMLX 的 2 倍,智能体扇出子代理时接近 4 倍;LM Studio 已在 Day 0 接入并可在 Settings > Runtime > Experimental backends 启用。

核心要点速览 (Key Takeaways)

  • 开源 Splash:专为 Apple 硅与 Qwen3.8-27B 优化的本地推理引擎。
  • 官方演示:M5 Max 上约 144 tok/s;相对 Ollama/oMLX 可达约 3×/2×,子代理扇出时接近 4×。
  • LM Studio Day 0 接入;引擎仓库 github.com/incoai/splash,说明见 lmstudio.ai/blog/splash-engine。
ADSponsored