Inco AI open-sourced Splash, a local inference engine built for Apple silicon and models like Qwen3.8-27B. On an M5 Max MacBook Pro it reports about 144 tok/s—up to 3× Ollama, 2× oMLX, and nearly 4× when an agent fans out sub-agents. LM Studio shipped day-0 support under Settings > Runtime > Experimental backends.

Key Takeaways

  • Open-source Splash: local inference tuned for Apple silicon and Qwen3.8-27B.
  • Demo: ~144 tok/s on M5 Max; up to ~3× Ollama / 2× oMLX, nearly 4× with agent fan-out.
  • LM Studio day-0 support; repo github.com/incoai/splash; blog lmstudio.ai/blog/splash-engine.
ADSponsored