NVIDIA RTX Spark 公布本地 Agent 推理优化:GeForce RTX 5090 上 llama.cpp 吞吐最高提升约 1.9 倍;RTX PRO 6000 Blackwell 上 vLLM 约 1.2 倍;双机 DGX Spark 集群最高约 1.4 倍。面向本地部署与边缘 Agent 服务路径的持续加速。

核心要点速览 (Key Takeaways)

  • llama.cpp:RTX 5090 吞吐最高约 1.9×,本地 Agent 推理更轻。
  • vLLM:RTX PRO 6000 Blackwell 约 1.2×;双机 DGX Spark 集群最高约 1.4×。
  • 定位:强化本地 / 边缘 Agent 服务栈,而非仅云端推理。
ADSponsored