高性能大模型推理框架 SGLang 宣布对开源权重 GLM-5.3 实现 Day-0 生产级适配。在真实多轮 Agent 复杂负载下,8×B300 上 NVFP4 吞吐达到 537.6 tok/s/user,并同步支持 AMD MI300X/355X 硬件加速。
核心要点速览 (Key Takeaways)
- ✓首发适配开源 320B-A18B 混合注意力架构,实现权重发布当日即可高并发部署上线;
- ✓基于 NVFP4 与 FP8 量化内核深度优化,在真实 Agent 编程会话中保持超 500 Token/s 用户吞吐;
- ✓同一套开源代码库全面打通 NVIDIA Blackwell/Hopper 与 AMD MI300X/325X/355X,避免硬件锁定。