高吞吐大模型推理引擎 SGLang 迎来里程碑版本 v0.5.20,汇聚来自 237 位开发者的 713 个合并 PR。新版本重磅推出面向强化学习(RL)采样轨迹的 return_sampling_mask 机制,在解码阶段直接输出候选采样空间与对数概率,彻底告别训练阶段反查 Top-k/Top-p 的高开销;结合采样掩码的重叠流水线调度,在 Qwen3-8B Batch 64 场景下解码吞吐暴增 52%。此外,统一基数树(Unified Radix Tree)为滑动窗口注意力(SWA)提供分支点复用,并全面支持 GLM-5.3-Flash、腾讯 Hy4-Preview 与 Qwen3.8-Flash-Next 等最新前沿模型。
- ✓合并规模空前:汇聚 237 位社区贡献者提交的 713 个 PR,覆盖强化学习采样、调度重叠与自回归/扩散新模型支持
- ✓RL Rollout 零重建回放:新增 return_sampling_mask 接口,精确输出解码候选集与 log-prob,为 GRPO/PPO 算法节省海量重构开销
- ✓重叠调度性能跃升:在 Qwen3-8B 实测中,Batch 1 解码吞吐提升 17%,Batch 64 下吞吐跃升 52%,显存流水线重叠更彻底
- ✓SWA 统一基数树缓存:重构 Radix Tree 结构,支持混合注意力与滑动窗口架构的分支节点复用,长文本首字延迟显著降低
- ✓首日模型生态完备:同步适配智谱 GLM-5.3-Flash、腾讯混元 Hy4-Preview、千问 Qwen3.8-Flash-Next 以及商汤 SenseNova 扩散模型
🔗
相关资源与官方项目出处
免代理直达💡 国内无需访问 Twitter,可直接访问上述项目官方资源与文档🔬
深度技术解析与实战评估
核心背景与行业痛点 在大语言模型进入强化学习(PPO / GRPO / DPO)后训练与测试时计算(Test-Time Compute)时代的当下,在线推理引擎不仅要追求极高的并发吞吐,更要与训练框架紧密联动。传统推理引擎在执行强化学习采样(Rollout)时,只能返回最终生成的 Token,导致训练端在计算策略梯度与重要性采样比率时,必须消耗昂贵的算力逆向重构 Top-k 与 Top-p 的候选截断空间。此外,随着具备混合注意力(Hybrid-Attention)与滑动窗口注意力(SWA)的新一代大模型普及,传统基数树(Radix Tree)前缀缓存难以跨窗口有效复用分支,造成长文本推理的首字延迟(TTFT)与显存浪费居高不下。 ### 架构亮点与底层机制 SGLang v0.5.20 针对上述瓶颈进行了深度的底层架构重构: 1. 强化学习采样掩码原语(Sampling Masks for RL):通过引入 return_sampling_mask 核心参数,SGLang 在每个 Decode 步直接返回当前采样器所依据的精确候选 Token 支持集以及生成 Token 的对数概率。训练器无需重构概率分布即可无缝回放轨迹,同时与 DisallowedTokensLogitsProcessor 深度解耦兼容; 2. 掩码流水线重叠调度(Overlap Scheduling):将采样掩码的处理逻辑与 GPU 计算流水线进行全异步重叠编排,通过 --sampling-mask-max-tokens(默认 4096)精确配额显存,大幅消除 CPU-GPU 同步阻塞; 3. 混合注意力统一基数树(Unified Radix Tree):为 SWA 组件重构了分支点级联缓存,使滑动窗口模型能够像标准因果注意力一样在多轮对话中安全命中共享前缀缓存; 4. 扩展架构首日支持:新增对智谱 GLM-5.3-Flash、腾讯 Hy4-Preview、阿里 Qwen3.8-Flash-Next 自回归模型以及 MiniMax FastH3、商汤 SenseNova-U1.5-8B-MoT 扩散模型的深度算子适配。 ### 权威 Benchmark 与实测跑分对比 SGLang 官方在多款业界标杆硬件与模型上进行了详实跑分: - 解码吞吐对比:在 NVIDIA H100 80GB 上运行 Qwen3-8B 模型,在开启采样掩码与重叠调度后,Batch Size = 1 场景下的解码吞吐较上一代版本提升 17%,而在高并发 Batch Size = 64 场景下,吞吐大幅跃升 52%; - RL 训练管线端到端提速:在结合 DeepSpeed / Ray 执行 GRPO 对齐训练的集成测试中,因消除了训练侧的概率重构与额外前向校验,整体分布式 RL 训练单轮耗时降低 28.4%; - SWA 前缀命中率:在长达 32K 上下文的多轮评测中,统一基数树使滑动窗口架构的前缀缓存命中率由原先的 21.3% 飙升至 78.9%,首字生成延迟(TTFT)降低 63%。 ### 开发者实战落地与开箱指南 开发者可通过 PyPI 或 Docker 镜像直接升级: ``bash pip install --upgrade sglang # 启动面向强化学习采样的高吞吐服务,开启重叠调度与掩码输出 python -m sglang.launch_server \ --model-path Qwen/Qwen3.8-Flash-Next \ --port 30000 \ --return-sampling-mask \ --sampling-mask-max-tokens 4096 ` 在客户端调用时,通过 /generate 传入 return_sampling_mask: true 即可在流式返回中直接提取每一步的精细 logprobs 与候选掩码。完整更新日志见 GitHub 发行页 https://github.com/sgl-project/sglang/releases/tag/v0.5.20 与官方文档 https://docs.sglang.io`。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察