OPEN SOURCE DEEP DIVE
SGLang:把前缀复用做成基数树的服务框架,也是前沿模型的 RL rollout 后端
LMSYS 托管的高性能服务框架:RadixAttention 前缀缓存、零开销 CPU 调度器、P/D 分离、DFlash 与 Spec V2 投机解码、压缩有限状态机做结构化输出、大规模专家并行(96 张 H100、GB200 NVL72 二期 3.8 倍 prefill / 4.8 倍 decode)。day-0 记录覆盖 Kimi K3、DeepSeek-V4、GLM5.2 NVFP4、Nemotron 3、MiniMax M2,并被 AReaL/Miles/slime/Tunix/verl 用作 RL rollout 后端。
RadixAttention:把前缀复用做成引擎的一等结构
SGLang 由非营利开源组织 LMSYS 托管,是高性能 LLM 与多模态模型服务框架。它的招牌是 RadixAttention:用基数树(radix tree)组织已经在显存里的 KV cache,让「多个请求共享同一段前缀」从一种偶然的缓存命中变成引擎的核心数据结构。任何共享系统提示词、few-shot 示例、多轮对话历史或 agent 工具定义的场景,重算的是差异部分而不是全量前缀。2024 年 1 月的发布博客给的是最高 5 倍推理加速。
这条路线与 vLLM 的分页内存是互补而非对立的:分页解决「块怎么放」,基数树解决「哪些块能被复用、以什么顺序匹配最长公共前缀」。SGLang 也确实在致谢里写明复用并学习了 vLLM、FlashInfer、Guidance、Outlines、LightLLM、LMQL 的设计与代码——这一层的开源项目互相搬运是常态,不是丑闻。
运行时的其余部分:零开销调度与大规模专家并行
README 把 Fast Runtime 拆成一串并列能力:RadixAttention 前缀缓存、零开销 CPU 调度器、prefill-decode 分离、投机解码、连续批处理、分页注意力、张量/流水线/专家/数据并行、结构化输出、分块 prefill、量化(FP4/FP8/INT4/AWQ/GPTQ)、多 LoRA 批处理。其中两项是它区别于同类的主要工程投入:
| 能力 | 解决的问题 | 公开结果 |
|---|---|---|
| 零开销 CPU 调度器(v0.4,2024-12) | 调度逻辑跑在 CPU 上,与 GPU 计算抢时间片;批越大、模型越快,CPU 侧越容易成为瓶颈 | v0.4 同时带来缓存感知负载均衡器与更快的结构化输出 |
| 大规模专家并行 + P/D 分离 | MoE 模型专家数超出单卡容量,且 prefill 与 decode 的最优并行策略不同,混在一起互相拖累 | 96 张 H100 上的部署博客(2025-05);GB200 NVL72 二期给到 3.8 倍 prefill、4.8 倍 decode 吞吐(2025-09) |
| 压缩有限状态机 | JSON 等结构化输出逐 token 校验语法,掩码计算本身成为开销 | 2024-02 博客:JSON 解码快 3 倍 |
| DFlash 与 Spec V2 | 投机解码的草稿质量与接受率 | 2026-06 博客称其为「下一代投机解码」;DFlash 也被 vLLM 列为可选路线之一 |
Day-0 记录:这条路线的真实竞争力指标
对一个服务引擎来说,最有说服力的不是某个稳态吞吐数字,而是新模型发布当天能不能跑起来、多久能跑到生产可用。SGLang 的 News 列表基本就是一部 day-0 记录:
| 时间 | 事件 |
|---|---|
| 2026-07 | 与 Miles 一起对 Kimi K3 提供 day-0 支持;RadixArk 与 Google 把完整 SGLang 特性带上 TPU;用 SGLang 服务 GLM5.2 NVFP4 的 agentic 负载,两周内做到 500 TPS |
| 2026-06 | DFlash 与 Spec V2;Nemotron 3 Ultra / Super、Higgs Audio v3 TTS 的 day-0 |
| 2026-04 | DeepSeek-V4 day-0:从快速推理到与 Miles 一起做可验证奖励 RL |
| 2026-02 | GB300 NVL72 上解锁 25 倍推理性能 |
| 2026-01 | SGLang Diffusion 加速视频与图像生成 |
| 2025-12 | MiMo-V2-Flash、Nemotron 3 Nano、Mistral Large 3、LLaDA 2.0 扩散 LLM、MiniMax M2 的 day-0 |
| 2025-10 | SGLang-Jax 后端,原生跑在 TPU 上 |
| 2025-09 | DeepSeek-V3.2 稀疏注意力 day-0 |
把扩散模型(WAN、Qwen-Image)与 TTS 也纳入同一个运行时,是它和纯 LLM 引擎的分野:SGLang 想当的是「生成类模型的统一服务层」,而不只是自回归解码器。
训练侧的身份:RL rollout 后端
README 单列了一段「RL & Post-Training Backbone」:SGLang 是被用于训练多个前沿模型的 rollout 后端,有原生 RL 集成,并被 AReaL、Miles、slime、Tunix、verl 等后训练框架采用。这一点很关键——RL 后训练里 rollout 的吞吐直接决定训练墙钟时间,而 rollout 又要求权重能热更新、KV cache 能按步重置。服务引擎能不能当好训练侧的采样器,是它进入前沿实验室的门票。SGLang 在这一侧的位置比在纯服务侧更硬。
规模与硬件
项目自述每天在生产中产出数万亿 token,部署覆盖超过 40 万张 GPU;采用方名单里既有 xAI、NVIDIA、AMD、Intel、LinkedIn、Cursor、Oracle Cloud、Google Cloud、Microsoft Azure、AWS、Baseten、Baidu、蚂蚁、阿里、腾讯,也有 MIT、UCLA、华盛顿大学、斯坦福、UC Berkeley、清华。硬件覆盖 NVIDIA(GB200/B300/H100/A100/Spark/5090)、AMD(MI355/MI300)、Intel Xeon CPU、Google TPU 与昇腾 NPU。2025 年 6 月拿到 a16z 第三批 Open Source AI Grant。
数字口径要说清楚:40 万张 GPU 与「数万亿 token/天」都是项目方陈述,没有第三方审计;本站按项目宣称收录。但 day-0 记录、被哪些后训练框架采用、以及 LMSYS 的治理身份是可核验的事实,这三项才是判断它位置的主要依据。
一个有意思的细节:SGLang 给长期活跃贡献者提供编码 agent 赞助(Cursor、Claude Code 或 OpenAI Codex),凭重要 commit 或 PR 申请。开源推理引擎用 AI 编程订阅当贡献者激励,本身就是这条赛道当前状态的注脚。