sgl-project/sglangApache-2.0 SGLang:把前缀复用做成基数树的服务框架,也是前沿模型的 RL rollout 后端
LMSYS 托管的高性能服务框架:RadixAttention 前缀缓存、零开销 CPU 调度器、P/D 分离、DFlash 与 Spec V2 投机解码、压缩有限状态机做结构化输出、大规模专家并行(96 张 H100、GB200 NVL72 二期 3.8 倍 prefill / 4.8 倍 decode)。day-0 记录覆盖 Kimi K3、DeepSeek-V4、GLM5.2 NVFP4、Nemotron 3、MiniMax M2,并被 AReaL/Miles/slime/Tunix/verl 用作 RL rollout 后端。
推理引擎RadixAttentionPrefix Caching