OPEN SOURCE DEEP DIVE
TensorRT-LLM:NVIDIA 的专用核与机架级并行引擎,把 agentic 服务做成一等议题
NVIDIA 的 LLM 与视觉生成推理优化库,2025-03-22 起完全开源。28 篇技术博客构成一份可查的工程账本:Skip Softmax 与稀疏注意力压长上下文、专家并行三部曲与 NVLink 单边 AlltoAll、NVL72 的 DWDP、引导解码与投机解码协作、推理时计算,以及用 trace 回放与作业级指标评估 agentic 服务。宣称 Llama 4 Maverick 单用户破 1000 TPS、B200 上超 40000 tok/s,Bing 与 NAVER Place 在生产使用。
硬件厂商的推理引擎:算子、运行时与一份公开的技术博客账本
TensorRT-LLM 是 NVIDIA 的 LLM 与视觉生成模型推理优化库,自我描述是三件事的组合:面向常见算子的专用核、一套高效运行时、以及一个可以定制与扩展系统的 Python 化框架。2025 年 3 月 22 日起它完全开源,开发转移到 GitHub——在那之前它是随 TensorRT 分发的闭源组件,这一点决定了它的历史定位与现在的差别。
它与 vLLM / SGLang 的结构性不同在于:那两者是硬件中立的社区项目,TensorRT-LLM 是硬件厂商为自家芯片做深度优化的引擎。所以它的技术博客读起来是另一类文献——不是「我们支持了什么模型」,而是「在这块芯片上把这个模型的这个算子压到了什么程度」。
从技术博客看它真正在优化的东西
仓库的 Tech Blogs 列表是判断它工程重心最可靠的入口,按主题归类如下:
| 主题 | 博客(日期) | 要解决的问题 |
|---|---|---|
| 长上下文注意力 | Skip Softmax Attention 加速长上下文推理(02/06);TensorRT LLM 中的稀疏注意力(03/04) | 注意力随序列长度平方增长;跳过与稀疏化是把它压回可服务范围的两条路 |
| MoE 与专家并行 | 扩展专家并行三部曲(06/05 设计与实现、08/01 性能现状与优化、10/13 推性能边界);用 NVLink 上的单边 AlltoAll 优化 MoE 通信(03/16) | 专家并行的瓶颈在 all-to-all 通信;单边通信绕开对端 CPU 参与 |
| 机架级并行 | DWDP:面向 NVL72 高性能推理的分布式权重数据并行(04/03) | NVL72 这种一个域内 72 张卡的机架,需要新的并行维度而不是把老维度放大 |
| 分离式服务 | TensorRT LLM 中的分离式服务(06/19) | prefill 与 decode 拆开独立扩缩 |
| 投机解码 | N-Gram 投机解码与自动启用(07/26);把引导解码与投机解码结合,让 CPU 与 GPU 无缝协作(09/19) | 前者零草稿模型成本并自动判断是否值得开;后者解决结构化输出与投机解码互相拖累的问题 |
| 执行图 | 调优 CUDA Graph 批大小以提高输出吞吐(04/03) | CUDA Graph 按批大小分桶,桶的粒度直接决定重放命中率 |
| 推理时计算 | TensorRT LLM 中的推理时计算实现(09/26) | 把 test-time compute / 多轮自洽这类「用更多解码换更好答案」的模式做进引擎 |
| agentic 负载 | agent 应用与 TensorRT-LLM 的联合优化(05/15);用 trace 回放与作业级指标评估 agentic 服务(08/20);DeepSeek-V4 在 Blackwell 上的模型专属与 agentic 负载优化(07/17) | agent 的请求形态与聊天完全不同:多轮、长前缀复用、工具调用、以「作业」而非「请求」为计量单位 |
| 视觉生成 | 跨 NVL72 机架扩展视频生成(07/01);用 GEMM 量化、注意力量化与 Skip Softmax 加速视频生成(09/02) | 扩散模型进入同一个引擎;2026-04-03 起正式支持视觉生成扩散模型 |
两条线索值得单独指出。一是 agentic 服务已经成为一等议题:不仅做联合优化,还提出了「trace 回放 + 作业级指标」的评估方法——承认按单请求 QPS/延迟衡量 agent 负载是错的。二是 扩散模型进了同一个引擎,与 SGLang 的 SGLang Diffusion 是同一个方向,说明「LLM 推理引擎」正在扩成「生成模型推理引擎」。
公开的性能口径
历史新闻里能拿到的量化结果包括:Blackwell 上用 Meta Llama 4 Maverick 突破单用户 1,000 TPS 的门槛;Llama 4 在 B200 上超过 40,000 tokens/s;Llama 3.3 70B 用投机解码把推理吞吐提高 3 倍(另有 3.6 倍的整体吞吐提升口径);NVIDIA Blackwell 用 TensorRT-LLM 创下 DeepSeek-R1 推理性能世界纪录,并在 Hugging Face 上放出 nvidia/DeepSeek-R1-FP4 权重。day-0 支持记录包括 OpenAI 的 GPT-OSS-120B / 20B 与 LG AI Research 的 EXAONE 4.0。生产采用方点名了 Bing(搜索的 LLM/SLM 化)与 NAVER Place(基于 SLM 的垂直服务)。
这些数字全部来自 NVIDIA 自己的博客或发布稿,没有独立第三方在同一硬件上的复现,本站按厂商宣称收录。FP4 是其中值得留意的一项:它是 Blackwell 的原生低精度格式,权重与激活都压到 4 比特量级,「每 token 成本」在这一档上会有台阶式变化,而它目前主要在这家的硬件上可用。
与 KV cache 复用、以及它在栈里的位置
2025 年 1 月它单独发过 KV cache 复用优化,这与 SGLang 的 RadixAttention、Dynamo 的 KV 感知路由是同一个问题在不同层的三种解法:引擎内部做块级复用、用基数树做前缀匹配、在集群层按缓存重叠度做路由。三层可以叠加,不是互斥选项。
选型上的实际结论:如果部署目标就是 NVIDIA 硬件、且要吃 FP4 与 NVL72 机架级并行的红利,TensorRT-LLM 的算子深度是社区引擎短期难以追平的;如果需要跨硬件(AMD、Intel、TPU、昇腾)或需要最大的模型架构兼容面,vLLM 与 SGLang 更省事。Dynamo 把三家都接成后端,等于官方承认这个选择是负载相关的,不是全局唯一的。