ai-dynamo/dynamoNOASSERTION Dynamo:推理引擎之上的数据中心级编排层,KV 感知路由、分层 KVBM 与 SLA 驱动的 Planner
NVIDIA 开源(Apache-2.0)的编排层,Rust 写性能路径、Python 留扩展面。明确不替代 SGLang/TensorRT-LLM/vLLM,而是把它们接成协同的多节点系统:分离式 prefill/decode、KV 感知路由(Qwen3-Coder 480B 上 TTFT 快 2 倍)、KVBM 把 KV cache 卸载到 CPU/SSD/远端、ModelExpress 走 NVLink 流式传权重让冷启动快 7 倍、Planner 按 SLA 自动扩缩(阿里生产环境违约少 80% 且 TCO 低 5%)、Grove 做 NVL72 拓扑感知调度。
Inference OrchestrationKV CacheDisaggregated Serving