llm-d 架构
在任何加速器上实现 SOTA 推理性能
最新动态 🔥
- [2025-12] v0.4 版本发布。该版本展示了 DeepSeek V3.1 在 H200 GPU 上的每输出 token 延迟降低了 40%;支持 Intel XPU 和 Google TPU 解耦(disaggregation)以实现更低的首字延迟;为 prefix cache 卸载至 vLLM 原生 CPU 内存分层提供了新的指引路径;并预览了可提高模型即服务(MaaS)效率的工作负载变体自动扩缩器。
- [2025-10] 我们的 v0.3 版本带来了对 Intel XPU 和 Google TPU 的支持;在解耦模式下测试了基于 RoCE 的 TCP 和 RDMA;新增实验性预测延迟平衡功能,可将长 prefill 场景下的 P90 延迟提升高达 3 倍;DeepSeek 专家并行(Expert Parallel)服务在 H200 上达到 2.2k token/s/gpu,在 B200 上达到 2.9k token/s/gpu;并集成了推理网关(Inference Gateway)v1.0 GA 版本。
- [2025-08] 阅读更多关于 智能推理调度器 的信息,包括深入探讨如何组合不同的平衡技术,在不使副本过载的情况下提高吞吐量。
📄 关于
llm-d 是一个 Kubernetes 原生的分布式推理服务栈,为大规模服务大型生成式 AI 模型提供了清晰的指引路径。我们帮助您在大多数硬件加速器和基础设施提供商上,针对关键开源模型实现最快的“达到最先进(SOTA)性能的时间”。
我们的指引路径提供了经过测试和基准测试的食谱(recipes)和 Helm chart,以便利用生产部署中常见的最佳实践快速开始服务。这些方案具有可扩展性和可定制性,适用于您的特定模型和用例,并使用了 Kubernetes、Envoy 代理、NIXL 和 vLLM 等流行开源组件。我们的目标是消除大规模推理调优和部署中常见的沉重工作。
我们目前提供三种经过测试和基准测试的路径,以帮助部署大型模型:
- 智能推理调度 - 在 推理网关 (IGW) 后方部署 vLLM,通过 预测延迟平衡(实验性)、精确的前缀缓存感知路由以及可定制的调度策略来降低服务延迟并提高吞吐量。
- Prefill/Decode 解耦 - 通过将推理拆分为处理提示(prompt)的 prefill 服务器和处理响应的 decode 服务器,缩短首字延迟(TTFT)并获得更可预测的每输出 token 延迟(TPOT),主要适用于 Llama-70B 等大型模型以及处理极长提示的场景。
- 宽专家并行(Wide Expert-Parallelism) - 部署像 DeepSeek-R1 这样超大型的混合专家(MoE)模型,通过在快速加速器网络上利用 数据并行和专家并行 进行扩展,从而显著降低端到端延迟并提高吞吐量。
硬件支持
llm-d 直接测试并验证了多种加速器类型,包括 NVIDIA GPU、AMD GPU、Google TPU 和 Intel XPU,并提供通用的操作模式以提高生产可靠性。
查看 加速器文档 以了解有关测试过的加速器、网络和配置的更多联系信息,并查看我们的 路线图 了解后续计划。
llm-d 的适用范围
llm-d 目前致力于改进以下方面的生产服务体验:
- 运行在 PyTorch 或 JAX 中的生成式模型的在线服务和在线批处理
- 参数量在 10 亿或以上的大语言模型 (LLM)
- 使用一个或多个硬件加速器的绝大部分或全部容量
- 在吞吐量、延迟或多目标配置下运行
- 在近几代数据中心级加速器上
- NVIDIA A100 / L4 或更新版本
- AMD MI250 或更新版本
- Google TPU v5e 或更新版本
- Intel Data Center GPU Max (XPU/Ponte Vecchio) 系列或更新版本
- 具有极快的加速器互连和数据中心网络
- 主机上每个加速器 600-16,000 Gbps 的 NVLINK,或跨越 NVL72 等狭窄域
- TPU pod 内每个芯片 1,600-5,000 Gbps 的 TPU OCS 链路
- 跨越广域(>128 主机)域的每主机 100-1,600 Gbps 数据中心网络
- 使用 Kubernetes 1.29+ 作为硬件编排器
- 在大型(100-10万节点)预留云容量或数据中心中,通常与 AI 批处理和训练重叠
- 在具有预留、按需或竞价容量混合的中型(10-1000 节点)云部署中
- 在具有静态占用空间、通常分时使用的微型(1-10 节点)测试和资格验证环境中
我们的上游项目——特别是 vLLM 和 Kubernetes——支持更广泛的模型、加速器和网络,它们也可能从我们的工作中受益,但我们专注于优化和标准化前沿推理工作负载的操作和自动化挑战。
🧱 架构
llm-d 通过集成行业标准的开放技术来加速分布式推理:vLLM 作为默认模型服务器和引擎,推理网关(Inference Gateway)作为请求调度器和平衡器,Kubernetes 作为基础设施编排器和工作负载控制平面。
llm-d 的核心特性包括:
-
vLLM 优化的推理调度器: llm-d 基于 IGW 的模式,利用 Envoy 代理及其可扩展的平衡策略,专门为 LLM 做出可定制的“智能”负载均衡决策。利用运行遥测,推理调度器实现了过滤和评分算法,以做出具备 P/D、KV 缓存、SLA 和负载感知能力的决策。高级用户可以实现自己的评分器以进一步自定义算法,同时受益于 IGW 的流量控制和延迟感知平衡等功能。查看我们的 Northstar 设计
-
使用 vLLM 的解耦服务: llm-d 将 prefill 和 decode 阶段编排到独立的实例上——调度器决定哪个实例应该接收给定的请求,并且交易通过 decode 实例旁的 sidecar 进行协调。Sidecar 指示 vLLM 通过 NIXL 在快速互连(IB/RoCE RDMA、TPU ICI 和 DCN)上提供点对点的 KV 缓存传输。查看我们的 Northstar 设计
-
解耦的前缀缓存: llm-d 使用 vLLM 的 KVConnector 抽象来配置可插拔的 KV 缓存层次结构,包括将 KV 卸载到主机、远程存储以及 LMCache 等系统。我们计划支持两种 KV 缓存方案。查看我们的 Northstar 设计
- 独立 (N/S) 缓存:支持卸载到本地内存和磁盘,提供一种零运营成本的卸载机制。
- 共享 (E/W) 缓存:支持实例间的 KV 传输和具有全局索引的共享存储,能够以更高的运营复杂性换取更高的性能潜力。
-
基于硬件、工作负载和流量的变体自动扩缩: 一种感知流量和硬件的自动扩缩器,能够 (a) 测量每个模型服务器实例的容量,(b) 推导出考虑不同请求形状和 QoS 的负载函数,以及 (c) 评估近期的流量组合(QPS、QoS 和形状),以计算处理 prefill、decode 和延迟容忍型请求的最佳实例组合,从而利用 HPA 实现 SLO 级别的效率。查看我们的 Northstar 设计
更多信息请参见 项目提案。
🚀 开始使用
llm-d 可以作为一个完整解决方案安装(自定义启用的功能),也可以通过其单个组件进行实验性使用。
先决条件
llm-d 需要能够运行大型模型的加速器。我们的指引路径专注于数据中心加速器和网络,在这些范围之外遇到的问题可能无法得到同等水平的关注。
有关支持的硬件、网络、Kubernetes 集群配置和客户端工具的更多详情,请参见 我们指南的先决条件。
部署 llm-d
llm-d 提供了部署 推理调度器 的 Helm chart,以及一个参数化的 vLLM 部署,展示了 多种不同的生产配置。
我们将这些与我们的指引路径指南捆绑在一起,包含关键决策、权衡、基准测试和推荐配置。
如果您需要一个简单、生产就绪且具有优化负载均衡的 vLLM 部署,我们建议使用 推理调度 指引路径。
如需更深入地了解 llm-d,请尝试我们的 分步快速入门。
使用 llm-d 进行实验和开发
llm-d 由多个组件仓库组成,并衍生自 vLLM 和推理网关(Inference Gateway)上游。有关开发的更多指导,请参阅各个仓库。
📦 版本发布
我们的指南是动态文档并保持更新。有关 Helm chart 和组件发布的详细信息,请访问我们的 GitHub Releases 页面查看发布说明。
查看我们的 路线图了解即将发布的版本。
贡献
- 查看 我们的项目概览,了解有关我们开发流程和治理的更多详情。
- 阅读 我们的贡献指南,了解如何为项目做出贡献的详细信息。
- 加入我们的 特别兴趣小组 (SIGs),为项目的特定领域做出贡献并与领域专家协作。
- 我们使用 Slack 跨组织讨论开发工作。请加入:Slack
- 我们每周三东部时间中午 12:30 为贡献者举办站会,并为各个 SIG 举办会议。您可以在 llm-d 公共日历中找到它们。
- 我们使用 Google Groups 分享架构图和其他内容。请加入:Google Group
许可证
本项目采用 Apache License 2.0 授权。详见 LICENSE 文件。