使用 llm-d 在 Kubernetes 上实现高性能分布式推理
我们的指南提供了经过测试和基准测试的方案及 Helm chart,旨在以生产部署中常见的最佳实践,实现大语言模型 (LLM) 的峰值性能服务。本文假设您已熟悉 Kubernetes 的基础部署和操作。
提示
如果您想通过实践学习,请参考 QUICKSTART.md 进行分步首次部署。
这些指南(以及 llm-d)适用于谁?
这些指南面向部署生产级 LLM 服务、希望在最大限度降低操作复杂性的同时获得最佳性能的初创公司和企业。先进的 LLM 推理涉及多种优化,根据使用场景的不同,这些优化之间存在权衡。本指南可帮助您识别这些关键优化,理解其权衡,并针对您自己的工作负载验证收益。
我们专注于以下使用场景
- 在数十或数百个节点上跨单一工作负载部署自托管 LLM
- 运行生产级模型即服务 (MaaS) 平台,支持多个用户和工作负载共享一个或多个 LLM 部署
“明径” (Well-Lit Path) 指南
“明径”是一套经过记录、测试和基准测试的首选解决方案,旨在降低采用风险和维护成本。这些是大型语言模型服务生产部署中常见的核心最佳实践。
我们目前提供以下经过测试和基准测试的路径,以帮助您部署大型模型
- 智能推理调度 - 在 推理网关 (IGW) 后部署 vLLM,通过 精确的前缀缓存感知路由 和 可定制的调度策略 来降低延迟并提高吞吐量。
- Prefill/Decode 分离 - 通过将推理拆分为处理提示词 (Prompt) 的 Prefill 服务器和处理响应的 Decode 服务器,缩短首字延迟 (TTFT) 并获得更可预测的每 Token 输出时间 (TPOT)。这主要适用于 Llama-70B 等大型模型以及处理极长提示词的场景。
- 宽专家并行 (Wide EP) - 部署如 DeepSeek-R1 等极大型混合专家 (MoE) 模型,通过在快速加速器网络上使用 数据并行和专家并行 进行扩展,从而显著降低端到端延迟并提高吞吐量。
- 分层前缀缓存 - 对于长上下文或高并发工作负载,通过在加速器显存之外增加分层前缀缓存(例如卸载到 CPU 内存),提高前缀缓存复用率,降低首字延迟 (TTFT) 并提高吞吐量。分层前缀缓存可以与上述三种“明径”中的任何一种结合使用。
信息
辅助指南
我们的辅助指南解决了大规模模型服务中的常见运维挑战
- 模拟模型服务器 可以部署 vLLM 模型服务器模拟器,由于每个实例不需要加速器,因此可以进行大规模推理调度和编排测试。
其他指南
以下指南由社区提供,但尚未完全整合到 llm-d 配置结构中,也未作为“明径”得到完全支持
- 即将推出!
注意
添加到此列表中的新指南至少启用了核心“明径”之一,但可能直接包含特定于新硬件或基础设施提供商的前置步骤,而没有完全抽象。添加到此处的指南预计最终会成为现有“明径”的一部分。
已知问题
- 在 v0.4.0 版本中,由于
routing-proxysidecar 上有一个已弃用的日志标志,wide-ep-lws会出现崩溃循环。这已在 提交 83dd587 中修复。
内容来源
此内容自动同步自 llm-d/llm-d 仓库 main 分支上的 guides/README.md。