llm-d 快速入门
概览
本快速入门将引导您完成在 Kubernetes 集群上安装和部署 llm-d 的步骤,解释每一步的关键选择,以及如何验证和删除您的部署。
先决条件
以足够的权限运行部署
在运行任何部署之前,请确保您拥有足够的权限来部署新的自定义资源定义 (CRD) 和更改角色。我们的指南是为集群管理员编写的,特别是针对先决条件部分。一旦配置好了先决条件,部署模型服务器和新的 InferencePools 通常只需要命名空间编辑 (editor) 权限。
llm-d 建议将基础设施配置(如推理网关)与工作负载部署分开。推理平台管理员负责管理集群和依赖项,而推理工作负载所有者则部署和管理自托管模型服务器的生命周期。
这些角色之间的分离程度取决于您环境中的工作负载数量。在单一生产工作负载中,可能由同一个团队管理所有软件。在大型内部“模型即服务” (MaaS) 部署中,平台团队可能管理共享推理网关,并允许各个工作负载团队直接管理大型模型服务器的配置和部署。有关角色原型的更多示例,请参阅 推理网关文档。
工具依赖项
您需要安装一些依赖项(如 kubectl、helm、yq、git 等),并且在大多数示例中需要 HuggingFace 令牌。我们在 prereq/client-setup 目录中记录了这些要求和说明。要安装依赖项,请使用提供的 install-deps.sh 脚本。
我们预计几乎所有的生产部署都将利用配置管理自动化、GitOps 或 CI/CD 流水线来自动化可重复的部署。大多数用户对如何部署工作负载都有自己的见解,且模型服务器部署的需求也存在很大差异。因此,llm-d 在我们的指南中尽量减少工具使用和参数化,并优先展示完整的示例和概念,以便您可以根据自己的用例调整我们的配置。
HuggingFace 令牌
从 HuggingFace Hub 下载模型需要 HuggingFace 令牌。在部署之前,您必须在目标命名空间中创建一个包含 HuggingFace 令牌的 Kubernetes secret,请参阅 说明。
vLLM 默认会根据需要从 HuggingFace 加载模型。由于在生产环境中下载模型是启动延迟的来源,也是潜在的故障点(如果模型提供商宕机),因此大多数部署应在多次重启之间缓存下载的内容,并在其副本所在的同一故障域内托管模型副本。
配置必要的基础设施和集群
llm-d 可以部署在各种 Kubernetes 发行版和托管提供商上。基础设施先决条件将帮助您确保集群正确配置了运行 LLM 推理所需的资源。
可以在 infra-providers 目录中查看与这些平台相关的特定要求、解决方法以及任何其他文档。
网关提供商
llm-d 与 Kubernetes Gateway API 集成,以优化到模型服务器副本的负载均衡,并访问您在生产中可能需要的全套服务管理功能,如流量拆分和身份验证/授权。
您必须为您的基础设施选择 合适的网关实现,并部署网关控制平面及其先决条件 CRD。
部署
从 README.md 的列表中选择合适的指南。
如果您希望在推荐的生产服务配置中部署 vLLM,我们建议从 推理调度 这一成熟路径开始。使用智能负载均衡器广泛适用于所有环境,并能简化关键运行指标的收集。
导航到所需的指南目录并按照其 README 说明操作。例如:
cd quickstarts/guides/inference-scheduling # Navigate to your desired example directory
# Follow the README.md instructions in the example directory
成功完成部署后,请返回此处。
验证
您应该能够列出所有 Helm release,以查看指南安装的 chart
helm list -n ${NAMESPACE}
您可以使用以下命令查看命名空间中的所有资源
kubectl get all -n ${NAMESPACE}
注意: 这假设在您指定的 ${NAMESPACE} 中没有部署其他指南。
向您的部署发送推理请求
有关如何开始发送推理请求的说明,请参阅 getting-started-inferencing.md。
指标收集
llm-d chart 包含对从 vLLM pod 收集指标的支持。当在相应的 Helm chart values 中启用时,llm-d 会应用 PodMonitor 以触发 Prometheus 抓取目标。详见 MONITORING.md。
在 Kubernetes 中,可以从 prometheus-community 的 kube-prometheus-stack helm charts 安装 Prometheus 和 Grafana。在 OpenShift 中,可以利用内置的用户工作负载监控 Prometheus 栈来收集指标。
我们强烈建议启用 llm-d 组件的监控和可观测性。LLM 推理可能会在多个方面遇到瓶颈,排查性能问题可能涉及检查网关、vLLM、操作系统和硬件层面的指标。
卸载
要从集群中删除 llm-d 资源,请参阅所选指南 README 中的卸载说明。
此内容自动同步自 llm-d/llm-d 仓库 main 分支下的 guides/QUICKSTART.md。