跳转至正文

6 篇文章带有标签 "llm-d release news!"

llm-d 标签描述

查看所有标签

llm-d 0.4: 在各类加速器上实现 SOTA 性能

·阅读时长 10 分钟
Robert Shaw
红帽(Red Hat)工程总监
Clayton Coleman
Google 杰出工程师
Carlos Costa
IBM 杰出工程师

llm-d 的使命是在任何加速器和云端提供达到 SOTA 推理性能的最快路径。在我们的 0.3 版本 中,我们为大型混合专家模型(MoE)实现了广泛的专家并行(EP),以提供极高的输出 Token 吞吐量——这是强化学习的关键推动因素——并增加了对多个非 GPU 加速器系列的初步支持。

本版本带来了对专家并行吞吐量的补充:提升生产服务的端到端请求延迟。通过推测解码(speculative decoding)和针对延迟敏感型工作负载的 vLLM 优化,我们将 DeepSeek 的单 Token 延迟降低了高达 50%。我们增加了对 Google TPU 和 Intel XPU 的动态解耦服务支持,以便在流量不可预测时进一步降低首 Token 延迟(TTFT);同时,我们新的前缀缓存卸载“坦途”指南可帮助您利用 CPU 内存和高性能远程存储来提高命中率并降低尾部延迟。对于部署了多个模型的使用者,我们的工作负载自动扩缩器预览版会根据实时服务器容量和流量进行调整,以减少模型部署排队请求的时间,从而减轻在有限加速器容量上运行多个模型的运维负担。

这些通过我们的 坦途(well-lit paths) 呈现的开源推理栈优化,确保您能在现实场景中的前沿开源模型上达到 SOTA 级的延迟水平。

llm-d 0.3: 为可扩展推理提供更宽广的坦途

·阅读时长 10 分钟
Robert Shaw
红帽(Red Hat)工程总监
Clayton Coleman
Google 杰出工程师
Carlos Costa
IBM 杰出工程师

在我们的 0.2 版本中,我们引入了首批“明径”(well-lit paths),即在 Kubernetes 上扩展推理规模的经过测试的蓝图。随着 0.3 版本的发布,我们加倍履行使命:为部署高性能、硬件无关、易于运维且可大规模扩展的推理提供一条快车道。

此版本交付了:

  • 扩展的硬件支持,现已包括 Google TPU 和 Intel 支持
  • 针对解耦(disaggregation)验证了 TCP 和基于 RoCE 的 RDMA
  • 基于预测延迟的均衡预览版,在长预填充(long-prefill)工作负载中将 P90 延迟提升高达 3 倍
  • 宽专家并行 (EP) 扩展,在 H200 GPU 上实现每秒每 GPU 2.2k token
  • 推理网关 (IGW v1.0) 的正式发布(GA)。

综上所述,这些结果重新定义了推理的运行范畴。llm-d 使集群在扩容前能以更高负载运行,从每个 GPU 中提取更多价值,同时仍能满足严格的延迟目标。其结果是一个不仅为速度而建,而且为可预测、高成本效益的规模化而建的控制平面。

肉眼可见的 KV 缓存收益:从 vLLM 中的前缀缓存到 llm-d 的分布式调度

·阅读时长 21 分钟
Maroon Ayoub
IBM 研究科学家与架构师
Danny Harnik
IBM 高级技术参谋
Tyler Smith
Red Hat 技术参谋
Kellen Swain
Google 软件工程师
Xining Wang
Xining Wang
阿里云高级技术专家
Hang Yin
Hang Yin
阿里云高级研发工程师
Kay Yan
DaoCloud 首席软件工程师

llm-d 项目提供了一系列“明径”——用于在生产环境中部署大语言模型的、经过测试和基准评估的解决方案。我们的第一条路径,智能推理调度,通过平衡集群负载和前缀缓存(prefix-cache)亲和性,为 AI 感知路由建立了基准。该路径的默认配置对后者使用“近似”方法,根据请求流量预测缓存局部性。

本博客阐述了一条更先进且强大的路径:精确前缀缓存感知调度

我们深入探讨了该特性的下一代技术,它超越了预测,赋予调度器直接内省分布式 vLLM 缓存的能力。这种精确性是最大化缓存命中率的关键,能在分布式部署中实现更高水平的性能并最大化成本效益。

博客核心要点
  • KV 缓存命中率直接影响底线:已缓存 token 与未缓存 token 之间存在 10 倍的成本差异,缓存效率不仅是性能优化,更是根本性的成本和性能驱动力
  • 并非理论:对话式 AI 和 Agent 工作流等真实生产工作负载,会自然产生这种适合该方案的高前缀模式
  • vLLM 的前缀缓存在分布式部署中会失效:标准负载均衡器会将相关请求分散到不同 Pod,破坏缓存局部性并强制进行昂贵的重复计算
  • 精确前缀缓存感知调度带来数量级提升:我们的基准测试显示,在相同硬件上,响应速度提升了 57 倍,且吞吐量翻倍

使用 llm-d 进行智能推理调度

·阅读时长 10 分钟
Nili Guy
IBM AI 基础设施研发经理
Vita Bortnikov
IBM 院士 (Fellow)
Etai Lev Ran
IBM 云架构师
Robert Shaw
红帽(Red Hat)工程总监
Clayton Coleman
Google 杰出工程师

llm-d 项目为任何想在现有部署框架(Kubernetes)中采用领先推理优化的用户规划了清晰的“明径”。这些是经过测试的方法,旨在使复杂的部署更简单、更高效。在这篇文章中,我们探讨第一条路径:智能推理调度。与基础的轮询负载均衡不同,此方法考虑了 LLM 的独特需求,从而带来全面的性能提升:更高的吞吐量、更低的延迟以及资源的高效利用。

为什么 LLM 推理需要智能推理

在 Kubernetes 上部署大语言模型 (LLM) 已成为常态,但 LLM 推理工作负载的行为与标准微服务截然不同。传统的统一副本配合轮询负载均衡模式假设每个请求使用相同的资源并在大致相同的时间内完成。相比之下,LLM 请求的 token 数量和计算需求差异巨大,使得简单的负载分配策略容易产生瓶颈和流量不平衡。

Intelligent inference scheduling diagram

llm-d 0.2: 我们的首条坦途(小心树根!)

·阅读时长 11 分钟
Robert Shaw
红帽(Red Hat)工程总监
Clayton Coleman
Google 杰出工程师
Carlos Costa
IBM 杰出工程师

我们的 0.2 版本在推进三条“明径”方面取得了进展,以加速在 Kubernetes 上部署大规模推理:更好的负载均衡、通过解构实现更低延迟,以及为 DeepSeek-R1 等超大型混合专家模型 (MoE) 提供原生 vLLM 支持。

我们还增强了部署和基准测试工具,吸收了现实世界基础设施部署的经验,并解决了关键的反模式。此版本为 llm-d 用户、贡献者、研究人员和运维人员在经过测试且可重复的场景中提供了更清晰的高效使用指南。

宣布 llm-d 社区成立!

·阅读时长 12 分钟
Robert Shaw
红帽(Red Hat)工程总监
Clayton Coleman
Google 杰出工程师
Carlos Costa
IBM 杰出工程师

宣布 llm-d 社区成立

llm-d 是一个云原生高性能分布式 LLM 推理框架
——它是供任何人进行大规模服务的“明径”,在大多数硬件加速器上针对大多数模型提供最快的价值实现时间和极具竞争力的性价比。

借助 llm-d,用户可以使用模块化、高性能的端到端服务解决方案实现生成式 AI 部署的运维化。该方案利用了最新的分布式推理优化技术(如 KV 缓存感知路由和解耦推理),并与 推理网关 (IGW) 中的 Kubernetes 运维工具协同设计并集成。