跳转至正文

3 篇文章被标记为“公告”

非新闻稿类型的公告

查看所有标签

llm-d 0.4: 在各类加速器上实现 SOTA 性能

·阅读时长 10 分钟
Robert Shaw
红帽(Red Hat)工程总监
Clayton Coleman
Google 杰出工程师
Carlos Costa
IBM 杰出工程师

llm-d 的使命是在任何加速器和云端提供达到 SOTA 推理性能的最快路径。在我们的 0.3 版本 中,我们为大型混合专家模型(MoE)实现了广泛的专家并行(EP),以提供极高的输出 Token 吞吐量——这是强化学习的关键推动因素——并增加了对多个非 GPU 加速器系列的初步支持。

本版本带来了对专家并行吞吐量的补充:提升生产服务的端到端请求延迟。通过推测解码(speculative decoding)和针对延迟敏感型工作负载的 vLLM 优化,我们将 DeepSeek 的单 Token 延迟降低了高达 50%。我们增加了对 Google TPU 和 Intel XPU 的动态解耦服务支持,以便在流量不可预测时进一步降低首 Token 延迟(TTFT);同时,我们新的前缀缓存卸载“坦途”指南可帮助您利用 CPU 内存和高性能远程存储来提高命中率并降低尾部延迟。对于部署了多个模型的使用者,我们的工作负载自动扩缩器预览版会根据实时服务器容量和流量进行调整,以减少模型部署排队请求的时间,从而减轻在有限加速器容量上运行多个模型的运维负担。

这些通过我们的 坦途(well-lit paths) 呈现的开源推理栈优化,确保您能在现实场景中的前沿开源模型上达到 SOTA 级的延迟水平。

llm-d 0.3: 为可扩展推理提供更宽广的坦途

·阅读时长 10 分钟
Robert Shaw
红帽(Red Hat)工程总监
Clayton Coleman
Google 杰出工程师
Carlos Costa
IBM 杰出工程师

在我们的 0.2 版本中,我们引入了首批“明径”(well-lit paths),即在 Kubernetes 上扩展推理规模的经过测试的蓝图。随着 0.3 版本的发布,我们加倍履行使命:为部署高性能、硬件无关、易于运维且可大规模扩展的推理提供一条快车道。

此版本交付了:

  • 扩展的硬件支持,现已包括 Google TPU 和 Intel 支持
  • 针对解耦(disaggregation)验证了 TCP 和基于 RoCE 的 RDMA
  • 基于预测延迟的均衡预览版,在长预填充(long-prefill)工作负载中将 P90 延迟提升高达 3 倍
  • 宽专家并行 (EP) 扩展,在 H200 GPU 上实现每秒每 GPU 2.2k token
  • 推理网关 (IGW v1.0) 的正式发布(GA)。

综上所述,这些结果重新定义了推理的运行范畴。llm-d 使集群在扩容前能以更高负载运行,从每个 GPU 中提取更多价值,同时仍能满足严格的延迟目标。其结果是一个不仅为速度而建,而且为可预测、高成本效益的规模化而建的控制平面。

llm-d 0.2: 我们的首条坦途(小心树根!)

·阅读时长 11 分钟
Robert Shaw
红帽(Red Hat)工程总监
Clayton Coleman
Google 杰出工程师
Carlos Costa
IBM 杰出工程师

我们的 0.2 版本在推进三条“明径”方面取得了进展,以加速在 Kubernetes 上部署大规模推理:更好的负载均衡、通过解构实现更低延迟,以及为 DeepSeek-R1 等超大型混合专家模型 (MoE) 提供原生 vLLM 支持。

我们还增强了部署和基准测试工具,吸收了现实世界基础设施部署的经验,并解决了关键的反模式。此版本为 llm-d 用户、贡献者、研究人员和运维人员在经过测试且可重复的场景中提供了更清晰的高效使用指南。