跳转至正文

3 posts tagged with "Updates"

项目更新和进度报告

查看所有标签

肉眼可见的 KV 缓存收益:从 vLLM 中的前缀缓存到 llm-d 的分布式调度

·阅读时长 21 分钟
Maroon Ayoub
IBM 研究科学家与架构师
Danny Harnik
IBM 高级技术参谋
Tyler Smith
Red Hat 技术参谋
Kellen Swain
Google 软件工程师
Xining Wang
Xining Wang
阿里云高级技术专家
Hang Yin
Hang Yin
阿里云高级研发工程师
Kay Yan
DaoCloud 首席软件工程师

llm-d 项目提供了一系列“明径”——用于在生产环境中部署大语言模型的、经过测试和基准评估的解决方案。我们的第一条路径,智能推理调度,通过平衡集群负载和前缀缓存(prefix-cache)亲和性,为 AI 感知路由建立了基准。该路径的默认配置对后者使用“近似”方法,根据请求流量预测缓存局部性。

本博客阐述了一条更先进且强大的路径:精确前缀缓存感知调度

我们深入探讨了该特性的下一代技术,它超越了预测,赋予调度器直接内省分布式 vLLM 缓存的能力。这种精确性是最大化缓存命中率的关键,能在分布式部署中实现更高水平的性能并最大化成本效益。

博客核心要点
  • KV 缓存命中率直接影响底线:已缓存 token 与未缓存 token 之间存在 10 倍的成本差异,缓存效率不仅是性能优化,更是根本性的成本和性能驱动力
  • 并非理论:对话式 AI 和 Agent 工作流等真实生产工作负载,会自然产生这种适合该方案的高前缀模式
  • vLLM 的前缀缓存在分布式部署中会失效:标准负载均衡器会将相关请求分散到不同 Pod,破坏缓存局部性并强制进行昂贵的重复计算
  • 精确前缀缓存感知调度带来数量级提升:我们的基准测试显示,在相同硬件上,响应速度提升了 57 倍,且吞吐量翻倍

使用 llm-d 进行智能推理调度

·阅读时长 10 分钟
Nili Guy
IBM AI 基础设施研发经理
Vita Bortnikov
IBM 院士 (Fellow)
Etai Lev Ran
IBM 云架构师
Robert Shaw
红帽(Red Hat)工程总监
Clayton Coleman
Google 杰出工程师

llm-d 项目为任何想在现有部署框架(Kubernetes)中采用领先推理优化的用户规划了清晰的“明径”。这些是经过测试的方法,旨在使复杂的部署更简单、更高效。在这篇文章中,我们探讨第一条路径:智能推理调度。与基础的轮询负载均衡不同,此方法考虑了 LLM 的独特需求,从而带来全面的性能提升:更高的吞吐量、更低的延迟以及资源的高效利用。

为什么 LLM 推理需要智能推理

在 Kubernetes 上部署大语言模型 (LLM) 已成为常态,但 LLM 推理工作负载的行为与标准微服务截然不同。传统的统一副本配合轮询负载均衡模式假设每个请求使用相同的资源并在大致相同的时间内完成。相比之下,LLM 请求的 token 数量和计算需求差异巨大,使得简单的负载分配策略容易产生瓶颈和流量不平衡。

Intelligent inference scheduling diagram

llm-d 社区更新 - 2025年6月

·阅读时长 4 分钟
Pete Cheslock
Red Hat AI 社区架构师

大家好!llm-d 项目取得了巨大进展,我想分享一些重要的更新以及参与其中的机会。

帮助塑造 llm-d 项目的未来

为了指导 llm-d 项目的未来发展,我们需要了解社区在现实世界中的挑战、配置和性能需求。我们创建了一份简短的调查问卷,以深入了解您如何提供大语言模型服务,从您使用的硬件到您最需要的特性。

这份 匿名、与供应商无关的调查大约需要 5 分钟完成。您的反馈将直接影响项目的路线图和优先级。汇总结果将分享到 llm-d-contributors 邮件列表,使整个社区受益。

您的反馈将定义我们的路线图

我们创建了 llm-d 社区路线图调查 来收集有关您的 LLM 工作负载的信息。我们希望了解:

  • 您的服务环境: 包括您现在使用以及预计一年后使用的硬件(如 NVIDIA GPU、AMD GPU 或 CPU),以及您是在本地、云端还是边缘设备上运行。
  • 您的模型策略: 您是提供少量大型模型还是许多较小型模型,哪些模型系列(如 Llama 或 Mistral)最常用,以及您如何利用 LoRA 适配器等技术。
  • 您的性能要求: 现实世界中对延迟和吞吐量的 SLO,以及您面临的最大 LLM 服务挑战——从成本优化到运维易用性。
  • 您的未来需求: 如果为 LLM“模型即服务”(MaaS)增加一个新特性,您会优先考虑哪一个,以帮助指导我们的创新。

参与 5 分钟调查

您的参与至关重要。 请花几分钟时间完成调查。我们鼓励您将其分享给其他用户,或在回答中代理他们的需求,以确保我们的方向能反映社区的多样化要求。