跳转至正文

2 posts tagged with "blog posts"

日常博客文章

查看所有标签

肉眼可见的 KV 缓存收益:从 vLLM 中的前缀缓存到 llm-d 的分布式调度

·阅读时长 21 分钟
Maroon Ayoub
IBM 研究科学家与架构师
Danny Harnik
IBM 高级技术参谋
Tyler Smith
Red Hat 技术参谋
Kellen Swain
Google 软件工程师
Xining Wang
Xining Wang
阿里云高级技术专家
Hang Yin
Hang Yin
阿里云高级研发工程师
Kay Yan
DaoCloud 首席软件工程师

llm-d 项目提供了一系列“明径”——用于在生产环境中部署大语言模型的、经过测试和基准评估的解决方案。我们的第一条路径,智能推理调度,通过平衡集群负载和前缀缓存(prefix-cache)亲和性,为 AI 感知路由建立了基准。该路径的默认配置对后者使用“近似”方法,根据请求流量预测缓存局部性。

本博客阐述了一条更先进且强大的路径:精确前缀缓存感知调度

我们深入探讨了该特性的下一代技术,它超越了预测,赋予调度器直接内省分布式 vLLM 缓存的能力。这种精确性是最大化缓存命中率的关键,能在分布式部署中实现更高水平的性能并最大化成本效益。

博客核心要点
  • KV 缓存命中率直接影响底线:已缓存 token 与未缓存 token 之间存在 10 倍的成本差异,缓存效率不仅是性能优化,更是根本性的成本和性能驱动力
  • 并非理论:对话式 AI 和 Agent 工作流等真实生产工作负载,会自然产生这种适合该方案的高前缀模式
  • vLLM 的前缀缓存在分布式部署中会失效:标准负载均衡器会将相关请求分散到不同 Pod,破坏缓存局部性并强制进行昂贵的重复计算
  • 精确前缀缓存感知调度带来数量级提升:我们的基准测试显示,在相同硬件上,响应速度提升了 57 倍,且吞吐量翻倍

使用 llm-d 进行智能推理调度

·阅读时长 10 分钟
Nili Guy
IBM AI 基础设施研发经理
Vita Bortnikov
IBM 院士 (Fellow)
Etai Lev Ran
IBM 云架构师
Robert Shaw
红帽(Red Hat)工程总监
Clayton Coleman
Google 杰出工程师

llm-d 项目为任何想在现有部署框架(Kubernetes)中采用领先推理优化的用户规划了清晰的“明径”。这些是经过测试的方法,旨在使复杂的部署更简单、更高效。在这篇文章中,我们探讨第一条路径:智能推理调度。与基础的轮询负载均衡不同,此方法考虑了 LLM 的独特需求,从而带来全面的性能提升:更高的吞吐量、更低的延迟以及资源的高效利用。

为什么 LLM 推理需要智能推理

在 Kubernetes 上部署大语言模型 (LLM) 已成为常态,但 LLM 推理工作负载的行为与标准微服务截然不同。传统的统一副本配合轮询负载均衡模式假设每个请求使用相同的资源并在大致相同的时间内完成。相比之下,LLM 请求的 token 数量和计算需求差异巨大,使得简单的负载分配策略容易产生瓶颈和流量不平衡。

Intelligent inference scheduling diagram