跳转至正文

llm-d 新闻稿

·阅读时长 12 分钟

2025年5月20日

Red Hat 启动 llm-d 社区,助力大规模分布式生成式 AI 推理

该项目由创始贡献者 CoreWeave、Google Cloud、IBM Research 和 NVIDIA 协作发起,并吸引了行业领导者 AMD、Cisco、Hugging Face、Intel、Lambda 和 Mistral AI,以及加州大学伯克利分校和芝加哥大学等高校支持,旨在使生产级生成式 AI 像 Linux 一样无处不在。

波士顿——红帽峰会——2025 年 5 月 20 日——全球领先的开源解决方案提供商红帽公司(Red Hat)今天宣布推出 llm-d,这是一个新的开源项目,旨在满足生成式人工智能(gen AI)未来最关键的需求:大规模推理。llm-d 利用突破性的技术实现大规模生成式人工智能推理,由原生 Kubernetes 架构、基于 vLLM 的分布式推理和智能的 AI 感知网络路由提供支持,从而能够构建强大、大规模语言模型(LLM)推理云,以满足最苛刻的生产服务级别目标(SLO)。

虽然训练仍然至关重要,但生成式人工智能的真正影响取决于更高效和可扩展的推理——将人工智能模型转化为可操作洞察和用户体验的引擎。根据 Gartner1 的数据,“到 2028 年,随着市场的成熟,超过 80% 的数据中心工作负载加速器将专门用于推理,而非训练用途。”这强调了生成式人工智能的未来在于执行能力。日益复杂和庞大的推理模型对资源需求的不断升级,限制了集中式推理的可行性,并可能因高昂的成本和严重的延迟而阻碍人工智能创新。

通过 llm-d 满足对可扩展生成式人工智能推理的需求

红帽及其行业合作伙伴正通过 llm-d 直接应对这一挑战。llm-d 是一个富有远见的项目,它利用 vLLM 的强大功能,超越了单服务器限制,实现了人工智能推理的大规模生产。llm-d 利用经过验证的 Kubernetes 编排能力,将先进的推理功能集成到现有的企业 IT 基础设施中。这个统一平台使 IT 团队能够满足关键业务工作负载的各种服务需求,同时部署创新技术来最大限度地提高效率,并显著降低与高性能人工智能加速器相关的总拥有成本(TCO)。

llm-d 提供了一套强大的创新功能,重点包括:

  • vLLM,已迅速成为开源事实上的标准推理服务器,为新兴的前沿模型提供零日模型支持,并支持广泛的加速器列表,现在包括 Google Cloud Tensor Processor Units (TPUs)。
  • 预填充和解码分离(Prefill and Decode Disaggregation),将人工智能的输入上下文和令牌生成阶段分离为独立的操作,然后可以分布在多台服务器上。
  • KV(键值)缓存卸载(KV Cache Offloading),基于 LMCache,将 KV 缓存的内存负担从 GPU 内存转移到更具成本效益和更丰富的标准存储,例如 CPU 内存或网络存储。
  • Kubernetes 驱动的集群和控制器,用于在工作负载需求波动时更有效地调度计算和存储资源,同时保持性能和较低延迟。
  • AI 感知网络路由(AI-Aware Network Routing),用于将传入请求调度到最有可能具有过去推理计算热缓存的服务器和加速器。
  • 高性能通信 API,用于服务器之间更快、更高效的数据传输,支持 NVIDIA Inference Xfer Library (NIXL)。

llm-d:由行业领导者支持

这个新的开源项目已经得到了由领先的生成式人工智能模型提供商、人工智能加速器先驱和顶级人工智能云平台组成的强大联盟的支持。CoreWeave、Google Cloud、IBM Research 和 NVIDIA 是创始贡献者,AMD、Cisco、Hugging Face、Intel、Lambda 和 Mistral AI 是合作伙伴,这凸显了行业在构建大规模 LLM 服务未来方面的深度协作。llm-d 社区还得到了加州大学 Sky Computing Lab(vLLM 的发起者)和芝加哥大学 LMCache Lab(LMCache 的发起者)的创始支持者的加入。

红帽坚定不移地致力于开放协作,认识到在快速发展的生成式人工智能推理领域中,充满活力且易于访问的社区至关重要。红帽将积极倡导 llm-d 社区的发展,为新成员营造一个包容的环境,并推动其持续演进。

红帽的愿景:任何模型、任何加速器、任何云。

人工智能的未来必须由无限机遇来定义,而不是受限于基础设施孤岛。红帽看到了一个愿景,即组织可以在任何云上使用任何加速器部署任何模型,以合理的成本提供卓越且更一致的用户体验。为了释放生成式人工智能投资的真正潜力,企业需要一个通用的推理平台——一个在当下和未来几年实现更顺畅、高性能人工智能创新的标准。

正如红帽通过将 Linux 转化为现代 IT 的基石而开创了开放企业一样,该公司现在也准备构建人工智能推理的未来。vLLM 具有成为标准化生成式人工智能推理关键的能力,红帽致力于围绕 vLLM 社区以及 llm-d 建立一个繁荣的生态系统,以实现大规模分布式推理。愿景很明确:无论人工智能模型、底层加速器还是部署环境如何,红帽都打算使 vLLM 成为新混合云中推理的权威开放标准。

红帽峰会
加入红帽峰会主题演讲,听取红帽高管、客户和合作伙伴的最新消息

支持引言
Brian Stevens,红帽高级副总裁兼人工智能首席技术官
“在众多人工智能领导者的支持下,llm-d 社区的启动标志着解决可扩展生成式人工智能推理需求的关键时刻,这是实现更广泛企业人工智能采用必须克服的关键障碍。llm-d 利用 vLLM 的创新和 Kubernetes 经过验证的能力,为跨扩展混合云的分布式、可扩展和高性能人工智能推理铺平了道路,支持任何模型、任何加速器、任何云环境,并帮助实现无限人工智能潜力的愿景。”

Ramine Roane,AMD 人工智能产品管理公司副总裁
"AMD 很自豪能成为 llm-d 社区的创始成员,贡献我们在高性能 GPU 方面的专业知识,以推进不断发展的企业人工智能需求的推理。随着组织应对生成式人工智能日益增加的复杂性以实现更大规模和效率,AMD 期待通过 llm-d 项目来满足这一行业需求。"

Shannon McFarland,思科开源项目办公室副总裁兼思科 DevNet 负责人
“llm-d 项目是实用生成式人工智能向前迈出的令人兴奋的一步。llm-d 使开发人员能够以编程方式集成和扩展生成式人工智能推理,在现代人工智能环境中释放新的创新和效率水平。思科很自豪能成为 llm-d 社区的一员,我们正在共同努力探索现实世界的用例,帮助组织更有效、更高效地应用人工智能。”

Chen Goldberg,CoreWeave 工程高级副总裁
“CoreWeave 很荣幸成为 llm-d 项目的创始贡献者,并深化我们对开源人工智能的长期承诺。
从我们与 EleutherAI 的早期合作,到我们目前在推进大规模推理方面的工作,我们一直在投资使强大的人工智能基础设施更易于访问。我们很高兴能与一群出色的合作伙伴
以及更广泛的开发社区合作,构建一个灵活、高性能的推理引擎,
加速创新,并为开放、可互操作的人工智能奠定基础。”

Mark Lohmeyer,Google Cloud 人工智能与计算基础设施副总裁兼总经理
"高效的人工智能推理对于组织转向大规模部署人工智能并为其用户提供价值至关重要。随着我们进入这个新的推理时代,Google Cloud 很自豪能作为 llm-d 项目的创始贡献者,以我们在开源贡献方面的传统为基础。这个新社区将成为大规模分布式人工智能推理的关键催化剂,帮助用户通过增加基础设施资源的选择性来提高工作负载效率。"

Jeff Boudier,Hugging Face 产品负责人
“我们相信每家公司都应该能够构建和运行自己的模型。vLLM 利用 Hugging Face transformers 库作为模型定义的真实来源;各种大小的模型可用于为文本、音频、图像和视频人工智能应用程序提供支持。八百万人工智能构建者使用 Hugging Face 协作处理超过两百万个与全球社区公开共享的人工智能模型和数据集。我们很高兴能支持 llm-d 项目,使开发人员能够将这些应用程序扩展到大规模。”

Priya Nagpurkar,IBM Research 混合云和人工智能平台副总裁
“在 IBM,我们相信人工智能的下一阶段是关于效率和规模。我们专注于通过他们可以有效部署的人工智能解决方案为企业释放价值。作为 llm-d 的创始贡献者,IBM 很自豪能成为构建差异化硬件无关分布式人工智能推理平台的关键部分。我们期待着继续为这个社区的成长和成功做出贡献,以改变人工智能推理的未来。”

Bill Pearson,英特尔数据中心与人工智能软件解决方案和生态系统副总裁
“llm-d 的推出将成为推动大规模人工智能转型的关键转折点,英特尔很高兴能作为创始支持者参与其中。英特尔参与 llm-d 是我们与红帽长达数十年合作的最新里程碑,旨在为企业提供开放源代码解决方案,使其能够在任何地方、在他们选择的平台上进行部署。我们期待通过 llm-d 社区进一步扩展和构建人工智能创新。”

Eve Callicoat,Lambda 机器学习平台高级工程师
"推理是人工智能交付实际价值的地方,llm-d 代表着一次重大飞跃。Lambda 很荣幸能支持一个使最先进的推理变得易于访问、高效和开放的项目。"

Ujval Kapasi,NVIDIA 工程人工智能框架副总裁
“llm-d 项目是开源人工智能生态系统的重要补充,反映了 NVIDIA 对通过协作推动生成式人工智能创新的支持。可扩展、高性能的推理是下一波生成式和代理式人工智能的关键。我们正在与红帽和其他支持合作伙伴合作,培养 llm-d 社区参与和行业采用,通过 NVIDIA Dynamo(例如 NIXL)的创新来加速 llm-d。”

Ion Stoica,加州大学伯克利分校教授兼 Sky Computing Lab 主任
“我们很高兴看到红帽在 vLLM 既有成功的基础上发展。vLLM 源于我们的实验室,旨在帮助解决运行大型人工智能模型带来的速度和内存挑战。像 vLLM 这样的开源项目,以及现在以 vLLM 为基础的 llm-d,正处于人工智能创新的前沿,解决了最苛刻的人工智能推理要求,并推动了整个行业的进步。”

Junchen Jiang,芝加哥大学 LMCache Lab 计算机科学教授
“分布式 KV 缓存优化(例如卸载、压缩和混合)一直是我们实验室的重点,我们很高兴看到 llm-d 利用 LMCache 作为核心组件来减少第一个令牌的生成时间并提高吞吐量,尤其是在长上下文推理中。”

额外资源

联系红帽

关于红帽
红帽 是开放混合云技术的领导者,为变革性的 IT 创新和人工智能应用程序提供值得信赖、一致且全面的基础。其云、开发人员、人工智能、Linux、自动化和应用程序平台技术组合使任何应用程序能够在任何地方运行——从数据中心到边缘。作为全球领先的企业开源软件解决方案提供商,红帽投资于开放生态系统和社区,以解决未来的 IT 挑战。通过与合作伙伴和客户合作,红帽帮助他们构建、连接、自动化、保护和管理他们的 IT 环境,并得到咨询服务和屡获殊荣的培训和认证服务的支持。

前瞻性声明
除此处包含的历史信息和讨论外,本新闻稿中包含的声明可能构成 1995 年《私人证券诉讼改革法案》所指的前瞻性声明。前瞻性声明基于公司对未来业务和财务业绩的当前假设。这些声明涉及许多风险、不确定性和其他因素,可能导致实际结果存在重大差异。本新闻稿中的任何前瞻性声明仅代表其发表之日的情况。除非法律要求,否则公司不承担更新或修订任何前瞻性声明的义务。

媒体联系人
John Terrill
Red Hat
+1-571-421-8132
jterrill@redhat.com

###

Red Hat 和 Red Hat 徽标是 Red Hat, Inc. 或其子公司在美国和其他国家/地区的商标或注册商标。

脚注

  1. 预测分析:全球人工智能半导体,Alan Priestley,Gartner,2024 年 8 月 2 日 - ID G00818912 GARTNER 是 Gartner, Inc. 和/或其附属公司在美国和其他国家/地区的注册商标和服务标志。