llm-d v0.4.0
发布日期:2025年11月26日
完整发布说明:在 GitHub 上查看
llm-d 生态系统由多个相互连接的组件组成,这些组件协同工作,为大语言模型提供分布式推理能力。
组件
| 组件 | 描述 | 代码仓库 | 版本 | 文档 |
|---|---|---|---|---|
| 推理调度器 | 该调度器为 llm-d 推理框架的推理请求做出优化的路由决策。 | llm-d/llm-d-inference-scheduler | v0.3.2 | 查看文档 |
| 模型服务 | modelservice 是一个 Helm chart,通过声明式管理用于提供基础模型服务的 Kubernetes 资源,简化了在 llm-d 上的 LLM 部署。它通过模块化预设实现可复现、可扩展且可调优的模型部署,并与 llm-d 生态系统组件(包括 vLLM、Gateway API 推理扩展、LeaderWorkerSet)紧密集成。 | llm-d-incubation/llm-d-modelservice | llm-d-modelservice-v0.3.8 | 查看文档 |
| 推理模拟器 | 一个轻量级的 vLLM 模拟器,模拟 vLLM 的 HTTP REST 端点响应。 | llm-d/llm-d-inference-sim | v0.6.1 | 查看文档 |
| 基础设施 | 用于部署网关及 llm-d 相关基础设施资源的 Helm chart。 | llm-d-incubation/llm-d-infra | v1.3.4 | 查看文档 |
| KV 缓存管理器 | 此仓库包含 llm-d-kv-cache-manager,这是一个可插拔服务,旨在实现 KV-Cache 感知路由,并为基于 vLLM 的服务平台中高级的跨节点缓存协调奠定基础。 | llm-d/llm-d-kv-cache-manager | v0.3.0 | 查看文档 |
| 基准测试工具 | 此仓库提供了一个自动化工作流,用于使用 llm-d 技术栈进行 LLM 推理基准测试。它包含了跨多种环境和部署模式进行部署、实验执行、数据收集和清理的工具。 | llm-d/llm-d-benchmark | v0.3.0 | 查看文档 |
入门指南
每个组件都有其详细的文档页面,可从侧边栏访问。要全面了解这些组件如何协同工作,请参阅主 架构概览。
快速链接
- llm-d 主仓库 - 核心平台与编排
- llm-d-incubation 组织 - 实验性及支持性组件
- 完整发布说明 - 版本 v0.4.0
- 所有版本 - 完整的发布历史
历史版本
有关先前版本及其功能的信息,请访问 GitHub 发布页面。
参与贡献
如需为这些组件贡献代码,请访问各自的代码仓库并遵循其贡献指南。每个组件都维护着自己的开发工作流和贡献流程。