跳转至正文

Go Report Card Go Reference License Join Slack

推理调度器

该调度器为 llm-d 推理框架的推理请求制定优化的路由决策。

关于

这为 llm-d 推理框架提供了一个“端点选择器 (EPP)”组件,该组件根据调度器插件,通过 Kubernetes Gateway 将进入平台的推理请求进行调度。有关 llm-d 推理调度器架构、路由逻辑和不同插件(过滤器和评分器)以及插件配置的更多详情,请参阅架构文档

与 GIE (IGW) 的关系

EPP 扩展了 Gateway API 推理扩展 (GIE) 项目,该项目为调度提供 API 资源和机制。我们在这里添加了一些 llm-d 特有的自定义功能,例如 P/D 解耦。这两个项目紧密合作,因为 llm-d 中的某项功能往往需要 GIE 代码库的支持和扩展。独特且实验性的功能可能先在 llm-d 中开始,并随着时间的推移迁移到 GIE。作为一个项目目标,在满足以下条件时,我们更倾向于将功能上游提交到 GIE:

  • 功能已足够成熟,并被证明具有广泛的适用性和实用性;且
  • 它不仅能在 EPP 中实现(即 llm-d 提供了一个除调度之外的完整推理框架)。

请注意,一般情况下,如果适用,功能应首先提交到上游的 Gateway API 推理扩展 (GIE) 项目。GIE 是我们的主要依赖项,也是大多数通用推理功能所在之处。如果您认为某些功能具有通用性或用途,它可能应该提交到 GIE。如果您有特定于 llm-d 的功能,则应提交到此处。如果您不确定您的功能属于这里还是 GIE,请随时发起 讨论 或在 Slack 上询问。

一个兼容的 Gateway API 实现被用作网关。该 Gateway API 实现必须使用 Envoy 并支持 ext-proc,因为这是目前 EPP 赖以对模型服务工作负载做出路由决策的回调机制。

参与贡献

我们的社区会议每两周一次,时间为 PDT 每周三上午 10 点(Google Meet会议记录)。

我们目前使用 llm-d Slack 工作区中的 #sig-inference-scheduler 频道进行交流。

对于重大更改,请先创建一个 Issue 来描述更改,以便维护者进行评估并与您讨论细节。有关如何使用代码库的详细信息,请参阅 DEVELOPMENT.md

欢迎贡献!

内容来源

此内容自动同步自 llm-d/llm-d-inference-scheduler 仓库 main 分支下的 README.md

📝 如需建议更改,请编辑源文件创建一个 Issue