跳转至正文

特别兴趣小组 (SIGs)

SIG 概览

特别兴趣小组 (SIGs) 是协调 llm-d 项目各项工作的核心组织单元。每个 SIG 专注于项目技术栈的一个特定领域,并负责推动其对应组件的设计、实现和维护。

SIG 提供以下机制:

  • 专业专注:汇聚在特定领域具有专业知识的贡献者
  • 协同开发:确保相关组件之间保持一致的架构决策
  • 社区建设:创建更小、更易管理的协作与导师指导小组
  • 责任制:对特定项目领域拥有明确的所有权和职责

SIG 结构与治理

SIG 领导层

每个 SIG 设有:

  • SIG 负责人 (2-3 人):负责 SIG 的总体方向、协调和决策

SIG 职责

  • 推动其技术领域的设计与实现
  • 维护文档和架构决策
  • 就跨领域问题与其他 SIG 进行协调
  • 指导新贡献者并发展社区
  • 参与项目范围内的规划与发布

SIG 会议

  • 定期举行技术讨论会议(通常为每周一次)

与项目治理的关系

SIG 在 PROJECT.md 中定义的更广泛的 llm-d 项目治理框架内运行

活跃的特别兴趣小组

有关最新的会议时间,请参阅公开会议日历

SIG关注领域文档
SIG 推理调度器 (Inference Scheduler)智能请求路由、负载均衡和流量管理会议录音与文档
llm-d-inference-scheduler 仓库
SIG 基准测试 (Benchmarking)性能测试、基准测试框架和优化会议录音与文档
llm-d-benchmark 仓库
SIG PD 分离 (PD-Disaggregation)Prefill/Decode 分离、分布式推理服务和工作负载解耦会议录音与文档
llm-d-routing-sidecar 仓库
SIG KV 分离 (KV-Disaggregation)KV 缓存、前缀缓存和分布式存储系统会议录音与文档
llm-d-kv-cache 仓库
SIG 安装 (Installation)Kubernetes 集成、部署工具和平台运维会议录音与文档
llm-d-modelservice 仓库
llm-d-infra 仓库
SIG 自动扩缩容 (Autoscaling)流量感知自动扩缩容、资源管理和容量规划会议录音与文档
workload-variant-autoscaler 仓库
SIG 可观测性 (Observability)监控、日志、指标和运行状态可见性会议录音与文档
llm-d 可观测性文档

SIG 详细说明

SIG 推理调度器 (Inference Scheduler)

👥 领导层: Nili Guy, Abdullah Gharaibeh, Vita Bortnikov

⭐️ 北极星设计文档 ↗️ (Google Docs)

章程:开发并维护智能请求路由和负载均衡系统,针对分布式推理工作负载的延迟、吞吐量和资源利用率进行优化。

关键领域:

  • 针对 vLLM 优化的推理调度算法
  • KV 缓存感知路由与负载均衡
  • 集成 Kubernetes Gateway API 和 Inference Gateway 扩展
  • 流量控制与流量整形
  • SLA 感知的请求优先级划分

💬 交流:

SIG 基准测试 (Benchmarking)

👥 领导层: Marcio A L Silva, Ashok Chandrasekar

⭐️ 北极星设计文档 ↗️ (Google Docs)

章程:建立全面的性能测试和基准测试框架,确保 llm-d 在各种工作负载和硬件配置下都能提供最佳性能。

关键领域:

  • 基准测试框架与方法论
  • 性能回归测试
  • 工作负载模拟与合成数据生成
  • 特定硬件优化
  • 性能分析与剖析工具

💬 交流:

SIG PD 分离 (PD-Disaggregation)

👥 领导层: Robert Shaw, Tyler Michael Smith

⭐️ 北极星设计文档 ↗️ (Google Docs)

章程:设计并实现 Prefill/Decode 分离模式,以便跨异构硬件和针对不同缩放需求高效地拆分推理工作负载。

关键领域:

  • Prefill/Decode 工作负载分离
  • 分离式服务架构
  • 跨实例通信协议
  • 异构硬件优化
  • Prefill 和 Decode 实例间的动态工作负载平衡

💬 交流:

SIG KV 分离 (KV-Disaggregation)

👥 领导层: Maroon Ayoub, Danny Harnik

⭐️ 北极星设计文档 ↗️ (Google Docs)

章程:设计并实现分布式 KV 缓存解决方案,通过智能缓存管理、前缀共享和分离式存储提高推理性能。

关键领域:

  • 分布式 KV 缓存架构
  • 前缀缓存层级(本地、远程、共享)
  • 缓存感知调度与路由
  • 针对推理工作负载的存储优化
  • 集成 vLLM 的 KVConnector

💬 交流:

SIG 安装 (Installation)

👥 领导层: Brent Salisbury, Greg Pereira

⭐️ 北极星设计文档 ↗️ (Google Docs)

章程:确保 llm-d 与 Kubernetes 无缝集成,并为生产环境提供稳健的部署、缩放和运维能力。

关键领域:

  • Kubernetes 原生部署模式
  • Helm Charts 与 Operators
  • 安装与配置管理
  • 使用 LeaderWorkerSet 进行多节点编排
  • 平台集成与运维最佳实践

💬 交流:

SIG 自动扩缩容 (Autoscaling)

👥 领导层: Tamar Eilam, Abhishek Malvankar

⭐️ 北极星设计文档 ↗️ (Google Docs)

章程:开发智能自动扩缩容解决方案,根据流量模式、工作负载特征和硬件利用率自动调整 llm-d 部署。

关键领域:

  • 流量感知自动扩缩容算法
  • 硬件特定缩放策略
  • 基于工作负载的容量规划
  • 集成 Kubernetes HPA/VPA
  • 成本优化缩放策略

💬 交流:

SIG 可观测性 (Observability)

👥 领导层: Sally O'Malley, Roy Nissim, Benedikt Bongartz

⭐️ 北极星设计文档 ↗️ (Google Docs)

章程:提供全面的监控、日志和可观测能力,使运维人员能够了解系统行为、诊断问题并优化性能。

关键领域:

  • 指标收集与可视化
  • 分布式追踪与日志
  • 性能监控与告警
  • 运行仪表板与报告
  • 集成监控生态系统(Prometheus, Grafana 等)

💬 交流:

参与其中

加入 SIG

  1. 参加会议:查看项目日历获取 SIG 会议时间
  2. 参与讨论:在 Slack 上参与 SIG 专属频道
  3. 查阅文档:阅读 SIG 的章程和当前倡议
  4. 开始贡献:寻找带有 SIG 领域标签的 "good first issues"(适合新手的议题)

SIG 沟通渠道

SIG 的形成与演进

创建一个新 SIG

  1. 确定需求:证明社区兴趣和技术必要性
  2. 起草章程:定义范围、目标和初始领导层
  3. 提案流程:按照项目贡献指南提交提案
  4. 社区评审:在每周项目站会上展示并收集反馈
  5. 审批:获得项目维护者的批准

SIG 生命周期管理

  • 活跃 (Active):定期会议、积极开发、社区参与度高
  • 维护 (Maintenance):有限的主动开发,专注于稳定性和漏洞修复
  • 已归档 (Archived):不再活跃,仅作历史参考

SIG 可能会根据项目需求和社区参与情况进行演进、合并或归档。

资源

维护

本文档由项目维护者维护,并随 SIG 的演进而更新。有关 SIG 结构的问题或建议,请通过以下方式联系:

内容来源

此内容自动同步自 llm-d/llm-d 仓库 main 分支下的 SIGS.md

📝 如需建议更改,请编辑源文件创建 Issue