跳转至正文

llm-d:一个云原生(Kubernetes-native)高性能分布式大语言模型推理框架

llm-d 为大规模推理服务提供了一条清晰的路径。它在多样化且全面的硬件加速器上,针对大多数模型实现了最快的价值实现时间和极具竞争力的性价比。

尝试快速入门演示

只需 1...2...llm-d,如此简单!

1. 检查先决条件

2. 运行快速入门

3. 探索 llm-d!

安装指南