跳转至正文
🎉
llm-d 0.4 现已发布!
查看支持推测解码的低延迟 DeepSeek 服务、分层前缀缓存卸载指南以及工作负载自动扩缩器预览。
阅读公告 →
架构
指南
使用
社区
博客
视频
Slack 框架
加入 Slack
llm-d:一个云原生(Kubernetes-native)高性能分布式大语言模型推理框架
架构
安装指南
社区
llm-d 为大规模推理服务提供了一条清晰的路径。它在多样化且全面的硬件加速器上,针对大多数模型实现了最快的价值实现时间和极具竞争力的性价比。
尝试快速入门演示
只需 1...2...llm-d,如此简单!
检查先决条件
运行快速入门
探索 llm-d!
安装指南