llm-d 0.4: 在各类加速器上实现 SOTA 性能
llm-d 的使命是在任何加速器和云端提供达到 SOTA 推理性能的最快路径。在我们的 0.3 版本 中,我们为大型混合专家模型(MoE)实现了广泛的专家并行(EP),以提供极高的输出 Token 吞吐量——这是强化学习的关键推动因素——并增加了对多个非 GPU 加速器系列的初步支持。
本版本带来了对专家并行吞吐量的补充:提升生产服务的端到端请求延迟。通过推测解码(speculative decoding)和针对延迟敏感型工作负载的 vLLM 优化,我们将 DeepSeek 的单 Token 延迟降低了高达 50%。我们增加了对 Google TPU 和 Intel XPU 的动态解耦服务支持,以便在流量不可预测时进一步降低首 Token 延迟(TTFT);同时,我们新的前缀缓存卸载“坦途”指南可帮助您利用 CPU 内存和高性能远程存储来提高命中率并降低尾部延迟。对于部署了多个模型的使用者,我们的工作负载自动扩缩器预览版会根据实时服务器容量和流量进行调整,以减少模型部署排队请求的时间,从而减轻在有限加速器容量上运行多个模型的运维负担。
这些通过我们的 坦途(well-lit paths) 呈现的开源推理栈优化,确保您能在现实场景中的前沿开源模型上达到 SOTA 级的延迟水平。










