资讯动态

LeaderWorkerSet 生态全景:vLLM、SGLang、TensorRT-LLM 与 NVIDIA NIM 集成实战

发布时间:2026/8/20 21:43:06 来源:尧图企业网站定制
LeaderWorkerSet 生态全景vLLM、SGLang、TensorRT-LLM 与 NVIDIA NIM 集成实战【免费下载链接】lwsLeaderWorkerSet: An API for deploying a group of pods as a unit of replication项目地址: https://gitcode.com/gh_mirrors/lws2/lwsLeaderWorkerSetLWS是一个开源的 Kubernetes 原生 API用于把「一组 Pod」作为一个复制单元进行部署和管理。它专为大规模 LLM 推理而设计——在 vLLM、SGLang、TensorRT-LLM 甚至 NVIDIA NIM 等主流推理框架的多节点部署中LeaderWorkerSet 正在成为事实上的编排标准。本文用最简单的方式带你一次看懂 LWS 生态全景与四大主流框架的集成实战让「分布式 LLM 推理服务」从复杂变得简单。为什么大模型推理需要 LeaderWorkerSet单个 GPU 装不下 Llama-3.1-405B、DeepSeek-R1 这类超大模型必须把模型切分到多台机器上并行推理张量并行 流水线并行。传统方式需要手工管理每台机器上的 Pod、协调它们的启动顺序非常痛苦。LeaderWorkerSet 的核心模型是Leader WorkerLeader Pod每个组有一个 Leader负责对外提供服务HTTP 接口Worker Pod跟随 Leader 的多个 Worker与 Leader 协作完成分布式推理组GroupLeader 所有 Worker 组成一个复制单元整体扩容、整体重启、整体滚动更新。更贴心的是LWS 会自动向每个 Pod 注入三个环境变量推理框架无需感知 Kubernetes 细节即可组网环境变量作用LWS_LEADER_ADDRESSLeader 的地址通过 headless service 暴露LWS_GROUP_SIZE当前组内的 Pod 总数LWS_WORKER_INDEX当前 Pod 在组内的索引0 代表 Leader这套设计正是集成 vLLM、SGLang、TensorRT-LLM 的关键钥匙。相关定义可参考源码 api/leaderworkerset/v1/leaderworkerset_types.go 与环境变量文档 site/content/en/docs/reference/labels-annotations-and-environment-variables.md。实战一vLLM 分布式推理集成 ✅vLLM 是目前最流行的开源推理框架它通过 Ray 管理分布式运行时。LWS 与 vLLM 的配合方式是Leader 作为 Ray head 节点并运行 API ServerWorker 作为 Ray worker 节点由 LWS 负责把整组 Pod 拉起。官方示例docs/examples/vllm/GPU/lws.yaml中每个副本包含 2 个 Podpipeline_parallel_size2每个 Pod 占 8 张 GPUtensor_parallel_size8部署 2 个副本即可跑起 Llama-3.1-405B-Instruct 这样的巨型模型command: - python3 -m vllm.entrypoints.openai.api_server --port 8080 --model meta-llama/Llama-3.1-405B-Instruct --tensor-parallel-size 8 --pipeline_parallel_size 2部署后通过kubectl port-forward svc/vllm-leader 8080:8080即可访问 OpenAI 兼容接口。此外仓库还提供了TPU 版本docs/examples/vllm/TPU/lws.yaml支持 GKE 上的 v5e 切片一条 YAML 同时覆盖 GPU 与 TPU 两种场景。实战二SGLang 多节点部署 ✅SGLang 以其极致的推理速度著称是 DeepSeek-R1 等模型的高性能选择。LWS 的集成方式同样优雅——SGLang 原生支持张量并行配合 LWS 注入的环境变量即可零脚本组网。以 docs/examples/sglang/lws.yaml 为例只需在启动参数中引用 LWS 注入的变量--dist-init-addr $(LWS_LEADER_ADDRESS):20000 --nnodes $(LWS_GROUP_SIZE) --node-rank $(LWS_WORKER_INDEX)Leader 运行 HTTP Server端口 40000所有 Pod 通过--tp 2跨节点张量并行。实测中这套方案可轻松扩展到 Llama-3.1-405B 甚至 DeepSeek-R1 671B 级别。唯一需要注意的是张量并行对节点间带宽要求较高生产环境建议使用高速互联网络。⚠️实战三TensorRT-LLM 集成 ✅TensorRT-LLM 是 NVIDIA 官方的高性能推理引擎通过MPI管理分布式运行时。LWS 集成 TensorRT-LLM 的步骤稍多但同样清晰构建镜像使用仓库提供的 Dockerfile 构建 Triton TensorRT-LLM 镜像创建 RBACMPI 脚本需要访问 kubectl 判断 Worker 就绪状态先应用 docs/examples/tensorrt-llm/rbac.yaml部署 LWS应用 docs/examples/tensorrt-llm/lws.yaml每个副本 2 个 Pod流水线并行2每 Pod 8 张 GPU张量并行8Leader 通过 ClusterIP Service 暴露 8000 端口。部署完成后即可通过 Triton 的/v2/models/ensemble/generate接口发起推理请求把复杂的 MPI 组网完全交给 LWS 托管。实战四NVIDIA NIM 集成 ✅NVIDIA NIM 是 NVIDIA 推出的企业级模型推理微服务方案。值得注意的是NVIDIA 官方明确推荐使用 LeaderWorkerSet 来部署多节点 NIM 模型——这是 LWS 生态获得顶级厂商背书的标志。借助 LWSNIM 的多节点部署可以直接复用 vLLM/SGLang 类似的 Leader-Worker 模式Leader 承载 NIM 推理端点Worker 参与张量并行整体由 LWS 统一编排生命周期让企业级推理服务在 Kubernetes 上获得与开源框架一致的一致性体验。生态扩展调度、HPA 与更多能力 除了推理框架集成LWS 生态还在不断壮大Gang Scheduling同组调度配合 Volcano 调度器docs/examples/gang-scheduling/保证一组 Pod 要么全部调度成功、要么全部等待避免资源浪费HPA 弹性伸缩LeaderWorkerSet 支持 HorizontalPodAutoscaler按副本组为单位自动扩缩容参考 docs/examples/horizontal-pod-autoscaler.yamlDisaggregatedSet面向 Prefill/Decode 分离架构的下一代 APIapi/disaggregatedset/v1/进一步优化长上下文推理成本滚动更新与故障恢复支持RecreateGroupOnPodRestart等重启策略组内任意 Pod 异常即整组重建保证分布式状态的一致性。快速上手3 步开始 想亲自体验克隆官方仓库即可获得全部示例git clone https://gitcode.com/gh_mirrors/lws2/lws然后参考 docs/examples/lws.yaml 部署一个最小示例再按上面的四大实战逐个替换为 vLLM、SGLang、TensorRT-LLM 或 NIM 的 YAML 文件即可。总结LeaderWorkerSet 用「一组 Pod 一个复制单元」的极简抽象统一了 vLLM、SGLang、TensorRT-LLM 与 NVIDIA NIM 的分布式推理编排方式。无论你是刚接触 Kubernetes 推理的新手还是负责大规模 LLM 服务的平台工程师LWS 都能大幅降低多节点部署的复杂度。生态全景已就绪剩下的就是动手部署你的第一个分布式推理服务了【免费下载链接】lwsLeaderWorkerSet: An API for deploying a group of pods as a unit of replication项目地址: https://gitcode.com/gh_mirrors/lws2/lws创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价