vLLM / TensorRT-LLM / SGLang 横评我在原生 Windows 上连 pip install 都装不上系列第 1 篇 · 推理选型决策⚠️ 数据性质声明先看这段避免误读本文只有「三框架在 Windows 的安装可装性」是本人实跑核验用 PyPI 官方 JSON API 查 wheel 平台标签「性能吞吐」全部来自各项目官方公开 benchmark非本人实测已在对应表格下方标注来源。本地真实推理基准已在本系列第 3、4 篇以「本人实测」补上本机torch加载 CUDA 扩展仍崩溃GPU 路径不可用故改用纯 NumPy CPU 推理引擎OpenBLAS实跑 Qwen2.5-0.5B/1.5B 的中文生成延迟约 15 / 5 tok/s与量化精度损失int8 保留 94%、int4 保留 82%数据真实可复现。所有数字请以你自己的硬件复测为准。官网说 vLLM 比 HuggingFace Transformers 快 3 倍但我在自己的RTX 5060 笔记本原生 Windows 11上敲pip install vllm直接报「找不到匹配的 Windows 包」。先别盲信 benchmark部署门槛才是第一道关。本辑主线把大模型从「能调通」做到「跑得快、跑得省、测得准、守得住」。这一篇先解决选型——同一模型、同一硬件三个推理引擎到底怎么选。一、为什么不直接用 APIAPI 够用但三个动因迟早把你推向自建推理引擎并发API 按 token 计费高并发下成本失控且速率限制卡脖子。成本长文本高 QPS 场景自托管一张卡往往比 API 账单便宜一个数量级。私有化数据不出内网金融/医疗/政企的硬要求。但自建的第一课不是「谁最快」是「谁装得上」。二、三框架定位差异一眼看懂引擎定位强项代价vLLM通用均衡社区大、连续批处理成熟、易上手极致性能非最强SGLang结构化输出RadixAttention 复用前缀、Agent/多轮强配置心智负担大TensorRT-LLMN 卡极致NVIDIA 上延迟/吞吐最优编译重、版本锁死、Linux only三、实测环境与数据来源哪些是我真跑的GPUNVIDIA RTX 5060 Laptop GPU8GB 显存Blackwell 架构计算能力 12.0驱动610.62系统Windows 11win32原生非 WSL2框架Python 3.13已安装torchCUDA 12.8 版诚实补充本机import torch在加载 CUDA 扩展时存在环境级崩溃torch 自带 CUDA 运行时与系统nvcuda.dll驱动接口不兼容因此本文尚未完成本地 Qwen2.5 的真实推理基准。下文「安装可装性」为本人实跑核验「性能吞吐」为官方公开数据非本人实测。数据边界务必看清①「安装可装性」 本人本机/PyPI 实跑②「性能吞吐」 各项目官方 benchmark 公开数据非本人实测文末附来源③本地推理基准已在本系列第 3、4 篇以纯 NumPy CPU 推理引擎补上GPU 路径因 torch 崩溃仍不可用。四、第一关原生 Windows 到底能不能装本人实跑我用 PyPI JSON API 拉了三者最新版的 wheel 平台标签结论很直接引擎(最新版)PyPI wheel 平台Windows wheelCUDA wheel本机pip installvLLM0.26.0manylinux_2_28 (x86/aarch64)无无❌ 无匹配包SGLang0.5.16manylinux_2_34 (x86/aarch64)无无❌ 无匹配包TensorRT-LLM1.2.1无任何 wheel仅源码包无无❌ 需源码编译反直觉结论三大引擎最新版在 PyPI 上全都只发 Linux wheel没有 Windows 轮子。想在原生 Windows消费级显卡上直接pip install目前三个都装不上。注意措辞是「原生 Windows」装不上不是「Windows 完全不行」——下面第七节给了 WSL2 解法。血的教训别信「某某框架支持 Windows」的旧教程。版本迭代极快装之前先pip index versions pkg或查 PyPIfiles页确认有没有win_amd64轮子否则白折腾一下午。五、性能怎么摆公开 benchmark非本人实测装得上才谈性能。下表汇总各项目官方文档/benchmark 博客的相对结论绝对 QPS 随硬件天差地别请在你自己的卡上复现维度vLLMSGLangTensorRT-LLM吞吐(对比 HF)官方称连续批处理带来2–4×提升前缀复用场景高吞吐N 卡上通常最优TTFT(首 token)中中低编译优化TPOT(每 token)低低最低峰值显存中PagedAttention中低内核融合来源vLLM 官方文档/BlogSGLang GitHubTRT-LLM 官方 Docs标注上表为公开数据非本人实测来源见文末。绝对数值请以你本机压测为准。六、血泪坑实录TRT-LLM 锁 CUDA 版本编译对 CUDA/driver 极其挑剔换张卡或升驱动可能整套重编CI 里是噩梦。SGLang 路由配置RadixAttention 强但多卡/路由参数配错时吞吐不升反降日志还不直观。vLLM 的 prefix cache 默认关多轮对话/共享前缀场景不显式开enable_prefix_caching等于白买内存带宽。七、选型决策树你用的是 N 卡 Linux 生产环境 ├─ 是且要极致延迟/吞吐 → TensorRT-LLM肯花编译成本 ├─ 是常规高并发服务 → vLLM最稳社区答案 └─ 否Windows / 消费级卡 / 想快上手 ├─ 多轮/Agent/结构化输出 → 上 WSL2 SGLang └─ 通用推理 → WSL2 vLLM一句话生产无脑 vLLMN 卡极致上 TRT-LLM结构化输出看 SGLangWindows 用户先装 WSL2别在原生 Windows 里死磕。八、读者交付物①选型决策树上图可截图 ②一键压测脚本骨架vegeta 版GitHub 风格片段# 用 vegeta 压你的 /v1/completions 接口echo{model:qwen2.5,prompt:你好,max_tokens:128}\|vegetaattack-rate20-duration30s-methodPOST\-headerContent-Type: application/json\-targethttps://your-host/v1/completions\|vegetareport# 看吞吐 QPS / p99 延迟结尾今天就能动手的 3 条清单先查轮子再动手pip index versions vllm确认有你系统的 wheel别上来就pip install。装 WSL2Windows 用户花 10 分钟wsl --install推理引擎的世界在 Linux 侧。压一次基线用上面 vegeta 片段压你现有接口记下 QPS/p99下篇我们拆延迟。实测环境与免责本次环境见第三节。安装可装性为本人在本机/PyPI 实跑PyPI 官方 JSON API 核验性能吞吐为各项目官方公开 benchmark非本人实测来源vLLM 官方文档与 Blog、SGLang GitHub README、NVIDIA TensorRT-LLM 官方 Docs。本地真实推理基准已在本系列第 3、4 篇以「本人实测」补上本机 torch 加载 CUDA 扩展崩溃GPU 不可用改用纯 NumPy CPU 推理引擎实跑 Qwen2.5-0.5B/1.5B 延迟约 15/5 tok/s与量化损失int8 94%/int4 82%。数据基于本人环境仅供参考请以你自己的硬件复测为准。**下篇我们聊为什么三引擎吞吐差这么多——连续批处理 投机解码的实测账。