资讯动态

将GPT OSS私有部署推理性能提升100倍的部署教程(下)

发布时间:2026/9/22 16:33:28 来源:尧图企业网站定制
部署 GPT OSS 模型确认模型下载完成后点击已下载模型右侧的部署按钮部署模型。在部署页面展开高级配置设置模型类别为 LLM。并在后端版本中填写自定义后端版本为0.10.1gptossGPUStack会自动调用/var/lib/gpustack/bin/vllm_0.10.1gptoss来运行模型并设置以下后端参数和环境变量后端参数--max-model-len32768环境变量VLLM_ATTENTION_BACKENDFLASH_ATTNVLLM_USE_FLASHINFER_SAMPLER0保存部署等待模型启动完成确认模型正常运行Running然后可以在试验场测试模型GPT OSS 20BGPT OSS 120BEvalScope 压测对比 OllamaEvalScope 是魔搭社区推出的模型评测与性能基准测试框架简单易上手此处使用 EvalScope 来对比 Ollama 和 GPUStack vLLM 后端运行的 GPT OSS 20B 与 GPT OSS 120B 的吞吐性能表现。使用 Conda 安装 EvalScope# 创建虚拟环境conda create -n evalscope python3.10 -y# 激活虚拟环境conda activate evalscope# 安装 EvalScopepip install -U evalscope[perf] plotly gradio wandb以下为压测记录可以直接跳过到最后查看压测结果汇总分析。GPT OSS 20B 单卡运行10 请求 1并发GPUStack vLLMevalscope perf \--url https://gpustack.xxx.xx/v1/chat/completions \--api-key gpustack_c07786062fb72316_ce5da3294ec87a708b25bda4082d894b \--model gpt-oss-20b \--number 10 \--parallel 1 \--api openai \--dataset openqa \--streamOllamaevalscope perf \--url http://192.168.0.1:11434/v1/chat/completions \--model gpt-oss:20b \--number 10 \--parallel 1 \--api openai \--dataset openqa \--stream将以上压测结果的吞吐表现汇总如下表以上测试结果表明在大模型推理的场景下硬件投入越高选择像 vLLM 这样的高效推理引擎其投资回报率ROI也就越高。举个形象的例子如果企业采购了价值 1000 万元的 GPU 硬件假设使用 vLLM 可以将 GPU 使用效率提升到约 80%相当于真正发挥出 800 万元的硬件价值。而若选择如 Ollama 这类桌面型工具相同资源条件下实际吞吐能力仅为 vLLM 的几分之一能够释放的计算能力远低于 vLLM。对于重视成本效益与性能表现的企业来说如何选型自然不言而喻。以上测试数据基于单实例运行环境。尽管 Ollama 单实例的资源占用看似远低于 vLLM但由于其技术架构的限制单实例一般也仅能支持个位数的并发连接。要想支撑更高的并发必须通过部署多个实例来扩展能力。然而多实例部署带来的最大问题就是显存资源的严重浪费。以部署 GPT OSS 20B 模型为例单个 Ollama 实例加载约 14GB 的模型权重假设每个实例支持 4 路并发实现 100 路并发需部署 25 个实例显存总占用超过 350GB。而采用 vLLM仅需约 130GB 显存即可支撑相同并发且具备更强的扩展能力。综上从资源利用率、扩展能力到总体成本控制vLLM 在实际生产环境中均展现出显著优势是面向企业级大模型推理部署的更优解。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价