资讯动态

NVIDIA Model Optimizer安装与环境配置完全教程:从pip一键到Docker容器

发布时间:2026/9/25 13:33:53 来源:尧图企业网站定制
NVIDIA Model Optimizer安装与环境配置完全教程从pip一键到Docker容器【免费下载链接】Model-OptimizerA unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.项目地址: https://gitcode.com/GitHub_Trending/te/Model-OptimizerNVIDIA Model Optimizer简称 ModelOpt是一款集量化、剪枝、知识蒸馏、神经架构搜索NAS、投机解码于一体的开源模型压缩与推理加速库能将大语言模型和扩散模型压缩 2-4 倍并直接对接 TensorRT-LLM、TensorRT、vLLM 等部署框架显著提升推理速度。本文将带你用pip 一条命令或Docker 容器两种方式快速完成 NVIDIA Model Optimizer 的安装与环境配置。一、系统要求安装前 1 分钟快速核对在开始安装前先确认你的环境满足 NVIDIA Model Optimizer 的系统要求详见 docs/source/getting_started/_installation_for_Linux.rst项目Linux 要求Windows 要求操作系统LinuxWindows (amd64 / ARM64 实验性)Python3.10, 3.153.10, 3.14CUDA12.x / 13.x12.0PyTorch2.8—ONNX 场景无需GPU 驱动与 CUDA 匹配565.90 或更新RTX 40/50 系 关键原则有 NVIDIA GPU 就装对应版本 PyTorch没有 GPU 也能装部分功能如 ONNX 量化配置、剪枝实验可在 CPU 环境运行。二、方式一pip 一键安装最简单3 步完成第 1 步创建虚拟环境推荐用 conda 创建独立的 Python 3.12 环境避免依赖冲突conda create -n modelopt python3.12 pip conda activate modelopt第 2 步一条命令安装 Model Optimizerpip install -U nvidia-modelopt[all]其中[all]表示安装全部可选依赖。如果你只需要部分功能可按需替换定义见 pyproject.toml安装方式适用场景nvidia-modelopt仅 PyTorch 核心模块nvidia-modelopt[onnx]ONNX 模型量化含 onnxruntime、CuPynvidia-modelopt[hf]Hugging Face 模型transformers/diffusersnvidia-modelopt[all]全功能推荐新手直接使用 ✅nvidia-modelopt[dev]开发模式含测试与文档依赖第 3 步按需处理 CUDA 13 环境默认安装的是cupy-cuda12x用于 INT4 ONNX 量化加速。如果你的机器是 CUDA 13请替换为pip uninstall -y cupy-cuda12x pip install cupy-cuda13x三、方式二Docker 容器安装官方推荐最省心如果你要配合 TensorRT-LLM、TensorRT 等部署框架做端到端流程官方强烈推荐使用NVIDIA 官方容器镜像Model Optimizer 已预装可跳过本地依赖配置的麻烦镜像适用场景nvcr.io/nvidia/tensorrt-llm/release:versionLLM 量化 TensorRT-LLM 部署首选nvcr.io/nvidia/pytorch:version-py3通用 PyTorch 场景nvcr.io/nvidia/nemo:versionMegatron-Bridge / NeMo 训练场景典型操作流程# 拉取并进入 TensorRT-LLM 容器版本号按官方发布选择 docker run --gpus all -it --rm nvcr.io/nvidia/tensorrt-llm/release:latest bash # 容器内将 Model Optimizer 升级到最新版 export PIP_CONSTRAINT pip install -U nvidia-modelopt[all]进入 TensorRT-LLM 容器后建议按官方文档设置 TensorRT 二进制路径变量LD_LIBRARY_PATH。项目内也提供了现成的容器构建示例例如面向 vLLM 部署的 examples/vllm_serve/Dockerfile 展示了如何预编译量化 CUDA 扩展以加速首次运行。四、方式三源码安装想尝鲜最新特性时git clone https://gitcode.com/GitHub_Trending/te/Model-Optimizer cd Model-Optimizer pip install -e .[all]源码安装适合需要阅读实现或提交补丁的开发者可自由切换功能模块进行实验。五、Windows 用户专属环境配置在 Windows 上Model Optimizer 主要面向ONNX 模型量化支持 RTX 40/50 系显卡当前为单卡配置完整步骤见 docs/source/getting_started/windows/_installation_for_Windows.rst安装 NVIDIA 显卡驱动565.90、CUDA Toolkit 与匹配版本 cuDNN用venv或 conda 创建 Python 3.10-3.13 虚拟环境执行安装命令pip install nvidia-modelopt[onnx]⚠️ 注意Windows 版本若缺少[onnx]选项将不会安装 ONNX 量化所需的 onnxruntime属于最常见的安装误区。六、安装验证一条命令确认环境可用导入检查确认各模块可正常加载python -c import modelopt.torch.quantization python -c import modelopt.onnx.quantization # 仅 [onnx] 用户预编译量化内核重要首次调用 PyTorch 量化 API 时Model Optimizer 会用当前 torch CUDA 现场编译快速量化内核可能耗时几分钟属正常现象。建议提前手动触发编译避免阻塞正式任务python -c import modelopt.torch.quantization.extensions as ext; ext.precompile()另外如果你的 GPU 计算能力 8.9如 RTX 40 系、L40执行pip install triton即可自动启用 Triton 加速量化内核量化速度可提升约 40%——无需任何额外配置。✅七、常见问题快速排查 ️问题现象解决方案modelopt.torch可导入但其他模块报错安装时漏了可选依赖补装nvidia-modelopt[all]或对应选项CUDA 13 环境下 INT4 ONNX 量化慢将cupy-cuda12x换成cupy-cuda13x首次量化等待很久正在编译 CUDA 扩展运行上文ext.precompile()提前完成容器内版本过旧容器预装版本较旧进入容器后执行pip install -U nvidia-modelopt[all]Windows 上 CUDA EP not found检查 CUDA/cuDNN 版本是否匹配并将 cuDNN 的 bin/lib 路径加入PATH后重启终端更多问题可查阅 docs/source/support/2_faqs.rst。八、下一步环境就绪后做什么安装完成后你可以立刻尝试这些官方示例LLM 后训练量化PTQexamples/hf_ptq/hf_ptq.py支持 NVFP4/FP8/INT4-AWQ扩散模型量化examples/diffusers/quantization/量化感知训练QATexamples/llm_qat/剪枝 蒸馏Minitron/Puzzletronexamples/pruning/现成的量化配置可直接复用 modelopt_recipes/ 目录下的官方 recipe。 本教程基于仓库安装文档整理核心参考docs/source/getting_started/2_installation.rst。祝压缩顺利推理起飞【免费下载链接】Model-OptimizerA unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.项目地址: https://gitcode.com/GitHub_Trending/te/Model-Optimizer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑