资讯动态

昇腾vLLM推理框架:openPangu-Ultra-MoE-718B-V1.1高效部署方案

发布时间:2026/8/31 5:26:45 来源:尧图企业网站定制
昇腾vLLM推理框架openPangu-Ultra-MoE-718B-V1.1高效部署方案【免费下载链接】openPangu-Ultra-MoE-718B-V1.1昇腾原生的开源盘古 Ultra-MoE-718B-V1.1 语言模型项目地址: https://ai.gitcode.com/ascend-tribe/openPangu-Ultra-MoE-718B-V1.1openPangu-Ultra-MoE-718B-V1.1是基于昇腾NPU训练的大规模混合专家语言模型总参数量为718B激活参数量为39B同一个模型具备快思考和慢思考两种能力。本文将详细介绍如何通过昇腾vLLM推理框架实现该模型的高效部署帮助新手和普通用户快速掌握部署技巧。部署环境准备 硬件要求部署openPangu-Ultra-MoE-718B-V1.1模型推荐使用昇腾Atlas 800T A2服务器。根据不同的量化方式硬件配置要求有所不同BF16推理需64卡Atlas 800T A2(64GB)Int8推理仅需32卡Atlas 800T A2(64GB)软件环境选用vllm-ascend社区镜像v0.9.1-dev多个节点都需拉取镜像。确保所有节点已正确配置昇腾驱动和固件。推理权重准备 ⚙️openPangu-Ultra-MoE-718B-V1.1推理采用Tensor Parallel并行策略叠加昇腾NPU融合大算子需要提前对safetensors权重进行切分。以下是32卡并行推理的权重切分示例切分后的权重会保存在model/目录下克隆仓库git clone https://gitcode.com/ascend-tribe/openPangu-Ultra-MoE-718B-V1.1运行权重切分脚本cd openPangu-Ultra-MoE-718B-V1.1 bash inference/split_weight.sh容器部署步骤 镜像启动使用以下命令启动vllm-ascend容器docker run --rm \ --privileged \ --networkhost \ -v /path/to/model:/workspace/model \ ascendhub.huawei.com/public-ascendhub/vllm-ascend:v0.9.1-dev \ /bin/bashBF16推理部署在64卡环境下使用以下命令启动BF16推理服务vllm serve /workspace/model \ --model openpangu-ultra-moe-718b \ --tensor-parallel-size 64 \ --host 0.0.0.0 \ --port 8000Int8推理部署相较于BF16模型推理int8量化模型推理仅需使用4节点32卡。启动命令需要修改为对应的量化权重路径另外增加--quantization ascendvllm serve /workspace/model/int8 \ --model openpangu-ultra-moe-718b \ --tensor-parallel-size 32 \ --quantization ascend \ --host 0.0.0.0 \ --port 8000推理性能优化 关键优化策略昇腾NPU融合大算子充分利用昇腾NPU的硬件特性通过算子融合减少数据传输开销Tensor Parallel并行策略根据模型规模和硬件配置合理设置并行度量化推理在精度损失可接受的情况下使用Int8量化可减少一半显存占用提升推理速度配置文件优化可通过修改推理配置文件调整性能参数配置文件路径inference/runner_config/包含tp1.yaml和tp32.yaml等不同并行度的配置模板。推理示例代码 使用Python进行推理的简单示例from vllm import LLM, SamplingParams # 加载模型 llm LLM(model/workspace/model, tensor_parallel_size32) # 设置采样参数 sampling_params SamplingParams(temperature0.7, top_p0.95, max_tokens1024) # 推理 prompts [什么是人工智能] outputs llm.generate(prompts, sampling_params) # 输出结果 for output in outputs: prompt output.prompt generated_text output.outputs[0].text print(fPrompt: {prompt!r}, Generated text: {generated_text!r})常见问题解决 ❓权重切分失败检查磁盘空间是否充足确认输入权重文件完整检查昇腾NPU驱动是否正常加载推理性能不佳尝试调整Tensor Parallel大小检查是否启用了昇腾NPU融合算子考虑使用Int8量化推理总结通过昇腾vLLM推理框架部署openPangu-Ultra-MoE-718B-V1.1模型不仅可以充分发挥昇腾NPU的硬件优势还能通过灵活的并行策略和量化技术在保证模型性能的同时降低部署成本。无论是科研机构还是企业用户都可以通过本文提供的方案快速实现大规模语言模型的高效部署。更多详细信息请参考项目文档部署和使用指南vllm-ascend部署指导Docker部署说明【免费下载链接】openPangu-Ultra-MoE-718B-V1.1昇腾原生的开源盘古 Ultra-MoE-718B-V1.1 语言模型项目地址: https://ai.gitcode.com/ascend-tribe/openPangu-Ultra-MoE-718B-V1.1创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价