资讯动态

国产GPU算力租赁实测:昇腾910B对比A100,性能成本全解析

发布时间:2026/9/9 10:14:46 来源:尧图企业网站定制
做了快四年的算力租赁生意从ChatGPT火起来之后我这边的NVIDIA显卡就没断过租。A100、H800、4090客户要什么我基本能搞到什么价格也从最早的按小时算钱卷到后来按分钟甚至按token计费。但2023年下半年开始陆续有客户问我“你们有没有国产GPU昇腾或者寒武纪的能不能租”说实话我一开始是拒绝的因为心里没底。手里的机器全是NVIDIA生态驱动、CUDA、PyTorch一条链路成熟得不能再成熟陡然换国产卡先不说性能光适配问题我都能猜到有多痛苦。但问的人多了我意识到这不是个别需求而是一波正在发生的市场转向。于是从2024年初开始我陆续弄了几台搭载国产GPU的机器进机房自己测、给客户试慢慢积累了一些一手数据和踩坑经历。今天这篇不吹不黑咱就站在算力租赁商的角度聊聊国产GPU到底能不能打哪些场景能打哪些场景目前还不能打。我会把实测数据、客户反馈、成本核算都摊开来讲给正在观望租国产算力或者犹豫要不要采购国产卡的兄弟们一个参考。1. 为什么我一个算力租赁商会动国产GPU的心思1.1 来自身边的真实账单先给大家看一笔账。我这边有一台8卡A100 80G的机器按一个月的租赁算市场价大概在4到6万人民币浮动。硬件采购成本高、折旧快、功耗大再加上现在H100、H800这些卡越来越难买NVIDIA的供货周期动不动就是三个月以上很多客户等不了那么久。但市场等不起尤其是一些创业团队和高校实验室预算有限时间紧张他们要的根本不是最顶级的卡而是“能跑起来、价格合理”的算力。与此同时国产GPU的供应方在拼命推市场。我参加过的几场算力行业交流会上昇腾、寒武纪、昆仑芯这些厂商的商务人员都主动加过我微信报价单直接甩过来。对比之下NVIDIA那边连个区域代理的态度都爱答不理。市场就是这么现实谁好拿货、谁便宜谁就能先把货铺出去。作为租赁商我也得跟着市场风向走不然等客户都跑到别家租国产卡了我再反应就晚了。1.2 国产卡进场的市场逻辑很多人觉得国产GPU是政策驱动的产物实际在算力租赁这个行当里逻辑其实很朴素第一供货稳定第二价格有竞争力第三生态在肉眼可见地变好。我2024年年初第一次接触昇腾910B供货商时对方承诺的交货周期是两周。两周这在NVIDIA那边是不可想象的A800当时排队至少两个月起。另一个推动力是成本结构。国产GPU的采购价普遍是同级别NVIDIA卡的六到七折功耗上也有一些优势。对于租赁商来说硬件成本低意味着回本周期短定价空间大。我算过一笔账同样做8卡服务器租赁NVIDIA A800的方案硬件成本大概是35万左右按市场价月租4万算回本周期接近9个月而昇腾910B的方案硬件成本在25万以内就算月租定到3万回本周期也在8个多月。看起来差不多但关键差异在于——NVIDIA的卡买得到买不到是个大问题而国产卡随时能补货。这对我这种中小规模的租赁商来说是致命的吸引力。2. 在售主力国产卡都有谁从昇腾到寒武纪的快速扫描2.1 昇腾系列目前市场声量最大的一档提到国产GPU绕不开华为昇腾。目前市面上能拿到货且正经在算力租赁市场流通的主要是昇腾910B和昇腾310系列。910B定位是训练卡大家常说的“昇腾910B”其实包含多个型号版本比如910B2、910B3、910B4配置略有差异对应不同的算力和显存规格。310系列则是推理卡常见于边缘推理、视频分析这类低功耗场景。从我实际接触到的参数来看昇腾910B的FP16算力大约在376 TFLOPS左右不同版本有浮动显存是64GB HBM2e显存带宽达到1.6TB/s。这个数字什么概念A100 80G的FP16算力是312 TFLOPS显存带宽2TB/s。也就是说单看纸面参数910B的FP16算力甚至比A100高一点但显存带宽略低整体属于同一档位。当然纸面参数只是参考实际能不能发挥出来取决于软件栈和算子库的完善程度这点后面细说。2.2 寒武纪、昆仑芯、壁仞等其他选手寒武纪思元370系列MLU370-S4/S8在推理市场有存在感尤其是搭配寒武纪自研的CNToolkit框架做视觉模型推理性能比早期版本稳定很多。昆仑芯P800是百度系的核心产品在文心一言的训练和推理中大规模部署过算力参数不差但目前市面上的流通量不如昇腾大租赁市场遇到得少。壁仞科技BR100系列在2022年发布会时参数很猛但实际落地项目不多我在租赁圈子里没怎么见过实物。还有一个不得不提的是摩尔线程虽然它家主要做消费级显卡但在AI加速卡领域也有布局。我记得有位做语音识别客户测试过摩尔的显卡跑Whisper推理没问题速度也还行但训练大模型就差些意思。总得来说国产卡能选的型号不少但真正能在租赁市场稳定供货、有成熟售后支持、客户愿意买单的目前还是以昇腾为主其他家的卡还在从“能跑”往“好用”过渡。2.3 关于显卡算力TOPS对照表的一点看法经常有客户拿网上那种“显卡算力TOPS对照表”来问我某张国产卡标称的算力是XXX TOPS是不是比A100还强这里我必须泼盆冷水。算力标称值在GPU领域有不同口径比如FP16、FP32、INT8这些精度下的TOPS完全不是一个量级还有的厂商标的是稀疏算力需要配合稀疏化技术才能达到而NVIDIA标的一般是稠密算力。纸面数据看看就行真正的参考价值得靠实际跑基准测试。我这边的经验是租卡之前一定要让供应商给你开一台临时测试机跑你真实业务的模型用数据说话不要对着参数表意淫。3. 实测记录真实跑训练和推理国产卡和NVIDIA差在哪3.1 训练实测用Qwen1.5-7B微调做对比我自己的实测项目用的是ModelScope上开源的Qwen1.5-7B模型做LoRA微调。数据量大概2万条中文指令数据训练配置是DeepSpeed ZeRO-3batch size按默认设置来分别跑在8卡A100 80G和8卡昇腾910B3上记录整体训练时间和稳定性。A100平台跑了大概1小时47分钟训练过程基本无感日志里没有任何warn或errorLoss曲线平滑下降。昇腾910B3这边前期的环境配置多花了大半天——因为需要安装torch_npu和对应的CANN工具包它不兼容标准PyTorch的CUDA后端。把代码里的.cuda()改成.npu()再把部分算子做适配之后实际训练耗时大约2小时40分钟。差距大约在50%左右。910B3的纸面算力比A100高但实际训练时间反而慢了50%这中间的差距完全来自软件栈的成熟度PyTorch对昇腾NPU的算子支持还没做到全覆盖很多算子走了自定义实现无法用到硬件的最优指令。3.2 推理实测vLLM部署带来的意外发现推理场景我选择了vLLM作为服务框架测试模型是Qwen2-7B-Instruct量化方式是FP16并发设置为32。在A100上vLLM一条命令直接跑通平均首token时延TTFT在120ms左右单卡吞吐能到每天200万token以上。在昇腾910B上vLLM也有适配版本但版本号比NVIDIA那边落后不少而且部分特性比如paged attention的某些优化不可用。实测下来的结果是昇腾910B跑Qwen2-7B推理首token时延在200ms左右单卡吞吐差不多是A100的55%到60%。换句话说如果以推理服务为核心业务用国产卡就需要多备大概一倍的卡才能扛住同样的并发量这就会抵消掉硬件采购成本的优势。不过让我意外的有一点在昇腾的CANN最新版本里有些针对Transformer结构的融合算子效率其实很高纯跑长序列生成类任务时910B的功耗比和时延表现没有想象中那么拉胯属于有惊喜但也有明显短板的状态。3.3 稳定性与运维三个GPU同时测试露馅了不少问题我自己有一套小脚本会在新卡进机房时做连续三天的压测三个GPU一起跑监控温度、风扇转速、卡死和报错情况。这轮测试里NVIDIA的A100和4090几乎零报错跑完72小时温度曲线平稳。国产卡就有意思了部分型号在长时间高负载下会出现显存频率自动下降的情况也就是降频。我推测是散热策略或硬件调度的问题但供应商的工程师也说不清具体原因只说“新批次固件会优化”。后来我换了版本较新的CANN包情况好了一些但依然有偶发性的dfx报错。更麻烦的是驱动依赖。我遇到过在某张国产卡上跑PyTorch程序崩溃后核心转储core dump留下了一大堆日志里面有一个“gpu crash dump triggered”的提示。这个现象在NVIDIA卡上我基本没遇到过但在国产卡上出现了两三次。每次都得清掉旧的驱动模块、重装和PyTorch对应的适配包折腾下来小半天没了。稳定性这关国产卡整体只能打70分比想象中好但还没到“开箱即用、不用管”的程度。4. 比性能差距更麻烦的CUDA生态迁移的那些坑4.1 PyTorch安装教程GPU版的“国产变体”很多初学者在网上搜“pytorch安装教程gpu”照着NVIDIA的教程装完就能跑。国产卡不行标准的pip install torch直接装的是CUDA版在国产卡上根本识别不到设备。昇腾的卡需要先装CANN工具包再装torch_npu插件然后通过import torch_npu来让PyTorch能够调用NPU。寒武纪那边则是用自己的CNToolkit加PyTorch补丁分支。也就是说同样一份训练代码在NVIDIA上如果是一小时的部署成本在国产卡上至少是三到四小时而且中间会遇到各种版本不兼容的报错。我踩过的一个典型坑是CANN版本和PyTorch版本必须严格匹配不然跑起来会随机报socket connect failed或者invalid device。供应商给的部署文档有时候也不够细我在CentOS 7.9系统上装完驱动后模块加载失败后来发现是内核版本太老和CANN要求的glibc版本对不上折腾了一整天才解决。Linux下部署国产GPU驱动建议直接用Ubuntu 20.04以上的新内核版本不要在旧系统上死磕。4.2 框架支持的新生态不只是换一个命令的事现在问题最大的环节是训练框架和推理框架的支持度。DeepSpeed、Megatron-LM这类分布式训练框架NVIDIA版本直接支持CUDA集合通信国产卡这边通常是厂商自己做了第三方适配比如昇腾有CANN版本的集合通信库HCCL接口方法和NCCL不完全一样。多机多卡训练时只要代码里涉及通信拓扑设置、集合通信初始化参数就得按厂商的文档改。推理框架这边vLLM有昇腾适配分支但版本和特性的滞后让很多新模型无法直接跑。比如有些模型里用到了某种新的attention实现在昇腾版本上还没有对应的算子vLLM会直接报NotImplementedError。客户如果对框架版本有要求合同里最好提前写清楚国产卡平台需要额外适配时间。我遇到过不止一个客户拿着NVIDIA平台的部署文档要我在国产卡上原样执行最后都以失败告终。搞清楚边界比闷头硬坑要重要得多。4.3 国产框架的自我进化PaddlePaddle和MindSpore的存在感除了PyTorch兼容层国产GPU厂商也在推自己的原生框架。昇腾主推MindSpore寒武纪有自家的框架体系百度系产品天然亲近PaddlePaddle。从我这边的观察来看如果模型本来就是PaddlePaddle训练的迁移到国产卡上的难度明显更低。但现实是大部分开源社区的模型都是PyTorch生态MindSpore的模型库和第三方衍生项目还是少。客户来租卡大多数要求“PyTorch能跑就行”对MindSpore这种“换一个生态”的建议普遍不接受。所以短期来看国产GPU要走量的关键还是在PyTorch兼容层上谁家能把torch_npu做好谁就能抢占算力租赁市场。这也是我和供应商沟通时沟通得最多的一件事好在2024年以来适配进度明显在加快PyTorch生态的成熟度正在肉眼可见地提升。5. 算力租赁怎么定价国产卡到底划不划算5.1 定价逻辑和成本构成算力租赁的定价不是拍脑袋定个价那么简单。我做成本核算至少看四个维度硬件折旧、机柜电费、带宽运维、摊销人工。拿一台8卡的昇腾910B3机器举例。硬件成本大概在22到28万按五年折旧算每年折旧4到5万机器额定功耗2400W以上机房电费按1.2元一度算一个月电费就是2400乘以24小时乘以30天再除以1000乘以1.2大约2000块电费只多不少再加上机柜托管、网络带宽、技术运维的人工成本一个月基础成本大概在5000到8000元。在这个基础上加利润和风险溢价月租定在2.8万到3.3万是合理的。同级别的A100 8卡机成本月租大概在4.2万到4.8万。所以我这边租国产卡给客户的报价能做到同等训练能力下NVIDIA平台的六到七折。对于预算敏感型客户这是很大的吸引力。5.2 客户的算力需求评估从token成本角度谈很多做应用层的小团队来咨询租卡时张口就问“你们100万token多少钱”。这里需要理清概念token、算力、API是完全不同的三个维度。token是文本处理的最小单位算力是底层资源API是上层服务。国产GPU租赁是按算力资源计费不直接和token挂钩但客户可以大致估算自己的token需要多少算力来支撑。怎么评估一般逻辑是先测一下目标模型在单卡上的吞吐比如跑Qwen2-7BFP16精度并发32的情况下单张A100一天能处理200万token。如果客户业务每天需要5000万token那他至少需要25张卡或等价的算力。这个评估方法同样适用于国产卡只是国产卡的单卡吞吐要打六折计算。我建议客户在合约前先拿500条真实业务数据跑一遍推理服务把首token时延和并发能力测出来用实测结果反推需要租多少张卡。这样签的合同更准确后期的纠纷也少很多。5.3 租赁收益模型算完账再决定买不买卡对着租赁市场算了算账做一个小结如果你是打算直接采购国产GPU搭建算力平台做对外租赁那就不能只看硬件采购价差还要把软件适配带来的隐性成本算进去。我这边单独有一位工程师每个月大概有一半时间都花在帮助客户解决国产卡环境的部署问题上。有他的存在机器的出租率才能稳定在70%以上。如果这块人力成本管理不好国产卡租赁的利润优势很快就会被摊薄。我给同行的建议是不要把国产卡当成A100的平替去卖要把它定位成“性价比训练推理一体机”专门切给那些预算有限、业务场景较轻的中小客户。这类客户对性能上限不那么敏感但对账单金额很敏感国产卡的租金优势正好命中他们的痛点。6. 租赁客户的真实反馈大家吐槽最多的三个问题6.1 “我的模型为什么在你们这卡死了”这是国产卡租赁服务里遇到的最高频投诉。很多时候不是卡本身死了而是代码里用到了某个国产卡适配层尚未支持的算子导致程序直接unexpected quit。一位做中文法律文书解析的客户在NVIDIA上跑得好好的BERT模型切到国产卡后频繁崩溃最后发现是transformers库里某个torch.where算子在昇腾NPU上的实现有bug升级CANN后修复。这类问题小但烦人非常考验供应商的技术支持能力。说到底国产卡租赁卖的不是单纯算力而是“适配服务”。谁家的技术工程师能更快解决算子兼容问题谁就能留住客户。我见过一些从别家转过来的客户他们对性能倒是没有太多抱怨但都表达过“之前那个平台出了问题找不到人”的无奈。这反而成了我们的竞争力。6.2 “监控面板怎么连不上”多卡机器的监控管理是目前另一个痛点。NVIDIA有成熟的nvidia-smi和DCGM工具一条命令就能查看所有卡的状态、温度、功率。国产卡各自有各自的工具昇腾有npu-smi寒武纪有cnmon昆仑芯也有自己的监控工具但统一程度不如NVIDIA。我这边好几台机器用了Prometheus加Grafana做统一监控但不同厂商的exporter采集器成熟度不一样安装配置的难度差别很大。有客户在Linux上执行npu-smi info反馈和nvidia-smi的体验差不少显示信息不全没有单卡利用率的历史曲线定位问题难度更大。统一管理多台算力服务器现在的最佳实践是用容器化方案把不同厂商的驱动和工具包都打进镜像里然后通过Kubernetes的device plugin做资源调度。这条路能走通但前期的工程复杂度确实不低。6.3 “说好的算力怎么波动这么大”还有一类客户比较心细他们会持续监测任务的训练速度发现有时候快有时候慢。这是GPU虚拟化和资源隔离的问题。在裸机租赁模式下一般不存在这个问题但如果是按容器或者虚拟机方式售卖算力底层排布会影响显存带宽、PCIe通道争用。我在这块吃过的亏是刚开始用虚拟化方式售卖的国产卡机器同一个客户的任务前后跑的吞吐差了20%以上后来改为裸机独占租赁才解决了这个问题。给同行的经验是国产GPU的算力资源池化技术目前不如NVIDIA成熟如果你的客户对训练效率敏感建议用整卡独占的方式出租不要为了追求出租率而引入复杂的虚拟化否则后续的投诉和运维成本会远超收益。7. 选型建议什么业务适合租国产GPU什么情况别碰7.1 适合的中小模型微调、推理部署、成本敏感型业务先说不劝退的场景。第一类是中小模型的微调Qwen1.5-7B、ChatGLM3-6B、Llama2-13B这类参数量在10B以下的模型LoRA或全量微调在昇腾910B上虽然慢一些但能跑而且跑得完。对于做垂直行业应用的团队拿国产卡做训练不仅能省预算还能避开NVIDIA卡缺货的排队焦虑。第二类是纯推理部署尤其是不需要高并发的内部工具、私有化知识库。把模型部署在国产卡上并发量控制在个位数到十几体验差距不大成本能省三分之一。第三类是预算极敏感的科研场景比如毕业设计、学术实验国产卡按天租比NVIDIA卡便宜很多只要愿意折腾环境性能影响可控。7.2 不合适的大模型预训练、高并发推理、超长序列任务不建议用国产卡做什么呢第一是大规模预训练。训练千亿参数模型通信开销和集群稳定性要求极高NVIDIA的NCCLInfiniBand方案成熟度遥遥领先国产卡在万卡集群的稳定性和通信效率上还有很大差距。第二是高并发在线推理。上面提到过单卡并发30往上国产卡的时延和吞吐劣势就会被放大需要双倍卡数才能撑住成本反而没优势。第三是超长序列任务。国产卡在attention算子和显存管理上还有优化空间遇到长上下文任务比如跑128K上下文的大模型容易出现显存溢出或效率显著下降的情况。7.3 采购和租赁前的三项硬指标不管你是想采购还是想租赁国产算力我都建议先看三个硬指标第一你的代码在目标模型上完整跑通一遍包括训练和推理两个环节都有日志输出确认生态兼容性合格第二供应商能提供7×24小时的技术支持国产卡环境问题多没人响应会把你逼疯第三合同里写清楚性能兜底条款比如“保证单卡推理吞吐不低于XX”或“训练任务连续运行时间不低于XX小时”避免用的时候才发现货不对板。我在实际经营中越来越确认一点国产GPU不是能不能用的问题而是“谁来用、用它做什么”的问题。目前它正在从“实验室玩具”走向“生产工具”的拐点上生态成熟的每一小步都能带动租赁市场新增一批客户。最后分享一个小技巧如果你租的国产卡遇到性能异常别急着怪硬件。先用厂商自带的profiling工具比如昇腾的msprof把算子级别的耗时数据拉出来找耗时Top10的算子基本就能定位到是算子的实现效率问题还是显存拷贝的瓶颈。我在实际故障排查中用这个方法解决了不少疑难杂症比盲目重装环境高效得多。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价