资讯动态

云厂商自研芯片:从AWS Trainium看算力竞争下沉

发布时间:2026/9/12 12:09:17 来源:尧图企业网站定制
9月12日科技日报发了一篇观察文章讲云服务商纷纷下场自研芯片算力竞争进入芯片定义时代。触发点是8月31日英伟达出资35亿美元认购联发科海外可转换公司债双方在AI基建、边缘AI、车用电子三个方向深度合作。而更值得关注的是文章里提到的一个事实据英国《金融时报》报道AWS自研Trainium芯片支撑的算力服务营收保持快速增长在其AI算力业务中的占比持续提升已经成为和英伟达GPU算力并行的核心产品线。云厂商造芯片不是新鲜事但自研芯片的收入能和GPU算力并列这个信号比以前强得多。一、云厂商为什么要亲自造芯片过去几十年云计算的玩法是通用芯片采购 软件层调度优化买通用GPU和CPU靠虚拟化把算力切给不同用户。这套模式能跑是因为通用芯片什么都能干。但大模型改变了需求形状。训练和推理的本质是海量并行的矩阵运算对并发度、时延、功耗都极其敏感。通用芯片为了兼容全场景保留了大量和AI计算无关的硬件模块在推理这种高并发场景下实际算力利用率据科技日报的表述不足七成。这就带来两个后果一是利用率低只能靠多买芯片来补成本降不下来二是高端AI芯片供给集中在少数厂商价格和交期都不由云厂商自己说了算。自研ASIC专用集成电路的逻辑就是把和AI无关的模块砍掉只保留需要的那部分电路。据科技日报报道定制化AI芯片在大模型推理场景下的能效比可以达到同级别通用GPU的1.5–3倍单位算力成本降低35%以上。AWS官方资料显示Trainium3单芯片提供2.52 PFLOPS的FP8算力配144GB HBM3e内存内存带宽4.9TB/s一台完整UltraServer最多集成144颗芯片合计可提供362 PFLOPS的FP8算力。二、变了什么没变什么变的是竞争的位置。以前云厂商比的是谁的软件调度做得细、谁的可用区覆盖广现在要比的是谁能从芯片架构开始做定制优化。竞争从软件层下沉到了芯片层。没变的是通用芯片不会消失。科技日报的观点很明确定制芯片和通用芯片长期是互补共存而非替代关系。ASIC只擅长特定的计算模式一旦业务模型变了、算子变了灵活性远不如GPU。这也是为什么AWS一边推Trainium一边仍然大量采购英伟达的卡。还有一件没变的事软件生态的门槛依然很高。CUDA攒了十几年的库和工具链是英伟达最深的护城河。自研芯片要真正被开发者用起来不止是把晶体管做出来还得把编译器、框架适配、算子库一层层补齐。这是慢功夫。三、对普通开发者和从业者意味着什么如果不在芯片行业这件事看起来离得很远其实有几个实际影响。第一推理价格还有继续下降的空间。云厂商自研芯片的核心动力就是降本成本降下来后一部分会传导到API和实例价格上。据报道AWS管理层曾表示Trainium已获得Anthropic、OpenAI等客户的多年期采购承诺并称其性价比较同类GPU有优势也有报道提到亚马逊正考虑把自研芯片业务对外开放销售。对开发者来说这意味着在选云、选实例时除了GPU型号有没有可用的ASIC实例也要放进比价清单了。第二供应风险会被分散。自研芯片让云厂商在供给侧多了一条腿地缘政策、产能波动带来的单一来源风险会缓解一些。对做长期容量规划的人来说这算是利好。第三选型要多问几个问题。看到算力便宜一半这类说法先别急着迁移要问清楚支持的算子覆盖度够不够训练和推理分别是什么表现迁移要改多少代码社区和文档齐不齐ASIC类的算力通常是性价比高但适配成本高只有在负载足够标准、规模足够大的时候才划算。小团队、实验性项目优先选生态成熟的通用方案更稳。四、一个容易被忽略的角度硬件之外真正的瓶颈往往在互联和存储。科技日报引用半导体媒体EE Times的数据在万卡级AI训练集群里网络通信开销已经占到总算力开销的32%。而存储这边算力性能大约每两年提升3倍存储读写速度年增速却不足20%算力单元等待数据的时间占比超过30%。换句话说芯片算得快不等于集群跑得快。通信墙和存储墙不解决单芯片再强整体效率也上不去。这也是为什么云厂商的芯片布局都是计算—通信—存储三条线一起推而不是只造计算芯片。结尾云厂商自研芯片这件事短期看是财报上的一个增长数字长期看是算力产业话语权的重新分配。对普通开发者来说最直接的体感可能只是账单上少了一点点。你在选云或者选实例的时候会考虑非英伟达的算力方案吗评论区聊聊。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价