资讯动态

CPU、GPU、NPU工作原理和区别

发布时间:2026/8/26 20:22:57 来源:尧图企业网站定制
大家读完觉得有帮助记得关注和点赞1. 核心术语CPU, GPU, NPU核心观点 在芯片总面积一定的情况下晶体管资源在控制逻辑单元和计算单元之间的分配决定了芯片的特性和用途。1.1 CPU - 复杂逻辑的控制大师面积分配 大部分芯片面积用于控制逻辑如分支预测、乱序执行、多级高速缓存。计算单元ALU/FPU占比相对较小。能力 逻辑控制能力极强擅长处理复杂、串行、多变的任务。单线程性能高但并行算力相对较弱。角色 系统的大脑和指挥官负责运行操作系统、应用程序的整体调度和复杂决策。1.2 GPU - 大规模并行的计算巨兽面积分配 绝大部分芯片面积用于构建海量的、相对简单的计算核心Streaming Processors / CUDA Cores。控制逻辑和缓存被大量核心共享相对简化。能力 并行计算能力极强逻辑控制能力弱。适合处理高度并行、计算模式统一的任务如图形渲染、科学计算、矩阵运算。角色 协处理器在CPU的指挥下负责完成计算密集型的“重活”。1.3 NPU / TPU - 专精定制的效率专家设计哲学 属于专用集成电路范畴的AI加速器。硬件电路直接针对神经网络的核心运算如张量运算、卷积、矩阵乘加、激活函数进行固化优化。能力 在其特定任务上相比通用处理器CPU/GPU具有压倒性的能效比和速度优势例如一个时钟周期内可完成数万至数十万次乘加运算。应用场景 手机、物联网设备、边缘计算等对功耗和实时性要求极高的场景。TPU Google的张量处理单元是NPU的一个著名实现。其设计目标与NPU高度一致。TPU vs. GPU 的经典比喻 [11]GPU 像一个博士生他能够快速解决各种复杂的数学问题通用并行计算能力强。TPU 像一个专门计算两位数字乘法的计算器它做这个特定任务的速度远超博士生且功耗极低但你无法用它来写论文。Google TPU芯片布局直观展示了其专用性黄色计算单元 占据了绝对主导的面积即庞大的矩阵乘加计算阵列。蓝色数据单元/ 绿色I/O单元 服务于计算单元的数据搬运。红色控制单元 面积最小逻辑极其简化负责调度固定的计算流程。1.4 小结融合与演进GPU 在保持通用并行计算的同时不断引入针对AI的专用硬件单元如NVIDIA的Tensor Cores专门加速矩阵运算。NPU 在保证极致能效的同时也开始增强其编程灵活性和对更多计算类型的支持。趋势 GPU与NPU呈现出 “双向奔赴” 的融合趋势旨在实现通用性与高效能之间的最佳平衡。2. DaVinci 架构统一架构覆盖全场景2.1 场景与需求分析不同AI应用场景对算力和内存的需求差异巨大设备端Device 功耗敏感算力需求通常小于10 TFLOPS内存要求小如手机、摄像头。边缘端Edge 中等算力与内存需求如边缘服务器、智能网关。云端Cloud 追求极致算力需求可达数百甚至数千TFLOPS需要大内存支持大规模模型训练和推理。华为的解决方案是采用统一的DaVinci架构通过 scalable 的设计以同一套核心架构覆盖从极低功耗到极高算力的所有场景。2.2 Ascend NPU 核心设计DaVinci架构的创新在于引入了 3D Cube 引擎作为矩阵计算的专用硬件。传统计算 标量Scalar、矢量Vector运算。AI核心 3D Cube 实现了大规模矩阵Tensor的并行计算极大提升了计算密度和效率。效果 在单位芯片面积或单位功耗下其AI计算性能相比传统的CPU和GPU架构实现了数量级的提升。3. 路线一NPU集成于手机SoCKirin系列现代手机是一个片上系统将CPU、GPU、NPU、ISP、基带等多种处理器集成于一颗芯片。3.1 Kirin 970 (2017) - 首秀搭载机型 Mate 10系列。意义 全球首款内置独立NPU的手机AI芯片。性能 在AI任务如图片识别上速度比CPU快25~50倍。3.2 Kirin 990 5G (2019) - 集成与进化搭载机型 Mate 30系列。NPU 集成达芬奇架构的NPU大核微核实现不同场景下的能效最优。SoC拓扑 典型的多核异构架构NPU与CPU、GPU、ISP等协同工作。关键参数工艺 台积电7nm EUVCPU 2xA76 2.86GHz 2xA76 2.36GHz 4xA55 1.95GHzGPU Mali-G76 MP16NPU 1个大核 1个微核3.3 Kirin 9000 5G (2020) - 巅峰搭载机型 Mate 40系列。工艺 台积电5nm代表了当时最先进的制程。NPU 采用2个大核 1个微核的设计AI算力再创新高。3.4 Kirin 9000s (2023) - 回归与突破搭载机型 Mate 60系列。意义 在美国制裁背景下的“王者低调回归”。工艺 据分析采用中芯国际N2等效7nm工艺。性能定位 虽在制程上略逊于Kirin 9000但实现了从0到1的突破具备强大的综合性能和AI能力。4. 路线二独立AI加速卡Ascend系列面向数据中心和企业市场提供独立的AI训练和推理卡。4.1 产品形态Atlas系列包括Atlas 200/300/500/800/900等是集成了Ascend NPU的加速卡、服务器或一体机。4.2 Ascend 310 (2019) - 推理主力定位 高效AI推理。架构 达芬奇架构 D-mini 核心。算力 FP16 INT8 算力分别达到8 TFLOPS和16 TOPS。对标 性能与能效对标NVIDIA T4 推理卡。4.3 Ascend 910 (2019) - 训练定位 高端AI模型训练。架构 达芬奇架构 Max 核心。算力 FP16算力高达256 TFLOPSINT8算力512 TOPS。工艺 台积电7nm EUV。对标 直接挑战Google TPU v3 和NVIDIA V100。集群能力 数千颗Ascend 910可通过高速互联构建AI计算集群如鹏城实验室的“鹏城云脑”提供E级百亿亿次AI算力。4.4 Ascend 910B (2023) - 持续迭代定位 Ascend 910的升级版是目前中国AI算力市场的关键产品。改进 在制程、架构、互联带宽等方面均有优化综合性能进一步提升以应对NVIDIA H800/A800等最新GPU的竞争。总结通过统一的达芬奇架构成功地将其NPU技术横向扩展应用于从极致能效的手机端到极致算力的云端的全场景。纵向深耕在手机芯片Kirin和AI加速卡Ascend两条产品线上持续迭代构建了完整的自主AI算力体系。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价