资讯动态

高通GPU内置AI核心:端侧AI算力融合的关键一跃

发布时间:2026/9/9 18:48:54 来源:尧图企业网站定制
看到“高通给GPU装上专用AI核心”这条消息我第一反应不是“又升级了”而是“终于走到这一步了”。从早年的Hexagon DSP到后来的独立NPU再到今天把AI核心直接设计进Adreno GPU内部高通的算力架构终于和苹果的Neural Engine、英伟达的Tensor Core站到了同一个坐标系里。虽然三家路线各有侧重但方向已经非常一致AI算力不再是芯片里塞一个独立单元那么简单而是要跟每一块关键计算硬件深度绑定。这篇文章不打算复述新闻稿我想把它背后的技术逻辑掰开揉碎。不管你是做端侧AI开发的、搞安卓性能优化的还是单纯纠结要不要为新AI手机买单的普通用户我都会尽量用大白话把这件事讲清楚高通的这个新动作到底解决了什么问题跟苹果英伟达的账要怎么看以及接下来哪些变化会真正落到你的手机、你的开发环境和你的日常使用里。1. 高通把AI核心装进GPU这就是“算力融合”的标志性节点1.1 以前高通怎么做AICPU、GPU、NPU三件套协同先回顾一下高通的现有架构。在最新一次调整之前骁龙平台的AI任务通常不靠某一个硬件单打独斗而是由CPU、GPU、Hexagon NPU三部分协同完成。所谓高通AI Engine严格说是一个异构软件框架的名字它根据任务特点把负载分给不同的硬件系统级语音唤醒走Hexagon传感器处理和图像语义分割也走Hexagon部分矩阵运算会丢给GPU用OpenCL跑CPU则负责调度和一些通用逻辑。这个架构本身没有问题灵活性很高。但它的代价是任务拆解复杂尤其是当模型变大、推理连续化之后比如端侧跑一个大模型聊天机器人频繁地跨硬件搬运数据会非常消耗内存带宽和功耗。调度要反复判断哪些算子放GPU、哪些放NPU这本身也是一笔不小的开销。如果说以前这是高通AI的“常规形态”那么GPU内置AI核心就是把形态改掉了——大部分矩阵算力直接在GPU内部完成不需要跨硬件也不用在异构调度上浪费太多时间。1.2 GPU内部长出AI核心为什么说是顺势而为GPU从诞生那天起就是为大规模并行计算服务的而AI推理恰恰是典型的并行矩阵运算。两者在数学基础上高度同构区别只是精度要求、调度粒度和功耗模型不同。英伟达最早就看到了这一点所以在GPU内部加入了Tensor Core专门做低精度高吞吐的矩阵乘加。苹果虽然没有叫它Tensor Core但Neural Engine的很多设计思路也是类似处理。高通这一次把AI核心放进Adreno GPU本质上是同样的逻辑与其外挂NPU或者靠通用shader硬算不如让专业单元直接内嵌在GPU里让AI算子跑得又快又省电。从历史上看高通在GPU这条路上并不缺技术积累。Adreno GPU的能效比一直不错在移动端的图形性能排在第一梯队只是以前AI的“主力”更多被放在了Hexagon处理器上。现在把AI核心直接挪进GPU等于承认一个现实端侧AI不再是小打小闹的语音助手和场景识别而是已经演进到需要GPU级吞吐的大模型推理、实时图像生成和游戏画面增强。这些场景恰恰是NPU的主要算力覆盖不到的。1.3 它和NPU的关系互补不是替代这里我要给不少朋友的困惑先做个回答GPU里面有了AI核心高通是不是就不需要NPU了我判断短期不会。NPU在低功耗常驻场景里优势非常明显比如心率监测、语音唤醒、传感器融合这些任务系统已经把大量后台工作放在NPU上替换成本极高。GPU内嵌AI核心更擅长的是那些跟图形渲染缠绕在一起的AI任务比如游戏画面超分、降噪、实时背景虚化以及未来端侧大模型生成式推理这种高吞吐场景。两者各管一摊以后开发者在设计AI应用时可以灵活选择。真正的挑战在于软件抽象层如果上层框架能帮开发者自动挑选最合适的计算单元那这个架构的价值才会充分释放出来。现阶段只能说是开了个头后续软件能写成什么样比硬件本身更值得关注。2. 苹果Neural Engine、英伟达Tensor Core、高通AI核心三条路线怎么收敛2.1 苹果Neural Engine加上统一内存端侧体验最顺滑苹果从A11开始给芯片内置Neural Engine到现在的M系列芯片中间迭代了很多次但基本思路一直很稳定专门有一块硅片处理神经网络推理CPU和GPU各司其职。更关键的是苹果的“统一内存”架构CPU、GPU、NPU共享同一块物理内存和超高带宽模型推理时权重不需要从一个专用存储拷贝到另一个数据流动天然顺畅。软件层面苹果用Core ML加Metal Performance Shaders搭了一套从上到下的通路开发者把模型转成Core ML格式就能直接调用部署体验相对省心。也因为苹果同时掌控硬件、系统、框架它总能在第一时间把新模型和端侧能力结合起来真正推给海量用户。缺点是生态封闭离开Apple平台这套工具链就不再生效这意味着开发者在选型时几乎要被绑死在这套框架里。2.2 英伟达Tensor Core加CUDA护城河专注训练和云推理英伟达把Tensor Core放进GPU已经有了很长历史。从Volta架构开始Tensor Core伴随每一代架构更新不断迭代。训练大模型、云推理、专业图形渲染几乎都跑在英伟达这套方案上。相比苹果和高通英伟达真正的护城河其实不是某个硬件单元而是CUDA这个庞大的软件生态。我关注到最近圈内有不少讨论说CUDA Tile编程模型的更新可能会削弱英伟达的软件壁垒这确实是个值得聊的话题。GPU的编程抽象层越低、越贴近硬件第三方框架就越难脱离它自建一套。如果软件层次越来越开放未来异构计算确实有可能出现更分散的生态。但至少在今天英伟达在训练侧的地位并没有动摇。从PyTorch的安装配置到各种大模型推理优化默认“跑在NVIDIA GPU上”已经成了绝大多数开发者的第一选择。数据中心里GPU服务器运维、显存管理、多卡并行这些工程链路也早已围绕CUDA长出一整套成熟体系微调大模型这种典型工作负载目前基本跑不出这个圈子。2.3 高通补上GPU这一环才算真正形成端侧AI拼图高通之前的AI重心在Hexagon NPU主攻低功耗、常驻场景。而这次把AI核心放进Adreno GPU等于把端侧AI的“高吞吐”这一环补上了。手机上跑大模型不可能只靠NPU做大量连续推理GPU的并行性和带宽利用率更合适但GPU又要兼顾渲染如果AI负载全压在通用shader上功耗和性能都不好看。专用AI核心相当于在GPU里开了一条“AI快车道”渲染管线照常跑AI计算也有专门的高速单元。从此以后高通在移动端拥有两条AI高速通道一条是低功耗常驻的Hexagon NPU一条是高吞吐的GPU内嵌AI核心。两条通道配合CPU的调度理论上可以覆盖绝大多数端侧AI场景。这对应用生态会是实质性利好因为开发者再也不用为了“手机跑不动模型”而被迫全部丢到云端。不过话说回来做到这一步只是硬件层准备好软件生态能不能跟上才是决定这套架构上限的关键。三家路线放到一张表里看会清楚很多玩家AI核心形态软件关键盘重点战场苹果Neural Engine 统一内存Core ML、Metal自有生态端侧英伟达Tensor CoreCUDA、TensorRT、PyTorch训练、云端、专业图形高通GPU内嵌AI核心 Hexagon NPUQNN、SNPE、ONNX Runtime移动端、边缘设备这张表不是想分高下而是说明各家的侧重点确实不同。苹果吃定自有生态英伟达吃定开发者和数据中台高通吃定海量移动设备。现在高通把GPU AI核心这条线补齐了说白了就是要在“移动端AI”这个自己最熟悉的地盘上站稳脚跟。3. 这一架构最绕不开的三个技术关带宽、功耗、软件栈3.1 内存带宽决定端侧AI的上限先给行业里的朋友泼个冷水AI核心的算力数字做得再高如果数据喂不进去一切等于零。移动端的内存带宽跟桌面级显卡和数据中心加速卡差距巨大后者动辄上TB/s手机端的LPDDR带宽也就几十GB/s到上百GB/s这个量级。数据搬运河道的宽度决定了端侧大模型推理的吞吐上限。所以GPU内嵌AI核心的设计重点不只在加上多少TFLOPS更在于怎么把片上缓存结构设计好让权重尽可能复用、减少外存访问。换个生活化的类比工作站显卡像是大仓库配多台大卡车手机芯片则是小仓库配小推车你要让“小仓库”效率高就得让搬运工少跑腿、一次多扛几件。这也解释了为什么很多端侧优化最后都要落到“量化”和“剪枝”上——模型小了搬运次数自然就少了。桌面端很多玩ComfyUI的朋友已经在研究多GPU显存管理方案因为生成式AI对显存的需求大到怎么都不够用在移动端这个逻辑变得更加严酷统一内存就那么大模型能不能塞进去、跑得顺不顺全都卡在带宽和容量上。3.2 功耗墙AI核心跑起来散热跟不跟得上把AI核心放进GPU等于把更多热源聚集在同一块芯片区域。以前跑AI可以借用NPU热密度还在可控范围现在GPU既负责渲染又负责AI发热问题会被放大。我推测厂商的调度策略会往这几个方向走让AI核心尽量跑在低电压区间、支持任务抢占和动态降载、配合系统级温控调整频率。这里就要说到对开发者和评测媒体来说后续判断新一代平台的好用程度绝对不能只看AI跑分要看“满负载连续推理15分钟之后还能不能稳帧率”。凡是做过手机性能优化的朋友都清楚最影响体验的不是峰值性能而是持续性能。GPU跑游戏的时候玩家已经很在意散热了现在又叠加AI负载如果压不住温度那再多算力也只是PPT上的数字。这个道理放到AI场景也是一模一样甚至更敏感。3.3 软件适配硬件长出来了开发者能不能用上才是关键再硬的硬件最终都要靠软件来激活。高通现有的AI软件栈包括QNN、SNPE、跟ONNX Runtime对接的执行提供者、Adreno GPU SDK等。GPU内嵌AI核心之后最大的悬念是它能不能迅速融入这套现有的AI推理链路。开发者比较关心的通常是几个具体问题模型能不能一键转换到新核心量化支持哪些精度常见框架什么时候适配跑起来CPU能不能同时调度等等。如果这些问题的答案不清晰新架构就只是发布会上的漂亮数字。所以我的建议是大家现在就可以开始熟悉QNN的模型转换流程和ONNX Runtime的QNN执行提供者。新硬件的SDK一发布你手里的迁移能力立刻就能用上。另外做GPU驱动开发和定制内核的朋友也要提前跟厂商的开发文档保持同步这类底层适配往往是最容易被忽略、又最容易卡脖子的环节。4. 落地影响开发者、游戏玩家、AI应用圈的下一步4.1 端侧大模型推理会迎来一次效率革命最直接的变化会发生在端侧跑大模型这件事上。这两年大家应该见过不少跑在手机上的大模型Demo说实话能用但离“流畅好用”还有距离。瓶颈基本都在算力、内存带宽和能效这三点上。GPU内嵌AI核心解决的是“算力”和“能效”两个问题配合模型量化7B甚至更大参数的模型在手机上跑起来速度有望大幅提升。对于开发者这意味着一件事以后做端侧产品不再需要为了推理性能去跟NPU算子做艰苦搏斗。你可以把主力推理放在GPU的AI核心上NPU继续负责后台低功耗任务。像视频生成、AI绘画这些重负载任务也会因为新的GPU AI算力而有机会下沉到手机端而不是一直往云上推。以前只能在多GPU工作站上跑的视频模型和图像模型未来会有更多轻量版本跑在移动端整个应用形态都会随之发生变化。4.2 游戏超分、插帧会从“高级功能”变成“默认能力”桌面端大家已经习惯了DLSS这类AI超分带来的体验提升。移动端因为GPU算力和AI单元的限制超分实现一直不算成熟。AI核心入GPU之后移动端动态分辨率渲染、AI超分重建、插帧这些以前只能想想的能力会真正具备落地条件。对游戏玩家来说最直观的体感就是同样一个画面GPU可以先用较低分辨率渲染再用AI核心把画质提升到接近原生分辨率帧率反而更高、功耗更低。这种做法俗称“用算力换体验”在旗舰机上会有非常明显的感知。再加上AI核心不占用通用渲染管线资源画质和帧率之间不再是向左还是向右的二选一。等到适配成熟用户会发现很多游戏不用再靠“锁画质保帧率”过日子了。4.3 边缘计算和ARM服务器也会吃上红利高通也在布局PC、车机、边缘计算和ARM服务器。GPU内嵌AI核心之后虽然主要宣传口径在手机但底层的IP能力可以复用到其他产品线。边缘设备部署AI模型时不仅需要算力还要控制功耗和体积一个集成AI核心的GPU比外挂加速卡更符合边缘侧需求。不过这里也要客观一点在训练环节英伟达的地位短期依然稳固。边缘推理设备扩容、AI一体机增多会利好高通这类新玩家。但整体来看未来几年服务端训练生态还是不会轻易脱离CUDA体系。对ARM服务器感兴趣的朋友最好把精力放在“推理场景”而不是“训模型”场景这样踩坑的概率会小很多。5. 常见问题与我的几点判断5.1 这是不是又一个营销话术我判断不是。如果是宣传噱头完全可以把NPU的TOPS数字再吹一轮没必要在GPU内部做一次涉及架构与调度的大改。这种改动投入成本高、周期长而且会直接影响后续几代芯片的设计路线。厂商愿意在这个时间点做恰恰说明端侧AI负载已经从“锦上添花”变成了“刚需”。5.2 独立NPU会不会逐渐消失短期不会。NPU负责的低功耗常驻场景太多大到语音唤醒小到传感器处理都已经深嵌系统。而且现有软件栈大量针对NPU优化迁移成本不是一两个版本能解决的。长期看随着GPU AI核心能效比继续提高架构融合的趋势会越来越强但这个过程会非常慢至少未来五六代产品之内我们大概率会看到NPU和GPU AI核心并存的局面。5.3 新手机到底该不该等普通消费者不必特意等因为刚发布的新架构往往要等软件适配真正好用通常需要半年到一年。而且现在旗舰机的日常使用体验差距并不大AI核心带来的改变更多是在特定场景里体现。但如果你是AI开发者或者重度手游玩家可以先关注技术支持和开发者文档评估清楚生态进度再决定是否升级。5.4 会不会影响英伟达在AI市场的位置我认为会影响“边缘/移动端”这个细分市场但不会动摇英伟达在数据中心的统治地位。训练和庞大的CUDA生态不是一朝一夕能被替代的。高通这次的追赶更像是在补自己的短板顺便在边缘AI这个增量市场抢占有利身位。真要撼动英伟达关键不在硬件而在能不能养出一个足够开放的端侧AI软件生态。6. 我想给开发者的几条实操建议6.1 现在就开始熟悉异构AI工具链别等新硬件的SDK出来才开始学。QNN、ONNX Runtime的QNN执行提供者、OpenCL之外的GPU推理接口这些知识在当下就能用新硬件来了直接无缝衔接。我见过太多工程师在架构升级之后才临时抱佛脚结果适配工作量翻倍产品上线节奏被拖得很惨。6.2 把“模型量化”这件事真正重视起来端侧推理绕不开量化。无论是INT8还是INT4量化后模型体积和带宽占用都会大幅降低。跑大模型时显存或者统一内存的占用直接决定模型能不能塞进去这也是我在评估各种本地推理方案时第一个看的指标。模型先用量化压缩好等AI核心铺开你的应用立刻就能吃满新硬件的带宽红利。6.3 关注框架官方对高通架构的适配公告如果你平时用PyTorch可以留意它对高通后端支持的变化用ONNX Runtime的多关注QNN执行提供者的更新内容跑Llama.cpp的看看官方是否会针对Adreno的新AI核心做优化。框架适配是硬件能力到达开发者的最后一段路也是最容易被忽略的一段路。很多人硬件很强但应用跑不出效果问题多半出在这里。6.4 从“看跑分”转向“看持续体验”评测新架构时多跑连续推理测试、温度曲线、功耗数据和帧率稳定性把这些指标组合起来看。峰值算力只说明短时间很猛持续体验才能反映真实的芯片设计水平。这个习惯放到任何新硬件上都不会过时。跑分是给市场看的持续体验才是留给用户的。我自己在这个行业里做性能优化这么些年最大的感受是硬件架构的每一次大调整都伴随着一波生态洗牌。高通这次给GPU装AI核心向苹果英伟达看齐表面是产品迭代实际上是整个行业默认了“AI算力就该长在每一块关键芯片上”这件事。对搞技术的人来说别急着下结论说谁强谁弱先把工具链和工程能力备好才是正事。等到新架构的软件适配全面铺开你手里能调用的资源就是你最大的竞争优势。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价