资讯动态

端侧AI推理芯片定制化:从架构设计到模型部署的完整实战解析

发布时间:2026/9/24 9:10:42 来源:尧图企业网站定制
1. 项目概述一台“移动的推理大脑”是怎么炼成的这两年关注AI芯片的人大概都有同一个感受大模型跑在云端已经不新鲜了真正的兵家必争之地正在往端侧迁移。手机上的语音助手、车里的智能座舱、工厂里的视觉质检设备、甚至你家里那个摄像头都需要本地跑推理。但问题在于端侧的场景千差万别有的要超低功耗有的要极低延迟有的要同时跑好几个模型通用芯片很难一碗水端平。这个背景下去看淬思科技完成的过亿融资就非常有意思了。创始人是复旦博士潘鸿洋做的方向不是通用的AI加速芯片而是针对不同端侧场景定制专属推理芯片。这个“定制”两个字正是整个项目最核心的差异点。简单说他们不是想做一个什么都跑的万能芯片而是根据具体场景的需求把架构、算力、内存、功耗全部按需设计。这个思路在业内其实讨论了很多年但真正把公司做起来、拿到大额融资的并不多见。这篇文章想做的事就是把“端侧AI硬件部署”这条产业链上的关键环节拆开讲清楚为什么定制推理芯片在这个时间点成了风口芯片的架构设计到底在解决什么问题创业公司做这件事的技术门槛和商业逻辑是什么以及真正把模型部署到端侧硬件上时你会遇到哪些坑。如果你正在做AI硬件产品、做边缘计算方案或者单纯对芯片创业感兴趣这篇文章应该能给你一个比较完整的视角。2. 从“云上跑”到“端上跑”推理芯片的需求倒逼2.1 云端推理的四个“不够用”先说为什么大家拼命往端侧迁移。最直接的原因就是云端推理在四个维度上越来越不够用。第一个是延迟。你调用云端大模型接口网络往返一次至少几十毫秒遇到弱网环境直接飙升到几百毫秒。可工业质检、自动驾驶这类场景要求的响应时间是以毫秒甚至微秒来计算的。等到数据传到云端、算完、再传回来产线上的次品早就过去了。第二个是隐私。医疗影像、金融单据、企业内部文档这些数据是绝对不能出本地的。哪怕合同里写了“不上传”客户心里那道坎也过不去。端侧推理能保证数据从头到尾不出设备这在合规上的价值有时候比性能更重要。第三个是成本。大模型API按token收费短时间跑一跑还行要是设备7×24小时不间断调用一年下来的费用可能比设备本身还贵。端侧推理把算力一次性买到手后续的边际成本几乎为零。第四个是稳定性。工厂车间、野外基站、移动车辆这些场景的网络环境远比办公室恶劣。完全依赖云端的方案一旦断网就全线瘫痪端侧算力在关键时刻就是保底方案。这四个问题叠在一起结论就很清晰了在推理这个环节算力正在从数据中心向设备边缘迁移。但迁移不是把云端的芯片缩小放到设备里那么简单这就引出了下一个问题。2.2 为什么通用芯片搞不定端侧很多人会问现在的手机SoC不是已经带NPU了吗高通的、联发科的、苹果的不是都能跑AI吗为什么还需要专门的推理芯片公司这里要分清两个概念通用AI能力和场景化AI能力。手机SoC里的NPU确实能跑AI但它要兼顾拍照、语音、游戏等各种负载不可能为某一个特定场景做极致优化。结果是每个场景都能跑但每个场景都不是最优解。我们用功耗来举个例子。一颗旗舰手机SoC的AI算力可以达到几十TOPS但跑满的时候功耗要奔着5瓦甚至10瓦去。对于手机来说这个功耗可以接受因为电池大、散热条件好。但你在一个纽扣电池供电的温湿度传感器上试试看或者在只有被动散热、整机功耗预算只有1瓦的工业设备上试试看通用芯片直接出局。再举个延迟的例子。通用NPU的调度机制比较复杂从数据进入神经网络到推理结果出来中间要经历驱动加载、算子分派、内存搬运等一系列环节。在实时控制类场景比如机器人避障、无人机视觉导航里这种不确定性是致命的。而专用推理芯片可以把整个数据通路做成硬流水线从传感器数据进来到控制指令出去延迟做到完全可预测。还有一个很实际的问题内存带宽。做AI的人都知道算力只是纸面参数真正决定实测性能的是数据能不能喂得饱计算单元。通用芯片的内存带宽是给多类应用共享的在某个特定模型上可能只能用到带宽峰值的两三成。而定制芯片可以把片上缓存、访存调度、数据复用全部按目标模型的算子特征来设计同样水平的算力实测吞吐能翻好几倍。所以“定制”这个词不是营销话术它要解决的是通用方案在功耗、延迟、内存带宽三个维度上与端侧需求的结构性矛盾。淬思科技做的本质上就是把“按需设计”这件事产品化、工程化。3. 定制推理芯片的设计逻辑与核心难点3.1 从算法到硬件的“翻译”过程如果你完全没接触过AI芯片设计可以用一个类比来理解算法工程师写出来的神经网络模型是一道复杂的菜谱芯片是厨房里的一整套设备而定制推理芯片就是按照菜谱的具体要求重新设计这间厨房。通用芯片的道理是“厨房设备样样齐全谁来都能做菜”但每道菜的效率都可能不是最优。定制芯片的逻辑是“既然我主要就做这几道菜那就把灶台、切菜台、餐具柜全部按照这几道菜的操作流程来布局”。这个“主要针对的模型集合”在业内叫“目标负载”。淬思这类公司做定制推理芯片第一步就是定义目标负载。比如你主要跑的是端侧大语言模型那你的核心算子就是矩阵乘法和注意力机制如果你主要跑的是计算机视觉模型核心算子就是卷积和池化。不同的算子集合对应的数据流模式完全不同。这带来一个很重要的设计决策到底要不要在芯片里放一个“可重构”的加速器来兼容多种模型还是干脆做一个接近ASIC的半定制方案这里存在一个典型的三角权衡通用性、性能、开发周期。ASIC方案性能和能效最优但一旦模型结构变了硬件可能就废了纯可重构方案灵活但芯片面积和功耗会显著增加。我看到的行业主流方案是“软件定义硬件”先确定目标场景里未来一到两年会用到的模型结构把必备算子集合摸清楚然后围绕这些算子设计专用数据通路但保留一定的可配置性比如变换算子的拆分方式、调整数据缓冲区大小给后续模型演进留出余地。这考验的不是硬件一个维度而是软件和硬件的协同能力。3.2 算力、带宽与功耗的三角平衡芯片设计中最核心的一件事就是平衡算力、带宽、功耗三个指标。定制推理芯片不是单纯追求算力高而是追求在特定功耗包络下把“有效算力”做到最极致。有效算力怎么理解芯片的TOPS是理论峰值但实际跑模型的时候计算单元经常在那里空转因为数据没有按时送达。这种等待就是“算力浪费”。定制芯片的优化重点就是把计算单元和内存系统之间的数据流转做到 предельный高效。这里面有几项关键技术。一是数据复用机制。以卷积计算为例同一块输入数据会被多个卷积核反复使用。如果每次用都去内存里重新读一遍带宽开销巨大。定制芯片会在片上做专门的缓冲区和数据复用调度器让同一份数据在片上被反复用多次每用一次对应的内存访问次数就少一次。二是精度调度。端侧推理普遍不用FP32而是用INT8、INT16甚至混合精度。定制芯片的厉害之处在于它可以根据不同层的敏感度动态选择不同的量化精度而不是全模型统一一个精度。在不太影响模型精度的前提下把计算量和带宽需求降下来。三是内存带宽匹配。芯片设计前端架构师会先计算目标模型的访存量再倒推片上存储容量和外部存储带宽的需求。这一步做不好后面就是灾难。我见过很多花了大力气堆算力的芯片最后因为带宽配不上实测性能只有峰值的20%这类案例在业内并不罕见。3.3 编译器定制芯片的“隐形战场”说到芯片大多数人第一反应是硬件但在定制AI芯片里编译器的重要性一点都不比硬件低。硬件只是提供一个计算平台真正让模型跑得高效的是编译器将神经网络转换为芯片指令集的方式。我举个例子某模型里有大量矩阵乘法芯片计算单元支持多级流水线。编译器需要做的事情是把大矩阵拆成小矩阵块把每一块的加载、计算、存储排列成流水线操作。排列得好计算单元几乎没有空闲排列不好计算单元一直都在等数据。同样的芯片、同样的模型不同编译器的优化效果可以差出数倍。这是很多芯片公司早期容易忽视的地方。硬件团队把芯片做出来了但是编译器只有一个初版能跑模型的实测效率一塌糊涂。于是从用户视角来看这颗芯片的实际能力根本达不到纸面参数所说的水平。淬思这类面向端侧场景的芯片公司在编译器上的投入通常不小。因为端侧模型相对固定、数量有限编译团队可以做“针对性的算子库优化”而不是去做一个通用的编译框架。这种“少而精”的打法反倒比通用编译器更容易达到极高的利用率。3.4 软硬协同的另一层模型协同设计还有一个有趣的趋势是模型训练阶段就把目标芯片的硬件特性考虑进去而不是等模型训完了再去做适配。过去大家普遍是“先有模型再适配芯片”模型的算子尽可能多样化自适应不同硬件。但现在做定制芯片反过来可以做“模型与硬件协同设计”。比如你在设计芯片时就明确未来要支持的模型性能边界训练团队可以针对性地调整模型结构把某些算子在模型层面替换成硬件更高效的算子或者把模型的精度需求调整到与芯片的数据位宽匹配。这种协同会让整个系统的能效提升非常可观。但它的前提是芯片公司与模型团队深度绑定甚至能够直接控制模型演进的节奏。这也是定制推理芯片创业公司的天然优势团队小、决策快模型和硬件可以在一个团队内迭代。从整个行业来看这一趋势还在早期但已经有一些端侧AI硬件部署实践证明了它的价值。未来谁能把“模型训练-模型压缩-芯片设计-编译优化”这条链路捏成一个整体谁就有可能在端侧AI的赛道上建立真正的壁垒。4. 从融资到落地创业公司的路径选择与商业化思考4.1 为什么是“从小场景到大场景”芯片创业向来是重投入、长周期的赛道能拿到过亿级别融资投资者看重的不只是技术本身更是商业化路径是否清晰。淬思科技选择“不同端侧场景定制专属推理芯片”这条路线在我看来有一个非常务实的商业逻辑先切那些需求明确、痛点强烈的细分场景做透一个再扩下一个。举几个例子。智能座舱里的语音交互、视觉监测、驾驶员状态识别这些任务对端侧算力的需求是真实且刚性的。而智慧安防摄像头、工业质检设备、边缘AI盒子这些产品的共同点是需要一定算力、对成本和功耗敏感、且对方案定制化有天然需求。对这些场景做定制芯片芯片公司能提供的价值不是“一颗芯片”而是“一套更优解”更低的功耗、更好的性能、更小的面积、更低的成本。相比之下如果一上来就想做一个能覆盖所有场景的大而全芯片反而容易陷入两条战线同时作战的困境既要和海思、高通这些巨头拼通用算力又要在具体场景的优化上面对英伟达的成熟生态。对于初创公司来说这基本没有胜算。4.2 产品落地过程中的三个关键选择第一是卖芯片还是卖方案。纯卖芯片的商业模式对创业公司来说往往很难赚到钱因为芯片本身毛利率有限而且客户用芯片还需要自己搭建软硬件环境这对大多数终端厂商来说门槛太高。更现实的路径是提供“芯片开发板参考方案工具链”客户拿到手能在一到两个月内完成产品原型验证。这类打法对客户来说价值更大也更容易推动深度合作。第二是自研还是做IP授权。定制推理芯片市场里也分两种公司一种直接做独立芯片对外销售另一种把芯片内核作为IP授权给其他芯片厂商让对方在自己的SoC里集成AI推理能力。后者的门槛更高因为你的IP必须足够成熟、足够好用能让客户像搭积木一样把它嵌进自己的整体芯片设计流程中。这两者并不互斥但初创团队在资源有限的情况下一般得先选一个主攻方向。第三是自建生产还是Fabless模式。从行业现状来看绝大多数AI芯片创业公司都采用Fabless模式即只做设计和验证生产交给晶圆代工厂。好处是固定资产投入小、可以轻资产运营但挑战在于对供应链的管控力不足。尤其在产能紧张或先进制程资源向头部玩家倾斜的时候小公司的产能不能被充分保障。这是一个长期存在的行业风险需要公司在业务层面留出足够的缓冲。4.3 端侧AI硬件部署的选型决策框架如果你并不是芯片从业者而是做AI应用和端侧设备的开发人员那么在“端侧AI硬件部署”这条路线上最关心的其实是我要不要为了某个产品去定制一颗芯片还是先用现成的方案这个决策没有一个放之四海而皆准的答案但可以参考一个简单的框架权重分配取决你的业务偏重。产品预期的年出货量是首要指标。如果年出货量在百万颗以下定制的意义不大因为分摊研发成本后单颗成本反而更高。而如果年出货量达到千万颗级别定制芯片带来的成本优势和性能优势就非常可观了。功耗与性能的约束是另一个指标。如果你的产品只需要在3瓦的功耗包络里跑几十毫秒的推理任务那通用市场芯片就能轻松搞定不用自己折腾。但如果你需要在2瓦以内同时跑实时视觉和语音识别通用芯片往往在能效上无法满足需求这时候定制就是刚需。生态依赖度同样不容忽视。如果产品重度依赖CUDA/OpenVINO等成熟软件栈完全自研就等于放弃了生态红利软件开发周期会变得非常长。可如果你使用的是标准化、开源的AI框架模型也从公开渠道获取那么切换到定制芯片的软件成本反而没那么高。综合来看端侧定制推理芯片并不是所有场景的答案。但对于那些出货量大、功耗要求苛刻、算法相对固定的产品定制方案的综合收益会明显超过通用方案。这就是这类公司切入市场的切入口所在。5. 端侧模型部署的工程化陷阱与实操要点5.1 算子替换与图优化模型转换不是“一键完成”真正把一个训练好的模型部署到端侧推理芯片上第一步就是模型转换。但这一步远不是“导出一个ONNX文件再加载一下”那么简单。实际过程中你可能遇到大量算子不支持、精度不匹配、数据排列不一致的问题。这时候就需要做算子替换和图优化。我见过一个实用的做法是先用profiler工具跑一遍模型在目标芯片模拟器上的算子耗时分析。把耗时占比最高的几个算子揪出来逐个判断是否有硬件支持的高效替代算子。比如把一个普通卷积替换成深度可分离卷积加逐点卷积可能整个模型的速度直接快了两三倍而精度损失几乎可以忽略。这就是典型的图优化价值。很多初学者会把模型当作“白盒”不做改动地部署结果性能惨不忍睹问题往往出在这一步。正确的方式是先在Linux机器的模拟器上跑通模型确认算子的计算结果是正确的再固化到设备里。每一步之间都要留出充分的验证环节。5.2 内存规划与内存生命周期管理端侧设备的RAM通常比云端服务器小得多很多边缘AI设备总共只有几十到几百MB可用内存。而AI模型在推理过程中需要存储中间特征图、权重数据、临时缓存等内存规划稍有不慎就触发OOM导致程序崩溃。实操中要做的是先分析模型每一层的中间张量大小预测峰值内存占用。然后用内存池复用机制把生命周期不重叠的中间缓冲合并成同一块物理内存空间。这步看起来很基础但在大模型普及的今天变得尤其重要因为Attention层的KV cache会随着序列长度增加而占用大量内存不做好规划模型根本推不起来。我还踩过另一个坑有些芯片平台的内存带宽有限同一块DDR既被CPU核访问又被NPU访问两者互相竞争导致NPU的有效吞吐大幅下降。解决办法是把计算密集型的任务尽量放在NPU上CPU只负责数据搬运和控制流然后利用DMA把数据搬进搬出。听起来简单但真正把DMA调度做好的项目我接触下来并不多。5.3 功耗管理动态电压频率调节的重要性端侧AI硬件的功耗问题是结构性的芯片面积小、散热空间有限发热到一定程度就会触发降频保护实测性能瞬间下降一大截。应对策略有三个层面。第一是芯片设计层面做功耗感知调度把任务根据计算强度映射到不同的计算单元、不同的工作频率上实现“按需算力”。第二是系统层面的动态电压频率调节策略可以把CPU、NPU、GPU的频率绑在一起调也可以独立调频。实际经验是独立调频更灵活能把功耗控制得更精细。第三是软件层面的推理调度如果业务允许可以把推理任务分散在不同时间片执行而不是集中在同一时刻这样整体的功耗峰值就会平滑很多。这些工作很多客户在合作初期不会想到真正批量部署后才会发现同样的芯片别人能稳定跑出80%的算力自己只能到50%差距基本就出在功耗和散热管理上。5.4 端侧AI模型工具链的选型建议做端侧AI硬件部署的朋友还有一个避免不了的课题怎么选择推理框架和工具链。如果你用的是通用SoC现在基本可以闭眼选几个主流推理框架之一它们生态成熟、算子覆盖率高。如果你用的是定制AI芯片那么厂商自带的编译器、运行时和推理框架基本就是你唯一的选择。这时候要重点考察的是算子覆盖度、中间表示标准性和性能分析工具的完善程度。我的一个经验是一定要把性能分析工具的易用性放在很高的优先级——调试效率决定了你的开发生命周期长短等价于你的项目成本。另外尽量选择支持ONNX或者开放式神经网络交换标准中间表示的方案这会在模型迭代的时候省不少力气。不然每次模型结构一改整个工具链都要适配一遍这种痛苦我亲身经历过。以下可以整理成一张速查表方便做技术选型时参考考虑维度通用SoC方案定制推理芯片方案性能/功耗比中等高优于通用方案开发周期短生态成熟相对较长需厂商工具链支持单位成本出货量小时较优出货量大时显著更优定制化空间有限高可深度适配场景对团队要求较低较高需软硬协同6. 场景扩展与值得关注的信号6.1 典型落地场景的覆盖顺序我个人判断未来端侧推理芯片会沿着“高确定场景 → 高通用场景”的路径逐步渗透。最先落地的是那些算法相对固定、需求长期稳定的专用场景。智能座舱、工业质检、智慧医疗影像等都有这样的特质。其后会进入AI PC、智能家居中控这类综合场景。再往后随着端侧大模型变得越来越小、量化和蒸馏技术越发成熟手机之外的各种移动终端也会逐步导入定制推理能力。以智能座舱为例其特殊之处在于车规级芯片对稳定性、安全性要求极高一旦通过验证替换成本和意愿都会很低。这对芯片公司来说既是高门槛也是高壁垒只要进了供应链合作关系通常能维持很长时间。再看边缘AI盒子这种产品其硬件形态非常分散每家的接口、功耗、尺寸要求都不一样。通用方案往往需要外挂独立加速卡既费钱又费空间。定制方案可以把推理能力直接做到主控芯片里在成本、面积、功耗上都有明显优势。6.2 端侧大模型是下一波催化剂从技术的角度说端侧大模型的兴起可能会把这波定制推理芯片的需求推到新的高度。过去端侧AI主要跑的是小的CNN模型计算量有限、结构固定。现在大模型通过量化、剪枝、蒸馏之后已经能塞进几百MB甚至几十MB的空间里了能在手机、PC、智能汽车上跑起来。但这类模型的访存带宽需求极大尤其注意力机制的KV Cache操作对SRAM容量的要求远高于卷积模型。通用硬件跑端侧大模型面临的主要问题就是内存带宽和片上缓存吃紧。而定制推理芯片之所以能应对核心在于能够围绕自注意力算子设计专门的数据流和片上存储结构。一个很典型的案例是近年手机端大语言模型的推理速度。即便只是跑7B参数级别的量化模型对内存带宽和缓存命中率的要求也非常苛刻通用NPU往往只能跑到每秒几到十几个token。定制芯片通过“大缓存高带宽”设计能把速度提升到每秒几十甚至上百个token这个体验差异对用户来说几乎是决定性的。6.3 开源IP和小芯片带来的新变量还有一个趋势值得关注开源硬件IP开放指令集架构生态和Chiplet小芯片技术的结合正在显著降低芯片创业的门槛。过去一颗SoC从设计到流片需要投入上亿美元现在通过购买成熟的CPU、GPU、总线等IP再结合自研NPU模块可以控制在数千万人民币级别。这对像淬思这样的创业公司来说是一条很有利的路径不必从零开始造所有模块把核心精力集中在自研NPU和数据通路上就能做出一颗有差异化的芯片。小芯片技术带来的另一个好处是场景适配的灵活性。你可以先做一颗通用主控芯片再根据不同的终端场景组合一颗与之匹配的NPU小芯片。这样既能快速切入多个细分市场又不会因为某一条产品线失败而全盘皆输。7. 复盘这个项目给端侧AI从业者的三点启示做完这个项目的拆解我最强烈的感受是端侧AI推理芯片这赛道不缺理论缺的是把理论转换成产品的工程能力和商业路径。潘鸿洋和淬思科技这套“按场景定制”的打法至少在方向上解决了一个核心矛盾——端侧场景高度碎片化通用芯片的全部优势在碎片化市场会大打折扣而定制芯片正是从碎片化中找 “单点最优” 的解法。第一点启示是端侧AI硬件部署真正难的不是芯片本身而是软硬协同。模型、编译器、芯片、工具链任何一环拖后腿整个系统的表现都要大打折扣。这也是我一直在强调编译器价值的根本原因。第二点启示是在碎片化市场里与其做大而全的平台不如先做深几个核心场景。端侧AI的需求极其分散但每一个细分场景里都存在一批“愿意为更高能效付费”的客户。只要你能在其中一个场景里建立起口碑后续的复利效应会非常明显。第三点启示是过亿融资只是起点量产交付才是真正的试金石。芯片创业的周期极长从流片到量产再到客户导入至少要两到三年。真正决定企业生死的是能否在第一颗芯片量产之后快速完成性能验证、软件适配和市场的正面反馈闭环。最后再分享一个我个人的实操感触每次做端侧部署的时候我都会先花时间把目标场景的用户预期量化成具体指标比如“功耗必须低于2瓦”“首token响应必须小于200毫秒”“模型精度损失不超过1%”。这些指标越清楚后面选芯片、做软硬件设计时决策就越果断也越不容易被厂商的PPT参数带偏。这个习惯放到任何端侧AI项目里都适用。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价