资讯动态

30亿参数跑在手机上,端侧AI的‘iPhone时刻‘到了吗?

发布时间:2026/9/6 2:04:24 来源:尧图企业网站定制
上周骁龙峰会我连着看了两天直播。说实话最开始没抱太大期待——芯片发布会嘛无非是算力提升多少、能效优化几个点。但面壁智能拿出 AgentCPM 的时候我愣了一下。一个 4B 参数的 GUI Agent能看懂手机屏幕能理解你的自然语言指令然后在手机上自动操作 App——而且完全跑在本地不联网。这不是实验室 demo。面壁和高通现场演示了对着手机说帮我在大众点评上找一家附近评分最高的川菜馆AgentCPM 自己打开点评、输入搜索、筛选排序、点进详情页一气呵成。全程在骁龙 8 至尊版上跑延迟肉眼可见地在 1-2 秒以内。这个事的冲击力在于端侧 AI 终于从能跑模型进化到了能干活。端侧 AI 的堆料元年先列几个数据感受一下 2025 年下半年端侧 AI 的节奏。9 月 25 日骁龙峰会高通发布第五代骁龙 8 至尊版Hexagon NPU 算力 75 TOPSAI 性能比上一代提升 37%能效提升 16%。这个 NPU 能跑 220 tokens/s 的端侧推理速度——什么概念你在手机上打开一个 7B 的对话模型回答速度比打字还快。同一天荣耀宣布 Magic8 系列首发搭载这颗芯片搭载端侧 30 亿参数大模型。荣耀讲了一个场景YOYO 智能体支持一语跨端搜索你说帮我找一下上周二群里发的那张机票截图它能在本地索引里找到不用上传云端。两天后苹果在 Hugging Face 上开源了 FastVLM 和 MobileCLIP2。FastVLM 是苹果专门为端侧设计的视觉语言模型能在 iPhone 上实时做视频描述和物体识别而 MobileCLIP2 则是对 CLIP 的端侧量化优化——图片理解能力不降级但推理延迟降到 10ms 级。再往前推5 月份面壁和清华就开源了 AgentCPM-GUI8B 参数已经被吉利银河 M9 用在了车载智能座舱里。一个趋势已经很清楚了2025 年下半年端侧 AI 从有没有变成了能不能用。各家不是在比谁的模型参数大而是比谁的模型能在手机上跑出真效果。为什么是现在三个技术推手端侧 AI 喊了两年为什么今年下半年突然爆发了我自己的判断是三个东西同时到位了。第一芯片算力到了临界点。75 TOPS 是什么水平两年前 A17 Pro 的 NPU 算力是 35 TOPS翻了不止一倍。而且这次不是单纯堆算力——Hexagon NPU 的架构做了大改标量加速器从 8 个增加到 12 个向量加速器从 6 个增加到 8 个。这意味着它不仅能跑更大的模型还能同时跑多个模型。举个例子你手机上的语音助手之前需要先唤醒跑一个小模型、再语音识别跑一个 ASR 模型、再语义理解跑一个 LLM、再生成回复再跑一遍 LLM。这四个步骤在旧架构上只能串行但在新 NPU 上可以并行整机延迟从秒级降到百毫秒级。第二小模型的能力密度够了。面壁智能一直在推密度定律——每单位参数能承载的智能密度在持续提升。MiniCPM 从 1.0 到 4.0参数规模没怎么涨2B → 8B但能力密度翻了不止一个数量级。我实际跑了一下 MiniCPM 4.0 8B 的稀疏注意力版本用 LlamaFactory 在自己的 MacBook 上做了部署测试。MMLU 得分 70.2超过了同参数规模的 Qwen3-8B 和 Gemma 3-12B。8B 的模型能在这个水平上已经足够覆盖日常对话、代码生成、文档理解这些场景了。第三Agent 框架让能跑变成能用。AgentCPM 最让我觉得有意思的地方不是它的模型本身而是它的 RFT推理前思考训练策略。它不是在手机上跑一个通用的多模态模型然后用 prompt 去引导它操作 App——它是在训练阶段就专门针对 GUI 操作做了强化学习。具体来说AgentCPM 的数据集包含了 55k 个中文 Android App 的操作轨迹覆盖 30 多个主流 App合计 470k 步操作。训练时用三阶段 pipeline先做 grounding 预训练让模型学会看到按钮和输入框再做 SFT学会规划操作步骤最后用 RFT 强化学习学会在出错时自我纠正。这个三阶段就是它和普通端侧模型最大的区别——它不是为了回答问题训练的而是为了操作手机训练的。端侧 Agent 的四个现实问题但聊完这些我想泼点冷水。因为我自己试过在手机上跑端侧模型踩过的坑不少。第一个问题功耗。骁龙 8 至尊版发布会上说 AI 能效提升 16%这是个好数字。但提升 16%的意思是跑一个大模型推理芯片功耗从 5W 降到了 4.2W——对手机来说还是不可忽视的发热源。如果 AgentCPM 持续执行任务比如连续操作 5 分钟手机背面温度能不能控制在 40 度以下目前没有看到实测数据。第二个问题多任务切换。现场演示的 AgentCPM 是一个任务到底——打开点评、搜索、筛选、查看详情。但现实场景是你正在用微信突然想查个东西Agent 得先记住当前的应用状态操作完再恢复。这个上下文切换在端侧模型上怎么做目前还没有看到很好的方案。第三个问题OTA 更新。端侧模型的好处是隐私坏处是更新慢。云端模型今天发现 bug明天就能修。端侧模型呢得等厂商发 OTA 包用户下载安装重启手机。如果 AgentCPM 在某个 App 更新后操作逻辑变了模型得重新训练。面壁说支持端侧模型的小版本更新但具体更新频率和更新包大小还没公开。第四个问题生态碎片化。荣耀的 YOYO 智能体跑在骁龙上AgentCPM 也是跑在骁龙上苹果的 FastVLM 跑在 A18 上联发科的天玑也有自己的 AI 引擎。端侧模型不像云端模型那样一次训练到处部署——每个芯片平台的 NPU 指令集、量化格式、内存带宽都不一样。模型适配成本很高。这些问题短期解决不了但反过来想它们也意味着端侧 AI 还有很多技术红利可以挖。端侧 AI 会怎么改变开发者的工作方式我猜接下来半年会有几个明显的变化。第一端侧模型会成为 App 的标配能力。就像几年前手机摄像头普遍支持 AI 美颜一样2026 年的 App 可能普遍会集成本地的小模型来做隐私敏感的场景——比如本地相册搜索、本地文档摘要、本地语音输入。这些功能以前用云端 API 也能做但端侧的好处是零延迟、不消耗流量、数据不出设备。第二GUI Agent 会让无代码变成无 App。AgentCPM 的方向如果继续走下去用户可能不需要点开 App 了——直接说一句话Agent 就帮你操作完了。这听起来很科幻但想想 Siri 刚出来的时候谁能想到现在人人都在用语音助手GUI Agent 的潜力可能比我们想象的更大。第三端侧 云端的混合架构会成为主流。不是所有任务都适合端侧也不是所有任务都适合云端。端侧跑轻量级的实时推理语音识别、图像分类、简单对话云端跑重量级的复杂任务代码生成、长文档分析、多轮推理。两者结合才是最优解。荣耀在骁龙峰会上提了一个概念叫混合 AI 架构我觉得挺精确的——端侧做感知 执行云端做思考 创造。问题是这个感知和思考的分界线在哪里目前还没有标准答案。说回 AgentCPM。面壁把 4B 参数的 GUI Agent 跑在手机上这件事本身的技术意义不在参数大小而在一个能在本地完成复杂任务的 Agent终于被验证了可行。但端侧 AI 是不是真的到了iPhone 时刻我觉得还差一口气。这口气在功耗优化、在多任务管理、在生态统一。不过方向上已经很清楚了——AI 正在从云端的神变成口袋里的工具。你现在用的手机里有端侧模型吗你更愿意用本地的还是云端的 AI 功能欢迎评论区聊聊。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价