资讯动态

旧手机变身AI智能体:大模型+自动化工具,月花12元复刻旗舰体验

发布时间:2026/9/20 19:48:57 来源:尧图企业网站定制
上个月我刷到一条消息某品牌主打 AI 智能体概念的新手机开启预售预约人数直接冲到 36 万。评论区吵成一片有人说这是下一代手机该有的样子有人质疑又是饥饿营销。而我当时的反应有点不合群——因为摆在桌上的那台用了快三年、边框掉漆、电池健康度只剩 78% 的旧安卓机早被我改造成了一个类似的东西它能听懂语音指令能跨应用帮我设闹钟、发消息、记笔记能在我下班前主动提醒取快递甚至能根据早上的日程自动生成当日简报。全部增量成本是每个月 12 块的 API 费用。这篇文章不是来论证厂商在割韭菜的也不是劝你别买 AI 智能体手机。我想做一件更实在的事把所谓AI 智能体手机的卖点彻底拆开告诉你背后到底是什么技术在起效然后给出一套我本人跑了两个多月的低成本复刻方案。看完你至少能回答一个问题那 36 万人抢的东西对我来说到底值不值。1. 36万人抢的AI智能体手机核心卖点拆开无非三块积木1.1 厂商不说的秘密这就是大模型 系统权限 自动化AI 智能体手机铺天盖地的宣传里高频词永远是系统级 AI跨应用操作主动服务全程语音。听起来非常科幻可落到技术实现层面翻来覆去逃不开三块积木。第一块是大模型的意图理解能力。所谓用自然语言操控手机本质是让 AI 听懂明早 8 点提醒我开会这句话并把它拆解成创建提醒、时间明早8点、内容开会。这个动作靠的是手机里塞了一个云端或端侧的大语言模型跟机器上焊的是哪颗芯片关系不大。哪怕是三年前的旧手机只要能发起一个 HTTP 请求就能获得同样的听懂人话能力。第二块是系统权限和自动化工具。AI 听懂之后总得动手干活跨应用操作依赖的是系统级助手协议、无障碍服务、快捷指令、剪贴板、通知栏权限这些管道。说得直白点就是让 AI 能替你点屏幕、填表单、调起 App、发送内容。这套东西在 Tasker、快捷指令这些工具里已经存在很多年了并不是新发明。第三块是场景感知与主动触发。所谓主动服务靠的是日历、位置、WiFi、时间、通知事件这些信息的联动。到了某个点、进了某个区域、收到某一类通知就触发一条自动化流程。这同样不是新东西很多自动化玩家十年前就在玩了。三块积木拼起来就是一台 AI 智能体手机的核心体验。厂商花了很大力气把它们打磨成软硬一体的产品但如果你只看功能上有还是没有那差异就被大大压缩了。1.2 为什么这个组合能卖上万块单独做却不神秘厂商把这三样东西封装成一个产品当然有不可否认的工程价值。端侧模型、安全沙箱、系统级 API、售后生态每一环都要投入大量研发体验和稳定性也确实比自己拼装强。可换个角度看发布会上一页页 PPT 演示的场景——语音设提醒、跨应用转发、自动生成摘要、主动日程建议——你在旧手机上用一个十几块的 API 套餐一个个复刻出来完全可行。我并不是说厂商在骗钱。任何成熟产品都包含封装红利你花钱买的是省心、稳定和一整套售后保障。但如果你想搞清楚这笔钱到底花在了哪里本文的核心判断是AI 智能体手机卖的不是魔法是封装。愿意折腾的人确实可以用极低的成本逐件买到这些积木。2. 12块/月怎么落地先画一张最小可用的Agent架构动手之前先把账算清楚再把架构想明白。这是我和很多一上来就装各种AI 手机助手 App的人最大的区别——前者是在搭系统后者只是多装了几个聊天机器人。2.1 12块钱到底买到了什么先说费用构成。我选的是一个国产大模型 API按 token 计费。日常使用强度大概是每天 20 到 40 次请求多数是几十到几百 token 的短指令偶尔用来做长文本总结。这样跑下来一个月账单基本落在 10 到 15 元之间取个平均就是 12 块。给不熟悉 API 计费的朋友补个概念。大模型 API 按 token 收钱token 可以粗略理解成模型读取的字词碎片1 个汉字大约对应 1 到 2 个 token。现在国产模型价格卷得厉害输入侧一两块钱能买几百万 token输出侧贵一些但也不至于用不起。按我的使用频率和上下文长度几十次调用一天一个月十几块完全在可接受范围内。这里有个要命的细节12 块/月的前提是把模型用在刀刃上。只让它做意图识别和轻量生成长文本总结这种重活偶尔用一次。如果天天让它写几千字文章、批量分析上百页文档账单会轻松跳到几十上百。我第一个月就吃过这个亏后面第五节细说。2.2 整套方案由四个模块组成我不画架构图直接按数据流把模块摆出来你顺着数字走一遍就清楚了。入口模块接收声音或文字指令。我用的是手机自带语音助手 桌面小部件 快捷方式把语音到文字这步解决掉。Agent 网关一台旧电脑或者手机上的 Termux 里跑着一个小服务负责把指令转发给大模型让大模型做两件事——理解意图 输出结构化任务参数然后网关再决定调用哪个工具执行。工具执行层手机本地安装的自动化工具比如安卓上的 Tasker、HTTP Shortcuts或者 iOS 上的快捷指令负责真正操作系统。记忆与偏好存储一个本地 JSON 文件记下常用地址、联系人、习惯提醒时间让 Agent 越用越顺手。整套链路拆到底就是听指令 → 大模型规划 → 系统执行 → 反馈结果。这和厂商的 AI 智能体手机没有代差只是他们封装得更深、更稳定、更快罢了。你的手机、我的旧安卓机跑的是同一条逻辑。3. 从零搭建把旧手机调教成AI智能体手机的完整步骤下面进入实操环节。我按大脑 → 手脚 → 耳朵 → 记忆四个层次来讲每一步都给出可复制的方案照着做基本都能跑通。3.1 先搭一个会规划的大脑Agent 网关的代码并不复杂。我在旧笔记本上装好 Python 环境用 Flask 起了个 HTTP 服务核心思路是前端指令进来后通过提示词约束大模型输出固定格式的 JSON让它只做意图识别和参数提取不废话、不自由发挥。代码如下# agent_gateway.py from flask import Flask, request, jsonify import requests import json app Flask(__name__) SYSTEM_PROMPT 你是手机智能体的任务规划器。根据用户指令只输出一个JSON对象 {intent: set_alarm|create_note|send_message|query_weather|review_schedule|other, params: {...}} intent只允许列出的枚举值。params里放执行该操作所需的最小参数时间一律转换为24小时制并带日期。 不要输出任何解释或额外内容。 def call_llm(user_text): resp requests.post( https://api.example.com/v1/chat/completions, headers{Authorization: Bearer 你的KEY}, json{ model: 你选的模型名, messages: [ {role: system, content: SYSTEM_PROMPT}, {role: user, content: user_text} ], temperature: 0.1 }, timeout15 ) data resp.json() content data[choices][0][message][content] # 去掉模型偶尔会加的 json 围栏 cleaned content.strip().lstrip(json).rstrip() return json.loads(cleaned) app.route(/agent, methods[POST]) def agent(): text request.get_json().get(text, ) plan call_llm(text) return jsonify(plan) if __name__ __main__: app.run(host0.0.0.0, port8080)这段代码的要害在于把大模型的自然语言输出转成机器可执行的结构化指令。比如我说明天早上 7 点 45 提醒我带身份证它返回的就是{ intent: set_alarm, params: { time: 07:45, date: 2026-06-11, note: 带身份证 } }有了这种结构化输出后面的自动化才有意义。没有它模型只是在聊天有了它模型才是在干活。不想用旧电脑的话还有两个替换方案把服务跑在手机里的 Termux 上或者放到树莓派、软路由里。我实测过 Termux 方案性能完全够用唯一的代价是手机在家里不能随意断网。平时出门在外我依赖的是自己在云上长期挂机的一台小服务器那部分成本另算如果你只在家里玩零额外硬件成本就能跑起来。3.2 再让AI拥有手脚连接手机自动化工具大脑有了手脚怎么接安卓上我用的是两件免费工具HTTP Shortcuts 和 Tasker。思路是在 HTTP Shortcuts 里新建一个请求把语音或文字通过 POST 发给 Agent 网关然后解析返回的 JSON按 intent 字段分流到不同的自动化动作。intent 是 set_alarm就调起系统闹钟 App填入精确时间——Tasker 里有现成的设置闹钟动作intent 是 create_note就调用备忘录的分享接口写入intent 是 send_message就弹一个确认框确认后通过短信或微信发送intent 是 query_weather就请求天气接口再朗读结果。配置完一轮之后以后想新增能力只需要在 Tasker 里多加一个分支或者在网关系关里多定义一个 intent 枚举不需要动其他代码。iOS 用户也不用叹气快捷指令能做同样的事用获取 URL 内容请求网关用如果条件判断 JSON 里的 intent再调用对应的系统操作逻辑一模一样。这里有一个我反复强调的经验能走系统原生 Intent 的千万别走无障碍模拟点击。原生方式稳定、不打断用户操作、不会被系统拦截模拟点击虽然万能但一次误触可能把整页设置改得乱七八糟。后面坑里会细讲。3.3 语音入口与主动提醒怎么实现语音入口是衡量智能体手机体验的关键。我的做法是给手机自带语音助手设定一个自定义指令说出问问 AI或者某个自定义短语唤起一个 URL Scheme把语音转出来的文字发到 Agent 网关。全程用的是手机自带能力不用额外装 App。主动提醒靠的是触发器。Tasker 里能监听大量事件时间到达、日历事件、WiFi 连接变化、电量变化、通知内容匹配。举两个我实测有效的例子每天早上 8 点网关自动查当天天气和日程摘要生成一段今日简报推送到通知栏当我连上公司 WiFi 时网关收到事件后提醒我把昨天的工作日报发了。从体验上看这就是厂商宣传的主动服务只是少了一点动画过渡多了一点极客味。但该有的提醒、该省的心一分不少。3.4 让Agent记住你一个JSON文件就够了AI 智能体手机的另一大卖点是越用越懂你。我的做法很朴素在网关服务里维护一个 memory.json大模型每次处理完指令后把值得记住的信息——常用地点、偏好的提醒时间、重要联系人的称呼——抽出来写进文件。下一条指令进来时把这些记忆塞进提示词的上下文。不搞向量数据库也不上 embedding 服务这点数据量用一个 JSON 文件绰绰有余。前面代码里已经预留了接口你可以在 call_llm 时把 memory 内容一并传给模型让它结合历史偏好做判断。想要更进阶的语义记忆以后可以加但那是锦上添花不是起步必需。到这里一台旧手机已经完成了大部分AI 智能体手机发布会上的表演。剩下的问题是它到底好用吗4. 同场景实测12块方案和万元旗舰的差距比想象中小搭完之后我把这台12 块版智能体手机当主力用了半个月期间借朋友的万元 AI 旗舰对比了几轮。直接说结论差距存在但没有厂商渲染的那么大。4.1 同一批场景的横向对比场景12块自建方案万元AI旗舰语音设闹钟/提醒体验基本一致端侧处理速度更快跨应用发消息需要二次确认一键完成日程摘要生成效果好但受费用限制效果好基本免费主动提醒靠自建触发器系统级整合更顺滑离线可用不行依赖网络端侧模型可离线长文本总结偶尔用控制成本放开用个性化记忆本地 JSON手动自动混合系统级自动学习可定制性极高想接什么接什么低只能等厂商更新隐私控制关键数据本地存大部分依赖云端月度成本12元手机溢价数千元必须说明的是这里对比的是我这套方案和厂商产品的公开宣传体验不同品牌差异也很大。但大方向不会错核心交互能力基本在同一水平线差的是稳定性和生态密度。4.2 便宜方案反而强的场景先说我自认为赢得比较轻松的地方。第一是可定制性。厂商给你预置的工具就那几个而我的 Agent 网关只要加几行代码就能接入任何想接的东西。前天我把家里的米家智能插座也接了进去——说一句把客厅灯关了网关直接通过局域网接口下发指令灯光熄灭。这种自由度厂商目前不会给你开放。第二是隐私和数据掌控感。我的记忆文件存在自己设备上重要内容随时能删不会莫名其妙被拿去训练模型。厂商的主动服务需要数据上云虽然方便但扪心自问你愿意把多少生活细节交给手机厂商每个人答案不同但至少我这种数据敏感型用户自建方案更安心。第三是成本。12 块/月核心功能都有剩下的钱能吃好几顿火锅。只谈核心体验的话这笔账怎么算都不亏。4.3 确实追不上的场景我不玩虚的差距最大的三个点必须讲清楚。第一端侧大模型的速度与离线能力。旗舰机的端侧模型可以在无网状态下完成大部分意图识别我的方案一断网就哑火。地铁里没信号的那几分钟体验差距是最明显的。第二系统级整合的稳定度。厂商的系统 AI 能直接调用日历、地图、支付等深度服务几乎不会误触。自建方案有时要绕一大圈碰上某个应用更新了权限策略脚本可能就悄悄罢工。第三主动服务的生态密度。厂商能从你的邮件、短信、日历、地理位置里综合计算给出更贴心的建议我的方案只能靠手动设定好的触发器覆盖面窄得多。比如根据通勤实时路况提前提醒出门这种场景自建方案要人工适配的数据源太多做起来很累。所以我的定位很明确核心体验平替不是完全复刻。如果你追求的是偶尔用着很爽这套方案已经值回票价如果你要的是每时每刻无感流畅那确实得靠厂商的软硬一体工程。5. 复刻过程踩过的5个坑每一个都折腾到半夜搭建流程看着顺实际操作时我踩了一堆坑。挑最典型的五个说提前知道能省下好几个通宵。5.1 API延迟让我差点放弃最初网关是同步调大模型 API一个语音指令从说话到执行常常要等 3 到 5 秒。演示视频里这个延迟能接受真当主力用就很急人一度想放弃。我后来做了三个优化。第一该用流式输出的地方用流式让正在处理的反馈先出来第二给常见指令做了本地缓存比如现在几点明天天气这种高频问题直接走缓存不模型第三接受一个事实——自动化任务比实时对话允许慢半拍。所以我尽量把语音命令设计成一句到位避免来回多轮沟通。5.2 高危操作误触闹钟差点全没了有次测试帮我把明天的闹钟都关掉结果 Tasker 把整个闹钟 App 的所有闹钟全清了。原因是我在任务分支里写得太宽匹配到闹钟关键词就一股脑全关没有做二次确认。这件事之后我立了一个规矩AI 可以包办但不能越权包办。凡是涉及删除、发送、支付等级别的操作一律在高危动作前加确认弹窗或者要求指令里必须包含明确的确认关键词。自动化执行和高危操作之间必须永远留一个人类确认的闸门这是底线。5.3 第一个月账单超了预算我以为自己用量很低结果第一个月账单下来 30 多块比预期翻了一倍多。查了一下用量明细原因有两处某几天连续跑了很多长文本总结另一些请求把超长历史记录全塞进了上下文token 消耗巨大。对症下药后我把上下文做了截断处理超过 2000 token 的历史直接归档日常只加载最近几条同时对 API 设置了月度额度预警超过 80% 就通知我。账单慢慢回落到了 12 块附近。这个坑必须警惕模型本身的单价已经很低贵的是无节制的上下文堆积和放飞的调用量。5.4 语音入口接得稀碎自定义语音指令最大的坑是系统自带语音助手的识别率还行但对第三方自定义触发词的支持极不稳定。我折腾了两天发现最优解不是硬刚语音助手而是换一个交互方式——在桌面放一个小部件点一下就能录音并转文字发到网关识别率比语音助手的自定义短语高得多。对于不想动手的场景再保留语音触发词双管齐下。这个经历让我明白交互从来不是只有一条路灵活组合最重要没必要死磕某一个入口。5.5 后台被杀、权限被回收自建方案的另一个大敌是安卓后台回收机制。自动化工具、本地小服务动不动就被系统进程回收我已经不止一次发现闹钟没设上就是因为 Tasker 在后台被杀了。解决方案是把关键工具加入电池优化白名单、锁定后台任务部分机型还要在权限设置里允许自启动。如果你是 iOS 用户后台限制更严建议把需要稳定运行的服务放在家里的小主机上手机只当遥控器这样反而更稳。我的最终状态就是这样网关和记忆文件都在家里的小主机上手机通过局域网或远程访问很少再出幺蛾子。这五个坑只要提前知道几乎都能绕开但一个个踩过去确实很耗时间。好在踩完之后的稳定性还是很让人满意的。6. 拿12块方案先跑两周再决定要不要花上万文章最后聊聊那 36 万人到底该不该抢的问题。我的答案比较折中先搞清楚自己属于哪一类人。6.1 四种人直接买AI智能体手机更合适如果你属于下面几类建议不要折腾自建方案直接买厂商的 AI 智能体手机更省心完全不想折腾技术的人。宁可多花钱也要开箱即用稳定优先。重度日程和商务人士。系统级整合的日历、邮件、会议摘要体验确实值那个溢价。长辈用户。语音交互门槛低厂商的端侧模型和主动服务更可靠出问题有售后。很看重离线能力的人。经常出入无信号环境端侧推理是刚需。6.2 另一种情况我的方案可能更适合你如果你的情况符合下面任何一条我强烈建议先别急着掏钱你本来就爱折腾数码和自动化家里有闲置电脑或手机你对手机厂商掌握全部数据这件事很敏感你只是被某两三个 AI 场景吸引并不需要全系统 AI 覆盖你预算有限但不想放弃智能体功能。这四种情况下12 块/月方案会给你 90% 的体验外加 10% 的折腾成本。而对于爱玩的人来说这 10% 的折腾本身就是乐趣。6.3 我的最终建议先试再买如果你正在纠结要不要冲那台 36 万人抢的手机我建议先别冲。用这套 12 块的方案跑两周搞清楚AI 智能体手机在你生活里到底扮演什么角色。跑完你会得到两个结果要么发现你需要的就是一个会设闹钟、查天气、记备忘的语音助手那 12 块方案绰绰有余要么你确实对系统的流畅整合、离线响应、生态联动产生了刚需那到时候再买也不迟而且选择会理性得多。我常跟朋友说的一句话是新技术的价格里总是含着不少想象力溢价。自己动手做一遍既是把这笔溢价省下来也是把对技术的理解真正握回自己手里。这和省不省钱无关纯粹是折腾的乐趣顺带还能在日常使用中收获一种这手机是真的懂我的实在感。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价