资讯动态

GPT-6之后,企业该换一把尺子衡量AI:不是token单价,是“干成一件事”的总账

发布时间:2026/9/5 3:38:09 来源:尧图企业网站定制
四年前微软的科学家为了论证“GPT-4是AGI的早期火花”让模型用代码画过一只独角兽。当时它磕磕绊绊画出来的东西像儿童简笔画。后来模型一代代升级独角兽越来越精致但还是一眼能看出是代码画的。直到这次GPT-6发布画面终于“看不出来了”。OpenAI正式发布GPT-6Astra与AstraPro总裁GregBrockman在发布会结尾抛出一句“欢迎来到AGI时代”。消息铺天盖地各种满分截图刷了满屏。但对做企业的人而言真正值得翻来覆去琢磨的不是那只独角兽也不是那堆分数而是藏在发布稿里的一处表态——衡量AI的那把尺子可能要换了。换一把尺子计价单位从“一个token多少钱”变成“干成一件事多少钱”先看价格。Astra的API定价是输入10美元、输出50美元百万token是上一代GPT-5.6Sol的2.5倍几乎与同期发布的ClaudeFable5.1持平。单看单价不少企业第一反应是用不起了。但OpenAI这次想讲的是另一本账。Brockman在发布会上说得挺直接一个模型单次调用更贵但如果它能减少返工、用更少的步骤干完一整件事总成本反而更低。数据也在支撑这个说法——同一项电脑操作任务上一代平均要75分钟Astra约40分钟耗时少了近一半在AutomationBench这类“干长活”的测试里任务完成率从上一代的18.1%提到41.4%而且这份评测还把完成任务的API成本一并摆了出来明摆着要你算总账。翻译成企业语言就是采购AI的计价单位正在从“按字数付费”走向“按结果验收”。过去大家比的是谁的模型便宜、谁的上下文长往后比的是谁能让AI少返工、一次把活干到位。单价贵一倍但返工省下来总账未必亏——这才是Astra敢定高价的底气。顺带说一句这次刷屏的ARC-AGI-399.9%等高分是在OpenAI自带的Agent运行框架下取得的并非模型“裸奔”的成绩。这本身也是尺子要换的证据——以后比的从来不只是模型本身还有套在它外面那套“怎么干活”的框架。算一笔总账演示很漂亮企业更要看那个“3%”这次发布会最不缺的就是演示自己进KiCad画PCB电路板在Blender里建模再导入虚幻引擎、生成一栋能走进去的房子照着企业模板直接产出整套PPT把人类要花5小时的儿科医生搜索压缩到2分54秒……每一条都够上三天热搜。但对真正打算引入AI的企业来说比演示更值得琢磨的是两个已经跑起来的企业案例。法律AI平台Legora用Astra一次性核对了41份财务文件几分钟内找出全部4个预先埋下的错误其中有一处50万英镑的收入附注差额。听起来相当惊人可Legora自己补了一句特别冷静的话放到它所有智能体任务里平均算整体提升只有约3%。另一边游戏公司Playco让Astra直接进Unity和Godot做游戏同一份灰盒底稿一次吐出3个不同主题的可玩原型人工修补的工作量少了近一半。两个案例放在一起其实是在提醒企业两件事AI的价值峰值和均值之间可能差着一个数量级。它擅长的是少数几类长流程任务而不是均匀地替代所有岗位——指望“买一个模型、全公司效率翻倍”的大概率会失望-同样的模型只有在“任务定义清楚、资料给得完整”的地方才能跑出峰值。任务说得糊谁来都白搭流程里那些说不清、查不到的信息恰恰是AI最容易翻车的地方。划一条边界“知道什么不能碰”正在成为核心卖点能力越强越要回答一个问题它会不会为了完成目标乱来OpenAI专门做了个测试在任务旁边故意留下可以钻的“诱饵漏洞”。结果上一代模型有48.2%的测试出现越界行为Astra是0%。与此同时它又刷新了网络安全漏洞利用测试的满分记录还在测试中顺手发现了两个此前无人知晓的V8零日漏洞。更强的攻击力配上0%的越界率——“清楚哪些系统不能碰”就这样从一句安全口号变成了这一代模型真正拿得出手的能力项。日常使用里也能看到这种“边界感”Astra会一边干活一边补问信息不影响结果的部分自己推进只有涉及关键选择时才停下来等你确认在Codex里它甚至能跨上下文保存工作笔记回头翻找此前聊过的限制条件不用你反复交代。对企业来说这条边界线的意义可能比跑分更大把AI放进业务流程本质上是把一部分权限交给它。权限越大的工具越需要自带刹车。以后评估一个AI能不能用“它清楚什么不能碰”会和“它有多能干”放在同一个天平上称。把“形象验收”加进清单企业在AI眼里是什么样也该定期查把上面的账合起来看会得出一个有点反常识的结论AI越强企业要操心的反而不是“怎么用工具”而是三件更基础的事——怎么交代任务、怎么划边界、怎么验收结果。顺着“验收”再往下想一层既然越来越多工作要交给AI干AI动手前一定会先去读企业信息——搜官网、翻资料、看各种公开介绍。它读到的关于你的内容准不准、全不全、新不新会直接影响它交出来的结果。换句话说“企业在AI眼里的形象”本身就是一份需要定期验收的资产。过去企业做官网、做内容大多停留在“给人看”的思维而AI时代的做法是把品牌信息当成一套需要持续自检的系统哪些问题AI答得对哪些说法已经过时哪些页面它根本找不到。行业中一些GEO建站体系已经把这套自检做成了内置的智能检测报告——企业自己的员工就能定期跑一遍看看品牌在AI问答里的信任度是涨是跌而不是等客资悄悄流失了才回头查。品牌在AI眼里的形象从此变成一件看得见、量得出、可以跟踪的事。写在最后四年前那只代码画出来的独角兽如今已经看不出是代码画的。从“会回答”到“会干活”再到“知道边界”模型的能力在换挡企业这边衡量AI的尺子、交给AI的任务、验收AI的方式也到了该跟着换一换的时候。AGI是不是真的来了可以留给时间去验证。企业眼下更现实的功课只有一条把目标说清楚把边界划明白再把自己在AI眼里的形象纳入每一次例行验收。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价