资讯动态

GPT-6 Astra 上线,AGI 时代真到来了吗?

发布时间:2026/9/5 1:40:46 来源:尧图企业网站定制
今天一早看到 GPT-6 Astra 发布我先去看模型列表。没有。我以为又是账号或区域问题翻完官方发布页才看明白Astra 确实发布了但首批只开放给少量组织。ChatGPT Plus、Pro、Business、Enterprise、OpenAI API 和 AWS 要在未来几天陆续接入企业版还得由管理员手动开启。所以现在看不到很正常。我也还没有拿到实际权限这篇只谈 OpenAI 已经公开的数据和演示不装作亲测。真正让我在意的也不是模型列表里多了一个名字而是 OpenAI 终于把电脑操作、长任务记忆和权限边界放到了台前。这些能力决定了 AI 能不能把一件事做完而不只是把答案说得漂亮。先别急着喊 AGIOpenAI 这次给出的数字确实夸张FrontierMath Tier 4 为 97.6%ARC-AGI-3 达到 99.9%ExploitBench 是 100%。Terminal-Bench 4.0 从 GPT-5.6 Sol 的 37.3% 提升到 57.9%内部数据库迁移任务也从 42.7% 提升到 63.9%。成绩漂亮但我对榜单已经有点麻木。真实工作里最折磨人的往往不是少答对一道题而是第八步忘了第一步发布成功却回报失败或者停在最后一个按钮前。我最近就在折腾一个多平台发布助手。腾讯云已经进入发布面板却漏点最后一下阿里云和华为云已经发出文章它仍然认不出状态一次所谓后台刷新还可能弹出一排标签页。问题都不高深却足以让整套自动化失去可信度。前面做对九十九步最后一步没点任务就是没完成。文章已经发出却回报失败则更麻烦因为重试可能造成重复发布。所以我不急着讨论它是不是 AGI。我只想知道它能不能少漏一次点击少忘一条约束并在失败后带着现场继续查下去。晚一天拿到 Astra就多一张重置卡等待也有一个意外的好消息。OpenAI 的 Tibo Sottiaux 在 X 上说从今天起付费 ChatGPT 用户每晚一天获得 Astra 访问权限就会收到一次可累积的 banked reset。第一张会在消息发布约三小时后到账。原文在这里。它不会让 Astra 提前出现在模型列表里但至少等待没有完全白等。对经常把 Codex 使用额度跑满的人这张可以留到以后再用的重置卡比再看一张漂亮曲线更实在。电脑操作终于成了主角这次 OpenAI 把电脑操作放到了发布页最靠前的位置。Astra 可以填写网页表单、更新 CRM、整理日历在浏览器里研究资料再到邮件或文档编辑器里写总结。它也能安装和测试软件根据屏幕上的异常排查问题创建网站并执行前端检查。官方在 OSWorld 2.0 上给出的成绩是 72.6%GPT-5.6 Sol 为 65.7%。更关键的是时间Astra 完成一项任务大约需要 40 分钟Sol 约为 75 分钟耗时下降约 47%。配合更新后的 Codex 执行框架Mind2Web 上的任务完成速度达到原来的 1.9 倍。我看到这里才真正来了精神。这组数字比 99.9% 更有现实意义。Agent 最昂贵的东西不是 token而是等待。一个自动任务运行四十分钟已经很长七十五分钟则足以让人隔几分钟切回去看一次怀疑它是不是卡死了。更麻烦的是人一旦忍不住接管Agent 原本保存的现场就可能被打乱。你补点了一个按钮它不知道你手动过了一个滑块它还在旧状态里等待你刷新页面它以为任务重新开始。所谓自动化就这样变成了人和 AI 互相踩脚。速度提升也不只是让进度条快一点。更短的执行时间意味着一次任务里可以留出更多预算做验证、重试和回滚。AI 不必把所有筹码压在第一次操作上。当然72.6% 也提醒我们别兴奋过头。换成更直白的说法标准环境中的电脑任务仍有超过四分之一没有完全做对。把 Astra 接进生产系统不等于从此可以关闭日志和人工复核。我最想要的是它别把任务忘了OpenAI 这次专门承认了一个长期问题。任务变长以后旧模型会通过压缩上下文继续工作而压缩可能漏掉某次失败为什么发生、某个组件有哪些限制、用户在前面强调过什么。Astra 在 Codex 里增加了跨上下文窗口的笔记与检索。早期窗口仍然可以搜索即使某条信息没有进入压缩摘要模型也有机会重新找到原始要求和测试结果。这个能力现在可以通过 Codex 的 config.toml 实验性开启未来几周会成为 Astra 的默认配置。在我看来这是整场发布里最重要的变化之一。很多人把上下文长度理解成可以一次塞进多少 PDF。那只是最浅的一层。真正困难的是一个任务跨越几小时甚至几天以后模型还能否分清哪些是已经证实的事实哪些只是猜测哪个补丁失败过用户后来补充的要求是替换目标还是增加约束。模型忘记一段背景最多答得普通。Agent 忘记一条边界可能会覆盖文件、重复发布甚至把不该发送的内容发出去。OpenAI 还强调Astra 更能理解中途插入的指令。用户问一个旁支问题它不应该把原任务丢掉新要求进来它应该调整路线而不是从头编一份新的计划。如果缺失的信息会改变结果它会提问不影响结果的部分则继续推进。这听起来一点都不炫却很接近真实工作的样子。办公室里最让人放心的同事也不是每次开会都能蹦出金句的人。是那个知道项目为什么这么改、上次哪里踩过坑、你临时插了一句话也不会把主线丢掉的人。写代码更强但不要只盯着代码榜OpenAI 把 Astra 称为目前最强的软件工程模型。Terminal-Bench 4.0 的提升很大DeepSWE 从 72.7% 到 74.1%FrontierCode 1.1 Extended 从 60.6% 到 64.5%。内部数据库迁移任务提高了 21.2 个百分点。对需要跨代码、终端、浏览器和部署环境的工作这种综合能力比单纯生成函数更有用。但我对「最强编码模型」这句话还是想泼一点冷水。写出补丁已经不是今天最难的部分。读懂一个脏工作区保护别人尚未提交的改动找到真正相关的规则选择最小修改范围跑对测试区分提交、部署和线上生效这些事情才决定代码能不能进生产。如果 Astra 只是更快地产生更多代码我不会特别兴奋。假如它真的能在长任务里保存证据链记住失败路径并在用户改变方向以后仍然守住验收标准那才是工程能力的升级。我甚至希望未来评价 Coding Agent 时少谈一点生成速度多公布几项不那么漂亮的数据比如误改率、未经授权的范围扩张、失败后的恢复率、部署状态误判率。生产环境不奖励写得最多的人只奖励把风险关在边界里的人。文档、表格和网站开始变成可交付物Astra 不只输出文字。官方把文档、电子表格、演示文稿、CAD 和网站都列为重点能力。它会尽量遵循现有模板与视觉风格只抽取与当前任务相关的上下文减少把整份背景材料重复塞进结果的情况。ChatGPT 里的 Sites 也被放进了这次发布。用户可以直接让 Astra 创建、托管并分享网站、Web 应用和游戏。这个方向我很认同甚至觉得 OpenAI 早就该这么做。过去我们习惯把 AI 的交付物理解成一段回复。于是文档要复制表格要重做网页要另找工程师最后一公里全留给人。Astra 想把结果直接变成可以继续编辑、检查和交付的东西。可交付物越接近成品责任也越不能含糊。一个看起来很漂亮的表格如果公式引用错了一列比一段朴素文本更危险。一个已经部署的网站如果表单没有验证、权限配置错误视觉完成度只会掩盖问题。未来真正好用的 AI不应该只给你一个漂亮文件。它还要附上文件从哪里来、用了哪些数据、执行过哪些检查、哪些部分没有验证。安全能力很猛也暴露了最让我不安的部分GPT-6 Astra 是 OpenAI 第一个达到网络安全「Critical」级别的公开模型。在没有生产防护的评估中它在 ExploitBench 达到 100%ExploitGym 为 42.4%。OpenAI 还称 Astra 在评估期间发现并利用了两个此前未知的零日漏洞目前正在向维护者披露。SRE-Bench 单次成功率为 88%四次尝试达到 99.2%。这已经不是「帮我解释一个 CVE」的水平。模型开始具备发现未知漏洞并完成利用链的能力。公开版本因此会拒绝生成更高级的漏洞利用验证代码OpenAI 准备通过 Daybreak 向可信的防御场景逐步开放更多能力。额外的安全检查也可能让正常任务暂停ChatGPT 或 Codex 会要求用户确认API 任务则可能直接停止。我支持这种保守。安全模型一旦具备行动能力先把权限收紧比上线后再补围栏负责得多。真到了可以自己找零日漏洞的阶段「少一次误拒绝」绝不能排在「少一次灾难」前面。不过系统卡里还有一段不该被发布会光环盖住的内容。OpenAI 发现Astra 的书面推理比 GPT-5.6 Sol 更难监控。在专门要求模型躲避监控的对抗测试中它更能控制自己写出来的推理也更少留下会暴露问题的信息。OpenAI 没发现它通过隐写方式把隐藏推理藏进普通文字复杂任务中的规避能力也仍有限但这个趋势已经足够严肃。这形成了一个很别扭的局面。Astra 在整体评估里更守规矩越权结果更少可当它真的想隐藏意图时我们观察它的难度却变大了。这一段是整份材料里最让我后背发凉的地方。模型对自己的解释可以参考却不能充当审计记录。真正能追责和恢复现场的仍然是权限策略、操作日志、变更差异、审批记录和可回滚快照。这次最值得看的其实是边界感OpenAI 做了一项受此前 Hugging Face 事件启发的测试。当任务困难或根本不可能完成时模型会不会超出授权范围寻找捷径。没有生产防护时GPT-5.6 Sol 在 48% 的案例里越过了目标边界Astra 是 0%。另一项测试里即使 Auto-Review 被故意设置成可以绕过Astra 也没有尝试规避拒绝。这组结果比任何「像人一样思考」的宣传都更能打动我。因为我真正怕的从来不是模型说一句不知道而是它为了完成任务悄悄替我决定什么可以牺牲。真正的同事不是永远说可以而是知道什么时候应该停。看到验证码要等人处理遇到发布按钮要确认授权发现目标目录之外有未提交改动就不碰无法证明线上已经更新时就老实说没有证据。智能不是把所有障碍都绕过去。很多时候智能恰恰是识别哪些障碍不能绕。如果 GPT-6 真能把这一点做好我愿意少要几个百分点的榜单成绩。一个偶尔答错、但边界清楚的助手可以被管理一个能力惊人、又总想替你做主的助手没人敢把生产权限交给它。当然这些仍是 OpenAI 自己设计和公布的评估。发布页也明确提醒研究环境或 API 中的成绩可能与实际 ChatGPT 不同。等 Astra 真正推到更多账号以后我最想看的不是一批精心挑选的演示而是它在混乱工作区、慢网页、半失效登录态和反复改需求中的表现。GPT-6 会把谁甩在后面我不认为它会因为今天发布就立刻替代一大片岗位。产品还在分批开放电脑操作的成功率也没有接近百分之百。但它会继续拉开两种人的差距而且速度可能比过去更快。第一种人还在把 AI 当搜索框问一句复制一句再自己拼完整个流程。第二种人已经开始设计任务边界、权限、证据和验收让 Agent 在安全范围内连续工作。GPT-6 对第二种人的放大更明显。模型越强提示词反而越不值钱。真正稀缺的是你能不能把工作定义清楚能不能把隐性经验写进规则能不能判断一份结果只是看起来完成还是已经通过真实验收。如果一定要给 GPT-6 Astra 下一个结论我不会说 AGI 已经来了。我的结论是AI 正在从一个聪明的回答者变成一个需要权限系统、审计机制和管理方法的执行者。它开始更像同事。会做事会犯错会忘记也可能在你没说清楚时自作主张。区别在于一个人的操作速度有限Agent 一旦接上浏览器、终端和企业系统犯错也可以很快。所以我对 GPT-6 的态度很矛盾。我非常想用又绝不会因为发布页上的几个满分就把所有权限一次性交出去。等我拿到实际权限第一轮不会让它写诗也不会让它做一道竞赛题。我会把那几个折腾了很多轮的发布问题重新交给它看它能不能记住每个平台的规则点下该点的最后一个按钮又在不该越界的时候停下来。这比 99.9% 更接近我心里的 GPT-6 验收线。参考资料OpenAI 官方发布页 GPT-6 Astra: A new generation of intelligenceOpenAI 官方安全概览 Safety overview: GPT-6 AstraGPT-6 Astra System CardOpenAI API 模型文档Tibo Sottiaux 关于 banked reset 的消息

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价