资讯动态

还得是谷歌,Gemini 4 发布,猛的离谱。。。

发布时间:2026/10/2 20:12:23 来源:尧图企业网站定制
centerspan stylebackground:#d3f8b6这是苍何的第 605 篇原创/span/center大家好我是苍何。猜到它会来但没猜到它又赶在这个点发布。就在昨夜凌晨当我们还沉浸在梦乡的时候谷歌发布了他们家新的旗舰模型 Gemini 4 Argon。Gemini 4 Argon 太猛了多项基准测试能力都超过了 GPT 6 AstraClaude Opus 5.5。特别是在 DeepSWE v1.1真实软件工程任务以 77.9% 位列全球第一。Vals Index、AutomationBench 均拿第一。谷歌一共公布了 18 项测试Argon 独占第一 12 项并列第一 1 项GPT 6 Astra 赢 3 项Opus 5.5 赢 2 项。谷歌如今再次重回人工智能领域三大顶尖实验室之列。Gemini 4 Argon 是 Google DeepMind 七个多月以来推出的首款高于 Flash 级别的自主研发模型。凭借其高推理能力目前最高级别它在人工智能分析智能指数 (AII) 中获得 53 分与 GPT-6 Astra最高分 53 分持平比 GPT-6.1 Sol最高分 52 分高出 1 分其得分提升主要得益于更少的幻觉和更强的自主能力。在 AA-Omniscience 测试中Gemini 4 Argon 的幻觉率仅为 15%是所有智能指数得分 45 分以上的模型中最低的输出上限更是直接拉到 100 万 token之前 64K业界第一。支持文本、图像、视频和语音输入并输出文本。API 价格方面标准价格为每百万输入/输出令牌 4 美元/20 美元目前优惠 50%价格为 2 美元/10 美元。缓存输入令牌可享受 95% 的折扣折扣价为每百万 0.10 美元高于 Gemini 3.8 Flash 的 90% 折扣。智能体性能历来是 Gemini 模型的弱项但 Gemini 4 Argon 在各项智能体评估中均有所提升。它在 AutomationBench-AA 测试中以 77.5% 的成绩位列第一比 Claude Sonnet 5.5最高分 71.3%高出 6 分。第三方评测 Artificial Analysis 数据如下Gemini 4 Argon 主打长程复杂任务软件工程、金融/法律知识工作、网络安全防御。数千名谷歌员工强调了该模型在专业编码任务、深度研究和高质量写作方面的优势。谷歌还放出了一篇博客文章放了一些他们的 case他们利用 Argon 帮助量子计算研究人员优化那些限制重要应用性能的子程序的时空资源量子比特 × 量子门。例如在短短几分钟内它就将性能提升了 40%超过了已发布的基准水平。他们还拿 Argon 做内部的内存优化 Argon Agent Team 分析了整个集群的分析遥测数据自主识别并应用了 Google 数据中心的内存优化一旦推出即可释放超过 300 TiB 的内存预计总共可节省 500 TiB 到 1 PiB 的内存。在大规模代码库迁移与优化工作中Argon 团队正在将 Google 各部门的 C/C 代码库迁移到 Rust迁移规模从 re2、libgav1 等核心库的数万行代码到 Fuchsia Zircon 内核的 80 万多行代码不等。如此大规模的代码迁移对模型能力的考验不是一点半点。不过可惜的是现在大部分人还无法使用先开放给可信网络安全防御者之后轮到付费 API 和 AI Ultra 用户。希望你不要像某些家伙一样吧快放出给测测。哈哈哈没拿到测试在当下我认为Claude Opus 5.5 依旧是神那种爽感是完全不一样的。如果 Gemini 4 Argon 比不过 Opus 5.5大概率就是在拉。还有我不知道为什么每次这帮人老喜欢在中国的节假日发布新模型太气人了。国庆第一天别人在高速上堵车我在电脑前熬夜看跑分麻了。模型不放假我们也别想放假苦了。吐槽归吐槽谷歌这次确实拿出了真东西。100 万 token 输出、80 万行代码迁移、300 TiB 内存优化都是谷歌在自家业务里实打实跑出来的。但讲真的跑分这东西看看就好。官方数据里 Argon 横扫一片到了第三方评测也就和 GPT 6 Astra 打个平手。发布会看跑分干活还得看手感。等 Argon 正式开放我第一时间拉真实项目去测到时候再给大家出一期实测。大厂卷得越凶我们这些用模型的人就越爽。你觉得 Gemini 4 Argon 能打得过 Opus 5.5 吗评论区聊聊。觉得有用的话点赞、在看走一波祝大家国庆快乐

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑