资讯动态

大语言模型 8 月榜单更新:Claude Opus 5 登顶,Gemini 3.6-Flash 与 DeepSeek-V4 Flash 展现差异化优势

发布时间:2026/9/2 15:41:21 来源:尧图企业网站定制
评测背景晓天衡宇评测社区大语言模型 8 月榜单迎来三款新模型入榜Claude Opus 5、 Gemini 3.6-Flash 和 DeepSeek-V4 Flash。榜单从智能体、代码、通用、推理四个维度并基于 20 主流评测基准对国内外主流大语言模型进行了全面评测现公布晓天衡宇大语言模型 8 月评测榜单。本文基于本期榜单结果重点解读三款模型入榜带来的榜单变化。完整 36 个模型的排名与得分欢迎访问晓天衡宇评测社区查看。榜单概览图中仅展示当前榜单前 10 名完整榜单欢迎点击阅读原文查看。核心结论结论 1Claude Opus 5 入榜即登顶Anthropic 包揽前两名本期榜单中Claude Opus 5 以 71.27 分位列第一。相较上期榜首 Claude Fable 570.72 分Claude Opus 5 进一步刷新了榜单最高分纪录。Claude Opus 5 与 Claude Fable 5 分差仅 0.55 分。两款模型各有优势能力侧重点并不相同Claude Opus 5 主要在智能体与推理维度领先 Claude Fable 5 在代码与通用上仍略胜一筹。结论 2Gemini 3.6-Flash 与 DeepSeek-V4 Flash 位居中游能力结构相近、定位路径不同Gemini 3.6-Flash 与 DeepSeek-V4 Flash 分别以 64.13 分、64.06 分位列第 14、15 名分差仅 0.07 分。两者智能体与代码维度的差距均不足 0.4 分推理维度相差 0.82 分主要差异来自通用维度Gemini 3.6-Flash 领先 2.41 分。从能力结构看两款模型均以推理见长DeepSeek-V4 Flash 推理得分 74.68 Gemini 3.6-Flash 为 73.86 分推理均为各自四个维度中得分最高的一项。差异在于二者相对自身的优化方向Gemini 3.6-Flash 延续 Flash 系列的速度优先路线DeepSeek-V4 Flash 相较 DeepSeek-V4 ProMax则以更小参数规模取得更高综合分。结论 3效率分化明显三款模型路线各异三款模型效率定位各有差异Gemini 3.6-Flash 以 213.5 Tokens/s 的推理速度大幅领先以速度优先DeepSeek-V4 Flash 以 1.25 元的 API 价格和 938 元的推理成本成为 60 分以上模型中成本最低的选手Claude Opus 5 则以 55.1 Tokens/s 的速度处于榜单中下综合能力居首但推理速度处于中下游。评测体系本榜单基于智能体、代码、通用、推理四大能力维度进行综合评估并根据各维度权重计算综合得分。其中智能体占比最高为 35%代码和推理各占 25%通用占 15%。模型迭代对比三款新模型从能力结构上看具体提升体现在哪些方面我们通过四大维度得分对比来给出答案。Claude Opus 5四维全面提升智能体与工程能力是最大亮点Claude Opus 5 智能体能力提升最为显著以 59.63 分成为当前榜单中智能体维度最高分。相较前代 Claude Opus 4.8 Claude Opus 5 总分提升 3.88 分 至 71.27 分四个维度全部实现正增长。它的优势集中在智能体与软件工程能力上 SWE-Multilingual 提升 8.91 分反映了自主代码修复与仓库级工程能力的明显增强DeepPlanningShopping提升 10.9 分体现出工具调用与长链路任务规划、复杂场景决策能力的强化。个别项目如 IMO-Bench-Gold 小幅回落但幅度有限不改变其综合能力显著增强的大方向。Gemini 3.6-Flash四项能力均衡小幅提升相较前代 Gemini 3.5 Flash Gemini 3.6-Flash 总分提升 1.28 分至 64.13 分四个维度均有小幅正增长。其中智能体与代码相对明显通用基本持平。Gemini 3.6-Flash 提升最大的是 DeepPlanningShopping子维度提升 7.73 分在复杂场景下的任务规划与决策能力有所强化HLE 等个别子维度小幅回落。DeepSeek-V4 Flash小参数实现更高得分通用、智能体与推理提升明显DeepSeek-V4 Flash 的提升集中在通用、智能体与推理代码提升相对较低。DeepSeek-V4 Flash 总分 64.06 较 DeepSeek-V4 Pro (Max) 高出 1.63 分。对比 DeepSeek-V4 Pro (Max) DeepSeek-V4 Flash 的优势集中在 HaluEval 与 IMO-Bench-Gold 子维度即输出抗幻觉能力以及数学推理能力有所增强。衡量终端环境下工程执行能力的 Terminal-Bench-Pro 等个别子维度则略有回落。注由于 DeepSeek-V4 Flash 为系列首款 Flash 模型本文以其同代 DeepSeek-V4 Pro (Max) 作为能力参照基准。效率表现对比Claude Opus 5综合能力居首效率稳定发挥Claude Opus 5 的推理速度为 55.1 Tokens/s处于整体中下水平较前代略有下降API 价格维持 70 元不变Token 消耗与推理成本小幅上升。整体来看Claude Opus 5 适合对能力要求较高、对响应速度不敏感的场景。Gemini 3.6-Flash速度全场第一成本与消耗较前代下降Gemini 3.6-Flash 以 213.5 Tokens/s 的推理速度位列当前第一较前代 Gemini 3.5 Flash 进一步提升。同时它的 Token 消耗仅 12 MTokens为全场最低API 价格 21.6 元、推理成本 6480 元均低于前代。能力提升的同时实现了速度、成本、Token 消耗三项指标的同步改善。DeepSeek-V4 Flash成本显著降低速度跻身第一梯队DeepSeek-V4 Flash API 价格仅 1.25 元推理成本仅 938 元。它的推理速度 115.9 Tokens/s 位列全场第四较参照基准实现明显提升。虽然其 Token 消耗高于 V4 Pro (Max)但由于 API 单价大幅下降推理成本反而从 6825 元降至 938 元。注本文中的 API 价格为输入与输出价格按 3:1 加权计算的综合单价单位为元/百万 Tokens 。综合判断综合来看三款新模型呈现出不同的能力与效率取向Claude Opus 5 综合能力领先本期榜单优势集中在智能体与复杂任务处理能力。相较前代 Claude Opus 4.8 在多步规划、工具调用和软件工程任务上均有明显增强但推理速度处于中下水平更适合对任务完成质量要求较高、对响应时延不敏感的场景。Gemini 3.6-Flash 在能力提升的同时保持高效率表现智能体与代码能力有所增强推理速度、Token 消耗均具优势适合目标明确、流程清晰且强调响应效率的应用场景。DeepSeek-V4 Flash 则展现出较强的成本竞争力在较小参数规模下实现较高综合得分通用、智能体与推理能力均有提升结合较低 API 价格和推理成本更适合调用规模较大、成本约束较强的场景。注本文结论基于晓天衡宇本期评测体系与样本反映模型在该评测框架下的相对表现不代表所有业务场景中的绝对优劣。实际选型仍建议结合具体任务、成本预算与业务验证结果综合判断。写在最后最新 8 月大语言模型评测榜单已同步上线至晓天衡宇评测社区官网欢迎访问查看更详细的评测数据关注晓天衡宇•评测社区官方账号获取更多大模型相关知识~

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价