资讯动态

8月大语言模型榜单更新:Grok 4.6 跻身前三,四款新模型如何取舍?

发布时间:2026/9/2 8:02:46 来源:尧图企业网站定制
评测背景晓天衡宇大语言榜单更新四款近期受关注度较高的模型Grok 4.6、GLM 5.3、Gemini 3.7 Flash 与 DeepSeek-V4 Pro。基于晓天衡宇大语言模型榜单评测体系我们从 Agentic、Coding、General、Reasoning 四个一级维度及 20 主流评测集对四款模型进行了系统评测。本文我们不仅呈现榜单更新后的排名还将聚焦以下问题● 四款模型优势和短板分别是什么横向对比排名如何● 与前代或相近定位模型相比能力与效率变化体现在哪些方面● 谁在速度、Token 消耗和推理成本上更具优势榜单概览点击跳转晓天衡宇评测社区查看大语言模型 8 月榜单完整结果。核心结论结论一Grok 4.6 综合得分 69.45 位列总榜第 3四项一级维度全部进入总榜前五Grok 4.6 综合得分 69.45位列总榜第 3是本次上新四款模型中排名最高的一款。距离榜首 Claude Opus 571.27差 1.82 分距离第 2 名 Claude Fable 570.72差 1.27 分同时领先 GPT 5.6 SolMax0.35、GPT-5.5xhigh1.10、Kimi-K31.14。从一级维度看Grok 4.6 的 Coding77.87和 General74.16均位列总榜第 3Reasoning77.09位列第 4Agentic55.95位列第 5。四项一级维度全部进入总榜前五说明其能力结构相对均衡没有特别突出的单项短板。结论二GLM 5.3 较 GLM 5.2 提升 3.57 分四项一级能力全部上升GLM 5.3 综合得分 68.10位列总榜第 7较前代 GLM 5.2 的 64.53 分提升 3.57 分排名从第 12 位跃升至第 7 位。GLM 5.3 四个维度的能力都有所提升Agentic 从 54.07 提升至 55.591.52Coding 从 70.76 提升至 75.704.94General 从 66.66 提升至 70.193.53Reasoning 从 71.65 提升至 76.765.11。其中Reasoning 是 GLM 5.3 提升最快的维度也是其能力结构中最靠前的一项。结论三Gemini 3.7 Flash 推理速度在本期参评模型中位列第一General 能力表现突出Gemini 3.7 Flash 的推理速度为 343.7 Tokens/s在全部参评模型中位列第 1较 Gemini 3.1 Pro108.2 Tokens/s提升约 217.7%。其 General 得分为 70.45在本次上新四款模型中排名第 2仅次于 Grok 4.6 的 74.16。综合得分 65.43位列总榜第 10。结论四DeepSeek-V4 Pro 本次上新模型中定价最低DeepSeek-V4 Pro 综合得分 64.82总榜排名第 11在本次上新的四款模型中排名最低。四款上新模型横向对比DeepSeek-V4 Pro 的 General、Coding、Reasoning 均处于相对靠后位置Agentic 虽高于 Gemini 3.7 Flash但低于 Grok 4.6 和 GLM 5.3。不过它的价格优势明显API 定价 3.75 元/百万 Tokens为四款中最低约为 Grok 4.618 元的五分之一本次评测推理总成本约 2,531 元也是本次上新四款模型中最低。注本文中的 API 价格为输入与输出价格按 3:1 加权计算的综合单价单位为元/百万 Tokens 。评测体系本榜单基于智能体、代码、通用、推理四大能力维度进行综合评估并根据各维度权重计算综合得分。其中智能体占比最高为 35%代码和推理各占 25%通用占 15%。完整评测体系及方法解读可点击查看大语言模型榜单评测体系详解深度解读四款模型能力结构横向对比从本次评测结果来看四款模型的能力总体表现为Grok 4.6 综合分最高并且四个一级维度均领先但领先幅度并不一致。GLM 5.3 各维度较均衡Gemini 3.7 Flash 速度优势突出但 Agentic 相对较弱DeepSeek-V4 Pro 综合分靠后但价格优势明显。1、AgenticGrok 4.6 与 GLM 5.3 分差较小Gemini 3.7 Flash 相对靠后Agentic 维度排序为Grok 4.655.95 GLM 5.355.59 DeepSeek-V4 Pro53.88 Gemini 3.7 Flash52.80。Gemini 落后前两名约 3 分差距相对明显。从二级维度看Grok 4.6 的强项在复杂规划和中文浏览检索DeepPlanningShopping得分 62.05为四款中最高BrowseComp-ZH 得分 53.19同样为本组最高。但 TAU3-Bench 得分 74.42 是本组最低与 GLM 5.3 差 7.57 分形成 DeepPlanning、BrowseComp-ZH 强而 TAU3-Bench 相对弱的结构差异。GLM 5.3 与 Grok 4.6 的优势项有所错位TAU3-Bench 81.99 为本组最高是四款中唯一超过 80 分的模型。但在 BrowseComp-ZH48.06和 DeepPlanning58.19上落后于 Grok 4.6。DeepSeek-V4 Pro 的 TAU3-Bench79.02和 DeepPlanning58.75处于本组中上水平但 BrowseComp-ZH47.64为本组最低Seal-Hard 得分 30.11 仅略高于 Gemini。Gemini 3.7 Flash 在 DeepPlanning 和 Seal-Hard 上均为本组最低TAU3-Bench 也不占优但 BrowseComp-ZH 表现相对尚可。2、CodingGrok 4.6 与 GLM 5.3 各有胜负DeepSeek-V4 Pro 整体偏弱Coding 维度四个模型的排名为Grok 4.677.87 GLM 5.375.70 Gemini 3.7 Flash70.59 DeepSeek-V4 Pro69.63。从二级维度看Grok 4.6 的优势在于软件工程多语言能力SWE-Multilingual 87.00本组最高和科学代码SciCode 57.60本组最高Livecode-Bench-V6 也达到 95.15仅比 GLM 5.3 低 0.01 分。短板是 SWE-Bench-Verified58.04为本组最低比 GLM 5.3 低约 9 分说明其在 SWE-Bench-Verified 这类工程修复验证任务上相对弱。GLM 5.3 在代码生成和工具调用上表现突出Livecode-Bench-V6 以 95.16 位列本组最高ClawEval 88.65 为本组最高SWE-Bench-Verified 67.12 同样本组第一。相对薄弱的是 SciCode51.70低于 Grok 4.6 约 6 分。整体来看GLM 5.3 的 Coding 结构相对均衡在 Livecode-Bench-V6、ClawEval、SWE-Bench-Verified 上表现均较为突出但 SciCode 相对不占优。Gemini 3.7 Flash 在 Coding 维度上Livecode-Bench-V693.28和 SciCode56.80表现尚可处于中上游水平但 Terminal-Bench-Pro49.08和 ClawEval80.58均为本组最低终端执行与工具调用是其突出的短板。此外SWE-Bench-Verified60.03也偏低仅高于 Grok 4.6低于 GLM 和 DeepSeek。综合来看Gemini 在代码生成Livecode-Bench-V6和科学计算方面有一定竞争力但在工程修复SWE-Bench-Verified和终端交互类任务上表现较弱整体 Coding 能力在四款模型中排名靠后。DeepSeek-V4 Pro 在 Coding 上没有一项子维度领先Livecode-Bench-V688.07和 SciCode49.20均为本组最低仅 SWE-Bench-Verified65.00处于本组中游。在四款横向对比中Coding 是 DeepSeek-V4 Pro 相对靠后的维度。3、GeneralGrok 4.6 领先明显DeepSeek-V4 Pro 多数子项靠后General 维度排序为Grok 4.674.16 Gemini 3.7 Flash70.45 GLM 5.370.19 DeepSeek-V4 Pro67.05。Grok 4.6 领先第二名 3.71 分是四款中优势最明显的一级维度后三名之间差距较小。从二级维度看Grok 4.6 在 General 的多数子维度上都是本组最高AA-Omniscience 75.15 为本组最高领先第二名约 6.5 分HaluEval74.15、IFBench82.0、MRCR-V2-Gold90.15、LoCoMo 两项也均为本组最高。相对短板是 HLE 知识储备39.9低于 GLM 5.3 和 Gemini 3.7 Flash但高于 DeepSeek-V4 Pro。整体呈现“通用能力强、专业知识项不占优”的特征。GLM 5.3 在知识储备上表现最好HLE 45.4 为本组最高幻觉控制73.61和长上下文89.41也处于本组第二。但 AA-Omniscience56.51处于本组低位仅高于 DeepSeek-V4 ProIFBench75.1为本组最低。综合知识问答和指令遵循是其相对短板。Gemini 3.7 Flash 各子维度大多处于本组中游无明显领先项。AA-Omniscience68.68和 HLE44.9为本组第二但 HaluEval 得分 68.98低于 Grok 4.6 和 GLM 5.3说明幻觉控制不是其优势项。DeepSeek-V4 Pro 在 General 多数子项上靠后HLE38.6、AA-Omniscience55.8、HaluEval61.3、MRCR-V2-Gold88.10、LoCoMo 两项均为本组最低。其中 HaluEval 与 Grok 4.6 差距达 12.85 分AA-Omniscience 差距达 19.35 分是四款模型中 General 短板最集中的一款。仅 IFBench77.7处于本组中游。4、ReasoningGrok 4.6 与 GLM 5.3 势均力敌语言推理是 Grok4.6 明显短板Reasoning 维度排序为Grok 4.677.09 GLM 5.376.76 Gemini 3.7 Flash74.94 DeepSeek-V4 Pro73.98。前两名仅差 0.33 分后两名与前两名拉开约 3 分的差距。从二级维度看Grok 4.6 在 GPQA-Diamond 和 AIME 2026 上表现突出AIME 2026 拿到满分GPQA-Diamond 94.9 为本组最高。但语言推理68.54为本组最低比 Gemini 低 7.24 分是四个模型中语言推理最弱的一个。IMO-Bench-Gold74.05同样低于GLM 5.3 和 DeepSeek-V4 Pro。GLM 5.3 的推理结构相对均衡逻辑推理82.66、规划推理81.51、ReasoningMath75.44三项均为本组最高语言推理75.56为本组第二。相较之下GPQA-Diamond 和 RealWorldPlan 不是其最强项。Gemini 3.7 Flash 在语言推理上表现最好75.78本组第一GPQA-Diamond94.5也处于本组第二。但逻辑推理76.98、规划推理73.68和 RealWorldPlan 均为本组最低与 GLM 5.3 分别拉开一定差距。DeepSeek-V4 Pro 的 IMO-Bench-Gold78.62为本组最高规划推理80.28处于本组第二竞赛级数学能力不弱。但 GPQA-Diamond88.4和 ReasoningMath69.42均为本组最低是 DeepSeek-V4 Pro 在推理维度中的相对短板。效率与成本Gemini 速度和 Token 消耗占优DeepSeek 成本最低推理速度Gemini 3.7 Flash 总榜第一Grok 4.6 本组最慢四款模型的推理速度呈明显梯度Gemini 3.7 Flash 以 343.7 Tokens/s 位列榜单第 1DeepSeek-V4 Pro83.2 Tokens/s 与 GLM 5.383.0 Tokens/s速度几乎相同分列榜单第 7、第 8处于中上水平。Grok 4.6 的推理速度为 61.3 Tokens/s在本次上新的四款模型中最低在所有参评模型中排名靠后。结合其综合得分表现来看体现出 Grok 4.6 在能力与响应效率之间的取舍。成本效率DeepSeek-V4 Pro 定价最低Gemini 3.7 Flash Token 消耗最少DeepSeek-V4 Pro API 定价 3.75 元在本次上新的四款模型中最低。虽然 Token 消耗量最大27 MTokens但凭借定价优势本次评测推理总成本约 2,531 元是四款中最低。Gemini 3.7 Flash Token 消耗 14 MTokens为四款中最低结合 8 元 API 价格本次评测推理总成本约 2,800 元仅次于 DeepSeek-V4 Pro。GLM 5.3 Token 消耗为 16.5 MTokens在四款中处于较低水平约为 DeepSeek 的 61%、Grok 的 75%结合 13 元 API 价格本次评测推理总成本约 5,363 元。Grok 4.6 定价最高18 元Token 消耗 22 MTokens本次评测推理总成本约 9,900 元为四款中最高。但其综合得分 69.45 也是本组最高。作为对比同处总榜前三的 Claude Opus 5 和 Claude Fable 5API 价格分别为 70 元和 140 元推理成本分别是 63,000 元和 119,000 元Grok 4.6 在 Top 3 模型中仍属于低成本选择。注本文中的 API 价格为输入与输出价格按 3:1 加权计算的综合单价单位为元/百万 Tokens与前代及相近定位模型对比能力变化与效率路径分化Grok 4.6 vs Grok 4.5Grok 4.6 综合得分 69.45总榜第 3较前代 Grok 4.565.75 分总榜第 9提升 3.70 分排名跃升 6 个位次直接进入总榜前三。能力维度对比Coding 是 Grok 4.6 进步最大的维度从 73.39 提升至 77.87增加 4.48 分进入 Coding 维度榜首竞争区。General 同样进步显著从 70.14 提升至 74.16增加 4.02 分在 General 维度榜中排名第 3。Reasoning 从 73.19 提升至 77.09增加 3.90 分Agentic 从 53.11 提升至 55.95增加 2.84 分。效率与价格对比Grok 4.6 在四项能力全面提升的同时Token 消耗与前代持平22 MTokensAPI 价格从 21 元降至 18 元推理总成本从 11,550 元降至 9,900 元实现了“能力升、Token 不变、价格降”的优化。但推理速度从 86.0 Tokens/s 降至 61.3 Tokens/s-28.7%体现了能力提升与响应效率之间的权衡。GLM 5.3 vs GLM 5.2GLM 5.3 综合得分 68.10总榜第 7较前代 GLM 5.264.53 分总榜第 12提升 3.57 分排名跃升 5 个位次。能力维度对比Reasoning 是 GLM 5.3 进步最大的维度从 71.65 提升至 76.76增加 5.11 分在四款上新模型中仅次于 Grok 4.6 的 77.09 分成为 GLM 5.3 最突出的一级维度。Coding 同样提升明显从 70.76 提升至 75.70增加 4.94 分。General 从 66.66 提升至 70.19增加 3.53 分Agentic 从 54.07 提升至 55.59增加 1.52 分。效率与价格对比GLM 5.3 在四项能力全面提升的同时Token 消耗从 20 MTokens 降至 16.5 MTokens-17.5%推理速度从 80.0 Tokens/s 小幅提升至 83.0 Tokens/sAPI 价格保持不变推理总成本从 6,500 元降至 5,363 元。整体来看GLM 5.3 是本次代际对比中能力提升和消耗控制较均衡的一款。Gemini 3.7 Flash vs Gemini 3.1 ProGemini 3.7 Flash 综合得分 65.43总榜第 10较 Gemini 3.1 Pro64.18 分总榜第 15提升 1.25 分排名跃升 5 个位次。需要说明的是两者并非同一产品线的严格前后代关系Gemini 3.1 Pro 是榜单中相近的 Google Pro 系列参考模型侧重综合能力Gemini 3.7 Flash 则是新一代轻量级模型侧重速度与效率。此次对比更多体现的是 Gemini 3.7 Flash 相对榜单中相近 Google 模型的效率优势而非 Pro 系列的常规迭代。从能力对比看Gemini 3.7 Flash 较 Gemini 3.1 Pro 在 Reasoning2.03、Agentic1.70、Coding1.22三个维度上均有提升General 小幅回落 1.05 分。作为一个轻量级模型Gemini 3.7 Flash 能够在三项核心能力上接近或超过榜单中的 Gemini 3.1 Pro说明其在速度优势之外能力表现也已接近更高定位模型。能力维度对比效率与价格对比Gemini 3.7 Flash API 价格为 8 元/MTokens相较于 Gemini 3.1 Pro 31.5 元/MTokens 低 23.5 元/MTokensToken 消耗方面Gemini 3.7 Flash 低于 Gemini 3.1 Pro 17 MTokens本次评测推理总成本低 21,613 元。效率方面Gemini 3.7 Flash 推理速度 343.7 Tokens/s 相较于 Gemini 3.1 Pro 108.2 Tokens/s 高 235.5 Tokens/s。综合来看Flash 相对 Pro 在响应速度上更高在 API 价格、Token 消耗和推理总成本上更低成本与响应效率均体现相对优势。DeepSeek-V4 Pro vs DeepSeek-V4 FlashDeepSeek-V4 Pro 综合得分 64.82总榜第 11较 DeepSeek-V4 Flash64.06 分总榜第 16提升 0.76 分排名提升 5 个位次。能力维度对比效率与价格对比DeepSeek-V4 Pro API 价格为 3.75 元/MTokens相较于DeepSeek-V4 Flash 1.25 元/MTokens 高 2.50 元/MTokensToken 消耗方面DeepSeek-V4 Pro 比 DeepSeek-V4 Flash 低 3 MTokens。本次评测推理总成本 DeepSeek-V4 Pro 比 DeepSeek-V4 Flash 高 1,593 元。效率方面DeepSeek-V4 Pro 推理速度 83.2 Tokens/s 相较于DeepSeek-V4 Flash 115.9 Tokens/s 低 32.7 Tokens/s。综合来看Pro 相对 Flash 在定价和总成本上更高在响应速度和 Token 消耗上更低Token 消耗上的小幅相对优势未覆盖价格与总成本上的相对劣势。综合判断综合本次评测结果Grok 4.6 以 69.45 分位列总榜第 3是四款上新模型中综合得分最高的一款其 Coding、General、Reasoning、Agentic 四项一级维度均进入总榜前五能力结构较均衡。GLM 5.3 以 68.10 分位列总榜第 7较 GLM 5.2 提升 3.57 分四项一级能力均有提升其中 Reasoning 和 Coding 提升最明显。与此同时GLM 5.3 的 Token 消耗下降、推理速度小幅提升API 价格保持不变是能力提升和消耗控制较均衡的一款。Gemini 3.7 Flash 以 65.43 分位列第 10最大优势在于 343.7 Tokens/s 的推理速度和 14 MTokens 的低 Token 消耗。它的推理速度在所有参评模型中第一本次评测推理总成本约 2,800 元仅高于上新四款模型中的 DeepSeek-V4 Pro。DeepSeek-V4 Pro 以 64.82 分位列第 11在四款中综合得分最低但 API 定价 3.75 元、本次评测推理总成本约 2,531 元均为四款最低成本优势明显。从效率结构看Gemini 3.7 Flash 速度最快、Token 消耗最低DeepSeek-V4 Pro 定价和总成本最低GLM 5.3 在能力提升和消耗控制之间较均衡Grok 4.6 综合得分最高但速度和成本不占优。注本文结论基于晓天衡宇本期评测体系与样本反映模型在该评测框架下的相对表现不代表所有业务场景中的绝对优劣。实际选型仍建议结合具体任务、成本预算与业务验证结果综合判断。写在最后最新大语言模型评测榜单已同步上线至晓天衡宇•评测社区官网欢迎大家访问查看更详细的评测数据关注晓天衡宇•评测社区官方账号获取更多大模型相关知识~

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价