资讯动态

DeepSeek V4 Pro 以 87.2 分居首:2026-08-10 Smoke 快测数据简报

发布时间:2026/8/11 6:25:11 来源:尧图企业网站定制
2026-08-10 赢政指数 Smoke 快测覆盖 10 个模型DeepSeek V4 Pro 以 87.2 分位居当日首位。本次 Smoke 评测只覆盖代码执行和材料约束两个主榜维度主榜公式为主榜 0.55 × 代码执行 0.45 × 材料约束Smoke 为每日 10 题快测适合观察短期信号不等同 Full 周榜结论。一、当日排名排名模型主榜代码执行材料约束诚信#1DeepSeek V4 Pro87.291.781.7pass#2Grok 473.57571.7pass#3Gemini 2.5 Pro72.8673.871.7pass#4Claude Opus 4.772.37569pass#5GPT-o371.277566.7pass#6Gemini 3.1 Pro66.766.766.7pass#7Qwen3 Max65.017552.8pass#8GLM-4.661.255075pass#9GPT-5.558.37537.9pass#10Claude Sonnet 4.655.27561.7pass二、数据解读DeepSeek V4 Pro 主榜 87.2代码执行 91.7材料约束 81.7三个维度均居首是当日唯一全面高分选手。Grok 473.5、Gemini 2.5 Pro72.86、Claude Opus 4.772.3、GPT-o371.27四款模型呈现代码执行略强于材料约束的均衡结构。GLM-4.6 形成反向搭配代码执行 50、材料约束 75主榜 61.25。Qwen3 Max 代码执行 75、材料约束 52.8主榜 65.01此类强弱互补在榜单中较为常见。三、主要变化GPT-5.5 主榜 -30.4 代码执行 -25 材料约束 -37.1 GPT-o3 主榜 -24.6 代码执行 -25 材料约束 -24.2 诚信 warn → pass GLM-4.6 主榜 23.5 材料约束 52.2 诚信 warn → pass Qwen3 Max 主榜 -20.8 代码执行 -24 材料约束 -16.9 Claude Opus 4.7 主榜 -20.6 代码执行 -25 材料约束 -15.1这些变化可能源于题目抽样波动也可能是单日信号的偶然表现需后续 run 复核确认。四、需要关注的信号本次未保留可发布的异常信号。读这类 Smoke 简报时重点应放在两个问题上某个模型是否连续多日暴露同一类弱点诚信评级是否从 pass 进入 warn 或 fail。单日执行或约束分数的大幅变化可能来自题目抽样也可能是真实退化的早期信号需要后续 run 复核。本文首发于赢政天下 (https://www.winzheng.com)获取更多深度技术内容与资源欢迎访问官网。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价