资讯动态

Smoke快测Run#258简报:Claude Opus 4.7以95.19分居首,豆包Pro骤降40.8分

发布时间:2026/8/4 14:28:51 来源:尧图企业网站定制
2026-08-03 赢政指数 Smoke 快测覆盖 11 个模型Claude Opus 4.7 以 95.19 分位居当日首位。Smoke 为每日 10 题快测适合观察短期信号不等同 Full 周榜结论。本次 Smoke 评测只覆盖代码执行和材料约束两个主榜维度主榜公式为0.55 × 代码执行 0.45 × 材料约束。由于每日样本量较小单日分数更适合作为监控信号而不是对模型能力做长期定论。当日排名排名模型主榜代码执行材料约束诚信#1Claude Opus 4.795.1910089.3pass#2Grok 489.3197.978.8pass#3Gemini 2.5 Pro78.598.753.8pass#4GPT-5.574.7583.364.3pass#5GPT-o374.7583.364.3pass#6GLM-4.672.2558.389.3pass#7DeepSeek V4 Pro70.197564.3pass#8Claude Sonnet 4.662.965078.8pass#9Gemini 3.1 Pro60.6257.664.3pass#10Qwen3 Max58.947539.3pass#11豆包 Pro55.8957.653.8pass数据解读今日 Smoke 快测中Claude Opus 4.7 以主榜 95.19 位居首位其代码执行 100 分与材料约束 89.3 的组合形成明显优势。Grok 4 紧随其后主榜 89.31代码执行 97.9、材料约束 78.8。Gemini 2.5 Pro 代码执行高达 98.7但材料约束仅 53.8拖累主榜至 78.5。GLM-4.6 则呈现相反的分化材料约束 89.3、代码执行 58.3主榜 72.25——在 0.55×代码执行 0.45×材料约束 的公式下权重分配对结果的影响十分显著。主要变化多模型出现明显回落豆包 Pro主榜下降 40.8 分其中代码执行 -36.4 分材料约束 -46.2 分Qwen3 Max主榜下降 37.2 分其中代码执行 -22 分材料约束 -55.7 分Gemini 3.1 Pro主榜下降 33.8 分其中代码执行 -36.4 分材料约束 -30.7 分Claude Sonnet 4.6主榜下降 31.5 分其中代码执行 -44 分材料约束 -16.2 分DeepSeek V4 Pro主榜下降 24.3 分其中代码执行 -19 分材料约束 -30.7 分诚信从 warn 恢复至 pass这些变化可能源于单日小样本抽样波动也可能反映真实性能退化需后续同口径 run 复核确认。需要关注的信号本次未保留可发布的异常信号。阅读 Smoke 简报时重点应放在两个问题上第一某个模型是否连续多日暴露同一类弱点第二诚信评级是否从 pass 进入 warn 或 fail。单日执行或约束分数的大幅变化可能来自题目抽样也可能是真实退化的早期信号需要后续 run 复核。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价