资讯动态

DEEPSEEK V4 实测:它不够炸裂,但正在啃最硬的骨头

发布时间:2026/10/8 8:02:49 来源:尧图企业网站定制
DeepSeek V4终于来了。从 R1 算起大家等了整整 15 个月。期间下周发布被调侃了无数轮搞得像追更一部永远不更新的番剧。现在靴子落地一次性放出两个版本——V4 Pro 和 V4 Flash全部标配 1M 上下文全部开源。简单列一下参数V4 Pro 总参数 1.6T1.6 万亿49B 激活V4 Flash 总参数 284B2840 亿13B 激活。在网页端和 APP 上Pro 对应「专家模式」Flash 对应「快速模式」。DeepSeek 自己对 V4 的定位相当坦诚。官方报告里白纸黑字写着Agent 能力勉强对齐 Claude Sonnet 4.5离 Opus 4.6、4.7 还有差距世界知识赶不上 Gemini-Pro-3.1推理性能倒是和 GPT-5.4 打得有来有回。整体判断是——发展轨迹约滞后前沿闭源模型 3 到 6 个月。这话由他们自己说出来我还挺意外的毕竟现在的 AI 圈子里这么说实话的厂商已经不多了。API 价格方面V4 Pro 比 V3.2 涨了约 6 倍V4 Flash 反而降了约 50%。另外提一句Coding Plan 依然没有不知道后续会不会安排上。以上是官方给的账本。下面进入实测环节。01一、编程3D 任务先跑一个 3D 前端的老活看模型在空间想象和逻辑推理上的功力。KEY SIGNAL提示词制作一个 3D 的雪山场景 HTML雪山中间有一座日式寺庙整体风格参考《塞尔达旷野之息》。一圈跑下来开源五杰各显神通。GLM-5.1、Qwen3.6-Plus 和 Gemini-3.1-Pro 属于同一梯队剩下几家稍逊一筹。细节上GLM-5.1 和 Qwen3.6-Plus 是最能打的——雪山粒子特效、日式建筑的还原度、对塞尔达风格的理解明显比其他模型高出一截。DeepSeek V4 Pro 在这个 case 里只能说中规中矩不出彩但也不翻车。我又补了一个 3D 魔方的经典 caseV4 能一次还原。不过说实话这个难度在当下已经不算挑战最新一批模型基本都能 one shot 跑通。02二、编程SKILLS 任务藏师傅今天开源了一个 PPT skill名字叫「guizang-ppt-skill」我只能说——真的离谱。生成的 PPT 是一个 HTML 文件几十 KB发谁谁就能在浏览器打开字体不丢、动画不崩。藏师傅自己是这么形容的这是我十年审美的压缩包。一点不夸张。我第一时间把这个 skill 怼进了 Claude Code然后切到 DeepSeek V4 Pro 跑了一个 case让它把我前一天的文章设计成 10 页 PPT。出来的效果——排版、风格、字体搭配每一页我都挑不出大毛病。略微改改文字用 Trae 或文本编辑器就能搞定这套 PPT 直接能上台。03三、编程网站开发这个 case 是让 V4 Pro 给我做一个摄影师作品集网站。我给它扔了一个文件夹的模特照片身份设定是我是拍模特广告的摄影师工作室叫「小逸摄影」目标是生成一个审美在线、有大片质感的作品网站。之前用 Qwen3.6-Plus 跑过同样的需求效果非常惊艳。这次换 V4 Pro 上——深色背景、Hero 全屏、网格画廊大方向上的审美判断基本和 Qwen3.6-Plus 在一个层级。但扣细节的话Qwen3.6-Plus 在 logo 设计、文字配色和交互动画上还是要更细腻一些。04四、AGENT 长程任务进入重头戏。还是我们的保留项目让 Claude Code 执行一个连环复杂任务——联网搜索 生成 Word 报告 调用 skill 搭建网站。KEY SIGNAL提示词联网搜索、调研张雪机车的发展轨迹尽量从权威信源获取信息。首先给我创建一份 5000 字的 Word 调研报告。然后调用 Knowledge Site Creator Skills 给这份报告创建一个知识学习网站页面高级审美。这次 V4 Pro 跑了整整 33 分钟很慢但确实跑完了。交付了两样东西一份 Word 报告一个知识学习网站带后端的那种。报告内容相当扎实。最近我一直在把 DeepSeek 当检索工具高频使用回答质量确实稳去年的幻觉问题已经大幅收敛。网站这边更让我惊喜——直接带了后端和数据库我往里面加数据就能真正用起来。以上四个 case 跑完总共烧了 450 万 tokens花了 10 块钱。蹲一个 Coding Plan真的蹲了好久了。05五、世界知识任务世界知识要系统测确实麻烦我先挑了一些冷门领域的问题问它全程关闭联网基本都能答得靠谱。一些没那么新但也不算旧的知识它也训进去了。但真正刚发生的事情——不行确实不知道。我问它训练数据截止时间它说是 2025 年 5 月。06六、写作任务写作测试用的是我日常最常干的事让 AI 续写。给一段风格鲜明的原文让它接下去 300 字。这段原文是我自己写的现在谁发我一张图我的第一反应都是这是不是 GPT 生成的人类社会大家能够坐下来一起讨论事情最基本的前提是我们活在同一个现实里对最基础的事实认知是一致的。而今天目光所及的一切都在崩塌。DeepSeek V4 Pro 的表现——还行但老毛病没改喜欢拽技术词锚点脚本图灵测试这些词老往外蹦读着就不像人话。GPT-5 就明显自然多了输出的东西有人味儿。GPT 也一直是我写作的主力模型不过用的时候要微调比如让它别老不是……而是……破折号和冒号也别没完没了地往上堆。Gemini-3.1-Pro 就……继续拉胯。堆了一堆成语不但没用还对不上原作的调性读起来割裂感拉满。上周我跟大家聊写作经验评论区一片哀嚎说 Gemini 3.1 / 3.0 远不如 2.5所言非虚。Claude-Opus-4.6——写作能力依然是天花板。07写在最后一轮测下来我对 DeepSeek V4 的总体评价是一般货色。这其实和他们自己的判断对得上——距离全球最顶尖的模型不分开源闭源大概还有 3 到 6 个月的身位差。官方文章里写了一句挺克制的话「不诱于誉不恐于诽率道而行端然正己。」翻译成人话就是不因为夸奖飘起来也不因为骂声慌神走自己的路把身板立正。但有意思的事情来了——今天的 AI 行业已经没什么人愿意接受一般货色这四个字了。你发一个新模型如果做不到吊打、碾压、重构一切舆论很容易直接定性为没意思。可是冷静下来想想这种期待本身就不太正常。技术的发展从来不是一根直线往上冲也不是永远指数增长。前进—倒退—前进—再前进—又倒退这才是常态。很多时候真正影响行业格局的反而是那些看着差一点点的版本稳了一点、可控了一点、生态完善了一点。DeepSeek V4 给我的感觉就是这样一个差一点点的版本。它不惊艳但它在补课——重写注意力机制对 Token 维度做压缩叠上自研的 DSA 稀疏注意力把上下文从 128k 一把推到 1M而且是全系标配。重改模型架构同时适配英伟达 GPU 和华为昇腾 NPU。重换后训练路径从 V3.2 的 SFT混合 RL切换到 On-Policy DistillationOPD——先练专家再做融合。同时死磕 Agent 能力对 Claude Code、OpenClaw、CodeBuddy 这些一线 Agent 产品做针对性优化。这些事情没有一件能上热搜。但总得有人去做。而这一次去做的人是 DeepSeek。本文部分图片来源于网络版权归原作者所有如有疑问请联系删除。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑