上篇《5毛钱的 deepseek-v4-flash 能干什么》拿它做了一次单点巡检证明“便宜模型也能干大活”。但那只是一次任务样本太小。这次我直接把 Codex 的主力模型换成 deepseek-v4-flash连续跑了 48 小时真实工作然后把所有会话记录翻出来统计多少 token、缓存命中多少、reasoning 占了多少、到底交付了什么再和之前用 gpt-5.6-sol 的会话对比。这篇不是评测报告是一次带数据的真实使用复盘。起因codex没额度了一直用gpt-5.6-sol 被频繁的重置惯坏了三天额度就见底了谁知道这次死活也不重置都已经超过4天半了。用 gpt-5.6-sol 做主力质量确实好但目前看不控制的话周额度绝对是不够用的。deepseek-v4-flash 的官方单价是缓存命中 0.02 元/百万、未命中 1 元/百万、输出 2 元/百万比 GPT 系 API 的 5 / 0.5 / 30 美元每百万便宜一到两个数量级。便宜的前提是缓存要命中——而 Codex 这类 agent 每一轮都要把整个上下文重发一遍缓存命中率直接决定真实账单。上篇的 94% 命中已经让我觉得可行这次干脆让它当主力跑两天。48 小时干了什么三个线程一长串可验证的交付这两天实际主要开了三个 deepseek-v4-flash 的会话都是真实工作下面是这些会话的主要内容会话 A先处理“测试账号某页面报错”的工单最后交付了「某服务成功率自动下线机制」自动合并PR并提交测试环境会话 B恢复一个之前中断的由gpt-5.6-sol一直跑了一周的某服务开发的 goal持续24小时完成若干子任务并推进到生产侧会话 C从“网站上线验证”开始陆续做了线上环境排查、某服务线上问题修复提交若干PR 、某仓库CI 流程精简、某仓库smoke test增加容错、给同事做的十几个代码的PR review 与 approve、某服务代码的整体分析最后还建了一个服务的上线 PR。没有一次会话是因为模型“卡住”或上下文溢出中断的。三个线程都从 08-03 下午一路跑到了 08-05 中午连续 46 到 48 小时。数据怎么说14 亿 token99.4% 缓存命中约 40 块钱从 Codex 会话记录rollout JSONL里统计三个线程合计指标数值事件数17,535累计输入 token1,411,089,346其中缓存命中1,402,989,95299.4%未命中输入8,099,394输出 token1,837,393其中 reasoning1,052,75957.3%按 DeepSeek 官方单价折算未命中输入 809 万 × 1 元/百万 ≈ 8.1 元缓存输入 14.03 亿 × 0.02 元/百万 ≈ 28.1 元输出 183.7 万 × 2 元/百万 ≈ 3.7 元合计 ≈ 40 元两天高强度工程开发覆盖验证、修复、CI、Review、部署一整套流程API 等价成本大约四十块钱。这是官方 API 口径的估算不是 Codex 订阅账单但量级是清楚的。和 gpt-5.6-sol 对比能比的只有这些维度我翻出之前用 gpt-5.6-sol 做的连续一周某服务开发的会话作为对照。中途换过登录resume 看不到历史只能从本机会话目录里把当时的 rollout 文件找回来。那条主线线程的具体内容就不细说了任务类型跟这两天基本一致都是工程实现、运维排查和审计。维度deepseek-v4-flash近48hgpt-5.6-sol之前一周开发主线事件数17,535224,489累计输入 token14.11 亿72.4 亿缓存命中率99.4%97.1%输出 token183.7 万1,502.9 万reasoning 占比57.3%23.8%会话跨度连续 46–48h跨一周多的主线线程任务类型工程实现 / 运维 / Review工程实现 / 运维 / 审计几个能直接比的点缓存命中率99.4% 对 97.1%。在每轮重发全上下文的场景下这 2.3 个百分点的差距对成本的影响被 DeepSeek 的缓存定价放大了几十倍。reasoning 占比57% 对 24%。deepseek-v4-flash 明显“想得多”输出预算里有一半多是思考 token。这不是缺点但意味着max_tokens必须留足否则会出现上篇那种“正文被 reasoning 吃光”的现象。长会话续航deepseek 三个线程连续跑两天没有中断gpt-5.6-sol 那边是跨一周多的主线线程22.4 万事件说明长线程本身两边都扛得住。成本量级按官方 API 价同样规模的输出量级差约 40 倍。必须诚实两条样本时长和规模不同所以“每个任务花多少 token”这种指标我不列。上面只列不受这些差异影响的维度缓存命中率、reasoning 占比、续航以及用真实交付物说话的结果。我的评价值不值边界在哪值得。至少在我这种“长上下文、多仓库、多任务串行”的使用方式里deepseek-v4-flash 表现稳定两天里把从线上验证到 PR 合并的完整链路都走通了没有一次因为模型问题返工。99.4% 的缓存命中率说明它的上下文复用做得很好这也是它能便宜到 40 块跑两天的根本原因。边界有三条reasoning 占比高输出预算要留足。57% 的输出是思考 token调用方如果还按“输出 token 正文长度”来设预算会踩上篇 glm-5.2 那种坑。缓存是生命线。14 亿输入里 99.4% 靠缓存兜着一旦缓存失效换任务、改系统提示、跨会话成本会向未命中价靠拢量级立刻上来。长会话里中途切换上下文要小心。这是真实使用样本不是受控评测。之前那条主线里“审计/评审”类任务占比更高deepseek 在这类任务上还没有同等规模的对照样本不下结论。局限样本是我自己的真实工作两批任务的时长与规模不同48h 对一周多对比维度受限成本是 API 等价估算DeepSeek 官方价 / GPT-5.5 参考价不是 Codex 订阅实际账单48 小时没出问题不构成对更长或更复杂任务的承诺。下一步我打算把 deepseek-v4-flash 用到“跨周的长期 goal”上重点观察缓存命中率和长上下文漂移——这两个才是它能不能长期当主力的真正试金石。