花大价钱订阅的顶级编码服务,最终输给了一个"快"字。两张真实截图,说明白这个选择

我买了 Codex Max 20 Pro,但这周开始,我的主力开发模型就换成了 DeepSeek-V4-Flash 正式版。 不是 Codex 不好,是 Flash 太快了——快到什么程度?快到文章后面那两张截图,看完你就懂。
先说清楚:钱是真花出去了
上个月初,我给自己办了一张 Codex Max 20 Pro 的订阅。理由和很多人一样:它是当下顶配的编码服务,Agent 能力、长上下文、处理复杂工程任务的宣传样样齐全,价格也是实打实的不便宜。想着"贵的总归是好的,一步到位",痛痛快快付了钱。
最初几天确实新鲜。界面流畅、任务完成度在线,一些大型重构场景表现得体面。我一度以为,AI 编程的"终极形态"也就这样了——直到我顺手把 DeepSeek-V4-Flash 正式版接回了 Claude Code。
7 月 31 日 DeepSeek-V4-Flash 正式版上线,1M 上下文,官方基准全面超过自家 V4-Pro-Preview、赢了 GLM-5.2。我本来只是抱着"测一测"的心态接上去,结果一用就再也没换回去。
先认识:DeepSeek-V4-Flash 正式版是什么
可能还有朋友没关注到这个新模型,先补个背景。DeepSeek-V4-Flash 是 DeepSeek 在 7 月 31 日正式上线公测的编码主力模型,官方定位就是 Agent 场景,有几个点值得先交代:
-
1M 上下文:正式版提供 1M 上下文的版本(
deepseek-v4-flash[1m]),长对话、大项目上下文都不怵——这正是我敢把整个工程交给它的底气 - 官方数据确实能打:上线时官方直接甩出了与 V4-Pro-Preview、GLM-5.2 的 Agent 基准横评,全面超越自家 Pro-Preview,9 项基准全胜 GLM-5.2
- 最让我意外的是它的实现路径:V4-Flash-0731 的模型结构、尺寸和 preview 版本完全一致,只重新做了后训练(post-training)——没有加参数、没有换架构,纯粹靠训练方法论就把 Agent 能力拉到了超过自家 Pro 的程度,这也说明模型能力提升不一定只靠堆规模

我当时本来只是抱着"测一测"的心态把它接回 Claude Code,结果这一测,就再也没换回去。
为什么?因为"快"这个字,对日常开发是致命的
买之前我想象中的体验是:顶级模型 + 顶级服务 = 顶级生产力。
用了几天之后我悟了:模型能力 95 分和 92 分的差别,你一天可能都感觉不到;但响应快 3 倍和慢 3 倍,你十分钟就能感知到。
Codex 的问题不在能力,在于它慢。每次提需求,都要等一段明显的心跳空白期——思考、规划、再动手。如果你像我一样一天要在编辑器里进出几十个来回,这种等待会不断打断你的思路。等它出结果的时间,够你自己想清楚下一步怎么做了。
DeepSeek-V4-Flash 给我的体感是完全反过来的:你提需求、它干活、你看结果,节奏跟得上你的思维。 响应几乎即时,长对话不拖沓,1M 上下文扛着项目代码也流畅。这种感觉用一句话形容就是——你还没走神,它已经干完了。

两张截图:一个电话的功夫,功能就做完了
光说"快"太空泛,上证据。下面这两张是我真实工作的截图,都是 Flash 干的活。


第一张,是给 JeecgBoot 的 Online 图表加"复制"功能的完整任务。 后端:新增 POST /online/graphreport/head/copy 接口、Service 接口 + 实现(复制图表头 + 字段 + 参数三张表,事务、缓存清空、重名去重、名称加"副本",异常处理一个不少);前端:API 封装 + 列表页"复制"按钮 + 确认弹窗 + 刷新逻辑。前后端 5 个文件,全程耗时 2 分 11 秒。
截图里我自己画的红框和批注还记得很清楚——当时接了个电话回来,发现活已经干完了,顺手就在截图里写了句"真快啊,我接了个电话,就完事了!"这不是段子,是当天的真实反应。


第二张,是个日常小任务: 扔给它一个删除接口的 URL,问"这个接口有没有权限注解"。它思考了 11 秒、搜了 3 处代码,把 OnCgformHeadController.delete 方法翻出来,@RequiresPermissions("online:form:delete")、@AutoLowApp 注解、类级权限配置,连"类里其他方法也都带注解、权限体系完整"这种补充结论都给了。整个回答 16 秒完成。
16 秒查完一个接口的权限体系、2 分 11 秒做完一个前后端完整功能——这就是我这几天的日常。这种节奏下,我实在没有理由再切回那个让我等心焦的 Codex。
能力没有缺席:它不是"快而弱"
有人可能会问:快是快,能力跟得上吗?这正是我敢换的理由——Flash 是"够强 + 最快"的那个,不是"最快但凑合"的那个。
看官方给的 Agent 基准横评(V4-Flash 正式版 vs V4-Pro-Preview vs GLM-5.2):
| 基准测试 | V4-Flash 正式版 | V4-Pro-Preview | GLM-5.2 |
|---|---|---|---|
| Terminal Bench | 82.7 | 72.1 | 81.0 |
| CyberGym | 76.7 | 52.7 | - |
| Toolathlon | 70.3 | 55.9 | 59.9 |
| DSBench-Hard | 59.6 | 31.1 | 54.5 |
| DeepSWE | 54.4 | - | 46.2 |
| NL2Repo | 54.2 | - | 48.9 |

全面压制自家 Pro-Preview,9 项基准全胜 GLM-5.2。而且有个耐人寻味的细节:Flash 正式版的模型结构和 preview 完全一致,没有加参数、没有换架构,纯粹重新做了后训练——靠训练方法论就把 Agent 能力推到超过自家 Pro 的程度。这说明 DeepSeek 团队这波是真的很用力。
落到真实使用上,我这几天的感受是:改 Java 改完自动编译验证、批量改 YML 配置缩进分毫不差、跨模块追版本号沿着继承链往上游找、范围控制干净不越权——上个月我吐槽过的那些"工程基本功"问题,正式版里一个都没再遇到。
性价比:这账不用算,体感就赢了
Codex Max 20 Pro 的价格摆在那儿,按月真金白银地扣。DeepSeek-V4-Flash 的 API 呢?便宜到几乎可以忽略不计——而且我有 1M 上下文的版本可用,长对话、大项目上下文都不怵。
同一个 Claude Code 工作流,模型从"贵"换成"快",体验不降反升,成本反而断崖式下降。 这种落差体验一次,就回不去了。
短板也照说:它不是没有边界
既然是实测,公道话也得讲清楚:
- 图片理解还是明显短板。 涉及读界面截图、分析配图这类任务,Flash 目前处理不了,得降级到外部视觉模型。对纯文本编程影响不大,但想做全栈视觉任务的朋友要注意这个边界
- "会验证、会追查"的工程习惯能不能长期保持,比能力本身更值得观察。 毕竟 Flash 正式版才上线几天,长周期稳定性还需要更多时间验证
- Codex Max 20 Pro 不是一无是处。 它在部分深度重构场景确实有独到之处,我只是说日常主力选型上,Flash 的"快"让它赢了
总结:贵不等于生产力,"快"才是
这几天下来,我对"顶级订阅"这件事的心态已经彻底变了。
以前我的选型逻辑是:能力天花板越高越好,价格贵点没关系。现在我的逻辑是:能力到第一梯队就够用,速度决定日常生产力,价格决定能不能无脑用。 三个维度里,DeepSeek-V4-Flash 占了两项——它足够快,也足够便宜,能力还站在第一梯队。
Codex Max 20 Pro 的订阅我暂时没退,偶尔深度的重构任务还会切过去用。但打开编辑器的那一刻,默认接上的永远是 DeepSeek-V4-Flash。不是我喜新厌旧,是"快的不可思议"这件事,一旦体验过就真的回不去了。