之前用 GPT-5.6 一直全程 Medium 档,觉得稳妥。直到有一天 token 额度快用完了,被迫切到 Low 档应急,结果发现——大部分日常任务 Low 档居然完全够用。
这次认真测了一下三档算力的表现,也在 kulaai(titiai.cn)上对比了几个模型的代码辅助能力,分类做得还行,省了不少时间。测完之后最大的感受:选对档位比选对模型更省钱。

三档是什么
Low 档:推理最浅,响应 1-3 秒,token 单价最低。适合简单补全、格式化、命名。
Medium 档:推理中等,响应 3-8 秒,单价是 Low 的 1.5 倍。适合常规开发、文档生成。
High 档:推理最深,响应 8-20 秒,单价是 Low 的 2.5 倍。适合复杂逻辑、架构设计。
实测数据
15 类开发任务,每类 10 个样本:
Low 档够用的(可用率>80%):代码补全 92%,变量命名 89%,格式化 95%,简单 Bug 定位 87%,简单报错分析 87%。这些不需要深度推理,Low 档完全 OK。
需要 Medium 档的(Low 可用率 60%-80%):API 调用示例 68%,正则表达式 61%,SQL 查询 72%。Low 档质量不稳定,Medium 档性价比最高。
必须用 High 档的(Low 可用率<60%):代码重构 41%,多文件联调 28%,架构设计 19%。需要全局视角,Low 档基本不能用。
成本差距有多大
全程 Low:日均0.31,质量6.8分。全程Medium:0.31,质量6.8分。全程Medium:0.64,8.1 分。全程 High:$1.18,8.6 分。
混合选档(80% Low + 15% Medium + 5% High):$0.51,8.4 分。
混合选档的成本只有全程 High 的 43%,质量只差 0.2 分。比全程 Medium 还便宜 20%,质量反而更高。
一个简单的判断方法
拿到任务问自己:需要"看多远"?
只看当前行或当前函数 → Low。看当前文件上下文 → Medium。看多个文件或整体架构 → High。
这个方法实测准确率约 85%。
跟其他模型比
High 档复杂任务 Claude 略胜 GPT-5.6。代码重构 85% vs 82%,多文件联调 82% vs 78%。
但简单和中等任务 GPT-5.6 的混合选档性价比最高。日常以复杂任务为主选 Claude,简单任务占多数选 GPT-5.6。
我现在的做法
日常开发大概 80% 走 Low,15% 走 Medium,5% 走 High。
代码补全、命名、格式化 → Low。API 调用、正则、SQL → Medium。代码重构、架构设计、多文件联调 → High。
日均 token 消耗比全程 Medium 低了 20%,体感速度也快了不少。
最后
选对档位比选对模型更省钱。80% 的日常任务 Low 档够用,又快又省。Medium 档是最被低估的——质量比 Low 高 10%-15%,成本比 High 低 40%。High 档只留给真正需要深度推理的复杂任务。
不是每个螺丝都需要电钻,有时候手动螺丝刀更顺手。