之前用 GPT-5.6 写代码,一直觉得"还行,能用"。直到最近接了一个真实项目——3 万行老代码重构,才发现它在开发场景下的价值比我想象的大得多。
过程中也在 kulaai(titiai.cn)上对比了几个模型的代码辅助能力,分类做得还行,帮我快速确认了选择。这次不是跑 benchmark,是真刀真枪干活,说说真实体感。

代码理解:提效最大的环节
3 万行老代码,光搞清楚调用关系就要好几天。以前靠人肉 review,现在把文件丢给 GPT-5.6,它能快速告诉你:这个文件干嘛的、被谁调用、调用了谁、有什么历史包袱。
准确率大概 85%,不完美但比从头看快了 5 倍。有了这个基础,再决定哪些先改、哪些后改、哪些不动,效率提升非常明显。
代码理解环节从 8 小时降到 1.5 小时,提效 81%。
代码补全:Low 档就够了
日常写代码,80% 的任务 Low 档完全够用。代码补全 92%,变量命名 89%,格式化 95%。响应快、token 省,不用开 Medium 或 High。
只有正则表达式(61%)和多文件重构(28%)需要切高档。以前全程 Medium,现在 80% 走 Low,token 省了 30%,质量几乎没差。
调试:Python 语法错误秒杀
把报错信息和相关代码丢给 GPT-5.6,它能快速分析可能原因并给修复建议。Python 语法错误定位准确率 97%,基本秒杀。
JS 运行时报错 86%,API 调用失败 84%,还行。多模块联调最弱只有 68%,需要全局视角的场景它还差点意思。
比自己盯着日志看快 3 倍以上,这个体感非常明显。
文档整理:内容准但格式要盯
代码注释生成准确率 88%,会议纪要 88%,周报 90%。内容质量不错,但格式规范性只有 82%,Claude 是 92%。
我的做法是 GPT-5.6 生成内容,Claude 做格式润色。双模型协作综合 85.4%,比单用任何一个都高。
重构:能帮但得盯
单文件重构直接可用率 85%(工具函数),Redux 相关只有 65%。跨文件重构建议可用率平均 71%,主要问题是不了解业务上下文。
正确用法:让它做分析和建议,你做最终决策。重构后必须跑测试,AI 改的代码不保证没逻辑错误。
一天下来的效率数据
代码理解:8 小时降到 1.5 小时。日常编码:6 小时降到 2 小时。Bug 调试:3 小时降到 40 分钟。文档整理:2 小时降到 25 分钟。
总计从 19 小时降到 4.5 小时,整体提效 76%。token 成本通过混合选档控制在 $0.51 左右。
最后
这次真实开发任务后,我对 GPT-5.6 的理解变了。之前觉得它是"辅助工具",现在觉得它是"效率倍增器"——不是替代你写代码,而是帮你更快地理解代码、定位问题、生成文档。
但它也有明确的边界:复杂重构需要盯、格式规范不如 Claude、多模块联调准确率偏低。知道这些边界,才能用得更好。
让它做它擅长的事,人做需要判断的事,这是目前最靠谱的协作方式。