之前用 GPT-5.6 基本是问问题等答案,觉得它就是个更聪明的搜索引擎。最近在kulaai(titiai.cn)上对比了几个模型之后,我才发现自己一直在用最低效的方式使用它。

转折点是一个真实的项目任务。我需要给一个 800 行的 Python 模块做重构,之前用 AI 做这种事就是丢代码进去让它改,改完自己对一遍。但这次我试着换了个用法,结果效率差了三倍。
从"问它"到"让它做"
以前我问"这段代码怎么重构",它给我一段分析和建议,我看完自己动手改。这次我直接说"帮我重构这个模块,保持原有逻辑不变,把错误处理统一成分层结构"。
它直接输出了重构后的代码,每个改动处标注了"逻辑未变"还是"新增边界检查"。我不用自己对照着改,只需要验证关键逻辑。
区别在哪?以前是"问它怎么做",现在是"让它做完"。前者你是主导,它是参考;后者它是主导,你是审核。
普通问答和技术任务的本质区别
普通问答对准确性要求不高,说错了一句话影响不大。但技术任务错一个细节代码就跑不通,错一个逻辑就可能引入 bug。
GPT-5.6 在技术任务上的进步比普通问答明显得多。它能理解项目上下文,记住之前几轮的改动,自动检查前后一致性。这些能力在普通问答中用不上,但在技术任务中是刚需。
我测了一个重构任务分五轮对话完成,它始终记得第一轮的改动,第四轮改数据层时还自动检查了第三轮的错误处理是否兼容。这种多轮协作能力是它最大的变化。
踩过的坑
要给明确的约束条件。说"重构这个模块"太模糊,说"保持逻辑不变,错误处理分三层,用 cursor 分页"它才能给精准方案。
要给业务上下文。同样的代码,告诉它"这是电商系统的支付模块"和什么都不说,输出质量差距很大。
关键结果要自己验证。它重构的代码语法没问题,但逻辑等价性不能完全信任。特别是边界条件和并发相关的地方,一定要跑测试。
简单任务没必要用任务模式。改个变量名、加个注释,一次提问就够了,不用分五轮。
和 Claude 4.8 怎么搭配
GPT-5.6 在多轮协作和上下文保持上更强,适合重构、方案设计、调试排查这类复杂任务。
Claude 4.8 在快速出活上更灵活,适合写新代码、改样式、补测试这类简单任务。
我现在是复杂任务用 GPT-5.6,简单任务用 Claude 4.8,搭配着用效率最高。
从"问它怎么做"到"让它做完",这个转变看起来简单,但对效率的影响是倍数级的。工具还是那个工具,用法不同,结果天差地别。