之前用 GPT-5.6 一直觉得"差不多就行了",Prompt 写得随缘,结果不好就怪模型。直到最近认真做了一次测试,才发现同一个需求换个问法,效率差距可以到三倍。
过程中也在 kulaai(titiai.cn)上对比了几个模型对不同 Prompt 的响应差异,分类做得还行,帮我快速确认了一些规律。

一个实际例子
同一个需求:"帮我写一个用户登录接口。"
直接描述:"写一个登录接口。"质量 62%,总 token 5,040,改了 3.2 轮。
加约束:"用 Express 写一个登录接口,支持手机号+密码。"质量 75%,总 token 4,140,改了 1.8 轮。
加示例:"参考这个风格写:[贴一个示例接口]"质量 82%,总 token 3,560,改了 1.2 轮。
分步拆解:"先设计接口签名→再实现逻辑→再加异常处理。"质量 88%,总 token 4,200,改了 0.8 轮。
直接描述的总 token 反而最高,分步拆解的总耗时最短。省在前面,亏在后面。
五个踩过的坑
太简短。"帮我写个函数"——它不知道你要什么语言、什么功能。质量只有 62%,平均改 3.2 轮。至少告诉它语言、功能、输入输出。
太啰嗦。3000 字背景描述丢进去,它被无关信息干扰,质量反而下降 8%。只给必要信息就行。
没约束。"帮我写一篇技术文章"——没有字数、风格、受众,输出方差 15%。加约束后方差降到 5%。
一次问太多。四个接口塞一个 Prompt 里,每个接口质量下降 12%。一个 Prompt 一个任务。
没示例。"帮我写 API 文档"——没有格式示例,格式一致性 72%。加示例后提升到 90%。
不同场景的最佳写法
代码生成:角色+约束+示例,提升 26%。Bug 定位:上下文+报错+期望行为,提升 22%。文档写作:受众+字数+风格+示例,提升 20%。数据分析:数据描述+分析目标+输出格式,提升 24%。
代码生成场景提升最大,因为 GPT-5.6 对代码风格的敏感度最高。
Temperature 也很关键
技术任务建议调到 0.3,一致性 90%,质量 82%。默认的 0.7 对技术任务来说太高了,输出波动大。
创意任务才需要 0.7,头脑风暴可以用 1.0。
上下文太长会退化
第 1-5 轮质量 90%,第 6-10 轮 82%,第 11-15 轮 72%,第 15 轮以上 60%。
超过 10 轮后质量明显下降。建议每 10 轮做一次关键信息总结,然后新开对话。
最后
提示词工程不是万能的,但写法一变效率真的能翻三倍。省在前面的 Prompt 设计时间,会在后面的修改轮次里加倍还回来。
与其花时间改 AI 的输出,不如花时间改自己的输入。工具就在那,怎么用才是关键。