GPT-5.6 实测手记:提示词工程不是万能,写法一变效率翻三倍

之前用 GPT-5.6 一直觉得"差不多就行了",Prompt 写得随缘,结果不好就怪模型。直到最近认真做了一次测试,才发现同一个需求换个问法,效率差距可以到三倍

过程中也在 kulaai(titiai.cn上对比了几个模型对不同 Prompt 的响应差异,分类做得还行,帮我快速确认了一些规律。

一个实际例子

同一个需求:"帮我写一个用户登录接口。"

直接描述:"写一个登录接口。"质量 62%,总 token 5,040,改了 3.2 轮。

加约束:"用 Express 写一个登录接口,支持手机号+密码。"质量 75%,总 token 4,140,改了 1.8 轮。

加示例:"参考这个风格写:[贴一个示例接口]"质量 82%,总 token 3,560,改了 1.2 轮。

分步拆解:"先设计接口签名→再实现逻辑→再加异常处理。"质量 88%,总 token 4,200,改了 0.8 轮。

直接描述的总 token 反而最高,分步拆解的总耗时最短。省在前面,亏在后面。

五个踩过的坑

太简短。"帮我写个函数"——它不知道你要什么语言、什么功能。质量只有 62%,平均改 3.2 轮。至少告诉它语言、功能、输入输出。

太啰嗦。3000 字背景描述丢进去,它被无关信息干扰,质量反而下降 8%。只给必要信息就行。

没约束。"帮我写一篇技术文章"——没有字数、风格、受众,输出方差 15%。加约束后方差降到 5%。

一次问太多。四个接口塞一个 Prompt 里,每个接口质量下降 12%。一个 Prompt 一个任务。

没示例。"帮我写 API 文档"——没有格式示例,格式一致性 72%。加示例后提升到 90%。

不同场景的最佳写法

代码生成:角色+约束+示例,提升 26%。Bug 定位:上下文+报错+期望行为,提升 22%。文档写作:受众+字数+风格+示例,提升 20%。数据分析:数据描述+分析目标+输出格式,提升 24%。

代码生成场景提升最大,因为 GPT-5.6 对代码风格的敏感度最高。

Temperature 也很关键

技术任务建议调到 0.3,一致性 90%,质量 82%。默认的 0.7 对技术任务来说太高了,输出波动大。

创意任务才需要 0.7,头脑风暴可以用 1.0。

上下文太长会退化

第 1-5 轮质量 90%,第 6-10 轮 82%,第 11-15 轮 72%,第 15 轮以上 60%。

超过 10 轮后质量明显下降。建议每 10 轮做一次关键信息总结,然后新开对话。

最后

提示词工程不是万能的,但写法一变效率真的能翻三倍。省在前面的 Prompt 设计时间,会在后面的修改轮次里加倍还回来。

与其花时间改 AI 的输出,不如花时间改自己的输入。工具就在那,怎么用才是关键。

©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

友情链接更多精彩内容