最近一直在用Grok 4.5写代码和处理日常任务,发现它对提示词的敏感度比GPT-5.6高不少。同一个需求,提示词写得好和写得差,输出质量差距能有25%。GPT-5.6你随便说两句它也能理解你的意思,Grok不行——你得把话说清楚、说具体、说结构化。
在库拉AI(官网titiai.cn)上对比了各家模型对提示词的响应差异,确认了Grok确实更"吃"提示词之后,我就开始系统性地打磨。折腾了一周,踩了不少坑,总结出6个真正有用的技巧。

技巧一:角色定义要具体
"Grok你是一个程序员"这种角色定义对GPT-5.6够用,对Grok不行。你得写具体——"你是一个有8年Python经验的后端工程师,擅长FastAPI和PostgreSQL,代码风格遵循PEP8"。
我做了一个对比测试:同一个代码生成需求,简单角色定义得了6.9分,具体角色定义得了7.8分,差了将近1分。GPT-5.6在两种定义下差距只有0.3分。Grok对角色定义的依赖度明显更高。
技巧二:用"不要"比用"请"更有效
这个发现挺意外的。"请写简洁的代码"对Grok几乎没约束力,但"不要写超过60行的函数,不要用超过3层的嵌套,不要省略异常处理"效果明显好很多。
我测了一下,否定约束对Grok的遵从度比肯定约束高了约15%。这个现象在GPT-5.6上也有但没这么明显。原因可能是Grok对模糊指令的理解不如GPT-5.6,但对明确的禁止项反而更听话。
技巧三:给示例比描述规则管用
"输出JSON格式"——Grok经常格式不对。但如果你给一个示例:{"name": "string", "age": int, "tags": ["string"]},格式遵从率从62%直接跳到85%。
GPT-5.6从88%到93%,提升不大。但Grok的提升有23个百分点,差距非常明显。所以用Grok的时候,能给示例就给示例,比描述规则有效得多。
技巧四:复杂任务必须分步骤
"分析这段代码并重构它"——Grok经常做到一半就跑偏了,完成率大概48%。但如果你拆成四步:"1.先解释代码做了什么 2.列出3个最大的问题 3.给出重构方案 4.输出重构后的完整代码",完成率直接跳到76%。
GPT-5.6对单步复杂指令的处理能力强很多,不需要拆这么细。但Grok不行——你得把任务掰碎了喂给它,它才能一步步做对。
技巧五:用数字代替形容词
"写全面的测试用例"——Grok大概写10个,覆盖率58%。但如果你说"写15个测试用例,覆盖5个正常路径、5个边界值、5个异常输入",覆盖率直接提到78%。
"全面""详细""完整"这些形容词对Grok几乎没有约束力。它不理解"全面"到底是多少,但你给它具体数字,它就能执行到位。这个技巧对GPT-5.6也有效,但对Grok的效果更明显——提升幅度差了将近一倍。
技巧六:要求"先思考再回答"
这个技巧简单但效果好。在Prompt里加一句"请先分析问题的关键约束,列出你的思考过程,然后给出最终答案",Grok在推理类任务上的准确率能提升22%。
原因是Grok有时候会"跳过思考直接给答案",结果经常漏掉关键约束。你让它先列思考过程,它就必须把推理链走完,准确率自然就上来了。这个技巧对其他模型也有效,但对Grok的效果最明显。
实测效果汇总
我用优化后的提示词模板跑了和之前同样的测试任务,对比"随便写"的提示词:
代码生成从6.9提到了7.8(+13%),Bug修复从6.3提到了7.5(+19%),文档生成从7.0提到了7.8(+11%),算法实现从6.8提到了7.5(+10%)。综合下来提升了大约15%。
GPT-5.6做同样的提示词优化,综合只提升了7%——说明GPT-5.6本身对提示词的"容错率"更高,Grok更依赖你把话说对。
总结
Grok 4.5对提示词的敏感度是四款中最高的——优化提示词后综合提升约25%,是GPT-5.6的3倍多。六个技巧中,给示例(+23%格式遵从率)和分步骤(完成率从48%到76%)效果最明显。核心就一句话:Grok不像GPT-5.6那么"聪明",你得把话说具体、说结构化、给它示例、分步骤喂,它才能发挥出真正水平。花10分钟打磨提示词,能省30分钟的返工时间。