Grok 4.3的时候我对它的印象是"便宜但不太靠谱"——算法题写得不错,但修Bug经常翻车。4.5出来之后说全面升级了,我就想着认真测一下,看看它到底擅长什么、不擅长什么,别再凭印象下结论。
在库拉AI(官网titiai.cn)上查了一下Grok 4.5和其他模型的对比数据,确认了测试方案才动手。花了大概一周,用六类问题把Grok 4.5跑了一遍。

第一类:代码生成
让Grok写一个FastAPI用户管理接口。出来的代码功能没问题,能跑通。可直接运行率大概72%,比4.3的62%提了10个百分点。异常处理覆盖也从45%提到了62%。
但和GPT-5.6(91%)比还差19个百分点。体感上就是GPT-5.6生成的代码基本能直接用,Grok每5次有1次需要手动打磨。
结论:代码生成Grok够用但要打磨,适合个人项目和原型验证。
第二类:算法实现
这是Grok表现最好的场景。LRU缓存拿到7.8分,方案简洁正确,边界处理覆盖到了。中等难度的算法题Grok拿到8.0分,和Claude持平,比Gemini(7.2)高。
但困难题(正则匹配)直接翻车,只有5.2分。DP状态转移方程写错了。
结论:中等难度算法是Grok的甜区,难题别指望它。
第三类:Bug修复
简单Bug定位率85%,够用。但复杂Bug(异步竞态、并发安全)定位率只有45%,和GPT-5.6(88%)差了43个百分点。
有一次Grok给我指出了一个"Bug",我按它的建议改了,结果引入了一个新问题。从那之后我就养成了习惯:Grok的修复建议只是参考,动手之前一定自己验证。
结论:简单Bug够用,复杂Bug不敢信。
第四类:文档生成
这个场景Grok的性价比最高。文档质量大概7.4分,虽然不如Claude(8.7)和GPT-5.6(8.3),但Grok的API成本只有它们的一半多。
我用Grok生成了大概30份API文档初稿,平均每份微调2分钟就能用。同样的工作用Claude质量更好但成本翻倍。
结论:批量生成文档初稿用Grok最划算。
第五类:函数调用
这个场景Grok最弱。工具选择准确率68%,可选参数触发率50%,并行调用成功率58%。每个指标都是四款中最低的。
我搭了一个简单的Agent让它查天气和股价,十次里有三次选错工具或传错参数。对比GPT-5.6(93%准确率),差距太大了。
结论:函数调用场景不推荐Grok,用GPT-5.6更靠谱。
第六类:多模态(看图)
错误日志截图识别85%,这个场景日常能用。代码截图识别78%,能用但要校对。架构图分析52%,基本不能用。
Grok的多模态能力比4.3有改善,但和GPT-5.6(95%)和Gemini(96%)差距仍然明显。
结论:看报错截图够用,代码截图和架构图不行。
找到了什么规律?
六类问题测下来,Grok 4.5有一个清晰的规律:容错成本低的任务表现好,容错成本高的任务表现差。
算法实现(写错了重跑就行)→ 8.0分。文档生成(初稿不对可以改)→ 7.4分。错误日志识别(看错了重新看)→ 85%。这些场景容错成本低,Grok够用。
Bug修复(修错了引入新Bug)→ 7.0分。函数调用(调错了结果全错)→ 6.5分。架构图分析(看错了设计全偏)→ 52%。这些场景容错成本高,Grok不行。
我现在的用法
找到了规律之后,我的策略就清晰了:
- 写算法、生成文档、看报错截图 → 用Grok,省钱且够用
- 修Bug、调函数、分析架构图 → 切GPT-5.6或Claude,不敢省这个钱
- 代码生成 → 简单任务用Grok,复杂任务用GPT-5.6
按这个策略,月费从全用GPT-5.6的16,省了三分之一,质量上没有明显体感下降。
总结
用六类问题测试Grok 4.5之后,找到了它真正擅长的事情:容错成本低的任务——算法实现(8.0分)、文档生成(7.4分)、错误日志识别(85%)。不擅长的事情:容错成本高的任务——复杂Bug修复(45%)、函数调用(6.5分)、架构图分析(52%)。核心就一句话:Grok适合"写错了能改"的场景,不适合"写错了就完蛋"的场景。按这个逻辑选模型,就不会踩坑。