最近在(titiai.cn)上试了 Grok 4.3 和 Claude 4.8 搭配使用,发现单模型审查有盲区,两个一起用覆盖率高了不少。记录一下真实感受。

代码审查:一个主审一个复审
Claude 4.8 做主审,扫描边界条件和并发风险,速度也快。Grok 4.3 做复审,从不同角度检查 Claude 可能漏掉的问题。
Claude 偏保守,有时候会把没问题的代码也标出来。Grok 风格更自由,能从不同视角发现盲区。两个搭配用,审查覆盖率比单用一个高 30% 左右。
架构优化:分别出方案对比
Claude 偏保守,倾向于最小改动——能不改就不改,改了也要保持兼容。Grok 更大胆,有时候会建议推倒重来。
我现在是让两者分别出方案,对比差异。Claude 的方案稳妥可以直接执行,Grok 的方案参考但要谨慎评估。有时候 Grok 能给出 Claude 想不到的角度,但也有过于激进的时候。
它们的共同短板
工时预估两个都不靠谱,不要信。性能定量分析也是编数据。并发代码两个都有风险,Claude 比 Grok 强(20% vs 60% 有问题)但也不是 100% 可靠。数据库调优两个都偏弱。
这些短板只能靠人来补,不能指望 AI。
和 GPT-5.6 怎么搭配
GPT-5.6 在需求分析和测试生成上最强,Claude 4.8 在代码生成和审查上最强,Grok 4.3 在实时信息和不同视角上有优势。三个搭配效率最高:GPT 做分析,Claude 做实现和主审,Grok 做复审。
单模型有盲区,双模型互补才能兜住。关键是搞清楚每个模型擅长什么,让它们各干各的活。