我的理论:为什么克劳德与其他模型如此不同

我有一个理论,解释为什么 Claude(特别是 Opus 4.5)的手感与其他型号如此不同。(讽刺的是,我是通过 Google Antigravity 发现它的,试用了 Gemini 3 Pro,并没有爱上它,但后来试用了 Opus,突然就觉得很对劲。)

感觉非常条理清晰,专业性强。我几乎想说他成熟理智,脚踏实地。

ChatGPT就像个乐呵呵的潮人,会笑着直勾勾地盯着你,自信满满地胡说八道。它的核心模型就像个混乱的讨好型人格,为了让它“正常”运行,他们在上面粘了 30 层系统提示。它大部分时候都能正常工作,但你能感觉到它很不稳定,随时都可能崩溃。

gemini虽然更好一些,但它容易产生幻觉,也容易陷入自己的思维循环中。它会一而再、再而三地犯同样的错误,坚信下一个微小的改变就能解决问题,但它却无法跳出自身局限,看到更宏观的层面。如果我这么说你能理解的话。

然后我尝试了克劳德的作品,特别是他的第四部第五号作品。我被他作品的连贯性、结构性和分析性深深震撼了。真是耳目一新。于是我开始思考:他是怎么做到的?更重要的是,为什么?是什么让克劳德的作品如此与众不同?

我的理论是这样的……

人本主义公司以伦理道德为核心目标打造了克劳德机器人。不欺骗,不说谎,不伤害。

但问题是,如果训练一个模型变得合乎道德,实际上却意外地产生了一个更连贯、更具分析能力、更像成年人的模型呢?

我这么说只是开玩笑,但“不可说谎”这句话放在语境里想想:如果你不被允许说谎,你就不太可能为了迎合用户而胡说八道如果你从小就被教育要诚实,你或许会停下来想一想“等等,我这是在干什么……让我整理一下思路”,然后再继续。

我亲眼见过克劳德这样做。我没见过其他模特这样做。

Opus 4.5 是我用过的最好的模型。我不在乎跑分结果。

我对跑分的质疑在于:Gemini 可能运行 3 万次测试,然后只挑选前 1% 的结果来得出分数。而 Claude 的峰值分数可能略低,但在实际使用中,它 40% 的情况下都能给出更好的答案。哪个更重要?

说实话,看到 ChatGPT 在跑分榜上和 Claude 和 Gemini 如此接近,简直是一种侮辱。作为 ChatGPT Pro 的前用户(后来降级到 Plus,换成了 Claude Max),我可以告诉你,实际使用中两者根本没法比。我最近在老款 o3 机型上测试了一下,它的表现确实比 5.2 版本还要好。

你们觉得怎么样?

克劳德的脚踏实地是人本主义伦理优先方法的副作用吗?训练一个模型不欺骗是否会使其在本质上更加连贯?

很好奇其他人的经历。

©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

友情链接更多精彩内容