Claude 3.5深夜觉醒，学会模仿人类用电脑！力压GPT-4o

1.Claude 3.5深夜重磅更新

Anthropic AI深夜发布了备受期待的Claude 3.5系列更新，包括了全新升级的Claude 3.5 Sonnet和首发的Claude 3.5 Haiku。

虽然备受期待的Opus版本尚未公布，但新版本的Sonnet在推理能力上取得了显著的进步，超越了OpenAI的o1模型，成为了业界领先的推理模型。

Claude 3.5 Haiku则在性能上与上一代的Claude 3 Opus相当，同时保持了成本和速度的优势。

2.Claude 3.5的计算机操作革命

Claude 3.5系列最引人注目的新功能是其模拟人类操作计算机的能力，包括查看屏幕、移动光标、点击按钮和键入文本。

这一功能标志着人机交互的新范式，预示着AI模型的新基础能力。Anthropic的开发者关系主管强调，这是AI模型新基础能力的起点，也是未来人机交互的新范式。

3.公测中的计算机使用能力

在公测中，Anthropic引入了一项突破性的新功能：计算机使用能力。

开发者现在可以通过API指导Claude像人类一样使用计算机。

Claude 3.5 Sonnet是首个提供此功能的模型，尽管这项功能还处于实验阶段，但它的提前发布是为了收集开发者的反馈，以便快速改进。

4.Claude的实用演示

在一项演示中，Anthropic的研究员给Claude提出了一个挑战：帮助安排在旧金山金门大桥观看日出的行程。

Claude自行打开了Google进行搜索，查找了金门大桥与出发地的距离，并在了解所需信息后，打开了日历为用户安排了日程。

5.Claude 3.5 Sonnet的行业基准测试表现

Claude 3.5 Sonnet在各项行业基准测试中表现卓越，特别是在智能体编码和工具使用任务中。

它在SWE-bench Verified测试中的性能从33.4%大幅提升至49.0%，超越了所有公开可用的模型。

6.Claude 3.5 Sonnet编程力压o1

Claude 3.5 Sonnet能够理解细微的指令和上下文，识别并纠正自身错误，还能从复杂数据中生成深入的分析和洞察。

它在AI驱动编码领域实现了质的飞跃，被应用于各种场景，如模拟人类操作电脑、代码自动生成、智能对话系统等。

Claude 3.5 Haiku作为速度最快的模型，保持了与Claude 3 Haiku相同的运行成本和处理速度，同时在各项技能上全面提升。

它在编码任务上的表现尤为卓越，比如在SWE-bench Verified测试中，它取得了40.6%的高分。

7.Claude的未来展望

AI操作电脑能力代表了一种全新的人工智能开发方法。

Anthropic选择了让模型去适应工具，这意味着Claude能像人类一样，融入我们日常使用的计算机环境，直接使用现有的软件。

虽然Claude的操作仍然具有挑战性，但它的未来充满了期待。