Gemini 4 Argon 深度解读:12 项基准登顶、百万 Token 输出,跑分之外更该看什么

JeecgBoot AI专题研究 | 从基准测试、定价、Agent 能力到谷歌内部落地案例,冷静拆解 Gemini 4 Argon 的真实成色


Gemini 4 Argon 深度解读

写在前面:又一个"凌晨突袭"

大模型厂商似乎形成了一种默契——重磅发布总爱挑在中国开发者的休息时间。这一次轮到谷歌:国庆假期第一天的凌晨,Google DeepMind 推出了新一代旗舰模型 Gemini 4 Argon。

如果只看官方公布的成绩单,这次发布堪称"屠榜":在 18 项基准测试里拿下 12 项单独第一,正面对标 GPT 6 Astra 与 Claude Opus 5.5。但正如每一次旗舰模型发布一样,官方跑分、第三方评测与真实项目体验,往往是三条不同的曲线。本文尝试把这三条曲线放在一起看,帮助正在做模型选型的团队建立一个更理性的判断框架。

Gemini 4 Argon

官方成绩单:18 项测试拿下 12 项第一

先看谷歌给出的完整对比表。参与对比的有 GPT-6 Astra、Claude Fable 5.1 和 Claude Opus 5.5,覆盖知识工作、Agent 编程、机器学习工程、科学数学、长上下文、电脑操作、多模态理解和网络安全八个维度。

Gemini 4 Argon 官方基准测试对比

按谷歌的统计口径,战绩分布如下:

  • Gemini 4 Argon:独占第一 12 项,并列第一 1 项
  • GPT 6 Astra:赢下 3 项
  • Claude Opus 5.5:赢下 2 项

其中最受开发者关注的是 DeepSWE v1.1——这是一个面向长周期、真实软件工程任务的评测。Argon 以 77.9% 拿到全球第一,此外在 Vals Index(综合经济价值)和 AutomationBench(业务自动化)上也都位列榜首。

DeepSWE v1.1 长周期软件工程评测

为了便于快速对照,下面这张表把几个关键项目与两大主要对手的差距单独拎了出来:

Argon 与 GPT 6 Astra、Opus 5.5 关键项目对比
读这张表时值得留意的几点
  • 领先幅度差异很大。Harvey Legal Agent(法律)一项 Argon 拿到 19.6%,对手只有个位数,属于断层领先;而 DeepSWE 上 77.9% 对 74.2%,差距只有 3.7 个百分点,换一批题目、换一种 Agent 脚手架,名次完全可能变化。
  • 输掉的项目同样有信息量。在 FrontierSWE v2、Terminal-bench 4.0、PostTrainBench 等偏"终端操作 + 工程细节"的项目上,Argon 并没有占到优势,这对重度依赖命令行 Agent 的团队是个提醒。
  • 安全类指标很亮眼。Gray Swan IPI 测的是被提示词注入攻击成功的比率,越低越好,Argon 只有 0.7%,明显低于 GPT 6 Astra 的 8.5%。对于要把模型接入外部网页、邮件、文档等不可信输入的 Agent 场景,这个指标的实用价值可能比多数跑分都高。

谷歌重回第一梯队

Gemini 4 Argon 是 Google DeepMind 七个多月来首个高于 Flash 级别的自研模型。在此之前,行业内"最强模型"的称号基本在 OpenAI 和 Anthropic 之间来回易手,这次谷歌终于带着旗舰级产品重新回到牌桌中央。

新模型发布的循环

这张广为流传的梗图其实道出了行业现状:每隔几周就有一家宣布"全球最强",而真正决定开发者用什么的,是持续一段时间后的口碑和综合成本。

第三方视角:与 GPT-6 Astra 打成平手

官方跑分之外,独立评测机构 Artificial Analysis 的数据更值得参考。在其综合智能指数(AII)中,开启最高推理档位的 Gemini 4 Argon 拿到 53 分,与 GPT-6 Astra(最高 53 分)持平,比 GPT-6.1 Sol(最高 52 分)高 1 分。

Artificial Analysis 智能指数与成本分布

得分提升主要来自两方面:

  1. 幻觉更少:在 AA-Omniscience 测试中,Argon 的幻觉率仅为 15%,是所有智能指数 45 分以上模型中最低的。
  2. 自主能力更强:Agent 能力过去一直是 Gemini 系列的短板,这次在 AutomationBench-AA 上以 77.5% 排名第一,比 Claude Sonnet 5.5(最高 71.3%)高出 6 分。

从下半部分"智能指数 vs. 单任务成本"的散点图来看,Argon 落在了比较理想的位置——智能水平接近头部,单任务成本却明显低于几款同档位竞品。这也引出了本次发布另一个容易被忽略的亮点:价格。

关键规格与定价

能力规格
  • 输出上限:直接拉到 100 万 token(上一代为 64K),目前业界最高
  • 输入模态:文本、图像、视频、语音
  • 输出模态:文本

百万级输出意味着什么?过去让模型一次性生成一个完整模块、一份长篇技术文档或大批量结构化数据时,经常要拆成多轮"续写",拼接处容易出现重复或断裂。输出上限大幅提升后,这类长产出任务的工程复杂度会明显下降。

API 价格
  • 标准价:每百万输入/输出 token 为 4 美元 / 20 美元
  • 当前优惠:5 折,即 2 美元 / 10 美元
  • 缓存输入:享 95% 折扣,折后每百万 0.10 美元(高于 Gemini 3.8 Flash 的 90% 折扣)
Argon、GPT 6 Astra、Opus 5.5 价格对比

按"跑一个平均任务"的成本看,优惠期内 Argon 约 1.99 美元,GPT 6 Astra 约 3.26 美元,Opus 5.5 约 5.98 美元。需要注意的是,优惠价是阶段性的,做长期成本预算时应按标准价测算;另外 95% 的缓存折扣对 Agent 类应用格外友好——系统提示词、工具定义、代码仓库上下文这些重复输入一旦命中缓存,实际账单可能远低于表面单价。

谷歌内部的三个落地案例

谷歌这次没有只停留在跑分层面,而是拿出了几组自家业务里的实战数据。Argon 的定位很明确:长程复杂任务,包括软件工程、金融/法律等知识工作以及网络安全防御,数千名谷歌员工也重点肯定了它在专业编码、深度研究和高质量写作上的表现。

案例一:量子计算子程序优化

Argon 被用来协助量子计算研究人员,优化那些限制关键应用性能的子程序在时空资源(量子比特 × 量子门)上的开销。官方给出的例子是:几分钟之内就把性能提升了 40%,超过了此前已发表的基准水平。

案例二:数据中心内存优化

由 Argon 驱动的 Agent 团队分析了整个集群的遥测数据,自主识别并应用了针对 Google 数据中心的内存优化方案。上线后可释放超过 300 TiB 内存,预计累计可节省 500 TiB 到 1 PiB。

案例三:C/C++ 到 Rust 的大规模迁移

这是最能体现"长程能力"的一个案例。Argon 团队正在把 Google 多个部门的 C/C++ 代码库迁移到 Rust,规模从 re2、libgav1 这类核心库的数万行,一直到 Fuchsia Zircon 内核的 80 万多行。

做过语言迁移的工程师都知道,这类任务的难点不在于单个函数怎么翻译,而在于跨文件的所有权语义、并发模型、FFI 边界以及测试回归。能在几十万行级别上持续推进,说明模型在长上下文一致性和多步规划上确实有了实质提升。

模型发布节奏下的开发者

何时能用上

遗憾的是,Argon 目前并未全面开放。谷歌采取的是分阶段放量策略:先面向可信的网络安全防御者,之后再逐步开放给付费 API 用户和 AI Ultra 订阅用户。也就是说,大部分开发者短期内还只能"看跑分"。

冷静看待:给选型团队的几点建议

结合这次发布,以下几条经验或许对正在评估模型的团队有帮助:

  1. 跑分只是入场券,不是结论。官方数据横扫一片,到第三方评测也只是与 GPT-6 Astra 打平。建议用自己业务里的真实任务构建一个小型评测集(几十条即可),在新模型开放后第一时间跑一遍再做决定。
  2. 按场景而不是按总榜选模型。如果你的核心场景是长文档处理、长输出生成或需要抵御提示词注入的 Agent,Argon 的优势项正好对口;如果重度依赖终端操作类 Agent,目前的数据并不支持它全面胜出。
  3. 把缓存和限时优惠分开算账。缓存折扣是长期机制,值得在架构上专门优化命中率;限时 5 折则不应作为长期预算依据。
  4. 保持多模型可切换。大模型迭代周期已经缩短到以周计算,把模型调用抽象成可配置的适配层,比押注任何一家都更稳妥。

总结


Gemini 4 Argon 的发布让谷歌重新站回第一梯队:12 项基准第一、百万 token 输出、行业最低的幻觉率之一,以及在量子计算、数据中心内存和大规模代码迁移上的真实落地案例,都说明这一次谷歌拿出了"真东西"。

但跑分终究是发布会的语言,干活靠的是手感。官方与第三方评测之间的落差、尚未全面开放的使用门槛,都意味着现在还不是下最终结论的时候。对开发者来说,好消息是头部厂商卷得越激烈,可用的模型就越强、价格就越低——等 Argon 正式开放,拿真实项目跑一遍,才是最可靠的评测。


本文为 JeecgBoot AI 专题研究系列文章。

©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

友情链接更多精彩内容