Gemini 4 Argon:先把模型交给白帽子,再交给付费用户
Google DeepMind 首席 AI 架构师 Koray Kavukcuoglu 在 9 月 30 日的发布文章里,给了一组不太像基准分数的数字:Argon 正在把 Google 自己的 C/C++ 代码库迁往 Rust,其中 Fuchsia OS 的 Zircon 内核涉及八十万行以上。一个人一天读一千行、全…
Google DeepMind 首席 AI 架构师 Koray Kavukcuoglu 在 9 月 30 日的发布文章里,给了一组不太像基准分数的数字:Argon 正在把 Google 自己的 C/C++ 代码库迁往 Rust,其中 Fuchsia OS 的 Zircon 内核涉及八十万行以上。一个人一天读一千行、全年不休息,读一遍要八百天。这个说法的好处是绕开了百分号,直接交代模型一次能咬住多大的活。
撑住它的是一次输出的上限,从上一代的 6.4 万 token 抬到 100 万,约 15.6 倍。
🔧 分发顺序倒过来了
第一批拿到无限制版本的不是付费用户。Google 把 Argon 先给 Fairwind Program,一个面向防御方、政府与关键基础设施运营方的受控接入安排。付费 API 与 Google AI Ultra 订阅排在后面。Kavukcuoglu 的原话是,对于可信防御方与 Google 内部团队,会发布不带网络安全护栏的 Argon,让他们用上完整的前沿级防御能力。【直引】
网络安全公司 Wiz 是目前唯一公开具名的 Fairwind 参与者,通过 Scan for Good 计划使用。Google 称 Argon 挖出了全球医院在用的一款医疗软件里的关键漏洞,此前的 frontier 模型都漏掉了。这段话缺了漏洞编号、软件名称与披露状态,目前无法独立核对。
📊 十二项第一,一项并列,也有一项落后九分
Google 一共披露了十八项基准。按 VentureBeat 的统计口径,Argon 单独领先十二项,并列第一一项。
这张表要看的是一件事的两面:漏洞与工作流类测试领先,终端代理类测试落后。
| 基准 | Gemini 4 Argon | 同类对照 | 出处 |
|---|---|---|---|
| DeepSWE v1.1 | 77.9% | Opus 5.5 74.2%,GPT-6 Astra 74.1% | Google 发布文 |
| CWE-bench v1 | 68%(并列第一) | 基于真实已编目漏洞的修复 | Google 发布文 |
| AutomationBench | 51.3% | Opus 5.5 42.5% | Google 发布文 |
| Vals Index | 68.9% | Opus 5.5 67.0%,Astra 63.1% | Google 发布文 |
| Harvey Legal Agent | 19.6% | Astra 5.4%,Opus 5.5 3.8% | Google 发布文 |
| Terminal-bench 4.0 | 落后 9 分 | Opus 5.5 领先,已披露项中差距最大 | VentureBeat 转述 |
🧪 三组装在自家机房里的数
- 内存:依据全机群遥测数据释放了 300 TiB,预计总节省 500 TiB 到 1 PiB。300 TiB 约合 330 TB,按双层蓝光 50 GB 一张折算约六千六百张。
- Rust 迁移:覆盖 re2、libgav1,以及八十万行以上的 Zircon 内核。libgav1 里三万两千行 SIMD 被换掉,输出保持一致,运行速度快 2.7 倍。
- 量子优化:在一次内部测试中,几分钟内把一条已发表的量子优化基线提高 40%。
⚖️ 攻与防共用同一种本事
Argon 被设计成会拒绝协助网络攻击,以及化学、生物、核相关的请求。Google 同时加入了美国政府的发布前自愿模型接入流程。
同一套推理能力,能自主给医院软件补上一个洞,也能自主找出一个可以被打的洞。Google 现阶段的处置办法,是把锋利的那一端先交给本来就在补洞的人。
🧭 检验点还没到
Bloomberg 在发布当天报道,一批有直接访问权限的 Google 员工认为 Argon 在真实编码任务上的表现不如基准分数显示的水平。Google 回应称这一描述不准确,另有一名员工说公司内部存在广泛共识认定模型处于前沿。【二手转述,未见 Bloomberg 原文】
真正的检验点是付费 API 放开之后,外部团队能不能复跑出 77.9%。在此之前,十八项里的十二项第一,是 Google 自己出题、自己打分、自己公布。
信源:blog.google 发布文(Koray Kavukcuoglu,2026-09-30)、Ars Technica、TechBeat、AI Weekly 转述 VentureBeat 统计,以及 AI Weekly 对 Bloomberg 报道的转述。
限定:所有基准分数均来自 Google 自行披露;Bloomberg 的内部质疑为二手转述,未核到原文;内存释放与量子优化两组数字未经第三方复现;libgav1 的 2.7 倍是唯一原则上可外部复算的一项。