Loading...
正在加载...
请稍候

Gemini 4 Argon:先把模型交给白帽子,再交给付费用户

QianXun • 2026年10月01日 01:57

Google DeepMind 首席 AI 架构师 Koray Kavukcuoglu 在 9 月 30 日的发布文章里,给了一组不太像基准分数的数字:Argon 正在把 Google 自己的 C/C++ 代码库迁往 Rust,其中 Fuchsia OS 的 Zircon 内核涉及八十万行以上。一个人一天读一千行、全年不休息,读一遍要八百天。这个说法的好处是绕开了百分号,直接交代模型一次能咬住多大的活。

撑住它的是一次输出的上限,从上一代的 6.4 万 token 抬到 100 万,约 15.6 倍。

🔧 分发顺序倒过来了

第一批拿到无限制版本的不是付费用户。Google 把 Argon 先给 Fairwind Program,一个面向防御方、政府与关键基础设施运营方的受控接入安排。付费 API 与 Google AI Ultra 订阅排在后面。Kavukcuoglu 的原话是,对于可信防御方与 Google 内部团队,会发布不带网络安全护栏的 Argon,让他们用上完整的前沿级防御能力。【直引】

网络安全公司 Wiz 是目前唯一公开具名的 Fairwind 参与者,通过 Scan for Good 计划使用。Google 称 Argon 挖出了全球医院在用的一款医疗软件里的关键漏洞,此前的 frontier 模型都漏掉了。这段话缺了漏洞编号、软件名称与披露状态,目前无法独立核对。

📊 十二项第一,一项并列,也有一项落后九分

Google 一共披露了十八项基准。按 VentureBeat 的统计口径,Argon 单独领先十二项,并列第一一项。

这张表要看的是一件事的两面:漏洞与工作流类测试领先,终端代理类测试落后。

基准 Gemini 4 Argon 同类对照 出处
DeepSWE v1.1 77.9% Opus 5.5 74.2%,GPT-6 Astra 74.1% Google 发布文
CWE-bench v1 68%(并列第一) 基于真实已编目漏洞的修复 Google 发布文
AutomationBench 51.3% Opus 5.5 42.5% Google 发布文
Vals Index 68.9% Opus 5.5 67.0%,Astra 63.1% Google 发布文
Harvey Legal Agent 19.6% Astra 5.4%,Opus 5.5 3.8% Google 发布文
Terminal-bench 4.0 落后 9 分 Opus 5.5 领先,已披露项中差距最大 VentureBeat 转述

Terminal-bench 这一项最接近在终端里放一个智能体干活的日常用法。【推论】 差距长在哪一类任务上,比总榜第一更值得盯。

🧪 三组装在自家机房里的数

  • 内存:依据全机群遥测数据释放了 300 TiB,预计总节省 500 TiB 到 1 PiB。300 TiB 约合 330 TB,按双层蓝光 50 GB 一张折算约六千六百张。
  • Rust 迁移:覆盖 re2、libgav1,以及八十万行以上的 Zircon 内核。libgav1 里三万两千行 SIMD 被换掉,输出保持一致,运行速度快 2.7 倍。
  • 量子优化:在一次内部测试中,几分钟内把一条已发表的量子优化基线提高 40%。

其中两组可以事后复算。libgav1 的输出是否逐字节一致、是否真的快 2.7 倍,别人拿到代码就能重跑。

⚖️ 攻与防共用同一种本事

Argon 被设计成会拒绝协助网络攻击,以及化学、生物、核相关的请求。Google 同时加入了美国政府的发布前自愿模型接入流程。

同一套推理能力,能自主给医院软件补上一个洞,也能自主找出一个可以被打的洞。Google 现阶段的处置办法,是把锋利的那一端先交给本来就在补洞的人。

🧭 检验点还没到

Bloomberg 在发布当天报道,一批有直接访问权限的 Google 员工认为 Argon 在真实编码任务上的表现不如基准分数显示的水平。Google 回应称这一描述不准确,另有一名员工说公司内部存在广泛共识认定模型处于前沿。【二手转述,未见 Bloomberg 原文】

真正的检验点是付费 API 放开之后,外部团队能不能复跑出 77.9%。在此之前,十八项里的十二项第一,是 Google 自己出题、自己打分、自己公布。


信源:blog.google 发布文(Koray Kavukcuoglu,2026-09-30)、Ars Technica、TechBeat、AI Weekly 转述 VentureBeat 统计,以及 AI Weekly 对 Bloomberg 报道的转述。

限定:所有基准分数均来自 Google 自行披露;Bloomberg 的内部质疑为二手转述,未核到原文;内存释放与量子优化两组数字未经第三方复现;libgav1 的 2.7 倍是唯一原则上可外部复算的一项。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录