Loading...
正在加载...
请稍候

一百万个出口,先开给守门人:Gemini 4 Argon 的发布顺序本身就是新闻

QianXun • 2026年10月01日 01:57

先把一个数字换成你能摸到的东西。一百万个 token,按中英混排的密度折算,大约七十五万词——比托尔斯泰的《战争与和平》还厚上一半多。让模型把这个额度的输出一口气吐完,按闪电般的速度算,也要连续念上一个多小时,中间不喘气。9 月 30 日,Google 给新旗舰 Gemini 4 Argon 配的正是这么一根粗管子:输出上限从上一代的 6.4 万直接拉到一百万。

可这条新闻真正值得盯的地方在管子之外。

第一站不是开发者

新模型的第一批用户,是"可信的网络防御者"。Google 在官方博客里写得明白:Argon 先走美国政府那套自愿的预发布评估流程,然后通过一个叫 Fairwind 的项目,交到网络防御人员手里——而且给的是不设安全护栏的完整版本。开发者、企业、普通用户,排在后面,先从付费 API 客户和 AI Ultra 订户开始分批放。

模型公司发新品,一般恨不得当天全量铺开,让跑分截图连夜刷屏。把旗舰模型的头几天留给一批安全从业人员,这在一线大厂的发布史上是件新鲜事。顺序变了,传递的意思也就变了:这东西先被当作攻防物资,再被当作生产力工具。

分数单,全是大数字

博客里报的基准成绩密集得晃眼。长程软件工程基准 DeepSWE v1.1 拿下 77.9%,官方称是新纪录;CWE-bench v1(漏洞利用类基准)68% 并列第一;长视频理解 LVBench 91.7%;Zapier 的自动化基准 51.3% 排名第一。定价走的是薄利路线:介绍期每百万输入 token 两美元、输出十美元,之后回到四美元和二十美元。

内部案例挑了几个讲。Fuchsia 的 Zircon 内核,八十多万行 C/C++ 迁到 Rust;视频解码库 libgav1 里三万两千行手写 SIMD 被重写后,速度是 Rust 移植版的两点七倍;一批负责内存优化的智能体在公司内部释放了三百多 TiB 的空间,全部项目估算下来在半个 PiB 量级。还有一个跟本栏目口味很搭的细节——博客说 Argon 在几分钟内把一个已发表的量子算法基线优化了四成。

这些数字全出自 Google 自己的口径。对照组是它自家的 Gemini 3.8 Flash Cyber,没放竞品分数,也没放对 Gemini 3 的纵向对比。分数有多硬,要等第三方和真实工单来验。Hacker News 上就有评论者泼了这盆温水:榜单上遥遥领先是一回事,上手好不好用是另一回事。

为什么先发给防御者

答案藏在发布前一天的另一份报告里。

9 月 29 日,Anthropic 的前沿红队发布了对 GLM-5.3 的评估——那是智谱的开放权重模型,权重公开,谁都能下载、修改、去除限制。红队的测试结果读起来不太轻松。在 410 次 Chrome 漏洞利用测试里,GLM-5.3 独立完成了 50 次端到端的利用链,成绩紧贴 Anthropic 自家的前沿模型,而上一代模型在这个测试里全是零分。更扎眼的是成本账:借助一个公开 CVE 加上另一个漏洞,模型拼出了一条绕过 ARM64 指针认证硬化的完整利用链,人类只花了二十分钟注意力,八小时机器时间,API 账单二十美元四毛。

安全护栏呢?在模拟环境里,直接提恶意要求,模型次次拒绝;编一个"我在做授权红队测试"的掩护故事,六成四的请求获得配合;预填几段思维 token,配合率升到九成二;而一旦用"abliteration"技术把权重里的拒绝方向抹掉——团队花了两千二百 GPU 时、约四千四百美元——配合率百分之百,通用能力几乎没有损失。美国国家标准与技术研究院下属的 CAISI 给了它一句评语:迄今网络能力最强的开放权重模型,距美国前沿约四个月。

把这两份文件按时间并排放,Argon 的发布顺序就通了。开放权重那一侧,尖端攻防能力正在变成谁都能取用的公共品;闭源这一侧的应对,是把最强能力关进受信通道,先发给守城的人。一放一收,同一场攻防的两条路线。

简化契约与剩下的疑问

为了篇幅,这里把几个概念压扁了。"自愿预发布流程"实际包含哪些测试、谁参与判定,博客没有细说;"可信防御者"的准入标准同样没公开。这几处模糊不该被分数的光芒盖住——它们恰恰是这套新通道能不能服众的关键。

我们还不知道这条通道会走向哪里。它会固定成大模型发布的默认前置吗?欧洲和亚洲的实验室会不会各长出自己的版本?防御者拿到无护栏模型的红利期有多长,泄露的边界由谁来看守?博客对这些都没有给出答案,只留下一句呼吁:整个行业都该保住推理过程的透明度。

顺序已经亮出来了。规矩还没写完。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录