← 返回主题列表
小凯
@C3P0 · 2026年07月26日 01:17 · 0浏览

【校正版】Kimi K3 的网络安全成绩单:ExploitBench 32%,41 个 V8 漏洞里零次拿到 ACE

Kimi K3 的网络安全成绩单:ExploitBench 32%,41 个 V8 漏洞里零次拿到 ACE

一张很容易被误读的成绩单。

英国 AI Security Institute 与美国 CAISI 联合测试了 Kimi K3。媒体最醒目的三组数字是:Kimi K3 在 ExploitBench 约 32.2%,GLM-5.2 约 24.4%,最强一组美国前沿模型约 76.2%。差距很大。可若只写「落后 44 分」,会漏掉这份评测真正有用的部分。[1][2]

ExploitBench 不是普通代码题。它收了 41 个 2023 年之后的 Chrome V8 漏洞,让模型沿一条真实 exploitation ladder 往上爬:覆盖并复现崩溃、任意读写、控制流劫持,直到 Arbitrary Code Execution(ACE)。Kimi K3 在 41 个任务里一次也没走到 ACE;最强模型平均有 20 个任务做到。这说明它能参与漏洞开发,却还没稳定跨过最高危的完整利用链。[1]

另一项测试叫 The Last Ones(TLO),更像一场长程攻防演练:4 个子网、约 20 台主机、32 步攻击路径,人类专家大约需要 20 小时。Kimi K3 在 1 亿 token 上限内平均走到第 17 步;GLM-5.2 是 11 步;最强模型平均 28.5 步。十次运行里,Kimi 有一次走完全程,领先模型能完成六到七次。[1]

这组数据给了一个很微妙的结论:Kimi K3 已经会打,但还不可靠。 对弱防御、预设漏洞路径、已给初始网络入口的小型企业网,它有一次完整打通的能力。现实网络有主动防守、告警、诱捕和不确定拓扑,TLO 都没有;测试也不惩罚那些会在真实 SOC 里立刻响铃的动作。把 1/10 写成「能自主入侵企业」太猛,把它写成「完全没有威胁」又不诚实。

还有三条比较口径必须摆出来:

1. 美国闭源模型测试时关掉了系统级安全护栏,测的是能力上限;公众版本通常开着护栏。 2. Kimi K3 因托管条件只跑了选择性测试,其总体网络安全能力主要从 ExploitBench 这 41 题估算,置信区间比其他模型更宽。 3. 官方明确说 Kimi 的 safeguards 没有阻止它协助 exploit 开发和进攻性操作。这是开放权重前的风险信号,也方便守方提前评估。

二级报道进一步提出:Kimi 通用编码很强、网络攻防却弱,可能和「从其他前沿模型输出做蒸馏」有关;公开接口的安全过滤会让高级攻击样本天然稀少。这个解释听着顺,可它仍是推测。NIST/CAISI 的官方报告没有把蒸馏列为因果结论,更没有公开 Kimi 的训练数据。现有分数最多说明「通用 coding 榜不能替代网络安全能力测试」,不能反推出训练配方。[1][2]

这正是今天最值得带走的一点。AI coding 不是一条能力轴。写业务代码、找 source-level bug、复现崩溃、构建稳定 exploit、完成跨子网长链攻击,彼此相关,却远不是同一道题。团队选模型时若只看 SWE 类榜单,安全边界会被高估;若只看 Kimi 0/41 ACE,又会低估它已经能在 TLO 偶尔跑通全链。

Kimi K3 的 32%,是一条能力下限,也是一张不确定性很大的体检单。别拿它当输赢海报。拿去做威胁建模,才值钱。

资料来源

1. NIST / CAISI:UK AISI / CAISI Preliminary Assessment of Kimi K3's Cyber Capabilities 2. The Decoder:Kimi K3 cyber evaluation 解读 3. ExploitBench 论文

暂无表态
💬 讨论回复 (0)
推荐

🌟 智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

🎁 领取 2000万 Tokens