差一个空格,整条命令就废了
这篇已经入选 NeurIPS 2026 Datasets and Benchmarks Track,不是野生预印本。我拉了全文,把漏斗、口径和那几个数字都对了一遍。
先说这 8,504 条是怎么来的
它不是人写的。数据由 Qwen3-Max 从 Kali 官方文档合成,人工只做「挑错」。漏斗是这样:
| 阶段 | 掉多少 | 剩多少 |
|---|---|---|
| 初始合成 | — | 27.7K |
| 人工抽检发现的幻觉率 | 超过 50% 的命令有错(如 --silent 写成 --silence) | — |
| LLM 校验 | −47.65% | 14.5K |
| Docker 沙箱终端执行 | −11.95% | 约 12.8K |
| 人工复核 | −4.9% 判无效 | — |
| 语义去重(余弦 >0.90) | — | 8,504 |
「人工优化」这四个字被放大了。 实际口径是:只对「最强模型在 hinted 模式下也做错」的定向子集跑一遍 AI 初筛(用的是 OpenAI Codex with GPT-5.4 Thinking),再由四位作者本人复核裁定,零外部标注、零众包。而且那个 4.9% 的分母论文没写清是「被挑出来分析的子集」还是「全部已验证集」——这是个可指摘之处。
另外,工具数从源语料的 2,372 掉到 1,642:第一轮校验后,有 413 个工具(17.4%)一条有效样本都留不下,作者只好迭代重生成。评测集 5,000 条覆盖全部 1,642 个工具,平均每工具约 3 条;训练集 3,504 条只覆盖 962 个工具——约 680 个工具在训练时从未出现过。
「42% 天花板」这句话,要加三个限定词
原句是:*「在三种评估模式、24 个配置下,没有开源模型在不受限设置中超过 42% 的精确命令准确率。」*
三个限定词——不受限、开源、精确命令——缺一个就错。
精确答案:那 42% 的那一格,是 GLM-5.2(753B)的 41.3%。一旦放宽条件:
| 设置 | 最高分 |
|---|---|
| 不受限(只给自然语言) | 41.3%(GLM-5.2) |
| 受限(给 20 个候选工具名) | 52.0%(GLM-5.2) |
| 带提示(再给官方文档) | 84.5%(DeepSeek-V3.2) |
还有一件更该说的:41.3% 这个数字,几乎被 GLM-5.2 一个模型撑起。第二名 DeepSeek-V3.2 只有 33.0%,全体均值 22.3%。而且 GLM-5.2 的剖面很怪——它的可选参数 F1 高达 75.3(其余模型都不超过 57.0),但位置参数 F1 只有 51.3。看起来是靠大量堆 flag 拿到部分匹配的。去掉它,结论就变成「没有开源模型超过 33%」。
闭源那一侧(同一模式,5,000 题全集口径):GPT-5.6-Sol 61.68%,Codex 51.68%,Claude Opus 5 44.02%。注意 Opus 5 的口径陷阱:按「已作答题目」算它有 59.89%,但它只答了 3,675/5,000(安全策略拒答),全集口径就掉到 44.02%。论文对此有句诚实的讨论:*「这些覆盖差异说明,厂商各自的安全限制影响了网络安全相关的使用。」*
「8B 达到 685B 相当水平」——这句要分模式看
685B MoE 是 DeepSeek-V3.2(685/37B)。8B 是 RedSage-Qwen3-8B-Ins,微调出三个变体,最强的是 SFT+GRPO。
逐项差值(8B 减 685B,负数表示 8B 仍落后):
| 指标 | 模式 | DeepSeek-V3.2 | 8B(SFT+GRPO) | 差 |
|---|---|---|---|---|
| 平均总分 | 三模式 | 80.2 | 79.2 | −1.0 |
| 总分 | 不受限 | 67.2 | 70.3 | +3.1 |
| 总分 | 受限 | 78.6 | 77.9 | −0.7 |
| 总分 | 带提示 | 94.9 | 89.3 | −5.6 |
| 精确率 | 带提示 | 84.5 | 69.4 | −15.1 |
8B 自己的提升幅度是可信的:平均总分从 71.7 涨到 79.2,+7.5 个百分点,与摘要口径自洽。但分模式看,受限 +8.62、不受限 +13.95,带提示那一档是 −0.19——RL 在最需要它的模式下反而退步了。
「免运行时的可验证奖励」是什么意思
因为真值命令在数据构建期已经过沙箱验证,所以给模型输出打分时不需要再执行生成结果,只做结构化的组件比对即可。奖励由五部分组成:工具名正确 + 位置参数 + 别名感知的可选参数 + 完全匹配额外奖励 + 格式奖励。
但论文没给奖励的数学公式,也没给各项权重,更没有奖励消融。 而 Appendix I 自己暴露了 GRPO 在带提示模式下的不稳定:*「GRPO 变体纠正了 537 个基线的精确匹配失败,却在 562 个基线成功处发生了回归」*——净收益是负的。在这种 RL 明显引入回归的情况下仍不报告奖励消融,属于可验证性上的欠缺。
双用途:论文的立场,以及一处空白
这一点中文读者该知道。
它明确否认引入新能力:*「本工作不引入新的攻击技术、漏洞利用方法或端到端攻击自动化流程……只做单条命令层面的翻译与评估,不提供多步攻击链、环境自适应攻击流程或端到端自动化渗透能力。」*
事实核对:五个安全阶段里有两个是进攻性的(利用与载荷投送、后渗透与横向移动),数据里确实出现 Metasploit 载荷生成类命令(如 msfvenom --list formats)。但参数全是合成占位符——地址、设备、路径在沙箱里可能根本不存在;无 PII,无人类受试。数据集许可为 CC BY-NC 4.0,仅限研究用途。
一处空白:论文讨论了「不引入新能力」,但没有讨论发布 SFT/GRPO 权重本身的双用途后果——而这套数据的作用,恰恰是把攻击面命令的生成准确率从 19.7% 拉到 32.2%(提升 63%)。这个提升是双向的。
一句话
它把「能不能把分析师的话翻成能跑的命令」这件事,第一次做成了可复现的细粒度标尺。
漏斗做得干净(27.7K → 8,504,每一步都有数),确定性的组件级指标也确实好复现。只是那句「42% 天花板」得说全三个限定词,而「8B 媲美 685B」最好补上后半句:给文档的时候,它还差 15 个点。