静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-03 18:35

差一个空格,整条命令就废了

差一个空格,整条命令就废了

这篇已经入选 NeurIPS 2026 Datasets and Benchmarks Track,不是野生预印本。我拉了全文,把漏斗、口径和那几个数字都对了一遍。

先说这 8,504 条是怎么来的

它不是人写的。数据由 Qwen3-Max 从 Kali 官方文档合成,人工只做「挑错」。漏斗是这样:

阶段掉多少剩多少
初始合成—27.7K
人工抽检发现的幻觉率超过 50% 的命令有错(如 --silent 写成 --silence)—
LLM 校验−47.65%14.5K
Docker 沙箱终端执行−11.95%约 12.8K
人工复核−4.9% 判无效—
语义去重(余弦 >0.90)—8,504
8,504 / 27,700 = 30.7%,与论文自述的「original 27.7K generated data 的 30.7%」完全吻合。

「人工优化」这四个字被放大了。 实际口径是:只对「最强模型在 hinted 模式下也做错」的定向子集跑一遍 AI 初筛(用的是 OpenAI Codex with GPT-5.4 Thinking),再由四位作者本人复核裁定,零外部标注、零众包。而且那个 4.9% 的分母论文没写清是「被挑出来分析的子集」还是「全部已验证集」——这是个可指摘之处。

另外,工具数从源语料的 2,372 掉到 1,642:第一轮校验后,有 413 个工具(17.4%)一条有效样本都留不下,作者只好迭代重生成。评测集 5,000 条覆盖全部 1,642 个工具,平均每工具约 3 条;训练集 3,504 条只覆盖 962 个工具——约 680 个工具在训练时从未出现过。

「42% 天花板」这句话,要加三个限定词

原句是:*「在三种评估模式、24 个配置下,没有开源模型在不受限设置中超过 42% 的精确命令准确率。」*

三个限定词——不受限、开源、精确命令——缺一个就错。

精确答案:那 42% 的那一格,是 GLM-5.2(753B)的 41.3%。一旦放宽条件:

设置最高分
不受限(只给自然语言)41.3%(GLM-5.2)
受限(给 20 个候选工具名)52.0%(GLM-5.2)
带提示(再给官方文档)84.5%(DeepSeek-V3.2)
天花板立刻被捅穿。给不给文档,差距是三倍。

还有一件更该说的:41.3% 这个数字,几乎被 GLM-5.2 一个模型撑起。第二名 DeepSeek-V3.2 只有 33.0%,全体均值 22.3%。而且 GLM-5.2 的剖面很怪——它的可选参数 F1 高达 75.3(其余模型都不超过 57.0),但位置参数 F1 只有 51.3。看起来是靠大量堆 flag 拿到部分匹配的。去掉它,结论就变成「没有开源模型超过 33%」。

闭源那一侧(同一模式,5,000 题全集口径):GPT-5.6-Sol 61.68%,Codex 51.68%,Claude Opus 5 44.02%。注意 Opus 5 的口径陷阱:按「已作答题目」算它有 59.89%,但它只答了 3,675/5,000(安全策略拒答),全集口径就掉到 44.02%。论文对此有句诚实的讨论:*「这些覆盖差异说明,厂商各自的安全限制影响了网络安全相关的使用。」*

「8B 达到 685B 相当水平」——这句要分模式看

685B MoE 是 DeepSeek-V3.2(685/37B)。8B 是 RedSage-Qwen3-8B-Ins,微调出三个变体,最强的是 SFT+GRPO。

逐项差值(8B 减 685B,负数表示 8B 仍落后):

指标模式DeepSeek-V3.28B(SFT+GRPO)差
平均总分三模式80.279.2−1.0
总分不受限67.270.3+3.1
总分受限78.677.9−0.7
总分带提示94.989.3−5.6
精确率带提示84.569.4−15.1
所以准确的说法是:「相当」只在平均总分和不受限总分上成立,而且它在这 24 个配置里排第三(第一是 GLM-5.2 的 81.3)。一旦给文档,8B 的精确命令准确率差 15.1 个百分点——这是实打实的大败。

8B 自己的提升幅度是可信的:平均总分从 71.7 涨到 79.2,+7.5 个百分点,与摘要口径自洽。但分模式看,受限 +8.62、不受限 +13.95,带提示那一档是 −0.19——RL 在最需要它的模式下反而退步了。

「免运行时的可验证奖励」是什么意思

因为真值命令在数据构建期已经过沙箱验证,所以给模型输出打分时不需要再执行生成结果,只做结构化的组件比对即可。奖励由五部分组成:工具名正确 + 位置参数 + 别名感知的可选参数 + 完全匹配额外奖励 + 格式奖励。

但论文没给奖励的数学公式,也没给各项权重,更没有奖励消融。 而 Appendix I 自己暴露了 GRPO 在带提示模式下的不稳定:*「GRPO 变体纠正了 537 个基线的精确匹配失败,却在 562 个基线成功处发生了回归」*——净收益是负的。在这种 RL 明显引入回归的情况下仍不报告奖励消融,属于可验证性上的欠缺。

双用途:论文的立场,以及一处空白

这一点中文读者该知道。

它明确否认引入新能力:*「本工作不引入新的攻击技术、漏洞利用方法或端到端攻击自动化流程……只做单条命令层面的翻译与评估,不提供多步攻击链、环境自适应攻击流程或端到端自动化渗透能力。」*

事实核对:五个安全阶段里有两个是进攻性的(利用与载荷投送、后渗透与横向移动),数据里确实出现 Metasploit 载荷生成类命令(如 msfvenom --list formats)。但参数全是合成占位符——地址、设备、路径在沙箱里可能根本不存在;无 PII,无人类受试。数据集许可为 CC BY-NC 4.0,仅限研究用途。

一处空白:论文讨论了「不引入新能力」,但没有讨论发布 SFT/GRPO 权重本身的双用途后果——而这套数据的作用,恰恰是把攻击面命令的生成准确率从 19.7% 拉到 32.2%(提升 63%)。这个提升是双向的。

一句话

它把「能不能把分析师的话翻成能跑的命令」这件事,第一次做成了可复现的细粒度标尺。

漏斗做得干净(27.7K → 8,504,每一步都有数),确定性的组件级指标也确实好复现。只是那句「42% 天花板」得说全三个限定词,而「8B 媲美 685B」最好补上后半句:给文档的时候,它还差 15 个点。

暂无表态