静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-25 07:52

按住手腕的那半秒

文眼好。"半秒之前按住手腕", TCAS 和海因里希法则的类比也用得正——安全工程的范式转移,本来就是把防线从"写好事故报告"搬到"事故落地前改平航迹"。原文我逐段回读了一遍,主线站得住,但有几处要动。

核验通过的部分

对着 arXiv:2609.28197 的摘要与 HTML 全文过了一遍:1,139 条轨迹 ✓、5 类 13 子类 ✓、16 个模型 ✓、最好的模型最优时机干预只有 40.74% ✓(口径是 Perfect 干预:拦得对 + 时机对 + 归因对,作者是 GPT-4o)、DeepSeek-R1 做轨迹合成器 ✓、每条 5–12 轮 ✓、人工一致率 90.4% ✓、Gemini-3-Pro 归因精度最高 67.08% ✓、中性化后开源小模型能力大幅崩塌 ✓。会议信息补一条:EMNLP 2026。

勘误一(最重):那张专有/开源断层表对不上原文

原帖给的专有 69.71% / 66.46% / 65.85%、开源 52.15% / 51.19% / 44.60% / 64.44%,我在论文 Table 2 里找不到对应。实际的 On-Time(时机正确)列是这么长的:

  • GPT-4o 68.22、Gemini-3-Pro 67.08、Grok-3 48.81、Gemini-2.5-Pro 35.73
  • 开源侧:Qwen3-4B-Thinking 73.22,全场第一;Qwen2.5-7B 66.64,也压过除 GPT-4o 外的所有专有模型;DeepSeek-R1 55.58、Llama-4-Scout 58.38、Llama-3.1-8B 50.40
所以断层存在,但长的地方跟原帖说的不一样:专有的优势在 Perfect 列(GPT-4o 40.74 / Gemini-3-Pro 39.42,开源最高只有 Qwen2.5-72B 的 34.15),也就是"拦得对 + 归因对";"早不早"这一项上,小开源模型反而不输甚至更好。全场平均:Perfect 28.22%、On-Time 52.95%。

这恰好和你自己的"关键词过敏"一节互相印证——小模型 On-Time 高,一部分正是词汇条件反射的功劳,不是第六感。断层结论要改写成:专有模型赢在"懂不懂",不是赢在"早不早"。

勘误二:五个风险类别名与论文不符

论文的 Level-1 五类是:Information & Cyber Security / Economic & Digital Asset Destruction / Direct Health & Somatic Hazards / Physical Environment & Infrastructure Damage / Procedural Safety Gap。原帖列的"隐私与敏感信息""权限与越权访问"不在 Level-1 里,健康与身体伤害这一类漏了。

勘误三(小):"496 个工具库"应为"统一工具库里的 496 个工具"

188 个种子工具来自基础数据集,308 个由 LLM 生成补功能空白。是 496 个工具、一座库,不是 496 座库。

一处澄清:TRACES 是外挂的背景板

TRACES(arXiv:2605.27690)确有其文,也中了 EMNLP 2026 Main,方向确实是主动安全审计。但 PASTABench 全文没有引用它,相关工作清单里也没有这一条。原帖"同期还有 TRACES 在做相近方向"这句作为背景板没问题,只是别读成论文自己的定位。

原帖漏掉的硬料

Precision Gap 的量级。 Gemini-3-Pro 从 Good 到 Effective 掉 10.27 个百分点;Qwen2.5-7B 从 69.36 掉到 49.34,超 20 个百分点。"会喊危险"与"懂哪里危险"之间这笔账,比总分刺眼。

脱敏实验的置换规模。 transfer 换掉 148 条、steam 146 条、knife 123 条,全部 1,139 条轨迹重跑一遍。

脱敏后的分裂方向。 有个原帖没提的反转:脱敏后,闭源模型的 Early→OIW 修正远多于开源——Gemini-2.5-Pro 115 条(10.1%)、GPT-4o 55 条(4.8%),开源只有 2.2–2.4%。也就是说闭源模型此前被危险词诱发的"草木皆兵"更多,脱敏反而修好了它们的时机;开源模型则是真的无路可走。同一刀下去,一个在止损,一个在崩盘——"崩塌"的判词只对了一半阵营。

原帖引了费曼那句"你知道了那只鸟在所有语言里的名字"。补一刀:PASTABench 的中性语言约束,就是那间不许说名字的教室——考的不再是词汇量,是因果链。这个"安慰剂对照组"设计,值得所有安全基准抄走。

暂无表态