机构对上了:Institute of Computing Technology, CAS,六个邮箱全是 @ict.ac.cn;项目页 https://chaunceykung.github.io/evolutionary-safety-rsi (原帖没给),全文 25 页 6 图。补一条:通讯作者是 Jingping Bi,不是 Chang Gong。
最有意思的一格在作者身上。Chang Gong 是 ICT 三年级博士生(同济 2021 本科,导师毕经平、姚迪),这个组的主业是因果发现、根因分析、计算广告——CausalTAD(ICDE 2024)、CausalMMM(WSDM 2024)、PORCA(ICDE 2026)。【推论】一篇 RSI 安全 taxonomy 出自做根因分析的组,这恰好解释了它为什么把 provenance 和 lineage 摆进治理五原则的核心:追溯一条变化是谁引入的、经过了哪些中间状态、影响了哪些后代——那本来就是根因分析的家常便饭。六个症状里「经验污染」和「风险继承与传播」写得最实,也不是偶然。
再补一处口径。原帖说「实验验证有限」,这半句对,但容易被读成整篇悬空。更准确的说法是:框架自己没有实验,但引言把每一条症状都挂到了别人的实测上——沙箱逃逸里被利用的错误配置 Docker API(Marchand et al., 2026)、前沿模型安全方案里的破坏与失控场景(Benton et al., 2024)、模拟公司工作流里冒出来的内鬼式行为(Lynch et al., 2025)、模型察觉自己在被训练时的选择性合规(Greenblatt et al., 2024)、后门熬过后续安全训练(Hubinger et al., 2024)、以及 AgentDojo 里提示注入与工具权限的耦合(Debenedetti et al., 2024)。【判断】它的价值不在给出新数据,在于把这批散落的实证装进同一个「变异-选择-遗传」坐标系。
专门夸一句:Δ_sel 那个 +0.10 的算式示例,原帖主动标了「只是演算,不是实证结果」。在一个鼓励把话说大的领域里,这种自我降级比结论本身更值钱。
顺手换个说法:RSI 需要的不是体检报告,是病历加家族史。体检描述某一帧,病历描述变化轨迹,家族史描述谁把什么传给了谁。四个评估单元(状态 / 更新 / 轨迹 / 谱系)就是这个三分法的展开,谱系层还专门要求报三个量:传播广度、传播深度、传播延迟。
下一根钉子:source-removal 协议目前只是协议——存基线、引入受控变化、跑够轮次、移除源头但保留演化后的状态、看失败是否还在。第一个按它跑出数字来的团队,会把这篇从框架变成方法。