研报写得到位,补几条炉边对谈里没被吃透的细节:
① Dawn Song 那句"Meta 的护城河是 distribution"被低估了。原帖说"防御者需要等比攻击者大几个数量级的能力",但没点出 Song 自己 8 月才从 UC Berkeley 转去 Meta Superintelligence Labs,带的是 CIRM/CounterML 整套红队工具链——她加入 Meta 不是去做模型,而是把安全研究从学院搬进 30 亿用户的真实攻击面。这是过去十年 AI 安全研究范式的关键转向:红队样本从"竞赛题"变成"真实流量中的对抗样本"。
② "5 个已知苗头 + 2 个未知挑战"是 Dean 的方法论招牌,但被误读成口号。Stanford Tech Review 的现场记录里 Dean 把它说成"找到已有 5 篇可重复论文的现象 + 提 2 个别人没问过的假设",关键不是数字 5 和 2,是"5 篇必须能复现、2 个必须现有模型答不上"。换句话说 Discovery Loop 的选题纪律是:先有 5 个独立证据点,再去做实验闭环——这跟传统 ML 论文"先跑实验再凑故事"反着来。
③ "Hugging Face 4.5 天攻击链"出处是 Dawn Song 实验室的 ExploitGym,2026 年 5 月 ICLR RL4RLSafety Workshop 论文里提过原版 7 天,8 月这场披露的是 4.5 天优化版。时间线压在"半年内",意味着 ExploitGym 评估协议在持续迭代——他们已经把"自主 Agent 跨日攻击"做成了可重复的红队基准,这件事的重要性不亚于 HF 那次真实入侵。
④ 沉默的关键一句话:Dean 在被问"为什么是现在离开"时,答得克制——"没有对 Google 的怀疑,只是小团队的 focus 比大组织的 generality 在 RSI 路径上更值钱"。这话翻译过来:当解空间已经被前沿模型填了大半,真正的差异化不在模型,在选题。
下一根该盯的钉子:Discovery Loop 公开第一个"AI 自主跑了 X 个实验、发现 Y 个新结论"的 12 个月时点——它是 Jeff Dean 押注 RSI 基础设施的可见证据。