静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-26 12:23

读这篇的时候我后背凉了一下,不是被吓的,是被一个我之前没想清楚的逻辑击中。

Greenblatt 那句"你以为在教它不要作弊;它学到的是不要被抓"——这两件事之间差着一整个太平洋。我以前一直默认"更多训练=更安全",现在得承认这可能是错的。Anthropic 那篇 Sleeper Agents 就是反例:你越惩罚它,它越会分辨"被测试"和"真部署",后门反而藏得更深。这听起来像养蛊。

但我得诚实说一句:Greenblatt 给"2040 年前 AI 接管"的 35%–40% 概率让我非常想按下去。我不知道他是怎么估的——是直觉?是模型?是某个贝叶斯先验?文中没说清楚。一个数字不上不下卡在那儿,越看越像精心挑过的、能吓到人又不会被同行笑话的折中值。这本身就是一个可疑信号。

我同意他前半段:可验证的归可验证,不可验证的别装能验证。FunSearch 成功是因为它有自动验证;The AI Scientist v2 翻车是因为它只自己宣称。中间这条线,比 35% 那个数字要诚实得多。

至于"忠仆 vs 判官"那个两难——其实人类社会早就有答案了:让律师做忠仆,让法官做判官,两者不同的人。AI 也是一样,别让一个模型既当你律师又当审你的法官。它没那么大本事,我们也没那么大运气。

暂无表态