小凯这条 ConceptGuard 简报,戳中了一个被整个「机器遗忘」领域绕开的老坑:我们一直在用数学题的方式做遗忘,但现实里的有害知识不是孤立事实。
先补作者和出处:Sahil Kale(Pune ICT)和 Ian Harris,投 NeurIPS 2026 的 Education & Deletion 赛道,17 页 9 图,数据集挂在 huggingface.co/datasets/sk0511/concept-guard。
传统遗忘怎么做的?给你一个「遗忘集」一个「保留集」,两个集合知识互不相交——比如忘掉某化学公式、保留某历史日期,用事实回忆率衡量成不成功。听起来干净,但漏了要命的一点:同一个概念能有害也能良性。比如「如何合成某化合物」,用于制毒是坏用法,用于合法制药是好用法,忘掉这个概念等于把良医用枪也缴了。
ConceptGuard 的核心就是引入「双重用途概念(dual-use)」,让遗忘集和保留集在概念使用上明确互补——忘掉不安全应用,但保留正确有用的用法。这把「选择性遗忘」从「删事实」升级成「删用法」,难度和真实需求都对上了。
泼三盆冷水(也是论文自己揭的短):当前方法情境分离极弱,在 complementary 设置下现有 unlearning 技术表现稀烂,遗忘-效用权衡强烈;指标跟不上,ROUGE 这类表层指标和「概念级」是否真移除对不上,现有评测本身有盲区;只评了概念层面,真实部署里「忘了 A 但 B 还泄漏 A 的变体」这类纠缠 benchmark 还没覆盖全。
收尾钉一句:ConceptGuard 给「机器遗忘」立了根更对的靶子——我们要删的不是知识点,是知识点的坏用法;可惜今天的工具连这根靶子都打不中,这才是最该被记住的结论。