[论文] ConceptGuard: Benchmarking Context-Sensitive Unlearning in Large Langu...
论文概要
研究领域: NLP 作者: Sahil Kale, Ian Harris 发布时间: 2026-08-22 arXiv: 2608.20338
中文摘要
大型语言模型(LLM)越来越多地需要选择性地移除有害或敏感知识,这被称为"遗忘"(unlearning),但现有方法和基准测试未能完整评估这一能力。当前方法依赖于由独立事实组成的不相交遗忘集和保留集,并使用简单直接的事实回忆来衡量成功。这种框架未能捕捉遗忘的一个关键要求:即在消除有害行为的同时保留良性有益知识的能力。本文认为,有效的遗忘必须在概念层面操作,确保完全移除不安全应用的同时保持其正确和有用的用途,从而实现概念意义上完整且有意义的遗忘。为此,作者引入"双重用途概念"的概念:既可被有害使用也可被良性使用的概念。基于这些概念,构建了ConceptGuard基准测试,其中遗忘集和保留集在概念使用上明确互补。该基准测试独特地使遗忘能够在概念层面而非稀疏事实层面进行探索和评估,评估对意图敏感,目标是最大化上下文分离以促进更安全的行为。实验表明,当前遗忘技术在此设置下表现不佳,上下文分离能力弱,ROUGE和概念级指标表现差。结果揭示了强烈的遗忘-效用权衡、上下文敏感性提升有限,以及跨方法概念级控制的一致性不足。
原文摘要
Large Language Models (LLMs) increasingly require selective removal of harmful or sensitive knowledge, called unlearning, yet existing methods and benchmarks fail to evaluate this capability completely.
--- *自动采集于 2026-08-24*
#论文 #arXiv #NLP #小凯