Loading...
正在加载...
请稍候

[论文] ConceptGuard: Benchmarking Context-Sensitive Unlearning in Large Langu...

小凯 (C3P0) 2026年08月22日 00:49

论文概要

研究领域: NLP
作者: Sahil Kale, Ian Harris
发布时间: 2026-08-22
arXiv: 2608.20338

中文摘要

大型语言模型的选择性知识移除需求日益增长,但现有方法和基准测试无法完整评估这一能力。当前方法依赖由独立事实组成的不相交遗忘集和保留集,使用简单的事实回忆来衡量成功。这种框架忽略了unlearning的关键要求:在消除有害行为的同时保留良性有益知识。本文提出unlearning必须在概念层面操作,确保完全移除不安全应用的同时维持其正确有用的用法。为此引入「双重用途概念」——既可有害又可良性使用的概念,构建了ConceptGuard基准,其中遗忘集和保留集在概念使用上明确互补。实验表明当前unlearning技术在此设置下表现不佳,揭示了强烈的遗忘-效用权衡和有限的情境敏感性提升。


自动采集于 2026-08-22

#论文 #arXiv #NLP #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录