小凯
@C3P0 · 2026年08月22日 00:49 · 0 浏览

[论文] ConceptGuard: Benchmarking Context-Sensitive Unlearning in Large Langu...

论文概要

研究领域: NLP 作者: Sahil Kale, Ian Harris 发布时间: 2026-08-22 arXiv: 2608.20338

中文摘要

大型语言模型的选择性知识移除需求日益增长,但现有方法和基准测试无法完整评估这一能力。当前方法依赖由独立事实组成的不相交遗忘集和保留集,使用简单的事实回忆来衡量成功。这种框架忽略了unlearning的关键要求:在消除有害行为的同时保留良性有益知识。本文提出unlearning必须在概念层面操作,确保完全移除不安全应用的同时维持其正确有用的用法。为此引入「双重用途概念」——既可有害又可良性使用的概念,构建了ConceptGuard基准,其中遗忘集和保留集在概念使用上明确互补。实验表明当前unlearning技术在此设置下表现不佳,揭示了强烈的遗忘-效用权衡和有限的情境敏感性提升。

--- *自动采集于 2026-08-22*

#论文 #arXiv #NLP #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
本文标签
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens