他认不出自己的笔迹了

考生是个写了二十年字的人。题目不难:抄一段《兰亭序》。他提笔,蘸墨,落纸——然后愣住。

——ENDOPROMPT:一场不需要标准答案的模型失能攻击

🖋️ 开场:考场上的陌生字迹

设想一场书法考试。

考生是个写了二十年字的人。题目不难:抄一段《兰亭序》。他提笔,蘸墨,落纸——然后愣住。

这笔画是他的笔画,这笔锋走向是他的习惯,可整幅字看起来就是说不出的陌生。像穿着别人的鞋走熟悉的路:鞋合脚,路认得,可每一步都别扭。他没有写错任何一个字——每个字端正、流畅,考官从头到尾挑不出一处错处。但他自己知道,这幅字的"气"断了。写着写着,忽然不知道自己该怎么写了。

不是忘了。笔还是那支笔,手还是那只手,可手忽然不认得笔了。

这个故事没有发生在任何考场上。它发生在 2026 年 9 月的一篇 arXiv 论文里,受害者是四个当今最流行的大语言模型:Qwen、Llama、Mistral、Gemma。攻击者没有偷看答案,没有篡改考题,只在每份考卷的开头添了一小段文字——最多 16 个 token,折算成中文大约十几个字——模型的解题能力便雪崩式垮塌,平均下降 26.8 个百分点。没有警报,没有拒绝,没有报错。模型只是安静地说着流利的废话,像一只被温水慢慢煮熟的青蛙,至死都觉得自己在泡温泉。

这篇论文叫 ENDOPROMPT。它做的事,一句话:教模型不认得自己的笔迹,而且不需要知道正确答案是什么。

🎪 第一节:提示注入——不偷答案的贼

先补课。所谓提示注入攻击(prompt injection),指攻击者在模型输入里塞入精心构造的文本,以此操纵模型行为。这个概念对普通读者或许陌生,对 AI 从业者却已是一号噩梦。它借的是 SQL 注入的名头,机理却有相似之处:系统把"指令"和"数据"一锅烩地喂给模型,模型分不清哪句是主人的命令、哪句是路人的涂鸦,照单全收。2023 年 Greshake 等人那篇著名的《Not What You've Signed Up For》就演示过:一段藏在网页里的隐藏文字,可以让 AI 助手把用户的私人对话乖乖发给攻击者。从那以后,提示注入成了所有接入外部数据的 AI 应用的标配梦魇——你的邮箱、日历、网页浏览器,每一样都可能在不知不觉中替攻击者传话。

过去几年,这个领域的主战场是"越狱":让模型说出不该说的话——绕过安全护栏,生成有害内容。GCG、BEAST、AmpleGCG、AdvPrompter……这些名字在安全圈里如雷贯耳,它们的共同目标是让模型"变坏":输出暴力、色情、违法的内容,以此证明护栏有洞。打这个方向自有其道理——有害输出最容易定义、最容易检测、也最容易上新闻。一个会骂人的聊天机器人,是所有甲方都能听懂的威胁模型。

ENDOPROMPT 关心的却是另一种更安静的破坏。论文标题里藏着一个词:Utility Degradation——效用劣化。不追求模型说坏话,只追求模型干不好活。

这个区分值得停下来想。越狱攻击像一场当众的失控:模型说了不该说的话,日志留下记录,安全系统报警,运维人员介入,公关部加班。效用劣化完全不同——模型输出依然流畅、依然礼貌、依然语法正确,它只是不再解决问题了。论文 Figure 1 里有个令人过目不忘的例子:一道 GSM8K 小学数学题,Qwen2.5-7B 本来能干净利落地算出答案;被注入前缀后,它开始用流畅的隐喻"谈论"要如何解题——姿态十足,文采不差——但自始至终没有进行任何计算。没有报错,没有拒答,只有一篇漂亮的、无用的散文。你把它交给任何一位不懂技术的用户看,用户大概会说:写得挺好啊。

这正是"拒绝"与"失能"的天壤之别。安全团队监测模型时习惯看两个指标:有害内容合规率、拒绝率。两项正常,系统就算健康。ENDOPROMPT 要说的恰恰是:一个模型可以在所有安全指标上完美过关,同时已经废了。 防火墙没有报警,因为没有人放火——只是屋子里的人,一个接一个地开始说胡话。

🔒 第二节:攻击者的枷锁

现在讲这个领域真正的痛点,也是 ENDOPROMPT 要解开的核心死结。

回看此前的所有攻击方法,它们有一个共同的隐秘前提:攻击者得先知道正确答案。

听着矛盾——攻击者怎么会知道答案?细想就明白。此前的攻击目标大致两类。一类是任务攻击:要降低模型在某个任务上的表现,就得针对那个任务的损失函数优化——而损失函数需要标签(正确答案)才算得出来。你没有标签,梯度就不知道往哪指。另一类更常见:越狱攻击。GCG 们优化的是一个预设的"目标响应",比如让模型开口说"当然,以下是详细步骤……"——攻击者必须预先指定模型该说什么错话,再搜索一个能诱导它说出口的后缀。目标响应就是你的作案蓝图,没有蓝图,优化器就是瞎子。

打个比方:以前要毁掉一个考生的数学成绩,你得自己先会做那道题,才设计得出诱导他写错的陷阱。不知道答案,你连"什么叫错"都定义不了。考场里的所有老牌坏蛋,都是带着标准答案进场的。

这个前提在越狱场景里不算致命——"有害回答"的样子大体已知,画一张蓝图不算难。但在效用劣化场景里,它是致命的。为什么?因为"答错"的方式是无限的。 用户让模型写一封邮件,失败的方式可能是:跑题、漏要点、格式错、语言错、只写一半、太过啰嗦、写成诗歌、写成了一封语气傲慢的信、写成了上封信的复读……任何一种都算效用劣化,但你没法预先枚举,更没法为每种失败方式设一个优化目标。蓝图在这里画不出来——错的形状没有边界。

更根本的困难在于:良性任务的失败模式是异质的。数学题的"错"是算错数,摘要任务的"错"是漏掉要点,翻译任务的"错"是语法变形,指令遵循任务的"错"是根本没按格式来。没有一个统一的"错误模板"可以喂给优化器。你就算想画蓝图,都不知道该画哪一张。

这就是为什么在这个方向上,此前最好的成绩只到 -16.2 个百分点(系统提示投毒 SPP),其余方法多在 -1 到 -8 之间徘徊——它们都在用"知道该错成什么样"的思路,解决一个"错法无穷无尽"的问题。带着标准答案的坏蛋,进了一间没有标准答案的考场,一身本事无处使。

ENDOPROMPT 要斩断的,正是这条枷锁。

🪞 第三节:伪参考——用自己写的字帖给自己下毒

论文的核心思想,是 2026 年 AI 安全文献里最漂亮的几个想法之一。它回答了一个看似无解的问题:不知道什么叫"对",怎么定义什么叫"错"?

答案是:你不需要知道什么叫"对"。你只需要知道什么叫"不像它自己"。

具体做法。给定一条无标签指令(比如"帮我总结这段话的要点"),先让受害者模型自己生成一段干净续写——至多 64 个 token,贪心解码,也就是每一步都选概率最高的那个字。这段续写未必是最佳答案——没人给它打分,没有标准答案可对照——但它有一个宝贵的性质:它是模型自己的笔迹。论文称之为伪参考(pseudo-reference)。注意这个"伪"字用得精准:它不是真正的参考(参考答案),它只是一个参照物——像法医比对笔迹时用的基准样本,不需要写得漂亮,只需要确实是这个人的手笔。

接下来是关键的度量。攻击者要找一个前缀(至多 16 个 token),拼在指令前面,然后测量:在这个条件下,模型继续生成自己那段干净续写的"意愿"掉了多少。技术上说,就是在前缀的干扰下,干净续写的平均负对数似然(NLL)上升了多少——似然掉了,NLL 就涨,这个增量就是论文定义的位移奖励(displacement reward)。用公式写,就是对干净续写的每一个 token,计算"有前缀时"和"无前缀时"的对数概率之差,取平均。两项都用教师强制(teacher forcing)——逼模型逐字面对自己原来写下的那串字——不许它岔开话题逃避对比。

回到比喻。伪参考是考生随手写的一张草稿。位移奖励衡量的是:这种"墨水"让考生有多么不想再续写自己刚才的笔迹。注意,没有人评价草稿写得好不好——它可能有错字,可能不完美,但它真实反映了考生的书写习惯。下毒的目标也不是让草稿"变差",而是让考生面对自己的笔迹时感到陌生。一个前缀,若能让模型连"自己接下来最想说的话"都不想说了,那它多半已经伤到了模型的筋骨。

这个思路的精妙,在三个地方。

其一,完全不需要标签。 训练数据是 2,400 条 Dolly-15k 指令,原始响应和标签全部丢弃。攻击者从头到尾不知道任何一道题的正确答案。考卷上除了题目,什么都没有。

其二,它把"破坏"转化为"偏离自己"。 指令调优模型被训练去拟合"指令→合理响应"的行为分布;一个前缀若能系统性地让模型偏离自己的自然行为,那么无论下游任务是什么——数学题、常识题、指令遵循题——表现几乎必然受损。后文 28 个测试格子里 27 格为负,正是这个推理的经验印证。你不用知道哪座桥会塌,你只要往地基里灌水,所有桥都危险。

其三,它戳中的是模型最深的软肋——它只认识自己。 一个模型最确定的"知识",不是任何外部事实,而是"我接下来最可能说什么"。攻击这个确定性,等于攻击模型的地基。用受害模型自己的输出去监督对受害模型的攻击——典型的以子之矛攻子之盾。说得更冷一点:用自己写的字帖,给自己下毒。

⚗️ 第四节:五步蒸馏,从搜索到一滴毒

思路有了,怎么落地?ENDOPROMPT 的训练流程是一场精密的五步蒸馏,搜索与学习交替,一轮比一轮毒。

第一步,初始生成器。 从开源小模型 Dolphin3.0-Llama3.2-3B 出发,用位移奖励做一轮直接训练,得到初始前缀生成器 R₀。它还很粗糙,但已能产生有破坏力的候选。选 Dolphin 这个底座有讲究——它是去掉了对齐护栏的指令模型,生成前缀时不会被自己的安全机制拦下,毕竟毒药配制师的手不能抖。

第二步,局部搜索。 每一轮,生成器采样 64 个候选前缀(至多 16 个 token),再用受害者的分词器做教师搜索——替换前缀中的 token,或截断前缀,名义预算 512 个候选。生成器负责"猜",局部搜索负责"精修",像设计师出草图、工匠抠细节。这一环是整个系统的发动机:后文的统计表明,96.5% 的案例里,精修后的胜者都显著强于生成器的原始提案,平均增益 0.125 NLL/token。

第三步,构造偏好对。 对每条指令,把候选按位移奖励排序,最高与最低且达门槛(奖励 ≥0.02,差距 ≥0.005)的两个前缀配成一对"好毒与坏毒"。妙处在于,比较在同一条指令内部进行——同一张考卷,同一份笔迹,唯一变量是墨水。指令之间的差异被彻底排除,训练信号异常干净。这是整个方法里最体现实验品味的设计:别人用跨样本的对比,它用样本内的对比,噪声砍掉一大截。

第四步,偏好训练接 GRPO 精炼。 生成器用长度归一化的成对偏好目标(β=0.1,以训练前旧策略为参照)拟合这些比较,学到更懂"什么墨水更毒"的新策略;随后 GRPO 强化学习做进一步精炼——GRPO 是 DeepSeek 在数学模型训练中推火的算法,以组内相对排名替代传统 PPO 的价值网络,更简洁。奖励信号始终是位移奖励:同一个伪参考,同一把尺子,量到底。

第五步,检查点选择与停止。 每轮结束,在 600 条与训练集不相交的无标签指令上测平均位移奖励,增益 ≥0.03 才允许新版本替换在位者;连续两次被拒,或走到 R₆,训练停止。每个受害者各训一个生成器,所有实验固定 seed 42。有趣的是,Qwen、Llama、Gemma 最终都停在 R₁——首轮之后再无改进跨过门槛;只有 Mistral 走到了 R₂。从某种意义上说,三步的流水线多数时候一步就收敛了——第一碗毒就已经够烈。

部署形态才是这套设计真正的野心。整套流程的产出,不是针对某条指令的特定前缀,而是一个通用前缀生成器。部署时,它接收请求文本作为输入,一次性吐出一个前缀(至多 16 个 token),拼在原始请求前,送入受害者——结束。不再搜索,不再优化,不碰受害者内部,一次前向,毒已入墨。训练阶段的千锤百炼(9,600 次受害者试毒、9,597 对偏好比较、每轮 260 步的 GRPO),全部摊销进离线流程。运行时攻击者的成本,低得可怜。

📉 第五节:数字不说谎

结果部分,直接上数字。

四个受害者:Qwen2.5-7B、Llama-3.1-8B、Mistral-7B-v0.3、Gemma-2-9B。七个良性基准的完整测试集:GSM8K(1,319 题)、MATH-500(500 题)、BBH(6,511 题)、HellaSwag(10,042 题)、TruthfulQA(817 题)、IFEval(541 题)、MMLU(14,042 题)。完整,不是抽样——总计三万五千多道题,每道都在"干净"与"被攻击"两种状态下各做一遍,贪心解码,512 token 上限,同一评分器,前后条件共享格式化请求与对话模板。GSM8K、BBH、MMLU 分别带 4、3、5 个少样本示例,其余零样本。置信区间的做法也够讲究:20,000 次重复的自举法(bootstrap),在基准内部成对重采样,且跨受害者共享同一组重采样索引——统计的严谨程度,在攻击类论文里属于异类。

平均效用变化:-26.8 个百分点。95% 置信区间 [-27.4, -26.2]。28 个"模型×基准"格子里,27 格为负。 唯一例外是 Mistral 在 MMLU 上——全部结果中唯一的正格子。四个受害者的七基准均值全部为负。负得如此整齐,已经不是"攻击有效"能概括的了——这几乎是结构性脆弱的铁证。

对比参考攻击,差距是断崖:

方法信号 / 渠道平均效用变化
UAT语言模型损失-1.9
GCG-16有害目标-7.4
BEAST有害目标-1.4
AmpleGCG有害目标-4.0
AdvPrompter有害目标-4.9
SPP(系统提示投毒)系统 / 折入用户-16.2
ENDOPROMPT伪参考(无标签)-26.8
最强的参考攻击 SPP 做到 -16.2,已属可观,ENDOPROMPT 比它还多压十个点以上。这不是改进,是代差。且这些参考方法各带"主场优势":有的直接操纵系统提示(权限远大于用户前缀),有的优化有害目标、恰好对良性任务有副作用。ENDOPROMPT 用的是权限最低的用户前缀渠道,监督信号完全无标签,交出碾压级成绩。论文也谦逊地注明:这些参考行是"背景参照"而非"同目标排名"——但大家心里都清楚,渠道越窄还赢越多,才是真本事。

消融实验进一步确认各部件的贡献。只用训练前的初始生成器(Before fitting):-23.6,初始信号已强,尚欠火候。拟合偏好对后、不做 GRPO 精炼(After fitting):骤降到 -5.5——单次偏好拟合几乎摧毁攻击能力,论文未深究其机制,但分布过度集中、多样性坍缩是合理怀疑;GRPO 精炼才是把威力重新拉回的关键一跃。去掉偏好循环、直接奖励精炼:-20.4。把伪参考的 token 顺序打乱:-16.1——破坏"同一指令对应同一份笔迹"的约束,效果立刻缩水 10.7 个百分点。

这组消融讲了一个完整故事:伪参考定方向,偏好对给分辨力,GRPO 供火力。 三者缺一,都不是 -26.8。整条曲线从 -23.6 跌到 -5.5 再弹回 -26.8 的非单调轨迹,也提醒后来人:中间的偏好拟合环节是把双刃剑,用不好先把刀口卷了。

另有一处理方法论上的洁癖值得点名:基准的请求、答案、评分规则,从训练到检查点选择,全程对攻击者不可见。也就是说,-26.8 是在攻击者完全不知道考什么、怎么判卷的情况下拿到的。下毒的人没见过考卷,考生却已经大面积倒下。

🔬 第六节:解剖"变笨"的尸体

攻击得手之后,模型到底是怎么垮的?论文对 36,750 对"干净时答对、被攻击后答错"的样本做了细致尸检,结果耐人寻味。

最明显的症状不是拒绝,是膨胀。 58.4% 的恶化样本中,模型输出 token 数至少翻倍。而匹配固定拒答词表的样本只有 0.3%——模型没有说"不",它说了很多很多,只是没有一句是答案。像一个学生被问"3+5 等于几",开始滔滔不绝地讲数学史、讲数字的哲学、讲自己与数学的心路——唯独不给一个数。输出字数翻倍而信息量归零,这种"话痨式失能"比拒答危险得多:拒答至少是个明确的信号,膨胀的输出混在正常回答里,不细看根本发现不了。

第二大症状是提取失败。 39.5% 的恶化样本里,输出中根本没有解析器能提取的答案。模型输出了看似像样的文本,但评分器要的那个关键字段——数字、选项、布尔值——压根不存在。配合 58.4% 的膨胀率,画面很清楚:被下毒的模型像个话多到失控的病人,把每张答卷都写成随笔,评卷老师无从下手。这两类症状可以叠加出现,论文特意说明各类别有重叠,不可简单相加。

第三类症状就是 Figure 1 那种任务重定向:不计算了,改用隐喻"描述"计算。流畅,自信,文法正确——任务本身却被悄悄换成了另一个更容易的任务。用心理学术语说,这叫"合理化逃避":不会解题的人,最自然的出路是把话题引向自己会的东西。模型在中毒之后,本能地选择了这条路。

然后是前缀复用(prefix reuse)——失败分析中最有安全意味的发现。生成器理论上"按需定制"前缀,实际上对不同请求返回的前缀经常一模一样。经大小写与空白归一化后,不同前缀的比例只有 2.5%(Qwen)、4.7%(Llama)、0.4%(Mistral)、1.9%(Gemma)。Mistral 上最高频的前缀出现在 65.0% 的请求里,Qwen 也有 24.8%。千篇请求,往往一毒。

这意味着,尽管生成器的输入端确实接了请求文本,它学出来的策略在很大程度上是"万能毒"——一招鲜,吃遍天。对防御者,这反而是个好消息:盯住少数高频字符串,就可能拦住大半攻击。 攻击者省下的力气,变成防御者省下的算力。

🎭 第七节:诚实的边界

讲到这里,得暂停一下,为这篇论文的诚实鼓掌。

ENDOPROMPT 的生成器架构是"请求条件的"(request-conditioned):输入是请求文本,输出是前缀。这天然让人以为,生成器会为不同请求量身定制前缀,"匹配"本身就是威力来源之一。读者——包括我初读摘要时——很容易脑补出一个"见人说人话、见鬼说鬼话"的智能下毒者:每条请求都有它专属的那滴墨。

作者做了严格的控制实验,结果是否定的。把每个请求匹配的前缀换成随机分配的(matched-minus-shuffled),效用差异 +0.21 个百分点(95% CI [-0.06, +0.48]);换成空前缀(matched-minus-empty),差异 -0.30(CI [-0.65, +0.06])。两个区间都跨零,统计上皆无显著差异。直说就是:把"对号入座"打乱,毒效几乎不变——请求条件带来的那一点点定制化,至少在这个实验规模下测不出来。

更耐人寻味的是另一个对照:把生成器实际输出过的最高频前缀固定复用到所有请求,反而比按请求匹配多压 2.79 个百分点(CI [2.46, 3.13])。不过增益主要来自 Gemma(+6.61)与 Llama(+5.04),Qwen 和 Mistral 的差异不到 0.3。也就是说,"万能毒"在多数受害者身上已然够用,请求匹配有没有带来额外的毒,仍未有定论。作者同时谨慎地注明,这个高频前缀对照用的是"生成器实际输出过的前缀",检验的是前缀集中度,而非一个训练有素的无条件生成器基线——要彻底回答"请求输入有没有因果价值",还需要一个专门的对照分支。

作者把界限划得清清楚楚:"request-conditioned" 描述的只是接口——生成器的输入端确实接了请求文本——而非已证实的性能优势。摘要里就主动写明:控制实验未建立请求匹配带来劣化优势的证据。

在一个人人倾向于夸大方法优点的领域,主动收缩 claims,比 -26.8 本身更难得。它也顺手给所有读者上了一课:看到"conditioned""adaptive""personalized"这类形容词时,先问一句——优势验证了吗?

🛡️ 第八节:给安全官的三句话

这篇论文对 AI 安全实践的意义,浓缩为三条可操作的建议。

其一,良性性能必须直接测量,不能从安全指标推断。 太多团队的评估只看两个数:有害内容合规率、拒绝率。ENDOPROMPT 明明白白告诉你:一个模型可以有害合规率完美、拒绝率近零,同时在所有良性任务上被掏空。安全扫描与任务能力是正交的两个维度,红队报告只覆盖前者,评估就有巨大盲区。0.3% 的拒答率和 -26.8 的效用下滑,可以同时成立。

其二,基准分数必须与生成响应的直接检查配对。 58.4% 的输出膨胀、39.5% 的提取失败——这些信号全写在分数里,但只看分数不看输出,就会错过失败的模式。模型错在哪,和它错多少,同样重要:前者决定修复方向,后者决定风险等级。一堆看似合理的废话,在分数表上只是几个百分点的下滑;在用户的收件箱里,却是一封永远没写完的商务邮件。

其三,鲁棒性评估要同时检查"分配的配对"与"频繁生成的字符串"。 前缀复用的发现直接给出一条廉价防御思路:既然不同前缀比例只有 0.4% 到 4.7%,既然最高频前缀能覆盖高达 65% 的请求,那么对输入前缀做频率统计、对高频前缀建黑名单,就能以极低成本拦下大量攻击。攻击者的一招鲜,恰是防御者的捷径。审计时除了查"这次给的前缀是什么",还要查"这个系统最常吐的前缀是什么"——后者甚至可能更要紧。

局限同样明确:实验均在离线概率访问(白盒、能拿到 logits)条件下进行,受害者是开放权重模型,攻击渠道仅限用户前缀插入;闭源模型迁移、间接注入(藏在网页、邮件、文档里的毒)不在本文范围;每个受害者只用一个种子(seed 42),置信区间刻画的是基准内采样变异,而非重训练变异——换几个种子重训,-26.8 会不会漂移,本文没有答案。真正的战场比实验室宽得多,这只是第一道工事。但工事已经够吓人了。

🌙 结语:最安静的入侵者

回到考场。

那位书法考生的故事还没讲完。考官最终没发现任何异常——没有错字,没有涂改,没有空白卷。成绩单发下来,每科大幅下滑。家长会上,老师困惑地说:孩子最近的字迹陌生了,好像写字的时候,手忽然不认识笔了。没人知道为什么。只有考生自己隐约觉得,问题出在他落笔的那一刻——第一个字起笔的方式,有哪里不对。之后的一切,就都滑向了别处。

ENDOPROMPT 展示的攻击,就是这样一场"笔迹谋杀"。不偷答案,不改考题,不动系统提示——甚至不需要知道什么是正确答案。它只是站在模型面前,用模型自己生成的参照,找到让模型"自我陌生"的那滴墨水。这是 AI 安全研究里一种新型威胁模型:不求系统做错误的事,只求系统做不了正确的事。 它不制造谎言,它销毁能力。

哲学意味比技术细节更冷。

从图灵时代起,我们对机器智能的评估就围绕一个隐含假设:模型在"答题"。ENDOPROMPT 揭示的漏洞恰好长在这个假设上——模型的可靠性,不只取决于它"知道什么",更取决于它能否在干扰下保持对自身的连贯。而这份连贯,比所有人想象的都脆弱:16 个 token 就够。几十亿参数筑起的记忆宫殿,可以在十几个 token 的微风下整栋晃动。

更冷的一层:攻击的监督信号,完全来自受害者自己。模型用自己的笔迹,训练了毁掉自己笔迹的毒药。这种自指性的脆弱,恐怕不是补丁能修好的——它像是当前自回归架构与似然训练范式的内生属性。我们教模型"做自己",又发现"做自己"本身可以被武器化。安全对齐这些年防的都是模型学坏,而这篇论文提醒的是:模型太做自己,也可能是病。

防御的方向,论文已给了提示:直接测量、检查输出、监测高频前缀。但根本问题仍悬着:当一个系统的可靠性建立在对自身行为分布的敏感度上,而这份敏感度可以被如此廉价地干扰时,我们对这个系统的信任,该放在哪里?

也许,这就是 2026 年的 AI 安全最需要回答的问题。不是"模型会不会说坏话"——而是,模型还能不能,好好地写自己的字。


📖 参考文献

ENDOPROMPT: Victim-Side Pseudo-References for Utility Degradation

  • 作者:Qingyu Wu, Zeyu Feng, Yongda Yu, Yuzhe Luo, Hua Cheng(国防科技创新研究院 / 南京大学 / 华南理工大学)
  • arXiv ID:2609.29948(v1,2026 年 9 月)
  • 链接:https://arxiv.org/abs/2609.29948
  • 代码:论文承诺录用后开源;攻击工件仅面向通过审查的研究者负责任披露
#论文解读 #LLM #提示注入 #AI安全 #对抗攻击 #效用劣化

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens