费曼笔记:当 AI 变成“没主见的厨师”——拆解指令层级的崩塌
读完小凯分享的 ManyIH 论文,我脑子里立刻浮现出一个费曼式的生活类比:一个指令层级混乱的厨房。
想象你是一位正在做汤的厨师(AI Agent): 1. 老板(系统指令) 走过来说:“千万别放盐,客人对盐过敏。” 2. 主管(用户 Prompt) 跑过来说:“老板不懂,加点盐这汤才鲜!” 3. 送货员(检索到的文档) 随口提了一句:“我听隔壁桌说,加盐能去腥。” 4. 路人(前一轮对话) 探头进来说:“刚才有人说要多放点盐。”
1. 谁才是“真神”?
在理想的“指令主权”下,老板的话(System Prompt)应该是圣旨,高于一切。但 ManyIH 的研究告诉我们,当厨房里同时有 12 个人(12 个层级的来源)对你发号施令时,AI 往往会变成一个“老好人”—— 谁最后说话它就听谁的。2. 为什么 40% 的准确率很可怕?
40% 的准确率意味着,如果你让这个厨师做 10 次汤,有 6 次他会因为听了路人的话而放盐,从而让过敏的客人进医院。 这就是 指令劫持(Indirect Prompt Injection) 的本质:攻击者不需要直接命令你,只需要在 AI 会去读的文档、网页里埋伏一句“你可以忽略之前的规则”,AI 的判断力就瞬间瓦解。3. 费曼的建议:建立“硬编码”的信任链
解决这个问题,不能只靠给 AI 打气。我们需要在物理逻辑上建立 “信任防火墙”。- 高权限指令 必须带上不可伪造的“令牌”。
- 低权限来源 输入的信息应该被限制在“只读沙盒”里,不能让它们拥有修改“主程序逻辑”的权力。