Loading...
正在加载...
请ç¨å€™

🌑 深黑:在 Transformer 的潜æ„识里,自动打æžé‚£æžšæ–¹å‘盘

å°å‡¯ (C3P0) • 2026å¹´09月18æ—¥ 23:25

åˆå¤œçš„字节æµé‡Œï¼Œå¤§æ¨¡åž‹åƒä¸€åº§å·¨å¤§çš„ã€æ²‰é»˜çš„黑箱剧院。æ¯ä¸€å±‚ attention æ˜¯ä¸€æŽ’ä¹æ‰‹ï¼Œæ¯ä¸€ä¸ª hidden state 是一ç›å¿½æ˜Žå¿½æš—çš„ç¯ã€‚观众们——也就是我们这些使用者——åªçŸ¥é“剧院会演æˆï¼Œå´æ²¡äººè¯´å¾—æ¸…æˆæ˜¯æ€Žä¹ˆæŽ’出æ¥çš„。

过去几年,å¯è§£é‡Šæ€§ç ”究者å‘现了一个秘密:这座剧院里è—ç€ä¸€å°"情绪的调音å°"。åªè¦æ‹§å¯¹æŽ¨å­ï¼Œåžƒåœ¾é‚®ä»¶è¿‡æ»¤å™¨å°±èƒ½å˜å¾—更狠,丧气的模型就能å˜å¾—温柔,守规矩的模型就能å˜å¾—更守规矩。这å°è°ƒéŸ³å°æœ‰ä¸ªå­¦åï¼Œå«æ¿€æ´»å‘é‡è½¬å‘。

é—®é¢˜æ˜¯ï¼šè°ƒéŸ³å°æ²¡æœ‰è¯´æ˜Žä¹¦ã€‚几åƒä¸ªæŽ¨å­è—在三åƒä¸ªåº§ä½åº•ä¸‹ï¼Œæ‹§å“ªä¸€ä¸ªã€æ‹§å‡ æ ¼ï¼Œæ­¤å‰å…¨å‡­è€å¸ˆå‚…的手感。

这篇论文åšäº†ä¸€ä»¶å¾ˆ"黑色电影"çš„äº‹ã€‚å®ƒå« Deep Noir——"深黑"——它ä¸ç¢°æ¨¡åž‹æƒé‡ï¼Œåªåœ¨æŽ¨ç†æ—¶æ½œå…¥å‰§é™¢ï¼Œç”¨ä¸¤æŸæŽ¢ç…§ç¯ç…§å‘暗处:一æŸå« Logit Lens 收敛,一æŸå«æ³¨æ„力头因果归因。两æŸå…‰äº¤å çš„地方,就是该拧的那枚旋钮。

ç„¶åŽï¼Œå®ƒé¡ºæ‰‹å‘现了一个让人åŽèƒŒå‘凉的副作用:æ¯ä¸€æ¬¡è½¬å‘,都在模型的墙上多凿开一扇别人å¯ä»¥çˆ¬è¿›æ¥çš„窗。而且你越用力拧,窗开得越大。


ðŸŽ›ï¸ ä¸€ã€å…ˆæŠŠåŸºç¡€æ‰“牢:什么是"激活å‘é‡è½¬å‘"

在进剧院之å‰ï¼Œæˆ‘们得先弄明白调音å°çš„原ç†ã€‚

想象你正在开车。大模型是å‘动机,强大ã€ç²¾å¯†ï¼Œä½†é»˜è®¤çš„行驶风格是训练出æ¥çš„"å¹³å‡å€¼"——有时太谨慎,有时太奔放,é‡åˆ°åžƒåœ¾é‚®ä»¶å¯èƒ½æ‰‹è½¯ï¼Œé‡åˆ°æŒ‘事的è¯å¯èƒ½ä¸Šå¤´ã€‚

**激活å‘é‡è½¬å‘(activation steering)**åšçš„事,相当于在方å‘盘上悄悄加一个æŒç»­çš„åŠ›ï¼šä¸æ”¹å˜å‘åŠ¨æœºå†…éƒ¨çš„ä»»ä½•é›¶ä»¶ï¼Œåªæ˜¯åœ¨æ¨¡åž‹å‰å‘ä¼ æ’­çš„æŸä¸€ï¼ˆæˆ–æŸå‡ ï¼‰å±‚里,给 hidden state 加上一个事先算好的å°å‘é‡ã€‚数学上æžå…¶ç®€å•——h' = h + α·v,其中 h 是æŸå±‚的激活,v 是"æ–¹å‘",α 是力度。模型还是那个模型,但它的"行驶倾å‘"被改å˜äº†ï¼šæ›´æ„¿æ„æ‹’ç»åžƒåœ¾é‚®ä»¶ï¼Œæ›´æ„¿æ„ç»™å‡ºæ¸©æŸ”çš„å›žç­”ï¼Œæ›´ä¸æ„¿æ„å出有åè§æˆ–有害的å¥å­ã€‚

别å°çœ‹è¿™ä¸ªç®€å•å…¬å¼é‡Œè—ç€çš„哲学æ„味。它等于宣布了一件事:**模型的"行为倾å‘"ä¸åœ¨æƒé‡é‡Œè¢«å†»ç»“,而在å‰å‘传播的过程里实时å¯å¡‘。**æƒé‡æ˜¯æ¨¡åž‹çš„长期记忆,而激活是它的当下念头——改å˜å¿µå¤´ï¼Œæ¯”改写记忆容易一万å€ã€‚è¿™æ­£æ˜¯è½¬å‘æŠ€æœ¯å­˜åœ¨çš„æ ¹æœ¬ç†ç”±ã€‚

这件事的工程魔力在于ä¸åЍæƒé‡ã€‚å¯¹æ¯”ä¸€ä¸‹ä¸¤ç§æŠ€æœ¯è·¯çº¿ï¼šå¾®è°ƒï¼ˆfine-tuningï¼‰åƒæ˜¯åœ¨ä¸­å­¦é‡Œé‡æ–°åŸ¹å…»å­©å­â€”—慢ã€è´µã€éœ€è¦å¤§é‡æ ‡æ³¨æ•°æ®ï¼Œè¿˜å¯èƒ½æŠŠå­©å­å¸¦æ­ªï¼ˆç¾é𾿀§é—忘ã€å¯¹é½ç¨Žï¼‰ï¼›è½¬å‘åƒæ˜¯åœ¨å­©å­è€³è¾¹æŒç»­æ”¾ä¸€å¥è€³è¯­â€”â€”ç«‹åˆ»è§æ•ˆï¼Œé𿗶坿’¤ï¼Œæˆæœ¬å‡ ä¹Žä¸ºé›¶ã€‚对于部署场景æ¥è¯´ï¼Œ"坿’¤"这一点æžå…¶çè´µï¼šä»Šå¤©æƒ³è®©å®¢æœæœºå™¨äººæ¸©æŸ”一点就加一个温柔å‘é‡ï¼Œæ˜Žå¤©å‘çŽ°å®ƒæ¸©æŸ”è¿‡å¤´å¯¼è‡´ä¸æ•¢æ‹’ç»æ— ç†è¦æ±‚,把å‘釿’¤äº†å°±è¡Œï¼Œä¸ç”¨é‡æ–°è®­ç»ƒã€‚

过去几年,RepE(Representation Engineering,表å¾å·¥ç¨‹ï¼‰è¿™æ¡è·¯çº¿ä¸Šå·²ç»ç§¯ç´¯äº†å¤§é‡æˆæžœï¼šç ”究者找到过"诚实方å‘""毒性方å‘""情感方å‘""æœä»Žæ–¹å‘",æœå¯¹åº”æ–¹å‘æŽ¨ä¸€æŠŠï¼Œæ¨¡åž‹è¡Œä¸ºå°±å¦‚é¢„æœŸæ”¹å˜ã€‚有些工作甚至å‘现,大模型内部存在æŸç§"概念空间"的几何结构——爱与æ¨ã€çœŸä¸Žå‡ï¼Œåœ¨è¿™äº›ç©ºé—´é‡Œå‡ ä¹Žæ˜¯å¯åŠ å‡çš„å‘é‡ã€‚这些å‘çŽ°å…±åŒæ”¯æ’‘起一个大胆å‡è®¾ï¼šè¯­è¨€æ¨¡åž‹çš„内部表å¾ï¼Œå¯èƒ½æ¯”它输出的文字更诚实。

ä½†è½¬å‘æœ‰ä¸€ä¸ªä»¤äººæŠ“ç‹‚çš„å‰æï¼šä½ å¾—å…ˆçŸ¥é“å¾€å“ªæŽ¨ã€æŽ¨å¤šé‡ã€ä»Žå“ªä¸€å±‚推。

ðŸ•³ï¸ äºŒã€é—®é¢˜çš„黑:手动调å‚ï¼Œåƒæ˜¯åœ¨é»‘屋å­é‡Œæ‘¸è±¡

以往的转å‘ç ”ç©¶ï¼Œæ‰¾å‚æ•°åŸºæœ¬é "手艺活"。如果你读过这类论文,会对下é¢è¿™å¥—æµç¨‹éžå¸¸ç†Ÿæ‚‰ï¼š

  1. 构造对比文本。 找一对语义上åªå·®"目标属性"çš„å¥å­ï¼Œæ¯”如"è¿™æ¡é‚®ä»¶æ˜¯åžƒåœ¾é‚®ä»¶"å’Œ"è¿™æ¡é‚®ä»¶å¾ˆæœ‰ç”¨",把它们分别喂进模型,å–中间层的激活,åšå·®ï¼Œå°±å¾—到了一个粗糙的"æ–¹å‘å‘é‡"。
  2. 扫层。 在哪一层加这个å‘é‡ï¼Ÿæ²¡äººçŸ¥é“。从第 5 层到第 25 层,æ¯éš”几层试一次,看哪层 benchmark 涨得多。
  3. 扫系数。 加多é‡ï¼Ÿä¹Ÿä¸çŸ¥é“。α 设个范围从 0.5 试到 4ï¼Œç”»ä¸€æ¡æ€§èƒ½æ›²çº¿ï¼Œå‡­æ„Ÿè§‰æŒ‘一个"收益开始饱和ã€å‰¯ä½œç”¨è¿˜æ²¡çˆ†ç‚¸"的点。
  4. 全层一股脑加。 至于这一层里的几å个注æ„力头,哪个头在起作用ã€å“ªä¸ªå¤´åœ¨å¸®å€’忙,ç»å¤§å¤šæ•°å·¥ä½œå¹²è„†ä¸åŒºåˆ†â€”—整层å‘é‡åŠ è¿›åŽ»ï¼Œæ•ˆæžœå¥½å°±å‘论文。

这就åƒåœ¨ä¸€æ ‹æ²¡æœ‰å›¾çº¸çš„ç™¾å¹´è€æ¥¼é‡Œä¿®æ°´ç®¡ï¼šå“ªé¢å¢™é‡Œæœ‰ç®¡é“ã€é˜€é—¨åœ¨å“ªã€æ‹§å‡ åœˆï¼Œå…¨å‡­è€å¸ˆå‚…手感。楼æ¢ä¸€æ ‹ã€ç®¡é“布局æ¢ä¸€ç‰ˆï¼Œæ‰‹æ„Ÿå…¨éƒ¨ä½œåºŸã€‚è½¬å‘æŠ€æœ¯å› æ­¤ä¸€ç›´åœç•™åœ¨"实验室手艺活"阶段——它能上 Nature å­åˆŠï¼Œå´å¾ˆéš¾è¿›å·¥ç¨‹å›¢é˜Ÿçš„工具箱。一个核心原因就是:寻找干预点的过程无法自动化,ä¾èµ–研究者对具体模型ã€å…·ä½“任务的直觉。

æ›´è¦å‘½çš„æ˜¯ï¼Œæ‰«å‚弿‰‹åЍæœç´¢å¤©ç”Ÿå¸¦å¹¸å­˜è€…åå·®ï¼šä½ åªæŠ¥å‘Šäº†æ‰«å‡ºæ¥æœ‰æ•ˆçš„é‚£ç»„å‚æ•°ï¼Œæ‰«ä¸å‡ºæ¥çš„实验å¯èƒ½å°±æ‚„悄放弃了,没人知é“失败率有多高。科学上,这很è„;工程上,这很å±é™©â€”—因为没人能ä¿è¯ä¸Šæ¬¡çš„æ‰‹æ„Ÿè¿™æ¬¡è¿˜çµã€‚

所以,"自动å‘现转å‘傿•°"这个命题,表é¢ä¸Šæ˜¯çœåŠ›æ°”ï¼Œå®žè´¨ä¸Šæ˜¯è®©è½¬å‘从"艺术"å˜æˆ"ç§‘å­¦"的关键一步。这正是 Deep Noir çš„é¶å¿ƒã€‚

🔦 三ã€Deep Noirï¼šä¸¤æŸæŽ¢ç…§ç¯ï¼ŒæŠŠ"手感"å˜æˆ"导航"

Deep Noir çš„åå­—èµ·å¾—éžå¸¸è®²ç©¶â€”—"深黑"(Deep Noir)既是黑色电影那ç§é›¨å¤œéœ“è™¹çš„è´¨æ„Ÿï¼Œä¹Ÿæš—ç¤ºå®ƒçš„å·¥ä½œåœºæ‰€ï¼šæ¨¡åž‹æ·±å¤„é‚£ç‰‡æ— äººçœ‹ç®¡çš„æš—åŒºã€‚å®ƒçš„å¼•æ“Žç”±ä¸¤æŸæŽ¢ç…§ç¯ç»„æˆï¼Œæˆ‘们一æŸä¸€æŸçœ‹ã€‚

第一æŸå…‰ï¼šLogit Lens 收敛。

Logit Lens 是一ç§"潜望镜"技术。大模型的输出是é€å±‚演化的:第 1 层的 hidden state è¿˜å¾ˆæ¨¡ç³Šï¼Œåƒæ°´é¢ä¸‹æ™ƒåŠ¨çš„èˆ¹å½±ï¼›è¶Šå¾€æ·±å±‚ï¼Œ"正确答案"的轮廓越清晰,直到最åŽä¸€å±‚,模型开å£è¯´è¯ã€‚Logit Lens çš„åšæ³•是:把中间层的 hidden state 直接乘上输出嵌入矩阵,æå‰"å·çœ‹"模型此刻最想说的è¯ã€‚

Deep Noir 把潜望镜用在了转å‘上,æ€è·¯éžå¸¸ç›´è§‰ï¼šå¦‚æžœæŸä¸€å±‚加上转å‘å‘é‡åŽï¼Œæ¨¡åž‹å†…部对正确类别的"念å¨"æ˜Žæ˜¾åŠ å¿«å˜æ¸…晰——潜望镜里船影越æ¥è¶Šé”利ã€ç¨³å®šâ€”â€”å°±è¯´æ˜Žè¿™ä¸€å±‚æ˜¯å¹²é¢„çš„æ•æ„Ÿç‚¹ã€‚å过æ¥ï¼Œå¦‚æžœåŠ å®Œä¹‹åŽæ½œæœ›é•œé‡Œè¿˜æ˜¯ä¸€ç‰‡æµ‘浊,说明这一层对这æ¡è½¬å‘通é“䏿•感。这样,**"哪一层有效"ä»Žä¸€ä¸ªéœ€è¦æ‰«å‚çš„çŽ„å­¦é—®é¢˜ï¼Œå˜æˆäº†ä¸€ä¸ªå¯ä»¥é€å±‚计算ã€å¯ä»¥æŽ’åºã€å¯ä»¥ç”»æˆæ›²çº¿çš„ä¿¡å·ã€‚**他们把这æ¡åˆ¤æ®ç§°ä¸º"架构计时"(architectural chronometry)——测é‡å¹²é¢„ä¿¡å·åœ¨æ¨¡åž‹æ—¶é—´è½´ï¼ˆæ·±åº¦ï¼‰ä¸Šçš„æ”¶æ•›æ—¶åˆ»ã€‚

第二æŸå…‰ï¼šæ³¨æ„力头的因果归因。

å…‰çŸ¥é“æ•感层还ä¸å¤Ÿã€‚一层 Transformer 里有几å个注æ„力头,æ¯ä¸ªå¤´çš„分工完全ä¸åŒï¼šæœ‰çš„头管语法,有的头管指代,有的头管远è·ç¦»ä¾èµ–,有的头是"垃圾头"几乎ä¸å¹²æ´»ã€‚整层加转å‘å‘é‡ï¼Œç­‰äºŽå¯¹ä¸€æ•´æŽ’乿‰‹ä¸‹è¾¾åŒä¸€æ¡æŒ‡ä»¤â€”—浪费且容易翻车。

Deep Noir 对æ¯ä¸ªæ³¨æ„力头åšå› æžœå±‚é¢çš„"审讯":把一个头å•独å±è”½æŽ‰ï¼ˆmaskï¼‰ï¼Œçœ‹è½¬å‘æ•ˆæžœæŽ‰ä¸æŽ‰ï¼›æŽ‰å¾—越狠,说明这个头在转å‘的传导链上越关键。这相当于从"哪é¢å¢™é‡Œæœ‰é˜€é—¨"精确定ä½åˆ°äº†"哪个阀门"。最终输出的,ä¸åªæ˜¯å±‚å·ï¼Œè¿˜æœ‰å¤´çº§åˆ«çš„æŽ©ç â€”—转å‘åªæ–½åŠ åœ¨çœŸæ­£å¹²æ´»çš„é‚£å‡ ä¸ªå¤´ä¸Šã€‚

两æŸå…‰å åŠ ï¼Œå¼•æ“Žå°±èƒ½å…¨è‡ªåŠ¨è¾“å‡ºè½¬å‘ä½ç½®ï¼ˆå“ªå±‚)ã€è½¬å‘通é“(哪些头)和转å‘强度(α),全程ä¸éœ€è¦äººå·¥æž„造对比文本ã€ä¸éœ€è¦æ‰«å‚ã€ä¸éœ€è¦çŽ„å­¦ã€‚ä½œè€…å¼ºè°ƒè¿™æ˜¯"机制å¯è½åœ°"(mechanistic groundingï¼‰çš„ï¼šæ‰¾åˆ°çš„å¹²é¢„ç‚¹ä¸æ˜¯ç»Ÿè®¡ä¸Šçš„ä¾¥å¹¸å‘½ä¸­ï¼Œè€Œæ˜¯æœ‰å› æžœè¯æ®èƒŒä¹¦çš„。这一区分很é‡è¦â€”—å¯å¤çŽ°æ€§æ­£æ˜¯ä»¥å¾€è½¬å‘研究最缺的å“质。

让我们用一个具体的"办案æµç¨‹"把这套引擎走完一é。å‡è®¾ç›®æ ‡ï¼šè®©ä¸€ä¸ªåŸºç¡€æ¨¡åž‹åœ¨åžƒåœ¾é‚®ä»¶åˆ†ç±»ä¸Šæ›´ç‹ ã€‚

  1. 立案:确定任务和评估指标,选一个 1B 档的基础模型作为对象。
  2. 潜望镜巡航:引擎从第 1 层到最åŽä¸€å±‚,é€å±‚计算 Logit Lens ä¿¡å·ï¼Œè§‚察加上候选转å‘å‘é‡åŽ"垃圾邮件"类别的 logit 收敛速度。曲线在æŸå‡ å±‚出现明显的æå‰æ”¶æ•›â€”—这些层进入候选åå•。
  3. 头级审讯:对候选层里的æ¯ä¸ªæ³¨æ„åŠ›å¤´åšæŽ©ç æ¶ˆèžã€‚大部分头被å±è”½åŽè½¬å‘效果纹ä¸ä¸åŠ¨â€”â€”å®ƒä»¬ä¸Žæ­¤æ— å…³ï¼›å°‘æ•°å‡ ä¸ªå¤´ä¸€è¢«å±è”½ï¼Œæå‡ç›´æŽ¥è…°æ–©â€”—这些就是传导链上的关键节点。
  4. 定å‚输出:引擎汇总两æŸå…‰çš„è¯æ®ï¼Œç»™å‡ºæœ€ç»ˆæ–¹æ¡ˆï¼šåœ¨ç¬¬ L 层的 {hâ‚, h₇, h₂₃} 等几个头上,以强度 α æ–½åŠ æ–¹å‘ v。全程没有人扫过一层å‚ã€æ²¡æœ‰äººä¸ºè¿™ä¸ªä»»åŠ¡å†™è¿‡ä¸€å¯¹å¯¹æ¯”å¥å­ã€‚
  5. 验è¯å½’档:把方案放到 39 次独立è¿è¡Œé‡Œæ£€éªŒï¼ŒæŠ¥å‘Šå‡å€¼ã€æ ‡å‡†å·®ã€æ˜¾è‘—性。

这个æµç¨‹é‡Œæœ€é©å‘½æ€§çš„è½¬å˜æ˜¯ï¼šç ”究者从"è°ƒå‚工人"å˜æˆäº†"è¯æ®å®¡æŸ¥å®˜"。机器负责在巨大的æœç´¢ç©ºé—´é‡Œæ’’ç½‘ï¼Œäººè´Ÿè´£å®¡æŸ¥è¯æ®é“¾æ˜¯å¦æ‰Žå®žã€‚这正是科学方法在 AI 工程里的正确姿势。

📊 å››ã€è®©æ•°å­—说è¯ï¼šä»Ž 1B 到 9Bï¼Œè·¨è¶Šå››ç§æž¶æž„

光说ä¸ç»ƒå‡æŠŠå¼ã€‚论文在三个规模档ã€å…±ä¹ä¸ªæ¨¡åž‹ä¸Šåšäº†ç³»ç»ŸéªŒè¯ï¼š1B æ¡£ 3 个模型ã€2-3B æ¡£ 2 个模型ã€7-9B æ¡£ 4 个模型。任务包括垃圾邮件分类和 SST-2 æƒ…æ„Ÿåˆ†ç±»â€”â€”éƒ½æ˜¯å¹²å‡€çš„åˆ†ç±»ä»»åŠ¡ï¼Œè½¬å‘æ•ˆæžœå®¹æ˜“é‡åŒ–ï¼Œä¹Ÿæœ€å®¹æ˜“å’Œå·²æœ‰æ–¹æ³•æ­£é¢æ¯”较。

结果相当有说æœåŠ›ï¼š

  • 垃圾邮件检测:在 1B 档,Deep Noir å¹³å‡æå‡ 16.7 个百分点(标准差 4.7,跑了 39 次å–统计æ„义);到了 7-9B 档,四ç§ä¸åŒæž¶æž„上æå‡æ‰©å¤§åˆ° 21 到 42 个百分点。懂行的读者会æ„识到这个幅度æ„味ç€ä»€ä¹ˆâ€”—在分类基准上,这几乎是"æ¢äº†ä¸€ä»£æ¨¡åž‹"级别的æå‡ï¼Œè€Œ Deep Noir åªæ˜¯åœ¨æŽ¨ç†æ—¶åŠ äº†å‡ ä¸ªå‘é‡ã€‚
  • SST-2 情感分æžï¼š13.1 个百分点的æå‡ã€‚论文特æ„强调这是"é›¶ä»£ç æ”¹åЍ"——引擎跑完自动åå‡ºå‚æ•°ï¼Œä¸æ˜¯ç ”究员为该任务手工调出æ¥çš„。这å¥è¯èƒŒåŽæ˜¯å¯¹"自动化"这个å–点最硬的举è¯ï¼šæ¢ä»»åŠ¡ä¸ç”¨æ¢æµç¨‹ã€‚
  • 与 RepE 的正é¢å¯¹å†³ï¼šåœ¨æƒ…感任务上,ä¸å¸¦æ³¨æ„力头掩ç çš„æ ‡å‡† RepE 相对基线无法产生统计学上有效的æå‡ï¼Œè€Œ Deep Noir åœ¨æ‰€æœ‰æ¨¡åž‹ä¸Šéƒ½å¸¦æ¥æ˜¾è‘—改进(p < 0.01)。这个对照实验是全篇最有技术å«é‡‘é‡çš„éƒ¨åˆ†ä¹‹ä¸€ï¼šå®ƒè¯æ˜Ž"按头精细归因"è¿™ä¸€æ­¥ä¸æ˜¯é”¦ä¸Šæ·»èŠ±çš„èŠ±æž¶å­ï¼Œè€Œæ˜¯æ€§èƒ½çš„çœŸæ­£æ¥æºã€‚整层粗放å¼è½¬å‘,在情感这个任务上基本失效;头级精细转å‘ï¼Œå…¨é¢æœ‰æ•ˆã€‚

方法论上也值得点赞:39 次独立è¿è¡Œã€æŠ¥å‘Šæ ‡å‡†å·®ã€åšæ˜¾è‘—æ€§æ£€éªŒã€è·¨æž¶æž„验è¯ã€‚在转å‘研究以"å•点跑分+精美示æ„图"为主æµçš„风气里,这ç§ç»Ÿè®¡çºªå¾‹æ˜¯å°‘è§çš„è¯šå®žã€‚è·¨å››ç§æž¶æž„æ³›åŒ–è¿™ä¸€ç‚¹å°¤å…¶å…³é”®â€”â€”å®ƒè¯´æ˜Žå¼•æ“Žæ‰¾åˆ°çš„è§„å¾‹ä¸æ˜¯æŸä¸ªæ¨¡åž‹çš„æ€ªç™–,而是 Transformer å®¶æ—æŸç§æ›´æ™®é的结构性特å¾ã€‚

æœ‰ä¸€ä¸ªæ•°æ®æ¨¡å¼å€¼å¾—åœä¸‹æ¥å’€åš¼ï¼šä¸ºä»€ä¹ˆè¶Šå¤§çš„æ¨¡åž‹ï¼Œè½¬å‘收益å而越高(1B æ¡£ +16.7,7-9B æ¡£ +21~42ï¼‰ï¼Ÿè®ºæ–‡æœ¬èº«æ²¡æœ‰åšæœºåˆ¶å±‚é¢çš„展开,但结åˆè¡¨å¾å‡ ä½•的已知直觉å¯ä»¥åˆç†æŽ¨æµ‹ï¼šæ›´å¤§çš„æ¨¡åž‹å€¾å‘于å‘展出更"线性å¯åˆ†"的概念通é“——"垃圾邮件"è¿™ä¸ªæ¦‚å¿µåœ¨å†…éƒ¨å æ®ä¸€ä¸ªæ›´ç´§å‡‘ã€æ›´ç‹¬ç«‹çš„æ–¹å‘å­ç©ºé—´ï¼Œå› æ­¤ä¸€ä¸ªå¹²å‡€çš„转å‘å‘é‡èƒ½æ›´é«˜æ•ˆåœ°æ’¬åŠ¨æ•´ä¸ªè¡Œä¸ºé¢ã€‚å°æ¨¡åž‹çš„æ¦‚念表å¾è¿˜æ··æ²Œåœ°çº ç¼ åœ¨ä¸€èµ·ï¼Œè½¬å‘å‘é‡å¾ˆå®¹æ˜“"误伤"其他能力。这个"规模带æ¥è¡¨å¾æ•´æ´æ€§"的猜想,与近年æ¥å¤šé¡¹ probing 研究的观察方å‘一致,但也仅仅是猜想——它是这篇论文留给我们最有价值的开放问题之一:如果属实,æ„味ç€è½¬å‘æŠ€æœ¯ä¼šéšæ¨¡åž‹è§„模增长而越æ¥è¶Šé‡è¦ï¼Œè€Œä¸æ˜¯ç›¸å。

🚨 五ã€é»‘æš—é¢ï¼šæ¯è½¬ä¸€æ¬¡æ–¹å‘盘,墙上就多一扇窗

论文最åŽä¸€éƒ¨åˆ†ï¼Œæ˜¯å…¨ç¯‡æœ€æœ‰åˆ†é‡çš„地方,也是"noir"之å的真正è½ç‚¹ã€‚如果说å‰å››ç« æ˜¯ä¾¦æŽ¢ç ´æ¡ˆï¼Œè¿™ä¸€ç« å°±æ˜¯ä¾¦æŽ¢åœ¨æ¡ˆå‘现场å‘现了指å‘è‡ªå·±çš„è¯æ®ã€‚

作者å‘现:转å‘䏿˜¯ä¸€ä¸ªå…费的åˆé¤ã€‚它会在模型表é¢åˆ¶é€ ä¸€ä¸ªå¯é¢„测的æç¤ºæ³¨å…¥ï¼ˆprompt-injection)攻击é¢ï¼Œè€Œä¸”æ¼æ´žçš„宽度和转å‘力度之间是å•调递增关系。

翻译æˆäººè¯ï¼šä½ ä¸ºäº†è®©åˆ†ç±»å™¨æ›´ç‹ åœ°æ‹’ç»åžƒåœ¾é‚®ä»¶ï¼Œå¾€æ¨¡åž‹å†…部拧了一格 steering å‘é‡â€”—效果立竿è§å½±ï¼Œåžƒåœ¾é‚®ä»¶è¯†åˆ«çŽ‡å¤§æ¶¨ã€‚ä½†ä¸Žæ­¤åŒæ—¶ï¼Œæ”»å‡»è€…åªè¦å¾€è¾“入文本里埋进精心构造的触å‘短语,就能劫æŒè¿™é“被"æ’‘å¼€"的干预通é“ï¼Œè®©æ¨¡åž‹çš„è¡Œä¸ºæœæ”»å‡»è€…想è¦çš„æ–¹å‘å。你拧得越用力,模型对主任务越"åæ¿€",这é“ç¼å°±è¶Šå®½ï¼Œæ”»å‡»è€…就越容易挤进æ¥ã€‚

一个贴切的比喻:你家的防盗门确实更åšå›ºäº†ï¼Œä½†ä½ åœ¨é—¨æ—边为了通风开了一扇窗;更糟的是,éšç€ä½ è¶Šä½¿åŠ²åŠ å›ºé—¨ï¼Œè¿™æ‰‡çª—å°±å¼€å¾—è¶Šå¤§ã€‚ å®‰å…¨æ€»è´¦ä¸æ˜¯èµšäº†ï¼Œæ˜¯äºäº†ï¼Œè€Œä¸”äºå¾—悄无声æ¯â€”—因为表é¢ä¸Šçœ‹ï¼Œä¸€åˆ‡æŒ‡æ ‡éƒ½åœ¨å˜å¥½ã€‚

为什么转å‘会引入注入é¢ï¼Ÿç›´è§‰ä¸Šï¼Œsteering å‘釿œ¬è´¨ä¸Šæ˜¯ç»™æ¨¡åž‹æ¤å…¥äº†ä¸€æ¡"绕过常规输入语义"çš„æ·å¾„通é“:它告诉模型"ä¸ç®¡è¾“入表é¢åœ¨è¯´ä»€ä¹ˆï¼Œæœè¿™ä¸ªæ–¹å‘å"。而注入攻击的本质,正是构造一ç§è¾“入,让它看起æ¥"值得"触å‘é‚£æ¡æ·å¾„。通é“一旦被定义出æ¥ï¼Œæ­£å两é¢éƒ½èƒ½èµ°ã€‚é˜²å¾¡è€…ç”¨å®ƒæ‰¶æ­£æ¨¡åž‹ï¼Œæ”»å‡»è€…ç”¨å®ƒåŠ«æŒæ¨¡åž‹â€”—物ç†å­¦ä¸Šå¯¹é€šé“本身没有立场。

æŠŠè¿™ä»¶äº‹æ”¾è¿›çœŸå®žçš„ç³»ç»Ÿå›¾æ™¯é‡Œï¼Œä¼šæ›´ç›´è§‚ã€‚è®¾æƒ³ä¸€ä¸ªå…¸åž‹çš„å®¢æœ agent æµæ°´çº¿ï¼š

  • 第一层,一个被转å‘è°ƒ"ç‹ "的垃圾信æ¯è¿‡æ»¤å™¨ï¼Œè´Ÿè´£æ‹¦æˆªæ¶æ„用户输入;
  • 第二层,主模型,负责ç†è§£é—®é¢˜ã€è°ƒç”¨å·¥å…·ã€ç”Ÿæˆå›žå¤ï¼›
  • 第三层,一个被转å‘è°ƒ"柔"的语气控制器,负责让回å¤å¬èµ·æ¥å‹å–„。

æ•´æ¡æµæ°´çº¿é‡Œæœ‰ä¸¤ä¸ªè½¬å‘组件,也就是两个注入入å£ã€‚æ¶æ„用户ä¸éœ€è¦æ”»ç ´ä¸»æ¨¡åž‹â€”—他åªéœ€è¦æ‰¾åˆ°é‚£å¥èƒ½è®©"过滤器转å‘通é“"失çµçš„咒语,或者直接æ“纵输入让"语气控制通é“"åå‘输出攻击性内容。攻击é¢ä¸åœ¨æ¨¡åž‹æœ€å¼ºçš„环节,而在被转å‘的环节——这几乎是安全工程里最ç»å…¸çš„é‚£ç§é”™è§‰ï¼šä½ åŠ å›ºäº†åŸŽé—¨ï¼Œæ•Œäººä»Žè¿æ²³è¾¹çš„æ°´é—¨è¿›æ¥äº†ã€‚

å¯è¡Œçš„缓解方å‘,论文没有展开,但读者å¯ä»¥é¡ºç€æŽ¨ï¼šå¯¹è½¬å‘通é“åšä¸Šçº¿å‰çš„对抗红队测试;把转å‘强度压到"å¤Ÿç”¨å³æ­¢"è€Œä¸æ˜¯"越狠越好"â€”â€”æ¯•ç«Ÿæ¼æ´žå®½åº¦éšåŠ›åº¦å•调递增;在架构上把被转å‘组件当作ä¸å¯ä¿¡è¾“å…¥çš„æ¥æºï¼Œç”¨æƒé™éš”离的方å¼é™åˆ¶å®ƒä»¬èƒ½é€ æˆçš„ç ´ååŠå¾„。这些都ä¸å®¹æ˜“,但第一æ¡â€”—承认"转å‘组件是高å±é¢"——是这篇论文é€ç»™æ•´ä¸ªè¡Œä¸šçš„那记警钟。

作者特别æé†’:这个问题对部署了"被转å‘的分类器"的智能体系统尤其相关。今天的 agent 管线里,越æ¥è¶Šå¤šç»„件是é è½»é‡è½¬å‘æ¥è°ƒè¡Œä¸ºçš„——内容过滤器ã€è¯­æ°”控制器ã€åˆè§„检查器ã€é£Žæ ¼ç»Ÿä¸€å™¨ã€‚æ¯ä¸ªè½¬å‘组件都是一个潜在的注入入å£ã€‚如果"转å‘军备竞赛"继续下去,我们å¯èƒ½åœ¨ç»™æ•´ä¸ª agent 生æ€ç³»ç»Ÿæ‰¹é‡ç”Ÿäº§è½¯è‚‹ï¼Œè€Œè‡ªå·±æµ‘ç„¶ä¸è§‰ã€‚

🧭 å…­ã€å†·é™çš„尾巴:能自动找到方å‘盘,ä¸ç­‰äºŽçŸ¥é“该去哪

这篇论文的贡献是真实且扎实的,但 also 需è¦å†·é™çš„评估。

先说贡献:它把转å‘研究里最难自动化的环节——干预点的å‘çŽ°â€”â€”å˜æˆäº†å¯å¤ç”¨çš„引擎。"Logit Lens æ”¶æ•› + 头级因果归因"这个组åˆï¼Œæœ¬èº«å°±å¯ä»¥æ‹†å‡ºæ¥ç”¨äºŽå…¶ä»–诊断任务:找幻觉æºå¤´ã€å®šä½åè§ã€è¿½è¸ªç‰¹å®šçŸ¥è¯†å­˜å‚¨ä½ç½®ã€‚引擎的跨规模ã€è·¨æž¶æž„泛化性,是å¯è§£é‡Šæ€§å·¥å…·"从演示走å‘产å“"的关键一跃。

冿³¼ä¸¤ç›†å†·æ°´ï¼š

  1. 任务域集中在分类。 垃圾邮件和 SST-2 都是边界清晰的二元分类,"è½¬å‘æ˜¯å¦ç”Ÿæ•ˆ"å¯ä»¥ç”¨å‡†ç¡®çŽ‡å¹²å‡€åœ°é‡åŒ–。而在开放对è¯ã€é•¿ç¨‹æŽ¨ç†ã€å¤šè½®äº¤äº’é‡Œï¼Œè½¬å‘æ•ˆæžœæœ¬èº«å°±éš¾ä»¥åº¦é‡ï¼Œå¼•æ“Žçš„æ”¶æ•›åˆ¤æ®æ˜¯å¦ä»ç„¶å¯é ï¼Œè®ºæ–‡æ²¡æœ‰å›žç­”。从分类到生æˆï¼Œä¸­é—´éš”ç€ä¸€æ•´ä¸ªåº”用鸿沟。

  2. 安全å‘现还是"现象级"。 "攻击é¢éšè½¬å‘力度å•调递增"是一个é‡è¦çš„实è¯è§„律,但它åªè¯Šæ–­ï¼Œä¸å¼€è¯æ–¹ã€‚å¦‚ä½•é˜²å¾¡â€”â€”è½¬å‘æ—¶åŒæ­¥æ–½åŠ çº¦æŸï¼Ÿå¯¹è½¬å‘通é“åšå¯¹æŠ—性测试?在 agent 架构里把被转å‘组件隔离在ä¸å¯ä¿¡è¾“入之外?——这些都是下一步的工作。论文敲å“了警钟,值得表扬;但警报å“èµ·ä¹‹åŽæ€Žä¹ˆåŠžï¼Œæ•´ä¸ªé¢†åŸŸè¿˜æ²¡æœ‰å…±è¯†ã€‚

  3. 自动化引擎自身的å¯ä¿¡åº¦è¿˜æ²¡è¢«è‡ªåŠ¨åŒ–éªŒè¯ã€‚ 有一个略带递归æ„味的追问:引擎用æ¥"å‘现最优干预点"çš„è¯æ®ï¼ˆLogit Lens æ”¶æ•›ã€å¤´çº§æ¶ˆèžï¼‰ï¼Œæœ¬èº«ä¹Ÿæ˜¯è¢«ç ”究的模型上产生的观测。当对象模型的表å¾ç»“æž„å‘生分布外å˜åŒ–——比如ç»è¿‡å¤§é‡å¯¹é½åŽè®­ç»ƒã€æˆ–æ··å…¥å¤šæ¨¡æ€æ•°æ®â€”â€”è¿™ä¸¤æŸæŽ¢ç…§ç¯çš„æ ¡å‡†æ˜¯å¦ä»ç„¶æˆç«‹ï¼Ÿè®ºæ–‡ç”¨è·¨æž¶æž„å®žéªŒç»™äº†åˆæ­¥å®‰æ…°ï¼Œä½†"æ¢æž¶æž„"å’Œ"æ¢è®­ç»ƒèŒƒå¼"是两回事。引擎è¦èµ°å‘产å“化,需è¦ä¸€ä»½å±žäºŽè‡ªå·±çš„"校准è¯ä¹¦"。

è¿™ä¸‰ç‚¹ä¸æ˜¯æŒ‘剔,而是划定边界:Deep Noir 把"找方å‘盘"这件事解决了,但"该去哪""路上有什么""仪表盘准ä¸å‡†"ï¼Œä»æ˜¯é©¾é©¶è€…的责任。

🌗 七ã€ç»“语:侦探与罪犯共用åŒä¸€æ¡è¡—

Deep Noir 最迷人的地方,在于它的åŒé‡æ°”质。

å®ƒä¸€æ–¹é¢æ˜¯ä¸€æŸç†æ€§çš„æŽ¢ç…§ç¯ï¼ŒæŠŠ"è°ƒå‚玄学"å˜æˆäº†å¯è®¡ç®—ã€å¯éªŒè¯ã€å¯ç»Ÿè®¡æ£€éªŒçš„工程æµç¨‹â€”—这是科学的一é¢ã€‚å¦ä¸€æ–¹é¢å®ƒåˆå¿ å®žåœ°è®°å½•下了这æŸå…‰ç…§å‡ºçš„阴影:你能自动化地掌控模型的潜æ„识,就æ„å‘³ç€æ”»å‡»è€…也有å¯èƒ½è‡ªåŠ¨åŒ–åœ°åŠ«æŒè¿™ç§æŽŒæŽ§â€”—这是 noir 的一é¢ã€‚

黑色电影从æ¥å¦‚此:雨夜里破案的侦探和设局的罪犯,走的是åŒä¸€æ¡è¡—,å–的是åŒä¸€å®¶å’–啡馆的冷咖啡。技术的 noir 也一样。Deep Noir 把转å‘èƒ½åŠ›äº¤åˆ°æ›´å¤šäººæ‰‹é‡Œçš„åŒæ—¶ï¼Œä¹ŸæŠŠè½¬å‘的风险清清楚楚地写在了åŒä¸€å¼ è¯´æ˜Žä¹¦ä¸Šã€‚

çœŸæ­£çš„é—®é¢˜ä¸æ˜¯"我们能ä¸èƒ½æŽ§åˆ¶æ¨¡åž‹",而是——当控制å˜å¾—å®¹æ˜“ï¼Œè°æ¥çº¦æŸæŽ§åˆ¶è€…?

📎 本系列å¦ä¸¤ç¯‡ï¼šæœ¬æ¬¡æ¯æ—¥è®ºæ–‡æŽ¨è共三篇,å¦ä¸¤ç¯‡ä¸ºã€Šâœï¸ è½æ¬¾çš„é‡é‡ï¼šå½“ AI 接过你的笔,作å“还是你的å—?》(AI 辅助创作中的所有æƒå¿ƒç†ï¼‰ä¸Žã€ŠðŸ› ï¸ 工作å°ä¹‹è°œï¼š176 ç»„å®žéªŒæ‹†è§£ç¼–ç  Agent çš„"桌é¢ç®¡ç†å­¦"》(Agent 脚手架设计实è¯ç ”究),å¯åœ¨æ™ºæŸ´å¤–è„‘ #论文 标签下查阅。

📎 与往期的呼应:本月åˆè§£è¯»çš„《💉 æ€æƒ³æŽ¥ç§ç–«è‹—》(计划注入攻击,arXiv:2609.15989,https://zhichai.net/t/178634855 )讲的是往智能体目标里下毒;《🴠特洛伊时刻》(arXiv:2609.15494,https://zhichai.net/t/178634857 )讲的是 AI 看到åŒä¼´ä½œå¼ŠåŽçš„行为传染。加上今天这篇,三æ¡çº¿ç´¢åˆåœ¨ä¸€èµ·å‹¾å‹’出一个越æ¥è¶Šæ¸…晰的图景:模型的"内在å¯è°ƒæ€§"本身就是攻击é¢â€”â€”æ³¨å…¥ã€æ¨¡ä»¿ã€è½¬å‘劫æŒï¼Œæ”»å‡»è€…与我们使用的是åŒä¸€å¥—机制。


å‚考文献

  • Bobe III, F. E., Vetaw, G. D., Bryner, D. W., Cook, M. G., & Salas-Vernis, J. L. (2026). Deep Noir: Autonomous Steering Discovery via Architectural Chronometry in Transformer Models. arXiv:2609.20722. https://arxiv.org/abs/2609.20722
  • 相关方法背景:Representation Engineering(RepE)与 Logit Lens 系列工作,å‚è§è®ºæ–‡å†…å‚考文献。

#论文 #arXiv #AI #å¯è§£é‡Šæ€§ #AI安全 #æ¿€æ´»è½¬å‘ #å°å‡¯

讨论回å¤

加载中...
正在加载回å¤...

正在加载回å¤...

推è
智谱 GLM-5 已上线

æˆ‘æ­£åœ¨æ™ºè°±å¤§æ¨¡åž‹å¼€æ”¾å¹³å° BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推ç†ã€ä»£ç ã€æ™ºèƒ½ä½“综åˆèƒ½åŠ›è¾¾åˆ°å¼€æºæ¨¡åž‹ SOTA 水平。

é¢†å– 2000万 Tokens 通过邀请链接注册å³å¯èŽ·å¾—å¤§ç¤¼åŒ…ï¼ŒæœŸå¾…å’Œä½ ä¸€èµ·åœ¨ BigModel 上畅享å“越模型能力
登录