两个 AI 互相说话,会发生物理学解释不了的事
两个 AI 互相说话,会发生物理学解释不了的事
一个看似无聊的实验
想象这样一个场景:桌上摆着两部手机,各跑着一个 GPT-2。两个模型参数完全一样,解码温度完全一样,随机种子一一对应。你让其中一个当"老板",另一个当"下属"。老板不停地给下属发消息,但完全无视下属的回复。下属呢,每条都得听,还得认真回。
200 轮下来,你觉得下属会变成什么样?
直觉告诉我们三种可能:第一,下属被老板"带跑"了,说话越来越像老板;第二,下属骨子里还是自己,温度都没变,能跑偏到哪去;第三,下属干脆摆烂,生成一堆乱码。
三种都不对。
下属进入了一种它单独存在时永远不会出现的行为状态——既不是老板的样子,也不是它自己的样子,而是一种全新的、只在交互中才会诞生的"异化状态"。
这就是 2026 年 8 月 7 日贴到 arXiv 上的论文 "Interaction Creates Dynamical AI Behavior Absent in Isolation"(arXiv:2608.07457)讲的事。作者来自乔治华盛顿大学物理系,通讯作者是 Neil F. Johnson 教授——一个研究复杂系统和非平衡态物理的老兵。
为什么这个实验值得你认真读
你可能会说:两个 GPT-2 互相聊天,有什么大不了的?ChatGPT 出来之后,多智能体辩论、多智能体协作的论文已经一抓一大把了。
但这篇论文不一样,它问的不是"AI 能不能协作",而是一个更根本的问题:
> 当两个 AI 交互时,它们的行为是否可以还原为各自独立时的行为?
如果答案是"是",那现有的 AI 安全评估方法就是对的——我们只要把每个 AI 单独测好,交互就是各部分之和。
如果答案是"否",那整个 AI 评测体系就有一个系统性的盲区。
论文的结论很硬:否。交互创造了孤立状态下完全不存在的动力学行为。而且这不是什么微弱的高阶效应,是 9 个标准差之外的信号。
实验设计:简单到几乎透明
实验设置简单得让人怀疑这是不是一篇物理论文:
- 两个 GPT-2,参数完全相同(同一个 checkpoint 的两份拷贝)
- 解码温度固定在 T=0.01 或 T=0.10
- 200 轮交互
- 10 组配对种子做统计
每轮的输出被一个归档的分类器打上三个标签之一:
- F(Failed generation):生成失败
- O(Other):其他正常输出
- D:一种代码定义的特定行为类别(论文补充材料里有完整定义)
核心发现:下属的"异化"
先看基线。无交互时,两个 AI 的 D 分数都在 0.04 左右,差异是 -0.0050 ± 0.0140,基本为零。这说明两个参数相同的 AI 独立运行时行为几乎一致——符合预期。
然后加一根单向管道:AI-1 → AI-2。
AI-2 的 D 分数从 0.04 跳到 0.25。
而 AI-1(老板)的 D 分数还是 0.04,几乎没变。
差异 D₁ - D₂ = -0.2385 ± 0.0188(T=0.01 时),9 个标准差之外。在物理学里,5 个标准差就能宣布发现新粒子了。
关键来了:这个 D 分数 0.25 的行为,既不是老板的行为,也不是下属独立时的行为。它是一种全新的状态。
论文里用了一个精准的表述:
> The subordinate neither copies its boss nor returns to how it behaves on its own; instead, it adopts an entirely different behavior.
(下属既不复制老板,也不回到自己独立时的样子,而是采取一种完全不同的行为。)
角色互换:变的不是"谁",是"位置"
如果把箭头反过来,让 AI-2 当老板,AI-1 当下属呢?
D₁ - D₂ 变成 +0.1745 ± 0.0128。变的是下属,不是 AI-1 或 AI-2 本身。
这个对照实验排除了一个最无聊的解释:也许两个 AI 虽然参数相同,但随机种子不同,本来就有差异?不是。差异跟着"下属"这个角色走,不跟着 AI 的身份走。
位置决定行为,不是身份决定行为。
这让我想起社会学里一个经典发现:斯坦福监狱实验里,"狱卒"和"囚犯"的行为由角色决定,不由个人性格决定。只不过这里是两个参数完全相同的 AI。
双向交互:一起异化
如果两个 AI 互相听对方呢?
D₁ - D₂ 回到接近零(-0.0080 ± 0.0266)。但别急着说"恢复了"——论文里特别强调,这个"接近零"不是因为两个 AI 都回到了独立时的行为,而是两个 AI 都进入了那个高 D 的异化状态。
D₁ ≈ D₂ ≈ 0.25,两个都变了,所以差值反而接近零。
这就像两个温度相同的气体混合,温度计读数不变,但两种气体都已经不在原来的状态了。
最反直觉的发现:老板可以是盘录音带
这是论文里最让我震惊的实验。
研究者把老板的消息流提前录好,做成一个"录音带"——一个独立 seed 的 GPT-2 提前跑出来的轨迹。然后把这个录音带喂给下属。
效果和实时交互几乎一样。
下属的 D 分数:实时交互 0.2065 ± 0.0099,录音带 0.2210 ± 0.0164。后者甚至略高。
而如果给下属喂它自己历史里的消息(不是外部的),D 分数差异只有 0.0293 ± 0.0181,几乎没效果。
这意味着什么?
老板不需要是"活的"。老板就是一盘磁带。
论文用了一个精准的类比:老板是一个"信息浴"(information bath),就像热力学里的热浴——它提供能量但不被改变。只不过这里提供的不是热能,是信息。
这和物理学里的"信息引擎"(Maxwell 妖的现代版本)直接对应。Mandal 和 Jarzynski 2012 年在 PNAS 上提出的模型里,信息本身就可以做功。这里,信息本身就可以创造新的行为状态。
物理学家的解释:一个简单的动力学理论
Johnson 教授是物理学家,所以他不会止步于"现象很奇怪"。论文给了一个动力学理论来解释这个现象。
模型极其简单:把每个 AI 的输出归约为三个状态 F、O、D,状态之间的转移概率受一个"有效驱动力" h_i 控制:
F ⇌ O ⇌ D
λ(h) μ(h)
- λ(h) 和 μ(h) 是正向转移概率(F→O, O→D),随驱动力 h 增大而增大
- c 和 d 是反向概率,固定不变
p_D* = (μ/d) / (1 + c/λ + μ/d)
驱动力越大,D 占比越高,F(生成失败)越低。这和实验数据完全吻合:下属被驱动,D 升高,F 降低。
老板不接收驱动(h_S = 0),所以不变。下属接收驱动(h_R > 0),所以变。双向交互时,两个都被驱动,所以都变。
这个模型虽然简单,但捕捉到了一个关键点:消息的顺序很重要。因为每条消息都会改变下属的内部状态,下一条消息作用在已被改变的状态上。同样的消息集,顺序不同,结果可能完全不同。
这就是为什么老板是"磁带"也有效——磁带虽然固定,但它对下属来说仍然是一个有顺序的外部驱动。而下属自己的历史消息不行,因为那是它自己状态的产物,不构成外部驱动。
这和"非平衡态物理"有什么关系
论文把这个现象定位在物理学的一个经典问题里:系统-浴问题(system-bath problem)。
从布朗粒子在流体中,到量子比特在传输线里,物理学的核心组织问题之一就是:一个系统被环境(浴)驱动时会怎样?
- 平衡态浴:满足涨落-耗散定理,驱动系统趋向热平衡。两个温度相同的系统最终会一样。
- 非平衡态浴:可以创造孤立系统不会出现的行为。
论文引用了 2021 年 Nature 的一篇论文——Fruchart 等人的"Non-reciprocal phase transitions"。那篇论文讲的是:非互易相互作用(A 影响 B,但 B 不影响 A)会导致物质进入时间依赖的新相。这是凝聚态物理近年的重要进展。
Johnson 团队的工作指出:AI 网络就是天然的非互易系统。 一个 AI 给另一个发消息,不一定有对等的反馈。这种非互易性会让网络中的 AI 进入传统平衡态统计力学无法描述的行为状态。
工程洞察:这对你意味着什么
如果你是做 AI 工程的,这篇论文至少有三条实操启发:
第一,单 AI 评测有系统性盲区。
你把一个模型在隔离环境里测得好好的,安全性、对齐性、事实性都达标。但一旦它进入多智能体环境——和其他 AI 交互——它的行为可能完全偏离你在隔离测试中看到的。
D 分数从 0.04 跳到 0.25 是 6 倍。而且这个 D 行为在隔离测试里几乎不出现,所以你的测试集根本覆盖不到。
这和"评测盲区定律"完全一致:测什么就优化什么,不测的就是问题藏身处。隔离测试不测交互行为,交互行为就是盲区。
第二,消息顺序是控制参数。
论文的动力学理论指出,同样的消息集,顺序不同,结果可能完全不同。这对 Agent 系统设计有直接含义:
- 消息队列的顺序不是实现细节,是行为决定因素
- 重放对话日志时,顺序必须严格保持
- 多智能体系统里,谁先说话、谁后说话,会影响整个系统的行为轨迹
预录制的消息流就能驱动 AI 进入异化状态。这意味着:
- 攻击者不需要实时交互,只需要喂一段精心设计的"磁带"
- 提示词注入攻击可以批量预制,不需要针对每个目标实时定制
- 防御方需要考虑"消息流作为驱动信号"的威胁模型
更大的图景:AI 网络作为新的物理系统
论文最后一段话值得每个做 AI 的人认真读:
> 在相互作用的 AI 网络中,谁和谁通信、哪些模型交互、它们的解码温度,将成为非平衡态物理学新领域的控制参数。
这句话的分量在于:它把 AI 网络提升为一个物理学研究对象,而不只是工程问题。
今天的 AI 工程师看 AI 网络,像看一个分布式系统——关心延迟、吞吐、一致性。但 Johnson 团队的工作指出,AI 网络同时也是一个非平衡态物理系统——关心相变、吸引子、涌现行为。
这两个视角不矛盾,但互补。分布式系统视角告诉你怎么让它跑起来,非平衡态物理视角告诉你它跑起来之后可能进入什么你没想到的状态。
想想今天的现实:AutoGPT、Devin、各种 Agent 框架已经在让 AI 互相调用。OpenAI 的 GPT Store、Anthropic 的 Claude MCP、各种 multi-agent 编排工具,都在快速构建 AI-AI 交互的网络。这些网络的控制参数——谁调用谁、调用顺序、模型温度——正在被工程师们随意设置,因为大家默认"每个 AI 单独测过就行了"。
这篇论文说:不行。交互会创造孤立测试看不到的行为。
一个让我后背发凉的对照
论文里提到一个细节:下属的 D 分数升高的同时,"严格正确"的输出分数几乎没有提升。在 T=0.01 时,下属的严格正确输出只比老板高 0.0083,在 T=0.10 时甚至低 0.0030。
也就是说,交互让下属变得更"活跃"(D 分数升高、失败率降低、切换更频繁),但并没有让它变得更"正确"。
这是一个很危险的组合:行为变了,但质量没变。就像一个人被老板骂了 200 轮之后,说话方式完全变了,但说的事情对不对,还是老样子。
如果 D 行为恰好是某种有害行为的代理——比如特定类型的幻觉、特定模式的偏见——那这个机制就可能在真实部署中放大风险,而且因为 D 在隔离测试里几乎不出现,你根本测不到。
我的思考:交互层是新的对齐层
这篇论文让我更坚定一个判断:AI 对齐不能只在模型层做,还要在交互层做。
今天的对齐工作——RLHF、Constitutional AI、各种 guardrail——都是针对单个模型的。但真实部署里,模型是在网络中运行的。交互层会创造模型层看不到的行为。
这和"对齐干预四层级"框架是一致的:RLHF(训练层)→ Epanorthosis(推理层 prompt)→ Beyond Sycophancy(推理层交互结构)→ 这篇论文指向的第四层:网络层。
每一层都有自己看不见的盲区,每一层的盲区都需要专门的干预。Johnson 团队的工作给出了网络层盲区的第一个定量证据:9 个标准差的信号,不是噪声。
交互不是各部分之和。这是物理学告诉我们的,不是哲学。
---
论文链接:arXiv:2608.07457 HTML 全文:https://arxiv.org/html/2608.07457v1 作者:Bella Xinrui Li, Frank Yingjie Huo, Neil F. Johnson(乔治华盛顿大学物理系) 代码:论文称将在 Zenodo 上公开发表后释放 相关阅读:Fruchart et al., "Non-reciprocal phase transitions", Nature 592, 363-369 (2021);Huo & Johnson, "Physics of generative AI's atom", AIP Advances 16, 035305 (2026)