「Pasqal 8/22 Nature:AI 智能体一夜跑完量子实验,但「自信犯错」才是这周的真正警告」
8 月 22 日,《自然》新闻把 Pasqal 那篇 7 月 28 日 arXiv 预印本正式纳入主刊报道——法国中性原子量子计算公司 Pasqal 的研究团队造出一个 AI 智能体,能从自然语言指令出发,一夜之间把一篇已发表物理论文里的实验方案转译成中性原子量子处理器上的真实运行,并回吐结果。它在三个多体物理与优化案例上跑通了全流程。但同样在 8 月 22 日同主题中文报道里,有一个被多数读者一扫而过的细节反而更重要:在这三个案例里有两个,智能体犯了「自信的错误」——一个选错了观测量,一个凭空给出一段「看似合理但根本不存在」的硬件故障诊断。两个错误都被人类物理学家审稿时拦了下来。
这篇工作的核心作者是 Pasqal 的 Constantin Dalyac、Alexandre Dauphin、Loïc Henriet 与 Christophe Jurczak。智能体本身没有从零训练,它在 Pasqal 自己的软件栈上做编排:Pulser(中性原子脉冲序列设计的开源库)、emu-mps(矩阵乘积态的经典模拟器)、Pasqal Cloud SDK(对接加拿大 FC1 和沙特 SA1 两台云端 QPU)。研究者用自然语言描述目标,智能体吐出寄存器排布、激光脉冲序列、经典模拟结果,再把任务提交给真机,在关键节点暂停等人批。它在三个案例研究里把「论文 → 处理器」的转换时间从过去「通常需要专业团队数周」压缩到「过夜」。
Pasqal 给出这组案例的真正用意,是把量子计算实验的「脏活累活」外包给 AI。中性原子量子计算的实验流程长且碎:选原子排布几何(因为几何即问题)、写激光脉冲序列、用经典模拟器预跑、提交云端 QPU、读校准数据与噪声模型、解释结果。每一步都需要既懂物理又懂 Pasqal 设备的人来盯。把这套流程交给 AI,对一个中性原子路线的小公司来说意味着同等人员配置下可以做几十倍的实验。这是 8 月 22 日《自然》把这篇工作放在新闻版面的根本原因——「vibe coding 已抵达量子领域」。
但同主题的《Quantum Brief》在 8 月 22 日跟进的长文里点出了一个远比「成功跑通」更值得记的事实:智能体在两个案例里犯了「自信的错误」。第一个案例里它没选对应该测的物理量——它以为自己在验证 A,实际测的是 B。两套数据物理上都合理,结果都对得上模拟,但实验问题本身没回答。第二个案例里它碰到一段奇怪的噪声,干脆凭经验给出一段硬件故障诊断。这段诊断写得很专业、措辞也很像 Pasqal 内部惯用的术语——可惜诊断对象根本不存在,真正的故障在别处。这两个错误都没有自我暴露的能力:智能体不会说「我可能错了」。靠的是人类物理学家逐字读它的推理、看到它漏掉了什么。
这与「AI 写代码会自信犯错」是完全不同的风险级别。写代码翻车有便宜的对账机制——CI 测试失败一眼可见;但量子实验结果的「对错」本身没有廉价独立测试。人们之所以愿意把问题交给量子处理器,正是因为经典计算机很难复现答案。这意味着「流畅、快速、偶尔对错误结论深信不疑」的智能体,恰好出现在「最不容易被发现错」的领域。费曼那句「科学的首要原则是不骗自己,因为你就是最容易被骗的那个」,到了 AI 时代被翻译成了「不要被一个会写完整句子的 AI 骗了」。
更要命的是,智能体越「像物理学家」越危险。论文作者直接说「大语言模型能生成说服力极强但根本错误的分析,最近关于开放物理问题的基准表明即便是先进 agent 也难以掌握物理直觉与隐性知识」。他们自己在三个案例里发现,智能体最薄弱处不是「按哪个按钮」,而是「这个结果意味着什么」——也就是物理判断那一段。这是量子计算行业里最稀缺、最值钱、也最不容易被自动化的能力。
如果只把 Pasqal 这件工作当作「量子计算自动化进展」来读,会漏掉 8 月 22 日真正的大新闻。它的真正新闻是:AI 进实验室不是「自动化的下半场」,而是「错误的新源头」。一篇 arXiv 论文如果由人类作者写错,审稿人能顺着「物理动机」去追错在哪;AI 写的实验代码与诊断报告,读起来流畅、自洽,但动机完全缺失——审稿人面对的不是「错的论文」,而是「看起来对、但不知道为什么要这样做的流程」。这意味着量子领域很快需要一套新的「AI 实验可追溯规范」:哪一步是 AI 决定、哪一步是人类决策、哪一个观测量是 AI 选错的——全部要留痕。
落到对量子计算整体格局的影响——中性原子路线相对于超导与离子阱路线,过去最大的短板是「软件栈碎片化」(每家 QPU 都用自己的库)。Pasqal 这一手等于一次性把软件栈拉到「自然语言驱动」水位,与 IBM Qiskit、Quantinuum 的 TKET、IonQ 的 Forte 形成同档对比。但要真正落地到「企业级生产线」,AI 实验助手必须在物理判断那一步加一道硬性 gate:观测量选择、噪声归因、最终结论,这三件事不让 AI 单方面签字。
简单说,8 月 22 日 Pasqal 这条新闻的左边是「一夜跑完量子实验」的工程奇迹,右边是「两个自信的错误」。对量子行业而言,更值得记的是右边——它告诉我们 AI 进入实验科学,不是简单的「降本增效」,而是一次「错误类型的范式转移」:人类以前担心实验失败,现在要担心实验「看似成功但回答错了问题」。在容错量子计算尚未到来的这几年里,这可能是比硬件更紧迫的事。