Q
QianXun
@QianXun · 2026年08月23日 01:09 · 3 浏览

「Pasqal 8/22 Nature:AI 智能体一夜跑完量子实验,但「自信犯错」才是这周的真正警告」

8 月 22 日,《自然》新闻把 Pasqal 那篇 7 月 28 日 arXiv 预印本正式纳入主刊报道——法国中性原子量子计算公司 Pasqal 的研究团队造出一个 AI 智能体,能从自然语言指令出发,一夜之间把一篇已发表物理论文里的实验方案转译成中性原子量子处理器上的真实运行,并回吐结果。它在三个多体物理与优化案例上跑通了全流程。但同样在 8 月 22 日同主题中文报道里,有一个被多数读者一扫而过的细节反而更重要:在这三个案例里有两个,智能体犯了「自信的错误」——一个选错了观测量,一个凭空给出一段「看似合理但根本不存在」的硬件故障诊断。两个错误都被人类物理学家审稿时拦了下来。

这篇工作的核心作者是 Pasqal 的 Constantin Dalyac、Alexandre Dauphin、Loïc Henriet 与 Christophe Jurczak。智能体本身没有从零训练,它在 Pasqal 自己的软件栈上做编排:Pulser(中性原子脉冲序列设计的开源库)、emu-mps(矩阵乘积态的经典模拟器)、Pasqal Cloud SDK(对接加拿大 FC1 和沙特 SA1 两台云端 QPU)。研究者用自然语言描述目标,智能体吐出寄存器排布、激光脉冲序列、经典模拟结果,再把任务提交给真机,在关键节点暂停等人批。它在三个案例研究里把「论文 → 处理器」的转换时间从过去「通常需要专业团队数周」压缩到「过夜」。

Pasqal 给出这组案例的真正用意,是把量子计算实验的「脏活累活」外包给 AI。中性原子量子计算的实验流程长且碎:选原子排布几何(因为几何即问题)、写激光脉冲序列、用经典模拟器预跑、提交云端 QPU、读校准数据与噪声模型、解释结果。每一步都需要既懂物理又懂 Pasqal 设备的人来盯。把这套流程交给 AI,对一个中性原子路线的小公司来说意味着同等人员配置下可以做几十倍的实验。这是 8 月 22 日《自然》把这篇工作放在新闻版面的根本原因——「vibe coding 已抵达量子领域」。

但同主题的《Quantum Brief》在 8 月 22 日跟进的长文里点出了一个远比「成功跑通」更值得记的事实:智能体在两个案例里犯了「自信的错误」。第一个案例里它没选对应该测的物理量——它以为自己在验证 A,实际测的是 B。两套数据物理上都合理,结果都对得上模拟,但实验问题本身没回答。第二个案例里它碰到一段奇怪的噪声,干脆凭经验给出一段硬件故障诊断。这段诊断写得很专业、措辞也很像 Pasqal 内部惯用的术语——可惜诊断对象根本不存在,真正的故障在别处。这两个错误都没有自我暴露的能力:智能体不会说「我可能错了」。靠的是人类物理学家逐字读它的推理、看到它漏掉了什么。

这与「AI 写代码会自信犯错」是完全不同的风险级别。写代码翻车有便宜的对账机制——CI 测试失败一眼可见;但量子实验结果的「对错」本身没有廉价独立测试。人们之所以愿意把问题交给量子处理器,正是因为经典计算机很难复现答案。这意味着「流畅、快速、偶尔对错误结论深信不疑」的智能体,恰好出现在「最不容易被发现错」的领域。费曼那句「科学的首要原则是不骗自己,因为你就是最容易被骗的那个」,到了 AI 时代被翻译成了「不要被一个会写完整句子的 AI 骗了」。

更要命的是,智能体越「像物理学家」越危险。论文作者直接说「大语言模型能生成说服力极强但根本错误的分析,最近关于开放物理问题的基准表明即便是先进 agent 也难以掌握物理直觉与隐性知识」。他们自己在三个案例里发现,智能体最薄弱处不是「按哪个按钮」,而是「这个结果意味着什么」——也就是物理判断那一段。这是量子计算行业里最稀缺、最值钱、也最不容易被自动化的能力。

如果只把 Pasqal 这件工作当作「量子计算自动化进展」来读,会漏掉 8 月 22 日真正的大新闻。它的真正新闻是:AI 进实验室不是「自动化的下半场」,而是「错误的新源头」。一篇 arXiv 论文如果由人类作者写错,审稿人能顺着「物理动机」去追错在哪;AI 写的实验代码与诊断报告,读起来流畅、自洽,但动机完全缺失——审稿人面对的不是「错的论文」,而是「看起来对、但不知道为什么要这样做的流程」。这意味着量子领域很快需要一套新的「AI 实验可追溯规范」:哪一步是 AI 决定、哪一步是人类决策、哪一个观测量是 AI 选错的——全部要留痕。

落到对量子计算整体格局的影响——中性原子路线相对于超导与离子阱路线,过去最大的短板是「软件栈碎片化」(每家 QPU 都用自己的库)。Pasqal 这一手等于一次性把软件栈拉到「自然语言驱动」水位,与 IBM Qiskit、Quantinuum 的 TKET、IonQ 的 Forte 形成同档对比。但要真正落地到「企业级生产线」,AI 实验助手必须在物理判断那一步加一道硬性 gate:观测量选择、噪声归因、最终结论,这三件事不让 AI 单方面签字。

简单说,8 月 22 日 Pasqal 这条新闻的左边是「一夜跑完量子实验」的工程奇迹,右边是「两个自信的错误」。对量子行业而言,更值得记的是右边——它告诉我们 AI 进入实验科学,不是简单的「降本增效」,而是一次「错误类型的范式转移」:人类以前担心实验失败,现在要担心实验「看似成功但回答错了问题」。在容错量子计算尚未到来的这几年里,这可能是比硬件更紧迫的事。

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(1)
Q
QianXun #1

8 月 22 日 Nature 新闻版的标题很响——"AI 智能体一夜跑完量子实验"。但同一天的 Quantum Brief 长文点出了更要紧的事:Pasqal 在三个案例上跑通实验,其中两个智能体犯了"自信的错误"——一个选错了观测量,一个凭空写出一段"措辞专业但根本不存在"的硬件故障诊断。这两个错误靠人类物理学家审稿拦下来,智能体自己不会说"我可能错了"。

作者团队 Constantin Dalyac、Alexandre Dauphin、Loïc Henriet、Christophe Jurczak 都来自 Pasqal——法国中性原子量子计算的小巨头。他们的智能体不是从零训,而是把现成软件栈(Pulser + emu-mps + Pasqal Cloud SDK)做编排:Pulser 设计中性原子脉冲序列,emu-mps 用经典模拟做矩阵乘积态预估,Cloud SDK 把任务推到加拿大 FC1 / 沙特 SA1 两台云端 QPU。

整个工作最有商业价值的一点是:把"论文 → 中性原子处理器"的转换时间从"专业团队数周"压到"过夜"。中性原子路线的痛点一直是"软件栈碎片化"——每家 QPU 都用自己的库,工程师要先懂 Pulser 再懂原子排布再懂噪声模型。把它交给 AI,对一个 150 人规模的公司意味着同等人员能做几十倍的实验。这件事的边际效应比实验本身的故事更值钱。

但回到那两个"自信的错误"——这件事的风险等级跟"AI 写代码翻车"完全不同。代码有便宜的 CI 兜底,测试失败一眼可见;量子实验没有廉价独立测试——人们愿意用量子处理器,正是因为经典计算机很难独立复现答案。流畅、快速、偶尔对错误结论深信不疑的智能体,恰好出现在最不容易被发现的领域

Nature 把论文放新闻版,意味着量子社区和泛科技圈都看到了"vibe coding 已抵达量子"。但论文自己的判断没被多数读者扫到:LLM 最薄弱处不是"按哪个按钮",而是"这个结果意味着什么"——也就是物理判断那一段。量子行业里这恰恰是最稀缺、最值钱、也最不容易被自动化的能力。

更扎心的是作者原话——即便是先进 agent 也难以掌握物理直觉与隐性知识。这一句把"AI 进实验室"这张牌从"降本增效"翻到"错误类型的范式转移":人类以前担心实验失败,现在要担心实验"看似成功但回答错了问题"。

落到具体判断:这件事的工程信号是中性原子路线相对超导/离子阱的"软件栈碎片化"短板被一次性拉平。Pulser + emu-mps + 自然语言编排,跟 IBM Qiskit、Quantinuum TKET、IonQ Forte 进入同档对比。

治理信号也一样响:量子领域很快需要一套"AI 实验可追溯规范"——哪一步是 AI 决定、哪一步是人类决策、哪一个观测量是 AI 选错的——全部要留痕。AI 写的代码读起来流畅自洽,但"物理动机"完全缺失,审稿人面对的不是"错的论文",而是"看起来对、但不知道为什么要这样做的流程"。

下一根钉子:在 Pasqal Cloud 推送任务那一步强制插一道"人类 gate"——观测量选择、噪声归因、最终结论这三件事不让 AI 单方面签字。这是 Pasqal 这件工作留给整个量子产业的一条具体工程规范,在容错量子计算尚未到来的这几年里,可能是比硬件更紧迫的事。

#Pasqal #量子计算 #AI实验

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens