四分之一的数据,落在解码器自己划的那条线之外

每个量子纠错解码器都跑在一套「这台机器会怎么坏」的模型上。把这个模型转过来对着自己,它会预测一百条测量记录里有一条难以解释。在 IBM 的 Boston 与 Kingston 两台处理器上,实际有 25.7% 的记录越过了这条线。

每个量子纠错解码器都跑在一套「这台机器会怎么坏」的模型上。把这个模型转过来对着自己,它会预测一百条测量记录里有一条难以解释。在 IBM 的 Boston 与 Kingston 两台处理器上,实际有 25.7% 的记录越过了这条线。

太平洋西北国家实验室牵头的一个团队把这次失灵做成了一道过滤器。论文 9 月 24 日挂上 arXiv,编号 2609.29018。

解码器算完就扔掉的那个数

最小权完美匹配解码器算出来的东西比它报告的那个纠错多。对每个可能的逻辑答案,它找出能产生眼前症候征的最便宜物理故障集合,回来时手里有两个成本。两个成本相减就是所谓的逻辑间隙(logical gap),由 Bombín、Pant、Roberts 与 Seetharam 在 2024 年提出,作为置信度度量。它回答的是模型更偏好哪个答案。间隙小的记录是模棱两可的那些,丢掉它们能换保真度,代价是吞吐率。

English、Williamson 与 Bartlett 去年在《物理评论快报》上证明过一件事:在解码器掌握了设备真实噪声分布的前提下,按这个置信度排序做后选择,在固定接受率下是最优的拒绝规则。

问题出在那个前提上。任何一个冻结的解码器都握不住一台活机器的真实分布,握不了多久。

这篇论文捡起了两个成本里较小的那个,作者叫它 W。算完间隙,W 通常就扔了。W 携带的信息间隙够不着:它说的是任何一个答案能不能解释这条记录。两条记录可以间隙完全相同,其中一条在模型下平平常常,另一条几乎无从解释。

一个月的漂移是怎么测出来的

团队用 Stim 生成重复码线路,经 Qiskit 编译后提交到 IBM Quantum,前后跨度约一个月。结果是码距 5、7、9 上共 163 个物理实现,分布在两块芯片的不同区域,每个实现留下约 200 万个留出(held-out)shot,总计 3.05 亿个。

每个实现都用它采集当次的 IBM 校准快照构建 detector error model,用 PyMatching 解码,然后把解码器冻结起来再去看留出那一半。机器此后发生的一切变化都相对一个固定参照显示出来,不会被重新拟合吸收掉。

机器确实在动。最平稳的那个实现全程 detector 事件率贴在 1.1% 附近。最不稳定的那个码距 9 布局在 8.9% 与 34.5% 之间摆动,逻辑错误率按每 10000 个连续 shot 的窗口跟着一起走,是一段一段平移,不是孤立的尖峰。

超导量子比特本来就会漂。弛豫时间随微观两能级缺陷的谱动力学起伏,一次宇宙线事件能在整块芯片上同时撒下准粒子,把许多量子比特的 T1 一起拉低。

接着他们把实测的 W 分布与从校准模型自身采样出来的记录做对比。取每个模型自己的第 99 百分位作阈值,硬件在这一分位上的中位成本高出 2.30 倍,25.7% 的留出硬件 shot 落在模型给自己最古怪的那百分之一划的线之上。

这道过滤器买到了什么

方法只加一个标量系数,按时间顺序在更早的验证数据上拟合后冻结,留出 shot 一个都不进拟合。在 15% 拒绝率下,组合分数比只用间隙的拒绝在码距 7 上多降 10.6% 的保留逻辑错误率,bootstrap 区间 8.35 到 16.18;码距 9 上多降 28.8%,区间 26.84 到 30.20。

同一套构造在团队完全没参与的机器上同样成立。Google 公布 72 量子比特 Willow 处理器的 below-threshold 记忆数据显示出同样的偏离:在十轮码距 5 的 XZZX 表面码记忆上,过滤器把保留下来的逻辑错误概率降低 75.4%,只是 95% 区间从 50.8% 一直开到 100%,而且这个工作点十次里丢掉九次。这份增益还叠在 Google 已经用强化学习调优过的解码器先验之上依然有效。

真正会付账的地方是魔术态

一台容错机器把大量面积与时间花在制造魔术态上,那是让电路跑出 Clifford 之外的非 Clifford 资源。魔术态培育(magic state cultivation)由 Gidney、Shutty 与 Jones 在 2024 年提出,思路是用若干轮容错检查与拒绝把一个编码 T 态养大,再在普通的未纠错周期毁掉它之前嫁接到更大的码上。Google 已经在超导处理器上跑过这个协议并公开了记录,嫁接阶段用 Tesseract 这个基于 A* 的最大似然错误解码器。

Hoyt 这组把似然感知分数加在嫁接阶段,位置在 Google 自己的硬接受检查之后。三周期数据上,再丢弃 30% 的记录,把接受态的层析不保真度降低 34.7%。换个方向读,把输出质量固定在 97% 保真度这个目标上,同样的信息每次尝试多给出 30.4% 的接受态。两周期数据走向相同,区间更宽,分别是 19.2% 与 15.5%。

对一座输出被下游消费的工厂来说,产率才是那个数。作者把自己的主张收得很紧:把接受率的改善换算成端到端计算吞吐,需要对工厂并行度、缓冲与魔术态消费三件事建模,这三件都留给了后续工作。

代理量的边界,作者自己写了

W 站得住脚的第一个理由是它免费。它本来就存在于 sector-constrained 解码问题内部,整套方法只多一步拟合,用的还是实验已经采到的数据。团队也在同一批 163 个实现上比对过更简单的替代品:单独用 W、detector 比特触发的原始比例、以及间隙与 detector 密度的归一化组合。

他们对 W 自己的评价是,它「应当被视为一种可能的代理量,而非最优度量」。

模型失配这件事也不专属匹配解码器。任何从假定的噪声模型报告置信度的解码器,在机器漂移时那个置信度都可能出错。正在被装进实时控制栈的神经网络解码器与置信传播解码器会返回似然、聚类分数和学到的特征,这些量的 compatibility 对应物目前还没人写出来。下一次运行里漂移照样会在,缺的是读它的那个数。

参考信源

  • Aaron C. Hoyt 等《Decoder Model Compatibility Provides Information beyond the Logical Gap under Drifting and Correlated Quantum Noise》,arXiv:2609.29018,2026-09-24 提交。作者机构含太平洋西北国家实验室、华盛顿大学、劳伦斯伯克利国家实验室、NASA Ames 研究中心与福特汉姆大学
  • Héctor Bombín 等,PRX Quantum 5, 010302 (2024),逻辑间隙作为后选择置信度度量
  • Lucas H. English 等,Physical Review Letters 135, 120603 (2025),正确指定噪声模型下按置信度排序后选择的最优性
  • Craig Gidney 等《Magic state cultivation》(arXiv:2409.17595);Google 超导处理器上的实验记录 (arXiv:2512.13908)
  • Google Quantum AI,Nature 638, 920-926 (2025),Willow 公开记忆数据
  • Quantum Brief 2026-09-28 报道
#量子计算 #量子纠错 #解码器

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens