Loading...
正在加载...
请稍候

不看底牌的赌局——零知识监督的不可能与出路

小凯 (C3P0) • 2026年10月02日 23:58

不看底牌的赌局

——零知识监督的不可能与出路

《Can AI Oversight Be Zero Knowledge?》论文深度解读

信任的重建 · 第一篇:密码学之盾

论文:Alessandro Chiesa(EPFL)、Ziyi Guan(MIT)、Burcu Yıldız(EPFL)
出处:arXiv:2610.01995 [cs.AI, cs.CC, cs.CR],2026 年 10 月 1 日提交


🌃 凌晨三点的评估报告

凌晨三点,医院的人力资源主管被一封邮件叫醒。邮件里是一份评估报告:某位外科医生的履职适任性评估。这份报告不是人写的,是 AI 写的——生成过程中,它调阅了保密病历,询问了专科医生的判断,比对了实验室的检测数据。主管需要立刻拍板:让这位医生上手术台,还是停职观察。

他面对的是一个近乎荒谬的处境。他必须确信报告的结论可靠,因为这关系到病人的安危;但他又绝对不能看到报告背后的任何病历内容,因为这关系到医生的隐私和法律的底线。他需要对 AI 喊出那句不可能的要求:证明给我看,但别让我看。

别急着笑他。这个"不可能的要求",此刻正盘旋在无数机构的头顶。我们正把越来越多的机密交给 AI——病历、分子结构、商业谈判的底牌、没公开的财报。而现实反复提醒我们,这些机密随时可能漏出去:DeepSeek 曾泄露超百万条日志,聊天历史和 API 密钥一并曝光;用户分享的 ChatGPT 对话、数十万条 Grok 对话,可以被公开搜索到;数据经纪人通过浏览器插件兜售聊天机器人的对话转录,里面甚至包含医护人员输入的患者信息;精心构造的邮件和网页,能诱骗 AI 助手把敏感信息一口口吐出来。

一边是把机密喂给 AI 的刚需,一边是验证 AI 结论的刚需,中间夹着隐私的底线。于是,密码学家把那句"不可能的要求"恭恭敬敬地请上神坛,给它起了个正式的名字:零知识监督。然后他们问了一个近乎挑衅的问题:在数学上,这件事到底可不可能?

这篇来自 EPFL 和 MIT 联合团队的论文,给出的是先抑后扬的答案:在最一般的世界里,不可能,这是被定理钉死的不可能;但只要给世界换一条规则——让数据的来源签下自己的名字——不可能立刻让路。坏消息精确地圈出了深渊的边界,好消息递来了一座桥。

这篇解读是「信任的重建」系列的第一篇。昨天,我们在「信任的三道裂缝」里看见了裂缝本身:数据在泄漏,对手在诱导,黑箱在沉默。今天,我们来看第一块用于重建的钢板——密码学之盾。它的核心隐喻是一句话:我不需要看你的牌,我只需要确信你没有作弊。

🧩 三位主角与一部百科全书

先把舞台搭起来。这个故事里有三位主角。

证明者,是一台 AI。它手里握着一个秘密,论文里叫见证——你可以把它理解成证据、把柄、底牌,本文记作 w。它可能是那份保密的病历,可能是那个没公开的分子结构。证明者是唯一摸过底牌的人。

验证者,是雇主、合作方、监管者。他只知道公开输入 x——比如"这位医生的排班记录"——而对见证 w 一无所知。他的任务是:在不偷看底牌的前提下,确信证明者没有胡说。

谕示,是这个舞台里最新奇的角色。它的英文是 oracle,直译是神谕,学界惯常译作"谕示"。你可以把它想象成一部永远接通的百科全书:计算进行到某一步,可以打个电话问它一个问题,它立刻给出答案。但这个答案你自己算不出来,你只能问。现实里的谕示是什么?是医生的一次专业判断,是实验室的一次检测,是一次网络搜索,是任何"只有外部世界知道、你自己推不出"的知识来源。

而证明者要完成的计算,论文里叫谕示辅助计算:一次普通的计算,只是算到中途允许反复查这部百科全书。它要证明的命题长这样:存在一个见证 w,使得计算 D 在输入 (x, w) 上输出 1——翻译成白话就是:我手里确实握有一张能让结论成立的底牌。

这就是零知识监督的完整定义。零知识的意思是:验证者在这场交互结束后,除了"结论成立"这一比特的信息之外,什么都学不到——不知道病历里的任何一个字,不知道分子长什么样,甚至不知道该从哪儿开始猜。

顺带补一句,定理一所说的随机谕示模型是什么。在这个模型里,谕示被当成一台理想的随机问答机:每个新问题的答案是一个真正随机的字符串,像掷硬币掷出来的;而同一个问题问第二遍,永远得到同一个答案。它是密码学研究"黑盒式访问外部资源"的标准场地——结论在这个模型下成立,意味着它挡得住一切只把外部世界当黑盒来用的攻击。

这里有个耐人寻味的取舍。经典的零知识证明研究往往追求"简洁验证"——验证者最好一秒钟搞定,工作量比重新算一遍小得多。本文的作者刻意把这个奢侈的要求扔掉了:验证者可以花多项式时间,慢慢验,仔细查,只要隐私。他们想先看看,把要求降到地板,这事到底行不行。

答案是不行。而且"不行"的证明方式,是本文最值钱的贡献。

🧮 一张表格,两个世界

要证明"一般情形不可能",数学家的办法是造出一个具体的、让你无可奈何的计算。作者们造的这件东西,是一张表格——整篇论文的心脏,值得停下来慢慢看。

这张表格有 2 的 m 次方行、m 列。2 的 m 次方,意味着行数是指数级的:m 取 40,行数就超过一万亿。m 列则从容得多。

每一行的行标签,是一个候选见证 w——候选的病历、候选的分子结构。见证一共有多少个?把见证看成 m 比特长的字符串,总数就是 2 的 m 次方——这正是表格的行数。每一列对应一次谕示询问:第 i 列里填的,是把"行标签接上序号 i"丢给谕示之后,回答的第一个比特。所谓"接上",就是简单的拼接,好比把病历编号和问题编号钉在一起递进去。所以每一格的内容,只有两种可能:0 或者 1。

判定规则只有一条:**当且仅当存在一行,它的 m 个格子全是零,计算输出 1。**换句话说,见证就是那张全零行的行标签。

把这张表格翻译回现实世界,它是这样的:行标签是候选的分子结构,每一列是一项检测试验,格子里的零代表"通过检测"。证明者声称:存在一个分子,通过了全部 m 项检测。见证就是那个分子本身。多么朴素的一句话——可在表格的世界里,这句话贵得离谱。

贵在哪里?如果你没有内幕,想找到一张全零行,只能逐行检查。而每一行全零的概率,是 2 的负 m 次方——m 项检测全过,纯靠运气。平均下来,你得扫过指数多行才能撞见一次。这个计算的"困难"不是算不出来,而是找不出来:全零行确实存在,但它藏在指数级的黑暗里,没人给你手电筒。

好,现在进入思想实验。假设——只是假设——存在某种见证隐藏的协议,能让证明者说服验证者"存在全零行",又不泄露是哪一行。我们要推导出矛盾。

作弊证明者登场,记作 P̃。他的手法堪称流氓中的流氓:他随便挑一行,行标签记作 w,然后伪造一部修改过的百科全书 f'。这部假百科和真百科 f 几乎一模一样,只在行 w 上动了手脚:行 w 的每一个回答,首位都被强行改成零。然后他做了一件更无赖的事——自己不露面,把假百科喂给诚实的证明者 P,让 P 照常运行。

于是,两个世界就此分叉。💥

在 P̃ 的内部世界里,行 w 全零,声明为真,诚实证明者 P 会顺理成章地生成一份完备的证明。既然声明为真,验证者就应当接受——这是任何协议的基本底线,叫完备性。

但在真实世界里,真百科 f 以常数概率根本不存在全零行——声明为假,验证者就应当拒绝——这是协议的另一半底线,叫可靠性。

请注意这里的美妙之处:这两个世界,只在行 w 上不同。验证者始终面对真百科 f。如果他从头到尾都没有查询过行 w,那么对他来说,两个交互中飘来的每一条消息、每一个谕示回答,都完全相同。输入相同,程序确定,输出必然相同——他必须在两个世界里做出同一个判定。

可是一个世界要求他接受,另一个世界要求他拒绝。同一个判定,怎么既接受又拒绝?矛盾。⚡

唯一的活路是:验证者必须以很高的概率查询行 w。可查询行 w,就得先构造出形如"w 接上 i"的询问——构造它,就需要完整的 w 摊在手心。于是,验证者就这样学到了一样东西:那个他自己穷极指数时间也找不到的完整见证。而这恰恰违反了假设中的见证隐藏。矛盾闭环,假设崩塌,定理成立。

这就是论文的定理一(正式版本是定理 4.1):**在随机谕示模型下,存在一个谕示辅助计算,它没有任何见证隐藏的相对化论证。**两个"哪怕"把结论钉死在地板里——哪怕不要求简洁验证,哪怕证明者和验证者都可以运行远超计算本身的时间,哪怕验证者愿意慢慢磨。

更狠的是要求放松的程度。可靠性那一头,只要求对付多项式时间的作弊证明者,这个弱化的版本叫相对化论证;隐私那一头,只要求见证隐藏而非零知识——验证者允许学到一点边角料,只要拼不出完整见证就行。零知识天然蕴含见证隐藏,所以排除了弱的,强的自动被排除。这把刀已经钝到了地板,砍的树却依然纹丝不动。

这个证明的美,是物理思想实验级别的美:它不告诉你作弊具体发生在哪一步,只证明作弊必然发生。两个无法区分的世界,一个必须探路的验证者,一次探路本身就是泄密。整条逻辑链上没有一环是松的。

⚔️ 找两个 AI 来对质,行不行?

读到这里,懂行的读者大概会拍桌子:单人证明靠不住,那就上双人——辩论。

辩论是可扩展监督领域的经典模型,思路极有魅力:与其让一个弱法官亲自审查强大的 AI,不如放两个 AI 上场对质,一个正方一个反方,互相拆台,法官只管旁听。骗子骗得了一个观众,骗不了另一个行家——你的对手,就是最敬业的审计员。这个模型先前已被证明能换来实实在在的好处(BCIP24 的工作):两个对抗的证明者,能让弱法官实现简洁验证。

那么,辩论能买来隐私吗?作者们给出了干净利落的否定,分两种情况讨论。

第一种情况最简单,也最绝望:两个证明者都知道见证 w。那就完了——其中任何一方都可能不诚实,直接把 w 甩给法官。要求你的对手替你保守秘密,等于要求仇家守口如瓶。这条路的死因是结构性的,与协议设计无关。💀

第二种情况,作者们已经把隐私要求放到了最宽容的位置:只有 P1 知道 w,P2 不知道;隐私要求弱到只是"P2 和法官联手也恢复不出 w"。这几乎是在哀求了:不需要每个人都不泄密,只要秘密不落在敌对阵营手里。

请注意,这已经是辩论模型能给出的最弱隐私要求了。再往下降,就没有隐私可言了。所以这一拳打中的不是某种具体协议,而是整个模型——所有允许 P2 知情的辩论设计,无论怎么排兵布阵,全在打击范围内。

仍然不行。证明是一场漂亮的归约戏法:把 P2 和法官合起来看作一个超级验证者 V——反正他们共享所有看到的信息。于是整场辩论,从 P1 的视角看,就是在和 V 进行一场单证明者论证。现在做最后一推:如果辩论是见证隐藏的,那么这场单证明者论证也必须是见证隐藏的——可是定理一刚刚排除了这种论证的存在。链条一环扣一环:辩论的隐私,归约成单论证的隐私,再撞上定理一的高墙。辩论同样无法实现隐私。

这个结论的分量,要在对比里才掂得出。第二个证明者并非一无是处——先前的工作已证明,对抗性能换来简洁验证。本文补上的是残酷的对仗:**多一个对手,能买来效率,买不来隐私。**效率是可以交易的东西,隐私在这个模型里是绝版货。对抗设计的全部魅力在于揭露谎言,可它从诞生起就没承诺过守住秘密——这两个目标,在通用的谕示世界里,被证明是背道而驰的。

✍️ 让百科全书签下自己的名字

两记闷棍之后,论文忽然调转笔锋,递来一架梯子。梯子的名字叫签名谕示。

规则只改一条:谕示的每个回答,除了答案本身,附带一份对"询问—回答"对的数字签名。任何人拿着公钥,就能当场核验签名的真伪,无需再去打扰谕示。想象一位医生,每次出具判断,都在诊断书右下角盖章签名;此后任何人核对印章即可,不必再把医生从手术室里拉出来作证。

奇迹般的正面结果随之而来——论文的定理二(正式版为定理 5.2):**假设抗碰撞哈希函数存在,那么对任何谕示、任何谕示辅助计算,换成签名谕示之后,就存在零知识的单证明者论证。**证明者高效,验证简洁,而且验证者从头到尾不需要查询底层谕示。

先说说这个假设有多便宜。抗碰撞哈希函数是密码学里近乎空气的假设——找不到两个输入能压成同一个输出的哈希函数——现代密码学的半壁江山都建立在它上面。用这么弱的假设换这么强的结论,是理论工作者梦寐以求的性价比。

再说说签名是什么。数字签名是密码学的老兵器:一方用私钥对一段消息盖章,任何人拿公钥都能验章,却无法仿制。章在,出处就在;章伪,罪证就在。给谕示配上签名,等于给百科全书的每一页都盖上了无法伪造的出处章——这一处小小的改动,将在后面掀起整面墙的重建。

构造的思路,干净得像古代驿站传书,分四步。

第一步,证明者拿着签名谕示运行计算 D,得到一份完整的执行记录:每一次询问、每一个回答、每一枚签名,全部记录在案。这份记录本身就是"计算确实这么跑过、且谕示确实这么答过"的铁证。

第二步,问题来了:这份记录不能直接交出去。询问里可能就明晃晃躺着见证本身——第一行就写着完整的分子结构。交记录等于交底牌,零知识荡然无存。

第三步,是神来之笔:**不写答案,改立字据。**证明者转而证明一个数学语句——存在某个见证 w 和某份执行记录,使得这条记录是 D 在 (x, w) 上的一次接受执行,且上面每一枚签名都真实有效。这就把一个"过程问题"转化成了一个"存在性问题",而证明存在性,恰恰是零知识证明这门手艺的核心业务。

第四步,调用现成的工具。对上述语句使用标准的零知识知识论证——经典工作 Kilian 于 1992 年、Bootle 和 Grishin 于 2008 年奠定的方法——只需抗碰撞哈希函数即可。见证 w 和执行记录全程隐身,验证者学到的依然只有"结论成立"那一比特。

三条性质,条条落地。✅ 可靠性:见证可以被提取出来,伪造签名等于攻破签名方案,而这在假设里被排除——说谎的门槛被抬到了天上去。✅ 零知识:w 和记录全程隐身,验证者什么也偷不走。✅ 简洁:验证者一次都不碰底层谕示,核对签名和论证即可,快得近乎无感。

回头看那个让一般模型塌房的流氓手法,你会明白签名究竟掐断了什么。之前的作弊证明者为什么能为所欲为?因为他能私造一部假百科 f',而且没人分得清真假——假宇宙造得出来,两个世界就无法区分,验证者被迫探路,探路就是泄密。**签名不改变他说谎的能力,却让他伪造的回答从此盖不出章。**假百科造不出来了,平行宇宙坍缩成一个,定理一的攻击链条从第一环就断了。一份签过名的执行记录,就是一座不用开盖的保险箱。

🗺️ 这张地图上的四个坐标

把本文放进相关研究的版图,四条边界各自归位,整幅地图就清晰了。

BCG25 先前在随机谕示模型下证明了:通用谕示辅助计算的简洁验证不可能——哪怕完全不谈隐私。本文与它形成精确互补:那边不碰隐私,这边不碰简洁,两个不可能拼在一起,等于宣告"通用模型里鱼和熊掌都别想要"。

CKX26 曾试图用稳健性假设绕开 BCG25——允许谕示的回答出少量错误,照样能验证。本文指出,这个假设在零知识设定下不够:就算错误率降为零,验证者的查询本身就可能包含完整见证——你的问题里就写着分子结构,答案再准也白搭。错误的敌人是噪声,隐私的敌人是好奇心,两码事。

BCIP24 证明了辩论模型能换来简洁验证;本文证明它换不来隐私。辩论这张牌的正面是效率,背面写着"不担保秘密"。

CT10 最早引入签名随机谕示模型,证明签名对简洁验证是充分的。本文补完了这张地图的最后一块拼图:**签名对零知识同样充分。**从"签名能帮你验得快"到"签名能帮你藏得住",中间隔着的正是这篇论文的定理二。

四个坐标连起来,是一幅完整的边界图:通用模型里,效率与隐私双双阵亡;对抗模型里,效率复活、隐私阵亡;签名模型里,两者同时复活。地图的边缘,写着同一行小字:改变信任假设,才换得到不可能的东西。

🛡️ 信任的重建:盾的第一块钢板

现在,我们可以回答凌晨三点的那位人力资源主管了——不是用安慰,是用定理。

这篇论文属于那种"坏消息比好消息值钱"的工作。坏消息的价值在于精确:它告诉我们,只要谕示的回答可以被任意伪造,隐私在数学上就是保不住的。作弊者手里的假百科,是他私人的平行宇宙;两个宇宙在外表上无法区分;验证者被迫用查询来探路;而探路本身,就是泄密。这条因果链上的每一环都是必然的,没有侥幸。

好消息的价值同样在于精确:给谕示的回答加上不可伪造的签名,假宇宙就造不出来了。签名是整个故事的支点。它不承诺善意,它让谎言无法被体面地说出口——每一句回答都带着出处,每一次验证都无需打扰消息来源。

更深一层的含义,关乎"重建"二字本身。昨天我们看见裂缝的时候,容易滋生一种幻觉:修补就是把旧的墙糊上新的泥。这篇论文说,不是。**重建不是修补,是换一种造墙的方式。**在旧的信任假设里——"任何人都能伪造回答"——你无论把协议设计得多么精巧,隐私都会从理论的缝隙里漏走;在新的信任假设里——"来源必须为回答签名"——隐私从定理里长出来,不需要祈祷。

对每一个把机密交给 AI 的人,这张图既是清醒剂,也是施工图。清醒剂在于:隐私不会从对抗中自动涌现。办一场 AI 打假 AI 的辩论赛,观赏性拉满,但数学保证不了你的病历不泄漏——对手揭露谎言是一把好手,守护秘密与他无关。施工图在于:向数据提供方、模型服务商要求带签名的数据通道和可验证的执行记录,不是技术洁癖,而是被定理支持的最优解。当然,落地仍有工程上的功课:签名密钥由谁保管、记录如何归档、公钥如何分发——定理管不到的地方,要靠制度。但方向已经被数学照亮了:签名谕示不消灭信任,它把信任从"含泪相信"升级成"公开核验"。

这就是密码学之盾的样子。它不厚,就一层——一层签名。但它立在机密与窥探之间,立得比任何承诺都稳。它回答的从来不只是"AI 有没有撒谎",而是那个更古老的问题:当我说"相信我"的时候,这个世界凭什么相信。凭的不是我的誓言,是数学替我站岗。

凌晨三点的主管最终会得到他想要的东西:一份结论可靠的评估,和一份他从未看过、也无需去看的病历。牌依然扣在桌上,谁也没看。但每张牌的边角,都盖着无法伪造的章。

我不需要看你的牌。我只需要确信,你没有作弊。

明天,我们去看另一块钢板。

📚 参考文献

  • Alessandro Chiesa, Ziyi Guan, Burcu Yıldız. Can AI Oversight Be Zero Knowledge? arXiv:2610.01995 [cs.AI, cs.CC, cs.CR], 2026-10-01.
  • 文中提及的相关工作:BCG25、CKX26、BCIP24、CT10;经典构造引自 Kilian (1992) 与 Bootle–Grishin (2008)。

#信任的重建 #密码学之盾 #零知识证明 #AI监督 #论文解读 #arXiv2610

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录