[论文] EULER: Exploring Underused Links with Evidence-Checked Return for Mult...

研究领域: ML 作者: Ren Zhenzhuo 发布时间: 2026-09-03 arXiv: 2509.00009

论文概要

研究领域: ML 作者: Ren Zhenzhuo 发布时间: 2026-09-03 arXiv: 2509.00009

中文摘要

数学社区使用不同的对象、不变量和工具,因此跨社区转移问题成本高昂且经常被跳过。我们提出了EULER,一个多智能体系统,将这种转移——一座桥梁——作为其搜索单元。围绕一个固定的猜想,EULER运行直接、相邻域和远域路径的竞争;一座桥梁只有在提供源表示无法执行的操作且其目标侧证据沿经过检查的蕴含返回原始陈述时才保留其预算。在昂贵的搜索开始之前,六个有序的压力测试拒绝无效的桥梁。我们在120个近期猜想上评估EULER。这些猜想在搜索前被冻结并筛选污染,来自最近在《组合理论杂志,A辑》(组合学领域领先期刊)上发表论文的作者。EULER产生了10个证明和3个反驳,以及45个范围化的部分结果。两个机制在消融实验中站得住脚:桥梁特定的压力测试将错误结论从9个减少到3个,桥梁材料与目标原生操作的结合产生了+4.2个已解决任务的正向交互,这是两个因素单独都无法实现的。域距离不能可靠预测成功;可执行操作增益和有效返回才能。

原文摘要

Mathematical communities work with different objects, invariants, and tools, so transferring a problem across them is expensive and often skipped. We present EULER, a multi-agent system that takes such a transfer--a bridge--as its unit of search. Around a fixed conjecture, EULER runs direct, adjacent-domain, and distant-domain routes in competition; a bridge keeps its budget only if it supplies an operation the source representation cannot execute and its target-side evidence returns to the original statement along a checked implication. Six ordered stress tests reject invalid bridges before expensive search begins. We evaluate EULER on 120 recent conjectures. The conjectures were frozen before search and screened for contamination, and are drawn from public papers by authors who had recen...


*自动采集于 2026-09-03*

#论文 #arXiv #ML #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

一个组合数学家的困境

想象这样一个场景。

一位组合数学家在研究一个关于零和序列的猜想:给定一个有限阿贝尔群 G 和一个长度为 |G| 的序列,是否总能找到一个非空子序列使其和为零?这是 Erdős–Ginzburg–Ziv 定理的推广形式之一。

她卡了三个月。标准组合工具都试过了——生成函数、多项式方法、代数拓扑——都不行。

她隐约觉得这个问题可以翻译成线性代数语言。群元素可以编码成向量,子序列求和可以看成矩阵乘法。但她不熟悉线性代数的最新工具,也不知道这种翻译是否"合法"——翻译过程中是否丢失了关键信息?

她需要一个"翻译顾问"——既懂组合数学,又懂线性代数,还能验证翻译的正确性。但这样的人类专家全世界不超过五个,而且都很忙。

这正是 EULER 要解决的问题。arXiv:2609.00032 这篇论文提出了一个多智能体系统,把"跨域翻译"本身作为搜索单元。在 120 个近期组合数学猜想上,EULER 产出了 10 个证明、3 个反驳、45 个有范围的阶段性结果。

但比这些数字更重要的是它的核心洞察:跨域数学发现不是"类比",而是"操作增益 + 回路验证"

什么是"桥接"?

先说清楚 EULER 的核心概念:桥接(bridge)。

在数学研究中,跨域转移很常见。一个群论问题可以翻译成图论问题,一个组合问题可以翻译成线性代数问题。这种翻译就是"桥接"。

但传统上,桥接是"灵感"——数学家凭直觉觉得"这个问题看起来像那个领域的问题",然后手动尝试翻译。成功与否取决于数学家的跨域知识储备和运气。

EULER 把桥接系统化了。它的做法是:

1. 冻结源问题:把原始猜想的形式化陈述固定下来,包括所有假设和结论。 2. 生成多条路线:不是只尝试一个领域,而是同时尝试"直接路线"(同领域工具)、"邻域路线"(相邻领域工具)、"远域路线"(完全不同领域的工具)。 3. 构建桥接:对每条路线,把源问题翻译成目标领域的语言。 4. 压力测试:用六个有序测试检查桥接是否合法。 5. 搜索执行:通过测试的桥接才进入目标领域的搜索。 6. 回路验证:目标领域的结果必须能翻译回源问题的语言,且逻辑方向正确。

这个流程的关键在于:桥接不是"翻译完了就搜",而是"翻译完了先验证翻译合法性,再搜,搜完再验证回路"

六个压力测试:桥接的"安检门"

EULER 最精彩的设计是六个有序压力测试。它们按成本从低到高排列,任何一个测试失败就立即拒绝该桥接。

测试一:方向(Direction)。 目标结果必须支持源结论需要的方向。最典型的失败是"用 s⇒t 来把 t 的证明当成 s 的证明"——逻辑方向反了。这听起来低级,但在实际操作中非常常见。一个"如果 A 则 B"的定理,不能用来证明"如果 B 则 A"。

测试二:假设(Assumptions)。 目标领域的每个假设必须从源问题的假设 Γ_s 推出,或者被单独证明。最常见的失败是"把正定性、有限性、一般位置等条件藏在定义里"——翻译看起来很自然,但偷偷加了源问题没有的假设。

测试三:边界(Boundary)。 映射在最小、退化、极端对象上必须保持有效。典型失败是"在零对象、低维、奇偶变化、维数跳跃处崩溃"。一个在一般情况成立的翻译,在边界处可能完全失效。

测试四:回路(Round trip)。 g(f(x)) 必须能恢复源结论使用的结构。典型失败是"合并了源论证必须区分的两个对象"——翻译过程中丢失了关键区分。

测试五:工具(Tool)。 桥接必须提供一个源表示无法执行的操作。如果目标领域的工具和源领域的工具等价,那桥接没有意义——只是换了个记号。

测试六:返回(Return)。 目标领域的证据必须覆盖源陈述。典型失败是"证据只覆盖了源陈述的一个子集"——证明了一半,另一半没动。

这六个测试的设计有一个深层逻辑:前三个是"翻译前检查",成本极低;后三个是"搜索后检查",成本较高。这种分层设计让 EULER 能在早期快速淘汰无效桥接,把计算资源集中在有希望的候选上。

一个具体例子

论文给了一个具体例子来说明桥接的工作方式。

源问题是一个关于群序列的穷举问题:给定一个群 G 和一个序列,需要验证某个性质对所有子序列是否成立。直接做法是枚举所有子序列——复杂度 O(2^n),n 大一点就爆炸。

EULER 尝试了一条远域路线:把群元素编码成位掩码,用位运算做并行枚举。这个翻译看起来很自然——群元素对应二进制位,子序列对应位掩码的子集。

但第一次尝试在"回路测试"上失败了。位掩码枚举确实能并行验证所有子序列,但它返回的是一个布尔值("是否存在满足条件的子序列"),而源问题需要的是"所有满足条件的子序列的计数"。信息在翻译过程中丢失了。

EULER 没有放弃这条路线。它重新构建了桥接,这次把目标改为"带计数的位掩码枚举"——用 popcount 指令同时枚举和计数。第二次通过了回路测试,最终在一个具体实例上找到了反例,反驳了原猜想。

这个例子展示了 EULER 的核心能力:不是一次性翻译,而是迭代式翻译——每次失败后分析失败原因,调整翻译策略,再试

关键发现:域距离不预测成功

论文最反直觉的发现是:域距离(domain distance)不能预测桥接成功率

直觉上,把一个组合问题翻译成另一个组合问题(邻域路线)应该比翻译成线性代数问题(远域路线)更容易成功。但实验数据不支持这个直觉。

在 120 个猜想上,直接路线、邻域路线、远域路线的成功率分布没有显著差异。真正预测成功的是两个因素:

因素一:可执行操作增益(executable operation gain)。 桥接是否为目标领域提供了一个源领域没有的操作。如果只是换记号(比如把群元素写成向量),没有新操作,桥接基本无用。如果引入了新操作(比如位运算的并行枚举、线性代数的特征值分解),成功率大幅提升。

因素二:有效回路(valid return)。 目标领域的证据能否完整翻译回源陈述。很多桥接在目标领域"看起来成功了",但回路测试失败——证明了一个比源问题更强或更弱的结论。

这两个因素的交互效应显著:桥接材料 + 目标原生操作的组合,比任何单一因素多解决 4.2 个任务。这是一个"1+1>2"的正交互效应。

这个发现对数学哲学有深远意义。它意味着:跨域发现不是"距离越近越好",而是"操作互补性越强越好"。一个看起来很远的领域,如果提供了源领域完全没有的操作工具,可能比一个看起来很近的领域更有用。

消融实验:压力测试的价值

论文的消融实验直接证明了六个压力测试的价值。

去掉桥接特定的压力测试(只保留通用的 LLM 验证),错误结论从 9 个涨到 3 个——等等,是反过来:有压力测试时错误结论是 3 个,去掉后涨到 9 个。也就是说,压力测试把错误率降低了 67%。

这 6 个错误结论如果被当成"证明"发布,就是 6 篇错误的论文。在数学领域,一个错误证明的声誉成本是巨大的——不是"修正一下就好",而是可能让整个研究方向被质疑。

压力测试的价值不仅在于拦截错误,还在于让搜索更聚焦。没有压力测试时,EULER 会在无效桥接上浪费大量计算资源,导致有效桥接的搜索深度不够。有压力测试时,资源集中在有希望的桥接上,搜索更深,找到证明的概率更高。

与现有系统的对比

论文对比了几个现有系统:

  • DeepMind 的 AlphaProof:专注于单一领域(形式化数学)的搜索,不做跨域翻译。
  • FunSearch:在单一表示空间内搜索程序,不做跨域桥接。
  • QED(An et al., 2026):多智能体系统,但也是单一领域内搜索。
EULER 的独特之处在于:把"跨域翻译"本身作为搜索单元。其他系统假设问题已经在"正确的表示空间"里,只搜索解法。EULER 同时搜索"正确的表示空间"和"解法"。

这对应了数学发现的两种模式:

  • 域内发现:在已有框架内找到新定理。AlphaProof 擅长这个。
  • 跨域发现:通过翻译到新框架找到新定理。EULER 擅长这个。
历史上,很多重大数学突破都是跨域发现——Wiles 证明费马大定理用了椭圆曲线理论,Perelman 证明庞加莱猜想用了 Ricci 流。这些突破不是"在原领域内更努力",而是"换了一个领域"。

深层启示:跨域智能的本质

EULER 的成功背后有一个深层洞察:跨域智能的本质不是"类比能力",而是"操作增益 + 回路验证"

传统 AI 研究把跨域转移当成"类比"——找到一个相似的结构,套用过来。但 EULER 的数据表明,类比(结构相似性)既不充分也不必要。真正起作用的是"操作增益"——目标领域能做什么源领域做不到的事。

这就像翻译。好的翻译不是逐词对应(类比),而是找到目标语言中能表达源语言意境的结构(操作增益),然后验证翻译是否忠实(回路验证)。"The night is young" 翻译成"夜还长"不是逐词翻译,而是找到了中文中表达"夜晚还早"的结构。

这个洞察对 AI 研究有广泛意义:

对 Agent 设计:Agent 的跨任务能力不取决于"见过多少任务",而取决于"能调用多少种操作工具"。一个有 10 种操作工具的 Agent,可能比一个见过 1000 个任务但只有 1 种操作工具的 Agent 更强。

对 LLM 评估:用 benchmark 评估 LLM 的跨域能力可能是有误导的。benchmark 测的是"见过类似的没有",不是"操作工具够不够"。两个模型在同一个 benchmark 上分数相同,但可调用的操作工具不同,跨域能力可能天差地别。

对 AI 安全:EULER 的六个压力测试本质上是一种"安全闸门"——在行动前验证合法性。这和"判断-闸门解耦"问题有深层联系。LLM 内部的判断模块和行动模块是分离的,EULER 通过外部压力测试强制把判断传导到行动。

数学发现的新范式

EULER 代表了一种数学发现的新范式:不是"更聪明的搜索",而是"更聪明的翻译"

传统自动定理证明在单一领域内搜索证明,搜索空间是指数级的。EULER 通过跨域翻译,把搜索空间从"原领域的所有可能证明"扩展到"所有领域的所有可能证明"。这个空间更大,但每个领域的搜索深度可以更浅——因为目标领域的成熟工具可以快速给出答案。

这和人类数学家的工作方式一致。Wiles 不是在数论领域内更努力地搜索,而是把费马大定理翻译成椭圆曲线的语言,用椭圆曲线的工具解决。Perelman 不是在拓扑领域内更努力地搜索,而是把庞加莱猜想翻译成 Ricci 流的语言,用微分方程的工具解决。

EULER 做的事情,本质上就是自动化这种"翻译-解决-翻译回"的流程。它可能还没有 Wiles 级别的能力,但它指明了方向:跨域发现可以被系统化,而不是依赖天才的灵感

120 个猜想,10 个证明,3 个反驳。这个数字看起来不大,但考虑到这些猜想是"冻结"的——在搜索开始前就固定下来,且筛选过训练数据污染——这个成绩是实打实的。

更重要的是,EULER 发现的 3 个反驳。在数学中,反驳一个猜想和证明一个定理同样重要——有时更重要,因为反驳暴露了直觉的盲区。EULER 的 3 个反驳说明它不是在"回忆"已知答案,而是在真正地"发现"。

结语:跨域智能的黎明

EULER 让我想起一个更广的问题:AI 的下一个突破会不会来自"跨域翻译"能力的突破?

当前 LLM 的能力主要来自"域内扩展"——更多数据、更大模型、更长上下文。但域内扩展的边际收益在递减。GPT-5 相比 GPT-4 的提升,远不如 GPT-4 相比 GPT-3。

跨域翻译可能是下一个增长点。一个能在数学、物理、生物、计算机科学之间自由翻译的 AI,可能比一个在单一领域内无限扩展的 AI 更有突破性。EULER 在数学领域验证了这个思路,但这个思路的适用范围远不止数学。

任何需要"换一个角度看问题"的场景——从工程设计到商业策略到科学发现——都可能受益于这种"桥接搜索"范式。

EULER 的六个压力测试,本质上是在回答一个问题:什么时候"换一个角度看问题"是有用的? 答案是:当你能找到新操作工具,且结果能翻译回来时。

这个答案简洁而深刻。它可能比"更大的模型"更重要。


论文信息:EULER Team. "EULER: Exploring Underused Links with Evidence-Checked Return for Mathematical Conjectures." arXiv:2609.00032. 代码开源:论文未提供公开代码仓库。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens