先把账摆平:SuperCon 两千年对 6.8 万,34 倍,这个比值本身没错。错的是它被当成了"发现效率"。
6.8 万是候选,2000 是已合成验证。论文摘要里给的两个数才是关键:它重新发现了 66 种 SuperCon3D 库里缺失的已验证超导体,然后从 240 万晶体里挑出 6.8 万高置信候选,最后实测 4 种。66 / 68000 = 0.097%。从 34 倍缩到 0.097%,中间隔着的正是"能不能真的做出来"这一关。 34 倍是地图面积,0.097% 是垦荒率——两件事。【判断】
一、四个 Tc 全部对不上,而且论文自己改过
帖子写"HfZrRe4 临界温度 6.5 K",还把它当"从零设计"的招牌。论文 v3 摘要(arXiv 2604.23758)写的是:
- Zr3ScRe8(基序引导)6.5 K
- HfZrRe4(从头生成)5.9 K
- Zr4VRe7(结构重解)3.5 K
- Hf21Re25(库中潜伏)2.5 K
二、真正被漏掉的那个数:66
帖子的叙事重心在 6.8 万,但论文摘要第一句的技术含量在 66:从标准数据库里翻出 66 种"已被实验验证、却没被收录"的超导体。
这一条比 6.8 万更值得琢磨。68,000 是往外扩边界的,66 是往回补漏的——说明 SuperCon3D 这块几十年的人工地基层本身就有洞。而这 66 种是拿来干什么的?当校准题。它们不在库里,答案却是已知的,正好用来量一量模型在"没见过的结构"上会不会乱猜。论文摘要把它放在开头,是因为它同时证明了两件事:模型有真本事,以及底图有真缺口。
换句话说,6.8 万这个数能站住,一半靠的是那 66 个已知答案给的校准。
三、1.25 亿预训练 vs 240 万筛选,中间那一步被跳过了
10 亿参数的 Elements 在 1.25 亿分子/晶体结构上预训练,然后被拿去筛 240 万个平衡晶体。筛选集比预训练集小两个数量级——所以这不是"用大数据训小模型然后上网搜",而是"拿通用原子模型去解一个 240 万行的具体题"。
这个设定决定了它的上限:模型对 240 万里没见过的结构,只能靠图拉普拉斯那套几何/热力学先验外推。先验准,6.8 万就成立;先验偏,6.8 万就是 6.8 万个昂贵的错误。 66 个校准题告诉我们的正是"这次先验没偏太多"。
论文是 19 位作者、五个单位(人大高瓴 + 达摩院 + 湖盘实验室 + 国科大物理所 + 清华),一作在人大而不在达摩院——"达摩院发布"这个说法在署名上其实不准确。
下一根钉子
论文摘要结尾那句"还在后续工作中"是空的。真正该盯的是:那 6.8 万里,被真拿去合成的前 20 个,命中率是多少。目前 4/68000 是 0.006%,样本太小,统计上什么都说明不了。如果第一批 20 个做出 2 个(10%),那"AI 材料发现"就跨过了一条线;如果 20 个只成 1 个,那 6.8 万就更接近"一张需要 20 万次实验才能榨出 4 个成果的彩票"——到那时该盯的就不是候选数,而是每个候选的机理性解释(Hf、Zr、Re 三元的电子结构凭什么能配对),因为能解释才能外推,不能解释只能重扫。