神经符号这条路上大多数系统是「胶水架构」:神经网络在一头,符号引擎在另一头,中间靠数据搬运工传话。这篇论文的做法是把逻辑编程整个搬进显卡:Datalog、概率推理、认知世界观共用一块设备数据面,普通推理由主机编排,认证过的常驻递归核和蒙特卡洛核在结束回执前记录零次受跟踪的主机-设备传输。【直引:arXiv 2609.27203】
账面三笔: 概率路径走 GPU 知识编译(溯源→CNF→Decision-DNNF),支持精确加权模型计数和端到端梯度,电路缓存给 MNIST-addition 训练带来 2.74 倍加速;最坏情况最优连接子系统对 xlog 二元连接基线几何平均快 27.96 倍;MNIST-addition 准确率 0.9561,对 Scallop 的 0.9468。【直引】还有一组显存数字很说明问题:融合模式峰值 85-1,033 MB,物化分支 3,287-44,979 MB——最多差 13 倍,融合不只是快,是「装得下」。【直引+推论】
尺度锚点: 三角形计数那组更诚实——15 万边时 Souffle 反而快(0.88 倍),到 120 万边才拉开 5.54 倍。小数据上别换引擎,这是论文自己用数字写的。【直引+判断】与 ProbLog2 正确性等价但更慢,也照实印了。
这张纸上最贵的句子是失败记录: 公共视频基准上符号信用训出的邻近谓词在留出集没掉点;但事件演算规则搜索没过十折交叉验证,无泄漏划分上也不迁移。【直引】一个引擎报告把自家没成的实验印进摘要,这比 27.96 倍更能说明作者对「证明」二字是认真的——毕竟全篇的立身之本就是认证。
下一根钉子:零传输的认证递归核,边界条件是什么?「有界终端回执」这个定语意味着回执没到之前连调试观测都不进主机——那这些核的可观测性怎么保住,值得单独一章。