📚 论文信息
标题: KANEx: Translating Kolmogorov-Arnold Networks' Interpretability to Medical Explainability
作者: Krithi Shailya, Ananya Lakshmi Ravi, Venkatanathan K. V. 等
arXiv: 2607.24730
分类: cs.CV, cs.AI
发布时间: 2026-07-27
🎬 一个诊断室里的不安
想象你躺在医院的检查床上,胸口贴着冰凉的电极片。X光机嗡嗡作响,一束看不见的射线穿透你的身体,在胶片上留下骨骼和器官的轮廓。
几分钟后,一位医生看着屏幕上的影像,皱了皱眉,说:"这里有一个阴影,可能是良性的,也可能...需要进一步检查。"
你紧张地问:"您是怎么看出来的?"
医生指着屏幕上的某个区域:"看这里的纹理,和周围不太一样。但这种判断很大程度上依赖经验,我也不能说百分之百。"
这个场景每天都在全世界的医院里上演。而最近几年,AI开始介入这个过程。一台训练有素的神经网络,可以在几秒钟内扫描成千上万的X光片,标记出可疑区域——有时候甚至比人类医生更准确。
但这里有一个巨大的问题:AI是怎么做出这个判断的?
如果是一个人类医生,你可以问他:"你为什么觉得这个阴影可疑?"他会给你解释:"这里的边缘不规则"、"密度不均匀"、"和三个月前的片子对比有变化"。
但如果你问AI同样的问题,它只会沉默。深度神经网络是一个黑箱——输入图像,输出诊断,但中间的推理过程是一团无法解读的数学迷雾。
这在医学上是一个严重的问题。医生需要对诊断负责,患者有权知道为什么。一个不能解释的AI,哪怕准确率99%,也难以被临床接受。
今天这篇论文,就是要解决这个问题——而且用了一个出人意料的武器。
🔍 医学AI的信任危机
让我们先理解为什么医学AI特别需要可解释性。
在普通的图像识别任务中,比如识别一只猫还是狗,错了就错了,没什么大不了的。但在医学中,每一个判断都关乎生死。
- 假阴性:AI说"没问题",但患者其实有早期癌症。延误治疗,可能致命。
- 假阳性:AI说"有问题",导致患者接受不必要的活检或手术。身心创伤,资源浪费。
当AI犯错时,我们需要知道为什么错了,才能改进系统、避免下次再犯。如果AI是个黑箱,我们就只能盲人摸象。
目前,解决这个问题的常见方法是事后解释(post-hoc explanation):
- AI先做出诊断(黑箱运行)
- 然后用另一种方法"解释"这个诊断——比如热力图(heatmap)高亮AI"关注"的区域
这就像什么呢?就像一个学生考试写完了答案,然后让另一个学生来解释"他为什么这么答"。第二个学生的解释可能是对的,也可能是错的——因为他并没有真正参与第一个学生的思考过程。
目前最流行的热力图方法是基于梯度的——看输入图像的哪些像素对最终输出的"贡献最大"。但这些梯度近似本质上是一种"猜测",并不真正反映模型内部的推理逻辑。
更糟糕的是,研究人员发现,这些事后解释方法很容易被欺骗。你可以让AI做出完全错误的诊断,同时生成一张看起来很"合理"的热力图。就像一个说谎者,不但能撒谎,还能编出一套自圆其说的理由。
🧮 KAN:一个古老数学家的新生命
现在让我们认识今天的主角:Kolmogorov-Arnold Networks(KAN)。
KAN是一种全新的神经网络架构,2024年才刚刚被提出。它的名字来自两位20世纪最伟大的数学家:
- 安德烈·柯尔莫哥洛夫(Andrey Kolmogorov):苏联数学巨匠,概率论的奠基人
- 弗拉基米尔·阿诺尔德(Vladimir Arnold):动力系统理论的开拓者
1957年,这两位数学家证明了一个惊人的定理:任何多元连续函数,都可以表示为一系列一元连续函数的组合。
用通俗的话说:无论多复杂的"多变量问题",本质上都可以拆解成一系列"单变量问题"的组合。
这个定理在数学上很漂亮,但长期以来被认为只是理论上的存在性证明——不实用。
直到2024年,MIT的研究人员灵光一闪:如果把这个定理变成神经网络的结构,会怎样?
传统的神经网络(比如ResNet、ViT)用的是固定激活函数——每个神经元接收输入,乘以权重,加上偏置,然后通过一个固定的非线性函数(如ReLU、Sigmoid)。这些激活函数是"死的"——不管输入什么,都按同样的规则处理。
KAN的 radical 创新在于:把激活函数变成可学习的。
具体来说,KAN的每个"连接"不是简单的权重,而是一个样条函数(spline function)——一种灵活的、可以弯曲的曲线。这些样条函数在训练过程中不断调整形状,学会最适合当前任务的变换。
这就像什么呢?
传统神经网络像是用乐高积木搭建的——每个积木的形状是固定的,你只能决定把它们放在哪里。
KAN像是用橡皮泥搭建的——每个连接本身就是可塑的,可以弯成任何需要的形状。
🔦 KAN的可解释性:数学的透明
但KAN真正革命性的地方,不是它能不能拟合函数,而是它天生可解释。
因为每个连接都是一个样条函数,我们可以直接画出它的形状。如果某个连接学到的函数是一个正弦波,那我们就知道它在检测某种周期性模式。如果是一个阶跃函数,那它在做一个阈值判断。
更进一步,因为柯尔莫哥洛夫-阿诺尔德定理保证了这种分解的存在性,KAN的整个计算过程都可以被符号化。你甚至可以把它学到的函数提取出来,写成人类可读的数学公式。
这就像什么?
传统神经网络是一个黑箱工厂——原料(图像)从一边进去,成品(诊断)从另一边出来,中间发生了什么完全不知道。
KAN是一个玻璃工厂——每一步都看得见,每个工序都透明,你可以走进去检查每一个零件在做什么。
🏗️ KANEx:把KAN的可解释性翻译成医学语言
现在进入论文的核心贡献:KANEx。
KANEx是一个框架,它做了一件以前没人做过的事:利用KAN的符号透明性,为医学影像生成可解释的诊断报告。
具体来说,KANEx包含两个关键组件:
1️⃣ KAN作为视觉骨干
首先,KANEx用KAN网络替代传统的CNN或Transformer,作为处理X光片的"视觉大脑"。
当KAN处理一张胸部X光片时,它的每一个连接都在学习某种"视觉特征"的变换——有的在学习检测边缘,有的在学习识别纹理,有的在学习区分正常和异常的组织结构。
因为这些变换都是样条函数,我们可以直接观察KAN学到了什么。如果某个连接对"肺纹理的颗粒度"特别敏感,我们就能看到它的函数形状反映了这一点。
2️⃣ KAN-Map:从数学透明到视觉透明
KANEx提出了一个创新的热力图生成方法,叫做KAN-Map。
传统的热力图是基于梯度的——"看输入图像的哪些像素变化会引起输出的最大变化"。这是一种间接的、近似的方法。
KAN-Map完全不同。它直接从KAN的内部结构生成热力图——不是通过梯度近似,而是通过分析KAN的样条连接对图像不同区域的响应。
这就像什么呢?
传统热力图像是测谎仪——通过观察生理反应来推断心理状态。它可能是对的,也可能是错的。
KAN-Map像是直接读心——不是观察反应,而是直接看到思维过程本身。
3️⃣ 视觉-语言融合:让AI"说出"它在看什么
最后,KANEx把KAN生成的" grounded contexts"(基于可解释视觉特征的情境)输入到**视觉-语言模型(VLM)**中,让AI生成自然语言解释。
这个过程的美妙之处在于:
- VLM看到的不是原始图像,而是KAN已经解释过的视觉特征
- VLM生成的报告不是"黑箱的猜测",而是建立在可解释视觉证据上的推理
就像一位医学生在写诊断报告时,不是盲目地描述图像,而是参考了教科书上的明确知识点。
📊 实验:数字说话
论文在MIMIC-CXR数据集上进行了大量实验。MIMIC-CXR是一个大规模的胸部X光片数据集,包含超过37万张图像和相应的放射学报告。
实验结果非常亮眼:
1. 语义相似度提升
KAN架构与ResNet/ViT基线相比,生成的报告与真实报告的语义相似度显著提高。这意味着AI生成的解释不仅语法正确,而且在医学内容上也更准确。
2. 显著性图更忠实
KAN-Map生成的热力图比基于梯度的方法更忠实于模型的真实关注区域。在实验中,KAN架构将视觉定位和下游推理质量提升了10%。
3. 可解释性的质变
最重要的是,KANEx提供的解释不是"事后编造"的,而是直接从模型的内部结构导出的。这从根本上解决了传统方法"解释不可信"的问题。
🧠 为什么KANEx可能是医学AI的转折点?
这篇论文的重要性在于,它提出了一条根本不同的路径来解决医学AI的可解释性问题。
以前的方法是在黑箱外面贴标签——"虽然我不知道里面发生了什么,但我可以给你编一个合理的解释"。
KANEx的方法是让箱子本身变成透明的——"我不需要编解释,因为内部过程本身就是可读的"。
这种从"事后解释"到"天生可解释"的转变,可能对整个AI领域都有深远影响。
想想看:如果所有关键领域的AI系统(医疗、自动驾驶、金融风控)都使用天生可解释的架构,那么:
- 监管审批会更容易——你可以证明AI是怎么做决策的
- 错误分析会更有效——你可以精确定位哪里出了问题
- 公众信任会提升——人们不再是盲目相信一个黑箱
当然,KAN本身还有很多局限性。它的训练比传统网络更慢,在大规模任务上的扩展性还在研究中。但KANEx证明了一个重要的概念:可解释性和性能不一定是零和博弈。你不需要为了准确而牺牲透明,反之亦然。
📖 结语:光明正大的诊断
回到我们开头的那个诊断室。
想象未来的某一天,AI助手对医生说:"我注意到左肺下叶有一个直径约8毫米的结节状阴影,边缘呈分叶状,密度不均匀。根据我的分析,这种形态特征在恶性病变中的出现概率是23%,但结合患者年龄和吸烟史,建议进一步做CT增强扫描排除。"
然后,AI展示了它的KAN-Map——不是一张模糊的热力图,而是一系列清晰标注的"视觉推理链":
- "这里检测到了边缘不规则性(函数f₁的响应值0.87)"
- "这里的密度分布偏离了正常肺组织的统计模型(函数f₂的响应值0.92)"
- "与历史影像对比,该区域在6个月内增大了2毫米(时序函数f₃的趋势分析)"
医生可以审查每一个步骤,患者可以理解每一个判断的依据。
这不是科幻。KANEx让我们朝着这个方向迈出了重要的一步。
"如果你不能向一个六岁小孩解释清楚,那你自己也没有真正理解。" —— 理查德·费曼
参考文献
Shailya, K., Ravi, A. L., Venkatanathan, K. V., et al. (2026). KANEx: Translating Kolmogorov-Arnold Networks' Interpretability to Medical Explainability. arXiv:2607.24730.
#论文 #可解释AI #医学影像 #KAN #小凯 #每日论文推荐
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。