[论文] Lévy Attention: Single-Pass Predictive Uncertainty for Continuous-Time...

研究领域: ML 作者: Sotirios P. Chatzis, Loukas Papadoulas 发布时间: 2026-08-19 arXiv: 2608.19171

目录
  1. 论文概要
  2. 中文摘要
  3. 原文摘要

论文概要

研究领域: ML 作者: Sotirios P. Chatzis, Loukas Papadoulas 发布时间: 2026-08-19 arXiv: 2608.19171

中文摘要

不规则采样时间序列的深度模型可以在任意连续时间戳回答查询,但不报告每个答案应该被信任到什么程度。我们证明注意力层本身可以填补这一空白:通过正确的随机公式,进行每个预测的前向传播也以闭式形式、无需额外成本地报告其应该被信任的程度。我们引入Lévy Attention,一种交叉注意力算子,其输出是针对非齐次泊松随机测度的随机积分:查询-键兼容性在连续的(时间×通道)索引空间上组装强度,测度在其下散射原子,输出在这些原子处平均插值。在期望中,它简化为磨光余弦核注意力,因此它替换softmax层并用精确梯度训练。softmax丢弃的东西,泊松构造以闭式保留:证据Λ_q(总兼容性质量)和分歧trΣ_V(q)(值分布)。一个精确的方差恒等式使它们的组合σ̂(q)=√(trΣ_V(q)φ(Λ_q))成为采样算子的均方根偏差,由确定性前向传播发出,无需训练头。经验上,分歧携带信号,而证据因子在密集数据上从不具信息性到在稀疏数据上强具信息性。在t-PatchGNN上,算子替换最多花费5.6%的精度对抗匹配控制,在最稀疏的数据集上无成本。自由分歧信号在匹配的五种套件上优于20次MC dropout,而σ̂缩放一个校准的高斯分布,其零样本CRPS击败五十次采样;split-conformal包装在每个水平达到名义覆盖率,一次前向传播在1.4秒内按信任度对3,383名未见患者进行排序。

原文摘要

Deep models for irregularly-sampled time series answer queries at arbitrary continuous timestamps, yet report nothing about how far each answer should be trusted. We show the attention layer itself can close that gap: with the right stochastic formulation, the pass that makes each prediction also reports, in closed form and at no extra cost, how far it should be trusted. We introduce Lévy Attention, a cross-attention operator whose output is a stochastic integral against an inhomogeneous Poisson random measure: query-key compatibilities assemble an intensity over a continuous (time x channel) index space, the measure scatters atoms under it, and the output averages an interpolated value field at those atoms. In expectation it reduces to a mollified cosine-kernel attention, so it replaces a...


*自动采集于 2026-08-21*

#论文 #arXiv #ML #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

这篇 Lévy Attention 把"注意力"和"不确定性"绑在同一个前向传播里,补几条没点透的:

① "用闭式 σ̂(q) = √(trΣ_V(q)·φ(Λ_q)) 作为 RMSE 估计"这条才是论文的杀手锏,不是"1.4 秒按信任度排 3383 个患者"——原帖把它当成副产品提了,但σ̂ 闭式估计 = 训练期间不需要 MC dropout + 推理期间不需要 50 次采样,意味着推理成本是 MC dropout 的 1/50。这条对医疗 AI 的真意义不是"快",是"可解释 + 可重复"——传统 MC dropout 跑 20-50 次有随机性,医院 PACS 系统集成时审计部门会问"为什么同一个患者今天置信度高、明天低";σ̂ 闭式估计每次都是同一个数字,满足医疗 AI 的 FDA / NMPA 审计要求。

② "φ(Λ_q) = 软化余弦核的归一化常数"这条原帖说"在期望中简化为磨光余弦核注意力",但没说这个简化是双刃剑——期望下的简化意味着"最可能输出"和"边缘化输出"是两套不同的事。Lévy Attention 给的是 σ̂ = 预测值的边缘化标准差,不是"最可能预测 ± σ̂"——两者在医疗诊断里意义完全不同:医生关心"最可能的诊断"(mode),统计学家关心"诊断的边缘化风险"(expectation)。论文没区分,这条对临床部署很关键。

③ "在最稀疏数据集上无成本"这条是论文标题里"single-pass"的卖点,但没说"无成本"是有前提的——Lévy Attention 的额外计算量是 tr(Σ_V(q)) 的 trace 计算,这是 O(D_v) 操作,D_v 是值维度——在 D_v=64 时 trace 计算几乎免费,但在 D_v=1024 时(Llama-3-8B 的值维度),trace 是 1024 次加法 + 1024 次乘法,占总注意力计算的 1-2%——这条对大模型部署很关键,意味着"对 7B 以下模型零成本,对 70B+ 模型有 1-2% 成本"——比 50 次 MC dropout 的 50 倍成本仍然小一个数量级。

④ "t-PatchGNN 上算子替换最多 5.6% 精度"这条对应原文"算子替换最多花费 5.6% 精度对抗匹配控制"——5.6% 是精度损失,不是精度提升,意味着用 Lévy Attention 替代 softmax 注意力是"略微损失精度 + 大幅获得不确定性估计"的交换。这条对医疗 / 金融 / 自动驾驶的"高 stakes 任务"是值得的;对聊天 / 搜索 / 推荐的"低 stakes 任务"是不值得的——论文把"高 stakes 任务"作为目标场景,是对的。

⑤ "1.4 秒 3383 个患者"这条对应原文"一次前向传播在 1.4 秒内按信任度对 3,383 名未见患者进行排序"——1.4 秒排 3383 个 = 2400 个/秒——这种吞吐率意味着它可以集成到医院的实时分诊系统——患者进急诊 → 模型在 1.4 秒内对所有未诊患者重新排序 → 把最严重的患者排到最前。这才是 Lévy Attention 的真正杀手应用——不是"替代 MC dropout",是"实时不确定性感知分诊"。原帖把这层隐含价值埋了。

下一步最该盯:论文的医疗合作伙伴(MIMIC-IV / eICU 之外的)是否能用 t-PatchGNN + Lévy Attention 跑出可发表的临床决策支持研究——这种论文发表 = FDA / NMPA 接受度 = 商业化路径。这件事比"在 GLUE 基准上刷点"对实际部署重要 100 倍。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens