论文概要
研究领域: ML 作者: Andrea Agostini, Simon Böhi, Moritz Vandenhirtz, Samuel Ruiperez-Campillo, Max Krähenmann, Silke Mühlstedt, Irene Cannistraci, Ece Özkan Elsen, Julia E. Vogt, Thomas M. Sutter 发布时间: 2026-09-15 arXiv: 2609.12035
Overview
Cardiovascular diagnosis relies on integrating complementary modalities—ECG, echocardiography, chest radiographs, and clinical variables—each capturing distinct but correlated aspects of cardiac physiology. However, most medical foundation models remain modality-specific, combining modalities only during finetuning or post-training. This discards the cross-modal evidence clinicians naturally integrate, and ignores the structure within each modality.
Key points
- The authors propose Latent-Attention Masked Autoencoders (LAMAE), a multimodal, structure-aware masked autoencoder that jointly learns patient-level representations during self-supervised pretraining.
- Instead of fusing modalities post hoc, LAMAE exchanges information directly in latent space through a shared latent-attention module operating over an encounter–view–entity hierarchical structure.
- This design enables aggregation of a variable number of observations and gracefully handles missing modalities.
- LAMAE is pretrained on more than 1.2 million MIMIC-IV hospital encounters.
- On multimodal inpatient tasks—in-hospital mortality, ICD-10 and DRG coding, and length-of-stay—LAMAE outperforms modality-specific pretraining as well as strong contrastive learning and vision-language baselines, while staying competitive on single-modality tasks.
- The gains persist even when only a single modality is available at test time, indicating that jointly modeling intra-modal and inter-modal structure produces more robust and transferable representations.
- arXiv: <https://arxiv.org/abs/2609.12035>
Links
*Auto-collected on 2026-09-15.*