CMSA-Net: Cross-Modal Sparse Attention and Generative Representation Repair for Multimodal Classification Under Missing Inputs

Abstract—Heterogeneous clinical data streams—electronic
health records (EHR), computed tomography (CT), magnetic
resonance imaging (MRI), and wearable Internet-of-Things (IoT)
signals—offer complementary information for cardiovascular
risk stratification but are often incomplete at inference time.
We propose CMSA-Net, a novel Cross-Modal Sparse Attention
Network to integrate data from multiple modalities using a
transformer encoder with a specific missing modality mask
and top-K sparse cross-modal attention mechanism. In order
to deal with missing modalities arbitrarily, CMSA-Net has a
conditional variational auto-encoder based Generative Modality
Repair (GMR) mechanism that generates robust embeddings
for missing modalities along with a Monte-Carlo Dropout head
for accurate uncertainty quantification. On the standardized
multimodal dataset of 738 encounters, CMSA-Net delivers an
outstanding performance of 0.979 AUROC (bootstrapped 95%
CI: [0.976, 0.982]), 0.972 AUPRC, 0.909 F1, and 0.923 accuracy,
beating the best baseline, an early-fusion MLP, by 0.031 AUROC
and 0.058 F1. Comprehensive robustness analysis confirms invariance of performance across random missing modalities with
AUROC change by less than 0.001 with up to 70% modality
dropout. Moreover, five-fold cross-validation results in average
AUROC 0.983 ± 0.004 with well-calibrated expected calibration
error 0.040. These results establish CMSA-Net as a highly
effective, resilient architecture for robust clinical prediction under
missing-data conditions.