TY - JOUR
T1 - MAFFUNet
T2 - A Multimodal Attention and Feature Fusion Framework for Remote Sensing Image Integration
AU - Zhang, Songjia
AU - Lin, Yi
AU - Li, Qingli
AU - Yang, Xiaonan
N1 - Publisher Copyright:
© 2008-2012 IEEE.
PY - 2026
Y1 - 2026
N2 - Multimodal image fusion in remote sensing, integrating data from sources like SAR, optical, multispectral, and hyperspectral sensors, is critical for applications such as land cover classification and disaster monitoring. However, challenges like modality heterogeneity, cloud occlusion, and cross-domain variability demand advanced fusion algorithms capable of capturing nonlinear correlations and ensuring robust generalization.We propose MAFFUNet, a lightweight U-Net-based framework with a five-layer encoder-decoder architecture, incorporating depthwise separable convolutions for efficiency and temporal data support via flattening. MAFFUNet integrates three novel modules: Adversarial Feature Fusion (AFF) for maximizing mutual information, Hybrid Attention and Multiscale Fusion (HAMF) for optimizing spectral and spatial features, and Cross-Domain Regularization (CDR) for enhancing cross-domain adaptability.Experiments on the Chikusei, PaviaC, and PaviaU datasets at 4×, 8×, and 16× scaling factors demonstrate that MAFFUNet outperforms traditional methods and deep learning approaches in metrics like RMSE, PSNR, ERGAS, and SAM, with superior spectral fidelity and spatial detail preservation. Its low computational complexity suits resource-constrained environments.MAFFUNet provides an efficient and robust solution for multimodal remote sensing image fusion.
AB - Multimodal image fusion in remote sensing, integrating data from sources like SAR, optical, multispectral, and hyperspectral sensors, is critical for applications such as land cover classification and disaster monitoring. However, challenges like modality heterogeneity, cloud occlusion, and cross-domain variability demand advanced fusion algorithms capable of capturing nonlinear correlations and ensuring robust generalization.We propose MAFFUNet, a lightweight U-Net-based framework with a five-layer encoder-decoder architecture, incorporating depthwise separable convolutions for efficiency and temporal data support via flattening. MAFFUNet integrates three novel modules: Adversarial Feature Fusion (AFF) for maximizing mutual information, Hybrid Attention and Multiscale Fusion (HAMF) for optimizing spectral and spatial features, and Cross-Domain Regularization (CDR) for enhancing cross-domain adaptability.Experiments on the Chikusei, PaviaC, and PaviaU datasets at 4×, 8×, and 16× scaling factors demonstrate that MAFFUNet outperforms traditional methods and deep learning approaches in metrics like RMSE, PSNR, ERGAS, and SAM, with superior spectral fidelity and spatial detail preservation. Its low computational complexity suits resource-constrained environments.MAFFUNet provides an efficient and robust solution for multimodal remote sensing image fusion.
KW - Attention Mechanism
KW - Cross-Domain Generalization
KW - Deep Learning
KW - Multimodal Fusion
KW - Remote Sensing Image
UR - https://www.scopus.com/pages/publications/105036597248
U2 - 10.1109/JSTARS.2026.3686133
DO - 10.1109/JSTARS.2026.3686133
M3 - 文章
AN - SCOPUS:105036597248
SN - 1939-1404
JO - IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing
JF - IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing
ER -