Extraction de bâtiments à haute résolution des images satellitaires par fusion de l’attention multitête et de la recalibration double des caractéristiques

HAN Yilong ,  

GONG Danchao ,  

ZHENG Min ,  

HOU Jiawen ,  

摘要

Face à la grande échelle des cibles, la complexité des textures supérieures et les interférences environnementales dans l'extraction des bâtiments à partir d'images satellitaires à haute résolution, ce qui entraîne des cavités internes dans les grands bâtiments et la perte des caractéristiques géométriques des frontières des petites cibles par les modèles traditionnels, cet article propose une architecture de réseau à double flux fusionnant des caractéristiques locales multi-échelles et des représentations spatiales globales. Un réseau hybride basé sur une U-Net totalement symétrique est construit : en phase d'encodage, une pyramide hiérarchique de caractéristiques est conçue pour extraire des informations texturales locales à multiples résolutions, et un module Vision Transformer est intégré dans la couche la plus profonde à une résolution spatiale de 1/16, utilisant un mécanisme d'attention multitête pour modéliser les dépendances à longue portée ; en phase de décodage, un mécanisme d'attention double adaptatif est introduit, avec des modules d'attention à blocs convolutifs en cascade (CBAM) pour supprimer le bruit dans les caractéristiques des connexions de saut selon les dimensions spatiales et canales, et un module d'attention croisée est fusionné pour aligner les caractéristiques multi-échelles ; à la fin du réseau, des branches de sortie multitâches parallèles de segmentation et de prédiction des contours sont construites avec une fonction de perte de contour pour une optimisation conjointe. Sur le jeu de données d'images aériennes WHU, le modèle atteint un IoU de 89,48 %, un score F1 de 94,45 %, une précision de 90,12 % et un rappel de 99,21 % ; comparé à l'architecture U-Net, l'IoU et le score F1 sont augmentés respectivement de 13,95 % et 14,05 %. Sur le jeu de données ISPRS Potsdam à fond complexe, le rappel du modèle se maintient à 90,48 %. Les expériences d’ablation montrent que l’introduction du module d’attention globale améliore l’IoU de 6,67 %, améliorant efficacement la perte des caractéristiques internes des cibles. Cette architecture réseau réalise une extraction efficace de la topologie spatiale multi-échelles et des contours locaux des bâtiments, avec un coût de calcul contrôlé, compensant les limites du champ réceptif local des réseaux convolutifs 2D, et possède une valeur d’application pratique dans la surveillance de l’évolution urbaine et la mise à jour des bases de données géographiques.

关键词

extraction de bâtiments;segmentation sémantique;mécanisme d’attention multitête;recalibration des caractéristiques;apprentissage multitâche

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website