Hochauflösende Fernerkundungs-Gebäudeextraktion durch Fusion von Multi-Head-Selbstaufmerksamkeit und dualer Merkmalsrekalibrierung

HAN Yilong ,  

GONG Danchao ,  

ZHENG Min ,  

HOU Jiawen ,  

摘要

Aufgrund der großen Zielskalen, der komplexen Oberflächentexturen und der Hintergrundstörungen bei der Extraktion von Gebäuden aus hochauflösenden Fernerkundungsbildern führen traditionelle Modelle oft zu inneren Hohlräumen bei großen Gebäuden und zum Verlust der geometrischen Grenzmerkmale bei kleinen Objekten. In diesem Artikel wird eine Dual-Stream-Netzwerkarchitektur vorgeschlagen, die mehrskalige lokale Merkmale mit globalen räumlichen Darstellungen fusioniert. Ein hybrides Netzwerk auf Basis einer vollsymmetrischen U-Net-Topologie wird aufgebaut: In der Kodierungsphase wird eine hierarchische Merkmalspyramide entworfen, um mehrstufige lokale Texturinformationen zu extrahieren, und im tiefsten Layer mit einer räumlichen Auflösung von 1/16 der Originalgröße wird ein Vision Transformer Modul eingebettet, das durch einen Multi-Head-Selbstaufmerksamkeitsmechanismus Langstreckenabhängigkeiten modelliert; in der Dekodierungsphase wird ein adaptiver dualer Aufmerksamkeits-Rekalibrierungsmechanismus eingeführt, der über kaskadierte Convolutional Block Attention Module (CBAM) Rauschunterdrückung in den Merkmalen der Skip-Connections aus dem räumlichen und Kanal-Dimensionen durchführt und ein Cross-Attention-Modul zur Ausrichtung mehrskaliger Merkmale integriert; am Netzwerkende werden parallele multitaskige Ausgabestränge für Segmentierung und Kantenvorhersage aufgebaut, wobei eine Randverlustfunktion für die gemeinsame Optimierung genutzt wird. Im WHU-Luftbilddatensatz erreicht das Modell einen Intersection-over-Union (IoU) von 89,48 %, einen F1-Score von 94,45 %, eine Präzision von 90,12 % und einen Recall von 99,21 %; im Vergleich zur U-Net-Architektur steigen IoU und F1-Score um jeweils 13,95 % bzw. 14,05 %. Im ISPRS-Potsdam-Datensatz mit komplexem Hintergrund bleibt der Recall des Modells stabil bei 90,48 %. Ablationsstudien zeigen, dass die Einführung des globalen Selbstaufmerksamkeitsmoduls den IoU um 6,67 % verbessert und den Verlust interner Merkmale effektiv reduziert. Die Netzwerkarchitektur ermöglicht bei kontrolliertem Rechenaufwand eine effektive Extraktion der mehrskaligen Gebäudetopologie und lokalen Konturen und gleicht die eingeschränkten lokalen Rezeptivfelder von 2D-Konvolutionsmodellen aus, was praktische Anwendungen bei der Überwachung der städtischen Entwicklung und der Aktualisierung geographischer Datenbanken ermöglicht.

关键词

Gebäudeextraktion;semantische Segmentierung;Multi-Head-Selbstaufmerksamkeitsmechanismus;Merkmalsrekalibrierung;Multitask-Lernen

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website