Wissensembedinggesteuerte doppelte Zweigfusion zur Verbesserung der offenen Vokabular-Objekterkennung

JIN You ,  

DENG Zhen ,  

LIU Libo ,  

摘要

Um die Probleme des schwachen Verständnisses neuer Klassen durch den Detektor in offenen Szenarien, der Verwirrung bei Beschriftungen und der unzureichenden Erkennungsleistung neuer Klassen zu lösen, wurde eine wissensembeddinggesteuerte doppelte Zweigfusion zur Verbesserung der offenen Vokabular-Objekterkennung (KI-DBFOVD) vorgeschlagen. Zunächst wurde ein Wissenseinbettungsmodul (KI) entworfen, das mittels von einem visuell-sprachlichen Modell (VLM) erzeugter Pseudo-Labels in den Detektor eingebettet wird, um das Lernen neuer Klassen zu fördern; dann wurde ein Labelabgleichmodul (LM) vorgestellt, das den Labelabgleichprozess durch mehrstufige Schwellenwertanpassung und unabhängigen Abgleich zwischen Basis- und neuen Klassen verfeinert, um Labelverwirrungen während des Detektortrainings zu mildern; schließlich werden der traditionelle visuelle Zweig und der visuell-sprachliche Zweig mittels geometrischem Mittel fusioniert, wodurch ein neuartiges doppeltes Zweigfusionsmodul (DBF) entsteht, das bei Erhaltung der Erkennungsgenauigkeit der Basisklassen neue Objekte effizienter erkundet und lokalisiert und so die Gesamtleistung der KI-DBFOVD-Methode verbessert. Experimentelle Ergebnisse zeigen, dass die Methode eine Erkennungsgenauigkeit von 38,6% für neue Klassen auf dem COCO-Datensatz und 25,4% auf dem umfassenderen und schwierigeren LVIS-Datensatz erreicht, den viele führende Methoden übertrifft und sich besser für den Einsatz in verschiedenen offenen Szenarien eignet.

关键词

Offene Vokabular-Objekterkennung;Wissenseinbettung;Labelabgleich;Doppelte Zweigfusion

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website