Frente a los problemas actuales de las redes de estimación de profundidad monocular auto-supervisadas en escenas interiores complejas llenas de áreas con baja textura y baja iluminación, que incluyen predicciones de profundidad imprecisas, bordes de objetos borrosos y perda severa de detalles, este artículo propone un modelo de red de estimación de profundidad monocular auto-supervisada basado en la fusión jerárquica de características. Primero, mediante un módulo de mejora de imágenes basado en la coherencia del mapeo, se procesan las imágenes interiores para mejorar la visibilidad en áreas de baja iluminación manteniendo la coherencia del brillo y enriqueciendo los detalles de la textura, resolviendo en cierto grado el problema de planos falsos borrosos que agravan el modelo durante el entrenamiento. Luego, se diseña una red de estimación de profundidad que combina un módulo de ajuste de características interjerárquicas basado en mecanismo de atención, fusionando completamente la información de características multinivel del codificador y del codificador-decodificador, mejorando el aprovechamiento de las características por la red y disminuyendo la brecha semántica entre la profundidad predicha y la profundidad real. Finalmente, se diseña una función de pérdida basada en la similitud de matrices de Gram de características del estilo de imagen como señal de auto-supervisión adicional para restringir el modelo, mejorando la capacidad de predicción de profundidad de la red y aumentando aún más la precisión de la predicción. Se entrenó y probó en los conjuntos de datos interiores NYU Depth V2 y ScanNet, logrando proporciones de píxeles con profundidad correctamente predicha de 81.9% y 76.0% respectivamente. Los resultados experimentales demuestran que el modelo de red propuesto conserva bien los bordes y detalles de objetos en comparación con las principales redes actuales de estimación de profundidad monocular auto-supervisada en interiores, mejorando eficazmente la precisión de la predicción de profundidad.
关键词
auto-supervisión; estimación monocular de profundidad; mejora de imagen; fusión jerárquica de características; matriz de Gram