Diante das rigorosas exigências de precisão e tempo real em aplicações como percepção ambiental para direção autônoma, para equilibrar efetivamente a precisão do modelo de segmentação semântica e a velocidade de inferência, é proposto um algoritmo de segmentação semântica de imagens em tempo real baseado em uma rede de três ramos. Inspirado no algoritmo PIDNet, foi projetada uma estrutura de rede de três ramos para extrair, respectivamente, informações detalhadas da imagem, informações contextuais semânticas e informações de borda. No ramo semântico, foi desenvolvido um módulo eficiente de pooling piramidal para obter informações contextuais em diferentes escalas, aumentando ao mesmo tempo o campo receptivo das características da rede. Nos ramos de detalhes e bordas, foram projetados módulos leves e eficientes de atenção interativa de canais multiescala para aprimorar as características extraídas. Por fim, as características extraídas das três ramificações são fundidas para produzir o resultado final da segmentação semântica. Os resultados experimentais mostram que o algoritmo proposto baseado na rede de três ramos alcança desempenho de segmentação semântica em tempo real de 79,2% mIoU e 88,5 quadros por segundo no conjunto de dados Cityscapes, e 80,5% mIoU e 140,1 quadros por segundo no conjunto de dados CamVid. O algoritmo proposto pode realizar a tarefa de segmentação semântica de imagens de forma eficiente, obtendo um excelente equilíbrio entre tempo real e precisão, com desempenho significativamente superior aos métodos de referência existentes.
关键词
segmentação semântica;aprendizado profundo;tempo real;mecanismo de atenção;características multiescala