El aprendizaje profundo generativo resuelve el problema del aliasing en las imágenes 3D
29 Sep
En el contexto del rápido desarrollo de la informatización, la digitalización y la inteligencia, las tecnologías de imagen óptica y visual tridimensional de alta fidelidad desempeñan un papel cada vez más importante en numerosos ámbitos industriales y de consumo. Entre ellas, el método de imagen tridimensional por luz estructurada, representado por la proyección de franjas, permite realizar mediciones precisas y rápidas de la forma y la geometría tridimensionales de los objetos, y ha recibido una gran atención y se ha aplicado ampliamente en la detección automatizada, la percepción robótica, la biomedicina y el entretenimiento. Aunque esta tecnología ofrece alta precisión y velocidad, requiere una sincronización precisa entre los dispositivos de imagen (módulos de proyección y cámaras), lo que limita la aplicación de la tecnología de luz estructurada en escenarios de percepción tridimensional de gran formato, en matriz y colaborativos. El profesor asociado Lv Lei, de la Universidad Tecnológica de Henan, el investigador asociado Su Zhilong, de la Universidad de Shanghái, y el equipo de investigación de la Universidad Nacional de Tecnología de Defensa establecieron un método generativo de aprendizaje profundo para resolver el problema del aliasing de franjas en la captura de imágenes asíncrona mediante el análisis del problema de aliasing en la captura de imágenes causado por la eliminación de las restricciones de sincronización, y propusieron una tecnología generativa de captura de imágenes tridimensionales con luz estructurada asíncrona.
La tecnología tradicional de luz estructurada se basa en una sincronización estricta entre el módulo de proyección y el dispositivo de captura de imágenes para lograr una reconstrucción precisa de la escena tridimensional. En la captura de imágenes 3D asíncrona, cada dispositivo es independiente de los demás, y el módulo de proyección puede cambiar el patrón de proyección sin verse limitado por el tiempo de exposición de la cámara. Esta independencia rompe con el supuesto de sincronización de los métodos tradicionales, y el sistema puede funcionar con mayor flexibilidad, lo que reduce los requisitos de sincronización en las aplicaciones prácticas y amplía considerablemente el ámbito de aplicación de la tecnología de luz estructurada. Sin embargo, de ello se deduce que se capturarán múltiples imágenes durante el tiempo de exposición de la cámara, lo que da lugar a graves problemas de aliasing, con una pérdida de precisión de hasta tres órdenes de magnitud. Aunque la imagen con aliasing causada por esta asincronía tiene características aditivas, se ve afectada por la interacción de múltiples factores, como el momento de inicio de la exposición de la cámara y el tiempo de cambio de franja. Estos parámetros son difíciles de predecir o medir con precisión en la práctica, y se han convertido en un problema crónico de aliasing en imágenes de múltiples fuentes que ha limitado el desarrollo de la tecnología de luz estructurada asíncrona.
En el ámbito de la obtención de imágenes asíncronas, el efecto de aliasing en forma de franjas constituye un reto de larga data que aún no se ha resuelto. El equipo de investigación analizó en profundidad las características geométricas y estadísticas del efecto de aliasing aditivo global en las imágenes y propuso establecer un método generativo eficaz de aprendizaje profundo para resolver este problema de aliasing desde la perspectiva de la generación de imágenes bajo restricciones previas. Concretamente, tomando como punto de partida el patrón básico de aliasing, los investigadores descubrieron que el aliasing de la imagen asíncrona no tiene nada que ver con la posición espacial de los píxeles, sino que es simplemente la acumulación global de la intensidad luminosa de fotogramas adyacentes en una combinación desconocida. Desde la perspectiva de la geometría de variedades, el proceso de aliasing no deforma la estructura subyacente de la imagen, por lo que el proceso de separación del aliasing no necesita tener en cuenta el problema de la transformación de la posición de los píxeles. Esto proporciona, de hecho, una prior inductiva potente y elegante —con equivarianza espacial—, que asocia de forma natural este problema con la convolución. Por lo tanto, se puede diseñar un modelo de red neuronal profunda simétrica basado en la convolución para aprender las características intrínsecas de las franjas, lo que garantiza esencialmente la capacidad de generalización del modelo.
Con el fin de utilizar la menor cantidad de datos posible para construir un modelo con una gran capacidad de generación, el equipo de investigación introdujo el marco de aprendizaje generativo adversarial (GAN) y profundizó en el estudio de las características estadísticas del aliasing de rayas. Partiendo del marco de aprendizaje adversarial, se aplica la distribución a priori del patrón de rayas como condición de generación, y se utilizan el principio de similitud de la imagen subyacente y el principio de similitud estructural superior para permitir que el modelo aprenda de forma eficiente la información de las rayas sin aliasing. En comparación con los modelos generales de generación de imágenes, el método de aprendizaje basado en la estrategia anterior puede reducir eficazmente la cantidad de datos, al tiempo que garantiza la estabilidad de la dinámica de entrenamiento del modelo y una gran capacidad de generalización. Mediante la aplicación del método clásico de desplazamiento de fase, se puede reconstruir con precisión la forma tridimensional del objeto a partir de la imagen de rayas generada. Mediante el uso de diferentes objetos y diferentes tipos de rayas para realizar pruebas de imagen tridimensional asíncronas, se comprobó que el método propuesto por el equipo de investigación era comparable al método síncrono en términos de precisión. En comparación con los resultados de la reconstrucción asíncrona de rayas, la precisión mejoró hasta en tres órdenes de magnitud.
Este logro combina el concepto de la obtención de imágenes asíncronas con métodos generativos de aprendizaje profundo, lo que ofrece una nueva forma de conseguir una percepción de imágenes tridimensionales altamente flexible y escalable en entornos industriales y de consumo. El método generativo de imagen tridimensional asíncrona propuesto es capaz de aprender las características intrínsecas de las imágenes de franjas de luz estructurada a partir de una pequeña cantidad de datos de muestra, bajo la guía de priores “inteligentes”, y puede abordar problemas de imagen tridimensional asíncrona en diversos escenarios con una gran capacidad de generalización. El nuevo marco de referencia proporcionado permite superar las limitaciones de los dispositivos de imagen y aporta nuevas ideas para la investigación y el desarrollo futuro de la imagen por luz estructurada.