Cross-Domain Image Processing Using Generative Models
Suárez Riofrío, Patricia
Sappa, Angel dir.

Data: 2026
Resum: Processament d'imatges inter-dominis El processament d'imatges inter-dominis ha emergit com una àrea clau de recerca en visió per computador, impulsada per la necessitat de superar les limitacions derivades de la manca o la inaccessibilitat de dades procedents de sensors especialitzats, sovint costosos o no disponibles. Aquest camp se centra en el desenvolupament de mètodes capaços de transformar, complementar o sintetitzar modalitats d'imatge a partir de dades visuals disponibles, emulant la capacitat humana d'inferir informació no visible. Els avenços en xarxes neuronals profundes, en particular en les Xarxes Generatives Antagòniques (GAN), han obert noves oportunitats per abordar aquestes tasques mitjançant tècniques d'aprenentatge basades en dades. Aquesta tesi introdueix una sèrie de solucions generatives dissenyades per processar imatges a través de diferents dominis, incloent-hi representacions visibles, tèrmiques, d'infraroig proper (NIR) i de profunditat, sense dependre de maquinari multiespectral o especialitzat. El treball aborda l'estimació de profunditat monocular a partir d'imatges en escala de grisos per recuperar informació estructural 3D. També explora la traducció inter-dominis per a la síntesi d'imatges tèrmiques a partir d'entrades de l'espectre visible i millora aquesta síntesi mitjançant la integració multicue de dades de profunditat i vores. A més, avalua tècniques de superresolució guiada per a imatges tèrmiques utilitzant representacions sintètiques i proposa una arquitectura avançada de GAN condicional apilada per a la coloració d'imatges NIR a RGB. Aquest treball demostra que els models generatius proporcionen un marc sòlid i eficaç per reduir les bretxes entre modalitats i millorar les representacions que, altrament, serien difícils d'adquirir o d'accedir-hi.
Resum: Procesamiento de imágenes inter-dominios El procesamiento de imágenes inter-dominios ha surgido como un área clave de investigación en visión por computador, impulsada por la necesidad de superar las limitaciones impuestas por la falta o inaccesibilidad de datos provenientes de sensores especializados, que a menudo resultan costosos o no están disponibles. Este campo se centra en el desarrollo de métodos capaces de transformar, complementar o sintetizar modalidades de imagen a partir de datos visuales disponibles, emulando la capacidad humana de inferir información no visible. Los avances en redes neuronales profundas, en particular en las Redes Generativas Antagónicas (GAN), han abierto nuevas oportunidades para abordar estas tareas mediante técnicas de aprendizaje basadas en datos. Esta tesis introduce una serie de soluciones generativas diseñadas para procesar imágenes a través de diferentes dominios, incluyendo representaciones visibles, térmicas, de infrarrojo cercano (NIR) y de profundidad, sin depender de hardware multiespectral o especializado. El trabajo aborda la estimación de profundidad monocular a partir de imágenes en escala de grises para recuperar información estructural 3D. También explora la traducción inter-dominios para la síntesis de imágenes térmicas a partir de entradas del espectro visible y mejora dicha síntesis mediante la integración multicue de datos de profundidad y bordes. Además, evalúa técnicas de superresolución guiada para imágenes térmicas utilizando representaciones sintéticas y propone una arquitectura avanzada de GAN condicional apilada para la colorización de imágenes NIR a RGB. Este trabajo demuestra que los modelos generativos proporcionan un marco sólido y eficaz para reducir las brechas entre modalidades y mejorar las representaciones que de otro modo serían difíciles de adquirir o acceder.
Resum: Cross-domain image processing has emerged as a key research area in computer vision, driven by the need to overcome limitations posed by missing or inaccessible data from specialized sensors, which are often costly or unavailable. This field focuses on developing methods capable of transforming, complementing, or synthesizing image modalities from available visual data, emulating the human ability to infer non-visible information. Advances in deep neural networks, particularly Generative Adversarial Networks (GANs), have created new opportunities to address these tasks through data-driven learning techniques. This thesis introduces a series of generative solutions designed to process images across different domains, including visible, thermal, near infrared (NIR), and depth representations, without relying on multispectral or specialized hardware. The work addresses monocular depth estimation from grayscale images to recover 3D structural information. It also explores cross-domain translation for thermal image synthesis from visible spectrum inputs and enhances this synthesis through multi-cue integration of depth and edge data. Furthermore, it evaluates guided super-resolution techniques for thermal imagery using synthetic representations and proposes an advanced stacked conditional GAN architecture for NIR to RGB colorization. This work demonstrates that generative models provide a robust and effective framework for bridging modality gaps and enhancing representations that are otherwise difficult to acquire or access.
Resum: Universitat Autònoma de Barcelona. Programa de Doctorat en Informàtica.
Drets: Aquest document està subjecte a una llicència d'ús Creative Commons. Es permet la reproducció total o parcial, la distribució, la comunicació pública de l'obra i la creació d'obres derivades, sempre i quan aquestes es distribueixin sota la mateixa llicència que regula l'obra original i es reconegui l'autoria. Creative Commons
Llengua: Anglès
Document: Tesi doctoral ; Text ; Versió publicada
Matèria: Inter-Dominis ; Cross-Domain ; Inter-Dominios ; Models Generatius ; Generative Models ; Modelos Generativos ; Tecnologies

Adreça alternativa: https://hdl.handle.net/10803/697215


151 p, 41.4 MB

El registre apareix a les col·leccions:
Documents de recerca > Tesis doctorals

 Registre creat el 2026-07-21, darrera modificació el 2026-07-22



   Favorit i Compartir