Are AI models fooled by 3D visual illusions?
Martin Campoy, Iván
Gómez Villa, Alexandra tut. (Universitat Autònoma de Barcelona. Departament de Ciències de la Computació)
Universitat Autònoma de Barcelona. Escola d'Enginyeria

Títol variant: Els models d'IA es deixen enganyar per il·lusions visuals en 3D?
Títol variant: ¿Los modelos de IA son engañados por ilusiones visuales 3D?
Data: 2026
Resum: Els models d'estimació de profunditat monocular (MDE) aconsegueixen capacitats excepcionals en la reconstrucció espacial a partir d'una sola imatge, però la seva dependència de les prioritats apreses els fa susceptibles a paradoxes visuals. Aquest treball investiga el raonament espacial i la consistència estructural dels Models de Fonamentació Visual (VFM), específicament la família Depth Anything (V1, V2, V3) i MiDaS, quan s'exposen a una taxonomia seleccionada d'il·lusions 3D. Es proposa un marc de Psicofísica Artificial extraient la disparitat de profunditat entre Regions d'Interès (ROI), permetent el càlcul del Punt d'Igualtat Subjectiva (PSE) i la Diferència Just Notable (JND). A més, es realitza una validació entre dominis mitjançant un laboratori basat en vòxels (Minecraft) per aïllar pistes estructurals geomètriques del soroll visual d'alta freqüència. Els resultats demostren un canvi evolutiu en els biaixos del model: V1 es basa en gran mesura en una prioritat d'alçada en el camp, V2 fa transicions a un biaix de centralitat fotocèntrica i V3 mostra una geometria altament sensible i impulsada pel context que es col·lapsa quan s'exposa a impossibilitats topològiques. Aquestes troballes confirmen que els VFM avançats repliquen errors similars als humans, cosa que demostra que una major comprensió semàntica pot comprometre la robustesa geomètrica.
Resum: Monocular Depth Estimation (MDE) models achieve exceptional capabilities in spatial reconstruction from a single image, yet their dependence on learned priors makes them susceptible to visual paradoxes. This work investigates the spatial reasoning and structural consistency of Visual Foundation Models (VFMs), specifically the Depth Anything family (V1, V2, V3) and MiDaS, when exposed to a curated taxonomy of 3D illusions. An Artificial Psychophysics framework is proposed by extracting the depth disparity across Regions of Interest (ROI), enabling the computation of the Point of Subjective Equality (PSE) and Just Noticeable Difference (JND). Furthermore, cross-domain validation is performed using a voxel-based laboratory (Minecraft) to isolate geometric structural cues from high-frequency visual noise. Results demonstrate an evolutionary shift in model biases: V1 relies heavily on a height-in-field prior, V2 transitions to a photo-centric centrality bias, and V3 shows a highly sensitive, context-driven geometry that collapses when exposed to topological impossibilities. These findings confirm that advanced VFMs replicate human-like errors, demonstrating that increased semantic comprehension can compromise geometric robustness.
Resum: Los modelos de Estimación de Profundidad Monocular (MDE) logran capacidades excepcionales en la reconstrucción espacial a partir de una sola imagen; sin embargo, su dependencia de información previa aprendida los hace susceptibles a paradojas visuales. Este trabajo investiga el razonamiento espacial y la consistencia estructural de los Modelos de Fundamentos Visuales (VFM), específicamente la familia Depth Anything (V1, V2, V3) y MiDaS, al exponerlos a una taxonomía curada de ilusiones 3D. Se propone un marco de Psicofísica Artificial mediante la extracción de la disparidad de profundidad en regiones de interés (ROI), lo que permite el cálculo del Punto de Igualdad Subjetiva (PSE) y la Diferencia Apreciable Justa (JND). Además, se realiza una validación cruzada utilizando un laboratorio basado en vóxeles (Minecraft) para aislar las claves estructurales geométricas del ruido visual de alta frecuencia. Los resultados demuestran un cambio evolutivo en los sesgos del modelo: V1 se basa en gran medida en un prior de altura en el campo, V2 transiciona a un sesgo de centralidad fotocéntrica, y V3 muestra una geometría altamente sensible, impulsada por el contexto, que colapsa al exponerse a imposibilidades topológicas. Estos hallazgos confirman que los VFM avanzados replican errores similares a los humanos, lo que demuestra que una mayor comprensión semántica puede comprometer la robustez geométrica.
Drets: Aquest document està subjecte a una llicència d'ús Creative Commons. Es permet la reproducció total o parcial, la distribució, la comunicació pública de l'obra i la creació d'obres derivades, sempre i quan aquestes es distribueixin sota la mateixa llicència que regula l'obra original i es reconegui l'autoria. Creative Commons
Llengua: Anglès
Titulació: Grau en Intel·ligència Artificial [2504392]
Pla d'estudis: Intel·ligència Artificial [1497]
Document: Treball final de grau
Matèria: Estimació de la profunditat monocular ; Models bàsics de la visió ; Psicofísica artificial ; Il·lusions òptiques en 3D ; Monocular Depth Estimation ; Vision Foundation Models ; Artificial Psychophysics ; 3D Optical Illusions ; Estimación de profundidad monocular ; Modelos de fundamentos de la visión ; ilusiones ópticas 3D



14 p, 9.0 MB

El registre apareix a les col·leccions:
Documents de recerca > Treballs de final de grau > Escola d'Enginyeria. TFG

 Registre creat el 2026-09-21, darrera modificació el 2026-09-21



   Favorit i Compartir