tut. (Universitat Autònoma de Barcelona. Departament de Ciències de la Computació)
| Additional title: |
De mapes d'atenció 2D a visualitzacions 3D en models de conducció profunda |
| Additional title: |
De mapas de atención 2D a visualizaciones 3D en modelos de conducción profunda |
| Date: |
2026 |
| Abstract: |
L'adopció de models d'aprenentatge profund d'extrem a extrem (end-to-end) en la conducció autònoma ha permès obtenir millores significatives en el rendiment, però la seva naturalesa de "caixa negra" dificulta la verificació de la seguretat, la depuració d'errors (debugging) i la confiança de l'usuari. Aquest projecte aborda aquest desafiament mitjançant el desenvolupament d'un sistema d'explicabilitat innovador que visualitza en 3D la pròpia atenció del model de conducció. Els avenços recents en models de llenguatge i visió (VLM) han permès predir no només on miraria un conductor humà, sinó també el raonament semàntic que hi ha darrere d'aquesta atenció. En aquest treball, reutilitzem aquest VLM i el reajustem (fine-tuning) amb mapes d'atenció extrets d'un model de conducció d'extrem a extrem d'última generació, de manera que generi explicacions semàntiques alineades amb el focus real del model i no amb la mirada d'un humà. La contribució principal recau en la projecció d'aquests mapes d'atenció derivats del model en una representació 3D coherent de l'escena de conducció, enriquint aquesta vista 3D amb les anotacions textuals del VLM. El resultat final permetrà als usuaris finals observar, en un context espacial complet, a quins elements de l'entorn (per exemple, vianants, senyals de trànsit, límits de la carretera) està prestant atenció el model, juntament amb descripcions llegibles per humans sobre què són aquests elements i per què són importants. Al transformar mapes de calor 2D abstractes i text en explicacions 3D fonamentades espacialment, aquest projecte pretén millorar significativament la interpretabilitat dels agents de conducció autònoma, contribuint en última instància a sistemes d'IA més segurs i fiables per a la carretera. |
| Abstract: |
The adoption of end-to-end deep learning models in autonomous driving has led to significant performance gains, but their ”black-box” nature hinders safety verification, debugging and user trust. This project addresses that challenge by developing a novel explainability system that visualises the driving model’s own attention in 3D. Recent advances in vision-language models (VLMs) have enabled the prediction of not only where a human driver would look, but also the semantic reasoning behind that attention. We repurpose such a VLM, fine-tuning it on attention maps extracted from a state-of- the-art end-to-end driving model, so that it produces semantic explanations aligned with the model’s actual focus, not a human’s gaze. The core contribution lies in projecting these model-derived attention maps into a coherent 3D representation of the driving scene and enriching that 3D view with the VLM’s textual annotations. The final output will allow end-users to observe, in full spatial context, which elements of the environment (e. g. pedestrians, traffic signs, road boundaries) the model is attending to, along with human-readable descriptions of what those elements are and why they are important. By transforming abstract 2D heatmaps and text into spatially grounded 3D explanations, this project aims to significantly enhance the interpretability of autonomous driving agents, ultimately contributing to safer and more trustworthy AI systems for the road. |
| Abstract: |
La adopción de modelos de aprendizaje profundo de extremo a extremo (end-to-end) en la conducción autónoma ha permitido obtener mejoras significativas en el rendimiento, pero su naturaleza de "caja negra" dificulta la verificación de la seguridad, la depuración de errores (debugging) y la confianza del usuario. Este proyecto aborda dicho desafío mediante el desarrollo de un sistema de explicabilidad novedoso que visualiza en 3D la propia atención del modelo de conducción. Los avances recientes en modelos de lenguaje y visión (VLM) han permitido predecir no solo dónde miraría un conductor humano, sino también el razonamiento semántico detrás de esa atención. En este trabajo, reutilizamos dicho VLM y lo ajustamos (fine-tuning) con mapas de atención extraídos de un modelo de conducción de extremo a extremo de última generación, de modo que genere explicaciones semánticas alineadas con el foco real del modelo y no con la mirada de un humano. La contribución principal radica en proyectar estos mapas de atención derivados del modelo en una representación 3D coherente de la escena de conducción, enriqueciendo dicha vista 3D con las anotaciones textuales del VLM. El resultado final permitirá a los usuarios finales observar, en un contexto espacial completo, a qué elementos del entorno (por ejemplo, peatones, señales de tráfico, límites de la carretera) está prestando atención el modelo, junto con descripciones legibles por humanos sobre qué son esos elementos y por qué son importantes. Al transformar mapas de calor 2D abstractos y texto en explicaciones 3D fundamentadas espacialmente, este proyecto aspira a mejorar significativamente la interpretabilidad de los agentes de conducción autónoma, contribuyendo en última instancia a sistemas de IA más seguros y confiables para la carretera. |
| Rights: |
Aquest document està subjecte a una llicència d'ús Creative Commons. Es permet la reproducció total o parcial, la distribució, la comunicació pública de l'obra i la creació d'obres derivades, sempre i quan aquestes es distribueixin sota la mateixa llicència que regula l'obra original i es reconegui l'autoria.  |
| Language: |
Anglès |
| Studies: |
Grau en Intel·ligència Artificial [2504392] |
| Study plan: |
Intel·ligència Artificial [1497] |
| Document: |
Treball final de grau |
| Subject: |
Predicció de l'atenció del conductor ;
IA explicable (XAI) ;
Conducció autònoma ;
Visualització 3D ;
Aprenentatge profund ;
Models de llenguatge de gran mida (LLM) ;
Visió per computador ;
Conducció d'extrem a extrem ;
IA centrada en l'ésser humà ;
Driver attention prediction ;
Explainable AI (XAI) ;
Autonomous Driving ;
3D Visualization ;
Deep Learning ;
Large Language Models (LLMs) ;
Computer Vision ;
End-to-End Driving ;
Human- Centered AI ;
Predicción de la atención del conductor ;
Conducción autónoma ;
Visualización 3D ;
Aprendizaje profundo ;
Modelos de lenguaje de gran tamaño (LLM) ;
Visión por computadora ;
Conducción de extremo a extremo ;
IA centrada en el ser humano |