ViT-Explorer : Eina de visualització per a la interpretació de Vision Transformers
Capdevila Estadella, Albert
Vanrell i Martorell, Maria Isabel tut. (Universitat Autònoma de Barcelona. Departament de Ciències de la Computació)
Universitat Autònoma de Barcelona. Escola d'Enginyeria

Títol variant: ViT-Explorer : A Visualization Tool for Vision Transformer Interpretation
Títol variant: ViT-Explorer : Herramienta de visualización para la interpretación de Vision Transformers
Data: 2026
Resum: Els transformers són una arquitectura que ha revolucionat tant la visió per computador com el processament del llenguatge natural, però la seva interpretabilitat s’ha estudiat més extensament en llenguatge que en visió. Per a reduir aquesta diferència, es proposa ViT-Explorer, una eina que combina anàlisi de dades i visualitzacions per a explorar les representacions internes d'un Vision Transformer. L'eina aporta tres contribucions de visualització: (a) un graf de l'espai latent reduït amb representacions d'atenció; (b) graelles de colors per visualitzar embeddings; i (c) mapes d'opacitat interactius per visualitzar l'atenció. Aquestes vistes es validen mitjançant tres casos d'ús, mostrant com evolucionen els embeddings des de trets de baix nivell fins a classes definides, com es separen patches idèntics en l'espai latent segons el context, i com els heads d'atenció presenten patrons diferents. Així doncs, ViT-Explorer fa una passa més en la interpretabilitat dels Vision Transformers.
Resum: Transformers are a deep learning architecture that has revolutionized both Computer Vision and Natural Language Processing, however, their interpretability has been studied more extensively in language than in vision. To help bridge this gap, ViT-Explorer is proposed as a tool that combines visualization and data analysis techniques to explore Vision Transformers’ internal representations across layers. It provides three main visualization contributions: (a) a low-dimensional latent space with graph-based attention representations; (b) a color-based embedding visualization; and (c) an interactive opacity map for attention display. These approaches are validated through three case studies, showing how embeddings evolve from low-level features to semantic classes, how identical patches are pulled away by their context in latent space, and how attention heads display different patterns across depth. Overall, ViT-Explorer is a further step toward explainable Vision Transformers.
Resum: Los transformers son una arquitectura que ha revolucionado la visión artificial y el procesamiento del lenguaje natural, pero su interpretabilidad se ha estudiado más en lenguaje que en visión. Para reducir esta diferencia, se propone ViT-Explorer, una herramienta que combina análisis de datos y visualizaciones para explorar las representaciones internas de un Vision Transformer. La herramienta aporta tres contribuciones de visualización: (a) un grafo del espacio latente reducido con representaciones de atención; (b) cuadrículas de colores para visualizar embeddings; y (c) mapas de opacidad interactivos para visualizar la atención. Estas vistas se validan en tres casos de uso, mostrando cómo los embeddings evolucionan desde características de bajo nivel hasta clases definidas, cómo se separan patches idénticos en el espacio latente según el contexto, y cómo los heads de atención presentan patrones diferentes. En conjunto, ViT-Explorer avanza en la interpretabilidad de los Vision Transformers.
Drets: Aquest document està subjecte a una llicència d'ús Creative Commons. Es permet la reproducció total o parcial, la distribució, i la comunicació pública de l'obra, sempre que no sigui amb finalitats comercials, i sempre que es reconegui l'autoria de l'obra original. No es permet la creació d'obres derivades. Creative Commons
Llengua: Català
Titulació: Enginyeria Informàtica [2502441]
Pla d'estudis: Enginyeria Informàtica [958]
Document: Treball final de grau
Àrea temàtica: Menció Computació
Matèria: Vision Transformers ; Visió per computador ; IA explicable ; Visualització d'embeddings ; Visualització d'autoatenció ; Visualització de l'espai latent ; Reducció de dimensionalitat ; AlignedUMAP ; Computer vision ; explainable AI (XAI) ; Embedding visualization ; Self-attention visualization ; Latent space visualization ; Dimensionality reduction ; Transformers de visión ; Visión artificial ; Visualización de embeddings ; Visualización de autoatención ; Visualización del espacio latente ; Reducción de dimensionalidad



12 p, 14.1 MB

El registre apareix a les col·leccions:
Documents de recerca > Treballs de final de grau > Escola d'Enginyeria. TFG

 Registre creat el 2026-07-21, darrera modificació el 2026-07-21



   Favorit i Compartir