Pedestrian Intention Prediction for Autonomous Driving
Naveed Riaz, Muhammad
López Peña, Antonio M. dir.
Wielgosz, Maciej dir.

Data: 2026
Resum: La intel·ligència artificial (IA) és una pedra angular dels sistemes de transport intel·ligents (ITS), on la capacitat de percebre, interpretar i anticipar el comportament humà impacta directament en la seguretat vial i la confiança en els vehicles autònoms. Entre els reptes d'aquest domini, predir la intenció del vianant (PIP), especialment determinar si creuarà davant d'un vehicle, és una tasca crítica. Una PIP precisa permet maniobres proactives, segures i còmodes, reduint accidents i assegurant interaccions més fluids entre humans i vehicles. No obstant això, el progrés en PIP s'ha vist obstaculitzat per tres reptes persistents: l'escassetat de conjunts de dades etiquetats i diversos, la dependència d'un etiquetat manual costós i la complexitat dels enfocaments multimodals basats en nombrosos fluxos d'entrada, que limiten el desplegament en temps real. Per abordar la manca de dades diverses i etiquetades, aquesta tesi introdueix PedSynth, un conjunt sintètic basat en el simulador CARLA i generat programàticament per mostrar diferents comportaments de vianants. PedSynth complementa conjunts de dades del món real com JAAD i PIE en proporcionar una riquesa de escenaris de creuament (C) i no creuament (NC), essencials per entrenar models PIP robustos. Sobre aquest recurs, proposem PedGNN, un model recurrent lleuger basat en grafs que utilitza seqüències d'esquelets de vianants per predir intencions de creuament. PedGNN està optimitzat per execució a bord, assolint inferència ràpida i ús mínim de memòria, ideal per a sistemes de conducció autònoma en temps real. Per superar el coll d'ampolla de l'etiquetat manual, proposem una adaptació no supervisada de domini sintètic-a-real per a la predicció C/NC, anomenada S2R-UDA-CP. Aquest procediment utilitza PedSynth com a conjunt sintètic font i PedGNN, en la seva forma no entrenada, per generar automàticament etiquetes C/NC per a vídeos del domini real. En avaluar models PIP de l'estat de l'art, com ST-CrossingPose i PedGraph+, en aquests conjunts etiquetats automàticament, demostrem que entrenar amb etiquetes generades per S2R-UDA-CP produeix models amb rendiment comparable als entrenats amb etiquetes humanes. A més de l'eficiència, aquest enfocament revela discrepàncies clau entre l'etiquetat humà i automàtic, oferint noves perspectives sobre pràctiques d'etiquetat en tasques de predicció de comportament. Per reduir la complexitat dels models PIP multimodals, hem desenvolupat PedGT, que combina xarxes convolucionals de grafs (GCNs) per al raonament espacial amb Transformers per al modelat temporal. A diferència d'enfocaments que depenen de múltiples entrades (aparença, context, postura, detecció 2D, trajectòria, segmentació semàntica), PedGT opera només sobre punts clau de l'esquelet del vianant i centres de deteccions. Aquest disseny simplificat assoleix resultats de l'estat de l'art, amb guanys significatius en F1-score i recall a PIE i JAAD, mentre un estudi ablatiu revela la importància de la normalització d'entrades i la selecció de frames. Simplificant el model PIP sense comprometre la precisió, PedGT és apte per predicció eficient i en temps real de la intenció dels vianants. També demostrem la seva robustesa dins de S2R-UDA-CP, on assoleix la major precisió, supera totes les arquitectures avaluades i manté estabilitat d'entrenament superior, confirmant la seva efectivitat amb etiquetes humanes i generades automàticament. En conjunt, aquesta tesi avança la PIP abordant sistemàticament els seus reptes principals: escassetat de dades, costos d'etiquetatge manual i complexitat del model. Mitjançant generació de dades sintètiques, adaptació de domini no supervisada i arquitectures eficients basades en grafs, les contribucions proposades alliberen el camí cap a sistemes PIP precisos, robustos i en temps real, reforçant la seguretat i fiabilitat de la conducció autònoma i els sistemes avançats d'ajuda a la conducció (ADAS).
Resum: La inteligencia artificial (IA) es una piedra angular de los sistemas de transporte inteligentes (ITS), donde la capacidad de percibir, interpretar y anticipar el comportamiento humano impacta directamente en la seguridad vial y la confianza en los vehículos autónomos. Entre los desafíos de este dominio, predecir la intención del peatón (PIP), en particular determinar si cruzará frente a un vehículo, es una tarea crítica. Una PIP precisa permite maniobras proactivas, seguras y confortables, reduciendo accidentes y asegurando interacciones más fluidas entre humanos y vehículos. Sin embargo, el progreso en PIP se ha visto obstaculizado por tres desafíos persistentes: la escasez de conjuntos de datos etiquetados y diversos, la dependencia de etiquetado manual costoso y la complejidad de enfoques multimodales basados en numerosos flujos de entrada, que limitan el despliegue en tiempo real. Para abordar la falta de datos diversos y etiquetados, esta tesis introduce PedSynth, un conjunto sintético basado en el simulador CARLA y generado programáticamente para mostrar distintos comportamientos de peatones. PedSynth complementa conjuntos de datos del mundo real como JAAD y PIE al proporcionar una rica variedad de escenarios de cruce (C) y no cruce (NC), esenciales para entrenar modelos PIP robustos. Sobre este recurso, proponemos PedGNN, un modelo recurrente ligero basado en grafos que usa secuencias de esqueletos de peatones para predecir intenciones de cruce. PedGNN está optimizado para ejecución a bordo, logrando inferencia rápida y mínimo uso de memoria, lo que lo hace adecuado para sistemas de conducción autónoma en tiempo real. Para superar el cuello de botella del etiquetado manual, proponemos una adaptación no supervisada de dominio sintéticoareal para la predicción C/NC, denominada S2R-UDA-CP. Este procedimiento utiliza PedSynth como conjunto sintético fuente y nuestra segunda contribución, PedGNN en su forma no entrenada, para generar automáticamente etiquetas C/NC para videos del dominio real. Al evaluar modelos PIP del estado del arte, como ST-CrossingPose y PedGraph+, en estos conjuntos etiquetados automáticamente, mostramos que entrenar con etiquetas generadas por S2R-UDA-CP produce modelos con rendimiento comparable al de modelos entrenados con etiquetas humanas. Además de la eficiencia, este enfoque revela discrepancias clave entre etiquetado humano y automático, ofreciendo nuevas perspectivas sobre las prácticas de etiquetado en tareas de predicción de comportamiento. Para reducir la complejidad de los modelos PIP multimodales, desarrollamos PedGT, que combina redes convolucionales de grafos (GCNs) para el razonamiento espacial con Transformers para el modelado temporal. A diferencia de enfoques que dependen de múltiples entradas (apariencia, contexto, postura, detección 2D, trayectoria, segmentación semántica), PedGT opera únicamente sobre puntos clave del esqueleto del peatón y centros de detecciones. Este diseño simplificado logra resultados del estado del arte, con ganancias significativas en F1-score y recall en PIE y JAAD, mientras un estudio ablativo revela la importancia de la normalización de entradas y la selección de frames. Al simplificar el modelo PIP sin comprometer la precisión, PedGT es apto para la predicción eficiente y en tiempo real de la intención de los peatones. También demostramos su robustez dentro del procedimiento de etiquetado automático S2R-UDA-CP, donde alcanza la mayor precisión, supera todas las arquitecturas evaluadas y mantiene una estabilidad de entrenamiento superior, confirmando su efectividad con etiquetas humanas y generadas automáticamente. En conjunto, esta tesis avanza la PIP al abordar sistemáticamente sus desafíos principales: escasez de datos, costos de etiquetado manual y complejidad del modelo. Mediante generación de datos sintéticos, adaptación de dominio no supervisada y arquitecturas eficientes basadas en grafos, las contribuciones propuestas allanan el camino hacia sistemas PIP precisos, robustos y en tiempo real, reforzando la seguridad y la fiabilidad de la conducción autónoma y los sistemas avanzados de asistencia al conductor (ADAS).
Resum: Artificial Intelligence (AI) has become a cornerstone of intelligent transportation systems (ITS), where the ability to perceive, interpret, and anticipate human behavior directly impacts road safety and trust in autonomous vehicles. Among the many challenges in this domain, pedestrian intention prediction (PIP), in particular, determining whether a pedestrian will cross in front of an ego-vehicle, stands as a critical task. Accurate PIP enables autonomous systems to perform proactive, safe, and comfortable maneuvers, thereby reducing accidents and ensuring smoother human-vehicle interactions. However, progress in PIP has been hindered by three persistent challenges: the scarcity of diverse labeled datasets, the dependence on costly manual labeling, and the complexity of multi-modal approaches, which rely on numerous data input streams and limit real-time deployment. To address the lack of diverse datasets, this thesis introduces PedSynth, a CARLA-based synthetic dataset of programmatically generated pedestrian scenarios. PedSynth complements existing real-world datasets such as JAAD and PIE by providing a rich variety of crossing (C) and non-crossing (NC) scenarios, essential for training robust PIP models. Building upon this asset, we propose PedGNN, a lightweight graph-based recurrent model that leverages pedestrian skeleton sequences to predict crossing intentions. PedGNN is optimized for onboard deployment, achieving fast inference and a minimal memory footprint, making it particularly suitable for real-time autonomous driving systems. To overcome the bottleneck of manual labeling, we propose a synth-to-real unsupervised domain adaptation for C/NC prediction, so we term it S2R-UDA-CP. This procedure leverages our first contribution, PedSynth, as the synthetic source dataset, and our second contribution, PedGNN, in its untrained form, to automatically generate C/NC labels for real-world videos. By evaluating state-of-the-art third-party PIP models such as ST-CrossingPose and PedGraph+ on these automatically labeled datasets, we demonstrate that training on S2R-UDA-CP labels yields models with performance comparable to the models trained on human labels. Beyond efficiency, this approach also reveals key discrepancies between human and machine labeling, offering new insights into labeling practices for behavior prediction tasks. Finally, to reduce the complexity of multi-input PIP models, we develop PedGT, a graph-based transformer model that combines graph convolutional networks (GCNs) for spatial reasoning with transformer encoders for temporal modeling. Unlike approaches that rely on multiple inputs such as appearance, context, pose, bounding box, trajectory, and segmentation maps, PedGT operates solely on pedestrian skeleton keypoints and bounding box centers. This streamlined design achieves state-of-the-art results, with significant gains in F1-score and recall on both PIE and JAAD datasets, while ablation studies highlight the importance of input normalization and frame selection. By simplifying the pipeline without compromising accuracy, PedGT makes a strong case for efficient, real-time PIP. Furthermore, we demonstrate PedGT's robustness within the S2R-UDA-CP automatic labeling procedure, where it achieves the highest accuracy, surpassing all evaluated architectures while maintaining superior training stability, confirming its effectiveness with both human-provided and automatically generated labels. In summary, this thesis advances PIP by systematically addressing its core challenges: dataset scarcity, manual labeling costs, and model complexity. Through synthetic data generation, unsupervised domain adaptation, and efficient graph-based architectures, the proposed contributions pave the way for accurate, robust, and real-time PIP systems, strengthening the safety and reliability of autonomous driving and advanced driver assistance systems (ADAS).
Nota: Universitat Autònoma de Barcelona. Programa de Doctorat en Informàtica.
Drets: Aquest document està subjecte a una llicència d'ús Creative Commons. Es permet la reproducció total o parcial, la distribució, la comunicació pública de l'obra i la creació d'obres derivades, sempre i quan aquestes es distribueixin sota la mateixa llicència que regula l'obra original i es reconegui l'autoria. Creative Commons
Llengua: Anglès
Document: Tesi doctoral ; Text ; Versió publicada
Matèria: Intenció de Vianants ; Pedestrian Intention Recog. ; Intención de Peatones ; Tecnologies

Adreça alternativa: https://hdl.handle.net/10803/697614


127 p, 39.2 MB

El registre apareix a les col·leccions:
Documents de recerca > Tesis doctorals

 Registre creat el 2026-07-14, darrera modificació el 2026-07-18



   Favorit i Compartir