| dc.contributor.advisor | Bellotti, Francesco <1972> | |
| dc.contributor.advisor | Berta, Riccardo <1974> | |
| dc.contributor.author | Benvenuto, Luca <2001> | |
| dc.contributor.other | Alessandro Pighetti | |
| dc.date.accessioned | 2026-07-23T14:33:10Z | |
| dc.date.available | 2026-07-23T14:33:10Z | |
| dc.date.issued | 2026-07-17 | |
| dc.identifier.uri | https://unire.unige.it/handle/123456789/16523 | |
| dc.description.abstract | Il riconoscimento automatico di scenari di guida è un componente fondamentale per i sistemi di assistenza alla guida avanzati (ADAS) e per i veicoli autonomi. La maggior parte degli eventi che definiscono uno scenario, quali tagli di corsia, frenate o avvicinamenti, è intrinsecamente relazionale: il loro riconoscimento richiede la modellazione congiunta del comportamento di più agenti nel tempo.
Questo lavoro introduce un benchmark sintetico etichettato di 31.502 finestre di scenario estratte da registrazioni multi-agente simulate in CARLA, codificate nel formato ASAM Open Simulation Interface (OSI) e classificate in nove categorie in accordo con la tassonomia ISO 34502. Viene proposto uno Spatio-Temporal Transformer (STT), un'architettura ad attenzione fattorizzata che alterna l'attenzione spaziale multi-testa tra gli slot degli agenti con l'attenzione temporale multi-testa lungo la sequenza temporale. Un modulo di Ego Cross-Attention intermedio distilla il contesto multi-agente in una rappresentazione ego-centrica prima dell'elaborazione temporale. Il modello è addestrato con un framework multi-task che combina Focal Loss per la classificazione e Huber Loss per la regressione su tre target cinematici del veicolo ego, con bilanciamento dei pesi tramite la ponderazione di incertezza omoschedastica di Kendall.
Sulla partizione di test, lo STT raggiunge un macro-F1 di 0,732 ± 0,005 su tre run con seed diversi, equiparando il Flat Transformer (0,733 ± 0,020) e lo STGCN (0,730 ± 0,007) con una varianza seed-to-seed nettamente inferiore. La baseline ego-only LSTM registra un macro-F1 di 0,444, inferiore di 0,288 punti rispetto ai modelli interaction-aware, confermando che il contesto multi-agente è indispensabile per le classi di scenari a base relazionale. La valutazione della testa di regressione dimostra che i target cinematici ego-centrici sono predetti con precisione comparabile da modelli ego-only e multi-agente, validando la razionale del design multi-task.
Parol | it_IT |
| dc.description.abstract | Automatic driving scenario recognition is a core capability for advanced driver-assistance systems (ADAS) and autonomous vehicles. Most scenario-defining events, such as cut-ins, braking, and gap-closing, are inherently relational: their recognition requires joint modelling of multiple agents over time.
This thesis introduces a synthetic labelled benchmark of 31,502 scenario windows extracted from multi-agent CARLA simulations, encoded in the ASAM Open Simulation Interface (OSI) format and classified into nine categories in accordance with the ISO 34502 taxonomy. We propose a Spatio-Temporal Transformer (STT), a factorised attention architecture that alternates spatial multi-head attention across agent slots with temporal multi-head attention along the scenario timeline. An intermediate Ego Cross-Attention module distils multi-agent context into an ego-centric representation before temporal processing. The model is trained under a multi-task learning framework combining Focal Loss classification over the nine scenario classes with Huber Loss regression over three ego-vehicle kinematic targets, with task weights balanced via Kendall homoscedastic uncertainty weighting.
On the test partition, the STT achieves a macro-F1 of 0.732 ± 0.005 across three random seeds, matching the Flat Transformer (0.733 ± 0.020) and STGCN (0.730 ± 0.007) while exhibiting substantially lower seed-to-seed variance. The ego-only LSTM baseline achieves a macro-F1 of 0.444, falling 0.288 points below the interaction-aware models, confirming that multi-agent context is essential for relational scenario classes. The regression head evaluation demonstrates that ego-centric kinematic targets are predicted with comparable accuracy by ego-only and multi-agent models, validating the multi-task design rationale.
Keywords. Driving scenario recognition, Spatio-Temporal Transformer, multi-task learning, CARLA simulation, Open Simulation Interface (OSI), ISO 34502. | en_UK |
| dc.language.iso | en | |
| dc.rights | info:eu-repo/semantics/openAccess | |
| dc.title | Riconoscimento degli scenari di guida basato su Transformers spazio-temporali per l'analisi di serie temporali veicolari e del traffico | it_IT |
| dc.title.alternative | Driving Scenario Recognition Using Spatio-Temporal Transformers on Vehicular Signals and Traffic Time Series | en_UK |
| dc.type | info:eu-repo/semantics/masterThesis | |
| dc.subject.miur | ING-INF/01 - ELETTRONICA | |
| dc.publisher.name | Università degli studi di Genova | |
| dc.date.academicyear | 2025/2026 | |
| dc.description.corsolaurea | 10728 - ENGINEERING TECHNOLOGY FOR STRATEGY (AND SECURITY) | |
| dc.description.area | 9 - INGEGNERIA | |
| dc.description.department | 100026 - DIPARTIMENTO DI INGEGNERIA NAVALE, ELETTRICA, ELETTRONICA E DELLE TELECOMUNICAZIONI | |