Architettura di sistema basata su VLM per il riconoscimento e la caratterizzazione in tempo reale degli scenari di guida

Mostra/ Apri
Autore
Incerti, Simone <2001>
Data
2026-07-17Disponibile dal
2026-07-23Abstract
La guida autonoma richiede la comprensione semantica della scena e la stima di grandezze fisiche come velocità, time headway (THW) e time to collision (TTC). Tradizionalmente gestite da modelli separati, questa tesi analizza se un singolo Vision-Language Model (VLM) possa svolgere entrambi i compiti simultaneamente tramite apprendimento multi-task. Il sistema usa Qwen3-VL-2B-Instruct come backbone condiviso. Il primo task è la regressione fisica: da 3 frame di una dashcam, una testa MLP stima velocità, THW e TTC. Il secondo task genera descrizioni in linguaggio naturale delle azioni del veicolo (benchmark BDD-X). Vengono confrontati due approcci: una baseline con backbone congelato (frozen) e un modello end-to-end con fine-tuning tramite QLORA. Una masked regression loss gestisce la disponibilità condizionale di THW e TTC, attivi solo in presenza di un veicolo che precede. L'addestramento ottimizza i task congiuntamente per prevenire la dominanza di uno sull'altro. Si usano due dataset: uno telemetrico ADAS personalizzato e BDD-X. È stata inoltre sviluppata una pipeline di inferenza in tempo reale con un filtro semantico anti-flicker per stabilizzare le descrizioni generate. I risultati dimostrano che un VLM compatto è efficace in entrambi i ruoli. L'approccio QLORA supera la baseline, ottenendo un MAE sulla velocità di 5.32 km/h (miglioramento del 47.6%) e un BERTScore F1 di 0.9124 per la descrizione della scena. Autonomous driving requires semantic scene understanding and precise estimation of safety metrics like ego-vehicle speed, time headway (THW), and time to collision (TTC). Traditionally handled by separate models, this thesis investigates if a single Vision-Language Model (VLM) can perform both tasks simultaneously via multi-task learning. The system uses Qwen3-VL-2B-Instruct as a shared backbone. The first task is physical regression: from a 3-frame dashcam sequence, an MLP head estimates speed, THW, and TTC. The second task generates natural language descriptions of vehicle actions, following the BDD-X benchmark. Two training paradigms are compared: a frozen backbone baseline and a full end-to-end approach fine-tuned with QLORA. A custom masked regression loss handles the conditional availability of THW and TTC, defined only when a lead vehicle is present. Training uses a proportional random interleaving strategy to jointly optimize tasks without dominance. The study relies on a custom ADAS telemetry dataset and the public BDD-X benchmark. A real-time inference pipeline was also developed, featuring a semantic anti-flicker filter to stabilize generated descriptions. Results confirm a compact VLM effectively serves both perceptual roles. The QLORA approach substantially outperforms the baseline, achieving an ego speed MAE of 5.32 km/h (47.6% improvement) and strong semantic reasoning with a BERTScore F1 of 0.9124.
Tipo
info:eu-repo/semantics/masterThesisCollezioni
- Laurea Magistrale [8032]

