Social Media Crawler: implementazione di una piattaforma multilingua automatizzata per l’estrazione di informazioni
View/ Open
Author
Nabizada, Abida <1996>
Date
2026-07-27Data available
2026-08-06Abstract
Le piattaforme di social media sono sempre più usate come sistemi di allerta precoce per i conflitti regionali e le crisi politiche e, per questo motivo, sono diventate fonti essenziali per il monitoraggio delle notizie prima della pubblicazione giornalistica ufficiale. Tuttavia, tracciare i contenuti di queste piattaforme comporta notevoli sfide tecniche. Gli analisti devono fare i conti con rapidi picchi (burst) di post frammentati, formati di dati fortemente eterogenei e con importanti barriere linguistiche, specialmente nelle regioni colpite da conflitti in cui sono usate lingue diverse.
Per rispondere a queste sfide, questa tesi di laurea magistrale introduce SocialMediaCrawler, un framework modulare progettato per l'estrazione automatizzata di notizie in lingue multiple. Il sistema utilizza un'architettura asincrona e robusta per acquisire e normalizzare continuamente i post non strutturati dei social media insieme a feed di canali RSS strutturati. Per mitigare la frammentazione dei dati, il framework impiega una strategia di aggregazione dei post configurabile che permette di raggruppare i rapidi picchi di messaggi in unità temporali coese. Inoltre, il framework integra l’uso di Large Language Model per superare le barriere linguistiche.
SocialMediaCrawler viene valutato attraverso un caso di studio reale focalizzato sul Medio Oriente, per il quale è stata monitorata una selezione eterogenea di canali Telegram pubblici e feed RSS. L'analisi sperimentale mostra il funzionamento del sistema, la sua capacità di garantire la riproducibilità sperimentale attraverso la conservazione dei dati grezzi e la sua efficacia nel facilitare confronti temporali della propagazione delle notizie sfruttando sorgenti di dati diverse. As social media platforms increasingly serve as early-warning systems for regional conflicts and political crises, they have become key sources for news monitoring before formal journalistic publication. However, tracking social media platforms presents significant technical challenges. Analysts must contend with rapid bursts of fragmented posts, highly heterogeneous data formats, and substantial linguistic barriers, particularly in conflict-affected regions where multiple languages are prevalent.
To address these challenges, this master's thesis introduces SocialMediaCrawler, a modular, proof-of-concept framework designed for automated multilingual news extraction. The system uses a fault-tolerant, asynchronous streaming architecture that continuously ingests and normalizes unstructured social media posts alongside structured RSS news feeds. To mitigate data fragmentation, the framework employs a configurable contextual aggregation strategy that groups rapid message bursts into cohesive temporal units. The pipeline also integrates Large Language Models to overcome language barriers.
The framework is evaluated through a real-world case study focused on the Middle East, monitoring a diverse selection of public Telegram channels and RSS feeds. The experimental analysis explores the operational resilience of the system, its capacity to guarantee experimental reproducibility through raw data preservation, and its effectiveness in supporting exploratory cross-source temporal comparisons of news propagation.
Type
info:eu-repo/semantics/masterThesisCollections
- Laurea Magistrale [8032]

