Show simple item record

dc.contributor.advisorCambiaso, Enrico <1985>
dc.contributor.advisorRibaudo, Marina <1964>
dc.contributor.authorNabizada, Abida <1996>
dc.date.accessioned2026-08-06T14:16:50Z
dc.date.available2026-08-06T14:16:50Z
dc.date.issued2026-07-27
dc.identifier.urihttps://unire.unige.it/handle/123456789/16658
dc.description.abstractLe piattaforme di social media sono sempre più usate come sistemi di allerta precoce per i conflitti regionali e le crisi politiche e, per questo motivo, sono diventate fonti essenziali per il monitoraggio delle notizie prima della pubblicazione giornalistica ufficiale. Tuttavia, tracciare i contenuti di queste piattaforme comporta notevoli sfide tecniche. Gli analisti devono fare i conti con rapidi picchi (burst) di post frammentati, formati di dati fortemente eterogenei e con importanti barriere linguistiche, specialmente nelle regioni colpite da conflitti in cui sono usate lingue diverse. Per rispondere a queste sfide, questa tesi di laurea magistrale introduce SocialMediaCrawler, un framework modulare progettato per l'estrazione automatizzata di notizie in lingue multiple. Il sistema utilizza un'architettura asincrona e robusta per acquisire e normalizzare continuamente i post non strutturati dei social media insieme a feed di canali RSS strutturati. Per mitigare la frammentazione dei dati, il framework impiega una strategia di aggregazione dei post configurabile che permette di raggruppare i rapidi picchi di messaggi in unità temporali coese. Inoltre, il framework integra l’uso di Large Language Model per superare le barriere linguistiche. SocialMediaCrawler viene valutato attraverso un caso di studio reale focalizzato sul Medio Oriente, per il quale è stata monitorata una selezione eterogenea di canali Telegram pubblici e feed RSS. L'analisi sperimentale mostra il funzionamento del sistema, la sua capacità di garantire la riproducibilità sperimentale attraverso la conservazione dei dati grezzi e la sua efficacia nel facilitare confronti temporali della propagazione delle notizie sfruttando sorgenti di dati diverse.it_IT
dc.description.abstractAs social media platforms increasingly serve as early-warning systems for regional conflicts and political crises, they have become key sources for news monitoring before formal journalistic publication. However, tracking social media platforms presents significant technical challenges. Analysts must contend with rapid bursts of fragmented posts, highly heterogeneous data formats, and substantial linguistic barriers, particularly in conflict-affected regions where multiple languages are prevalent. To address these challenges, this master's thesis introduces SocialMediaCrawler, a modular, proof-of-concept framework designed for automated multilingual news extraction. The system uses a fault-tolerant, asynchronous streaming architecture that continuously ingests and normalizes unstructured social media posts alongside structured RSS news feeds. To mitigate data fragmentation, the framework employs a configurable contextual aggregation strategy that groups rapid message bursts into cohesive temporal units. The pipeline also integrates Large Language Models to overcome language barriers. The framework is evaluated through a real-world case study focused on the Middle East, monitoring a diverse selection of public Telegram channels and RSS feeds. The experimental analysis explores the operational resilience of the system, its capacity to guarantee experimental reproducibility through raw data preservation, and its effectiveness in supporting exploratory cross-source temporal comparisons of news propagation.en_UK
dc.language.isoen
dc.rightsinfo:eu-repo/semantics/closedAccess
dc.titleSocial Media Crawler: implementazione di una piattaforma multilingua automatizzata per l’estrazione di informazioniit_IT
dc.title.alternativeSocial Media Crawler: Implementation of an Automated Multilingual News Extraction Platformen_UK
dc.typeinfo:eu-repo/semantics/masterThesis
dc.subject.miurINF/01 - INFORMATICA
dc.subject.miurINF/01 - INFORMATICA
dc.subject.miurINF/01 - INFORMATICA
dc.publisher.nameUniversità degli studi di Genova
dc.date.academicyear2025/2026
dc.description.corsolaurea10852 - COMPUTER SCIENCE
dc.description.area7 - SCIENZE MAT.FIS.NAT.
dc.description.department100023 - DIPARTIMENTO DI INFORMATICA, BIOINGEGNERIA, ROBOTICA E INGEGNERIA DEI SISTEMI


Files in this item

This item appears in the following Collection(s)

Show simple item record