Show simple item record

dc.contributor.advisorCarrega, Alessandro <1982>
dc.contributor.advisorBolla, Raffaele <1963>
dc.contributor.authorShahabi, Mohammaderfan <1997>
dc.date.accessioned2026-07-23T14:29:41Z
dc.date.available2026-07-23T14:29:41Z
dc.date.issued2026-07-16
dc.identifier.urihttps://unire.unige.it/handle/123456789/16400
dc.description.abstractJavaScript è ampiamente utilizzato nelle applicazioni web moderne ed è anche frequentemente sfruttato per attacchi malevoli e offuscati. Questa tesi indaga se una pipeline ibrida, che combina l'apprendimento di rappresentazioni basate su grafi con l'aumento sintetico dei dati, migliori il rilevamento di JavaScript malevolo rispetto a caratteristiche strutturali accuratamente ingegnerizzate. Il corpus iniziale contiene 68.658 campioni JavaScript (39.452 malevoli e 29.206 benigni). Dopo la rimozione di 41.075 duplicati esatti, restano 27.583 campioni unici (15.555 malevoli e 12.028 benigni), con la classe benigna come minoranza e uno sbilanciamento moderato. Per affrontare lo sbilanciamento, CTGAN genera campioni sintetici della classe minoritaria (benigna), mentre Node2Vec viene applicato a un grafo di similarità k-nearest-neighbor costruito per ogni fold per apprendere embedding strutturali dalle caratteristiche ingegnerizzate. Tutti i modelli sono valutati con una cross-validation a 5 fold priva di leakage su otto classificatori, tra cui Random Forest, MLP, CatBoost, XGBoost, KNN, ExtraTrees, HistGradientBoosting e Decision Tree. Le sole caratteristiche ingegnerizzate risultano altamente discriminative: i modelli ensemble ad alberi raggiungono un AUROC fino al 99,79%. L'aumento con CTGAN non produce cambiamenti significativi e gli embedding di grafo Node2Vec non migliorano le prestazioni, degradando sostanzialmente Random Forest, i cui split assiali sono inadatti alle coordinate dense e ruotate dello spazio di embedding. Si conclude che, per questo dataset, semplici caratteristiche strutturali sono sufficienti e i passaggi aggiuntivi di representation learning e aumento dei dati non sono giustificati. I risultati sono limitati a un corpus pubblico e parzialmente ridondante; resta necessaria una validazione più ampia e temporalmente separata.it_IT
dc.description.abstractJavaScript is widely used in modern web applications and is also frequently exploited for malicious and obfuscated attacks. This thesis investigates whether a hybrid pipeline that combines graph-based representation learning with synthetic data augmentation improves malicious JavaScript detection beyond carefully engineered structural features. The initial corpus contains 68,658 JavaScript samples (39,452 malicious and 29,206 benign). After removing 41,075 exact-duplicate records, 27,583 unique samples remain (15,555 malicious and 12,028 benign), leaving the benign class as the minority with a moderate imbalance. To address the imbalance, CTGAN is used to generate synthetic minority-class (benign) samples, while Node2Vec is applied on a per-fold k-nearest-neighbor similarity graph to learn structural embeddings from engineered JavaScript features. All models are evaluated under leakage-free 5-fold cross-validation across eight classifiers, including Random Forest, MLP, CatBoost, XGBoost, KNN, ExtraTrees, HistGradientBoosting, and Decision Tree. The engineered features alone are highly discriminative, with tree-ensemble models reaching an AUROC of up to 99.79%. CTGAN augmentation yields no meaningful change, and Node2Vec graph embeddings do not improve performance and substantially degrade Random Forest, whose axis-aligned decision splits are ill-suited to the dense, rotated coordinates of the embedding space. We conclude that, for this dataset, simple structural features are sufficient and the additional representation-learning and augmentation steps are not justified. Results are limited to a publicly available, partly redundant corpus, and broader, temporally separated validation is still required.en_UK
dc.language.isoen
dc.language.isoen
dc.rightsinfo:eu-repo/semantics/openAccess
dc.titleCombinazione dell’embedding dei nodi del grafo e del Random Forest per il rilevamento di JavaScript malevoliit_IT
dc.title.alternativeCombining Graph Node Embedding and random Forest foe Malicious JavaScript Detectionen_UK
dc.typeinfo:eu-repo/semantics/masterThesis
dc.subject.miurING-INF/05 - SISTEMI DI ELABORAZIONE DELLE INFORMAZIONI
dc.publisher.nameUniversità degli studi di Genova
dc.date.academicyear2025/2026
dc.description.corsolaurea11160 - COMPUTER ENGINEERING
dc.description.area9 - INGEGNERIA
dc.description.department100023 - DIPARTIMENTO DI INFORMATICA, BIOINGEGNERIA, ROBOTICA E INGEGNERIA DEI SISTEMI


Files in this item

Thumbnail

This item appears in the following Collection(s)

Show simple item record