Mostra i principali dati dell'item
Combinazione dell’embedding dei nodi del grafo e del Random Forest per il rilevamento di JavaScript malevoli
| dc.contributor.advisor | Carrega, Alessandro <1982> | |
| dc.contributor.advisor | Bolla, Raffaele <1963> | |
| dc.contributor.author | Shahabi, Mohammaderfan <1997> | |
| dc.date.accessioned | 2026-07-23T14:29:41Z | |
| dc.date.available | 2026-07-23T14:29:41Z | |
| dc.date.issued | 2026-07-16 | |
| dc.identifier.uri | https://unire.unige.it/handle/123456789/16400 | |
| dc.description.abstract | JavaScript è ampiamente utilizzato nelle applicazioni web moderne ed è anche frequentemente sfruttato per attacchi malevoli e offuscati. Questa tesi indaga se una pipeline ibrida, che combina l'apprendimento di rappresentazioni basate su grafi con l'aumento sintetico dei dati, migliori il rilevamento di JavaScript malevolo rispetto a caratteristiche strutturali accuratamente ingegnerizzate. Il corpus iniziale contiene 68.658 campioni JavaScript (39.452 malevoli e 29.206 benigni). Dopo la rimozione di 41.075 duplicati esatti, restano 27.583 campioni unici (15.555 malevoli e 12.028 benigni), con la classe benigna come minoranza e uno sbilanciamento moderato. Per affrontare lo sbilanciamento, CTGAN genera campioni sintetici della classe minoritaria (benigna), mentre Node2Vec viene applicato a un grafo di similarità k-nearest-neighbor costruito per ogni fold per apprendere embedding strutturali dalle caratteristiche ingegnerizzate. Tutti i modelli sono valutati con una cross-validation a 5 fold priva di leakage su otto classificatori, tra cui Random Forest, MLP, CatBoost, XGBoost, KNN, ExtraTrees, HistGradientBoosting e Decision Tree. Le sole caratteristiche ingegnerizzate risultano altamente discriminative: i modelli ensemble ad alberi raggiungono un AUROC fino al 99,79%. L'aumento con CTGAN non produce cambiamenti significativi e gli embedding di grafo Node2Vec non migliorano le prestazioni, degradando sostanzialmente Random Forest, i cui split assiali sono inadatti alle coordinate dense e ruotate dello spazio di embedding. Si conclude che, per questo dataset, semplici caratteristiche strutturali sono sufficienti e i passaggi aggiuntivi di representation learning e aumento dei dati non sono giustificati. I risultati sono limitati a un corpus pubblico e parzialmente ridondante; resta necessaria una validazione più ampia e temporalmente separata. | it_IT |
| dc.description.abstract | JavaScript is widely used in modern web applications and is also frequently exploited for malicious and obfuscated attacks. This thesis investigates whether a hybrid pipeline that combines graph-based representation learning with synthetic data augmentation improves malicious JavaScript detection beyond carefully engineered structural features. The initial corpus contains 68,658 JavaScript samples (39,452 malicious and 29,206 benign). After removing 41,075 exact-duplicate records, 27,583 unique samples remain (15,555 malicious and 12,028 benign), leaving the benign class as the minority with a moderate imbalance. To address the imbalance, CTGAN is used to generate synthetic minority-class (benign) samples, while Node2Vec is applied on a per-fold k-nearest-neighbor similarity graph to learn structural embeddings from engineered JavaScript features. All models are evaluated under leakage-free 5-fold cross-validation across eight classifiers, including Random Forest, MLP, CatBoost, XGBoost, KNN, ExtraTrees, HistGradientBoosting, and Decision Tree. The engineered features alone are highly discriminative, with tree-ensemble models reaching an AUROC of up to 99.79%. CTGAN augmentation yields no meaningful change, and Node2Vec graph embeddings do not improve performance and substantially degrade Random Forest, whose axis-aligned decision splits are ill-suited to the dense, rotated coordinates of the embedding space. We conclude that, for this dataset, simple structural features are sufficient and the additional representation-learning and augmentation steps are not justified. Results are limited to a publicly available, partly redundant corpus, and broader, temporally separated validation is still required. | en_UK |
| dc.language.iso | en | |
| dc.language.iso | en | |
| dc.rights | info:eu-repo/semantics/openAccess | |
| dc.title | Combinazione dell’embedding dei nodi del grafo e del Random Forest per il rilevamento di JavaScript malevoli | it_IT |
| dc.title.alternative | Combining Graph Node Embedding and random Forest foe Malicious JavaScript Detection | en_UK |
| dc.type | info:eu-repo/semantics/masterThesis | |
| dc.subject.miur | ING-INF/05 - SISTEMI DI ELABORAZIONE DELLE INFORMAZIONI | |
| dc.publisher.name | Università degli studi di Genova | |
| dc.date.academicyear | 2025/2026 | |
| dc.description.corsolaurea | 11160 - COMPUTER ENGINEERING | |
| dc.description.area | 9 - INGEGNERIA | |
| dc.description.department | 100023 - DIPARTIMENTO DI INFORMATICA, BIOINGEGNERIA, ROBOTICA E INGEGNERIA DEI SISTEMI |
Files in questo item
Questo item appare nelle seguenti collezioni
-
Laurea Magistrale [8032]


