| dc.contributor.advisor | Fugacci, Ulderico <1988> | |
| dc.contributor.author | Di Via, Andrea <1998> | |
| dc.contributor.other | Claudio Muselli | |
| dc.date.accessioned | 2026-08-06T14:19:07Z | |
| dc.date.available | 2026-08-06T14:19:07Z | |
| dc.date.issued | 2026-07-22 | |
| dc.identifier.uri | https://unire.unige.it/handle/123456789/16693 | |
| dc.description.abstract | I modelli di embedding sono la spina dorsale silenziosa dei moderni sistemi di information retrieval: convertono il testo in oggetti geometrici, e la qualità di ogni risposta dipende dalla fedeltà di tale conversione. La robustezza di questi modelli al rumore tipografico ha però ricevuto scarsa attenzione sistematica. Questa tesi affronta tale lacuna.
Viene introdotto il Normalised Embedding Displacement (NED), un indice adimensionale di robustezza definito come rapporto tra lo spostamento nello spazio di output indotto da una perturbazione e la sua distanza di edit di Damerau-Levenshtein dalla query originale. Trattando un modello di embedding come mappa lipschitziana tra spazi metrici, il NED ne stima la costante di Lipschitz locale; il suo raffinamento bi-lipschitziano fornisce una banda empirica di stabilità e un indice di distorsione.
Il framework è applicato a sei modelli, valutati su 20 query, 13 budget di perturbazione e quattro funzioni distanza. Le varianti tipografiche sono generate da un canale di rumore a catena di Markov stimato su due corpora di errori ortografici.
Emergono tre risultati. Il NED medio decresce monotonicamente al crescere del budget, segnalando una saturazione metrica. Gemini e multilingual-e5-large risultano i più robusti per ragioni complementari: distorsione minima il primo, NED coseno più basso e traiettoria più regolare il secondo. La distanza coseno preserva l'ordinamento dei vicini meglio delle alternative, pur mostrando la distorsione maggiore. Una valutazione end-to-end su pipeline RAG rivela infine una netta dissociazione tra recupero e generazione: la sovrapposizione dei documenti recuperati crolla di circa il 78%, mentre la qualità delle risposte cala solo del 10%. | it_IT |
| dc.description.abstract | Embedding models are the silent backbone of modern information-retrieval systems: they convert raw text into geometric objects, and the quality of every downstream answer depends on the fidelity of that conversion. Yet their robustness to typographical noise has received little systematic attention. This thesis addresses that gap.
I introduce the Normalised Embedding Displacement (NED), a dimensionless robustness index defined as the ratio of the output-space displacement induced by a perturbation to its Damerau-Levenshtein edit distance from the original query. Treating an embedding model as a Lipschitz map between metric spaces, NED estimates its local Lipschitz constant; its bi-Lipschitz refinement yields an empirical stability band and a distortion index.
The framework is applied to six models, evaluated on 20 queries across 13 perturbation budgets and four distance functions. Typographical variants are generated by a Markov-chain noise channel estimated from two spelling-error corpora.
Three findings emerge. Mean NED decreases monotonically with the budget, reflecting metric saturation. Gemini and multilingual-e5-large are the most robust for complementary reasons: lowest distortion for the former, lowest mean cosine NED and most regular trajectory for the latter. Cosine distance preserves nearest-neighbour ordering better than the alternatives, despite the largest distortion index. An end-to-end RAG evaluation finally reveals a sharp retrieval/generation dissociation: overlap between retrieved documents collapses by roughly 78%, while answer quality declines by only 10%. | en_UK |
| dc.language.iso | en | |
| dc.rights | info:eu-repo/semantics/openAccess | |
| dc.title | Robustezza agli errori tipografici nei modelli di embedding: analisi della stabilità metrica | it_IT |
| dc.title.alternative | Typo Robustness of Embedding Models: A Metric Stability Analysis | en_UK |
| dc.type | info:eu-repo/semantics/masterThesis | |
| dc.subject.miur | INF/01 - INFORMATICA | |
| dc.subject.miur | MAT/06 - PROBABILITÀ E STATISTICA MATEMATICA | |
| dc.publisher.name | Università degli studi di Genova | |
| dc.date.academicyear | 2025/2026 | |
| dc.description.corsolaurea | 9011 - MATEMATICA | |
| dc.description.area | 7 - SCIENZE MAT.FIS.NAT. | |
| dc.description.department | 100021 - DIPARTIMENTO DI MATEMATICA | |