Mostra i principali dati dell'item

dc.contributor.advisorFerrari, Nicola <1973>
dc.contributor.advisorOneto, Luca <1986>
dc.contributor.authorRahneshin, Ali <1997>
dc.contributor.otherTraviglia Arianna
dc.contributor.otherSara Ferro
dc.date.accessioned2026-07-23T14:32:10Z
dc.date.available2027-07-23
dc.date.issued2026-07-16
dc.identifier.urihttps://unire.unige.it/handle/123456789/16488
dc.description.abstractI recenti progressi nel riconoscimento del testo manoscritto (HTR) derivano soprattutto da reti sempre più grandi, pre-addestrate su milioni di campioni di scrittura moderna o sintetica. Questa tesi ha riportato l'attenzione sui dati di interesse: l'obiettivo era adattare la rete ai documenti in esame, dimensionando un encoder convoluzionale (CNN) compatto così che il campo recettivo corrispondesse alla granularità linguistica del testo, con estensioni di monogramma, bigramma o trigramma derivate dalle larghezze dei caratteri, con parametri minimi per piccoli corpora annotati. Una ricerca sistematica di architetture è stata svolta su tre dataset storici: Saint Gall (latino, IX sec.), Washington (inglese, XVIII sec.) e LAM (lettere italiane, XVII–XVIII sec.). L'esplicabilità è stata usata come strumento, non come illustrazione. Le analisi del campo recettivo e della salienza hanno confermato le estensioni previste e rivelato un difetto correggibile: definite sulle immagini originali anziché alla risoluzione ridotta della rete, la finestra nominale di un carattere su Saint Gall copriva di fatto due caratteri. Le metriche di rilevanza dell'inchiostro (Grad-CAM) hanno mostrato che gli encoder si concentravano sui tratti manoscritti in tutti i dataset, mentre un encoder di riferimento progettato a mano falliva su Washington e LAM. I campi recettivi a scala di bigramma hanno sempre vinto il compromesso efficienza–accuratezza; con un decoder ricorrente gated, i modelli sono rimasti di uno–due ordini di grandezza più piccoli dello stato dell'arte avvicinandone l'accuratezza: su LAM, un encoder da 0,18M parametri ha raggiunto un CER del 3,77% (greedy), a 1,0 punti da HTR-VT con 300× meno parametri; su Washington e Saint Gall gli encoder hanno superato il riferimento CNN-BGRU gated (5,99% vs 8,41% e 4,60% vs 5,49%). Ne risulta una procedura trasparente e basata sui dati per progettare encoder HTR compatti, verificata con l'esplicabilità e non accettata sulla sola accuratezza.it_IT
dc.description.abstractRecent advances in Handwritten Text Recognition (HTR) have come mainly from ever larger networks pre-trained on millions of modern or synthetic handwriting samples. This thesis returned the focus to the target data: the objective was to adapt the network to the documents of interest by sizing a compact Convolutional Neural Network (CNN) encoder so its receptive field matched the linguistic granularity of the text, using monogram, bigram, or trigram spans derived from measured character widths, while keeping parameters minimal for small expert-annotated corpora. A systematic architecture search was run on three historical datasets: Saint Gall (9th-century Latin), Washington (18th-century English), and LAM (Italian letters, 17th–18th century). Explainability was used as an instrument rather than an illustration. Receptive-field and saliency analyses confirmed the encoders realised the designed spans and exposed a correctable flaw: span targets were defined on the original images rather than at the network's reduced input resolution, so the nominal single-character window on Saint Gall effectively covered two characters. Grad-CAM ink-relevance metrics showed the searched encoders reliably focused on the handwritten strokes in all three datasets, whereas a handcrafted state-of-the-art encoder failed to do so on Washington and LAM. Bigram-scale receptive fields consistently won the efficiency–accuracy trade-off; with a gated recurrent decoder, the models remained one to two orders of magnitude smaller than state-of-the-art systems while approaching their accuracy: on LAM, a 0.18M-parameter encoder reached 3.77% CER with greedy decoding, within 1.0 point of HTR-VT at 300× fewer encoder parameters; on Washington and Saint Gall the encoders surpassed a gated CNN-BGRU reference (5.99% vs. 8.41% and 4.60% vs. 5.49% CER). The result is a transparent, data-aware procedure for designing compact HTR encoders, verified with explainability rather than accepted on accuracy alone.en_UK
dc.language.isoen
dc.rightsinfo:eu-repo/semantics/embargoedAccess
dc.titleExplainability-Driven Optimization of Historical Handwriting Recognition Modelsit_IT
dc.title.alternativeExplainability-Driven Optimization of Historical Handwriting Recognition Modelsen_UK
dc.typeinfo:eu-repo/semantics/masterThesis
dc.subject.miurL-FIL-LET/14 - CRITICA LETTERARIA E LETTERATURE COMPARATE
dc.publisher.nameUniversità degli studi di Genova
dc.date.academicyear2025/2026
dc.description.corsolaurea11661 - DIGITAL HUMANITIES - INTERACTIVE SYSTEMS AND DIGITAL MEDIA
dc.description.area9 - INGEGNERIA
dc.description.department100023 - DIPARTIMENTO DI INFORMATICA, BIOINGEGNERIA, ROBOTICA E INGEGNERIA DEI SISTEMI


Files in questo item

Questo item appare nelle seguenti collezioni

Mostra i principali dati dell'item