Mostra i principali dati dell'item
Analisi e sviluppo di soluzioni per PDF e riconoscimento dei contenuti mediante OCR e LLM
| dc.contributor.advisor | Oneto, Luca <1986> | |
| dc.contributor.author | Signoretti, Walter <2002> | |
| dc.contributor.other | Stefano Demarchi | |
| dc.date.accessioned | 2026-07-23T14:29:56Z | |
| dc.date.available | 2026-07-23T14:29:56Z | |
| dc.date.issued | 2026-07-16 | |
| dc.identifier.uri | https://unire.unige.it/handle/123456789/16410 | |
| dc.description.abstract | Il presente lavoro di tesi documenta l’analisi e lo sviluppo di un ecosistema avanzato per l’automazione del ciclo passivo e la gestione documentale nel settore logistico, integrando tecnologie di Intelligenza Artificiale Generativa (GenAI) all’interno di un sistema ERP consolidato. Il cuore dell’attivit`a di ricerca e sviluppo si `e concentrato sulla progettazione di un workflow di dematerializzazione per le fatture passive, volto a eliminare i colli di bottiglia derivanti dal data-entry manuale. Un contributo centrale `e rappresentato dall’implementazione di un sistema di caricamento massivo di documenti PDF, che permette l’ingestione asincrona di decine di file simultaneamente. Attraverso l’uso di Apache Kafka e una strategia di elaborazione ”Dual-Path”, il sistema estrae metadati complessi in formato JSON tramite il Cognitive Hub, garantendo una reattivit`a dell’interfaccia utente basata su Knockout.js. Una scelta architettonica fondamentale `e stata l’ottimizzazione del workflow per dare priorit`a alla velocit`a di caricamento, permettendo al sistema di popolare automaticamente le testate delle fatture e rinviando la riconciliazione semantica delle singole righe a una fase successiva di validazione da parte dell’utente. Parallelamente, la tesi affronta il problema della frammentazione dei dati tramite il modulo di Supplier Onboarding. Quest’ultimo risolve le discrepanze tra archivi legacy e cloud-native mediante un risolutore deterministico basato sulla logica pa_id e l’uso di database vettoriali Qdrant per la validazione semantica dei fornitori. I risultati evidenziano un’accuratezza del 94.2% nell’estrazione dei dati e una riduzione dell’85% del carico di lavoro manuale, dimostrando l’efficacia dell’approccio Human-in-the-Loop applicato alla logistica moderna. | it_IT |
| dc.description.abstract | This thesis details the design and implementation of an AI-driven ecosystem for automating the passive accounting cycle and document management within the logistics sector, integrated directly into the Seven ERP platform. The core of the work focuses on the development of a document dematerialization workflow specifically for passive invoices. A primary contribution is the implementation of a bulk PDF upload system, enabling asynchronous ingestion of multiple documents simultaneously through an Apache Kafka-backed architecture. By utilizing Google Gemini for multi-modal extraction, the system automatically populates invoice headers from structured JSON payloads, maintaining high frontend reactivity through Knockout.js. A strategic decision was made to prioritize ingestion speed by streamlining the workflow, allowing for automatic header population while deferring complex line-item reconciliation to a dedicated human-in-the-loop validation stage. In addition to invoice management, this research introduces a Supplier Onboarding module designed to bridge data fragmentation between legacy and cloud-native storage systems. By implementing a deterministic pa id resolver and utilizing Qdrant vector databases for semantic entity resolution, the system ensures 100% consistency in document association. Experimental results show a 94.2% accuracy rate in metadata extraction and an 85% reduction in manual data entry, proving that the integration of LLMs into established ERP ecosystems significantly redefines operational efficiency. | en_UK |
| dc.language.iso | en | |
| dc.language.iso | it | |
| dc.rights | info:eu-repo/semantics/openAccess | |
| dc.title | Analisi e sviluppo di soluzioni per PDF e riconoscimento dei contenuti mediante OCR e LLM | it_IT |
| dc.title.alternative | Analysis and Development of Solutions for PDF Content Recognition using OCR and LLMs | en_UK |
| dc.type | info:eu-repo/semantics/masterThesis | |
| dc.subject.miur | ING-INF/05 - SISTEMI DI ELABORAZIONE DELLE INFORMAZIONI | |
| dc.publisher.name | Università degli studi di Genova | |
| dc.date.academicyear | 2025/2026 | |
| dc.description.corsolaurea | 11160 - COMPUTER ENGINEERING | |
| dc.description.area | 9 - INGEGNERIA | |
| dc.description.department | 100023 - DIPARTIMENTO DI INFORMATICA, BIOINGEGNERIA, ROBOTICA E INGEGNERIA DEI SISTEMI |
Files in questo item
Questo item appare nelle seguenti collezioni
-
Laurea Magistrale [8032]


