Analisi e sviluppo di soluzioni per PDF e riconoscimento dei contenuti mediante OCR e LLM

Mostra/ Apri
Autore
Signoretti, Walter <2002>
Data
2026-07-16Disponibile dal
2026-07-23Abstract
Il presente lavoro di tesi documenta l’analisi e lo sviluppo di un ecosistema
avanzato per l’automazione del ciclo passivo e la gestione documentale nel settore
logistico, integrando tecnologie di Intelligenza Artificiale Generativa (GenAI)
all’interno di un sistema ERP consolidato.
Il cuore dell’attivit`a di ricerca e sviluppo si `e concentrato sulla progettazione
di un workflow di dematerializzazione per le fatture passive, volto
a eliminare i colli di bottiglia derivanti dal data-entry manuale. Un contributo
centrale `e rappresentato dall’implementazione di un sistema di caricamento
massivo di documenti PDF, che permette l’ingestione asincrona di decine di file
simultaneamente. Attraverso l’uso di Apache Kafka e una strategia di elaborazione
”Dual-Path”, il sistema estrae metadati complessi in formato JSON tramite il
Cognitive Hub, garantendo una reattivit`a dell’interfaccia utente
basata su Knockout.js.
Una scelta architettonica fondamentale `e stata l’ottimizzazione del workflow
per dare priorit`a alla velocit`a di caricamento, permettendo al sistema di popolare
automaticamente le testate delle fatture e rinviando la riconciliazione semantica
delle singole righe a una fase successiva di validazione da parte dell’utente.
Parallelamente, la tesi affronta il problema della frammentazione dei dati tramite
il modulo di Supplier Onboarding. Quest’ultimo risolve le discrepanze
tra archivi legacy e cloud-native mediante
un risolutore deterministico basato sulla logica pa_id e l’uso di database vettoriali
Qdrant per la validazione semantica dei fornitori. I risultati evidenziano
un’accuratezza del 94.2% nell’estrazione dei dati e una riduzione dell’85% del carico
di lavoro manuale, dimostrando l’efficacia dell’approccio Human-in-the-Loop
applicato alla logistica moderna. This thesis details the design and implementation of an AI-driven ecosystem
for automating the passive accounting cycle and document management within
the logistics sector, integrated directly into the Seven ERP platform.
The core of the work focuses on the development of a document dematerialization
workflow specifically for passive invoices. A primary contribution
is the implementation of a bulk PDF upload system, enabling asynchronous
ingestion of multiple documents simultaneously through an Apache Kafka-backed
architecture. By utilizing Google Gemini for multi-modal extraction, the system
automatically populates invoice headers from structured JSON payloads, maintaining
high frontend reactivity through Knockout.js.
A strategic decision was made to prioritize ingestion speed by streamlining
the workflow, allowing for automatic header population while deferring complex
line-item reconciliation to a dedicated human-in-the-loop validation stage.
In addition to invoice management, this research introduces a Supplier Onboarding
module designed to bridge data fragmentation between legacy and
cloud-native storage systems. By implementing a deterministic pa id resolver
and utilizing Qdrant vector databases for semantic entity resolution, the system
ensures 100% consistency in document association. Experimental results show
a 94.2% accuracy rate in metadata extraction and an 85% reduction in manual
data entry, proving that the integration of LLMs into established ERP ecosystems
significantly redefines operational efficiency.
Tipo
info:eu-repo/semantics/masterThesisCollezioni
- Laurea Magistrale [8032]

