Integrating data from multiple sources in decentralized ecosystems requires advanced Truth Discovery (TD) methodologies to resolve information conflicts and estimate source reliability when ground truth is unavailable. This thesis proposes a novel, generic five-phase architectural framework for TD, designed to overcome the vulnerabilities of purely statistical approaches. The pipeline integrates Large Language Models (LLMs) for initial semantic disambiguation, ensuring rigor- ous ontological alignment prior to data fusion. The mathematical core of the system introduces a Domain-Aware paradigm for the probabilistic CATD algorithm, enabling the direct injection of physical and logical con- straints into the optimization cycle. This architecture dynamically penalizes claims that violate fundamental domain invariants and implements a Bayesian feedback loop to au- tonomously calibrate the reliability of sources. To demonstrate the framework’s effectiveness, the thesis presents an empirical validation within nutritional biochemistry, benchmarking the Domain-Aware CATD model against the standard CRH algorithm. The results prove that enforcing domain constraints signifi- cantly reduces the Mean Absolute Error (MAE) compared to the statistical baseline, effectively isolating systematic noise and ensuring robust, context-aware data inference that is highly adaptable to complex data engineering scenarios.
L’integrazione di dati provenienti da molteplici fonti in ecosistemi decentralizzati richiede metodologie avanzate di Truth Discovery (TD) per risolvere i conflitti informativi e stimare l’affidabilità delle fonti quando non è disponibile una ground truth. Questa tesi propone un innovativo framework architetturale generico in cinque fasi per la TD, progettato per superare le vulnerabilità degli approcci puramente statistici. La pipeline integra Large Language Models (LLMs) per la disambiguazione semantica iniziale, garantendo un rigoroso allineamento ontologico prima della fusione dei dati. Il cuore matematico del sistema introduce un paradigma Domain-Aware per l’algoritmo probabilistico CATD, permettendo l’iniezione diretta di vincoli fisici e logici nel ciclo di ottimizzazione. Questa architettura penalizza dinamicamente le affermazioni che violano le leggi intrinseche del dominio e implementa un ciclo di feedback bayesiano per calibrare autonomamente l’affidabilità delle fonti. Per dimostrare l’efficacia del framework, la tesi presenta una validazione empirica nella biochimica nutrizionale, confrontando il modello CATD Domain-Aware con l’algoritmo CRH nella sua versione standard. I risultati provano che l’applicazione dei vincoli di do- minio riduce significativamente l’errore assoluto medio (MAE) rispetto alla baseline statistica, isolando efficacemente il rumore sistematico e garantendo un’inferenza dei dati robusta, contestualizzata e adattabile a scenari complessi di data engineering.
A novel framework for Truth Discovery
MINUTILLO, ALESSANDRO
2025/2026
Abstract
Integrating data from multiple sources in decentralized ecosystems requires advanced Truth Discovery (TD) methodologies to resolve information conflicts and estimate source reliability when ground truth is unavailable. This thesis proposes a novel, generic five-phase architectural framework for TD, designed to overcome the vulnerabilities of purely statistical approaches. The pipeline integrates Large Language Models (LLMs) for initial semantic disambiguation, ensuring rigor- ous ontological alignment prior to data fusion. The mathematical core of the system introduces a Domain-Aware paradigm for the probabilistic CATD algorithm, enabling the direct injection of physical and logical con- straints into the optimization cycle. This architecture dynamically penalizes claims that violate fundamental domain invariants and implements a Bayesian feedback loop to au- tonomously calibrate the reliability of sources. To demonstrate the framework’s effectiveness, the thesis presents an empirical validation within nutritional biochemistry, benchmarking the Domain-Aware CATD model against the standard CRH algorithm. The results prove that enforcing domain constraints signifi- cantly reduces the Mean Absolute Error (MAE) compared to the statistical baseline, effectively isolating systematic noise and ensuring robust, context-aware data inference that is highly adaptable to complex data engineering scenarios.| File | Dimensione | Formato | |
|---|---|---|---|
|
2026_07_Minutillo_Tesi.pdf
non accessibile
Descrizione: testo tesi
Dimensione
2.14 MB
Formato
Adobe PDF
|
2.14 MB | Adobe PDF | Visualizza/Apri |
|
2026_07_Minutillo_Executive Summary.pdf
non accessibile
Descrizione: testo executive summary
Dimensione
681.63 kB
Formato
Adobe PDF
|
681.63 kB | Adobe PDF | Visualizza/Apri |
I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.
https://hdl.handle.net/10589/260746