Integrating data from multiple sources in decentralized ecosystems requires advanced Truth Discovery (TD) methodologies to resolve information conflicts and estimate source reliability when ground truth is unavailable. This thesis proposes a novel, generic five-phase architectural framework for TD, designed to overcome the vulnerabilities of purely statistical approaches. The pipeline integrates Large Language Models (LLMs) for initial semantic disambiguation, ensuring rigor- ous ontological alignment prior to data fusion. The mathematical core of the system introduces a Domain-Aware paradigm for the probabilistic CATD algorithm, enabling the direct injection of physical and logical con- straints into the optimization cycle. This architecture dynamically penalizes claims that violate fundamental domain invariants and implements a Bayesian feedback loop to au- tonomously calibrate the reliability of sources. To demonstrate the framework’s effectiveness, the thesis presents an empirical validation within nutritional biochemistry, benchmarking the Domain-Aware CATD model against the standard CRH algorithm. The results prove that enforcing domain constraints signifi- cantly reduces the Mean Absolute Error (MAE) compared to the statistical baseline, effectively isolating systematic noise and ensuring robust, context-aware data inference that is highly adaptable to complex data engineering scenarios.

L’integrazione di dati provenienti da molteplici fonti in ecosistemi decentralizzati richiede metodologie avanzate di Truth Discovery (TD) per risolvere i conflitti informativi e stimare l’affidabilità delle fonti quando non è disponibile una ground truth. Questa tesi propone un innovativo framework architetturale generico in cinque fasi per la TD, progettato per superare le vulnerabilità degli approcci puramente statistici. La pipeline integra Large Language Models (LLMs) per la disambiguazione semantica iniziale, garantendo un rigoroso allineamento ontologico prima della fusione dei dati. Il cuore matematico del sistema introduce un paradigma Domain-Aware per l’algoritmo probabilistico CATD, permettendo l’iniezione diretta di vincoli fisici e logici nel ciclo di ottimizzazione. Questa architettura penalizza dinamicamente le affermazioni che violano le leggi intrinseche del dominio e implementa un ciclo di feedback bayesiano per calibrare autonomamente l’affidabilità delle fonti. Per dimostrare l’efficacia del framework, la tesi presenta una validazione empirica nella biochimica nutrizionale, confrontando il modello CATD Domain-Aware con l’algoritmo CRH nella sua versione standard. I risultati provano che l’applicazione dei vincoli di do- minio riduce significativamente l’errore assoluto medio (MAE) rispetto alla baseline statistica, isolando efficacemente il rumore sistematico e garantendo un’inferenza dei dati robusta, contestualizzata e adattabile a scenari complessi di data engineering.

A novel framework for Truth Discovery

MINUTILLO, ALESSANDRO
2025/2026

Abstract

Integrating data from multiple sources in decentralized ecosystems requires advanced Truth Discovery (TD) methodologies to resolve information conflicts and estimate source reliability when ground truth is unavailable. This thesis proposes a novel, generic five-phase architectural framework for TD, designed to overcome the vulnerabilities of purely statistical approaches. The pipeline integrates Large Language Models (LLMs) for initial semantic disambiguation, ensuring rigor- ous ontological alignment prior to data fusion. The mathematical core of the system introduces a Domain-Aware paradigm for the probabilistic CATD algorithm, enabling the direct injection of physical and logical con- straints into the optimization cycle. This architecture dynamically penalizes claims that violate fundamental domain invariants and implements a Bayesian feedback loop to au- tonomously calibrate the reliability of sources. To demonstrate the framework’s effectiveness, the thesis presents an empirical validation within nutritional biochemistry, benchmarking the Domain-Aware CATD model against the standard CRH algorithm. The results prove that enforcing domain constraints signifi- cantly reduces the Mean Absolute Error (MAE) compared to the statistical baseline, effectively isolating systematic noise and ensuring robust, context-aware data inference that is highly adaptable to complex data engineering scenarios.
ING - Scuola di Ingegneria Industriale e dell'Informazione
22-lug-2026
2025/2026
L’integrazione di dati provenienti da molteplici fonti in ecosistemi decentralizzati richiede metodologie avanzate di Truth Discovery (TD) per risolvere i conflitti informativi e stimare l’affidabilità delle fonti quando non è disponibile una ground truth. Questa tesi propone un innovativo framework architetturale generico in cinque fasi per la TD, progettato per superare le vulnerabilità degli approcci puramente statistici. La pipeline integra Large Language Models (LLMs) per la disambiguazione semantica iniziale, garantendo un rigoroso allineamento ontologico prima della fusione dei dati. Il cuore matematico del sistema introduce un paradigma Domain-Aware per l’algoritmo probabilistico CATD, permettendo l’iniezione diretta di vincoli fisici e logici nel ciclo di ottimizzazione. Questa architettura penalizza dinamicamente le affermazioni che violano le leggi intrinseche del dominio e implementa un ciclo di feedback bayesiano per calibrare autonomamente l’affidabilità delle fonti. Per dimostrare l’efficacia del framework, la tesi presenta una validazione empirica nella biochimica nutrizionale, confrontando il modello CATD Domain-Aware con l’algoritmo CRH nella sua versione standard. I risultati provano che l’applicazione dei vincoli di do- minio riduce significativamente l’errore assoluto medio (MAE) rispetto alla baseline statistica, isolando efficacemente il rumore sistematico e garantendo un’inferenza dei dati robusta, contestualizzata e adattabile a scenari complessi di data engineering.
File allegati
File Dimensione Formato  
2026_07_Minutillo_Tesi.pdf

non accessibile

Descrizione: testo tesi
Dimensione 2.14 MB
Formato Adobe PDF
2.14 MB Adobe PDF   Visualizza/Apri
2026_07_Minutillo_Executive Summary.pdf

non accessibile

Descrizione: testo executive summary
Dimensione 681.63 kB
Formato Adobe PDF
681.63 kB Adobe PDF   Visualizza/Apri

I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10589/260746