In the exploratory data science lifecycle, a significant portion of effort is devoted to data acquisition, integration, and cleaning. Despite advances in data validation techniques, data preparation remains a largely manual, iterative, and labor-intensive process, espe cially when dealing with large-scale datasets. Moreover, the performance of downstream Machine Learning (ML) models is fundamentally constrained by input data quality, rein forcing the well-known “garbage in, garbage out” paradigm. This thesis addresses this data-centric challenge by proposing an automated framework based on Multi-Agent Systems (MAS). The approach introduces an Orchestrator Agent that dynamically manages a data processing pipeline composed of four key phases: stan dardization, functional dependency analysis, outlier treatment, and missing value im putation. The system leverages a Reflexion-based pattern, in which specialized agents iteratively validate transformations and provide feedback, enabling adaptive correction while maintaining a comprehensive audit trail of operations. Experimental results demonstrate that the proposed agentic framework can outperform traditional manually defined pipelines in terms of data quality outcomes. Additionally, the system achieves improved efficiency in resource consumption and token usage by se lectively invoking tools or generating targeted code only when necessary. This work con tributes a scalable and autonomous solution for data preparation, significantly reducing the human effort required in the data analysis workflow.
Nel ciclo di vita dell’analisi dei dati, una parte significativa del lavoro è dedicata alla raccolta, integrazione e pulizia dei dataset. Nonostante i progressi nelle tecniche di val idazione dei dati, la preparazione dei dati rimane un processo in gran parte manuale, iterativo e dispendioso in termini di tempo, soprattutto nel contesto di dataset di grandi dimensioni. Inoltre, le prestazioni dei modelli di Machine Learning (ML) dipendono in modo critico dalla qualità dei dati in ingresso, rafforzando il noto principio del “garbage in, garbage out”. Questa tesi affronta tale problematica proponendo un framework automatizzato basato su Multi-Agent Systems (MAS). L’approccio introduce un Orchestrator Agent che gestisce dinamicamente una pipeline di elaborazione dei dati composta da quattro fasi principali: standardizzazione, analisi delle dipendenze tra colonne, trattamento degli outlier e im putazione dei valori mancanti. Il sistema sfrutta un pattern di tipo Reflexion, in cui agenti specializzati validano iterativamente le trasformazioni e forniscono feedback, con sentendo correzioni adattive e mantenendo al contempo una tracciabilità completa delle operazioni. I risultati sperimentali dimostrano che il framework proposto è in grado di superare la maggior parte delle pipeline tradizionali definite manualmente in termini di qualità dei dati ottenuti. Inoltre, il sistema migliora l’efficienza nell’utilizzo delle risorse e dei token, selezionando dinamicamente gli strumenti più appropriati o generando codice mirato solo quando necessario. Questo lavoro contribuisce con una soluzione scalabile e autonoma per la preparazione dei dati, riducendo significativamente il carico di lavoro umano nel processo di analisi dei dati.
Agent-based data cleaning: a Multi-Agent approach for automated data preparation
Riccardi, Francesco
2025/2026
Abstract
In the exploratory data science lifecycle, a significant portion of effort is devoted to data acquisition, integration, and cleaning. Despite advances in data validation techniques, data preparation remains a largely manual, iterative, and labor-intensive process, espe cially when dealing with large-scale datasets. Moreover, the performance of downstream Machine Learning (ML) models is fundamentally constrained by input data quality, rein forcing the well-known “garbage in, garbage out” paradigm. This thesis addresses this data-centric challenge by proposing an automated framework based on Multi-Agent Systems (MAS). The approach introduces an Orchestrator Agent that dynamically manages a data processing pipeline composed of four key phases: stan dardization, functional dependency analysis, outlier treatment, and missing value im putation. The system leverages a Reflexion-based pattern, in which specialized agents iteratively validate transformations and provide feedback, enabling adaptive correction while maintaining a comprehensive audit trail of operations. Experimental results demonstrate that the proposed agentic framework can outperform traditional manually defined pipelines in terms of data quality outcomes. Additionally, the system achieves improved efficiency in resource consumption and token usage by se lectively invoking tools or generating targeted code only when necessary. This work con tributes a scalable and autonomous solution for data preparation, significantly reducing the human effort required in the data analysis workflow.| File | Dimensione | Formato | |
|---|---|---|---|
|
2026_07_Riccardi_Thesis.pdf
accessibile in internet solo dagli utenti autorizzati
Descrizione: Testo della tesi
Dimensione
2.19 MB
Formato
Adobe PDF
|
2.19 MB | Adobe PDF | Visualizza/Apri |
|
2026_07_Riccardi_Executive_Summary.pdf
accessibile in internet solo dagli utenti autorizzati
Descrizione: Executive summary della tesi
Dimensione
500.84 kB
Formato
Adobe PDF
|
500.84 kB | Adobe PDF | Visualizza/Apri |
I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.
https://hdl.handle.net/10589/260515