In privacy-sensitive domains, Federated Learning (FL) has emerged as an alternative to classical centralized Machine Learning (ML) due to its privacy-oriented nature, which allows multiple nodes to collaboratively train a model without directly sharing data. In this context, tree-based models have gained strong appeal because of their interpretability and high performance on tabular datasets across different settings. In particular, their usage in both horizontal FL (HFL) and vertical FL (VFL) has grown in industry in recent years, due to the need to combine data from different partners while preserving their privacy. However, the security and privacy implications of such models have only recently been explored, and only for binary classification tasks in HFL. In this work, we propose TimberStorm, a dataset reconstruction attack targeting GBDT and XGBoost implementations for multiclass and regression tasks in HFL and for binary classification tasks in VFL, thereby filling a gap in the security analysis of federated tree-based gradient boosting systems. Our attack, carried out by an honest-but-curious client, exploits the discrete structure of decision trees by leveraging split values and decision paths, along with additional information available depending on the specific setting, to reconstruct the training dataset of other clients. We highlight that, regardless of task-specific implementation details, State-of-the-Art federated gradient boosting implementations for both horizontal and vertical settings across multiple frameworks (including Flower, NVFlare, and FedTree) are vulnerable to dataset reconstruction. Indeed, TimberStorm is able to reconstruct a significant portion of the target dataset in all scenarios, achieving a Reconstruction Accuracy (RA) above 70% for at least one dataset in each learning scenario considered. We further analyze Differential Privacy and Homomorphic Encryption-based solutions as potential defenses in horizontal and vertical FL, respectively. We show that, although these approaches generally degrade model performance or utility, none of them fully mitigates our attack. Finally, we discuss potential directions for designing more effective countermeasures specifically tailored to tree-based FL systems and provide preliminary insights into their development.

Nei domini sensibili alla privacy, il Federated Learning (FL) si è affermato come alternativa al Machine Learning (ML) centralizzato tradizionale grazie alla sua natura orientata alla tutela della privacy, che permette a più nodi di addestrare collaborativamente un modello senza dover condividere direttamente i propri dati. In questo contesto, i modelli basati su alberi decisionali hanno riscosso un crescente interesse per via della loro interpretabilità e delle elevate prestazioni su dataset tabulari in scenari eterogenei. Il loro impiego sia nel FL orizzontale (HFL) che in quello verticale (VFL) ha conosciuto una rapida diffusione in ambito industriale negli ultimi anni, spinto dalla necessità di integrare dati provenienti da partner diversi garantendone al contempo la riservatezza. Le implicazioni di sicurezza e privacy di tali modelli, tuttavia, sono state indagate solo di recente, e limitatamente a scenari di classificazione binaria in HFL. In questo lavoro presentiamo TimberStorm, un attacco di ricostruzione dataset che prende di mira le implementazioni GBDT e XGBoost per scenari di classificazione multiclasse e di regressione in HFL, nonché per compiti di classificazione binaria in VFL, colmando così una lacuna nell'analisi della sicurezza dei sistemi federati di gradient boosting basati su alberi decisionali. L'attacco, condotto da un client honest-but-curious, sfrutta la struttura discreta degli alberi decisionali insieme a ulteriori informazioni disponibili a seconda dello specifico contesto, al fine di ricostruire i dataset di training di altri client. I risultati mostrano che, indipendentemente dai dettagli implementativi legati al singolo scenario, le implementazioni allo stato dell'arte di gradient boosting federato — sia in scenari di FL orizzontale che verticale, su framework quali Flower, NVFlare e FedTree — risultano vulnerabili ad attacchi di ricostruzione dataset. TimberStorm è in grado di ricostruire una porzione significativa del dataset della vittima in tutti gli scenari considerati, raggiungendo una Reconstruction Accuracy (RA) superiore al 70% su almeno un dataset per ciascuno scenario analizzato. Vengono inoltre esaminate soluzioni basate su Differential Privacy e Homomorphic Encryption come possibili difese, rispettivamente per FL orizzontale e verticale. L'analisi dimostra che, oltre ad apportare un degrado delle prestazioni o dell'utilità del modello, nessuno di questi approcci è in grado di neutralizzare completamente l'attacco. Il lavoro si conclude con una discussione sulle possibili direzioni di ricerca per lo sviluppo di contromisure più efficaci, specificamente progettate per i sistemi FL basati su alberi decisionali, offrendo al contempo una prima esplorazione delle relative strategie di progettazione.

TimberStorm: dataset reconstruction attack revealing privacy leakage in horizontal and vertical federated tree-based systems across multiple learning tasks

ALGISI, GIORGIO
2025/2026

Abstract

In privacy-sensitive domains, Federated Learning (FL) has emerged as an alternative to classical centralized Machine Learning (ML) due to its privacy-oriented nature, which allows multiple nodes to collaboratively train a model without directly sharing data. In this context, tree-based models have gained strong appeal because of their interpretability and high performance on tabular datasets across different settings. In particular, their usage in both horizontal FL (HFL) and vertical FL (VFL) has grown in industry in recent years, due to the need to combine data from different partners while preserving their privacy. However, the security and privacy implications of such models have only recently been explored, and only for binary classification tasks in HFL. In this work, we propose TimberStorm, a dataset reconstruction attack targeting GBDT and XGBoost implementations for multiclass and regression tasks in HFL and for binary classification tasks in VFL, thereby filling a gap in the security analysis of federated tree-based gradient boosting systems. Our attack, carried out by an honest-but-curious client, exploits the discrete structure of decision trees by leveraging split values and decision paths, along with additional information available depending on the specific setting, to reconstruct the training dataset of other clients. We highlight that, regardless of task-specific implementation details, State-of-the-Art federated gradient boosting implementations for both horizontal and vertical settings across multiple frameworks (including Flower, NVFlare, and FedTree) are vulnerable to dataset reconstruction. Indeed, TimberStorm is able to reconstruct a significant portion of the target dataset in all scenarios, achieving a Reconstruction Accuracy (RA) above 70% for at least one dataset in each learning scenario considered. We further analyze Differential Privacy and Homomorphic Encryption-based solutions as potential defenses in horizontal and vertical FL, respectively. We show that, although these approaches generally degrade model performance or utility, none of them fully mitigates our attack. Finally, we discuss potential directions for designing more effective countermeasures specifically tailored to tree-based FL systems and provide preliminary insights into their development.
ING - Scuola di Ingegneria Industriale e dell'Informazione
26-mar-2026
2025/2026
Nei domini sensibili alla privacy, il Federated Learning (FL) si è affermato come alternativa al Machine Learning (ML) centralizzato tradizionale grazie alla sua natura orientata alla tutela della privacy, che permette a più nodi di addestrare collaborativamente un modello senza dover condividere direttamente i propri dati. In questo contesto, i modelli basati su alberi decisionali hanno riscosso un crescente interesse per via della loro interpretabilità e delle elevate prestazioni su dataset tabulari in scenari eterogenei. Il loro impiego sia nel FL orizzontale (HFL) che in quello verticale (VFL) ha conosciuto una rapida diffusione in ambito industriale negli ultimi anni, spinto dalla necessità di integrare dati provenienti da partner diversi garantendone al contempo la riservatezza. Le implicazioni di sicurezza e privacy di tali modelli, tuttavia, sono state indagate solo di recente, e limitatamente a scenari di classificazione binaria in HFL. In questo lavoro presentiamo TimberStorm, un attacco di ricostruzione dataset che prende di mira le implementazioni GBDT e XGBoost per scenari di classificazione multiclasse e di regressione in HFL, nonché per compiti di classificazione binaria in VFL, colmando così una lacuna nell'analisi della sicurezza dei sistemi federati di gradient boosting basati su alberi decisionali. L'attacco, condotto da un client honest-but-curious, sfrutta la struttura discreta degli alberi decisionali insieme a ulteriori informazioni disponibili a seconda dello specifico contesto, al fine di ricostruire i dataset di training di altri client. I risultati mostrano che, indipendentemente dai dettagli implementativi legati al singolo scenario, le implementazioni allo stato dell'arte di gradient boosting federato — sia in scenari di FL orizzontale che verticale, su framework quali Flower, NVFlare e FedTree — risultano vulnerabili ad attacchi di ricostruzione dataset. TimberStorm è in grado di ricostruire una porzione significativa del dataset della vittima in tutti gli scenari considerati, raggiungendo una Reconstruction Accuracy (RA) superiore al 70% su almeno un dataset per ciascuno scenario analizzato. Vengono inoltre esaminate soluzioni basate su Differential Privacy e Homomorphic Encryption come possibili difese, rispettivamente per FL orizzontale e verticale. L'analisi dimostra che, oltre ad apportare un degrado delle prestazioni o dell'utilità del modello, nessuno di questi approcci è in grado di neutralizzare completamente l'attacco. Il lavoro si conclude con una discussione sulle possibili direzioni di ricerca per lo sviluppo di contromisure più efficaci, specificamente progettate per i sistemi FL basati su alberi decisionali, offrendo al contempo una prima esplorazione delle relative strategie di progettazione.
File allegati
File Dimensione Formato  
2026_03_Algisi_Executive_Summary.pdf

accessibile in internet per tutti a partire dal 23/02/2029

Descrizione: Testo dell'executive summary
Dimensione 382.38 kB
Formato Adobe PDF
382.38 kB Adobe PDF   Visualizza/Apri
2026_03_Algisi_Tesi.pdf

accessibile in internet per tutti a partire dal 23/02/2029

Descrizione: Testo della tesi
Dimensione 1.42 MB
Formato Adobe PDF
1.42 MB Adobe PDF   Visualizza/Apri

I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10589/252839