The rapid democratization of Large Language Models (LLMs) has amplified a dual-use dilemma: the same capabilities that let these models advance legitimate science also let them generate unsafe content in domains such as biosecurity, chemistry, and cybersecurity. At the same time, the demand for privacy-preserving training has driven the adoption of Federated Learning (FL), in which a central server aggregates client updates but never sees the raw local data. This privacy guarantee disables the dominant safety paradigm: server-side inspection and filtering of training data becomes impossible, so a client fine-tuning on hazardous data can silently poison the global model. Our key observation is that, although the server cannot select data, it can still act on a standardized, trusted data risk signal computed locally and shared without ever exposing raw samples. The goal of this work is therefore to relocate safety enforcement from the data space into the aggregation space, using this risk signal to properly weight the incoming updates. Building on a LoRA-based Parameter-Efficient Fine-Tuning (PEFT) approach, we evaluate a series of aggregation strategies, including a novel technique, Risk-Aware Projection for Federated Learning (RAP-FL). Across extreme and realistic data-heterogeneity scenarios, we quantify the trade-off between suppressing hazardous knowledge (WMDP) and preserving general-domain utility (MMLU), and show that RAP-FL achieves the strongest safety-utility balance.

La rapida democratizzazione dei Large Language Models (LLM) ha amplificato un dilemma dual-use: le stesse capacità che permettono a questi modelli di favorire la ricerca scientifica legittima permettono loro anche di generare contenuti non sicuri in ambiti come la biosicurezza, la chimica e la cybersecurity. Allo stesso tempo, la richiesta di un addestramento che preservi la privacy ha spinto l'adozione del Federated Learning (FL), in cui un server centrale aggrega gli aggiornamenti dei client senza mai osservare i dati locali grezzi. Questa garanzia di privacy disabilita il paradigma di sicurezza dominante: l'ispezione e il filtraggio dei dati di addestramento lato server diventano impossibili, per cui un client che esegue il fine-tuning su dati pericolosi può avvelenare silenziosamente il modello globale. La nostra osservazione chiave è che, sebbene il server non possa selezionare i dati, può comunque agire sulla base di un segnale di rischio standardizzato e affidabile, calcolato localmente e condiviso senza mai esporre i campioni grezzi. L'obiettivo di questo lavoro è quindi spostare l'applicazione della sicurezza dallo spazio dei dati allo spazio dell'aggregazione, utilizzando questo segnale di rischio per pesare opportunamente gli aggiornamenti in arrivo. Sfruttando un approccio di Parameter-Efficient Fine-Tuning (PEFT) basato su LoRA, valutiamo uno spettro di strategie di aggregazione, tra cui una nuova tecnica: Risk-Aware Projection for Federated Learning (RAP-FL). In scenari di eterogeneità dei dati sia estremi che realistici, quantifichiamo il trade-off tra la soppressione della conoscenza pericolosa (WMDP) e la preservazione dell'utilità generale (MMLU), mostrando che RAP-FL raggiunge il miglior equilibrio di sicurezza-utilità.

Safety-aware aggregation for federated fine-tuning of Large Language Models

LEI, LEONARDO
2025/2026

Abstract

The rapid democratization of Large Language Models (LLMs) has amplified a dual-use dilemma: the same capabilities that let these models advance legitimate science also let them generate unsafe content in domains such as biosecurity, chemistry, and cybersecurity. At the same time, the demand for privacy-preserving training has driven the adoption of Federated Learning (FL), in which a central server aggregates client updates but never sees the raw local data. This privacy guarantee disables the dominant safety paradigm: server-side inspection and filtering of training data becomes impossible, so a client fine-tuning on hazardous data can silently poison the global model. Our key observation is that, although the server cannot select data, it can still act on a standardized, trusted data risk signal computed locally and shared without ever exposing raw samples. The goal of this work is therefore to relocate safety enforcement from the data space into the aggregation space, using this risk signal to properly weight the incoming updates. Building on a LoRA-based Parameter-Efficient Fine-Tuning (PEFT) approach, we evaluate a series of aggregation strategies, including a novel technique, Risk-Aware Projection for Federated Learning (RAP-FL). Across extreme and realistic data-heterogeneity scenarios, we quantify the trade-off between suppressing hazardous knowledge (WMDP) and preserving general-domain utility (MMLU), and show that RAP-FL achieves the strongest safety-utility balance.
ING - Scuola di Ingegneria Industriale e dell'Informazione
22-lug-2026
2025/2026
La rapida democratizzazione dei Large Language Models (LLM) ha amplificato un dilemma dual-use: le stesse capacità che permettono a questi modelli di favorire la ricerca scientifica legittima permettono loro anche di generare contenuti non sicuri in ambiti come la biosicurezza, la chimica e la cybersecurity. Allo stesso tempo, la richiesta di un addestramento che preservi la privacy ha spinto l'adozione del Federated Learning (FL), in cui un server centrale aggrega gli aggiornamenti dei client senza mai osservare i dati locali grezzi. Questa garanzia di privacy disabilita il paradigma di sicurezza dominante: l'ispezione e il filtraggio dei dati di addestramento lato server diventano impossibili, per cui un client che esegue il fine-tuning su dati pericolosi può avvelenare silenziosamente il modello globale. La nostra osservazione chiave è che, sebbene il server non possa selezionare i dati, può comunque agire sulla base di un segnale di rischio standardizzato e affidabile, calcolato localmente e condiviso senza mai esporre i campioni grezzi. L'obiettivo di questo lavoro è quindi spostare l'applicazione della sicurezza dallo spazio dei dati allo spazio dell'aggregazione, utilizzando questo segnale di rischio per pesare opportunamente gli aggiornamenti in arrivo. Sfruttando un approccio di Parameter-Efficient Fine-Tuning (PEFT) basato su LoRA, valutiamo uno spettro di strategie di aggregazione, tra cui una nuova tecnica: Risk-Aware Projection for Federated Learning (RAP-FL). In scenari di eterogeneità dei dati sia estremi che realistici, quantifichiamo il trade-off tra la soppressione della conoscenza pericolosa (WMDP) e la preservazione dell'utilità generale (MMLU), mostrando che RAP-FL raggiunge il miglior equilibrio di sicurezza-utilità.
File allegati
File Dimensione Formato  
2026_07_Lei_Executive_Summary.pdf

accessibile in internet per tutti

Descrizione: Executive Summary
Dimensione 1.46 MB
Formato Adobe PDF
1.46 MB Adobe PDF Visualizza/Apri
2026_07_Lei_Tesi.pdf

accessibile in internet per tutti

Descrizione: Tesi
Dimensione 10.27 MB
Formato Adobe PDF
10.27 MB Adobe PDF Visualizza/Apri

I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10589/261375