With the rise in popularity of 5G and 6G technologies, machine learning is being applied to microwave networks for a number of different use-cases. Due to the evolving nature of network data used for different classification and regression tasks, model adaptations are becoming a required characteristic of these models. While online and stream learning models typically rely on a continuous stream of incoming data to update the model, they are not designed for applications where data labels require costly labelling procedures. In the case of link failure cause identification, domain experts have to manually label failure causes according to the network data. We propose a Batch Incremental Gradient Boosting framework that utilizes unsupervised drift detectors and continual learning (CL) techniques to monitor data concepts and trigger the labelling process only when a drift is detected and the model needs to be updated. BIGBoost combines the Student-Teacher method for Unsupervised Drift Detection (STUDD) with Streaming Gradient Boosted Trees (SGBT) to achieve its CL goals without the need for data storage and replay. Explainable AI tools are also integrated into the framework to explain the adaptive model instances using interpretable surrogate trees, SHAP-explainable surrogate XGBoost models, and model-agnostic methods like LIME and Permutation Feature Importance. The framework is tested on real-world network Received Signal Strength (RSS) data for failure cause identification and its performance is compared to baseline static models and CL with data replay. The findings show that for a six-class classification problem, BIGBoost performs at least as well as data replay and achieves up to 26% higher Macro F1 score than a static model trained on all available data before deployment.

Con la crescente popolarità delle tecnologie 5G e 6G, si è diffusa la pratica di applicare Machine Learning (ML) alle reti a microonde per una serie di diversi casi d’uso. La capacità dei modelli di adattarsi sta diventando una caratteristica necessaria a causa della continua evoluzione dei dati di rete utilizzati per vari compiti di classificazione e regressione. Tuttavia, i modelli di apprendimento online e di tipo "stream", che si basano tipicamente su un flusso continuo di dati in entrata per aggiornare il modello, non sono progettati per applicazioni in cui l’etichettatura dei dati richiedono procedure di classificazione costose. Nel caso dell’identificazione delle cause di guasto dei collegamenti, gli esperti del settore devono etichettare manualmente le cause in base ai dati di rete. Proponiamo un framework di "Batch Incremental Gradient Boosting" che utilizza rilevatori di deriva ("drift") non supervisionati e tecniche di Continual Learning (CL) per monitorare i dati e attivare il processo di etichettatura solo quando viene rilevato un drift. BIGBoost combina il metodo "Student-Teacher" per il rilevamento non supervisionato del drift (STUDD) con gli alberi decisionali "Streaming Gradient Boosted Trees" (SGBT) per raggiungere i suoi obiettivi di CL senza la necessità di memorizzazione e riproduzione dei dati. Nel framework sono integrati anche strumenti di "Explainable AI" per illustrare le istanze del modello adattivo utilizzando modelli surrogati interpretabili e metodi "model-agnostic". Il framework è testato su dati di rete RSS (Received Signal Strength) per l’identificazione delle cause di guasto; le sue prestazioni sono confrontate con modelli statici di riferimento e con tecniche di CL basate sul "data replay". I risultati mostrano che, per un problema di classificazione a sei classi, BIGBoost ottiene prestazioni almeno pari al "data replay" e raggiunge un punteggio Macro F1 fino al 26% superiore rispetto a un modello statico addestrato su tutti i dati disponibili prima dell’implementazione.

Online drift detection and continual learning for failure cause identification in microwave networks

LABIB, AHMAD ASHRAF TAREEF
2024/2025

Abstract

With the rise in popularity of 5G and 6G technologies, machine learning is being applied to microwave networks for a number of different use-cases. Due to the evolving nature of network data used for different classification and regression tasks, model adaptations are becoming a required characteristic of these models. While online and stream learning models typically rely on a continuous stream of incoming data to update the model, they are not designed for applications where data labels require costly labelling procedures. In the case of link failure cause identification, domain experts have to manually label failure causes according to the network data. We propose a Batch Incremental Gradient Boosting framework that utilizes unsupervised drift detectors and continual learning (CL) techniques to monitor data concepts and trigger the labelling process only when a drift is detected and the model needs to be updated. BIGBoost combines the Student-Teacher method for Unsupervised Drift Detection (STUDD) with Streaming Gradient Boosted Trees (SGBT) to achieve its CL goals without the need for data storage and replay. Explainable AI tools are also integrated into the framework to explain the adaptive model instances using interpretable surrogate trees, SHAP-explainable surrogate XGBoost models, and model-agnostic methods like LIME and Permutation Feature Importance. The framework is tested on real-world network Received Signal Strength (RSS) data for failure cause identification and its performance is compared to baseline static models and CL with data replay. The findings show that for a six-class classification problem, BIGBoost performs at least as well as data replay and achieves up to 26% higher Macro F1 score than a static model trained on all available data before deployment.
ING - Scuola di Ingegneria Industriale e dell'Informazione
26-mar-2026
2024/2025
Con la crescente popolarità delle tecnologie 5G e 6G, si è diffusa la pratica di applicare Machine Learning (ML) alle reti a microonde per una serie di diversi casi d’uso. La capacità dei modelli di adattarsi sta diventando una caratteristica necessaria a causa della continua evoluzione dei dati di rete utilizzati per vari compiti di classificazione e regressione. Tuttavia, i modelli di apprendimento online e di tipo "stream", che si basano tipicamente su un flusso continuo di dati in entrata per aggiornare il modello, non sono progettati per applicazioni in cui l’etichettatura dei dati richiedono procedure di classificazione costose. Nel caso dell’identificazione delle cause di guasto dei collegamenti, gli esperti del settore devono etichettare manualmente le cause in base ai dati di rete. Proponiamo un framework di "Batch Incremental Gradient Boosting" che utilizza rilevatori di deriva ("drift") non supervisionati e tecniche di Continual Learning (CL) per monitorare i dati e attivare il processo di etichettatura solo quando viene rilevato un drift. BIGBoost combina il metodo "Student-Teacher" per il rilevamento non supervisionato del drift (STUDD) con gli alberi decisionali "Streaming Gradient Boosted Trees" (SGBT) per raggiungere i suoi obiettivi di CL senza la necessità di memorizzazione e riproduzione dei dati. Nel framework sono integrati anche strumenti di "Explainable AI" per illustrare le istanze del modello adattivo utilizzando modelli surrogati interpretabili e metodi "model-agnostic". Il framework è testato su dati di rete RSS (Received Signal Strength) per l’identificazione delle cause di guasto; le sue prestazioni sono confrontate con modelli statici di riferimento e con tecniche di CL basate sul "data replay". I risultati mostrano che, per un problema di classificazione a sei classi, BIGBoost ottiene prestazioni almeno pari al "data replay" e raggiunge un punteggio Macro F1 fino al 26% superiore rispetto a un modello statico addestrato su tutti i dati disponibili prima dell’implementazione.
File allegati
File Dimensione Formato  
2026_03_Labib_Executive_Summary_02.pdf

solo utenti autorizzati a partire dal 02/03/2027

Descrizione: Executive Summary
Dimensione 790.88 kB
Formato Adobe PDF
790.88 kB Adobe PDF   Visualizza/Apri
2026_03_Labib_Thesis_01.pdf

solo utenti autorizzati a partire dal 02/03/2027

Descrizione: Thesis
Dimensione 3.86 MB
Formato Adobe PDF
3.86 MB Adobe PDF   Visualizza/Apri

I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10589/253804