The handling of high-dimensional network-based systems is a key challenge in the real-world application of reinforcement learning algorithms. Standard methods are typically effective on small-scale problems but fail to scale to larger scenarios, such as those considered in the AI4REALNET project. In this work, we propose a dynamic clustering method based on mutual information to factorize the original problem into approximately independent sub-problems. We then develop a multi-agent reinforcement learning approach based on the Proximal Policy Optimization (PPO) algorithm, in which each sub-problem is tackled by a distinct agent. We demonstrate the effectiveness of this framework in two different environments. The first is a relatively small and simple setting involving power line management and load balancing. Through this environment we show that our approach significantly reduces training time while maintaining competitive performance comparing to a standard centralized approach. The second is a larger and more complex railway network simulation, which we used to show that our factorization approach can be applied across different domains.

La gestione di sistemi multi dimensionali basati su reti rappresenta una sfida chiave per l'applicazione di algoritmi di reinforcement learning al mondo reale. I metodi classici risultano solitamente efficaci su problemi di piccola scala, ma non si riescono ad applicare a scenari più ampi, come quelli considerati nel progetto AI4REALNET. In questo lavoro proponiamo un metodo di clustering dinamico basato sulla mutua informazione per fattorizzare il problema originale in sottoproblemi approssimativamente indipendenti. Successivamente abbiamo sviluppato un approccio multi agente di reinforcement learning basato sull'algoritmo Proximal Policy Optimization (PPO), in cui ciascun sottoproblema è gestito da un agente distinto. Abbiamo dimostrato l'efficacia di questo algoritmo in due diversi ambienti. Il primo è un contesto relativamente piccolo e semplice che coinvolge la gestione di linee elettriche e il bilanciamento del carico. Attraverso questo ambiente dimostriamo che il nostro approccio riduce significativamente il tempo di addestramento mantenendo prestazioni competitive rispetto ad un classico approccio centralizzato. Il secondo è una simulazione di una rete ferroviaria più ampia e complessa, che abbiamo utilizzato per mostrare come il nostro approccio possa essere applicato su domini diversi.

Dynamic state and action factorization for distributed reinforcement learning

Fondacaro, Andrea
2024/2025

Abstract

The handling of high-dimensional network-based systems is a key challenge in the real-world application of reinforcement learning algorithms. Standard methods are typically effective on small-scale problems but fail to scale to larger scenarios, such as those considered in the AI4REALNET project. In this work, we propose a dynamic clustering method based on mutual information to factorize the original problem into approximately independent sub-problems. We then develop a multi-agent reinforcement learning approach based on the Proximal Policy Optimization (PPO) algorithm, in which each sub-problem is tackled by a distinct agent. We demonstrate the effectiveness of this framework in two different environments. The first is a relatively small and simple setting involving power line management and load balancing. Through this environment we show that our approach significantly reduces training time while maintaining competitive performance comparing to a standard centralized approach. The second is a larger and more complex railway network simulation, which we used to show that our factorization approach can be applied across different domains.
ING - Scuola di Ingegneria Industriale e dell'Informazione
26-mar-2026
2024/2025
La gestione di sistemi multi dimensionali basati su reti rappresenta una sfida chiave per l'applicazione di algoritmi di reinforcement learning al mondo reale. I metodi classici risultano solitamente efficaci su problemi di piccola scala, ma non si riescono ad applicare a scenari più ampi, come quelli considerati nel progetto AI4REALNET. In questo lavoro proponiamo un metodo di clustering dinamico basato sulla mutua informazione per fattorizzare il problema originale in sottoproblemi approssimativamente indipendenti. Successivamente abbiamo sviluppato un approccio multi agente di reinforcement learning basato sull'algoritmo Proximal Policy Optimization (PPO), in cui ciascun sottoproblema è gestito da un agente distinto. Abbiamo dimostrato l'efficacia di questo algoritmo in due diversi ambienti. Il primo è un contesto relativamente piccolo e semplice che coinvolge la gestione di linee elettriche e il bilanciamento del carico. Attraverso questo ambiente dimostriamo che il nostro approccio riduce significativamente il tempo di addestramento mantenendo prestazioni competitive rispetto ad un classico approccio centralizzato. Il secondo è una simulazione di una rete ferroviaria più ampia e complessa, che abbiamo utilizzato per mostrare come il nostro approccio possa essere applicato su domini diversi.
File allegati
File Dimensione Formato  
Fondacaro Andrea Thesis.pdf

accessibile in internet per tutti

Dimensione 3.74 MB
Formato Adobe PDF
3.74 MB Adobe PDF Visualizza/Apri
Fondacaro Andrea Executive Summary.pdf

accessibile in internet per tutti

Dimensione 1.5 MB
Formato Adobe PDF
1.5 MB Adobe PDF Visualizza/Apri

I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10589/253651