The increasing level of autonomy required by future on-orbit servicing missions motivates the development of decentralised decision-making frameworks capable of operating under uncertainty and limited information. In close-proximity inspection scenarios involving multiple agents and an uncooperative tumbling target, centralised control architectures become impractical due to scalability, communication, and robustness constraints. Specifically, the present thesis proposes a solution to the problem of the autonomous inspection of an unknown tumbling space object via a distributed multi-agent reinforcement learning approach. The problem is modelled as a Decentralized Partially Observable Markov Decision Process (Dec-POMDP), in which the agents react only based on local information to accomplish the inspection mission. The objective of the inspection is formulated as a cooperative coverage problem, with multiple spacecraft working together to optimise the coverage of a target, subject to collision avoidance constraints. Deep reinforcement learning is utilised, and transfer learning is exploited to initialise multi-agent policies from a pretrained single-agent model. Three learning strategies are investigated and compared: Independent Proximal Policy Optimization (IPPO), Multi-Agent Proximal Policy Optimization (MAPPO) with parameter sharing, and MAPPO without parameter sharing. Simulation results show that centralised training with decentralised execution enables safe and effective cooperative inspection of an unknown tumbling target. Furthermore, transfer learning significantly accelerates convergence and improves overall performance in the multi-agent setting. These findings demonstrate the potential of distributed reinforcement learning approaches for autonomous multi-agent inspection missions in complex and partially observable space environments.

L’incremento del livello di autonomia richiesto dalle future missioni di on-orbit servicing motiva lo sviluppo di strutture decisionali decentralizzate, capaci di operare in presenza di incertezze e informazioni limitate. In scenari di prossimità che coinvolgono più agenti e un bersaglio non cooperativo in rotazione, le architetture di controllo centralizzate risultano poco pratiche a causa di vincoli di scalabilità, comunicazione e robustezza. La presente tesi affronta il problema dell’ispezione autonoma di un bersaglio sconosciuto rotante mediante un approccio distribuito di apprendimento per rinforzo multi-agente. Il problema è modellato come un Processo Decisionale di Markov Decentralizzato Parzialmente Osservabile (Dec-POMDP), nel quale ciascun agente agisce esclusivamente sulla base di informazioni locali. L’ispezione è formulata come un problema di copertura cooperativa, in cui più satelliti collaborano per massimizzare la copertura del bersaglio nel rispetto di vincoli di evitamento delle collisioni. L’addestramento si basa su tecniche di deep reinforcement learning, sfruttando il transfer learning per inizializzare le policy multi-agente a partire da una policy a singolo agente pre-addestrata. Sono implementati e confrontati tre algoritmi: Independent Proximal Policy Optimization (IPPO), Multi-Agent Proximal Policy Optimization (MAPPO) con condivisione dei parametri e MAPPO senza condivisione dei parametri. I risultati mostrano che l’addestramento centralizzato con esecuzione decentralizzata consente un’ispezione cooperativa sicura ed efficace. Inoltre, il transfer learning accelera la convergenza e migliora le prestazioni nel contesto multi-agente, evidenziando il potenziale degli approcci di apprendimento per rinforzo distribuito per missioni autonome in ambienti spaziali complessi e parzialmente osservabili.

Multi-agent deep reinforcement learning framework for autonomous spacecraft fleet coordination

Provenzi, Davide
2024/2025

Abstract

The increasing level of autonomy required by future on-orbit servicing missions motivates the development of decentralised decision-making frameworks capable of operating under uncertainty and limited information. In close-proximity inspection scenarios involving multiple agents and an uncooperative tumbling target, centralised control architectures become impractical due to scalability, communication, and robustness constraints. Specifically, the present thesis proposes a solution to the problem of the autonomous inspection of an unknown tumbling space object via a distributed multi-agent reinforcement learning approach. The problem is modelled as a Decentralized Partially Observable Markov Decision Process (Dec-POMDP), in which the agents react only based on local information to accomplish the inspection mission. The objective of the inspection is formulated as a cooperative coverage problem, with multiple spacecraft working together to optimise the coverage of a target, subject to collision avoidance constraints. Deep reinforcement learning is utilised, and transfer learning is exploited to initialise multi-agent policies from a pretrained single-agent model. Three learning strategies are investigated and compared: Independent Proximal Policy Optimization (IPPO), Multi-Agent Proximal Policy Optimization (MAPPO) with parameter sharing, and MAPPO without parameter sharing. Simulation results show that centralised training with decentralised execution enables safe and effective cooperative inspection of an unknown tumbling target. Furthermore, transfer learning significantly accelerates convergence and improves overall performance in the multi-agent setting. These findings demonstrate the potential of distributed reinforcement learning approaches for autonomous multi-agent inspection missions in complex and partially observable space environments.
ING - Scuola di Ingegneria Industriale e dell'Informazione
26-mar-2026
2024/2025
L’incremento del livello di autonomia richiesto dalle future missioni di on-orbit servicing motiva lo sviluppo di strutture decisionali decentralizzate, capaci di operare in presenza di incertezze e informazioni limitate. In scenari di prossimità che coinvolgono più agenti e un bersaglio non cooperativo in rotazione, le architetture di controllo centralizzate risultano poco pratiche a causa di vincoli di scalabilità, comunicazione e robustezza. La presente tesi affronta il problema dell’ispezione autonoma di un bersaglio sconosciuto rotante mediante un approccio distribuito di apprendimento per rinforzo multi-agente. Il problema è modellato come un Processo Decisionale di Markov Decentralizzato Parzialmente Osservabile (Dec-POMDP), nel quale ciascun agente agisce esclusivamente sulla base di informazioni locali. L’ispezione è formulata come un problema di copertura cooperativa, in cui più satelliti collaborano per massimizzare la copertura del bersaglio nel rispetto di vincoli di evitamento delle collisioni. L’addestramento si basa su tecniche di deep reinforcement learning, sfruttando il transfer learning per inizializzare le policy multi-agente a partire da una policy a singolo agente pre-addestrata. Sono implementati e confrontati tre algoritmi: Independent Proximal Policy Optimization (IPPO), Multi-Agent Proximal Policy Optimization (MAPPO) con condivisione dei parametri e MAPPO senza condivisione dei parametri. I risultati mostrano che l’addestramento centralizzato con esecuzione decentralizzata consente un’ispezione cooperativa sicura ed efficace. Inoltre, il transfer learning accelera la convergenza e migliora le prestazioni nel contesto multi-agente, evidenziando il potenziale degli approcci di apprendimento per rinforzo distribuito per missioni autonome in ambienti spaziali complessi e parzialmente osservabili.
File allegati
File Dimensione Formato  
2026_03_Provenzi_Thesis.pdf

accessibile in internet per tutti a partire dal 01/03/2027

Descrizione: testo tesi
Dimensione 16.48 MB
Formato Adobe PDF
16.48 MB Adobe PDF   Visualizza/Apri
2026_03_Provenzi_Executive_Summary.pdf

accessibile in internet per tutti a partire dal 01/03/2027

Descrizione: testo executive summary
Dimensione 1.49 MB
Formato Adobe PDF
1.49 MB Adobe PDF   Visualizza/Apri

I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10589/252631