This work investigates the application of Reinforcement Learning (RL) techniques to a Sensor Management System for the autonomous control of an airborne RADAR. The objective is to optimize the use of sensor resources through strategies capable of adapting to the operational scenario and mission objectives, while complying with system constraints. In highly dynamic and uncertain environments with limited sensing resources, the definition of efficient and context-aware sensor management policies represents a key enabling factor for mission effectiveness. The problem is formulated as a sequential decision-making process and addressed using the Proximal Policy Optimization (PPO) algorithm within a dedicated simulation framework that enables continuous interaction between the agent and the mission environment. Two primary RADAR operating modes are considered: Track-While-Scan (TWS), used for surveillance and track maintenance, and Antenna Steering (ANT), which enables focused antenna pointing toward specific regions of interest. The reward function integrates effectiveness and performance metrics to balance tracking accuracy, track stability, and appropriate resource allocation. Experimental results demonstrate that the learned policy converges toward stable and interpretable behavior, dynamically adapting RADAR mode selection to target range and scenario complexity. Compared to a baseline configuration operating in fixed TWS mode, the RL-based approach improves tracking accuracy when targets are closer to the RADAR through increased focused sensing, while prioritizing surveillance-oriented configurations when targets are farther and in multi-target scenarios to preserve coverage and discovery capability. Overall, the results support the feasibility and highlight the potential of Reinforcement Learning for adaptive RADAR management, providing a solid foundation for future developments toward increasingly autonomous and mission-aware Sensor Management Systems.

Il presente lavoro affronta il problema della gestione autonoma di un RADAR mediante l’applicazione di tecniche di Reinforcement Learning (RL) al Sensor Management System. L’obiettivo è ottimizzare l’impiego delle risorse sensoriali attraverso strategie che sappiano adattarsi allo scenario e agli obiettivi della missione, rispettando i vincoli del sistema. In contesti caratterizzati da elevata dinamicità e risorse limitate, la definizione di modalità di gestione efficienti e coerenti con il contesto rappresenta un fattore chiave. Il problema è formulato come processo decisionale sequenziale ed è affrontato tramite l’algoritmo Proximal Policy Optimization (PPO), all’interno di un framework che consente l’interazione continua tra agente e ambiente simulato. Sono considerate due modalità operative: Track- While-Scan (TWS), per la sorveglianza ed il mantenimento delle tracce, e Antenna Steering (ANT), per il puntamento focalizzato dell’antenna verso specifiche regioni dello spazio. La funzione di reward integra metriche di efficacia e prestazione per bilanciare accuratezza e stabilità del tracciamento. I risultati mostrano che la policy converge verso un comportamento stabile ed interpretabile, adattando dinamicamente la selezione delle modalità RADAR alla distanza degli oggetti osservati e alla complessità dello scenario. Rispetto ad una configurazione di riferimento con modalità TWS fissa, l’approccio basato su RL migliora l’accuratezza di tracciamento a distanze ridotte, mentre privilegia configurazioni orientate alla sorveglianza quando le entità osservate sono più distanti o in presenza di scenari multi-target, preservando la copertura e la capacità di scoperta. Nel complesso, i risultati confermano il potenziale del Reinforcement Learning per la gestione adattiva di sistemi RADAR, fornendo la base per sviluppi futuri verso Sensor Management System sempre più autonomi.

Reinforcement Learning for Adaptive Airborne Radar Sensor Management

RICCARDI, LEONARDO
2025/2026

Abstract

This work investigates the application of Reinforcement Learning (RL) techniques to a Sensor Management System for the autonomous control of an airborne RADAR. The objective is to optimize the use of sensor resources through strategies capable of adapting to the operational scenario and mission objectives, while complying with system constraints. In highly dynamic and uncertain environments with limited sensing resources, the definition of efficient and context-aware sensor management policies represents a key enabling factor for mission effectiveness. The problem is formulated as a sequential decision-making process and addressed using the Proximal Policy Optimization (PPO) algorithm within a dedicated simulation framework that enables continuous interaction between the agent and the mission environment. Two primary RADAR operating modes are considered: Track-While-Scan (TWS), used for surveillance and track maintenance, and Antenna Steering (ANT), which enables focused antenna pointing toward specific regions of interest. The reward function integrates effectiveness and performance metrics to balance tracking accuracy, track stability, and appropriate resource allocation. Experimental results demonstrate that the learned policy converges toward stable and interpretable behavior, dynamically adapting RADAR mode selection to target range and scenario complexity. Compared to a baseline configuration operating in fixed TWS mode, the RL-based approach improves tracking accuracy when targets are closer to the RADAR through increased focused sensing, while prioritizing surveillance-oriented configurations when targets are farther and in multi-target scenarios to preserve coverage and discovery capability. Overall, the results support the feasibility and highlight the potential of Reinforcement Learning for adaptive RADAR management, providing a solid foundation for future developments toward increasingly autonomous and mission-aware Sensor Management Systems.
ING - Scuola di Ingegneria Industriale e dell'Informazione
26-mar-2026
2025/2026
Il presente lavoro affronta il problema della gestione autonoma di un RADAR mediante l’applicazione di tecniche di Reinforcement Learning (RL) al Sensor Management System. L’obiettivo è ottimizzare l’impiego delle risorse sensoriali attraverso strategie che sappiano adattarsi allo scenario e agli obiettivi della missione, rispettando i vincoli del sistema. In contesti caratterizzati da elevata dinamicità e risorse limitate, la definizione di modalità di gestione efficienti e coerenti con il contesto rappresenta un fattore chiave. Il problema è formulato come processo decisionale sequenziale ed è affrontato tramite l’algoritmo Proximal Policy Optimization (PPO), all’interno di un framework che consente l’interazione continua tra agente e ambiente simulato. Sono considerate due modalità operative: Track- While-Scan (TWS), per la sorveglianza ed il mantenimento delle tracce, e Antenna Steering (ANT), per il puntamento focalizzato dell’antenna verso specifiche regioni dello spazio. La funzione di reward integra metriche di efficacia e prestazione per bilanciare accuratezza e stabilità del tracciamento. I risultati mostrano che la policy converge verso un comportamento stabile ed interpretabile, adattando dinamicamente la selezione delle modalità RADAR alla distanza degli oggetti osservati e alla complessità dello scenario. Rispetto ad una configurazione di riferimento con modalità TWS fissa, l’approccio basato su RL migliora l’accuratezza di tracciamento a distanze ridotte, mentre privilegia configurazioni orientate alla sorveglianza quando le entità osservate sono più distanti o in presenza di scenari multi-target, preservando la copertura e la capacità di scoperta. Nel complesso, i risultati confermano il potenziale del Reinforcement Learning per la gestione adattiva di sistemi RADAR, fornendo la base per sviluppi futuri verso Sensor Management System sempre più autonomi.
File allegati
File Dimensione Formato  
2026_03_Riccardi.pdf

non accessibile

Descrizione: Testo della Tesi
Dimensione 2.92 MB
Formato Adobe PDF
2.92 MB Adobe PDF   Visualizza/Apri
2026_03_Riccardi_executive summary.pdf

accessibile in internet solo dagli utenti autorizzati

Descrizione: Executive Summary
Dimensione 469.99 kB
Formato Adobe PDF
469.99 kB Adobe PDF   Visualizza/Apri

I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10589/252493