The design of effective close-range air combat tactics depends on a tight coupling between aircraft dynamic capabilities, control architectures, and decision-making strategies. This thesis presents an integrated simulation and reinforcement learning framework for the joint analysis and development of aircraft concepts and tactical control policies in subsonic airto- air combat. A custom six-degree-of-freedom aircraft simulator is developed, combining parametric mass, inertia, propulsion, and aerodynamic models with a hierarchical control stack that separates high-frequency stabilization from low-frequency tactical decision making. On top of this simulator, a geometry-aware reinforcement learning environment is constructed, featuring invariant observation representations, simplified engagement rules based on weapon and vulnerability zones, and a modular reward structure shaping flight stability, pursuit geometry, closure control, and weapon usage. Soft Actor–Critic is adopted as the learning algorithm and embedded within a curriculum learning and self-play framework. Experimental results show that the framework reliably produces tactically coherent behaviors, including controlled intercepts, speed management across engagement regimes, and disciplined firing decisions. In one-versus-one self-play, learned policies converge toward interaction patterns closely resembling real-world Basic Fighter Maneuvers. Comparative self-play across aircraft variants indicates that dynamic differences primarily affect stability margins and failure modes rather than inducing fundamentally distinct tactics. Extension to two-versus-two scenarios shows that non-trivial multi-agent interaction patterns can emerge from shared objectives, while also highlighting the limitations of symmetric, non-cooperative training setups. Overall, this work establishes a flexible engineering tool for studying the interplay between aircraft design choices and reinforcement-learning-driven tactical behavior, supporting future investigations into asymmetric manned–unmanned combat and coordinated multiagent air combat.

La progettazione di tattiche efficaci per il combattimento aereo a corto raggio richiede una stretta integrazione tra le capacità dinamiche del velivolo, l’architettura di controllo e i meccanismi decisionali. Questa tesi presenta un framework integrato di simulazione e reinforcement learning per l’analisi congiunta e lo sviluppo di concetti aeronautici e politiche tattiche di controllo nel combattimento aria–aria subsonico. Viene sviluppato un simulatore aeronautico a sei gradi di libertà, basato su modelli parametrici di massa, inerzia, propulsione e aerodinamica, integrato con un’architettura di controllo gerarchica che separa la stabilizzazione ad alta frequenza dalle decisioni tattiche a bassa frequenza. Su questa base è costruito un ambiente di reinforcement learning orientato alla geometria dell’ingaggio, con rappresentazioni osservative invarianti, regole di ingaggio semplificate basate su zone offensive e di vulnerabilità, e una funzione di ricompensa modulare che guida stabilità di volo, geometria di inseguimento, controllo della chiusura e impiego dell’armamento. L’algoritmo Soft Actor–Critic è adottato all’interno di una strategia di curriculum learning e self-play. I risultati sperimentali mostrano che il framework produce comportamenti tatticamente coerenti, includendo intercetti controllati, gestione della velocità nei diversi regimi di ingaggio e decisioni di fuoco disciplinate. Nel self-play uno-contro-uno, le politiche apprese convergono verso schemi di interazione riconducibili alle Basic Fighter Maneuvers. Il confronto tra varianti di velivolo indica che le differenze dinamiche influenzano soprattutto i margini di stabilità e le modalità di fallimento. L’estensione a scenari due-contro-due mostra che strutture di interazione multi-agente non banali possono emergere da obiettivi condivisi. Nel complesso, questo lavoro introduce uno strumento ingegneristico flessibile per lo studio dell’interazione tra progettazione del velivolo e comportamenti tattici guidati dal reinforcement learning.

Joint aircraft design and tactical learing via reinforcement learning for air combat

Grazi, Marco
2025/2026

Abstract

The design of effective close-range air combat tactics depends on a tight coupling between aircraft dynamic capabilities, control architectures, and decision-making strategies. This thesis presents an integrated simulation and reinforcement learning framework for the joint analysis and development of aircraft concepts and tactical control policies in subsonic airto- air combat. A custom six-degree-of-freedom aircraft simulator is developed, combining parametric mass, inertia, propulsion, and aerodynamic models with a hierarchical control stack that separates high-frequency stabilization from low-frequency tactical decision making. On top of this simulator, a geometry-aware reinforcement learning environment is constructed, featuring invariant observation representations, simplified engagement rules based on weapon and vulnerability zones, and a modular reward structure shaping flight stability, pursuit geometry, closure control, and weapon usage. Soft Actor–Critic is adopted as the learning algorithm and embedded within a curriculum learning and self-play framework. Experimental results show that the framework reliably produces tactically coherent behaviors, including controlled intercepts, speed management across engagement regimes, and disciplined firing decisions. In one-versus-one self-play, learned policies converge toward interaction patterns closely resembling real-world Basic Fighter Maneuvers. Comparative self-play across aircraft variants indicates that dynamic differences primarily affect stability margins and failure modes rather than inducing fundamentally distinct tactics. Extension to two-versus-two scenarios shows that non-trivial multi-agent interaction patterns can emerge from shared objectives, while also highlighting the limitations of symmetric, non-cooperative training setups. Overall, this work establishes a flexible engineering tool for studying the interplay between aircraft design choices and reinforcement-learning-driven tactical behavior, supporting future investigations into asymmetric manned–unmanned combat and coordinated multiagent air combat.
ING - Scuola di Ingegneria Industriale e dell'Informazione
26-mar-2026
2025/2026
La progettazione di tattiche efficaci per il combattimento aereo a corto raggio richiede una stretta integrazione tra le capacità dinamiche del velivolo, l’architettura di controllo e i meccanismi decisionali. Questa tesi presenta un framework integrato di simulazione e reinforcement learning per l’analisi congiunta e lo sviluppo di concetti aeronautici e politiche tattiche di controllo nel combattimento aria–aria subsonico. Viene sviluppato un simulatore aeronautico a sei gradi di libertà, basato su modelli parametrici di massa, inerzia, propulsione e aerodinamica, integrato con un’architettura di controllo gerarchica che separa la stabilizzazione ad alta frequenza dalle decisioni tattiche a bassa frequenza. Su questa base è costruito un ambiente di reinforcement learning orientato alla geometria dell’ingaggio, con rappresentazioni osservative invarianti, regole di ingaggio semplificate basate su zone offensive e di vulnerabilità, e una funzione di ricompensa modulare che guida stabilità di volo, geometria di inseguimento, controllo della chiusura e impiego dell’armamento. L’algoritmo Soft Actor–Critic è adottato all’interno di una strategia di curriculum learning e self-play. I risultati sperimentali mostrano che il framework produce comportamenti tatticamente coerenti, includendo intercetti controllati, gestione della velocità nei diversi regimi di ingaggio e decisioni di fuoco disciplinate. Nel self-play uno-contro-uno, le politiche apprese convergono verso schemi di interazione riconducibili alle Basic Fighter Maneuvers. Il confronto tra varianti di velivolo indica che le differenze dinamiche influenzano soprattutto i margini di stabilità e le modalità di fallimento. L’estensione a scenari due-contro-due mostra che strutture di interazione multi-agente non banali possono emergere da obiettivi condivisi. Nel complesso, questo lavoro introduce uno strumento ingegneristico flessibile per lo studio dell’interazione tra progettazione del velivolo e comportamenti tattici guidati dal reinforcement learning.
File allegati
File Dimensione Formato  
2026_3_Grazi_Tesi.pdf

accessibile in internet per tutti

Dimensione 9.89 MB
Formato Adobe PDF
9.89 MB Adobe PDF Visualizza/Apri
2026_3_Grazi_ExecutiveSummary.pdf

accessibile in internet per tutti

Dimensione 340.81 kB
Formato Adobe PDF
340.81 kB Adobe PDF Visualizza/Apri

I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10589/251178