Asset-Liability Management (ALM) requires financial institutions to allocate their resources in order to maximize returns while meeting their obligations and complying with regulatory liquidity requirements. If these requirements, as decided by regulators, are not met, usually fines are triggered that transform the optimization objective into a discontinuous and multimodal landscape, making it difficult for gradient-based methods inspired by the Deep Hedging approach to find the correct solution. In this thesis, we first formulate a tractable, discrete-time ALM model and solve it exactly through a corner-bounded backward recursion, obtaining a dynamic-programming ground truth that is globally optimal on the discretized state space with a provably bounded approximation error. Using this and a closed-form, single-period instance of this model, we then show that the Deep Hedging approach fails in the presence of regulatory penalties. To address this problematic landscape, we propose a stochastic Actor-Critic algorithm whose policy is parameterized by a Dirichlet distribution and regularized by an annealed entropy term that preserves a certain degree of exploration. On a realistic two-year, five-bond instance, the proposed method (benchmarked against RL baselines and static policies) is the only learned strategy that is safe and well-diversified at the same time, while achieving a negligible default rate and attaining the best risk-return trade-off.

La gestione delle attività e passività (ALM) richiede alle istituzioni di allocare le loro risorse in modo da massimizzare il rendimento, mantenendo la capacità di pagare i propri debiti e soddisfacendo i requisiti regolatori di liquidità. Se questi requisiti decisi dagli enti regolatori non vengono rispettati, di solito vengono applicate multe che rendono discontinuo e multimodale il paesaggio di ottimizzazione, rendendo difficile la scoperta della soluzione corretta per i metodi basati sul gradiente, come quelli ispirati dall'approccio del Deep Hedging. In questa tesi noi prima formuliamo un modello ALM trattabile a tempo discreto e lo risolviamo in modo esatto con una ricorsione all'indietro, ottenendo una soluzione globalmente ottima con la programmazione dinamica nello spazio degli stati discreti con un limite d'errore dimostrato. Usando ciò e una soluzione in forma chiusa, su un'istanza del problema con un singolo istante di tempo, mostriamo che l'approccio basato sul Deep Hedging fallisce in presenza di penalità regolatorie. Per affrontare questo paesaggio d'ottimizzazione problematico, proponiamo un algoritmo Actor-Critic stocastico la cui strategia è parametrizzata da una distribuzione di Dirichlet e regolarizzata da un termine di entropia che decade nel tempo, per preservare un certo grado di esplorazione. Su un'istanza di due anni di tempo, con possibilità di scegliere fra 5 bond, il metodo proposto (confrontato con algoritmi baseline di Reinforcement Learning e strategie statiche), è l'unico non statico che è sicuro e diversificato allo stesso tempo, ottenendo una trascurabile percentuale di default ed il migliore profilo di rischio-rendimento.

Deep reinforcement learning for Asset-Liability Management under regulatory constraints

GRIBALDO, EDOARDO SILVIO
2025/2026

Abstract

Asset-Liability Management (ALM) requires financial institutions to allocate their resources in order to maximize returns while meeting their obligations and complying with regulatory liquidity requirements. If these requirements, as decided by regulators, are not met, usually fines are triggered that transform the optimization objective into a discontinuous and multimodal landscape, making it difficult for gradient-based methods inspired by the Deep Hedging approach to find the correct solution. In this thesis, we first formulate a tractable, discrete-time ALM model and solve it exactly through a corner-bounded backward recursion, obtaining a dynamic-programming ground truth that is globally optimal on the discretized state space with a provably bounded approximation error. Using this and a closed-form, single-period instance of this model, we then show that the Deep Hedging approach fails in the presence of regulatory penalties. To address this problematic landscape, we propose a stochastic Actor-Critic algorithm whose policy is parameterized by a Dirichlet distribution and regularized by an annealed entropy term that preserves a certain degree of exploration. On a realistic two-year, five-bond instance, the proposed method (benchmarked against RL baselines and static policies) is the only learned strategy that is safe and well-diversified at the same time, while achieving a negligible default rate and attaining the best risk-return trade-off.
ING - Scuola di Ingegneria Industriale e dell'Informazione
22-lug-2026
2025/2026
La gestione delle attività e passività (ALM) richiede alle istituzioni di allocare le loro risorse in modo da massimizzare il rendimento, mantenendo la capacità di pagare i propri debiti e soddisfacendo i requisiti regolatori di liquidità. Se questi requisiti decisi dagli enti regolatori non vengono rispettati, di solito vengono applicate multe che rendono discontinuo e multimodale il paesaggio di ottimizzazione, rendendo difficile la scoperta della soluzione corretta per i metodi basati sul gradiente, come quelli ispirati dall'approccio del Deep Hedging. In questa tesi noi prima formuliamo un modello ALM trattabile a tempo discreto e lo risolviamo in modo esatto con una ricorsione all'indietro, ottenendo una soluzione globalmente ottima con la programmazione dinamica nello spazio degli stati discreti con un limite d'errore dimostrato. Usando ciò e una soluzione in forma chiusa, su un'istanza del problema con un singolo istante di tempo, mostriamo che l'approccio basato sul Deep Hedging fallisce in presenza di penalità regolatorie. Per affrontare questo paesaggio d'ottimizzazione problematico, proponiamo un algoritmo Actor-Critic stocastico la cui strategia è parametrizzata da una distribuzione di Dirichlet e regolarizzata da un termine di entropia che decade nel tempo, per preservare un certo grado di esplorazione. Su un'istanza di due anni di tempo, con possibilità di scegliere fra 5 bond, il metodo proposto (confrontato con algoritmi baseline di Reinforcement Learning e strategie statiche), è l'unico non statico che è sicuro e diversificato allo stesso tempo, ottenendo una trascurabile percentuale di default ed il migliore profilo di rischio-rendimento.
File allegati
File Dimensione Formato  
2026_07_Gribaldo_Tesi.pdf

accessibile in internet per tutti

Descrizione: tesi
Dimensione 1.01 MB
Formato Adobe PDF
1.01 MB Adobe PDF Visualizza/Apri
2026_07_Gribaldo_Executive Summary.pdf

accessibile in internet per tutti

Descrizione: executive summary
Dimensione 576.25 kB
Formato Adobe PDF
576.25 kB Adobe PDF Visualizza/Apri

I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10589/259981