Contemporary electricity markets face volatility driven by renewable energy integration, fossil fuel price fluctuations, and geopolitical instabilities. Traditional forecasting approaches struggle to capture the strategic interactions among market participants, particularly as generators adapt bidding strategies in response to evolving market conditions. This thesis develops a multi-agent deep reinforcement learning framework for simulating strategic bidding behavior in the Italian day-ahead electricity market (Mercato del Giorno Prima, MGP), enabling evidence-based analysis of market dynamics under uncertainty. The research employs Multi-Agent Deep Deterministic Policy Gradient (MADDPG) algorithms combined with an instance-based similarity search mechanism to identify historically analogous market conditions for agent training initialization. The framework incorporates heterogeneous agent types representing thermal generation (CCGT, nuclear, hydroelectric), renewable sources with priority dispatch, and static market participants, replicating the multi-technology portfolio characteristic of modern electricity systems. Two training configurations are evaluated: single-day training exposing agents to fixed market conditions, and multi-day training with domain randomization across diverse exogenous scenarios. Single-day training demonstrates rapid convergence to Nash equilibrium strategies within low number of episodes, achieving market clearing price reductions of 44% compared to baseline non-optimized outcomes. Multi-day training reveals greater instability due to the absence of EUPHEMIA-based market coupling mechanisms, highlighting the critical importance of realistic clearing algorithms for stable multi-agent learning. The developed framework provides energy companies and policymakers with a computational testbed for evaluating investment decisions, assessing regulatory interventions, and analyzing competitive dynamics in increasingly complex and volatile electricity markets.

I mercati elettrici contemporanei affrontano una volatilità guidata dall'integrazione delle energie rinnovabili, dalle fluttuazioni dei prezzi dei combustibili fossili e dalle instabilità geopolitiche. Gli approcci tradizionali di previsione faticano a catturare le interazioni strategiche tra i partecipanti al mercato, in particolare quando i generatori adattano le strategie di offerta in risposta alle condizioni di mercato in evoluzione. Questa tesi sviluppa un framework di apprendimento per rinforzo profondo multi-agente per la simulazione del comportamento strategico di offerta nel mercato elettrico italiano del giorno prima (Mercato del Giorno Prima, MGP), consentendo un'analisi basata sull'evidenza delle dinamiche di mercato in condizioni di incertezza. La ricerca impiega algoritmi Multi-Agent Deep Deterministic Policy Gradient (MADDPG) combinati con un meccanismo di ricerca per similarità basato su istanze per identificare condizioni di mercato storicamente analoghe per l'inizializzazione dell'addestramento degli agenti. Il framework incorpora tipologie di agenti eterogenei che rappresentano la generazione termica (CCGT, nucleare, idroelettrica), fonti rinnovabili con dispacciamento prioritario e partecipanti di mercato statici, replicando il portafoglio multi-tecnologico caratteristico dei moderni sistemi elettrici. Vengono valutate due configurazioni di addestramento: addestramento single-day che espone gli agenti a condizioni di mercato fisse, e addestramento multi-day con randomizzazione di dominio attraverso diversi scenari esogeni. L'addestramento single-day dimostra una rapida convergenza verso strategie di equilibrio di Nash entro un basso numero di episodi, ottenendo riduzioni del prezzo di chiusura del mercato del 44% rispetto ai risultati di base non ottimizzati. L'addestramento multi-day rivela una maggiore instabilità a causa dell'assenza di meccanismi di accoppiamento di mercato basati su EUPHEMIA, evidenziando l'importanza critica di algoritmi di clearing realistici per un apprendimento multi-agente stabile. Il framework sviluppato fornisce alle società energetiche e ai decisori politici un banco di prova computazionale per valutare decisioni di investimento, valutare interventi normativi e analizzare le dinamiche competitive in mercati elettrici sempre più complessi e volatili.

Simulation of the italian day-ahead electricity market based on a multi-agent reinforcement learning model

Valente, Gabriele
2024/2025

Abstract

Contemporary electricity markets face volatility driven by renewable energy integration, fossil fuel price fluctuations, and geopolitical instabilities. Traditional forecasting approaches struggle to capture the strategic interactions among market participants, particularly as generators adapt bidding strategies in response to evolving market conditions. This thesis develops a multi-agent deep reinforcement learning framework for simulating strategic bidding behavior in the Italian day-ahead electricity market (Mercato del Giorno Prima, MGP), enabling evidence-based analysis of market dynamics under uncertainty. The research employs Multi-Agent Deep Deterministic Policy Gradient (MADDPG) algorithms combined with an instance-based similarity search mechanism to identify historically analogous market conditions for agent training initialization. The framework incorporates heterogeneous agent types representing thermal generation (CCGT, nuclear, hydroelectric), renewable sources with priority dispatch, and static market participants, replicating the multi-technology portfolio characteristic of modern electricity systems. Two training configurations are evaluated: single-day training exposing agents to fixed market conditions, and multi-day training with domain randomization across diverse exogenous scenarios. Single-day training demonstrates rapid convergence to Nash equilibrium strategies within low number of episodes, achieving market clearing price reductions of 44% compared to baseline non-optimized outcomes. Multi-day training reveals greater instability due to the absence of EUPHEMIA-based market coupling mechanisms, highlighting the critical importance of realistic clearing algorithms for stable multi-agent learning. The developed framework provides energy companies and policymakers with a computational testbed for evaluating investment decisions, assessing regulatory interventions, and analyzing competitive dynamics in increasingly complex and volatile electricity markets.
ING - Scuola di Ingegneria Industriale e dell'Informazione
26-mar-2026
2024/2025
I mercati elettrici contemporanei affrontano una volatilità guidata dall'integrazione delle energie rinnovabili, dalle fluttuazioni dei prezzi dei combustibili fossili e dalle instabilità geopolitiche. Gli approcci tradizionali di previsione faticano a catturare le interazioni strategiche tra i partecipanti al mercato, in particolare quando i generatori adattano le strategie di offerta in risposta alle condizioni di mercato in evoluzione. Questa tesi sviluppa un framework di apprendimento per rinforzo profondo multi-agente per la simulazione del comportamento strategico di offerta nel mercato elettrico italiano del giorno prima (Mercato del Giorno Prima, MGP), consentendo un'analisi basata sull'evidenza delle dinamiche di mercato in condizioni di incertezza. La ricerca impiega algoritmi Multi-Agent Deep Deterministic Policy Gradient (MADDPG) combinati con un meccanismo di ricerca per similarità basato su istanze per identificare condizioni di mercato storicamente analoghe per l'inizializzazione dell'addestramento degli agenti. Il framework incorpora tipologie di agenti eterogenei che rappresentano la generazione termica (CCGT, nucleare, idroelettrica), fonti rinnovabili con dispacciamento prioritario e partecipanti di mercato statici, replicando il portafoglio multi-tecnologico caratteristico dei moderni sistemi elettrici. Vengono valutate due configurazioni di addestramento: addestramento single-day che espone gli agenti a condizioni di mercato fisse, e addestramento multi-day con randomizzazione di dominio attraverso diversi scenari esogeni. L'addestramento single-day dimostra una rapida convergenza verso strategie di equilibrio di Nash entro un basso numero di episodi, ottenendo riduzioni del prezzo di chiusura del mercato del 44% rispetto ai risultati di base non ottimizzati. L'addestramento multi-day rivela una maggiore instabilità a causa dell'assenza di meccanismi di accoppiamento di mercato basati su EUPHEMIA, evidenziando l'importanza critica di algoritmi di clearing realistici per un apprendimento multi-agente stabile. Il framework sviluppato fornisce alle società energetiche e ai decisori politici un banco di prova computazionale per valutare decisioni di investimento, valutare interventi normativi e analizzare le dinamiche competitive in mercati elettrici sempre più complessi e volatili.
File allegati
File Dimensione Formato  
Executive_Summary___Valente.pdf

non accessibile

Dimensione 3.21 MB
Formato Adobe PDF
3.21 MB Adobe PDF   Visualizza/Apri
2026_03_VALENTE.pdf

non accessibile

Dimensione 19.6 MB
Formato Adobe PDF
19.6 MB Adobe PDF   Visualizza/Apri

I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10589/253440