The transition from monolithic architectures to distributed microservices has obscured system visibility, making manual incident response a significant bottleneck for Site Reliability Engineering (SRE) teams. Although Large Language Models (LLMs) are increasingly explored for Root Cause Analysis (RCA), deploying them introduces "AI in the Wild" challenges, including high token costs, context saturation, and hallucinations. To address these limitations, this thesis introduces a novel Multi-Agent System (MAS) for RCA in Kubernetes environments. The architecture employs a divide and conquer strategy, decomposing complex diagnostics into manageable sub-tasks executed by specialized agents. Key contributions include a hybrid deterministic-generative Triage agent, a Datagraph to ground reasoning in the cluster topology, and a custom Model Context Protocol (MCP) server that distills telemetry data to optimize token efficiency and mitigate hallucinations. Experimental validation in 17 fault scenarios demonstrated that this approach, using the cost-effective GPT-5-mini model, outperformed state-of-the-art baselines (AIOpsLab using GPT-4). The system achieved a Localization Accuracy of 82% versus 61.54% for AIOpsLab, corresponding to a +20.46 percentage-point gain (i.e., a +33.25% relative improvement). In addition, a within-model comparative analysis across GPT-5-mini configurations shows that Planner-guided tool selection yields statistically significant efficiency gains, reducing token usage by up to 42% and execution time by up to 29%. These findings suggest that architectural guardrails and task decomposition can outweigh raw model parameter counts for RCA, achieving strong performance with a lower-cost model; although parameter counts are not publicly disclosed for proprietary models, GPT-4 is widely regarded as having more parameters than GPT-5-mini.
La transizione dalle architetture monolitiche ai microservizi distribuiti ha ridotto la visibilità complessiva del sistema, trasformando la risposta manuale agli incidenti in un collo di bottiglia critico per le operazioni di Site Reliability Engineering (SRE). Sebbene i Large Language Models (LLM) stiano emergendo come strumenti promettenti per la Root Cause Analysis (RCA), la loro adozione in ambienti reali introduce le sfide tipiche della cosiddetta "AI in the Wild", quali costi elevati, saturazione della finestra di contesto e allucinazioni. Per superare tali limitazioni, il presente lavoro propone un innovativo Sistema Multi-Agente (MAS) per la RCA in ambienti Kubernetes. L'architettura adotta una strategia di Divide et Impera, che scompone la complessità diagnostica in sotto-task gestiti da agenti specializzati. I contributi principali includono un agente di Triage ibrido (deterministico-generativo), l'impiego di un Datagraph per ancorare il ragionamento alla topologia del cluster e un server Model Context Protocol (MCP) appositamente sviluppato per filtrare e sintetizzare i dati di telemetria, ottimizzando così l'efficienza dei token e mitigando il rischio di allucinazioni. La campagna sperimentale, condotta su 17 scenari di guasto, ha dimostrato che l'approccio proposto, utilizzando il modello cost-effective GPT-5-mini, supera le prestazioni delle soluzioni allo stato dell'arte (come AIOpsLab basato su GPT-4). Il sistema ha raggiunto un'accuratezza di localizzazione dell'82% contro il 61.54% di AIOpsLab, corrispondente a un guadagno assoluto di +20.46 punti percentuali (ossia un +33.25% di miglioramento relativo). Inoltre, un'analisi comparativa interna sulle configurazioni di GPT-5-mini evidenzia che la selezione degli strumenti guidata dal Planner produce guadagni di efficienza statisticamente significativi, riducendo l'uso dei token fino al 42% e il tempo di esecuzione fino al 29%. Tali risultati suggeriscono che l'adozione di guardrail architetturali e la scomposizione dei task possano prevalere sul mero numero di parametri del modello per la RCA, ottenendo prestazioni elevate con modelli a basso costo; sebbene i conteggi dei parametri non siano pubblici per i modelli proprietari, GPT-4 è ampiamente considerato avere un numero di parametri superiore rispetto a GPT-5-mini.
Beyond AI in the wild: optimizing root cause analysis with Multi-Agent System
Martini, Marcello
2025/2026
Abstract
The transition from monolithic architectures to distributed microservices has obscured system visibility, making manual incident response a significant bottleneck for Site Reliability Engineering (SRE) teams. Although Large Language Models (LLMs) are increasingly explored for Root Cause Analysis (RCA), deploying them introduces "AI in the Wild" challenges, including high token costs, context saturation, and hallucinations. To address these limitations, this thesis introduces a novel Multi-Agent System (MAS) for RCA in Kubernetes environments. The architecture employs a divide and conquer strategy, decomposing complex diagnostics into manageable sub-tasks executed by specialized agents. Key contributions include a hybrid deterministic-generative Triage agent, a Datagraph to ground reasoning in the cluster topology, and a custom Model Context Protocol (MCP) server that distills telemetry data to optimize token efficiency and mitigate hallucinations. Experimental validation in 17 fault scenarios demonstrated that this approach, using the cost-effective GPT-5-mini model, outperformed state-of-the-art baselines (AIOpsLab using GPT-4). The system achieved a Localization Accuracy of 82% versus 61.54% for AIOpsLab, corresponding to a +20.46 percentage-point gain (i.e., a +33.25% relative improvement). In addition, a within-model comparative analysis across GPT-5-mini configurations shows that Planner-guided tool selection yields statistically significant efficiency gains, reducing token usage by up to 42% and execution time by up to 29%. These findings suggest that architectural guardrails and task decomposition can outweigh raw model parameter counts for RCA, achieving strong performance with a lower-cost model; although parameter counts are not publicly disclosed for proprietary models, GPT-4 is widely regarded as having more parameters than GPT-5-mini.| File | Dimensione | Formato | |
|---|---|---|---|
|
2026_03_Martini_Tesi.pdf
accessibile in internet per tutti
Dimensione
1.45 MB
Formato
Adobe PDF
|
1.45 MB | Adobe PDF | Visualizza/Apri |
|
2026_03_Martini_ExecutiveSummary.pdf
accessibile in internet per tutti
Dimensione
777.53 kB
Formato
Adobe PDF
|
777.53 kB | Adobe PDF | Visualizza/Apri |
I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.
https://hdl.handle.net/10589/250037