This thesis presents an in-depth study of hardware data prefetching techniques applied to a high-performance, out-of-order RISC-V processor, using the Berkeley Out-of-Order Machine (BOOM) as an open and realistic evaluation platform. The work moves beyond algorithm-centric analyses by evaluating prefetching mechanisms directly at the Register Transfer Level (RTL), thereby capturing micro-architectural interactions that are typically hidden in abstract or trace-driven simulation models. Multiple state-of-the-art data prefetchers are implemented and evaluated within the BOOM microarchitecture, with particular attention to their interaction with the Load/Store Unit, Miss Status Holding Registers, cache hierarchy, and on-chip interconnect. The experimental results confirm that data prefetching remains an effective technique for mitigating memory latency in memory-bound workloads; however, they also reveal that prefetcher effectiveness is strongly constrained by structural resource contention and micro-architectural integration. A key finding of this work is that, in out-of-order processors, aggressive prefetching strategies may provide diminishing or even negative returns when speculative traffic interferes with demand requests. The study shows that prefetchers designed to operate independently of demand-side MSHRs improve system performance under high memory pressure, while simpler algorithms such as Best-Offset Prefetching often deliver superior cost–benefit trade-offs compared to more complex approaches. Overall, this thesis demonstrates that effective hardware data prefetching in out-of-order architectures is a system-level challenge that requires careful consideration of resource contention, non-intrusiveness, and implementation cost. By leveraging an open-source RTL platform, this work provides realistic insights into the practical limitations and design trade-offs of modern data prefetching strategies for high-performance RISC-V processors.

Questa tesi presenta uno studio approfondito delle tecniche di data prefetching hardware applicate a un processore RISC-V ad alte prestazioni e a esecuzione fuori ordine, utilizzando il Berkeley Out-of-Order Machine (BOOM) come piattaforma di valutazione aperta e realistica. Il lavoro supera le analisi puramente algoritmiche valutando i meccanismi di prefetching direttamente a livello Register Transfer Level (RTL), consentendo di osservare interazioni micro-architetturali che risultano generalmente invisibili nei modelli di simulazione astratti o trace-driven. Diversi prefetcher di stato dell’arte vengono implementati e valutati all’interno della microarchitettura BOOM, con particolare attenzione alla loro interazione con la Load/Store Unit, i Miss Status Holding Registers, la gerarchia di cache e l’interconnessione on-chip. I risultati sperimentali confermano che il data prefetching rappresenta una tecnica efficace per mitigare la latenza di memoria nei carichi di lavoro memory-bound; tuttavia, evidenziano anche come l’efficacia dei prefetcher sia fortemente limitata dalla contesa delle risorse strutturali e dalla loro integrazione micro-architetturale. Uno dei principali risultati di questa tesi è che, nei processori out-of-order, strategie di prefetching eccessivamente aggressive possono produrre benefici marginali o addirittura peggiorare le prestazioni quando il traffico speculativo interferisce con le richieste di memoria effettive. Lo studio mostra inoltre che i prefetcher progettati per operare in modo indipendente dagli MSHR associati alle richieste di domanda migliorano la robustezza del sistema in condizioni di elevata pressione di memoria, mentre algoritmi più semplici come il Best-Offset Prefetching offrono spesso un migliore compromesso tra costo hardware e guadagno prestazionale rispetto a soluzioni più complesse. Nel complesso, questa tesi dimostra che il data prefetching hardware in architetture out-of-order costituisce una sfida di sistema, che richiede un’attenta considerazione della contesa delle risorse, della non intrusività e dei costi di implementazione. Grazie all’utilizzo di una piattaforma RTL open-source, il lavoro fornisce una valutazione realistica dei limiti pratici e dei compromessi progettuali delle moderne strategie di data prefetching per processori RISC-V ad alte prestazioni.

An experimental analysis of hardware data prefetching algorithms in out-of-order RISC-V processors

Logallo, Nunzio
2025/2026

Abstract

This thesis presents an in-depth study of hardware data prefetching techniques applied to a high-performance, out-of-order RISC-V processor, using the Berkeley Out-of-Order Machine (BOOM) as an open and realistic evaluation platform. The work moves beyond algorithm-centric analyses by evaluating prefetching mechanisms directly at the Register Transfer Level (RTL), thereby capturing micro-architectural interactions that are typically hidden in abstract or trace-driven simulation models. Multiple state-of-the-art data prefetchers are implemented and evaluated within the BOOM microarchitecture, with particular attention to their interaction with the Load/Store Unit, Miss Status Holding Registers, cache hierarchy, and on-chip interconnect. The experimental results confirm that data prefetching remains an effective technique for mitigating memory latency in memory-bound workloads; however, they also reveal that prefetcher effectiveness is strongly constrained by structural resource contention and micro-architectural integration. A key finding of this work is that, in out-of-order processors, aggressive prefetching strategies may provide diminishing or even negative returns when speculative traffic interferes with demand requests. The study shows that prefetchers designed to operate independently of demand-side MSHRs improve system performance under high memory pressure, while simpler algorithms such as Best-Offset Prefetching often deliver superior cost–benefit trade-offs compared to more complex approaches. Overall, this thesis demonstrates that effective hardware data prefetching in out-of-order architectures is a system-level challenge that requires careful consideration of resource contention, non-intrusiveness, and implementation cost. By leveraging an open-source RTL platform, this work provides realistic insights into the practical limitations and design trade-offs of modern data prefetching strategies for high-performance RISC-V processors.
ING - Scuola di Ingegneria Industriale e dell'Informazione
26-mar-2026
2025/2026
Questa tesi presenta uno studio approfondito delle tecniche di data prefetching hardware applicate a un processore RISC-V ad alte prestazioni e a esecuzione fuori ordine, utilizzando il Berkeley Out-of-Order Machine (BOOM) come piattaforma di valutazione aperta e realistica. Il lavoro supera le analisi puramente algoritmiche valutando i meccanismi di prefetching direttamente a livello Register Transfer Level (RTL), consentendo di osservare interazioni micro-architetturali che risultano generalmente invisibili nei modelli di simulazione astratti o trace-driven. Diversi prefetcher di stato dell’arte vengono implementati e valutati all’interno della microarchitettura BOOM, con particolare attenzione alla loro interazione con la Load/Store Unit, i Miss Status Holding Registers, la gerarchia di cache e l’interconnessione on-chip. I risultati sperimentali confermano che il data prefetching rappresenta una tecnica efficace per mitigare la latenza di memoria nei carichi di lavoro memory-bound; tuttavia, evidenziano anche come l’efficacia dei prefetcher sia fortemente limitata dalla contesa delle risorse strutturali e dalla loro integrazione micro-architetturale. Uno dei principali risultati di questa tesi è che, nei processori out-of-order, strategie di prefetching eccessivamente aggressive possono produrre benefici marginali o addirittura peggiorare le prestazioni quando il traffico speculativo interferisce con le richieste di memoria effettive. Lo studio mostra inoltre che i prefetcher progettati per operare in modo indipendente dagli MSHR associati alle richieste di domanda migliorano la robustezza del sistema in condizioni di elevata pressione di memoria, mentre algoritmi più semplici come il Best-Offset Prefetching offrono spesso un migliore compromesso tra costo hardware e guadagno prestazionale rispetto a soluzioni più complesse. Nel complesso, questa tesi dimostra che il data prefetching hardware in architetture out-of-order costituisce una sfida di sistema, che richiede un’attenta considerazione della contesa delle risorse, della non intrusività e dei costi di implementazione. Grazie all’utilizzo di una piattaforma RTL open-source, il lavoro fornisce una valutazione realistica dei limiti pratici e dei compromessi progettuali delle moderne strategie di data prefetching per processori RISC-V ad alte prestazioni.
File allegati
File Dimensione Formato  
2026_03_Logallo_Tesi.pdf

solo utenti autorizzati a partire dal 22/02/2027

Descrizione: Testo della Tesi
Dimensione 1.91 MB
Formato Adobe PDF
1.91 MB Adobe PDF   Visualizza/Apri
2026_03_Logallo_Executive Summary.pdf

solo utenti autorizzati a partire dal 22/02/2027

Descrizione: Testo dell'Executive Summary
Dimensione 469.42 kB
Formato Adobe PDF
469.42 kB Adobe PDF   Visualizza/Apri

I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10589/252190