Keyword spotting (KWS) enables low-latency voice interaction in edge and embedded systems and is a key component of always-on speech interfaces operating under strict resource constraints. While state-of-the-art convolutional and Transformer-based artificial neural networks (ANNs) achieve high accuracy on benchmark datasets, their computational complexity and memory requirements limit deployment on ultra-low-power platforms. This thesis addresses these challenges by proposing and evaluating a spiking neural network (SNN) architecture for KWS, integrated with a previously developed Mel-spectrogram-like front end for energy-efficient feature extraction. The proposed model employs Leaky Integrate-and-Fire (LIF) neurons and introduces a novel decompression layer that replaces the standard fully connected layer, reducing parameter count while preserving representational capacity. Training is performed using surrogate gradient learning with backpropagation through time, enabling effective optimization despite the non-differentiability of spike generation. The model was evaluated on the Google Speech Commands v2 dataset, considering both the full 35-word vocabulary plus silence (36 classes) and a reduced 12-class subset commonly adopted in embedded applications. Experimental results show that the proposed SNN achieves competitive accuracy, reaching 87.11% on the 36-class task and 93.27% on the 12-class task, with a compact model size of only 84.71k parameters. Analysis of the network dynamics reveals very low firing rates in the early layers, highlighting the energy-efficiency advantages of event-driven computation. Confusion matrix analysis further indicates that most classification errors arise from acoustically similar word pairs (e.g., “four”/“forward”, “off”/“up”, “three”/“tree”), reflecting inherent phonetic ambiguities in speech recognition. Overall, the results indicate that the proposed SNN architecture achieves a favorable trade-off between accuracy, model size, and computational efficiency compared to conventional ANN-based approaches. While the model leverages spike-based representations and can benefit from sparse computation, its structure is not directly aligned with existing neuromorphic hardware paradigms. Instead, the proposed architecture is well-suited for implementation on custom hardware accelerators (e.g., ASICs), where its low-rank structure and potential for event-driven computation can be exploited to achieve high energy efficiency.

Il keyword spotting (KWS) rappresenta una tecnologia fondamentale per abilitare interazioni vocali a bassa latenza in sistemi edge ed embedded ed è alla base delle interfacce vocali always-on che operano in presenza di severi vincoli energetici e di memoria. Sebbene le reti neurali artificiali (ANN) basate su architetture convoluzionali e Transformer allo stato dell’arte garantiscano elevate prestazioni sui principali dataset di riferimento, la loro complessità computazionale e l’elevato numero di parametri ne limitano l’impiego su piattaforme a bassissimo consumo. Questa tesi affronta tali criticità proponendo e analizzando un’architettura di rete neurale spiking (SNN) per applicazioni di KWS, integrata con un front-end per l’estrazione delle caratteristiche energeticamente efficiente, basato su un processo simile all'estrazione del Mel-spettrogramma, sviluppato in lavori precedenti. Il modello utilizza neuroni Leaky Integrate-and-Fire (LIF) e introduce uno strato di decompressione innovativo in sostituzione del livello completamente connesso tradizionale, con l’obiettivo di ridurre il numero di parametri mantenendo un’adeguata capacità rappresentativa. L’addestramento viene effettuato tramite apprendimento con gradiente surrogato e backpropagation nel tempo, consentendo l'ottimizzazione del modello nonostante la natura non differenziabile del meccanismo di generazione degli spike. Le prestazioni sono state valutate sul dataset Google Speech Commands v2, considerando sia il vocabolario completo composto da 35 parole più la classe “silence” (36 classi totali), sia un sottoinsieme ridotto a 12 classi, comunemente adottato in ambito embedded. I risultati sperimentali mostrano che l’architettura proposta raggiunge prestazioni competitive, con un’accuratezza pari all’87,11% nel caso a 36 classi e al 93,27% nel caso a 12 classi, a fronte di una dimensione del modello contenuta in soli 84,71k parametri. L’analisi delle dinamiche interne della rete evidenzia tassi di attivazione molto ridotti nei primi strati, confermando il potenziale vantaggio in termini di efficienza energetica legato alla natura sparsa ed event-driven delle SNN. Dall’analisi della matrice di confusione emerge inoltre che gli errori principali sono associati a coppie di parole foneticamente simili (ad esempio “four”/“forward”, “off”/“up”, “three”/“tree”), in linea con le ambiguità acustiche intrinseche ai sistemi di riconoscimento vocale. Nel complesso, l’architettura proposta offre un compromesso favorevole tra accuratezza, compattezza del modello ed efficienza computazionale rispetto agli approcci ANN convenzionali. Pur sfruttando rappresentazioni basate su spike e potendo beneficiare della computazione sparsa, la struttura del modello non risulta direttamente compatibile con le attuali piattaforme neuromorfiche general-purpose. Tuttavia, essa si presta in modo particolarmente efficace a un’implementazione su acceleratori hardware dedicati (ad esempio ASIC), dove la struttura a basso rango e la possibilità di elaborazione guidata dagli eventi possono essere pienamente valorizzate per massimizzare l’efficienza energetica.

Research and development of a Spiking Neural Network for keyword spotting

GIANGREGORIO, DANIELE
2025/2026

Abstract

Keyword spotting (KWS) enables low-latency voice interaction in edge and embedded systems and is a key component of always-on speech interfaces operating under strict resource constraints. While state-of-the-art convolutional and Transformer-based artificial neural networks (ANNs) achieve high accuracy on benchmark datasets, their computational complexity and memory requirements limit deployment on ultra-low-power platforms. This thesis addresses these challenges by proposing and evaluating a spiking neural network (SNN) architecture for KWS, integrated with a previously developed Mel-spectrogram-like front end for energy-efficient feature extraction. The proposed model employs Leaky Integrate-and-Fire (LIF) neurons and introduces a novel decompression layer that replaces the standard fully connected layer, reducing parameter count while preserving representational capacity. Training is performed using surrogate gradient learning with backpropagation through time, enabling effective optimization despite the non-differentiability of spike generation. The model was evaluated on the Google Speech Commands v2 dataset, considering both the full 35-word vocabulary plus silence (36 classes) and a reduced 12-class subset commonly adopted in embedded applications. Experimental results show that the proposed SNN achieves competitive accuracy, reaching 87.11% on the 36-class task and 93.27% on the 12-class task, with a compact model size of only 84.71k parameters. Analysis of the network dynamics reveals very low firing rates in the early layers, highlighting the energy-efficiency advantages of event-driven computation. Confusion matrix analysis further indicates that most classification errors arise from acoustically similar word pairs (e.g., “four”/“forward”, “off”/“up”, “three”/“tree”), reflecting inherent phonetic ambiguities in speech recognition. Overall, the results indicate that the proposed SNN architecture achieves a favorable trade-off between accuracy, model size, and computational efficiency compared to conventional ANN-based approaches. While the model leverages spike-based representations and can benefit from sparse computation, its structure is not directly aligned with existing neuromorphic hardware paradigms. Instead, the proposed architecture is well-suited for implementation on custom hardware accelerators (e.g., ASICs), where its low-rank structure and potential for event-driven computation can be exploited to achieve high energy efficiency.
ING - Scuola di Ingegneria Industriale e dell'Informazione
26-mar-2026
2025/2026
Il keyword spotting (KWS) rappresenta una tecnologia fondamentale per abilitare interazioni vocali a bassa latenza in sistemi edge ed embedded ed è alla base delle interfacce vocali always-on che operano in presenza di severi vincoli energetici e di memoria. Sebbene le reti neurali artificiali (ANN) basate su architetture convoluzionali e Transformer allo stato dell’arte garantiscano elevate prestazioni sui principali dataset di riferimento, la loro complessità computazionale e l’elevato numero di parametri ne limitano l’impiego su piattaforme a bassissimo consumo. Questa tesi affronta tali criticità proponendo e analizzando un’architettura di rete neurale spiking (SNN) per applicazioni di KWS, integrata con un front-end per l’estrazione delle caratteristiche energeticamente efficiente, basato su un processo simile all'estrazione del Mel-spettrogramma, sviluppato in lavori precedenti. Il modello utilizza neuroni Leaky Integrate-and-Fire (LIF) e introduce uno strato di decompressione innovativo in sostituzione del livello completamente connesso tradizionale, con l’obiettivo di ridurre il numero di parametri mantenendo un’adeguata capacità rappresentativa. L’addestramento viene effettuato tramite apprendimento con gradiente surrogato e backpropagation nel tempo, consentendo l'ottimizzazione del modello nonostante la natura non differenziabile del meccanismo di generazione degli spike. Le prestazioni sono state valutate sul dataset Google Speech Commands v2, considerando sia il vocabolario completo composto da 35 parole più la classe “silence” (36 classi totali), sia un sottoinsieme ridotto a 12 classi, comunemente adottato in ambito embedded. I risultati sperimentali mostrano che l’architettura proposta raggiunge prestazioni competitive, con un’accuratezza pari all’87,11% nel caso a 36 classi e al 93,27% nel caso a 12 classi, a fronte di una dimensione del modello contenuta in soli 84,71k parametri. L’analisi delle dinamiche interne della rete evidenzia tassi di attivazione molto ridotti nei primi strati, confermando il potenziale vantaggio in termini di efficienza energetica legato alla natura sparsa ed event-driven delle SNN. Dall’analisi della matrice di confusione emerge inoltre che gli errori principali sono associati a coppie di parole foneticamente simili (ad esempio “four”/“forward”, “off”/“up”, “three”/“tree”), in linea con le ambiguità acustiche intrinseche ai sistemi di riconoscimento vocale. Nel complesso, l’architettura proposta offre un compromesso favorevole tra accuratezza, compattezza del modello ed efficienza computazionale rispetto agli approcci ANN convenzionali. Pur sfruttando rappresentazioni basate su spike e potendo beneficiare della computazione sparsa, la struttura del modello non risulta direttamente compatibile con le attuali piattaforme neuromorfiche general-purpose. Tuttavia, essa si presta in modo particolarmente efficace a un’implementazione su acceleratori hardware dedicati (ad esempio ASIC), dove la struttura a basso rango e la possibilità di elaborazione guidata dagli eventi possono essere pienamente valorizzate per massimizzare l’efficienza energetica.
File allegati
File Dimensione Formato  
2026_03_Giangregorio_Executive_Summary.pdf

accessibile in internet per tutti a partire dal 02/03/2027

Descrizione: Executive summary
Dimensione 14.85 MB
Formato Adobe PDF
14.85 MB Adobe PDF   Visualizza/Apri
2026_03_Giangregorio_Tesi.pdf

accessibile in internet per tutti a partire dal 02/03/2027

Descrizione: testo della tesi
Dimensione 41.4 MB
Formato Adobe PDF
41.4 MB Adobe PDF   Visualizza/Apri

I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10589/253632