Deploying deep learning models on resource-constrained devices, such as smart wearables, enhances user privacy by keeping biometric data local. However, edge-based speaker verification faces performance degradation from voice drift and ambient noise, requiring on-device adaptation. Traditional paradigms present a trade-off on constrained hardware: non-parametric, instance-based models adapt quickly but scale poorly in latency and memory as data accumulates, while parametric models maintain constant inference complexity but overfit when initial training data is scarce. This work addresses this trade-off by introducing an adaptive speaker verification architecture, tailored for smart eyewear, that transitions from a non-parametric, instance-based classifier to a parametric, tied-weights autoencoder over a discrete time horizon. The sequential pipeline integrates Mel-Frequency Cepstral Coefficients extraction, a convolutional keyword spotter, a speaker feature extractor, and a lightweight verification head operating as a one-class classifier. To guide the transition as data accumulates, two frameworks are presented, based on the available scenarios: the supervised Continual Buffered Fine-Tuning, which employs a redundancy minimisation policy to preserve acoustic variability, and the semi-supervised Dynamic Instance Reweighting, which dynamically updates template importance weights. Experimental evaluations show that the system efficiently manages this transition also under domain imbalances and acoustic shifts, with the autoencoder model reaching an empirical accuracy and AUC crossover point after 32 to 48 utterances. Furthermore, the instance reweighting framework effectively absorbs false positives without boundary corruption, showing the viability of multi-paradigm learning on resource-constrained microcontrollers.

L'esecuzione di modelli di deep learning su dispositivi edge a risorse limitate, come i dispositivi wearable, tutela la privacy mantenendo locali i dati biometrici. Tuttavia, i sistemi di riconoscimento vocale in ambito edge perdono precisione a causa di cambiamenti della voce e del rumore ambientale, richiedendo l'adattamento sul dispositivo. I paradigmi tradizionali presentano un trade-off su hardware limitato: i modelli non parametrici, basati su istanze, si adattano rapidamente ma rallentano l'inferenza al crescere dei dati, mentre i modelli parametrici mantengono complessità costante ma soffrono di overfitting con pochi dati iniziali. Questo lavoro affronta questo compromesso introducendo un'architettura adattiva di riconoscimento vocale, pensata per smart eyewear, che passa da un classificatore basato su istanze a un autoencoder a pesi condivisi, su un orizzonte temporale discreto. La pipeline sequenziale integra l'estrazione di coefficienti MFCC, un keyword spotter convoluzionale, un estrattore di feature del parlante e un modulo di verifica che opera come classificatore a singola classe. Due framework distinti guidano la transizione al crescere dei dati, in base agli scenari: il framework di Continual Buffered Fine-Tuning, supervisionato, con una politica di sostituzione a minima ridondanza per preservare la variabilità acustica, e il framework di Dynamic Instance Reweighting, semi-supervisionato, che aggiorna dinamicamente i pesi dei template. I risultati sperimentali mostrano che il sistema gestisce la transizione anche con domini sbilanciati e variazioni acustiche, con il modello autoencoder che raggiunge un punto di crossover per accuratezza e AUC dopo circa 32-48 campioni. Infine, il framework di Dynamic Instance Reweighting assorbe efficacemente la presenza di falsi positivi senza corrompere i confini decisionali, validando l'apprendimento multiparadigma su microcontrollori a risorse limitate.

Speaker verification on the edge: from instance-based to parametric models in resource-constrained environments

Figini, Matteo
2025/2026

Abstract

Deploying deep learning models on resource-constrained devices, such as smart wearables, enhances user privacy by keeping biometric data local. However, edge-based speaker verification faces performance degradation from voice drift and ambient noise, requiring on-device adaptation. Traditional paradigms present a trade-off on constrained hardware: non-parametric, instance-based models adapt quickly but scale poorly in latency and memory as data accumulates, while parametric models maintain constant inference complexity but overfit when initial training data is scarce. This work addresses this trade-off by introducing an adaptive speaker verification architecture, tailored for smart eyewear, that transitions from a non-parametric, instance-based classifier to a parametric, tied-weights autoencoder over a discrete time horizon. The sequential pipeline integrates Mel-Frequency Cepstral Coefficients extraction, a convolutional keyword spotter, a speaker feature extractor, and a lightweight verification head operating as a one-class classifier. To guide the transition as data accumulates, two frameworks are presented, based on the available scenarios: the supervised Continual Buffered Fine-Tuning, which employs a redundancy minimisation policy to preserve acoustic variability, and the semi-supervised Dynamic Instance Reweighting, which dynamically updates template importance weights. Experimental evaluations show that the system efficiently manages this transition also under domain imbalances and acoustic shifts, with the autoencoder model reaching an empirical accuracy and AUC crossover point after 32 to 48 utterances. Furthermore, the instance reweighting framework effectively absorbs false positives without boundary corruption, showing the viability of multi-paradigm learning on resource-constrained microcontrollers.
ING - Scuola di Ingegneria Industriale e dell'Informazione
22-lug-2026
2025/2026
L'esecuzione di modelli di deep learning su dispositivi edge a risorse limitate, come i dispositivi wearable, tutela la privacy mantenendo locali i dati biometrici. Tuttavia, i sistemi di riconoscimento vocale in ambito edge perdono precisione a causa di cambiamenti della voce e del rumore ambientale, richiedendo l'adattamento sul dispositivo. I paradigmi tradizionali presentano un trade-off su hardware limitato: i modelli non parametrici, basati su istanze, si adattano rapidamente ma rallentano l'inferenza al crescere dei dati, mentre i modelli parametrici mantengono complessità costante ma soffrono di overfitting con pochi dati iniziali. Questo lavoro affronta questo compromesso introducendo un'architettura adattiva di riconoscimento vocale, pensata per smart eyewear, che passa da un classificatore basato su istanze a un autoencoder a pesi condivisi, su un orizzonte temporale discreto. La pipeline sequenziale integra l'estrazione di coefficienti MFCC, un keyword spotter convoluzionale, un estrattore di feature del parlante e un modulo di verifica che opera come classificatore a singola classe. Due framework distinti guidano la transizione al crescere dei dati, in base agli scenari: il framework di Continual Buffered Fine-Tuning, supervisionato, con una politica di sostituzione a minima ridondanza per preservare la variabilità acustica, e il framework di Dynamic Instance Reweighting, semi-supervisionato, che aggiorna dinamicamente i pesi dei template. I risultati sperimentali mostrano che il sistema gestisce la transizione anche con domini sbilanciati e variazioni acustiche, con il modello autoencoder che raggiunge un punto di crossover per accuratezza e AUC dopo circa 32-48 campioni. Infine, il framework di Dynamic Instance Reweighting assorbe efficacemente la presenza di falsi positivi senza corrompere i confini decisionali, validando l'apprendimento multiparadigma su microcontrollori a risorse limitate.
File allegati
File Dimensione Formato  
2026_07_Figini_ExecutiveSummary.pdf

accessibile in internet per tutti a partire dal 02/07/2027

Descrizione: Executive Summary
Dimensione 1.12 MB
Formato Adobe PDF
1.12 MB Adobe PDF   Visualizza/Apri
2026_07_Figini_Tesi.pdf

accessibile in internet per tutti a partire dal 02/07/2027

Descrizione: Tesi
Dimensione 3.27 MB
Formato Adobe PDF
3.27 MB Adobe PDF   Visualizza/Apri

I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10589/261200