Decoding imagined speech from single-trial Electroencephalography (EEG) remains a formidable Brain-Computer Interface (BCI) challenge, bottlenecked by low signal-to-noise ratios and non-stationary temporal drift. While Riemannian geometry provides robust spatial representations, traditional Riemannian Deep Learning models rely on computationally expensive eigenvalue decompositions, hindering real-time adaptation. This thesis proposes a highly optimized, Riemannian Deep Learning architecture for the synchronous decoding of a 5-class imagined speech vocabulary. By performing spatial dimensionality reduction in the Euclidean domain, utilizing a differentiable Covariance Shrinkage regularization, and integrating a state-aware Subject Centering Memory module, the proposed model achieves robust Riemannian Alignment with an ultra-lightweight footprint of approximately 2.5k parameters. While standard offline batch evaluation demonstrated strong feature separability and competitive classification accuracy, a strictly causal, \textit{predict-then-adapt} online simulation revealed severe deployment realities. Utilizing an Unconditional Exponential Moving Average (EMA) for continuous geometric adaptation exposed the profound mathematical volatility of single-trial covariance estimation. While highly proficient subjects successfully adapted to temporal drift, low-aptitude users suffered from catastrophic error cascades caused by covariance poisoning.To neutralize this volatility, we introduced a Hybrid Ensemble, fusing the dynamically adapting Riemannian core with robust, static deep learning anchors (EEGNet and Conformer) via a rank-based Z-Softmax Borda Count strategy. This ordinal fusion successfully counteracted the corrupted geometry of non-proficient users, allowing the stable temporal feature extractors to override poisoned spatial adaptations. Ultimately, this thesis explicitly quantifies the strict performance penalties inherent to true causal BCI deployment and establishes a scalable, multi-domain ensembling framework necessary for safe, zero-retraining real-world inference.
La decodifica dell'imagined speech da elettroencefalografia (EEG) single-trial rimane una sfida formidabile per le interfacce cervello-computer (BCI), ostacolata da bassi rapporti segnale-rumore e da una deriva temporale non stazionaria. Sebbene la geometria riemanniana offra rappresentazioni spaziali robuste, i modelli tradizionali di Deep Learning riemanniano si basano su decomposizioni agli autovalori computazionalmente onerose, ostacolando l'adattamento in tempo reale. Questa tesi propone un'architettura di Deep Learning riemanniano altamente ottimizzata per la decodifica sincrona di un vocabolario di imagined speech a 5 classi. Eseguendo la riduzione della dimensionalità spaziale nel dominio euclideo, utilizzando una regolarizzazione differenziabile di Covariance Shrinkage e integrando un modulo state-aware di Subject Centering Memory, il modello proposto ottiene un robusto Allineamento Riemanniano con un'impronta ultra-leggera di circa 2.5k parametri. Sebbene la valutazione standard offline in batch abbia dimostrato una forte separabilità delle feature e un'accuratezza di classificazione competitiva, una simulazione online strettamente causale, predict-then-adapt, ha rivelato le severe realtà dell'implementazione. L'utilizzo di una Media Mobile Esponenziale (EMA) incondizionata per l'adattamento geometrico continuo ha esposto la profonda volatilità matematica della stima della covarianza single-trial. Mentre i soggetti altamente competenti si sono adattati con successo alla deriva temporale, gli utenti con bassa attitudine hanno subito catastrofiche cascate di errori causate dall'avvelenamento della covarianza. Per neutralizzare questa volatilità, abbiamo introdotto un Hybrid Ensemble, fondendo il nucleo riemanniano ad adattamento dinamico con ancore statiche e robuste di deep learning (EEGNet e Conformer) tramite una strategia Borda Count basata sui ranghi con Z-Softmax. Questa fusione ordinale ha contrastato con successo la geometria corrotta degli utenti non competenti, permettendo agli estrattori di feature temporali stabili di sovrascrivere gli adattamenti spaziali avvelenati. In definitiva, questa tesi quantifica esplicitamente le rigide penalità di prestazione inerenti alla vera implementazione causale delle BCI e stabilisce un framework scalabile di ensembling multi-dominio necessario per un'inferenza sicura e zero-retraining nel mondo reale.
Real-time imagined speech decoding using optimized Riemannian deep learning
Calvaresi, Cristiana
2025/2026
Abstract
Decoding imagined speech from single-trial Electroencephalography (EEG) remains a formidable Brain-Computer Interface (BCI) challenge, bottlenecked by low signal-to-noise ratios and non-stationary temporal drift. While Riemannian geometry provides robust spatial representations, traditional Riemannian Deep Learning models rely on computationally expensive eigenvalue decompositions, hindering real-time adaptation. This thesis proposes a highly optimized, Riemannian Deep Learning architecture for the synchronous decoding of a 5-class imagined speech vocabulary. By performing spatial dimensionality reduction in the Euclidean domain, utilizing a differentiable Covariance Shrinkage regularization, and integrating a state-aware Subject Centering Memory module, the proposed model achieves robust Riemannian Alignment with an ultra-lightweight footprint of approximately 2.5k parameters. While standard offline batch evaluation demonstrated strong feature separability and competitive classification accuracy, a strictly causal, \textit{predict-then-adapt} online simulation revealed severe deployment realities. Utilizing an Unconditional Exponential Moving Average (EMA) for continuous geometric adaptation exposed the profound mathematical volatility of single-trial covariance estimation. While highly proficient subjects successfully adapted to temporal drift, low-aptitude users suffered from catastrophic error cascades caused by covariance poisoning.To neutralize this volatility, we introduced a Hybrid Ensemble, fusing the dynamically adapting Riemannian core with robust, static deep learning anchors (EEGNet and Conformer) via a rank-based Z-Softmax Borda Count strategy. This ordinal fusion successfully counteracted the corrupted geometry of non-proficient users, allowing the stable temporal feature extractors to override poisoned spatial adaptations. Ultimately, this thesis explicitly quantifies the strict performance penalties inherent to true causal BCI deployment and establishes a scalable, multi-domain ensembling framework necessary for safe, zero-retraining real-world inference.| File | Dimensione | Formato | |
|---|---|---|---|
|
2026_07_Calvaresi_Executive Summary.pdf
accessibile in internet solo dagli utenti autorizzati
Descrizione: Testo Executive Summary
Dimensione
874.06 kB
Formato
Adobe PDF
|
874.06 kB | Adobe PDF | Visualizza/Apri |
|
2026_07_Calvaresi_Tesi.pdf
accessibile in internet solo dagli utenti autorizzati
Descrizione: Testo Tesi
Dimensione
7.06 MB
Formato
Adobe PDF
|
7.06 MB | Adobe PDF | Visualizza/Apri |
I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.
https://hdl.handle.net/10589/259418