Speech Emotion Recognition (SER) has advanced rapidly, yet the field's most capable models seldom reach the operational settings that motivate them. Production deployments routinely collapse rich model outputs to a single dominant label, bind the temporal behaviour of the system to one specific model, and leave operators with little insight into how uncertain a prediction is. This thesis presents the design, implementation, and evaluation of a modular, real-time SER platform for call-centre monitoring that preserves the full probabilistic richness of model outputs, from inference through to the operator-facing visualisation. The system is built on five contributions. A hexagonal architecture with a dependency-injection container factorises three interchangeable SER backends, a BiLSTM and two Whisper-based checkpoints (categorical and dimensional), behind a uniform port interface, enabling session-level backend selection without any change to the surrounding pipeline. A probabilistic temporal aggregation algorithm turns the raw sliding-window event stream into stable, regularly spaced frames and transcript-enriched utterances while preserving the posterior distribution at every granularity. A distances-to-probabilities inversion grounds the dimensional backend in Russell's circumplex geometry, mapping continuous valence--arousal estimates to categorical distributions and making the dimensional model a structurally equal citizen of the pipeline. A set of empirically grounded operating points fixes the configuration of the system, and an interpretability-first visualisation layer renders the preserved distributions as a probability-weighted circumplex, an interpolated-colour emotional timeline, and an uncertainty-annotated transcript. The evaluation, built on a synthetic geometric suite and four real Italian call-centre sessions, confirms the intended geometric properties of the conversion exactly, shows that aggregation reduces inter-frame jitter by about 70% without collapsing the distributions, and demonstrates the full pipeline running in real time (real-time factor < 0.75) on a commodity laptop. Together these results show that distributional, interpretability-first SER is deployable today on consumer hardware.

Il riconoscimento delle emozioni dal parlato (Speech Emotion Recognition, SER) ha conosciuto rapidi progressi, ma i modelli più capaci raramente raggiungono i contesti operativi che ne motivano lo sviluppo. I sistemi in produzione tipicamente riducono le ricche uscite dei modelli a una singola etichetta dominante, vincolano il comportamento temporale del sistema a uno specifico modello e offrono agli operatori scarsa visibilità sul grado di incertezza di ciascuna predizione. Questa tesi presenta la progettazione, l'implementazione e la valutazione di una piattaforma SER modulare e in tempo reale per il monitoraggio di call center, che preserva l'intera ricchezza probabilistica delle uscite dei modelli, dall'inferenza fino alla visualizzazione destinata all'operatore. Il sistema si fonda su cinque contributi. Un'architettura esagonale con un container di dependency injection fattorizza tre backend SER intercambiabili, una BiLSTM e due checkpoint basati su Whisper (categorico e dimensionale), dietro un'interfaccia di porta uniforme, consentendo la selezione del backend a livello di sessione senza alcuna modifica al resto della pipeline. Un algoritmo di aggregazione temporale probabilistica trasforma il flusso grezzo di eventi a finestra scorrevole in frame stabili e regolarmente spaziati e in enunciati arricchiti dalla trascrizione, preservando la distribuzione a posteriori a ogni livello di granularità. Un'inversione da distanze a probabilità ancora il backend dimensionale alla geometria del circumplesso di Russell, mappando le stime continue di valenza e attivazione in distribuzioni categoriche e rendendo il modello dimensionale un cittadino strutturalmente paritario della pipeline. Un insieme di punti operativi fondati empiricamente fissa la configurazione del sistema, e un livello di visualizzazione orientato all'interpretabilità rende le distribuzioni preservate come un circumplesso pesato per probabilità, una linea temporale emotiva a colori interpolati e una trascrizione annotata con l'incertezza. La valutazione, basata su una suite geometrica sintetica e su quattro sessioni reali di call center in lingua italiana, conferma esattamente le proprietà geometriche attese della conversione, mostra che l'aggregazione riduce il jitter tra frame di circa il 70% senza far collassare le distribuzioni e dimostra l'esecuzione dell'intera pipeline in tempo reale (fattore di tempo reale <0.75) su un laptop di fascia consumer. Nel complesso, questi risultati mostrano che un SER distribuzionale e orientato all'interpretabilità e oggi implementabile su hardware di consumo.

Speech Emotion Recognition in the real world: a modular pipeline for real-time deployment and emotion-aware interaction

Morcavallo, Pietro
2025/2026

Abstract

Speech Emotion Recognition (SER) has advanced rapidly, yet the field's most capable models seldom reach the operational settings that motivate them. Production deployments routinely collapse rich model outputs to a single dominant label, bind the temporal behaviour of the system to one specific model, and leave operators with little insight into how uncertain a prediction is. This thesis presents the design, implementation, and evaluation of a modular, real-time SER platform for call-centre monitoring that preserves the full probabilistic richness of model outputs, from inference through to the operator-facing visualisation. The system is built on five contributions. A hexagonal architecture with a dependency-injection container factorises three interchangeable SER backends, a BiLSTM and two Whisper-based checkpoints (categorical and dimensional), behind a uniform port interface, enabling session-level backend selection without any change to the surrounding pipeline. A probabilistic temporal aggregation algorithm turns the raw sliding-window event stream into stable, regularly spaced frames and transcript-enriched utterances while preserving the posterior distribution at every granularity. A distances-to-probabilities inversion grounds the dimensional backend in Russell's circumplex geometry, mapping continuous valence--arousal estimates to categorical distributions and making the dimensional model a structurally equal citizen of the pipeline. A set of empirically grounded operating points fixes the configuration of the system, and an interpretability-first visualisation layer renders the preserved distributions as a probability-weighted circumplex, an interpolated-colour emotional timeline, and an uncertainty-annotated transcript. The evaluation, built on a synthetic geometric suite and four real Italian call-centre sessions, confirms the intended geometric properties of the conversion exactly, shows that aggregation reduces inter-frame jitter by about 70% without collapsing the distributions, and demonstrates the full pipeline running in real time (real-time factor < 0.75) on a commodity laptop. Together these results show that distributional, interpretability-first SER is deployable today on consumer hardware.
ING - Scuola di Ingegneria Industriale e dell'Informazione
22-lug-2026
2025/2026
Il riconoscimento delle emozioni dal parlato (Speech Emotion Recognition, SER) ha conosciuto rapidi progressi, ma i modelli più capaci raramente raggiungono i contesti operativi che ne motivano lo sviluppo. I sistemi in produzione tipicamente riducono le ricche uscite dei modelli a una singola etichetta dominante, vincolano il comportamento temporale del sistema a uno specifico modello e offrono agli operatori scarsa visibilità sul grado di incertezza di ciascuna predizione. Questa tesi presenta la progettazione, l'implementazione e la valutazione di una piattaforma SER modulare e in tempo reale per il monitoraggio di call center, che preserva l'intera ricchezza probabilistica delle uscite dei modelli, dall'inferenza fino alla visualizzazione destinata all'operatore. Il sistema si fonda su cinque contributi. Un'architettura esagonale con un container di dependency injection fattorizza tre backend SER intercambiabili, una BiLSTM e due checkpoint basati su Whisper (categorico e dimensionale), dietro un'interfaccia di porta uniforme, consentendo la selezione del backend a livello di sessione senza alcuna modifica al resto della pipeline. Un algoritmo di aggregazione temporale probabilistica trasforma il flusso grezzo di eventi a finestra scorrevole in frame stabili e regolarmente spaziati e in enunciati arricchiti dalla trascrizione, preservando la distribuzione a posteriori a ogni livello di granularità. Un'inversione da distanze a probabilità ancora il backend dimensionale alla geometria del circumplesso di Russell, mappando le stime continue di valenza e attivazione in distribuzioni categoriche e rendendo il modello dimensionale un cittadino strutturalmente paritario della pipeline. Un insieme di punti operativi fondati empiricamente fissa la configurazione del sistema, e un livello di visualizzazione orientato all'interpretabilità rende le distribuzioni preservate come un circumplesso pesato per probabilità, una linea temporale emotiva a colori interpolati e una trascrizione annotata con l'incertezza. La valutazione, basata su una suite geometrica sintetica e su quattro sessioni reali di call center in lingua italiana, conferma esattamente le proprietà geometriche attese della conversione, mostra che l'aggregazione riduce il jitter tra frame di circa il 70% senza far collassare le distribuzioni e dimostra l'esecuzione dell'intera pipeline in tempo reale (fattore di tempo reale <0.75) su un laptop di fascia consumer. Nel complesso, questi risultati mostrano che un SER distribuzionale e orientato all'interpretabilità e oggi implementabile su hardware di consumo.
File allegati
File Dimensione Formato  
2026_07_Morcavallo.pdf

accessibile in internet per tutti

Descrizione: Thesis
Dimensione 3.72 MB
Formato Adobe PDF
3.72 MB Adobe PDF Visualizza/Apri
2026_07_Morcavallo_Executive Summary.pdf

accessibile in internet per tutti

Descrizione: Executive Summary
Dimensione 963.07 kB
Formato Adobe PDF
963.07 kB Adobe PDF Visualizza/Apri

I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10589/260222