Continuous multimodal sensing for context and activity recognition on wearable devices, such as smartwatches, is fundamentally constrained by severe battery limitations. While approaches combining inertial measurement units with acoustic data achieve high recognition accuracy, the continuous nature of high-resolution audio sampling and the associated deep learning inference create an unsustainable energy burden. Existing solutions often rely on static sensor configurations or naive sub-sampling, leading to poor generalization across diverse acoustic environments and user behaviors. To address this challenge, this thesis proposes a generalized, end-to-end adaptive sampling architecture designed to dynamically optimize both sensor configuration and computational depth in real-time. We introduce an ultra-lightweight sampling rate selector, which leverages an inertial context embedding to predict the optimal audio sampling frequency via a differentiable Gumbel-Softmax policy. This allows the system to seamlessly transition from an inertial-only state up to maximum acoustic resolution based on immediate environmental needs. Furthermore, the extracted features are processed by a multi-exit cascaded backbone equipped with a confidence-based gating mechanism, allowing the network to terminate inference early for easily recognizable instances. The system is jointly optimized using a multi-objective loss function that balances task accuracy against a dynamic hardware cost penalty. The model achieves a state-of-the-art context-aware balanced accuracy of 95.00%, outperforming established baselines while significantly improving energy efficiency. In particular, the proposed dynamic architecture reduces the computational cost (MACs) by 51.4%. Crucially, the depth-adaptive cascade intrinsically minimizes the average dynamic computational cost by enabling early exits for simple instances. Ultimately, this work demonstrates that dynamic, input-conditioned neural routing can effectively bridge the gap between high-fidelity multimodal context recognition and wearable energy autonomy.

Il rilevamento multimodale continuo per il riconoscimento di contesto e attività su dispositivi indossabili, come gli smartwatch, è intrinsecamente limitato da severe restrizioni energetiche. Sebbene gli approcci che combinano unità di misura inerziali (IMU) e dati acustici raggiungano elevate prestazioni di riconoscimento, la natura continua del campionamento audio ad alta risoluzione e la relativa inferenza tramite deep learning comportano un consumo energetico insostenibile. Le soluzioni esistenti si basano spesso su configurazioni statiche dei sensori o su strategie di sotto-campionamento semplicistiche, con conseguente scarsa capacità di generalizzazione in ambienti acustici eterogenei e tra differenti comportamenti degli utenti. Per affrontare questa sfida, la presente tesi propone un’architettura di campionamento adattiva, generalizzata ed end-to-end, progettata per ottimizzare dinamicamente sia la configurazione dei sensori sia la profondità computazionale in tempo reale. Introduciamo un selettore di frequenza di campionamento ultra-leggero, che sfrutta un embedding del contesto inerziale per predire la frequenza di campionamento audio ottimale tramite una politica differenziabile basata su Gumbel-Softmax. Ciò consente al sistema di passare in modo fluido da uno stato esclusivamente inerziale fino alla massima risoluzione acustica, in funzione delle esigenze ambientali immediate. Inoltre, le caratteristiche estratte vengono elaborate da una backbone a cascata multi-exit dotata di un meccanismo di gating basato sulla confidenza, che permette alla rete di terminare l’inferenza anticipatamente nei casi facilmente riconoscibili. Il sistema è ottimizzato congiuntamente mediante una funzione di perdita multi-obiettivo che bilancia l’accuratezza del compito con una penalizzazione dinamica del costo hardware. Il modello raggiunge un’accuratezza bilanciata context-aware pari al 95,00%, superando i baseline consolidati e migliorando significativamente l’efficienza energetica. In particolare, l’architettura dinamica proposta riduce il costo computazionale (MACs) del 51,4%. Inoltre, la cascata adattiva in profondità riduce intrinsecamente il carico computazionale medio grazie alla possibilità di effettuare uscite anticipate per le istanze più semplici. In conclusione, questo lavoro dimostra che un instradamento neurale dinamico e condizionato dall’input può colmare efficacemente il divario tra il riconoscimento multimodale ad alta fedeltà e l’autonomia energetica dei dispositivi indossabili.

End-to-end adaptive network for energy-efficient dynamic sensor configuration

Laganà, Daniele
2025/2026

Abstract

Continuous multimodal sensing for context and activity recognition on wearable devices, such as smartwatches, is fundamentally constrained by severe battery limitations. While approaches combining inertial measurement units with acoustic data achieve high recognition accuracy, the continuous nature of high-resolution audio sampling and the associated deep learning inference create an unsustainable energy burden. Existing solutions often rely on static sensor configurations or naive sub-sampling, leading to poor generalization across diverse acoustic environments and user behaviors. To address this challenge, this thesis proposes a generalized, end-to-end adaptive sampling architecture designed to dynamically optimize both sensor configuration and computational depth in real-time. We introduce an ultra-lightweight sampling rate selector, which leverages an inertial context embedding to predict the optimal audio sampling frequency via a differentiable Gumbel-Softmax policy. This allows the system to seamlessly transition from an inertial-only state up to maximum acoustic resolution based on immediate environmental needs. Furthermore, the extracted features are processed by a multi-exit cascaded backbone equipped with a confidence-based gating mechanism, allowing the network to terminate inference early for easily recognizable instances. The system is jointly optimized using a multi-objective loss function that balances task accuracy against a dynamic hardware cost penalty. The model achieves a state-of-the-art context-aware balanced accuracy of 95.00%, outperforming established baselines while significantly improving energy efficiency. In particular, the proposed dynamic architecture reduces the computational cost (MACs) by 51.4%. Crucially, the depth-adaptive cascade intrinsically minimizes the average dynamic computational cost by enabling early exits for simple instances. Ultimately, this work demonstrates that dynamic, input-conditioned neural routing can effectively bridge the gap between high-fidelity multimodal context recognition and wearable energy autonomy.
ING - Scuola di Ingegneria Industriale e dell'Informazione
26-mar-2026
2025/2026
Il rilevamento multimodale continuo per il riconoscimento di contesto e attività su dispositivi indossabili, come gli smartwatch, è intrinsecamente limitato da severe restrizioni energetiche. Sebbene gli approcci che combinano unità di misura inerziali (IMU) e dati acustici raggiungano elevate prestazioni di riconoscimento, la natura continua del campionamento audio ad alta risoluzione e la relativa inferenza tramite deep learning comportano un consumo energetico insostenibile. Le soluzioni esistenti si basano spesso su configurazioni statiche dei sensori o su strategie di sotto-campionamento semplicistiche, con conseguente scarsa capacità di generalizzazione in ambienti acustici eterogenei e tra differenti comportamenti degli utenti. Per affrontare questa sfida, la presente tesi propone un’architettura di campionamento adattiva, generalizzata ed end-to-end, progettata per ottimizzare dinamicamente sia la configurazione dei sensori sia la profondità computazionale in tempo reale. Introduciamo un selettore di frequenza di campionamento ultra-leggero, che sfrutta un embedding del contesto inerziale per predire la frequenza di campionamento audio ottimale tramite una politica differenziabile basata su Gumbel-Softmax. Ciò consente al sistema di passare in modo fluido da uno stato esclusivamente inerziale fino alla massima risoluzione acustica, in funzione delle esigenze ambientali immediate. Inoltre, le caratteristiche estratte vengono elaborate da una backbone a cascata multi-exit dotata di un meccanismo di gating basato sulla confidenza, che permette alla rete di terminare l’inferenza anticipatamente nei casi facilmente riconoscibili. Il sistema è ottimizzato congiuntamente mediante una funzione di perdita multi-obiettivo che bilancia l’accuratezza del compito con una penalizzazione dinamica del costo hardware. Il modello raggiunge un’accuratezza bilanciata context-aware pari al 95,00%, superando i baseline consolidati e migliorando significativamente l’efficienza energetica. In particolare, l’architettura dinamica proposta riduce il costo computazionale (MACs) del 51,4%. Inoltre, la cascata adattiva in profondità riduce intrinsecamente il carico computazionale medio grazie alla possibilità di effettuare uscite anticipate per le istanze più semplici. In conclusione, questo lavoro dimostra che un instradamento neurale dinamico e condizionato dall’input può colmare efficacemente il divario tra il riconoscimento multimodale ad alta fedeltà e l’autonomia energetica dei dispositivi indossabili.
File allegati
File Dimensione Formato  
2026_03_Lagana_Executive Summary.pdf

accessibile in internet per tutti a partire dal 26/02/2029

Descrizione: Executive Summary
Dimensione 1.49 MB
Formato Adobe PDF
1.49 MB Adobe PDF   Visualizza/Apri
2026_03_Lagana_Tesi.pdf

accessibile in internet per tutti a partire dal 26/02/2029

Descrizione: Article Thesis
Dimensione 3.62 MB
Formato Adobe PDF
3.62 MB Adobe PDF   Visualizza/Apri

I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10589/252035