Modern autonomous robots have achieved high proficiency in spatial navigation through Simultaneous Localization and Mapping (SLAM). However, they remain fundamentally disconnected from the semantic history of their environment. While the robot can successfully navigate metric space, it lacks the episodic memory required to recall past events or answer natural language queries about its experience. The advent of Vision-Language Models (VLMs) offers us the required semantic generality to close this gap, enabling open-vocabulary recognition and reasoning that was previously impossible with closed-set perception systems. Nevertheless, applying these technologies to long-horizon robotics presents significant challenges regarding computational efficiency and data privacy. Existing solutions often rely on massive cloud-based infrastructure to handle the cognitive load, introducing unacceptable latency and severe privacy risks. To resolve these conflicts, this thesis presents a fully local architecture for long-horizon spatio-temporal memory. By re-engineering the state-of-the-art ReMEmbR framework for edge deployment, we introduce a lightweight software stack optimized for on-device reasoning. The proposed system utilizes quantized local VLMs orchestrated via a custom dual-bank vector database that explicitly separates static visual descriptions from dynamic temporal events. Furthermore, we investigate the impact of semantic redundancy filtering and visual look-back mechanisms to balance storage efficiency with high-fidelity retrieval. The efficacy of the system is evaluated on the NaVQA benchmark. The experimental results demonstrate that our local implementation not only maintains the reasoning accuracy of cloud-dependent baselines but also significantly outperforms larger open-weight models in spatial grounding tasks. These findings validate that architectural efficiency outweighs raw parameter count, enabling robust and history-aware intelligence entirely on the edge.

I moderni robot autonomi hanno raggiunto livelli eccellenti di competenza nella navigazione spaziale grazie ai sistemi di Localizzazione e Mappatura Simultanee (SLAM). Tuttavia, questi sistemi rimangono fondamentalmente disconnessi dal contesto semantico e storico dell'ambiente circostante. Sebbene i robot siano in grado di navigare efficacemente nello spazio metrico, mancano della memoria episodica necessaria per ricordare eventi passati o rispondere a domande in linguaggio naturale sulla propria esperienza operativa. L'avvento dei Modelli Visione-Linguaggio (VLM) offre la generalità semantica necessaria per colmare questo divario, abilitando capacità di ragionamento e riconoscimento open-vocabulary precedentemente impossibili con i tradizionali sistemi di percezione a vocabolario chiuso. Ciononostante, l'applicazione di queste tecnologie alla robotica a lungo termine presenta sfide significative in termini di efficienza computazionale e tutela della privacy. Le soluzioni attuali dipendono spesso da imponenti infrastrutture cloud per gestire il carico cognitivo, generando latenze inaccettabili e gravi rischi per la privacy legati alla trasmissione di dati video egocentrici potenzialmente sensibili. Per affrontare queste problematiche, questa tesi presenta un'architettura completamente locale e rispettosa della privacy per la gestione della memoria spazio-temporale a lungo termine. Replicando e riprogettando ReMEmbR, il framework rappresentante lo stato dell'arte, per l'esecuzione on-device, introduciamo uno stack software leggero ottimizzato per il ragionamento direttamente sul dispositivo. Il sistema proposto utilizza VLM locali quantizzati, orchestrati attraverso due database vettoriali che separano esplicitamente le descrizioni visive statiche dagli eventi temporali dinamici. Questa architettura permette a un agente di recupero iterativo di scomporre query complesse degli utenti in specifici compiti di ricerca spaziale, temporale e descrittiva, senza dipendere da connettività esterna. Inoltre, vengono analizzati l'impatto del filtraggio della ridondanza semantica e i meccanismi di riesame visivo per bilanciare l'efficienza di archiviazione con un recupero delle informazioni ad alta fedeltà. L'efficacia del sistema è stata valutata rigorosamente sul benchmark NaVQA. I risultati sperimentali dimostrano che la nostra implementazione locale ottimizzata non solo mantiene l'accuratezza di ragionamento delle baseline dipendenti dal cloud, ma supera significativamente modelli open-weight di dimensioni maggiori nelle domande di tipo spaziale. Questi risultati confermano che l'efficienza architetturale e un utilizzo ben orchestrato della memoria sono fattori più determinanti rispetto al mero numero di parametri nel contesto della memoria semantica robotica, dimostrando la possibilità concreta di costruire agenti robusti e consapevoli della propria storia operando interamente in locale.

Long-horizon robot memory and spatio-temporal reasoning with small vision-language models

Natuzzi, Ernesto
2025/2026

Abstract

Modern autonomous robots have achieved high proficiency in spatial navigation through Simultaneous Localization and Mapping (SLAM). However, they remain fundamentally disconnected from the semantic history of their environment. While the robot can successfully navigate metric space, it lacks the episodic memory required to recall past events or answer natural language queries about its experience. The advent of Vision-Language Models (VLMs) offers us the required semantic generality to close this gap, enabling open-vocabulary recognition and reasoning that was previously impossible with closed-set perception systems. Nevertheless, applying these technologies to long-horizon robotics presents significant challenges regarding computational efficiency and data privacy. Existing solutions often rely on massive cloud-based infrastructure to handle the cognitive load, introducing unacceptable latency and severe privacy risks. To resolve these conflicts, this thesis presents a fully local architecture for long-horizon spatio-temporal memory. By re-engineering the state-of-the-art ReMEmbR framework for edge deployment, we introduce a lightweight software stack optimized for on-device reasoning. The proposed system utilizes quantized local VLMs orchestrated via a custom dual-bank vector database that explicitly separates static visual descriptions from dynamic temporal events. Furthermore, we investigate the impact of semantic redundancy filtering and visual look-back mechanisms to balance storage efficiency with high-fidelity retrieval. The efficacy of the system is evaluated on the NaVQA benchmark. The experimental results demonstrate that our local implementation not only maintains the reasoning accuracy of cloud-dependent baselines but also significantly outperforms larger open-weight models in spatial grounding tasks. These findings validate that architectural efficiency outweighs raw parameter count, enabling robust and history-aware intelligence entirely on the edge.
ING - Scuola di Ingegneria Industriale e dell'Informazione
26-mar-2026
2025/2026
I moderni robot autonomi hanno raggiunto livelli eccellenti di competenza nella navigazione spaziale grazie ai sistemi di Localizzazione e Mappatura Simultanee (SLAM). Tuttavia, questi sistemi rimangono fondamentalmente disconnessi dal contesto semantico e storico dell'ambiente circostante. Sebbene i robot siano in grado di navigare efficacemente nello spazio metrico, mancano della memoria episodica necessaria per ricordare eventi passati o rispondere a domande in linguaggio naturale sulla propria esperienza operativa. L'avvento dei Modelli Visione-Linguaggio (VLM) offre la generalità semantica necessaria per colmare questo divario, abilitando capacità di ragionamento e riconoscimento open-vocabulary precedentemente impossibili con i tradizionali sistemi di percezione a vocabolario chiuso. Ciononostante, l'applicazione di queste tecnologie alla robotica a lungo termine presenta sfide significative in termini di efficienza computazionale e tutela della privacy. Le soluzioni attuali dipendono spesso da imponenti infrastrutture cloud per gestire il carico cognitivo, generando latenze inaccettabili e gravi rischi per la privacy legati alla trasmissione di dati video egocentrici potenzialmente sensibili. Per affrontare queste problematiche, questa tesi presenta un'architettura completamente locale e rispettosa della privacy per la gestione della memoria spazio-temporale a lungo termine. Replicando e riprogettando ReMEmbR, il framework rappresentante lo stato dell'arte, per l'esecuzione on-device, introduciamo uno stack software leggero ottimizzato per il ragionamento direttamente sul dispositivo. Il sistema proposto utilizza VLM locali quantizzati, orchestrati attraverso due database vettoriali che separano esplicitamente le descrizioni visive statiche dagli eventi temporali dinamici. Questa architettura permette a un agente di recupero iterativo di scomporre query complesse degli utenti in specifici compiti di ricerca spaziale, temporale e descrittiva, senza dipendere da connettività esterna. Inoltre, vengono analizzati l'impatto del filtraggio della ridondanza semantica e i meccanismi di riesame visivo per bilanciare l'efficienza di archiviazione con un recupero delle informazioni ad alta fedeltà. L'efficacia del sistema è stata valutata rigorosamente sul benchmark NaVQA. I risultati sperimentali dimostrano che la nostra implementazione locale ottimizzata non solo mantiene l'accuratezza di ragionamento delle baseline dipendenti dal cloud, ma supera significativamente modelli open-weight di dimensioni maggiori nelle domande di tipo spaziale. Questi risultati confermano che l'efficienza architetturale e un utilizzo ben orchestrato della memoria sono fattori più determinanti rispetto al mero numero di parametri nel contesto della memoria semantica robotica, dimostrando la possibilità concreta di costruire agenti robusti e consapevoli della propria storia operando interamente in locale.
File allegati
File Dimensione Formato  
2026_03_Natuzzi_Tesi.pdf

accessibile in internet per tutti a partire dal 02/03/2027

Dimensione 5.85 MB
Formato Adobe PDF
5.85 MB Adobe PDF   Visualizza/Apri
2026_03_Natuzzi_Executive Summary.pdf

accessibile in internet per tutti a partire dal 02/03/2027

Dimensione 3.77 MB
Formato Adobe PDF
3.77 MB Adobe PDF   Visualizza/Apri

I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10589/252840