3D digitization plays a vital role in documentation, preservation, analysis, and monitoring across various fields, including cultural heritage, urban planning, and engineering applications. While traditional methods, such as photogrammetry and terrestrial laser scanning (TLS), yield accurate 3D models, they are hindered by slow data acquisition and labor-intensive processing, especially in large or complex environments. Mobile mapping systems (MMSs) equipped with simultaneous localization and mapping (SLAM) technology accelerate fieldwork and offer flexible data acquisition, but still require significant post-processing to achieve accuracy and completeness. Semantic enrichment, which is essential for the interpretability and usability of 3D data, typically depends on computationally intensive 3D point cloud processing techniques. This thesis addresses these challenges by developing a multi-camera MMS that supports real-time data acquisition and near-real-time optimization while maintaining survey-grade accuracy, and by introducing a novel 2D-to-3D semantic segmentation and enrichment framework. A comprehensive review of MMSs technologies encompasses various platforms, including vehicle-mounted, backpack, and handheld systems, as well as sensing modalities such as LiDAR, vision-only, and hybrid approaches. The review also addresses sensor integration, deployment strategies, and system limitations. Most MMS utilize LiDAR-centric SLAM, whereas vision-only MMS for real-time surveying remain in early stages of development, with commercial solutions often restricted to image capture rather than real-time mapping. In addition, the backbone principles of visual SLAM (V-SLAM) algorithms, configurations, and trends are reviewed. V-SLAM developments are predominantly designed for robotics applications and autonomous navigation, typically employing monocular or stereo configurations and validated on controlled datasets. These algorithms are rarely evaluated in real-world surveying scenarios that involve challenging conditions, such as narrow passages, low-light environments, or feature-scarce environments. As a result, current systems often do not achieve survey-grade accuracy and require further adaptation for reliable field deployment. To address these limitations, this thesis introduces ATOM-ANT3D, an enhanced multi-camera fisheye MMS. The system incorporates a unified Acquisition and Control Unit (ACU) that enables synchronized camera control, efficient data management, and seamless integration with V-SLAM components, utilizing open-source tools such as Spinnaker, OpenCV, and ROS. Hardware improvements facilitate increased data throughput and onboard processing capabilities. The Multi-Instance V-SLAM, an adapted extension of ORB-SLAM3, supports synchronized multi-camera input and data fusion, outperforming traditional monocular and stereo configurations. Improved tracking, mapping, and safety mechanisms contribute to stable and robust system performance. This multi-camera strategy introduces redundancy, ensuring reliable tracking, and accelerates the digitization process. To further enhance accuracy, two near-real-time post-optimization techniques are proposed: (i) Multi-Camera Pose Graph Optimization, which fuses multi-camera pose estimates into a unique optimized solution, and (ii) Multi-View Feature-Based Optimization, which utilizes V-SLAM multi-camera poses and inter-camera constraints. These methods achieve centimeter-level accuracy while reducing computational time requirements. In addition, a 2D-to-3D semantic enrichment framework is introduced, projecting AI-based 2D image object detections onto 3D reconstructions generated by the V-SLAM data. This framework leverages pre-trained and state-of-the-art 2D object detection and segmentation models and rich information contained in images to reduce manual labeling and computational costs compared to 3D-based techniques, while improving the semantic detail of both common and fine-scale features in 3D models. The complete pipeline, including the ATOM-ANT3D MMS platform, real-time multi-camera SLAM, near-real-time optimization techniques, and 2D-to-3D semantic segmentation and enrichment, was evaluated through multiple real-world challenging case studies. Assessments employed survey-grade ground control and independent verification to quantify geometric accuracy, completeness, and time-to-deliverable. Across all datasets, the proposed pipeline achieved centimeter-level geometric accuracy and reduced end-to-end acquisition-to-processing time by 91 to 94 percent compared to a standard photogrammetric workflow. The 2D-to-3D semantic enrichment approach achieved F1 scores ranging from approximately 80 to 92 percent across architectural and fine-scale classes, including stone blocks, material detachment or loss, and architectural elements such as arches, columns, walls, etc. These findings demonstrate accelerated fieldwork, real-time localization and mapping with survey-grade accuracy, and effective semantic enrichment. In summary, this thesis offers a practical innovation and advancement for 3D digitization by presenting a comprehensive framework, identifying current limitations, and proposing solutions and guidelines, while highlighting opportunities for future research and further improvement.
La digitalizzazione 3D svolge un ruolo fondamentale nella documentazione, nella conservazione, nell'analisi e nel monitoraggio in diversi ambiti, tra cui il patrimonio culturale, la pianificazione urbana e le applicazioni ingegneristiche. Sebbene i metodi tradizionali, come la fotogrammetria e la scansione laser terrestre (TLS), producano modelli 3D accurati, sono ostacolati dalla lentezza dell’acquisizione dei dati e dall’elevato impegno richiesto dall’elaborazione, soprattutto in ambienti di grandi dimensioni o complessi. I sistemi di mappatura mobile (MMS) dotati di tecnologia di localizzazione e mappatura simultanea (SLAM) accelerano il lavoro sul campo e offrono un’acquisizione dei dati flessibile, ma richiedono comunque una post-elaborazione significativa per ottenere accuratezza e completezza. L'arricchimento semantico, essenziale per l'interpretabilità e l'usabilità dei dati 3D, dipende in genere da tecniche di elaborazione di nuvole di punti 3D ad alta intensità computazionale. Questa tesi affronta queste sfide sviluppando un MMS multi-camera che supporta l'acquisizione dati in tempo reale e l'ottimizzazione quasi in tempo reale, mantenendo al contempo un'accuratezza di livello topografico, e introducendo un nuovo framework di segmentazione e arricchimento semantico 2D-3D. Una revisione completa delle tecnologie MMS comprende diverse piattaforme, inclusi sistemi montati su veicoli, zaini e portatili, nonché modalità di acquisizione come approcci LiDAR, solo visione e ibridi. La revisione affronta anche l'integrazione dei sensori, le strategie di implementazione e le limitazioni dei sistemi. La maggior parte degli MMS utilizza SLAM basati su LiDAR, mentre gli MMS basati esclusivamente sulla visione per il rilevamento in tempo reale sono ancora in fase iniziale di sviluppo, con soluzioni commerciali spesso limitate all'acquisizione di immagini piuttosto che alla mappatura in tempo reale. Inoltre, vengono esaminati i principi fondamentali, le configurazioni e le tendenze degli algoritmi di visual SLAM (V-SLAM). Gli sviluppi del V-SLAM sono progettati principalmente per applicazioni robotiche e navigazione autonoma, impiegando tipicamente configurazioni monoculari o stereoscopiche e convalidati su set di dati controllati. Questi algoritmi vengono raramente valutati in scenari di rilevamento reali che comportano condizioni difficili, come passaggi stretti, ambienti scarsamente illuminati o ambienti con scarsità di feature. Di conseguenza, i sistemi attuali spesso non raggiungono un'accuratezza di livello topografico e richiedono ulteriori adattamenti per un'implementazione affidabile sul campo. Per superare queste limitazioni, questa tesi introduce ATOM-ANT3D, un MMS fisheye multi-camera migliorato. Il sistema incorpora un'unità di acquisizione e controllo (ACU) unificata che consente il controllo sincronizzato delle telecamera, una gestione efficiente dei dati e una fluida integrazione con i componenti V-SLAM, utilizzando strumenti open source come Spinnaker, OpenCV e ROS. I miglioramenti hardware consentono un aumento della velocità di trasferimento dei dati e delle capacità di elaborazione a bordo. Il V-SLAM multi-istanza, un'estensione adattata di ORB-SLAM3, supporta input multicamera sincronizzati e la fusione dei dati, superando le tradizionali configurazioni monoculari e stereo. Meccanismi migliorati di tracking, mapping e sicurezza contribuiscono a prestazioni di sistema stabili e robuste. Questa strategia multi-camera introduce ridondanza, garantendo un tracking affidabile e accelerando il processo di digitalizzazione. Per migliorare ulteriormente l'accuratezza, vengono proposte due tecniche di post-ottimizzazione quasi in tempo reale: (i) Multi-Camera Pose Graph Optimization, che fonde le stime di posa multi-camera in un'unica soluzione ottimizzata, e (ii) Multi-View Feature-Based Optimization, che utilizza pose multi-camera V-SLAM e vincoli inter-camera. Questi metodi raggiungono un'accuratezza centimetrica riducendo al contempo i tempi di calcolo. Inoltre, viene introdotto un framework di arricchimento semantico 2D-3D, che proietta i rilevamenti di oggetti nelle immagini 2D basati su intelligenza artificiale sulle ricostruzioni 3D generate dai dati V-SLAM. Questo framework sfrutta modelli preaddestrati e allo stato dell’arte per il rilevamento e la segmentazione di oggetti 2D, nonché la ricchezza di informazioni contenute nelle immagini, per ridurre l'etichettatura manuale e i costi computazionali rispetto alle tecniche basate sul 3D, migliorando al contempo il dettaglio semantico delle caratteristiche comuni e di quelle a scala fine nei modelli 3D. L'intera pipeline, che include la piattaforma ATOM-ANT3D MMS, il sistema SLAM multi-camera in tempo reale, le tecniche di ottimizzazione quasi in tempo reale e la segmentazione e l'arricchimento semantico 2D-3D, è stata valutata attraverso molteplici casi di studio reali e complessi. Le valutazioni hanno utilizzato punti di controllo di livello topografico e la verifica indipendente per quantificare l'accuratezza geometrica, la completezza e il tempo necessario per ottenere il prodotto finale. Su tutti i set di dati, la pipeline proposta ha raggiunto un'accuratezza geometrica centimetrica e ha ridotto il tempo di acquisizione-elaborazione end-to-end del 91-94% rispetto a un flusso di lavoro fotogrammetrico standard. L'approccio di arricchimento semantico 2D-3D ha ottenuto punteggi F1 compresi tra circa l'80 e il 92% nelle classi architettoniche e a scala fine, inclusi blocchi di pietra, distacchi o perdite di materiale ed elementi architettonici come archi, colonne, muri, ecc. Questi risultati dimostrano un lavoro sul campo accelerato, una localizzazione e una mappatura in tempo reale con accuratezza a livello di rilievo e un efficace arricchimento semantico. In sintesi, questa tesi offre un’innovazione pratica e un avanzamento per la digitalizzazione 3D presentando un framework completo, identificando le attuali limitazioni e proponendo soluzioni e linee guida, evidenziando al contempo opportunità per future ricerche e ulteriori miglioramenti.
Semantic photogrammetry and visual mobile mapping for real-time 3D applications
ELALAILYI, AHMAD
2025/2026
Abstract
3D digitization plays a vital role in documentation, preservation, analysis, and monitoring across various fields, including cultural heritage, urban planning, and engineering applications. While traditional methods, such as photogrammetry and terrestrial laser scanning (TLS), yield accurate 3D models, they are hindered by slow data acquisition and labor-intensive processing, especially in large or complex environments. Mobile mapping systems (MMSs) equipped with simultaneous localization and mapping (SLAM) technology accelerate fieldwork and offer flexible data acquisition, but still require significant post-processing to achieve accuracy and completeness. Semantic enrichment, which is essential for the interpretability and usability of 3D data, typically depends on computationally intensive 3D point cloud processing techniques. This thesis addresses these challenges by developing a multi-camera MMS that supports real-time data acquisition and near-real-time optimization while maintaining survey-grade accuracy, and by introducing a novel 2D-to-3D semantic segmentation and enrichment framework. A comprehensive review of MMSs technologies encompasses various platforms, including vehicle-mounted, backpack, and handheld systems, as well as sensing modalities such as LiDAR, vision-only, and hybrid approaches. The review also addresses sensor integration, deployment strategies, and system limitations. Most MMS utilize LiDAR-centric SLAM, whereas vision-only MMS for real-time surveying remain in early stages of development, with commercial solutions often restricted to image capture rather than real-time mapping. In addition, the backbone principles of visual SLAM (V-SLAM) algorithms, configurations, and trends are reviewed. V-SLAM developments are predominantly designed for robotics applications and autonomous navigation, typically employing monocular or stereo configurations and validated on controlled datasets. These algorithms are rarely evaluated in real-world surveying scenarios that involve challenging conditions, such as narrow passages, low-light environments, or feature-scarce environments. As a result, current systems often do not achieve survey-grade accuracy and require further adaptation for reliable field deployment. To address these limitations, this thesis introduces ATOM-ANT3D, an enhanced multi-camera fisheye MMS. The system incorporates a unified Acquisition and Control Unit (ACU) that enables synchronized camera control, efficient data management, and seamless integration with V-SLAM components, utilizing open-source tools such as Spinnaker, OpenCV, and ROS. Hardware improvements facilitate increased data throughput and onboard processing capabilities. The Multi-Instance V-SLAM, an adapted extension of ORB-SLAM3, supports synchronized multi-camera input and data fusion, outperforming traditional monocular and stereo configurations. Improved tracking, mapping, and safety mechanisms contribute to stable and robust system performance. This multi-camera strategy introduces redundancy, ensuring reliable tracking, and accelerates the digitization process. To further enhance accuracy, two near-real-time post-optimization techniques are proposed: (i) Multi-Camera Pose Graph Optimization, which fuses multi-camera pose estimates into a unique optimized solution, and (ii) Multi-View Feature-Based Optimization, which utilizes V-SLAM multi-camera poses and inter-camera constraints. These methods achieve centimeter-level accuracy while reducing computational time requirements. In addition, a 2D-to-3D semantic enrichment framework is introduced, projecting AI-based 2D image object detections onto 3D reconstructions generated by the V-SLAM data. This framework leverages pre-trained and state-of-the-art 2D object detection and segmentation models and rich information contained in images to reduce manual labeling and computational costs compared to 3D-based techniques, while improving the semantic detail of both common and fine-scale features in 3D models. The complete pipeline, including the ATOM-ANT3D MMS platform, real-time multi-camera SLAM, near-real-time optimization techniques, and 2D-to-3D semantic segmentation and enrichment, was evaluated through multiple real-world challenging case studies. Assessments employed survey-grade ground control and independent verification to quantify geometric accuracy, completeness, and time-to-deliverable. Across all datasets, the proposed pipeline achieved centimeter-level geometric accuracy and reduced end-to-end acquisition-to-processing time by 91 to 94 percent compared to a standard photogrammetric workflow. The 2D-to-3D semantic enrichment approach achieved F1 scores ranging from approximately 80 to 92 percent across architectural and fine-scale classes, including stone blocks, material detachment or loss, and architectural elements such as arches, columns, walls, etc. These findings demonstrate accelerated fieldwork, real-time localization and mapping with survey-grade accuracy, and effective semantic enrichment. In summary, this thesis offers a practical innovation and advancement for 3D digitization by presenting a comprehensive framework, identifying current limitations, and proposing solutions and guidelines, while highlighting opportunities for future research and further improvement.| File | Dimensione | Formato | |
|---|---|---|---|
|
2026_04_Elalailyi.pdf
non accessibile
Descrizione: PhD Thesis
Dimensione
12.77 MB
Formato
Adobe PDF
|
12.77 MB | Adobe PDF | Visualizza/Apri |
I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.
https://hdl.handle.net/10589/254717