This thesis has been developed within the context of robotic assembly applications, where automated systems require reference images in order to recognize and manipulate industrial components. The main objective is to significantly reduce the time associated with manual photographic dataset collection by replacing the traditional physical acquisition process with automatic image generation through generative artificial intelligence models. As a case study to validate the effectiveness of this approach, the EPART device is employed. EPART is an industrial control panel characterized by multiple configurations of colored buttons mounted on rectangular cases. The EPART domain represents a realistic benchmark to evaluate the ability of generative models to produce controllable and coherent images in an industrial setting subject to typical constraints, such as limited dataset size, the need for geometric precision, and the requirement to generalize to unseen product variants. Three fundamental generative paradigms are analyzed and compared: conditional Generative Adversarial Networks (GANs) based on discrete attribute vectors, diffusion models trained from scratch with textual conditioning, and parameter-efficient fine-tuning of pre-trained foundation models through Low-Rank Adaptation (LoRA) techniques. Each approach is evaluated in terms of visual quality, semantic fidelity, computational efficiency, and generalization capability, with particular attention to the trade-offs between perceptual realism, controllability, and resource requirements. The adoption of text-to-image models, especially diffusion-based architectures, enables intuitive interaction through natural language prompts, eliminating the need for advanced technical expertise by operators. Furthermore, the fine-tuning strategy on domain-specific datasets ensures high flexibility: the system can be rapidly adapted to new product categories through partial retraining on targeted datasets, making the approach scalable and applicable to multiple production lines and robotic assembly scenarios. The results demonstrate that properly configured generative models are capable of producing high-quality synthetic images even when trained on extremely limited datasets, thereby validating the feasibility of this approach for real industrial applications. These include data augmentation for robotic computer vision systems, virtual prototyping of product variants, and the reduction of data preparation time for automated assembly tasks.

Il presente lavoro di tesi nasce nel contesto di applicazioni di assemblaggio robotico, dove sistemi automatizzati necessitano di immagini di riferimento per riconoscere e manipolare componenti industriali. L'obiettivo è ridurre significativamente i tempi associati alla raccolta manuale di dataset fotografici, sostituendo il processo tradizionale di acquisizione fisica con la generazione automatica di immagini tramite modelli di intelligenza artificiale generativa. Come caso di studio per validare l'efficacia di questo approccio, viene utilizzato il dispositivo EPART, un pannello di controllo industriale caratterizzato da diverse configurazioni di pulsanti colorati montati su case rettangolari. Il dominio EPART rappresenta un benchmark realistico per testare la capacità dei modelli generativi di produrre immagini controllabili e coerenti in un contesto industriale con vincoli tipici: dataset di dimensioni limitate, necessità di precisione geometrica, e requisiti di generalizzazione a varianti non viste durante l'addestramento. Vengono analizzati e confrontati tre paradigmi generativi fondamentali: reti generative avversariali (GAN) condizionate su vettori di attributi discreti, modelli di diffusione addestrati da zero con conditioning testuale, e fine-tuning parameter-efficient di modelli foundation pre-addestrati tramite tecniche Low-Rank Adaptation (LoRA). Ciascun approccio viene valutato in termini di qualità visiva, fedeltà semantica, efficienza computazionale e capacità di generalizzazione, con particolare attenzione ai trade-off tra realismo percettivo, controllabilità e requisiti di risorse. L'adozione di modelli text-to-image, in particolare quelli basati su diffusione, consente un'interazione intuitiva attraverso prompt in linguaggio naturale, eliminando la necessità di competenze tecniche avanzate da parte degli operatori. La strategia di fine-tuning su dataset domain-specific garantisce inoltre elevata flessibilità: il sistema può essere rapidamente adattato a nuove tipologie di prodotti mediante riaddestramento parziale su dataset mirati, rendendo l'approccio scalabile e applicabile a diverse linee produttive e scenari di assemblaggio robotico. Il lavoro dimostra che modelli generativi opportunamente configurati possono produrre immagini sintetiche di qualità elevata anche con dataset estremamente ridotti, validando la fattibilità dell'approccio per applicazioni industriali reali quali data augmentation per sistemi di visione artificiale robotica, prototipazione virtuale di varianti di prodotto, e riduzione dei tempi di preparazione dati per task di assemblaggio automatizzato.

Comparative evaluation of generative models for image synthesis in robotics: from GANs to fine-tuned diffusion models

RUBINI, FRANCESCO
2024/2025

Abstract

This thesis has been developed within the context of robotic assembly applications, where automated systems require reference images in order to recognize and manipulate industrial components. The main objective is to significantly reduce the time associated with manual photographic dataset collection by replacing the traditional physical acquisition process with automatic image generation through generative artificial intelligence models. As a case study to validate the effectiveness of this approach, the EPART device is employed. EPART is an industrial control panel characterized by multiple configurations of colored buttons mounted on rectangular cases. The EPART domain represents a realistic benchmark to evaluate the ability of generative models to produce controllable and coherent images in an industrial setting subject to typical constraints, such as limited dataset size, the need for geometric precision, and the requirement to generalize to unseen product variants. Three fundamental generative paradigms are analyzed and compared: conditional Generative Adversarial Networks (GANs) based on discrete attribute vectors, diffusion models trained from scratch with textual conditioning, and parameter-efficient fine-tuning of pre-trained foundation models through Low-Rank Adaptation (LoRA) techniques. Each approach is evaluated in terms of visual quality, semantic fidelity, computational efficiency, and generalization capability, with particular attention to the trade-offs between perceptual realism, controllability, and resource requirements. The adoption of text-to-image models, especially diffusion-based architectures, enables intuitive interaction through natural language prompts, eliminating the need for advanced technical expertise by operators. Furthermore, the fine-tuning strategy on domain-specific datasets ensures high flexibility: the system can be rapidly adapted to new product categories through partial retraining on targeted datasets, making the approach scalable and applicable to multiple production lines and robotic assembly scenarios. The results demonstrate that properly configured generative models are capable of producing high-quality synthetic images even when trained on extremely limited datasets, thereby validating the feasibility of this approach for real industrial applications. These include data augmentation for robotic computer vision systems, virtual prototyping of product variants, and the reduction of data preparation time for automated assembly tasks.
ING - Scuola di Ingegneria Industriale e dell'Informazione
26-mar-2026
2024/2025
Il presente lavoro di tesi nasce nel contesto di applicazioni di assemblaggio robotico, dove sistemi automatizzati necessitano di immagini di riferimento per riconoscere e manipolare componenti industriali. L'obiettivo è ridurre significativamente i tempi associati alla raccolta manuale di dataset fotografici, sostituendo il processo tradizionale di acquisizione fisica con la generazione automatica di immagini tramite modelli di intelligenza artificiale generativa. Come caso di studio per validare l'efficacia di questo approccio, viene utilizzato il dispositivo EPART, un pannello di controllo industriale caratterizzato da diverse configurazioni di pulsanti colorati montati su case rettangolari. Il dominio EPART rappresenta un benchmark realistico per testare la capacità dei modelli generativi di produrre immagini controllabili e coerenti in un contesto industriale con vincoli tipici: dataset di dimensioni limitate, necessità di precisione geometrica, e requisiti di generalizzazione a varianti non viste durante l'addestramento. Vengono analizzati e confrontati tre paradigmi generativi fondamentali: reti generative avversariali (GAN) condizionate su vettori di attributi discreti, modelli di diffusione addestrati da zero con conditioning testuale, e fine-tuning parameter-efficient di modelli foundation pre-addestrati tramite tecniche Low-Rank Adaptation (LoRA). Ciascun approccio viene valutato in termini di qualità visiva, fedeltà semantica, efficienza computazionale e capacità di generalizzazione, con particolare attenzione ai trade-off tra realismo percettivo, controllabilità e requisiti di risorse. L'adozione di modelli text-to-image, in particolare quelli basati su diffusione, consente un'interazione intuitiva attraverso prompt in linguaggio naturale, eliminando la necessità di competenze tecniche avanzate da parte degli operatori. La strategia di fine-tuning su dataset domain-specific garantisce inoltre elevata flessibilità: il sistema può essere rapidamente adattato a nuove tipologie di prodotti mediante riaddestramento parziale su dataset mirati, rendendo l'approccio scalabile e applicabile a diverse linee produttive e scenari di assemblaggio robotico. Il lavoro dimostra che modelli generativi opportunamente configurati possono produrre immagini sintetiche di qualità elevata anche con dataset estremamente ridotti, validando la fattibilità dell'approccio per applicazioni industriali reali quali data augmentation per sistemi di visione artificiale robotica, prototipazione virtuale di varianti di prodotto, e riduzione dei tempi di preparazione dati per task di assemblaggio automatizzato.
File allegati
File Dimensione Formato  
2026_03_Rubini_Tesi.pdf

accessibile in internet per tutti

Dimensione 25.35 MB
Formato Adobe PDF
25.35 MB Adobe PDF Visualizza/Apri
2026_03_Rubini_executive summary.pdf

accessibile in internet per tutti

Dimensione 21.31 MB
Formato Adobe PDF
21.31 MB Adobe PDF Visualizza/Apri

I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10589/251629