Foundation models generalize across many computer vision tasks but transfer poorly to specialized industrial domains, where they lack the required domain priors and are too slow for production-line inference. Such settings therefore still rely on fully supervised segmentation models, which are accurate and efficient at inference but depend on dense, pixel-level human annotations that are costly and not always available. We study this bottleneck in WS², an industrial waste-sorting use case in which target PET recyclables must be separated from contaminants on a cluttered, high-throughput conveyor belt, asking whether foundation-model annotation can replace or cost-effectively reduce scarce expert supervision. We propose an annotation pipeline that formalizes operator sorting rules as a domain ontology for prompt creation, combining Vision-Language Model (VLM) reasoning with the masks produced by SAM 3 to generate instance-level pseudo-labels at scale, without any manually drawn mask. From three zero-shot pipelines we select the best (0.663 mIoU), in which SAM 3 proposes a mask for every object and a VLM classifies each one. Reusing the same proposals, we build a human-assisted route in which a custom tool lets an expert label each object as target or contaminant with one click. Starting both routes from identical masks isolates the effect of automatic versus human labeling. We distill a compact YOLO26-nano student from each label set, obtaining a real-time model at 54 FPS, hundreds of times faster than the pipeline. The pseudo-label student matches its teacher, and at small budgets pseudo-labels are on par with human labels. At larger budgets, however, the click-based tool makes the human-assisted route more precise and far more data-efficient, with only 200 human-labeled frames surpassing the best pseudo-label model in roughly one-fifth of the time. Foundation-model annotation, whether automatic or paired with a lightweight human-in-the-loop, thus substantially lowers the cost of the annotated datasets behind deployable segmentation models for specialized industrial waste sorting.

I foundation model generalizzano su molti compiti di computer vision ma si trasferiscono male ai domini industriali specializzati, dove mancano i prior di dominio necessari e sono troppo lenti per l'inferenza in produzione. Tali contesti si affidano quindi ancora a modelli di segmentazione supervisionati, accurati ed efficienti ma dipendenti da costose annotazioni umane a livello di pixel, non sempre disponibili. Studiamo questo collo di bottiglia nel caso d'uso WS² di smistamento industriale dei rifiuti, in cui gli oggetti riciclabili in PET vanno separati dai contaminanti su un nastro trasportatore, chiedendoci se l'annotazione tramite foundation model possa sostituire o ridurre la scarsa supervisione di esperti. Proponiamo una pipeline di annotazione che formalizza le regole degli operatori in un'ontologia di dominio per i prompt, combinando un Vision-Language Model (VLM) con le maschere di SAM 3 per generare su larga scala pseudo-etichette di istanza senza disegnare maschere a mano. Tra tre pipeline zero-shot scegliamo la migliore (mIoU di 0,663), in cui SAM 3 propone una maschera per ogni oggetto e un VLM la classifica. Riutilizzando le stesse proposte, costruiamo un percorso assistito in cui uno strumento fa etichettare a un esperto ogni oggetto come target o contaminante con un click. Avviare entrambi i percorsi dalle stesse maschere isola l'effetto dell'etichettatura automatica rispetto a quella umana. Distilliamo uno studente YOLO26-nano compatto da ciascun set di etichette, ottenendo un modello in tempo reale a 54 FPS. Lo studente a pseudo-etichette eguaglia il suo teacher e con budget ridotti le pseudo-etichette pareggiano quelle umane. Con budget più ampi, però, lo strumento a click rende il percorso assistito più preciso e molto più efficiente nei dati, e bastano 200 fotogrammi etichettati a mano per superare il miglior modello a pseudo-etichette in circa un quinto del tempo. L'annotazione tramite foundation model, automatica o con un leggero apporto human-in-the-loop, riduce così nettamente il costo dei dataset annotati per modelli di segmentazione utilizzabili in produzione nello smistamento industriale dei rifiuti.

Integrating vision foundation models for pseudo-label generation in industrial waste sorting

RAMIREZ RAMIREZ, JUAN PABLO
2025/2026

Abstract

Foundation models generalize across many computer vision tasks but transfer poorly to specialized industrial domains, where they lack the required domain priors and are too slow for production-line inference. Such settings therefore still rely on fully supervised segmentation models, which are accurate and efficient at inference but depend on dense, pixel-level human annotations that are costly and not always available. We study this bottleneck in WS², an industrial waste-sorting use case in which target PET recyclables must be separated from contaminants on a cluttered, high-throughput conveyor belt, asking whether foundation-model annotation can replace or cost-effectively reduce scarce expert supervision. We propose an annotation pipeline that formalizes operator sorting rules as a domain ontology for prompt creation, combining Vision-Language Model (VLM) reasoning with the masks produced by SAM 3 to generate instance-level pseudo-labels at scale, without any manually drawn mask. From three zero-shot pipelines we select the best (0.663 mIoU), in which SAM 3 proposes a mask for every object and a VLM classifies each one. Reusing the same proposals, we build a human-assisted route in which a custom tool lets an expert label each object as target or contaminant with one click. Starting both routes from identical masks isolates the effect of automatic versus human labeling. We distill a compact YOLO26-nano student from each label set, obtaining a real-time model at 54 FPS, hundreds of times faster than the pipeline. The pseudo-label student matches its teacher, and at small budgets pseudo-labels are on par with human labels. At larger budgets, however, the click-based tool makes the human-assisted route more precise and far more data-efficient, with only 200 human-labeled frames surpassing the best pseudo-label model in roughly one-fifth of the time. Foundation-model annotation, whether automatic or paired with a lightweight human-in-the-loop, thus substantially lowers the cost of the annotated datasets behind deployable segmentation models for specialized industrial waste sorting.
ING - Scuola di Ingegneria Industriale e dell'Informazione
22-lug-2026
2025/2026
I foundation model generalizzano su molti compiti di computer vision ma si trasferiscono male ai domini industriali specializzati, dove mancano i prior di dominio necessari e sono troppo lenti per l'inferenza in produzione. Tali contesti si affidano quindi ancora a modelli di segmentazione supervisionati, accurati ed efficienti ma dipendenti da costose annotazioni umane a livello di pixel, non sempre disponibili. Studiamo questo collo di bottiglia nel caso d'uso WS² di smistamento industriale dei rifiuti, in cui gli oggetti riciclabili in PET vanno separati dai contaminanti su un nastro trasportatore, chiedendoci se l'annotazione tramite foundation model possa sostituire o ridurre la scarsa supervisione di esperti. Proponiamo una pipeline di annotazione che formalizza le regole degli operatori in un'ontologia di dominio per i prompt, combinando un Vision-Language Model (VLM) con le maschere di SAM 3 per generare su larga scala pseudo-etichette di istanza senza disegnare maschere a mano. Tra tre pipeline zero-shot scegliamo la migliore (mIoU di 0,663), in cui SAM 3 propone una maschera per ogni oggetto e un VLM la classifica. Riutilizzando le stesse proposte, costruiamo un percorso assistito in cui uno strumento fa etichettare a un esperto ogni oggetto come target o contaminante con un click. Avviare entrambi i percorsi dalle stesse maschere isola l'effetto dell'etichettatura automatica rispetto a quella umana. Distilliamo uno studente YOLO26-nano compatto da ciascun set di etichette, ottenendo un modello in tempo reale a 54 FPS. Lo studente a pseudo-etichette eguaglia il suo teacher e con budget ridotti le pseudo-etichette pareggiano quelle umane. Con budget più ampi, però, lo strumento a click rende il percorso assistito più preciso e molto più efficiente nei dati, e bastano 200 fotogrammi etichettati a mano per superare il miglior modello a pseudo-etichette in circa un quinto del tempo. L'annotazione tramite foundation model, automatica o con un leggero apporto human-in-the-loop, riduce così nettamente il costo dei dataset annotati per modelli di segmentazione utilizzabili in produzione nello smistamento industriale dei rifiuti.
File allegati
File Dimensione Formato  
2026_07_Ramirez_ExecutiveSummary.pdf

solo utenti autorizzati a partire dal 02/07/2027

Descrizione: Executive Summary
Dimensione 2.05 MB
Formato Adobe PDF
2.05 MB Adobe PDF   Visualizza/Apri
2026_07_Ramirez_Thesis.pdf

non accessibile

Descrizione: Full thesis document
Dimensione 33.03 MB
Formato Adobe PDF
33.03 MB Adobe PDF   Visualizza/Apri

I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10589/261575