Sparse implicit-feedback data represent a central limitation for collaborative recommender systems, since users typically interact with only a small portion of the available catalogue and observed interactions provide noisy, incomplete evidence of preference. This thesis explores whether diffusion models can be used to generate synthetic user profiles capable of augmenting such datasets and enriching the collaborative signal available during recommender training. The work frames diffusion models as synthetic data generators. Several design choices are investigated, including categorical and SVD-based profile representations, alternative reconstruction losses, model-selection criteria, augmentation ratios, and downstream recommender models. Particular attention is given to the distinction between distributional fidelity and recommendation utility, assessing whether realistic synthetic profiles are also beneficial for top-K recommendation. The experimental results show that model selection plays a decisive role. Diffusion models selected through a distributional-fidelity objective based on Maximum Mean Discrepancy generate synthetic profiles that preserve meaningful statistical and structural properties of the original data. In contrast, selection based directly on downstream recommendation performance tends to favor degenerate and weakly informative profiles. Although synthetic augmentation does not improve recommendation accuracy over the real-data baseline, well-selected diffusion models preserve most of the recommendation performance even when large amounts of synthetic data are added. The generated profiles also exhibit novelty while retaining recommendation-relevant structure, suggesting that diffusion-based generation may be valuable for analysis, simulation, and controlled experimentation beyond direct data augmentation.

La sparsità che caratterizza i dataset di feedback implicito rappresenta una limitazione centrale per i sistemi di raccomandazione collaborativi, poiché gli utenti interagiscono tipicamente solo con una piccola parte del catalogo disponibile e le interazioni osservate forniscono evidenze rumorose e incomplete delle preferenze. Questa tesi esplora la possibilità di utilizzare modelli di diffusione per generare profili utente sintetici in grado di arricchire tali dataset e potenziare il segnale collaborativo disponibile durante l’addestramento di sistemi di raccomandazione. Questo lavoro valuta i modelli di diffusione come generatori di dati sintetici. Vengono analizzate diverse scelte progettuali, tra cui rappresentazioni dei profili di tipo categorico e basate su SVD, diverse funzioni di loss per la ricostruzione, criteri di selezione dei modelli, rapporti di augmentazione e modelli di raccomandazione a valle. Particolare attenzione è dedicata alla distinzione tra fedeltà distribuzionale e utilità per la raccomandazione, valutando se profili sintetici realistici siano anche utili alle raccomandazioni top-K. I risultati sperimentali mostrano che la selezione del modello ricopre un ruolo decisivo. I modelli di diffusione selezionati tramite un obiettivo di fedeltà distribuzionale basato sulla Maximum Mean Discrepancy generano profili sintetici che preservano proprietà statistiche e strutturali significative dei dati originali. Al contrario, la selezione basata direttamente sulle prestazioni di raccomandazione tende a favorire profili degenerati e poco informativi. Sebbene l’augmentazione con dati sintetici non migliori l’accuratezza della raccomandazione rispetto ai livelli di riferimento sui dati reali, i modelli di diffusione ben selezionati preservano gran parte delle prestazioni anche quando si aggiungono grandi quantità di dati sintetici. I profili generati mostrano inoltre novità pur mantenendo una struttura rilevante per la raccomandazione, suggerendo che la generazione basata su diffusione possa essere utile per analisi, simulazione e sperimentazione controllata oltre al semplice arricchimento di dati.

Synthetic data generation for sparse implicit-feedback recommender systems via diffusion models

COLECCHIA, SIMONE
2025/2026

Abstract

Sparse implicit-feedback data represent a central limitation for collaborative recommender systems, since users typically interact with only a small portion of the available catalogue and observed interactions provide noisy, incomplete evidence of preference. This thesis explores whether diffusion models can be used to generate synthetic user profiles capable of augmenting such datasets and enriching the collaborative signal available during recommender training. The work frames diffusion models as synthetic data generators. Several design choices are investigated, including categorical and SVD-based profile representations, alternative reconstruction losses, model-selection criteria, augmentation ratios, and downstream recommender models. Particular attention is given to the distinction between distributional fidelity and recommendation utility, assessing whether realistic synthetic profiles are also beneficial for top-K recommendation. The experimental results show that model selection plays a decisive role. Diffusion models selected through a distributional-fidelity objective based on Maximum Mean Discrepancy generate synthetic profiles that preserve meaningful statistical and structural properties of the original data. In contrast, selection based directly on downstream recommendation performance tends to favor degenerate and weakly informative profiles. Although synthetic augmentation does not improve recommendation accuracy over the real-data baseline, well-selected diffusion models preserve most of the recommendation performance even when large amounts of synthetic data are added. The generated profiles also exhibit novelty while retaining recommendation-relevant structure, suggesting that diffusion-based generation may be valuable for analysis, simulation, and controlled experimentation beyond direct data augmentation.
ING - Scuola di Ingegneria Industriale e dell'Informazione
22-lug-2026
2025/2026
La sparsità che caratterizza i dataset di feedback implicito rappresenta una limitazione centrale per i sistemi di raccomandazione collaborativi, poiché gli utenti interagiscono tipicamente solo con una piccola parte del catalogo disponibile e le interazioni osservate forniscono evidenze rumorose e incomplete delle preferenze. Questa tesi esplora la possibilità di utilizzare modelli di diffusione per generare profili utente sintetici in grado di arricchire tali dataset e potenziare il segnale collaborativo disponibile durante l’addestramento di sistemi di raccomandazione. Questo lavoro valuta i modelli di diffusione come generatori di dati sintetici. Vengono analizzate diverse scelte progettuali, tra cui rappresentazioni dei profili di tipo categorico e basate su SVD, diverse funzioni di loss per la ricostruzione, criteri di selezione dei modelli, rapporti di augmentazione e modelli di raccomandazione a valle. Particolare attenzione è dedicata alla distinzione tra fedeltà distribuzionale e utilità per la raccomandazione, valutando se profili sintetici realistici siano anche utili alle raccomandazioni top-K. I risultati sperimentali mostrano che la selezione del modello ricopre un ruolo decisivo. I modelli di diffusione selezionati tramite un obiettivo di fedeltà distribuzionale basato sulla Maximum Mean Discrepancy generano profili sintetici che preservano proprietà statistiche e strutturali significative dei dati originali. Al contrario, la selezione basata direttamente sulle prestazioni di raccomandazione tende a favorire profili degenerati e poco informativi. Sebbene l’augmentazione con dati sintetici non migliori l’accuratezza della raccomandazione rispetto ai livelli di riferimento sui dati reali, i modelli di diffusione ben selezionati preservano gran parte delle prestazioni anche quando si aggiungono grandi quantità di dati sintetici. I profili generati mostrano inoltre novità pur mantenendo una struttura rilevante per la raccomandazione, suggerendo che la generazione basata su diffusione possa essere utile per analisi, simulazione e sperimentazione controllata oltre al semplice arricchimento di dati.
File allegati
File Dimensione Formato  
2026_07_Colecchia_Tesi.pdf

accessibile in internet solo dagli utenti autorizzati

Descrizione: Tesi principale
Dimensione 2.7 MB
Formato Adobe PDF
2.7 MB Adobe PDF   Visualizza/Apri
2026_07_Colecchia_Executive summary.pdf

accessibile in internet solo dagli utenti autorizzati

Descrizione: Executive summary
Dimensione 632.73 kB
Formato Adobe PDF
632.73 kB Adobe PDF   Visualizza/Apri

I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10589/261304