Recommender systems are essential tools for filtering information and suggesting relevant content to users. Candidate generation is a crucial step in these systems, as it produces a set of items from which the final recommendations are selected. This work investigates whether user histories can be represented effectively as a set of distinct interests rather than as a single averaged profile. The proposed pipeline builds semantic item representations from metadata and reviews, refines the item space with collaborative information, and clusters items to construct multi-interest user profiles. Each interest is then used as a separate retrieval signal for candidate generation. In addition, an offline LLM-based module produces natural-language descriptions of the resulting interests. The experimental evaluation is conducted on the Movies and TV and Video Games categories of the Amazon Reviews 2023 collection in an offline top-K setting. The results show that multi-interest profiles consistently improve retrieval over single-vector user representations under the same embedding space, supporting the hypothesis that profile structure matters during candidate generation. Review evidence improves item representations, with a stronger effect on Movies and TV, while collaborative refinement further strengthens the retrieval space. Global catalogue-level clustering provides slightly better retrieval quality than user-level clustering, while producing more stable interest representatives and avoiding per-user reclustering. When the generated candidate list is evaluated directly as a top-K output, the method improves over the content-based baseline and reaches a performance range close to collaborative baselines. Overall, the results support clustering-based multi-interest profiles as a practical way to preserve heterogeneous user preferences during candidate generation, while the semantic profiling module adds an interpretable layer without affecting retrieval.

I sistemi di raccomandazione sono strumenti fondamentali per filtrare informazioni e suggerire contenuti rilevanti agli utenti. La generazione dei candidati è un passaggio cruciale in questi sistemi, in quanto produce un insieme di prodotti da cui selezionare le raccomandazioni finali. Questo lavoro studia se le cronologie utente possano essere rappresentate efficacemente come un insieme di interessi distinti, piuttosto che come un profilo unico medio. La pipeline proposta costruisce rappresentazioni semantiche dei prodotti da metadati e recensioni, raffina questo spazio con informazioni collaborative e raggruppa i prodotti tramite clustering per costruire profili multi-interesse. Ogni interesse viene usato come segnale di ricerca indipendente per la generazione di candidati. Un modulo offline basato su modelli linguistici produce inoltre descrizioni in linguaggio naturale degli interessi risultanti. La valutazione del metodo è condotta sulle categorie Movies and TV e Video Games della collezione Amazon Reviews 2023 in un contesto offline top-K. I risultati mostrano che i profili multi-interesse migliorano consistentemente il recupero rispetto a rappresentazioni a vettore singolo nello stesso spazio, confermando che la struttura del profilo influisce sulla qualità della generazione di candidati. Si nota, inoltre, che le recensioni migliorano le rappresentazioni dei prodotti, con un effetto maggiore su Movies and TV, mentre il raffinamento collaborativo potenzia ulteriormente lo spazio di recupero. Infine, il clustering a livello di catalogo produce raccomandazioni di qualità leggermente superiore rispetto al clustering per utente, rimanendo più stabile. Quando la lista di candidati viene valutata direttamente come output di raccomandazione, il metodo migliora rispetto alla baseline basata sul contenuto e raggiunge prestazioni competitive con le baseline collaborative. Nel complesso, i risultati supportano i profili multi-interesse per preservare preferenze eterogenee durante la generazione di candidati, mentre il modulo di profilazione semantica aggiunge un livello di interpretabilità senza influire sul recupero di candidati.

Multi-interest user profiles for embedding-based candidate generation in recommender systems

PROCACCIO, ARIANNA
2025/2026

Abstract

Recommender systems are essential tools for filtering information and suggesting relevant content to users. Candidate generation is a crucial step in these systems, as it produces a set of items from which the final recommendations are selected. This work investigates whether user histories can be represented effectively as a set of distinct interests rather than as a single averaged profile. The proposed pipeline builds semantic item representations from metadata and reviews, refines the item space with collaborative information, and clusters items to construct multi-interest user profiles. Each interest is then used as a separate retrieval signal for candidate generation. In addition, an offline LLM-based module produces natural-language descriptions of the resulting interests. The experimental evaluation is conducted on the Movies and TV and Video Games categories of the Amazon Reviews 2023 collection in an offline top-K setting. The results show that multi-interest profiles consistently improve retrieval over single-vector user representations under the same embedding space, supporting the hypothesis that profile structure matters during candidate generation. Review evidence improves item representations, with a stronger effect on Movies and TV, while collaborative refinement further strengthens the retrieval space. Global catalogue-level clustering provides slightly better retrieval quality than user-level clustering, while producing more stable interest representatives and avoiding per-user reclustering. When the generated candidate list is evaluated directly as a top-K output, the method improves over the content-based baseline and reaches a performance range close to collaborative baselines. Overall, the results support clustering-based multi-interest profiles as a practical way to preserve heterogeneous user preferences during candidate generation, while the semantic profiling module adds an interpretable layer without affecting retrieval.
ING - Scuola di Ingegneria Industriale e dell'Informazione
22-lug-2026
2025/2026
I sistemi di raccomandazione sono strumenti fondamentali per filtrare informazioni e suggerire contenuti rilevanti agli utenti. La generazione dei candidati è un passaggio cruciale in questi sistemi, in quanto produce un insieme di prodotti da cui selezionare le raccomandazioni finali. Questo lavoro studia se le cronologie utente possano essere rappresentate efficacemente come un insieme di interessi distinti, piuttosto che come un profilo unico medio. La pipeline proposta costruisce rappresentazioni semantiche dei prodotti da metadati e recensioni, raffina questo spazio con informazioni collaborative e raggruppa i prodotti tramite clustering per costruire profili multi-interesse. Ogni interesse viene usato come segnale di ricerca indipendente per la generazione di candidati. Un modulo offline basato su modelli linguistici produce inoltre descrizioni in linguaggio naturale degli interessi risultanti. La valutazione del metodo è condotta sulle categorie Movies and TV e Video Games della collezione Amazon Reviews 2023 in un contesto offline top-K. I risultati mostrano che i profili multi-interesse migliorano consistentemente il recupero rispetto a rappresentazioni a vettore singolo nello stesso spazio, confermando che la struttura del profilo influisce sulla qualità della generazione di candidati. Si nota, inoltre, che le recensioni migliorano le rappresentazioni dei prodotti, con un effetto maggiore su Movies and TV, mentre il raffinamento collaborativo potenzia ulteriormente lo spazio di recupero. Infine, il clustering a livello di catalogo produce raccomandazioni di qualità leggermente superiore rispetto al clustering per utente, rimanendo più stabile. Quando la lista di candidati viene valutata direttamente come output di raccomandazione, il metodo migliora rispetto alla baseline basata sul contenuto e raggiunge prestazioni competitive con le baseline collaborative. Nel complesso, i risultati supportano i profili multi-interesse per preservare preferenze eterogenee durante la generazione di candidati, mentre il modulo di profilazione semantica aggiunge un livello di interpretabilità senza influire sul recupero di candidati.
File allegati
File Dimensione Formato  
2026_07_Procaccio_executive_summary.pdf

non accessibile

Dimensione 363.19 kB
Formato Adobe PDF
363.19 kB Adobe PDF   Visualizza/Apri
2026_07_Procaccio_tesi.pdf

non accessibile

Dimensione 1.5 MB
Formato Adobe PDF
1.5 MB Adobe PDF   Visualizza/Apri

I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10589/261297