Knowledge Graphs (KGs) are widely adopted to represent complex, heterogeneous, and semantically rich domains such as education and healthcare. However, in many real-world scenarios — especially longitudinal ones — the availability of sufficiently large datasets remains a major limitation. Synthetic Data Generation (SDG) offers a potential solution, yet existing graph generators often struggle to reproduce domain-specific semantic structures and controlled relational patterns. This thesis proposes the Conversational Data Generation (CDG) approach, a domain-agnostic framework for KG generation using Large Language Models (LLMs) organized as a conversation between two or more agents. The approach structures the generation process as a dialogue between two specialized roles: querent agent(s), responsible for orchestrating semantically meaningful actions derived from an ontology, and witness agent(s), responsible for producing synthetic data consistent with those actions. Domain knowledge is captured through OWL ontologies and translated into a compact conversational contract composed of semantically meaningful instructions that guide agents in generating coherent RDF triples. The framework supports multiple orchestration strategies (one-to-one, many-to-one, one-to-many, and many-to-many) and includes structured parsing to convert conversational outputs into valid RDF data. The method is evaluated across ontologies from different domains, including education, healthcare, and editorial contexts, and is analyzed for scalability, execution time, hallucination behavior, and data distribution. Results show that organizing KG generation as a semantically guided agent-based conversation can yield controllable, realistically distributed results, even with some limitations in dialogue consistency. This approach demonstrates that LLM-based agents can reliably generate RDF triples from ontologies, representing a promising step toward a flexible method for generating synthetic data in specialized Knowledge Graphs.

I Knowledge Graph (KG) sono ampiamente adottati per rappresentare domini complessi, eterogenei e semanticamente ricchi, come l’istruzione e la sanità. Tuttavia, in molti scenari reali — in particolare quelli longitudinali — la disponibilità di dataset sufficientemente ampi resta una limitazione significativa. La Generazione di Dati Sintetici (SDG) offre una soluzione potenziale, ma i generatori di grafi esistenti spesso faticano a riprodurre strutture semantiche specifiche del dominio e pattern relazionali controllati. Questa tesi propone Conversational Data Generation (CDG), un framework applicabile a qualsiasi dominio per la generazione di KG che utilizza una conversazione tra due o più agenti basata su Large Language Models (LLMs). L’approccio struttura il processo di generazione come un dialogo tra due ruoli specializzati: agente (o agenti) querent, responsabile(i) dell’orchestrazione di azioni semanticamente significative derivate da un’ontologia, e agente (o agenti) witness, responsabile(i) della produzione di dati sintetici coerenti con tali azioni. La conoscenza del dominio viene catturata tramite ontologie basate sul linguaggio OWL e tradotta in un contratto conversazionale compatto, composto da istruzioni semanticamente significative che guidano gli agenti nella generazione di triple RDF coerenti. Il framework supporta diverse strategie di orchestrazione (uno-a-uno, molti-a-uno, uno-a-molti e molti-a-molti) e include un parsing strutturato per convertire gli output conversazionali in dati RDF validi. Il metodo è valutato su ontologie provenienti da diversi domini, tra cui l'istruzione, la sanità e i contesti editoriali, e viene analizzato in termini di scalabilità, tempo di esecuzione, comportamento di allucinazione e distribuzione dei dati. I risultati mostrano che organizzare la generazione di KG come una conversazione guidata semanticamente tra agenti può produrre risultati controllabili e realisticamente distribuiti, nonostante alcune limitazioni nella coerenza del dialogo. Questo approccio dimostra che gli agenti basati su LLM possono generare in modo affidabile triple RDF a partire da ontologie, rappresentando un passo promettente verso un metodo flessibile per la generazione di Knowledge Graph specializzati nei dati sintetici.

Synthetic Knowledge Graph generation with querent-witness agents

GALBIATI, FRANCESCO
2025/2026

Abstract

Knowledge Graphs (KGs) are widely adopted to represent complex, heterogeneous, and semantically rich domains such as education and healthcare. However, in many real-world scenarios — especially longitudinal ones — the availability of sufficiently large datasets remains a major limitation. Synthetic Data Generation (SDG) offers a potential solution, yet existing graph generators often struggle to reproduce domain-specific semantic structures and controlled relational patterns. This thesis proposes the Conversational Data Generation (CDG) approach, a domain-agnostic framework for KG generation using Large Language Models (LLMs) organized as a conversation between two or more agents. The approach structures the generation process as a dialogue between two specialized roles: querent agent(s), responsible for orchestrating semantically meaningful actions derived from an ontology, and witness agent(s), responsible for producing synthetic data consistent with those actions. Domain knowledge is captured through OWL ontologies and translated into a compact conversational contract composed of semantically meaningful instructions that guide agents in generating coherent RDF triples. The framework supports multiple orchestration strategies (one-to-one, many-to-one, one-to-many, and many-to-many) and includes structured parsing to convert conversational outputs into valid RDF data. The method is evaluated across ontologies from different domains, including education, healthcare, and editorial contexts, and is analyzed for scalability, execution time, hallucination behavior, and data distribution. Results show that organizing KG generation as a semantically guided agent-based conversation can yield controllable, realistically distributed results, even with some limitations in dialogue consistency. This approach demonstrates that LLM-based agents can reliably generate RDF triples from ontologies, representing a promising step toward a flexible method for generating synthetic data in specialized Knowledge Graphs.
ING - Scuola di Ingegneria Industriale e dell'Informazione
26-mar-2026
2025/2026
I Knowledge Graph (KG) sono ampiamente adottati per rappresentare domini complessi, eterogenei e semanticamente ricchi, come l’istruzione e la sanità. Tuttavia, in molti scenari reali — in particolare quelli longitudinali — la disponibilità di dataset sufficientemente ampi resta una limitazione significativa. La Generazione di Dati Sintetici (SDG) offre una soluzione potenziale, ma i generatori di grafi esistenti spesso faticano a riprodurre strutture semantiche specifiche del dominio e pattern relazionali controllati. Questa tesi propone Conversational Data Generation (CDG), un framework applicabile a qualsiasi dominio per la generazione di KG che utilizza una conversazione tra due o più agenti basata su Large Language Models (LLMs). L’approccio struttura il processo di generazione come un dialogo tra due ruoli specializzati: agente (o agenti) querent, responsabile(i) dell’orchestrazione di azioni semanticamente significative derivate da un’ontologia, e agente (o agenti) witness, responsabile(i) della produzione di dati sintetici coerenti con tali azioni. La conoscenza del dominio viene catturata tramite ontologie basate sul linguaggio OWL e tradotta in un contratto conversazionale compatto, composto da istruzioni semanticamente significative che guidano gli agenti nella generazione di triple RDF coerenti. Il framework supporta diverse strategie di orchestrazione (uno-a-uno, molti-a-uno, uno-a-molti e molti-a-molti) e include un parsing strutturato per convertire gli output conversazionali in dati RDF validi. Il metodo è valutato su ontologie provenienti da diversi domini, tra cui l'istruzione, la sanità e i contesti editoriali, e viene analizzato in termini di scalabilità, tempo di esecuzione, comportamento di allucinazione e distribuzione dei dati. I risultati mostrano che organizzare la generazione di KG come una conversazione guidata semanticamente tra agenti può produrre risultati controllabili e realisticamente distribuiti, nonostante alcune limitazioni nella coerenza del dialogo. Questo approccio dimostra che gli agenti basati su LLM possono generare in modo affidabile triple RDF a partire da ontologie, rappresentando un passo promettente verso un metodo flessibile per la generazione di Knowledge Graph specializzati nei dati sintetici.
File allegati
File Dimensione Formato  
Synthetic Knowledge Graph Generation with Querent Witness Agents.pdf

accessibile in internet per tutti a partire dal 02/03/2027

Descrizione: Documento principale della tesi
Dimensione 1.42 MB
Formato Adobe PDF
1.42 MB Adobe PDF   Visualizza/Apri
Synthetic Knowledge Graph Generation with Querent Witness Agents - Executive_Summary.pdf

accessibile in internet per tutti a partire dal 02/03/2027

Descrizione: Executive Summary
Dimensione 487.57 kB
Formato Adobe PDF
487.57 kB Adobe PDF   Visualizza/Apri

I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10589/250866