The integration of genomic data into clinical systems remains one of the key challenges in modern healthcare. While Next-Generation Sequencing technologies generate rich variant data stored in Variant Call Format (VCF) files, these remain isolated from standard hospital records, making large-scale genomic research difficult across institutions. The Observational Medical Outcomes Partnership (OMOP) Common Data Model (CDM) provides a widely adopted standard for structuring clinical data, but its native schema was not designed to accommodate high-dimensional genomic variants. This thesis addresses this gap by designing, implementing, and validating an automated end-to-end Extract- Transform-Load (ETL) pipeline that maps raw genomic variant data and associated clinical metadata into an OMOP CDM schema including its genomic extension tables. The pipeline was developed in the context of the Italian Health Big Data (HBD) project and evaluated against a cohort of 18 patient VCF files from the European Genome-Phenome Archive repository. The work begins with an evaluation of tools proposed by ELIXIR Italy, leading to the selection of ANNOVAR and Ensembl VEP as the core annotation engines based on their ETL compatibility and throughput. The pipeline orchestrates file decompression, variant filtering, annotation and record linkage of outputs, standardized vocabulary mapping using HGNC gene identifiers and SNOMED clinical concepts, and idempotent loading into a PostgreSQL instance of the genomic extension to OMOP CDM). Validated on chromosome 17 across all 18 samples, the pipeline achieved a 93.39% align- ment rate between ANNOVAR and VEP records, a 97.45% standard gene mapping rate, and successfully resolved 66 unique SNOMED concepts for clinical variant standardization. The results demonstrate that a local, annotation-driven ETL architecture can effectively bridge the gap between raw genomic files and a standard clinical database. The full end-to- end processing time per patient chromosome averaged 20 minutes on local infrastructure, representing a computational overhead that, while manageable for single-chromosome validation runs, highlights the need for parallelization when scaling to full genomes.

L’integrazione dei dati genomici nei sistemi clinici rappresenta una delle sfide principali della medicina moderna. Sebbene le tecnologie Next-Generation Sequencing (NGS) producano ricchi dati di varianti in formato Variant Call Format (VCF), questi rimangono isolati dalle cartelle cliniche standard, rendendo difficile la ricerca genomica su larga scala tra istituzioni. L’Observational Medical Outcomes Partnership (OMOP) Common Data Model (CDM) fornisce uno standard ampiamente adottato per la strutturazione dei dati clinici, ma il suo schema nativo non è stato progettato per varianti genomiche ad alta dimensionalità. Questa tesi colma tale lacuna progettando, implementando e validando una pipeline Extract-Transform-Load (ETL) automatizzata che mappa varianti genomiche e metadati clinici in uno schema OMOP CDM comprensivo delle sue tabelle di estensione genomica. La pipeline è stata sviluppata nell’ambito del progetto Health Big Data (HBD) e valutata su 18 file VCF di pazienti provenienti dall’European Genome-Phenome Archive. Il lavoro include una valutazione degli strumenti proposti da ELIXIR Italy, che ha portato alla selezione di ANNOVAR ed Ensembl VEP come motori di annotazione principali. La pipeline orchestra decompressione, filtraggio, annotazione e record linkage, mappatura tramite identificatori HGNC e concetti SNOMED, e caricamento idempotente in un’istanza PostgreSQL dell’estensione genomica di OMOP CDM. Validata sul cromosoma 17 per tutti i 18 campioni, la pipeline ha raggiunto un tasso di allineamento del 93,39% tra ANNOVAR e VEP, un tasso di mappatura genica del 97,45%, e ha risolto 66 concetti SNOMED unici. I risultati dimostrano che un’architettura ETL locale e guidata dall’annotazione può efficacemente integrare file genomici grezzi in un database clinico standardizzato. Il tempo medio di elaborazione per cromosoma per paziente è stato di 20 minuti su infrastruttura locale, overhead gestibile per validazioni su singolo cromosoma ma che evidenzia la necessità di parallelizzazione per scalare a genomi completi.

Rethinking genomic data annotation : an ETL pipeline

Huard, Anatole Fantin
2025/2026

Abstract

The integration of genomic data into clinical systems remains one of the key challenges in modern healthcare. While Next-Generation Sequencing technologies generate rich variant data stored in Variant Call Format (VCF) files, these remain isolated from standard hospital records, making large-scale genomic research difficult across institutions. The Observational Medical Outcomes Partnership (OMOP) Common Data Model (CDM) provides a widely adopted standard for structuring clinical data, but its native schema was not designed to accommodate high-dimensional genomic variants. This thesis addresses this gap by designing, implementing, and validating an automated end-to-end Extract- Transform-Load (ETL) pipeline that maps raw genomic variant data and associated clinical metadata into an OMOP CDM schema including its genomic extension tables. The pipeline was developed in the context of the Italian Health Big Data (HBD) project and evaluated against a cohort of 18 patient VCF files from the European Genome-Phenome Archive repository. The work begins with an evaluation of tools proposed by ELIXIR Italy, leading to the selection of ANNOVAR and Ensembl VEP as the core annotation engines based on their ETL compatibility and throughput. The pipeline orchestrates file decompression, variant filtering, annotation and record linkage of outputs, standardized vocabulary mapping using HGNC gene identifiers and SNOMED clinical concepts, and idempotent loading into a PostgreSQL instance of the genomic extension to OMOP CDM). Validated on chromosome 17 across all 18 samples, the pipeline achieved a 93.39% align- ment rate between ANNOVAR and VEP records, a 97.45% standard gene mapping rate, and successfully resolved 66 unique SNOMED concepts for clinical variant standardization. The results demonstrate that a local, annotation-driven ETL architecture can effectively bridge the gap between raw genomic files and a standard clinical database. The full end-to- end processing time per patient chromosome averaged 20 minutes on local infrastructure, representing a computational overhead that, while manageable for single-chromosome validation runs, highlights the need for parallelization when scaling to full genomes.
ING - Scuola di Ingegneria Industriale e dell'Informazione
22-lug-2026
2025/2026
L’integrazione dei dati genomici nei sistemi clinici rappresenta una delle sfide principali della medicina moderna. Sebbene le tecnologie Next-Generation Sequencing (NGS) producano ricchi dati di varianti in formato Variant Call Format (VCF), questi rimangono isolati dalle cartelle cliniche standard, rendendo difficile la ricerca genomica su larga scala tra istituzioni. L’Observational Medical Outcomes Partnership (OMOP) Common Data Model (CDM) fornisce uno standard ampiamente adottato per la strutturazione dei dati clinici, ma il suo schema nativo non è stato progettato per varianti genomiche ad alta dimensionalità. Questa tesi colma tale lacuna progettando, implementando e validando una pipeline Extract-Transform-Load (ETL) automatizzata che mappa varianti genomiche e metadati clinici in uno schema OMOP CDM comprensivo delle sue tabelle di estensione genomica. La pipeline è stata sviluppata nell’ambito del progetto Health Big Data (HBD) e valutata su 18 file VCF di pazienti provenienti dall’European Genome-Phenome Archive. Il lavoro include una valutazione degli strumenti proposti da ELIXIR Italy, che ha portato alla selezione di ANNOVAR ed Ensembl VEP come motori di annotazione principali. La pipeline orchestra decompressione, filtraggio, annotazione e record linkage, mappatura tramite identificatori HGNC e concetti SNOMED, e caricamento idempotente in un’istanza PostgreSQL dell’estensione genomica di OMOP CDM. Validata sul cromosoma 17 per tutti i 18 campioni, la pipeline ha raggiunto un tasso di allineamento del 93,39% tra ANNOVAR e VEP, un tasso di mappatura genica del 97,45%, e ha risolto 66 concetti SNOMED unici. I risultati dimostrano che un’architettura ETL locale e guidata dall’annotazione può efficacemente integrare file genomici grezzi in un database clinico standardizzato. Il tempo medio di elaborazione per cromosoma per paziente è stato di 20 minuti su infrastruttura locale, overhead gestibile per validazioni su singolo cromosoma ma che evidenzia la necessità di parallelizzazione per scalare a genomi completi.
File allegati
File Dimensione Formato  
22_07_Huard.pdf

solo utenti autorizzati a partire dal 02/07/2027

Descrizione: Thesis text
Dimensione 583.99 kB
Formato Adobe PDF
583.99 kB Adobe PDF   Visualizza/Apri

I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10589/261107