Biomedical research increasingly depends on heterogeneous genomic data sources—Ensembl, NCBI, UniProt, KEGG, Gene Ontology—that remain scattered across independently- curated databases with distinct identifier systems, formats, and update schedules. Recent breakthroughs such as Google’s AlphaFold have expanded the volume of available protein structure data, further amplifying the integration challenge: researchers must manually orchestrate queries across multiple APIs and hardcode pipelines for every new combina- tion of data sources, limiting both extensibility and ad-hoc exploration. To address this, we developed BioGraph, a Python package that uses reflection and type introspection to automatically discover relationships between biological entities at runtime. BioGraph collects data from heterogeneous sources, normalises it into a unified object model, and returns results as a traversable knowledge graph—without requiring changes to framework code when new entity types or data sources are added. A universal traversal engine handles arbitrary multi-hop queries by inspecting entity class definitions rather than relying on hardcoded routing logic. We validate BioGraph through three case studies. In targeted pathway discovery, Bi- oGraph identified 28,161 gene–pathway pairs from 1,000 input genes using only 2 API calls. In gene-to-PPI traversal, batching reduced API calls by 67% compared to individ- ual queries. In open-ended radial exploration of three cancer genes, BioGraph discovered 124,852 entity relationships across six relationship types at depth 3, with a 55% reduction in execution time when queries were combined. These results demonstrate that automatic relationship discovery via reflection enables flexible, extensible biological data integration without sacrificing query efficiency.

La ricerca biomedica dipende in misura crescente da fonti di dati genomici eterogenee— Ensembl, NCBI, UniProt, KEGG, Gene Ontology—che rimangono distribuite tra banche dati indipendenti con sistemi di identificatori, formati e cicli di aggiornamento distinti. Recenti progressi come AlphaFold di Google hanno ulteriormente ampliato il volume di dati disponibili, accentuando la sfida dell’integrazione: i ricercatori devono orchestrare manualmente le interrogazioni su più API e codificare pipeline rigide per ogni nuova combinazione di sorgenti, limitando l’estensibilità e l’esplorazione ad hoc. Per affrontare questo problema, abbiamo sviluppato BioGraph, un pacchetto Python che utilizza reflection e introspezione dei tipi per scoprire automaticamente le relazioni tra entità biologiche a runtime. BioGraph raccoglie dati da sorgenti eterogenee, li nor- malizza in un modello a oggetti unificato e restituisce i risultati come un grafo della conoscenza percorribile—senza richiedere modifiche al codice del framework quando ven- gono aggiunti nuovi tipi di entità o sorgenti dati. Un motore di traversal universale gestisce interrogazioni multi-hop arbitrarie ispezionando le definizioni delle classi entità anziché affidarsi a logiche di routing predefinite. BioGraph è validato attraverso tre casi studio. Nel caso di pathway discovery mirata, BioGraph ha identificato 28.161 coppie gene–pathway da 1.000 geni in input con sole 2 chiamate API. Nella traversal gene-to-PPI, il batching ha ridotto le chiamate API del 67% rispetto alle interrogazioni individuali. Nell’esplorazione radiale aperta di tre geni oncologici, BioGraph ha scoperto 124.852 relazioni tra entità su sei tipi di relazione a profondità 3, con una riduzione del 55% del tempo di esecuzione combinando le inter- rogazioni. Questi risultati dimostrano che la scoperta automatica delle relazioni tramite reflection consente un’integrazione flessibile ed estensibile dei dati biologici senza sacrifi- care l’efficienza delle interrogazioni.

BioGraph: a network approach to multi-omics information retrieval

INZERILLO, FRANCESCO MARIO
2025/2026

Abstract

Biomedical research increasingly depends on heterogeneous genomic data sources—Ensembl, NCBI, UniProt, KEGG, Gene Ontology—that remain scattered across independently- curated databases with distinct identifier systems, formats, and update schedules. Recent breakthroughs such as Google’s AlphaFold have expanded the volume of available protein structure data, further amplifying the integration challenge: researchers must manually orchestrate queries across multiple APIs and hardcode pipelines for every new combina- tion of data sources, limiting both extensibility and ad-hoc exploration. To address this, we developed BioGraph, a Python package that uses reflection and type introspection to automatically discover relationships between biological entities at runtime. BioGraph collects data from heterogeneous sources, normalises it into a unified object model, and returns results as a traversable knowledge graph—without requiring changes to framework code when new entity types or data sources are added. A universal traversal engine handles arbitrary multi-hop queries by inspecting entity class definitions rather than relying on hardcoded routing logic. We validate BioGraph through three case studies. In targeted pathway discovery, Bi- oGraph identified 28,161 gene–pathway pairs from 1,000 input genes using only 2 API calls. In gene-to-PPI traversal, batching reduced API calls by 67% compared to individ- ual queries. In open-ended radial exploration of three cancer genes, BioGraph discovered 124,852 entity relationships across six relationship types at depth 3, with a 55% reduction in execution time when queries were combined. These results demonstrate that automatic relationship discovery via reflection enables flexible, extensible biological data integration without sacrificing query efficiency.
ING - Scuola di Ingegneria Industriale e dell'Informazione
22-lug-2026
2025/2026
La ricerca biomedica dipende in misura crescente da fonti di dati genomici eterogenee— Ensembl, NCBI, UniProt, KEGG, Gene Ontology—che rimangono distribuite tra banche dati indipendenti con sistemi di identificatori, formati e cicli di aggiornamento distinti. Recenti progressi come AlphaFold di Google hanno ulteriormente ampliato il volume di dati disponibili, accentuando la sfida dell’integrazione: i ricercatori devono orchestrare manualmente le interrogazioni su più API e codificare pipeline rigide per ogni nuova combinazione di sorgenti, limitando l’estensibilità e l’esplorazione ad hoc. Per affrontare questo problema, abbiamo sviluppato BioGraph, un pacchetto Python che utilizza reflection e introspezione dei tipi per scoprire automaticamente le relazioni tra entità biologiche a runtime. BioGraph raccoglie dati da sorgenti eterogenee, li nor- malizza in un modello a oggetti unificato e restituisce i risultati come un grafo della conoscenza percorribile—senza richiedere modifiche al codice del framework quando ven- gono aggiunti nuovi tipi di entità o sorgenti dati. Un motore di traversal universale gestisce interrogazioni multi-hop arbitrarie ispezionando le definizioni delle classi entità anziché affidarsi a logiche di routing predefinite. BioGraph è validato attraverso tre casi studio. Nel caso di pathway discovery mirata, BioGraph ha identificato 28.161 coppie gene–pathway da 1.000 geni in input con sole 2 chiamate API. Nella traversal gene-to-PPI, il batching ha ridotto le chiamate API del 67% rispetto alle interrogazioni individuali. Nell’esplorazione radiale aperta di tre geni oncologici, BioGraph ha scoperto 124.852 relazioni tra entità su sei tipi di relazione a profondità 3, con una riduzione del 55% del tempo di esecuzione combinando le inter- rogazioni. Questi risultati dimostrano che la scoperta automatica delle relazioni tramite reflection consente un’integrazione flessibile ed estensibile dei dati biologici senza sacrifi- care l’efficienza delle interrogazioni.
File allegati
File Dimensione Formato  
2026_07_Inzerillo.pdf

accessibile in internet per tutti

Descrizione: Tesi
Dimensione 2.05 MB
Formato Adobe PDF
2.05 MB Adobe PDF Visualizza/Apri
2026_07_Inzerillo_Executive_Summary.pdf

accessibile in internet per tutti

Descrizione: Executive Summary
Dimensione 597.61 kB
Formato Adobe PDF
597.61 kB Adobe PDF Visualizza/Apri

I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10589/261085