Integrating scientific knowledge into machine learning models is challenging when predictions must be both data-adaptive and consistent with structural or mechanistic constraints. Neural networks (NNs) capture condition-specific variation but may produce infeasible outputs, whereas principles-based models enforce known relationships but often adapt poorly. This thesis develops a semi-amortized, end-to-end differentiable framework that combines these complementary capabilities. A NN maps observed features to an instance-specific proposal, which is refined by a convex optimization layer formulated as a single quadratic program. Using a proximal-style objective, the layer minimizes deviation from the neural output while enforcing equality, inequality, and bound constraints derived from prior knowledge. Because the optimization problem is embedded in the computation graph, the neural component is trained through the constrained refinement. When the feasible set is non-empty and the problem is appropriately regularized, the layer returns a unique feasible solution. The framework is evaluated on a proof-of-concept maximum-flow problem and a biological case study predicting E. coli growth from medium composition using flux-balance constraints. In both settings, convex refinement reduces constraint violations to solver tolerance while maintaining competitive predictive performance. Unconstrained neural models can nevertheless match or exceed scalar accuracy when the observed phenotype contains variation absent from the metabolic model. The main benefit is therefore not guaranteed predictive improvement, but reliable feasibility and an explicit separation of learned, condition-dependent information from trusted structural assumptions. The approach is most useful when feasibility is essential, although solver cost and model misspecification remain important limitations.

Integrare conoscenze scientifiche nei modelli di machine learning è complesso quando le predizioni devono essere al tempo stesso adattive rispetto ai dati e coerenti con vincoli strutturali o meccanicistici. Le neural network (NN) catturano variazioni specifiche delle condizioni, ma possono produrre risultati non ammissibili; i modelli basati su principi, invece, impongono relazioni note ma spesso si adattano poco. Questa tesi sviluppa un framework semi-ammortizzato e differenziabile end-to-end che combina queste capacità complementari. Una NN trasforma le caratteristiche osservate in una proposta specifica per ciascuna istanza, successivamente raffinata da un layer di ottimizzazione convessa formulato come un unico quadratic program. Attraverso un obiettivo di tipo prossimale, il layer minimizza lo scostamento dall’output neurale imponendo al contempo vincoli di uguaglianza, disuguaglianza e limite derivati dalla prior knowledge. Poiché il problema di ottimizzazione è integrato nel grafo computazionale, la componente neurale viene addestrata attraverso il raffinamento vincolato. Quando l’insieme ammissibile è non vuoto e il problema è adeguatamente regolarizzato, il layer restituisce una soluzione ammissibile unica. Il framework è valutato su un problema proof-of-concept di flusso massimo e su un caso di studio biologico relativo alla predizione della crescita di E. coli a partire dalla composizione del terreno di coltura, utilizzando vincoli di flux balance. In entrambi i contesti, il raffinamento convesso riduce le violazioni dei vincoli fino alla tolleranza del solver, mantenendo prestazioni predittive competitive. I modelli neurali non vincolati possono tuttavia eguagliare o superare l’accuratezza scalare quando il fenotipo osservato include variazioni non rappresentate dal modello metabolico. Il principale vantaggio consiste nell’ammissibilità delle soluzioni e nella separazione esplicita tra informazione appresa, dipendente dalle condizioni, e assunzioni strutturali affidabili. L’approccio è particolarmente utile quando l’ammissibilità è essenziale, sebbene il costo computazionale del solver e la specificazione errata del modello restino limiti rilevanti.

Knowledge-based machine learning via semi-amortized neural networks and differentiable convex optimization layers

BOTTAZZI, DANIELE
2025/2026

Abstract

Integrating scientific knowledge into machine learning models is challenging when predictions must be both data-adaptive and consistent with structural or mechanistic constraints. Neural networks (NNs) capture condition-specific variation but may produce infeasible outputs, whereas principles-based models enforce known relationships but often adapt poorly. This thesis develops a semi-amortized, end-to-end differentiable framework that combines these complementary capabilities. A NN maps observed features to an instance-specific proposal, which is refined by a convex optimization layer formulated as a single quadratic program. Using a proximal-style objective, the layer minimizes deviation from the neural output while enforcing equality, inequality, and bound constraints derived from prior knowledge. Because the optimization problem is embedded in the computation graph, the neural component is trained through the constrained refinement. When the feasible set is non-empty and the problem is appropriately regularized, the layer returns a unique feasible solution. The framework is evaluated on a proof-of-concept maximum-flow problem and a biological case study predicting E. coli growth from medium composition using flux-balance constraints. In both settings, convex refinement reduces constraint violations to solver tolerance while maintaining competitive predictive performance. Unconstrained neural models can nevertheless match or exceed scalar accuracy when the observed phenotype contains variation absent from the metabolic model. The main benefit is therefore not guaranteed predictive improvement, but reliable feasibility and an explicit separation of learned, condition-dependent information from trusted structural assumptions. The approach is most useful when feasibility is essential, although solver cost and model misspecification remain important limitations.
ING - Scuola di Ingegneria Industriale e dell'Informazione
22-lug-2026
2025/2026
Integrare conoscenze scientifiche nei modelli di machine learning è complesso quando le predizioni devono essere al tempo stesso adattive rispetto ai dati e coerenti con vincoli strutturali o meccanicistici. Le neural network (NN) catturano variazioni specifiche delle condizioni, ma possono produrre risultati non ammissibili; i modelli basati su principi, invece, impongono relazioni note ma spesso si adattano poco. Questa tesi sviluppa un framework semi-ammortizzato e differenziabile end-to-end che combina queste capacità complementari. Una NN trasforma le caratteristiche osservate in una proposta specifica per ciascuna istanza, successivamente raffinata da un layer di ottimizzazione convessa formulato come un unico quadratic program. Attraverso un obiettivo di tipo prossimale, il layer minimizza lo scostamento dall’output neurale imponendo al contempo vincoli di uguaglianza, disuguaglianza e limite derivati dalla prior knowledge. Poiché il problema di ottimizzazione è integrato nel grafo computazionale, la componente neurale viene addestrata attraverso il raffinamento vincolato. Quando l’insieme ammissibile è non vuoto e il problema è adeguatamente regolarizzato, il layer restituisce una soluzione ammissibile unica. Il framework è valutato su un problema proof-of-concept di flusso massimo e su un caso di studio biologico relativo alla predizione della crescita di E. coli a partire dalla composizione del terreno di coltura, utilizzando vincoli di flux balance. In entrambi i contesti, il raffinamento convesso riduce le violazioni dei vincoli fino alla tolleranza del solver, mantenendo prestazioni predittive competitive. I modelli neurali non vincolati possono tuttavia eguagliare o superare l’accuratezza scalare quando il fenotipo osservato include variazioni non rappresentate dal modello metabolico. Il principale vantaggio consiste nell’ammissibilità delle soluzioni e nella separazione esplicita tra informazione appresa, dipendente dalle condizioni, e assunzioni strutturali affidabili. L’approccio è particolarmente utile quando l’ammissibilità è essenziale, sebbene il costo computazionale del solver e la specificazione errata del modello restino limiti rilevanti.
File allegati
File Dimensione Formato  
2026_07_Bottazzi_ExecutiveSummary.pdf

accessibile in internet per tutti

Descrizione: executive summary
Dimensione 1.78 MB
Formato Adobe PDF
1.78 MB Adobe PDF Visualizza/Apri
2026_07_Bottazzi_Tesi.pdf

accessibile in internet per tutti

Descrizione: testo tesi
Dimensione 18.85 MB
Formato Adobe PDF
18.85 MB Adobe PDF Visualizza/Apri

I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10589/261377