This thesis examines model compression as a practical response to the growing cost and complexity of deploying large language models. It argues that model quality alone is insufficient for real-world adoption: inference systems must also meet requirements related to memory, latency, throughput, hardware availability, and operational control. Compression is therefore considered as a deployment trade-off rather than as a simple reduction in model size. The thesis introduces the foundations of large language model inference and reviews the main compression techniques, including quantization, pruning, distillation, low-rank methods, tensor-network approaches, sparsity, and key--value cache optimization. It also discusses the relevance of compression for enterprise, on-premises, edge, and energy-aware applications. The central case study is CompactifAI, Multiverse Computing's tensor-network compression framework, analysed through a collaboration with the company. The empirical evaluation compares compressed and original language models in terms of model footprint, serving performance, and task quality. The results show that compression can improve deployment feasibility, while the resulting quality--efficiency trade-off depends on the model, workload, and intended application. The thesis concludes that every compressed model should be evaluated as a distinct version before production adoption.

Questa tesi esamina la compressione dei modelli come risposta pratica al crescente costo e alla complessità di distribuire modelli linguistici di grandi dimensioni. Sostiene che la qualità del modello, da sola, non sia sufficiente per l'adozione nel mondo reale: i sistemi di inferenza devono soddisfare anche requisiti legati a memoria, latenza, throughput, disponibilità dell'hardware e controllo operativo. La compressione viene quindi considerata come un compromesso di deployment, anzichè come una semplice riduzione della dimensione del modello. La tesi introduce le basi dell'inferenza dei modelli linguistici di grandi dimensioni ed esamina le principali tecniche di compressione, tra cui quantizzazione, pruning, distillazione, metodi a basso rango, approcci basati su reti tensoriali, sparsity e ottimizzazione della cache chiave-valore. Discute inoltre la rilevanza della compressione per applicazioni aziendali, on-premises, edge ed energy-aware. Il caso di studio centrale è CompactifAI, il framework di compressione basato su reti tensoriali di Multiverse Computing, analizzato attraverso una collaborazione con l'azienda. La valutazione empirica confronta modelli linguistici compressi e originali in termini di occupazione del modello, prestazioni di serving e qualità nei task. I risultati mostrano che la compressione può migliorare la fattibilità del deployment, mentre il compromesso tra qualità ed efficienza dipende dal modello, dal carico di lavoro e dall'applicazione prevista. La tesi conclude che ogni modello compresso debba essere valutato come versione distinta prima dell'adozione in produzione.

Large Language Model compression: a comparative evaluation with CompactifAI

Zamuner, Matteo
2025/2026

Abstract

This thesis examines model compression as a practical response to the growing cost and complexity of deploying large language models. It argues that model quality alone is insufficient for real-world adoption: inference systems must also meet requirements related to memory, latency, throughput, hardware availability, and operational control. Compression is therefore considered as a deployment trade-off rather than as a simple reduction in model size. The thesis introduces the foundations of large language model inference and reviews the main compression techniques, including quantization, pruning, distillation, low-rank methods, tensor-network approaches, sparsity, and key--value cache optimization. It also discusses the relevance of compression for enterprise, on-premises, edge, and energy-aware applications. The central case study is CompactifAI, Multiverse Computing's tensor-network compression framework, analysed through a collaboration with the company. The empirical evaluation compares compressed and original language models in terms of model footprint, serving performance, and task quality. The results show that compression can improve deployment feasibility, while the resulting quality--efficiency trade-off depends on the model, workload, and intended application. The thesis concludes that every compressed model should be evaluated as a distinct version before production adoption.
ING - Scuola di Ingegneria Industriale e dell'Informazione
22-lug-2026
2025/2026
Questa tesi esamina la compressione dei modelli come risposta pratica al crescente costo e alla complessità di distribuire modelli linguistici di grandi dimensioni. Sostiene che la qualità del modello, da sola, non sia sufficiente per l'adozione nel mondo reale: i sistemi di inferenza devono soddisfare anche requisiti legati a memoria, latenza, throughput, disponibilità dell'hardware e controllo operativo. La compressione viene quindi considerata come un compromesso di deployment, anzichè come una semplice riduzione della dimensione del modello. La tesi introduce le basi dell'inferenza dei modelli linguistici di grandi dimensioni ed esamina le principali tecniche di compressione, tra cui quantizzazione, pruning, distillazione, metodi a basso rango, approcci basati su reti tensoriali, sparsity e ottimizzazione della cache chiave-valore. Discute inoltre la rilevanza della compressione per applicazioni aziendali, on-premises, edge ed energy-aware. Il caso di studio centrale è CompactifAI, il framework di compressione basato su reti tensoriali di Multiverse Computing, analizzato attraverso una collaborazione con l'azienda. La valutazione empirica confronta modelli linguistici compressi e originali in termini di occupazione del modello, prestazioni di serving e qualità nei task. I risultati mostrano che la compressione può migliorare la fattibilità del deployment, mentre il compromesso tra qualità ed efficienza dipende dal modello, dal carico di lavoro e dall'applicazione prevista. La tesi conclude che ogni modello compresso debba essere valutato come versione distinta prima dell'adozione in produzione.
File allegati
File Dimensione Formato  
2026_07_Zamuner.pdf

non accessibile

Descrizione: testo della tesi
Dimensione 2.63 MB
Formato Adobe PDF
2.63 MB Adobe PDF   Visualizza/Apri

I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10589/260842