The convergence of GPU-accelerated 5G NR baseband processing and artificial intelligence workloads at the network edge, a paradigm known as AI-RAN, demands effective GPU sharing mechanisms that can accommodate the distinct resource profiles of real-time radio access network (RAN) processing and AI inference. Existing GPU sharing technologies present fundamental tradeoffs: time-slicing introduces latency variability incompatible with real-time RAN; Multi-Process Service (MPS) lacks memory isolation and cannot coexist with workloads that bypass it; and Multi-Instance GPU (MIG), while providing hardware-enforced isolation, bundles compute and memory into indivisible GPU Instances, stranding significant memory when a workload underutilizes its allocation. This thesis investigates these sharing mechanisms in the context of AI-RAN co-location and proposes a novel approach based on MIG Compute Instances (CIs). By creating multiple CIs within a single GPU Instance, heterogeneous workloads can share the same memory pool while retaining isolated compute resources. We implement this approach through an extension to the NVIDIA Dynamic Resource Allocation (DRA) Kubernetes plugin, introducing a new mig-ci device type for on-demand CI lifecycle management, and a compatibility patch for the vLLM inference engine. We validate the approach on the Open6G testbed at Northeastern University, co-locating a commercial 5G NR L1 stack (NVIDIA Aerial cuPHY) and vLLM serving Llama~3.3 70B on a server equipped with the NVIDIA GH200 Grace Hopper Superchip. Results show no measurable degradation in 5G NR throughput, while extending the GPU memory that can be allocated to the LLM KV by 33 GiB, leading to a 6.3X increase in cache capacity (from 5.7 GiB to 35.9 GiB). This demonstrates that fine-grained GPU sharing can unlock substantial value in AI-RAN deployments.

La convergenza dell'elaborazione baseband 5G NR accelerata da GPU e dei carichi di lavoro di intelligenza artificiale all'edge della rete, un paradigma noto come AI-RAN, richiede tecnologie efficaci di condivisione della GPU in grado di gestire i distinti profili di risorse dell'elaborazione real-time della Radio Access Network (RAN) e dell'inferenza AI. Le tecnologie di condivisione della GPU esistenti presentano compromessi fondamentali: il time-slicing introduce una variabilità della latenza incompatibile con la real-timeness della RAN; Multi-Process Service (MPS) è privo di isolamento della risorse e non può coesistere con carichi di lavoro che non lo supportano; e Multi-Instance GPU (MIG), pur fornendo un isolamento a livello di hardware, raggruppa risorse di calcolo e memoria in GPU Instance indivisibili, rendendo inutilizzabile una quantità significativa di memoria quando un carico di lavoro non sfrutta appieno la propria allocazione. Questa tesi analizza le tecnologie di sharing GPU nel contesto della coesistenza AI-RAN e propone un approccio innovativo basato sulle MIG Compute Instances (CI). Creando più CI all'interno di una singola GPU Instance, carichi di lavoro eterogenei possono condividere la stessa memoria mantenendo al contempo isolamento per le risorse di calcolo. Questo approccio viene realizzato tramite un'estensione al plugin Kubernetes NVIDIA Dynamic Resource Allocation (DRA), introducendo un nuovo tipo di device mig-ci per la gestione del ciclo di vita delle CI su richiesta, e una patch di compatibilità per vLLM. Validiamo l'approccio sul testbed Open6G della Northeastern University, facendo coesistere uno stack 5G NR L1 commerciale (NVIDIA Aerial cuPHY) e vLLM con il modello Llama~3.3 70B su un server equipaggiato con l'NVIDIA GH200 Grace Hopper Superchip. I risultati non mostrano alcuna degradazione misurabile nel throughput 5G NR, mentre la memoria GPU allocabile alla KV cache del LLM viene estesa di 33 GiB, determinando un aumento della capacità di cache pari a 6,3X (da 5,7 GiB a 35,9 GiB). Ciò dimostra che una condivisione fine-grained della GPU può sbloccare un valore sostanziale nei deployment AI-RAN.

A new approach to GPU sharing for radio access network and Artificial Intelligence inference

Vacca, Alessandro
2025/2026

Abstract

The convergence of GPU-accelerated 5G NR baseband processing and artificial intelligence workloads at the network edge, a paradigm known as AI-RAN, demands effective GPU sharing mechanisms that can accommodate the distinct resource profiles of real-time radio access network (RAN) processing and AI inference. Existing GPU sharing technologies present fundamental tradeoffs: time-slicing introduces latency variability incompatible with real-time RAN; Multi-Process Service (MPS) lacks memory isolation and cannot coexist with workloads that bypass it; and Multi-Instance GPU (MIG), while providing hardware-enforced isolation, bundles compute and memory into indivisible GPU Instances, stranding significant memory when a workload underutilizes its allocation. This thesis investigates these sharing mechanisms in the context of AI-RAN co-location and proposes a novel approach based on MIG Compute Instances (CIs). By creating multiple CIs within a single GPU Instance, heterogeneous workloads can share the same memory pool while retaining isolated compute resources. We implement this approach through an extension to the NVIDIA Dynamic Resource Allocation (DRA) Kubernetes plugin, introducing a new mig-ci device type for on-demand CI lifecycle management, and a compatibility patch for the vLLM inference engine. We validate the approach on the Open6G testbed at Northeastern University, co-locating a commercial 5G NR L1 stack (NVIDIA Aerial cuPHY) and vLLM serving Llama~3.3 70B on a server equipped with the NVIDIA GH200 Grace Hopper Superchip. Results show no measurable degradation in 5G NR throughput, while extending the GPU memory that can be allocated to the LLM KV by 33 GiB, leading to a 6.3X increase in cache capacity (from 5.7 GiB to 35.9 GiB). This demonstrates that fine-grained GPU sharing can unlock substantial value in AI-RAN deployments.
ING - Scuola di Ingegneria Industriale e dell'Informazione
22-lug-2026
2025/2026
La convergenza dell'elaborazione baseband 5G NR accelerata da GPU e dei carichi di lavoro di intelligenza artificiale all'edge della rete, un paradigma noto come AI-RAN, richiede tecnologie efficaci di condivisione della GPU in grado di gestire i distinti profili di risorse dell'elaborazione real-time della Radio Access Network (RAN) e dell'inferenza AI. Le tecnologie di condivisione della GPU esistenti presentano compromessi fondamentali: il time-slicing introduce una variabilità della latenza incompatibile con la real-timeness della RAN; Multi-Process Service (MPS) è privo di isolamento della risorse e non può coesistere con carichi di lavoro che non lo supportano; e Multi-Instance GPU (MIG), pur fornendo un isolamento a livello di hardware, raggruppa risorse di calcolo e memoria in GPU Instance indivisibili, rendendo inutilizzabile una quantità significativa di memoria quando un carico di lavoro non sfrutta appieno la propria allocazione. Questa tesi analizza le tecnologie di sharing GPU nel contesto della coesistenza AI-RAN e propone un approccio innovativo basato sulle MIG Compute Instances (CI). Creando più CI all'interno di una singola GPU Instance, carichi di lavoro eterogenei possono condividere la stessa memoria mantenendo al contempo isolamento per le risorse di calcolo. Questo approccio viene realizzato tramite un'estensione al plugin Kubernetes NVIDIA Dynamic Resource Allocation (DRA), introducendo un nuovo tipo di device mig-ci per la gestione del ciclo di vita delle CI su richiesta, e una patch di compatibilità per vLLM. Validiamo l'approccio sul testbed Open6G della Northeastern University, facendo coesistere uno stack 5G NR L1 commerciale (NVIDIA Aerial cuPHY) e vLLM con il modello Llama~3.3 70B su un server equipaggiato con l'NVIDIA GH200 Grace Hopper Superchip. I risultati non mostrano alcuna degradazione misurabile nel throughput 5G NR, mentre la memoria GPU allocabile alla KV cache del LLM viene estesa di 33 GiB, determinando un aumento della capacità di cache pari a 6,3X (da 5,7 GiB a 35,9 GiB). Ciò dimostra che una condivisione fine-grained della GPU può sbloccare un valore sostanziale nei deployment AI-RAN.
File allegati
File Dimensione Formato  
2026_7_Vacca_Executive Summary.pdf

accessibile in internet per tutti

Dimensione 796.22 kB
Formato Adobe PDF
796.22 kB Adobe PDF Visualizza/Apri
2026_7_Vacca_Thesis.pdf

accessibile in internet per tutti

Dimensione 1.22 MB
Formato Adobe PDF
1.22 MB Adobe PDF Visualizza/Apri

I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10589/261548