Large language models (LLMs) are increasingly used in multilingual settings, where reliability and inference cost vary across models, languages, and prompts. Recent work has shown that a model's future success can be predicted from pre-generation hidden activations, but it remains unclear whether these signals can be reused across languages without labelled examples in each target language. This thesis studies the layer-wise transferability of pre-generation success probes in multilingual large language models. A multilingual benchmark is constructed from 3,000 MATH problems translated into ten languages. For each model, language, and problem, repeated generations are used to estimate empirical success rates, while pre-generation residual-stream activations are extracted at every layer. Linear ridge-regression probes are then trained to predict model success under same-language, cross-lingual, and pooled multilingual settings. The results show that success is linearly decodable across models and languages, and that cross-lingual transfer is consistently informative. However, transfer depends on layer depth, with the most transferable signals generally appearing in intermediate or middle-to-late layers and declining toward the final layers. English-trained probes transfer discriminatively but are often poorly calibrated, while pooled multilingual probes provide more reliable score estimates. A routing simulation further shows that pooled multilingual probes achieve a stronger accuracy--cost trade-off than English-only transfer probes. Overall, the thesis shows that pre-generation success signals can transfer across languages, but reliable multilingual use requires attention to layer depth, calibration, and decision thresholds.
I Large Language Models (LLMs) sono sempre più utilizzati in contesti multilingue, dove l'affidabilità delle risposte e il costo di inferenza possono variare sensibilmente in funzione del modello utilizzato e alla lingua in cui è scritto il prompt. Studi recenti hanno dimostrato che è possibile prevedere il futuro successo di un modello analizzandone le attivazioni interne prima che inizi a generare una risposta. Tuttavia, non è chiaro se questi segnali possano essere trasferiti e riutilizzati tra lingue diverse. Questa tesi analizza tali segnali attraverso l'uso di probe, ovvero semplici modelli predittivi addestrati sulle attivazioni interne prodotte dopo l'elaborazione del prompt. L'obiettivo è comprendere se i segnali appresi in una lingua possano essere riutilizzati anche in altre lingue, oppure se sia necessario disporre di dati etichettati specifici per ciascuna lingua di destinazione. A questo scopo, viene costruito un benchmark multilingue basato su 3.000 problemi del dataset MATH tradotti in dieci lingue. Per ogni modello, lingua e problema vengono generate più risposte, in modo da stimare un tasso empirico di successo. Le attivazioni vengono quindi estratte a diversi livelli del modello e utilizzate per addestrare regressori lineari con l'obiettivo di predire la correttezza della risposta finale. I risultati mostrano che è possibile prevedere il successo di un modello a partire dalle attivazioni estratte prima dell'inizio della generazione, e che i probe mantengono capacità predittiva anche quando vengono trasferiti tra lingue diverse. Tuttavia, la trasferibilità varia attraverso la profondità del modello, con segnali più riutilizzabili presenti nei layer intermedi. Inoltre, i probe addestrati esclusivamente in inglese risultano spesso informativi ma scarsamente calibrati, mentre quelli addestrati su dati multilingue producono stime più affidabili. Infine, una simulazione di routing mostra che questi segnali possono essere impiegati per selezionare in modo efficiente il modello da utilizzare per ciascun prompt.
Layer-wise transferability of pre-generation success probes in multilingual Large Language Models
PAGANELLI, ANDREA
2025/2026
Abstract
Large language models (LLMs) are increasingly used in multilingual settings, where reliability and inference cost vary across models, languages, and prompts. Recent work has shown that a model's future success can be predicted from pre-generation hidden activations, but it remains unclear whether these signals can be reused across languages without labelled examples in each target language. This thesis studies the layer-wise transferability of pre-generation success probes in multilingual large language models. A multilingual benchmark is constructed from 3,000 MATH problems translated into ten languages. For each model, language, and problem, repeated generations are used to estimate empirical success rates, while pre-generation residual-stream activations are extracted at every layer. Linear ridge-regression probes are then trained to predict model success under same-language, cross-lingual, and pooled multilingual settings. The results show that success is linearly decodable across models and languages, and that cross-lingual transfer is consistently informative. However, transfer depends on layer depth, with the most transferable signals generally appearing in intermediate or middle-to-late layers and declining toward the final layers. English-trained probes transfer discriminatively but are often poorly calibrated, while pooled multilingual probes provide more reliable score estimates. A routing simulation further shows that pooled multilingual probes achieve a stronger accuracy--cost trade-off than English-only transfer probes. Overall, the thesis shows that pre-generation success signals can transfer across languages, but reliable multilingual use requires attention to layer depth, calibration, and decision thresholds.| File | Dimensione | Formato | |
|---|---|---|---|
|
2026_07_Paganelli_Thesis.pdf
accessibile in internet per tutti
Dimensione
2.56 MB
Formato
Adobe PDF
|
2.56 MB | Adobe PDF | Visualizza/Apri |
|
2026_07_Paganelli_Executive_Summary.pdf
accessibile in internet per tutti
Dimensione
640.55 kB
Formato
Adobe PDF
|
640.55 kB | Adobe PDF | Visualizza/Apri |
I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.
https://hdl.handle.net/10589/261357