Multimodal large language models (MLLMs) applied to Medical Visual Question Answering (VQA) tend to produce overconfident outputs regardless of actual correctness, and existing verbalized confidence calibration methods, developed primarily for text-only LLMs, do not account for the multimodal nature of medical image understanding. This thesis proposes a training-based framework that fine-tunes MedGemma-4B-IT using a composite calibration loss combining a Brier-style calibration term, an anchor regularizer that prevents confidence collapse toward extreme values, and a contrastive alignment term. The alignment signal is derived from a 2x2 factorial perturbation design that crosses image presence with text integrity, producing paired training conditions that probe the model's reliance on visual modality input versus language priors. To preserve the model's answering ability during confidence fine-tuning, we replace the standard cross-entropy regularizer on answer tokens with a top-k KL divergence regularizer computed against a frozen copy of the base model. Across three Medical VQA benchmarks spanning different accuracy regimes (70%, 45%, and 24% mean accuracy), our method reduces average calibration error by more than 50% relative to the base model, improves confidence ranking ability by 27%, and preserves or slightly improves predictive accuracy on every benchmark. Calibration transfers across datasets and accuracy regimes, and the method outperforms all compared baselines, including both prompting-based and training-based approaches, on the combined calibration and discrimination metrics. Ablation experiments confirm that each loss component serves a distinct role: the alignment term drives discrimination while the KL regularizer protects generalization under distribution shift.
I modelli linguistici multimodali di grandi dimensioni (MLLM) applicati al Visual Question Answering (VQA) medico tendono a produrre risposte con un livello di confidenza eccessivo indipendentemente dalla correttezza effettiva, e i metodi esistenti di calibrazione della confidenza verbalizzata, sviluppati principalmente per LLM solo testuali, non tengono conto della natura multimodale della comprensione delle immagini mediche. Questa tesi propone un framework basato su addestramento che esegue il fine-tuning di MedGemma-4B-IT utilizzando una funzione di perdita composita di calibrazione che combina un termine di calibrazione in stile Brier, un regolarizzatore di ancoraggio che previene il collasso della confidenza verso valori estremi e un termine di allineamento contrastivo. Il segnale di allineamento deriva da un disegno di perturbazione fattoriale 2x2 che incrocia la presenza dell'immagine con l'integrit`a del testo, producendo coppie di condizioni di addestramento che sondano la dipendenza del modello dall'input visivo rispetto ai prior linguistici. Per preservare la capacit`a del modello di rispondere durante il fine-tuning della confidenza, sostituiamo il regolarizzatore standard basato su cross-entropy sui token di risposta con un regolarizzatore di divergenza KL top-k calcolato rispetto a una copia congelata del modello base. Su tre benchmark di VQA medico che coprono diversi regimi di accuratezza (70%, 45% e 24% di accuratezza media), il nostro metodo riduce l'errore medio di calibrazione di oltre il 50% rispetto al modello base, migliora la capacit`a di ordinamento della confidenza del 27% e preserva o migliora leggermente l'accuratezza predittiva su ogni benchmark. La calibrazione si trasferisce tra dataset e regimi di accuratezza, e il metodo supera tutti i baseline confrontati, inclusi approcci sia basati su prompting che su addestramento, sulle metriche combinate di calibrazione e discriminazione. Gli esperimenti di ablazione confermano che ogni componente della funzione di perdita svolge un ruolo distinto: il termine di allineamento guida la discriminazione mentre il regolarizzatore KL protegge la generalizzazione sotto distributional shift.
Verbalized uncertainty calibration of multimodal LLMs in Medical VQA
Senoglu, Eren
2025/2026
Abstract
Multimodal large language models (MLLMs) applied to Medical Visual Question Answering (VQA) tend to produce overconfident outputs regardless of actual correctness, and existing verbalized confidence calibration methods, developed primarily for text-only LLMs, do not account for the multimodal nature of medical image understanding. This thesis proposes a training-based framework that fine-tunes MedGemma-4B-IT using a composite calibration loss combining a Brier-style calibration term, an anchor regularizer that prevents confidence collapse toward extreme values, and a contrastive alignment term. The alignment signal is derived from a 2x2 factorial perturbation design that crosses image presence with text integrity, producing paired training conditions that probe the model's reliance on visual modality input versus language priors. To preserve the model's answering ability during confidence fine-tuning, we replace the standard cross-entropy regularizer on answer tokens with a top-k KL divergence regularizer computed against a frozen copy of the base model. Across three Medical VQA benchmarks spanning different accuracy regimes (70%, 45%, and 24% mean accuracy), our method reduces average calibration error by more than 50% relative to the base model, improves confidence ranking ability by 27%, and preserves or slightly improves predictive accuracy on every benchmark. Calibration transfers across datasets and accuracy regimes, and the method outperforms all compared baselines, including both prompting-based and training-based approaches, on the combined calibration and discrimination metrics. Ablation experiments confirm that each loss component serves a distinct role: the alignment term drives discrimination while the KL regularizer protects generalization under distribution shift.| File | Dimensione | Formato | |
|---|---|---|---|
|
2026_03_Senoglu_Thesis.pdf
accessibile in internet per tutti a partire dal 02/03/2029
Descrizione: Thesis
Dimensione
7.28 MB
Formato
Adobe PDF
|
7.28 MB | Adobe PDF | Visualizza/Apri |
|
2026_03_Senoglu_Executive_Summary.pdf
accessibile in internet per tutti a partire dal 02/03/2029
Descrizione: Executive Summary
Dimensione
852.54 kB
Formato
Adobe PDF
|
852.54 kB | Adobe PDF | Visualizza/Apri |
I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.
https://hdl.handle.net/10589/253643