Technical manuals make retrieval-augmented generation harder than ordinary passage retrieval. Useful evidence may appear as prose, table rows, screenshots, icons, drawing labels, page layout, or cross-page procedures. This thesis presents RAG-Flow, a multimodal pipeline that converts technical-manual PDFs into auditable evidence for retrieval and question answering. The evaluation was built in stages rather than as a single final run: v1 established the pipeline and visual-enhancement baselines; v2 tightened the artifact contract and tested chunking, retrieval, answering, and presets on 14 PDFs; v3 kept the v2 pipeline fixed and checked whether the remaining weakness could be explained by the text-retrieval backbone alone. The final v2 validation uses a 50-question search set, a 200-question validation set, and three separate Codex 5.5 extra-high review passes per answer. The selected online contract is deliberately limited. It uses section-aware 1500/150/150 chunks, dense plus sparse text retrieval, and six runnable presets: low, medium, high, low-with-image-input, medium-with-image-input, and medium-with-visual-recall. On the 200-question validation set, high obtains the best mean score, 2.4133, while low reaches 2.3833 with much lower average retrieved context, 4156 tokens. Some negative results were as important as the winning row: the 24k context setting often crossed the serving limit, thinking-on sometimes produced empty answers, and image input could make visual-counting questions worse rather than better. Direct-PDF and v3 diagnostics suggest that the remaining gap is not only a text-backbone issue; it also comes from evidence preservation, evidence selection, and answerer capability.

I manuali tecnici rendono la retrieval-augmented generation più difficile del normale retrieval di passaggi. L’evidenza utile può trovarsi in testo, righe di tabella, screenshot, icone, etichette di disegni, layout di pagina o procedure su più pagine. Questa tesi presenta RAG-Flow, una pipeline multimodale che trasforma PDF di manuali tecnici in evidenza verificabile per il retrieval e la generazione di risposte. La valutazione è stata costruita per fasi, non come un’unica esecuzione finale: v1 stabilisce la pipeline e le baseline di arricchimento visuale; v2 raffina il contratto degli artefatti e testa chunking, retrieval, answering e preset su 14 PDF; v3 mantiene fissa la pipeline v2 e controlla se la debolezza residua possa essere spiegata solo dal backbone di retrieval testuale. La validazione finale v2 usa un set di ricerca da 50 domande, un set di validazione da 200 domande e tre passaggi separati di revisione Codex 5.5 extra-high per ogni risposta. Il contratto online selezionato è volutamente limitato. Usa chunk sensibili alle sezioni 1500/150/150, retrieval testuale denso e sparso, e sei preset eseguibili: low, medium, high, low-with-image-input, medium-with-image-input e medium-with-visual-recall. Nella validazione da 200 domande, high ottiene il miglior punteggio medio, 2.4133, mentre low raggiunge 2.3833 con un contesto recuperato medio molto più basso, 4156 token. Alcuni risultati negativi sono stati importanti quanto la riga migliore: il contesto da 24k spesso supera il limite di serving, il thinking-on produce talvolta risposte vuote, e l’input immagine può peggiorare domande di conteggio visuale invece di migliorarle. Le diagnostiche direct-PDF e v3 suggeriscono che il divario residuo non è solo un problema di backbone testuale, ma anche di preservazione dell’evidenza, selezione dell’evidenza e capacità del modello di risposta.

RAG-Flow: a multimodal retrieval-augmented generation pipeline for technical manuals

Cheng, Ziyan
2025/2026

Abstract

Technical manuals make retrieval-augmented generation harder than ordinary passage retrieval. Useful evidence may appear as prose, table rows, screenshots, icons, drawing labels, page layout, or cross-page procedures. This thesis presents RAG-Flow, a multimodal pipeline that converts technical-manual PDFs into auditable evidence for retrieval and question answering. The evaluation was built in stages rather than as a single final run: v1 established the pipeline and visual-enhancement baselines; v2 tightened the artifact contract and tested chunking, retrieval, answering, and presets on 14 PDFs; v3 kept the v2 pipeline fixed and checked whether the remaining weakness could be explained by the text-retrieval backbone alone. The final v2 validation uses a 50-question search set, a 200-question validation set, and three separate Codex 5.5 extra-high review passes per answer. The selected online contract is deliberately limited. It uses section-aware 1500/150/150 chunks, dense plus sparse text retrieval, and six runnable presets: low, medium, high, low-with-image-input, medium-with-image-input, and medium-with-visual-recall. On the 200-question validation set, high obtains the best mean score, 2.4133, while low reaches 2.3833 with much lower average retrieved context, 4156 tokens. Some negative results were as important as the winning row: the 24k context setting often crossed the serving limit, thinking-on sometimes produced empty answers, and image input could make visual-counting questions worse rather than better. Direct-PDF and v3 diagnostics suggest that the remaining gap is not only a text-backbone issue; it also comes from evidence preservation, evidence selection, and answerer capability.
ING - Scuola di Ingegneria Industriale e dell'Informazione
22-lug-2026
2025/2026
I manuali tecnici rendono la retrieval-augmented generation più difficile del normale retrieval di passaggi. L’evidenza utile può trovarsi in testo, righe di tabella, screenshot, icone, etichette di disegni, layout di pagina o procedure su più pagine. Questa tesi presenta RAG-Flow, una pipeline multimodale che trasforma PDF di manuali tecnici in evidenza verificabile per il retrieval e la generazione di risposte. La valutazione è stata costruita per fasi, non come un’unica esecuzione finale: v1 stabilisce la pipeline e le baseline di arricchimento visuale; v2 raffina il contratto degli artefatti e testa chunking, retrieval, answering e preset su 14 PDF; v3 mantiene fissa la pipeline v2 e controlla se la debolezza residua possa essere spiegata solo dal backbone di retrieval testuale. La validazione finale v2 usa un set di ricerca da 50 domande, un set di validazione da 200 domande e tre passaggi separati di revisione Codex 5.5 extra-high per ogni risposta. Il contratto online selezionato è volutamente limitato. Usa chunk sensibili alle sezioni 1500/150/150, retrieval testuale denso e sparso, e sei preset eseguibili: low, medium, high, low-with-image-input, medium-with-image-input e medium-with-visual-recall. Nella validazione da 200 domande, high ottiene il miglior punteggio medio, 2.4133, mentre low raggiunge 2.3833 con un contesto recuperato medio molto più basso, 4156 token. Alcuni risultati negativi sono stati importanti quanto la riga migliore: il contesto da 24k spesso supera il limite di serving, il thinking-on produce talvolta risposte vuote, e l’input immagine può peggiorare domande di conteggio visuale invece di migliorarle. Le diagnostiche direct-PDF e v3 suggeriscono che il divario residuo non è solo un problema di backbone testuale, ma anche di preservazione dell’evidenza, selezione dell’evidenza e capacità del modello di risposta.
File allegati
File Dimensione Formato  
Thesis.pdf

accessibile in internet per tutti

Dimensione 678.79 kB
Formato Adobe PDF
678.79 kB Adobe PDF Visualizza/Apri

I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/10589/259920