The multi-source financial-prediction literature reports gains over price-only baselines, paper after paper: news, social media, macroeconomic indicators, and inter-stock graphs, fused through increasingly elaborate architectures, are said to beat price alone. Yet the empirical-asset-pricing literature finds that most published return predictors fail to replicate and decay sharply once published, which sets a low prior for any new predictability claim on liquid US equities. This article takes that prior seriously and tests the multi-source claim for daily next-day direction prediction of 55 large-cap US equities (2015-2023), under a single controlled ablation of 2,468 experiments that holds the universe, folds, seeds, and Bonferroni-corrected paired statistics constant across every comparison. No combination of news, social, macro, or graph signals significantly beats the price-only baseline, and the null holds across every axis we vary: three fusion strategies, two prediction targets, four text encoders, and a tenfold parameter range across two structurally distinct architectures. Inside the null, adding backward-looking news degrades direction prediction in four of the five folds. We then reproduce one prominent published positive (MSGCA) and show, from the authors' own released code, that its reported gain does not survive a leakage-free protocol: the reported model is selected on the test set, and under leakage-free validation-based selection on the same data and model the advantage disappears. A second system (CAMEF) shows a different pathway: its headline reproduces from the authors' released weights but collapses under a chronological train/test split, which the released code leaves to a non-default flag. On this problem the estimator and the rigour of its evaluation matter more than which data sources are added.
Nella letteratura sulla previsione finanziaria multi-sorgente i risultati positivi si susseguono, studio dopo studio: notizie, social media, indicatori macroeconomici e grafi di relazione tra titoli, combinati attraverso architetture sempre più elaborate, batterebbero il solo prezzo. La letteratura di empirical asset pricing restituisce però il quadro opposto: la maggior parte dei predittori di rendimento pubblicati non è replicabile e decade rapidamente dopo la pubblicazione, il che fissa un prior basso per qualunque nuova affermazione di prevedibilità sui titoli statunitensi ad alta liquidità. Questo lavoro prende sul serio tale prior e mette alla prova l'ipotesi multi-sorgente sulla previsione della direzione del rendimento del giorno successivo per 55 titoli statunitensi a grande capitalizzazione (2015-2023). Lo fa con un unico studio di ablazione controllato, composto da 2.468 esperimenti, che in ogni confronto mantiene costanti l'universo dei titoli, i fold temporali, i seed e le statistiche appaiate con correzione di Bonferroni. Nessuna combinazione di notizie, social media, indicatori macroeconomici o grafi supera in modo significativo il modello basato sul solo prezzo, e il risultato nullo si conferma lungo ogni asse considerato: tre strategie di fusione, due target di previsione, quattro encoder testuali e una variazione di un ordine di grandezza nel numero di parametri tra due architetture strutturalmente distinte. All'interno di questo risultato nullo, l'aggiunta di notizie rivolte al passato peggiora la previsione della direzione in quattro fold su cinque. Riproduciamo poi un noto risultato positivo della letteratura (MSGCA) e mostriamo, a partire dal codice rilasciato dagli stessi autori, che il guadagno riportato non sopravvive a una valutazione priva di leakage: il modello riportato è selezionato sull'insieme di test e, con una selezione basata sull'insieme di validazione e priva di leakage, a parità di dati e di modello, il vantaggio svanisce. Un secondo sistema (CAMEF) segue una via diversa: il suo risultato di punta si riproduce a partire dai pesi rilasciati dagli autori, ma crolla con una suddivisione train/test cronologica, che nel codice rilasciato è governata da un'opzione disattivata di default. Su questo problema contano più lo stimatore e il rigore della sua valutazione che non le sorgenti di dati aggiunte.
Does multi-source data beat price alone? A controlled ablation for next-day stock direction prediction
LTIFI, MOUADH
2025/2026
Abstract
The multi-source financial-prediction literature reports gains over price-only baselines, paper after paper: news, social media, macroeconomic indicators, and inter-stock graphs, fused through increasingly elaborate architectures, are said to beat price alone. Yet the empirical-asset-pricing literature finds that most published return predictors fail to replicate and decay sharply once published, which sets a low prior for any new predictability claim on liquid US equities. This article takes that prior seriously and tests the multi-source claim for daily next-day direction prediction of 55 large-cap US equities (2015-2023), under a single controlled ablation of 2,468 experiments that holds the universe, folds, seeds, and Bonferroni-corrected paired statistics constant across every comparison. No combination of news, social, macro, or graph signals significantly beats the price-only baseline, and the null holds across every axis we vary: three fusion strategies, two prediction targets, four text encoders, and a tenfold parameter range across two structurally distinct architectures. Inside the null, adding backward-looking news degrades direction prediction in four of the five folds. We then reproduce one prominent published positive (MSGCA) and show, from the authors' own released code, that its reported gain does not survive a leakage-free protocol: the reported model is selected on the test set, and under leakage-free validation-based selection on the same data and model the advantage disappears. A second system (CAMEF) shows a different pathway: its headline reproduces from the authors' released weights but collapses under a chronological train/test split, which the released code leaves to a non-default flag. On this problem the estimator and the rigour of its evaluation matter more than which data sources are added.| File | Dimensione | Formato | |
|---|---|---|---|
|
Does Multi-Source Data Beat Price Alone.pdf
accessibile in internet per tutti
Dimensione
675.75 kB
Formato
Adobe PDF
|
675.75 kB | Adobe PDF | Visualizza/Apri |
|
Executive Summary.pdf
accessibile in internet per tutti
Descrizione: Executive Summary - Extended Abstract
Dimensione
236.59 kB
Formato
Adobe PDF
|
236.59 kB | Adobe PDF | Visualizza/Apri |
I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.
https://hdl.handle.net/10589/260344