Large Language Models (LLMs) are increasingly deployed in persona driven applications spanning education, customer service, mental health, and social interaction, raising fundamental concerns about how identity conditioning inter acts with social biases encoded during pretraining. While prior work has examined gender bias and personality simulation in isolation, the interaction between psy chologically grounded personality traits and gender stereotype expression in gener ated narratives remains largely uncharacterized. We present a large-scale controlled study of persona-conditioned narrative generation in English and Hindi, systemati cally varying persona gender, occupational role, and personality traits derived from the HEXACOandDarkTriadframeworks across six state-of-the-art language mod els. We introduce a sentence-level gender bias metric based on centroid-based co sine similarity between contextual narrative embeddings and gender-stereotypical reference centroids, extending the WEAT/SEAT paradigm to the discourse level. Across 23,400 narratives, we find that Dark Triad traits particularly Machiavellian ism and Psychopathy consistently amplify male-stereotypical semantic alignment, while prosocial HEXACO traits such as Agreeableness and Honesty-Humility exert a robust attenuating effect. Narcissism shows a directionally consistent but archi tecturally variable pattern. Strikingly, personality-induced bias shifts exceed the effect of the explicit gender label itself in a substantial proportion of conditions, indicating that persona configuration is at least as consequential as demographic specification in shaping generated content. These effects persist cross-linguistically, with Hindi exhibiting a systematic compression of effect magnitude attributable to its obligatory morphological gender-marking system. Our findings demonstrate that gender bias in LLMs is not a static property of demographic labeling but a context-dependent phenomenon shaped by psychological persona conditioning, underscoring the need for fairness evaluation frameworks that treat personality as a first-class variable alongside demographic identity.
I Large Language Model (LLM)sonosemprepiùutilizzati in applicazioni basate su persona nei settori dell’istruzione, del servizio clienti, della salute mentale e dell’interazione sociale, sollevando preoccupazioni fondamentali su come il condizionamento dell’identità interagisca con i bias sociali codificati durante il preaddestramento. Sebbene lavori precedenti abbiano esaminato il bias di genere e la simulazione della personalità in modo iso lato, l’interazione tra tratti di personalità psicologicamente fondati e l’espressione di stereotipi di genere nelle narrazioni generate rimane in larga parte non caratterizzata. Presentiamo uno studio controllato su larga scala della generazione di narrazioni condizionate da persona in inglese e hindi, variando sistematicamente il genere, il ruolo occupazionale e i tratti di personalità derivati dai framework HEXACO e Dark Triad su sei modelli linguistici allo stato dell’arte. Introduciamo una metrica di bias di genere a livello di frase basata sulla similar ità coseno centroid tra embedding narrativi contestuali e centroidi di riferimento stereotipicamente di genere, estendendo il paradigma WEAT/SEAT al livello del discorso. Su 23.400 narrazioni, riscontriamo che i tratti del Dark Triad-in particolare Machiavellismo e Psicopatia-amplificano in modo consistente l’allineamento semantico maschile-stereotipico, mentre i tratti prosociali HEXACO come Gradevolezza e Onestà-Umiltà esercitano un effetto attenuante robusto. Il Narcisismo mostra un pattern direzionalmente consistente ma architetturalmente variabile. In modo sorprendente, gli spostamenti di bias indotti dalla personalità superano l’effetto dell’etichetta di genere esplicita in una proporzione sostanziale delle condizioni, indicando che la configurazione della persona è almeno tanto determinante quanto la specifica demografica nel plasmare il contenuto generato. Questi effetti persistono in modo trasversale alle lingue, con l’hindi che mostra una compressione sistematica della grandezza degli effetti attribuibile al suo sistema obbligatorio di marcatura morfologica del genere. I nostri risultati di mostrano che il bias di genere negli LLM non è una proprietà statica dell’etichettatura demografica, ma un fenomeno dipendente dal contesto modellato dal condizionamento psicologico della persona, sottolineando la necessità di framework di valutazione dell’equità che trattino la personalità come una variabile di primo ordine accanto all’identità demografica.
The persona effect: analyzing how personality traits amplify gender bias in hindi and english large language model narratives
Gautam, Shreya;KUMAR, TANAY
2025/2026
Abstract
Large Language Models (LLMs) are increasingly deployed in persona driven applications spanning education, customer service, mental health, and social interaction, raising fundamental concerns about how identity conditioning inter acts with social biases encoded during pretraining. While prior work has examined gender bias and personality simulation in isolation, the interaction between psy chologically grounded personality traits and gender stereotype expression in gener ated narratives remains largely uncharacterized. We present a large-scale controlled study of persona-conditioned narrative generation in English and Hindi, systemati cally varying persona gender, occupational role, and personality traits derived from the HEXACOandDarkTriadframeworks across six state-of-the-art language mod els. We introduce a sentence-level gender bias metric based on centroid-based co sine similarity between contextual narrative embeddings and gender-stereotypical reference centroids, extending the WEAT/SEAT paradigm to the discourse level. Across 23,400 narratives, we find that Dark Triad traits particularly Machiavellian ism and Psychopathy consistently amplify male-stereotypical semantic alignment, while prosocial HEXACO traits such as Agreeableness and Honesty-Humility exert a robust attenuating effect. Narcissism shows a directionally consistent but archi tecturally variable pattern. Strikingly, personality-induced bias shifts exceed the effect of the explicit gender label itself in a substantial proportion of conditions, indicating that persona configuration is at least as consequential as demographic specification in shaping generated content. These effects persist cross-linguistically, with Hindi exhibiting a systematic compression of effect magnitude attributable to its obligatory morphological gender-marking system. Our findings demonstrate that gender bias in LLMs is not a static property of demographic labeling but a context-dependent phenomenon shaped by psychological persona conditioning, underscoring the need for fairness evaluation frameworks that treat personality as a first-class variable alongside demographic identity.| File | Dimensione | Formato | |
|---|---|---|---|
|
2026_03_KUMAR_GAUTAM_ExecutiveSummary.pdf
accessibile in internet per tutti
Descrizione: Executive Summary
Dimensione
289.71 kB
Formato
Adobe PDF
|
289.71 kB | Adobe PDF | Visualizza/Apri |
|
2026_03_KUMAR_GAUTAM_Thesis.pdf
accessibile in internet per tutti
Descrizione: Master's Thesis
Dimensione
1.43 MB
Formato
Adobe PDF
|
1.43 MB | Adobe PDF | Visualizza/Apri |
I documenti in POLITesi sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.
https://hdl.handle.net/10589/252720