Questo studio ha analizzato esclusivamente testi generati dall'intelligenza artificiale e non ha coinvolto partecipanti umani, animali, campioni biologici, cartelle cliniche, informazioni personali identificabili né interventi nell'assistenza clinica. Pertanto, la revisione etica e il consenso informato formale non erano applicabili.
Progettazione dello studio
Questo studio trasversale ha valutato la leggibilità, la qualità e l'idoneità educativa delle risposte generate da cinque modelli linguistici di grandi dimensioni (LLM) in risposta a domande frequenti riguardanti la nevralgia del trigemino (TN).
Identificazione delle domande più comuni relative al TN
Il 25 novembre 2025, due esperti clinici con ampia esperienza in medicina del dolore hanno esaminato in modo indipendente le attuali linee guida cliniche per la nevralgia del trigemino (TN), inclusa la Classificazione Internazionale dei Disturbi Cefalalgici, terza edizione (ICHD-3), la linea guida dell'Accademia Europea di Neurologia e la linea guida dell'Accademia Americana di Neurologia/Federazione Europea delle Società di Neurologia1,10,11. Dopo una discussione di consenso, hanno compilato un elenco di 20 domande relative alla TN comunemente riscontrate nella pratica clinica. Il numero di domande è stato stabilito a priori per garantire una copertura equilibrata dei cinque domini tematici predeterminati, con quattro domande selezionate per ciascun dominio, mantenendo nel contempo il numero totale di risposte generate dal modello entro un intervallo gestibile per la valutazione e verifica manuale da parte di esperti. Per migliorare la riproducibilità, il processo di selezione ha seguito un quadro predeterminato basato sui domini: gli esperti hanno innanzitutto identificato le domande candidate all'interno di ciascun dominio, le hanno esaminate autonomamente per rilevanza clinica, formulazione orientata al paziente e assenza di ridondanze, quindi hanno raggiunto un accordo sulle quattro domande finali per ogni dominio. L'elenco finale delle domande è riportato nella Tabella 1 e nel File Supplementare 1. I cinque domini tematici predeterminati erano conoscenze di base sulla malattia, eziologia e fattori di rischio, diagnosi, trattamento, prevenzione e riabilitazione. Poiché l'insieme delle domande non è stato ricavato da log di ricerca dei pazienti, query online o interviste formali ai pazienti, si riconosce la possibilità di un bias di selezione come limitazione dello studio.
Modelli di intelligenza artificiale e procedura di raccolta dati
Il 25 novembre 2025, l'insieme definitivo di 20 domande relative al TN è stato inviato a cinque piattaforme pubblicamente accessibili di modelli linguistici di grandi dimensioni (LLM): Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen e GPT-5/ChatGPT. A tutti i modelli si è acceduto tramite le loro normali interfacce web pubbliche basate su chat; non è stato utilizzato l'accesso tramite application programming interface (API). Per ciascuna piattaforma, è stato impiegato il modello pubblicamente disponibile per impostazione predefinita alla data della raccolta dei dati, senza alcuna modifica dei parametri di generazione. Poiché le interfacce web pubbliche non mostravano identificatori del modello backend, prompt di sistema nascosti, temperatura, top-p, numero massimo di token in uscita o altri parametri di generazione, queste informazioni sono state registrate come "non visualizzate nell'interfaccia web pubblica".
Le lingue del prompt e della risposta erano l'inglese per tutti i modelli. Ogni prompt standardizzato consisteva esclusivamente della domanda in inglese riportata alla lettera, senza ulteriori istruzioni specifiche per il modello. Ogni domanda è stata inviata singolarmente in una nuova sessione di chat indipendente, senza alcuna cronologia di conversazioni precedenti, file caricati, plug-in, istruzioni personalizzate o prompt di follow-up. L'elenco completo dei prompt standardizzati e le corrispondenti risposte grezze dei modelli sono riportati nel File Supplementare 1. I metadati dei modelli e le impostazioni di raccolta dati sono riassunti nella Tabella Supplementare 1.
Valutazione della leggibilità
La leggibilità delle risposte generate da LLM è stata valutata utilizzando diverse formule di leggibilità consolidate disponibili tramite una piattaforma online per la valutazione della leggibilità (http://readabilityformulas.com/). In assenza di uno standard universale accettato per la valutazione della leggibilità e in linea con studi precedenti, è stato impiegato un insieme completo di indici di leggibilità ampiamente utilizzati23,27. Sono stati selezionati sette indici per cogliere aspetti complementari della leggibilità, inclusi la lunghezza delle frasi, la lunghezza delle parole, il carico sillabico, la complessità basata sui caratteri, la facilità di lettura e il livello scolastico stimato, riducendo così la dipendenza da una singola formula. In particolare, sono stati calcolati l'Indice di Coleman-Liau (CL), la Formula Linsear Write (LW), l'Indice di Leggibilità Automatica (ARI), la Misura Semplice di Gobbledygook (SMOG), l'Indice Gunning Fog (GFOG), il Punteggio di Facilità di Lettura di Flesch (FRES) e il Livello Scolastico Flesch-Kincaid (FKGL). Questi indici stimano la difficoltà di lettura o il livello scolastico e forniscono misure quantitative della leggibilità del testo (Tabella 2).
Valutazione dell'idoneità educativa e della qualità delle informazioni
L'idoneità educativa è stata valutata utilizzando lo strumento di valutazione dei materiali informativi per i pazienti (Patient Education Materials Assessment Tool, PEMAT), che comprende due domini: comprensibilità e attuabilità28. Lo strumento comprende 24 elementi, di cui 16 valutano la comprensibilità e otto l'attuabilità. Ogni elemento è stato valutato in modo dicotomico (0 = criterio non soddisfatto; 1 = criterio soddisfatto), producendo un punteggio totale compreso tra 0 e 24, dove punteggi più alti indicano una maggiore idoneità per l'educazione del paziente. La qualità complessiva delle informazioni è stata valutata mediante il punteggio di qualità globale (Global Quality Score, GQS)27, una scala di tipo Likert a cinque punti ampiamente utilizzata per la valutazione della qualità delle informazioni mediche (Tabella 3).
Il 25 novembre 2025, due esperti clinici con oltre 3 anni di esperienza nella gestione della nevralgia del trigemino hanno valutato tutte le risposte generate dall'intelligenza artificiale utilizzando entrambi gli strumenti di valutazione. Prima della valutazione, tutte le risposte generate dall'IA sono state anonimizzate mediante identificatori codificati, e i revisori sono stati mantenuti all'oscuro della piattaforma di linguaggio di grandi dimensioni durante le valutazioni PEMAT e GQS. Le divergenze sono state risolte da un terzo esperto senior, che ha stabilito i punteggi finali. L'affidabilità tra valutatori è stata misurata mediante il coefficiente kappa di Cohen, con valori >0,75 che indicano un accordo eccellente, da 0,40 a 0,75 un accordo accettabile e <0,40 un accordo scarso. I valori kappa di Cohen per PEMAT e GQS hanno superato entrambi 0,75, dimostrando un'elevata affidabilità tra valutatori.
Analisi statistica
Tutte le analisi statistiche sono state eseguite utilizzando il software R (versione 4.4.3). La normalità dei dati è stata valutata mediante il test di Shapiro-Wilk e i grafici Q-Q. Le variabili distribuite normalmente sono state riassunte come media ± deviazione standard e confrontate utilizzando l'analisi della varianza a un fattore (ANOVA), seguita dal test post hoc di Tukey quando appropriato. Le variabili non distribuite normalmente sono state riassunte come mediane e intervalli interquartili e confrontate utilizzando il test di Kruskal-Wallis, seguito dal test post hoc di Dunn con correzione di Bonferroni per i confronti a coppie. Le correlazioni tra gli indici di leggibilità, i punteggi PEMAT e i valori GQS sono state valutate utilizzando il coefficiente di correlazione per ranghi di Spearman, applicando la correzione di Benjamini-Hochberg per i test multipli. Un valore di P aggiustato bidirezionale < 0,05 è stato considerato statisticamente significativo.