È richiesta un abbonamento a JoVE per visualizzare questo contenuto. Accedi o inizia la tua prova gratuita.

Articolo di ricerca

Leggibilità e qualità dell'educazione del paziente tramite modelli linguistici di grandi dimensioni per la nevralgia del trigemino: uno studio trasversale

70 visualizzazioni

⸱

DOI:

10.3791/70833

⸱

21 agosto 2026

In questo articolo

Sommario

In questo studio, presentiamo un protocollo per valutare sistematicamente la leggibilità, l'adeguatezza didattica e la qualità delle informazioni sui pazienti generate da modelli linguistici di grandi dimensioni riguardo alla nevralgia del trigemino, al fine di stabilire parametri di riferimento per i modelli e orientare la comunicazione rivolta ai pazienti.

Abstract

I modelli linguistici di grandi dimensioni (LLM) vengono utilizzati con crescente frequenza per l'educazione sanitaria dei pazienti, tuttavia la leggibilità e la qualità educativa delle informazioni generate dagli LLM sulla nevralgia del trigemino (TN) sono state valutate in modo insufficiente. Questo studio trasversale di benchmarking ha confrontato contenuti educativi sulla TN generati da cinque LLM disponibili pubblicamente (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen e GPT-5). A ciascun modello sono state sottoposte venti domande frequenti sulla TN, che coprivano conoscenze di base sulla malattia, eziologia/fattori di rischio, diagnosi, trattamento e prevenzione/riabilitazione, utilizzando prompt standardizzati. La leggibilità è stata valutata mediante sette indici consolidati, l'idoneità educativa è stata misurata con lo strumento Patient Education Materials Assessment Tool per la comprensibilità e l'azione concreta (PEMAT), e la qualità complessiva delle informazioni è stata valutata con il Global Quality Score (GQS). Due esperti clinici hanno valutato in modo indipendente tutte le risposte, risolvendo le divergenze di opinione tramite un valutatore senior. Analisi statistiche hanno confrontato le prestazioni dei modelli, le differenze tematiche e le correlazioni tra le metriche di valutazione. Sono state osservate differenze significative tra i modelli per quanto riguarda i punteggi di leggibilità, PEMAT e GQS. GPT-5 ha prodotto risposte linguisticamente più complesse, ma ha ottenuto i punteggi più elevati per idoneità educativa e qualità delle informazioni. Al contrario, Wenxin Yiyan ha generato testi più leggibili, ma in generale ha ottenuto punteggi più bassi su PEMAT e GQS. La categoria del contenuto ha influenzato la leggibilità: argomenti relativi a prevenzione/riabilitazione ed eziologia/fattori di rischio si sono rivelati più difficili da leggere, mentre PEMAT e GQS sono rimasti relativamente costanti tra i diversi temi. Gli indici di leggibilità hanno mostrato una forte coerenza interna e correlazioni positive da deboli a moderate con PEMAT e GQS, mentre PEMAT e GQS hanno mostrato una correlazione positiva moderata. Questi risultati indicano che la scelta del modello influenza l'idoneità educativa e la qualità complessiva delle informazioni valutate dagli esperti, mentre la complessità dell'argomento incide principalmente sulla leggibilità. Poiché non sono stati valutati la comprensione del paziente, la soddisfazione, la fiducia, gli esiti sanitari, l'accuratezza fattuale e la sicurezza clinica, questi risultati devono essere interpretati come un'analisi di benchmarking basata sul giudizio di esperti, piuttosto che come prova di prontezza clinica.

Introduzione

La nevralgia del trigemino (TN) è un disturbo da dolore neuropatico caratterizzato da episodi ricorrenti, unilaterali, brevi e di intensità estremamente elevata, comunemente descritti come scosse elettriche o colpi di pugnale. Secondo la Classificazione Internazionale dei Disturbi Cefalalgici, terza edizione (ICHD-3), il dolore si localizza tipicamente nel territorio di distribuzione di uno o più rami del nervo trigemino, è spesso insopportabile nell'intensità e può essere innescato da stimoli innocui come un lieve tocco, il lavaggio del viso, lo spazzolamento dei denti, il parlare o il masticare. Gli attacchi si manifestano con insorgenza improvvisa e cessazione brusca, con una durata che varia da frazioni di secondo fino a diversi minuti1,2. Sebbene la TN non sia solitamente una condizione a rischio di vita, il dolore intenso e imprevedibile altera in modo significativo le attività quotidiane essenziali, tra cui alimentazione, parlato, sonno e regolazione emotiva, determinando un notevole carico psicosociale e una riduzione della qualità della vita. Evidenze provenienti da revisioni sistematiche indicano che i pazienti con TN presentano un rischio significativamente più elevato di depressione, ansia e disturbi del sonno rispetto alla popolazione generale3,4. In ampi studi di coorte, circa il 35–55% dei pazienti con TN manifestano sintomi clinicamente rilevanti di ansia o depressione, e la catastrofizzazione del dolore è molto diffusa, suggerendo un'interazione bidirezionale tra dolore cronico intenso, insonnia e disturbi affettivi5,6. Stime epidemiologiche indicano che la prevalenza della TN nella popolazione generale varia approssimativamente dallo 0,03% allo 0,3%, con una maggiore incidenza tra le donne e gli adulti di età avanzata e notevoli variazioni tra regioni geografiche, gruppi etnici e fasce d'età7,8. In paesi ad alta densità demografica, come Cina e India, l'invecchiamento rapido della popolazione è stato accompagnato da un aumento costante del numero di persone affette da TN, imponendo un carico crescente sui sistemi sanitari e sottolineando la necessità di approcci più efficaci, scalabili e basati sui dati per la valutazione e la gestione della malattia8,9.

La nevralgia del trigemino può essere classificata in sottotipi classico, secondario e idiopatico, con un numero crescente di evidenze che dimostrano significative differenze nei meccanismi eziologici e nelle strategie terapeutiche tra queste categorie1,10. Studi recenti indicano che cambiamenti strutturali legati al conflitto neurovascolare nella zona di ingresso della radice del nervo trigemino, l'iper eccitabilità del nervo periferico e una modificata modulazione centrale del dolore contribuiscono congiuntamente alla patogenesi della malattia11,12. Le linee guida cliniche raccomandano il carbamazepine e l'ossicarbazepina come trattamenti di prima linea, mentre si ricorre a interventi chirurgici o procedure invasive qualora la terapia farmacologica risulti inefficace o scarsamente tollerata10. Nonostante questi progressi terapeutici, la nevralgia del trigemino è caratterizzata da un decorso recidivante-remittente e le recidive del dolore a lungo termine rimangono comuni, rendendo difficile raggiungere una remissione permanente13. Di conseguenza, un follow-up a lungo termine e una gestione strutturata della malattia cronica sono essenziali per monitorare il rischio di recidiva, la risposta al trattamento e le possibili complicanze. Studi di coorte longitudinali indicano che, con strategie di gestione standardizzate (inclusi trattamento farmacologico, intervento chirurgico quando indicato e un follow-up completo), circa la metà dei pazienti sottoposti a trattamento conservativo può ottenere una riduzione ≥50% del carico complessivo del dolore entro due anni, senza un inevitabile aggravamento della malattia14. Questi risultati sottolineano l'importanza di un coinvolgimento continuativo del paziente e di un'efficace educazione sanitaria per la gestione a lungo termine della malattia. Evidenze indicano che i pazienti con una migliore comprensione dell'etiologia, della fisiopatologia e delle opzioni terapeutiche sono più propensi a partecipare attivamente e ad aderire ai regimi terapeutici, ottenendo così risultati migliori15. Tuttavia, gli approcci tradizionali all'educazione sanitaria sono spesso limitati per portata e scalabilità. Con l'ampia diffusione di internet, in particolare delle piattaforme online di domande e risposte e dei social media, i pazienti si affidano sempre più a fonti digitali per ottenere informazioni mediche16,17. Tuttavia, la notevole variabilità nella letteratura sanitaria individuale e nella capacità di accedere, elaborare e comprendere informazioni sanitarie di base per decisioni informate rappresenta un ostacolo significativo a un'efficace educazione del paziente18. Inoltre, la qualità disomogenea delle informazioni sanitarie online, inclusi contenuti inaccurati o fuorvianti, può influenzare negativamente le decisioni mediche e il benessere psicologico dei pazienti19.

Le tecnologie dell'intelligenza artificiale (AI), in particolare lo sviluppo rapido dei modelli linguistici di grandi dimensioni (LLMs) negli ultimi anni, hanno creato nuove opportunità per la comunicazione scientifica in ambito medico e per l'educazione sanitaria20. Allenati su ampi corpora testuali, questi modelli possono generare risposte strutturate e logicamente coerenti attraverso l'interazione in linguaggio naturale21. Sistemi internazionali rappresentativi, come ChatGPT, hanno dimostrato un potenziale promettente per la risposta a domande mediche, la consulenza ai pazienti e l'educazione medica22,23. Diversi LLM funzionalmente simili sono emersi in Cina, con una copertura utenti e scenari applicativi in continua espansione24. Nonostante questi progressi, l'applicazione dei LLM nella divulgazione scientifica medica continua a presentare sfide significative, tra cui l'affidabilità dei dati di addestramento, la frequenza di aggiornamento, l'accuratezza scientifica delle risposte generate e la mancanza di validazione clinica25. Inoltre, differenze tra i modelli in termini di stile linguistico, leggibilità, struttura logica e accuratezza delle citazioni possono influenzare direttamente la comprensione e la fiducia dei pazienti nelle informazioni sanitarie26. Ad oggi, le valutazioni sistematiche delle prestazioni dei LLM nell'educazione sanitaria relativa alla TN sono state limitate.

Pertanto, questo studio si è proposto di valutare e confrontare sistematicamente le prestazioni di quattro modelli linguistici di grandi dimensioni (LLM) cinesi ampiamente utilizzati (Doubao, DeepSeek, Wenxin Yiyan e Tongyi Qianwen) e di un LLM internazionale rappresentativo (ChatGPT) nel rispondere a domande sui pazienti relative alla nevralgia del trigemino (TN). Utilizzando un disegno trasversale, abbiamo costruito un insieme di domande sulla TN basato su linee guida cliniche e sulle preoccupazioni comuni dei pazienti, valutando le risposte generate da cinque LLM disponibili pubblicamente (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen e GPT-5). La leggibilità è stata valutata mediante l'uso di diverse metriche, mentre la comprensibilità e l'attuabilità sono state analizzate tramite lo strumento di valutazione dei materiali educativi per i pazienti (Patient Education Materials Assessment Tool, PEMAT). La qualità complessiva delle informazioni è stata valutata utilizzando il punteggio globale di qualità (Global Quality Score, GQS). Inoltre, abbiamo analizzato in che modo diversi argomenti di educazione sanitaria influenzino tali metriche di valutazione e le loro interrelazioni, con l'obiettivo di fornire indicazioni basate su evidenze per la selezione e l'ottimizzazione degli LLM nella comunicazione sanitaria clinica.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

Questo studio ha analizzato esclusivamente testi generati dall'intelligenza artificiale e non ha coinvolto partecipanti umani, animali, campioni biologici, cartelle cliniche, informazioni personali identificabili né interventi nell'assistenza clinica. Pertanto, la revisione etica e il consenso informato formale non erano applicabili.

Progettazione dello studio

Questo studio trasversale ha valutato la leggibilità, la qualità e l'idoneità educativa delle risposte generate da cinque modelli linguistici di grandi dimensioni (LLM) in risposta a domande frequenti riguardanti la nevralgia del trigemino (TN).

Identificazione delle domande più comuni relative al TN

Il 25 novembre 2025, due esperti clinici con ampia esperienza in medicina del dolore hanno esaminato in modo indipendente le attuali linee guida cliniche per la nevralgia del trigemino (TN), inclusa la Classificazione Internazionale dei Disturbi Cefalalgici, terza edizione (ICHD-3), la linea guida dell'Accademia Europea di Neurologia e la linea guida dell'Accademia Americana di Neurologia/Federazione Europea delle Società di Neurologia1,10,11. Dopo una discussione di consenso, hanno compilato un elenco di 20 domande relative alla TN comunemente riscontrate nella pratica clinica. Il numero di domande è stato stabilito a priori per garantire una copertura equilibrata dei cinque domini tematici predeterminati, con quattro domande selezionate per ciascun dominio, mantenendo nel contempo il numero totale di risposte generate dal modello entro un intervallo gestibile per la valutazione e verifica manuale da parte di esperti. Per migliorare la riproducibilità, il processo di selezione ha seguito un quadro predeterminato basato sui domini: gli esperti hanno innanzitutto identificato le domande candidate all'interno di ciascun dominio, le hanno esaminate autonomamente per rilevanza clinica, formulazione orientata al paziente e assenza di ridondanze, quindi hanno raggiunto un accordo sulle quattro domande finali per ogni dominio. L'elenco finale delle domande è riportato nella Tabella 1 e nel File Supplementare 1. I cinque domini tematici predeterminati erano conoscenze di base sulla malattia, eziologia e fattori di rischio, diagnosi, trattamento, prevenzione e riabilitazione. Poiché l'insieme delle domande non è stato ricavato da log di ricerca dei pazienti, query online o interviste formali ai pazienti, si riconosce la possibilità di un bias di selezione come limitazione dello studio.

Modelli di intelligenza artificiale e procedura di raccolta dati

Il 25 novembre 2025, l'insieme definitivo di 20 domande relative al TN è stato inviato a cinque piattaforme pubblicamente accessibili di modelli linguistici di grandi dimensioni (LLM): Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen e GPT-5/ChatGPT. A tutti i modelli si è acceduto tramite le loro normali interfacce web pubbliche basate su chat; non è stato utilizzato l'accesso tramite application programming interface (API). Per ciascuna piattaforma, è stato impiegato il modello pubblicamente disponibile per impostazione predefinita alla data della raccolta dei dati, senza alcuna modifica dei parametri di generazione. Poiché le interfacce web pubbliche non mostravano identificatori del modello backend, prompt di sistema nascosti, temperatura, top-p, numero massimo di token in uscita o altri parametri di generazione, queste informazioni sono state registrate come "non visualizzate nell'interfaccia web pubblica".

Le lingue del prompt e della risposta erano l'inglese per tutti i modelli. Ogni prompt standardizzato consisteva esclusivamente della domanda in inglese riportata alla lettera, senza ulteriori istruzioni specifiche per il modello. Ogni domanda è stata inviata singolarmente in una nuova sessione di chat indipendente, senza alcuna cronologia di conversazioni precedenti, file caricati, plug-in, istruzioni personalizzate o prompt di follow-up. L'elenco completo dei prompt standardizzati e le corrispondenti risposte grezze dei modelli sono riportati nel File Supplementare 1. I metadati dei modelli e le impostazioni di raccolta dati sono riassunti nella Tabella Supplementare 1.

Valutazione della leggibilità

La leggibilità delle risposte generate da LLM è stata valutata utilizzando diverse formule di leggibilità consolidate disponibili tramite una piattaforma online per la valutazione della leggibilità (http://readabilityformulas.com/). In assenza di uno standard universale accettato per la valutazione della leggibilità e in linea con studi precedenti, è stato impiegato un insieme completo di indici di leggibilità ampiamente utilizzati23,27. Sono stati selezionati sette indici per cogliere aspetti complementari della leggibilità, inclusi la lunghezza delle frasi, la lunghezza delle parole, il carico sillabico, la complessità basata sui caratteri, la facilità di lettura e il livello scolastico stimato, riducendo così la dipendenza da una singola formula. In particolare, sono stati calcolati l'Indice di Coleman-Liau (CL), la Formula Linsear Write (LW), l'Indice di Leggibilità Automatica (ARI), la Misura Semplice di Gobbledygook (SMOG), l'Indice Gunning Fog (GFOG), il Punteggio di Facilità di Lettura di Flesch (FRES) e il Livello Scolastico Flesch-Kincaid (FKGL). Questi indici stimano la difficoltà di lettura o il livello scolastico e forniscono misure quantitative della leggibilità del testo (Tabella 2).

Valutazione dell'idoneità educativa e della qualità delle informazioni

L'idoneità educativa è stata valutata utilizzando lo strumento di valutazione dei materiali informativi per i pazienti (Patient Education Materials Assessment Tool, PEMAT), che comprende due domini: comprensibilità e attuabilità28. Lo strumento comprende 24 elementi, di cui 16 valutano la comprensibilità e otto l'attuabilità. Ogni elemento è stato valutato in modo dicotomico (0 = criterio non soddisfatto; 1 = criterio soddisfatto), producendo un punteggio totale compreso tra 0 e 24, dove punteggi più alti indicano una maggiore idoneità per l'educazione del paziente. La qualità complessiva delle informazioni è stata valutata mediante il punteggio di qualità globale (Global Quality Score, GQS)27, una scala di tipo Likert a cinque punti ampiamente utilizzata per la valutazione della qualità delle informazioni mediche (Tabella 3).

Il 25 novembre 2025, due esperti clinici con oltre 3 anni di esperienza nella gestione della nevralgia del trigemino hanno valutato tutte le risposte generate dall'intelligenza artificiale utilizzando entrambi gli strumenti di valutazione. Prima della valutazione, tutte le risposte generate dall'IA sono state anonimizzate mediante identificatori codificati, e i revisori sono stati mantenuti all'oscuro della piattaforma di linguaggio di grandi dimensioni durante le valutazioni PEMAT e GQS. Le divergenze sono state risolte da un terzo esperto senior, che ha stabilito i punteggi finali. L'affidabilità tra valutatori è stata misurata mediante il coefficiente kappa di Cohen, con valori >0,75 che indicano un accordo eccellente, da 0,40 a 0,75 un accordo accettabile e <0,40 un accordo scarso. I valori kappa di Cohen per PEMAT e GQS hanno superato entrambi 0,75, dimostrando un'elevata affidabilità tra valutatori.

Analisi statistica

Tutte le analisi statistiche sono state eseguite utilizzando il software R (versione 4.4.3). La normalità dei dati è stata valutata mediante il test di Shapiro-Wilk e i grafici Q-Q. Le variabili distribuite normalmente sono state riassunte come media ± deviazione standard e confrontate utilizzando l'analisi della varianza a un fattore (ANOVA), seguita dal test post hoc di Tukey quando appropriato. Le variabili non distribuite normalmente sono state riassunte come mediane e intervalli interquartili e confrontate utilizzando il test di Kruskal-Wallis, seguito dal test post hoc di Dunn con correzione di Bonferroni per i confronti a coppie. Le correlazioni tra gli indici di leggibilità, i punteggi PEMAT e i valori GQS sono state valutate utilizzando il coefficiente di correlazione per ranghi di Spearman, applicando la correzione di Benjamini-Hochberg per i test multipli. Un valore di P aggiustato bidirezionale < 0,05 è stato considerato statisticamente significativo.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Questo studio ha valutato sistematicamente gli effetti dei modelli linguistici di grandi dimensioni (LLM) e di diverse categorie di contenuti educativi sanitari sulla leggibilità e sulla qualità dei testi generati. In primo luogo, abbiamo confrontato le prestazioni di cinque LLM—Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen e GPT-5—per quanto riguarda l'idoneità per l'educazione del paziente, la qualità complessiva delle informazioni e diverse metriche di leggibilità, inclusi il punteggio PEMAT, il GQS e indici di leggi...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

Questo studio trasversale di riferimento ha confrontato in modo sistematico la leggibilità, l'idoneità educativa e la qualità complessiva delle informazioni nei materiali educativi per pazienti con nevralgia del trigemino (TN) generati da cinque modelli linguistici di grandi dimensioni (LLM) disponibili pubblicamente. Sono emerse quattro scoperte principali. In primo luogo, la leggibilità ha mostrato ampie differenze tra i modelli, con GPT-5 che ha prodotto risposte linguisticamente più complesse e Wenxin Yiyan che ha ge...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Gli autori dichiarano di non avere interessi in conflitto.

Ringraziamenti

Questa ricerca non ha ricevuto alcun finanziamento specifico da agenzie pubbliche, commerciali o senza scopo di lucro. Gli autori ringraziano i colleghi clinici che hanno fornito commenti sul set di domande relativo alla nevralgia del trigemino e hanno contribuito a perfezionare il quadro di valutazione. Ringraziamo inoltre tutti i collaboratori che hanno supportato la preparazione e la revisione del manoscritto.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
Piattaforma di chat DeepSeekDeepSeekhttps://chat.deepseek.com/Interfaccia pubblicamente accessibile di un modello linguistico di grandi dimensioni utilizzata per generare risposte
Piattaforma di chat DoubaoDoubaohttps://www.doubao.com/chat/Interfaccia pubblicamente accessibile di un modello linguistico di grandi dimensioni utilizzata per generare risposte
GPT 5 OpenAIhttps://chat.openai.com/Interfaccia pubblicamente accessibile di un modello linguistico di grandi dimensioni utilizzata per generare risposte
Software R, versione 4.4.3Fondazione R per il Calcolo StatisticoNon applicabileAnalisi e visualizzazione statistica
Calcolatore online di formule per la leggibilitàReadability FormulasNon applicabileStrumento online utilizzato per calcolare gli indici di leggibilità
Piattaforma di chat Tongyi QianwenTongyi Qianwenhttps://www.tongyi.com/Interfaccia pubblicamente accessibile di un modello linguistico di grandi dimensioni utilizzata per generare risposte
Piattaforma di chat Wenxin YiyanWenxin Yiyanhttps://yiyan.baidu.com/Interfaccia pubblicamente accessibile di un modello linguistico di grandi dimensioni utilizzata per generare risposte

Riferimenti

  1. Headache Classification Committee of the International Headache Society (IHS). The International Classification of Headache Disorders, 3rd edition. Cephalalgia. 2018;38(1):1-211.
  2. Ashina S, et al. Trigeminal neuralgia. Nat Rev Dis Primers. 2024;10(1):39.
  3. Donertas-Ayaz B, Caudle RM. Locus coeruleus-noradrenergic modulation of trigeminal pain: Implications for trigeminal neuralgia and psychiatric comorbidities. Neurobiol Pain. 2023;13:100124.
  4. Martinelli R, et al. Psychological assessment in patients affected by trigeminal neuralgia: A systematic review. Neurosurg Rev. 2025;48(1):414.
  5. Melek LN, et al. Comparison of the neuropathic pain symptoms and psychosocial impacts of trigeminal neuralgia and painful posttraumatic trigeminal neuropathy. J Oral Facial Pain Headache. 2019;33(1):77-88.
  6. Zakrzewska JM, et al. Evaluating the impact of trigeminal neuralgia. Pain. 2017;158(6):1166-1174.
  7. Gambeta E, Chichorro JG, Zamponi GW. Trigeminal neuralgia: An overview from pathophysiology to pharmacological treatments. Mol Pain. 2020;16:1744806920901890.
  8. De Toledo IP, et al. Prevalence of trigeminal neuralgia: A systematic review. J Am Dent Assoc. 2016;147(7):570-576.e2.
  9. Svedung Wettervik T, et al. Incidence of trigeminal neuralgia: A population-based study in central Sweden. Eur J Pain. 2023;27(5):580-587.
  10. Bendtsen L, et al. European Academy of Neurology guideline on trigeminal neuralgia. Eur J Neurol. 2019;26(6):831-849.
  11. Cruccu G, et al. Trigeminal neuralgia: New classification and diagnostic grading for practice and research. Neurology. 2016;87(2):220-228.
  12. Araya EI, et al. Trigeminal neuralgia: Basic and clinical aspects. Curr Neuropharmacol. 2020;18(2):109-119.
  13. Chong MS, Bahra A, Zakrzewska JM. Guidelines for the management of trigeminal neuralgia. Cleve Clin J Med. 2023;90(6):355-362.
  14. Heinskou TB, et al. Favourable prognosis of trigeminal neuralgia when enrolled in a multidisciplinary management program: A two-year prospective real-life study. J Headache Pain. 2019;20(1):23.
  15. Liu S, et al. Comparative evaluation of ChatGPT and Gemini in brain-computer interface patient education: A multidimensional analysis of reliability, accuracy, comprehensibility, and readability. Int J Med Inform. 2026;206:106164.
  16. Forgie EME, et al. Social media and the transformation of the physician-patient relationship: Viewpoint. J Med Internet Res. 2021;23(12):e25230.
  17. Gantenbein L, Navarini AA, Maul LV, Brandt O, Mueller SM. Internet and social media use in dermatology patients: Search behavior and impact on the patient-physician relationship. Dermatol Ther. 2020;33(6):e14098.
  18. Youssef Y, et al. Social media and internet use among orthopedic patients in Germany: A multicenter survey. Front Digit Health. 2025;7:1486296.
  19. De Martino I, et al. Social media for patients: Benefits and drawbacks. Curr Rev Musculoskelet Med. 2017;10(1):141-145.
  20. Johnson KB, et al. Precision medicine, AI, and the future of personalized health care. Clin Transl Sci. 2021;14(1):86-93.
  21. Hirani R, et al. Artificial intelligence and healthcare: A journey through history, present innovations, and future possibilities. Life (Basel). 2024;14(5):557.
  22. Karatas G, Kirik F, Karatas ME, Cakir A, Ozdemir H. Comparative performance of ChatGPT o3-mini-high and DeepSeek-R1 in ophthalmology: An evaluation of diagnostic reasoning and case-based problem solving. J Fr Ophtalmol. 2025;49(1):104712.
  23. Hanci V, et al. Assessment of readability, reliability, and quality of ChatGPT, Bard, Gemini, Copilot, and Perplexity responses on palliative care. Medicine (Baltimore). 2024;103(33):e39305.
  24. Liu C, et al. Potential to perpetuate social biases in health care by Chinese large language models: A model evaluation study. Int J Equity Health. 2025;24(1):206.
  25. Haupt CE, Marks M. AI-generated medical advice—GPT and beyond. JAMA. 2023;329(16):1349-1350.
  26. Aydin S, Karabacak M, Vlachos V, Margetis K. Large language models in patient education: A scoping review of applications in medicine. Front Med (Lausanne). 2024;11:1477898.
  27. Kara M, et al. Evaluating the readability, quality, and reliability of responses generated by ChatGPT, Gemini, and Perplexity on the most commonly asked questions about ankylosing spondylitis. PLoS One. 2025;20(6):e0326351.
  28. Perez Rivera LR, et al. Evaluating the quality and reliability of large language models for plastic surgery patient education: A comparative analysis of ChatGPT and OpenEvidence. Aesthet Surg J. 2025. doi:10.1093/asj/sjaf249.
  29. Wilhelm TI, Roos J, Kaczmarczyk R. Large language models for therapy recommendations across three clinical specialties: Comparative study. J Med Internet Res. 2023;25:e49324.
  30. Will J, et al. Enhancing the readability of online patient education materials using large language models: Cross-sectional study. J Med Internet Res. 2025;27:e69955.
  31. Tukur Jido J, Al-Wizni A, Aung SL. Readability of AI-generated patient information leaflets on Alzheimer's disease, vascular dementia, and delirium. Cureus. 2025;17(6):e85463.
  32. Luo Z, Lin C, Kim TH, Shin YS, Ahn ST. Quality and readability analysis of artificial intelligence-generated medical information related to prostate cancer: A cross-sectional study of ChatGPT and DeepSeek. World J Mens Health. 2025. doi:10.5534/wjmh.250144.
  33. Joseph P, Silva NA, Nanda A, Gupta G. Evaluating the readability of online patient education materials for trigeminal neuralgia. World Neurosurg. 2020;144:e934-e938.
  34. Dong C, et al. Comparative evaluation of large language models in delivering guideline-compliant recommendations for topical NSAID use in musculoskeletal pain: A multidimensional analysis. Clin Rheumatol. 2025;44(11):4703-4710.
  35. Ozduran E, Buyukcoban S. Evaluating the readability, quality, and reliability of online patient education materials on post-COVID pain. PeerJ. 2022;10:e13686.
  36. Wang LW, Miller MJ, Schmitt MR, Wen FK. Assessing readability formula differences with written health information materials: Application, results, and recommendations. Res Social Adm Pharm. 2013;9(5):503-516.
  37. Singh SP, et al. Comprehension profile of patient education materials in endocrine care. Kans J Med. 2022;15(2):247-252.
  38. Marder RS, et al. ChatGPT-3.5 and ChatGPT-4.0 do not reliably create readable patient education materials for common orthopaedic upper- and lower-extremity conditions. Arthrosc Sports Med Rehabil. 2025;7(1):101027.
  39. Nasra M, et al. Can artificial intelligence improve patient educational material readability? A systematic review and narrative synthesis. Intern Med J. 2025;55(1):20-34.
  40. Bhatt C, et al. Evaluating readability, understandability, and actionability of online printable patient education materials for cholesterol management: A systematic review. J Am Heart Assoc. 2024;13(8):e030140.
  41. Avra TD, Le M, Hernandez S, Thure K, Ulloa JG. Readability assessment of online peripheral artery disease education materials. J Vasc Surg. 2022;76(6):1728-1732.
  42. Rooney MK, et al. Readability of patient education materials from high-impact medical journals: A 20-year analysis. J Patient Exp. 2021;8:2374373521998847.
  43. Ahmadzadeh K, et al. Patient education information material assessment criteria: A scoping review. Health Info Libr J. 2023;40(1):3-28.
  44. Duan L, Yao Z, Li X, Wu Y, Sheng D. Comparing large language models and human doctors in symptom-driven online medical consultations: A case study on trigeminal neuralgia. Digit Health. 2025;11:20552076251388140.
  45. Werner C, Harden J, Lawton J. Pathways to a diagnosis of trigeminal neuralgia: A qualitative study of patients' experiences. BMC Prim Care. 2025;26(1):65.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Ristampe e permessi

Tag

Modelli linguistici di grandi dimensioniValutazione della leggibilitàQualità educativaValutazione PEMATGlobal Quality ScoreQualità delle informazioni sanitarieBenchmarking dei modelliComprensione del paziente