Een abonnement op JoVE is vereist om deze inhoud te bekijken. Log in of start vandaag met uw gratis proefperiode.

Onderzoeksartikel

Leesbaarheid en kwaliteit van patiëntenvoorlichting over trigeminusneuralgie door grote taalmodellen: een crosssectionele studie

70 weergaven

⸱

DOI:

10.3791/70833

⸱

21 augustus 2026

In dit artikel

Samenvatting

Hier presenteren wij een protocol om systematisch de leesbaarheid, educatieve geschiktheid en kwaliteit van door grote taalmodellen gegenereerde patiënteninformatie over trigeminale neuralgie te evalueren, om zo modellen te benchmarken en patiëntgerichte communicatie te sturen.

Samenvatting

Grote taalmodellen (LLM's) worden steeds vaker ingezet voor patiëntenvoorlichting, maar de leesbaarheid en de educatieve kwaliteit van door LLM's gegenereerde informatie over trigeminuseuralgie (TN) zijn onvoldoende geëvalueerd. Deze crosssectionele benchmarkingstudie vergeleek educatieve inhoud over TN die was gegenereerd door vijf publiek toegankelijke LLM's (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen en GPT-5). Twintig veelgestelde vragen over TN, die basiskennis over de ziekte, etiologie/risicofactoren, diagnose, behandeling en preventie/revalidatie besloegen, werden aan elk model voorgelegd met behulp van gestandaardiseerde prompts. De leesbaarheid werd beoordeeld aan de hand van zeven erkende indexen, de educatieve geschiktheid met de Patient Education Materials Assessment Tool for Understandability and Actionability (PEMAT) en de algemene informatiekwaliteit met de Global Quality Score (GQS). Twee klinische experts evalueerden alle antwoorden onafhankelijk van elkaar, waarbij meningsverschillen werden opgelost door een senior scheidsrechter. Statistische analyses vergeleken de prestaties van de modellen, thematische verschillen en correlaties tussen de evaluatiemetrieken. Er werden significante verschillen waargenomen tussen de modellen wat betreft leesbaarheid, PEMAT- en GQS-scores. GPT-5 genereerde de linguïstisch meest complexe antwoorden, maar behaalde de hoogste scores voor educatieve geschiktheid en informatiekwaliteit. Wenxin Yiyan produceerde daarentegen de meest leesbare tekst, maar scoorde over het algemeen lager op PEMAT en GQS. De inhoudscategorie beïnvloedde de leesbaarheid, waarbij onderwerpen over preventie/revalidatie en etiologie/risicofactoren moeilijker leesbaar waren, terwijl PEMAT en GQS relatief consistent bleven over de verschillende thema's. De leesbaarheidsindexen vertoonden een sterke interne consistentie en zwakke tot matige positieve correlaties met PEMAT en GQS, terwijl PEMAT en GQS een matige positieve correlatie vertoonden. Deze bevindingen suggereren dat de modelkeuze van invloed is op de door experts beoordeelde educatieve geschiktheid en algemene informatiekwaliteit, terwijl de complexiteit van het onderwerp primair de leesbaarheid beïnvloedt. Omdat patiëntenbegrip, tevredenheid, vertrouwen, gezondheidsuitkomsten, feitelijke nauwkeurigheid en klinische veiligheid niet zijn geëvalueerd, moeten deze resultaten worden geïnterpreteerd als een door experts beoordeelde benchmarkinganalyse en niet als bewijs van klinische inzetbaarheid.

Inleiding

Trigeminusneuralgie (TN) is een neuropathisch pijnsyndroom dat wordt gekenmerkt door recidiverende episodes van unilaterale, kortstondige en extreem ernstige gezichtspijn, die vaak wordt beschreven als een elektrische schok of een steekende pijn. Volgens de International Classification of Headache Disorders, 3de editie (ICHD-3), is de pijn doorgaans gelokaliseerd in het verspreidingsgebied van één of meer takken van de nervus trigeminus, is deze vaak onverdraaglijk intens en kan deze worden uitgelokt door onschadelijke prikkels zoals een lichte aanraking, gezichtsverzorging, tandenpoetsen, spreken of kauwen. Aanvallen worden gekenmerkt door een plotseling begin en een abrupt einde, met een duur die varieert van fracties van een seconde tot enkele minuten1,2. Hoewel TN gewoonlijk niet levensbedreigend is, verstoren de ernstige en onvoorspelbare pijnen essentiële dagelijkse activiteiten aanzienlijk, waaronder eten, spreken, slapen en emotionele regulatie, wat leidt tot een aanzienlijke psychosociale belasting en een verminderde kwaliteit van leven. Bewijs uit systematische reviews geeft aan dat personen met TN een significant verhoogd risico lopen op depressie, angst en slaapstoornissen in vergelijking met de algemene populatie3,4. In grootschalige cohortstudies vertoont ongeveer 35–55% van de patiënten met TN klinisch relevante symptomen van angst of depressie, en is pijncatastroferen zeer prevalent, wat wijst op een bidirectionele interactie tussen chronische ernstige pijn, insomnia en affectieve stoornissen5,6. Epidemiologische schattingen geven aan dat de prevalentie van TN in de algemene populatie varieert van ongeveer 0,03% tot 0,3%, met een hogere incidentie bij vrouwen en ouderen en opmerkelijke variaties tussen geografische regio's, etnische groepen en leeftijdsschommelingen7,8. In dichtbevolkte landen, zoals China en India, is de snelle vergrijzing van de bevolking gepaard gegaan met een aanhoudende toename van het aantal personen die door TN worden getroffen, waardoor de druk op de gezondheidszorg toeneemt en de noodzaak voor effectievere, schaalbare en op data gebaseerde benaderingen voor ziektebeoordeling en -beheer wordt benadrukt8,9.

TN kan worden geclassificeerd in klassieke, secundaire en idiopathische subtypes, waarbij steeds meer bewijs substantiële verschillen aantoont in de etiologische mechanismen en therapeutische strategieën tussen deze categorieën1,10. Huidige studies suggereren dat neurovasculaire conflict-gerelateerde structurele veranderingen bij de wortelingangszone van de nervus trigeminus, perifere nerveuze hyperexcitabiliteit en een veranderde centrale pijnmodulatie gezamenlijk bijdragen aan de pathogenese van de ziekte11,12. Klinische richtlijnen bevelen carbamazepine en oxcarbazepine aan als eerstelijnsbehandelingen, terwijl chirurgische of interventionele benaderingen worden overwogen wanneer farmacologische therapie ineffectief is of slecht wordt getolereerd10. Ondanks deze therapeutische vooruitgang wordt TN gekenmerkt door een recidiverend-remitterend beloop, en recidiverende pijn op lange termijn komt veel voor, waardoor permanente remissie moeilijk te bereiken is13. Bijgevolg zijn langdurige follow-up en gestructureerd chronisch ziektebeheer essentieel voor het monitoren van het risico op recidieven, de behandelrespons en complicaties. Longitudinale cohortstudies geven aan dat onder gestandaardiseerde beheersstrategieën (inclusief farmacologische behandeling, chirurgische interventie indien geïndiceerd en uitgebreide follow-up) ongeveer de helft van de patiënten die conservatief behandeld worden, binnen twee jaar een reductie van ≥50% in de totale pijnlast kan bereiken, zonder onvermijdelijke ziekteprogressie14. Deze bevindingen onderstrepen het belang van aanhoudende patiëntenbetrokkenheid en effectieve gezondheidseducatie voor langdurig ziektebeheer. Bewijs suggereert dat patiënten met een beter begrip van de ziekte-etiologie, pathofysiologie en behandelopties vaker actief deelnemen aan en zich houden aan therapeutische schema's, wat leidt tot verbeterde uitkomsten15. Traditionele benaderingen van gezondheidseducatie zijn echter vaak beperkt in bereik en schaalbaarheid. Met de wijdverbreide adoptie van het internet, in het bijzonder online vraag-en-antwoordplatforms en sociale media, vertrouwen patiënten steeds vaker op digitale bronnen om medische informatie te verkrijgen16,17. Desondanks vormen aanzienlijke variabiliteit in individuele gezondheidsvaardigheden en het vermogen om basisgezondheidsinformatie te raadplegen, te verwerken en te begrijpen voor een geïnformeerde besluitvorming grote barrières voor effectieve patiënteneducatie18. Bovendien kan de ongelijke kwaliteit van online gezondheidsinformatie, inclusief onjuiste of misleidende inhoud, de medische beslissingen en het psychologische welzijn van patiënten negatief beïnvloeden19.

Technologieën voor kunstmatige intelligentie (KI), en in het bijzonder de snelle ontwikkeling van grote taalmodellen (LLM's) in recente jaren, hebben nieuwe mogelijkheden gecreëerd voor medische wetenschapscommunicatie en gezondheidseducatie20. Deze modellen zijn getraind op grootschalige tekstuele corpora en kunnen via interactie in natuurlijke taal gestructureerde en logisch coherente antwoorden genereren21. Representatieve internationale systemen, zoals ChatGPT, hebben veelbelovend potentieel getoond voor het beantwoorden van medische vragen, patiëntenconsultatie en medisch onderwijs22,23. In China zijn verschillende functioneel vergelijkbare LLM's verschenen, met een voortdurend uitbreidende gebruikersgroep en diverse toepassingsscenario's24. Ondanks deze vooruitgang staat de toepassing van LLM's bij de popularisering van de medische wetenschap nog voor aanzienlijke uitdagingen, waaronder de betrouwbaarheid van trainingsgegevens, de updatefrequentie, de wetenschappelijke nauwkeurigheid van de gegenereerde antwoorden en een gebrek aan klinische validatie25. Daarnaast kunnen verschillen tussen modellen in taalstijl, leesbaarheid, logische structuur en de nauwkeurigheid van citaties direct van invloed zijn op het begrip van patiënten en hun vertrouwen in gezondheidsinformatie26. Tot op heden zijn systematische evaluaties van de prestaties van LLM's in gezondheidseducatie met betrekking tot TN beperkt.

Daarom was het doel van deze studie om systematisch de prestaties te evalueren en te vergelijken van vier veelgebruikte Chinese LLM's (Doubao, DeepSeek, Wenxin Yiyan en Tongyi Qianwen) en een representatieve internationale LLM (ChatGPT) bij het beantwoorden van patiëntenvoorlichtingsvragen met betrekking tot TN. Middels een cross-sectioneel design hebben we een TN-vragenset samengesteld op basis van klinische richtlijnen en veelvoorkomende zorgen van patiënten, en hebben we de antwoorden beoordeeld die werden gegenereerd door vijf openbaar toegankelijke LLM's (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen en GPT-5). De leesbaarheid werd geëvalueerd met behulp van meerdere metrieken, en de begrijpelijkheid en toepasbaarheid werden beoordeeld met de Patient Education Materials Assessment Tool (PEMAT). De algehele informatiekwaliteit werd geëvalueerd met de Global Quality Score (GQS). Daarnaast hebben we geanalyseerd hoe verschillende onderwerpen voor gezondheidsvoorlichting deze evaluatiemetrieken en hun onderlinge relaties beïnvloeden, met als doel evidence-based richtlijnen te bieden voor het selecteren en optimaliseren van LLM's in klinische gezondheidscommunicatie.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

Deze studie analyseerde uitsluitend door AI gegenereerde tekst en hield geen menselijke deelnemers, dieren, biologische monsters, medische dossiers, identificeerbare persoonlijke informatie of interventies in de klinische zorg in. Daarom waren een ethische toetsing en formele geïnformeerde toestemming niet van toepassing.

Studieopzet

Deze cross-sectionele studie evalueerde de leesbaarheid, kwaliteit en educatieve geschiktheid van antwoorden gegenereerd door vijf LLM's op veelgestelde vragen over TN.

Identificatie van veelgestelde vragen met betrekking tot TN

Op 25 november 2025 hebben twee klinische experts met uitgebreide ervaring in pijnbestrijding onafhankelijk de huidige klinische richtlijnen voor trigeminusneuralgie (TN) beoordeeld, waaronder de International Classification of Headache Disorders, 3de editie (ICHD-3), de richtlijn van de European Academy of Neurology en de richtlijn van de American Academy of Neurology/European Federation of Neurological Societies1,10,11. Na een consensusdiscussie stelden zij een lijst samen van 20 TN-gerelateerde vragen die veel voorkomen in de klinische praktijk. Het aantal vragen werd a priori bepaald om een gebalanceerde dekking van de vijf vooraf gedefinieerde thematische domeinen te bieden, waarbij voor elk domein vier vragen werden geselecteerd, terwijl het totale aantal door het model gegenereerde antwoorden binnen een bereik bleef dat haalbaar was voor handmatige beoordeling en verificatie door experts. Om de reproduceerbaarheid te verbeteren, volgde het selectieproces een vooraf gedefinieerd domeingebaseerd kader: de experts identificeerden eerst kandidaatvragen binnen elk domein, beoordeelden deze onafhankelijk op klinische relevantie, patiëntgerichte formulering en het vermijden van redundantie, en bereikten vervolgens consensus over de definitieve vier vragen per domein. De definitieve lijst met vragen staat in Tabel 1 en Aanvullend Bestand 1. De vijf vooraf gedefinieerde thematische domeinen waren basiskennis van de ziekte, etiologie en risicofactoren, diagnose, behandeling, en preventie en rehabilitatie. Omdat de set vragen niet was afgeleid van zoeklogs van patiënten, online zoekopdrachten of formele patiëntinterviews, wordt de mogelijkheid van selectiebias erkend als een beperking van de studie.

AI-modellen en procedure voor gegevensverzameling

Op 25 november 2025 werd de definitieve set van 20 TN-gerelateerde vragen ingediend bij vijf publiek toegankelijke platforms voor grote taalmodellen (LLM): Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen en GPT-5/ChatGPT. Alle modellen werden benaderd via hun standaard publieke webgebaseerde chat-interfaces; er werd geen gebruik gemaakt van toegang via een application programming interface (API). Voor elk platform werd het standaard publiek beschikbare model gebruikt dat op de datum van gegevensverzameling beschikbaar was, zonder wijziging van de generatieparameters. Omdat de publieke webinterfaces geen backend-model-snapshot-identificatoren, verborgen systeemprompts, temperatuur, top-p, maximale output-tokens of andere generatieparameters weergaven, werden deze items genoteerd als "niet weergegeven in de publieke webinterface".

De talen voor de prompts en de reacties waren voor alle modellen Engels. Elke gestandaardiseerde prompt bestond uitsluitend uit de letterlijke Engelse vraag zonder aanvullende modelspecifieke instructies. Elke vraag werd individueel ingediend in een nieuwe, onafhankelijke chatsessie zonder voorafgaande gespreksgeschiedenis, geüploade bestanden, plug-ins, aangepaste instructies of vervolgprompts. De volledige lijst met gestandaardiseerde prompts en de bijbehorende ruwe modeloutputs is opgenomen in Supplementary File 1. De modelmetadata en de instellingen voor de gegevensverzameling zijn samengevat in Supplementary Table 1.

Beoordeling van de leesbaarheid

De leesbaarheid van de door de LLM gegenereerde antwoorden werd geëvalueerd met behulp van meerdere gevestigde leesbaarheidsformules die beschikbaar zijn via een online platform voor leesbaarheidsbeoordeling (http://readabilityformulas.com/). Gezien het ontbreken van een universeel geaccepteerde gouden standaard voor leesbaarheidsbeoordeling en in overeenstemming met eerdere studies, werd een uitgebreide set veelgebruikte leesbaarheidsindexen toegepast23,27. Zeven indexen werden geselecteerd om complementaire aspecten van leesbaarheid te vatten, waaronder zinlengte, woordlengte, lettergreepbelasting, op tekens gebaseerde complexiteit, leesgemak en het geschatte taalniveau, waardoor de afhankelijkheid van één enkele formule werd verminderd. Specifiek werden de Coleman-Liau Index (CL), Linsear Write Formula (LW), Automated Readability Index (ARI), Simple Measure of Gobbledygook (SMOG), Gunning Fog Index (GFOG), Flesch Reading Ease Score (FRES) en Flesch-Kincaid Grade Level (FKGL) berekend. Deze indexen schatten de leesmoeilijkheid of het taalniveau in en bieden kwantitatieve maten voor de leesbaarheid van de tekst (Tabel 2).

Evaluatie van educatieve geschiktheid en informatiekwaliteit

De educatieve geschiktheid werd beoordeeld met de Patient Education Materials Assessment Tool (PEMAT), die uit twee domeinen bestaat: begrijpelijkheid en actiegerichtheid28. Het instrument bevat 24 items, waarvan er 16 de begrijpelijkheid evalueren en acht de actiegerichtheid. Elk item werd dichotoom gescoord (0 = criterium niet behaald; 1 = criterium behaald), wat resulteerde in een totale score variërend van 0 tot 24, waarbij hogere scores duiden op een grotere geschiktheid voor patiëntenvoorlichting. De algehele informatiekwaliteit werd geëvalueerd met de Global Quality Score (GQS)27, een veelgebruikte vijfpunts Likert-schaal voor het beoordelen van de kwaliteit van medische informatie (Tabel 3).

Op 25 november 2025 evalueerden twee klinische experts met meer dan 3 jaar ervaring in het beheer van TN alle AI-gegenereerde antwoorden met behulp van beide beoordelingsinstrumenten. Voorafgaand aan de scoring werden alle AI-gegenereerde antwoorden geanonimiseerd met gecodeerde respondent-identificaties, en de beoordelaars waren tijdens de PEMAT- en GQS-beoordelingen geblinderd voor het LLM-platform. Onenigheden werden opgelost door een derde senior expert, die de definitieve scores vaststelde. De interbeoordelaarsbetrouwbaarheid werd beoordeeld met de coëfficiënt kappa van Cohen, waarbij waarden >0,75 wezen op uitstekende overeenstemming, 0,40–0,75 op acceptabele overeenstemming en <0,40 op matige overeenstemming. De kappa-waarden van Cohen voor zowel de PEMAT als de GQS waren hoger dan 0,75, wat wijst op een uitstekende interbeoordelaarsbetrouwbaarheid.

Statistische analyse

Alle statistische analyses werden uitgevoerd met R-software (versie 4.4.3). De normaliteit van de gegevens werd beoordeeld met de Shapiro-Wilk-toets en Q-Q-plots. Normaal verdeelde variabelen werden samengevat als gemiddelde ± standaarddeviatie en vergeleken met behulp van een eenweg-variantieanalyse (ANOVA), gevolgd door de post hoc-toets van Tukey indien van toepassing. Niet-normaal verdeelde variabelen werden samengevat als medianen en interkwartielafstanden en vergeleken met de Kruskal-Wallis-toets, gevolgd door de post hoc-toets van Dunn met een Bonferroni-correctie voor paarsgewijze vergelijkingen. Correlaties tussen leesbaarheidsindexen, PEMAT-scores en GQS-waarden werden geëvalueerd met de rangcorrelatiecoëfficiënt van Spearman, waarbij de Benjamini-Hochberg-correctie is toegepast voor meervoudig testen. Een tweezijdige gecorrigeerde P-waarde < 0,05 werd beschouwd als statistisch significant.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

Deze studie evalueerde systematisch de effecten van grote taalmodellen (LLM's) en verschillende categorieën gezondheidseducatieve inhoud op de leesbaarheid en kwaliteit van de gegenereerde teksten. Ten eerste vergeleken we de prestaties van vijf LLM's—Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen en GPT-5—met betrekking tot de geschiktheid voor patiëntenvoorlichting, de algemene informatiekwaliteit en meerdere leesbaarheidsmetrieken, waaronder de PEMAT-score, GQS en gevestigde leesbaarheidsindices (ARI, FRES, GFOG, FKGL...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Deze cross-sectionele benchmarkingstudie vergeleek systematisch de leesbaarheid, educatieve geschiktheid en de algehele informatiekwaliteit van patiëntenvoorlichtingsmaterialen over trigeminusneuralgie (TN), gegenereerd door vijf publiek toegankelijke grote taalmodellen (LLM's). Er kwamen vier belangrijke bevindingen naar voren. Ten eerste verschilde de leesbaarheid aanzienlijk tussen de modellen, waarbij GPT-5 de taalkundig meest complexe antwoorden genereerde en Wenxin Yiyan de meest leesbare inhoud produceerde. Ten tw...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

De auteurs verklaren dat er geen belangenverstrengelingen zijn.

Dankbetuigingen

Dit onderzoek heeft geen specifieke subsidie ontvangen van enige financieringsinstantie in de publieke, commerciële of non-profit sector. De auteurs danken de klinische collega's die feedback hebben gegeven op de vragenlijst over trigeminusneuralgie en hebben geholpen bij het verfijnen van het evaluatiekader. We danken ook alle medewerkers die hebben ondersteund bij het opstellen en herzien van het manuscript.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
DeepSeek chatplatformDeepSeekhttps://chat.deepseek.com/Publiek toegankelijke interface van een groot taalmodel gebruikt voor het genereren van antwoorden
Doubao chatplatformDoubaohttps://www.doubao.com/chat/Publiek toegankelijke interface van een groot taalmodel gebruikt voor het genereren van antwoorden
GPT 5 OpenAIhttps://chat.openai.com/Publiek toegankelijke interface van een groot taalmodel gebruikt voor het genereren van antwoorden
R-software, versie 4.4.3R Foundation for Statistical ComputingNiet van toepassingStatistische analyse en visualisatie
Readability Formulas online leesbaarheidscalculatorReadability FormulasNiet van toepassingOnline tool gebruikt voor het berekenen van leesbaarheidsindices
Tongyi Qianwen chatplatformTongyi Qianwenhttps://www.tongyi.com/Publiek toegankelijke interface van een groot taalmodel gebruikt voor het genereren van antwoorden
Wenxin Yiyan chatplatformWenxin Yiyanhttps://yiyan.baidu.com/Publiek toegankelijke interface van een groot taalmodel gebruikt voor het genereren van antwoorden

Referenties

  1. Headache Classification Committee of the International Headache Society (IHS). The International Classification of Headache Disorders, 3rd edition. Cephalalgia. 2018;38(1):1-211.
  2. Ashina S, et al. Trigeminal neuralgia. Nat Rev Dis Primers. 2024;10(1):39.
  3. Donertas-Ayaz B, Caudle RM. Locus coeruleus-noradrenergic modulation of trigeminal pain: Implications for trigeminal neuralgia and psychiatric comorbidities. Neurobiol Pain. 2023;13:100124.
  4. Martinelli R, et al. Psychological assessment in patients affected by trigeminal neuralgia: A systematic review. Neurosurg Rev. 2025;48(1):414.
  5. Melek LN, et al. Comparison of the neuropathic pain symptoms and psychosocial impacts of trigeminal neuralgia and painful posttraumatic trigeminal neuropathy. J Oral Facial Pain Headache. 2019;33(1):77-88.
  6. Zakrzewska JM, et al. Evaluating the impact of trigeminal neuralgia. Pain. 2017;158(6):1166-1174.
  7. Gambeta E, Chichorro JG, Zamponi GW. Trigeminal neuralgia: An overview from pathophysiology to pharmacological treatments. Mol Pain. 2020;16:1744806920901890.
  8. De Toledo IP, et al. Prevalence of trigeminal neuralgia: A systematic review. J Am Dent Assoc. 2016;147(7):570-576.e2.
  9. Svedung Wettervik T, et al. Incidence of trigeminal neuralgia: A population-based study in central Sweden. Eur J Pain. 2023;27(5):580-587.
  10. Bendtsen L, et al. European Academy of Neurology guideline on trigeminal neuralgia. Eur J Neurol. 2019;26(6):831-849.
  11. Cruccu G, et al. Trigeminal neuralgia: New classification and diagnostic grading for practice and research. Neurology. 2016;87(2):220-228.
  12. Araya EI, et al. Trigeminal neuralgia: Basic and clinical aspects. Curr Neuropharmacol. 2020;18(2):109-119.
  13. Chong MS, Bahra A, Zakrzewska JM. Guidelines for the management of trigeminal neuralgia. Cleve Clin J Med. 2023;90(6):355-362.
  14. Heinskou TB, et al. Favourable prognosis of trigeminal neuralgia when enrolled in a multidisciplinary management program: A two-year prospective real-life study. J Headache Pain. 2019;20(1):23.
  15. Liu S, et al. Comparative evaluation of ChatGPT and Gemini in brain-computer interface patient education: A multidimensional analysis of reliability, accuracy, comprehensibility, and readability. Int J Med Inform. 2026;206:106164.
  16. Forgie EME, et al. Social media and the transformation of the physician-patient relationship: Viewpoint. J Med Internet Res. 2021;23(12):e25230.
  17. Gantenbein L, Navarini AA, Maul LV, Brandt O, Mueller SM. Internet and social media use in dermatology patients: Search behavior and impact on the patient-physician relationship. Dermatol Ther. 2020;33(6):e14098.
  18. Youssef Y, et al. Social media and internet use among orthopedic patients in Germany: A multicenter survey. Front Digit Health. 2025;7:1486296.
  19. De Martino I, et al. Social media for patients: Benefits and drawbacks. Curr Rev Musculoskelet Med. 2017;10(1):141-145.
  20. Johnson KB, et al. Precision medicine, AI, and the future of personalized health care. Clin Transl Sci. 2021;14(1):86-93.
  21. Hirani R, et al. Artificial intelligence and healthcare: A journey through history, present innovations, and future possibilities. Life (Basel). 2024;14(5):557.
  22. Karatas G, Kirik F, Karatas ME, Cakir A, Ozdemir H. Comparative performance of ChatGPT o3-mini-high and DeepSeek-R1 in ophthalmology: An evaluation of diagnostic reasoning and case-based problem solving. J Fr Ophtalmol. 2025;49(1):104712.
  23. Hanci V, et al. Assessment of readability, reliability, and quality of ChatGPT, Bard, Gemini, Copilot, and Perplexity responses on palliative care. Medicine (Baltimore). 2024;103(33):e39305.
  24. Liu C, et al. Potential to perpetuate social biases in health care by Chinese large language models: A model evaluation study. Int J Equity Health. 2025;24(1):206.
  25. Haupt CE, Marks M. AI-generated medical advice—GPT and beyond. JAMA. 2023;329(16):1349-1350.
  26. Aydin S, Karabacak M, Vlachos V, Margetis K. Large language models in patient education: A scoping review of applications in medicine. Front Med (Lausanne). 2024;11:1477898.
  27. Kara M, et al. Evaluating the readability, quality, and reliability of responses generated by ChatGPT, Gemini, and Perplexity on the most commonly asked questions about ankylosing spondylitis. PLoS One. 2025;20(6):e0326351.
  28. Perez Rivera LR, et al. Evaluating the quality and reliability of large language models for plastic surgery patient education: A comparative analysis of ChatGPT and OpenEvidence. Aesthet Surg J. 2025. doi:10.1093/asj/sjaf249.
  29. Wilhelm TI, Roos J, Kaczmarczyk R. Large language models for therapy recommendations across three clinical specialties: Comparative study. J Med Internet Res. 2023;25:e49324.
  30. Will J, et al. Enhancing the readability of online patient education materials using large language models: Cross-sectional study. J Med Internet Res. 2025;27:e69955.
  31. Tukur Jido J, Al-Wizni A, Aung SL. Readability of AI-generated patient information leaflets on Alzheimer's disease, vascular dementia, and delirium. Cureus. 2025;17(6):e85463.
  32. Luo Z, Lin C, Kim TH, Shin YS, Ahn ST. Quality and readability analysis of artificial intelligence-generated medical information related to prostate cancer: A cross-sectional study of ChatGPT and DeepSeek. World J Mens Health. 2025. doi:10.5534/wjmh.250144.
  33. Joseph P, Silva NA, Nanda A, Gupta G. Evaluating the readability of online patient education materials for trigeminal neuralgia. World Neurosurg. 2020;144:e934-e938.
  34. Dong C, et al. Comparative evaluation of large language models in delivering guideline-compliant recommendations for topical NSAID use in musculoskeletal pain: A multidimensional analysis. Clin Rheumatol. 2025;44(11):4703-4710.
  35. Ozduran E, Buyukcoban S. Evaluating the readability, quality, and reliability of online patient education materials on post-COVID pain. PeerJ. 2022;10:e13686.
  36. Wang LW, Miller MJ, Schmitt MR, Wen FK. Assessing readability formula differences with written health information materials: Application, results, and recommendations. Res Social Adm Pharm. 2013;9(5):503-516.
  37. Singh SP, et al. Comprehension profile of patient education materials in endocrine care. Kans J Med. 2022;15(2):247-252.
  38. Marder RS, et al. ChatGPT-3.5 and ChatGPT-4.0 do not reliably create readable patient education materials for common orthopaedic upper- and lower-extremity conditions. Arthrosc Sports Med Rehabil. 2025;7(1):101027.
  39. Nasra M, et al. Can artificial intelligence improve patient educational material readability? A systematic review and narrative synthesis. Intern Med J. 2025;55(1):20-34.
  40. Bhatt C, et al. Evaluating readability, understandability, and actionability of online printable patient education materials for cholesterol management: A systematic review. J Am Heart Assoc. 2024;13(8):e030140.
  41. Avra TD, Le M, Hernandez S, Thure K, Ulloa JG. Readability assessment of online peripheral artery disease education materials. J Vasc Surg. 2022;76(6):1728-1732.
  42. Rooney MK, et al. Readability of patient education materials from high-impact medical journals: A 20-year analysis. J Patient Exp. 2021;8:2374373521998847.
  43. Ahmadzadeh K, et al. Patient education information material assessment criteria: A scoping review. Health Info Libr J. 2023;40(1):3-28.
  44. Duan L, Yao Z, Li X, Wu Y, Sheng D. Comparing large language models and human doctors in symptom-driven online medical consultations: A case study on trigeminal neuralgia. Digit Health. 2025;11:20552076251388140.
  45. Werner C, Harden J, Lawton J. Pathways to a diagnosis of trigeminal neuralgia: A qualitative study of patients' experiences. BMC Prim Care. 2025;26(1):65.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Herprints en machtigingen

Tags

Grote taalmodellenleesbaarheidsbeoordelingeducatieve kwaliteitPEMAT-evaluatieGlobal Quality Scorekwaliteit van gezondheidsinformatiemodel-benchmarkingpatiëntenbegrip