Deze studie analyseerde uitsluitend door AI gegenereerde tekst en hield geen menselijke deelnemers, dieren, biologische monsters, medische dossiers, identificeerbare persoonlijke informatie of interventies in de klinische zorg in. Daarom waren een ethische toetsing en formele geïnformeerde toestemming niet van toepassing.
Studieopzet
Deze cross-sectionele studie evalueerde de leesbaarheid, kwaliteit en educatieve geschiktheid van antwoorden gegenereerd door vijf LLM's op veelgestelde vragen over TN.
Identificatie van veelgestelde vragen met betrekking tot TN
Op 25 november 2025 hebben twee klinische experts met uitgebreide ervaring in pijnbestrijding onafhankelijk de huidige klinische richtlijnen voor trigeminusneuralgie (TN) beoordeeld, waaronder de International Classification of Headache Disorders, 3de editie (ICHD-3), de richtlijn van de European Academy of Neurology en de richtlijn van de American Academy of Neurology/European Federation of Neurological Societies1,10,11. Na een consensusdiscussie stelden zij een lijst samen van 20 TN-gerelateerde vragen die veel voorkomen in de klinische praktijk. Het aantal vragen werd a priori bepaald om een gebalanceerde dekking van de vijf vooraf gedefinieerde thematische domeinen te bieden, waarbij voor elk domein vier vragen werden geselecteerd, terwijl het totale aantal door het model gegenereerde antwoorden binnen een bereik bleef dat haalbaar was voor handmatige beoordeling en verificatie door experts. Om de reproduceerbaarheid te verbeteren, volgde het selectieproces een vooraf gedefinieerd domeingebaseerd kader: de experts identificeerden eerst kandidaatvragen binnen elk domein, beoordeelden deze onafhankelijk op klinische relevantie, patiëntgerichte formulering en het vermijden van redundantie, en bereikten vervolgens consensus over de definitieve vier vragen per domein. De definitieve lijst met vragen staat in Tabel 1 en Aanvullend Bestand 1. De vijf vooraf gedefinieerde thematische domeinen waren basiskennis van de ziekte, etiologie en risicofactoren, diagnose, behandeling, en preventie en rehabilitatie. Omdat de set vragen niet was afgeleid van zoeklogs van patiënten, online zoekopdrachten of formele patiëntinterviews, wordt de mogelijkheid van selectiebias erkend als een beperking van de studie.
AI-modellen en procedure voor gegevensverzameling
Op 25 november 2025 werd de definitieve set van 20 TN-gerelateerde vragen ingediend bij vijf publiek toegankelijke platforms voor grote taalmodellen (LLM): Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen en GPT-5/ChatGPT. Alle modellen werden benaderd via hun standaard publieke webgebaseerde chat-interfaces; er werd geen gebruik gemaakt van toegang via een application programming interface (API). Voor elk platform werd het standaard publiek beschikbare model gebruikt dat op de datum van gegevensverzameling beschikbaar was, zonder wijziging van de generatieparameters. Omdat de publieke webinterfaces geen backend-model-snapshot-identificatoren, verborgen systeemprompts, temperatuur, top-p, maximale output-tokens of andere generatieparameters weergaven, werden deze items genoteerd als "niet weergegeven in de publieke webinterface".
De talen voor de prompts en de reacties waren voor alle modellen Engels. Elke gestandaardiseerde prompt bestond uitsluitend uit de letterlijke Engelse vraag zonder aanvullende modelspecifieke instructies. Elke vraag werd individueel ingediend in een nieuwe, onafhankelijke chatsessie zonder voorafgaande gespreksgeschiedenis, geüploade bestanden, plug-ins, aangepaste instructies of vervolgprompts. De volledige lijst met gestandaardiseerde prompts en de bijbehorende ruwe modeloutputs is opgenomen in Supplementary File 1. De modelmetadata en de instellingen voor de gegevensverzameling zijn samengevat in Supplementary Table 1.
Beoordeling van de leesbaarheid
De leesbaarheid van de door de LLM gegenereerde antwoorden werd geëvalueerd met behulp van meerdere gevestigde leesbaarheidsformules die beschikbaar zijn via een online platform voor leesbaarheidsbeoordeling (http://readabilityformulas.com/). Gezien het ontbreken van een universeel geaccepteerde gouden standaard voor leesbaarheidsbeoordeling en in overeenstemming met eerdere studies, werd een uitgebreide set veelgebruikte leesbaarheidsindexen toegepast23,27. Zeven indexen werden geselecteerd om complementaire aspecten van leesbaarheid te vatten, waaronder zinlengte, woordlengte, lettergreepbelasting, op tekens gebaseerde complexiteit, leesgemak en het geschatte taalniveau, waardoor de afhankelijkheid van één enkele formule werd verminderd. Specifiek werden de Coleman-Liau Index (CL), Linsear Write Formula (LW), Automated Readability Index (ARI), Simple Measure of Gobbledygook (SMOG), Gunning Fog Index (GFOG), Flesch Reading Ease Score (FRES) en Flesch-Kincaid Grade Level (FKGL) berekend. Deze indexen schatten de leesmoeilijkheid of het taalniveau in en bieden kwantitatieve maten voor de leesbaarheid van de tekst (Tabel 2).
Evaluatie van educatieve geschiktheid en informatiekwaliteit
De educatieve geschiktheid werd beoordeeld met de Patient Education Materials Assessment Tool (PEMAT), die uit twee domeinen bestaat: begrijpelijkheid en actiegerichtheid28. Het instrument bevat 24 items, waarvan er 16 de begrijpelijkheid evalueren en acht de actiegerichtheid. Elk item werd dichotoom gescoord (0 = criterium niet behaald; 1 = criterium behaald), wat resulteerde in een totale score variërend van 0 tot 24, waarbij hogere scores duiden op een grotere geschiktheid voor patiëntenvoorlichting. De algehele informatiekwaliteit werd geëvalueerd met de Global Quality Score (GQS)27, een veelgebruikte vijfpunts Likert-schaal voor het beoordelen van de kwaliteit van medische informatie (Tabel 3).
Op 25 november 2025 evalueerden twee klinische experts met meer dan 3 jaar ervaring in het beheer van TN alle AI-gegenereerde antwoorden met behulp van beide beoordelingsinstrumenten. Voorafgaand aan de scoring werden alle AI-gegenereerde antwoorden geanonimiseerd met gecodeerde respondent-identificaties, en de beoordelaars waren tijdens de PEMAT- en GQS-beoordelingen geblinderd voor het LLM-platform. Onenigheden werden opgelost door een derde senior expert, die de definitieve scores vaststelde. De interbeoordelaarsbetrouwbaarheid werd beoordeeld met de coëfficiënt kappa van Cohen, waarbij waarden >0,75 wezen op uitstekende overeenstemming, 0,40–0,75 op acceptabele overeenstemming en <0,40 op matige overeenstemming. De kappa-waarden van Cohen voor zowel de PEMAT als de GQS waren hoger dan 0,75, wat wijst op een uitstekende interbeoordelaarsbetrouwbaarheid.
Statistische analyse
Alle statistische analyses werden uitgevoerd met R-software (versie 4.4.3). De normaliteit van de gegevens werd beoordeeld met de Shapiro-Wilk-toets en Q-Q-plots. Normaal verdeelde variabelen werden samengevat als gemiddelde ± standaarddeviatie en vergeleken met behulp van een eenweg-variantieanalyse (ANOVA), gevolgd door de post hoc-toets van Tukey indien van toepassing. Niet-normaal verdeelde variabelen werden samengevat als medianen en interkwartielafstanden en vergeleken met de Kruskal-Wallis-toets, gevolgd door de post hoc-toets van Dunn met een Bonferroni-correctie voor paarsgewijze vergelijkingen. Correlaties tussen leesbaarheidsindexen, PEMAT-scores en GQS-waarden werden geëvalueerd met de rangcorrelatiecoëfficiënt van Spearman, waarbij de Benjamini-Hochberg-correctie is toegepast voor meervoudig testen. Een tweezijdige gecorrigeerde P-waarde < 0,05 werd beschouwd als statistisch significant.