Diese Studie analysierte ausschließlich künstlich generierte Texte und umfasste keine menschlichen Probanden, Tiere, biologischen Proben, Krankenakten, identifizierbare personenbezogene Daten oder Eingriffe in die klinische Versorgung. Daher war eine Ethikprüfung und eine formelle Einwilligung nicht erforderlich.
Studienaufbau
Diese Querschnittsstudie bewertete die Lesbarkeit, Qualität und didaktische Eignung der Antworten, die fünf LLMs als Reaktion auf häufig gestellte Fragen zu TN generierten.
Identifizierung häufig gestellter Fragen zum Trigeminusnerv
Am 25. November 2025 überprüften zwei klinische Experten mit umfangreicher Erfahrung in der Schmerzmedizin unabhängig voneinander die aktuellen klinischen Leitlinien zur Trigeminusneuralgie (TN), einschließlich der Internationalen Klassifikation der Kopfschmerzerkrankungen, 3. Auflage (ICHD-3), der Leitlinie der Europäischen Akademie für Neurologie sowie der Leitlinie der American Academy of Neurology/Europäischen Föderation neurologischer Gesellschaften1,10,11. Nach einer Konsensusdiskussion erstellten sie eine Liste mit 20 in der klinischen Praxis häufig auftretenden, TN-bezogenen Fragen. Die Anzahl der Fragen wurde a priori festgelegt, um eine ausgewogene Abdeckung der fünf vorab definierten thematischen Bereiche sicherzustellen, wobei jeweils vier Fragen pro Bereich ausgewählt wurden, während die Gesamtanzahl der modellgenerierten Antworten in einem für die manuelle Bewertung und Verifizierung durch Experten praktikablen Bereich blieb. Zur Verbesserung der Reproduzierbarkeit folgte der Auswahlprozess einem vorab festgelegten, domänenbasierten Rahmen: Die Experten identifizierten zunächst Kandidatenfragen innerhalb jedes Bereichs, prüften diese unabhängig auf klinische Relevanz, patientenorientierte Formulierung und Vermeidung von Redundanz und einigten sich anschließend auf die endgültigen vier Fragen pro Bereich. Die endgültige Liste der Fragen ist in Tabelle 1 und Zusatzdatei 1 enthalten. Die fünf vorab definierten thematischen Bereiche waren grundlegendes Krankheitswissen, Ätiologie und Risikofaktoren, Diagnose, Therapie sowie Prävention und Rehabilitation. Da der Fragenkatalog nicht aus Patientensuchprotokollen, Online-Suchanfragen oder formellen Patienteninterviews abgeleitet wurde, wird eine mögliche Selektionsverzerrung als Studienlimitation anerkannt.
KI-Modelle und Datenerhebungsverfahren
Am 25. November 2025 wurde der endgültige Satz mit 20 TN-bezogenen Fragen fünf öffentlich zugänglichen Plattformen für große Sprachmodelle (LLM) übermittelt: Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen und GPT-5/ChatGPT. Auf alle Modelle wurde über ihre standardmäßigen, öffentlichen Web-Chat-Schnittstellen zugegriffen; der Zugriff erfolgte nicht über eine Programmierschnittstelle (API). Für jede Plattform wurde das jeweils am Tag der Datenerhebung standardmäßig verfügbare öffentliche Modell verwendet, ohne irgendwelche Generierungsparameter zu verändern. Da die öffentlichen Webschnittstellen keine Backend-Modellversionen, versteckten Systemanweisungen, Temperatur, Top-p, maximale Ausgabewörter oder andere Generierungsparameter anzeigten, wurden diese Angaben als „nicht in der öffentlichen Webschnittstelle angezeigt“ dokumentiert.
Die Ausgangssprache und die Antwortsprache waren für alle Modelle Englisch. Jede standardisierte Aufforderung bestand ausschließlich aus der wörtlichen englischen Frage ohne zusätzliche, modellspezifische Anweisungen. Jede Frage wurde einzeln in einer neuen, unabhängigen Chat-Sitzung ohne vorherigen Gesprächsverlauf, hochgeladene Dateien, Plug-Ins, angepasste Anweisungen oder Nachfragen eingereicht. Die vollständige Liste der standardisierten Aufforderungen und die entsprechenden rohen Modellergebnisse sind in Supplementary File 1 enthalten. Die Metadaten der Modelle und die Einstellungen zur Datensammlung sind in Supplementary Table 1 zusammengefasst.
Beurteilung der Lesbarkeit
Die Lesbarkeit der von LLMs generierten Antworten wurde mithilfe mehrerer etablierter Formeln zur Lesbarkeitsbewertung bewertet, die über eine Online-Plattform zur Lesbarkeitsanalyse verfügbar sind (http://readabilityformulas.com/). Angesichts des Fehlens eines universell anerkannten Goldstandards zur Bewertung der Lesbarkeit und in Übereinstimmung mit früheren Studien kam ein umfassender Satz weit verbreiteter Lesbarkeitsindizes zum Einsatz23,27. Sieben Indizes wurden ausgewählt, um komplementäre Aspekte der Lesbarkeit abzudecken, darunter Satzlänge, Wortlänge, Silbenbelastung, zeichenbasierte Komplexität, Lesefreundlichkeit und geschätzte Schulstufe, wodurch die Abhängigkeit von einer einzelnen Formel verringert wurde. Konkret wurden der Coleman-Liau-Index (CL), die Linsear-Write-Formel (LW), der Automated Readability Index (ARI), das Simple Measure of Gobbledygook (SMOG), der Gunning-Fog-Index (GFOG), der Flesch-Lesefreundlichkeitswert (FRES) und der Flesch-Kincaid-Schulstufenindex (FKGL) berechnet. Diese Indizes schätzen den Leseschwierigkeitsgrad bzw. die Schulstufe und liefern quantitative Maße für die Lesbarkeit des Textes (Tabelle 2).
Beurteilung der pädagogischen Eignung und Informationsqualität
Die Eignung für die Bildung wurde mithilfe des Patient Education Materials Assessment Tool (PEMAT) bewertet, das zwei Bereiche umfasst: Verständlichkeit und Handlungsorientierung28. Das Instrument besteht aus 24 Einzelitems, wobei 16 die Verständlichkeit und acht die Handlungsorientierung beurteilen. Jedes Item wurde dichotom bewertet (0 = Kriterium nicht erfüllt; 1 = Kriterium erfüllt), was zu einer Gesamtpunktzahl zwischen 0 und 24 führt, wobei höhere Werte auf eine bessere Eignung für die Patientenaufklärung hinweisen. Die Gesamtqualität der Informationen wurde anhand der Global Quality Score (GQS)27 bewertet, einer weit verbreiteten fünfstufigen Likert-Skala zur Beurteilung der Qualität medizinischer Informationen (Tabelle 3).
Am 25. November 2025 bewerteten zwei klinische Experten mit mehr als drei Jahren Erfahrung im TN-Management alle KI-generierten Antworten unter Verwendung beider Bewertungsinstrumente. Vor der Bewertung wurden alle KI-generierten Antworten mit codierten Antwortkennungen anonymisiert, und die Prüfer waren während der PEMAT- und GQS-Bewertungen gegenüber der LLM-Plattform verblindet. Uneinigkeiten wurden von einem dritten, erfahrenen Experten beigelegt, der die endgültigen Bewertungen entschied. Die Übereinstimmung zwischen den Bewertenden wurde mittels des Cohens Kappa-Koeffizienten ermittelt, wobei Werte >0,75 auf eine hervorragende Übereinstimmung, 0,40–0,75 auf eine akzeptable Übereinstimmung und <0,40 auf eine schlechte Übereinstimmung hinweisen. Die Cohens Kappa-Werte sowohl für die PEMAT- als auch für die GQS lagen über 0,75 und zeigten somit eine hervorragende Übereinstimmung zwischen den Bewertenden.
Statistische Analyse
Alle statistischen Analysen wurden mit der R-Software (Version 4.4.3) durchgeführt. Die Datennormalität wurde mithilfe des Shapiro-Wilk-Tests und von Q-Q-Diagrammen überprüft. Normalverteilte Variablen wurden als Mittelwert ± Standardabweichung zusammengefasst und mittels einfaktorieller Varianzanalyse (ANOVA) verglichen, gefolgt von Tukeys Post-hoc-Test, wenn angebracht. Nicht normalverteilte Variablen wurden als Mediane und Interquartilbereiche dargestellt und mittels des Kruskal-Wallis-Tests verglichen, gefolgt von DUNNs Post-hoc-Test mit Bonferroni-Korrektur für paarweise Vergleiche. Zusammenhänge zwischen Lesbarkeitsindizes, PEMAT-Scores und GQS-Werten wurden mittels Spearmans Rangkorrelationskoeffizienten bewertet, wobei eine Benjamini-Hochberg-Korrektur für Mehrfachvergleiche angewandt wurde. Ein zweiseitiger adjustierter P-Wert < 0,05 galt als statistisch signifikant.