Ein Abonnement von JoVE ist erforderlich, um diesen Inhalt anzuzeigen. Melden Sie sich an oder beginnen Sie noch heute mit einer kostenlosen Testphase.

Forschungsartikel

Lesbarkeit und Qualität der Patientenaufklärung durch große Sprachmodelle bei Trigeminusneuralgie: Eine Querschnittsstudie

70 Aufrufe

⸱

DOI:

10.3791/70833

⸱

21. August 2026

In diesem Artikel

Zusammenfassung

Hier stellen wir ein Protokoll vor, um systematisch die Lesbarkeit, pädagogische Eignung und Qualität patientenbezogener Informationen zum trigeminalen Neuralgie, die von großen Sprachmodellen generiert wurden, zu bewerten, um Modelle zu vergleichen und die Kommunikation mit Patienten zu leiten.

Zusammenfassung

Große Sprachmodelle (LLMs) werden zunehmend für die Patientenaufklärung genutzt, doch die Lesbarkeit und pädagogische Qualität von LLM-generierten Informationen zur Trigeminusneuralgie (TN) wurde bisher unzureichend bewertet. Diese querschnittliche Benchmark-Studie verglich TN-Aufklärungsinhalte, die von fünf öffentlich verfügbaren LLMs generiert wurden (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen und GPT-5). Zwanzig häufig gestellte TN-Fragen, die grundlegendes Krankheitswissen, Ätiologie/Risikofaktoren, Diagnose, Therapie sowie Prävention/Rehabilitation abdeckten, wurden an jedes Modell mittels standardisierter Prompts gestellt. Die Lesbarkeit wurde anhand von sieben etablierten Indizes bewertet, die pädagogische Eignung mit dem Patient Education Materials Assessment Tool für Verständlichkeit und Handlungsorientierung (PEMAT) und die Gesamtinformationsqualität anhand der Global Quality Score (GQS). Zwei klinische Experten bewerteten alle Antworten unabhängig voneinander, wobei Meinungsverschiedenheiten durch einen erfahrenen Schiedsrichter beigelegt wurden. Statistische Analysen verglichen die Modelleistung, thematische Unterschiede und Korrelationen zwischen den Bewertungsmetriken. Es zeigten sich signifikante Unterschiede zwischen den Modellen hinsichtlich Lesbarkeit, PEMAT- und GQS-Werten. GPT-5 erzeugte die sprachlich komplexesten Antworten, erzielte jedoch die höchsten Bewertungen hinsichtlich pädagogischer Eignung und Informationsqualität. Im Gegensatz dazu lieferte Wenxin Yiyan den am leichtesten lesbaren Text, erzielte aber im Allgemeinen niedrigere Werte bei PEMAT und GQS. Die Inhaltskategorie beeinflusste die Lesbarkeit, wobei Themen zur Prävention/Rehabilitation und zur Ätiologie/Risikofaktoren schwerer verständlich waren, während PEMAT und GQS über die Themen hinweg relativ konstant blieben. Die Lesbarkeitsindizes wiesen eine hohe interne Konsistenz sowie schwache bis moderate positive Korrelationen mit PEMAT und GQS auf, während PEMAT und GQS eine moderate positive Korrelation aufwiesen. Diese Ergebnisse legen nahe, dass die Modellauswahl die von Experten bewertete pädagogische Eignung und die Gesamtinformationsqualität beeinflusst, während die thematische Komplexität vorrangig die Lesbarkeit beeinträchtigt. Da Verständnis, Zufriedenheit, Vertrauen, Gesundheitsoutcomes, faktische Genauigkeit und klinische Sicherheit der Patienten nicht evaluiert wurden, sollten diese Ergebnisse als expertenbasierte Benchmark-Analyse und nicht als Beleg für klinische Einsatzbereitschaft interpretiert werden.

Einleitung

Trigeminusneuralgie (TN) ist ein neuropathisches Schmerzsyndrom, das durch wiederkehrende Episoden einseitiger, kurzer und äußerst heftiger Gesichtsschmerzen gekennzeichnet ist, die häufig als elektrische Schock- oder Stichschmerzen beschrieben werden. Laut der Internationalen Klassifikation von Kopfschmerzerkrankungen, 3. Auflage (ICHD-3), ist der Schmerz typischerweise auf das Versorgungsgebiet eines oder mehrerer Äste des Nervus trigeminus begrenzt, oft in unerträglicher Intensität und kann durch harmlose Reize wie leichtes Berühren, Gesichtswaschen, Zähneputzen, Sprechen oder Kauen ausgelöst werden. Die Anfälle zeichnen sich durch plötzlichen Beginn und abruptes Ende aus und dauern von Bruchteilen einer Sekunde bis zu mehreren Minuten1,2. Obwohl TN in der Regel nicht lebensbedrohlich ist, beeinträchtigt der starke und unvorhersehbare Schmerz wesentliche alltägliche Aktivitäten erheblich, darunter Essen, Sprechen, Schlaf und emotionale Regulation, was zu einer erheblichen psychosozialen Belastung und einer verminderten Lebensqualität führt. Evidenz aus systematischen Übersichtsarbeiten zeigt, dass Personen mit TN im Vergleich zur Allgemeinbevölkerung ein signifikant erhöhtes Risiko für Depressionen, Angststörungen und Schlafstörungen aufweisen3,4. In großen Kohortenstudien weisen etwa 35–55 % der TN-Patienten klinisch relevante Symptome von Angst oder Depression auf, und Schmerzkatastrophisierung ist weit verbreitet, was auf eine wechselseitige Interaktion zwischen chronischen schweren Schmerzen, Schlaflosigkeit und affektiven Störungen hindeutet5,6. Epidemiologische Schätzungen zufolge liegt die Prävalenz von TN in der Allgemeinbevölkerung zwischen etwa 0,03 % und 0,3 %, wobei eine höhere Häufigkeit bei Frauen und älteren Erwachsenen sowie bemerkenswerte Unterschiede zwischen geografischen Regionen, ethnischen Gruppen und Altersschichten bestehen7,8. In stark bevölkerten Ländern wie China und Indien ist mit der raschen Alterung der Bevölkerung ein anhaltender Anstieg der Zahl der von TN Betroffenen verbunden, was die Gesundheitssysteme zunehmend belastet und die Notwendigkeit wirksamerer, skalierbarer und datengestützter Ansätze zur Beurteilung und Behandlung der Erkrankung unterstreicht8,9.

TN kann in die Untertypen klassisch, sekundär und idiopathisch eingeteilt werden, wobei zunehmende Evidenz erhebliche Unterschiede in den ätiologischen Mechanismen und therapeutischen Strategien zwischen diesen Kategorien belegt1,10. Aktuelle Studien legen nahe, dass strukturelle Veränderungen im Eintrittsbereich der Nervenwurzel des Nervus trigeminus, die mit einem neurovaskulären Konflikt assoziiert sind, eine periphere Nervenhypererregbarkeit sowie eine veränderte zentrale Schmerzmodulation gemeinsam zur Pathogenese der Erkrankung beitragen11,12. Klinische Leitlinien empfehlen Carbamazepin und Oxcarbazepin als Therapie der ersten Wahl, während chirurgische oder interventionelle Maßnahmen in Betracht gezogen werden, wenn eine pharmakologische Therapie unwirksam oder schlecht verträglich ist10. Trotz dieser therapeutischen Fortschritte zeichnet sich TN durch einen rezidivierend-remittierenden Verlauf aus, und langfristige Schmerzrezidive bleiben häufig, sodass eine dauerhafte Remission schwer zu erreichen ist13. Folglich sind eine langfristige Nachsorge und ein strukturiertes Management chronischer Erkrankungen unerlässlich, um das Rezidivrisiko, die Therapieantwort und Komplikationen zu überwachen. Längsschnittliche Kohortenstudien zeigen, dass unter standardisierten Managementstrategien (einschließlich pharmakologischer Behandlung, indizierter chirurgischer Intervention und umfassender Nachsorge) etwa die Hälfte der Patienten, die einer konservativen Therapie unterzogen werden, innerhalb von zwei Jahren eine Reduktion der gesamten Schmerzbelastung um ≥50 % erreichen kann, ohne dass ein unvermeidlicher Krankheitsprogress eintritt14. Diese Befunde unterstreichen die Bedeutung einer nachhaltigen Patientenbeteiligung und einer wirksamen Gesundheitsaufklärung für das langfristige Krankheitsmanagement. Evidenz legt nahe, dass Patienten mit einem besseren Verständnis der Krankheitsätiologie, der Pathophysiologie und der Behandlungsoptionen eher bereit sind, aktiv an therapeutischen Maßnahmen teilzunehmen und diese einzuhalten, was zu verbesserten Behandlungsergebnissen führt15. Traditionelle Ansätze der Gesundheitsaufklärung sind jedoch häufig in ihrer Reichweite und Skalierbarkeit begrenzt. Angesichts der weiten Verbreitung des Internets, insbesondere von Online-Frage-und-Antwort-Plattformen und sozialen Medien, verlassen sich Patienten zunehmend auf digitale Quellen, um medizinische Informationen zu erhalten16,17. Dennoch stellen erhebliche Unterschiede in der individuellen Gesundheitskompetenz sowie die Fähigkeit, grundlegende Gesundheitsinformationen zugänglich zu machen, zu verarbeiten und zu verstehen, um informierte Entscheidungen zu treffen, erhebliche Barrieren für eine wirksame Patientenaufklärung dar18. Zudem kann die uneinheitliche Qualität von Online-Gesundheitsinformationen, einschließlich ungenauer oder irreführender Inhalte, die medizinischen Entscheidungen und das psychische Wohlbefinden der Patienten negativ beeinflussen19.

Künstliche Intelligenz (KI), insbesondere die rasante Entwicklung großer Sprachmodelle (LLMs) in den letzten Jahren, hat neue Möglichkeiten für die Wissenschaftskommunikation im medizinischen Bereich und die Gesundheitsaufklärung geschaffen20. Diese auf umfangreichen Textkorpora trainierten Modelle können durch Interaktion in natürlicher Sprache strukturierte und logisch kohärente Antworten generieren21. Repräsentative internationale Systeme wie ChatGPT haben vielversprechendes Potenzial für die Beantwortung medizinischer Fragen, die Patientenberatung und die medizinische Ausbildung gezeigt22,23. In China sind mehrere funktional ähnliche LLMs entstanden, deren Nutzerkreis und Anwendungsszenarien sich kontinuierlich erweitern24. Trotz dieser Fortschritte stehen die Anwendungen von LLMs in der medizinischen Volksaufklärung nach wie vor vor erheblichen Herausforderungen, darunter die Zuverlässigkeit der Trainingsdaten, die Aktualisierungshäufigkeit, die wissenschaftliche Genauigkeit der generierten Antworten sowie der Mangel an klinischer Validierung25. Zudem können Unterschiede zwischen Modellen hinsichtlich Sprachstil, Lesbarkeit, logischer Struktur und Zitiergenauigkeit das Verständnis und das Vertrauen der Patienten in gesundheitsrelevante Informationen direkt beeinflussen26. Bisher gibt es nur begrenzte systematische Bewertungen der Leistung von LLMs im Bereich der gesundheitlichen Aufklärung zu Themen rund um TN.

Daher hatte diese Studie zum Ziel, die Leistung von vier weit verbreiteten chinesischen LLMs (Doubao, DeepSeek, Wenxin Yiyan und Tongyi Qianwen) und eines repräsentativen internationalen LLMs (ChatGPT) bei der Beantwortung von Patientenaufklärungsfragen im Zusammenhang mit TN systematisch zu bewerten und zu vergleichen. Mithilfe eines Querschnittdesigns erstellten wir einen TN-Fragenkatalog basierend auf klinischen Leitlinien und häufigen patientenseitigen Anliegen und bewerteten die von fünf öffentlich verfügbaren LLMs (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen und GPT-5) generierten Antworten. Die Lesbarkeit wurde anhand mehrerer Metriken bewertet, während Verständlichkeit und Handlungsorientierung mit dem Patient Education Materials Assessment Tool (PEMAT) erhoben wurden. Die Gesamtinformationsqualität wurde anhand der Global Quality Score (GQS) bewertet. Zusätzlich analysierten wir, wie unterschiedliche Themen der Gesundheitsaufklärung diese Bewertungsmetriken und deren Wechselbeziehungen beeinflussen, um evidenzbasierte Empfehlungen für die Auswahl und Optimierung von LLMs in der klinischen Gesundheitskommunikation bereitzustellen.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Protokoll

Diese Studie analysierte ausschließlich künstlich generierte Texte und umfasste keine menschlichen Probanden, Tiere, biologischen Proben, Krankenakten, identifizierbare personenbezogene Daten oder Eingriffe in die klinische Versorgung. Daher war eine Ethikprüfung und eine formelle Einwilligung nicht erforderlich.

Studienaufbau

Diese Querschnittsstudie bewertete die Lesbarkeit, Qualität und didaktische Eignung der Antworten, die fünf LLMs als Reaktion auf häufig gestellte Fragen zu TN generierten.

Identifizierung häufig gestellter Fragen zum Trigeminusnerv

Am 25. November 2025 überprüften zwei klinische Experten mit umfangreicher Erfahrung in der Schmerzmedizin unabhängig voneinander die aktuellen klinischen Leitlinien zur Trigeminusneuralgie (TN), einschließlich der Internationalen Klassifikation der Kopfschmerzerkrankungen, 3. Auflage (ICHD-3), der Leitlinie der Europäischen Akademie für Neurologie sowie der Leitlinie der American Academy of Neurology/Europäischen Föderation neurologischer Gesellschaften1,10,11. Nach einer Konsensusdiskussion erstellten sie eine Liste mit 20 in der klinischen Praxis häufig auftretenden, TN-bezogenen Fragen. Die Anzahl der Fragen wurde a priori festgelegt, um eine ausgewogene Abdeckung der fünf vorab definierten thematischen Bereiche sicherzustellen, wobei jeweils vier Fragen pro Bereich ausgewählt wurden, während die Gesamtanzahl der modellgenerierten Antworten in einem für die manuelle Bewertung und Verifizierung durch Experten praktikablen Bereich blieb. Zur Verbesserung der Reproduzierbarkeit folgte der Auswahlprozess einem vorab festgelegten, domänenbasierten Rahmen: Die Experten identifizierten zunächst Kandidatenfragen innerhalb jedes Bereichs, prüften diese unabhängig auf klinische Relevanz, patientenorientierte Formulierung und Vermeidung von Redundanz und einigten sich anschließend auf die endgültigen vier Fragen pro Bereich. Die endgültige Liste der Fragen ist in Tabelle 1 und Zusatzdatei 1 enthalten. Die fünf vorab definierten thematischen Bereiche waren grundlegendes Krankheitswissen, Ätiologie und Risikofaktoren, Diagnose, Therapie sowie Prävention und Rehabilitation. Da der Fragenkatalog nicht aus Patientensuchprotokollen, Online-Suchanfragen oder formellen Patienteninterviews abgeleitet wurde, wird eine mögliche Selektionsverzerrung als Studienlimitation anerkannt.

KI-Modelle und Datenerhebungsverfahren

Am 25. November 2025 wurde der endgültige Satz mit 20 TN-bezogenen Fragen fünf öffentlich zugänglichen Plattformen für große Sprachmodelle (LLM) übermittelt: Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen und GPT-5/ChatGPT. Auf alle Modelle wurde über ihre standardmäßigen, öffentlichen Web-Chat-Schnittstellen zugegriffen; der Zugriff erfolgte nicht über eine Programmierschnittstelle (API). Für jede Plattform wurde das jeweils am Tag der Datenerhebung standardmäßig verfügbare öffentliche Modell verwendet, ohne irgendwelche Generierungsparameter zu verändern. Da die öffentlichen Webschnittstellen keine Backend-Modellversionen, versteckten Systemanweisungen, Temperatur, Top-p, maximale Ausgabewörter oder andere Generierungsparameter anzeigten, wurden diese Angaben als „nicht in der öffentlichen Webschnittstelle angezeigt“ dokumentiert.

Die Ausgangssprache und die Antwortsprache waren für alle Modelle Englisch. Jede standardisierte Aufforderung bestand ausschließlich aus der wörtlichen englischen Frage ohne zusätzliche, modellspezifische Anweisungen. Jede Frage wurde einzeln in einer neuen, unabhängigen Chat-Sitzung ohne vorherigen Gesprächsverlauf, hochgeladene Dateien, Plug-Ins, angepasste Anweisungen oder Nachfragen eingereicht. Die vollständige Liste der standardisierten Aufforderungen und die entsprechenden rohen Modellergebnisse sind in Supplementary File 1 enthalten. Die Metadaten der Modelle und die Einstellungen zur Datensammlung sind in Supplementary Table 1 zusammengefasst.

Beurteilung der Lesbarkeit

Die Lesbarkeit der von LLMs generierten Antworten wurde mithilfe mehrerer etablierter Formeln zur Lesbarkeitsbewertung bewertet, die über eine Online-Plattform zur Lesbarkeitsanalyse verfügbar sind (http://readabilityformulas.com/). Angesichts des Fehlens eines universell anerkannten Goldstandards zur Bewertung der Lesbarkeit und in Übereinstimmung mit früheren Studien kam ein umfassender Satz weit verbreiteter Lesbarkeitsindizes zum Einsatz23,27. Sieben Indizes wurden ausgewählt, um komplementäre Aspekte der Lesbarkeit abzudecken, darunter Satzlänge, Wortlänge, Silbenbelastung, zeichenbasierte Komplexität, Lesefreundlichkeit und geschätzte Schulstufe, wodurch die Abhängigkeit von einer einzelnen Formel verringert wurde. Konkret wurden der Coleman-Liau-Index (CL), die Linsear-Write-Formel (LW), der Automated Readability Index (ARI), das Simple Measure of Gobbledygook (SMOG), der Gunning-Fog-Index (GFOG), der Flesch-Lesefreundlichkeitswert (FRES) und der Flesch-Kincaid-Schulstufenindex (FKGL) berechnet. Diese Indizes schätzen den Leseschwierigkeitsgrad bzw. die Schulstufe und liefern quantitative Maße für die Lesbarkeit des Textes (Tabelle 2).

Beurteilung der pädagogischen Eignung und Informationsqualität

Die Eignung für die Bildung wurde mithilfe des Patient Education Materials Assessment Tool (PEMAT) bewertet, das zwei Bereiche umfasst: Verständlichkeit und Handlungsorientierung28. Das Instrument besteht aus 24 Einzelitems, wobei 16 die Verständlichkeit und acht die Handlungsorientierung beurteilen. Jedes Item wurde dichotom bewertet (0 = Kriterium nicht erfüllt; 1 = Kriterium erfüllt), was zu einer Gesamtpunktzahl zwischen 0 und 24 führt, wobei höhere Werte auf eine bessere Eignung für die Patientenaufklärung hinweisen. Die Gesamtqualität der Informationen wurde anhand der Global Quality Score (GQS)27 bewertet, einer weit verbreiteten fünfstufigen Likert-Skala zur Beurteilung der Qualität medizinischer Informationen (Tabelle 3).

Am 25. November 2025 bewerteten zwei klinische Experten mit mehr als drei Jahren Erfahrung im TN-Management alle KI-generierten Antworten unter Verwendung beider Bewertungsinstrumente. Vor der Bewertung wurden alle KI-generierten Antworten mit codierten Antwortkennungen anonymisiert, und die Prüfer waren während der PEMAT- und GQS-Bewertungen gegenüber der LLM-Plattform verblindet. Uneinigkeiten wurden von einem dritten, erfahrenen Experten beigelegt, der die endgültigen Bewertungen entschied. Die Übereinstimmung zwischen den Bewertenden wurde mittels des Cohens Kappa-Koeffizienten ermittelt, wobei Werte >0,75 auf eine hervorragende Übereinstimmung, 0,40–0,75 auf eine akzeptable Übereinstimmung und <0,40 auf eine schlechte Übereinstimmung hinweisen. Die Cohens Kappa-Werte sowohl für die PEMAT- als auch für die GQS lagen über 0,75 und zeigten somit eine hervorragende Übereinstimmung zwischen den Bewertenden.

Statistische Analyse

Alle statistischen Analysen wurden mit der R-Software (Version 4.4.3) durchgeführt. Die Datennormalität wurde mithilfe des Shapiro-Wilk-Tests und von Q-Q-Diagrammen überprüft. Normalverteilte Variablen wurden als Mittelwert ± Standardabweichung zusammengefasst und mittels einfaktorieller Varianzanalyse (ANOVA) verglichen, gefolgt von Tukeys Post-hoc-Test, wenn angebracht. Nicht normalverteilte Variablen wurden als Mediane und Interquartilbereiche dargestellt und mittels des Kruskal-Wallis-Tests verglichen, gefolgt von DUNNs Post-hoc-Test mit Bonferroni-Korrektur für paarweise Vergleiche. Zusammenhänge zwischen Lesbarkeitsindizes, PEMAT-Scores und GQS-Werten wurden mittels Spearmans Rangkorrelationskoeffizienten bewertet, wobei eine Benjamini-Hochberg-Korrektur für Mehrfachvergleiche angewandt wurde. Ein zweiseitiger adjustierter P-Wert < 0,05 galt als statistisch signifikant.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Ergebnisse

Diese Studie bewertete systematisch die Auswirkungen großer Sprachmodelle (LLMs) und verschiedener Kategorien von Gesundheitsbildungsinhalten auf die Lesbarkeit und Qualität der generierten Texte. Zunächst verglichen wir die Leistungsfähigkeit von fünf LLMs – Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen und GPT-5 – hinsichtlich der Eignung für die Patientenaufklärung, der Gesamtinformationsqualität sowie mehrerer Lesbarkeitsmetriken, einschließlich des PEMAT-Scores, des GQS und etablierter Lesbarkeitsindizes (ARI, FRES...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Diskussion

Diese querschnittliche Benchmarking-Studie verglich systematisch die Lesbarkeit, pädagogische Eignung und die gesamte Informationsqualität von Patientenbildungsunterlagen zur trigeminalen Neuralgie (TN), die von fünf öffentlich verfügbaren großen Sprachmodellen (LLMs) generiert wurden. Vier zentrale Ergebnisse wurden ermittelt. Erstens unterschied sich die Lesbarkeit erheblich zwischen den Modellen, wobei GPT-5 die sprachlich komplexesten Antworten erzeugte und Wenxin Yiyan die am leichtesten lesbaren Inhalte lieferte. Z...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Offenlegungen

Die Autoren erklären, dass sie keine konkurrierenden Interessen haben.

Danksagungen

Diese Forschung erhielt keine spezifische Förderung durch öffentliche, kommerzielle oder gemeinnützige Einrichtungen. Die Autoren danken den klinischen Kollegen, die Rückmeldungen zum Fragenkatalog zur Trigeminusneuralgie gegeben und bei der Weiterentwicklung des Evaluationsrahmens unterstützt haben. Wir danken auch allen Beiträgenden, die bei der Erstellung und Überarbeitung des Manuskripts unterstützt haben.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Materialien

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
DeepSeek-ChatplattformDeepSeekhttps://chat.deepseek.com/Öffentlich zugängliche Schnittstelle für große Sprachmodelle, die zur Erzeugung von Antworten verwendet wird
Doubao-ChatplattformDoubaohttps://www.doubao.com/chat/Öffentlich zugängliche Schnittstelle für große Sprachmodelle, die zur Erzeugung von Antworten verwendet wird
GPT 5 OpenAINicht zutreffendStatistische Analyse und Visualisierung
R-Software, Version 4.4.3R Foundation for Statistical ComputingNicht zutreffendStatistische Analyse und Visualisierung
Online-Lesbarkeitsrechner von Readability FormulasReadability FormulasNicht zutreffendOnline-Tool zur Berechnung von Lesbarkeitsindizes
Tongyi-Qianwen-ChatplattformTongyi Qianwenhttps://www.tongyi.com/Öffentlich zugängliche Schnittstelle für große Sprachmodelle, die zur Erzeugung von Antworten verwendet wird
Wenxin-Yiyan-ChatplattformWenxin Yiyanhttps://yiyan.baidu.com/Öffentlich zugängliche Schnittstelle für große Sprachmodelle, die zur Erzeugung von Antworten verwendet wird

Referenzen

  1. Headache Classification Committee of the International Headache Society (IHS). The International Classification of Headache Disorders, 3rd edition. Cephalalgia. 2018;38(1):1-211.
  2. Ashina S, et al. Trigeminal neuralgia. Nat Rev Dis Primers. 2024;10(1):39.
  3. Donertas-Ayaz B, Caudle RM. Locus coeruleus-noradrenergic modulation of trigeminal pain: Implications for trigeminal neuralgia and psychiatric comorbidities. Neurobiol Pain. 2023;13:100124.
  4. Martinelli R, et al. Psychological assessment in patients affected by trigeminal neuralgia: A systematic review. Neurosurg Rev. 2025;48(1):414.
  5. Melek LN, et al. Comparison of the neuropathic pain symptoms and psychosocial impacts of trigeminal neuralgia and painful posttraumatic trigeminal neuropathy. J Oral Facial Pain Headache. 2019;33(1):77-88.
  6. Zakrzewska JM, et al. Evaluating the impact of trigeminal neuralgia. Pain. 2017;158(6):1166-1174.
  7. Gambeta E, Chichorro JG, Zamponi GW. Trigeminal neuralgia: An overview from pathophysiology to pharmacological treatments. Mol Pain. 2020;16:1744806920901890.
  8. De Toledo IP, et al. Prevalence of trigeminal neuralgia: A systematic review. J Am Dent Assoc. 2016;147(7):570-576.e2.
  9. Svedung Wettervik T, et al. Incidence of trigeminal neuralgia: A population-based study in central Sweden. Eur J Pain. 2023;27(5):580-587.
  10. Bendtsen L, et al. European Academy of Neurology guideline on trigeminal neuralgia. Eur J Neurol. 2019;26(6):831-849.
  11. Cruccu G, et al. Trigeminal neuralgia: New classification and diagnostic grading for practice and research. Neurology. 2016;87(2):220-228.
  12. Araya EI, et al. Trigeminal neuralgia: Basic and clinical aspects. Curr Neuropharmacol. 2020;18(2):109-119.
  13. Chong MS, Bahra A, Zakrzewska JM. Guidelines for the management of trigeminal neuralgia. Cleve Clin J Med. 2023;90(6):355-362.
  14. Heinskou TB, et al. Favourable prognosis of trigeminal neuralgia when enrolled in a multidisciplinary management program: A two-year prospective real-life study. J Headache Pain. 2019;20(1):23.
  15. Liu S, et al. Comparative evaluation of ChatGPT and Gemini in brain-computer interface patient education: A multidimensional analysis of reliability, accuracy, comprehensibility, and readability. Int J Med Inform. 2026;206:106164.
  16. Forgie EME, et al. Social media and the transformation of the physician-patient relationship: Viewpoint. J Med Internet Res. 2021;23(12):e25230.
  17. Gantenbein L, Navarini AA, Maul LV, Brandt O, Mueller SM. Internet and social media use in dermatology patients: Search behavior and impact on the patient-physician relationship. Dermatol Ther. 2020;33(6):e14098.
  18. Youssef Y, et al. Social media and internet use among orthopedic patients in Germany: A multicenter survey. Front Digit Health. 2025;7:1486296.
  19. De Martino I, et al. Social media for patients: Benefits and drawbacks. Curr Rev Musculoskelet Med. 2017;10(1):141-145.
  20. Johnson KB, et al. Precision medicine, AI, and the future of personalized health care. Clin Transl Sci. 2021;14(1):86-93.
  21. Hirani R, et al. Artificial intelligence and healthcare: A journey through history, present innovations, and future possibilities. Life (Basel). 2024;14(5):557.
  22. Karatas G, Kirik F, Karatas ME, Cakir A, Ozdemir H. Comparative performance of ChatGPT o3-mini-high and DeepSeek-R1 in ophthalmology: An evaluation of diagnostic reasoning and case-based problem solving. J Fr Ophtalmol. 2025;49(1):104712.
  23. Hanci V, et al. Assessment of readability, reliability, and quality of ChatGPT, Bard, Gemini, Copilot, and Perplexity responses on palliative care. Medicine (Baltimore). 2024;103(33):e39305.
  24. Liu C, et al. Potential to perpetuate social biases in health care by Chinese large language models: A model evaluation study. Int J Equity Health. 2025;24(1):206.
  25. Haupt CE, Marks M. AI-generated medical advice—GPT and beyond. JAMA. 2023;329(16):1349-1350.
  26. Aydin S, Karabacak M, Vlachos V, Margetis K. Large language models in patient education: A scoping review of applications in medicine. Front Med (Lausanne). 2024;11:1477898.
  27. Kara M, et al. Evaluating the readability, quality, and reliability of responses generated by ChatGPT, Gemini, and Perplexity on the most commonly asked questions about ankylosing spondylitis. PLoS One. 2025;20(6):e0326351.
  28. Perez Rivera LR, et al. Evaluating the quality and reliability of large language models for plastic surgery patient education: A comparative analysis of ChatGPT and OpenEvidence. Aesthet Surg J. 2025. doi:10.1093/asj/sjaf249.
  29. Wilhelm TI, Roos J, Kaczmarczyk R. Large language models for therapy recommendations across three clinical specialties: Comparative study. J Med Internet Res. 2023;25:e49324.
  30. Will J, et al. Enhancing the readability of online patient education materials using large language models: Cross-sectional study. J Med Internet Res. 2025;27:e69955.
  31. Tukur Jido J, Al-Wizni A, Aung SL. Readability of AI-generated patient information leaflets on Alzheimer's disease, vascular dementia, and delirium. Cureus. 2025;17(6):e85463.
  32. Luo Z, Lin C, Kim TH, Shin YS, Ahn ST. Quality and readability analysis of artificial intelligence-generated medical information related to prostate cancer: A cross-sectional study of ChatGPT and DeepSeek. World J Mens Health. 2025. doi:10.5534/wjmh.250144.
  33. Joseph P, Silva NA, Nanda A, Gupta G. Evaluating the readability of online patient education materials for trigeminal neuralgia. World Neurosurg. 2020;144:e934-e938.
  34. Dong C, et al. Comparative evaluation of large language models in delivering guideline-compliant recommendations for topical NSAID use in musculoskeletal pain: A multidimensional analysis. Clin Rheumatol. 2025;44(11):4703-4710.
  35. Ozduran E, Buyukcoban S. Evaluating the readability, quality, and reliability of online patient education materials on post-COVID pain. PeerJ. 2022;10:e13686.
  36. Wang LW, Miller MJ, Schmitt MR, Wen FK. Assessing readability formula differences with written health information materials: Application, results, and recommendations. Res Social Adm Pharm. 2013;9(5):503-516.
  37. Singh SP, et al. Comprehension profile of patient education materials in endocrine care. Kans J Med. 2022;15(2):247-252.
  38. Marder RS, et al. ChatGPT-3.5 and ChatGPT-4.0 do not reliably create readable patient education materials for common orthopaedic upper- and lower-extremity conditions. Arthrosc Sports Med Rehabil. 2025;7(1):101027.
  39. Nasra M, et al. Can artificial intelligence improve patient educational material readability? A systematic review and narrative synthesis. Intern Med J. 2025;55(1):20-34.
  40. Bhatt C, et al. Evaluating readability, understandability, and actionability of online printable patient education materials for cholesterol management: A systematic review. J Am Heart Assoc. 2024;13(8):e030140.
  41. Avra TD, Le M, Hernandez S, Thure K, Ulloa JG. Readability assessment of online peripheral artery disease education materials. J Vasc Surg. 2022;76(6):1728-1732.
  42. Rooney MK, et al. Readability of patient education materials from high-impact medical journals: A 20-year analysis. J Patient Exp. 2021;8:2374373521998847.
  43. Ahmadzadeh K, et al. Patient education information material assessment criteria: A scoping review. Health Info Libr J. 2023;40(1):3-28.
  44. Duan L, Yao Z, Li X, Wu Y, Sheng D. Comparing large language models and human doctors in symptom-driven online medical consultations: A case study on trigeminal neuralgia. Digit Health. 2025;11:20552076251388140.
  45. Werner C, Harden J, Lawton J. Pathways to a diagnosis of trigeminal neuralgia: A qualitative study of patients' experiences. BMC Prim Care. 2025;26(1):65.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Nachdrucke und Genehmigungen

Tags

Große SprachmodelleLesbarkeitsprüfungpädagogische QualitätPEMAT-EvaluierungGlobal Quality ScoreQualität von GesundheitsinformationenModell-BenchmarkingPatientenverständnis