Subskrypcja JoVE jest wymagana do oglądania tego materiału. Zaloguj się lub rozpocznij bezpłatny okres próbny.

Artykuł badawczy

Czytelność i jakość edukacji pacjentów z nerwobóla trójdzielnego generowanej przez duże modele językowe: badanie przekrojowe

70 wyświetleń

⸱

DOI:

10.3791/70833

⸱

21 sierpnia 2026

W tym artykule

Podsumowanie

W niniejszej pracy przedstawiamy protokół systematycznej oceny czytelności, przydatności edukacyjnej oraz jakości informacji dla pacjentów na temat nerwoból ósemki, wygenerowanych przez duże modele językowe, w celu przeprowadzenia benchmarkingu modeli oraz optymalizacji komunikacji z pacjentami.

Streszczenie

Duże modele językowe (LLM) są coraz częściej wykorzystywane do edukacji zdrowotnej pacjentów, jednak czytelność i jakość edukacyjna informacji na temat neuralgii trójdzielnej (TN) generowanych przez LLM nie zostały wystarczająco ocenione. Niniejsze przekrojowe badanie porównawcze analizowało treści edukacyjne dotyczące TN wygenerowane przez pięć publicznie dostępnych modeli LLM (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen oraz GPT-5). Każdemu modelowi przedstawiono dwadzieścia często zadawanych pytań dotyczących TN, obejmujących podstawową wiedzę o chorobie, etiologię/czynniki ryzyka, diagnostykę, leczenie oraz profilaktykę/rehabilitację, z wykorzystaniem ustandaryzowanych promptów. Czytelność oceniono za pomocą siedmiu uznanych wskaźników, przydatność edukacyjną za pomocą narzędzia Patient Education Materials Assessment Tool for Understandability and Actionability (PEMAT), a ogólną jakość informacji za pomocą Global Quality Score (GQS). Dwoje ekspertów klinicznych niezależnie oceniło wszystkie odpowiedzi, a rozbieżności rozstrzygał starszy arbiter. Analizy statystyczne porównały wydajność modeli, różnice tematyczne oraz korelacje między metrykami oceny. Zaobserwowano istotne różnice między modelami w zakresie wyników czytelności, PEMAT oraz GQS. Model GPT-5 generował najbardziej złożone językowo odpowiedzi, ale uzyskał najwyższe oceny w kategorii przydatności edukacyjnej i jakości informacji. Z kolei Wenxin Yiyan tworzył najbardziej czytelne teksty, lecz zazwyczaj otrzymywał niższe oceny PEMAT i GQS. Kategoria treści wpływała na czytelność – tematy dotyczące profilaktyki/rehabilitacji oraz etiologii/czynników ryzyka były trudniejsze w odbiorze, podczas gdy wyniki PEMAT i GQS pozostawały stosunkowo spójne w różnych tematach. Wskaźniki czytelności wykazały silną spójność wewnętrzną oraz słabą do umiarkowanej dodatnią korelację z PEMAT i GQS, natomiast PEMAT i GQS wykazały umiarkowaną korelację dodatnią. Wyniki te sugerują, że wybór modelu wpływa na ocenianą przez ekspertów przydatność edukacyjną i ogólną jakość informacji, podczas gdy złożoność tematu wpływa przede wszystkim na czytelność. Ponieważ nie oceniano zrozumienia przez pacjentów, satysfakcji, zaufania, wyników zdrowotnych, dokładności faktów ani bezpieczeństwa klinicznego, wyniki te należy interpretować jako ekspercką analizę porównawczą, a nie jako dowód gotowości do zastosowania w praktyce klinicznej.

Wprowadzenie

Nerwoból trójdzielny (TN) jest zespołem bólu neuropatycznego charakteryzującym się nawracającymi epizodami jednostronnego, krótkotrwałego i niezwykle silnego bólu twarzy, często opisywanego jako przypominający wstrząs elektryczny lub kłucie. Zgodnie z Międzynarodową Klasyfikacją Zespołów Bólowych Głowy, 3. wydanie (ICHD-3), ból jest zazwyczaj zlokalizowany w obszarze unerwienia jednej lub więcej gałęzi nerwu trójdzielnego, często ma nie do zniesienia natężenie i może być wyzwalany przez nieistotne bodźce, takie jak lekki dotyk, mycie twarzy, szczotkowanie zębów, mówienie lub żucie. Napady charakteryzują się nagłym początkiem i gwałtownym ustąpieniem, a ich czas trwania waha się od ułamków sekundy do kilku minut1,2. Chociaż TN zazwyczaj nie zagraża życiu, silny i nieprzewidywalny ból w znacznym stopniu zakłóca podstawowe czynności dnia codziennego, w tym jedzenie, mowę, sen i regulację emocjonalną, co skutkuje znacznym obciążeniem psychospołecznym i obniżeniem jakości życia. Dane z przeglądów systematycznych wskazują, że osoby z TN wykazują znacznie zwiększone ryzyko depresji, lęku i zaburzeń snu w porównaniu z ogółem populacji3,4. W dużych badaniach kohortowych około 35–55% pacjentów z TN wykazuje klinicznie istotne objawy lęku lub depresji, a katastrofizowanie bólu jest powszechne, co sugeruje dwukierunkową interakcję między przewlekłym silnym bólem, bezsennością a zaburzeniami afektywnymi5,6. Szacunki epidemiologiczne wskazują, że zapadalność na TN w ogólnej populacji wynosi od około 0,03% do 0,3%, przy czym częściej występuje u kobiet i osób starszych, z zauważalnymi różnicami w zależności od regionów geograficznych, grup etnicznych i grup wiekowych7,8. W krajach o bardzo dużym zagęszczeniu ludności, takich jak Chiny i Indie, szybkie starzenie się populacji wiąże się z trwałym wzrostem liczby osób cierpiących na TN, co nakłada rosnące obciążenie na systemy opieki zdrowotnej i podkreśla potrzebę opracowania bardziej skutecznych, skalowalnych i opartych na danych podejść do oceny i leczenia tej choroby8,9.

NN można podzielić na podtypy: klasyczny, wtórny i idiopatyczny, przy czym coraz więcej dowodów wskazuje na istotne różnice w mechanizmach etiologicznych i strategiach terapeutycznych między tymi kategoriami1,10. Obecne badania sugerują, że zmiany strukturalne związane z konfliktem naczyniowo-nerwowym w strefie wejścia korzenia nerwu trójdzielnego, nadpobudliwość nerwów obwodowych oraz zaburzona centralna modulacja bólu wspólnie przyczyniają się do patogenezy tej choroby11,12. Wytyczne kliniczne zalecają karbamazepinę i okskarbamazepinę jako leki pierwszego rzutu, natomiast podejścia chirurgiczne lub interwencyjne rozważa się w przypadku nieskuteczności lub słabej tolerancji farmakoterapii10. Mimo tych postępów terapeutycznych, NN charakteryzuje się przebiegiem nawracającym z okresami remisji, a długoterminowe nawroty bólu pozostają częste, co sprawia, że osiągnięcie trwałej remisji jest trudne13. W związku z tym niezbędne jest długoterminowe obserwowanie pacjentów oraz ustrukturyzowane zarządzanie chorobą przewlekłą w celu monitorowania ryzyka nawrotów, odpowiedzi na leczenie i powikłań. Podłużne badania kohortowe wskazują, że przy zastosowaniu znormalizowanych strategii zarządzania (obejmujących leczenie farmakologiczne, interwencję chirurgiczną w razie wskazań oraz kompleksową obserwację), około połowa pacjentów objętych leczeniem zachowawczym może osiągnąć ≥50% redukcji całkowitego obciążenia bólem w ciągu dwóch lat, bez nieuniknionej progresji choroby14. Wyniki te podkreślają znaczenie stałego zaangażowania pacjenta i skutecznej edukacji zdrowotnej w długoterminowym zarządzaniu chorobą. Dowody sugerują, że pacjenci z lepszym zrozumieniem etiologii, patofizjologii i opcji leczenia częściej aktywnie uczestniczą w schematach terapeutycznych i przestrzegają ich, co prowadzi do poprawy wyników15. Jednak tradycyjne metody edukacji zdrowotnej są często ograniczone pod względem zasięgu i skalowalności. Wraz z powszechnym upowszechnieniem internetu, w szczególności platform pytań i odpowiedzi oraz mediów społecznościowych, pacjenci coraz częściej polegają na źródłach cyfrowych w celu pozyskiwania informacji medycznych16,17. Niemniej jednak znaczna zmienność w indywidualnym poziomie kompetencji zdrowotnych oraz zdolności do dostępu, przetwarzania i rozumienia podstawowych informacji zdrowotnych niezbędnych do podejmowania świadomych decyzji stanowi główną barierę dla skutecznej edukacji pacjentów18. Co więcej, nierówna jakość internetowych informacji zdrowotnych, w tym treści niedokładnych lub wprowadzających w błąd, może negatywnie wpływać na decyzje medyczne i dobrostan psychiczny pacjentów19.

Technologie sztucznej inteligencji (AI), a w szczególności gwałtowny rozwój dużych modeli językowych (LLM) w ostatnich latach, stworzyły nowe możliwości w zakresie komunikacji nauk medycznych i edukacji zdrowotnej20. Modele te, trenowane na wielkoskalowych korpusach tekstowych, potrafią generować ustrukturyzowane i logicznie spójne odpowiedzi poprzez interakcję w języku naturalnym21. Reprezentatywne systemy międzynarodowe, takie jak ChatGPT, wykazały obiecujący potencjał w odpowiadaniu na pytania medyczne, konsultacjach pacjentów oraz edukacji medycznej22,23. W Chinach pojawiło się kilka funkcjonalnie podobnych modeli LLM, z stale rosnącą liczbą użytkowników i obszarami zastosowań24. Mimo tych postępów, zastosowanie modeli LLM w upowszechnianiu wiedzy medycznej wciąż napotyka istotne wyzwania, w tym kwestie niezawodności danych treningowych, częstotliwości aktualizacji, naukowej dokładności generowanych odpowiedzi oraz braku walidacji klinicznej25. Ponadto różnice między modelami w stylu językowym, czytelności, strukturze logicznej i dokładności cytowań mogą bezpośrednio wpływać na zrozumienie informacji zdrowotnych przez pacjentów oraz ich zaufanie do nich26. Do tej pory systematyczne oceny wydajności modeli LLM w edukacji zdrowotnej związanej z TN były ograniczone.

W związku z tym celem niniejszego badania była systematyczna ocena i porównanie skuteczności czterech powszechnie stosowanych chińskich modeli LLM (Doubao, DeepSeek, Wenxin Yiyan i Tongyi Qianwen) oraz reprezentatywnego międzynarodowego modelu LLM (ChatGPT) w odpowiadaniu na pytania dotyczące edukacji pacjentów w zakresie TN. Wykorzystując projekt przekrojowy, opracowaliśmy zestaw pytań dotyczących TN w oparciu o wytyczne kliniczne i typowe wątpliwości pacjentów, a następnie oceniliśmy odpowiedzi wygenerowane przez pięć publicznie dostępnych modeli LLM (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen i GPT-5). Czytelność oceniano przy użyciu wielu wskaźników, natomiast zrozumiałość i możliwość wdrożenia zaleceń oceniano za pomocą narzędzia Patient Education Materials Assessment Tool (PEMAT). Ogólną jakość informacji oceniano za pomocą Global Quality Score (GQS). Ponadto przeanalizowano, w jaki sposób różne tematy edukacji zdrowotnej wpływają na te wskaźniki oceny oraz jakie są zależności między nimi, z целью dostarczenia opartych na dowodach wytycznych dotyczących wyboru i optymalizacji modeli LLM w klinicznej komunikacji zdrowotnej.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

W niniejszym badaniu analizowano wyłącznie tekst wygenerowany przez AI; nie zaangażowano w niego uczestników będących ludźmi, zwierząt, preparatów biologicznych, dokumentacji medycznej, możliwych do zidentyfikowania informacji osobistych ani interwencji w opiece klinicznej. W związku z tym ocena etyczna oraz formalna świadoma zgoda nie były wymagane.

Projekt badania

W niniejszym badaniu przekrojowym oceniono czytelność, jakość i przydatność edukacyjną odpowiedzi generowanych przez pięć modeli LLM na najczęściej zadawane pytania dotyczące TN.

Identyfikacja najczęściej zadawanych pytań dotyczących TN

25 listopada 2025 r. dwóch ekspertów klinicznych z dużym doświadczeniem w leczeniu bólu niezależnie przeanalizowało aktualne wytyczne kliniczne dotyczące nerwobólgu trójdzielnego (TN), w tym Międzynarodową Klasyfikację Zzaburzeń Bólowych Głowy, wydanie 3. (ICHD-3), wytyczne Europejskiej Akademii Neurologii oraz wytyczne Amerykańskiej Akademii Neurologii/Europejskiej Federacji Towarzystw Neurologicznych1,10,11. Po dyskusji konsensusowej opracowali listę 20 pytań związanych z TN, które często pojawiają się w praktyce klinicznej. Liczbę pytań ustalono a priori, aby zapewnić zrównoważony zakres pięciu zdefiniowanych wcześniej obszarów tematycznych, wybierając po cztery pytania dla każdego obszaru, zachowując jednocześnie całkowitą liczbę odpowiedzi generowanych przez model w zakresie umożliwiającym manualną ocenę i weryfikację przez ekspertów. Aby zwiększyć powtarzalność, proces wyboru przebiegał zgodnie z wcześniej zdefiniowaną strukturą opartą na obszarach: eksperci najpierw zidentyfikowali potencjalne pytania w każdym obszarze, niezależnie ocenili ich istotność kliniczną, sformułowanie zorientowane na pacjenta oraz brak redundancji, a następnie osiągnęli konsensus co do końcowych czterech pytań na obszar. Końcowa lista pytań znajduje się w Tabeli 1 oraz Pliku uzupełniającym 1. Pięć zdefiniowanych obszarów tematycznych to podstawowa wiedza o chorobie, etiologia i czynniki ryzyka, diagnostyka, leczenie oraz profilaktyka i rehabilitacja. Ponieważ zestaw pytań nie został opracowany na podstawie dzienników wyszukiwań pacjentów, zapytań w wyszukiwarkach internetowych ani formalnych wywiadów z pacjentami, możliwość wystąpienia błędu selekcji uznaje się za ograniczenie badania.

Modele AI i procedura gromadzenia danych

25 listopada 2025 r. sfinalizowany zestaw 20 pytań związanych z TN przekazano do pięciu publicznie dostępnych platform dużych modeli językowych (LLM): Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen oraz GPT-5/ChatGPT. Do wszystkich modeli uzyskano dostęp poprzez ich standardowe publiczne interfejsy czatu w przeglądarce; nie korzystano z dostępu przez interfejs programistyczny aplikacji (API). W przypadku każdej platformy wykorzystano domyślny publicznie dostępny model aktualny w dacie zbierania danych, bez modyfikacji jakichkolwiek parametrów generowania. Ponieważ publiczne interfejsy internetowe nie wyświetlały identyfikatorów snapshotów modeli backendowych, ukrytych promptów systemowych, temperatury, top-p, maksymalnej liczby tokenów wyjściowych ani innych parametrów generowania, elementy te odnotowano jako „niewidoczne w publicznym interfejsie internetowym”.

Językiem zapytań i odpowiedzi dla wszystkich modeli był język angielski. Każde zestandaryzowane zapytanie składało się wyłącznie z dosłownego pytania w języku angielskim, bez żadnych dodatkowych instrukcji specyficznych dla modelu. Każde pytanie przesyłano indywidualnie w nowej, niezależnej sesji czatu, bez wcześniejszej historii konwersacji, przesłanych plików, wtyczek, spersonalizowanych instrukcji czy zapytań uzupełniających. Pełna lista zestandaryzowanych zapytań oraz odpowiadające im surowe wyniki modeli znajdują się w Pliku uzupełniającym 1. Metadane modeli oraz ustawienia gromadzenia danych podsumowano w Tabeli uzupełniającej 1.

Ocena czytelności

Czytelność odpowiedzi generowanych przez LLM została oceniona przy użyciu wielu uznanych wzorów czytelności dostępnych za pośrednictwem internetowej platformy oceny czytelności (http://readabilityformulas.com/). Ze względu na brak powszechnie akceptowanego złotego standardu oceny czytelności i zgodnie z poprzednimi badaniami, zastosowano kompleksowy zestaw szeroko używanych wskaźników czytelności23,27. Wybrano siedem wskaźników, aby uchwycić komplementarne aspekty czytelności, w tym długość zdania, długość słowa, obciążenie sylabami, złożoność opartą na znakach, łatwość czytania oraz szacowany poziom klasy, co pozwoliło ograniczyć zależność od pojedynczego wzoru. Konkretnie obliczono: wskaźnik Colemana-Liau (CL), wzór Linsear Write (LW), zautomatyzowany wskaźnik czytelności (ARI), prosty pomiar bełkotu (SMOG), wskaźnik Gunning Fog (GFOG), wynik łatwości czytania Flescha (FRES) oraz poziom klasy Flescha-Kincaida (FKGL). Wskaźniki te szacują trudność czytania lub poziom klasy i dostarczają ilościowych miar czytelności tekstu (Tabela 2).

Ocena przydatności edukacyjnej i jakości informacji

Kwalifikację edukacyjną oceniono za pomocą narzędzia Patient Education Materials Assessment Tool (PEMAT), które składa się z dwóch domen: zrozumiałości i możliwości wdrożenia działań28. Narzędzie obejmuje 24 elementy, z czego 16 ocenia zrozumiałość, a osiem ocenia możliwość wdrożenia działań. Każdy element oceniano dychotomicznie (0 = kryterium niespełnione; 1 = kryterium spełnione), co dawało wynik całkowity w zakresie od 0 do 24, gdzie wyższe wyniki wskazywały na większą przydatność do edukacji pacjentów. Ogólną jakość informacji oceniono za pomocą Global Quality Score (GQS)27, szeroko stosowanej pięciostopniowej skali Likerta służącej do oceny jakości informacji medycznych (Tabela 3).

25 listopada 2025 roku dwóch ekspertów klinicznych z ponad 3-letnim doświadczeniem w leczeniu TN oceniło wszystkie odpowiedzi wygenerowane przez AI przy użyciu obu instrumentów oceny. Przed punktacją wszystkie odpowiedzi wygenerowane przez AI zostały zanonimizowane za pomocą kodowych identyfikatorów, a recenzenci nie wiedzieli, z której platformy LLM pochodziły odpowiedzi podczas ocen PEMAT i GQS. Rozbieżności rozstrzygał trzeci, starszy ekspert, który ustalał ostateczne wyniki. Niezawodność między sędziami oceniano za pomocą współczynnika kappa Cohena, gdzie wartości >0,75 oznaczały doskonałą zgodność, 0,40–0,75 oznaczały akceptowalną zgodność, a <0,40 oznaczały słabą zgodność. Wartości kappa Cohena dla PEMAT i GQS przekroczyły 0,75, co wykazało doskonałą niezawodność między sędziami.

Analiza statystyczna

Wszystkie analizy statystyczne przeprowadzono przy użyciu oprogramowania R (wersja 4.4.3). Normalność rozkładu danych oceniono za pomocą testu Shapiro-Wilka oraz wykresów Q-Q. Zmienne o rozkładzie normalnym przedstawiono jako średnia ± odchylenie standardowe i porównano za pomocą jednoczynnikowej analizy wariancji (ANOVA), a następnie, w razie potrzeby, zastosowano test post hoc Tukeya. Zmienne o rozkładzie nienormalnym przedstawiono jako mediany i rozstępy międzykwartylne i porównano za pomocą testu Kruskala-Wallisa, a następnie testu post hoc Dunna z korektą Bonferroniego dla porównań parzystych. Korelacje między wskaźnikami czytelności, wynikami PEMAT i wartościami GQS oceniono za pomocą współczynnika korelacji rang Spearmana, stosując korektę Benjamini-Hochberga dla wielokrotnych testów. Dwustronną skorygowaną wartość P < 0,05 uznano za statystycznie istotną.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

W niniejszym badaniu systematycznie oceniono wpływ dużych modeli językowych (LLM) oraz różnych kategorii treści edukacji zdrowotnej na czytelność i jakość generowanych tekstów. Po pierwsze, porównano wydajność pięciu modeli LLM — Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen oraz GPT-5 — pod kątem przydatności w edukacji pacjentów, ogólnej jakości informacji oraz wielu wskaźników czytelności, w tym wyniku PEMAT, GQS oraz uznanych indeksów czytelności (ARI, FRES, GFOG, FKGL, CL, SMOG i LW). Po drugie, zbadano te same mie...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Niniejsze przekrojowe badanie benchmarkingowe systematycznie porównało czytelność, przydatność edukacyjną oraz ogólną jakość informacji zawartych w materiałach edukacyjnych dla pacjentów z nerwobólem trójdzielnym (TN), wygenerowanych przez pięć publicznie dostępnych dużych modeli językowych (LLM). Sformułowano cztery główne wnioski. Po pierwsze, czytelność znacząco różniła się w zależności od modelu – GPT-5 generował odpowiedzi najbardziej złożone językowo, natomiast Wenxin Yiyan tworzył treści najbardziej czytelne. Po d...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Autorzy oświadczają, że nie mają żadnych konfliktów interesów.

Podziękowania

Niniejsze badanie nie otrzymało żadnego konkretnego grantu z żadnej instytucji finansującej w sektorze publicznym, komercyjnym ani non-profit. Autorzy dziękują współpracownikom klinicznym, którzy przekazali uwagi do zestawu pytań dotyczących nerwobólu trójdzielnego i pomogli w dopracowaniu ram oceny. Dziękujemy również wszystkim osobom wspierającym przygotowanie i redakcję manuskryptu.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Platforma czatu DeepSeekDeepSeekhttps://chat.deepseek.com/Publicznie dostępny interfejs dużego modelu językowego służący do generowania odpowiedzi
Platforma czatu DoubaoDoubaohttps://www.doubao.com/chat/Publicznie dostępny interfejs dużego modelu językowego służący do generowania odpowiedzi
GPT 5 OpenAIhttps://chat.openai.com/Publicznie dostępny interfejs dużego modelu językowego służący do generowania odpowiedzi
Oprogramowanie R, wersja 4.4.3R Foundation for Statistical ComputingNie dotyczyAnaliza statystyczna i wizualizacja
Kalkulator czytelności online Readability FormulasReadability FormulasNie dotyczyNarzędzie online służące do obliczania wskaźników czytelności
Platforma czatu Tongyi QianwenTongyi Qianwenhttps://www.tongyi.com/Publicznie dostępny interfejs dużego modelu językowego służący do generowania odpowiedzi
Platforma czatu Wenxin YiyanWenxin Yiyanhttps://yiyan.baidu.com/Publicznie dostępny interfejs dużego modelu językowego służący do generowania odpowiedzi

Bibliografia

  1. Headache Classification Committee of the International Headache Society (IHS). The International Classification of Headache Disorders, 3rd edition. Cephalalgia. 2018;38(1):1-211.
  2. Ashina S, et al. Trigeminal neuralgia. Nat Rev Dis Primers. 2024;10(1):39.
  3. Donertas-Ayaz B, Caudle RM. Locus coeruleus-noradrenergic modulation of trigeminal pain: Implications for trigeminal neuralgia and psychiatric comorbidities. Neurobiol Pain. 2023;13:100124.
  4. Martinelli R, et al. Psychological assessment in patients affected by trigeminal neuralgia: A systematic review. Neurosurg Rev. 2025;48(1):414.
  5. Melek LN, et al. Comparison of the neuropathic pain symptoms and psychosocial impacts of trigeminal neuralgia and painful posttraumatic trigeminal neuropathy. J Oral Facial Pain Headache. 2019;33(1):77-88.
  6. Zakrzewska JM, et al. Evaluating the impact of trigeminal neuralgia. Pain. 2017;158(6):1166-1174.
  7. Gambeta E, Chichorro JG, Zamponi GW. Trigeminal neuralgia: An overview from pathophysiology to pharmacological treatments. Mol Pain. 2020;16:1744806920901890.
  8. De Toledo IP, et al. Prevalence of trigeminal neuralgia: A systematic review. J Am Dent Assoc. 2016;147(7):570-576.e2.
  9. Svedung Wettervik T, et al. Incidence of trigeminal neuralgia: A population-based study in central Sweden. Eur J Pain. 2023;27(5):580-587.
  10. Bendtsen L, et al. European Academy of Neurology guideline on trigeminal neuralgia. Eur J Neurol. 2019;26(6):831-849.
  11. Cruccu G, et al. Trigeminal neuralgia: New classification and diagnostic grading for practice and research. Neurology. 2016;87(2):220-228.
  12. Araya EI, et al. Trigeminal neuralgia: Basic and clinical aspects. Curr Neuropharmacol. 2020;18(2):109-119.
  13. Chong MS, Bahra A, Zakrzewska JM. Guidelines for the management of trigeminal neuralgia. Cleve Clin J Med. 2023;90(6):355-362.
  14. Heinskou TB, et al. Favourable prognosis of trigeminal neuralgia when enrolled in a multidisciplinary management program: A two-year prospective real-life study. J Headache Pain. 2019;20(1):23.
  15. Liu S, et al. Comparative evaluation of ChatGPT and Gemini in brain-computer interface patient education: A multidimensional analysis of reliability, accuracy, comprehensibility, and readability. Int J Med Inform. 2026;206:106164.
  16. Forgie EME, et al. Social media and the transformation of the physician-patient relationship: Viewpoint. J Med Internet Res. 2021;23(12):e25230.
  17. Gantenbein L, Navarini AA, Maul LV, Brandt O, Mueller SM. Internet and social media use in dermatology patients: Search behavior and impact on the patient-physician relationship. Dermatol Ther. 2020;33(6):e14098.
  18. Youssef Y, et al. Social media and internet use among orthopedic patients in Germany: A multicenter survey. Front Digit Health. 2025;7:1486296.
  19. De Martino I, et al. Social media for patients: Benefits and drawbacks. Curr Rev Musculoskelet Med. 2017;10(1):141-145.
  20. Johnson KB, et al. Precision medicine, AI, and the future of personalized health care. Clin Transl Sci. 2021;14(1):86-93.
  21. Hirani R, et al. Artificial intelligence and healthcare: A journey through history, present innovations, and future possibilities. Life (Basel). 2024;14(5):557.
  22. Karatas G, Kirik F, Karatas ME, Cakir A, Ozdemir H. Comparative performance of ChatGPT o3-mini-high and DeepSeek-R1 in ophthalmology: An evaluation of diagnostic reasoning and case-based problem solving. J Fr Ophtalmol. 2025;49(1):104712.
  23. Hanci V, et al. Assessment of readability, reliability, and quality of ChatGPT, Bard, Gemini, Copilot, and Perplexity responses on palliative care. Medicine (Baltimore). 2024;103(33):e39305.
  24. Liu C, et al. Potential to perpetuate social biases in health care by Chinese large language models: A model evaluation study. Int J Equity Health. 2025;24(1):206.
  25. Haupt CE, Marks M. AI-generated medical advice—GPT and beyond. JAMA. 2023;329(16):1349-1350.
  26. Aydin S, Karabacak M, Vlachos V, Margetis K. Large language models in patient education: A scoping review of applications in medicine. Front Med (Lausanne). 2024;11:1477898.
  27. Kara M, et al. Evaluating the readability, quality, and reliability of responses generated by ChatGPT, Gemini, and Perplexity on the most commonly asked questions about ankylosing spondylitis. PLoS One. 2025;20(6):e0326351.
  28. Perez Rivera LR, et al. Evaluating the quality and reliability of large language models for plastic surgery patient education: A comparative analysis of ChatGPT and OpenEvidence. Aesthet Surg J. 2025. doi:10.1093/asj/sjaf249.
  29. Wilhelm TI, Roos J, Kaczmarczyk R. Large language models for therapy recommendations across three clinical specialties: Comparative study. J Med Internet Res. 2023;25:e49324.
  30. Will J, et al. Enhancing the readability of online patient education materials using large language models: Cross-sectional study. J Med Internet Res. 2025;27:e69955.
  31. Tukur Jido J, Al-Wizni A, Aung SL. Readability of AI-generated patient information leaflets on Alzheimer's disease, vascular dementia, and delirium. Cureus. 2025;17(6):e85463.
  32. Luo Z, Lin C, Kim TH, Shin YS, Ahn ST. Quality and readability analysis of artificial intelligence-generated medical information related to prostate cancer: A cross-sectional study of ChatGPT and DeepSeek. World J Mens Health. 2025. doi:10.5534/wjmh.250144.
  33. Joseph P, Silva NA, Nanda A, Gupta G. Evaluating the readability of online patient education materials for trigeminal neuralgia. World Neurosurg. 2020;144:e934-e938.
  34. Dong C, et al. Comparative evaluation of large language models in delivering guideline-compliant recommendations for topical NSAID use in musculoskeletal pain: A multidimensional analysis. Clin Rheumatol. 2025;44(11):4703-4710.
  35. Ozduran E, Buyukcoban S. Evaluating the readability, quality, and reliability of online patient education materials on post-COVID pain. PeerJ. 2022;10:e13686.
  36. Wang LW, Miller MJ, Schmitt MR, Wen FK. Assessing readability formula differences with written health information materials: Application, results, and recommendations. Res Social Adm Pharm. 2013;9(5):503-516.
  37. Singh SP, et al. Comprehension profile of patient education materials in endocrine care. Kans J Med. 2022;15(2):247-252.
  38. Marder RS, et al. ChatGPT-3.5 and ChatGPT-4.0 do not reliably create readable patient education materials for common orthopaedic upper- and lower-extremity conditions. Arthrosc Sports Med Rehabil. 2025;7(1):101027.
  39. Nasra M, et al. Can artificial intelligence improve patient educational material readability? A systematic review and narrative synthesis. Intern Med J. 2025;55(1):20-34.
  40. Bhatt C, et al. Evaluating readability, understandability, and actionability of online printable patient education materials for cholesterol management: A systematic review. J Am Heart Assoc. 2024;13(8):e030140.
  41. Avra TD, Le M, Hernandez S, Thure K, Ulloa JG. Readability assessment of online peripheral artery disease education materials. J Vasc Surg. 2022;76(6):1728-1732.
  42. Rooney MK, et al. Readability of patient education materials from high-impact medical journals: A 20-year analysis. J Patient Exp. 2021;8:2374373521998847.
  43. Ahmadzadeh K, et al. Patient education information material assessment criteria: A scoping review. Health Info Libr J. 2023;40(1):3-28.
  44. Duan L, Yao Z, Li X, Wu Y, Sheng D. Comparing large language models and human doctors in symptom-driven online medical consultations: A case study on trigeminal neuralgia. Digit Health. 2025;11:20552076251388140.
  45. Werner C, Harden J, Lawton J. Pathways to a diagnosis of trigeminal neuralgia: A qualitative study of patients' experiences. BMC Prim Care. 2025;26(1):65.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Tagi

Duże modele językoweocena czytelnościjakość edukacyjnaocena PEMATglobalna ocena jakości (GQS)jakość informacji zdrowotnychbenchmarking modelizrozumienie pacjenta