W niniejszym badaniu analizowano wyłącznie tekst wygenerowany przez AI; nie zaangażowano w niego uczestników będących ludźmi, zwierząt, preparatów biologicznych, dokumentacji medycznej, możliwych do zidentyfikowania informacji osobistych ani interwencji w opiece klinicznej. W związku z tym ocena etyczna oraz formalna świadoma zgoda nie były wymagane.
Projekt badania
W niniejszym badaniu przekrojowym oceniono czytelność, jakość i przydatność edukacyjną odpowiedzi generowanych przez pięć modeli LLM na najczęściej zadawane pytania dotyczące TN.
Identyfikacja najczęściej zadawanych pytań dotyczących TN
25 listopada 2025 r. dwóch ekspertów klinicznych z dużym doświadczeniem w leczeniu bólu niezależnie przeanalizowało aktualne wytyczne kliniczne dotyczące nerwobólgu trójdzielnego (TN), w tym Międzynarodową Klasyfikację Zzaburzeń Bólowych Głowy, wydanie 3. (ICHD-3), wytyczne Europejskiej Akademii Neurologii oraz wytyczne Amerykańskiej Akademii Neurologii/Europejskiej Federacji Towarzystw Neurologicznych1,10,11. Po dyskusji konsensusowej opracowali listę 20 pytań związanych z TN, które często pojawiają się w praktyce klinicznej. Liczbę pytań ustalono a priori, aby zapewnić zrównoważony zakres pięciu zdefiniowanych wcześniej obszarów tematycznych, wybierając po cztery pytania dla każdego obszaru, zachowując jednocześnie całkowitą liczbę odpowiedzi generowanych przez model w zakresie umożliwiającym manualną ocenę i weryfikację przez ekspertów. Aby zwiększyć powtarzalność, proces wyboru przebiegał zgodnie z wcześniej zdefiniowaną strukturą opartą na obszarach: eksperci najpierw zidentyfikowali potencjalne pytania w każdym obszarze, niezależnie ocenili ich istotność kliniczną, sformułowanie zorientowane na pacjenta oraz brak redundancji, a następnie osiągnęli konsensus co do końcowych czterech pytań na obszar. Końcowa lista pytań znajduje się w Tabeli 1 oraz Pliku uzupełniającym 1. Pięć zdefiniowanych obszarów tematycznych to podstawowa wiedza o chorobie, etiologia i czynniki ryzyka, diagnostyka, leczenie oraz profilaktyka i rehabilitacja. Ponieważ zestaw pytań nie został opracowany na podstawie dzienników wyszukiwań pacjentów, zapytań w wyszukiwarkach internetowych ani formalnych wywiadów z pacjentami, możliwość wystąpienia błędu selekcji uznaje się za ograniczenie badania.
Modele AI i procedura gromadzenia danych
25 listopada 2025 r. sfinalizowany zestaw 20 pytań związanych z TN przekazano do pięciu publicznie dostępnych platform dużych modeli językowych (LLM): Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen oraz GPT-5/ChatGPT. Do wszystkich modeli uzyskano dostęp poprzez ich standardowe publiczne interfejsy czatu w przeglądarce; nie korzystano z dostępu przez interfejs programistyczny aplikacji (API). W przypadku każdej platformy wykorzystano domyślny publicznie dostępny model aktualny w dacie zbierania danych, bez modyfikacji jakichkolwiek parametrów generowania. Ponieważ publiczne interfejsy internetowe nie wyświetlały identyfikatorów snapshotów modeli backendowych, ukrytych promptów systemowych, temperatury, top-p, maksymalnej liczby tokenów wyjściowych ani innych parametrów generowania, elementy te odnotowano jako „niewidoczne w publicznym interfejsie internetowym”.
Językiem zapytań i odpowiedzi dla wszystkich modeli był język angielski. Każde zestandaryzowane zapytanie składało się wyłącznie z dosłownego pytania w języku angielskim, bez żadnych dodatkowych instrukcji specyficznych dla modelu. Każde pytanie przesyłano indywidualnie w nowej, niezależnej sesji czatu, bez wcześniejszej historii konwersacji, przesłanych plików, wtyczek, spersonalizowanych instrukcji czy zapytań uzupełniających. Pełna lista zestandaryzowanych zapytań oraz odpowiadające im surowe wyniki modeli znajdują się w Pliku uzupełniającym 1. Metadane modeli oraz ustawienia gromadzenia danych podsumowano w Tabeli uzupełniającej 1.
Ocena czytelności
Czytelność odpowiedzi generowanych przez LLM została oceniona przy użyciu wielu uznanych wzorów czytelności dostępnych za pośrednictwem internetowej platformy oceny czytelności (http://readabilityformulas.com/). Ze względu na brak powszechnie akceptowanego złotego standardu oceny czytelności i zgodnie z poprzednimi badaniami, zastosowano kompleksowy zestaw szeroko używanych wskaźników czytelności23,27. Wybrano siedem wskaźników, aby uchwycić komplementarne aspekty czytelności, w tym długość zdania, długość słowa, obciążenie sylabami, złożoność opartą na znakach, łatwość czytania oraz szacowany poziom klasy, co pozwoliło ograniczyć zależność od pojedynczego wzoru. Konkretnie obliczono: wskaźnik Colemana-Liau (CL), wzór Linsear Write (LW), zautomatyzowany wskaźnik czytelności (ARI), prosty pomiar bełkotu (SMOG), wskaźnik Gunning Fog (GFOG), wynik łatwości czytania Flescha (FRES) oraz poziom klasy Flescha-Kincaida (FKGL). Wskaźniki te szacują trudność czytania lub poziom klasy i dostarczają ilościowych miar czytelności tekstu (Tabela 2).
Ocena przydatności edukacyjnej i jakości informacji
Kwalifikację edukacyjną oceniono za pomocą narzędzia Patient Education Materials Assessment Tool (PEMAT), które składa się z dwóch domen: zrozumiałości i możliwości wdrożenia działań28. Narzędzie obejmuje 24 elementy, z czego 16 ocenia zrozumiałość, a osiem ocenia możliwość wdrożenia działań. Każdy element oceniano dychotomicznie (0 = kryterium niespełnione; 1 = kryterium spełnione), co dawało wynik całkowity w zakresie od 0 do 24, gdzie wyższe wyniki wskazywały na większą przydatność do edukacji pacjentów. Ogólną jakość informacji oceniono za pomocą Global Quality Score (GQS)27, szeroko stosowanej pięciostopniowej skali Likerta służącej do oceny jakości informacji medycznych (Tabela 3).
25 listopada 2025 roku dwóch ekspertów klinicznych z ponad 3-letnim doświadczeniem w leczeniu TN oceniło wszystkie odpowiedzi wygenerowane przez AI przy użyciu obu instrumentów oceny. Przed punktacją wszystkie odpowiedzi wygenerowane przez AI zostały zanonimizowane za pomocą kodowych identyfikatorów, a recenzenci nie wiedzieli, z której platformy LLM pochodziły odpowiedzi podczas ocen PEMAT i GQS. Rozbieżności rozstrzygał trzeci, starszy ekspert, który ustalał ostateczne wyniki. Niezawodność między sędziami oceniano za pomocą współczynnika kappa Cohena, gdzie wartości >0,75 oznaczały doskonałą zgodność, 0,40–0,75 oznaczały akceptowalną zgodność, a <0,40 oznaczały słabą zgodność. Wartości kappa Cohena dla PEMAT i GQS przekroczyły 0,75, co wykazało doskonałą niezawodność między sędziami.
Analiza statystyczna
Wszystkie analizy statystyczne przeprowadzono przy użyciu oprogramowania R (wersja 4.4.3). Normalność rozkładu danych oceniono za pomocą testu Shapiro-Wilka oraz wykresów Q-Q. Zmienne o rozkładzie normalnym przedstawiono jako średnia ± odchylenie standardowe i porównano za pomocą jednoczynnikowej analizy wariancji (ANOVA), a następnie, w razie potrzeby, zastosowano test post hoc Tukeya. Zmienne o rozkładzie nienormalnym przedstawiono jako mediany i rozstępy międzykwartylne i porównano za pomocą testu Kruskala-Wallisa, a następnie testu post hoc Dunna z korektą Bonferroniego dla porównań parzystych. Korelacje między wskaźnikami czytelności, wynikami PEMAT i wartościami GQS oceniono za pomocą współczynnika korelacji rang Spearmana, stosując korektę Benjamini-Hochberga dla wielokrotnych testów. Dwustronną skorygowaną wartość P < 0,05 uznano za statystycznie istotną.