W niniejszym badaniu systematycznie oceniono wpływ dużych modeli językowych (LLM) oraz różnych kategorii treści edukacji zdrowotnej na czytelność i jakość generowanych tekstów. Po pierwsze, porównano wydajność pięciu modeli LLM — Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen oraz GPT-5 — pod kątem przydatności w edukacji pacjentów, ogólnej jakości informacji oraz wielu wskaźników czytelności, w tym wyniku PEMAT, GQS oraz uznanych indeksów czytelności (ARI, FRES, GFOG, FKGL, CL, SMOG i LW). Po drugie, zbadano te same mierniki wyników w pięciu domenach tematycznych treści edukacji zdrowotnej: podstawowa wiedza o chorobie, etiologia i czynniki ryzyka, diagnostyka, leczenie oraz profilaktyka i rehabilitacja. Poprzez zintegrowanie tych dwóch perspektyw analitycznych, dalej zbadano, w jaki sposób typ modelu i kategoria treści wspólnie wpływają na jakość i czytelność tekstu, identyfikując tym samym systematyczne wzorce w materiałach edukacyjnych dla pacjentów generowanych przez LLM.
Analiza czytelności w różnych dużych modelach językowych
Do systematycznego porównania złożoności językowej tekstów dotyczących neuralgii nerwu trójdzielnego, wygenerowanych przez pięć dużych modeli językowych: Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen oraz GPT-5, wykorzystano siedem uznanych wskaźników czytelności. Ogólne wyniki podsumowano w Tabeli 4, a rozkłady poszczególnych miar czytelności przedstawiono na Rysunku 1A–G. W przypadku wszystkich wskaźników czytelności zaobserwowano statystycznie istotne różnice pomiędzy pięcioma modelami, przy P < 0,001 dla każdego z nich.
GPT-5 wykazywało najwyższe wartości mediany dla wskaźników ARI, GFOG, FKGL, CL i SMOG oraz najniższą wartość FRES, co wskazuje, że generowało teksty o dłuższych strukturach zdań, bardziej złożonym słownictwie i największym ogólnym obciążeniu podczas czytania (Rysunek 1A–G). Z kolei Wenxin Yiyan wykazywało najniższą złożoność językową. Jego wartości mediany ARI, GFOG, FKGL, CL i SMOG były najniższe spośród pięciu modeli, podczas gdy wskaźnik FRES był najwyższy.
Modele Doubao, DeepSeek i Tongyi Qianwen wykazały pośredni poziom czytelności pomiędzy GPT-5 a Wenxin Yiyan. Doubao i DeepSeek wykazały porównywalną wydajność w obrębie wskaźników poziomu edukacyjnego, w tym ARI, GFOG, FKGL i CL, a oba uzyskały znacznie wyższe wartości niż Wenxin Yiyan, przy wszystkich P < 0,05. Wyniki te wskazują na podobne ogólne obciążenie procesem czytania dla Doubao i DeepSeek, przy większej złożoności językowej niż w przypadku Wenxin Yiyan.
Tongyi Qianwen zazwyczaj uzyskiwał wartości pomiędzy wynikami Doubao/DeepSeek a GPT-5 w większości indeksów czytelności. Warto zauważyć, że jego wynik CL był bliższy wynikowi GPT-5, co sugeruje nieco większą złożoność językową niż w przypadku Doubao i DeepSeek, choć nadal mniejszą niż w GPT-5. Indeks LW wykazał wzorzec rozkładu odmienny od pozostałych miar czytelności. Wenxin Yiyan osiągnął najwyższy wynik LW (60.00), a następnie Tongyi Qianwen, DeepSeek i Doubao, podczas gdy GPT-5 uzyskał najniższy wynik LW (46.50). Rozbieżność ta odzwierciedla różnice w sposobie, w jaki poszczególne wzory czytelności przypisują wagi długości zdań i trudności słów (Rysunek 1G).
Ogólnie zaobserwowano istotne różnice w złożoności językowej pomiędzy pięcioma dużymi modelami językowymi. GPT-5 generował teksty o największej złożoności językowej, Wenxin Yiyan tworzył treści najbardziej przystępne, a pozostałe modele wykazywały pośredni poziom czytelności, choć widoczne były różnice strukturalne.
Porównanie przydatności w edukacji pacjentów oraz ogólnej jakości dużych modeli językowych
Zaobserwowano istotne różnice w przydatności do edukacji pacjentów, ocenianej za pomocą PEMAT, pomiędzy pięcioma modelami językowymi (Rysunek 1H; Tabela 4), przy wszystkich P < 0,001. GPT-5 uzyskał najwyższą ocenę PEMAT w ocenie eksperckiej (9,40 ± 1,90), co wskazuje na większą przydatność edukacyjną w ramach zastosowanego schematu porównawczego. Wynik ten nie powinien być jednak interpretowany jako dowód na to, że materiały wygenerowane przez GPT-5 poprawiają rzeczywiste zrozumienie, satysfakcję, zaufanie, zachowania prozdrowotne lub wyniki kliniczne pacjentów.
DeepSeek uzyskał umiarkowany wynik PEMAT (6,80 ± 1,06) przy stosunkowo wąskim rozkładzie wyników, co sugeruje spójną wydajność w generowaniu materiałów edukacyjnych dla pacjentów. Niemniej jednak, jego ogólna przydatność edukacyjna pozostała znacząco niższa niż w przypadku GPT-5 (P < 0,001). Modele Doubao, Tongyi Qianwen i Wenxin Yiyan osiągnęły niższe wyniki PEMAT (odpowiednio 5,35 ± 1,04, 5,65 ± 1,09 i 5,35 ± 0,93). Nie zaobserwowano istotnych różnic między tymi trzema modelami, a wszystkie one wypadły znacząco gorzej niż DeepSeek i GPT-5 (wszystkie P < 0,01). Wyniki te wskazują na porównywalną, lecz ograniczoną przydatność edukacyjną tych modeli, szczególnie w zakresie jasności instrukcji, organizacji językowej i łatwości zrozumienia.
Podobny wzorzec zaobserwowano w przypadku ogólnej jakości informacji, ocenianej za pomocą GQS (Rysunek 1I). Zidentyfikowano statystycznie istotne różnice pomiędzy pięcioma modelami, przy wszystkich P < 0,001. GPT-5 uzyskał najwyższą punktację GQS (4,00 ± 0,65). Jego wyniki koncentrowały się w przedziale 4–5 przy ograniczonej zmienności, co wskazuje na konsekwentnie wysoką wydajność w zakresie spójności treści, kompletności strukturalnej i użyteczności praktycznej.
Kolejno wyniki uzyskały modele DeepSeek oraz Doubao, z wynikiem GQS wynoszącym odpowiednio 3,35 ± 0,59 oraz 3,40 ± 0,50. Rozkłady ich wyników koncentrowały się między 3 a 4, co sugeruje umiarkowaną jakość informacji i rozsądną wiarygodność. W przeciwieństwie do nich, Tongyi Qianwen i Wenxin Yiyan osiągnęły najniższe wyniki GQS (odpowiednio 2,50 ± 0,51 i 2,20 ± 0,52). Ich rozkłady były przesunięte w stronę dolnego końca skali, co wskazuje na ograniczenia w zakresie dokładności informacji, rygoru strukturalnego i głębi treści, co może obniżać ich użyteczność w edukacji pacjentów.
Ogólnie GPT-5 uzyskał najwyższe oceny PEMAT i GQS wystawione przez ekspertów w tym zbiorze danych, podczas gdy DeepSeek i Doubao wykazały średnią wydajność. Tongyi Qianwen i Wenxin Yiyan otrzymały niższe oceny GQS. Wyniki te stanowią wyniki benchmarkingu ocenionego przez ekspertów i nie powinny być interpretowane jako dowód gotowości klinicznej lub skuteczności na poziomie pacjenta.
Porównanie czytelności, przydatności w edukacji pacjentów oraz ogólnej jakości w różnych kategoriach treści edukacji zdrowotnej
Analiza według kategorii treści wykazała istotne różnice w czytelności w obrębie pięciu tematów edukacji zdrowotnej (Tabela 5). W przypadku wskaźnika FRES zaobserwowano statystycznie istotne różnice między kategoriami tematycznymi (P = 0,004). Wyższe wartości FRES wskazują na łatwiejszą czytelność. Teksty dotyczące podstawowej wiedzy o chorobach były najbardziej czytelne (mediana = 28,50), a następnie treści diagnostyczne (mediana = 16,00), treści dotyczące etiologii i czynników ryzyka (mediana = 12,50) oraz treści związane z leczeniem (mediana = 11,50). Z kolei teksty dotyczące profilaktyki i rehabilitacji wykazały najniższą czytelność (mediana FRES = 1,00), co wskazuje na największą trudność w czytaniu.
Podobne wzorce zaobserwowano w przypadku pozostałych indeksów czytelności. Wskaźniki GFOG i FKGL różniły się znacząco pomiędzy kategoriami tematycznymi (P = 0,002 i P = 0,036), przy czym oba indeksy wskazywały na wyższy poziom trudności czytania w treściach dotyczących etiologii i czynników ryzyka oraz profilaktyki i rehabilitacji. Indeks SMOG również sugerował, że teksty dotyczące etiologii i czynników ryzyka zawierały większą proporcję słów wielosylabowych (P = 0,039). Największe różnice odnotowano dla CL (P < 0,001). Teksty dotyczące profilaktyki i rehabilitacji posiadały najdłuższe zdania (mediana = 21,01), co znacząco zwiększało trudność czytania, natomiast teksty zawierające podstawową wiedzę o chorobie miały najkrótsze zdania (mediana = 14,88), co odpowiadało najniższemu obciążeniu podczas czytania. Nie zaobserwowano istotnych różnic między kategoriami treści dla ARI lub LW.
Nie zidentyfikowano statystycznie istotnych różnic w przydatności materiałów do edukacji pacjentów pomiędzy pięcioma kategoriami treści na podstawie wyników PEMAT (P = 0,252). Średnie wyniki PEMAT wahały się od 5,90 do 7,20, co wskazuje, że mimo wyraźnych różnic w złożoności językowej, przydatność edukacyjna pozostała stosunkowo spójna we wszystkich tematach. Podobnie ogólna jakość informacji, oceniana za pomocą GQS, nie różniła się znacząco pomiędzy kategoriami treści (P = 0,822). Średnie wartości GQS mieściły się w przedziale od 2,95 do 3,25, co wskazuje, że ogólna jakość informacji była stosunkowo stabilna we wszystkich tematach treści.
Ogólnie zaobserwowano istotne różnice w czytelności poszczególnych tematów edukacji zdrowotnej; największą trudność w czytaniu wykazały treści dotyczące etiologii i czynników ryzyka oraz treści dotyczące profilaktyki i rehabilitacji, natomiast najbardziej czytelne były treści dotyczące podstawowej wiedzy o chorobie. W przeciwieństwie do tego, odpowiedniość edukacji pacjentów oraz ogólna jakość informacji pozostawały stosunkowo spójne we wszystkich kategoriach treści.
Analiza korelacji między czytelnością, przydatnością w edukacji pacjentów a ogólną jakością
Macierz korelacji na Rysunku 2 wykazuje spójne i silne powiązania między indeksami czytelności, co wskazuje na wysoką spójność wewnętrzną. Większość wskaźników czytelności, w tym ARI, GFOG, FKGL, CL i SMOG, wykazała umiarkowane do silnych korelacje dodatnie ze sobą, przy współczynnikach korelacji w zakresie od 0,64 do 0,97 (wszystkie P < 0,001). Wyniki te dodatkowo potwierdzają komplementarny charakter tych indeksów w ocenie złożoności językowej. W przeciwieństwie do nich, FRES wykazał istotne korelacje ujemne z wieloma wskaźnikami czytelności, w tym z ARI, GFOG, FKGL, CL i SMOG, przy wartościach bezwzględnych współczynników korelacji powyżej 0,70 (wszystkie P < 0,001). Wzorzec ten odzwierciedla odwrotny kierunek punktacji w FRES, gdzie wyższe wyniki oznaczają większą czytelność. Indeks LW również wykazał istotne korelacje ujemne z innymi indeksami czytelności, w tym z ARI, FKGL, GFOG i SMOG, przy wartościach bezwzględnych współczynników korelacji w zakresie od 0,75 do 0,90 (wszystkie P < 0,001). Z kolei LW był dodatnio skorelowany z FRES (współczynnik korelacji = 0,69, P < 0,001).
Zaobserwowano również wyraźne powiązania między wskaźnikami czytelności a ogólną jakością informacji, mierzoną za pomocą GQS. GQS wykazał słabe do umiarkowanych dodatnich korelacje z większością wskaźników czytelności, w tym ARI, GFOG, FKGL, CL oraz SMOG, przy współczynnikach korelacji w zakresie od 0,326 do 0,391 (wszystkie P < 0,001). Wyniki te sugerują, że większa złożoność językowa wiązała się z wyższą jakością informacji w ocenie ekspertów. Odwrotnie, GQS był umiarkowanie ujemnie skorelowany z FRES (współczynnik korelacji = −0,408, P < 0,001), co wskazuje, że teksty wymagające wyższego poziomu umiejętności czytania zazwyczaj otrzymywały wyższe oceny GQS. GQS wykazał również umiarkowaną ujemną korelację z LW (współczynnik korelacji = −0,421, P < 0,001).
Powiązania między czytelnością a przydatnością w edukacji pacjentów, oceniane za pomocą narzędzia PEMAT, były zazwyczaj słabsze, lecz spójne pod względem kierunku. Wyniki PEMAT wykazały słabe korelacje dodatnie z ARI, GFOG, FKGL, CL oraz SMOG, przy współczynnikach korelacji w zakresie od 0,305 do 0,434 (wszystkie P < 0,01). W przeciwieństwie do tego, wyniki PEMAT były słabo skorelowane ujemnie z FRES i LW, przy bezwzględnych współczynnikach korelacji wynoszących odpowiednio 0,432 i 0,320 (oba P < 0,01). Wyniki te sugerują, że w ramach tego zbioru danych większa złożoność językowa wiązała się z umiarkowanie wyższą oceną przydatności edukacyjnej dokonaną przez ekspertów, choć siła tych powiązań była ograniczona.
Co istotne, zaobserwowano umiarkowaną dodatnią korelację między wynikami PEMAT a GQS (współczynnik korelacji = 0,645, P < 0,001). Było to najsilniejsze powiązanie odnotowane pomiędzy domenami oceny, co wskazuje, że odpowiedzi o wyższej przydatności edukacyjnej miały również tendencję do otrzymywania wyższych ocen ogólnej jakości informacji.
DOSTĘPNOŚĆ DANYCH:
Pełny zestaw danych wspierający niniejsze badanie został udostępniony jako materiał uzupełniający. Plik uzupełniający 1 zawiera pełną listę ustandaryzowanych pytań, promptów oraz 100 zarchiwizowanych odpowiedzi wygenerowanych przez LLM. Tabela uzupełniająca 2 zawiera arkusze ocen PEMAT i GQS wypełnione przez ekspertów, w tym oceny PEMAT na poziomie poszczególnych pozycji (jeśli są dostępne), całkowite wyniki PEMAT, wyniki GQS, informacje dotyczące porównania oceniających oraz zapisy rozstrzygnięć w przypadkach spornych. Wyniki czytelności, dane źródłowe do rycin oraz kod analizy w programie R zostały dostarczone jako Plik uzupełniający 2. Ponieważ wyniki generowane przez LLM mogą zmieniać się w czasie ze względu na aktualizacje modeli, zmiany w interfejsie oraz modyfikacje na poziomie platformy, do weryfikacji i analiz wtórnych należy wykorzystywać zarchiwizowane wyniki, a nie odpowiedzi generowane ponownie.

Rysunek 1: Porównanie czytelności, przydatności w edukacji pacjentów oraz ogólnej jakości informacji w pięciu dużych modelach językowych. (A–G) Ten panel przedstawia wskaźniki czytelności: Automated Readability Index (ARI), Flesch Reading Ease Score (FRES), Gunning Fog Index (GFOG), Flesch-Kincaid Grade Level (FKGL), Coleman-Liau Index (CL), Simple Measure of Gobbledygook (SMOG) oraz Linsear Write Formula (LW). (H) Ten panel pokazuje całkowite wyniki PEMAT, a panel (I) przedstawia wyniki Global Quality Scores (GQS). Na każdym wykresie pudełkowym linia środkowa reprezentuje medianę, pudełko wskazuje rozstęp międzykwartylny (IQR), wąsy sięgają do 1,5 × IQR, a punkty poza wąsami reprezentują wartości odstające. Skróty: ARI = Automated Readability Index; FRES = Flesch Reading Ease Score; GFOG = Gunning Fog Index; FKGL = Flesch Kincaid Grade Level; CL = Coleman Liau Index; SMOG = Simple Measure of Gobbledygook; LW = Linsear Write; PEMAT = Patient Education Materials Assessment Tool for Understandability and Actionability, format do druku; Global Quality Score = GQS. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rycina 2: Macierz korelacji Spearmana między wskaźnikami czytelności, przydatnością materiałów edukacyjnych dla pacjentów a ogólną jakością informacji we wszystkich odpowiedziach wygenerowanych przez model. Macierz przedstawia współczynniki korelacji Spearmana dla powiązań parzystych między ARI, FRES, GFOG, FKGL, CL, SMOG, LW, PEMAT i GQS. Skróty: ARI = Automated Readability Index; FRES = Flesch Reading Ease Score; GFOG = Gunning Fog Index; FKGL = Flesch-Kincaid Grade Level; CL = Coleman-Liau Index; SMOG = Simple Measure of Gobbledygook; LW = Linsear Write; PEMAT = Patient Education Materials Assessment Tool; GQS = Global Quality Score. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.
Tabela 1: Lista 20 pytań dotyczących nerwobólu trójdzielnego. Prosimy kliknąć tutaj, aby pobrać ten plik.
Tabela 2: Narzędzia do pomiaru czytelności, wzory i opisy. Kliknij tutaj, aby pobrać ten plik.
Tabela 3: Kryteria jakości Global Quality Score (GQS). Kliknij tutaj, aby pobrać ten plik.
Tabela 4: Wyniki analizy różnych dużych modeli językowych w odniesieniu do najczęstszych pytań dotyczących nerwobólu trójdzielnego. Kliknij tutaj, aby pobrać ten plik.
Tabela 5: Wyniki analizy w różnych wymiarach dla najczęstszych pytań dotyczących nerwobólu twarzy. Prosimy kliknąć tutaj, aby pobrać ten plik.
Tabela uzupełniająca 1: Wyniki czytelności odpowiedzi wygenerowanych przez pięć dużych modeli językowych we wszystkich ocenianych indeksach czytelności.Prosimy kliknąć tutaj, aby pobrać ten plik.
Tabela uzupełniająca 2: Oceny eksperckie przydatności edukacji pacjenta (PEMAT) oraz ogólnej jakości informacji (GQS) dla odpowiedzi wygenerowanych przez pięć dużych modeli językowych. Kliknij tutaj, aby pobrać ten plik.
Plik uzupełniający 1: Zestandaryzowane pytania dotyczące nerwobólu trójdzielnego oraz kompletne odpowiedzi wygenerowane przez pięć dużych modeli językowych. Kliknij tutaj, aby pobrać ten plik.
Plik uzupełniający 2: Skrypty R oraz dane źródłowe wykorzystane do analiz statystycznych i generowania rycin. Aby pobrać ten plik, kliknij tutaj.