Bu çalışma, büyük dil modellerinin (LLM'ler) ve farklı sağlık eğitimi içerik kategorilerinin, üretilen metinlerin okunabilirliği ve kalitesi üzerindeki etkilerini sistematik olarak değerlendirmiştir. İlk olarak; Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen ve GPT-5 olmak üzere beş LLM'in performansını; hasta eğitimi uygunluğu, genel bilgi kalitesi ve PEMAT puanı, GQS ve kabul görmüş okunabilirlik indeksleri (ARI, FRES, GFOG, FKGL, CL, SMOG ve LW) dahil olmak üzere birden fazla okunabilirlik metriği açısından karşılaştırdık. İkinci olarak; temel hastalık bilgisi, etiyoloji ve risk faktörleri, tanı, tedavi ile önleme ve rehabilitasyon olmak üzere beş sağlık eğitimi içerik tematik alanı genelinde aynı sonuç ölçütlerini inceledik. Bu iki analitik perspektifi entegre ederek, model türü ve içerik kategorisinin metin kalitesini ve okunabilirliğini birlikte nasıl etkilediğini daha ayrıntılı olarak araştırdık ve böylece LLM tarafından üretilen hasta eğitimi materyallerindeki sistematik kalıpları belirledik.
Farklı büyük dil modelleri arasında okunabilirlik analizi
Beş büyük dil modeli (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen ve GPT-5) tarafından oluşturulan trigeminal nevralji ile ilgili metinlerin dilbilimsel karmaşıklığını sistematik olarak karşılaştırmak için yedi yerleşik okunabilirlik indeksi kullanılmıştır. Genel sonuçlar Tablo 4'te özetlenmiş ve bireysel okunabilirlik metriklerinin dağılımları Şekil 1A–G'de gösterilmiştir. Beş model arasında tüm okunabilirlik indeksleri için her biri için P < 0.001 olacak şekilde istatistiksel olarak anlamlı farklar gözlemlenmiştir.
GPT-5; ARI, GFOG, FKGL, CL ve SMOG için en yüksek medyan değerlerini ve en düşük FRES değerini sergilemiş olup, bu durum daha uzun cümle yapılarına, daha karmaşık bir kelime dağarcığına ve genel olarak en yüksek okuma yüküne sahip metinler oluşturduğunu göstermektedir (Şekil 1A–G). Buna karşılık, Wenxin Yiyan en düşük dilsel karmaşıklığı göstermiştir. ARI, GFOG, FKGL, CL ve SMOG medyan değerleri beş model arasında en düşük seviyedeyken, FRES değeri en yüksek seviyede çıkmıştır.
Doubao, DeepSeek ve Tongyi Qianwen, GPT-5 ile Wenxin Yiyan arasında orta düzeyde okunabilirlik seviyeleri sergilemiştir. Doubao ve DeepSeek; ARI, GFOG, FKGL ve CL dahil olmak üzere sınıf düzeyi indekslerinde karşılaştırılabilir performanslar göstermiş ve her ikisi de tüm P < 0.05 değerleri ile Wenxin Yiyan'dan anlamlı derecede yüksek değerlere sahip olmuştur. Bu bulgular, Doubao ve DeepSeek için benzer bir genel okuma yükü olduğunu ve her ikisinin de Wenxin Yiyan'dan daha fazla dilsel karmaşıklığa sahip olduğunu göstermektedir.
Tongyi Qianwen, çoğu okunabilirlik indeksi genelinde genellikle Doubao/DeepSeek ile GPT-5 arasındaki değerleri vermiştir. Özellikle, CL skorunun GPT-5'e daha yakın olması, Doubao ve DeepSeek'ten biraz daha yüksek bir dilsel karmaşıklığa sahip olduğunu, ancak yine de GPT-5'ten daha az karmaşık kaldığını göstermektedir. LW indeksi, diğer okunabilirlik metriklerinden farklı bir dağılım örüntüsü sergilemiştir. En yüksek LW skoruna Wenxin Yiyan (60,00) ulaşmış, onu sırasıyla Tongyi Qianwen, DeepSeek ve Doubao izlemiş, GPT-5 ise en düşük LW skoruna (46,50) sahip olmuştur. Bu tutarsızlık, bireysel okunabilirlik formüllerinin cümle uzunluğu ve kelime zorluğunu ağırlıklandırma biçimlerindeki farklılıkları yansıtmaktadır (Şekil 1G).
Genel olarak, beş büyük dil modeli arasında dilsel karmaşıklık açısından önemli farklar gözlemlenmiştir. En karmaşık dilsel metni GPT-5 oluştururken, en okunabilir içeriği Wenxin Yiyan üretmiş; geri kalan modeller ise yapısal farklar belirgin olsa da orta düzeyde okunabilirlik sergilemiştir.
Büyük dil modelleri arasında hasta eğitimi uygunluğunun ve genel kalitenin karşılaştırılması
PEMAT kullanılarak değerlendirilen hasta eğitimi uygunluğunda, beş dil modeli arasında tüm P < 0,001 olacak şekilde anlamlı farklılıklar gözlemlenmiştir (Şekil 1H; Tablo 4). GPT-5, uzmanlar tarafından puanlanan en yüksek PEMAT skoruna (9,40 ± 1,90) ulaşarak mevcut kıyaslama çerçevesinde daha yüksek bir eğitim uygunluğu sergilemiştir. Ancak bu bulgu, GPT-5 tarafından oluşturulan materyallerin gerçek hasta kavrayışını, memnuniyetini, güvenini, sağlık davranışlarını veya klinik sonuçlarını iyileştirdiğine dair bir kanıt olarak yorumlanmamalıdır.
DeepSeek, nispeten dar bir skor dağılımıyla orta düzeyde bir PEMAT skoru (6.80 ± 1.06) elde etmiştir; bu durum, hasta eğitim materyalleri oluşturmada tutarlı bir performans sergilediğini göstermektedir. Buna rağmen, genel eğitim uygunluğu GPT-5'ten anlamlı derecede düşük kalmıştır (P < 0.001). Doubao, Tongyi Qianwen ve Wenxin Yiyan daha düşük PEMAT skorları (sırasıyla 5.35 ± 1.04, 5.65 ± 1.09 ve 5.35 ± 0.93) vermiştir. Bu üç model arasında anlamlı bir fark gözlemlenmemiş olup, tümü DeepSeek ve GPT-5'ten anlamlı derecede daha kötü performans göstermiştir (tümü için P < 0.01). Bu bulgular, özellikle talimat netliği, dilsel organizasyon ve anlaşılabilirlik açısından bu modeller arasında karşılaştırılabilir ancak sınırlı bir eğitim uygunluğu olduğunu göstermektedir.
GQS kullanılarak değerlendirilen genel bilgi kalitesi için de benzer bir örüntü gözlemlenmiştir (Şekil 1I). Beş model arasında, tümü P < 0.001 olan istatistiksel olarak anlamlı farklar tespit edilmiştir. GPT-5 en yüksek GQS puanını (4.00 ± 0.65) elde etmiştir. Puanları, sınırlı bir değişkenlikle 4–5 aralığında yoğunlaşmış olup; bu durum içerik tutarlılığı, yapısal bütünlük ve pratik fayda açısından tutarlı bir şekilde yüksek performans sergilediğini göstermektedir.
Sırasıyla 3,35 ± 0,59 ve 3,40 ± 0,50 GQS puanları ile DeepSeek ve Doubao onları takip etti. Puan dağılımlarının 3 ile 4 arasında yoğunlaşması, orta düzeyde bilgi kalitesine ve makul bir güvenilirliğe işaret etmektedir. Buna karşılık, Tongyi Qianwen ve Wenxin Yiyan en düşük GQS puanlarını (sırasıyla 2,50 ± 0,51 ve 2,20 ± 0,52) elde etti. Bu modellerin dağılımları ölçeğin alt ucuna doğru kaymış olup, hasta eğitimi için kullanışlılıklarını azaltabilecek bilgi doğruluğu, yapısal titizlik ve içerik derinliği konusundaki kısıtlılıkları göstermektedir.
Genel olarak, bu veri setinde GPT-5 uzmanlar tarafından değerlendirilen en yüksek PEMAT ve GQS puanlarını elde ederken, DeepSeek ve Doubao orta düzeyde performans sergilemiştir. Tongyi Qianwen ve Wenxin Yiyan daha düşük GQS puanları almıştır. Bu bulgular, uzmanlar tarafından değerlendirilmiş kıyaslama sonuçlarını temsil etmektedir ve klinik hazırlığın veya hasta düzeyindeki etkinliğin bir kanıtı olarak yorumlanmamalıdır.
Sağlık eğitimi içerik kategorileri arasında okunabilirlik, hasta eğitimi uygunluğu ve genel kalitenin karşılaştırılması
İçerik kategorisine göre yapılan analiz, beş sağlık eğitimi teması arasında okunabilirlik açısından anlamlı farklılıklar olduğunu ortaya koymuştur (Tablo 5). FRES için tematik kategoriler arasında istatistiksel olarak anlamlı farklılıklar gözlemlenmiştir (P = 0.004). Daha yüksek FRES değerleri, okunabilirliğin daha kolay olduğunu gösterir. Temel hastalık bilgisi metinleri en okunabilir olanlardı (medyan = 28.50), bunu sırasıyla tanısal içerik (medyan = 16.00), etiyoloji ve risk faktörü içeriği (medyan = 12.50) ve tedaviyle ilgili içerik (medyan = 11.50) izlemiştir. Buna karşılık, önleme ve rehabilitasyon metinleri en düşük okunabilirliği sergilemiş (medyan FRES = 1.00), bu da en yüksek okuma zorluğuna işaret etmiştir.
Benzer örüntüler diğer okunabilirlik indekslerinde de gözlemlenmiştir. GFOG ve FKGL tematik kategoriler arasında anlamlı farklılıklar göstermiştir (P = 0.002 ve P = 0.036), her iki indeks de etiyoloji ve risk faktörleri ile önleme ve rehabilitasyon içerikleri için daha yüksek okuma seviyelerine işaret etmiştir. SMOG indeksi de benzer şekilde, etiyoloji ve risk faktörü metinlerinin daha yüksek oranda çok heceli kelimeler içerdiğini göstermiştir (P = 0.039). En büyük farklar CL için gözlemlenmiştir (P < 0.001). Önleme ve rehabilitasyon metinleri, okuma zorluğunu önemli ölçüde artıran en uzun cümlelere (medyan = 21.01) sahipken; temel hastalık bilgisi metinleri, en düşük okuma yüküne karşılık gelen en kısa cümlelere (medyan = 14.88) sahipti. ARI veya LW için içerik kategorileri arasında anlamlı bir fark gözlemlenmemiştir.
PEMAT puanlarına göre beş içerik kategorisi arasında hasta eğitimi uygunluğu açısından istatistiksel olarak anlamlı bir fark tespit edilmemiştir (P = 0.252). Ortalama PEMAT puanları 5,90 ile 7,20 arasında değişmiş olup, bu durum dilsel karmaşıklıktaki belirgin farklılıklara rağmen eğitim uygunluğunun temalar genelinde nispeten tutarlı kaldığını göstermektedir. Benzer şekilde, GQS kullanılarak değerlendirilen genel bilgi kalitesi, içerik kategorileri arasında anlamlı bir farklılık göstermemiştir (P = 0.822). Ortalama GQS değerleri 2,95 ile 3,25 arasında değişmiş olup, genel bilgi kalitesinin içerik temaları genelinde nispeten stabil olduğunu göstermiştir.
Genel olarak, sağlık eğitimi temaları arasında okunabilirlik açısından önemli farklılıklar gözlemlenmiş olup; etiyoloji ve risk faktörü içerikleri ile önleme ve rehabilitasyon içerikleri en yüksek okuma zorluğunu sergilerken, temel hastalık bilgisi içerikleri en okunabilir olanlar olarak belirlenmiştir. Buna karşılık, hasta eğitiminin uygunluğu ve bilgilerin genel kalitesi, içerik kategorileri arasında nispeten tutarlı kalmıştır.
Okunabilirlik, hasta eğitimi uygunluğu ve genel kalite arasındaki korelasyon analizi
Şekil 2'deki korelasyon matrisi, okunabilirlik indeksleri arasında tutarlı ve güçlü ilişkiler olduğunu göstermekte ve bu durum güçlü bir iç tutarlılığa işaret etmektedir. ARI, GFOG, FKGL, CL ve SMOG dahil olmak üzere çoğu okunabilirlik metriği, korelasyon katsayıları 0,64 ile 0,97 arasında değişerek (tüm P < 0,001) birbirleriyle orta ila güçlü pozitif korelasyonlar sergilemiştir. Bu bulgular, dilsel karmaşıklığın değerlendirilmesinde bu indekslerin tamamlayıcı doğasını daha da desteklemektedir. Buna karşılık FRES; ARI, GFOG, FKGL, CL ve SMOG dahil olmak üzere birden fazla okunabilirlik metriği ile mutlak korelasyon katsayıları 0,70'den büyük olacak şekilde anlamlı negatif korelasyonlar göstermiştir (tüm P < 0,001). Bu örüntü, daha yüksek puanların daha yüksek okunabilirliğe işaret ettiği FRES'in ters puanlama yönünü yansıtmaktadır. LW indeksi de ARI, FKGL, GFOG ve SMOG dahil olmak üzere diğer okunabilirlik indeksleri ile mutlak korelasyon katsayıları 0,75 ile 0,90 arasında değişen anlamlı negatif korelasyonlar göstermiştir (tüm P < 0,001). Aksine, LW ile FRES arasında pozitif bir korelasyon saptanmıştır (korelasyon katsayısı = 0,69, P < 0,001).
Okunabilirlik indeksleri ile GQS tarafından ölçülen genel bilgi kalitesi arasında da belirgin ilişkiler gözlemlenmiştir. GQS; ARI, GFOG, FKGL, CL ve SMOG dahil olmak üzere çoğu okunabilirlik metriği ile 0,326 ile 0,391 arasında değişen korelasyon katsayılarına sahip, zayıf ila orta düzeyde pozitif korelasyonlar göstermiştir (tüm P < 0,001). Bu bulgular, daha yüksek dilsel karmaşıklığın, uzmanlar tarafından puanlanan daha yüksek bilgi kalitesi ile ilişkili olduğunu göstermektedir. Aksine, GQS ile FRES arasında orta düzeyde negatif bir korelasyon saptanmıştır (korelasyon katsayısı = −0,408, P < 0,001); bu durum, daha yüksek okuma seviyesi gerektiren metinlerin genellikle daha yüksek GQS puanları aldığını göstermektedir. GQS ayrıca LW ile de orta düzeyde negatif bir korelasyon göstermiştir (korelasyon katsayısı = −0,421, P < 0,001).
Okunabilirlik ile PEMAT kullanılarak değerlendirilen hasta eğitimi uygunluğu arasındaki ilişkiler genel olarak daha zayıftı ancak yönsel olarak tutarlıydı. PEMAT skorları; ARI, GFOG, FKGL, CL ve SMOG ile 0,305 ile 0,434 arasında değişen korelasyon katsayılarına sahip zayıf pozitif korelasyonlar göstermiştir (tümü P < 0,01). Buna karşılık, PEMAT skorları FRES ve LW ile sırasıyla 0,432 ve 0,320 mutlak korelasyon katsayılarıyla zayıf negatif korelasyon göstermiştir (her ikisi de P < 0,01). Bu bulgular, söz konusu veri seti dahilinde, ilişkilerin gücü sınırlı olsa da, daha yüksek dilsel karmaşıklığın uzmanlar tarafından değerlendirilen biraz daha yüksek eğitim uygunluğu ile ilişkili olduğunu göstermektedir.
Önemli bir nokta olarak, PEMAT ve GQS skorları arasında orta düzeyde pozitif bir korelasyon gözlemlenmiştir (korelasyon katsayısı = 0.645, P < 0.001). Bu, değerlendirme alanları arasında gözlemlenen en güçlü ilişki olup, eğitim uygunluğu daha yüksek olan yanıtların aynı zamanda daha yüksek genel bilgi kalitesi puanları alma eğiliminde olduğunu göstermektedir.
VERİ ERİŞİLEBİLİRLİĞİ:
Bu çalışmayı destekleyen veri setinin tamamı ek materyal olarak sunulmuştur. Ek Dosya 1, standartlaştırılmış soruların, istemlerin ve arşivlenmiş 100 LLM tarafından oluşturulmuş yanıtın tam listesini içermektedir. Ek Tablo 2; mevcut olan kalem düzeyindeki PEMAT derecelendirmelerini, toplam PEMAT puanlarını, GQS puanlarını, değerlendirici karşılaştırma bilgilerini ve uygun olduğunda hakem kayıtlarını içeren uzman PEMAT ve GQS puanlama çizelgelerini içermektedir. Okunabilirlik puanları, şekil kaynak verileri ve R analiz kodları Ek Dosya 2 olarak sunulmuştur. Model güncellemeleri, arayüz değişiklikleri ve platform düzeyindeki modifikasyonlar nedeniyle LLM çıktıları zamanla değişebileceğinden, doğrulama ve ikincil analizler için yeniden oluşturulan yanıtlar yerine arşivlenmiş çıktılar kullanılmalıdır.

Şekil 1: Beş büyük dil modeli arasında okunabilirlik, hasta eğitimi uygunluğu ve genel bilgi kalitesinin karşılaştırılması.(A–G) Bu panel okunabilirlik indekslerini sunmaktadır: Automated Readability Index (ARI), Flesch Reading Ease Score (FRES), Gunning Fog Index (GFOG), Flesch-Kincaid Grade Level (FKGL), Coleman-Liau Index (CL), Simple Measure of Gobbledygook (SMOG) ve Linsear Write Formula (LW). (H) Bu panel toplam PEMAT skorlarını, panel (I) ise Global Quality Scores (GQS) değerlerini göstermektedir. Her bir kutu grafiğinde, merkez hattı medyanı temsil eder, kutu çeyrekler arası aralığı (IQR) gösterir, bıyıklar 1.5 × IQR'ye kadar uzanır ve bıyıkların ötesindeki noktalar aykırı değerleri temsil eder. Kısaltmalar: ARI = Automated Readability Index; FRES = Flesch Reading Ease Score; GFOG = Gunning Fog Index; FKGL = Flesch Kincaid Grade Level; CL = Coleman Liau Index; SMOG = Simple Measure of Gobbledygook; LW = Linsear Write; PEMAT = Anlaşılabilirlik ve Uygulanabilirlik için Hasta Eğitimi Materyalleri Değerlendirme Aracı, yazdırılabilir format; Global Quality Score = GQS. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 2: Tüm model tarafından oluşturulan yanıtlar genelinde okunabilirlik indeksleri, hasta eğitimi uygunluğu ve genel bilgi kalitesi arasındaki Spearman korelasyon matrisi. Matris; ARI, FRES, GFOG, FKGL, CL, SMOG, LW, PEMAT ve GQS arasındaki ikili ilişkiler için Spearman korelasyon katsayılarını raporlamaktadır. Kısaltmalar: ARI = Automated Readability Index; FRES = Flesch Reading Ease Score; GFOG = Gunning Fog Index; FKGL = Flesch-Kincaid Grade Level; CL = Coleman-Liau Index; SMOG = Simple Measure of Gobbledygook; LW = Linsear Write; PEMAT = Patient Education Materials Assessment Tool; GQS = Global Quality Score. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
Tablo 1: Trigeminal nevralji ile ilgili 20 sorunun listesi. Lütfen bu dosyayı indirmek için buraya tıklayın.
Tablo 2: Okunabilirlik araçları, formülleri ve açıklamaları. Lütfen bu dosyayı indirmek için buraya tıklayın.
Tablo 3: Küresel Kalite Skoru (GQS) kalite kriterleri. Lütfen bu dosyayı indirmek için buraya tıklayın.
Tablo 4: Trigeminal nevralji ile ilgili en yaygın sorular için farklı büyük dil modellerinin analiz sonuçları. Lütfen bu dosyayı indirmek için buraya tıklayın.
Tablo 5: Trigeminal nevralji ile ilgili en yaygın sorular için farklı boyutlar genelindeki analiz sonuçları. Lütfen bu dosyayı indirmek için buraya tıklayın.
Ek Tablo 1: Beş büyük dil modeli tarafından oluşturulan yanıtların değerlendirilen tüm okunabilirlik indeksleri üzerinden okunabilirlik skorları. Bu dosyayı indirmek için lütfen buraya tıklayın.
Ek Tablo 2: Beş büyük dil modeli tarafından oluşturulan yanıtların hasta eğitimi uygunluğuna (PEMAT) ve genel bilgi kalitesine (GQS) ilişkin uzman değerlendirmeleri.Bu dosyayı indirmek için lütfen buraya tıklayın.
Ek Dosya 1: Beş büyük dil modeli tarafından oluşturulan standartlaştırılmış trigeminal nevralji soruları ve tam yanıtlar.Bu dosyayı indirmek için lütfen buraya tıklayın.
Ek Dosya 2: İstatistiksel analizler ve şekillerin oluşturulması için kullanılan R scriptleri ve kaynak veriler. Bu dosyayı indirmek için lütfen buraya tıklayın.