Araştırma makalesi

Trigeminal Nevralji için Büyük Dil Modeli Hasta Eğitiminin Okunabilirliği ve Kalitesi: Kesitsel Bir Çalışma

36 görüntüleme

DOI:

10.3791/70833

21 Ağustos 2026

Bu makalede

Özet

Burada, modelleri kıyaslamak ve hastaya yönelik iletişimi yönlendirmek amacıyla, büyük dil modelleri tarafından oluşturulan trigeminal nevralji hakkındaki hasta bilgilendirmelerinin okunabilirliğini, eğitimsel uygunluğunu ve kalitesini sistematik olarak değerlendirmek için bir protokol sunuyoruz.

Özet

Büyük dil modelleri (LLM'ler) hasta sağlık eğitimi için giderek daha fazla kullanılmaktadır, ancak trigeminal nevralji (TN) hakkında LLM tarafından oluşturulan bilgilerin okunabilirliği ve eğitim kalitesi yetersiz şekilde değerlendirilmiştir. Bu kesitsel kıyaslama çalışması, halka açık beş LLM (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen ve GPT-5) tarafından oluşturulan TN eğitim içeriklerini karşılaştırmıştır. Temel hastalık bilgisi, etiyoloji/risk faktörleri, tanı, tedavi ve önleme/rehabilitasyonu kapsayan, sıkça sorulan yirmi TN sorusu, standart istemler kullanılarak her bir modele sunulmuştur. Okunabilirlik yedi yerleşik indeksle, eğitim uygunluğu Anlaşılırlık ve Uygulanabilirlik için Hasta Eğitim Materyalleri Değerlendirme Aracı (PEMAT) ile ve genel bilgi kalitesi Küresel Kalite Puanı (GQS) kullanılarak değerlendirilmiştir. Tüm yanıtlar iki klinik uzman tarafından bağımsız olarak değerlendirilmiş ve uyuşmazlıklar kıdemli bir hakem tarafından çözülmüştür. İstatistiksel analizler, model performansını, tematik farklılıkları ve değerlendirme metrikleri arasındaki korelasyonları karşılaştırmıştır. Okunabilirlik, PEMAT ve GQS puanları açısından modeller arasında anlamlı farklılıklar gözlemlenmiştir. GPT-5 dilsel olarak en karmaşık yanıtları oluşturmuş ancak eğitim uygunluğu ve bilgi kalitesi açısından en yüksek puanları almıştır. Buna karşılık, Wenxin Yiyan en okunabilir metni üretmiş ancak genel olarak PEMAT ve GQS'de daha düşük puanlar almıştır. İçerik kategorisi okunabilirliği etkilemiş; önleme/rehabilitasyon ve etiyoloji/risk faktörü konularının okunması daha zor olurken, PEMAT ve GQS temalar arasında nispeten tutarlı kalmıştır. Okunabilirlik indeksleri güçlü bir iç tutarlılık ve PEMAT ile GQS ile zayıf ila orta derecede pozitif korelasyonlar gösterirken, PEMAT ve GQS orta derecede pozitif bir korelasyon sergilemiştir. Bu bulgular, model seçiminin uzmanlarca puanlanan eğitim uygunluğunu ve genel bilgi kalitesini etkilediğini, konu karmaşıklığının ise öncelikle okunabilirliği etkilediğini göstermektedir. Hasta kavrayışı, memnuniyeti, güveni, sağlık sonuçları, olgusal doğruluk ve klinik güvenlik değerlendirilmediğinden, bu sonuçlar klinik hazır oluş kanıtından ziyade uzmanlarca puanlanmış bir kıyaslama analizi olarak yorumlanmalıdır.

Giriş

Trigeminal nevralji (TN), genellikle elektrik çarpmasına benzer veya saplanma şeklinde tarif edilen, tekrarlayan, tek taraflı, kısa süreli ve aşırı şiddetli yüz ağrıları ile karakterize nöropatik bir ağrı sendromudur. Uluslararası Baş Ağrısı Bozuklukları Sınıflandırması 3. baskıya (ICHD-3) göre ağrı tipik olarak trigeminal sinirin bir veya daha fazla dalının dağılım alanıyla sınırlıdır, şiddeti genellikle dayanılmazdır ve hafif dokunuş, yüz yıkama, diş fırçalama, konuşma veya çiğneme gibi zararsız uyaranlarla tetiklenebilir. Ataklar, saniyenin küçük kesirlerinden birkaç dakikaya kadar değişen sürelerde, ani başlangıç ve aniden sona erme ile seyretmektedir1,2. TN genellikle yaşamı tehdit etmese de, şiddetli ve öngörülemez ağrıları; yemek yeme, konuşma, uyku ve duygusal düzenleme dahil olmak üzere temel günlük aktiviteleri önemli ölçüde bozarak ciddi bir psikososyal yüke ve yaşam kalitesinin düşmesine neden olur. Sistematik incelemelerden elde edilen kanıtlar, TN'li bireylerin genel popülasyona kıyasla depresyon, anksiyete ve uyku bozuklukları açısından önemli ölçüde daha yüksek risk altında olduğunu göstermektedir3,4. Geniş kohort çalışmalarında, TN hastalarının yaklaşık %35–55'i klinik olarak anlamlı anksiyete veya depresyon semptomları göstermekte ve ağrı katastrofize etme durumu oldukça yaygındır; bu da kronik şiddetli ağrı, insomni ve afektif bozukluklar arasında çift yönlü bir etkileşim olduğunu düşündürmektedir5,6. Epidemiyolojik tahminler, genel popülasyonda TN prevalansının yaklaşık %0,03 ile %0,3 arasında değiştiğini, kadınlarda ve yaşlı yetişkinlerde görülme oranının daha yüksek olduğunu ve coğrafi bölgeler, etnik gruplar ile yaş katmanları arasında belirgin farklılıklar olduğunu göstermektedir7,8. Çin ve Hindistan gibi nüfusun yoğun olduğu ülkelerde, hızlı nüfus yaşlanmasına TN'den etkilenen birey sayısındaki sürekli bir artış eşlik etmiş; bu durum sağlık sistemleri üzerinde artan bir yük oluşturmuş ve hastalık değerlendirmesi ile yönetimi için daha etkili, ölçeklenebilir ve veri odaklı yaklaşımlara duyulan ihtiyacı vurgulamıştır8,9.

TN; klasik, sekonder ve idiyopatik alt tiplere ayrılabilir ve artan kanıtlar, bu kategoriler arasında etiyolojik mekanizmalar ve terapötik stratejiler açısından önemli farklılıklar olduğunu göstermektedir1,10. Güncel çalışmalar; trigeminal sinir kök giriş bölgesindeki nörovasküler konfliğe bağlı yapısal değişikliklerin, periferik sinir hipereksitabilitesinin ve değişmiş merkezi ağrı modülasyonunun hastalığın patogenezine ortaklaşa katkıda bulunduğunu öne sürmektedir11,12. Klinik kılavuzlar, birinci basamak tedaviler olarak karbamazepin ve okskarbazepini önermekte, farmakolojik tedavinin etkisiz olduğu veya kötü tolere edildiği durumlarda ise cerrahi veya girişimsel yaklaşımlar değerlendirilmektedir10. Bu terapötik gelişmelere rağmen TN, relaps-remisyon seyri ile karakterizedir ve uzun vadeli ağrı nüksleri yaygın kalmaya devam etmekte, bu da kalıcı remisyonun elde edilmesini zorlaştırmaktadır13. Sonuç olarak, nüks riskinin, tedavi yanıtının ve komplikasyonların izlenmesi için uzun süreli takip ve yapılandırılmış kronik hastalık yönetimi esastır. Boylamsal kohort çalışmaları; standardize yönetim stratejileri altında (farmakolojik tedavi, endike olduğunda cerrahi müdahale ve kapsamlı takip dahil), konservatif yönetim alan hastaların yaklaşık yarısının, kaçınılmaz bir hastalık progresyonu olmaksızın iki yıl içinde toplam ağrı yükünde ≥50% azalma sağlayabildiğini göstermektedir14. Bu bulgular, uzun vadeli hastalık yönetimi için sürdürülebilir hasta katılımının ve etkili sağlık eğitiminin önemini vurgulamaktadır. Kanıtlar, hastalık etiyolojisini, patofizyolojisini ve tedavi seçeneklerini daha iyi anlayan hastaların, terapötik rejimlere aktif olarak katılma ve uyum sağlama olasılığının daha yüksek olduğunu ve bunun da iyileşmiş sonuçlara yol açtığını göstermektedir15. Ancak, geleneksel sağlık eğitimi yaklaşımları genellikle erişim ve ölçeklenebilirlik açısından sınırlıdır. İnternetin, özellikle çevrimiçi soru-cevap platformlarının ve sosyal medyanın yaygınlaşmasıyla birlikte hastalar, tıbbi bilgi edinmek için giderek daha fazla dijital kaynaklara güvenmektedir16,17. Buna rağmen, bireysel sağlık okuryazarlığındaki önemli değişkenlik ile bilinçli karar verme için temel sağlık bilgilerine erişme, işleme ve anlama yeteneği, etkili hasta eğitiminin önünde büyük engeller teşkil etmektedir18. Ayrıca, yanlış veya yanıltıcı içerikler de dahil olmak üzere çevrimiçi sağlık bilgilerinin düzensiz kalitesi, hastaların tıbbi kararlarını ve psikolojik refahlarını olumsuz etkileyebilir19.

Yapay zeka (AI) teknolojileri, özellikle son yıllarda büyük dil modellerinin (LLM'ler) hızla gelişmesi, tıp bilimi iletişimi ve sağlık eğitimi için yeni fırsatlar yaratmıştır20. Büyük ölçekli metinsel korpuslar üzerinde eğitilen bu modeller, doğal dil etkileşimi yoluyla yapılandırılmış ve mantıksal olarak tutarlı yanıtlar üretebilmektedir21. ChatGPT gibi temsili uluslararası sistemler; tıbbi soru yanıtlama, hasta konsültasyonu ve tıp eğitimi için gelecek vaat eden bir potansiyel sergilemiştir22,23. Çin'de, kullanıcı kapsamı ve uygulama senaryoları sürekli genişleyen, işlevsel olarak benzer birkaç LLM ortaya çıkmıştır24. Bu ilerlemelere rağmen, LLM'lerin tıp biliminin yaygınlaştırılmasındaki uygulamaları; eğitim verilerinin güvenilirliği, güncelleme sıklığı, üretilen yanıtların bilimsel doğruluğu ve klinik doğrulamanın eksikliği gibi önemli zorluklarla karşı karşıyadır25. Ayrıca, modeller arasındaki dil üslubu, okunabilirlik, mantıksal yapı ve atıf doğruluğu farklılıkları, hastaların sağlıkla ilgili bilgilere yönelik anlayışını ve güvenini doğrudan etkileyebilir26. Bugüne kadar, TN ile ilgili sağlık eğitiminde LLM performansının sistematik değerlendirmeleri sınırlı kalmıştır.

Bu nedenle, bu çalışma; yaygın olarak kullanılan dört Çin menşeli LLM'in (Doubao, DeepSeek, Wenxin Yiyan ve Tongyi Qianwen) ve temsilci bir uluslararası LLM'in (ChatGPT), TN ile ilgili hasta eğitimi sorularını yanıtlama performansını sistematik olarak değerlendirmeyi ve karşılaştırmayı amaçlamıştır. Kesitsel bir tasarım kullanarak, klinik kılavuzlar ve yaygın hasta endişeleri temelinde bir TN soru seti oluşturduk ve halka açık beş LLM (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen ve GPT-5) tarafından üretilen yanıtları değerlendirdik. Okunabilirlik birden fazla metrik kullanılarak değerlendirildi; anlaşılırlık ve uygulanabilirlik ise Hasta Eğitimi Materyalleri Değerlendirme Aracı (PEMAT) kullanılarak ölçüldü. Genel bilgi kalitesi, Global Kalite Puanı (GQS) kullanılarak değerlendirildi. Ayrıca, farklı sağlık eğitimi konularının bu değerlendirme metriklerini nasıl etkilediğini ve aralarındaki ilişkileri analiz ederek, klinik sağlık iletişiminde LLM'lerin seçimi ve optimizasyonu için kanıta dayalı rehberlik sağlamayı hedefledik.

Protokol

Bu çalışma yalnızca yapay zeka tarafından oluşturulan metinleri analiz etmiştir; insan katılımcıları, hayvanları, biyolojik örnekleri, tıbbi kayıtları, tanımlanabilir kişisel bilgileri veya klinik bakım müdahalesini kapsamamaktadır. Bu nedenle, etik kurul incelemesi ve resmi bilgilendirilmiş onam uygulanmamıştır.

Çalışma tasarımı

Bu kesitsel çalışma, TN hakkında sıkça sorulan sorulara yanıt olarak beş LLM tarafından üretilen yanıtların okunabilirliğini, kalitesini ve eğitimsel uygunluğunu değerlendirmiştir.

Sıkça sorulan TN ile ilgili soruların belirlenmesi

25 Kasım 2025 tarihinde, ağrı tıbbı konusunda kapsamlı deneyime sahip iki klinik uzman; Uluslararası Baş Ağrısı Bozuklukları Sınıflandırması, 3. baskı (ICHD-3), Avrupa Nöroloji Akademisi kılavuzu ve Amerikan Nöroloji Akademisi/Avrupa Nörolojik Cemiyetler Federasyonu kılavuzu dahil olmak üzere trigeminal nevralji (TN) için mevcut klinik kılavuzları bağımsız olarak incelemiştir1,10,11. Bir konsensüs tartışmasının ardından, klinik uygulamada yaygın olarak karşılaşılan TN ile ilgili 20 soruluk bir liste derlemişlerdir. Soru sayısı, önceden tanımlanmış beş tematik alanın dengeli bir şekilde kapsanmasını sağlamak amacıyla a priori olarak belirlenmiş ve her alan için dört soru seçilmiştir; böylece model tarafından üretilen toplam yanıt sayısı, uzmanlar tarafından manuel olarak derecelendirme ve doğrulama yapılabilmesi için uygun bir aralıkta tutulmuştur. Tekrarlanabilirliği artırmak için seçim süreci, önceden tanımlanmış alan tabanlı bir çerçeve izlemiştir: uzmanlar önce her alan içindeki aday soruları belirlemiş, bunları klinik uygunluk, hasta odaklı dil ve tekrarlardan kaçınma açısından bağımsız olarak incelemiş ve ardından alan başına nihai dört soru üzerinde konsensüse varmışlardır. Soruların nihai listesi Tablo 1 ve Ek Dosya 1'de sunulmuştur. Önceden tanımlanmış beş tematik alan; temel hastalık bilgisi, etiyoloji ve risk faktörleri, tanı, tedavi ile önleme ve rehabilitasyondan oluşmaktadır. Soru seti hasta arama kayıtlarından, çevrimiçi arama sorgularından veya resmi hasta mülakatlarından türetilmediği için, seçim yanlılığı potansiyeli bir çalışma kısıtlılığı olarak kabul edilmektedir.

Yapay zeka modelleri ve veri toplama prosedürü

25 Kasım 2025 tarihinde, TN ile ilgili kesinleştirilmiş 20 soruluk set; Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen ve GPT-5/ChatGPT olmak üzere halka açık beş büyük dil modeli (LLM) platformuna iletilmiştir. Tüm modellere standart halka açık web tabanlı sohbet arayüzleri üzerinden erişilmiş; uygulama programlama arayüzü (API) erişimi kullanılmamıştır. Her platform için, veri toplama tarihinde mevcut olan ve herhangi bir üretim parametresi değiştirilmeden kullanılan varsayılan halka açık model tercih edilmiştir. Halka açık web arayüzleri; arka uç model anlık görüntü tanımlayıcılarını, gizli sistem istemlerini, sıcaklığı (temperature), top-p değerini, maksimum çıktı token sayısını veya diğer üretim parametrelerini görüntülemediğinden, bu kalemler "halka açık web arayüzünde görüntülenmedi" şeklinde kaydedilmiştir.

Tüm modeller için istem ve yanıt dilleri İngilizceydi. Her standartlaştırılmış istem, modele özgü herhangi bir ek talimat olmaksızın yalnızca İngilizce sorunun aynından oluşmuştur. Her soru; önceki konuşma geçmişi, yüklenmiş dosyalar, eklentiler, özelleştirilmiş talimatlar veya takip istemleri olmaksızın yeni ve bağımsız bir sohbet oturumunda bireysel olarak gönderilmiştir. Standartlaştırılmış istemlerin tam listesi ve bunlara karşılık gelen ham model çıktıları Ek Dosya 1'de sunulmuştur. Model meta verileri ve veri toplama ayarları Ek Tablo 1'de özetlenmiştir.

Okunabilirlik değerlendirmesi

LLM tarafından oluşturulan yanıtların okunabilirliği, çevrimiçi bir okunabilirlik değerlendirme platformu (http://readabilityformulas.com/) üzerinden erişilebilen birden fazla yerleşik okunabilirlik formülü kullanılarak değerlendirilmiştir. Okunabilirlik değerlendirmesi için evrensel olarak kabul görmüş tek bir altın standart olmaması nedeniyle ve önceki çalışmalarla tutarlı olarak, yaygın olarak kullanılan kapsamlı bir okunabilirlik indeksleri seti uygulanmıştır23,27. Herhangi bir tek formüle olan bağımlılığı azaltmak amacıyla; cümle uzunluğu, kelime uzunluğu, hece yükü, karakter tabanlı karmaşıklık, okuma kolaylığı ve tahmini sınıf düzeyi dahil olmak üzere okunabilirliğin birbirini tamamlayan yönlerini yakalamak için yedi indeks seçilmiştir. Spesifik olarak, Coleman-Liau İndeksi (CL), Linsear Write Formülü (LW), Otomatik Okunabilirlik İndeksi (ARI), Simple Measure of Gobbledygook (SMOG), Gunning Fog İndeksi (GFOG), Flesch Okuma Kolaylığı Puanı (FRES) ve Flesch-Kincaid Sınıf Düzeyi (FKGL) hesaplanmıştır. Bu indeksler okuma zorluğunu veya sınıf düzeyini tahmin ederek metin okunabilirliğine dair nicel ölçütler sunmaktadır (Tablo 2).

Eğitimsel uygunluk ve bilgi kalitesinin değerlendirilmesi

Eğitimsel uygunluk, anlaşılırlık ve uygulanabilirlik olmak üzere iki alandan oluşan Hasta Eğitim Materyalleri Değerlendirme Aracı (PEMAT) kullanılarak değerlendirilmiştir28. Araç, 16'sı anlaşılırlığı ve sekizi uygulanabilirliği değerlendiren toplam 24 maddeden oluşmaktadır. Her madde iki seçenekli olarak puanlanmış (0 = kriter karşılanmadı; 1 = kriter karşılandı) ve 0 ile 24 arasında toplam bir puan elde edilmiştir; yüksek puanlar, hasta eğitimi için daha yüksek uygunluğu göstermektedir. Genel bilgi kalitesi, tıbbi bilgilerin kalitesini değerlendirmek için yaygın olarak kullanılan beşli Likert ölçeği olan Global Kalite Skoru (GQS) ile değerlendirilmiştir27 (Tablo 3).

25 Kasım 2025 tarihinde, TN yönetiminde 3 yılı aşkın deneyime sahip iki klinik uzman, her iki değerlendirme aracını kullanarak yapay zeka tarafından oluşturulan tüm yanıtları değerlendirmiştir. Puanlamadan önce, yapay zeka tarafından oluşturulan tüm yanıtlar kodlanmış yanıt tanımlayıcıları ile anonimize edilmiş ve değerlendiriciler PEMAT ve GQS değerlendirmeleri sırasında LLM platformuna karşı körlenmiştir. Uyuşmazlıklar, nihai puanlara karar veren üçüncü bir kıdemli uzman tarafından çözülmüştür. Değerlendiriciler arası güvenilirlik Cohen's kappa katsayısı ile değerlendirilmiş; >0.75 değerleri mükemmel uyumu, 0.40–0.75 değerleri kabul edilebilir uyumu ve <0.40 değerleri ise zayıf uyumu göstermiştir. Hem PEMAT hem de GQS için Cohen's kappa değerleri 0.75'i aşmış ve mükemmel değerlendiriciler arası güvenilirlik göstermiştir.

İstatistiksel analiz

Tüm istatistiksel analizler R yazılımı (versiyon 4.4.3) kullanılarak gerçekleştirilmiştir. Verilerin normalliği Shapiro-Wilk testi ve Q-Q grafikleri ile değerlendirilmiştir. Normal dağılım gösteren değişkenler ortalama ± standart sapma olarak özetlenmiş ve tek yönlü varyans analizi (ANOVA) ile karşılaştırılmış, uygun olduğunda Tukey post hoc testi uygulanmıştır. Normal dağılım göstermeyen değişkenler medyan ve çeyrekler arası aralık olarak özetlenmiş ve Kruskal-Wallis testi ile karşılaştırılmış, ardından ikili karşılaştırmalar için Bonferroni düzeltmeli Dunn post hoc testi uygulanmıştır. Okunabilirlik indeksleri, PEMAT puanları ve GQS değerleri arasındaki korelasyonlar, çoklu testler için Benjamini-Hochberg düzeltmesi uygulanarak Spearman sıra korelasyon katsayısı ile değerlendirilmiştir. İki yönlü düzeltilmiş P değeri < 0.05 istatistiksel olarak anlamlı kabul edilmiştir.

Sonuçlar

Bu çalışma, büyük dil modellerinin (LLM'ler) ve farklı sağlık eğitimi içerik kategorilerinin, üretilen metinlerin okunabilirliği ve kalitesi üzerindeki etkilerini sistematik olarak değerlendirmiştir. İlk olarak; Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen ve GPT-5 olmak üzere beş LLM'in performansını; hasta eğitimi uygunluğu, genel bilgi kalitesi ve PEMAT puanı, GQS ve kabul görmüş okunabilirlik indeksleri (ARI, FRES, GFOG, FKGL, CL, SMOG ve LW) dahil olmak üzere birden fazla okunabilirlik metriği açısından karşılaştırdık. İkinci olarak; temel hastalık bilgisi, etiyoloji ve risk faktörleri, tanı, tedavi ile önleme ve rehabilitasyon olmak üzere beş sağlık eğitimi içerik tematik alanı genelinde aynı sonuç ölçütlerini inceledik. Bu iki analitik perspektifi entegre ederek, model türü ve içerik kategorisinin metin kalitesini ve okunabilirliğini birlikte nasıl etkilediğini daha ayrıntılı olarak araştırdık ve böylece LLM tarafından üretilen hasta eğitimi materyallerindeki sistematik kalıpları belirledik.

Farklı büyük dil modelleri arasında okunabilirlik analizi

Beş büyük dil modeli (Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen ve GPT-5) tarafından oluşturulan trigeminal nevralji ile ilgili metinlerin dilbilimsel karmaşıklığını sistematik olarak karşılaştırmak için yedi yerleşik okunabilirlik indeksi kullanılmıştır. Genel sonuçlar Tablo 4'te özetlenmiş ve bireysel okunabilirlik metriklerinin dağılımları Şekil 1A–G'de gösterilmiştir. Beş model arasında tüm okunabilirlik indeksleri için her biri için P < 0.001 olacak şekilde istatistiksel olarak anlamlı farklar gözlemlenmiştir.

GPT-5; ARI, GFOG, FKGL, CL ve SMOG için en yüksek medyan değerlerini ve en düşük FRES değerini sergilemiş olup, bu durum daha uzun cümle yapılarına, daha karmaşık bir kelime dağarcığına ve genel olarak en yüksek okuma yüküne sahip metinler oluşturduğunu göstermektedir (Şekil 1A–G). Buna karşılık, Wenxin Yiyan en düşük dilsel karmaşıklığı göstermiştir. ARI, GFOG, FKGL, CL ve SMOG medyan değerleri beş model arasında en düşük seviyedeyken, FRES değeri en yüksek seviyede çıkmıştır.

Doubao, DeepSeek ve Tongyi Qianwen, GPT-5 ile Wenxin Yiyan arasında orta düzeyde okunabilirlik seviyeleri sergilemiştir. Doubao ve DeepSeek; ARI, GFOG, FKGL ve CL dahil olmak üzere sınıf düzeyi indekslerinde karşılaştırılabilir performanslar göstermiş ve her ikisi de tüm P < 0.05 değerleri ile Wenxin Yiyan'dan anlamlı derecede yüksek değerlere sahip olmuştur. Bu bulgular, Doubao ve DeepSeek için benzer bir genel okuma yükü olduğunu ve her ikisinin de Wenxin Yiyan'dan daha fazla dilsel karmaşıklığa sahip olduğunu göstermektedir.

Tongyi Qianwen, çoğu okunabilirlik indeksi genelinde genellikle Doubao/DeepSeek ile GPT-5 arasındaki değerleri vermiştir. Özellikle, CL skorunun GPT-5'e daha yakın olması, Doubao ve DeepSeek'ten biraz daha yüksek bir dilsel karmaşıklığa sahip olduğunu, ancak yine de GPT-5'ten daha az karmaşık kaldığını göstermektedir. LW indeksi, diğer okunabilirlik metriklerinden farklı bir dağılım örüntüsü sergilemiştir. En yüksek LW skoruna Wenxin Yiyan (60,00) ulaşmış, onu sırasıyla Tongyi Qianwen, DeepSeek ve Doubao izlemiş, GPT-5 ise en düşük LW skoruna (46,50) sahip olmuştur. Bu tutarsızlık, bireysel okunabilirlik formüllerinin cümle uzunluğu ve kelime zorluğunu ağırlıklandırma biçimlerindeki farklılıkları yansıtmaktadır (Şekil 1G).

Genel olarak, beş büyük dil modeli arasında dilsel karmaşıklık açısından önemli farklar gözlemlenmiştir. En karmaşık dilsel metni GPT-5 oluştururken, en okunabilir içeriği Wenxin Yiyan üretmiş; geri kalan modeller ise yapısal farklar belirgin olsa da orta düzeyde okunabilirlik sergilemiştir.

Büyük dil modelleri arasında hasta eğitimi uygunluğunun ve genel kalitenin karşılaştırılması

PEMAT kullanılarak değerlendirilen hasta eğitimi uygunluğunda, beş dil modeli arasında tüm P < 0,001 olacak şekilde anlamlı farklılıklar gözlemlenmiştir (Şekil 1H; Tablo 4). GPT-5, uzmanlar tarafından puanlanan en yüksek PEMAT skoruna (9,40 ± 1,90) ulaşarak mevcut kıyaslama çerçevesinde daha yüksek bir eğitim uygunluğu sergilemiştir. Ancak bu bulgu, GPT-5 tarafından oluşturulan materyallerin gerçek hasta kavrayışını, memnuniyetini, güvenini, sağlık davranışlarını veya klinik sonuçlarını iyileştirdiğine dair bir kanıt olarak yorumlanmamalıdır.

DeepSeek, nispeten dar bir skor dağılımıyla orta düzeyde bir PEMAT skoru (6.80 ± 1.06) elde etmiştir; bu durum, hasta eğitim materyalleri oluşturmada tutarlı bir performans sergilediğini göstermektedir. Buna rağmen, genel eğitim uygunluğu GPT-5'ten anlamlı derecede düşük kalmıştır (P < 0.001). Doubao, Tongyi Qianwen ve Wenxin Yiyan daha düşük PEMAT skorları (sırasıyla 5.35 ± 1.04, 5.65 ± 1.09 ve 5.35 ± 0.93) vermiştir. Bu üç model arasında anlamlı bir fark gözlemlenmemiş olup, tümü DeepSeek ve GPT-5'ten anlamlı derecede daha kötü performans göstermiştir (tümü için P < 0.01). Bu bulgular, özellikle talimat netliği, dilsel organizasyon ve anlaşılabilirlik açısından bu modeller arasında karşılaştırılabilir ancak sınırlı bir eğitim uygunluğu olduğunu göstermektedir.

GQS kullanılarak değerlendirilen genel bilgi kalitesi için de benzer bir örüntü gözlemlenmiştir (Şekil 1I). Beş model arasında, tümü P < 0.001 olan istatistiksel olarak anlamlı farklar tespit edilmiştir. GPT-5 en yüksek GQS puanını (4.00 ± 0.65) elde etmiştir. Puanları, sınırlı bir değişkenlikle 4–5 aralığında yoğunlaşmış olup; bu durum içerik tutarlılığı, yapısal bütünlük ve pratik fayda açısından tutarlı bir şekilde yüksek performans sergilediğini göstermektedir.

Sırasıyla 3,35 ± 0,59 ve 3,40 ± 0,50 GQS puanları ile DeepSeek ve Doubao onları takip etti. Puan dağılımlarının 3 ile 4 arasında yoğunlaşması, orta düzeyde bilgi kalitesine ve makul bir güvenilirliğe işaret etmektedir. Buna karşılık, Tongyi Qianwen ve Wenxin Yiyan en düşük GQS puanlarını (sırasıyla 2,50 ± 0,51 ve 2,20 ± 0,52) elde etti. Bu modellerin dağılımları ölçeğin alt ucuna doğru kaymış olup, hasta eğitimi için kullanışlılıklarını azaltabilecek bilgi doğruluğu, yapısal titizlik ve içerik derinliği konusundaki kısıtlılıkları göstermektedir.

Genel olarak, bu veri setinde GPT-5 uzmanlar tarafından değerlendirilen en yüksek PEMAT ve GQS puanlarını elde ederken, DeepSeek ve Doubao orta düzeyde performans sergilemiştir. Tongyi Qianwen ve Wenxin Yiyan daha düşük GQS puanları almıştır. Bu bulgular, uzmanlar tarafından değerlendirilmiş kıyaslama sonuçlarını temsil etmektedir ve klinik hazırlığın veya hasta düzeyindeki etkinliğin bir kanıtı olarak yorumlanmamalıdır.

Sağlık eğitimi içerik kategorileri arasında okunabilirlik, hasta eğitimi uygunluğu ve genel kalitenin karşılaştırılması

İçerik kategorisine göre yapılan analiz, beş sağlık eğitimi teması arasında okunabilirlik açısından anlamlı farklılıklar olduğunu ortaya koymuştur (Tablo 5). FRES için tematik kategoriler arasında istatistiksel olarak anlamlı farklılıklar gözlemlenmiştir (P = 0.004). Daha yüksek FRES değerleri, okunabilirliğin daha kolay olduğunu gösterir. Temel hastalık bilgisi metinleri en okunabilir olanlardı (medyan = 28.50), bunu sırasıyla tanısal içerik (medyan = 16.00), etiyoloji ve risk faktörü içeriği (medyan = 12.50) ve tedaviyle ilgili içerik (medyan = 11.50) izlemiştir. Buna karşılık, önleme ve rehabilitasyon metinleri en düşük okunabilirliği sergilemiş (medyan FRES = 1.00), bu da en yüksek okuma zorluğuna işaret etmiştir.

Benzer örüntüler diğer okunabilirlik indekslerinde de gözlemlenmiştir. GFOG ve FKGL tematik kategoriler arasında anlamlı farklılıklar göstermiştir (P = 0.002 ve P = 0.036), her iki indeks de etiyoloji ve risk faktörleri ile önleme ve rehabilitasyon içerikleri için daha yüksek okuma seviyelerine işaret etmiştir. SMOG indeksi de benzer şekilde, etiyoloji ve risk faktörü metinlerinin daha yüksek oranda çok heceli kelimeler içerdiğini göstermiştir (P = 0.039). En büyük farklar CL için gözlemlenmiştir (P < 0.001). Önleme ve rehabilitasyon metinleri, okuma zorluğunu önemli ölçüde artıran en uzun cümlelere (medyan = 21.01) sahipken; temel hastalık bilgisi metinleri, en düşük okuma yüküne karşılık gelen en kısa cümlelere (medyan = 14.88) sahipti. ARI veya LW için içerik kategorileri arasında anlamlı bir fark gözlemlenmemiştir.

PEMAT puanlarına göre beş içerik kategorisi arasında hasta eğitimi uygunluğu açısından istatistiksel olarak anlamlı bir fark tespit edilmemiştir (P = 0.252). Ortalama PEMAT puanları 5,90 ile 7,20 arasında değişmiş olup, bu durum dilsel karmaşıklıktaki belirgin farklılıklara rağmen eğitim uygunluğunun temalar genelinde nispeten tutarlı kaldığını göstermektedir. Benzer şekilde, GQS kullanılarak değerlendirilen genel bilgi kalitesi, içerik kategorileri arasında anlamlı bir farklılık göstermemiştir (P = 0.822). Ortalama GQS değerleri 2,95 ile 3,25 arasında değişmiş olup, genel bilgi kalitesinin içerik temaları genelinde nispeten stabil olduğunu göstermiştir.

Genel olarak, sağlık eğitimi temaları arasında okunabilirlik açısından önemli farklılıklar gözlemlenmiş olup; etiyoloji ve risk faktörü içerikleri ile önleme ve rehabilitasyon içerikleri en yüksek okuma zorluğunu sergilerken, temel hastalık bilgisi içerikleri en okunabilir olanlar olarak belirlenmiştir. Buna karşılık, hasta eğitiminin uygunluğu ve bilgilerin genel kalitesi, içerik kategorileri arasında nispeten tutarlı kalmıştır.

Okunabilirlik, hasta eğitimi uygunluğu ve genel kalite arasındaki korelasyon analizi

Şekil 2'deki korelasyon matrisi, okunabilirlik indeksleri arasında tutarlı ve güçlü ilişkiler olduğunu göstermekte ve bu durum güçlü bir iç tutarlılığa işaret etmektedir. ARI, GFOG, FKGL, CL ve SMOG dahil olmak üzere çoğu okunabilirlik metriği, korelasyon katsayıları 0,64 ile 0,97 arasında değişerek (tüm P < 0,001) birbirleriyle orta ila güçlü pozitif korelasyonlar sergilemiştir. Bu bulgular, dilsel karmaşıklığın değerlendirilmesinde bu indekslerin tamamlayıcı doğasını daha da desteklemektedir. Buna karşılık FRES; ARI, GFOG, FKGL, CL ve SMOG dahil olmak üzere birden fazla okunabilirlik metriği ile mutlak korelasyon katsayıları 0,70'den büyük olacak şekilde anlamlı negatif korelasyonlar göstermiştir (tüm P < 0,001). Bu örüntü, daha yüksek puanların daha yüksek okunabilirliğe işaret ettiği FRES'in ters puanlama yönünü yansıtmaktadır. LW indeksi de ARI, FKGL, GFOG ve SMOG dahil olmak üzere diğer okunabilirlik indeksleri ile mutlak korelasyon katsayıları 0,75 ile 0,90 arasında değişen anlamlı negatif korelasyonlar göstermiştir (tüm P < 0,001). Aksine, LW ile FRES arasında pozitif bir korelasyon saptanmıştır (korelasyon katsayısı = 0,69, P < 0,001).

Okunabilirlik indeksleri ile GQS tarafından ölçülen genel bilgi kalitesi arasında da belirgin ilişkiler gözlemlenmiştir. GQS; ARI, GFOG, FKGL, CL ve SMOG dahil olmak üzere çoğu okunabilirlik metriği ile 0,326 ile 0,391 arasında değişen korelasyon katsayılarına sahip, zayıf ila orta düzeyde pozitif korelasyonlar göstermiştir (tüm P < 0,001). Bu bulgular, daha yüksek dilsel karmaşıklığın, uzmanlar tarafından puanlanan daha yüksek bilgi kalitesi ile ilişkili olduğunu göstermektedir. Aksine, GQS ile FRES arasında orta düzeyde negatif bir korelasyon saptanmıştır (korelasyon katsayısı = −0,408, P < 0,001); bu durum, daha yüksek okuma seviyesi gerektiren metinlerin genellikle daha yüksek GQS puanları aldığını göstermektedir. GQS ayrıca LW ile de orta düzeyde negatif bir korelasyon göstermiştir (korelasyon katsayısı = −0,421, P < 0,001).

Okunabilirlik ile PEMAT kullanılarak değerlendirilen hasta eğitimi uygunluğu arasındaki ilişkiler genel olarak daha zayıftı ancak yönsel olarak tutarlıydı. PEMAT skorları; ARI, GFOG, FKGL, CL ve SMOG ile 0,305 ile 0,434 arasında değişen korelasyon katsayılarına sahip zayıf pozitif korelasyonlar göstermiştir (tümü P < 0,01). Buna karşılık, PEMAT skorları FRES ve LW ile sırasıyla 0,432 ve 0,320 mutlak korelasyon katsayılarıyla zayıf negatif korelasyon göstermiştir (her ikisi de P < 0,01). Bu bulgular, söz konusu veri seti dahilinde, ilişkilerin gücü sınırlı olsa da, daha yüksek dilsel karmaşıklığın uzmanlar tarafından değerlendirilen biraz daha yüksek eğitim uygunluğu ile ilişkili olduğunu göstermektedir.

Önemli bir nokta olarak, PEMAT ve GQS skorları arasında orta düzeyde pozitif bir korelasyon gözlemlenmiştir (korelasyon katsayısı = 0.645, P < 0.001). Bu, değerlendirme alanları arasında gözlemlenen en güçlü ilişki olup, eğitim uygunluğu daha yüksek olan yanıtların aynı zamanda daha yüksek genel bilgi kalitesi puanları alma eğiliminde olduğunu göstermektedir.

VERİ ERİŞİLEBİLİRLİĞİ:

Bu çalışmayı destekleyen veri setinin tamamı ek materyal olarak sunulmuştur. Ek Dosya 1, standartlaştırılmış soruların, istemlerin ve arşivlenmiş 100 LLM tarafından oluşturulmuş yanıtın tam listesini içermektedir. Ek Tablo 2; mevcut olan kalem düzeyindeki PEMAT derecelendirmelerini, toplam PEMAT puanlarını, GQS puanlarını, değerlendirici karşılaştırma bilgilerini ve uygun olduğunda hakem kayıtlarını içeren uzman PEMAT ve GQS puanlama çizelgelerini içermektedir. Okunabilirlik puanları, şekil kaynak verileri ve R analiz kodları Ek Dosya 2 olarak sunulmuştur. Model güncellemeleri, arayüz değişiklikleri ve platform düzeyindeki modifikasyonlar nedeniyle LLM çıktıları zamanla değişebileceğinden, doğrulama ve ikincil analizler için yeniden oluşturulan yanıtlar yerine arşivlenmiş çıktılar kullanılmalıdır.

Yapay zeka platform değerlendirme grafiği; ARI, FRES, GFOG, PKGL, CL, SMOG, IM, FENAT, GFIS skorlarının veri analizi.
Şekil 1: Beş büyük dil modeli arasında okunabilirlik, hasta eğitimi uygunluğu ve genel bilgi kalitesinin karşılaştırılması.(A–G) Bu panel okunabilirlik indekslerini sunmaktadır: Automated Readability Index (ARI), Flesch Reading Ease Score (FRES), Gunning Fog Index (GFOG), Flesch-Kincaid Grade Level (FKGL), Coleman-Liau Index (CL), Simple Measure of Gobbledygook (SMOG) ve Linsear Write Formula (LW). (H) Bu panel toplam PEMAT skorlarını, panel (I) ise Global Quality Scores (GQS) değerlerini göstermektedir. Her bir kutu grafiğinde, merkez hattı medyanı temsil eder, kutu çeyrekler arası aralığı (IQR) gösterir, bıyıklar 1.5 × IQR'ye kadar uzanır ve bıyıkların ötesindeki noktalar aykırı değerleri temsil eder. Kısaltmalar: ARI = Automated Readability Index; FRES = Flesch Reading Ease Score; GFOG = Gunning Fog Index; FKGL = Flesch Kincaid Grade Level; CL = Coleman Liau Index; SMOG = Simple Measure of Gobbledygook; LW = Linsear Write; PEMAT = Anlaşılabilirlik ve Uygulanabilirlik için Hasta Eğitimi Materyalleri Değerlendirme Aracı, yazdırılabilir format; Global Quality Score = GQS. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Saçılım grafikleri içeren korelasyon matrisi grafiği; ARI, FRES, FKGL değişkenleri, veri analizi, istatistiksel sonuç.
Şekil 2: Tüm model tarafından oluşturulan yanıtlar genelinde okunabilirlik indeksleri, hasta eğitimi uygunluğu ve genel bilgi kalitesi arasındaki Spearman korelasyon matrisi. Matris; ARI, FRES, GFOG, FKGL, CL, SMOG, LW, PEMAT ve GQS arasındaki ikili ilişkiler için Spearman korelasyon katsayılarını raporlamaktadır. Kısaltmalar: ARI = Automated Readability Index; FRES = Flesch Reading Ease Score; GFOG = Gunning Fog Index; FKGL = Flesch-Kincaid Grade Level; CL = Coleman-Liau Index; SMOG = Simple Measure of Gobbledygook; LW = Linsear Write; PEMAT = Patient Education Materials Assessment Tool; GQS = Global Quality Score. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Tablo 1: Trigeminal nevralji ile ilgili 20 sorunun listesi. Lütfen bu dosyayı indirmek için buraya tıklayın.

Tablo 2: Okunabilirlik araçları, formülleri ve açıklamaları. Lütfen bu dosyayı indirmek için buraya tıklayın.

Tablo 3: Küresel Kalite Skoru (GQS) kalite kriterleri. Lütfen bu dosyayı indirmek için buraya tıklayın.

Tablo 4: Trigeminal nevralji ile ilgili en yaygın sorular için farklı büyük dil modellerinin analiz sonuçları. Lütfen bu dosyayı indirmek için buraya tıklayın.

Tablo 5: Trigeminal nevralji ile ilgili en yaygın sorular için farklı boyutlar genelindeki analiz sonuçları. Lütfen bu dosyayı indirmek için buraya tıklayın.

Ek Tablo 1: Beş büyük dil modeli tarafından oluşturulan yanıtların değerlendirilen tüm okunabilirlik indeksleri üzerinden okunabilirlik skorları. Bu dosyayı indirmek için lütfen buraya tıklayın.

Ek Tablo 2: Beş büyük dil modeli tarafından oluşturulan yanıtların hasta eğitimi uygunluğuna (PEMAT) ve genel bilgi kalitesine (GQS) ilişkin uzman değerlendirmeleri.Bu dosyayı indirmek için lütfen buraya tıklayın.

Ek Dosya 1: Beş büyük dil modeli tarafından oluşturulan standartlaştırılmış trigeminal nevralji soruları ve tam yanıtlar.Bu dosyayı indirmek için lütfen buraya tıklayın.

Ek Dosya 2: İstatistiksel analizler ve şekillerin oluşturulması için kullanılan R scriptleri ve kaynak veriler. Bu dosyayı indirmek için lütfen buraya tıklayın.

Tartışma

Bu kesitsel kıyaslama çalışması, halka açık beş büyük dil modeli (LLM) tarafından oluşturulan trigeminal nevralji (TN) hasta eğitim materyallerinin okunabilirliğini, eğitimsel uygunluğunu ve genel bilgi kalitesini sistematik olarak karşılaştırmıştır. Dört temel bulgu ortaya çıkmıştır. İlk olarak, okunabilirlik modeller arasında önemli ölçüde farklılık göstermiş; GPT-5 dilsel olarak en karmaşık yanıtları üretirken, Wenxin Yiyan en okunabilir içeriği oluşturmuştur. İkinci olarak, okunabilirlik ile uzmanlar tarafından puanlanan bilgi kalitesinin farklı değerlendirme boyutları olduğu görülmüş ve GPT-5, düşük okunabilirliğine rağmen en yüksek PEMAT ve GQS puanlarını almıştır. Üçüncü olarak, içerik temasının okunabilirliği etkilediği; önleme, rehabilitasyon, etiyoloji ve risk faktörü konularının genellikle daha yüksek okuma seviyeleri gerektirdiği, PEMAT ve GQS değerlerinin ise içerik kategorileri arasında nispeten sabit kaldığı tespit edilmiştir. Son olarak, okunabilirlik indeksleri güçlü bir iç tutarlılık göstermiş ve korelasyon analizleri, dilsel karmaşıklık ile hem PEMAT hem de GQS arasında zayıf ila orta düzeyde pozitif ilişkiler olduğunu, ayrıca PEMAT ile GQS arasında orta düzeyde pozitif bir korelasyon olduğunu ortaya koymuştur. Toplu olarak bu bulgular, tıbbi eksiksizlik ile dilsel erişilebilirlik arasındaki dengenin kurulması gerektiğini vurgularken, LLM tarafından oluşturulan TN hasta eğitim materyallerini değerlendirmek için bir kıyaslama noktası sağlamaktadır. Önemli bir nokta olarak, bu sonuçlar uzmanlar tarafından puanlanmış kıyaslama çıktılarını temsil etmekte olup; hasta kavrayışının, olgusal doğruluğun, klinik güvenliğin veya rutin klinik kullanıma uygunluğun kanıtı olarak yorumlanmamalıdır.

Bu çalışmanın bulguları, LLM'ler arasında önemli değişkenlikler olduğunu ve okunabilirlik ile bilgi kalitesi arasında sıkça kopukluk yaşandığını bildiren, yapay zeka tarafından oluşturulan tıbbi bilgilere yönelik önceki değerlendirmelerle tutarlıdır26,27,29. Birden fazla hastalık alanında yürütülen önceki çalışmalar, LLM tarafından oluşturulan hasta eğitim materyallerinin genellikle önerilen okuma seviyelerini aştığını ve en okunabilir metinleri üreten modellerin her zaman en kapsamlı veya en yüksek kaliteli bilgileri sağlamadığını göstermiştir26,30. TN eğitimiyle ilgili bulgular bu gözlemi desteklemektedir. GPT-5, dilsel olarak en karmaşık yanıtları üretmesine rağmen en yüksek PEMAT ve GQS puanlarını elde ederken, Wenxin Yiyan daha okunabilir metinler üretmiş ancak uzmanlar tarafından değerlendirilen eğitim uygunluğu ve genel kalitede daha düşük puanlar almıştır. Ayrıca, okunabilirlik tematik alanlara göre farklılık göstermiş; önleme ve rehabilitasyon ile etiyoloji ve risk faktörü konuları genellikle daha fazla dilsel karmaşıklık sergilemiştir; bu durum, hem model özelliklerinin hem de konu karmaşıklığının okuma zorluğunu etkilediğini göstermektedir31.

Okunabilirlik ile bilgi kalitesi arasındaki görünür ödünleşim, değerlendirme araçları tarafından ölçülen farklı yapılarla tutarlıdır. Okunabilirlik formülleri öncelikle cümle uzunluğu ve sözcük karmaşıklığı gibi yüzeysel dilsel özellikleri değerlendirirken, PEMAT ve GQS; bilgi organizasyonu, tamlık, açıklamaların netliği ve uygulanabilirlik dahil olmak üzere daha üst düzey nitelikleri değerlendirir32. TN eğitimi için yüksek kaliteli yanıtlar sıklıkla kırmızı bayrak semptomları, ayırıcı tanı, farmakolojik yönetim ve yan etkiler,le girişimsel ve cerrahi seçenekler ile bireyselleştirilmiş rehabilitasyon stratejilerine ilişkin tartışmaları içerir33. Bu tür klinik olarak kapsamlı içerikler, terminolojik yoğunluğu ve sözdizimsel karmaşıklığı kaçınılmaz olarak artırarak daha yüksek okunabilirlik skorlarına ve uzmanlarca puanlanan eğitim kalitesinde artışa yol açar. Önemle belirtilmelidir ki, bu bulgular daha karmaşık bir dilin tercih edildiği şeklinde yorumlanmamalıdır. Aksine, mevcut LLM'lerin genellikle dilsel erişilebilirlik pahasına bilgi tamlığını artırdığını göstermektedir. Bu nedenle, hasta eğitim sistemlerinin gelecekteki geliştirme süreçleri; sade dille revizyon, temel noktaların yapılandırılmış sunumu, teknik terminolojinin açıklanması ve farklı sağlık okuryazarlığı seviyelerine sahip hastalar için uygun, net ve uygulanabilir rehberlik yoluyla dili sadeleştirirken tıbbi doğruluğu korumaya odaklanmalıdır11,34,35.

Korelasyon analizi, okunabilirlik ile eğitimsel kalite arasındaki ayrımı daha da desteklemektedir. Sınıf düzeyi tabanlı çoğu okunabilirlik indeksinin hem PEMAT hem de GQS ile zayıf ila orta düzeyde pozitif ilişkiler gösterdiği, buna karşın FRES'in, daha yüksek FRES skorlarının daha kolay okunabilirliği belirttiği nedeniyle beklenen ters ilişkiyi gösterdiği görülmüştür. Bu bulgular, daha yüksek dilsel karmaşıklığın arzu edilir olduğu anlamına gelmemektedir; aksine, mevcut LLM'lerin sıklıkla erişilebilirlik pahasına daha yüksek bilgilendirici tamamlığa ulaştıklarını göstermektedir34. Buna göre, yapay zeka destekli hasta eğitiminin geliştirilmesi, tıbbi doğruluğu ve tamamlığı önceliklendirirken aynı zamanda sade dil düzenlemelerini, temel noktaların yapılandırılmış sunumunu, teknik terminolojinin açık açıklamalarını ve farklı sağlık okuryazarlığı seviyelerine sahip hastalara göre uyarlanmış uygulanabilir önerileri içermelidir11,35.

Ek bir metodolojik bulgu, LW indeksinin diğer okunabilirlik ölçümleriyle karşılaştırıldığında sergilediği belirgin davranıştır. ARI, FKGL, GFOG, CL ve SMOG'un aksine LW, okunabilirlik formüllerinin metin karmaşıklığını işleme biçimlerindeki farklılıkları yansıtacak şekilde, FRES'e daha benzer bir örüntü izlemiştir36. LW başlangıçta teknik kılavuzlar için geliştirildiğinden ve genel cümle veya hece özelliklerinden ziyade örneklenen cümle yapısına ve kelime sınıflandırmasına önem verdiğinden; kısa ifadeleri daha uzun açıklayıcı pasajlarla ve teknik terminolojinin düzensiz dağılımlarıyla birleştiren yapay zeka tarafından oluşturulmuş tıbbi metinlere farklı tepki verebilir37,38. Hiçbir tekil okunabilirlik indeksinin metin karmaşıklığının tüm boyutlarını yeterince yakalayamaması nedeniyle, bu bulgular çoklu metrik değerlendirme çerçevesinin önemini pekiştirmektedir. Yapay zeka tarafından oluşturulan sağlık bilgilerine ilişkin önceki çalışmalarla tutarlı olarak, genel okunabilirlik, herhangi bir tekil ölçümden ziyade birden fazla tamamlayıcı indeks arasındaki yakınsayan kanıtlar kullanılarak yorumlanmalıdır39.

İçerik kategorisi de okunabilirliği etkilemiştir. Önleme, rehabilitasyon, etiyoloji ve risk faktörü konuları, genel olarak temel hastalık bilgilerine kıyasla daha yüksek okuma zorluğuna sahip metinler üretmiştir; bunun nedeni muhtemelen bu konuların koşullu öneriler, mekanistik açıklamalar ve daha uzmanlaşmış terminoloji gerektirmesidir40,41. Buna karşılık, temel hastalık bilgileri öncelikle tanımlara dayalıdır ve daha basit bir dille aktarılabilir42. Bu farklılıklara rağmen, PEMAT ve GQS puanları tematik alanlar genelinde nispeten tutarlı kalmıştır; bu durum, uzmanlar tarafından değerlendirilen eğitsel uygunluğun ve genel bilgi kalitesinin farklı hasta soruları genelinde korunduğunu göstermektedir35,43.

Bu bulguların klinik uygulama ve gelecekteki LLM geliştirme süreçleri için çeşitli çıkarımları vardır. Hastaların tıbbi konsültasyonlar öncesinde veya sonrasında bilgi edinmek için LLM'leri kullanımı arttıkça, yapay zeka tarafından oluşturulan içerikler; özellikle ilaç güvenliği, girişimsel veya cerrahi tedavi endikasyonları ve acil değerlendirme gerektiren kırmızı bayrak semptomlarının tanınması konularında, klinisyen danışmanlığının yerini almak yerine onu tamamlayıcı nitelikte olmalıdır44. Sağlık kuruluşları, LLM'leri otonom hasta eğitim sistemleri olarak kullanmak yerine, taslak oluşturma veya karar destek araçları olarak kullanırken, uzmanlarca gözden geçirilmiş ve yalın dille hazırlanmış eğitim kaynakları sağlayarak fayda sağlayabilirler. Gelecekteki modeller; klinik uygulamaya geçilmeden önce okunabilirlik farkındalığına sahip oluşturma stratejilerini, model sürümlerinin ve oluşturma tarihlerinin şeffaf raporlanmasını, belirsizliğin açıkça iletilmesini ve klinisyen incelemesi, olgusal doğruluk doğrulaması, halüsinasyon taraması, ilaç güvenliği kontrolleri, kırmızı bayrak kılavuzluğu ve hasta anlama testlerini içeren yönetişim prosedürlerini bünyesine katmalıdır26,44,45.

Bu çalışmanın birkaç kısıtlılığı bulunmaktadır. Model çıktıları, tek bir tarihte halka açık web arayüzlerinden toplanmıştır ve sonraki model güncellemeleri, arayüz değişiklikleri, gizli sistem istemleri veya varsayılan oluşturma ayarları tekrarlanabilirliği etkileyebilir. 20 soruluk set, hasta arama kayıtlarından veya resmi hasta görüşmelerinden türetilmek yerine klinik uzmanlar tarafından geliştirilmiştir; bu uygulama seçim yanlılığına yol açabilir. Ayrıca, çalışma uzmanlar tarafından puanlanan PEMAT ve GQS değerlendirmelerine dayanmış olup hastaların anlamasını, güvenini, memnuniyetini, sağlık davranışlarını veya klinik sonuçları değerlendirmemiştir. Okunabilirlik formülleri, PEMAT ve GQS ayrıca olgusal doğruluğu, halüsinasyon riskini, atıf doğruluğunu, kontrendikasyonların eksiksizliğini veya klinik güvenliği doğrudan değerlendirmez. Sonuç olarak, bu bulgular, herhangi bir LLM tarafından üretilen materyalin rutin klinik kullanıma hazır olduğuna dair bir kanıttan ziyade, uzmanlarca puanlanmış kesitsel bir kıyaslama analizi olarak yorumlanmalıdır. Gelecekteki çalışmalar, LLM tarafından üretilen eğitim materyalleri klinik uygulama için değerlendirilmeden önce, arşivlenmiş model çıktılarını, ayrıntılı model meta verilerini, çok dilli değerlendirmeleri, daha geniş soru setlerini, resmi güvenlik denetimlerini, olgusal doğruluk değerlendirmelerini ve hasta merkezli sonuç ölçümlerini içermelidir.

Uzmanlar tarafından değerlendirilen bu kesitsel kıyaslama çalışmasında, halka açık büyük dil modellerinin trigeminal nevralji hasta eğitim materyallerinin okunabilirliği, eğitimsel uygunluğu ve genel bilgi kalitesi açısından önemli ölçüde farklılık gösterdiği saptanmıştır. GPT-5, uzmanlar tarafından puanlanan en yüksek PEMAT ve GQS skorlarını elde etmiş ancak aynı zamanda dilsel olarak en karmaşık yanıtları üretmiştir; bu durum, okunabilirliğin ve uzmanlarca değerlendirilen eğitimsel kalitenin, hasta eğitiminin birbiriyle ilişkili ancak farklı boyutlarını temsil ettiğini vurgulamaktadır. Bazı modellerin daha okunabilir içerikler üretmiş olması, bunun mutlaka daha yüksek eğitimsel uygunluk veya genel bilgi kalitesi anlamına gelmediği görülmüştür. Bu çalışma; gerçek olguların doğruluğunu özel bir güvenlik denetimiyle değerlendirmediği, halüsinasyon riskini, atıf doğruluğunu, hasta kavrayışını, güveni, memnuniyeti, sağlık davranışlarını veya klinik sonuçları incelemediği için, bulgular klinik hazırlığa dair bir kanıttan ziyade uzman değerlendirmeli bir kıyaslama analizi olarak yorumlanmalıdır. Gelecekteki çalışmalar, LLM tarafından oluşturulan materyallerin hasta eğitiminde güvenli ve etkili kullanımını desteklemek için uzman incelemesini, resmi güvenlik ve gerçek doğruluk değerlendirmelerini ve hasta merkezli değerlendirmeleri entegre etmelidir.

Açıklamalar

Yazarlar, herhangi bir çıkar çatışmasının olmadığını beyan ederler.

Teşekkürler

Bu araştırma, kamu, ticari veya kâr amacı gütmeyen sektörlerdeki herhangi bir finansman kuruluşundan özel bir hibe almamıştır. Yazarlar, trigeminal nevralji soru seti hakkında geri bildirim sağlayan ve değerlendirme çerçevesinin geliştirilmesine yardımcı olan klinik meslektaşlarına teşekkür eder. Ayrıca, taslağın hazırlanması ve revizyonu aşamasında destek veren tüm katkıda bulunanlara teşekkür ederiz.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
DeepSeek sohbet platformuDeepSeekhttps://chat.deepseek.com/Yanıtlar oluşturmak için kullanılan halka açık büyük dil modeli arayüzü
Doubao sohbet platformuDoubaohttps://www.doubao.com/chat/Yanıtlar oluşturmak için kullanılan halka açık büyük dil modeli arayüzü
GPT 5 OpenAIhttps://chat.openai.com/Yanıtlar oluşturmak için kullanılan halka açık büyük dil modeli arayüzü
R yazılımı, versiyon 4.4.3R Foundation for Statistical ComputingUygulanamazİstatistiksel analiz ve görselleştirme
Readability Formulas çevrimiçi okunabilirlik hesaplayıcısıReadability FormulasUygulanamazOkunabilirlik indekslerini hesaplamak için kullanılan çevrimiçi araç
Tongyi Qianwen sohbet platformuTongyi Qianwenhttps://www.tongyi.com/Yanıtlar oluşturmak için kullanılan halka açık büyük dil modeli arayüzü
Wenxin Yiyan sohbet platformuWenxin Yiyanhttps://yiyan.baidu.com/Yanıtlar oluşturmak için kullanılan halka açık büyük dil modeli arayüzü

Kaynaklar

  1. Headache Classification Committee of the International Headache Society (IHS). The International Classification of Headache Disorders, 3rd edition. Cephalalgia. 2018;38(1):1-211.
  2. Ashina S, et al. Trigeminal neuralgia. Nat Rev Dis Primers. 2024;10(1):39.
  3. Donertas-Ayaz B, Caudle RM. Locus coeruleus-noradrenergic modulation of trigeminal pain: Implications for trigeminal neuralgia and psychiatric comorbidities. Neurobiol Pain. 2023;13:100124.
  4. Martinelli R, et al. Psychological assessment in patients affected by trigeminal neuralgia: A systematic review. Neurosurg Rev. 2025;48(1):414.
  5. Melek LN, et al. Comparison of the neuropathic pain symptoms and psychosocial impacts of trigeminal neuralgia and painful posttraumatic trigeminal neuropathy. J Oral Facial Pain Headache. 2019;33(1):77-88.
  6. Zakrzewska JM, et al. Evaluating the impact of trigeminal neuralgia. Pain. 2017;158(6):1166-1174.
  7. Gambeta E, Chichorro JG, Zamponi GW. Trigeminal neuralgia: An overview from pathophysiology to pharmacological treatments. Mol Pain. 2020;16:1744806920901890.
  8. De Toledo IP, et al. Prevalence of trigeminal neuralgia: A systematic review. J Am Dent Assoc. 2016;147(7):570-576.e2.
  9. Svedung Wettervik T, et al. Incidence of trigeminal neuralgia: A population-based study in central Sweden. Eur J Pain. 2023;27(5):580-587.
  10. Bendtsen L, et al. European Academy of Neurology guideline on trigeminal neuralgia. Eur J Neurol. 2019;26(6):831-849.
  11. Cruccu G, et al. Trigeminal neuralgia: New classification and diagnostic grading for practice and research. Neurology. 2016;87(2):220-228.
  12. Araya EI, et al. Trigeminal neuralgia: Basic and clinical aspects. Curr Neuropharmacol. 2020;18(2):109-119.
  13. Chong MS, Bahra A, Zakrzewska JM. Guidelines for the management of trigeminal neuralgia. Cleve Clin J Med. 2023;90(6):355-362.
  14. Heinskou TB, et al. Favourable prognosis of trigeminal neuralgia when enrolled in a multidisciplinary management program: A two-year prospective real-life study. J Headache Pain. 2019;20(1):23.
  15. Liu S, et al. Comparative evaluation of ChatGPT and Gemini in brain-computer interface patient education: A multidimensional analysis of reliability, accuracy, comprehensibility, and readability. Int J Med Inform. 2026;206:106164.
  16. Forgie EME, et al. Social media and the transformation of the physician-patient relationship: Viewpoint. J Med Internet Res. 2021;23(12):e25230.
  17. Gantenbein L, Navarini AA, Maul LV, Brandt O, Mueller SM. Internet and social media use in dermatology patients: Search behavior and impact on the patient-physician relationship. Dermatol Ther. 2020;33(6):e14098.
  18. Youssef Y, et al. Social media and internet use among orthopedic patients in Germany: A multicenter survey. Front Digit Health. 2025;7:1486296.
  19. De Martino I, et al. Social media for patients: Benefits and drawbacks. Curr Rev Musculoskelet Med. 2017;10(1):141-145.
  20. Johnson KB, et al. Precision medicine, AI, and the future of personalized health care. Clin Transl Sci. 2021;14(1):86-93.
  21. Hirani R, et al. Artificial intelligence and healthcare: A journey through history, present innovations, and future possibilities. Life (Basel). 2024;14(5):557.
  22. Karatas G, Kirik F, Karatas ME, Cakir A, Ozdemir H. Comparative performance of ChatGPT o3-mini-high and DeepSeek-R1 in ophthalmology: An evaluation of diagnostic reasoning and case-based problem solving. J Fr Ophtalmol. 2025;49(1):104712.
  23. Hanci V, et al. Assessment of readability, reliability, and quality of ChatGPT, Bard, Gemini, Copilot, and Perplexity responses on palliative care. Medicine (Baltimore). 2024;103(33):e39305.
  24. Liu C, et al. Potential to perpetuate social biases in health care by Chinese large language models: A model evaluation study. Int J Equity Health. 2025;24(1):206.
  25. Haupt CE, Marks M. AI-generated medical advice—GPT and beyond. JAMA. 2023;329(16):1349-1350.
  26. Aydin S, Karabacak M, Vlachos V, Margetis K. Large language models in patient education: A scoping review of applications in medicine. Front Med (Lausanne). 2024;11:1477898.
  27. Kara M, et al. Evaluating the readability, quality, and reliability of responses generated by ChatGPT, Gemini, and Perplexity on the most commonly asked questions about ankylosing spondylitis. PLoS One. 2025;20(6):e0326351.
  28. Perez Rivera LR, et al. Evaluating the quality and reliability of large language models for plastic surgery patient education: A comparative analysis of ChatGPT and OpenEvidence. Aesthet Surg J. 2025. doi:10.1093/asj/sjaf249.
  29. Wilhelm TI, Roos J, Kaczmarczyk R. Large language models for therapy recommendations across three clinical specialties: Comparative study. J Med Internet Res. 2023;25:e49324.
  30. Will J, et al. Enhancing the readability of online patient education materials using large language models: Cross-sectional study. J Med Internet Res. 2025;27:e69955.
  31. Tukur Jido J, Al-Wizni A, Aung SL. Readability of AI-generated patient information leaflets on Alzheimer's disease, vascular dementia, and delirium. Cureus. 2025;17(6):e85463.
  32. Luo Z, Lin C, Kim TH, Shin YS, Ahn ST. Quality and readability analysis of artificial intelligence-generated medical information related to prostate cancer: A cross-sectional study of ChatGPT and DeepSeek. World J Mens Health. 2025. doi:10.5534/wjmh.250144.
  33. Joseph P, Silva NA, Nanda A, Gupta G. Evaluating the readability of online patient education materials for trigeminal neuralgia. World Neurosurg. 2020;144:e934-e938.
  34. Dong C, et al. Comparative evaluation of large language models in delivering guideline-compliant recommendations for topical NSAID use in musculoskeletal pain: A multidimensional analysis. Clin Rheumatol. 2025;44(11):4703-4710.
  35. Ozduran E, Buyukcoban S. Evaluating the readability, quality, and reliability of online patient education materials on post-COVID pain. PeerJ. 2022;10:e13686.
  36. Wang LW, Miller MJ, Schmitt MR, Wen FK. Assessing readability formula differences with written health information materials: Application, results, and recommendations. Res Social Adm Pharm. 2013;9(5):503-516.
  37. Singh SP, et al. Comprehension profile of patient education materials in endocrine care. Kans J Med. 2022;15(2):247-252.
  38. Marder RS, et al. ChatGPT-3.5 and ChatGPT-4.0 do not reliably create readable patient education materials for common orthopaedic upper- and lower-extremity conditions. Arthrosc Sports Med Rehabil. 2025;7(1):101027.
  39. Nasra M, et al. Can artificial intelligence improve patient educational material readability? A systematic review and narrative synthesis. Intern Med J. 2025;55(1):20-34.
  40. Bhatt C, et al. Evaluating readability, understandability, and actionability of online printable patient education materials for cholesterol management: A systematic review. J Am Heart Assoc. 2024;13(8):e030140.
  41. Avra TD, Le M, Hernandez S, Thure K, Ulloa JG. Readability assessment of online peripheral artery disease education materials. J Vasc Surg. 2022;76(6):1728-1732.
  42. Rooney MK, et al. Readability of patient education materials from high-impact medical journals: A 20-year analysis. J Patient Exp. 2021;8:2374373521998847.
  43. Ahmadzadeh K, et al. Patient education information material assessment criteria: A scoping review. Health Info Libr J. 2023;40(1):3-28.
  44. Duan L, Yao Z, Li X, Wu Y, Sheng D. Comparing large language models and human doctors in symptom-driven online medical consultations: A case study on trigeminal neuralgia. Digit Health. 2025;11:20552076251388140.
  45. Werner C, Harden J, Lawton J. Pathways to a diagnosis of trigeminal neuralgia: A qualitative study of patients' experiences. BMC Prim Care. 2025;26(1):65.

Yeniden basım ve izinler

Etiketler

B y k Dil ModelleriOkunabilirlik De erlendirmesiE itsel KalitePEMAT De erlendirmesiGlobal Kalite SkoruSa l k Bilgisi KalitesiModel Kar la t rmasHasta Kavray