Bu çalışma yalnızca yapay zeka tarafından oluşturulan metinleri analiz etmiştir; insan katılımcıları, hayvanları, biyolojik örnekleri, tıbbi kayıtları, tanımlanabilir kişisel bilgileri veya klinik bakım müdahalesini kapsamamaktadır. Bu nedenle, etik kurul incelemesi ve resmi bilgilendirilmiş onam uygulanmamıştır.
Çalışma tasarımı
Bu kesitsel çalışma, TN hakkında sıkça sorulan sorulara yanıt olarak beş LLM tarafından üretilen yanıtların okunabilirliğini, kalitesini ve eğitimsel uygunluğunu değerlendirmiştir.
Sıkça sorulan TN ile ilgili soruların belirlenmesi
25 Kasım 2025 tarihinde, ağrı tıbbı konusunda kapsamlı deneyime sahip iki klinik uzman; Uluslararası Baş Ağrısı Bozuklukları Sınıflandırması, 3. baskı (ICHD-3), Avrupa Nöroloji Akademisi kılavuzu ve Amerikan Nöroloji Akademisi/Avrupa Nörolojik Cemiyetler Federasyonu kılavuzu dahil olmak üzere trigeminal nevralji (TN) için mevcut klinik kılavuzları bağımsız olarak incelemiştir1,10,11. Bir konsensüs tartışmasının ardından, klinik uygulamada yaygın olarak karşılaşılan TN ile ilgili 20 soruluk bir liste derlemişlerdir. Soru sayısı, önceden tanımlanmış beş tematik alanın dengeli bir şekilde kapsanmasını sağlamak amacıyla a priori olarak belirlenmiş ve her alan için dört soru seçilmiştir; böylece model tarafından üretilen toplam yanıt sayısı, uzmanlar tarafından manuel olarak derecelendirme ve doğrulama yapılabilmesi için uygun bir aralıkta tutulmuştur. Tekrarlanabilirliği artırmak için seçim süreci, önceden tanımlanmış alan tabanlı bir çerçeve izlemiştir: uzmanlar önce her alan içindeki aday soruları belirlemiş, bunları klinik uygunluk, hasta odaklı dil ve tekrarlardan kaçınma açısından bağımsız olarak incelemiş ve ardından alan başına nihai dört soru üzerinde konsensüse varmışlardır. Soruların nihai listesi Tablo 1 ve Ek Dosya 1'de sunulmuştur. Önceden tanımlanmış beş tematik alan; temel hastalık bilgisi, etiyoloji ve risk faktörleri, tanı, tedavi ile önleme ve rehabilitasyondan oluşmaktadır. Soru seti hasta arama kayıtlarından, çevrimiçi arama sorgularından veya resmi hasta mülakatlarından türetilmediği için, seçim yanlılığı potansiyeli bir çalışma kısıtlılığı olarak kabul edilmektedir.
Yapay zeka modelleri ve veri toplama prosedürü
25 Kasım 2025 tarihinde, TN ile ilgili kesinleştirilmiş 20 soruluk set; Doubao, DeepSeek, Wenxin Yiyan, Tongyi Qianwen ve GPT-5/ChatGPT olmak üzere halka açık beş büyük dil modeli (LLM) platformuna iletilmiştir. Tüm modellere standart halka açık web tabanlı sohbet arayüzleri üzerinden erişilmiş; uygulama programlama arayüzü (API) erişimi kullanılmamıştır. Her platform için, veri toplama tarihinde mevcut olan ve herhangi bir üretim parametresi değiştirilmeden kullanılan varsayılan halka açık model tercih edilmiştir. Halka açık web arayüzleri; arka uç model anlık görüntü tanımlayıcılarını, gizli sistem istemlerini, sıcaklığı (temperature), top-p değerini, maksimum çıktı token sayısını veya diğer üretim parametrelerini görüntülemediğinden, bu kalemler "halka açık web arayüzünde görüntülenmedi" şeklinde kaydedilmiştir.
Tüm modeller için istem ve yanıt dilleri İngilizceydi. Her standartlaştırılmış istem, modele özgü herhangi bir ek talimat olmaksızın yalnızca İngilizce sorunun aynından oluşmuştur. Her soru; önceki konuşma geçmişi, yüklenmiş dosyalar, eklentiler, özelleştirilmiş talimatlar veya takip istemleri olmaksızın yeni ve bağımsız bir sohbet oturumunda bireysel olarak gönderilmiştir. Standartlaştırılmış istemlerin tam listesi ve bunlara karşılık gelen ham model çıktıları Ek Dosya 1'de sunulmuştur. Model meta verileri ve veri toplama ayarları Ek Tablo 1'de özetlenmiştir.
Okunabilirlik değerlendirmesi
LLM tarafından oluşturulan yanıtların okunabilirliği, çevrimiçi bir okunabilirlik değerlendirme platformu (http://readabilityformulas.com/) üzerinden erişilebilen birden fazla yerleşik okunabilirlik formülü kullanılarak değerlendirilmiştir. Okunabilirlik değerlendirmesi için evrensel olarak kabul görmüş tek bir altın standart olmaması nedeniyle ve önceki çalışmalarla tutarlı olarak, yaygın olarak kullanılan kapsamlı bir okunabilirlik indeksleri seti uygulanmıştır23,27. Herhangi bir tek formüle olan bağımlılığı azaltmak amacıyla; cümle uzunluğu, kelime uzunluğu, hece yükü, karakter tabanlı karmaşıklık, okuma kolaylığı ve tahmini sınıf düzeyi dahil olmak üzere okunabilirliğin birbirini tamamlayan yönlerini yakalamak için yedi indeks seçilmiştir. Spesifik olarak, Coleman-Liau İndeksi (CL), Linsear Write Formülü (LW), Otomatik Okunabilirlik İndeksi (ARI), Simple Measure of Gobbledygook (SMOG), Gunning Fog İndeksi (GFOG), Flesch Okuma Kolaylığı Puanı (FRES) ve Flesch-Kincaid Sınıf Düzeyi (FKGL) hesaplanmıştır. Bu indeksler okuma zorluğunu veya sınıf düzeyini tahmin ederek metin okunabilirliğine dair nicel ölçütler sunmaktadır (Tablo 2).
Eğitimsel uygunluk ve bilgi kalitesinin değerlendirilmesi
Eğitimsel uygunluk, anlaşılırlık ve uygulanabilirlik olmak üzere iki alandan oluşan Hasta Eğitim Materyalleri Değerlendirme Aracı (PEMAT) kullanılarak değerlendirilmiştir28. Araç, 16'sı anlaşılırlığı ve sekizi uygulanabilirliği değerlendiren toplam 24 maddeden oluşmaktadır. Her madde iki seçenekli olarak puanlanmış (0 = kriter karşılanmadı; 1 = kriter karşılandı) ve 0 ile 24 arasında toplam bir puan elde edilmiştir; yüksek puanlar, hasta eğitimi için daha yüksek uygunluğu göstermektedir. Genel bilgi kalitesi, tıbbi bilgilerin kalitesini değerlendirmek için yaygın olarak kullanılan beşli Likert ölçeği olan Global Kalite Skoru (GQS) ile değerlendirilmiştir27 (Tablo 3).
25 Kasım 2025 tarihinde, TN yönetiminde 3 yılı aşkın deneyime sahip iki klinik uzman, her iki değerlendirme aracını kullanarak yapay zeka tarafından oluşturulan tüm yanıtları değerlendirmiştir. Puanlamadan önce, yapay zeka tarafından oluşturulan tüm yanıtlar kodlanmış yanıt tanımlayıcıları ile anonimize edilmiş ve değerlendiriciler PEMAT ve GQS değerlendirmeleri sırasında LLM platformuna karşı körlenmiştir. Uyuşmazlıklar, nihai puanlara karar veren üçüncü bir kıdemli uzman tarafından çözülmüştür. Değerlendiriciler arası güvenilirlik Cohen's kappa katsayısı ile değerlendirilmiş; >0.75 değerleri mükemmel uyumu, 0.40–0.75 değerleri kabul edilebilir uyumu ve <0.40 değerleri ise zayıf uyumu göstermiştir. Hem PEMAT hem de GQS için Cohen's kappa değerleri 0.75'i aşmış ve mükemmel değerlendiriciler arası güvenilirlik göstermiştir.
İstatistiksel analiz
Tüm istatistiksel analizler R yazılımı (versiyon 4.4.3) kullanılarak gerçekleştirilmiştir. Verilerin normalliği Shapiro-Wilk testi ve Q-Q grafikleri ile değerlendirilmiştir. Normal dağılım gösteren değişkenler ortalama ± standart sapma olarak özetlenmiş ve tek yönlü varyans analizi (ANOVA) ile karşılaştırılmış, uygun olduğunda Tukey post hoc testi uygulanmıştır. Normal dağılım göstermeyen değişkenler medyan ve çeyrekler arası aralık olarak özetlenmiş ve Kruskal-Wallis testi ile karşılaştırılmış, ardından ikili karşılaştırmalar için Bonferroni düzeltmeli Dunn post hoc testi uygulanmıştır. Okunabilirlik indeksleri, PEMAT puanları ve GQS değerleri arasındaki korelasyonlar, çoklu testler için Benjamini-Hochberg düzeltmesi uygulanarak Spearman sıra korelasyon katsayısı ile değerlendirilmiştir. İki yönlü düzeltilmiş P değeri < 0.05 istatistiksel olarak anlamlı kabul edilmiştir.