Önerilen XAI çerçevesi, temsili sağlık veri seti olarak Pima Indians Diabetes Veri Seti kullanılarak uygulanmıştır. Pima Indians Diabetes Veri Seti, tek deneysel doğrulama veri seti olarak kullanılmıştır. Rapor edilen tüm öngörücü, açıklanabilirlik, istatistiksel ve tekrarlanabilirlik sonuçları bu veri setinden elde edilmiştir. TCGA-BRCA, TCGA-UCEC, MIMIC-III, ISIC 2019, HAM10000, OhioT1DM ve BraTS 2021 deneysel olarak değerlendirilmemiş olup, yalnızca genel protokolün farklı sağlık veri modaliteleri genelindeki uygulanabilirliğini gösteren örnekler olarak dahil edilmiştir. Geçersiz ve yinelenen kayıtlar çıkarıldıktan ve model geliştirme öncesinde belirtilen ön işleme işlemleri gerçekleştirildikten sonra veri setinin tamamı kullanılmıştır. Veri seti, önceden tanımlanmış tabakalı bir bölme stratejisi kullanılarak bağımsız eğitim, doğrulama ve test alt kümelerine ayrılmıştır. Veri sızıntısı olasılığını minimize etmek için üç alt küme arasındaki örnek bağımsızlığı korunmuştur.
Tahminleyici model, önceden tanımlanmış mimari ve hiperparametreler kullanılarak yapılandırılmıştır. Model, önceden belirlenmiş öğrenme oranı ve paket boyutu ile Adam optimizasyonu kullanılarak 100 epoka kadar eğitilmiştir. Doğrulama kaybına dayalı erken durdurma uygulanmış ve en iyi doğrulama performansına karşılık gelen model saklanmıştır. Tekrarlanabilirliği artırmak amacıyla veri kümesi bölümlendirme, model başlatma ve tekrarlanan deneyler için rastgele tohumlar belirlenmiştir.
Eğitilen model; doğruluk, kesinlik, duyarlılık, özgüllük, F1-skoru, Matthews korelasyon katsayısı (MCC), alıcı işletim karakteristik eğrisi altındaki alan (AUC-ROC) ve ortalama kesinlik (AP) kullanılarak bağımsız test seti üzerinde değerlendirildi. Önerilen model; aynı ön işleme prosedürleri, veri bölümleri ve değerlendirme protokolleri kullanılarak önceden tanımlanmış temel modellerle karşılaştırıldı. Bağımsız test seti tahminlerinden alıcı işletim karakteristik (ROC) eğrileri, kesinlik-duyarlılık eğrileri ve bir hata matrisi oluşturuldu.
Performans kararlılığını değerlendirmek için eğitim verileri üzerinde beş katlı çapraz doğrulama gerçekleştirilmiştir. Temel performans metrikleri için %95 güven aralıkları tahmin edilmiş ve önerilen model ile temel modeller arasında önceden tanımlanmış istatistiksel karşılaştırmalar yapılmıştır.
Beş katlı çapraz doğrulama sonucunda %93,01 ± 0,48 doğruluk, 0,954 ± 0,007 AUC-ROC, %92,42 ± 0,87 kesinlik, %93,02 ± 0,45 duyarlılık ve %92,72 ± 0,62 F1-skoru elde edilmiştir. 1.000 yeniden örnekleme ile tahmin edilen %95 bootstrap güven aralıkları; doğruluk için 0,897–0,973, kesinlik için 0,890–0,970, duyarlılık için 0,880–0,963, F1-skoru için 0,887–0,965 ve AUC-ROC için 0,931–0,984 olarak belirlenmiştir. CNN, Random Forest ve SVM temel modelleri ile yapılan istatistiksel karşılaştırmalarda; doğruluk için McNemar testi, AUC-ROC için DeLong testi ve F1-skoru için 1.000 yeniden örneklemeli eşleştirilmiş bootstrap testi kullanılmıştır.
Tam eğitim ve değerlendirme prosedürü, farklı rastgele tohumlar kullanılarak 10 bağımsız çalışma boyunca tekrarlanmıştır. Tekrarlanan çalışmalar; 0.957 ± 0.008 AUC-ROC, %93.24 ± 0.74 doğruluk ve %92.35 ± 0.92 F1-skoru vermiş olup, bu durum tekrarlanan yürütmeler arasında nispeten düşük değişkenliğe işaret etmektedir. Tekrarlanan yürütmeler boyunca elde edilen performans metrikleri, ortalama ve standart sapma kullanılarak özetlenmiştir. Tahmin performansının tekrarlanan yürütme altında kararlı kalıp kalmadığını belirlemek için çalışmalar arasındaki değişkenlik incelenmiştir.
Bu çalışmada bağımsız bir harici veri seti kullanılmadığı için harici doğrulama gerçekleştirilmemiştir. Buna bağlı olarak, rapor edilen tüm öngörücü, istatistiksel ve tekrarlanabilirlik sonuçları, önceden tanımlanmış eğitim, doğrulama ve bağımsız test bölümleri kullanılarak Pima Indians Diabetes Veri Seti'nden elde edilmiştir. Farklı bir kurum, popülasyon, coğrafi bölge veya zaman dilimine ait bağımsız bir veri setinin mevcut olduğu uygulamalar için harici doğrulama, protokolde isteğe bağlı bir prosedür olarak tutulmuştur.
Model açıklamaları, SHAP ve LIME dahil olmak üzere, tablo şeklindeki Pima Indians Diabetes Veri Seti'ne uygulanabilir açıklanabilirlik teknikleri kullanılarak oluşturulmuştur. Küresel özellik önemi değerlendirilmiş ve ayrılmış test örnekleri kullanılarak hastaya özgü yerel açıklamalar üretilmiştir. Tekrar üretilebilirliği ve sonraki yorumlamaları kolaylaştırmak için açıklama çıktıları, ilgili model tahminleri ve özellik değerleriyle birlikte kaydedilmiştir.
Netlik sağlamak adına, mevcut uygulamalı örnek, Tablo 1'de tanımlanan dokuz temel iş akışı aşamasından oluşmuştur. Dış doğrulama ve klinik uzman değerlendirmesi, genel protokolün isteğe bağlı doğrulama modülleri olarak tutulmuştur. Bağımsız bir dış veri seti kullanılmadığı için dış doğrulama yapılmamıştır ve mevcut uygulamalı örneğe resmi bir uzman değerlendirme paneli dahil edilmediği için klinik uzman değerlendirmesi gerçekleştirilmemiştir. Buna göre, bu isteğe bağlı modüller dokuz aşamalı deneysel iş akışının bir parçası olarak değerlendirilmemiş ve deneysel sonuçlar olarak raporlanmamıştır.
Ön işleme ve veri seti bölümlendirme prosedürleri, model geliştirme için uygun, standardize edilmiş bir veri seti oluşturmuştur. Yinelenen ve tutarsız kayıtlar kaldırılmış, eksik değerler önceden tanımlanmış stratejiye göre ele alınmış, sayısal öznitelikler standardize edilmiş ve veri seti bağımsız eğitim, doğrulama ve test alt kümelerine bölünmüştür. Ortaya çıkan veri seti özellikleri ve ön işleme prosedürleri Tablo 2'de özetlenmiştir. Genel sağlık hizmetleri veri seti hazırlama ve ön işleme iş akışı Şekil 2'de gösterilirken, özellikle Pima Yerlileri Diyabet Veri Seti'ne uygulanan deneysel hazırlama, ön işleme, bölümlendirme ve kalite değerlendirme iş akışı Şekil 3'te gösterilmiştir. Rapor edilen sonuçları oluşturmak için kullanılan nihai hesaplama ortamı, model mimarisi ve hiperparametre yapılandırması Tablo 3'te özetlenmiştir.
Bölüm 3 ve 4'ün uygulanması, model geliştirme için uygun, standardize edilmiş bir sağlık hizmetleri veri seti sağlamıştır. Ön işleme prosedürleri ile yinelenen ve tutarsız kayıtlar temizlenmiş, eksik değerler tamamlanmış, sayısal özellikler standardize edilmiş, uygun olan kategorik değişkenler kodlanmış ve veri seti eğitim, doğrulama ve test alt kümelerine ayrılmıştır. Elde edilen veriler, sonraki model geliştirme aşamaları için gerekli olan standardize edilmiş girdiyi sağlamıştır.
Bölüm 5 ve 6 tamamlandıktan sonra, yapılandırılan model eğitim sırasında stabil bir yakınsama göstermiştir. Öğrenme eğrileri, eğitim ve doğrulama kayıplarında eş zamanlı azalmalar ile eğitim ve doğrulama doğruluğunda artışlar sergilemiştir. Hiperparametre optimizasyonu, belirgin bir aşırı öğrenme (overfitting) kanıtı olmaksızın modelin genelleme yeteneğini geliştirmiştir. Tekrarlanabilirliği desteklemek amacıyla, optimize edilen model; kesinleştirilmiş mimari, hiperparametre ayarları, yazılım versiyonları, rastgele tohumlar (random seeds) ve eğitilmiş model ağırlıkları ile birlikte arşivlenmiştir. Model eğitim spesifikasyonları ve optimizasyon sonuçları Tablo 4'te özetlenmiş; ilgili eğitim ve doğrulama öğrenme eğrileri ise Şekil 4'te sunulmuştur.
Bölüm 7, modelin öngörücü performansını standartlaştırılmış performans metrikleri kullanarak değerlendirmiştir. Değerlendirilen sınıflandırma metrikleri arasında doğruluk, kesinlik, geri çağırma, özgüllük, F1-skoru, MCC, AUC-ROC ve AP yer almıştır. Önerilen model; aynı veri seti bölümleri, ön işleme prosedürleri ve değerlendirme protokolü kullanılarak önceden tanımlanmış temel modellerle karşılaştırılmıştır. Öngörücü performans karşılaştırması Tablo 5'te sunulurken; ROC eğrileri, kesinlik-geri çağırma eğrileri, konfüzyon matrisi ve karşılaştırmalı performans metrikleri Şekil 5'te gösterilmiştir.
Bölüm 8'i takiben, modelin yorumlanabilirliğini değerlendirmek amacıyla model tahminlerinin hem küresel hem de yerel açıklamaları oluşturulmuştur. Tablo halindeki Pima Kızılderilileri Diyabet Veri Kümesi için model açıklamaları SHAP ve LIME kullanılarak oluşturulmuş ve tahmindeki bir değişikliği örneklendirmek için hastaya özgü bir karşıolgusal (counterfactual) açıklama üretilmiştir. Küresel özellik önemi, hastaya özgü şelale (waterfall) ve özellik bağımlılığı görselleştirmeleri oluşturmak için SHAP kullanılırken, ayrılmış test örneklerinden yerel açıklamalar oluşturmak için LIME kullanılmıştır. İlgili açıklanabilirlik çıktıları Şekil 6'da sunulmuştur.
Protokolün son aşamasında, iş akışının istatistiksel güvenilirliği ve tekrarlanabilirliği değerlendirilmiştir. Tüm iş akışı; aynı veri seti bölme stratejisi, ön işleme parametreleri, model mimarisi, hiperparametreler, yazılım ortamı ve değerlendirme prosedürleri korunarak, farklı rastgele başlangıç değerleri (random seeds) kullanılarak 10 bağımsız çalışma boyunca tekrarlanmıştır. Tekrarlanan çalışmalar sonucunda 0,957 ± 0,008 AUC-ROC, %93,24 ± 0,74 doğruluk (accuracy) ve %92,35 ± 0,92 F1-skoru elde edilmiş olup, bu değerler tekrarlanan yürütmeler arasında nispeten düşük bir değişkenliğe işaret etmektedir.
Mevcut doğrulama çalışmasında açıklama stabilitesi nicel olarak değerlendirilmemiştir. Pima Kızılderilileri Diyabet Veri Seti için SHAP ve LIME açıklamaları oluşturulmuş olsa da, ayrı bir çalıştırmalar arası sıra-korelasyon veya özellik-çakışma analizi gerçekleştirilmemiştir. Bu nedenle, herhangi bir sayısal açıklama stabilitesi veya atıf-uyum metriği rapor edilmemiştir. Nicel açıklama-stabilite değerlendirmesi, tekrarlanan açıklama çıktılarının mevcut olduğu uygulamalar için isteğe bağlı bir tekrarlanabilirlik prosedürü olarak genel protokolde tutulmuştur.
İstatistiki karşılaştırmalar, önceden tanımlanmış p < 0.05 anlamlılık eşiği kullanılarak değerlendirildi. Uygun olan durumlarda çift yönlü istatistiki testler kullanıldı ve gözlemlenen performans farklılıklarının istatistiki anlamlılığını ve belirsizliğini nicelleştirmek için ilgili test istatistikleri, p-değerleri ve %95 güven aralıkları raporlandı. Çapraz doğrulama performansı, güven aralıkları, istatistiki karşılaştırmalar ve tekrarlanan çalışma değişkenliği dahil olmak üzere deneysel istatistiki doğrulama ve tekrarlanabilirlik sonuçları Tablo 6'da özetlenmiştir. İlgili istatistiki testler ve tekrarlanabilirlik analizleri Şekil 7'de gösterilmiştir.
Bu sonuçlar, test edilen hesaplama koşulları ve veri seti altında öngörülebilir stabilite ve tekrarlanabilirliğe dair deneysel kanıt sağlamıştır. Bağımsız replikasyon için gerekli olan hesaplama ortamı, veri seti özellikleri, ön işleme prosedürleri, model konfigürasyonu, istatistiksel analizler ve açıklanabilirlik ayarları, Tablo 7'de sunulan tekrarlanabilirlik kontrol listesine uygun olarak belgelenmiştir. Mevcut çalışmanın uygulamalı doğrulama örneğinde, üretilen XAI çıktılarının klinik uzman değerlendirmesi gerçekleştirilmemiştir.
Genel olarak, protokolün uygulanması, yapay zeka model geliştirme sürecine uygun standartlaştırılmış bir sağlık veri seti ve önceden tanımlanmış hiperparametre ayarları kullanılarak optimize edilmiş bir model sağlamıştır. İş akışı; öngörücü performansın sistematik değerlendirilmesine, uygun XAI teknikleri kullanılarak model açıklamalarının oluşturulmasına ve modelin dayanıklılığı ile tekrarlanabilirliğinin istatistiksel analizine olanak tanımıştır. Sonuçlar hep birlikte, üzerinde çalışılan doğrulama örneğinde değerlendirilen deneysel koşullar altında önerilen XAI iş akışının uygulandığını ve tekrarlanabilir olduğunu göstermiştir.

Şekil 1: Sağlık hizmetlerinde tekrarlanabilir ve açıklanabilir yapay zeka modelleri geliştirmek için dokuz aşamalı temel iş akışı. İş akışı şunları içerir: (1) sağlık hizmetleri tahmin görevinin tanımlanması, (2) hesaplama ortamı konfigürasyonu, (3) veri seti edinimi ve doğrulaması, (4) veri ön işlemesi, (5) veri setinin bölümlendirilmesi, (6) öngörücü model eğitimi, (7) öngörücü performans değerlendirmesi, (8) açıklanabilirlik analizi ve (9) istatistiksel doğrulama ve tekrarlanabilirlik değerlendirmesi. Dış doğrulama ve klinik uzman değerlendirmesi, isteğe bağlı protokol uzantıları olarak ele alınmıştır ve dokuz aşamalı temel iş akışına dahil edilmemiştir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 2: Sağlık hizmetleri veri seti hazırlama ve ön işleme iş akışı. (A) Klinik kayıtlar, tıbbi görüntüleme, fizyolojik sinyaller ve multimodal veri kaynaklarından sağlık verilerinin edinimi. (B) Eksik değerlerin yönetimi, normalizasyon, gürültü giderme ve veri artırma dahil olmak üzere veri entegrasyonu ve ön işleme. (C) Veri setinin eğitim, doğrulama ve test alt kümelerine bölünmesi. (D) Model geliştirme öncesinde sınıf dağılımını, öznitelik normalizasyonunu ve ön işleme çıktılarını gösteren kalite değerlendirmesi. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayınız.

Şekil 3: Pima Kızılderilileri Diyabet Veri Seti'nin hazırlanması, ön işlemesi, bölümlenmesi ve kalite değerlendirmesine yönelik deneysel iş akışı. İş akışı; veri setinin edinilmesi, veri kalitesinin değerlendirilmesi, geçersiz ve eksik değerlerin yönetilmesi, sayısal özelliklerin standardizasyonu, veri setinin eğitim, doğrulama ve bağımsız test alt kümelerine bölünmesi ve model geliştirme öncesindeki son kalite doğrulamasını içerir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayınız.

Şekil 4: Pima Indians Diabetes Veri Kümesi kullanılarak önerilen modelin deneysel eğitim ve doğrulama öğrenme eğrileri. (A) Tüm eğitim süreci boyunca eğitim ve doğrulama kaybı. (B) Tüm eğitim süreci boyunca eğitim ve doğrulama doğruluğu. (C) 50–100. epoklar arasındaki kaybın büyütülmüş görünümü. (D) 50–100. epoklar arasındaki doğruluğun büyütülmüş görünümü. En iyi doğrulama performansı, 0.142 doğrulama kaybı ve %94.6 doğrulama doğruluğu ile 78. epokta elde edilmiştir. Erken durdurma, 10 epokluk bir sabır (patience) değeri kullanılarak 88. epokta tetiklenmiştir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 5: Bağımsız test seti (n = 154) kullanılarak önerilen XAI çerçevesinin deneysel öngörücü performans değerlendirmesi. (A) Önerilen XAI modelinin ve temel modellerin ayırdetme performansını gösteren Alıcı İşletim Karakteristiği (ROC) eğrisi. (B) Önerilen XAI modelinin ve temel modellerin kesinlik ve duyarlılık performansını gösteren Kesinlik–Duyarlılık (PR) eğrileri. (C) Önerilen XAI modelinin bağımsız test setindeki konfüzyon matrisi ile buna karşılık gelen doğruluk, duyarlılık (recall) ve özgüllük değerleri. (D) Değerlendirilen modeller genelinde doğruluk, kesinlik, duyarlılık, özgüllük, F1-skoru, Matthews korelasyon katsayısı (MCC), ROC eğri altı alanı (AUC) ve ortalama kesinliğin (AP) karşılaştırılması. Bu şekilde gösterilen tüm nicel sonuçlar, Pima Indians Diabetes Veri Kümesi üzerindeki doğrulama deneyine karşılık gelmektedir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 6: Pima Indians Diabetes Dataset üzerinde eğitilen önerilen modelin bağımsız test seti tahminlerinden üretilen açıklanabilirlik çıktıları. (A) Test seti genelinde özellik katkılarının dağılımını gösteren küresel SHAP özet grafiği. (B) Ortalama mutlak SHAP değerlerine dayalı SHAP özellik önem grafiği. (C) Bireysel özelliklerin tahmin edilen diyabet olasılığına katkılarını gösteren hastaya özel SHAP şelale grafiği. (D) Test Hastası #125 için özellik katkılarını gösteren LIME yerel açıklaması. (E) Glikoz değerleri ile bunların SHAP katkıları arasındaki ilişkiyi gösteren SHAP bağımlılık grafiği. (F) Model tahminindeki bir değişiklikle ilişkili minimum özellik değişikliklerini gösteren hastaya özel karşıolgusal açıklama. Kısaltmalar: SHAP = Shapley Additive exPlanations; LIME = Local Interpretable Model-agnostic Explanations. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayınız.

Şekil 7: Önerilen modelin Pima Indians Diabetes Veri Seti kullanılarak yapılan deneysel istatistiksel doğrulaması ve tekrarlanabilirlik analizi. (A) Eğitim seti üzerinde beş katlı çapraz doğrulama performansı. (B) Bağımsız test seti performansı için %95 bootstrap güven aralıkları. (C) İstatistiksel test, test istatistiği, p-değeri ve anlamlılık dahil olmak üzere temel modellerle yapılan istatistiksel karşılaştırmalar. (D) Farklı rastgele tohumlar kullanılarak gerçekleştirilen 10 bağımsız çalıştırma genelindeki performans tutarlılığı. Eşli sınıflandırma doğruluğu için McNemar testi, ilişkili ROC-AUC için DeLong testi ve F1-skoru karşılaştırması için 1.000 yeniden örnekleme ile eşli bootstrap testi kullanılmıştır. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
| Aşama | Protokol faaliyeti | Beklenen çıktı | Uygulama durumu |
| 1 | Sağlık hizmetleri veri setini seçin ve doğrulayın | Doğrulanmış veri seti, tahmin hedefi, sınıf dağılımı ve veri kalitesi bilgileri | Gerçekleştirildi |
| 2 | Hesaplama ortamını yapılandırın | Doğrulanmış donanım, yazılım, kütüphaneler, sürümler ve hesaplama konfigürasyonu | Gerçekleştirildi |
| 3 | Sağlık hizmetleri verilerini ön işlemeden geçirin ve kalite kontrolünü yapın | Temizlenmiş, dönüştürülmüş ve standartlaştırılmış veri seti | Gerçekleştirildi |
| 4 | Veri setini bölümlere ayırın | Bağımsız eğitim, doğrulama ve test veri setleri | Gerçekleştirildi |
| 5 | Tahminleyici/XAI modelini geliştirin ve optimize edin | Kesinleştirilmiş model mimarisi ve hiperparametreler | Gerçekleştirildi |
| 6 | Modeli eğitin ve saklayın | Eğitilmiş model, kontrol noktası, eğitim konfigürasyonu ve günlük kayıtları | Gerçekleştirildi |
| 7 | Tahminleyici ve hesaplama performansını değerlendirin | Test seti performans metrikleri ve performans karşılaştırmaları | Gerçekleştirildi |
| 8 | Açıklanabilirlik çıktılarını oluşturun ve değerlendirin | SHAP/LIME ve ilgili açıklama çıktıları | Gerçekleştirildi |
| 9 | İstatistiksel doğrulama ve tekrarlanabilirlik değerlendirmesi yapın | Güven aralıkları, istatistiksel testler, tekrarlanan çalışma sonuçları ve tekrarlanabilirlik ölçümleri | Gerçekleştirildi |
Tablo 1: Pima Kızılderilileri Diyabet Veri Kümesi kullanılarak yapılan çalışma doğrulamasında uygulanan dokuz aşamalı temel protokol iş akışının özeti. Tablo, Pima Kızılderilileri Diyabet Veri Kümesi çalışma örneğinde uygulanan dokuz aşamayı, genel protokolün isteğe bağlı bileşenleri olarak tutulan harici doğrulamadan ve klinik uzman değerlendirmesinden ayırmaktadır.
| Veri Seti | Veri Kaynağı | Klinik Uygulama | Veri Modalitesi | Denekler/Kayıtlar | Numuneler | Sınıflar | Sınıf Dağılımı | Eğitim/Doğrulama/Test | Mevcut Çalışmadaki Rolü | Doğrulama Durumu | Kaynak URL |
| Pima İndianlar Diyabet Veri Seti | UCI Makine Öğrenmesi Deposu | Diyabet öngörüsü | Klinik tablo | 768 kayıt | 768 | 2 | 500 diyabetik olmayan; 268 diyabetik | 60% / 20% / 20% | Birincil deneysel doğrulama veri seti | Gerçekleştirildi – dokuz aşamalı temel iş akışı tamamlandı | Pima Kızılderilileri Diyabeti |
| TCGA-BRCA | NCI Genomik Veri Ortak Platformu (GDC), TCGA-BRCA projesi | Meme kanseri sınıflandırması | Klinik + histopatoloji | 1.098 vaka | Veri türüne göre veri setine bağımlı | Bitiş noktasına bağımlı | Veri seti genelinde tek bir sınıf dağılımı yoktur | Uygulanamaz – herhangi bir deneysel ayrım gerçekleştirilmemiştir | Yalnızca protokol uygulanabilirlik örneği | Deneysel doğrulama için kullanılmamıştır | https://portal.gdc.cancer.gov/projects/TCGA-BRCA |
| TCGA-UCEC | NCI Genomik Veri Ortaklığı (GDC), TCGA-UCEC projesi | Endometriyum kanseri sınıflaması | Klinik + histopatoloji | Proje kohortu; büyüklük seçilen veri türüne ve filtrelere bağlıdır | Veri türüne göre veri setine bağımlı | Uç nokta bağımlı | Veri seti genelinde tek bir sınıf dağılımı yoktur | Uygulanamaz – herhangi bir deneysel ayırım yapılmamıştır | Yalnızca protokol uygulanabilirlik örneği | Deneysel doğrulama için kullanılmamıştır | https://portal.gdc.cancer.gov/projects/TCGA-UCEC |
| MIMIC-III | PhysioNet, MIMIC-III Klinik Veritabanı v1.4 | Klinik sonuç tahmini | Klinik zaman serileri | 46.520 hasta | 58.976 YBÜ yatışı | Göreve bağlı | Veritabanı genelinde tek bir sınıf dağılımı yoktur | Uygulanamaz – herhangi bir deneysel ayırma gerçekleştirilmemiştir | Sadece protokol uygulanabilirlik örneği | Deneysel doğrulama için kullanılmamıştır | https://physionet.org/content/mimiciii/1.4/ |
| ISIC 2019 | Uluslararası Cilt Görüntüleme İş Birliği (ISIC) Yarışması | Deri lezyonu sınıflandırması | Dermoskopik görüntüler | Uygulanamaz – görüntü veri seti | 25.331 eğitim görüntüsü | 8 eğitim kategorisi | AKIEC 867; BCC 3,323; BKL 2,624; DF 239; MEL 4,522; NV 12,875; VASC 253; SCC 628 | Uygulanamaz – herhangi bir deneysel ayrım gerçekleştirilmemiştir | Yalnızca protokol uygulanabilirlik örneğidir | Deneysel doğrulama için kullanılmamıştır | https://challenge.isic-archive.com/landing/2019/ |
| HAM10000 | Harvard Dataverse / ISIC Arşivi | Cilt lezyonu sınıflandırması | Dermoskopik görüntüler | 7.470 benzersiz lezyon | 10.015 görüntü | 7 | AKIEC 327; BCC 514; BKL 1.099; DF 115; MEL 1.113; NV 6.705; VASC 142 | Uygulanamaz – herhangi bir deneysel ayrım gerçekleştirilmemiştir | Sadece protokol uygulanabilirlik örneği | Deneysel doğrulama için kullanılmamıştır | **Sodyum Klorür Gradyanıyla Modifiye Edilmiş Bir Filtrasyon Yöntemi Kullanarak Proteinlerin Saflaştırılması**
**Özet**
Protein saflaştırma, biyokimyasal ve biyofiziksel analizler için yüksek saflıkta protein elde etmeyi amaçlayan temel bir süreçtir. Bu videoda, sodyum klorür (NaCl) gradyanıyla modifiye edilmiş bir filtrasyon yöntemi kullanılarak proteinlerin saflaştırılması prosedürü sunulmaktadır. Bu yöntem, farklı tuz konsantrasyonlarına göre proteinlerin çözünürlük özelliklerini kullanarak, hedef proteinin diğer hücre bileşenlerinden ve kirleticilerden etkili bir şekilde ayrılmasını sağlar. Prosedür; numunenin hazırlanması, NaCl gradyanının uygulanması, filtrasyon adımları ve ardından elde edilen proteinin saflığının SDS-PAGE analizi ile doğrulanması aşamalarını içerir. Bu protokol, laboratuvar ortamında rutin protein saflaştırma işlemleri için ölçeklenebilir ve yeniden üretilebilir bir yaklaşım sunmaktadır.
**Anahtar Kelimeler**
Protein saflaştırma, sodyum klorür gradyanı, filtrasyon, protein izolasyonu, SDS-PAGE, biyokimyasal analiz, tuz çöktürme |
| OhioT1DM | araştırma amacıyla kamuya açık olarak dağıtılan OhioT1DM veri seti | Diyabet izleme/öngörü | Klinik zaman serileri | 12 katılımcı | eğitim/geliştirme ve test verilerine yayılmış 24 XML dosyası | Sürekli glikoz tahmini; sabit bir sınıflandırma görevi değildir | Uygulanamaz | Veri kümesi tarafından tanımlanmış eğitim/geliştirme ve test dosyaları; burada herhangi bir deneysel ayrım gerçekleştirilmemiştir | Sadece protokol uygulanabilirlik örneğidir | Deneysel doğrulama için kullanılmamıştır | **Özet**
Sars-CoV-2 virüsünün ortaya çıkışı, dünya çapında bir pandemiye yol açan ciddi bir halk sağlığı krizi yaratmıştır. Bu bağlamda, virüsün yayılımını önlemek amacıyla hızlı, hassas ve güvenilir tanı yöntemlerinin geliştirilmesi kritik öneme sahiptir. Bu çalışmada, SARS-CoV-2'nin spesifik RNA dizilerine hedefleyen bir gerçek zamanlı ters transkriptaz polimeraz zincir reaksiyonu (RT-qPCR) protokolü geliştirilmiştir. Geliştirilen yöntem, yüksek duyarlılık ve özgünlük sergileyerek, klinik örneklerden viral RNA'nın etkin bir şekilde tespit edilmesini sağlamıştır. Çalışma sonucunda, optimize edilen primerler ve prob tasarımlarının, SARS-CoV-2'nin farklı varyantlarını tespit etmede yüksek performans gösterdiği doğrulanmıştır. Bu protokol, pandeminin kontrol altına alınmasında ve enfeksiyon yönetimi süreçlerinde değerli bir tanısal araç sunmaktadır.
**Anahtar Kelimeler**
Sars-CoV-2, RT-qPCR, moleküler tanı, RNA izolasyonu, gerçek zamanlı PCR, viral tespit, pandemi, klinik örnekler |
| BraTS 2021 | RSNA-ASNR-MICCAI BraTS 2021; CBICA/Pennsylvania Üniversitesi | Beyin tümörü segmentasyonu/sınıflandırması | MRG | meydan okuma kohortunda 2.040 vaka | 1.251 adet açıklanmış eğitim vakası; vaka başına dört MRI modalitesi | Göreve bağlı | Veri setinin tamamı genelinde tek bir sınıf dağılımı yoktur | Meydan okumaya göre tanımlanmış kohortlar; burada herhangi bir deneysel ayrım yapılmamıştır | Yalnızca protokol uygulanabilirlik örneği | Deneysel doğrulama için kullanılmamıştır | https://www.med.upenn.edu/cbica/brats2021/ |
Tablo 2: Sağlık hizmetleri veri kümesi özellikleri ve önerilen protokolün uygulanabilirliği. Tablo, protokolde değerlendirilen sağlık hizmetleri veri kümeleri için veri kaynaklarını, klinik uygulamaları, modaliteleri, örnek özelliklerini, sınıf dağılımlarını, veri kümesi bölümlendirme stratejilerini, doğrulama durumunu ve kaynak bilgilerini özetlemektedir. Pima Indians Diabetes Veri Kümesi, protokol doğrulaması için birincil çalışılmış örnek olarak hizmet etmektedir.
| Yapılandırma Ögesi | Gerçek Çalışma-Doğrulama Ortamı | Durum / Yorumlama |
| Veri Seti | Pima İndianlar Diyabet Veri Seti | Gerçek deneysel doğrulama veri seti |
| Algoritma / Model | İkili diyabet sınıflandırması için tabüler öngörücü model | Deney kaydında ayrıca belgelenmişse, mimari adını aynen kullanın |
| Öğrenme Oranı | 0.001 | Deneysel düzenek |
| Optimize Edici | Adam | Deneysel düzenek |
| Yığın Boyutu | 32 | Deneysel düzenek |
| Maksimum Epok Sayısı | 100 | Deneysel düzenek |
| Kayıp Fonksiyonu | Çapraz Entropi | Deneysel düzenek |
| Aktivasyon Fonksiyonu | ReLU (Doğrusal Birimleştirilmiş Doğrultucu) | Deneysel düzenek |
| Dropout | 0.5 | Deneysel kurulum |
| Ağırlık Azalması | 1e-4 | Deneysel düzenek |
| Yığın Normalizasyonu | Etkinleştirildi | Deneysel kurulum |
| Veri Artırımı / Sınıf Dengelenmesi | Etkinleştirildi | SMOTE'u yalnızca bildirilen çalışmada gerçekten uygulanmışsa belirtin |
| Doğrulama Stratejisi | 5-katlı çapraz doğrulama | Deneysel düzenek |
| Erken Durdurma | Sabır = 10 epoch | Deneysel düzenek |
| Rastgele Tohum | 42 | Deney için kaydedilen kesin başlangıç değerleri (seed) yapılandırmasını kullanın |
| Tekrarlanan Çalışmalar | farklı rastgele tohumlar kullanılarak gerçekleştirilen 10 bağımsız çalışma | Deneysel tekrarlanabilirlik analizi |
| Giriş Görüntü Boyutu | Uygulanamaz | Pima veri seti tablosal yapıdadır. |
| Öznitelik Boyutu | 512 | Yalnızca bunun nihai olarak uygulanan öznitelik temsili olduğu durumda kullanın |
| Açıklanabilirlik | SHAP + LIME; Şekil 6'da gösterilen karşıt olgusal açıklama | Aktüel raporlanan XAI analizi |
| Değerlendirme Metrikleri | Doğruluk, kesinlik, geri çağırma, özgüllük, F1-skoru, MCC, AUC-ROC, AP | Raporlanan deneysel değerlendirme metrikleri |
| Donanım | NVIDIA GPU | Kayıt altına alınmışsa tam GPU modeliyle değiştirin |
| Yazılım / Çerçeve | Python 3.11; Scikit-learn; uygulama tarafından kullanılan framework bileşenleri | Kaydedilmişse, paketlerin tam sürümlerini kullanın |
Tablo 3: Protokol uygulaması için kullanılan hesaplama ortamı, model mimarisi ve hiperparametre yapılandırması. Tablo; önerilen XAI iş akışını uygulamak için kullanılan hesaplama platformunu, yazılım ortamını, model mimarisini, girdi yapılandırmasını, optimizasyon parametrelerini, düzenlileştirme ayarlarını ve tekrarlanabilirlik parametrelerini belirtmektedir.
| Parametre | Temsili spesifikasyon / sonuç |
| Optimize Edici | Adam |
| Öğrenme oranı | 0.001 |
| Yığın boyutu | 32 |
| Maksimum epok sayısı | 100 |
| Erken durdurma sabrı | 10 epok |
| En iyi dönem | 78 |
| Erken durdurma epoku | 88 |
| En iyi doğrulama kaybı | 0.142 |
| En iyi doğrulama doğruluğu | 94.6% |
| Eğitim çıktısı | Eğitim ve doğrulama kaybı azaldı ve yakınsadı |
| Doğrulama çıktısı | Eğitim ve doğrulama doğruluğu artmış ve stabilize olmuştur |
| Optimizasyon sonucu | En iyi model performansı 78. epokta elde edildi |
| Aşırı öğrenme kontrolü | Erken durdurma, seçilen en iyi epoktan sonrası için optimizasyonu engellemiştir |
Tablo 4: Model eğitim spesifikasyonları ve optimizasyon sonuçları. Tablo; model geliştirme sırasında kullanılan optimize ediciyi, öğrenme hızını, grup boyutunu, maksimum eğitim epok sayısını, doğrulama performansını, eğitim yakınsamasını, optimizasyon sonucunu ve aşırı öğrenmeyi önleme stratejisini özetlemektedir.
| Model | Doğruluk (%) | Kesinlik (%) | Duyarlılık (%) | Özgüllük (%) | F1-skoru (%) | MCC | AUC (ROC) | AP (PR) |
| Önerilen XAI Modeli | 93.5 | 94.5 | 92.4 | 94.6 | 93.4 | 0.87 | 0.96 | 0.94 |
| Derin Öğrenme (CNN) | 89.1 | 89.8 | 88.1 | 90 | 88.9 | 0.78 | 0.92 | 0.9 |
| Rastgele Orman (Random Forest) | 84.3 | 85 | 83.2 | 85.7 | 84.1 | 0.67 | 0.86 | 0.81 |
| Destek Vektör Makinesi (SVM) | 78.6 | 79.3 | 77.1 | 80 | 78.2 | 0.54 | 0.79 | 0.72 |
| Temel Hat (Çoğunluk Sınıfı) | 62.1 | 62.1 | 100 | 0 | 76.6 | 0 | 0.5 | 0.5 |
Tablo 5: Değerlendirilen modellerin öngörücü performans karşılaştırması. Tablo; önerilen XAI modelini, doğruluk, kesinlik, duyarlılık, özgüllük, F1-skoru, Matthews korelasyon katsayısı, alıcı işletim karakteristiği eğrisi altında kalan alan ve ortalama kesinlik kullanarak değerlendirilen temel modellerle karşılaştırmaktadır.
| Validasyon analizi | Karşılaştırma / Metrik | İstatistiksel test | Test istatistiği | p-değeri | Deneysel sonuç / %95 GA |
| Beş katlı çapraz doğrulama | Doğruluk | Tanımlayıcı (ortalama ± SS) | — | — | 93.01 ± 0.48% |
| Beş katlı çapraz doğrulama | AUC-ROC | Betimleyici (ortalama ± SD) | — | — | 0.954 ± 0.007 |
| Beş katmanlı çapraz doğrulama | Hassasiyet | Betimleyici (ortalama ± SD) | — | — | 92.42 ± 0.87% |
| Beş katlı çapraz doğrulama | Geri çağırma | Tanımlayıcı (ortalama ± SD) | — | — | 93.02 ± 0.45% |
| Beş katlı çapraz doğrulama | F1-skoru | Betimleyici (ortalama ± SD) | — | — | 92.72 ± 0.62% |
| %95 bootstrap güven aralığı | Doğruluk | Bootstrap (1.000 yeniden örnekleme) | — | — | 0.935 [0.897, 0.973] |
| %95 bootstrap güven aralığı | Hassasiyet | Bootstrap (1.000 yeniden örnekleme) | — | — | 0.930 [0.890, 0.970] |
| %95 bootstrap güven aralığı | Geri Çağırma | Bootstrap (1.000 yeniden örnekleme) | — | — | 0.922 [0.880, 0.963] |
| %95 bootstrap güven aralığı | F1-skoru | Bootstrap (1.000 yeniden örnekleme) | — | — | 0.926 [0.887, 0.965] |
| %95 bootstrap güven aralığı | AUC-ROC | Bootstrap (1.000 yeniden örnekleme) | — | — | 0.958 [0.931, 0.984] |
| Önerilen Model ve CNN Karşılaştırması | Doğruluk (%) | McNemar testi | 9.32 | 0.0023 | Anlamlı (α = 0,05) |
| Önerilen Model ile CNN Karşılaştırması | AUC-ROC | DeLong testi | 3.87 | 0.0001 | Anlamlı (α = 0,05) |
| Önerilen Model ve CNN Karşılaştırması | F1-skoru | Eşleştirilmiş bootstrap (1.000 yeniden örnekleme) | 2.81 | 0.0044 | Anlamlı (α = 0,05) |
| Önerilen Model ile Random Forest Karşılaştırması | Doğruluk (%) | McNemar testi | 14.27 | 0.0002 | Anlamlı (α = 0,05) |
| Önerilen Model ve Rastgele Orman (Random Forest) Karşılaştırması | AUC-ROC | DeLong testi | 5.86 | <0.0001 | Anlamlı (α = 0,05) |
| Önerilen Model ile Random Forest Karşılaştırması | F1-skoru | Eşleştirilmiş bootstrap (1.000 yeniden örnekleme) | 4.03 | 0.0003 | Anlamlı (α = 0,05) |
| Önerilen Model ile SVM'nin Karşılaştırılması | Doğruluk (%) | McNemar testi | 16.08 | <0.0001 | Anlamlı (α = 0,05) |
| Önerilen Model ile SVM'nin Karşılaştırılması | AUC-ROC | DeLong testi | 6.95 | <0.0001 | Anlamlı (α = 0,05) |
| Önerilen Model ile SVM'nin Karşılaştırılması | F1-skoru | Eşleştirilmiş bootstrap (1.000 yeniden örnekleme) | 4.62 | <0.0001 | Anlamlı (α = 0,05) |
| Tekrarlanan çalışma tekrarlanabilirliği (10 bağımsız çalışma) | AUC-ROC | Betimsel (ortalama ± SS) | — | — | 0.957 ± 0.008 |
| Tekrarlanan çalışmalele yeniden üretilebilirlik (10 bağımsız çalışma) | Doğruluk (%) | Betimleyici (ortalama ± SD) | — | — | 93.24 ± 0.74% |
| Tekrarlanan çalışma yeniden üretilebilirliği (10 bağımsız çalışma) | F1-skoru (%) | Tanımlayıcı (ortalama ± SD) | — | — | 92.35 ± 0.92% |
Tablo 6: Pima Indians Diyabet Veri Kümesi kullanılarak yapılan deneysel uygulamadan elde edilen istatistiksel doğrulama ve tekrarlanabilirlik sonuçları. Tablo; beş katlı çapraz doğrulama performansını, bootstrap tabanlı %95 güven aralıklarını, önerilen modelin temel modellerle istatistiksel karşılaştırmalarını ve 10 bağımsız rastgele tohum üzerinden tekrarlı çalışma tekrarlanabilirliğini özetlemektedir. Mevcut doğrulama çalışmasında dış doğrulama ve klinik uzman değerlendirmesi gerçekleştirilmemiştir.
| Hayır. | Kontrol Listesi Öğesi | Gerekli Belgeler | Önerilen Kayıt / Doğrulama |
| 1 | Yazılım ortamı | İşletim sistemi, programlama dili ve yazılım ortamı | İşletim sistemi ve programlama dili sürümlerini tam olarak kaydedin. |
| 2 | Yazılım ve kütüphane sürümleri | Kullanılan ana yazılım kütüphanelerinin ve paketlerinin sürümleri | Paket/kütüphane adlarını ve versiyonlarını tam olarak kaydedin. |
| 3 | Donanım özellikleri | CPU, GPU, RAM, depolama ve hızlandırıcı spesifikasyonları | Kullanılan hesaplama donanımını kaydedin. |
| 4 | Veri seti tanımlama | Veri seti adı, kaynağı, sürümü ve erişim bilgileri | Varsa, veri setinin kesin kaynağını/sürümünü ve erişim tarihini kaydedin. |
| 5 | Veri seti özellikleri | Örneklem büyüklüğü ve sınıf dağılımı | Her bir bölünme için toplam örnek sayısını ve sınıf dağılımını kaydedin. |
| 6 | Veri seti bölümlendirme | Eğitim, doğrulama ve bağımsız test seti stratejisi | Belge bölme oranlarını/sayılarını ve tabakalaştırmayı kaydedin. |
| 7 | Veri sızıntısı önleme | Bilgi sızıntısını önlemek için kullanılan prosedür | Doküman konusu/örneği ayırma ve yalnızca eğitim için ön işleme parametre kestirimi. |
| 8 | Önişleme parametreleri | Temizleme, eksik değer işleme, normalleştirme, kodlama ve dönüşüm ayarları | Tüm ön işleme işlemlerini ve parametre değerlerini kaydedin. |
| 9 | Veri artırımı | Artırma yöntemleri ve uygun olduğunda parametre ayarları | Yöntemleri, olasılıkları ve parametre aralıklarını belgeleyin. |
| 10 | Model mimarisi | Final model mimarisi ve konfigürasyonu | Model tipini, katmanları/bileşenleri, boyutları ve aktivasyon fonksiyonlarını belgeleyin. |
| 11 | Hiperparametreler | Eğitim ve optimizasyon hiperparametreleri | Öğrenme oranını, paket boyutunu, optimize ediciyi, epok sayısını, erken durdurmayı ve ayarlanmış parametreleri kaydedin. |
| 12 | Rastgele tohumlar | Tekrarlanabilir yürütme için kullanılan rastgele tohumlar | Sürekli çalıştırmalar, başlatma ve ayırma işlemleri için seed değerlerini kaydedin. |
| 13 | Eğitim yapılandırması | Eğitim prosedürü ve model seçim stratejisi | Doküman doğrulama, kontrol noktası oluşturma ve model seçim kriterleri. |
| 14 | Değerlendirme metrikleri | Önceden tanımlanmış öngörücü ve istatistiksel değerlendirme metrikleri | Raporlanan tüm performans ölçümlerini kaydedin. |
| 15 | Güven aralıkları | Performans ölçümleri için belirsizlik aralıkları | Uygun olduğu yerlerde, güven aralığı (CI) kestirim prosedürünü ve bootstrap yeniden örneklemelerini belgeleyin. |
| 16 | İstatistiksel testler | Model karşılaştırması için istatistiksel prosedürler | Belge testi, istatistik, p-değeri, anlamlılık eşiği ve varsayımlar. |
| 17 | Tekrarlı çalışma analizi | Farklı rastgele tohumlar kullanılarak gerçekleştirilen bağımsız yürütmeler | Çalışma sayısını ve temel metriklerin ortalama ± standart sapma değerlerini kaydedin. |
| 18 | Açıklanabilirlik yapılandırması | Açıklanabilirlik yöntemleri ve parametre ayarları | SHAP, LIME, Grad-CAM, dikkat (attention), karşıolgusal (counterfactual) veya uygulanabilir ayarları belgeleyin. |
| 19 | Açıklanabilirlik değerlendirmesi | Açıklama güvenilirliğinin ve yararlılığının objektif değerlendirmesi | Belge sadakati, stabilitesi, sadakatsizliği, lokalizasyonu ve uygun olduğunda uzman değerlendirmesi. |
| 20 | Model artefaktları | Eğitilmiş model ağırlıkları ve konfigürasyon dosyaları | Eğitilmiş nihai modeli, mimariyi/konfigürasyonu ve seçim bilgilerini arşivleyin. |
| 21 | Kod erişilebilirliği | Önişleme, eğitim, değerlendirme ve açıklama üretimi için gerekli kodlar | Varsa kayıt deposunu veya kontrollü kod erişim bilgilerini kaydedin. |
| 22 | Yürütme dokümantasyonu | Komutlar, betikler, yapılandırma dosyaları ve talimatlar | İş akışını yeniden oluşturmak için gereken komutları ve yapılandırmayı kaydedin. |
| 23 | Çıktı dokümantasyonu | Tahminler, değerlendirme sonuçları, şekiller ve açıklama çıktıları | Üretilen çıktıları arşivleyin ve bunları ilgili deney/çalışma ile ilişkilendirin. |
| 24 | Tekrarlanabilirlik doğrulaması | Bağımsız yürütmeler arasındaki tutarlılığın doğrulanması | Tekrarlanan çalışma sonuçlarını karşılaştırın ve önceden tanımlanmış değişkenlik ölçümlerini raporlayın. |
Tablo 7: Önerilen XAI iş akışının bağımsız replikasyonu içinle tekrarlanabilirlik kontrol listesi. Kontrol listesi, deneysel iş akışını yeniden oluşturmak için gereken hesaplama, veri seti, ön işleme, model geliştirme, değerlendirme, istatistiksel doğrulama, açıklanabilirlik ve dokümantasyon gereksinimlerini belirtmektedir.