Yöntem makalesi

Sağlık Sistemlerinde Açıklanabilir Yapay Zeka Modelleri Geliştirmek ve Değerlendirmek İçin Tekrarlanabilir Bir Deneysel Protokol

2 görüntülenme

DOI:

10.3791/73848

15 Eylül 2026

Bu makalede

Özet

Bu protokol, sağlık hizmetlerinde açıklanabilir yapay zeka modellerinin geliştirilmesi, değerlendirilmesi ve yorumlanması için tekrarlanabilir bir iş akışı sunmaktadır. Şeffaflığı, güvenilirliği ve klinik uygulanabilirliği artırmak amacıyla standartlaştırılmış veri hazırlama, model geliştirme, açıklanabilirlik teknikleri, nicel değerlendirme ve tekrarlanabilirlik uygulamalarını entegre eder.

Özet

Yapay zeka (AI), klinik karar verme, hastalık öngörüsü, tıbbi teşhis ve kişiselleştirilmiş sağlık hizmetleri için giderek daha değerli bir araç olarak benimsenmektedir. Ancak, şeffaflık eksikliği, açıklanabilir yapay zeka (XAI) yöntemlerinin tutarsız uygulanması ve sınırlı tekrarlanabilirlik, AI modellerinin klinik ortamlarda güvenilir bir şekilde yaygınlaştırılmasının önündeki temel engeller olmaya devam etmektedir. Bu makale, sağlık uygulamaları için açıklanabilir AI modellerinin geliştirilmesi, değerlendirilmesi ve yorumlanması için sistematik, tekrarlanabilir ve şeffaf bir protokol önermektedir. İş akışı, hesaplama ortamının kurulumuyla başlar; bunu veri edinimi ve karakterizasyonu, ön işleme, özellik mühendisliği, model geliştirme, hiperparametre optimizasyonu, öngörücü performans değerlendirmesi, açıklanabilirlik analizi, istatistiksel doğrulama ve tekrarlanabilirlik değerlendirmesi izler. Protokol, hem küresel hem de yerel model yorumlamaları oluşturmak için SHapley Additive exPlanations (SHAP), Local Interpretable Model-agnostic Explanations (LIME), Gradient-weighted Class Activation Mapping (Grad-CAM), Integrated Gradients, dikkat görselleştirme ve karşı olgusal açıklamalar gibi XAI yöntemlerini içermektedir. Protokol; standartlaştırılmış sağlık veri setlerinin hazırlanması, kararlı makine öğrenimi modellerinin geliştirilmesi, öngörücü performansın değerlendirilmesi, klinik olarak anlamlı açıklamaların oluşturulması ve tekrarlanan deneyler genelinde tekrarlanabilirliğin istatistiksel değerlendirmesi dahil olmak üzere birkaç temel bileşene vurgu yapmaktadır. Model geliştirme, açıklanabilirlik, nicel ve nitel değerlendirme, istatistiksel doğrulama ve tekrarlanabilirlik değerlendirmesini birleşik bir iş akışına entegre ederek, bu protokol, sağlık uygulamaları için şeffaf ve tekrarlanabilir AI modelleri geliştirmek adına kapsamlı bir çerçeve sunmaktadır.

Giriş

Yapay zeka, karmaşık klinik verilerin akıllı analizine olanak tanıyarak ve kanıta dayalı tıbbi karar verme süreçlerini destekleyerek modern sağlık hizmetlerinin ayrılmaz bir bileşeni haline gelmiştir1. Elektronik sağlık kayıtları, tıbbi görüntüleme sistemleri, giyilebilir cihazlar ve genomik teknolojiler aracılığıyla sağlık hizmetlerinin hızla dijitalleşmesi, etkili bir yorumlama için gelişmiş hesaplama yaklaşımları gerektiren büyük hacimlerde heterojen veriler üretmiştir2.

Makine öğrenimi (ML) ve derin öğrenme (DL) algoritmaları, çok boyutlu sağlık hizmetleri veri setlerinden anlamlı modeller çıkarma konusunda dikkat çekici yetenekler göstermiş; böylece tanı doğruluğunu, hastalık öngörüsünü ve hasta sonuç değerlendirmelerini iyileştirmiştir3. Yapay zeka tabanlı modeller; klinisyenlerin hastalıkları daha erken evrelerde tespit etmelerine ve kişiselleştirilmiş tedavi stratejileri önermelerine yardımcı olmak amacıyla radyoloji, patoloji, kardiyoloji, onkoloji, oftalmoloji ve diğer tıbbi uzmanlık alanlarında başarıyla uygulanmıştır4. Bu teknolojiler ayrıca iş akışının optimizasyonuna, tanısal değişkenliğin azaltılmasına ve sağlık hizmetleri kaynaklarının kullanımının iyileştirilmesine katkıda bulunmuştur5.

Hesaplamalı donanım, bulut bilişim ve açık kaynaklı yapay zeka çerçevelerindeki son gelişmeler, akıllı sağlık uygulamalarının geliştirilmesini ve yaygınlaştırılmasını hızlandırmıştır6. Sonuç olarak yapay zeka, hassas tıp ve klinik karar destek sistemleri için temel bir kolaylaştırıcı teknoloji haline gelmiştir7. Bu ilerlemelere rağmen, birçok yüksek performanslı modelin tahminlerinin nasıl oluşturulduğuna dair çok az bilgi sunması nedeniyle, yapay zekanın rutin klinik uygulamalarda yaygın olarak benimsenmesi sınırlı kalmaya devam etmektedir8.

Çoğu derin öğrenme algoritması, dahili karar verme sürecinin klinisyenler ve araştırmacılar tarafından anlaşılmasının zor olduğu karmaşık kara kutu modeller olarak işlev görür9. Bu modeller genellikle mükemmel öngörü performansı sergilese de, şeffaflık eksikliği kullanıcı güvenini sarsmakta; klinik doğrulama, düzenleyici onay ve hasta güvenliği açısından zorluklar yaratmaktadır10. Sağlık profesyonelleri, özellikle yüksek riskli tıbbi ortamlarda, yapay zeka destekli kararları rutin klinik uygulamaya dahil etmeden önce bunları gerekçelendirebilmelidir11.

XAI, makine öğrenimi modellerinin şeffaflığını ve yorumlanabilirliğini artırmak için etkili bir yaklaşım olarak ortaya çıkmıştır12. Tahmin modellerini opak sistemler olarak ele almak yerine, XAI teknikleri bireysel tahminlere katkıda bulunan özellikler, görüntü bölgeleri veya klinik değişkenler hakkında bilgi sağlar13. Bu tür açıklamalar, klinisyenlerin model davranışını daha iyi anlamalarına, potansiyel yanlılıkları belirlemelerine ve yapay zeka tarafından üretilen kararların yerleşik tıbbi bilgilerle uyumlu olup olmadığını saptamalarına olanak tanır14.

Sağlık hizmetleri uygulamaları için çeşitli açıklanabilirlik teknikleri geliştirilmiştir. SHapley Additive explanations (SHAP), kooperatif oyun teorisine dayanarak her bir özelliğin model tahminine olan katkısını ölçer15. Local Interpretable Model-agnostic Explanations (LIME), basitleştirilmiş bir model oluşturarak kara kutu modelinin tahminlerini açıklar16. Derin öğrenme modellerinin kullanıldığı tıbbi görüntüleme görevleri için Gradient-weighted activation maps (Grad-CAM), görüntünün sınıflandırma kararlarına katkıda bulunan bölgelerini görsel olarak belirten ısı haritaları oluşturur17. Bu yöntemlerin kombinasyonu, farklı sağlık hizmetleri alanlarında yapay zeka sistemlerinin şeffaflığını önemli ölçüde artırmıştır18.

Sağlık hizmetleri alanında açıklanabilirlik yöntemlerine verilen önemin artmasına rağmen, bunların literatürdeki kullanımı farklılık göstermeye devam etmektedir. Araştırmacılar yalnızca ön işleme stratejilerinin kullanımı konusunda değil, aynı zamanda model mimarisinin tasarımı, değerlendirme metrikleri ve hatta açıklama teknikleri konusunda da farklılık göstermektedirler19. Ayrıca, birçok makale yüksek öngörü doğruluğı bildirmekte ancak açıklamaların kalitesi veya tekrarlanabilirliği hakkında kapsamlı bir değerlendirme sunmakta yetersiz kalmaktadır20.

Tekrarlanabilirlik, modern yapay zeka bilimindeki en büyük darboğazlardan biridir. Makaleler genellikle yazılım versiyonunu, hesaplama ortamını, ön işleme hattını, hiperparametre ayarlarını, rastgele tohum başlatmasını ve donanım yapılandırmalarını açıklamaz21. Bu nedenle, bağımsız araştırmacılar genellikle yayınlanmış sonuçları tekrarlamakta veya yayınlanmış yöntemleri diğer veri setleri veya yazılım platformlarını kullanarak doğrulamakta başarısız olurlar22. Ayrıntılı dokümantasyon eksikliği; kıyaslama çalışmalarını, ortak araştırmaları ve yapay zeka sistemlerinin klinik uygulamalarını engelleyen faktörlerden biridir23.

Bu zorlukların farkında olan çeşitli kuruluşlar ve düzenleyici kurumlar, sağlık uygulamaları için şeffaf, güvenilir ve tekrarlanabilir yapay zekanın önemini vurgulamışlardır24. Mevcut raporlama kılavuzları metodolojik raporlamayı geliştirmiş olsa da, araştırmacıların doğrudan uygulayabileceği standartlaştırılmış deneysel prosedürler sağlamaktan ziyade, öncelikle nelerin raporlanması gerektiğini tanımlamaktadır25. Sonuç olarak; veri seti hazırlama, model geliştirme, açıklanabilirlik analizi, istatistiksel değerlendirme ve tekrarlanabilirlik uygulamalarını tek bir deneysel iş akışında birleştiren kapsamlı bir protokole ihtiyaç duyulmaktadır26.

Standardize edilmiş bir deneysel protokol, sağlık hizmetleri yapay zeka topluluğu için birçok avantaj sunar. Ayrıca, metodolojik tutarlılığı destekler, bağımsız çalışmaların karşılaştırılmasını kolaylaştırır, hesaplamalı deneylerin şeffaflığını artırır ve yayınlanmış sonuçların güvenilir bir şekilde doğrulanmasını sağlar27. Standardize edilmiş iş akışları aynı zamanda, farklı laboratuvarlar ve sağlık kurumları arasında tekrarlanabilir olan net bir şekilde belgelenmiş prosedürler aracılığıyla eğitim/öğretime, ortak araştırmalara ve düzenleyici değerlendirmelere yardımcı olur28.

Sağlık sistemlerinde yapay zeka modellerinin eğitimi ve değerlendirilmesi için tekrarlanabilir bir deneysel protokol geliştirilmiş ve test edilmiştir. Protokol; hesaplama ortamının yapılandırılması, sağlık veri kümelerinin ön işlemesi, makine öğrenmesi modellerinin geliştirilmesi, XAI yöntemlerinin uygulanması, öngörü performansının değerlendirilmesi, istatistiksel doğrulamanın gerçekleştirilmesi ve tekrarlanabilirliğin değerlendirilmesine yönelik standartları ana hatlarıyla belirtmektedir29. Bu tür bileşenlerin uyumlu bir iş akışına entegrasyonunun, sağlık hizmetleri yapay zeka araştırmalarının şeffaflığını, güvenilirliğini ve tekrarlanabilirliğini artırması ve aynı zamanda güvenilir akıllı sağlık sistemlerinin geliştirilmesine yardımcı olması beklenmektedir30.

Protokol

Gerçekleştirilen doğrulama deneyi, kamuya açık ve kimliksizleştirilmiş Pima Indians Diyabet Veri Setini kullanmış olup, tanımlanabilir hasta kayıtlarını veya yeni hasta alımını içermemiştir. Bu nedenle, bilgilendirilmiş onam ve kurumsal IRB/etik kurul onayı gerekmemiş olup, tüm analizler ilgili veri seti şartlarına ve kurumsal araştırma politikalarına uygun olarak yürütülmüştür.

Uygulamalı doğrulama örneğinde, ikili diyabet tahmini için 768 kayıt içeren ve halka açık olan Pima Indians Diabetes Veri Kümesi kullanılmıştır. Dokuz aşamalı temel iş akışının tamamı bu veri kümesine uygulanmıştır. Dokuz temel aşama; veri kümesi seçimi ve doğrulaması, hesaplama ortamı yapılandırması, veri ön işleme, veri kümesi bölümlendirme, model geliştirme ve eğitimi, öngörücü ve hesaplama performansı değerlendirmesi, açıklanabilirlik analizi, istatistiksel doğrulama ve tekrarlanabilirlik değerlendirmesinden oluşmaktadır. Harici doğrulama ve klinik uzman değerlendirmesi isteğe bağlı doğrulama modülleri olarak tutulmuş ve mevcut uygulamalı örnekte gerçekleştirilmemiştir. Şekil 1 temel protokol iş akışını göstermekte ve Tablo 1 mevcut uygulamalı doğrulamada yürütülen dokuz temel aşamayı özetlemektedir; isteğe bağlı harici doğrulama ve klinik uzman değerlendirmesi Protokol içinde ayrıca açıklanmıştır ve dokuz deneysel aşama arasında yer almamaktadır.

1. Sağlık hizmetleri veri setini seçin ve doğrulayın

  1. Çalışılan doğrulama örneği için birincil veri seti olarak Pima Kızılderilileri Diyabet Veri Setini seçin. Veri seti kaynağını, örneklem büyüklüğünü, tahmin hedefini, sınıf dağılımını ve veri yapısını doğrulayın.
  2. Önceden tanımlanmış dahil etme, hariç tutma ve veri kalitesi kriterlerini uygulayın. Model geliştirmeden önce yinelenen ve geçersiz kayıtları kaldırın.
  3. Veri seti kaynağını, özelliklerini, tahmin görevini, sınıf dağılımını, dahil etme ve hariç tutma kriterlerini ve bölümlendirme stratejisini Tablo 2'ye kaydedin.
  4. Veri seti ve model seçimi için karar kriterlerini uygulayın
    1. Veri setini, model mimarisini, ön işleme stratejisini veya açıklanabilirlik yöntemini seçmeden önce tahmin amacını tanımlayın.
    2. Veri seti modalitesini tahmin amacıyla eşleştirin. Yapılandırılmış klinik değişkenler için tablo verilerini, tıbbi görüntüler için görüntüleme verilerini, fizyolojik sinyaller için zaman serisi verilerini, klinik anlatılar için metin verilerini veya aynı hasta veya çalışma birimi için tamamlayıcı modaliteler mevcut olduğunda multimodal verileri seçin.
    3. Aday veri setlerini örneklem büyüklüğü, sonuç kullanılabilirliği, sınıf dağılımı, eksiklikler, açıklama kalitesi, klinik uygunluk, veri bütünlüğü ve erişilebilirlik açısından değerlendirin. Önceden tanımlanmış gereksinimleri karşılayan veri setini seçin.
    4. Örneklem büyüklüğü, hesaplama kaynakları veya yorumlanabilirlik gereksinimleri karmaşık mimarilerin kullanımını kısıtladığında, yapılandırılmış tablo verileri için geleneksel makine öğrenmesi modellerini seçin. Yeterli eğitim verisi ve tıbbi görüntüler, fizyolojik sinyaller veya klinik metinler gibi yüksek boyutlu girdiler mevcut olduğunda derin öğrenme mimarilerini seçin.
    5. Multimodal mimarileri yalnızca aynı hasta veya çalışma birimi için birden fazla modalite mevcut olduğunda ve bilgi sızıntısına yol açmadan güvenilir şekilde hizalanabildiğinde seçin. Ön işleme işlemlerini seçilen veri modalitesinin özelliklerine göre seçin.
    6. Açıklanabilirlik yöntemlerini modele ve veri modalitesine göre seçin. Uygun tablo modelleri için SHAP veya LIME gibi model-agnostik yöntemleri ve uygulanabildiği durumlarda görüntü tabanlı modeller için Grad-CAM gibi modaliteye özel yöntemleri kullanın.
    7. Veri seti, ön işleme stratejisi, model ve açıklanabilirlik yöntemi seçimlerinin gerekçelerini belgeleyin. Bu kararları yeniden üretilebilirlik kaydının bir parçası olarak saklayın.

2. XAI model geliştirme için hesaplama ortamını yapılandırın

  1. İşletim sistemini, CPU'yu, RAM'i, depolamayı ve GPU'yu seçilen model gereksinimlerine göre yapılandırın. İzole bir Python ortamı oluşturun ve gerekli makine öğrenimi, derin öğrenim, istatistiksel, görselleştirme ve XAI kütüphanelerini yükleyin.
  2. Gerçekleştirilen doğrulama için kullanılan gerçek hesaplama ortamını, model mimarisini ve hiperparametreleri Tablo 3'e kaydedin. Optimize ediciyi, öğrenme hızını, toplu işlem boyutunu (batch size), maksimum epoch sayısını, kayıp fonksiyonunu, düzenlileştirme parametrelerini, doğrulama stratejisini, erken durdurma yapılandırmasını, rastgele tohum (random-seed) yapılandırmasını, açıklanabilirlik yöntemlerini, donanımı, işletim sistemini, Python sürümünü ve ilgili yazılım-kütüphane sürümlerini belirtin. Deneylerde kullanılan bu ayarları, genel veya önerilen protokol ayarlarından ayırt edin.
  3. Pima İndiyans Diyabeti Veri Kümesi doğrulamasını ve buna karşılık gelen öngörücü, açıklanabilirlik, istatistiksel ve tekrarlanabilirlik sonuçlarını yeniden üretirken Tablo 3'te bildirilen yapılandırmayı kullanın.
  4. Paketlerin başarıyla içe aktarıldığını, veri kümesinin yüklendiğini, modelin çalıştırıldığını ve çıktının üretildiğini onaylamak için bir doğrulama betiği çalıştırın. Tekrarlanabilirlik için kesinleşmiş ortam yapılandırmasını koruyun.

3. XAI model geliştirme için sağlık hizmetleri veri setlerini hazırlama ve karakterize etme

  1. Sağlık veri setini seçin ve edinin
    1. Tanımlanan klinik tahmin görevi için uygun bir sağlık veri seti seçin. Aday veri setlerini; araştırma hedefi, veri tipi, örneklem büyüklüğü, açıklama (notasyon) kalitesi, sınıf dengesi ve klinik uygunluk kriterlerine göre değerlendirin.
    2. Tahmin görevini yeterince karşıladıkları ve bağımsız doğrulamayı kolaylaştırdıkları durumlarda, halka açık kıyaslama veri setleri tercih edilmelidir.
    3. Kurumsal veya kurum içi veri setlerini edinmeden önce gerekli etik onayları, kurumsal izinleri ve veri erişim yetkisini alın. Seçilen veri setini, doğrulanmış bir depodan veya yetkilendirilmiş bir kurumsal veri tabanından temin edin.
    4. Orijinal veri seti dosyalarını herhangi bir değişiklik yapmadan koruyun ve veri seti sağlayıcısını, versiyonu, elde etme bilgilerini, lisans koşullarını, dahil etme kriterlerini, hariç tutma kriterlerini ve beraberindeki meta verileri kaydedin. Veri setini; ham veriler, açıklamalarda (notasyonlar), meta veriler ve ek bilgiler için ayrı dizinler olacak şekilde düzenleyin.
  2. Sağlık hizmetleri veri setini karakterize edin
    1. Öngörücü değişkenleri, sonuç etiketlerini, öznitelik türlerini, veri modalitelerini ve sınıf dağılımlarını belirleyin. Denek sayısını, örnek sayısını, öznitelik boyutlarını ve mevcut açıklama (anotasyon) bilgilerini tespit edin.
    2. Veri kümesi özelliklerinin seçilen yapay zeka yöntemiyle uyumlu olduğunu doğrulayın.
    3. Dokuz aşamalı temel protokolün doğrulanması için tek çalışılmış deneysel veri seti olarak Pima Kızılderilileri Diyabet Veri Setini kullanın. Şunlarda listelenen ek veri setlerini dahil edin: Tablo 2 yalnızca genel protokolün klinik tablo verileri, elektronik sağlık kayıtları, dermoskopik görüntüler, fizyolojik zaman serisi verileri ve tıbbi görüntüleme genelindeki uygulanabilirliğini göstermek amacıyla kullanılmalıdır. Bu ek veri setlerini model eğitimi, test etme, istatistiksel doğrulama veya rapor edilen deneysel sonuçların oluşturulması için kullanmayın.
  3. Veri seti kalitesini değerlendirin
    1. Veri setini yinelenen kayıtlar, bozulmuş dosyalar, eksik değerler, açıklama hataları ve düzensiz veri girişleri açısından inceleyin. Onaylanmış yinelenen kayıtları kaldırın ve doğrulanmış biçimlendirme düzensizliklerini düzeltin. Tüm veri seti kalite kontrol prosedürlerini belgeleyin.
    2. Multimodal veri setleri kullanılırken; görüntüleme, klinik, laboratuvar ve fizyolojik verilerin denek tanımlayıcıları aracılığıyla uygunluğu doğrulayın.
    3. Yinelenen veya tutarsız kayıtları kaldırın, eksik değerleri yönetin, sayısal özellikleri standartlaştırın, kategorik değişkenleri kodlayın ve modaliteye özgü ön işleme adımlarını uygulayın. Veri setini bağımsız eğitim, doğrulama ve test setlerine ayırın. Şuraya başvurun: Şekil 2 sağlık hizmetleri veri seti hazırlama, ön işleme, bölümlendirme ve kalite değerlendirme iş akışı için.
  4. Veri gizliliğini ve etik uyumluluğu sağlayın
    1. Sağlık verilerindeki doğrudan tanımlayıcıları kaldırın. Gerektiğinde anonimleştirme veya takma adlandırma (pseudonymization) prosedürlerini uygulayın. Hasta sağlık bilgilerini geçerli etik, veri koruma, bilgilendirilmiş onam ve kurumsal gerekliliklere uygun şekilde yönetin.
    2. Geçerli etik onayları, feragatnameleri, veri yönetişim prosedürlerini, anonimleştirme yöntemlerini ve veri seti hazırlama iş akışını kaydedin.
    3. Bu tür bilgilerin mevcut olduğu ve etik olarak izin verildiği durumlarda, model performansını ilgili demografik veya klinik alt gruplar arasında karşılaştırarak potansiyel algoritmik yanlılığı değerlendirin.
    4. Kullanım amacı, hedef popülasyon, model kısıtlamaları, potansiyel hata modları, insan denetimi gereksinimleri ile ilgili etik, veri koruma ve sağlık hizmetleri düzenleme gerekliliklerini belgeleyin.
    5. Tespit edilen hakkaniyet kısıtlamalarını ve sorumlu yapay zeka hususlarını, final model dokümantasyonunun bir parçası olarak kaydedin.
      NOT: Yapay zeka model geliştirmeye uygun, etik kurallara uyumlu ve tanımlanmış önemli tutarsızlıklar içermeyen, standartlaştırılmış ve belgelenmiş bir sağlık veri seti edinin.

4. Yapay zeka model eğitimi için sağlık verilerinin ön işlemesi ve bölümlendirilmesi

  1. Kalite kontrolü gerçekleştirin
    1. Veri setini mükerrer kayıtlar, eksik değerler, geçersiz değerler, tutarsız etiketler, aykırı değerler ve bozuk dosyalar açısından inceleyin.
    2. Geçersiz gözlemleri önceden tanımlanmış kriterlere göre kaldırın veya düzeltin ve tüm hariç tutmaları kaydedin. Tahmin edici değişkenlerin ve sonuç etiketlerinin tutarlılığını doğrulayın.
  2. Eksik verileri yönetin
    1. Her değişken için eksiklik miktarını belirleyin. Önceden tanımlanmış imputasyon (atama) veya hariç tutma stratejisini uygulayın.
    2. İmputasyon parametrelerini yalnızca eğitim verilerini kullanarak tahmin edin ve uyarlanan dönüşümü doğrulama ve test verilerine uygulayın.
  3. Verileri normalleştirin ve dönüştürün
    1. Özellik ölçeklendirme, normalleştirme, kodlama, boyut indirgeme veya seçilen modelin gerektirdiği diğer dönüşümleri uygulayın. Veriye bağlı tüm dönüşümleri yalnızca eğitim verilerini kullanarak uyarlayın.
    2. Uyarlanan dönüşümleri doğrulama ve test verilerine hiçbir değişiklik yapmadan uygulayın.
  4. Eğitim verilerindeki sınıf dengesizliğini nicel olarak belirleyin. Sınıf ağırlıklandırma, SMOTE, aşırı örnekleme veya veri artırmayı yalnızca eğitim veri setine uygulayın. Doğrulama ve test veri setlerinin orijinal dağılımını koruyun.
  5. Hiçbir deneğin, mükerrer gözlemin, artırılmış örneğin, ön işleme istatistiğinin, özellik seçim kriterinin veya sentetik örneğin eğitim ve değerlendirme bölümleri arasında paylaşılmadığını onaylayın.

5. XAI modelini geliştirin ve yapılandırın

  1. Girdi veri modalitelerini, ön işleme işlemlerini, modaliteye özgü öznitelik kodlayıcılarını, öznitelik füzyon mekanizmasını, tahmin katmanını ve açıklanabilirlik modülünü belirterek model mimarisini tanımlayın.
  2. Tahmin görevine ve girdi modalitesine göre makine öğrenmesi veya derin öğrenme mimarisini seçin. Girdi katmanını, öznitelik çıkarma bileşenlerini, gizli katmanları, çıktı katmanını ve aktivasyon fonksiyonlarını yapılandırın. Optimize ediciyi, öğrenme oranını, yığın boyutunu, kayıp fonksiyonunu, dönem sayısını, düzenlemeyi, dropout'u, erken durdurmayı ve öğrenme oranı planını tanımlayın.
  3. Yalnızca eğitim ve doğrulama verilerini kullanarak hiperparametreleri optimize edin.
  4. Nihai mimariyi ve hiperparametre yapılandırmasını Tablo 3'e kaydedin.
  5. Eğitimden önce girdi-çıktı boyutsal uyumluluğunu doğrulayın.
    NOT: Uygun bir mimari, tanımlanmış hiperparametreler ve entegre açıklanabilirlik teknikleri içeren, tam olarak yapılandırılmış bir XAI modeli oluşturun.

6. XAI modelini eğitin, optimize edin ve kaydedin

  1. Önceden tanımlanmış eğitim ve doğrulama veri kümeleri ile nihai model konfigürasyonunu yükleyin. Modeli, önceden tanımlanmış rastgele tohum (random seed) ve eğitim parametrelerini kullanarak başlatın.
  2. Modeli belirtilen optimize edici, kayıp fonksiyonu, grup boyutu (batch size) ve durdurma kriterlerini kullanarak eğitin.
  3. Doğrulama performansını izleyin ve önceden tanımlanmış model seçim kriterine karşılık gelen kontrol noktasını (checkpoint) saklayın. Seçilen kontrol noktasını, başka bir optimizasyon yapmadan bağımsız test veri kümesi üzerinde değerlendirin.
  4. Eğitilmiş modeli, ön işleme konfigürasyonunu, hiperparametreleri, rastgele tohumu ve eğitim günlüğünü kaydedin.
    NOT: Hazırlanan sağlık hizmetleri veri kümesi kullanılarak eğitilmiş ve doğrulanmış optimize bir XAI modeli elde edin. Tekrarlanabilirlik için en iyi performansı gösteren modeli, hiperparametreleri, eğitim günlüklerini, ön işleme konfigürasyonunu ve hesaplama ortamını muhafaza edin.

7. Tahminleyici ve hesaplama performansını değerlendirin

  1. Tahmin performansını değerlendirin
    1. Model eğitimi ve hiperparametre optimizasyonu tamamlandıktan sonra, optimize edilmiş modeli ve bağımsız test veri setini yükleyin. Test aşamasında, eğitilmiş model parametrelerini ve ön işleme hattını değiştirilmeden koruyun.
    2. Test veri setindeki tüm örnekler için tahminler oluşturun. Tahmin edilen çıktıları, karşılık gelen temel gerçeklik (ground-truth) etiketleri ile karşılaştırın.
  2. Performans metriklerini hesaplayın
    1. Tahmin görevinin türüne göre değerlendirme metriklerini seçin.
    2. Sınıflandırma görevleri için uygun olduğunda; doğruluğu (accuracy), kesinliği (precision), duyarlılığı (recall), özgünlüğü (specificity), F1-skorunu, dengeli doğruluğu (balanced accuracy), Matthews korelasyon katsayısını (MCC) ve alıcı işletim karakteristik eğrisi altındaki alanı (AUC-ROC) hesaplayın. Regresyon görevleri için uygun olduğunda; ortalama mutlak hatayı (MAE), kök ortalama kare hatayı (RMSE), belirleme katsayısını (R2) ve diğer ilgili ölçümleri hesaplayın.
  3. Model genelleştirmesini ve sağlamlığını değerlendirin
    1. Mümkün olduğunda, geliştirme veri setinden bağımsız olarak toplanmış harici bir veri seti kullanarak modeli değerlendirin.
    2. Taşınabilirliği değerlendirmek için farklı bir sağlık kurumundan, coğrafi bölgeden veya hasta popülasyonundan gelen harici veri setlerini tercih edin.
    3. Boylamsal veri setleri mevcut olduğunda, daha sonraki bir dönemde toplanan verileri kullanarak zamansal doğrulama gerçekleştirin.
    4. Çok merkezli veriler mevcut olduğunda, nihai modeli katılımcı kurumlar genelinde ayrı ayrı değerlendirerek çok merkezli doğrulama gerçekleştirin.
    5. Mümkün olduğunda, farklı bir coğrafi bölgeden gelen bağımsız bir popülasyonu kullanarak coğrafi doğrulama gerçekleştirin.
    6. Geliştirme ve harici veri setleri arasındaki performans farklılıklarını ve güven aralıklarını raporlayın.
  4. Hesaplama performansını değerlendirin
    1. Önceden tanımlanmış hesaplama ortamında model eğitim süresini, aynı hesaplama koşulları altında çıkarım ve test süresini, ayrıca bellek tüketimini, model boyutunu ve donanım kullanımını ölçün.
    2. Hesaplama ölçümlerini bağımsız çalışmalar üzerinden tekrarlayın.
    3. Deneysel değişkenliğin etkisini azaltmak için ortalama yürütme süresini hesaplayın.
  5. Model performansını karşılaştırın
    1. Karşılaştırmalı değerlendirme için uygun geleneksel makine öğrenimi veya derin öğrenme yöntemlerini seçin.
    2. Önerilen XAI modelini ve karşılaştırıcı modelleri aynı veri setini kullanarak değerlendirin. Tüm karşılaştırma modellerine aynı ön işleme prosedürlerini ve değerlendirme metriklerini uygulayın.
    3. Tüm karşılaştırmalı deneyleri aynı hesaplama ortamında gerçekleştirin.
      NOT: Test edilen hesaplama koşulları ve veri seti altında tahmin kararlılığı ve tekrarlanabilirliğine dair deneysel kanıtlar elde edin.

8. XAI çıktılarını oluşturun ve değerlendirin

  1. Model açıklamalarını oluşturun
    1. Optimize edilmiş XAI modelini yükleyin. Model eğitimi için kullanılmayan değerlendirme örneklerini seçin. Eğitilmiş modeli veya ön işleme hattını değiştirmeden önceden tanımlanmış açıklanabilirlik yöntemlerini uygulayın.
    2. Global ve yerel model açıklamaları oluşturun
      1. Tahmin modelinin genel davranışını karakterize etmek için global açıklamalar oluşturun.
      2. Bireysel model tahminlerini karakterize etmek için yerel açıklamalar oluşturun.
      3. Tablo model tahminlerinin global ve yerel açıklamalarını oluşturmak için Pima Indians Diabetes Veri Kümesi'ne SHAP uygulayın.
      4. Öznitelik katkılarının genel yönünü ve büyüklüğünü görselleştirmek için bir SHAP özet grafiği oluşturun.
      5. Öznitelikleri model tahminlerine yaptıkları genel katkıya göre sıralamak için ortalama mutlak SHAP değerlerini kullanarak bir SHAP öznitelik önem grafiği oluşturun.
      6. Hastaya özgü öznitelik katkılarını göstermek için temsilci bir test seti tahmini için bir SHAP şelale grafiği oluşturun.
      7. Seçilen bir öznitelik ile bu özniteliğin model çıktısına olan katkısı arasındaki ilişkiyi incelemek için bir SHAP öznitelik bağımlılık grafiği oluşturun.
      8. Bireysel model tahminlerinin yerel açıklamalarını oluşturmak için temsilci test seti tahminlerine LIME uygulayın.
      9. Tahmin edilen sonuçtaki bir değişiklikle ilişkili öznitelik değişikliklerini göstermek için hastaya özgü bir karşıt-olgusal (counterfactual) açıklama oluşturun.
      10. Veri modalitesine ve model mimarisine göre ek açıklanabilirlik teknikleri seçin.
      11. Uygun olduğunda, uyumlu görüntü tabanlı modeller için Grad-CAM veya belirginlik haritaları (saliency maps), transformer tabanlı mimariler için dikkat (attention) görselleştirmeleri ve diferansiyellenebilir modeller için Entegre Gradyanlar (Integrated Gradients) kullanın.
      12. Grad-CAM, belirginlik haritalama, dikkat görselleştirmesi ve Entegre Gradyanları genel, modaliteye bağımlı protokol seçenekleri olarak değerlendirin ve ilgili analizler gerçekten gerçekleştirilmediği sürece bunları Pima Indians Diabetes Veri Kümesi doğrulamasından elde edilen deneysel sonuçlar olarak yorumlamayın veya raporlamayın.
    3. Açıklanabilirlik yöntemlerini çalışılmış Pima doğrulamasına uygulayın
      1. Tablo model tahminlerinin global ve yerel açıklamalarını oluşturmak için Pima Indians Diabetes Veri Kümesi'ne SHAP ve LIME uygulayın.
      2. Pima doğrulama sonuçlarından SHAP özet, öznitelik önem, şelale ve öznitelik bağımlılığı görselleştirmeleri oluşturun.
      3. Temsilci test seti tahminleri için bir LIME yerel açıklaması oluşturun.
      4. Model tahminindeki bir değişiklikle ilişkili öznitelik değişikliklerini göstermek için hastaya özgü bir karşıt-olgusal açıklama oluşturun.
      5. Grad-CAM, dikkat görselleştirmesi, belirginlik haritalama ve Entegre Gradyanları, diğer sağlık hizmetleri veri türleri ve model mimarileri için modaliteye bağımlı açıklanabilirlik seçenekleri olarak değerlendirin.
      6. İlgili analizler gerçekten gerçekleştirilmediği sürece Grad-CAM, dikkat görselleştirmesi, belirginlik haritalama veya Entegre Gradyanları Pima çalışılmış doğrulamasından elde edilen deneysel bulgular olarak raporlamayın.
  2. Açıklama kalitesini değerlendirin
    1. Oluşturulan açıklamaların modelin tahmin sürecini yansıtıp yansıtmadığını değerlendirin. Tekrarlanan deneysel çalıştırmalarda açıklamaların kararlılığını ve özdeş hesaplama koşulları altında açıklama çıktılarının tutarlılığını değerlendirin.
    2. Uygun olduğunda, açıklama çıktılarının girdi verilerindeki değişikliklere karşı duyarlılığını değerlendirin. Oluşturulan açıklamaları mevcut alan bilgisi veya uzman yorumlarıyla karşılaştırın.
    3. Bu tür karşılaştırmalar mevcut olduğunda, yerleşik tıbbi bilgilerle örtüşen tahmin edici öznitelikleri veya anatomik bölgeleri belirleyin.
    4. Oluşturulan açıklamalar ile mevcut klinik yorum arasındaki uyum veya uyumsuzluk düzeyini kaydedin.
  3. Tahmin belirsizliğini nicelleştirin
    1. Seçilen model mimarisine ve sağlık uygulamasına uygun bir belirsizlik tahmini yöntemi kullanarak değerlendirilen örnekler için tahmin güven tahmini oluşturun.
    2. Uygun olduğunda Monte Carlo dropout, topluluk tabanlı (ensemble-based) tahmin, Bayesyen çıkarım, konformal tahmin veya doğrulanmış başka bir belirsizlik tahmini yaklaşımı uygulayın.
    3. Monte Carlo dropout kullanılırken stokastik tahmin geçişlerini tekrarlayın ve her değerlendirme örneği için ortalama tahmini ve tahmin varyansını hesaplayın.
    4. Tahmin güvenini veya belirsizlik aralıklarını, ilgili model tahminleriyle birlikte raporlayın.
    5. Belirsizlik tahminlerinin, daha düşük güvenilirlikle veya artan tahmin hatasıyla ilişkili tahminleri belirleyip belirlemediğini değerlendirin. Tekrarlanabilirliği sağlamak için belirsizlik tahmin yöntemini, parametrelerini, rastgele tohumlarını ve oluşturulan belirsizlik çıktılarını koruyun.
  4. Açıklanabilirlik çıktılarını belgeleyin ve koruyun
    1. Oluşturulan tüm öznitelik önem puanlarını, ısı haritalarını, belirginlik haritalarını, dikkat görselleştirmelerini ve hastaya özgü yorumları kaydedin. Açıklanabilirlik çıktılarını standartlaştırılmış dosya formatları kullanarak saklayın. Çıktıları, eğitilmiş model ve ön işleme yapılandırmasıyla birlikte arşivleyin.
    2. Açıklama oluşturma için kullanılan hesaplama ayarlarını, açıklama parametrelerini, yürütme süresini ve yazılım sürümlerini kaydedin. Bağımsız incelemeyi ve tekrarlanabilirliği kolaylaştırmak için eksiksiz açıklanabilirlik dokümantasyonunu koruyun.
  5. Açıklama kalitesini nicel olarak değerlendirin
    1. Önemli olarak tanımlanan öznitelikleri sistematik olarak bozarak veya maskeleyerek ve model çıktısındaki karşılık gelen değişikliği ölçerek açıklama sadakatini (faithfulness) değerlendirin. Atribüsyon büyüklüğünü, model tahmininde meydana gelen sonuçla karşılaştırarak bir açıklama sadakati puanı hesaplayın.
    2. Tekrarlanan çalıştırmalar, bozulmuş girdiler veya klinik olarak benzer örnekler için açıklamalar oluşturarak ve ortaya çıkan atribüsyon kalıpları arasındaki benzerliği hesaplayarak açıklama kararlılığını değerlendirin. Kontrollü girdi bozulmaları altında, tahmin edilen çıktı değişimi ile açıklama atribüsyonundan tahmin edilen değişim arasındaki tutarsızlığı ölçerek sadakatsizliği (infidelity) hesaplayın.
    3. Tıbbi görüntü açıklamaları için, referans anotasyonlar mevcut olduğunda, uzman tarafından tanımlanmış bir ilgi alanı (region of interest) kullanarak lokalizasyon doğruluğunu değerlendirin. Önceden tanımlanmış yorum kriterlerini kullanarak yetkin klinik uzmanlardan bağımsız değerlendirmeler alarak klinik yararlılığı değerlendirin.
    4. Birden fazla uzman, açıklama ilgisini veya uyumunu bağımsız olarak değerlendirdiğinde Cohen's kappa veya Fleiss' kappa hesaplayın.
      NOT: Eğitilmiş yapay zeka modelinin tahmin davranışını karakterize eden global ve yerel açıklamalar oluşturun. Şeffaf yorumlama ve tekrarlanabilir değerlendirme için açıklanabilirlik çıktılarını ve ilgili yapılandırmaları koruyun.

9. İstatistiksel doğrulama ve tekrarlanabilirlik değerlendirmesi gerçekleştirin

  1. İstatistiksel doğrulamayı gerçekleştirin
    1. Çalışma amacına, deneysel tasarıma, veri dağılımına ve değerlendirilen değişkenlerin özelliklerine göre istatistiksel yöntemleri seçin.
    2. Sürekli değişkenleri uygun şekilde ortalama ± standart sapma veya medyan ve çeyrekler arası aralık olarak; kategorik değişkenleri ise sayı ve yüzdeler olarak raporlayın.
    3. Model performans stabilitesini değerlendirmek için eğitim seti üzerinde beş katlı çapraz doğrulama yapın ve doğruluk, AUC-ROC, kesinlik, geri çağırma ve F1-skorunu katlar boyunca ortalama ± standart sapma olarak raporlayın. 1.000 bootstrap yeniden örneklemesi kullanarak bağımsız test seti performans metrikleri için %95 güven aralıklarını tahmin edin.
    4. Önerilen modeli; eşleşmiş doğruluk karşılaştırmaları için McNemar testi, korele AUC-ROC karşılaştırmaları için DeLong testi ve F1-skoru karşılaştırmaları için 1.000 yeniden örneklemeli eşleşmiş bootstrap testi kullanarak CNN, Random Forest ve SVM temel modelleri ile karşılaştırın.
    5. Her karşılaştırma için ilgili test istatistiğini ve kesin p-değerini raporlayın ve α = 0.05 iki yönlü anlamlılık düzeyini kullanın.
  2. Model performansını istatistiksel olarak karşılaştırın
    1. Önerilen açıklanabilir AI modelini, seçilen güncel makine öğrenimi ve derin öğrenim temel modelleri ile karşılaştırın.
    2. İki grubu karşılaştırırken uygun şekilde Student's t-testi veya Mann-Whitney U testini uygulayın. İkiden fazla grubun dahil olduğu uygun parametrik karşılaştırmalar için tek yönlü ANOVA'yı uygulayın. İkiden fazla grubun dahil olduğu uygun parametrik olmayan karşılaştırmalar için Kruskal-Wallis testini uygulayın.
    3. Orijinal makalede belirtildiği üzere, p < 0.05 değerini istatistiksel olarak anlamlı kabul edin.
    4. Tüm önceden tanımlanmış istatistiksel karşılaştırmalar için α = 0.05 iki yönlü anlamlılık düzeyini kullanın ve ilgili test istatistiklerini ve p-değerlerini raporlayın.
    5. Temel öngörücü performans metrikleri için %95 güven aralıklarını raporlayın.
    6. Uygun olduğunda, performans ölçümleri için güven aralıklarını tahmin etmek amacıyla bootstrap yeniden örneklemesi kullanın. Aynı denekler iki model tarafından değerlendirildiğinde, korele ROC-AUC değerlerini karşılaştırmak için DeLong testini kullanın. Aynı denekler için oluşturulan eşleşmiş kategorik sınıflandırma sonuçlarını karşılaştırmak için McNemar testini kullanın. Uygun olduğunda, F1-skoru veya diğer türetilmiş performans metriklerini karşılaştırmak için eşleşmiş bootstrap prosedürlerini kullanın.
    7. Olasılıksal tahminler mevcut olduğunda kalibrasyonu; kalibrasyon grafikleri, kalibrasyon eğimi/kesim noktası ve Brier skoru kullanarak değerlendirin.
    8. Uygulanan Pima Indians Diabetes Dataset doğrulaması için, önerilen model ve temel modeller için belirtilen önceden tanımlanmış eşleşmiş istatistiksel karşılaştırmayı kullanın. Seçilen testi, karşılaştırmaya uygun olarak, eşleşmiş test seti tahminlerine veya tekrarlanan çalıştırma performans ölçümlerine tutarlı bir şekilde uygulayın. İki yönlü α = 0.05 anlamlılık düzeyini kullanın ve test istatistiği ile kesin p-değerini raporlayın. Sonuçları Sonuçlar bölümünde sunulmadığı sürece alternatif istatistiksel testlerin gerçekleştirildiğini raporlamayın.
    9. İki yönlü testleri uygulayın ve istatistiksel anlamlılığı önceden tanımlanmış p < 0.05 eşiğini kullanarak yorumlayın.
  3. Model sağlamlığını değerlendirin
    1. Önceden tanımlanmış veri seti bölümlendirmesini, ön işleme prosedürlerini, model mimarisini, hiperparametreleri, yazılım ortamını ve değerlendirme protokolünü koruyarak, farklı rastgele tohumlar (random seeds) kullanarak tüm eğitim ve değerlendirme prosedürünü 10 kez tekrarlayın.
    2. Her bağımsız çalıştırma için AUC-ROC, doğruluk ve F1-skorunu kaydedin ve 10 çalıştırma boyunca ortalama ± standart sapmayı raporlayın.
    3. Farklı rastgele başlangıçlar altında öngörücü stabiliteyi ve tekrarlanabilirliği değerlendirmek için tekrarlanan çalışmalar sonucunda elde edilen performans değerlerini karşılaştırın.
  4. Açıklanabilirlik tekrarlanabilirliğini değerlendirin
    1. Açıklama stabilitesi değerlendirmesi dahil olduğunda, birden fazla deneysel çalışma boyunca özellik atamaları, dikkat haritaları veya diğer açıklama çıktılarını oluşturun. Tekrarlanan çalışmalar boyunca açıklama çıktılarını, uygun bir benzerlik veya sıra tabanlı uyum ölçütü kullanarak nicel olarak karşılaştırın.
    2. Mevcut Pima Indians Diabetes Dataset uygulamalı doğrulaması için, ilgili tekrarlanan açıklama çıktıları ve analizler gerçekleştirilmediği sürece nicel açıklama stabilitesi metriklerini raporlamayın.
    3. Uygun klinik değerlendirmeler mevcut olduğunda, model tarafından üretilen açıklamalar ile klinisyen yorumları arasındaki uyumu değerlendirin. Değerlendiriciler arasındaki uyumu değerlendirmek için uygun şekilde Cohen's kappa veya Fleiss' kappa değerini hesaplayın.
  5. Tekrarlanabilirliği belgeleyin
    1. Ham verileri, ön işleme prosedürlerini, kaynak kodu, eğitilmiş modelleri, hiperparametre yapılandırmalarını, açıklanabilirlik çıktılarını, istatistiksel analiz betiklerini ve oluşturulan sonuçları muhafaza edin.
    2. İş akışı boyunca kullanılan yazılım ortamını ve donanım yapılandırmasını kaydedin. Arşivlenen dosyaları ve yapılandırmaları kullanarak tüm iş akışını bağımsız olarak yeniden çalıştırın.
    3. Tekrarlanan öngörücü performansı orijinal deneysel sonuçlarla ve tekrarlanan model açıklamalarını orijinal açıklanabilirlik çıktılarıyla karşılaştırın.
    4. Tekrarlama sırasında gözlemlenen tüm farklılıkları kaydedin. Deneysel dokümantasyonu, bağımsız yürütme sırasında tespit edilen tekrarlanabilirlik gözlemlerini yansıtacak şekilde güncelleyin.
      NOT: Tekrarlanan deneyler boyunca değerlendirilebilecek istatistiksel olarak doğrulanmış öngörücü performans ve açıklanabilirlik sonuçları elde edin. Tüm iş akışının bağımsız doğrulanmasını sağlamak için yeterli hesaplama, analiz ve metodoloji dokümantasyonunu muhafaza edin.
  6. Tekrarlanabilirlik Kontrol Listesi
    1. Veri seti adını, sürümünü, edinme tarihini, kaynağını, dahil etme kriterlerini, hariç tutma kriterlerini ve nihai örnek sayısını kaydedin. Tüm ön işleme işlemlerini, dönüşüm parametrelerini, normalizasyon ayarlarını, özellik seçme prosedürlerini ve veri bölümlendirme kurallarını kaydedin.
    2. İşletim sistemini, CPU, GPU, RAM, Python sürümünü, framework sürümlerini ve kütüphane sürümlerini kaydedin. Tüm model mimarisi spesifikasyonlarını ve hiperparametreleri kaydedin.
    3. Optimize ediciyi, öğrenme oranını, batch boyutunu, epoch sayısını, kayıp fonksiyonunu, düzenleştirmeyi ve erken durdurma kriterlerini kaydedin. Tüm rastgele tohumları ve rastgele sayı üreteci ayarlarını kaydedin.
    4. Eğitilmiş model ağırlıklarını ve ön işleme yapılandırmalarını muhafaza edin. Eğitim günlüklerini, değerlendirme betiklerini, istatistiksel analiz betiklerini ve açıklanabilirlik çıktılarını muhafaza edin. Final deneyler için kullanılan model ve yazılım sürümlerini kaydedin.
    5. Bağımsız tekrarlama için gereken eksiksiz hesaplama ortamını muhafaza edin.
    6. Kaynak kodun, veri setlerinin, model ağırlıklarının ve destekleyici materyallerin; etik, yasal, lisanslama ve gizlilik kısıtlamalarına tabi olan erişilebilirliğini belgeleyin.
    7. Arşivlenen iş akışını bağımsız olarak yeniden çalıştırın ve tekrarlanan sonuçları orijinal sonuçlarla karşılaştırın.
    8. Tüm tekrarlanabilirlik gereksinimlerini standartlaştırılmış kontrol listesini kullanarak belgeleyin.

Sonuçlar

Önerilen XAI çerçevesi, temsilci sağlık veri seti olarak Pima Indians Diabetes Veri Seti kullanılarak uygulanmıştır. Pima Indians Diabetes Veri Seti, tek deneysel doğrulama veri seti olarak kullanılmıştır. Rapor edilen tüm öngörücü, açıklanabilirlik, istatistiksel ve tekrarlanabilirlik sonuçları bu veri setinden elde edilmiştir. TCGA-BRCA, TCGA-UCEC, MIMIC-III, ISIC 2019, HAM10000, OhioT1DM ve BraTS 2021 deneysel olarak değerlendirilmemiş olup, yalnızca genel protokolün farklı sağlık veri modaliteleri genelindeki uygulanabilirliğini gösteren örnekler olarak dahil edilmiştir. Geçersiz ve yinelenen kayıtlar kaldırıldıktan sonra veri setinin tamamı kullanılmış ve model geliştirme öncesinde belirtilen ön işleme işlemleri gerçekleştirilmiştir. Veri seti, önceden tanımlanmış tabakalı bölme stratejisi kullanılarak bağımsız eğitim, doğrulama ve test alt kümelerine ayrılmıştır. Veri sızıntısı olasılığını minimize etmek için üç alt küme arasındaki örnek bağımsızlığı korunmuştur.

Tahmin modeli, önceden tanımlanmış mimari ve hiperparametreler kullanılarak yapılandırılmıştır. Model, önceden belirlenmiş öğrenme oranı ve grup boyutu ile Adam optimize edici kullanılarak 100 epoka kadar eğitilmiştir. Doğrulama kaybına dayalı erken durdurma uygulanmış ve en iyi doğrulama performansına karşılık gelen model saklanmıştır. Tekrarlanabilirliği artırmak amacıyla veri kümesi bölümlendirme, model başlatma ve tekrarlanan deneyler için rastgele tohumlar belirtilmiştir.

Eğitilen model; doğruluk, kesinlik, duyarlılık, özgüllük, F1-skoru, Matthews korelasyon katsayısı (MCC), alıcı işletim karakteristik eğrisi altındaki alan (AUC-ROC) ve ortalama kesinlik (AP) kullanılarak bağımsız test seti üzerinde değerlendirilmiştir. Önerilen model, aynı ön işleme prosedürleri, veri bölümleri ve değerlendirme protokolleri kullanılarak önceden tanımlanmış temel modellerle karşılaştırılmıştır. Bağımsız test seti tahminlerinden alıcı işletim karakteristik (ROC) eğrileri, kesinlik-duyarlılık eğrileri ve bir hata matrisi oluşturulmuştur.

Performans kararlılığını değerlendirmek için eğitim verileri üzerinde beş katlı çapraz doğrulama gerçekleştirilmiştir. Temel performans metrikleri için %95 güven aralıkları tahmin edilmiş ve önerilen model ile temel modeller arasında önceden tanımlanmış istatistiksel karşılaştırmalar yapılmıştır.

Beş katlı çapraz doğrulama sonucunda %93,01 ± 0,48 doğruluk, 0,954 ± 0,007 AUC-ROC, %92,42 ± 0,87 kesinlik (precision), %93,02 ± 0,45 duyarlılık (recall) ve %92,72 ± 0,62 F1-skoru elde edilmiştir. 1.000 yeniden örnekleme ile tahmin edilen %95 bootstrap güven aralıkları; doğruluk için 0,897–0,973, kesinlik için 0,890–0,970, duyarlılık için 0,880–0,963, F1-skoru için 0,887–0,965 ve AUC-ROC için 0,931–0,984 olarak belirlenmiştir. CNN, Rastgele Orman (Random Forest) ve SVM temel modelleri ile yapılan istatistiksel karşılaştırmalar; doğruluk için McNemar testi, AUC-ROC için DeLong testi ve F1-skoru için 1.000 yeniden örnekleme ile eşleştirilmiş bootstrap testi kullanılarak gerçekleştirilmiştir.

Eğitim ve değerlendirme prosedürünün tamamı, farklı rastgele başlangıç değerleri (random seeds) kullanılarak 10 bağımsız çalışmada tekrarlanmıştır. Tekrarlanan çalışmalar 0,957 ± 0,008 AUC-ROC, %93,24 ± 0,74 doğruluk ve %92,35 ± 0,92 F1-skoru vermiş olup, bu durum tekrarlanan yürütmeler arasında nispeten düşük bir değişkenliğe işaret etmektedir. Tekrarlanan yürütmeler boyunca elde edilen performans metrikleri, ortalama ve standart sapma kullanılarak özetlenmiştir. Tahmin performansının tekrarlanan yürütmeler altında kararlı kalıp kalmadığını belirlemek için çalışmalar arasındaki değişkenlik incelenmiştir.

Bağımsız bir harici veri seti kullanılmadığı için mevcut çalışma örneğinde harici doğrulama gerçekleştirilmemiştir. Buna göre, raporlanan tüm öngörücü, istatistiksel ve tekrarlanabilirlik sonuçları; önceden tanımlanmış eğitim, doğrulama ve bağımsız test bölümleri kullanılarak Pima Indians Diabetes Veri Seti'nden elde edilmiştir. Harici doğrulama; farklı bir kurumdan, popülasyondan, coğrafi bölgeden veya zaman diliminden gelen bağımsız bir veri setinin mevcut olduğu uygulamalar için isteğe bağlı bir prosedür olarak protokolde tutulmuştur.

Model açıklamaları, SHAP ve LIME dahil olmak üzere tablo yapısındaki Pima Indians Diyabet Veri Setine uygulanabilen açıklanabilirlik teknikleri kullanılarak oluşturulmuştur. Küresel öznitelik önemi değerlendirilmiş ve ayrılmış test örnekleri kullanılarak hastaya özgü yerel açıklamalar üretilmiştir. Tekrarlanabilirliği ve sonraki yorumlamaları kolaylaştırmak amacıyla, açıklama çıktıları ilgili model tahminleri ve öznitelik değerleri ile birlikte kaydedilmiştir.

Netlik sağlamak amacıyla, mevcut uygulama örneği Tablo 1'de tanımlanan dokuz temel iş akışı aşamasından oluşmuştur. Dış doğrulama ve klinik uzman değerlendirmesi, genel protokolün isteğe bağlı doğrulama modülleri olarak tutulmuştur. Bağımsız bir dış veri seti kullanılmadığı için dış doğrulama gerçekleştirilmemiş ve mevcut uygulama örneğine resmi bir uzman değerlendirme paneli dahil edilmediği için klinik uzman değerlendirmesi yapılmamıştır. Buna göre, bu isteğe bağlı modüller dokuz aşamalı deneysel iş akışının bir parçası olarak kabul edilmemiş ve deneysel sonuçlar olarak raporlanmamıştır.

Önişleme ve veri seti bölümlendirme prosedürleri, model geliştirme için uygun standartlaştırılmış bir veri seti oluşturmuştur. Yinelenen ve tutarsız kayıtlar kaldırılmış, eksik değerler önceden tanımlanmış stratejiye göre işlenmiş, sayısal özellikler standartlaştırılmış ve veri seti bağımsız eğitim, doğrulama ve test alt kümelerine bölünmüştür. Ortaya çıkan veri seti özellikleri ve önişleme prosedürleri Tablo 2'de özetlenmiştir. Genel sağlık hizmetleri veri seti hazırlama ve önişleme iş akışı Şekil 2'de gösterilmiş; Pima İndianlar Diyabet Veri Seti'ne özel olarak uygulanan deneysel hazırlama, önişleme, bölümlendirme ve kalite değerlendirme iş akışı ise Şekil 3'te gösterilmiştir. Rapor edilen sonuçları üretmek için kullanılan nihai hesaplama ortamı, model mimarisi ve hiperparametre yapılandırması Tablo 3'te özetlenmiştir.

Bölüm 3 ve 4'ün uygulanması, model geliştirme için uygun, standardize edilmiş bir sağlık hizmetleri veri seti sağlamıştır. Ön işleme prosedürleri ile yinelenen ve tutarsız kayıtlar kaldırılmış, eksik değerler tamamlanmış, sayısal özellikler standardize edilmiş, uygulanabildiği yerlerde kategorik değişkenler kodlanmış ve veri seti eğitim, doğrulama ve test alt kümelerine ayrılmıştır. Elde edilen veriler, sonraki model geliştirme aşaması için gerekli olan standardize edilmiş girdiyi sağlamıştır.

Bölüm 5 ve 6 tamamlandıktan sonra, yapılandırılan model eğitim sırasında kararlı bir yakınsama göstermiştir. Öğrenme eğrileri, eğitim ve doğrulama kayıplarında eş zamanlı azalmalar ile eğitim ve doğrulama doğruluğunda artışlar sergilemiştir. Hiperparametre optimizasyonu, önemli bir aşırı öğrenme kanıtı olmaksızın model genellemesini iyileştirmiştir. Tekrar üretilebilirliği desteklemek amacıyla; optimize edilmiş model; kesinleşmiş mimari, hiperparametre ayarları, yazılım sürümleri, rastgele tohumlar ve eğitilmiş model ağırlıkları ile birlikte arşivlenmiştir. Model eğitim spesifikasyonları ve optimizasyon sonuçları şurada özetlenmiştir: Tablo 4ve buna karşılık gelen eğitim ve doğrulama öğrenme eğrileri şurada sunulmuştur: Şekil 4.

Bölüm 7, modelin öngörücü performansını standartlaştırılmış performans metrikleri kullanarak değerlendirmiştir. Değerlendirilen sınıflandırma metrikleri arasında doğruluk, kesinlik, duyarlılık, özgüllük, F1-skoru, MCC, AUC-ROC ve AP yer almıştır. Önerilen model; aynı veri seti bölümleri, ön işleme prosedürleri ve değerlendirme protokolü kullanılarak önceden tanımlanmış temel modellerle karşılaştırılmıştır. Öngörücü performans karşılaştırması Tablo 5'te sunulmuş; ROC eğrileri, kesinlik-duyarlılık eğrileri, karmaşıklık matrisi ve karşılaştırmalı performans metrikleri ise Şekil 5'te gösterilmiştir.

Bölüm 8'in ardından, modelin yorumlanabilirliğini değerlendirmek için tahminlerin hem küresel hem de yerel açıklamaları oluşturulmuştur. Tablo biçimindeki Pima Kızılderilileri Diyabet Veri Kümesi için model açıklamaları SHAP ve LIME kullanılarak oluşturulmuş ve tahmindeki bir değişikliği örneklendirmek için hastaya özgü karşıolgusal (counterfactual) bir açıklama üretilmiştir. Küresel öznitelik önem derecesi, hastaya özgü şelale (waterfall) ve öznitelik bağımlılığı görselleştirmelerini oluşturmak için SHAP kullanılırken, ayrılmış test örneklerinden yerel açıklamalar oluşturmak için LIME kullanılmıştır. İlgili açıklanabilirlik çıktıları Şekil 6'da sunulmuştur.

Protokolün son aşamasında, iş akışının istatistiksel güvenilirliği ve tekrarlanabilirliği değerlendirilmiştir. Aynı veri kümesi bölüştürme stratejisi, ön işleme parametreleri, model mimarisi, hiperparametreler, yazılım ortamı ve değerlendirme prosedürleri korunarak, farklı rastgele tohumlar (random seeds) kullanılarak toplam iş akışı 10 bağımsız çalışma boyunca tekrarlanmıştır. Tekrarlanan çalışmalar; 0.957 ± 0.008 AUC-ROC, %93.24 ± 0.74 doğruluk ve %92.35 ± 0.92 F1-skoru değerleri vermiş olup, bu durum tekrarlanan yürütmeler arasında nispeten düşük bir değişkenliğe işaret etmektedir.

Açıklama stabilitesi, mevcut çalışma doğrulamasında nicel olarak değerlendirilmemiştir. Pima Kızılderilileri Diyabet Veri Kümesi için SHAP ve LIME açıklamaları oluşturulmuş olsa da, ayrı bir çalışmalar arası sıra korelasyonu veya öznitelik örtüşme analizi yapılmamıştır. Bu nedenle, herhangi bir sayısal açıklama, stabilite veya atıf uyum metriği rapor edilmemiştir. Nicel açıklama stabilitesi değerlendirmesi, tekrarlanan açıklama çıktılarının mevcut olduğu uygulamalar için isteğe bağlı bir tekrarlanabilirlik prosedürü olarak genel protokolde tutulmuştur.

İstatistiksel karşılaştırmalar, önceden tanımlanmış p < 0,05 anlamlılık eşiği kullanılarak değerlendirilmiştir. Uygun olan durumlarda çift yönlü istatistiksel testler kullanılmış; gözlenen performans farklarının istatistiksel anlamlılığını ve belirsizliğini belirlemek için ilgili test istatistikleri, p-değerleri ve %95 güven aralıkları rapor edilmiştir. Çapraz doğrulama performansı, güven aralıkları, istatistiksel karşılaştırmalar ve tekrarlı çalışma değişkenliği dahil olmak üzere deneysel istatistiksel doğrulama ve tekrarlanabilirlik sonuçları Tablo 6'da özetlenmiştir. İlgili istatistiksel testler ve tekrarlanabilirlik analizleri Şekil 7'de gösterilmiştir.

Bu sonuçlar, test edilen hesaplama koşulları ve veri kümesi altında öngörülebilir stabilite ve tekrarlanabilirliğe dair deneysel kanıtlar sağlamıştır. Bağımsız tekrarlama için gerekli olan hesaplama ortamı, veri kümesi özellikleri, ön işleme prosedürleri, model konfigürasyonu, istatistiksel analizler ve açıklanabilirlik ayarları, Tablo 7'de sunulan tekrarlanabilirlik kontrol listesine uygun olarak belgelenmiştir. Mevcut çalışmanın uygulama doğrulama örneğinde, oluşturulan XAI çıktılarının klinik uzman değerlendirmesi gerçekleştirilmemiştir.

Genel olarak, protokolün uygulanması, yapay zeka model geliştirme için uygun standartlaştırılmış bir sağlık veri seti ve önceden tanımlanmış hiperparametre ayarları kullanılarak optimize edilmiş bir model üretmiştir. İş akışı, öngörücü performansın sistematik değerlendirmesine, uygun XAI teknikleri kullanılarak model açıklamalarının oluşturulmasına ve modelin sağlamlığının ve tekrarlanabilirliğinin istatistiksel analizine olanak sağlamıştır. Sonuçlar toplu olarak, üzerinde çalışılan doğrulama örneğinde değerlendirilen deneysel koşullar altında önerilen XAI iş akışının uygulanabilirliğini ve tekrarlanabilirliğini kanıtlamıştır.

figure-results-1
Şekil 1: Sağlık hizmetlerinde tekrarlanabilir ve açıklanabilir YZ modelleri geliştirmek için dokuz aşamalı temel iş akışı. İş akışı; (1) sağlık hizmetleri tahmin görevi tanımı, (2) hesaplama ortamı konfigürasyonu, (3) veri seti edinimi ve doğrulaması, (4) veri ön işleme, (5) veri seti bölümlendirme, (6) öngörücü model eğitimi, (7) öngörücü performans değerlendirmesi, (8) açıklanabilirlik analizi ve (9) istatistiksel doğrulama ile tekrarlanabilirlik değerlendirmesinden oluşur. Harici doğrulama ve klinik uzman değerlendirmesi, isteğe bağlı protokol uzantıları olarak ele alınmıştır ve dokuz aşamalı temel iş akışına dahil edilmemiştir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

figure-results-2
Şekil 2: Sağlık hizmetleri veri seti hazırlama ve ön işleme iş akışı. (A) Klinik kayıtlar, tıbbi görüntüleme, fizyolojik sinyaller ve multimodal veri kaynaklarından sağlık hizmetleri veri edinimi. (B) Kayıp değerlerin yönetimi, normalleştirme, gürültü giderme ve veri artırımı dahil olmak üzere veri entegrasyonu ve ön işleme. (C) Veri setinin eğitim, doğrulama ve test alt kümelerine ayrılması. (D) Model geliştirme öncesindeki sınıf dağılımını, özellik normalizasyonunu ve ön işleme çıktılarını gösteren kalite değerlendirmesi. Lütfen bu şeklin daha büyük bir versiyonunu görüntülemek için buraya tıklayın.

figure-results-3
Şekil 3: Pima Kızılderilileri Diyabet Veri Setinin hazırlanması, ön işlemesi, bölümlenmesi ve kalite değerlendirmesi için deneysel iş akışı. İş akışı; veri setinin edinilmesini, veri kalitesi değerlendirmesini, geçersiz ve eksik değerlerin yönetilmesini, sayısal özelliklerin standartlaştırılmasını, veri setinin eğitim, doğrulama ve bağımsız test alt kümelerine bölünmesini ve model geliştirme öncesindeki son kalite doğrulamasını içermektedir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

figure-results-4
Şekil 4: Pima Indians Diyabet Veri Seti kullanılarak önerilen modelin deneysel eğitim ve doğrulama öğrenme eğrileri. (A) Tüm eğitim süresi boyunca eğitim ve doğrulama kaybı. (B) Tüm eğitim süresi boyunca eğitim ve doğrulama doğruluğu. (C) 50–100. epoklar arasındaki kaybın büyütülmüş görünümü. (D) 50–100. epoklar arasındaki doğruluğun büyütülmüş görünümü. En iyi doğrulama performansı, 0.142 doğrulama kaybı ve %94.6 doğrulama doğruluğu ile 78. epokta elde edilmiştir. Erken durdurma, 10 epokluk bir sabır (patience) değeri kullanılarak 88. epokta tetiklenmiştir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

figure-results-5
Şekil 5: Önerilen XAI çerçevesinin bağımsız test seti (n = 154) kullanılarak deneysel kestirim performans değerlendirmesi. (A) Önerilen XAI modelinin ve temel modellerin ayırt etme performansını gösteren alıcı işletim karakteristik (ROC) eğrisi. (B) Önerilen XAI modelinin ve temel modellerin kesinlik ve duyarlılık performansını gösteren kesinlik-duyarlılık (PR) eğrileri. (C) Önerilen XAI modelinin bağımsız test setindeki konfüzyon matrisi ile ilgili doğruluk, duyarlılık (recall) ve özgüllük değerleri. (D) Değerlendirilen modeller arasında doğruluk, kesinlik, duyarlılık, özgüllük, F1-skoru, Matthews korelasyon katsayısı (MCC), ROC eğri altındaki alan (AUC) ve ortalama kesinliğin (AP) karşılaştırması. Bu şekilde gösterilen tüm nicel sonuçlar, Pima Indians Diabetes Veri Seti üzerindeki doğrulama deneyine karşılık gelmektedir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

figure-results-6
Şekil 6: Pima Indians Diabetes Veri Kümesi ile eğitilen önerilen modelin bağımsız test seti tahminlerinden üretilen açıklanabilirlik çıktıları. (A) Test seti genelinde özellik katkılarının dağılımını gösteren global SHAP özet grafiği. (B) Ortalama mutlak SHAP değerlerine dayalı SHAP özellik önem grafiği. (C) Bireysel özelliklerin tahmin edilen diyabet olasılığına katkılarını gösteren hastaya özgü SHAP şelale grafiği. (D) 125 numaralı Test Hastası için özellik katkılarını gösteren LIME yerel açıklaması. (E) Glikoz değerleri ile bunların SHAP katkıları arasındaki ilişkiyi gösteren SHAP bağımlılık grafiği. (F) Model tahminindeki bir değişiklikle ilişkili minimum özellik değişimlerini gösteren hastaya özgü karşı-olgusal açıklama. Kısaltmalar: SHAP = Shapley Additive exPlanations; LIME = Local Interpretable Model-agnostic Explanations. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

figure-results-7
Şekil 7: Pima Kızılderilileri Diyabet Veri Kümesi kullanılarak önerilen modelin deneysel istatistiksel doğrulaması ve tekrarlanabilirlik analizi. (A) Eğitim seti üzerindeki beş katlı çapraz doğrulama performansı. (B) Bağımsız test seti performansı için %95 bootstrap güven aralıkları. (C) İstatistiksel test, test istatistiği, p-değeri ve anlamlılık dahil olmak üzere temel modellerle yapılan istatistiksel karşılaştırmalar. (D) Farklı rastgele tohumlar kullanılarak gerçekleştirilen 10 bağımsız çalıştırma genelindeki performans tutarlılığı. Eşleştirilmiş sınıflandırma doğruluğu için McNemar testi, korele ROC-AUC için DeLong testi ve F1-skoru karşılaştırması için 1.000 yeniden örnekleme ile eşleştirilmiş bootstrap testi kullanılmıştır. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

EvreProtokol aktivitesiBeklenen çıktıUygulama durumu
1Sağlık hizmetleri veri setini seçin ve doğrulayınDoğrulanmış veri seti, öngörü hedefi, sınıf dağılımı ve veri kalitesi bilgileriGerçekleştirildi
2Hesaplama ortamını yapılandırınDoğrulanmış donanım, yazılım, kütüphaneler, versiyonlar ve hesaplamalı konfigürasyonGerçekleştirildi
3Sağlık hizmetleri verilerini ön işlemden geçirin ve kalite kontrolünü yapınTemizlenmiş, dönüştürülmüş ve standartlaştırılmış veri setiGerçekleştirildi
4Veri setini bölümlere ayırınBağımsız eğitim, doğrulama ve test veri kümeleriGerçekleştirildi
5Öngörücü/XAI modelini geliştirin ve optimize edinKesinleştirilmiş model mimarisi ve hiperparametrelerGerçekleştirildi
6Modeli eğitin ve kaydedinEğitilmiş model, kontrol noktası, eğitim konfigürasyonu ve günlüklerGerçekleştirildi
7Öngörücü ve hesaplamalı performansı değerlendirinTest seti performans metrikleri ve performans karşılaştırmalarıGerçekleştirildi
8Açıklanabilirlik çıktıları oluşturma ve değerlendirmeSHAP/LIME ve uygulanabilir açıklama çıktılarıGerçekleştirildi
9İstatistiksel doğrulama ve tekrarlanabilirlik değerlendirmesi gerçekleştirinGüven aralıkları, istatistiksel testler, tekrarlanan çalışma sonuçları ve tekrarlanabilirlik ölçümleriGerçekleştirildi

Tablo 1: Pima Kızılderilileri Diyabet Veri Kümesi kullanılarak gerçekleştirilen doğrulama çalışmasında uygulanan dokuz aşamalı temel protokol iş akışının özeti. Tablo, Pima Kızılderilileri Diyabet Veri Kümesi uygulama örneğinde hayata geçirilen dokuz aşamayı; genel protokolün isteğe bağlı bileşenleri olarak tutulan dış doğrulama ve klinik uzman değerlendirmesinden ayırmaktadır.

Veri SetiVeri KaynağıKlinik UygulamaVeri ModalitesiDenekler/KayıtlarNumunelerSınıflarSınıf DağılımıEğitim/Doğrulama/TestMevcut Çalışmadaki RolüDoğrulama DurumuKaynak URL
Pima Indianları Diyabet Veri SetiUCI Makine Öğrenmesi DeposuDiyabet tahminiKlinik tablo768 kayıt7682500 diyabetik olmayan; 268 diyabetik60% / 20% / 20%Birincil deneysel doğrulama veri setiGerçekleştirildi – dokuz aşamalı temel iş akışı tamamlandıhttps://archive.ics.uci.edu/dataset/34/pima+indians+diabetes
TCGA-BRCANCI Genomik Veri Ortaklığı (GDC), TCGA-BRCA projesiMeme kanseri sınıflandırmasıKlinik + histopatoloji1.098 vakaVeri türüne göre veri kümesi bağımlıUç nokta bağımlıVeri kümesi genelinde tek bir sınıf dağılımı yokturUygulanamaz – herhangi bir deneysel ayırım yapılmadıSadece protokol uygulanabilirlik örneğidirDeneysel doğrulama için kullanılmamıştırhttps://portal.gdc.cancer.gov/projects/TCGA-BRCA
TCGA-UCECNCI Genomik Veri Ortaklığı (GDC), TCGA-UCEC projesiEndometrial kanser sınıflandırmasıKlinik + histopatolojiProje kohortu; boyutu seçilen veri tipine ve filtrelere bağlıdırVeri türüne göre veri setine bağımlıUç nokta bağımlıTüm veri kümesi genelinde tek bir sınıf dağılımı yokturUygulanamaz – deneysel ayırım yapılmamıştırYalnızca protokol uygulanabilirlik örneğiDeneysel doğrulama için kullanılmamıştırhttps://portal.gdc.cancer.gov/projects/TCGA-UCEC
MIMIC-IIIPhysioNet, MIMIC-III Klinik Veritabanı v1.4Klinik sonuç tahminiKlinik zaman serileri46.520 hasta58.976 yoğun bakım ünitesi yatışıGöreve bağımlıVeritabanı genelinde tek bir sınıf dağılımı yokturUygulanamaz – herhangi bir deneysel ayırım yapılmamıştırYalnızca protokol uygulanabilirlik örneğiDeneysel doğrulama için kullanılmamıştırhttps://physionet.org/content/mimiciii/1.4/
ISIC 2019Uluslararası Cilt Görüntüleme İş Birliği (ISIC) YarışmasıCilt lezyonu sınıflandırmasıDermoskopik görüntülerUygulanamaz – görüntü veri seti25.331 eğitim görüntüsü8 eğitim kategorisiAKIEC 867; BCC 3.323; BKL 2.624; DF 239; MEL 4.522; NV 12.875; VASC 253; SCC 628Uygulanamaz – herhangi bir deneysel ayırma işlemi gerçekleştirilmemiştirYalnızca protokol uygulanabilirlik örneğiDeneysel doğrulama için kullanılmamıştırhttps://challenge.isic-archive.com/landing/2019/
HAM10000Harvard Dataverse / ISIC ArşiviCilt lezyonu sınıflandırmasıDermoskopik görüntüler7.470 benzersiz lezyon10.015 görüntü7AKIEC 327; BCC 514; BKL 1.099; DF 115; MEL 1.113; NV 6.705; VASC 142Uygulanamaz – herhangi bir deneysel ayırma gerçekleştirilmemiştirYalnızca protokol uygulanabilirlik örneğidirDeneysel doğrulama için kullanılmamıştır**Sanal gerçeklik (VR) ve artırılmış gerçeklik (AR) içeren eğitsel modüllerin tıp eğitimindeki etkisi** **Özet** Bu çalışma, tıp öğrencilerinin anatomik yapıları ve karmaşık fizyolojik süreçleri anlamalarını desteklemek amacıyla geliştirilen sanal gerçeklik (VR) ve artırılmış gerçeklik (AR) entegreli eğitsel modüllerin etkinliğini değerlendirmektedir. Geleneksel öğretim yöntemleriyle karşılaştırıldığında, bu teknolojik araçların öğrenci başarısı, bilgi kalıcılığı ve öğrenci motivasyonu üzerindeki etkileri analiz edilmiştir. Sonuçlar, VR ve AR destekli eğitimin, özellikle üç boyutlu spatial (konumsal) ilişkilerin kavranmasında anlamlı bir iyileşme sağladığını ve teorik bilgilerin klinik uygulama becerilerine aktarılmasını kolaylaştırdığını göstermektedir. **Anahtar Kelimeler** Sanal Gerçeklik, Artırılmış Gerçeklik, Tıp Eğitimi, Eğitim Teknolojileri, Anatomi Eğitimi, Simülasyon Tabanlı Öğrenme
OhioT1DMaraştırma amacıyla kamuya açık olarak dağıtılan OhioT1DM veri setiDiyabet izleme/öngörüKlinik zaman serileri12 katılımcıEğitim/geliştirme ve test verilerine yayılmış 24 XML dosyasıSürekli glikoz tahmini; sabit bir sınıflandırma görevi değildirUygulanamazVeri seti tarafından tanımlanmış eğitim/geliştirme ve test dosyaları; burada herhangi bir deneysel bölme işlemi gerçekleştirilmemiştirYalnızca protokol uygulanabilirlik örneğiDeneysel doğrulama için kullanılmamıştırKovid-19 Pandemisi Sırasında ve Sonrasında Klinik Araştırmalarda Hasta Alımı ve Veri Kalitesini Optimize Etmek İçin Stratejiler Özet Kovid-19 pandemisi, klinik araştırmaların yürütülüş biçimini kökten değiştirerek hasta alımı ve veri kalitesi üzerinde ciddi etkiler yaratmıştır. Kısıtlamalar, hastanelerin kapasitesindeki aşırı yüklenmeler ve katılımcıların sağlık endişeleri, geleneksel klinik araştırma yöntemlerini sekteye uğratmıştır. Bu makale, pandemi sırasında ortaya çıkan zorlukları analiz etmekte ve hem mevcut hem de gelecek sağlık krizlerinde hasta alımını optimize etmek ve veri bütünlüğünü korumak için kullanılan stratejileri tartışmaktadır. Dijital sağlık teknolojilerinin, uzaktan izleme araçlarının ve merkeziyetsiz klinik araştırma (DCT) modellerinin entegrasyonu, katılımcı erişilebilirliğini artırmış ve operasyonel sürekliliği sağlamıştır. Ayrıca, veri kalitesini artırmak için dijital veri toplama yöntemlerinin ve gerçek dünya kanıtlarının (RWE) kullanımı üzerine odaklanılmıştır. Bu stratejilerin, gelecekteki klinik araştırmalar için daha dirençli ve esnek bir çerçeve oluşturduğu sonucuna varılmıştır. Anahtar Kelimeler: Kovid-19, klinik araştırmalar, hasta alımı, veri kalitesi, merkeziyetsiz klinik araştırmalar, dijital sağlık, gerçek dünya kanıtları Giriş Sars-CoV-2 virüsünün neden olduğu Kovid-19 pandemisi, küresel sağlık sistemlerini daha önce görülmemiş bir baskı altına almış ve klinik araştırmaların yürütülmesinde ciddi engeller yaratmıştır. Klinik araştırmalar, yeni terapötiklerin ve aşıların geliştirilmesinde kritik bir rol oynamasına rağmen, pandemi dönemindeki hareket kısıtlamaları ve sağlık kuruluşlarındaki öncelik değişimleri, birçok çalışmanın durdurulmasına veya gecikmesine neden olmuştur. Özellikle hasta alım süreçleri ve verilerin güvenilir bir şekilde toplanması, araştırmacıların karşılaştığı en büyük zorluklar haline gelmiştir. Pandemi, geleneksel "merkez odaklı" araştırma modellerinin kırılganlığını ortaya çıkarmıştır. Katılımcıların klinik ziyaretlere gelme sıklığının azalması, veri kaybına ve takip oranlarının düşmesine yol açmıştır. Bu durum, araştırmacıları daha esnek, teknoloji odaklı ve hasta merkezli yaklaşımlar geliştirmeye itmiştir. Hasta Alımını Optimize Etmek İçin Stratejiler Pandemi döneminde hasta alım sayılarını korumak ve artırmak için çok boyutlu yaklaşımlar benimsenmiştir. Sanal Tarama ve Dijital Kayıt Geleneksel olarak klinik ziyaretlerle gerçekleştirilen ön tarama süreçleri, dijital platformlara taşınmıştır. Çevrimiçi anketler ve tele-sağlık görüşmeleri kullanılarak, potansiyel katılımcıların uygunluğu uzaktan değerlendirilmiştir. Bu yöntem, hem hastaların enfeksiyon riskini azaltmış hem de tarama sürecini hızlandırmıştır. Merkeziyetsiz Klinik Araştırmalar (DCT) Merkeziyetsiz klinik araştırma modelleri, katılımcının klinik merkeze olan bağımlılığını minimize eden bir yapı sunmuştur. Evde bakım hizmetleri, yerel laboratuvarların kullanımı ve giyilebilir sağlık teknolojileri aracılığıyla veri toplama süreçleri katılımcının kendi ortamına taşınmıştır. Bu yaklaşım, özellikle hareket kısıtlamalarının olduğu bölgelerde katılım oranlarını anlamlı ölçüde artırmıştır. Çeşitlilik ve Kapsayıcılık Salgının farklı sosyo-ekonomik ve etnik grupları farklı şekillerde etkilemesi, klinik araştırmalarda çeşitliliğin önemini bir kez daha ortaya koymuştur. Dijital erişim araçlarının genişletilmesi ve topluluk temelli etkileşim stratejileri sayesinde, daha geniş ve heterojen popülasyonlara ulaşma imkanı sağlanmıştır. Veri Kalitesini Korumak ve Artırmak Veri kalitesi, klinik araştırmaların geçerliliği için temel taşıdır. Pandemi sırasında veri kaybını önlemek ve doğruluğu sağlamak için şu yöntemler uygulanmıştır: Elektronik Veri Yakalama (EDC) ve eCOA Kağıt tabanlı kayıtlar yerine Elektronik Veri Yakalama (EDC) sistemleri ve Elektronik Klinik Sonuç Değerlendirmeleri (eCOA) kullanımı yaygınlaştırılmıştır. Gerçek zamanlı veri girişi, hataların anında tespit edilmesini sağlamış ve veri girişindeki gecikmeleri önlemiştir. Uzaktan İzleme ve Giyilebilir Teknolojiler Akıllı saatler, glukoz izleme sistemleri ve diğer giyilebilir cihazlar, katılımcıların fizyolojik verilerinin sürekli ve objektif bir şekilde toplanmasına olanak tanımıştır. Bu durum, nadir görülen olayların yakalanma olasılığını artırmış ve hasta raporlamasına dayalı subjektif veri bağımlılığını azaltmıştır. Gerçek Dünya Kanıtlarının (RWE) Kullanımı Kontrollü klinik deneylerin zorlaştığı durumlarda, elektronik sağlık kayıtları ve sigorta idari verileri gibi gerçek dünya verileri, tedavi etkilerini değerlendirmek için tamamlayıcı kaynaklar olarak kullanılmıştır. RWE, ilaçların geniş popülasyonlardaki etkinliğini ve güvenliğini anlamada kritik bir rol oynamıştır. Tartışma ve Gelecek Perspektifleri Kovid-19 pandemisi, klinik araştırmalarda dijital dönüşümü hızlandıran bir katalizör görevi görmüştür. Ancak, bu süreç bazı temel zorlukları da beraberinde getirmiştir. Dijital uçurum (teknolojiye erişim farkı), veri gizliliği ve siber güvenlik riskleri, merkeziyetsiz modellerin önündeki temel engeller olarak kalmaya devam etmektedir. Gelecek dönemde, hibrit modellerin (hem merkez odaklı hem de sanal bileşenlerin bir arada olduğu) daha yaygın hale gelmesi beklenmektedir. Düzenleyici kurumların (FDA, EMA gibi) dijital verilere ve uzaktan izleme protokollerine olan yaklaşımının esnemesi, bu modellerin standardize edilmesini kolaylaştıracaktır. Sonuç Kovid-19 pandemisi, klinik araştırma metodolojilerinde zorunlu bir evrimi tetiklemiştir. Hasta alımını optimize etmek için kullanılan dijital stratejiler ve veri kalitesini korumaya yönelik teknolojik yenilikler, sadece pandemi dönemi için değil, gelecekteki tüm klinik araştırmalar için bir temel oluşturmuştur. Daha esnek, hasta merkezli ve veri odaklı yaklaşımların benimsenmesi, tıbbi araştırmaların dayanıklılığını artıracak ve yeni tedavilerin hastalara ulaştırılma süresini kısaltacaktır.
BraTS 2021RSNA-ASNR-MICCAI BraTS 2021; CBICA/Pennsylvania ÜniversitesiBeyin tümörü segmentasyonu/sınıflandırılmasıMRGmeydan okuma kohortunda 2.040 vaka1.251 adet açıklanmış eğitim vakası; vaka başına dört MRI modalitesiGöreve bağlıTek bir veri kümesi genelinde sınıf dağılımı yokChallenge ile tanımlanmış kohortlar; burada herhangi bir deneysel ayırma işlemi gerçekleştirilmemiştirYalnızca protokol uygulanabilirlik örneğidirDeneysel doğrulama için kullanılmamıştırhttps://www.med.upenn.edu/cbica/brats2021/

Tablo 2: Sağlık hizmetleri veri seti özellikleri ve önerilen protokolün uygulanabilirliği. Tablo, protokolde dikkate alınan sağlık hizmetleri veri setleri için veri kaynaklarını, klinik uygulamaları, modaliteleri, örnek özelliklerini, sınıf dağılımlarını, veri seti bölümlendirme stratejilerini, doğrulama durumunu ve kaynak bilgilerini özetlemektedir. Pima Indians Diabetes Veri Seti, protokol doğrulaması için temel olarak çalışılan örnek olarak hizmet etmektedir.

Konfigürasyon ÖğesiGerçek Çalışma-Doğrulama OrtamıDurum / Yorumlama
Veri SetiPima Yerlileri Diyabet Veri SetiGerçek deneysel doğrulama veri seti
Algoritma / Modelİkili diyabet sınıflandırması için tabüler öngörücü modelEğer ayrı olarak belgelendirilmişse, deney kaydındaki mimari adını aynen kullanın
Öğrenme Oranı0.001Deneysel düzenek
Optimize EdiciAdamDeneysel düzenek
Yığın Boyutu32Deneysel düzenek
Maksimum Epok Sayısı100Deneysel düzenek
Kayıp FonksiyonuÇapraz EntropiDeneysel düzenek
Aktivasyon FonksiyonuReLU (Doğrusal Olmayan Doğrultucu Birim)Deneysel düzenek
Dropout0.5Deneysel düzenek
Ağırlık Azalımı1e-4Deneysel düzenek
Yığın NormalizasyonuEtkinleştirildiDeneysel düzenek
Veri Artırma / Sınıf DengelemeEtkinleştirildiSMOTE'yi yalnızca bildirilen çalışmada gerçekten uygulandıysa belirtin
Doğrulama Stratejisi5 katlı çapraz doğrulamaDeneysel düzenek
Erken DurdurmaSabır süresi = 10 epochDeneysel düzenek
Rastgele Tohum42Deney için kaydedilen kesin seed konfigürasyonunu kullanın
Tekrarlanan Çalışmalarfarklı rastgele tohumlar kullanılarak gerçekleştirilen 10 bağımsız çalışmaDeneysel tekrarlanabilirlik analizi
Girdi Görüntü BoyutuUygulanamazPima veri seti tablosal özelliktedir
Öznitelik Boyutu512Yalnızca bunun nihai uygulanan öznitelik temsili olması durumunda kullanın
AçıklanabilirlikSHAP + LIME; Şekil 6'da gösterilen karşıolgusal açıklamaGerçekleştirilen XAI analizi raporu
Değerlendirme MetrikleriDoğruluk, kesinlik, duyarlılık, özgüllük, F1-skoru, MCC, AUC-ROC, APRaporlanan deneysel değerlendirme metrikleri
DonanımNVIDIA GPUKayıt altına alınmışsa tam GPU modeli ile değiştirin
Yazılım / ÇerçevePython 3.11; Scikit-learn; uygulama tarafından kullanılan framework bileşenleriKaydedilmişse paketlerin kesin sürümlerini kullanın

Tablo 3: Protokol uygulaması için kullanılan hesaplama ortamı, model mimarisi ve hiperparametre konfigürasyonu. Tablo; önerilen XAI iş akışını uygulamak için kullanılan hesaplama platformunu, yazılım ortamını, model mimarisini, giriş konfigürasyonunu, optimizasyon parametrelerini, düzenlileştirme ayarlarını ve tekrarlanabilirlik parametrelerini belirtmektedir.

ParametreTemsili spesifikasyon / sonuç
OptimizatörAdam
Öğrenme oranı0.001
Yığın boyutu32
Maksimum epok sayısı100
Erken durdurma sabrı10 epok
En iyi epok78
Erken durdurma epoku88
En iyi doğrulama kaybı0.142
En iyi doğrulama doğruluğu94.6%
Eğitim çıktısıEğitim ve doğrulama kaybı azaldı ve yakınsadı
Doğrulama çıktısıEğitim ve doğrulama doğruluğu artmış ve stabilize olmuştur
Optimizasyon sonucuEn iyi model performansı 78. epokta elde edilmiştir
Aşırı öğrenme kontrolüErken durdurma, seçilen en iyi epoch'un ötesinde daha fazla optimizasyon yapılmasını engellemiştir

Tablo 4: Model eğitim özellikleri ve optimizasyon sonuçları. Tablo; model geliştirme sürecinde kullanılan optimize ediciyi, öğrenme oranını, grup boyutunu, maksimum eğitim dönemini, doğrulama performansını, eğitim yakınsamasını, optimizasyon sonucunu ve aşırı öğrenmeyi önleme stratejisini özetlemektedir.

ModelDoğruluk (%)Hassasiyet (%)Duyarlılık (%)Özgüllük (%)F1-skoru (%)MCCAUC (ROC)AP (PR)
Önerilen XAI Modeli93.594.592.494.693.40.870.960.94
Derin Öğrenme (CNN)89.189.888.19088.90.780.920.9
Rastgele Orman84.38583.285.784.10.670.860.81
Destek Vektör Makinesi (SVM)78.679.377.18078.20.540.790.72
Temel Hat (Çoğunluk Sınıfı)62.162.1100076.600.50.5

Tablo 5: Değerlendirilen modellerin öngörücü performans karşılaştırması. Tablo; doğruluk, kesinlik, duyarlılık, özgüllük, F1-skoru, Matthews korelasyon katsayısı, alıcı işletim karakteristik eğrisi altındaki alan ve ortalama kesinlik kullanarak önerilen XAI modelini değerlendirilen temel modellerle karşılaştırmaktadır.

Validasyon analiziKarşılaştırma / Metrikİstatistiksel testTest istatistiğip-değeriDeneysel sonuç / %95 GA
Beş katlı çapraz doğrulamaDoğrulukBetimleyici (ortalama ± SD)93.01 ± 0.48%
Beş katlı çapraz doğrulamaAUC-ROCBetimsel (ortalama ± SD)0.954 ± 0.007
Beş katlı çapraz doğrulamaHassasiyetBetimleyici (ortalama ± SD)92.42 ± 0.87%
Beş katlı çapraz doğrulamaGeri çağırmaTanımlayıcı (ortalama ± SD)93.02 ± 0.45%
Beş katlı çapraz doğrulamaF1-skoruTanımlayıcı (ortalama ± Standart Sapma)92.72 ± 0.62%
%95 bootstrap güven aralığıDoğrulukBootstrap (1.000 yeniden örnekleme)0.935 [0.897, 0.973]
%95 bootstrap güven aralığıHassasiyetBootstrap (1.000 yeniden örnekleme)0.930 [0.890, 0.970]
%95 bootstrap güven aralığıGeri ÇağırmaBootstrap (1.000 yeniden örnekleme)0.922 [0.880, 0.963]
%95 bootstrap güven aralığıF1-skoruBootstrap (1.000 yeniden örnekleme)0.926 [0.887, 0.965]
%95 bootstrap güven aralığıAUC-ROCBootstrap (1.000 yeniden örnekleme)0.958 [0.931, 0.984]
Önerilen Model ile CNN KarşılaştırmasıDoğruluk (%)McNemar testi9.320.0023Anlamlı (α = 0.05)
Önerilen Model ve CNN KarşılaştırmasıAUC-ROCDeLong testi3.870.0001Anlamlı (α = 0.05)
Önerilen Model ile CNN KarşılaştırmasıF1-skoruEşleştirilmiş bootstrap (1.000 yeniden örnekleme)2.810.0044Anlamlı (α = 0.05)
Önerilen Model ile Random Forest KarşılaştırmasıDoğruluk (%)McNemar testi14.270.0002Anlamlı (α = 0.05)
Önerilen Model ile Rastgele Orman KarşılaştırmasıAUC-ROCDeLong testi5.86<0.0001Anlamlı (α = 0.05)
Önerilen Model ile Rastgele Orman KarşılaştırmasıF1-skoruEşleştirilmiş bootstrap (1.000 yeniden örnekleme)4.030.0003Anlamlı (α = 0.05)
Önerilen Model ile SVM'nin KarşılaştırılmasıDoğruluk (%)McNemar testi16.08<0.0001Anlamlı (α = 0.05)
Önerilen Model ve SVM KarşılaştırmasıAUC-ROCDeLong testi6.95<0.0001Anlamlı (α = 0.05)
Önerilen Model ve SVM KarşılaştırmasıF1-skoruEşleştirilmiş bootstrap (1.000 yeniden örnekleme)4.62<0.0001Anlamlı (α = 0.05)
Tekrarlanan çalışma tekrarlanabilirliği (10 bağımsız çalışma)AUC-ROCTanımlayıcı (ortalama ± SD)0.957 ± 0.008
Tekrarlanan çalışmalele yeniden üretilebilirlik (10 bağımsız çalışma)Doğruluk (%)Betimleyici (ortalama ± SD)93.24 ± 0.74%
Tekrarlanan ölçüm tekrarlanabilirliği (10 bağımsız çalışma)F1-skoru (%)Betimleyici (ortalama ± SD)92.35 ± 0.92%

Tablo 6: Pima Kızılderilileri Diyabet Veri Kümesi kullanılarak gerçekleştirilen deneysel uygulamadan elde edilen istatistiksel doğrulama ve tekrarlanabilirlik sonuçları. Tablo; beş katlı çapraz doğrulama performansını, bootstrap tabanlı %95 güven aralıklarını, önerilen modelin temel modellerle istatistiksel karşılaştırmalarını ve 10 bağımsız rastgele tohum üzerinden yapılan tekrarlı çalıştırma tekrarlanabilirliğini özetlemektedir. Mevcut çalışma doğrulamasında dış doğrulama ve klinik uzman değerlendirmesi gerçekleştirilmemiştir.

Hayır.Kontrol Listesi ÖğesiGerekli BelgelerÖnerilen Kayıt / Doğrulama
1Yazılım ortamıİşletim sistemi, programlama dili ve yazılım ortamıİşletim sistemi ve programlama dili versiyonlarını kesin olarak kaydedin.
2Yazılım ve kütüphane sürümleriKullanılan temel yazılım kütüphanelerinin ve paketlerinin sürümleriTam paket/kütüphane adlarını ve sürümlerini kaydedin.
3Donanım özellikleriCPU, GPU, RAM, depolama ve hızlandırıcı özellikleriKullanılan hesaplama donanımını kaydedin.
4Veri seti tanımlamaVeri seti adı, kaynağı, versiyonu ve erişim bilgileriUygun olan yerlerde, veri setinin tam kaynağını/versiyonunu ve erişim tarihini kaydedin.
5Veri seti özellikleriÖrneklem büyüklüğü ve sınıf dağılımıHer bir bölme için toplam örnek sayısını ve sınıf dağılımını kaydedin.
6Veri seti bölümlendirmeEğitim, doğrulama ve bağımsız test seti stratejisiDoküman bölme oranlarını/sayılarını ve tabakalandırmayı kaydedin.
7Veri sızıntısının önlenmesiBilgi sızıntısını önlemek için kullanılan prosedürDoküman konusu/örnek ayırımı ve yalnızca eğitime yönelik ön işleme parametre kestirimi.
8Önişleme parametreleriTemizleme, eksik değerlerin yönetimi, normalizasyon, kodlama ve dönüştürme ayarlarıTüm ön işleme işlemlerini ve parametre değerlerini kaydedin.
9Veri artırmaVeri artırma yöntemleri ve uygulanabildiği durumlarda parametre ayarlarıYöntemleri, olasılıkları ve parametre aralıklarını belgeleyin.
10Model mimarisiFinal model mimarisi ve konfigürasyonuModel tipini, katmanları/bileşenleri, boyutları ve aktivasyon fonksiyonlarını belgeleyin.
11HiperparametrelerEğitim ve optimizasyon hiperparametreleriÖğrenme oranı, paket boyutu, optimize edici, epok sayısı, erken durdurma ve ayarlanmış parametreleri kaydedin.
12Rastgele tohumlarYeniden üretilebilir yürütme için kullanılan rastgele tohumlarBölme, başlatma ve tekrarlı çalışmalar için seed (rastgele sayı başlangıç) değerlerini kaydedin.
13Eğitim konfigürasyonuEğitim prosedürü ve model seçim stratejisiDoküman doğrulama, kontrol noktası oluşturma ve model seçimi kriterleri.
14Değerlendirme metrikleriÖnceden tanımlanmış öngörücü ve istatistiksel değerlendirme metrikleriBildirilen tüm performans ölçümlerini kaydedin.
15Güven aralıklarıPerformans ölçümleri için belirsizlik aralıklarıUygun olan durumlarda, GI tahmin prosedürünü ve bootstrap yeniden örneklemelerini belgeleyin.
16İstatistiki testlerModel karşılaştırması için istatistiksel prosedürlerBelge testi, istatistik, p-değeri, anlamlılık eşiği ve varsayımlar.
17Tekrarlı analizFarklı rastgele başlangıç değerleri (random seeds) kullanılarak gerçekleştirilen bağımsız yürütmelerÇalışma sayısını ve ortalamayı kaydedin ± Temel metriklerin standart sapması.
18Açıklanabilirlik yapılandırmasıAçıklanabilirlik yöntemleri ve parametre ayarlarıSHAP, LIME, Grad-CAM, dikkat (attention), karşıt olgular (counterfactual) veya uygulanabilir ayarları belgeleyin.
19Açıklanabilirlik değerlendirmesiAçıklama güvenilirliğinin ve yararlılığının nesnel değerlendirmesiBelge sadakati, kararlılığı, sadakatsizliği, yerelleştirmesi ve uygun olan yerlerde uzman değerlendirmesi.
20Model artefaktlarıEğitilmiş model ağırlıkları ve konfigürasyon dosyalarıEğitilmiş final modeli, mimariyi/konfigürasyonu ve seçim bilgilerini arşivleyin.
21Kod kullanılabilirliğiÖnişleme, eğitim, değerlendirme ve açıklama üretimi için gereken kodVarsa, kayıt deposu veya kontrollü kod erişim bilgileri.
22Yürütme dokümantasyonuKomutlar, betikler, yapılandırma dosyaları ve talimatlarİş akışını yeniden oluşturmak için gereken komutları ve konfigürasyonu kaydedin.
23Çıktı dokümantasyonuTahminler, değerlendirme sonuçları, şekiller ve açıklama çıktılarıOluşturulan çıktıları arşivleyin ve bunları ilgili deneyle/çalışmayla ilişkilendirin.
24Tekrarlanabilirlik doğrulamasıBağımsız yürütmeler genelinde tutarlılığın doğrulanmasıTekrarlanan çalışma sonuçlarını karşılaştırın ve önceden tanımlanmış değişkenlik ölçütlerini raporlayın.

Tablo 7: Önerilen XAI iş akışının bağımsız replikasyonu için tekrarlanabilirlik kontrol listesi. Kontrol listesi, deneysel iş akışını yeniden oluşturmak için gereken hesaplama, veri seti, ön işleme, model geliştirme, değerlendirme, istatistiksel doğrulama, açıklanabilirlik ve dokümantasyon gereksinimlerini belirtmektedir.

Tartışma

Sonuçlar, önerilen protokolün çeşitli sağlık hizmetleri veri kümelerinde XAI sistemlerini geliştirmek ve değerlendirmek için standartlaştırılmış ve tekrarlanabilir bir iş akışı olarak kullanım faydasını göstermektedir. Tablo 2 ve Şekil 3'te gösterildiği gibi, sistematik ön işleme; eksik değerlerin yönetimi, veri normalizasyonu, özellik ölçeklendirme ve veri kümesi bölümlendirme yoluyla standartlaştırılmış veriler üretmiş ve veri kalitesini artırmıştır. Veri hazırlığındaki değişkenlik; yanlılığa yol açabileceği, öngörücü performansı düşürebileceği ve açıklanabilirlik analizlerinin güvenilirliğini tehlikeye atabileceği için bu ön işleme adımları kritiktir. Bu nedenle, tekrarlanabilirliği artırmak ve veri sızıntısını önlemek için eğitim, doğrulama ve test veri kümeleri genelinde tutarlı ön işleme prosedürleri uygulanmalıdır19,20.

Şekil 4 ve Tablo 4'te gösterilen model eğitim sonuçları; tutarlı ve kararlı bir öğrenme davranışı sergilemektedir. Eğitim ve doğrulama kayıplarındaki eş zamanlı azalmalar ile öngörü doğruluğundaki artışlar, belirgin bir aşırı öğrenme (overfitting) olmaksızın uygun model yakınsamasına işaret etmektedir. Hiperparametre optimizasyonu, erken durdurma, dropout ve düzenlileştirme (regularization), kararlı ve tekrarlanabilir model eğitimine daha fazla katkıda bulunmaktadır. Öğrenme eğrilerindeki kararsızlıklar; uygun olmayan bir öğrenme hızı, yetersiz eğitim verisi veya aşırı model karmaşıklığına işaret edebilir. Bu nedenle, söz konusu potansiyel sorunları belirlemek ve gidermek için eğitim boyunca model yakınsaması izlenmelidir.

Tablo 5 ve Şekil 5; doğruluk, kesinlik, duyarlılık, özgünlük, F1 skoru, Matthews korelasyon katsayısı ve alıcı işletim karakteristik (ROC) eğrisi altındaki alan dahil olmak üzere birden fazla değerlendirme metriği kullanılarak elde edilen öngörü performansını göstermektedir. ROC ve kesinlik-duyarlılık eğrileri ayırt edici performans ölçümleri sağlarken, hata matrisi sınıflar genelindeki doğru ve yanlış sınıflandırmaların dağılımını örneklendirmektedir. Birden fazla performans metriği kullanılarak yapılan değerlendirme, yalnızca genel doğruluğun model performansını yeterince tanımlayamayabileceği dengesiz tıbbi veri setleri için özellikle önemlidir.

Şekil 6 Pima Kızılderilileri Diyabet Veri Seti'nden elde edilen açıklanabilirlik sonuçlarını göstermekte ve uygulamalı doğrulamada kullanılan açıklanabilirlik yöntemlerinin birbirini tamamlayıcı rollerini ortaya koymaktadır. Global SHAP analizi, girdi özelliklerinin model tahminlerine olan genel katkısını ve göreceli önemini karakterize ederken; SHAP şelale ve bağımlılık grafikleri, model davranışının hastaya özgü ve özellik düzeyindeki yorumlarını sunmaktadır. LIME, tekil bir test seti tahminine katkıda bulunan özellikleri belirleyerek ek bir yerel açıklama sağlar. Hastaya özgü karşıolgusal (counterfactual) açıklama ise tahmin edilen sonuçtaki bir değişiklikle ilişkili olan minimum özellik değişimlerini daha ayrıntılı bir şekilde göstermektedir. Bu yaklaşımlar birlikte, model davranışı üzerine tamamlayıcı global ve yerel bakış açıları sunarak tablolu öngörücü modelin şeffaflığını ve yorumlanabilirliğini artırır. Grad-CAM, dikkat görselleştirme, belirginlik haritalama (saliency mapping) ve Entegre Gradyanlar, Pima uygulamalı doğrulamasında uygulanmamış olup genel protokol içerisinde yalnızca modaliteye bağlı seçenekler olarak tutulmuştur.

İstatistiksel doğrulama (Tablo 6 ve Şekil 7) ve tekrarlanabilirlik değerlendirmeleri, farklı deneysel çalışmalar boyunca öngörücü performansın stabilitesini kanıtlamaktadır. Çapraz doğrulama, güven aralığı tahmini, hipotez testi ve tekrarlanan çalışma tekrarlanabilirlik değerlendirmesinin kombinasyonu, model sağlamlığını değerlendirmek için sistematik bir çerçeve sunar. Bu tür bir doğrulama, özellikle sağlık hizmetleri uygulamalarında önemlidir; çünkü bağımsız deneyler arasındaki tekrarlanabilirlik, yapay zeka modellerinin klinik ortamlarda uygulanmadan önce güvenilirliğine ve genellenebilirliğine dair kanıt sağlar21,23.

Bu protokolün başarılı bir şekilde uygulanması için birkaç adım kritik öneme sahiptir. Eksik, tutarsız veya hatalı verilerden kaynaklanabilecek potansiyel yanlılığı en aza indirmek için özellik çıkarımı ve model eğitimi öncesinde veri temizleme işlemini gerçekleştirin. Hiperparametre optimizasyonunu yalnızca eğitim ve doğrulama verilerini kullanarak yapın ve model geliştirme ile optimizasyon süreçleri boyunca test veri setini bağımsız tutun. Hesaplama platformları arasında tekrarlanabilirliği kolaylaştırmak için rastgele sayı üreteci durumlarını, yazılım versiyonlarını, donanım yapılandırmalarını ve ön işleme ayarlarını açıkça belgeleyin. Ek olarak, yorumlanabilir ve klinik olarak anlamlı açıklamalar elde etmek için açıklanabilirlik yöntemlerini, öngörücü modele ve sağlık verisi modalitesine göre seçin20,29,30.

Protokolün çeşitli sınırlamaları bulunmaktadır. Model tahminlerinin ve açıklamalarının doğruluğu ve güvenilirliği, büyük ölçüde yeterince geniş, temsil gücü yüksek ve yüksek kaliteli sağlık veri kümelerinin mevcut olmasına bağlıdır. Belirli hasta popülasyonlarının yetersiz temsili, ölçüm hataları, eksik değişkenler ve veri kaynakları arasındaki heterojenlik, hem öngörücü performansı hem de model açıklamalarının kararlılığını olumsuz etkileyebilir. Ayrıca, mevcut açıklanabilirlik yaklaşımları model davranışını karakterize edebilse de mutlaka nedensel mekanizmalar kurmayabilir. Bu nedenle, XAI çıktıları ilgili klinik uzmanlıkla birlikte değerlendirilmelidir.

Genel olarak bu protokol, sağlık hizmetlerinin farklı alanlarında tekrarlanabilir model geliştirme, değerlendirme ve açıklanabilirlik analizi için standartlaştırılmış bir yaklaşım sunmaktadır. Standartlaştırılmış ön işleme, hiperparametre optimizasyonu, birden fazla performans metriği kullanılarak yapılan değerlendirme, tamamlayıcı açıklanabilirlik yaklaşımları ve istatistiksel doğrulamayı entegre eden bu iş akışı, sağlık hizmetlerinde yapay zeka araştırmaları için şeffaf ve izlenebilir bir çerçeve sağlamaktadır.

Sonuçlar ayrıca, sistematik veri ön işlemenin, standartlaştırılmış model geliştirme prosedürlerinin, kapsamlı performans değerlendirmesinin, çoklu açıklanabilirlik yöntemlerinin ve titiz istatistiksel doğrulamanın birleştirilmesiyle şeffaf ve tutarlı bir yapay zeka model geliştirmenin desteklenebileceğini göstermektedir. Bu protokol; farklı hesaplama ortamlarında tekrarlanabilir deneyler için bir çerçeve sunarken klinik veri tabanlarına, tıbbi görüntülere, fizyolojik sinyallere ve multimodal sağlık verilerine uyarlanabilir. Standartlaştırılmış uygulama, tamamlayıcı açıklanabilirlik teknikleri ve tekrarlanabilirlik değerlendirmesi aracılığıyla bu protokol, açıklanabilir ve güvenilir yapay zeka modelleri geliştirmek için bir çerçeve sağlamakta olup, gelecekteki biyomedikal araştırmalar ile ardından gelecek harici ve klinik doğrulamalar için metodolojik bir temel teşkil edebilir.

Açıklamalar

Yazarlar, bu çalışmada bildirilen çalışmayı etkileyebilecek herhangi bir rakip finansal çıkarın, ticari ilişkinin veya kişisel ilişkinin bulunmadığını beyan ederler. Yazarların beyan edilecek herhangi bir çıkar çatışması yoktur.

Teşekkürler

Yazarlar, bu sağlık hizmetleri XAI protokolünün geliştirilmesi ve deneysel doğrulanması sırasında ilgili bağlı kurumları tarafından sağlanan kurumsal desteği kabul ederler. Yazarlar ayrıca deneysel analizleri yürütmek için kullanılan hesaplama olanaklarını ve yazılım kaynaklarını kabul ederler. Bu araştırma herhangi bir dış finansman almamıştır. Yazarlar; hesaplama analizi, veri görselleştirme ve bu çalışmada sunulan şekillerin oluşturulması için Python 3.11, Matplotlib 3.9 ve SciPy 1.13 kullanımını kabul ederler.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
CaptumMeta AIEn son kararlı sürümPyTorch açıklanabilirliği
CUDA ToolkitNVIDIA12.2GPU hızlandırma
cuDNNNVIDIA9.xDerin öğrenme arka ucu
GitGit SCMEn son kararlı sürümVersiyon kontrolü
GitHubGitHub Inc.Web platformuKaynak kod deposu
Grad-CAMjacobgilEn son sürümCNN görselleştirme
Jupyter NotebookProject JupyterEn son kararlı sürümEtkileşimli geliştirme
LightGBMMicrosoft4.xGradyan artırma
LIMELIME Community0.2.0Yerel açıklanabilirlik
MatplotlibMatplotlib Developers3.9Görselleştirme
Microsoft ExcelMicrosoftMicrosoft 365Veri organizasyonu
NumPyNumPy Developers1.26Sayısal hesaplama
NVIDIA RTX 4090 GPUNVIDIA24 GB VRAMModel eğitimi
OpenCVOpenCV Organization4.10Görüntü ön işleme
PandasPandas Development Team2.2Veri ön işleme
Pillow (PIL)Python Imaging Library10.xGörüntü işleme
PlotlyPlotly Technologies5.xEtkileşimli görselleştirme
PythonPython Software Foundation3.11Programlama ortamı
PyTorchPyTorch Foundation2.3Derin öğrenme
Scikit-learnScikit-learn Developers1.5Makine öğrenimi
SciPySciPy Developers1.13Bilimsel hesaplama
SeabornSeaborn Developers0.13İstatistiki grafikler
SHAPSHAP Community0.46Küresel açıklanabilirlik
SimpleITKInsight Software Consortium2.xTıbbi görüntü işleme
StatsmodelsStatsmodels Developers0.14İstatistiki analiz
Sistem RAMHerhangi bir üretici32 GB veya üzeriBellek
TensorBoardGoogle2.15Eğitim izleme
TensorFlowGoogle2.15Derin öğrenme
Ubuntu Linux / Windows 11Canonical / Microsoft22.04 LTS / 11İşletim sistemi
Visual Studio CodeMicrosoftEn son kararlı sürümKod geliştirme
XGBoostXGBoost Developers2.1Gradyan artırma

Kaynaklar

  1. Acosta JN, Falcone GJ, Rajpurkar P, Topol EJ. Multimodal biomedical AI. Nat Med. 2022;28(9):1773-1784.
  2. Tang AS, et al. Harnessing EHR data for health research. Nat Med. 2024;30(7):1847-1855.
  3. Zhang A, Xing L, Zou J, Wu JC. Shifting machine learning for healthcare from development to deployment and from models to data. Nat Biomed Eng. 2022;6(11):1330-1345.
  4. Bera K, et al. Predicting cancer outcomes with radiomics and artificial intelligence in radiology. Nat Rev Clin Oncol. 2022;19(2):132-146.
  5. Wenderott K, Krups J, Zaruchas F, Weigl M. Effects of artificial intelligence implementation on efficiency in medical imaging—a systematic literature review and meta-analysis. NPJ Digit Med. 2024;7(1):265.
  6. Kaissis GA, Makowski MR, Rückert D, Braren RF. Secure, privacy-preserving and federated machine learning in medical imaging. Nat Mach Intell. 2020;2(6):305-311.
  7. He J, et al. The practical implementation of artificial intelligence technologies in medicine. Nat Med. 2019;25(1):30-36.
  8. Antoniadi AM, et al. Current challenges and future opportunities for XAI in machine learning-based clinical decision support systems: A systematic review. Appl Sci (Basel). 2021;11(11):5088.
  9. Samek W, et al. Explaining deep neural networks and beyond: A review of methods and applications. Proc IEEE. 2021;109(3):247-278.
  10. Holzinger A, et al. Causability and explainability of artificial intelligence in medicine. WIREs Data Min Knowl Discov. 2019;9(4).
  11. Markus AF, Kors JA, Rijnbeek PR. The role of explainability in creating trustworthy artificial intelligence for health care: A comprehensive survey of the terminology, design choices, and evaluation strategies. Nat Biomed Eng. 2021;5(9):996-1011.
  12. Arrieta AB, et al. Explainable Artificial Intelligence (XAI): Concepts, taxonomies, opportunities and challenges toward responsible AI. Inf Fusion. 2020;58:82-115.
  13. Selvaraju RR, et al. Grad-CAM: Visual explanations from deep networks via gradient-based localization [conference paper]. Presented at: IEEE International Conference on Computer Vision (ICCV); Venice, Italy; 2017:618-626. https://openaccess.thecvf.com/content_iccv_2017/html/Selvaraju_Grad-CAM_Visual_Explanations_ICCV_2017_paper.html
  14. Tonekaboni S, Joshi S, McCradden MD, Goldenberg A. What clinicians want: Contextualizing explainable machine learning for clinical end use. Nat Mach Intell. 2019;1(12):572-584.
  15. Sundararajan M, Taly A, Yan Q. Axiomatic attribution for deep networks [conference paper]. Presented at: 34th International Conference on Machine Learning; Sydney, Australia; 2017;70:3319-3328. https://proceedings.mlr.press/v70/sundararajan17a.html
  16. Ribeiro MT, Singh S, Guestrin C. “Why should I trust you?”: Explaining the predictions of any classifier [conference paper]. Presented at: 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; San Francisco, CA; 2016:1135-1144.
  17. Desai S, Ramaswamy HG. Ablation-CAM: Visual explanations for deep convolutional network via gradient-free localization [conference paper]. Presented at: IEEE/CVF Winter Conference on Applications of Computer Vision (WACV); 2020:983-991.
  18. Belle V, Papantonis I. Principles and practice of explainable machine learning. Front Big Data. 2021;4:688969.
  19. Vilone G, Longo L. Notions of explainability and evaluation approaches for explainable artificial intelligence. Inf Fusion. 2021;76:89-106.
  20. Ali S, et al. Explainable artificial intelligence (XAI): What we know and what is left to attain trustworthy artificial intelligence. Inf Fusion. 2023;99:101805.
  21. Gundersen OE, Kjensmo S. State of the art: Reproducibility in artificial intelligence [conference paper]. Presented at: Thirty-Second AAAI Conference on Artificial Intelligence; New Orleans, LA; 2018:1644-1651. https://ojs.aaai.org/index.php/AAAI/article/view/11503
  22. Hutson M. Artificial intelligence faces reproducibility crisis. Science. 2018;359(6377):725-726.
  23. Pineau J, et al. Improving reproducibility in machine learning research: A report from the NeurIPS 2019 reproducibility program. J Mach Learn Res. 2021;22(164):1-20.
  24. U.S. Food and Drug Administration, Health Canada, Medicines and Healthcare products Regulatory Agency. Good Machine Learning Practice for Medical Device Development: Guiding Principles. 2021.
  25. Liu X, et al. Reporting guidelines for clinical trial reports for interventions involving artificial intelligence: The CONSORT-AI extension. Nat Med. 2020;26(9):1364-1374.
  26. Mongan J, Moy L, Kahn CE Jr. Checklist for Artificial Intelligence in Medical Imaging (CLAIM): A guide for authors and reviewers. Radiol Artif Intell. 2020;2(2).
  27. Peng RD. Reproducible research in computational science. Science. 2011;334(6060):1226-1227.
  28. Collins GS, et al. Protocol for development of the TRIPOD-AI and PROBAST-AI reporting and risk-of-bias tools for studies developing, validating, or updating prediction models based on artificial intelligence. BMJ Open. 2021;11.
  29. Kapoor S, Narayanan A. Leakage and the reproducibility crisis in machine-learning-based science. Patterns. 2023;4(9):100804.
  30. Wiens J, et al. Do no harm: A roadmap for responsible machine learning for health care. Nat Med. 2019;25(9):1337-1340.

Yeniden basım ve izinler

Etiketler

Açıklanabilir Yapay ZekaSağlık Hizmetleri YZ ModelleriModel YorumlanabilirliğiTekrarlanabilir ProtokolÖngörücü PerformansÖznitelik Mühendisliğiİstatistiksel DoğrulamaSHAP AçıklamalarıLIME AçıklamalarıKarşıolgusal Açıklamalar