Yöntem makalesi

Sağlık Sistemlerinde Açıklanabilir Yapay Zeka Modelleri Geliştirmek ve Değerlendirmek İçin Tekrarlanabilir Bir Deneysel Protokol

52 görüntülenme

⸱

DOI:

10.3791/73848

⸱

15 Eylül 2026

Bu makalede

Özet

Bu protokol, sağlık hizmetlerinde açıklanabilir yapay zeka modellerinin geliştirilmesi, değerlendirilmesi ve yorumlanması için tekrarlanabilir bir iş akışı sunmaktadır. Şeffaflığı, güvenilirliği ve klinik uygulanabilirliği artırmak amacıyla standartlaştırılmış veri hazırlama, model geliştirme, açıklanabilirlik teknikleri, nicel değerlendirme ve tekrarlanabilirlik uygulamalarını entegre eder.

Özet

Yapay zeka (AI), klinik karar verme, hastalık öngörüsü, tıbbi teşhis ve kişiselleştirilmiş sağlık hizmetleri için giderek daha değerli bir araç olarak benimsenmektedir. Ancak, şeffaflık eksikliği, açıklanabilir yapay zeka (XAI) yöntemlerinin tutarsız uygulanması ve sınırlı tekrarlanabilirlik, AI modellerinin klinik ortamlarda güvenilir bir şekilde yaygınlaştırılmasının önündeki temel engeller olmaya devam etmektedir. Bu makale, sağlık uygulamaları için açıklanabilir AI modellerinin geliştirilmesi, değerlendirilmesi ve yorumlanması için sistematik, tekrarlanabilir ve şeffaf bir protokol önermektedir. İş akışı, hesaplama ortamının kurulumuyla başlar; bunu veri edinimi ve karakterizasyonu, ön işleme, özellik mühendisliği, model geliştirme, hiperparametre optimizasyonu, öngörücü performans değerlendirmesi, açıklanabilirlik analizi, istatistiksel doğrulama ve tekrarlanabilirlik değerlendirmesi izler. Protokol, hem küresel hem de yerel model yorumlamaları oluşturmak için SHapley Additive exPlanations (SHAP), Local Interpretable Model-agnostic Explanations (LIME), Gradient-weighted Class Activation Mapping (Grad-CAM), Integrated Gradients, dikkat görselleştirme ve karşı olgusal açıklamalar gibi XAI yöntemlerini içermektedir. Protokol; standartlaştırılmış sağlık veri setlerinin hazırlanması, kararlı makine öğrenimi modellerinin geliştirilmesi, öngörücü performansın değerlendirilmesi, klinik olarak anlamlı açıklamaların oluşturulması ve tekrarlanan deneyler genelinde tekrarlanabilirliğin istatistiksel değerlendirmesi dahil olmak üzere birkaç temel bileşene vurgu yapmaktadır. Model geliştirme, açıklanabilirlik, nicel ve nitel değerlendirme, istatistiksel doğrulama ve tekrarlanabilirlik değerlendirmesini birleşik bir iş akışına entegre ederek, bu protokol, sağlık uygulamaları için şeffaf ve tekrarlanabilir AI modelleri geliştirmek adına kapsamlı bir çerçeve sunmaktadır.

Giriş

Yapay zeka, karmaşık klinik verilerin akıllı analizine olanak tanıyarak ve kanıta dayalı tıbbi karar verme süreçlerini destekleyerek modern sağlık hizmetlerinin ayrılmaz bir bileşeni haline gelmiştir1. Elektronik sağlık kayıtları, tıbbi görüntüleme sistemleri, giyilebilir cihazlar ve genomik teknolojiler aracılığıyla sağlık hizmetlerinin hızla dijitalleşmesi, etkili bir yorumlama için gelişmiş hesaplama yaklaşımları gerektiren büyük hacimlerde heterojen veriler üretmiştir2.

Makine öğrenimi (ML) ve derin öğrenme (DL) algoritmaları, çok boyutlu sağlık hizmetleri veri setlerinden anlamlı modeller çıkarma konusunda dikkat çekici yetenekler göstermiş; böylece tanı doğruluğunu, hastalık öngörüsünü ve hasta sonuç değerlendirmelerini iyileştirmiştir3. Yapay zeka tabanlı modeller; klinisyenlerin hastalıkları daha erken evrelerde tespit etmelerine ve kişiselleştirilmiş tedavi stratejileri önermelerine yardımcı olmak amacıyla radyoloji, patoloji, kardiyoloji, onkoloji, oftalmoloji ve diğer tıbbi uzmanlık alanlarında başarıyla uygulanmıştır4. Bu teknolojiler ayrıca iş akışının optimizasyonuna, tanısal değişkenliğin azaltılmasına ve sağlık hizmetleri kaynaklarının kullanımının iyileştirilmesine katkıda bulunmuştur5.

Hesaplamalı donanım, bulut bilişim ve açık kaynaklı yapay zeka çerçevelerindeki son gelişmeler, akıllı sağlık uygulamalarının geliştirilmesini ve yaygınlaştırılmasını hızlandırmıştır6. Sonuç olarak yapay zeka, hassas tıp ve klinik karar destek sistemleri için temel bir kolaylaştırıcı teknoloji haline gelmiştir7. Bu ilerlemelere rağmen, birçok yüksek performanslı modelin tahminlerinin nasıl oluşturulduğuna dair çok az bilgi sunması nedeniyle, yapay zekanın rutin klinik uygulamalarda yaygın olarak benimsenmesi sınırlı kalmaya devam etmektedir8.

Çoğu derin öğrenme algoritması, dahili karar verme sürecinin klinisyenler ve araştırmacılar tarafından anlaşılmasının zor olduğu karmaşık kara kutu modeller olarak işlev görür9. Bu modeller genellikle mükemmel öngörü performansı sergilese de, şeffaflık eksikliği kullanıcı güvenini sarsmakta; klinik doğrulama, düzenleyici onay ve hasta güvenliği açısından zorluklar yaratmaktadır10. Sağlık profesyonelleri, özellikle yüksek riskli tıbbi ortamlarda, yapay zeka destekli kararları rutin klinik uygulamaya dahil etmeden önce bunları gerekçelendirebilmelidir11.

XAI, makine öğrenimi modellerinin şeffaflığını ve yorumlanabilirliğini artırmak için etkili bir yaklaşım olarak ortaya çıkmıştır12. Tahmin modellerini opak sistemler olarak ele almak yerine, XAI teknikleri bireysel tahminlere katkıda bulunan özellikler, görüntü bölgeleri veya klinik değişkenler hakkında bilgi sağlar13. Bu tür açıklamalar, klinisyenlerin model davranışını daha iyi anlamalarına, potansiyel yanlılıkları belirlemelerine ve yapay zeka tarafından üretilen kararların yerleşik tıbbi bilgilerle uyumlu olup olmadığını saptamalarına olanak tanır14.

Sağlık hizmetleri uygulamaları için çeşitli açıklanabilirlik teknikleri geliştirilmiştir. SHapley Additive explanations (SHAP), kooperatif oyun teorisine dayanarak her bir özelliğin model tahminine olan katkısını ölçer15. Local Interpretable Model-agnostic Explanations (LIME), basitleştirilmiş bir model oluşturarak kara kutu modelinin tahminlerini açıklar16. Derin öğrenme modellerinin kullanıldığı tıbbi görüntüleme görevleri için Gradient-weighted activation maps (Grad-CAM), görüntünün sınıflandırma kararlarına katkıda bulunan bölgelerini görsel olarak belirten ısı haritaları oluşturur17. Bu yöntemlerin kombinasyonu, farklı sağlık hizmetleri alanlarında yapay zeka sistemlerinin şeffaflığını önemli ölçüde artırmıştır18.

Sağlık hizmetleri alanında açıklanabilirlik yöntemlerine verilen önemin artmasına rağmen, bunların literatürdeki kullanımı farklılık göstermeye devam etmektedir. Araştırmacılar yalnızca ön işleme stratejilerinin kullanımı konusunda değil, aynı zamanda model mimarisinin tasarımı, değerlendirme metrikleri ve hatta açıklama teknikleri konusunda da farklılık göstermektedirler19. Ayrıca, birçok makale yüksek öngörü doğruluğı bildirmekte ancak açıklamaların kalitesi veya tekrarlanabilirliği hakkında kapsamlı bir değerlendirme sunmakta yetersiz kalmaktadır20.

Tekrarlanabilirlik, modern yapay zeka bilimindeki en büyük darboğazlardan biridir. Makaleler genellikle yazılım versiyonunu, hesaplama ortamını, ön işleme hattını, hiperparametre ayarlarını, rastgele tohum başlatmasını ve donanım yapılandırmalarını açıklamaz21. Bu nedenle, bağımsız araştırmacılar genellikle yayınlanmış sonuçları tekrarlamakta veya yayınlanmış yöntemleri diğer veri setleri veya yazılım platformlarını kullanarak doğrulamakta başarısız olurlar22. Ayrıntılı dokümantasyon eksikliği; kıyaslama çalışmalarını, ortak araştırmaları ve yapay zeka sistemlerinin klinik uygulamalarını engelleyen faktörlerden biridir23.

Bu zorlukların farkında olan çeşitli kuruluşlar ve düzenleyici kurumlar, sağlık uygulamaları için şeffaf, güvenilir ve tekrarlanabilir yapay zekanın önemini vurgulamışlardır24. Mevcut raporlama kılavuzları metodolojik raporlamayı geliştirmiş olsa da, araştırmacıların doğrudan uygulayabileceği standartlaştırılmış deneysel prosedürler sağlamaktan ziyade, öncelikle nelerin raporlanması gerektiğini tanımlamaktadır25. Sonuç olarak; veri seti hazırlama, model geliştirme, açıklanabilirlik analizi, istatistiksel değerlendirme ve tekrarlanabilirlik uygulamalarını tek bir deneysel iş akışında birleştiren kapsamlı bir protokole ihtiyaç duyulmaktadır26.

Standardize edilmiş bir deneysel protokol, sağlık hizmetleri yapay zeka topluluğu için birçok avantaj sunar. Ayrıca, metodolojik tutarlılığı destekler, bağımsız çalışmaların karşılaştırılmasını kolaylaştırır, hesaplamalı deneylerin şeffaflığını artırır ve yayınlanmış sonuçların güvenilir bir şekilde doğrulanmasını sağlar27. Standardize edilmiş iş akışları aynı zamanda, farklı laboratuvarlar ve sağlık kurumları arasında tekrarlanabilir olan net bir şekilde belgelenmiş prosedürler aracılığıyla eğitim/öğretime, ortak araştırmalara ve düzenleyici değerlendirmelere yardımcı olur28.

Sağlık sistemlerinde yapay zeka modellerinin eğitimi ve değerlendirilmesi için tekrarlanabilir bir deneysel protokol geliştirilmiş ve test edilmiştir. Protokol; hesaplama ortamının yapılandırılması, sağlık veri kümelerinin ön işlemesi, makine öğrenmesi modellerinin geliştirilmesi, XAI yöntemlerinin uygulanması, öngörü performansının değerlendirilmesi, istatistiksel doğrulamanın gerçekleştirilmesi ve tekrarlanabilirliğin değerlendirilmesine yönelik standartları ana hatlarıyla belirtmektedir29. Bu tür bileşenlerin uyumlu bir iş akışına entegrasyonunun, sağlık hizmetleri yapay zeka araştırmalarının şeffaflığını, güvenilirliğini ve tekrarlanabilirliğini artırması ve aynı zamanda güvenilir akıllı sağlık sistemlerinin geliştirilmesine yardımcı olması beklenmektedir30.

Protokol

Gerçekleştirilen doğrulama deneyi, kamuya açık ve kimliksizleştirilmiş Pima Indians Diyabet Veri Setini kullanmış olup, tanımlanabilir hasta kayıtlarını veya yeni hasta alımını içermemiştir. Bu nedenle, bilgilendirilmiş onam ve kurumsal IRB/etik kurul onayı gerekmemiş olup, tüm analizler ilgili veri seti şartlarına ve kurumsal araştırma politikalarına uygun olarak yürütülmüştür.

Uygulamalı doğrulama örneğinde, ikili diyabet tahmini için 768 kayıt içeren ve halka açık olan Pima Indians Diabetes Veri Kümesi kullanılmıştır. Dokuz aşamalı temel iş akışının tamamı bu veri kümesine uygulanmıştır. Dokuz temel aşama; veri kümesi seçimi ve doğrulaması, hesaplama ortamı yapılandırması, veri ön işleme, veri kümesi bölümlendirme, model geliştirme ve eğitimi, öngörücü ve hesaplama performansı değerlendirmesi, açıklanabilirlik analizi, istatistiksel doğrulama ve tekrarlanabilirlik değerlendirmesinden oluşmaktadır. Harici doğrulama ve klinik uzman değerlendirmesi isteğe bağlı doğrulama modülleri olarak tutulmuş ve mevcut uygulamalı örnekte gerçekleştirilmemiştir. Şekil 1 temel protokol iş akışını göstermekte ve Tablo 1 mevcut uygulamalı doğrulamada yürütülen dokuz temel aşamayı özetlemektedir; isteğe bağlı harici doğrulama ve klinik uzman değerlendirmesi Protokol içinde ayrıca açıklanmıştır ve dokuz deneysel aşama arasında yer almamaktadır.

1. Sağlık hizmetleri veri setini seçin ve doğrulayın

  1. Çalışılan doğrulama örneği için birincil veri seti olarak Pima Kızılderilileri Diyabet Veri Setini seçin. Veri seti kaynağını, örneklem büyüklüğünü, tahmin hedefini, sınıf dağılımını ve veri yapısını doğrulayın.
  2. Önceden tanımlanmış dahil etme, hariç tutma ve veri kalitesi kriterlerini uygulayın. Model geliştirmeden önce yinelenen ve geçersiz kayıtları kaldırın.
  3. Veri seti kaynağını, özelliklerini, tahmin görevini, sınıf dağılımını, dahil etme ve hariç tutma kriterlerini ve bölümlendirme stratejisini Tablo 2'ye kaydedin.
  4. Veri seti ve model seçimi için karar kriterlerini uygulayın
    1. Veri setini, model mimarisini, ön işleme stratejisini veya açıklanabilirlik yöntemini seçmeden önce tahmin amacını tanımlayın.
    2. Veri seti modalitesini tahmin amacıyla eşleştirin. Yapılandırılmış klinik değişkenler için tablo verilerini, tıbbi görüntüler için görüntüleme verilerini, fizyolojik sinyaller için zaman serisi verilerini, klinik anlatılar için metin verilerini veya aynı hasta veya çalışma birimi için tamamlayıcı modaliteler mevcut olduğunda multimodal verileri seçin.
    3. Aday veri setlerini örneklem büyüklüğü, sonuç kullanılabilirliği, sınıf dağılımı, eksiklikler, açıklama kalitesi, klinik uygunluk, veri bütünlüğü ve erişilebilirlik açısından değerlendirin. Önceden tanımlanmış gereksinimleri karşılayan veri setini seçin.
    4. Örneklem büyüklüğü, hesaplama kaynakları veya yorumlanabilirlik gereksinimleri karmaşık mimarilerin kullanımını kısıtladığında, yapılandırılmış tablo verileri için geleneksel makine öğrenmesi modellerini seçin. Yeterli eğitim verisi ve tıbbi görüntüler, fizyolojik sinyaller veya klinik metinler gibi yüksek boyutlu girdiler mevcut olduğunda derin öğrenme mimarilerini seçin.
    5. Multimodal mimarileri yalnızca aynı hasta veya çalışma birimi için birden fazla modalite mevcut olduğunda ve bilgi sızıntısına yol açmadan güvenilir şekilde hizalanabildiğinde seçin. Ön işleme işlemlerini seçilen veri modalitesinin özelliklerine göre seçin.
    6. Açıklanabilirlik yöntemlerini modele ve veri modalitesine göre seçin. Uygun tablo modelleri için SHAP veya LIME gibi model-agnostik yöntemleri ve uygulanabildiği durumlarda görüntü tabanlı modeller için Grad-CAM gibi modaliteye özel yöntemleri kullanın.
    7. Veri seti, ön işleme stratejisi, model ve açıklanabilirlik yöntemi seçimlerinin gerekçelerini belgeleyin. Bu kararları yeniden üretilebilirlik kaydının bir parçası olarak saklayın.

2. XAI model geliştirme için hesaplama ortamını yapılandırın

  1. İşletim sistemini, CPU'yu, RAM'i, depolamayı ve GPU'yu seçilen model gereksinimlerine göre yapılandırın. İzole bir Python ortamı oluşturun ve gerekli makine öğrenimi, derin öğrenim, istatistiksel, görselleştirme ve XAI kütüphanelerini yükleyin.
  2. Gerçekleştirilen doğrulama için kullanılan gerçek hesaplama ortamını, model mimarisini ve hiperparametreleri Tablo 3'e kaydedin. Optimize ediciyi, öğrenme hızını, toplu işlem boyutunu (batch size), maksimum epoch sayısını, kayıp fonksiyonunu, düzenlileştirme parametrelerini, doğrulama stratejisini, erken durdurma yapılandırmasını, rastgele tohum (random-seed) yapılandırmasını, açıklanabilirlik yöntemlerini, donanımı, işletim sistemini, Python sürümünü ve ilgili yazılım-kütüphane sürümlerini belirtin. Deneylerde kullanılan bu ayarları, genel veya önerilen protokol ayarlarından ayırt edin.
  3. Pima İndiyans Diyabeti Veri Kümesi doğrulamasını ve buna karşılık gelen öngörücü, açıklanabilirlik, istatistiksel ve tekrarlanabilirlik sonuçlarını yeniden üretirken Tablo 3'te bildirilen yapılandırmayı kullanın.
  4. Paketlerin başarıyla içe aktarıldığını, veri kümesinin yüklendiğini, modelin çalıştırıldığını ve çıktının üretildiğini onaylamak için bir doğrulama betiği çalıştırın. Tekrarlanabilirlik için kesinleşmiş ortam yapılandırmasını koruyun.

3. XAI model geliştirme için sağlık hizmetleri veri setlerini hazırlama ve karakterize etme

  1. Sağlık veri setini seçin ve edinin
    1. Tanımlanan klinik tahmin görevi için uygun bir sağlık veri seti seçin. Aday veri setlerini; araştırma hedefi, veri tipi, örneklem büyüklüğü, açıklama (notasyon) kalitesi, sınıf dengesi ve klinik uygunluk kriterlerine göre değerlendirin.
    2. Tahmin görevini yeterince karşıladıkları ve bağımsız doğrulamayı kolaylaştırdıkları durumlarda, halka açık kıyaslama veri setleri tercih edilmelidir.
    3. Kurumsal veya kurum içi veri setlerini edinmeden önce gerekli etik onayları, kurumsal izinleri ve veri erişim yetkisini alın. Seçilen veri setini, doğrulanmış bir depodan veya yetkilendirilmiş bir kurumsal veri tabanından temin edin.
    4. Orijinal veri seti dosyalarını herhangi bir değişiklik yapmadan koruyun ve veri seti sağlayıcısını, versiyonu, elde etme bilgilerini, lisans koşullarını, dahil etme kriterlerini, hariç tutma kriterlerini ve beraberindeki meta verileri kaydedin. Veri setini; ham veriler, açıklamalarda (notasyonlar), meta veriler ve ek bilgiler için ayrı dizinler olacak şekilde düzenleyin.
  2. Sağlık hizmetleri veri setini karakterize edin
    1. Öngörücü değişkenleri, sonuç etiketlerini, öznitelik türlerini, veri modalitelerini ve sınıf dağılımlarını belirleyin. Denek sayısını, örnek sayısını, öznitelik boyutlarını ve mevcut açıklama (anotasyon) bilgilerini tespit edin.
    2. Veri kümesi özelliklerinin seçilen yapay zeka yöntemiyle uyumlu olduğunu doğrulayın.
    3. Dokuz aşamalı temel protokolün doğrulanması için tek çalışılmış deneysel veri seti olarak Pima Kızılderilileri Diyabet Veri Setini kullanın. Şunlarda listelenen ek veri setlerini dahil edin: Tablo 2 yalnızca genel protokolün klinik tablo verileri, elektronik sağlık kayıtları, dermoskopik görüntüler, fizyolojik zaman serisi verileri ve tıbbi görüntüleme genelindeki uygulanabilirliğini göstermek amacıyla kullanılmalıdır. Bu ek veri setlerini model eğitimi, test etme, istatistiksel doğrulama veya rapor edilen deneysel sonuçların oluşturulması için kullanmayın.
  3. Veri seti kalitesini değerlendirin
    1. Veri setini yinelenen kayıtlar, bozulmuş dosyalar, eksik değerler, açıklama hataları ve düzensiz veri girişleri açısından inceleyin. Onaylanmış yinelenen kayıtları kaldırın ve doğrulanmış biçimlendirme düzensizliklerini düzeltin. Tüm veri seti kalite kontrol prosedürlerini belgeleyin.
    2. Multimodal veri setleri kullanılırken; görüntüleme, klinik, laboratuvar ve fizyolojik verilerin denek tanımlayıcıları aracılığıyla uygunluğu doğrulayın.
    3. Yinelenen veya tutarsız kayıtları kaldırın, eksik değerleri yönetin, sayısal özellikleri standartlaştırın, kategorik değişkenleri kodlayın ve modaliteye özgü ön işleme adımlarını uygulayın. Veri setini bağımsız eğitim, doğrulama ve test setlerine ayırın. Şuraya başvurun: Şekil 2 sağlık hizmetleri veri seti hazırlama, ön işleme, bölümlendirme ve kalite değerlendirme iş akışı için.
  4. Veri gizliliğini ve etik uyumluluğu sağlayın
    1. Sağlık verilerindeki doğrudan tanımlayıcıları kaldırın. Gerektiğinde anonimleştirme veya takma adlandırma (pseudonymization) prosedürlerini uygulayın. Hasta sağlık bilgilerini geçerli etik, veri koruma, bilgilendirilmiş onam ve kurumsal gerekliliklere uygun şekilde yönetin.
    2. Geçerli etik onayları, feragatnameleri, veri yönetişim prosedürlerini, anonimleştirme yöntemlerini ve veri seti hazırlama iş akışını kaydedin.
    3. Bu tür bilgilerin mevcut olduğu ve etik olarak izin verildiği durumlarda, model performansını ilgili demografik veya klinik alt gruplar arasında karşılaştırarak potansiyel algoritmik yanlılığı değerlendirin.
    4. Kullanım amacı, hedef popülasyon, model kısıtlamaları, potansiyel hata modları, insan denetimi gereksinimleri ile ilgili etik, veri koruma ve sağlık hizmetleri düzenleme gerekliliklerini belgeleyin.
    5. Tespit edilen hakkaniyet kısıtlamalarını ve sorumlu yapay zeka hususlarını, final model dokümantasyonunun bir parçası olarak kaydedin.
      NOT: Yapay zeka model geliştirmeye uygun, etik kurallara uyumlu ve tanımlanmış önemli tutarsızlıklar içermeyen, standartlaştırılmış ve belgelenmiş bir sağlık veri seti edinin.

4. Yapay zeka model eğitimi için sağlık verilerinin ön işlemesi ve bölümlendirilmesi

  1. Kalite kontrolü gerçekleştirin
    1. Veri setini mükerrer kayıtlar, eksik değerler, geçersiz değerler, tutarsız etiketler, aykırı değerler ve bozuk dosyalar açısından inceleyin.
    2. Geçersiz gözlemleri önceden tanımlanmış kriterlere göre kaldırın veya düzeltin ve tüm hariç tutmaları kaydedin. Tahmin edici değişkenlerin ve sonuç etiketlerinin tutarlılığını doğrulayın.
  2. Eksik verileri yönetin
    1. Her değişken için eksiklik miktarını belirleyin. Önceden tanımlanmış imputasyon (atama) veya hariç tutma stratejisini uygulayın.
    2. İmputasyon parametrelerini yalnızca eğitim verilerini kullanarak tahmin edin ve uyarlanan dönüşümü doğrulama ve test verilerine uygulayın.
  3. Verileri normalleştirin ve dönüştürün
    1. Özellik ölçeklendirme, normalleştirme, kodlama, boyut indirgeme veya seçilen modelin gerektirdiği diğer dönüşümleri uygulayın. Veriye bağlı tüm dönüşümleri yalnızca eğitim verilerini kullanarak uyarlayın.
    2. Uyarlanan dönüşümleri doğrulama ve test verilerine hiçbir değişiklik yapmadan uygulayın.
  4. Eğitim verilerindeki sınıf dengesizliğini nicel olarak belirleyin. Sınıf ağırlıklandırma, SMOTE, aşırı örnekleme veya veri artırmayı yalnızca eğitim veri setine uygulayın. Doğrulama ve test veri setlerinin orijinal dağılımını koruyun.
  5. Hiçbir deneğin, mükerrer gözlemin, artırılmış örneğin, ön işleme istatistiğinin, özellik seçim kriterinin veya sentetik örneğin eğitim ve değerlendirme bölümleri arasında paylaşılmadığını onaylayın.

5. XAI modelini geliştirin ve yapılandırın

  1. Girdi veri modalitelerini, ön işleme işlemlerini, modaliteye özgü öznitelik kodlayıcılarını, öznitelik füzyon mekanizmasını, tahmin katmanını ve açıklanabilirlik modülünü belirterek model mimarisini tanımlayın.
  2. Tahmin görevine ve girdi modalitesine göre makine öğrenmesi veya derin öğrenme mimarisini seçin. Girdi katmanını, öznitelik çıkarma bileşenlerini, gizli katmanları, çıktı katmanını ve aktivasyon fonksiyonlarını yapılandırın. Optimize ediciyi, öğrenme oranını, yığın boyutunu, kayıp fonksiyonunu, dönem sayısını, düzenlemeyi, dropout'u, erken durdurmayı ve öğrenme oranı planını tanımlayın.
  3. Yalnızca eğitim ve doğrulama verilerini kullanarak hiperparametreleri optimize edin.
  4. Nihai mimariyi ve hiperparametre yapılandırmasını Tablo 3'e kaydedin.
  5. Eğitimden önce girdi-çıktı boyutsal uyumluluğunu doğrulayın.
    NOT: Uygun bir mimari, tanımlanmış hiperparametreler ve entegre açıklanabilirlik teknikleri içeren, tam olarak yapılandırılmış bir XAI modeli oluşturun.

6. XAI modelini eğitin, optimize edin ve kaydedin

  1. Önceden tanımlanmış eğitim ve doğrulama veri kümeleri ile nihai model konfigürasyonunu yükleyin. Modeli, önceden tanımlanmış rastgele tohum (random seed) ve eğitim parametrelerini kullanarak başlatın.
  2. Modeli belirtilen optimize edici, kayıp fonksiyonu, grup boyutu (batch size) ve durdurma kriterlerini kullanarak eğitin.
  3. Doğrulama performansını izleyin ve önceden tanımlanmış model seçim kriterine karşılık gelen kontrol noktasını (checkpoint) saklayın. Seçilen kontrol noktasını, başka bir optimizasyon yapmadan bağımsız test veri kümesi üzerinde değerlendirin.
  4. Eğitilmiş modeli, ön işleme konfigürasyonunu, hiperparametreleri, rastgele tohumu ve eğitim günlüğünü kaydedin.
    NOT: Hazırlanan sağlık hizmetleri veri kümesi kullanılarak eğitilmiş ve doğrulanmış optimize bir XAI modeli elde edin. Tekrarlanabilirlik için en iyi performansı gösteren modeli, hiperparametreleri, eğitim günlüklerini, ön işleme konfigürasyonunu ve hesaplama ortamını muhafaza edin.

7. Tahminleyici ve hesaplama performansını değerlendirin

  1. Tahmin performansını değerlendirin
    1. Model eğitimi ve hiperparametre optimizasyonu tamamlandıktan sonra, optimize edilmiş modeli ve bağımsız test veri setini yükleyin. Test aşamasında, eğitilmiş model parametrelerini ve ön işleme hattını değiştirilmeden koruyun.
    2. Test veri setindeki tüm örnekler için tahminler oluşturun. Tahmin edilen çıktıları, karşılık gelen temel gerçeklik (ground-truth) etiketleri ile karşılaştırın.
  2. Performans metriklerini hesaplayın
    1. Tahmin görevinin türüne göre değerlendirme metriklerini seçin.
    2. Sınıflandırma görevleri için uygun olduğunda; doğruluğu (accuracy), kesinliği (precision), duyarlılığı (recall), özgünlüğü (specificity), F1-skorunu, dengeli doğruluğu (balanced accuracy), Matthews korelasyon katsayısını (MCC) ve alıcı işletim karakteristik eğrisi altındaki alanı (AUC-ROC) hesaplayın. Regresyon görevleri için uygun olduğunda; ortalama mutlak hatayı (MAE), kök ortalama kare hatayı (RMSE), belirleme katsayısını (R2) ve diğer ilgili ölçümleri hesaplayın.
  3. Model genelleştirmesini ve sağlamlığını değerlendirin
    1. Mümkün olduğunda, geliştirme veri setinden bağımsız olarak toplanmış harici bir veri seti kullanarak modeli değerlendirin.
    2. Taşınabilirliği değerlendirmek için farklı bir sağlık kurumundan, coğrafi bölgeden veya hasta popülasyonundan gelen harici veri setlerini tercih edin.
    3. Boylamsal veri setleri mevcut olduğunda, daha sonraki bir dönemde toplanan verileri kullanarak zamansal doğrulama gerçekleştirin.
    4. Çok merkezli veriler mevcut olduğunda, nihai modeli katılımcı kurumlar genelinde ayrı ayrı değerlendirerek çok merkezli doğrulama gerçekleştirin.
    5. Mümkün olduğunda, farklı bir coğrafi bölgeden gelen bağımsız bir popülasyonu kullanarak coğrafi doğrulama gerçekleştirin.
    6. Geliştirme ve harici veri setleri arasındaki performans farklılıklarını ve güven aralıklarını raporlayın.
  4. Hesaplama performansını değerlendirin
    1. Önceden tanımlanmış hesaplama ortamında model eğitim süresini, aynı hesaplama koşulları altında çıkarım ve test süresini, ayrıca bellek tüketimini, model boyutunu ve donanım kullanımını ölçün.
    2. Hesaplama ölçümlerini bağımsız çalışmalar üzerinden tekrarlayın.
    3. Deneysel değişkenliğin etkisini azaltmak için ortalama yürütme süresini hesaplayın.
  5. Model performansını karşılaştırın
    1. Karşılaştırmalı değerlendirme için uygun geleneksel makine öğrenimi veya derin öğrenme yöntemlerini seçin.
    2. Önerilen XAI modelini ve karşılaştırıcı modelleri aynı veri setini kullanarak değerlendirin. Tüm karşılaştırma modellerine aynı ön işleme prosedürlerini ve değerlendirme metriklerini uygulayın.
    3. Tüm karşılaştırmalı deneyleri aynı hesaplama ortamında gerçekleştirin.
      NOT: Test edilen hesaplama koşulları ve veri seti altında tahmin kararlılığı ve tekrarlanabilirliğine dair deneysel kanıtlar elde edin.

8. XAI çıktılarını oluşturun ve değerlendirin

  1. Model açıklamalarını oluşturun
    1. Optimize edilmiş XAI modelini yükleyin. Model eğitimi için kullanılmayan değerlendirme örneklerini seçin. Eğitilmiş modeli veya ön işleme hattını değiştirmeden önceden tanımlanmış açıklanabilirlik yöntemlerini uygulayın.
    2. Global ve yerel model açıklamaları oluşturun
      1. Tahmin modelinin genel davranışını karakterize etmek için global açıklamalar oluşturun.
      2. Bireysel model tahminlerini karakterize etmek için yerel açıklamalar oluşturun.
      3. Tablo model tahminlerinin global ve yerel açıklamalarını oluşturmak için Pima Indians Diabetes Veri Kümesi'ne SHAP uygulayın.
      4. Öznitelik katkılarının genel yönünü ve büyüklüğünü görselleştirmek için bir SHAP özet grafiği oluşturun.
      5. Öznitelikleri model tahminlerine yaptıkları genel katkıya göre sıralamak için ortalama mutlak SHAP değerlerini kullanarak bir SHAP öznitelik önem grafiği oluşturun.
      6. Hastaya özgü öznitelik katkılarını göstermek için temsilci bir test seti tahmini için bir SHAP şelale grafiği oluşturun.
      7. Seçilen bir öznitelik ile bu özniteliğin model çıktısına olan katkısı arasındaki ilişkiyi incelemek için bir SHAP öznitelik bağımlılık grafiği oluşturun.
      8. Bireysel model tahminlerinin yerel açıklamalarını oluşturmak için temsilci test seti tahminlerine LIME uygulayın.
      9. Tahmin edilen sonuçtaki bir değişiklikle ilişkili öznitelik değişikliklerini göstermek için hastaya özgü bir karşıt-olgusal (counterfactual) açıklama oluşturun.
      10. Veri modalitesine ve model mimarisine göre ek açıklanabilirlik teknikleri seçin.
      11. Uygun olduğunda, uyumlu görüntü tabanlı modeller için Grad-CAM veya belirginlik haritaları (saliency maps), transformer tabanlı mimariler için dikkat (attention) görselleştirmeleri ve diferansiyellenebilir modeller için Entegre Gradyanlar (Integrated Gradients) kullanın.
      12. Grad-CAM, belirginlik haritalama, dikkat görselleştirmesi ve Entegre Gradyanları genel, modaliteye bağımlı protokol seçenekleri olarak değerlendirin ve ilgili analizler gerçekten gerçekleştirilmediği sürece bunları Pima Indians Diabetes Veri Kümesi doğrulamasından elde edilen deneysel sonuçlar olarak yorumlamayın veya raporlamayın.
    3. Açıklanabilirlik yöntemlerini çalışılmış Pima doğrulamasına uygulayın
      1. Tablo model tahminlerinin global ve yerel açıklamalarını oluşturmak için Pima Indians Diabetes Veri Kümesi'ne SHAP ve LIME uygulayın.
      2. Pima doğrulama sonuçlarından SHAP özet, öznitelik önem, şelale ve öznitelik bağımlılığı görselleştirmeleri oluşturun.
      3. Temsilci test seti tahminleri için bir LIME yerel açıklaması oluşturun.
      4. Model tahminindeki bir değişiklikle ilişkili öznitelik değişikliklerini göstermek için hastaya özgü bir karşıt-olgusal açıklama oluşturun.
      5. Grad-CAM, dikkat görselleştirmesi, belirginlik haritalama ve Entegre Gradyanları, diğer sağlık hizmetleri veri türleri ve model mimarileri için modaliteye bağımlı açıklanabilirlik seçenekleri olarak değerlendirin.
      6. İlgili analizler gerçekten gerçekleştirilmediği sürece Grad-CAM, dikkat görselleştirmesi, belirginlik haritalama veya Entegre Gradyanları Pima çalışılmış doğrulamasından elde edilen deneysel bulgular olarak raporlamayın.
  2. Açıklama kalitesini değerlendirin
    1. Oluşturulan açıklamaların modelin tahmin sürecini yansıtıp yansıtmadığını değerlendirin. Tekrarlanan deneysel çalıştırmalarda açıklamaların kararlılığını ve özdeş hesaplama koşulları altında açıklama çıktılarının tutarlılığını değerlendirin.
    2. Uygun olduğunda, açıklama çıktılarının girdi verilerindeki değişikliklere karşı duyarlılığını değerlendirin. Oluşturulan açıklamaları mevcut alan bilgisi veya uzman yorumlarıyla karşılaştırın.
    3. Bu tür karşılaştırmalar mevcut olduğunda, yerleşik tıbbi bilgilerle örtüşen tahmin edici öznitelikleri veya anatomik bölgeleri belirleyin.
    4. Oluşturulan açıklamalar ile mevcut klinik yorum arasındaki uyum veya uyumsuzluk düzeyini kaydedin.
  3. Tahmin belirsizliğini nicelleştirin
    1. Seçilen model mimarisine ve sağlık uygulamasına uygun bir belirsizlik tahmini yöntemi kullanarak değerlendirilen örnekler için tahmin güven tahmini oluşturun.
    2. Uygun olduğunda Monte Carlo dropout, topluluk tabanlı (ensemble-based) tahmin, Bayesyen çıkarım, konformal tahmin veya doğrulanmış başka bir belirsizlik tahmini yaklaşımı uygulayın.
    3. Monte Carlo dropout kullanılırken stokastik tahmin geçişlerini tekrarlayın ve her değerlendirme örneği için ortalama tahmini ve tahmin varyansını hesaplayın.
    4. Tahmin güvenini veya belirsizlik aralıklarını, ilgili model tahminleriyle birlikte raporlayın.
    5. Belirsizlik tahminlerinin, daha düşük güvenilirlikle veya artan tahmin hatasıyla ilişkili tahminleri belirleyip belirlemediğini değerlendirin. Tekrarlanabilirliği sağlamak için belirsizlik tahmin yöntemini, parametrelerini, rastgele tohumlarını ve oluşturulan belirsizlik çıktılarını koruyun.
  4. Açıklanabilirlik çıktılarını belgeleyin ve koruyun
    1. Oluşturulan tüm öznitelik önem puanlarını, ısı haritalarını, belirginlik haritalarını, dikkat görselleştirmelerini ve hastaya özgü yorumları kaydedin. Açıklanabilirlik çıktılarını standartlaştırılmış dosya formatları kullanarak saklayın. Çıktıları, eğitilmiş model ve ön işleme yapılandırmasıyla birlikte arşivleyin.
    2. Açıklama oluşturma için kullanılan hesaplama ayarlarını, açıklama parametrelerini, yürütme süresini ve yazılım sürümlerini kaydedin. Bağımsız incelemeyi ve tekrarlanabilirliği kolaylaştırmak için eksiksiz açıklanabilirlik dokümantasyonunu koruyun.
  5. Açıklama kalitesini nicel olarak değerlendirin
    1. Önemli olarak tanımlanan öznitelikleri sistematik olarak bozarak veya maskeleyerek ve model çıktısındaki karşılık gelen değişikliği ölçerek açıklama sadakatini (faithfulness) değerlendirin. Atribüsyon büyüklüğünü, model tahmininde meydana gelen sonuçla karşılaştırarak bir açıklama sadakati puanı hesaplayın.
    2. Tekrarlanan çalıştırmalar, bozulmuş girdiler veya klinik olarak benzer örnekler için açıklamalar oluşturarak ve ortaya çıkan atribüsyon kalıpları arasındaki benzerliği hesaplayarak açıklama kararlılığını değerlendirin. Kontrollü girdi bozulmaları altında, tahmin edilen çıktı değişimi ile açıklama atribüsyonundan tahmin edilen değişim arasındaki tutarsızlığı ölçerek sadakatsizliği (infidelity) hesaplayın.
    3. Tıbbi görüntü açıklamaları için, referans anotasyonlar mevcut olduğunda, uzman tarafından tanımlanmış bir ilgi alanı (region of interest) kullanarak lokalizasyon doğruluğunu değerlendirin. Önceden tanımlanmış yorum kriterlerini kullanarak yetkin klinik uzmanlardan bağımsız değerlendirmeler alarak klinik yararlılığı değerlendirin.
    4. Birden fazla uzman, açıklama ilgisini veya uyumunu bağımsız olarak değerlendirdiğinde Cohen's kappa veya Fleiss' kappa hesaplayın.
      NOT: Eğitilmiş yapay zeka modelinin tahmin davranışını karakterize eden global ve yerel açıklamalar oluşturun. Şeffaf yorumlama ve tekrarlanabilir değerlendirme için açıklanabilirlik çıktılarını ve ilgili yapılandırmaları koruyun.

9. İstatistiksel doğrulama ve tekrarlanabilirlik değerlendirmesi gerçekleştirin

  1. İstatistiksel doğrulamayı gerçekleştirin
    1. Çalışma amacına, deneysel tasarıma, veri dağılımına ve değerlendirilen değişkenlerin özelliklerine göre istatistiksel yöntemleri seçin.
    2. Sürekli değişkenleri uygun şekilde ortalama ± standart sapma veya medyan ve çeyrekler arası aralık olarak; kategorik değişkenleri ise sayı ve yüzdeler olarak raporlayın.
    3. Model performans stabilitesini değerlendirmek için eğitim seti üzerinde beş katlı çapraz doğrulama yapın ve doğruluk, AUC-ROC, kesinlik, geri çağırma ve F1-skorunu katlar boyunca ortalama ± standart sapma olarak raporlayın. 1.000 bootstrap yeniden örneklemesi kullanarak bağımsız test seti performans metrikleri için %95 güven aralıklarını tahmin edin.
    4. Önerilen modeli; eşleşmiş doğruluk karşılaştırmaları için McNemar testi, korele AUC-ROC karşılaştırmaları için DeLong testi ve F1-skoru karşılaştırmaları için 1.000 yeniden örneklemeli eşleşmiş bootstrap testi kullanarak CNN, Random Forest ve SVM temel modelleri ile karşılaştırın.
    5. Her karşılaştırma için ilgili test istatistiğini ve kesin p-değerini raporlayın ve α = 0.05 iki yönlü anlamlılık düzeyini kullanın.
  2. Model performansını istatistiksel olarak karşılaştırın
    1. Önerilen açıklanabilir AI modelini, seçilen güncel makine öğrenimi ve derin öğrenim temel modelleri ile karşılaştırın.
    2. İki grubu karşılaştırırken uygun şekilde Student's t-testi veya Mann-Whitney U testini uygulayın. İkiden fazla grubun dahil olduğu uygun parametrik karşılaştırmalar için tek yönlü ANOVA'yı uygulayın. İkiden fazla grubun dahil olduğu uygun parametrik olmayan karşılaştırmalar için Kruskal-Wallis testini uygulayın.
    3. Orijinal makalede belirtildiği üzere, p < 0.05 değerini istatistiksel olarak anlamlı kabul edin.
    4. Tüm önceden tanımlanmış istatistiksel karşılaştırmalar için α = 0.05 iki yönlü anlamlılık düzeyini kullanın ve ilgili test istatistiklerini ve p-değerlerini raporlayın.
    5. Temel öngörücü performans metrikleri için %95 güven aralıklarını raporlayın.
    6. Uygun olduğunda, performans ölçümleri için güven aralıklarını tahmin etmek amacıyla bootstrap yeniden örneklemesi kullanın. Aynı denekler iki model tarafından değerlendirildiğinde, korele ROC-AUC değerlerini karşılaştırmak için DeLong testini kullanın. Aynı denekler için oluşturulan eşleşmiş kategorik sınıflandırma sonuçlarını karşılaştırmak için McNemar testini kullanın. Uygun olduğunda, F1-skoru veya diğer türetilmiş performans metriklerini karşılaştırmak için eşleşmiş bootstrap prosedürlerini kullanın.
    7. Olasılıksal tahminler mevcut olduğunda kalibrasyonu; kalibrasyon grafikleri, kalibrasyon eğimi/kesim noktası ve Brier skoru kullanarak değerlendirin.
    8. Uygulanan Pima Indians Diabetes Dataset doğrulaması için, önerilen model ve temel modeller için belirtilen önceden tanımlanmış eşleşmiş istatistiksel karşılaştırmayı kullanın. Seçilen testi, karşılaştırmaya uygun olarak, eşleşmiş test seti tahminlerine veya tekrarlanan çalıştırma performans ölçümlerine tutarlı bir şekilde uygulayın. İki yönlü α = 0.05 anlamlılık düzeyini kullanın ve test istatistiği ile kesin p-değerini raporlayın. Sonuçları Sonuçlar bölümünde sunulmadığı sürece alternatif istatistiksel testlerin gerçekleştirildiğini raporlamayın.
    9. İki yönlü testleri uygulayın ve istatistiksel anlamlılığı önceden tanımlanmış p < 0.05 eşiğini kullanarak yorumlayın.
  3. Model sağlamlığını değerlendirin
    1. Önceden tanımlanmış veri seti bölümlendirmesini, ön işleme prosedürlerini, model mimarisini, hiperparametreleri, yazılım ortamını ve değerlendirme protokolünü koruyarak, farklı rastgele tohumlar (random seeds) kullanarak tüm eğitim ve değerlendirme prosedürünü 10 kez tekrarlayın.
    2. Her bağımsız çalıştırma için AUC-ROC, doğruluk ve F1-skorunu kaydedin ve 10 çalıştırma boyunca ortalama ± standart sapmayı raporlayın.
    3. Farklı rastgele başlangıçlar altında öngörücü stabiliteyi ve tekrarlanabilirliği değerlendirmek için tekrarlanan çalışmalar sonucunda elde edilen performans değerlerini karşılaştırın.
  4. Açıklanabilirlik tekrarlanabilirliğini değerlendirin
    1. Açıklama stabilitesi değerlendirmesi dahil olduğunda, birden fazla deneysel çalışma boyunca özellik atamaları, dikkat haritaları veya diğer açıklama çıktılarını oluşturun. Tekrarlanan çalışmalar boyunca açıklama çıktılarını, uygun bir benzerlik veya sıra tabanlı uyum ölçütü kullanarak nicel olarak karşılaştırın.
    2. Mevcut Pima Indians Diabetes Dataset uygulamalı doğrulaması için, ilgili tekrarlanan açıklama çıktıları ve analizler gerçekleştirilmediği sürece nicel açıklama stabilitesi metriklerini raporlamayın.
    3. Uygun klinik değerlendirmeler mevcut olduğunda, model tarafından üretilen açıklamalar ile klinisyen yorumları arasındaki uyumu değerlendirin. Değerlendiriciler arasındaki uyumu değerlendirmek için uygun şekilde Cohen's kappa veya Fleiss' kappa değerini hesaplayın.
  5. Tekrarlanabilirliği belgeleyin
    1. Ham verileri, ön işleme prosedürlerini, kaynak kodu, eğitilmiş modelleri, hiperparametre yapılandırmalarını, açıklanabilirlik çıktılarını, istatistiksel analiz betiklerini ve oluşturulan sonuçları muhafaza edin.
    2. İş akışı boyunca kullanılan yazılım ortamını ve donanım yapılandırmasını kaydedin. Arşivlenen dosyaları ve yapılandırmaları kullanarak tüm iş akışını bağımsız olarak yeniden çalıştırın.
    3. Tekrarlanan öngörücü performansı orijinal deneysel sonuçlarla ve tekrarlanan model açıklamalarını orijinal açıklanabilirlik çıktılarıyla karşılaştırın.
    4. Tekrarlama sırasında gözlemlenen tüm farklılıkları kaydedin. Deneysel dokümantasyonu, bağımsız yürütme sırasında tespit edilen tekrarlanabilirlik gözlemlerini yansıtacak şekilde güncelleyin.
      NOT: Tekrarlanan deneyler boyunca değerlendirilebilecek istatistiksel olarak doğrulanmış öngörücü performans ve açıklanabilirlik sonuçları elde edin. Tüm iş akışının bağımsız doğrulanmasını sağlamak için yeterli hesaplama, analiz ve metodoloji dokümantasyonunu muhafaza edin.
  6. Tekrarlanabilirlik Kontrol Listesi
    1. Veri seti adını, sürümünü, edinme tarihini, kaynağını, dahil etme kriterlerini, hariç tutma kriterlerini ve nihai örnek sayısını kaydedin. Tüm ön işleme işlemlerini, dönüşüm parametrelerini, normalizasyon ayarlarını, özellik seçme prosedürlerini ve veri bölümlendirme kurallarını kaydedin.
    2. İşletim sistemini, CPU, GPU, RAM, Python sürümünü, framework sürümlerini ve kütüphane sürümlerini kaydedin. Tüm model mimarisi spesifikasyonlarını ve hiperparametreleri kaydedin.
    3. Optimize ediciyi, öğrenme oranını, batch boyutunu, epoch sayısını, kayıp fonksiyonunu, düzenleştirmeyi ve erken durdurma kriterlerini kaydedin. Tüm rastgele tohumları ve rastgele sayı üreteci ayarlarını kaydedin.
    4. Eğitilmiş model ağırlıklarını ve ön işleme yapılandırmalarını muhafaza edin. Eğitim günlüklerini, değerlendirme betiklerini, istatistiksel analiz betiklerini ve açıklanabilirlik çıktılarını muhafaza edin. Final deneyler için kullanılan model ve yazılım sürümlerini kaydedin.
    5. Bağımsız tekrarlama için gereken eksiksiz hesaplama ortamını muhafaza edin.
    6. Kaynak kodun, veri setlerinin, model ağırlıklarının ve destekleyici materyallerin; etik, yasal, lisanslama ve gizlilik kısıtlamalarına tabi olan erişilebilirliğini belgeleyin.
    7. Arşivlenen iş akışını bağımsız olarak yeniden çalıştırın ve tekrarlanan sonuçları orijinal sonuçlarla karşılaştırın.
    8. Tüm tekrarlanabilirlik gereksinimlerini standartlaştırılmış kontrol listesini kullanarak belgeleyin.

Sonuçlar

Önerilen XAI çerçevesi, temsili sağlık veri seti olarak Pima Indians Diabetes Veri Seti kullanılarak uygulanmıştır. Pima Indians Diabetes Veri Seti, tek deneysel doğrulama veri seti olarak kullanılmıştır. Rapor edilen tüm öngörücü, açıklanabilirlik, istatistiksel ve tekrarlanabilirlik sonuçları bu veri setinden elde edilmiştir. TCGA-BRCA, TCGA-UCEC, MIMIC-III, ISIC 2019, HAM10000, OhioT1DM ve BraTS 2021 deneysel olarak değerlendirilmemiş olup, yalnızca genel protokolün farklı sağlık veri modaliteleri genelindeki uygulanabilirliğini gösteren örnekler olarak dahil edilmiştir. Geçersiz ve yinelenen kayıtlar çıkarıldıktan ve model geliştirme öncesinde belirtilen ön işleme işlemleri gerçekleştirildikten sonra veri setinin tamamı kullanılmıştır. Veri seti, önceden tanımlanmış tabakalı bir bölme stratejisi kullanılarak bağımsız eğitim, doğrulama ve test alt kümelerine ayrılmıştır. Veri sızıntısı olasılığını minimize etmek için üç alt küme arasındaki örnek bağımsızlığı korunmuştur.

Tahminleyici model, önceden tanımlanmış mimari ve hiperparametreler kullanılarak yapılandırılmıştır. Model, önceden belirlenmiş öğrenme oranı ve paket boyutu ile Adam optimizasyonu kullanılarak 100 epoka kadar eğitilmiştir. Doğrulama kaybına dayalı erken durdurma uygulanmış ve en iyi doğrulama performansına karşılık gelen model saklanmıştır. Tekrarlanabilirliği artırmak amacıyla veri kümesi bölümlendirme, model başlatma ve tekrarlanan deneyler için rastgele tohumlar belirlenmiştir.

Eğitilen model; doğruluk, kesinlik, duyarlılık, özgüllük, F1-skoru, Matthews korelasyon katsayısı (MCC), alıcı işletim karakteristik eğrisi altındaki alan (AUC-ROC) ve ortalama kesinlik (AP) kullanılarak bağımsız test seti üzerinde değerlendirildi. Önerilen model; aynı ön işleme prosedürleri, veri bölümleri ve değerlendirme protokolleri kullanılarak önceden tanımlanmış temel modellerle karşılaştırıldı. Bağımsız test seti tahminlerinden alıcı işletim karakteristik (ROC) eğrileri, kesinlik-duyarlılık eğrileri ve bir hata matrisi oluşturuldu.

Performans kararlılığını değerlendirmek için eğitim verileri üzerinde beş katlı çapraz doğrulama gerçekleştirilmiştir. Temel performans metrikleri için %95 güven aralıkları tahmin edilmiş ve önerilen model ile temel modeller arasında önceden tanımlanmış istatistiksel karşılaştırmalar yapılmıştır.

Beş katlı çapraz doğrulama sonucunda %93,01 ± 0,48 doğruluk, 0,954 ± 0,007 AUC-ROC, %92,42 ± 0,87 kesinlik, %93,02 ± 0,45 duyarlılık ve %92,72 ± 0,62 F1-skoru elde edilmiştir. 1.000 yeniden örnekleme ile tahmin edilen %95 bootstrap güven aralıkları; doğruluk için 0,897–0,973, kesinlik için 0,890–0,970, duyarlılık için 0,880–0,963, F1-skoru için 0,887–0,965 ve AUC-ROC için 0,931–0,984 olarak belirlenmiştir. CNN, Random Forest ve SVM temel modelleri ile yapılan istatistiksel karşılaştırmalarda; doğruluk için McNemar testi, AUC-ROC için DeLong testi ve F1-skoru için 1.000 yeniden örneklemeli eşleştirilmiş bootstrap testi kullanılmıştır.

Tam eğitim ve değerlendirme prosedürü, farklı rastgele tohumlar kullanılarak 10 bağımsız çalışma boyunca tekrarlanmıştır. Tekrarlanan çalışmalar; 0.957 ± 0.008 AUC-ROC, %93.24 ± 0.74 doğruluk ve %92.35 ± 0.92 F1-skoru vermiş olup, bu durum tekrarlanan yürütmeler arasında nispeten düşük değişkenliğe işaret etmektedir. Tekrarlanan yürütmeler boyunca elde edilen performans metrikleri, ortalama ve standart sapma kullanılarak özetlenmiştir. Tahmin performansının tekrarlanan yürütme altında kararlı kalıp kalmadığını belirlemek için çalışmalar arasındaki değişkenlik incelenmiştir.

Bu çalışmada bağımsız bir harici veri seti kullanılmadığı için harici doğrulama gerçekleştirilmemiştir. Buna bağlı olarak, rapor edilen tüm öngörücü, istatistiksel ve tekrarlanabilirlik sonuçları, önceden tanımlanmış eğitim, doğrulama ve bağımsız test bölümleri kullanılarak Pima Indians Diabetes Veri Seti'nden elde edilmiştir. Farklı bir kurum, popülasyon, coğrafi bölge veya zaman dilimine ait bağımsız bir veri setinin mevcut olduğu uygulamalar için harici doğrulama, protokolde isteğe bağlı bir prosedür olarak tutulmuştur.

Model açıklamaları, SHAP ve LIME dahil olmak üzere, tablo şeklindeki Pima Indians Diabetes Veri Seti'ne uygulanabilir açıklanabilirlik teknikleri kullanılarak oluşturulmuştur. Küresel özellik önemi değerlendirilmiş ve ayrılmış test örnekleri kullanılarak hastaya özgü yerel açıklamalar üretilmiştir. Tekrar üretilebilirliği ve sonraki yorumlamaları kolaylaştırmak için açıklama çıktıları, ilgili model tahminleri ve özellik değerleriyle birlikte kaydedilmiştir.

Netlik sağlamak adına, mevcut uygulamalı örnek, Tablo 1'de tanımlanan dokuz temel iş akışı aşamasından oluşmuştur. Dış doğrulama ve klinik uzman değerlendirmesi, genel protokolün isteğe bağlı doğrulama modülleri olarak tutulmuştur. Bağımsız bir dış veri seti kullanılmadığı için dış doğrulama yapılmamıştır ve mevcut uygulamalı örneğe resmi bir uzman değerlendirme paneli dahil edilmediği için klinik uzman değerlendirmesi gerçekleştirilmemiştir. Buna göre, bu isteğe bağlı modüller dokuz aşamalı deneysel iş akışının bir parçası olarak değerlendirilmemiş ve deneysel sonuçlar olarak raporlanmamıştır.

Ön işleme ve veri seti bölümlendirme prosedürleri, model geliştirme için uygun, standardize edilmiş bir veri seti oluşturmuştur. Yinelenen ve tutarsız kayıtlar kaldırılmış, eksik değerler önceden tanımlanmış stratejiye göre ele alınmış, sayısal öznitelikler standardize edilmiş ve veri seti bağımsız eğitim, doğrulama ve test alt kümelerine bölünmüştür. Ortaya çıkan veri seti özellikleri ve ön işleme prosedürleri Tablo 2'de özetlenmiştir. Genel sağlık hizmetleri veri seti hazırlama ve ön işleme iş akışı Şekil 2'de gösterilirken, özellikle Pima Yerlileri Diyabet Veri Seti'ne uygulanan deneysel hazırlama, ön işleme, bölümlendirme ve kalite değerlendirme iş akışı Şekil 3'te gösterilmiştir. Rapor edilen sonuçları oluşturmak için kullanılan nihai hesaplama ortamı, model mimarisi ve hiperparametre yapılandırması Tablo 3'te özetlenmiştir.

Bölüm 3 ve 4'ün uygulanması, model geliştirme için uygun, standardize edilmiş bir sağlık hizmetleri veri seti sağlamıştır. Ön işleme prosedürleri ile yinelenen ve tutarsız kayıtlar temizlenmiş, eksik değerler tamamlanmış, sayısal özellikler standardize edilmiş, uygun olan kategorik değişkenler kodlanmış ve veri seti eğitim, doğrulama ve test alt kümelerine ayrılmıştır. Elde edilen veriler, sonraki model geliştirme aşamaları için gerekli olan standardize edilmiş girdiyi sağlamıştır.

Bölüm 5 ve 6 tamamlandıktan sonra, yapılandırılan model eğitim sırasında stabil bir yakınsama göstermiştir. Öğrenme eğrileri, eğitim ve doğrulama kayıplarında eş zamanlı azalmalar ile eğitim ve doğrulama doğruluğunda artışlar sergilemiştir. Hiperparametre optimizasyonu, belirgin bir aşırı öğrenme (overfitting) kanıtı olmaksızın modelin genelleme yeteneğini geliştirmiştir. Tekrarlanabilirliği desteklemek amacıyla, optimize edilen model; kesinleştirilmiş mimari, hiperparametre ayarları, yazılım versiyonları, rastgele tohumlar (random seeds) ve eğitilmiş model ağırlıkları ile birlikte arşivlenmiştir. Model eğitim spesifikasyonları ve optimizasyon sonuçları Tablo 4'te özetlenmiş; ilgili eğitim ve doğrulama öğrenme eğrileri ise Şekil 4'te sunulmuştur.

Bölüm 7, modelin öngörücü performansını standartlaştırılmış performans metrikleri kullanarak değerlendirmiştir. Değerlendirilen sınıflandırma metrikleri arasında doğruluk, kesinlik, geri çağırma, özgüllük, F1-skoru, MCC, AUC-ROC ve AP yer almıştır. Önerilen model; aynı veri seti bölümleri, ön işleme prosedürleri ve değerlendirme protokolü kullanılarak önceden tanımlanmış temel modellerle karşılaştırılmıştır. Öngörücü performans karşılaştırması Tablo 5'te sunulurken; ROC eğrileri, kesinlik-geri çağırma eğrileri, konfüzyon matrisi ve karşılaştırmalı performans metrikleri Şekil 5'te gösterilmiştir.

Bölüm 8'i takiben, modelin yorumlanabilirliğini değerlendirmek amacıyla model tahminlerinin hem küresel hem de yerel açıklamaları oluşturulmuştur. Tablo halindeki Pima Kızılderilileri Diyabet Veri Kümesi için model açıklamaları SHAP ve LIME kullanılarak oluşturulmuş ve tahmindeki bir değişikliği örneklendirmek için hastaya özgü bir karşıolgusal (counterfactual) açıklama üretilmiştir. Küresel özellik önemi, hastaya özgü şelale (waterfall) ve özellik bağımlılığı görselleştirmeleri oluşturmak için SHAP kullanılırken, ayrılmış test örneklerinden yerel açıklamalar oluşturmak için LIME kullanılmıştır. İlgili açıklanabilirlik çıktıları Şekil 6'da sunulmuştur.

Protokolün son aşamasında, iş akışının istatistiksel güvenilirliği ve tekrarlanabilirliği değerlendirilmiştir. Tüm iş akışı; aynı veri seti bölme stratejisi, ön işleme parametreleri, model mimarisi, hiperparametreler, yazılım ortamı ve değerlendirme prosedürleri korunarak, farklı rastgele başlangıç değerleri (random seeds) kullanılarak 10 bağımsız çalışma boyunca tekrarlanmıştır. Tekrarlanan çalışmalar sonucunda 0,957 ± 0,008 AUC-ROC, %93,24 ± 0,74 doğruluk (accuracy) ve %92,35 ± 0,92 F1-skoru elde edilmiş olup, bu değerler tekrarlanan yürütmeler arasında nispeten düşük bir değişkenliğe işaret etmektedir.

Mevcut doğrulama çalışmasında açıklama stabilitesi nicel olarak değerlendirilmemiştir. Pima Kızılderilileri Diyabet Veri Seti için SHAP ve LIME açıklamaları oluşturulmuş olsa da, ayrı bir çalıştırmalar arası sıra-korelasyon veya özellik-çakışma analizi gerçekleştirilmemiştir. Bu nedenle, herhangi bir sayısal açıklama stabilitesi veya atıf-uyum metriği rapor edilmemiştir. Nicel açıklama-stabilite değerlendirmesi, tekrarlanan açıklama çıktılarının mevcut olduğu uygulamalar için isteğe bağlı bir tekrarlanabilirlik prosedürü olarak genel protokolde tutulmuştur.

İstatistiki karşılaştırmalar, önceden tanımlanmış p < 0.05 anlamlılık eşiği kullanılarak değerlendirildi. Uygun olan durumlarda çift yönlü istatistiki testler kullanıldı ve gözlemlenen performans farklılıklarının istatistiki anlamlılığını ve belirsizliğini nicelleştirmek için ilgili test istatistikleri, p-değerleri ve %95 güven aralıkları raporlandı. Çapraz doğrulama performansı, güven aralıkları, istatistiki karşılaştırmalar ve tekrarlanan çalışma değişkenliği dahil olmak üzere deneysel istatistiki doğrulama ve tekrarlanabilirlik sonuçları Tablo 6'da özetlenmiştir. İlgili istatistiki testler ve tekrarlanabilirlik analizleri Şekil 7'de gösterilmiştir.

Bu sonuçlar, test edilen hesaplama koşulları ve veri seti altında öngörülebilir stabilite ve tekrarlanabilirliğe dair deneysel kanıt sağlamıştır. Bağımsız replikasyon için gerekli olan hesaplama ortamı, veri seti özellikleri, ön işleme prosedürleri, model konfigürasyonu, istatistiksel analizler ve açıklanabilirlik ayarları, Tablo 7'de sunulan tekrarlanabilirlik kontrol listesine uygun olarak belgelenmiştir. Mevcut çalışmanın uygulamalı doğrulama örneğinde, üretilen XAI çıktılarının klinik uzman değerlendirmesi gerçekleştirilmemiştir.

Genel olarak, protokolün uygulanması, yapay zeka model geliştirme sürecine uygun standartlaştırılmış bir sağlık veri seti ve önceden tanımlanmış hiperparametre ayarları kullanılarak optimize edilmiş bir model sağlamıştır. İş akışı; öngörücü performansın sistematik değerlendirilmesine, uygun XAI teknikleri kullanılarak model açıklamalarının oluşturulmasına ve modelin dayanıklılığı ile tekrarlanabilirliğinin istatistiksel analizine olanak tanımıştır. Sonuçlar hep birlikte, üzerinde çalışılan doğrulama örneğinde değerlendirilen deneysel koşullar altında önerilen XAI iş akışının uygulandığını ve tekrarlanabilir olduğunu göstermiştir.

Makine öğrenimi iş akışı diyagramı: veri ön işlemesi dahil, proje kurulumundan istatistiksel doğrulamaya kadar.
Şekil 1: Sağlık hizmetlerinde tekrarlanabilir ve açıklanabilir yapay zeka modelleri geliştirmek için dokuz aşamalı temel iş akışı. İş akışı şunları içerir: (1) sağlık hizmetleri tahmin görevinin tanımlanması, (2) hesaplama ortamı konfigürasyonu, (3) veri seti edinimi ve doğrulaması, (4) veri ön işlemesi, (5) veri setinin bölümlendirilmesi, (6) öngörücü model eğitimi, (7) öngörücü performans değerlendirmesi, (8) açıklanabilirlik analizi ve (9) istatistiksel doğrulama ve tekrarlanabilirlik değerlendirmesi. Dış doğrulama ve klinik uzman değerlendirmesi, isteğe bağlı protokol uzantıları olarak ele alınmıştır ve dokuz aşamalı temel iş akışına dahil edilmemiştir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Veri ön işleme hattı, diyagram: AI veri seti kalitesi için entegrasyon, artırma ve bölümlendirme.
Şekil 2: Sağlık hizmetleri veri seti hazırlama ve ön işleme iş akışı. (A) Klinik kayıtlar, tıbbi görüntüleme, fizyolojik sinyaller ve multimodal veri kaynaklarından sağlık verilerinin edinimi. (B) Eksik değerlerin yönetimi, normalizasyon, gürültü giderme ve veri artırma dahil olmak üzere veri entegrasyonu ve ön işleme. (C) Veri setinin eğitim, doğrulama ve test alt kümelerine bölünmesi. (D) Model geliştirme öncesinde sınıf dağılımını, öznitelik normalizasyonunu ve ön işleme çıktılarını gösteren kalite değerlendirmesi. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayınız.

Diyabet veri seti için veri ön işleme diyagramı; adımlar kalite değerlendirmesi ve özellik işlemeyi içerir.
Şekil 3: Pima Kızılderilileri Diyabet Veri Seti'nin hazırlanması, ön işlemesi, bölümlenmesi ve kalite değerlendirmesine yönelik deneysel iş akışı. İş akışı; veri setinin edinilmesi, veri kalitesinin değerlendirilmesi, geçersiz ve eksik değerlerin yönetilmesi, sayısal özelliklerin standardizasyonu, veri setinin eğitim, doğrulama ve bağımsız test alt kümelerine bölünmesi ve model geliştirme öncesindeki son kalite doğrulamasını içerir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayınız.

Makine öğrenimi eğitim-doğrulama grafikleri; epoklar boyunca kayıp ve doğruluk grafiklerini içerir; temel metrikler gösterilmiştir.
Şekil 4: Pima Indians Diabetes Veri Kümesi kullanılarak önerilen modelin deneysel eğitim ve doğrulama öğrenme eğrileri. (A) Tüm eğitim süreci boyunca eğitim ve doğrulama kaybı. (B) Tüm eğitim süreci boyunca eğitim ve doğrulama doğruluğu. (C) 50–100. epoklar arasındaki kaybın büyütülmüş görünümü. (D) 50–100. epoklar arasındaki doğruluğun büyütülmüş görünümü. En iyi doğrulama performansı, 0.142 doğrulama kaybı ve %94.6 doğrulama doğruluğu ile 78. epokta elde edilmiştir. Erken durdurma, 10 epokluk bir sabır (patience) değeri kullanılarak 88. epokta tetiklenmiştir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Makine öğrenimi model performansını değerlendiren ROC eğrisi, kesinlik-duyarlılık grafiği ve konfüzyon matrisi.
Şekil 5: Bağımsız test seti (n = 154) kullanılarak önerilen XAI çerçevesinin deneysel öngörücü performans değerlendirmesi. (A) Önerilen XAI modelinin ve temel modellerin ayırdetme performansını gösteren Alıcı İşletim Karakteristiği (ROC) eğrisi. (B) Önerilen XAI modelinin ve temel modellerin kesinlik ve duyarlılık performansını gösteren Kesinlik–Duyarlılık (PR) eğrileri. (C) Önerilen XAI modelinin bağımsız test setindeki konfüzyon matrisi ile buna karşılık gelen doğruluk, duyarlılık (recall) ve özgüllük değerleri. (D) Değerlendirilen modeller genelinde doğruluk, kesinlik, duyarlılık, özgüllük, F1-skoru, Matthews korelasyon katsayısı (MCC), ROC eğri altı alanı (AUC) ve ortalama kesinliğin (AP) karşılaştırılması. Bu şekilde gösterilen tüm nicel sonuçlar, Pima Indians Diabetes Veri Kümesi üzerindeki doğrulama deneyine karşılık gelmektedir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Diyabet tahminlerinin SHAP analiz grafikleri; özellik önemi, küresel etki ve karşıolgusal sonuçlar.
Şekil 6: Pima Indians Diabetes Dataset üzerinde eğitilen önerilen modelin bağımsız test seti tahminlerinden üretilen açıklanabilirlik çıktıları. (A) Test seti genelinde özellik katkılarının dağılımını gösteren küresel SHAP özet grafiği. (B) Ortalama mutlak SHAP değerlerine dayalı SHAP özellik önem grafiği. (C) Bireysel özelliklerin tahmin edilen diyabet olasılığına katkılarını gösteren hastaya özel SHAP şelale grafiği. (D) Test Hastası #125 için özellik katkılarını gösteren LIME yerel açıklaması. (E) Glikoz değerleri ile bunların SHAP katkıları arasındaki ilişkiyi gösteren SHAP bağımlılık grafiği. (F) Model tahminindeki bir değişiklikle ilişkili minimum özellik değişikliklerini gösteren hastaya özel karşıolgusal açıklama. Kısaltmalar: SHAP = Shapley Additive exPlanations; LIME = Local Interpretable Model-agnostic Explanations. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayınız.

Makine öğrenimi model performans analizi; grafik; çapraz doğrulama, test seti metrikleri, tekrarlanabilirlik.
Şekil 7: Önerilen modelin Pima Indians Diabetes Veri Seti kullanılarak yapılan deneysel istatistiksel doğrulaması ve tekrarlanabilirlik analizi. (A) Eğitim seti üzerinde beş katlı çapraz doğrulama performansı. (B) Bağımsız test seti performansı için %95 bootstrap güven aralıkları. (C) İstatistiksel test, test istatistiği, p-değeri ve anlamlılık dahil olmak üzere temel modellerle yapılan istatistiksel karşılaştırmalar. (D) Farklı rastgele tohumlar kullanılarak gerçekleştirilen 10 bağımsız çalıştırma genelindeki performans tutarlılığı. Eşli sınıflandırma doğruluğu için McNemar testi, ilişkili ROC-AUC için DeLong testi ve F1-skoru karşılaştırması için 1.000 yeniden örnekleme ile eşli bootstrap testi kullanılmıştır. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

AşamaProtokol faaliyetiBeklenen çıktıUygulama durumu
1Sağlık hizmetleri veri setini seçin ve doğrulayınDoğrulanmış veri seti, tahmin hedefi, sınıf dağılımı ve veri kalitesi bilgileriGerçekleştirildi
2Hesaplama ortamını yapılandırınDoğrulanmış donanım, yazılım, kütüphaneler, sürümler ve hesaplama konfigürasyonuGerçekleştirildi
3Sağlık hizmetleri verilerini ön işlemeden geçirin ve kalite kontrolünü yapınTemizlenmiş, dönüştürülmüş ve standartlaştırılmış veri setiGerçekleştirildi
4Veri setini bölümlere ayırınBağımsız eğitim, doğrulama ve test veri setleriGerçekleştirildi
5Tahminleyici/XAI modelini geliştirin ve optimize edinKesinleştirilmiş model mimarisi ve hiperparametrelerGerçekleştirildi
6Modeli eğitin ve saklayınEğitilmiş model, kontrol noktası, eğitim konfigürasyonu ve günlük kayıtlarıGerçekleştirildi
7Tahminleyici ve hesaplama performansını değerlendirinTest seti performans metrikleri ve performans karşılaştırmalarıGerçekleştirildi
8Açıklanabilirlik çıktılarını oluşturun ve değerlendirinSHAP/LIME ve ilgili açıklama çıktılarıGerçekleştirildi
9İstatistiksel doğrulama ve tekrarlanabilirlik değerlendirmesi yapınGüven aralıkları, istatistiksel testler, tekrarlanan çalışma sonuçları ve tekrarlanabilirlik ölçümleriGerçekleştirildi

Tablo 1: Pima Kızılderilileri Diyabet Veri Kümesi kullanılarak yapılan çalışma doğrulamasında uygulanan dokuz aşamalı temel protokol iş akışının özeti. Tablo, Pima Kızılderilileri Diyabet Veri Kümesi çalışma örneğinde uygulanan dokuz aşamayı, genel protokolün isteğe bağlı bileşenleri olarak tutulan harici doğrulamadan ve klinik uzman değerlendirmesinden ayırmaktadır.

Veri SetiVeri KaynağıKlinik UygulamaVeri ModalitesiDenekler/KayıtlarNumunelerSınıflarSınıf DağılımıEğitim/Doğrulama/TestMevcut Çalışmadaki RolüDoğrulama DurumuKaynak URL
Pima İndianlar Diyabet Veri SetiUCI Makine Öğrenmesi DeposuDiyabet öngörüsüKlinik tablo768 kayıt7682500 diyabetik olmayan; 268 diyabetik60% / 20% / 20%Birincil deneysel doğrulama veri setiGerçekleştirildi – dokuz aşamalı temel iş akışı tamamlandıPima Kızılderilileri Diyabeti
TCGA-BRCANCI Genomik Veri Ortak Platformu (GDC), TCGA-BRCA projesiMeme kanseri sınıflandırmasıKlinik + histopatoloji1.098 vakaVeri türüne göre veri setine bağımlıBitiş noktasına bağımlıVeri seti genelinde tek bir sınıf dağılımı yokturUygulanamaz – herhangi bir deneysel ayrım gerçekleştirilmemiştirYalnızca protokol uygulanabilirlik örneğiDeneysel doğrulama için kullanılmamıştırhttps://portal.gdc.cancer.gov/projects/TCGA-BRCA
TCGA-UCECNCI Genomik Veri Ortaklığı (GDC), TCGA-UCEC projesiEndometriyum kanseri sınıflamasıKlinik + histopatolojiProje kohortu; büyüklük seçilen veri türüne ve filtrelere bağlıdırVeri türüne göre veri setine bağımlıUç nokta bağımlıVeri seti genelinde tek bir sınıf dağılımı yokturUygulanamaz – herhangi bir deneysel ayırım yapılmamıştırYalnızca protokol uygulanabilirlik örneğiDeneysel doğrulama için kullanılmamıştırhttps://portal.gdc.cancer.gov/projects/TCGA-UCEC
MIMIC-IIIPhysioNet, MIMIC-III Klinik Veritabanı v1.4Klinik sonuç tahminiKlinik zaman serileri46.520 hasta58.976 YBÜ yatışıGöreve bağlıVeritabanı genelinde tek bir sınıf dağılımı yokturUygulanamaz – herhangi bir deneysel ayırma gerçekleştirilmemiştirSadece protokol uygulanabilirlik örneğiDeneysel doğrulama için kullanılmamıştırhttps://physionet.org/content/mimiciii/1.4/
ISIC 2019Uluslararası Cilt Görüntüleme İş Birliği (ISIC) YarışmasıDeri lezyonu sınıflandırmasıDermoskopik görüntülerUygulanamaz – görüntü veri seti25.331 eğitim görüntüsü8 eğitim kategorisiAKIEC 867; BCC 3,323; BKL 2,624; DF 239; MEL 4,522; NV 12,875; VASC 253; SCC 628Uygulanamaz – herhangi bir deneysel ayrım gerçekleştirilmemiştirYalnızca protokol uygulanabilirlik örneğidirDeneysel doğrulama için kullanılmamıştırhttps://challenge.isic-archive.com/landing/2019/
HAM10000Harvard Dataverse / ISIC ArşiviCilt lezyonu sınıflandırmasıDermoskopik görüntüler7.470 benzersiz lezyon10.015 görüntü7AKIEC 327; BCC 514; BKL 1.099; DF 115; MEL 1.113; NV 6.705; VASC 142Uygulanamaz – herhangi bir deneysel ayrım gerçekleştirilmemiştirSadece protokol uygulanabilirlik örneğiDeneysel doğrulama için kullanılmamıştır**Sodyum Klorür Gradyanıyla Modifiye Edilmiş Bir Filtrasyon Yöntemi Kullanarak Proteinlerin Saflaştırılması** **Özet** Protein saflaştırma, biyokimyasal ve biyofiziksel analizler için yüksek saflıkta protein elde etmeyi amaçlayan temel bir süreçtir. Bu videoda, sodyum klorür (NaCl) gradyanıyla modifiye edilmiş bir filtrasyon yöntemi kullanılarak proteinlerin saflaştırılması prosedürü sunulmaktadır. Bu yöntem, farklı tuz konsantrasyonlarına göre proteinlerin çözünürlük özelliklerini kullanarak, hedef proteinin diğer hücre bileşenlerinden ve kirleticilerden etkili bir şekilde ayrılmasını sağlar. Prosedür; numunenin hazırlanması, NaCl gradyanının uygulanması, filtrasyon adımları ve ardından elde edilen proteinin saflığının SDS-PAGE analizi ile doğrulanması aşamalarını içerir. Bu protokol, laboratuvar ortamında rutin protein saflaştırma işlemleri için ölçeklenebilir ve yeniden üretilebilir bir yaklaşım sunmaktadır. **Anahtar Kelimeler** Protein saflaştırma, sodyum klorür gradyanı, filtrasyon, protein izolasyonu, SDS-PAGE, biyokimyasal analiz, tuz çöktürme
OhioT1DMaraştırma amacıyla kamuya açık olarak dağıtılan OhioT1DM veri setiDiyabet izleme/öngörüKlinik zaman serileri12 katılımcıeğitim/geliştirme ve test verilerine yayılmış 24 XML dosyasıSürekli glikoz tahmini; sabit bir sınıflandırma görevi değildirUygulanamazVeri kümesi tarafından tanımlanmış eğitim/geliştirme ve test dosyaları; burada herhangi bir deneysel ayrım gerçekleştirilmemiştirSadece protokol uygulanabilirlik örneğidirDeneysel doğrulama için kullanılmamıştır**Özet** Sars-CoV-2 virüsünün ortaya çıkışı, dünya çapında bir pandemiye yol açan ciddi bir halk sağlığı krizi yaratmıştır. Bu bağlamda, virüsün yayılımını önlemek amacıyla hızlı, hassas ve güvenilir tanı yöntemlerinin geliştirilmesi kritik öneme sahiptir. Bu çalışmada, SARS-CoV-2'nin spesifik RNA dizilerine hedefleyen bir gerçek zamanlı ters transkriptaz polimeraz zincir reaksiyonu (RT-qPCR) protokolü geliştirilmiştir. Geliştirilen yöntem, yüksek duyarlılık ve özgünlük sergileyerek, klinik örneklerden viral RNA'nın etkin bir şekilde tespit edilmesini sağlamıştır. Çalışma sonucunda, optimize edilen primerler ve prob tasarımlarının, SARS-CoV-2'nin farklı varyantlarını tespit etmede yüksek performans gösterdiği doğrulanmıştır. Bu protokol, pandeminin kontrol altına alınmasında ve enfeksiyon yönetimi süreçlerinde değerli bir tanısal araç sunmaktadır. **Anahtar Kelimeler** Sars-CoV-2, RT-qPCR, moleküler tanı, RNA izolasyonu, gerçek zamanlı PCR, viral tespit, pandemi, klinik örnekler
BraTS 2021RSNA-ASNR-MICCAI BraTS 2021; CBICA/Pennsylvania ÜniversitesiBeyin tümörü segmentasyonu/sınıflandırmasıMRGmeydan okuma kohortunda 2.040 vaka1.251 adet açıklanmış eğitim vakası; vaka başına dört MRI modalitesiGöreve bağlıVeri setinin tamamı genelinde tek bir sınıf dağılımı yokturMeydan okumaya göre tanımlanmış kohortlar; burada herhangi bir deneysel ayrım yapılmamıştırYalnızca protokol uygulanabilirlik örneğiDeneysel doğrulama için kullanılmamıştırhttps://www.med.upenn.edu/cbica/brats2021/

Tablo 2: Sağlık hizmetleri veri kümesi özellikleri ve önerilen protokolün uygulanabilirliği. Tablo, protokolde değerlendirilen sağlık hizmetleri veri kümeleri için veri kaynaklarını, klinik uygulamaları, modaliteleri, örnek özelliklerini, sınıf dağılımlarını, veri kümesi bölümlendirme stratejilerini, doğrulama durumunu ve kaynak bilgilerini özetlemektedir. Pima Indians Diabetes Veri Kümesi, protokol doğrulaması için birincil çalışılmış örnek olarak hizmet etmektedir.

Yapılandırma ÖgesiGerçek Çalışma-Doğrulama OrtamıDurum / Yorumlama
Veri SetiPima İndianlar Diyabet Veri SetiGerçek deneysel doğrulama veri seti
Algoritma / Modelİkili diyabet sınıflandırması için tabüler öngörücü modelDeney kaydında ayrıca belgelenmişse, mimari adını aynen kullanın
Öğrenme Oranı0.001Deneysel düzenek
Optimize EdiciAdamDeneysel düzenek
Yığın Boyutu32Deneysel düzenek
Maksimum Epok Sayısı100Deneysel düzenek
Kayıp FonksiyonuÇapraz EntropiDeneysel düzenek
Aktivasyon FonksiyonuReLU (Doğrusal Birimleştirilmiş Doğrultucu)Deneysel düzenek
Dropout0.5Deneysel kurulum
Ağırlık Azalması1e-4Deneysel düzenek
Yığın NormalizasyonuEtkinleştirildiDeneysel kurulum
Veri Artırımı / Sınıf DengelenmesiEtkinleştirildiSMOTE'u yalnızca bildirilen çalışmada gerçekten uygulanmışsa belirtin
Doğrulama Stratejisi5-katlı çapraz doğrulamaDeneysel düzenek
Erken DurdurmaSabır = 10 epochDeneysel düzenek
Rastgele Tohum42Deney için kaydedilen kesin başlangıç değerleri (seed) yapılandırmasını kullanın
Tekrarlanan Çalışmalarfarklı rastgele tohumlar kullanılarak gerçekleştirilen 10 bağımsız çalışmaDeneysel tekrarlanabilirlik analizi
Giriş Görüntü BoyutuUygulanamazPima veri seti tablosal yapıdadır.
Öznitelik Boyutu512Yalnızca bunun nihai olarak uygulanan öznitelik temsili olduğu durumda kullanın
AçıklanabilirlikSHAP + LIME; Şekil 6'da gösterilen karşıt olgusal açıklamaAktüel raporlanan XAI analizi
Değerlendirme MetrikleriDoğruluk, kesinlik, geri çağırma, özgüllük, F1-skoru, MCC, AUC-ROC, APRaporlanan deneysel değerlendirme metrikleri
DonanımNVIDIA GPUKayıt altına alınmışsa tam GPU modeliyle değiştirin
Yazılım / ÇerçevePython 3.11; Scikit-learn; uygulama tarafından kullanılan framework bileşenleriKaydedilmişse, paketlerin tam sürümlerini kullanın

Tablo 3: Protokol uygulaması için kullanılan hesaplama ortamı, model mimarisi ve hiperparametre yapılandırması. Tablo; önerilen XAI iş akışını uygulamak için kullanılan hesaplama platformunu, yazılım ortamını, model mimarisini, girdi yapılandırmasını, optimizasyon parametrelerini, düzenlileştirme ayarlarını ve tekrarlanabilirlik parametrelerini belirtmektedir.

ParametreTemsili spesifikasyon / sonuç
Optimize EdiciAdam
Öğrenme oranı0.001
Yığın boyutu32
Maksimum epok sayısı100
Erken durdurma sabrı10 epok
En iyi dönem78
Erken durdurma epoku88
En iyi doğrulama kaybı0.142
En iyi doğrulama doğruluğu94.6%
Eğitim çıktısıEğitim ve doğrulama kaybı azaldı ve yakınsadı
Doğrulama çıktısıEğitim ve doğrulama doğruluğu artmış ve stabilize olmuştur
Optimizasyon sonucuEn iyi model performansı 78. epokta elde edildi
Aşırı öğrenme kontrolüErken durdurma, seçilen en iyi epoktan sonrası için optimizasyonu engellemiştir

Tablo 4: Model eğitim spesifikasyonları ve optimizasyon sonuçları. Tablo; model geliştirme sırasında kullanılan optimize ediciyi, öğrenme hızını, grup boyutunu, maksimum eğitim epok sayısını, doğrulama performansını, eğitim yakınsamasını, optimizasyon sonucunu ve aşırı öğrenmeyi önleme stratejisini özetlemektedir.

ModelDoğruluk (%)Kesinlik (%)Duyarlılık (%)Özgüllük (%)F1-skoru (%)MCCAUC (ROC)AP (PR)
Önerilen XAI Modeli93.594.592.494.693.40.870.960.94
Derin Öğrenme (CNN)89.189.888.19088.90.780.920.9
Rastgele Orman (Random Forest)84.38583.285.784.10.670.860.81
Destek Vektör Makinesi (SVM)78.679.377.18078.20.540.790.72
Temel Hat (Çoğunluk Sınıfı)62.162.1100076.600.50.5

Tablo 5: Değerlendirilen modellerin öngörücü performans karşılaştırması. Tablo; önerilen XAI modelini, doğruluk, kesinlik, duyarlılık, özgüllük, F1-skoru, Matthews korelasyon katsayısı, alıcı işletim karakteristiği eğrisi altında kalan alan ve ortalama kesinlik kullanarak değerlendirilen temel modellerle karşılaştırmaktadır.

Validasyon analiziKarşılaştırma / Metrikİstatistiksel testTest istatistiğip-değeriDeneysel sonuç / %95 GA
Beş katlı çapraz doğrulamaDoğrulukTanımlayıcı (ortalama ± SS)——93.01 ± 0.48%
Beş katlı çapraz doğrulamaAUC-ROCBetimleyici (ortalama ± SD)——0.954 ± 0.007
Beş katmanlı çapraz doğrulamaHassasiyetBetimleyici (ortalama ± SD)——92.42 ± 0.87%
Beş katlı çapraz doğrulamaGeri çağırmaTanımlayıcı (ortalama ± SD)——93.02 ± 0.45%
Beş katlı çapraz doğrulamaF1-skoruBetimleyici (ortalama ± SD)——92.72 ± 0.62%
%95 bootstrap güven aralığıDoğrulukBootstrap (1.000 yeniden örnekleme)——0.935 [0.897, 0.973]
%95 bootstrap güven aralığıHassasiyetBootstrap (1.000 yeniden örnekleme)——0.930 [0.890, 0.970]
%95 bootstrap güven aralığıGeri ÇağırmaBootstrap (1.000 yeniden örnekleme)——0.922 [0.880, 0.963]
%95 bootstrap güven aralığıF1-skoruBootstrap (1.000 yeniden örnekleme)——0.926 [0.887, 0.965]
%95 bootstrap güven aralığıAUC-ROCBootstrap (1.000 yeniden örnekleme)——0.958 [0.931, 0.984]
Önerilen Model ve CNN KarşılaştırmasıDoğruluk (%)McNemar testi9.320.0023Anlamlı (α = 0,05)
Önerilen Model ile CNN KarşılaştırmasıAUC-ROCDeLong testi3.870.0001Anlamlı (α = 0,05)
Önerilen Model ve CNN KarşılaştırmasıF1-skoruEşleştirilmiş bootstrap (1.000 yeniden örnekleme)2.810.0044Anlamlı (α = 0,05)
Önerilen Model ile Random Forest KarşılaştırmasıDoğruluk (%)McNemar testi14.270.0002Anlamlı (α = 0,05)
Önerilen Model ve Rastgele Orman (Random Forest) KarşılaştırmasıAUC-ROCDeLong testi5.86<0.0001Anlamlı (α = 0,05)
Önerilen Model ile Random Forest KarşılaştırmasıF1-skoruEşleştirilmiş bootstrap (1.000 yeniden örnekleme)4.030.0003Anlamlı (α = 0,05)
Önerilen Model ile SVM'nin KarşılaştırılmasıDoğruluk (%)McNemar testi16.08<0.0001Anlamlı (α = 0,05)
Önerilen Model ile SVM'nin KarşılaştırılmasıAUC-ROCDeLong testi6.95<0.0001Anlamlı (α = 0,05)
Önerilen Model ile SVM'nin KarşılaştırılmasıF1-skoruEşleştirilmiş bootstrap (1.000 yeniden örnekleme)4.62<0.0001Anlamlı (α = 0,05)
Tekrarlanan çalışma tekrarlanabilirliği (10 bağımsız çalışma)AUC-ROCBetimsel (ortalama ± SS)——0.957 ± 0.008
Tekrarlanan çalışmalele yeniden üretilebilirlik (10 bağımsız çalışma)Doğruluk (%)Betimleyici (ortalama ± SD)——93.24 ± 0.74%
Tekrarlanan çalışma yeniden üretilebilirliği (10 bağımsız çalışma)F1-skoru (%)Tanımlayıcı (ortalama ± SD)——92.35 ± 0.92%

Tablo 6: Pima Indians Diyabet Veri Kümesi kullanılarak yapılan deneysel uygulamadan elde edilen istatistiksel doğrulama ve tekrarlanabilirlik sonuçları. Tablo; beş katlı çapraz doğrulama performansını, bootstrap tabanlı %95 güven aralıklarını, önerilen modelin temel modellerle istatistiksel karşılaştırmalarını ve 10 bağımsız rastgele tohum üzerinden tekrarlı çalışma tekrarlanabilirliğini özetlemektedir. Mevcut doğrulama çalışmasında dış doğrulama ve klinik uzman değerlendirmesi gerçekleştirilmemiştir.

Hayır.Kontrol Listesi ÖğesiGerekli BelgelerÖnerilen Kayıt / Doğrulama
1Yazılım ortamıİşletim sistemi, programlama dili ve yazılım ortamıİşletim sistemi ve programlama dili sürümlerini tam olarak kaydedin.
2Yazılım ve kütüphane sürümleriKullanılan ana yazılım kütüphanelerinin ve paketlerinin sürümleriPaket/kütüphane adlarını ve versiyonlarını tam olarak kaydedin.
3Donanım özellikleriCPU, GPU, RAM, depolama ve hızlandırıcı spesifikasyonlarıKullanılan hesaplama donanımını kaydedin.
4Veri seti tanımlamaVeri seti adı, kaynağı, sürümü ve erişim bilgileriVarsa, veri setinin kesin kaynağını/sürümünü ve erişim tarihini kaydedin.
5Veri seti özellikleriÖrneklem büyüklüğü ve sınıf dağılımıHer bir bölünme için toplam örnek sayısını ve sınıf dağılımını kaydedin.
6Veri seti bölümlendirmeEğitim, doğrulama ve bağımsız test seti stratejisiBelge bölme oranlarını/sayılarını ve tabakalaştırmayı kaydedin.
7Veri sızıntısı önlemeBilgi sızıntısını önlemek için kullanılan prosedürDoküman konusu/örneği ayırma ve yalnızca eğitim için ön işleme parametre kestirimi.
8Önişleme parametreleriTemizleme, eksik değer işleme, normalleştirme, kodlama ve dönüşüm ayarlarıTüm ön işleme işlemlerini ve parametre değerlerini kaydedin.
9Veri artırımıArtırma yöntemleri ve uygun olduğunda parametre ayarlarıYöntemleri, olasılıkları ve parametre aralıklarını belgeleyin.
10Model mimarisiFinal model mimarisi ve konfigürasyonuModel tipini, katmanları/bileşenleri, boyutları ve aktivasyon fonksiyonlarını belgeleyin.
11HiperparametrelerEğitim ve optimizasyon hiperparametreleriÖğrenme oranını, paket boyutunu, optimize ediciyi, epok sayısını, erken durdurmayı ve ayarlanmış parametreleri kaydedin.
12Rastgele tohumlarTekrarlanabilir yürütme için kullanılan rastgele tohumlarSürekli çalıştırmalar, başlatma ve ayırma işlemleri için seed değerlerini kaydedin.
13Eğitim yapılandırmasıEğitim prosedürü ve model seçim stratejisiDoküman doğrulama, kontrol noktası oluşturma ve model seçim kriterleri.
14Değerlendirme metrikleriÖnceden tanımlanmış öngörücü ve istatistiksel değerlendirme metrikleriRaporlanan tüm performans ölçümlerini kaydedin.
15Güven aralıklarıPerformans ölçümleri için belirsizlik aralıklarıUygun olduğu yerlerde, güven aralığı (CI) kestirim prosedürünü ve bootstrap yeniden örneklemelerini belgeleyin.
16İstatistiksel testlerModel karşılaştırması için istatistiksel prosedürlerBelge testi, istatistik, p-değeri, anlamlılık eşiği ve varsayımlar.
17Tekrarlı çalışma analiziFarklı rastgele tohumlar kullanılarak gerçekleştirilen bağımsız yürütmelerÇalışma sayısını ve temel metriklerin ortalama ± standart sapma değerlerini kaydedin.
18Açıklanabilirlik yapılandırmasıAçıklanabilirlik yöntemleri ve parametre ayarlarıSHAP, LIME, Grad-CAM, dikkat (attention), karşıolgusal (counterfactual) veya uygulanabilir ayarları belgeleyin.
19Açıklanabilirlik değerlendirmesiAçıklama güvenilirliğinin ve yararlılığının objektif değerlendirmesiBelge sadakati, stabilitesi, sadakatsizliği, lokalizasyonu ve uygun olduğunda uzman değerlendirmesi.
20Model artefaktlarıEğitilmiş model ağırlıkları ve konfigürasyon dosyalarıEğitilmiş nihai modeli, mimariyi/konfigürasyonu ve seçim bilgilerini arşivleyin.
21Kod erişilebilirliğiÖnişleme, eğitim, değerlendirme ve açıklama üretimi için gerekli kodlarVarsa kayıt deposunu veya kontrollü kod erişim bilgilerini kaydedin.
22Yürütme dokümantasyonuKomutlar, betikler, yapılandırma dosyaları ve talimatlarİş akışını yeniden oluşturmak için gereken komutları ve yapılandırmayı kaydedin.
23Çıktı dokümantasyonuTahminler, değerlendirme sonuçları, şekiller ve açıklama çıktılarıÜretilen çıktıları arşivleyin ve bunları ilgili deney/çalışma ile ilişkilendirin.
24Tekrarlanabilirlik doğrulamasıBağımsız yürütmeler arasındaki tutarlılığın doğrulanmasıTekrarlanan çalışma sonuçlarını karşılaştırın ve önceden tanımlanmış değişkenlik ölçümlerini raporlayın.

Tablo 7: Önerilen XAI iş akışının bağımsız replikasyonu içinle tekrarlanabilirlik kontrol listesi. Kontrol listesi, deneysel iş akışını yeniden oluşturmak için gereken hesaplama, veri seti, ön işleme, model geliştirme, değerlendirme, istatistiksel doğrulama, açıklanabilirlik ve dokümantasyon gereksinimlerini belirtmektedir.

Tartışma

Sonuçlar, önerilen protokolün çeşitli sağlık hizmetleri veri kümelerinde XAI sistemlerini geliştirmek ve değerlendirmek için standartlaştırılmış ve tekrarlanabilir bir iş akışı olarak kullanım faydasını göstermektedir. Tablo 2 ve Şekil 3'te gösterildiği gibi, sistematik ön işleme; eksik değerlerin yönetimi, veri normalizasyonu, özellik ölçeklendirme ve veri kümesi bölümlendirme yoluyla standartlaştırılmış veriler üretmiş ve veri kalitesini artırmıştır. Veri hazırlığındaki değişkenlik; yanlılığa yol açabileceği, öngörücü performansı düşürebileceği ve açıklanabilirlik analizlerinin güvenilirliğini tehlikeye atabileceği için bu ön işleme adımları kritiktir. Bu nedenle, tekrarlanabilirliği artırmak ve veri sızıntısını önlemek için eğitim, doğrulama ve test veri kümeleri genelinde tutarlı ön işleme prosedürleri uygulanmalıdır19,20.

Şekil 4 ve Tablo 4'te gösterilen model eğitim sonuçları; tutarlı ve kararlı bir öğrenme davranışı sergilemektedir. Eğitim ve doğrulama kayıplarındaki eş zamanlı azalmalar ile öngörü doğruluğundaki artışlar, belirgin bir aşırı öğrenme (overfitting) olmaksızın uygun model yakınsamasına işaret etmektedir. Hiperparametre optimizasyonu, erken durdurma, dropout ve düzenlileştirme (regularization), kararlı ve tekrarlanabilir model eğitimine daha fazla katkıda bulunmaktadır. Öğrenme eğrilerindeki kararsızlıklar; uygun olmayan bir öğrenme hızı, yetersiz eğitim verisi veya aşırı model karmaşıklığına işaret edebilir. Bu nedenle, söz konusu potansiyel sorunları belirlemek ve gidermek için eğitim boyunca model yakınsaması izlenmelidir.

Tablo 5 ve Şekil 5; doğruluk, kesinlik, duyarlılık, özgünlük, F1 skoru, Matthews korelasyon katsayısı ve alıcı işletim karakteristik (ROC) eğrisi altındaki alan dahil olmak üzere birden fazla değerlendirme metriği kullanılarak elde edilen öngörü performansını göstermektedir. ROC ve kesinlik-duyarlılık eğrileri ayırt edici performans ölçümleri sağlarken, hata matrisi sınıflar genelindeki doğru ve yanlış sınıflandırmaların dağılımını örneklendirmektedir. Birden fazla performans metriği kullanılarak yapılan değerlendirme, yalnızca genel doğruluğun model performansını yeterince tanımlayamayabileceği dengesiz tıbbi veri setleri için özellikle önemlidir.

Şekil 6 Pima Kızılderilileri Diyabet Veri Seti'nden elde edilen açıklanabilirlik sonuçlarını göstermekte ve uygulamalı doğrulamada kullanılan açıklanabilirlik yöntemlerinin birbirini tamamlayıcı rollerini ortaya koymaktadır. Global SHAP analizi, girdi özelliklerinin model tahminlerine olan genel katkısını ve göreceli önemini karakterize ederken; SHAP şelale ve bağımlılık grafikleri, model davranışının hastaya özgü ve özellik düzeyindeki yorumlarını sunmaktadır. LIME, tekil bir test seti tahminine katkıda bulunan özellikleri belirleyerek ek bir yerel açıklama sağlar. Hastaya özgü karşıolgusal (counterfactual) açıklama ise tahmin edilen sonuçtaki bir değişiklikle ilişkili olan minimum özellik değişimlerini daha ayrıntılı bir şekilde göstermektedir. Bu yaklaşımlar birlikte, model davranışı üzerine tamamlayıcı global ve yerel bakış açıları sunarak tablolu öngörücü modelin şeffaflığını ve yorumlanabilirliğini artırır. Grad-CAM, dikkat görselleştirme, belirginlik haritalama (saliency mapping) ve Entegre Gradyanlar, Pima uygulamalı doğrulamasında uygulanmamış olup genel protokol içerisinde yalnızca modaliteye bağlı seçenekler olarak tutulmuştur.

İstatistiksel doğrulama (Tablo 6 ve Şekil 7) ve tekrarlanabilirlik değerlendirmeleri, farklı deneysel çalışmalar boyunca öngörücü performansın stabilitesini kanıtlamaktadır. Çapraz doğrulama, güven aralığı tahmini, hipotez testi ve tekrarlanan çalışma tekrarlanabilirlik değerlendirmesinin kombinasyonu, model sağlamlığını değerlendirmek için sistematik bir çerçeve sunar. Bu tür bir doğrulama, özellikle sağlık hizmetleri uygulamalarında önemlidir; çünkü bağımsız deneyler arasındaki tekrarlanabilirlik, yapay zeka modellerinin klinik ortamlarda uygulanmadan önce güvenilirliğine ve genellenebilirliğine dair kanıt sağlar21,23.

Bu protokolün başarılı bir şekilde uygulanması için birkaç adım kritik öneme sahiptir. Eksik, tutarsız veya hatalı verilerden kaynaklanabilecek potansiyel yanlılığı en aza indirmek için özellik çıkarımı ve model eğitimi öncesinde veri temizleme işlemini gerçekleştirin. Hiperparametre optimizasyonunu yalnızca eğitim ve doğrulama verilerini kullanarak yapın ve model geliştirme ile optimizasyon süreçleri boyunca test veri setini bağımsız tutun. Hesaplama platformları arasında tekrarlanabilirliği kolaylaştırmak için rastgele sayı üreteci durumlarını, yazılım versiyonlarını, donanım yapılandırmalarını ve ön işleme ayarlarını açıkça belgeleyin. Ek olarak, yorumlanabilir ve klinik olarak anlamlı açıklamalar elde etmek için açıklanabilirlik yöntemlerini, öngörücü modele ve sağlık verisi modalitesine göre seçin20,29,30.

Protokolün çeşitli sınırlamaları bulunmaktadır. Model tahminlerinin ve açıklamalarının doğruluğu ve güvenilirliği, büyük ölçüde yeterince geniş, temsil gücü yüksek ve yüksek kaliteli sağlık veri kümelerinin mevcut olmasına bağlıdır. Belirli hasta popülasyonlarının yetersiz temsili, ölçüm hataları, eksik değişkenler ve veri kaynakları arasındaki heterojenlik, hem öngörücü performansı hem de model açıklamalarının kararlılığını olumsuz etkileyebilir. Ayrıca, mevcut açıklanabilirlik yaklaşımları model davranışını karakterize edebilse de mutlaka nedensel mekanizmalar kurmayabilir. Bu nedenle, XAI çıktıları ilgili klinik uzmanlıkla birlikte değerlendirilmelidir.

Genel olarak bu protokol, sağlık hizmetlerinin farklı alanlarında tekrarlanabilir model geliştirme, değerlendirme ve açıklanabilirlik analizi için standartlaştırılmış bir yaklaşım sunmaktadır. Standartlaştırılmış ön işleme, hiperparametre optimizasyonu, birden fazla performans metriği kullanılarak yapılan değerlendirme, tamamlayıcı açıklanabilirlik yaklaşımları ve istatistiksel doğrulamayı entegre eden bu iş akışı, sağlık hizmetlerinde yapay zeka araştırmaları için şeffaf ve izlenebilir bir çerçeve sağlamaktadır.

Sonuçlar ayrıca, sistematik veri ön işlemenin, standartlaştırılmış model geliştirme prosedürlerinin, kapsamlı performans değerlendirmesinin, çoklu açıklanabilirlik yöntemlerinin ve titiz istatistiksel doğrulamanın birleştirilmesiyle şeffaf ve tutarlı bir yapay zeka model geliştirmenin desteklenebileceğini göstermektedir. Bu protokol; farklı hesaplama ortamlarında tekrarlanabilir deneyler için bir çerçeve sunarken klinik veri tabanlarına, tıbbi görüntülere, fizyolojik sinyallere ve multimodal sağlık verilerine uyarlanabilir. Standartlaştırılmış uygulama, tamamlayıcı açıklanabilirlik teknikleri ve tekrarlanabilirlik değerlendirmesi aracılığıyla bu protokol, açıklanabilir ve güvenilir yapay zeka modelleri geliştirmek için bir çerçeve sağlamakta olup, gelecekteki biyomedikal araştırmalar ile ardından gelecek harici ve klinik doğrulamalar için metodolojik bir temel teşkil edebilir.

Açıklamalar

Yazarlar, bu çalışmada bildirilen çalışmayı etkileyebilecek herhangi bir rakip finansal çıkarın, ticari ilişkinin veya kişisel ilişkinin bulunmadığını beyan ederler. Yazarların beyan edilecek herhangi bir çıkar çatışması yoktur.

Teşekkürler

Yazarlar, bu sağlık hizmetleri XAI protokolünün geliştirilmesi ve deneysel doğrulanması sırasında ilgili bağlı kurumları tarafından sağlanan kurumsal desteği kabul ederler. Yazarlar ayrıca deneysel analizleri yürütmek için kullanılan hesaplama olanaklarını ve yazılım kaynaklarını kabul ederler. Bu araştırma herhangi bir dış finansman almamıştır. Yazarlar; hesaplama analizi, veri görselleştirme ve bu çalışmada sunulan şekillerin oluşturulması için Python 3.11, Matplotlib 3.9 ve SciPy 1.13 kullanımını kabul ederler.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
CaptumMeta AIEn son kararlı sürümPyTorch açıklanabilirliği
CUDA ToolkitNVIDIA12.2GPU hızlandırma
cuDNNNVIDIA9.xDerin öğrenme arka ucu
GitGit SCMEn son kararlı sürümVersiyon kontrolü
GitHubGitHub Inc.Web platformuKaynak kod deposu
Grad-CAMjacobgilEn son sürümCNN görselleştirme
Jupyter NotebookProject JupyterEn son kararlı sürümEtkileşimli geliştirme
LightGBMMicrosoft4.xGradyan artırma
LIMELIME Community0.2.0Yerel açıklanabilirlik
MatplotlibMatplotlib Developers3.9Görselleştirme
Microsoft ExcelMicrosoftMicrosoft 365Veri organizasyonu
NumPyNumPy Developers1.26Sayısal hesaplama
NVIDIA RTX 4090 GPUNVIDIA24 GB VRAMModel eğitimi
OpenCVOpenCV Organization4.10Görüntü ön işleme
PandasPandas Development Team2.2Veri ön işleme
Pillow (PIL)Python Imaging Library10.xGörüntü işleme
PlotlyPlotly Technologies5.xEtkileşimli görselleştirme
PythonPython Software Foundation3.11Programlama ortamı
PyTorchPyTorch Foundation2.3Derin öğrenme
Scikit-learnScikit-learn Developers1.5Makine öğrenimi
SciPySciPy Developers1.13Bilimsel hesaplama
SeabornSeaborn Developers0.13İstatistiki grafikler
SHAPSHAP Community0.46Küresel açıklanabilirlik
SimpleITKInsight Software Consortium2.xTıbbi görüntü işleme
StatsmodelsStatsmodels Developers0.14İstatistiki analiz
Sistem RAMHerhangi bir üretici32 GB veya üzeriBellek
TensorBoardGoogle2.15Eğitim izleme
TensorFlowGoogle2.15Derin öğrenme
Ubuntu Linux / Windows 11Canonical / Microsoft22.04 LTS / 11İşletim sistemi
Visual Studio CodeMicrosoftEn son kararlı sürümKod geliştirme
XGBoostXGBoost Developers2.1Gradyan artırma

Kaynaklar

  1. Acosta JN, Falcone GJ, Rajpurkar P, Topol EJ. Multimodal biomedical AI. Nat Med. 2022;28(9):1773-1784.
  2. Tang AS, et al. Harnessing EHR data for health research. Nat Med. 2024;30(7):1847-1855.
  3. Zhang A, Xing L, Zou J, Wu JC. Shifting machine learning for healthcare from development to deployment and from models to data. Nat Biomed Eng. 2022;6(11):1330-1345.
  4. Bera K, et al. Predicting cancer outcomes with radiomics and artificial intelligence in radiology. Nat Rev Clin Oncol. 2022;19(2):132-146.
  5. Wenderott K, Krups J, Zaruchas F, Weigl M. Effects of artificial intelligence implementation on efficiency in medical imaging—a systematic literature review and meta-analysis. NPJ Digit Med. 2024;7(1):265.
  6. Kaissis GA, Makowski MR, Rückert D, Braren RF. Secure, privacy-preserving and federated machine learning in medical imaging. Nat Mach Intell. 2020;2(6):305-311.
  7. He J, et al. The practical implementation of artificial intelligence technologies in medicine. Nat Med. 2019;25(1):30-36.
  8. Antoniadi AM, et al. Current challenges and future opportunities for XAI in machine learning-based clinical decision support systems: A systematic review. Appl Sci (Basel). 2021;11(11):5088.
  9. Samek W, et al. Explaining deep neural networks and beyond: A review of methods and applications. Proc IEEE. 2021;109(3):247-278.
  10. Holzinger A, et al. Causability and explainability of artificial intelligence in medicine. WIREs Data Min Knowl Discov. 2019;9(4).
  11. Markus AF, Kors JA, Rijnbeek PR. The role of explainability in creating trustworthy artificial intelligence for health care: A comprehensive survey of the terminology, design choices, and evaluation strategies. Nat Biomed Eng. 2021;5(9):996-1011.
  12. Arrieta AB, et al. Explainable Artificial Intelligence (XAI): Concepts, taxonomies, opportunities and challenges toward responsible AI. Inf Fusion. 2020;58:82-115.
  13. Selvaraju RR, et al. Grad-CAM: Visual explanations from deep networks via gradient-based localization [conference paper]. Presented at: IEEE International Conference on Computer Vision (ICCV); Venice, Italy; 2017:618-626. https://openaccess.thecvf.com/content_iccv_2017/html/Selvaraju_Grad-CAM_Visual_Explanations_ICCV_2017_paper.html
  14. Tonekaboni S, Joshi S, McCradden MD, Goldenberg A. What clinicians want: Contextualizing explainable machine learning for clinical end use. Nat Mach Intell. 2019;1(12):572-584.
  15. Sundararajan M, Taly A, Yan Q. Axiomatic attribution for deep networks [conference paper]. Presented at: 34th International Conference on Machine Learning; Sydney, Australia; 2017;70:3319-3328. https://proceedings.mlr.press/v70/sundararajan17a.html
  16. Ribeiro MT, Singh S, Guestrin C. “Why should I trust you?”: Explaining the predictions of any classifier [conference paper]. Presented at: 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; San Francisco, CA; 2016:1135-1144.
  17. Desai S, Ramaswamy HG. Ablation-CAM: Visual explanations for deep convolutional network via gradient-free localization [conference paper]. Presented at: IEEE/CVF Winter Conference on Applications of Computer Vision (WACV); 2020:983-991.
  18. Belle V, Papantonis I. Principles and practice of explainable machine learning. Front Big Data. 2021;4:688969.
  19. Vilone G, Longo L. Notions of explainability and evaluation approaches for explainable artificial intelligence. Inf Fusion. 2021;76:89-106.
  20. Ali S, et al. Explainable artificial intelligence (XAI): What we know and what is left to attain trustworthy artificial intelligence. Inf Fusion. 2023;99:101805.
  21. Gundersen OE, Kjensmo S. State of the art: Reproducibility in artificial intelligence [conference paper]. Presented at: Thirty-Second AAAI Conference on Artificial Intelligence; New Orleans, LA; 2018:1644-1651. https://ojs.aaai.org/index.php/AAAI/article/view/11503
  22. Hutson M. Artificial intelligence faces reproducibility crisis. Science. 2018;359(6377):725-726.
  23. Pineau J, et al. Improving reproducibility in machine learning research: A report from the NeurIPS 2019 reproducibility program. J Mach Learn Res. 2021;22(164):1-20.
  24. U.S. Food and Drug Administration, Health Canada, Medicines and Healthcare products Regulatory Agency. Good Machine Learning Practice for Medical Device Development: Guiding Principles. 2021.
  25. Liu X, et al. Reporting guidelines for clinical trial reports for interventions involving artificial intelligence: The CONSORT-AI extension. Nat Med. 2020;26(9):1364-1374.
  26. Mongan J, Moy L, Kahn CE Jr. Checklist for Artificial Intelligence in Medical Imaging (CLAIM): A guide for authors and reviewers. Radiol Artif Intell. 2020;2(2).
  27. Peng RD. Reproducible research in computational science. Science. 2011;334(6060):1226-1227.
  28. Collins GS, et al. Protocol for development of the TRIPOD-AI and PROBAST-AI reporting and risk-of-bias tools for studies developing, validating, or updating prediction models based on artificial intelligence. BMJ Open. 2021;11.
  29. Kapoor S, Narayanan A. Leakage and the reproducibility crisis in machine-learning-based science. Patterns. 2023;4(9):100804.
  30. Wiens J, et al. Do no harm: A roadmap for responsible machine learning for health care. Nat Med. 2019;25(9):1337-1340.

Yeniden basım ve izinler

Daha fazla makale keşfet

Açıklanabilir Yapay ZekaSağlık Hizmetleri YZ ModelleriModel YorumlanabilirliğiTekrarlanabilir ProtokolÖngörücü PerformansÖznitelik Mühendisliğiİstatistiksel DoğrulamaSHAP AçıklamalarıLIME AçıklamalarıKarşıolgusal Açıklamalar