Araştırma makalesi

Sağlık Analitiğinde Açıklanabilir Yapay Zeka Çerçeveleri Geliştirmek ve Değerlendirmek İçin Tekrarlanabilir Bir Protokol

DOI:

10.3791/71999

31 Temmuz 2026

Bu makalede

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Burada, sağlık analizleri için açıklanabilir yapay zeka modelleri geliştirmek ve değerlendirmek amacıyla tekrarlanabilir bir protokol sunuyoruz. İş akışı, veri ön işlemesi, öngörücü modelleme, SHAP-, LIME- ve Grad-CAM tabanlı açıklanabilirlik, nicel değerlendirme ve insan merkezli doğrulamayı entegre ederek şeffaf ve güvenilir klinik karar alma süreçlerini destekler.

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Açıklanabilir Yapay Zeka (XAI), şeffaflık ve kararları açıklama yeteneğinin klinik karar alma süreçlerinin temel bileşenleri olduğu sağlık hizmetlerinde güvenilir yapay zeka sistemleri inşa etmek için giderek daha fazla vazgeçilmez bir araç olarak kabul edilmektedir. Bu yayın, sağlık analizleri için açıklanabilir yapay zeka sistemlerinin geliştirilmesi ve değerlendirilmesine yönelik tekrarlanabilir deneysel bir yaklaşım sunmaktadır. Geliştirilen ürün hattı, veri ön işleme, öngörücü modelleme, yorumlama oluşturma ve değerlendirme adımlarını hem yapılandırılmış klinik verilere hem de tıbbi görüntüleme veri setlerine uygulanabilecek tek bir sorunsuz iş akışında entegre eder. Topluluk makine öğrenimi modelleri, yapılandırılmış tablo veri setlerinde güçlü öngörücü performans göstermişken, derin öğrenme modelleri tıbbi görüntüleme verilerindeki karmaşık desenleri öğrenmede etkilidir. SHAP, LIME ve Grad-CAM gibi teknikler, model yorumlamayı kolaylaştıran küresel ve yerel açıklamalardır. Çok yardımcı oldu. Çerçevenin nicel değerlendirmesi, doğruluk, hassasiyet, hatırlar, F1 puanı, ROC-AUC, açıklama metrikleri, sadakat ve istikrar gibi birçok farklı ölçütü kapsar. Sonuçlar, deneysel koşullar kontrol altına alındığında, çerçevenin değerlendirilen deneysel koşullar altında gelişmiş öngörücü performans ve açıklama kalitesi gösterdiğini göstermektedir. Protokol tarafından yönlendirilen bir belge olarak, bu çalışma tekrarlanabilirlik ve ölçeklenebilirliği, yani diğer canlılar tarafından sürekli uygulanmasını destekliyor. Bu şeffaf ve anlaşılır yapay zeka modeli, klinik karar alma desteği ve sağlık analitik sistemlerinin büyük ölçekte güven ve kullanım kazanmasının temelidir.

Giriş

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yapay zeka (YZE), hastalık teşhisi, prognozu, risk tabakası, tıbbi görüntü analizi ve klinik karar alma süreçlerini destekleyerek modern sağlık hizmetlerinin önemli bir bileşenihaline gelmiştir 1. Makine öğrenimi ve derin öğrenmedeki ilerlemeler, sağlık sistemlerinin büyük hacimlerde yapılandırılmış ve yapılandırılmamış verileri işlemesini sağlamış ve genellikle geleneksel istatistiksel yaklaşımlara benzer veya onları aşan öngörücü performanselde etmiştir 2. Bu gelişmelere rağmen, birçok yapay zeka modeli karmaşık kara kutu sistemleri olarak çalışır ve klinisyenlerin ve sağlık paydaşlarının tahminlerin nasıl üretildiğini anlamasınızorlaştırır 3. Bu şeffaflık eksikliği, yüksek riskli sağlık ortamlarında güven, benimseme ve hesap verebilirliğisınırlayabilir 4,5.

Açıklanabilir yapay zeka (XAI), makine öğrenimi modellerinin şeffaflığını ve yorumlanabilirliğini artırmak için umut vadeden bir yaklaşım olarak ortayaçıkmıştır 6. SHAP (Shapley ekleme açıklamaları), LIME (Yerel yorumlanabilir model-agnostik açıklamalar) ve gradyen ağırlıklı sınıf aktivasyon haritalama (Grad-CAM) gibi yaygın kullanılan açıklama teknikleri, özellik atfisyonu ve görsel açıklamamekanizmaları 7,8,9 aracılığıyla model davranışına dair içgörüler sağlar. Bu yöntemler, klinik yorumlama, model denetimi ve karar desteğini desteklemek için sağlık uygulamalarında giderek daha fazla uygulanmaktadır10,11. Ancak, açıklanabilirlik tek başına güvenilirlik, tekrarlanabilirlik veya klinik faydayı garanti etmez. Son çalışmalar, açıklama kararsızlığı, bozulmalara duyarlılık, sınırlı klinisyen doğrulaması ve açıklama çıktıları ile gerçek model akıl yürütmesi arasındakitutarsızlıklarla ilgili zorlukları ortaya koymuştur 12,13,14,15.

Açıklanabilirlik zorluklarının yanı sıra, tekrarlanabilirlik sağlık makine öğrenimi araştırmalarında önemli bir endişe olmaya devametmektedir 16,17,18. Yayınlanmış birçok çalışma, ön işleme prosedürleri, yazılım ortamları, hiperparametre yapılandırmaları, doğrulama stratejileri ve uygulama iş akışları hakkında sınırlı bilgi sunarak bağımsız çoğaltmayızorlaştırır 19,20,21. Ayrıca, sağlık AI çalışmaları sıklıkla öngörücü performansa odaklanırken, açıklama kalite değerlendirmesi, klinisyen merkezli değerlendirme ve pratik uygulama konularında sınırlı rehberlik sağlar22. Bu sınırlamalar, açıklanabilir yapay zeka sistemlerinin araştırma ortamlarından gerçek dünya sağlık ortamlarına geçişini engelleyebilir 23,24,25,26,27.

Mevcut sağlık XAI iş akışları genellikle bireysel açıklama tekniklerini veya öngörücü modelleri izole olarak değerlendirir ve nadiren veri hazırlama, öngörücü modelleme, açıklanabilirlik değerlendirmesi, insan merkezli değerlendirme ve tekrarlanabilirlik kaynaklarını entegre eden standart protokollersunar 28,29,30,31 . Sonuç olarak, araştırmacılar ve uygulayıcılar iş akışlarını yeniden ürederken, açıklama yöntemlerini karşılaştırırken veya farklı sağlık veri setleri ve uygulama alanlarında açıklanabilir yapay zeka sistemlerinin pratik faydasını değerlendirirken zorluklarla karşılaşabilirler. Bu nedenle, sağlık açıklanabilir yapay zeka iş akışlarının tutarlı uygulanması, değerlendirilmesi ve raporlanmasını kolaylaştırmak için kapsamlı ve tekrarlanabilir birprotokole ihtiyaç vardır 32,33,34,35.

Burada, sağlık analitiğinde açıklanabilir yapay zeka sistemlerinin geliştirilmesi, değerlendirilmesi ve yorumlanması için tekrarlanabilir bir protokol sunuyoruz. Protokol, veri ön işlemesi, öngörücü modelleme, SHAP, LIME ve Grad-CAM kullanılarak açıklanabilirlik değerlendirmesi, klinisyen odaklı değerlendirme, doğrulama prosedürleri ve tekrarlanabilirlik kaynaklarını birleşik bir iş akışı içinde entegre eder. Amaç, çeşitli sağlık veri setlerinde şeffaf model geliştirmeyi, açıklama kalite değerlendirmesini ve tekrarlanabilir uygulamayı destekleyen standartlaştırılmış bir çerçevesağlamaktır (36,37,38,39). Bu çalışmanın metodolojik katkısı, öngörücü analiz, açıklanabilirlik değerlendirmesi, klinisyen doğrulaması ve tekrarlanabilirlik uygulamalarının sağlık AI araştırmaları, eğitimi ve uygulama odaklı çalışmalar için uygun tek bir protokol içinde entegre edilmesindeyatmaktadır 40,41,42,43.

Bu çalışmanın temel katkısı, yeni bir açıklanabilirlik algoritmasının geliştirilmesi değildir.

Bunun yerine, tahmin modelleme, açıklanabilirlik değerlendirmesi, görselleştirme, değerlendirme ve insan merkezli yorumlamayı, sağlık analizi ve JoVE tabanlı protokol yayımı için uygun birleşik bir iş akışına entegre eden, standartlaştırılmış, tekrarlanabilir ve deneysel olarak doğrulanmış bir protokol sunar. Bu çalışmanın temel amacı, yeni bir öngörücü algoritma tanıtmak değil, sağlık analitiğinde açıklanabilir yapay zeka iş akışlarını uygulamak için standartlaştırılmış, tekrarlanabilir ve deneysel olarak doğrulanmış bir protokol sağlamaktır. Protokol, veri ön işlemesi, öngörücü modelleme, açıklanabilirlik değerlendirmesi, klinisyen odaklı değerlendirme ve tekrarlanabilirlik kaynaklarını benimseme, çoğaltma ve eğitimsel yayım için uygun birleşik bir çerçevede entegre eder.

Protokol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışmada kullanılan tüm veri setleri, UCI Makine Öğrenimi Deposu, PhysioNet MIMIC-III veri tabanı ve NIH Gevs X-ışını veri setleri dahil olmak üzere halka açık ve tamamen anonimleştirilmiş depolardan alınmıştır. Tanımlanabilir hasta bilgisi erişim sağlanmadı. Çalışma, kamuya açık kimliği yok edilmiş verilerin ikincil analizi için kurumsal araştırma etik rehberlerine uydu. Resmi Kurumsal İnceleme Kurulu onayı gerekmiyordu çünkü doğrudan insan katılımcılar alınmadı ve korunan sağlık bilgisi kullanılmadı.

1. Deneysel Çerçevelerin Genel Görünümü

  1. Şeffaf sağlık analizleri için tekrarlanabilir, açıklanabilir bir yapay zeka (XAI) boru hattı geliştirin. İş akışını Veri Katmanı, Ön İşlem Katmanı, Modelleme Katmanı, Açıklanabilirlik Katmanı, Değerlendirme Katmanı ve Görselleştirme Katmanı olarak organize edin.
  2. Bu modülleri, yapılandırılmış klinik veriler, elektronik sağlık kayıtları ve tıbbi görüntüleme veri setlerini işleyen birleşik bir iş akışına entegre edin.
  3. Her modülün tekrarlanabilirlik, yorumlanabilirlik, ölçeklenebilirlik ve standartlaştırılmış deneysel yürütmeye katkı sağladığından emin olun.
  4. Modüler mimariyi sürekli veri akışını destekleyecek şekilde tasarlayın ve boru hattının her aşamasının deneysel iş akışı boyunca tekrarlanabilirlik, yorumlanabilirlik ve ölçeklenebilirliğe katkı sağlamasını sağlasın.

2. Hesaplamalı Ortam ve Sistem Konfigürasyonu

  1. İş akışını çalıştırmadan önce gerekli yazılım bağımlılıklarını bir komut satırı terminali açarak ve aşağıdaki komutu çalıştırarak yükleyin:
    pip install numpy pandas scikit-learn tensorflow shap lime opencv-python matplotlib seaborn
  2. Tüm yazılım paketlerinin başarılı kurulumunu doğrulayın ve veri ön işleme ve model geliştirmeye geçmeden önce Materyaller Tablosu'nda listelenen yazılım sürümleriyle uyumluluğu doğrulayın.
  3. Ana programlama ortamı olarak Python 3.11'i kullanın. NumPy 1.26 ve Pandas 2.1'i veri işleme ve özellik mühendisliği görevleri için kurup yapılandırın. Makine öğrenimi modeli geliştirme ve değerlendirme için Scikit-learn 1.5'i kurun.
  4. Derin öğrenme modeli eğitimi ve çıkarım için TensorFlow 2.15'i kurun. Açıklanabilirlik analizi için SHAP 0.46 ve LIME 0.2.0 kurun. Görüntü işleme görevleri için OpenCV 4.10 kurun. Veri görselleştirme ve sonuç raporlaması için Matplotlib 3.9 ve Seaborn 0.13 yükleyin. Tekrarlanabilirlik için gerekli tam yazılım spesifikasyonları ve uygulama detayları için Materyal Tablosu'na bakabilirsiniz.
  5. Hesaplama ortamını, çok çekirdekli işlemci, grafik işlem birimi (GPU) hızlandırma ve büyük sağlık veri setleri ile derin öğrenme iş yüklerini karşılayacak yeterli bellek kaynaklarıyla donatılmış bir iş istasyonu kullanarak yapılandırmak.
  6. Deneysel çalışmalar arasında tekrarlanabilirliği sağlamak için veri bölmeleri, model başlatma ve eğitim prosedürleri için sabit rastgele tohumlar oluşturun. Günlük mekanizmalarının, iş akışı boyunca veri ön işleme işlemlerini, model yapılandırmalarını, hiperparametre ayarlarını, eğitim prosedürlerini ve değerlendirme sonuçlarını kaydetmesini etkinleştirin.
  7. Model mimarilerini, optimizasyon parametrelerini, öğrenme oranlarını, toplu boyutlarını, eğitim ayarlarını ve hiperparametre değerlerini Tablo 1'de özetlenen özelliklere göre yapılandırın. Tekrarlama deneyleri sırasında bildirilen sonuçlarla tutarlılığı sağlamak için bu ayarlara uyulabilir.
  8. Beklenen Çıktı - Tüm gerekli yazılım paketlerini, donanım kaynaklarını, kayıt mekanizmalarını ve model yapılandırma ayarlarını içeren tamamen yapılandırılabilir ve tekrarlanabilir bir hesaplama ortamı, sonraki veri ön işleme, model geliştirme, açıklanabilirlik analizi ve değerlendirme prosedürleri için kullanılabilir.
BileşenParametreDeğerTanım
Rastgele Ormann_estimators100Ağaç sayısı
Rastgele Ormanmax_depthHiçbiri yokAğaç derinliği
XGBoostlearning_rate0.01Öğrenme hızı
XGBoostn_estimators100Güçlendirme mermileri
CNNÇağlar25Eğitim dönemleri
CNNbatch_size32Parti büyüklüğü
CNNOptimizerAdamOptimizasyon algoritması
MLPhidden_layers2Gizli katman sayısı
MLPAktivasyonReLUAktivasyon fonksiyonu
Geneltrain_split70%Eğitim veri oranı
Genelvalidation_split15%Doğrulama oranı
Geneltest_split15%Test oranı

Tablo 1: Uygulama Detayları ve Hiperparametre Konfigürasyonu.

Bu tablo, önerilen açıklanabilir yapay zeka çerçevesinin deneysel değerlendirmesi boyunca kullanılan hesaplama ortamı, yazılım kütüphaneleri, makine öğrenimi ve derin öğrenme model yapılandırmaları, optimizasyon ayarları, öğrenme oranları, parti boyutları, eğitim parametreleri ve hiperparametre değerlerini özetlemektedir.

3. Veri Seti Hazırlama ve Ön İşleme

  1. Deneysel iş akışının şeffaflığını ve tekrarlanabilirliğini sağlamak için kamuya açık sağlık veri setlerini seçin.;
  2. Önerilen çerçeveyi doğrulamak için dört temsilli sağlık senaryosu kullanın: (i) Wisconsin Meme Kanseri Veri Seti kullanılarak meme kanseri teşhisi, (ii) Pima Indians Diyabet Veri Seti kullanılarak diyabet riski tahmini, (iii) MIMIC-III elektronik sağlık kayıtları kullanılarak klinik sonuç tahmini ve (iv) NIH Göğüs Röntgeni Veri Seti kullanılarak göğüs hastalığı sınıflandırması. Bu veri setlerini, yapılandırılmış klinik kayıtlar, uzunlamasına elektronik sağlık kayıtları ve sağlık karar destek sistemlerinde yaygın kullanılan tıbbi görüntüleme yöntemleri arasındaki çerçeveyi değerlendirmek için seçin.
  3. Her veri setini Python ortamına aktarın ve kayıtları giriş özellikleri ile hedef değişkenlere ayırın. Hastalık tahmin görevleri için yapılandırılmış klinik veriler, uzunlamasına sonuç analizi için elektronik sağlık kayıtları ve tanısal sınıflandırma görevleri için tıbbi görüntüleme veri setlerini organize etmek. Ön işlem işlemlerine geçmeden önce her veri setinin bütünlüğünü doğrulayın.
  4. Uygun ödüm teknikleriyle eksik değerleri belirleyin ve giderin. Değişkenler arasında karşılaştırılabilirliği sağlamak için özellik ölçeklendirme ve normalizasyon prosedürleriyle sayısal özellikleri standartlaştırın.
  5. Veri seti özelliklerine dayalı uygun kodlama yöntemleriyle kategorik değişkenleri kodlayın. En ilgili değişkenleri belirlemek ve veri boyutluluğunu azaltmak için korelasyon analizi ve model tabanlı özellik önemi ölçümleri kullanarak özellik seçimi yapın.
  6. Model eğitiminden önce tüm tıbbi görüntüleri 224,224 piksele boyutlandırın. Seçilen derin öğrenme mimarisinin gereksinimlerine göre piksel yoğunluk değerlerini normalleştirin. Model genellemesini iyileştirmek ve aşırı uyumu azaltmak için görüntü döndürme ve yatay çevirme gibi veri artırma tekniklerini uygulayın. Veri seti boyunca görüntü kalitesini doğrulayın ve görüntü boyutlarının tutarlılığını garantileyin.
  7. Veri bütünlüğünü, veri setinin tamlığını, tutarlılığını ve özellik-etiket uyumunu değerlendirerek değerlendirin. Tüm kayıtların ilgili hedef sınıflarına doğru şekilde atadığını doğrulayın. Örneklem büyüklüğü, özellik sayısı ve veri modalitesi gibi veri seti özelliklerini, Tablo 2'de özetlenmiş şekilde gözden geçirin.
  8. Metodolojik titizlik ve tekrarlanabilirlik sağlamak için veri setine özgü doğrulama prosedürlerini uygulayın. Her veri seti için örneklem büyüklüğünü, sınıf dağılımı, tren-doğrulama-test bölme stratejisini, sızıntı önleme önlemlerini, hiperparametre optimizasyon prosedürlerini, çapraz doğrulama tasarımını ve harici test protokolünü kaydedin. Bu doğrulama prosedürlerini Tablo 3'te özetleyin.
  9. Eksik değer işleme, outlier kaldırma, özellik ölçeklendirme, kategorik kodlama, sınıf dağıtımı koruma ve veri seti bölümleme prosedürlerini değerlendirerek ön işleme kalite kontrol kontrolleri gerçekleştirin. Tüm veri setlerinde ön işleme işlemlerinin tutarlı şekilde uygulandığını doğrulayın.
  10. Veri seti bölümlendirme sırasında önemli veri sızıntısı olmadığını doğrulayın. Şekil 1'de sunulan ön işleme doğrulama sonuçlarını inceleyerek sonraki makine öğrenimi ve açıklanabilirlik analizleri için standartlaştırılmış veri setlerinin oluşturulduğundan emin olun.
  11. Beklenen Çıktı - Eksik değerleri uygun şekilde gideren, kategorik değişkenler kodlanmış, sayısal özellikler normalleştirilmiş ve kayıtları eğitim, doğrulama ve test alt kümelerine bölmüş şekilde temizlenmiş ve standartlaştırılmış veri setleri oluşturun. Veri seti özellikleri, sınıf dağılımları ve doğrulama prosedürlerinin Tablo 2 ve Tablo 3'te bildirilenlerle uyumlu olduğundan emin olun ve Şekil 1'de gösterildiği gibi başarılı ön işleme doğrulamasını onaylayın.
Veri setiTipÖrneklerÖzelliklerHedef
Meme KanseriTabular56930İyi huylu/Kötü huylu
DiyabetTabular7688Diyabet Sonucu
MIMIC-IIIEHR~60.000Klinik DeğişkenlerÖlüm
Göğüs röntgeniGörüntüleme~112.000GörsellerHastalık Etiketleri

Tablo 2: Veri Seti Özellikleri ve Sağlık Kullanım Durumları.

Bu tablo, çalışmada kullanılan sağlık veri setlerinin özetini sunar; veri seti türü, örnek sayısı, özellik sayısı, hedef değişkenler, sağlık uygulama alanı ve ilgili klinik kullanım durumları dahildir. Veri setleri, çeşitli sağlık analitik senaryolarında çerçeve uygulanabilirliğini göstermek için yapılandırılmış klinik kayıtları, elektronik sağlık kayıtları ve tıbbi görüntüleme verilerini kapsar.

Veri setiÖrneklem BüyüklüğüSınıf DağılımıBölünme StratejisiSızıntı ÖnlemeHiperparametre AramasıÇapraz DoğrulamaDış Test
Meme Kanseri (UCI, Wisconsin)569357 İyi Niyetli / 212 Malign70/15/15Sadece tren ön işlemeŞebeke Arama5 Kat Katmanlı Katmanlı CVBağımsız Direniş Seti
Pima Kızılderilileri Diyabet768500 Diyabetik Olmayanlar / 268 Diyabetik70/15/15Sadece tren ön işlemeŞebeke Arama5 Kat Katmanlı Katmanlı CVBağımsız Direniş Seti
MIMIC-III EHR5274Sonuç-tabakalı kohortlar15.70.15 Hasta seviyesiHasta düzeyinde ayrımRastgele Arama5 Katmanlı Hasta Seviyesinde CVBağımsız Direniş Seti
NIH Gevs X-ray112120Zatürre/Normal tabakalı70/15/15Görüntü düzeyinde ayrımRastgele Arama5 Kat Katmanlı Katmanlı CVBağımsız Direniş Seti

Tablo 3: Veri Seti Düzeyinde Doğrulama ve Deneysel Tasarım.

Bu tablo, her veri seti için kullanılan doğrulama metodolojisini, örneklem büyüklüğü, sınıf dağılımı, tren-doğrulama-test bölme stratejisi, sızıntı önleme prosedürleri, hiperparametre optimizasyon yöntemleri, çapraz doğrulama tasarımı ve harici test protokollerini özetlemektedir. Bu önlemler, metodolojik titizlik, tekrarlanabilirlik ve tarafsız model değerlendirmesini sağlamak için uygulandı.

figure-protocol-1
Şekil 1: Veri Ön İşleme Boru Hattının Doğrulaması.
Model geliştirmeden önce gerçekleştirilen anahtar ön işleme işlemleri için doğrulama sonuçları. (A) Temsilci sağlık özellikleri genelinde eksik değer analizi. (B) Bir sayısal değişkenin dışna işleme öncesi ve sonrası dağılımı. (C) Standartlaştırma kullanarak özellik ölçeklendirme doğrulaması. (D) Kategorik kodlama doğrulaması. (E) Ön işleme sonrası sınıf dağılımı. (F) Tren doğrulama-test veri bölmesinin doğrulanması. Bu sonuçlar, veri setlerinin öngörülü modelleme ve açıklanabilirlik analizi için başarılı ön işleme ve hazırlanmasını doğrulamaktadır. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

4. Açıklanabilir YZ Çerçevesinin Sistem Mimarisi

  1. Modüler işlemeyi kolaylaştırmak, iş akışı şeffaflığını artırmak ve tekrarlanabilir uygulamayı desteklemek için katmanlı bir mimariyle çerçeveyi organize edin. Ham sağlık veri setlerini almak ve yönetmek için Veri Katmanını yapılandırın. Ön işlem işlemlerine başlamadan önce gelen tüm veri setlerini Veri Katmanı üzerinden yönlendirin.
  2. Ön İşleme Katmanı içinde veri temizliği, dönüşüm, normalizasyon, özellik mühendisliği ve kodlama prosedürlerini gerçekleştirin. Tüm ön işleme işlemlerinin model geliştirmeden önce tamamlandığından emin olun.
  3. Modelleme Katmanı içinde makine öğrenimi ve derin öğrenme algoritmaları kullanarak öngörücü modeller geliştirin. Gradient Boosting, Random Forest, Çok katmanlı Perceptron (MLP) ve Konvolüsyon Sinir Ağı (CNN) modellerini önceden işlenmiş veri setleri ve optimize edilmiş hiperparametre yapılandırmaları kullanarak eğin.
  4. Açıklanabilirlik Katmanı içinde açıklanabilirlik tekniklerini kullanarak model tahminlerini yorumlayın. Yapılandırılmış veri setleri için SHAP ve LIME kullanarak özellik atıflama açıklamaları oluşturun. Model tahminlerine katkıda bulunan bölgeleri görselleştirmek için görüntü tabanlı modeller için Grad-CAM ısı haritaları oluşturun.
  5. Değerlendirme Katmanı içinde öngörücü ve açıklanabilirlik performansını değerlendirin. Doğruluk, hassasiyet, hatırlama, F1-puan, ROC-AUC, sadakat, stabilite ve klinisyen merkezli değerlendirme metriklerini hesaplayın. Tüm değerlendirme çıktılarını sonraki analiz ve raporlama için kaydedin.
  6. Görselleştirme Katmanı içinde klinik olarak yorumlanabilir görsel çıktılar üretin. Performans karşılaştırma grafikleri, özellik önemi görselleştirmeleri, SHAP özet grafikleri, LIME açıklamaları, Grad-CAM ısı haritaları ve klinisyen odaklı raporlama panelleri oluşturun. Tüm görsel çıktıları nihai deneysel rapora dahil etmek üzere depolayın.
  7. İş akışı yürütmesine geçmeden önce Şekil 2'de gösterilen tüm framework mimarisini gözden geçirin.
  8. Beklenen Çıktı - Gradient Boosting, Random Forest, CNN ve MLP mimarileri dahil olmak üzere tam eğitilmiş makine öğrenimi ve derin öğrenme modelleri üretin. Model yapılandırmalarını, optimize edilmiş hiperparametreleri, eğitim günlüklerini, kontrol noktası dosyalarını, açıklanabilirlik çıktılarını ve görselleştirme eserlerini sonraki değerlendirme ve yorumlanabilirlik analizi için depolayın.

figure-protocol-2
Şekil 2: Sağlık Analitiği için Açıklanabilir YZ Çerçevesinin Sistem Mimarisi. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

5. İş Akışı Yürütme

  1. Kamuya açık depolardan sağlık veri setlerini edinin ve veri setlerini makine öğrenimi ve derin öğrenme analizine uygun yapılandırılmış formatlarda depolayın. Deneysel prosedüre başlamadan önce Şekil 3'te gösterilen tüm iş akışını gözden geçirin.
  2. Bölüm 3'te tanımlanan prosedürlere göre veri temizleme ve ön işleme işlemi yapılmalıdır. Uygun ölçeklendirme yöntemleriyle sayısal değişkenleri normalize edin. Uygun kodlama teknikleriyle kategorik değişkenleri kodlayın. Eksik değerleri veri setine özgü emputasyon stratejileri kullanarak tespit edin ve hesaplayın. Model geliştirmeye geçmeden önce veri kalitesini, özellik-etiket uyumunu ve veri seti tamlığını doğrulayın.
  3. Her veri setini, tarafsız model değerlendirmesini desteklemek için eğitim, doğrulama ve test alt kümelerine ayırın. Veri seti bölümlendirme sırasında sınıf dağılımlarını koruyun ve geçerlidirse sızıntı önleme önlemleri uygulayın. Test alt kümesini yalnızca nihai model değerlendirmesi için ayırın.
  4. Gradient Boosting ve Random Forest dahil olmak üzere toplu tabanlı algoritmalar kullanarak yapılandırılmış veri setlerinde makine öğrenimi modelleri eğitin. Mekansal görüntü özelliklerini öğrenebilen Konvolüsyon Sinir Ağı (CNN) mimarileri kullanarak görüntüleme veri setlerinde derin öğrenme modelleri eğitin. Model parametrelerini eğitim sırasında yinelemeli olarak güncelledin ve her eğitim döneminden sonra doğrulama performansını izleyin. Doğrulama performansı önceden belirlenmiş durdurma kriterlerine göre kötüleştiğinde veya iyileşmediğinde erken durdurma uygulanır.
  5. Şebeke ve rastgele arama dahil olmak üzere sistematik arama stratejileri kullanarak model hiperparametrelerini optimize edin. Öğrenme hızını, tahmin cihazlarının sayısını, ağaç derinliğini, parti büyüklüğünü, dönem sayısını ve diğer modele özgü parametreleri doğrulama performansına göre ayarlayın. Doğrulama veri setleri arasında öngörücü performans ve genelleştirme yeteneğine dayalı nihai modeli seçin.
  6. Model eğitimini tamamladıktan sonra açıklanabilirlik yöntemlerini uygulayın. Model tahminlerine en güçlü katkıda bulunan değişkenleri belirlemek için özellik-attribution teknikleriyle küresel açıklamalar oluşturun. Bireysel tahmin vakalarını analiz etmek ve örneklem düzeyinde model davranışını değerlendirmek için yerel açıklamalar üretmek. Görüntü sınıflandırma modelleri için Grad-CAM ısı haritaları oluşturularak tahmin edilen sonuca katkıda bulunan görüntü bölgelerini vurgulayabilir. Tüm açıklama çıktılarını sonraki analiz ve raporlama için depolayın.
  7. Doğruluk, hassasiyet, hatırlama, F1-puanı ve alıcının eğri altındaki çalışma karakteristik alanı (ROC-AUC) kullanılarak tahmin performansını değerlendirin. Açıklama güvenilirliği ve tutarlılığını değerlendirmek için güvenilirlik ve kararlılık metrikleri kullanarak açıklama kalitesini değerlendirin. Veri kümeleri ve açıklanabilirlik yöntemleri arasında model performansını karşılaştırarak çerçeve sağlamlığını ve genellenebilirliğini değerlendirin.
  8. Sonuçları klinik olarak yorumlanabilir bir şekilde iletmek için görselleştirme çıktıları ve analitik raporlar oluşturun. Performans karşılaştırma grafikleri, özellik önemi grafikleri, SHAP özet görselleştirmeleri, LIME açıklama çıktıları, Grad-CAM ısı haritaları ve diğer klinik açıdan ilgili görselleştirmeler oluşturun. Raporlamadan önce netlik ve tutarlılık sağlamak için tüm görsel çıktıları gözden geçirin.
  9. Tüm ön işleme işlemlerini, model yapılandırmalarını, hiperparametre ayarlarını, açıklanabilirlik prosedürlerini, doğrulama stratejilerini ve değerlendirme sonuçlarını belgeleyin. İş akışının tekrarlanabilirliğini ve bağımsız tekrarını kolaylaştırmak için ayrıntılı deneysel kayıtlar tutun. Tekrarlanan deneysel çalışmalarda sonuçların tutarlılığını doğrulayın ve tüm iş akışı eserlerini gelecekte referans için arşivleyin.
  10. Beklenen Çıktı - Optimize edilmiş hiperparametreler, kaydedilen model ağırlıkları, eğitim günlükleri, performans metrikleri ve açıklanabilirlik çıktılarıyla tam eğitilmiş bir öngörücü model oluşturun; bunlar arasında SHAP açıklamaları, LIME açıklamaları ve Grad-CAM ısı haritaları bulunur. Tüm model eserlerini, değerlendirme raporlarını ve görselleştirme çıktılarını sonraki analiz ve tekrarlanabilirlik değerlendirmesi için depolayın.

figure-protocol-3
Şekil 3: Açıklanabilir yapay zeka boru hattının uçtan uca iş akışı. Bu şekilin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

6. Model Değerlendirmesi ve Açıklanabilirlik Değerlendirmesi

  1. Doğruluk, hassasiyet, hatırlama, F1-puanı ve alıcının eğri altındaki çalışma karakteristik alanı (ROC-AUC) dahil olmak üzere standart sınıflandırma metrikleri kullanılarak öngörücü model performansını değerlendirin. Genel sınıflandırma doğruluğunu ölçmek için doğruluğu hesaplayın.
  2. Doğru tanımlanmış olumlu tahminlerin oranını değerlendirmek için hassasiyeti hesaplayın. Modelin pozitif vakaları tespit etme yeteneğini değerlendirmek için geri çağırma hesaplayın. Hassasiyet ve hatırlama dengesi için F1 puanını hesaplayın. Farklı sınıflandırma eşikleri arasında ayrımcı performansı değerlendirmek için ROC-AUC hesaplayın.
  3. Bu değerlendirme metriklerini tüm veri setleri ve model mimarilerinde tutarlı şekilde uygulayarak nesnel performans karşılaştırmasını kolaylaştırın. Tüm metrik değerlerini kaydedin ve değerlendirme sonuçlarını sonraki istatistiksel analiz ve raporlama için saklayın.
  4. Açıklanabilirlik performansını doğruluk ve kararlılık metrikleri kullanarak değerlendirin. Oluşturulan açıklamaların model tahminlerini ve karar alma davranışlarını ne ölçüde doğru yansıttığını belirlemek için doğruluğu hesaplayın.
  5. Benzer girdi örneklerinden üretilen açıklamaları karşılaştırarak ve açıklama çıktılarının tutarlılığını nicelikle ölçerek kararlılığı hesaplayın. Model açıklamalarını yorumlamadan önce doğruluk ve stabilitelik değerlerinin önceden tanımlanmış kalite kriterlerini karşıladığından emin olun.
  6. SHAP, LIME ve Grad-CAM çıktıları arasında açıklanabilirlik performansını karşılaştırın.
  7. Beklenen Çıktı - Doğruluk, hassasiyet, hatırlama, F1 puanı, ROC-AUC, sadakat ve istikrar metrikleri dahil olmak üzere nicel değerlendirme sonuçları oluşturun. Bilimsel raporlama, tekrarlanabilirlik değerlendirmesi ve klinik yorumlama için uygun açıklanabilirlik çıktıları ve görselleştirmeler üretin.

7. İnsan Merkezli Değerlendirme

  1. 6 hekim, 3 radyolog ve 3 klinik veri analistinden oluşan 12 sağlık profesyoneli işe alın. Klinik karar verme, tıbbi görüntü yorumu, sağlık analizi veya elektronik sağlık kaydı incelemesi konusunda önceden deneyimi olan katılımcıları seçin. Değerlendirme prosedürünü başlatmadan önce tüm katılımcılardan bilgilendirilmiş onay alın.
  2. Model eğitimi ve açıklanabilirlik analizi tamamlandıktan sonra test veri setlerinden rastgele 100 vaka seçilir. Her vaka için iki değerlendirme koşulu oluşturun:
    1. sadece tahmin için çıktı ve
    2. açıklanabilirlik bilgisi eşliğinde tahmin. Sunum yanlılığını ve öğrenme etkilerini en aza indirmek için vakaların sunum sırasını ve değerlendirme koşullarını rastgele hale getirin.
  3. Tahmin sonuçları, açıklama çıktıları ve değerlendirme anketleri içeren standart değerlendirme formları hazırlayın. Vakaları katılımcılara bireysel olarak bilgisayar tabanlı bir değerlendirme arayüzü kullanarak sunun.
  4. Katılımcılara, diğer değerlendiricilerle yanıtları tartışmadan her vakayı bağımsız olarak incelemeleri talimatını verin. Katılımcıların tüm değerlendirmeleri aynı deneysel koşullarda tamamlamasına izin verin.
  5. Yayınlanmış açıklanabilir yapay zeka değerlendirme çalışmalarından uyarlanmış beş maddelik Likert ölçeği anketi uygulayın. Katılımcıların, incelenen her dava için güven, yorumlanabilirlik ve kullanılabilirlik değerlendirmelerini yönlendirin. Anket yanıtlarını elektronik olarak kaydedin ve istatistiksel analize geçmeden önce tüm anket maddelerinin tamamlandığını doğrulayın.
  6. Değerlendirme sürecinde klinik faydanın nesnel göstergelerini ölçmek. Katılımcı kararlarını ilgili referans etiketleri veya gerçek sonuçlarıyla karşılaştırarak kayıt kararı anlaşması yapın. Katılımcı kararların referans sonucuna uyan yüzde yüzdesi olarak karar anlaşmasını hesaplayın.
  7. Her vaka için inceleme süresini kaydederek dava sunumu ile nihai yanıt gönderimi arasındaki aralığı ölçerek kaydedin. Sadece tahmin ile açıklamalı tahmin koşulları için ortalama inceleme süresini ayrı ayrı hesaplayın.
  8. Tüm katılımcılar ve değerlendirme vakaları arasında ortalama güven, yorumlanabilirlik ve kullanılabilirlik puanlarını hesaplayın. Sadece tahmin ve tahmin ile açıklama koşullarında elde edilen puanları karşılaştırın.
  9. Tüm katılımcı değerlendirmeleri tamamlandıktan sonra eşleştirilmiş t-testleri yapılarak güven, yorumlanabilirlik, kullanılabilirlik, karar anlaşması ve inceleme süresindeki farklılıkların istatistiksel olarak anlamlı olup olmadığını belirleyin. Tüm istatistiksel karşılaştırmalar için p 0.05 anlamlılık eşiği kullanın.
  10. Tüm katılımcılardan yanıtlar topladıktan sonra Fleiss Kappa'yı hesaplayarak değerlendiriciler arası anlaşmayı değerlendirin. Değerlendirmelerin değerlendiriciler arasındaki tutarlılığını belirlemek için toplu katılımcı puanlarını kullanın. Fleiss Kappa değerlerini yerleşik anlaşma yönergelerine göre yorumlayın ve ortaya çıkan anlaşma istatistiklerini kaydedin.
  11. Katılımcı demografisi, değerlendirme metodolojisi, anket tasarımı, istatistiksel analiz prosedürleri, nesnel performans ölçümleri ve değerlendiriciler arası anlaşma sonuçlarını Tablo 4'te özetleyin.
  12. Her iki değerlendirme koşullarında model çıktılarını inceleyin ve katılımcı yanıtlarını koşullar arasında karşılaştırın. Açıklamaların güveni, yorumlanabilirliği ve kullanılabilirliği artırdığını, karar kalitesini olumsuz etkilemeden yaptığını doğrulayın.
  13. Hesaplanan Fleiss Kappa istatistiği kullanılarak katılımcı değerlendirmelerinin tutarlılığını doğrulayın. Tüm değerlendirme sonuçlarını takip eden raporlama ve tekrarlanabilirlik değerlendirmesi için kaydedin.
  14. Beklenen Çıktı - Klinisyen güven puanları, yorumlanabilirlik dereceleri, kullanılabilirlik dereceleri, karar-anlaşma ölçümleri, inceleme süresi istatistikleri, eşleştirilmiş t-test sonuçları ve değerlendiriciler arası anlaşma istatistikleri oluşturun. Açıklanabilir yapay zeka çerçevesinin klinik faydası, yorumlanabilirliği ve güvenilirliğini tanımlayan nicel kanıtlar sunun.
ParametreDeğer
Uzmanlar12
Hekimler6
Radyologlar3
Klinik Veri Analistleri3
İncelenen Davalar100
Değerlendirme TasarımıRastgele (Sadece Tahmin vs Tahmin+Açıklama)
Ölçüm Aleti5 noktalı Likert Ölçeği
Güven DeğerlendirmesiYorumlanabilirlik, Güven, Kullanılabilirlik
İstatistiksel TestEşleştirilmiş t-testi (p 0.05)
Derecelendirme Arası GüvenilirlikFleiss Kappa
Nesnel ÖlçütlerKarar Anlaşması, İnceleme Süresi

Tablo 4: İnsan Merkezli Değerlendirme Protokolü ve Klinisyen Değerlendirme Tasarımı.

Bu tablo, açıklanabilir yapay zeka sisteminin yorumlanabilirliği, güvenilirliği ve kullanılabilirliğini değerlendirmek için kullanılan klinisyen değerlendirme çerçevesini sunmaktadır. Katılımcı demografisi, vaka inceleme metodolojisi, anket tasarımı, istatistiksel analiz prosedürleri, değerlendiriciler arası güvenilirlik değerlendirmesi ve nesnel değerlendirme ölçütleri hakkında bilgiler özetlenir.

8. Doğrulama ve Tekrarlanabilirlik Değerlendirmesi

  1. Önerilen çerçevenin sağlamlığını ve güvenilirliğini değerlendirmek için doğrulama ve ablasyon çalışmaları yapmaktır. Seçilen açıklanabilirlik yöntemleriyle yüksek önem puanlarına sahip özellikleri belirleyin. Önemli özellikleri kademeli olarak kaldırın ve her özellik kaldırma adımından sonra öngörücü modelleri yeniden eğitin.
  2. Her ablasyon deneyinden sonra model performansını doğruluk, hassasiyet, hatırlama, F1-puanı ve ROC-AUC metrikleri kullanarak değerlendirin. Ortaya çıkan performans değerlerini, tahmin edici sonuçlara bireysel özelliklerin katkısını belirlemek için temel model performansıyla karşılaştırın.
  3. SHAP, LIME ve Grad-CAM kullanarak benzer girdi örnekleri için açıklamalar üreterek açıklama kararlılığını değerlendirin. Tekrarlanan değerlendirmeler arasında açıklama çıktılarını karşılaştırın ve önceden tanımlanmış kararlılık metriklerini kullanarak tutarlılığı nicelikle ölçün. Açıklamaların küçük girdi varyasyonları ve tekrarlanan deneysel çalışmalar altında stabil kaldığını doğrulayın.
  4. İş akışı boyunca tüm deneysel prosedürleri kaydedin. Veri ön işleme işlemleri, veri seti bölümleme prosedürleri, model mimarileri, hiperparametre ayarları, eğitim yapılandırmaları, açıklanabilirlik yöntemleri, doğrulama stratejileri ve değerlendirme metrikleri belgelenmesi. Tüm yapılandırma parametrelerini ve deneysel çıktıları tekrarlanabilirlik ve bağımsız doğrulamayı kolaylaştırmak için yapılandırılmış bir formatta depolayın.
  5. Tüm deneysel kayıtları inceleyerek tamlık ve tutarlılık sağlanır. İş akışının belgelenmiş prosedürler, yapılandırma dosyaları ve yazılım spesifikasyonları kullanılarak çoğaltılabilir olup olmadığını doğrulayın. Protokolün gelecekteki çalışmalar için uyarlanmasını kolaylaştırmak ve JoVE metodolojik gereksinimlerine uygun video tabanlı deneysel protokole dönüşümü desteklemek amacıyla modüler bir iş akışı yapısı korumak.

9. Tekrarlanabilirlik Kaynakları

  1. Tüm deneyleri, tekrarlanan çalışmalarda tekrarlanabilir sonuçlar sağlamak için sabit rastgele tohumlarla yürütün. Kaynak kodu, ön işleme betikleri, yapılandırma dosyaları, ortam spesifikasyonları, model parametreleri ve görselleştirme betiklerini halka açık bir depoda tutun.
  2. Veri seti edinimi, ön işleme, deney yürütme, model eğitimi, açıklanabilirlik üretimi, doğrulama prosedürleri ve tüm rapor edilen tablo ve şekillerin yeniden oluşturulması için ayrıntılı talimatlar sağla. Bağımsız çoğaltma için gereken tüm iş akışı bileşenlerini arşivleyin; yazılım spesifikasyonları, ön işleme iş akışları, yapılandırma dosyaları, veri seti erişim talimatları, model kontrol noktaları ve görselleştirme varlıkları dahil.
  3. Çerçeve genelinde kullanılan yazılım kaynaklarını, ön işleme iş akışlarını, yapılandırma dosyalarını, veri seti erişim talimatlarını ve tekrarlanabilirlik varlıklarını Tablo 5'te özetleyin.
  4. Beklenen Çıktı - Ön işlem betikleri, yapılandırma dosyaları, eğitilmiş modeller, model kontrol noktaları, açıklanabilirlik çıktıları, doğrulama raporları, görselleştirme eserleri, yazılım spesifikasyonları ve önerilen çerçevenin bağımsız tekrarlanması ve doğrulanması için gerekli dokümantasyonları içeren tam bir tekrarlanabilir deneysel paket oluşturun.
KaynakTanım
Kaynak KoduVeri ön işleme, model eğitimi, açıklanabilirlik ve değerlendirme için Python uygulama betikleri
Çevre Dosyasırequirements.txt paket bağımlılıkları ve sürümleri içerir
Yapılandırma DosyalarıModel mimarisi ayarları, hiperparametreler ve deney yapılandırmaları
Sabit Rastgele TohumlarTohum = 42 tekrarlanabilir deneyler için kullanıldı
Veri Seti Erişim TalimatlarıKamu sağlık veri setlerinin edinilmesi için bağlantılar ve prosedürler
Ön İşleme SenaryolarıVeri temizliği, normalizasyon, kodlama ve özellik seçimi için betikler
Şekil Oluşturma YazılarıTüm el yazması figürlerini yeniden oluşturmak için yazı yazıları
Tablo Oluşturma ScriptleriRapor edilen tabloları ve metrikleri yeniden üreten betikler
Örnek GirdilerÖrnek veri setleri ve giriş dosyaları
Örnek ÇıktılarTahmin sonuçları, açıklamalar ve değerlendirme raporları

Tablo 5: Tekrarlanabilirlik Kaynakları ve Deneysel Varlıklar.

Bu tablo, deneysel tekrarlanabilirliği desteklemek için sağlanan kaynakları özetler; bunlar arasında kaynak kodu, ön işleme betikleri, yapılandırma dosyaları, ortam spesifikasyonları, veri seti erişim talimatları, sabit rastgele tohum ayarları, şekil oluşturma betikleri ve rapor edilen sonuçların yeniden üretilmesi için gerekli olan örnek giriş/çıktı dosyaları yer alır.

Sonuçlar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Tüm ürün hattımızın açıklayıcı yapay zeka bileşenini kapsamlı şekilde değerlendirdik; farklı sağlık verileri türlerinde, hem yapılandırılmış klinik veriler hem de tıbbi görüntüler dahil olmak üzere, ne kadar iyi tahmin edildiğini değerlendirdik. Sonuçlar, değerlendirilen veri setleri boyunca tutarlı öngörücü performans gösterdi. Test edilen modeller arasında, gradyan artırma modeli %97,4 ile en yüksek doğruluğu elde etti, ardından rastgele orman modeli %94,2 ile geldi. Görüntü setlerine uygulanan derin öğrenme yöntemleri %91,3 doğruluk sağlarken, çok katmanlı perceptron modelleri %90,8 oranında biraz daha düşük sonuçlar vermiştir. Bu, toplu tabanlı makine öğrenimi modellerinin yapılandırılmış sağlık verilerinde en iyi performans gösterdiğini, derin öğrenme mimarilerinin ise görüntüleme görevlerinde üstün olduğunu gösterir. Tablo 6, tahmin fonksiyonları için doğruluk, hassasiyet, hatırlama ve F1-puanı gibi çeşitli performans metriklerini ayrıntılı olarak özetlemektedir; ayrıca güvenilirlik ve istikrar gibi açıklanabilirlik metriklerini de belirtir. Bu performans rakamlarına beş kat çapraz doğrulama uygulayarak ve sonuçları ortalama değerler olarak (%95 güven aralıklarıyla) sunarak elde ettik. Güven aralıkları sadece modelin belirsizliğini göstermekle kalmaz, aynı zamanda veri seti belleği ve model mimarilerindeki farklılıkları hesaba katarak öngörücü performans karşılaştırmalarını daha güvenilir kılar.

ModelDoğruluk (%)HassasiyetGeri ÇağırmaF1-ScoreSadakatlilikStabilite%95 CI
Rastgele Orman94.20.930.920.920.850.8293.1–95.3
XGBoost97.40.960.950.950.920.8996.5–98.3
MLP90.80.890.880.880.800.7889.6–92.0
CNN (Görüntüleme)91.30.900.910.900.880.8690.1–92.5

Tablo 6: Öngörücü modeller ve açıklanabilirlik yöntemlerinin karşılaştırmalı performansı.
Bu tablo, doğruluk, hassasiyet, hatırlama, F1-puanı ve ROC-AUC dahil olmak üzere öngörücü performans metrikleri kullanılarak makine öğrenimi ve derin öğrenme modellerinin karşılaştırmalı bir değerlendirmesini sunmaktadır. Ayrıca, doğruluk, istikrar, anlaşılabilirlik ve insan güveni puanları gibi açıklanabilirlik metrikleri, hem öngörücü etkinlik hem de yorumlanabilirlik açısından kapsamlı bir değerlendirme sağlamaktadır.

Sonuçlar, Gradient Boosting'in en yüksek genel tahmin performansını (%97,4 doğruluk) elde ettiğini, Random Forest'ı 3,2 puan ve derin öğrenme modellerini 6 puandan fazla geride bıraktığını göstermektedir. Bu gözlem, toplu tabanlı öğrenme yöntemlerinin bu çalışmaya dahil edilen yapılandırılmış sağlık veri setleri için özellikle etkili olduğunu göstermektedir. CNN ve MLP modelleri arasındaki daha küçük performans farkı, yalnızca artan model karmaşıklığının değerlendirilen deneysel koşullarda mutlaka üstün öngörücü performansa dönüşmediğini göstermektedir.
Önerilen çerçevemizin çeşitli sağlık analitik görevlerinde faydalılığını göstermek için, veri setine özgü tahmin performans sonuçlarını Tablo 7'de sunuyoruz.

Veri Setine Özgü Analiz.
Performans veri setleri arasında özellik karmaşıklığı, örneklem büyüklüğü, sınıf dağılımı ve veri modalitesi farklılıkları nedeniyle değişiklik gösterdi. Meme Kanseri veri seti, muhtemelen iyi tanımlanmış özelliklerin ayrılabilirliği sayesinde en yüksek tahmin doğruluğunu sağladı. MIMIC-III ve NIH Gevs X-ışını veri setlerinde biraz daha düşük performans, uzunlamasına klinik kayıtlar ve tıbbi görüntüleme verilerinin daha karmaşık olduğunu yansıtmaktadır. Bu bulgular, çerçeve performansının veri seti özellikleri ve klinik bağlamdan etkilendiğini göstermektedir.

Veri setiDoğruluk (%)Hassasiyet (%)Geri çağırma (%)F1 puanı (%)
Meme Kanseri97.497.297.697.1
Diyabet94.293.994.494
MIMIC-III91.39191.591.1
NIH Gevs X-ray90.890.491.290.6

Tablo 7: Veri Setine Özgü Öngörülebilir Performans Sonuçları.
Önerilen açıklanabilir yapay zeka çerçevesinin dört temsilci sağlık veri seti boyunca öngörülebilir performansı. Doğruluk, hassasiyet, hatırlama ve F1 puanı bağımsız test setlerinde yüzde (%) olarak bildirilir. Daha yüksek değerler daha iyi sınıflandırma performansını gösterir.

Öngörücü performansı değerlendirmek için, Gradient Boosting, Random Forest, Convolütional Neural Network (CNN) ve Multilayer Perceptron (MLP) olmak üzere dört makine öğrenimi ve derin öğrenme modeli dört temsilli sağlık veri setinde değerlendirildi. Model performansı, 70:15:15 tren doğrulama-testi bölünmesi ve beş katlı çapraz doğrulama sonrası bağımsız test veri setlerinde doğruluk, hassasiyet, hatırlama, F1-puan ve ROC-AUC metrikleri kullanılarak değerlendirildi. Tahmin performansındaki iyileşmeler, aynı ön işleme ve doğrulama koşullarında modele özgü değerlendirme metriklerinin karşılaştırılmasıyla belirlendi.
Model performanslarının çeşitli yöntemlerde nasıl farklılaştığını aydınlatmak için, Şekil 4 topluluk, sinir ağı ve derin öğrenme modellerinin avantaj ve dezavantajlarını resimsel olarak gösterir.

figure-results-1
Şekil 4: Makine Öğrenimi ve Derin Öğrenme Modellerinin Sağlık Tahmin Görevlerinde Karşılaştırmalı Performansı. (A) Test veri setinde Gradient Boosting, Random Forest, CNN ve MLP modellerinin doğruluk karşılaştırması. (B) Test veri setinde Gradient Boosting, Random Forest, CNN ve MLP modellerinin F1 puan karşılaştırması. (C) Test veri setinde Gradient Boosting, Random Forest, CNN ve MLP modellerinin hassas karşılaştırılması. (D) Test veri setinde Gradient Boosting, Random Forest, CNN ve MLP modellerinin karşılaştırılmasını hatırlayın. Daha yüksek değerler daha iyi tahmin performansını gösterir. Gradient Boosting tüm değerlendirme metriklerinde en yüksek genel performansı elde etti, ardından Random Forest geldi. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Açıklanabilirlik Performansının Yorumlanması.
SHAP, değerlendirilen açıklanabilirlik yöntemleri arasında tutarlı olarak en yüksek isabet ve istikrar puanlarını elde etti; bu da oluşturulan açıklamalar ile temel model tahminleri arasında daha güçlü uyum sağladığını gösterdi. LIME, nispeten daha düşük bir kararlılık sergilemiştir; bu da yerel bozulmalara ve örnekleme değişkenliğine karşı daha yüksek hassasiyet olduğunu gösterir. Grad-CAM, görüntü tabanlı modeller için görsel olarak yorumlanabilir açıklamalar sağladı ancak SHAP'a göre biraz daha düşük isabet değerleri üretti. Bu bulgular, açıklama kalitesinin hem seçilen açıklama tekniğine hem de temel öngörücü model mimarisine bağlı olduğunu göstermektedir.

Boru hattına entegre edilen açıklanabilirlik teknikleri, performansları nicel ve niteliksel olarak değerlendirilmiştir. Özellikle, özellik atıflama yöntemleri, modelin iç mantığını farklı veri setleri arasında oldukça tutarlı şekilde ortaya çıkarmayı başarmıştır.
Çalışmada ele alınan tüm yöntemler, SHAP, değerlendirilen açıklanabilirlik yöntemleri arasında en yüksek isayette (0,92) ve stabiliteye (0,89) ulaşmıştır. Basitçe söylemek gerekirse, açıklamalar modelin aslında öngördüğü şeyin çok doğru temsilleriydi. Yerel açıklama yöntemleri, belirli bir tahmini görebildiğimiz ve modelin karar için neyi temel aldığını anlayabileceğimiz bir tür penceredir.

Yorumlanabilirlik performansı, insan merkezli değerlendirmeden elde edilen sadakat, istikrar, anlaşılabilirlik ve klinisyen güven puanları kullanılarak değerlendirildi. SHAP, LIME ve Grad-CAM açıklamaları, aynı veri setleri ve eğitilmiş modeller kullanılarak karşılaştırıldı. Açıklanabilirlikteki iyileşmeler, değerlendirilen açıklama yeteneği yöntemleri boyunca açıklama kalitesi metrikleri ve klinisyen değerlendirmeleri karşılaştırılarak değerlendirildi. Derin öğrenme modelleri için görselleştirme teknikleri, modellerle çalışan görselleştirme teknikleri, modelin tahminiyle en yüksek ilgiye sahip görüntülerin bölgelerini belirleyen ısı haritaları üretir. Farklı yöntemler arasında özellik önemi dağılımları ve açıklanabilirlik performans karşılaştırmaları Şekil 5'te gösterilmiştir.

figure-results-2
Şekil 5: Açıklanabilirlik Performans Değerlendirmesi.Şekil, açıklanabilirlik yöntemlerinin performansını isabet ve kararlılık metrikleri yardımıyla sunmaktadır. SHAP isabet (0.92) ve kararlılık (0.89) bakımından öncülük etmektedir; bu da açıklamalar ile model tahminleri arasında iyi uyum sağladığını gösterir. LIME, bireysel örneklerin yorumlanabilirliği için en iyi araç olarak ortaya çıkıyor. Öte yandan, Grad-CAM esas olarak görüntüleme modellerinde kullanılan görsel ısı haritaları üretir ve modelin tahmininden sorumlu en önemli bölgeleri kaba gösterir; bu bölgeler klinik açıdan çok ilgili olabilir. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Yorumlanabilirlik için öngörücü modeller ve teknikler değerlendirildikten sonra, bir modelin doğruluğu ile açıklamalarının güvenilirliği arasındaki korelasyonun çok güçlü olduğu ortaya çıktı. Aslında, tahmin iyileştirmelerini gösteren aynı modeller, yorumlanabilirlik teknikleri doğru uygulandığında sonuçlarını daha istikrarlı ve tutarlılıkla açıklıyordu. Topluluk modelleri, özellik atfetme yöntemleriyle birlikte en yorumlanabilir modeller olarak bulunurken, derin öğrenme modelleri görselleştirmeye dayalı açıklanabilir yöntemlerle daha iyi hizmet vermiştir. Tahminin doğruluğunu ve açıklamaların güvenilirliğini birbirine bağlayan bağlantı, model ile açıklanabilirlik arasındaki kavramsal dinamikleri ayrıntılı şekilde özetleyen Şekil 6'da görülebilir.

figure-results-3
Şekil 6: Modellerin karşılaştırmalı analizi ve yetenek yöntemlerini açıklamak.Grafik, çeşitli modellerin doğruluğunun ayrıntılı karşılaştırmasını ve yetenek ölçümlerini açıklar. Bu grafik, doğruluk ile açıklama kararlılığı arasındaki korelasyonu gösteren bir dağılma grafiği, performansların tablo şeklinde karşılaştırması ve farklı açıklama yetenek yöntemleri SHAP, LIME ve Grad-CAM'i ve bunların farklı model tipleriyle etkinliğini özetleyen uygunluk matrisinden oluşur. Görsel görüntü, topluluk modellerinin ve SHAP'ın büyük yorumlanabilirlik sağladığını, derin öğrenme modellerinin görselleştirme teknikleriyle açıklanabildiğini açıkça gösteriyor. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

İnsan merkezli değerlendirme, önerilen sistemin hastaneler ve diğer klinik tesislerde gerçek dünya faydasını doğruladı. Tıp profesyonelleri, açıklamalı ve açıklamasız model çıktılarını incelediler. Sonuçların açıklamalarla gösterilmesi, kullanıcı güveni ve yorumlanabilirliğinde önemli bir artışa yol açtı; Ortalama güven değeri 1'den 5'e kadar olan ölçekte 3,1'den 4,7'ye yükseldi. Güven puanındaki artış 3,1'den 4,7'ye yaklaşık %51,6'lık göreceli bir iyileşmeyi temsil eder. Önemli derecelendirmeler arası anlaşma (Fleiss'in κ = 0.81), açıklama faydalılığının klinisyenlerin tutarlı değerlendirmesini daha da göstermektedir. Bu bulgular, açıklanabilirlik çıktılarının kullanıcı güvenini artırabileceğini ve yapay zeka destekli klinik kararların yorumlanmasını kolaylaştırabileceğini göstermektedir. Profesyoneller, model çıktılarını daha iyi anladıklarını ve klinik durumların yapay zeka destekli yargısına daha yüksek güven duyduklarını belirtti; bu da sağlık hizmetlerinin gerçek uygulanmasında yorumlanabilirliğin önemini gösteriyor.

Çerçevemizin sağlamlığını ablasyon analiziyle daha da doğruladık. Açıklanabilirlik yöntemleriyle gerekli görülen kritik özelliklerin kaldırılması, tahmin performansında büyük bir kayıp yarattı. Dolayısıyla bu bulgu, özelliklerin sadece öngörü görevi için önemli ve önemli olduğunu yansıtıyor. Ayrıca, açıklama sonuçları farklı girdi örnekleri açıklandığında sadece önemsiz farklar göstermeye devam etti ve bu da açıklanabilirlik yöntemlerinin istikrarlılığını ve güvenilirliğini gösterdi.

Boru hattının pratik kullanım için uygulanabilirliğini kontrol etmek için hesaplama hızını ölçtük. Açıklanabilirlik tekniklerinin tanıtılması, özellikle özelliklerin atfedildiği ve görselleştirme oluşturulduğunda hesaplama süresinde bir miktar artışa yol açtı. Yine de, toplam uygulama süresi hâlâ mümkündü ve çok uzun değildi. Şekil 7, hesaplama zamanının boru hattının farklı aşamaları arasında nasıl paylaşıldığını göstermektedir; örneğin ön işleme, model eğitimi, açıklanabilirlik üretimi, değerlendirme ve görselleştirme.

figure-results-4
Şekil 7: Boru hattı yürütme süresinin dağılımı. Bu grafik, hesaplama zamanının açıklanabilir yapay zeka boru hattının çeşitli aşamalarına nasıl bölündüğünü gösterir; örneğin ön işleme, model eğitimi, yetenek oluşturma, değerlendirme ve görselleştirme. Veriler, zaman çizelgesinin çoğunun model eğitimi tarafından kaplandığını ve ardından yetenek işlemenin açıklandığını ortaya koyuyor. Öte yandan, ön işleme ve raporlama için harcanan zaman oldukça azdır. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Önerilen çerçevenin gücünü ablasyon analiziyle de test ettik. Açıklanabilirlik yöntemleriyle keşfedilen temel özelliklerin kaldırılması, öngörücü performansta belirgin bir düşüş gösterdi ki, bu da bu özelliklerin sadece ilgili değil, aynı zamanda oldukça önemli olduğunun açık bir göstergesidir. Bunun dışında, giriş örneklerinde küçük bir değişiklik olsa bile açıklama çıktıları oldukça stabildi; bu da açıklanabilirlik tekniklerinin tutarlılığı ve güvenilirliğinin kanıtıdır.

Kısacası, öngörücü performans, açıklanabilirlik ve insan odaklı doğrulama ölçümü birleştirilerek önerilen çerçevenin etkili olduğu gösterildi. Sistem sadece çok doğru tahminler yapmakla kalmadı, aynı zamanda son derece yorumlanabilir ve kullanımı kolay kaldı. Açıklanabilirlik yöntemlerinin getirilmesi, modelin performansına zarar vermeden tüm süreci şeffaf hale getirdi. Tahmin doğruluğu ve yorumlanabilirlikte gördüğümüz gelişmeler sadece sıkı deneysel kontrol altında yapılmadı, aynı zamanda istatistiksel olarak da anlamlıydı; bu da önerilen yolun dayanıklılığını ve özgünlüğünü gösteriyor. Öngörücü modeller arasında çift karşılaştırmalar, çapraz doğrulama katları boyunca eşleştirilmiş t-testleri kullanılarak gerçekleştirildi. Gradient Boosting ile rakip modeller arasında istatistiksel olarak anlamlı farklılıklar gözlemlendi (p < 0.05), önerilen konfigürasyonun üstünlüğünü doğruladı.

Genel bulgular.
Sonuçlar toplamda, öngörücü performansın, açıklama kalitesinin ve klinisyen güveninin birleşik ve tekrarlanabilir bir iş akışı içinde değerlendirilebileceğini göstermektedir. Çerçeve, birden fazla sağlık veri setinde tutarlı performans sürdürürken, SHAP, LIME ve Grad-CAM açıklamalarıyla şeffaf yorumu desteklemiştir. Ancak, bulgular seçilen veri setleri ve doğrulama ayarları bağlamında yorumlanmalıdır ve gerçek dünyada kullanımdan önce ek dış doğrulama gereklidir.

VERİ ERIŞILEBILIRLIĞI:
Mevcut araştırmada kullanılan veri setlerini kamu kaynaklarından elde ettik ve bunlar tanınmış veri depolarında bulunabilir. Örneğin, meme kanseri ve diyabete ilişkin veriler UCI Makine Öğrenme Deposu'ndan indirilebilir: https://archive.ics.uci.edu/ml/index.php

Elektronik sağlık kayıt veri setini (MIMIC-III) Physio Net üzerinden şu adresten edinebilirsiniz:
https://physionet.org/content/mimiciii/1.4/

Göğüs röntgeni görüntüleme verileri NIH Göğüs Xöntgeni Veri Setinden alındı ve şu adreslerde bulunabilir: https://www.kaggle.com/datasets/nih-chest-xrays/data

Bu çalışmada incelediğimiz tüm veri setleri anonimleştirilmiş ve kamuya açık hale getirilmiştir. Araştırma sırasında ürettiğimiz ön işleme adımları, eğitilmiş model ve açıklama yeteneği çıktıları, makul bir talep edilirse ilgili yazar aracılığıyla erişilebilir durumdadır. Kaynak kodu, ön işleme betikleri, yapılandırma dosyaları ve tekrarlanabilirlik kaynakları, makale kabulü sırasında kamuya açık bir depoya depolanacaktır.

Tartışma

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma, öngörücü modelleme, açıklanabilirlik değerlendirmesi, klinisyen odaklı değerlendirme ve tekrarlanabilirlik kaynaklarını tek bir protokol içinde entegre eden sağlık analizleri için tekrarlanabilir açıklanabilir yapay zeka (XAI) iş akışı geliştirmiş ve değerlendirmiştir. Sonuçlar, özellikle Gradient Boosting ve Random Forest, topluluk tabanlı makine öğrenimi modellerinin, değerlendirilen yapılandırılmış sağlık veri setlerinde en yüksek tahmin performansını elde ettiğini, derin öğrenme modellerinin ise görüntü tabanlı analizler için daha uygun olduğunu gösterdi. Bu bulgular, daha karmaşık modellerin her zaman üstün performans sağlayacağını varsaymak yerine veri özelliklerine göre model mimarisi seçmenin önemini vurgulamaktadır. Bu çalışmanın önemli katkılarından biri, tahmin modelleme, açıklanabilirlik değerlendirmesi, insan merkezli değerlendirme ve tekrarlanabilirlik uygulamalarının standart bir iş akışı içinde entegrasyonudur. Açıklanabilirlik tekniklerini izole olarak değerlendiren çalışmaların aksine, önerilen çerçeve, çeşitli sağlık veri setlerinde şeffaf ve tekrarlanabilir deneyleri destekleyen protokol odaklı bir metodoloji sunar.

Açıklanabilirlik analizi, değerlendirilen yöntemler arasında ölçülebilir farklılıklar gösterdi. SHAP, değerlendirilen deneysel koşullarda en yüksek isabet ve kararlılık puanlarını elde etti; bu da oluşturulan açıklamalar ile model tahminleri arasında daha yakın uyum sağladığını gösterdi. LIME faydalı yerel açıklamalar sağladı ancak daha düşük kararlılık sergilerken, Grad-CAM görüntüleme verileri için sezgisel görsel açıklamalar üretti. Bu bulgular, açıklama kalitesinin hem seçilen açıklanabilirlik yöntemine hem de temel öngörücü modele bağlı olduğunu göstermektedir. İnsan odaklı değerlendirme, açıklamaların dahil edilmesinin klinisyenlerin güvenini ve yorumlanabilirliğini artırdığını ayrıca gösterdi. Gözlemlenen güven puanlarındaki artış ve önemli derecelendiriciler arası anlaşma (Fleiss'in κ = 0.81), katılımcılar arasında açıklama faydasının tutarlı değerlendirildiğini göstermektedir. Bu bulgular, sağlık karar destek sistemlerinde şeffaflığı ve kullanıcı kabulünü artırmak için açıklanabilirlik yöntemlerinin potansiyel değerini desteklemektedir.

Sonuçları yorumlarken birkaç sınırlama göz önünde bulundurulmalıdır. İlk olarak, çerçeve sınırlı sayıda halka açık veri seti kullanılarak değerlendirildi ve gerçek dünya klinik ortamlarında karşılaşılan değişkenliği tam olarak yansıtmayabilir. İkinci olarak, klinisyen değerlendirmesi nispeten küçük bir katılımcı grubunu içeriyordu ve bu genellenebilirliği sınırlayabilir. Üçüncüsü, bu çalışmada incelenen açıklanabilirlik yöntemleri sonradan tekniklerdir ve bu nedenle bozulmalara duyarlılık ve açıklamalar ile gerçek model akıl yürütmesi arasındaki potansiyel tutarsızlıklar dahil olmak üzere bilinen sınırlamalara tabi kalır. Son olarak, bağımsız sağlık kurumları arasında dış doğrulama mevcut çalışmanın kapsamının dışında kalmıştır.

Gelecekteki araştırmalar, klinik kayıtları, tıbbi görüntüleme, fizyolojik sinyalleri ve giyilebilir sensör verilerini entegre eden çoklu modal sağlık analizlerini incelemelidir. Nedensel ve karşıt açıklama yöntemleri, belirsizlik niceliği, adalet değerlendirmesi, kalibrasyon analizi ve ileriye yönelik klinik doğrulama için ek çalışmalara ihtiyaç vardır. Bu tür çalışmalar, açıklanabilir yapay zeka sistemlerinin sağlıkta şeffaflığını, güvenilirliğini ve uygulanabilirliğini daha da artırabilir.

Performans değerlendirmesine ek olarak, önerilen açıklanabilir yapay zeka çerçevesinin çeşitli sağlık ortamlarında sağlam bir şekilde uygulanmasını sağlamak için birkaç pratik uygulama zorluğu ve protokol değişiklikleri göz önünde bulundurulmalıdır.

Açıklanabilirlik Yöntemlerinin Sınırlamaları

SHAP, LIME ve Grad-CAM, model davranışı hakkında faydalı bilgiler sunarken, birkaç dezavantajı da vardır. Literatürde, bu araçların tekrarlanan çalışmalarda kararsız olabileceği, bozulmalara karşı oldukça hassas olabileceği, veri setleri arasında farklılık gösterdiği ve bazen modelin gerçek nedenlerini doğru şekilde yansıtmadığı belirtilmiştir. Bu nedenle, sonradan yapılan açıklamalar yalnızca ek kanıt olarak görülmelidir ve nedensel karar mekanizmalarının gerçek tasviri olarak görülmemelidir. Açıklamaların güvenilirliğinin doğru şekilde doğrulanması, etkili klinik ortamlarda kullanılabilmeden önce hâlâ çok önemli bir adımdır.

Bu aynı zamanda, güvenilirlik doğrulamasının klinik ortamlarda uygulanmadan önce açıklanmasının gerekliliğini vurgulayan son biyomedikal yapay zeka araştırmalarının bulgularıyla da tutarlıdır. Açıklanabilirliğin dahil edilmesi, kardiyak arrest tahmin sistemlerinde doğrulamanın temel bir yönü olarak kullanılmıştır; böylece daha şeffaf olabilirler ve klinik tahminlerin güveninikazanabilirler 41. Benzer şekilde, görselleştirme odaklı açıklanabilirlik teknikleriyle karaciğer ultrason görüntü segmentasyonu, sonradan açıklamaların sınırlı olduğunu göz ardı etmeden yorumlanabilirliği artırmaya yönelikti. Bu makaleler, açıklama tutarlılığı kontrollerinin, açıklama sağlamlığı testlerinin ve klinik açıdan anlamlı açıklanabilirlik çıktısı doğrulamalarının klinik kullanım hazırlığının en yüksek seviyesinde olması için gerekliolduğunu doğrulamaktadır 42.

Kalibrasyon, Adillik, Dayanıklılık ve Dışsal Genelleme

Önerilen çerçevenin gelecekteki sürümleri, kalibrasyon eğrileri ve Brier skoru ile olasılık kalibrasyonunun değerlendirilmesini, Bayes ve topluluk tabanlı yöntemlerle belirsizliğin tahmin edilmesini, demografik alt grupların adalet denetimini ve gürültülü veriler ve değişen alan koşulları ortamında sağlamlık kontrolünü içerecektir. Bu analizler, model güveni, adil performans ve değişen klinik ortamlarda güvenilirliğin doğrudan hasta güvenliği ve klinik benimsenmesini etkilediği sağlık ortamlarında özellikle önemlidir. Son zamanlarda yapay zeka destekli bilimsel çerçeveler, geleneksel öngörücü performans değerlendirmesinin ötesinde güvenilir, şeffaf ve güvenilir karar destek sistemlerinin önemini vurgulamıştır. Son zamanlarda yapay zeka destekli bilimsel çerçeveler, geleneksel öngörücü performans değerlendirmesinin ötesinde güvenilir, şeffaf ve güvenilir karar destek sistemlerinin önemini vurgulamıştır 43.

Sorun Giderme ve Protokol Değişiklikleri

Önerilen açıklanabilir yapay zeka çerçevesinin başarılı bir şekilde uygulanması için birkaç pratik nokta dikkate alınmalıdır. Tipik bir sorun, örneğin, nispeten küçük sağlık veri setlerinde derin öğrenme modelleri eğitilirken aşırı uyum sağlamaktır. Aşırı uyum, çapraz doğrulama, erken durdurma, ayrılma düzenlemesi, veri artırımı ve kapsamlı hiperparametre optimizasyonu uygulanarak azaltılabilir. Eğitim sırasında doğrulama performansını izlemek, çok karmaşık ve kötü genelleme yapan bir modelden kaçınmanın iyi bir yoludur.

Sağlık veri setlerinde bir diğer çok önemli sorun ise sınıf dengesizliğidir; yani pozitif klinik sonuçların negatif vakalardan çok daha nadir olmasıdır. Bu sorunu ele almak için, katmanlı örnekleme, sınıf ağırlık ayarlaması, sentetik azınlık aşırı örnekleme ve F1-puanı ile ROC-AUC gibi dengeli değerlendirme metriklerinin kullanılması modelleme sürecinin bir parçası olmalıdır. Sınıf dengesizliğini görmezden gelmek, modeli gerçekten temsil etmeyen performans metrikleri ve önyargılı olabilecek klinik tahminler üretme riski taşır.

Tıbbi görüntüleme veri setleri genellikle mükemmel değildir ve gürültü, satın alma artefaktları, tutarsız kalite vb. nedeniyle bozulabilir. Bu faktörler görüntüleme cihazının türüne göre de değişir. Bu faktörler tahmin performansını olumsuz etkileyebilir ve açıklanabilirlik çıktılarını da etkileyebilir. Bu nedenle, modelin sağlamlığı ve güvenilirliği sağlanması için standartlaştırılmış ön işleme adımları, görüntü normalizasyonu, kalite kontrol kontrolleri ve veri artırma teknikleri uygulanmalıdır.

SHAP, son derece bilgilendirici özellik-atfümasyon açıklamalarının çıkarılmasını sağlar. Ancak, özellikle yüksek korelasyonlu özellikler varsa veya model sonuçları giriş verilerindeki küçük değişikliklere karşı çok hassas olduğunda, istikrarsızlık durumları göz ardı edilemez. Açıklama tutarlılığını ve güvenilirliğini artırmak için, açıklamayı birden fazla kez yazmak, birden fazla çalışmada istikrarı değerlendirmek, özellik gruplama stratejileri kullanmak ve LIME gibi diğer açıklanabilirlik yöntemleriyle karşılaştırmak önerilmektedir.

Büyük ölçekli sağlık verileri ve devasa derin sinir ağı mimarileri söz konusu olduğunda, GPU bellek sınırları en büyük kısıtlamalardan biri haline gelebilir. Bellek ihtiyaçları, toplu boyut değişiklikleri, karışık hassasiyet eğitimi, model budaması, özellik boyutlarının azaltılması ve verimli veri yüklemesinin benimsenmesiyle önemli ölçüde azaltılabilir. Ayrıca, çerçeveyi düşük kaynaklı sistemlerde uygulayan araştırmacılar, bulut bilişim ortamları veya dağıtık eğitim kullanmayı düşünebilir.

Önerilen çerçevenin modüler tasarımı, farklı sağlık uygulamaları için kolayca değişiklikler yapılmasını sağlar. Klinik göreve bağlı olarak, bilim insanları bir veya birden fazla bireysel tahmin modelini değiştirebilir, yeni açıklama yöntemleri ekleyebilir, farklı sağlık verilerini birlikte kullanabilir veya genel iş akışını değiştirmeden belirsizlik niceliği ve kalibrasyon modülleri ekleyebilir. Bu esneklik, çerçevenin çok farklı sağlık analitik vakalarında kullanılabilir olmasını sağlarken, yine de tekrarlanabilir ve yorumlanabilir hale gelir.

Düzenleyici ve Etik Değerlendirmeler:

Daha anlaşılır hale getirilen yapay zeka sistemleri sağlık hizmetlerinde büyük bir yardımcı olabilir. Ama bu yeterli değil. Şeffaflık, hesap verebilirlik, gizlilik ve hasta güvenliği talep eden düzenleyici kuralların yerine getirilmesi gerekir. Açıklanabilirlik güveni ve yorumlanabilirliği artırsa bile, tek başına klinik geçerliliği garanti edemez. Sorumlu uygulama, ileriye dönük klinik doğrulama, adalet değerlendirmesi, düzenleyici inceleme ve yerleştirme sonrası izleme gerektirir. Ayrıca, gelecekte çerçeve uygulanırken hasta gizliliği, klinisyen gözetimi ve demografik gruplar arasında adil performans dikkate alınmalıdır. Gerçek dünya klinik iş akışlarına entegre olmak için yapay zeka sistemleri ve sağlık profesyonelleri herhangi bir aksaklık olmadan etkileşimde bulunmalıdır. Bu nedenle, açıklanabilirlik bilgisi, yalnızca kendi başına çalışan ayrı araçlar değil, güncel elektronik sağlık kayıtları ve klinik karar destek platformlarının bir parçası olmalıdır. Nihai kararlar doktorlar tarafından verilmelidir; oysa açıklanabilir yapay zeka sadece şeffaflığı artıran, kanıta dayalı akıl yürütmeyi destekleyen ve sağlık çalışanları ile hastalar arasındaki iletişimi kolaylaştıran yardımcı bir teknolojidir.

Bu makale, sağlık analitiğinde açıklanabilir yapay zeka sistemlerinin geliştirilmesi, değerlendirilmesi ve yorumlanması için tekrarlanabilir bir protokol sunmaktadır. Bu katkı metodolojik ve iş akışına odaklıdır; araştırmacılar ile klinisyenlere çoklu sağlık uygulamalarında çoğaltılabilir, uyarlanabilir ve genişletilebilen standartlaştırılmış bir çerçeve sunar. Veri ön işleme, öngörücü modelleme, açıklanabilirlik yöntemleri ve performans değerlendirmesi gibi farklı yönleri tek bir birleşik bir şekilde birleştirir. Metodoloji, birden fazla sağlık veri setinde güçlü öngörücü performans göstermiştir. Yapılandırılmış veri analizi söz konusu olduğunda, model toplulukları en iyi performans gösteren gruplardırken, derin öğrenme modelleri tıbbi görüntüleme görevleri için çok etkili olduğu görülür. Ayrıca, açıklama teknikleri kullanmak, tahmin sonuçlarının hem küresel hem de yerel yorumlarını sunarak kullanıcıların modelleri anlamasını kolaylaştırır. Bu nedenle, sadece klinisyenlerin güvenini değil, aynı zamanda modellerin kullanılabilirliğini de artırır. Bulgular, açıklanabilir yapay zekanın şeffaf ve yorumlanabilir sağlık analitik sistemlerinin geliştirilmesini destekleyebileceğini, modellerin doğruluğu ve yorumlanabilirliği arasında bir uzlaşma bulunmasını destekleyebileceğini ve bu sistemlerin güvenilir ve güvenilir sağlık analizleri için vazgeçilmez olduğunu gösteriyor. Sonuç olarak, burada sunulan yöntem, sağlık profesyonellerinin güvendikleri yapay zeka teknolojilerini kullanmalarına yardımcı olabilecek çok etkili ve basit bir tıbbi veri analizi araçtır. Bu makale, sağlık analitiğinde açıklanabilir yapay zeka modellerinin geliştirilmesi, değerlendirilmesi ve yorumlanması için tekrarlanabilir bir protokol sunmaktadır. Veri ön işlemesi, öngörücü modelleme, açıklanabilirlik değerlendirmesi, klinisyen odaklı değerlendirme ve tekrarlanabilirlik kaynaklarını birleşik bir iş akışı içinde entegre ederek, protokol şeffaf sağlık AI araştırmaları için pratik bir çerçeve sağlar. İş akışı, açıklanabilir makine öğrenimi sistemlerinin tekrarlanabilir uygulaması, değerlendirilmesi ve raporlanmasını destekleyerek çeşitli sağlık veri setlerine ve uygulama alanlarına uyarlanabilir.

Açıklamalar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarlar, bu çalışmayla ilgili herhangi bir rekabet eden finansal çıkarları veya çıkar çatışmaları olmadığını belirtmektedir. Araştırma, potansiyel çıkar çatışması olarak değerlendirilebilecek herhangi bir ticari veya finansal ilişki olmadan bağımsız olarak yürütüldü.

Yapay Zeka Kullanımı Açıklaması

Yapay zeka araçları, dil geliştirme, dilbilgisi kontrolü ve makale hazırlığı sırasında editoryal destek için kullanıldı. Tüm bilimsel içerik, deneysel tasarım, veri analizi, yorumlama ve nihai makale doğrulaması yazarlar tarafından gerçekleştirilmiştir. Yazarlar, dergi yönergelerine doğruluk, bütünlük ve uyum sağlamak için tüm yapay zeka destekli çıktıları incelemiş ve doğrulamıştır.

Teşekkürler

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarlar, bu çalışmayı yürütmek için gerekli altyapı ve araştırma desteğini sağladıkları için ilgili kurumlarına teşekkür etmek isterler. Yazarlar ayrıca, önerilen açıklanabilir yapay zeka çerçevesinin geliştirilmesini ve değerlendirilmesini kolaylaştıran halka açık veri setleri ve açık kaynak araçların kullanımını da kabul etmektedir. İnsan odaklı değerlendirme aşamasında değerli bilgiler sunan alan uzmanlarına özel teşekkürler.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
GPU WorkstationÜreticiye bağlıNADerin öğrenme modellerinin eğitilmesi
Jupyter NotebookProject JupyterEn son kararlı sürümEtkileşimli deney çalıştırma
LIMELIMESürüm 0.2.0Yerel yorumlanabilir açıklamalar
MatplotlibMatplotlib ProjectSürüm 3.9Veri görselleştirme
MIMIC-III VeritabanıPhysioNetSürüm 1.4Elektronik sağlık kaydı analizi
NIH Göğüs X-ışını Veri SetiNIH Klinik MerkeziGenel Veri SetiGöğüs hastalığı sınıflandırması
NumPyNumPy GeliştiricileriSürüm 1.26Sayısal hesaplama ve dizi işlemleri
OpenCVOpenCV VakfıSürüm 4.10Görüntü ön işleme
PandasPandas Geliştirme EkibiSürüm 2.1Veri manipülasyonu ve ön işleme
Pima Hintlileri Diyabet Veri SetiUCI Makine Öğrenme DeposuGenel Veri SetiDiyabet riski tahmini
Python 3.11Python Yazılım VakfıSürüm 3.11Birincil programlama ortamı
Scikit-learnscikit-learnSürüm 1.5Makine öğrenme algoritmaları ve değerlendirme
SeabornSeabornSürüm 0.13İstatistiksel görselleştirme
SHAPSHAPSürüm 0.46Özellik atıf ve açıklanabilirlik
TensorFlowTensorFlowSürüm 2.15Derin öğrenme modeli geliştirme
Windows / Ubuntu LinuxMicrosoft / CanonicalNAİşletim sistemi
Wisconsin Meme Kanseri Veri SetiUCI Makine Öğrenme DeposuGenel Veri SetiMeme kanseri teşhisi

Yeniden basım ve izinler

Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste

İzin iste

Etiketler

EngineeringExplainable Artificial Intelligence XAIMachine learningdeep learningModel InterpretabilityClinical Decision Support SystemsReproducible Experimental Protocol

İlgili makaleler