$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Tüm ürün hattımızın açıklayıcı yapay zeka bileşenini kapsamlı şekilde değerlendirdik; farklı sağlık verileri türlerinde, hem yapılandırılmış klinik veriler hem de tıbbi görüntüler dahil olmak üzere, ne kadar iyi tahmin edildiğini değerlendirdik. Sonuçlar, değerlendirilen veri setleri boyunca tutarlı öngörücü performans gösterdi. Test edilen modeller arasında, gradyan artırma modeli %97,4 ile en yüksek doğruluğu elde etti, ardından rastgele orman modeli %94,2 ile geldi. Görüntü setlerine uygulanan derin öğrenme yöntemleri %91,3 doğruluk sağlarken, çok katmanlı perceptron modelleri %90,8 oranında biraz daha düşük sonuçlar vermiştir. Bu, toplu tabanlı makine öğrenimi modellerinin yapılandırılmış sağlık verilerinde en iyi performans gösterdiğini, derin öğrenme mimarilerinin ise görüntüleme görevlerinde üstün olduğunu gösterir. Tablo 6, tahmin fonksiyonları için doğruluk, hassasiyet, hatırlama ve F1-puanı gibi çeşitli performans metriklerini ayrıntılı olarak özetlemektedir; ayrıca güvenilirlik ve istikrar gibi açıklanabilirlik metriklerini de belirtir. Bu performans rakamlarına beş kat çapraz doğrulama uygulayarak ve sonuçları ortalama değerler olarak (%95 güven aralıklarıyla) sunarak elde ettik. Güven aralıkları sadece modelin belirsizliğini göstermekle kalmaz, aynı zamanda veri seti belleği ve model mimarilerindeki farklılıkları hesaba katarak öngörücü performans karşılaştırmalarını daha güvenilir kılar.
| Model | Doğruluk (%) | Hassasiyet | Geri Çağırma | F1-Score | Sadakatlilik | Stabilite | %95 CI |
| Rastgele Orman | 94.2 | 0.93 | 0.92 | 0.92 | 0.85 | 0.82 | 93.1–95.3 |
| XGBoost | 97.4 | 0.96 | 0.95 | 0.95 | 0.92 | 0.89 | 96.5–98.3 |
| MLP | 90.8 | 0.89 | 0.88 | 0.88 | 0.80 | 0.78 | 89.6–92.0 |
| CNN (Görüntüleme) | 91.3 | 0.90 | 0.91 | 0.90 | 0.88 | 0.86 | 90.1–92.5 |
Tablo 6: Öngörücü modeller ve açıklanabilirlik yöntemlerinin karşılaştırmalı performansı.
Bu tablo, doğruluk, hassasiyet, hatırlama, F1-puanı ve ROC-AUC dahil olmak üzere öngörücü performans metrikleri kullanılarak makine öğrenimi ve derin öğrenme modellerinin karşılaştırmalı bir değerlendirmesini sunmaktadır. Ayrıca, doğruluk, istikrar, anlaşılabilirlik ve insan güveni puanları gibi açıklanabilirlik metrikleri, hem öngörücü etkinlik hem de yorumlanabilirlik açısından kapsamlı bir değerlendirme sağlamaktadır.
Sonuçlar, Gradient Boosting'in en yüksek genel tahmin performansını (%97,4 doğruluk) elde ettiğini, Random Forest'ı 3,2 puan ve derin öğrenme modellerini 6 puandan fazla geride bıraktığını göstermektedir. Bu gözlem, toplu tabanlı öğrenme yöntemlerinin bu çalışmaya dahil edilen yapılandırılmış sağlık veri setleri için özellikle etkili olduğunu göstermektedir. CNN ve MLP modelleri arasındaki daha küçük performans farkı, yalnızca artan model karmaşıklığının değerlendirilen deneysel koşullarda mutlaka üstün öngörücü performansa dönüşmediğini göstermektedir.
Önerilen çerçevemizin çeşitli sağlık analitik görevlerinde faydalılığını göstermek için, veri setine özgü tahmin performans sonuçlarını Tablo 7'de sunuyoruz.
Veri Setine Özgü Analiz.
Performans veri setleri arasında özellik karmaşıklığı, örneklem büyüklüğü, sınıf dağılımı ve veri modalitesi farklılıkları nedeniyle değişiklik gösterdi. Meme Kanseri veri seti, muhtemelen iyi tanımlanmış özelliklerin ayrılabilirliği sayesinde en yüksek tahmin doğruluğunu sağladı. MIMIC-III ve NIH Gevs X-ışını veri setlerinde biraz daha düşük performans, uzunlamasına klinik kayıtlar ve tıbbi görüntüleme verilerinin daha karmaşık olduğunu yansıtmaktadır. Bu bulgular, çerçeve performansının veri seti özellikleri ve klinik bağlamdan etkilendiğini göstermektedir.
| Veri seti | Doğruluk (%) | Hassasiyet (%) | Geri çağırma (%) | F1 puanı (%) |
| Meme Kanseri | 97.4 | 97.2 | 97.6 | 97.1 |
| Diyabet | 94.2 | 93.9 | 94.4 | 94 |
| MIMIC-III | 91.3 | 91 | 91.5 | 91.1 |
| NIH Gevs X-ray | 90.8 | 90.4 | 91.2 | 90.6 |
Tablo 7: Veri Setine Özgü Öngörülebilir Performans Sonuçları.
Önerilen açıklanabilir yapay zeka çerçevesinin dört temsilci sağlık veri seti boyunca öngörülebilir performansı. Doğruluk, hassasiyet, hatırlama ve F1 puanı bağımsız test setlerinde yüzde (%) olarak bildirilir. Daha yüksek değerler daha iyi sınıflandırma performansını gösterir.
Öngörücü performansı değerlendirmek için, Gradient Boosting, Random Forest, Convolütional Neural Network (CNN) ve Multilayer Perceptron (MLP) olmak üzere dört makine öğrenimi ve derin öğrenme modeli dört temsilli sağlık veri setinde değerlendirildi. Model performansı, 70:15:15 tren doğrulama-testi bölünmesi ve beş katlı çapraz doğrulama sonrası bağımsız test veri setlerinde doğruluk, hassasiyet, hatırlama, F1-puan ve ROC-AUC metrikleri kullanılarak değerlendirildi. Tahmin performansındaki iyileşmeler, aynı ön işleme ve doğrulama koşullarında modele özgü değerlendirme metriklerinin karşılaştırılmasıyla belirlendi.
Model performanslarının çeşitli yöntemlerde nasıl farklılaştığını aydınlatmak için, Şekil 4 topluluk, sinir ağı ve derin öğrenme modellerinin avantaj ve dezavantajlarını resimsel olarak gösterir.

Şekil 4: Makine Öğrenimi ve Derin Öğrenme Modellerinin Sağlık Tahmin Görevlerinde Karşılaştırmalı Performansı. (A) Test veri setinde Gradient Boosting, Random Forest, CNN ve MLP modellerinin doğruluk karşılaştırması. (B) Test veri setinde Gradient Boosting, Random Forest, CNN ve MLP modellerinin F1 puan karşılaştırması. (C) Test veri setinde Gradient Boosting, Random Forest, CNN ve MLP modellerinin hassas karşılaştırılması. (D) Test veri setinde Gradient Boosting, Random Forest, CNN ve MLP modellerinin karşılaştırılmasını hatırlayın. Daha yüksek değerler daha iyi tahmin performansını gösterir. Gradient Boosting tüm değerlendirme metriklerinde en yüksek genel performansı elde etti, ardından Random Forest geldi. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Açıklanabilirlik Performansının Yorumlanması.
SHAP, değerlendirilen açıklanabilirlik yöntemleri arasında tutarlı olarak en yüksek isabet ve istikrar puanlarını elde etti; bu da oluşturulan açıklamalar ile temel model tahminleri arasında daha güçlü uyum sağladığını gösterdi. LIME, nispeten daha düşük bir kararlılık sergilemiştir; bu da yerel bozulmalara ve örnekleme değişkenliğine karşı daha yüksek hassasiyet olduğunu gösterir. Grad-CAM, görüntü tabanlı modeller için görsel olarak yorumlanabilir açıklamalar sağladı ancak SHAP'a göre biraz daha düşük isabet değerleri üretti. Bu bulgular, açıklama kalitesinin hem seçilen açıklama tekniğine hem de temel öngörücü model mimarisine bağlı olduğunu göstermektedir.
Boru hattına entegre edilen açıklanabilirlik teknikleri, performansları nicel ve niteliksel olarak değerlendirilmiştir. Özellikle, özellik atıflama yöntemleri, modelin iç mantığını farklı veri setleri arasında oldukça tutarlı şekilde ortaya çıkarmayı başarmıştır.
Çalışmada ele alınan tüm yöntemler, SHAP, değerlendirilen açıklanabilirlik yöntemleri arasında en yüksek isayette (0,92) ve stabiliteye (0,89) ulaşmıştır. Basitçe söylemek gerekirse, açıklamalar modelin aslında öngördüğü şeyin çok doğru temsilleriydi. Yerel açıklama yöntemleri, belirli bir tahmini görebildiğimiz ve modelin karar için neyi temel aldığını anlayabileceğimiz bir tür penceredir.
Yorumlanabilirlik performansı, insan merkezli değerlendirmeden elde edilen sadakat, istikrar, anlaşılabilirlik ve klinisyen güven puanları kullanılarak değerlendirildi. SHAP, LIME ve Grad-CAM açıklamaları, aynı veri setleri ve eğitilmiş modeller kullanılarak karşılaştırıldı. Açıklanabilirlikteki iyileşmeler, değerlendirilen açıklama yeteneği yöntemleri boyunca açıklama kalitesi metrikleri ve klinisyen değerlendirmeleri karşılaştırılarak değerlendirildi. Derin öğrenme modelleri için görselleştirme teknikleri, modellerle çalışan görselleştirme teknikleri, modelin tahminiyle en yüksek ilgiye sahip görüntülerin bölgelerini belirleyen ısı haritaları üretir. Farklı yöntemler arasında özellik önemi dağılımları ve açıklanabilirlik performans karşılaştırmaları Şekil 5'te gösterilmiştir.

Şekil 5: Açıklanabilirlik Performans Değerlendirmesi.Şekil, açıklanabilirlik yöntemlerinin performansını isabet ve kararlılık metrikleri yardımıyla sunmaktadır. SHAP isabet (0.92) ve kararlılık (0.89) bakımından öncülük etmektedir; bu da açıklamalar ile model tahminleri arasında iyi uyum sağladığını gösterir. LIME, bireysel örneklerin yorumlanabilirliği için en iyi araç olarak ortaya çıkıyor. Öte yandan, Grad-CAM esas olarak görüntüleme modellerinde kullanılan görsel ısı haritaları üretir ve modelin tahmininden sorumlu en önemli bölgeleri kaba gösterir; bu bölgeler klinik açıdan çok ilgili olabilir. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Yorumlanabilirlik için öngörücü modeller ve teknikler değerlendirildikten sonra, bir modelin doğruluğu ile açıklamalarının güvenilirliği arasındaki korelasyonun çok güçlü olduğu ortaya çıktı. Aslında, tahmin iyileştirmelerini gösteren aynı modeller, yorumlanabilirlik teknikleri doğru uygulandığında sonuçlarını daha istikrarlı ve tutarlılıkla açıklıyordu. Topluluk modelleri, özellik atfetme yöntemleriyle birlikte en yorumlanabilir modeller olarak bulunurken, derin öğrenme modelleri görselleştirmeye dayalı açıklanabilir yöntemlerle daha iyi hizmet vermiştir. Tahminin doğruluğunu ve açıklamaların güvenilirliğini birbirine bağlayan bağlantı, model ile açıklanabilirlik arasındaki kavramsal dinamikleri ayrıntılı şekilde özetleyen Şekil 6'da görülebilir.

Şekil 6: Modellerin karşılaştırmalı analizi ve yetenek yöntemlerini açıklamak.Grafik, çeşitli modellerin doğruluğunun ayrıntılı karşılaştırmasını ve yetenek ölçümlerini açıklar. Bu grafik, doğruluk ile açıklama kararlılığı arasındaki korelasyonu gösteren bir dağılma grafiği, performansların tablo şeklinde karşılaştırması ve farklı açıklama yetenek yöntemleri SHAP, LIME ve Grad-CAM'i ve bunların farklı model tipleriyle etkinliğini özetleyen uygunluk matrisinden oluşur. Görsel görüntü, topluluk modellerinin ve SHAP'ın büyük yorumlanabilirlik sağladığını, derin öğrenme modellerinin görselleştirme teknikleriyle açıklanabildiğini açıkça gösteriyor. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
İnsan merkezli değerlendirme, önerilen sistemin hastaneler ve diğer klinik tesislerde gerçek dünya faydasını doğruladı. Tıp profesyonelleri, açıklamalı ve açıklamasız model çıktılarını incelediler. Sonuçların açıklamalarla gösterilmesi, kullanıcı güveni ve yorumlanabilirliğinde önemli bir artışa yol açtı; Ortalama güven değeri 1'den 5'e kadar olan ölçekte 3,1'den 4,7'ye yükseldi. Güven puanındaki artış 3,1'den 4,7'ye yaklaşık %51,6'lık göreceli bir iyileşmeyi temsil eder. Önemli derecelendirmeler arası anlaşma (Fleiss'in κ = 0.81), açıklama faydalılığının klinisyenlerin tutarlı değerlendirmesini daha da göstermektedir. Bu bulgular, açıklanabilirlik çıktılarının kullanıcı güvenini artırabileceğini ve yapay zeka destekli klinik kararların yorumlanmasını kolaylaştırabileceğini göstermektedir. Profesyoneller, model çıktılarını daha iyi anladıklarını ve klinik durumların yapay zeka destekli yargısına daha yüksek güven duyduklarını belirtti; bu da sağlık hizmetlerinin gerçek uygulanmasında yorumlanabilirliğin önemini gösteriyor.
Çerçevemizin sağlamlığını ablasyon analiziyle daha da doğruladık. Açıklanabilirlik yöntemleriyle gerekli görülen kritik özelliklerin kaldırılması, tahmin performansında büyük bir kayıp yarattı. Dolayısıyla bu bulgu, özelliklerin sadece öngörü görevi için önemli ve önemli olduğunu yansıtıyor. Ayrıca, açıklama sonuçları farklı girdi örnekleri açıklandığında sadece önemsiz farklar göstermeye devam etti ve bu da açıklanabilirlik yöntemlerinin istikrarlılığını ve güvenilirliğini gösterdi.
Boru hattının pratik kullanım için uygulanabilirliğini kontrol etmek için hesaplama hızını ölçtük. Açıklanabilirlik tekniklerinin tanıtılması, özellikle özelliklerin atfedildiği ve görselleştirme oluşturulduğunda hesaplama süresinde bir miktar artışa yol açtı. Yine de, toplam uygulama süresi hâlâ mümkündü ve çok uzun değildi. Şekil 7, hesaplama zamanının boru hattının farklı aşamaları arasında nasıl paylaşıldığını göstermektedir; örneğin ön işleme, model eğitimi, açıklanabilirlik üretimi, değerlendirme ve görselleştirme.

Şekil 7: Boru hattı yürütme süresinin dağılımı. Bu grafik, hesaplama zamanının açıklanabilir yapay zeka boru hattının çeşitli aşamalarına nasıl bölündüğünü gösterir; örneğin ön işleme, model eğitimi, yetenek oluşturma, değerlendirme ve görselleştirme. Veriler, zaman çizelgesinin çoğunun model eğitimi tarafından kaplandığını ve ardından yetenek işlemenin açıklandığını ortaya koyuyor. Öte yandan, ön işleme ve raporlama için harcanan zaman oldukça azdır. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Önerilen çerçevenin gücünü ablasyon analiziyle de test ettik. Açıklanabilirlik yöntemleriyle keşfedilen temel özelliklerin kaldırılması, öngörücü performansta belirgin bir düşüş gösterdi ki, bu da bu özelliklerin sadece ilgili değil, aynı zamanda oldukça önemli olduğunun açık bir göstergesidir. Bunun dışında, giriş örneklerinde küçük bir değişiklik olsa bile açıklama çıktıları oldukça stabildi; bu da açıklanabilirlik tekniklerinin tutarlılığı ve güvenilirliğinin kanıtıdır.
Kısacası, öngörücü performans, açıklanabilirlik ve insan odaklı doğrulama ölçümü birleştirilerek önerilen çerçevenin etkili olduğu gösterildi. Sistem sadece çok doğru tahminler yapmakla kalmadı, aynı zamanda son derece yorumlanabilir ve kullanımı kolay kaldı. Açıklanabilirlik yöntemlerinin getirilmesi, modelin performansına zarar vermeden tüm süreci şeffaf hale getirdi. Tahmin doğruluğu ve yorumlanabilirlikte gördüğümüz gelişmeler sadece sıkı deneysel kontrol altında yapılmadı, aynı zamanda istatistiksel olarak da anlamlıydı; bu da önerilen yolun dayanıklılığını ve özgünlüğünü gösteriyor. Öngörücü modeller arasında çift karşılaştırmalar, çapraz doğrulama katları boyunca eşleştirilmiş t-testleri kullanılarak gerçekleştirildi. Gradient Boosting ile rakip modeller arasında istatistiksel olarak anlamlı farklılıklar gözlemlendi (p < 0.05), önerilen konfigürasyonun üstünlüğünü doğruladı.
Genel bulgular.
Sonuçlar toplamda, öngörücü performansın, açıklama kalitesinin ve klinisyen güveninin birleşik ve tekrarlanabilir bir iş akışı içinde değerlendirilebileceğini göstermektedir. Çerçeve, birden fazla sağlık veri setinde tutarlı performans sürdürürken, SHAP, LIME ve Grad-CAM açıklamalarıyla şeffaf yorumu desteklemiştir. Ancak, bulgular seçilen veri setleri ve doğrulama ayarları bağlamında yorumlanmalıdır ve gerçek dünyada kullanımdan önce ek dış doğrulama gereklidir.
VERİ ERIŞILEBILIRLIĞI:
Mevcut araştırmada kullanılan veri setlerini kamu kaynaklarından elde ettik ve bunlar tanınmış veri depolarında bulunabilir. Örneğin, meme kanseri ve diyabete ilişkin veriler UCI Makine Öğrenme Deposu'ndan indirilebilir: https://archive.ics.uci.edu/ml/index.php
Elektronik sağlık kayıt veri setini (MIMIC-III) Physio Net üzerinden şu adresten edinebilirsiniz:
https://physionet.org/content/mimiciii/1.4/
Göğüs röntgeni görüntüleme verileri NIH Göğüs Xöntgeni Veri Setinden alındı ve şu adreslerde bulunabilir: https://www.kaggle.com/datasets/nih-chest-xrays/data
Bu çalışmada incelediğimiz tüm veri setleri anonimleştirilmiş ve kamuya açık hale getirilmiştir. Araştırma sırasında ürettiğimiz ön işleme adımları, eğitilmiş model ve açıklama yeteneği çıktıları, makul bir talep edilirse ilgili yazar aracılığıyla erişilebilir durumdadır. Kaynak kodu, ön işleme betikleri, yapılandırma dosyaları ve tekrarlanabilirlik kaynakları, makale kabulü sırasında kamuya açık bir depoya depolanacaktır.