Bu protokol, üretken düşman ağları kullanılarak veri artırma, istatistiksel ve metasöristik tabanlı özellik seçimi ile açıklanabilir yapay zekayı birleştiren kalp hastalığı tahmini için bir makine öğrenimi çerçevesini tanımlar.
Method Article
Bu protokol, üretken düşman ağları kullanılarak veri artırma, istatistiksel ve metasöristik tabanlı özellik seçimi ile açıklanabilir yapay zekayı birleştiren kalp hastalığı tahmini için bir makine öğrenimi çerçevesini tanımlar.
Kalp hastalığı, dünya çapında önemli bir ölüm nedeni olup, erken tahminini önemli bir klinik ve hesaplamalı sorun haline getirmektedir. Veri kıtlığı, özellik seçimi ve model yorumlanabilirliği gibi zorlukları bireysel olarak ele alan birkaç çalışma olsa da, bu zorlukları sinerjik bir şekilde ele alan entegre bir çerçeve öneren daha az çalışma bulunmaktadır. Bu makale, aşağıdaki özellikleri içeren kapsamlı bir öngörü çerçevesi sunar: (1) sınıf dengesizliği ve veri kıtlığını ele almak için üretken bir rakip ağ (GAN); (2) Welch'in t.-testi ve Cohen'in d etkisi boyutu ile istatistiksel ön filtreleme ile Harris Hawk Optimizasyonu ile metasezgisel optimizasyonu birleştiren hibrit özellik seçim yaklaşımı; ve (3) SHAP, kısmi bağımlılık grafikleri ve oran oranları dahil olmak üzere çeşitli açıklanabilir yapay zeka yöntemleri. Bu çerçeve, Cleveland ve Statlog veri setlerinde değerlendirilmiş olup, seçilen temel ve mevcut yöntemlerle karşılaştırıldığında güçlü doğruluk, F1 puanları ve ROC-AUC değerleri elde edilmiştir. Model, makine öğrenimi performansını klinik yorumlanabilirlikle ilişkilendirerek kalp hastalığı tahmini için sağlam ve yorumlanabilir bir hesaplama çerçevesi sunar.
Kardiyovasküler hastalıklar, dünya genelinde hastalık ve ölüm nedenlerinden başlıca yer almakta olup, yılda tahmini 17,9 milyon ölüme yolaçmaktadır. Kalp hastalığının erken ve doğru tahmini, zamanında müdahale ve hasta sonuçlarının iyileştirilmesi için önemlidir. Bu bağlamda, makine öğrenimi (ML) algoritmalarıyla kalp hastalığı tahmini üç ana zorlukla karşı karşıyadır: yüksek kaliteli tıbbi verilerin sınırlı erişilebilirliği, gereksiz veya alakasız değişkenler içeren yüksek boyutlu özellik alanları ve klinik güven ile benimsemeyi engelleyebilen karmaşık modellerin kara kutudoğası 2. Son çalışmalar, makine öğrenimi ile açıklanabilir yapay zeka (XAI) yöntemlerini kalp hastalığı tahminiiçin birleştirmiştir 3. Birçok araştırmacı da kalp hastalığı tahmini ve tespiti için MLkullanmıştır 4. Üretken yapay zekadaki son gelişmeler, özellikle üretken düşman ağları (GAN'lar), sağlık hizmetlerinde veri artırımı için umutvaat ediyor 5. Aynı zamanda, Harris Hawk Optimizasyonu (HHO) ve Parçacık Sürüsü Optimizasyonu (PSO) gibi metasezgisel algoritmalar, özellik seçimi ve model optimizasyonunda etkiliolduğunu kanıtlamıştır 6. SHAP ve kısmi bağımlılık grafikleri (PDP) gibi XAI teknikleri, karmaşık model tahminlerinin yorumlanmasında önemli araçlar olarak ortayaçıkmıştır 7. Kardiyovasküler risk tahmini için ML modelleri üzerine birçok çalışmayapılmıştır 8.
Ancak, mevcut literatür bu konuları genellikle tek başına tartışır. Bazı çalışmalarGANs 9 kullanılarak veri artırımına odaklanırken, diğerleri özellikle metasezgiselalgoritmalar 10 kullanılarak özellik seçimi veya XAIyöntemleri 11 tabanlı model yorumlanabilirliği üzerine odaklanır. SMOTE tabanlı artırma, kalp yetmezliği hayatta kalma tahminiiçin araştırılmıştır 12. KNN tabanlı kalp hastalığı teşhisi debildirilmiştir 13. Bu ayrı yaklaşımlar, veri kıtlığı, özellik seçimi, model eğitimi ve yorumlanabilirliği birlikte ele alan entegre bir çerçeve aracılığıyla elde edilebilecek birleşik faydaları tam olarak kullanmıyor.
Son çalışmalar ilgili yaklaşımları araştırmıştır. 2026 yılında Frontiers in Medicine dergisinde yayımlanan bir çalışma, PSO için optimize edilmiş heterojen sınıflayıcılar önerdi; dolgu interpolasyonu ve kalp hastalığı teşhisi için medyan atama ile birleşik bir veriseti 14 üzerinde %91,3 doğruluk sağladı. Diğer son çalışmalar ise tıbbi görüntü segmentasyonu15 için metasezgisel optimizasyon, inmetahmini 16 için XAI, kardiyak aritmi sınıflandırması17 için hibrit optimizasyon ve SHAP ile geliştirilmiş klinik karar destek sistemleri18 uygulamıştır. Ancak, bu çalışmaların çok azı üretken artırma, çift kriterli istatistiksel özellik seçimi ile HHO optimizasyonu ve çoklu yöntem XAI ile tek entegre bir çerçevede birleştiriyor.
Bu makale, veri artırma, hibrit özellik seçimi, model optimizasyonu ve eğitimi ile açıklanabilirlik analizini sistematik olarak entegre eden bir kalp hastalığı tahmin çerçevesi önererek bu boşluğu kapatmayı amaçlamaktadır. Veri artırma aşamasında, GAN'lar yaş, kan basıncı, kolesterol seviyeleri ve elektrokardiyogram ölçümleri gibi hasta özelliklerine dayalı tablolu klinik veriler sentezlemek için kullanılır. GAN'lar tıbbi görüntü üretiminde yaygın olarak kullanılsa da, bu çalışma onları sınırlı örneklem büyüklüğü (n = 303) ve sınıf dengesizliğini ele almak için 13 sayısal ve kategorik özellik içeren Cleveland Kalp Hastalığı veri setine uygulamaktadır. Hibrit özellik seçimi aşamasında, Welch'in t.-testi ve Cohen'in d etkisi boyutu HHO ile birleştirilerek istatistiksel olarak sağlam ve klinik olarak ilgili özellik alt kümeleri belirlenir. Model optimizasyonu ve eğitim aşamasında, PSO yapay sinir ağının ağırlıklarını optimize etmek için kullanılırken, Lojistik Regresyon ve Rastgele Orman modelleri performans ve açıklanabilirlik arasındaki denge nedeniyle eğitilir. Açıklanabilirlik aşamasında, SHAP, PDP'ler ve oran oranları dahil olmak üzere tamamlayıcı XAI teknikleri küresel ve yerel model yorumları sağlamak için kullanılır.
Önerilen çerçevenin genel iş akışı Şekil 1'de gösterilmiştir. Tablo 1 , önerilen yaklaşım ile mevcut özellik seçme yöntemleri arasındaki temel farkları özetliyor [Tablo 1 burada].

Şekil 1: Önerilen kalp hastalığı tahmin çerçevesinin genel büzülü. İş akışı dört ana aşamadan oluşur: (1) veri kıtlığını gidermek için GAN'lar kullanılarak veri ön işleme ve artırma; (2) istatistiksel filtreleme (Welch'in t.-testi ile Cohen'in d'si) ve Harris Hawk Optimizasyonu'nu birleştiren hibrit özellik seçimi; (3) Lojistik Regresyon ve Random Forest dahil olmak üzere yorumlanabilir sınıflandırıcılarla model eğitimi ve PSO ile optimize edilmiş bir ANN; ve (4) SHAP, kısmi bağımlılık grafikleri ve oran oranları kullanılarak açıklanabilirlik analizi. Kısaltmalar: GANs = üretken düşman ağlar; PSO = Parçacık Sürüsü Optimizasyonu; ANN = Yapay Sinir Ağı. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
| Yaklaşım Kategorisi | İstatistiksel Testler (örneğin, t-testi) | Etki Boyutu (örneğin, Cohen'in d'si) | Meta-sezgisel Optimizasyon (örneğin, HHO/PSO) | Yorumlanabilirlik Odağı |
| Geleneksel istatistikler | Evet | Nadiren | Hayır | Tılımlı |
| Saf Optimizasyon | Hayır | Hayır | Evet | Düşük |
| Mevcut Hibrit Yöntemler | Bazen | Nadiren | Evet | Değişken |
| Önerilen Çerçeve | Evet (Welch'in t-testi) | Evet (Cohen'in d ≥ 0.5) | Evet (HHO) | Yüksek (XAI entegreli) |
Tablo 1: Kalp hastalığı tahmininde özellik seçimi yaklaşımlarının karşılaştırılması. Karşılaştırılan yaklaşımlar arasında Geleneksel İstatistik, Saf Optimizasyon, Mevcut Hibrit Yöntemler ve Önerilen Çerçeve yer alır: İstatistiksel Test, Etki Boyutu, Meta Sezgirik Optimizasyon ve Yorumlanabilirlik Odak.
Bu çalışmanın başlıca katkıları şunlardır. İlk olarak, veri kıtlığı ve sınıf dengesizliğini ele almak için, ikili çapraz entropi kaybı ve Adam optimizasyonu ile standart bir GAN uygulanır; ayrıca TensorFlow mevcut olmadığında Gauss pertürbasyon geri dönüşü uygulanır. İkinci olarak, özellik yedekliğini ele almak için, istatistiksel ön filtreleme ile HHO ile V-şekilli bir transfer fonksiyonu kullanan hibrit bir özellik seçim stratejisi önerilmiştir. Bu çift kriterli yaklaşım, hem istatistiksel olarak anlamlı hem de klinik olarak ilgili özellikleri seçmeyi amaçlar. Üçüncü olarak, model opaklığını ele almak için, SHAP arı sürüsü ve şelale grafikleri, PDP'ler ve %95 güven aralıklı oranları içeren çoklu yöntemli açıklanabilirlik paketi entegre edilmiştir. Klinik kullanıcılar için basit bir uzlaştırma protokolü sağlanır: Bir PDP doğrusal olmayan bir eğilim gösterirse, SHAP açıklaması lojistik regresyon katsayılarından daha öncelikli olmalıdır. Dördüncü olarak, tekrarlanabilirliği ve yapılandırılmış doğrulamayı desteklemek için çerçeve katmanlı çapraz doğrulama, adalet denetimi, ablasyon çalışmaları, MIMIC-III için harici doğrulama protokolü ve temel hiperparametrelerin dokümantasyonu içerir.
Access restricted. Please log in or start a trial to view this content.
Etik beyanı, veri seti, yazılım ve veri hazırlama
Bu çalışmanın bulguları, UCI Makine Öğrenimi Deposu'nun Kalp Hastalığı veri setine dayanmaktadır. Bu kamuya açık ve kimliği belirsiz bir kaynak olduğundan, kullanımı etik komite onayı gerektirmemiştir. Yazarlar ayrıca bu el yazmasının orijinalliğini doğrularak, daha önce yayımlanmadığını veya başka dergilere gönderilmediğini doğrulamaktadır.
Cleveland Kalp Hastalığı veri seti eğitim ve test setlerine 80/20 oranında ayrıldı. Veri seti genellikle 303 örnek içerir; Bu nedenle, yaklaşık 242 örnek eğitim için kullanıldı ve 61 örnek temiz test seti olarak tutuldu. GAN veya Gauss yedek yöntemiyle üretilen sentetik örnekler, veri sızıntısı riskini azaltmak için yalnızca eğitim verilerine eklenmiştir. Son artırılmış eğitim seti, yaklaşık 242 gerçek örnek ve 1.000 sentetik örnekten oluşarak 1.242 eğitim örneği elde etti. Sabit bir statik doğrulama seti kullanılmadı. Bunun yerine, model eğitimi sırasında katmanlı çapraz doğrulama uygulandı ve her katman artırılmış eğitim verilerini eğitim ve doğrulama alt kümelerine böldü.
Veri seti bir Pandas DataFrame'e yüklendi ve eksik değerler için incelendi. Eksik değerleri olan sayısal özellikler, scikit-learn'den alınan SimpleImputer sınıfıyla strateji = 'median' kullanılarak medyan ödümleme kullanılarak ele alındı. Eksik değerleri olan kategorik özellikler, mod imputasyonu kullanılarak SimpleImputer ile strategy = 'most_frequent' kullanılarak ele alındı. Eksiklik mekanizmaları, her özellik için eksik yüzde hesaplanarak belgelenmiştir; df.isnull().sum() / len(df). Rastgele olmayan eksiklik desenleri, sayısal özellikler için t.-testleri ve kategorik özellikler için ki-kare testleri kullanılarak veriler eksik ve eksik olmayan örnekler arasında diğer özelliklerin ortalama değerleriyle karşılaştırılarak değerlendirildi. Eksiklik, daha sonra uygunsa Tamamen Rastgele Eksik (MCAR), Rastgele Eksik (MAR) veya Rastgele Olmayan Eksik (MNAR) olarak belgelendi.
Önemli eksikliği olan veri setleri için, medyan/mod ödümlemesi ile Zincirli Denklemlerle Çoklu Tümleştirme (MICE) karşılaştırılarak bir hassasiyet analizi önerildi; bu analiz fancyimpute kullanıldı. max_iter = 10 ile iterativeImputer ve fancyimpute ile KNN imputation. k = 5 olan KNN. 0.03'ten küçük bir doğruluk farkı,12. hesaplama yöntemine karşı dayanıklılığı göstermek olarak kabul edilmiştir. Bu duyarlılık analizi, sınırlı eksiklik nedeniyle Cleveland veri seti için isteğe bağlı olarak kabul edildi, ancak %5'ten fazla eksik değeri olan diğer klinik veri setleri için önerildi. Eksiklik desenleri de missingno kütüphanesi kullanılarak msno.matrix(df) ile bir eksiklik matrisi ısı haritası oluşturularak görselleştirildi. Eksiklik kalıplarının kümelenmesi, eksik değerlerin sistematik olarak birlikte olup olmadığını belirlemek için kullanıldı; bu da klinik uzman görüşü gerektiren MNAR mekanizmalarını gösterebilir.
Sayısal özellikler z-skor normalizasyonu kullanılarak standartlaştırıldı. scikit-learn'den StandardScaler eğitim verilerine yerleştirildi ve ardından hem eğitim hem de test setlerine uygulandı. Kategorik değişkenler tek sıcak kodlama kullanılarak kodlanmıştır. Dört kategoriden oluşan göğüs ağrısı tipi (cp) pandas.get_dummies kullanılarak dört ikili gösterge sütununa dönüştürülmüştür. Üç kategoriden oluşan talasemiya (thal) üç ikili gösterge sütununa dönüştürülmüştür. GAN üreteci ve ayrımcı, tek sıcak kodlamadan önce orijinal veri setine karşılık gelen sabit 13 özelliklik bir giriş/çıkış boyutu kullandığı için, sentetik örnekler orijinal 13 özellik alanında üretilir ve gerçek veri ile aynı tek sıcak kodlama boru hattı üzerinden geçirilirdi. Bu, GAN mimarisiyle uyumluluğu korurken kodlanmış özelliklerin model eğitimi için kullanılmasına olanak tanır.
Matematiksel tanımlar ve kalite metrikleri
Fréchet mesafesi, gerçek ve sentetik özellik dağılımlarını karşılaştırmak için kullanıldı. İki dağılım F ve G arasındaki Fréchet mesafesi Fr(F, G) şu şekilde tanımlanmıştır:
Fr2(F,G)=minX,YE|X-Y|2 (1)
burada E beklentiyi temsil eder ve en düşük nokta, sırasıyla F ve G dağılımlarına sahip tüm rastgele değişkenler X ve Y üzerindenalınır, bunlar sırasıyla 19.
Metasezgisel optimizasyon yöntemi olarak Harris Hawk Optimizasyonu (HHO) kullanıldı. HHO, HarrisHawks 20'nin işbirlikçi avlanma davranışından ilham almıştır. Keşif ve sömürme aşamaları arasındaki geçiş, kaçış enerjisi E tarafından kontrol ediliyordu. Keşif aşamasında, burada |E| 1≥ güncelleme şu şekilde tanımlandı:
X(t+1) = Xrand (t) - r1 | Xrand (t) - 2r2X (t)|
Sömürü aşamasında, burada |E| 1< güncellemeler kaçış enerjisi E = 2E(1 − t/T) ve zıplama gücü J = 2(1 − r5) ile belirlendi. Yumuşak kuşatma durumunda, burada ≥ 0.5 ve |E| ≥ 0.5'te güncelleme şu şekilde tanımlandı:
X(t+1) = ΔX(t) - E|JXtavşan (t) - X(t)|
Zorlu kuşatma durumunda, burada ≥ 0.5 ve |E| < 0.5'te güncelleme şu şekilde tanımlandı:
X(t+1) = Xtavşan (t) - E|ΔX(t)|
Adalet, Hardt ve ark.20 ve Lima ve ark.21'in izlediği istatistiksel parite ve hata oranı dengesi kullanılarak değerlendirildi. Demografik eşitlik farkı, eşitlenmiş oran farkı ve yaşa dayalı kalibrasyon hatası adalet ölçütleri olarak kullanıldı.

ΔEO = max(|TPRA - TPRB |,| FPRA - FPRB |)
ΔBS=|BSyaş<50 - BSyaş>50 |
burada BS, Brier Puanıdır:

Dashboard yorumlanabilirliği, koalisyonel oyun teorisi kullanılarak hesaplanan SHAP değerlerine dayanıyordu18.

burada Φi, i özelliği için SHAP attıfını temsil eder, F. f(S) tüm özelliklerin kümesini temsil eder ve S özelliklerinin alt kümesi için model tahminini temsil eder.
GAN tabanlı veri artırma
Veri kıtlığı ve sınıf dengesizliğini gidermek için, sentetik örnekler oluşturmak için Üretken Karşı Çıkarıcı Ağ (GAN) kullanıldı. Jeneratör mimarisi TensorFlow/Keras ile yapılandırılmıştır. Standart normal dağılım N(0,1)'den örneklenen 100 boyutlu bir gürültü vektörünü kabul etti ve ardından ReLU aktivasyonu kullanılarak 128, 256 ve 512 birimli yoğun katmanlar geldi. Çıkış katmanı, orijinal özellik boyutuna karşılık gelen 13 birim içeriyordu ve sigmoid aktivasyon kullanıyordu.
Ayrımcı mimarisi, girdi olarak 13 boyutlu bir özellik vektörünü kabul etti. LeakyReLU aktivasyonu kullanan yoğun katmanlardan oluşuyordu ve α = 0.2 olan LeakyReLU aktivasyonu kullanılıyordu. Çıkış katmanı, gerçek ve sentetik örneklerin ikili sınıflandırılması için sigmoid aktivasyonlu bir birim içeriyordu.
GAN, 64 parti büyüklüğüyle 100 dönem boyunca eğitildi. Adam optimizatörü öğrenme hızı 0.0002, β1 = 0.5 ve β2 = 0.999 ile kullanıldı. Her dönemde, ayrımcılayıcı sırayla gerçek ve sentetik partiler üzerinde eğitiliyor, jeneratör ise ayrımcıyı kandıracak şekilde eğitiliyordu. Eğitimden sonra, jeneratöre 1.000 rastgele gürültü vektörü girilerek 1.000 sentetik örnek üretildi ve bu örnekler sadece eğitim setine eklendi.
GAN eğitimi sırasında mod çöküşü, her 10 dönemde oluşturulan 100 örnek üzerinde her sentetik özelliğin varyansı ölçülerek izlendi. Herhangi bir özelliğin varyansı, üç ardışık kontrol için karşılık gelen gerçek veri varyansının %10'unun altına düşerse, mod çökmesi şüphesi ortaya çıktı. Azaltma stratejileri arasında öğrenme oranını 1× 10⁻4'e düşürmek, parti sayısını 128'e çıkarmak, farklı ağırlık başlatımıyla antrenmanı yeniden başlatmak veya standart GAN'ın yerine Wasserstein GAN with Gradient Penalty (WGAN-GP) yer almak, Arjovsky ve ark.17 tarafından tanımlanmıştır. Uygulama, TensorFlow mevcut olmadığında sentetik veri üretimini sağlamak için standart bir GAN ve Gauss perturbasyon yedek geri dönüşü kullandı.
Sentetik veri kalitesi, gerçek ve sentetik özellik dağılımları arasındaki Fréchet Mesafesi hesaplanarak özel bir uygulama kullanılarak değerlendirildi. Lojistik regresyon gibi bir sınıflandırıcı da gerçek ile sentetik örnekleri ayırt etmek için eğitilmişti; Neredeyse şans tesadüfi sınıflandırma doğruluğu yüksek isayeti göstermek olarak değerlendirildi. Hassas Geri Çağırma AUC hesaplandı ve 0.9'un üzerindeki değerler iyi dağılım yakalama göstergesi olarak kabul edildi. Gerçek ve sentetik veri setlerindeki özellik çiftleri arasındaki Pearson korelasyonları da karşılaştırıldı; 0.05 altındaki farklar korelasyon yapısının kabul edilebilir korunması olarak değerlendirildi.
TensorFlow/Keras kullanılamazsa veya GAN eğitimi başarısız olduğunda, Gauss perturbasyon yedek yöntemi kullanıldı. Her sınıf için, her özelliğin ortalaması (μ) ve standart sapması (σ) eğitim setinden hesaplandı. Sentetik örnekler daha sonra aşağıdaki şekilde üretildi:
Xsynthetic = μ + ε × σ × 0.05, burada ε ~ N(0,1)
Sınıf etiketleri, orijinal sınıf dağılımına orantılı olarak oluşturuldu. Bu yedek, derin öğrenme bağımlılığı olmayan ortamlar arasında tekrarlanabilirliği desteklemek için dahil edilmiştir.
Hibrit özellik seçimi
İki aşamalı hibrit özellik seçimi stratejisi uygulandı. İlk aşamada istatistiksel ön filtreleme yapıldı. X özellik kümesindeki her xi özellik için, değerler ikili sonuç değişkenine göre iki gruba ayrılmıştır: G0 için y = 0, hastalık olmadığını gösterir; G1 ise y = 1, hastalık varlığını gösterir. Welch'in iki örneklemli t.-testi, equal_var = Yanlış olan scipy.stats.ttest_ind kullanılarak gerçekleştirildi. Cohen'in d etkisi boyutu daha sonra şu şekilde hesaplandı:
d = (ortalama1 − orta2) / pooled_std
burada:
pooled_std = sqrt((std12 + std22)/2)
Özellik adı, p-değeri ve Cohen'in d değeri bir sonuç tablosunda saklanıyordu. Özellikler, her iki kriterle de karşılık geliyorsa seçildi: p-değeri < 0.05 ve |Cohen'in d| ≥ 0.5. Ortaya çıkan özellik seti Xfiltered olarak tanımlandı.
Welch'in t-testi, yaş, talakh ve oldpeak gibi sürekli sayısal özellikler için uygun olduğu için kullanıldı. Cinsiyet ve exang gibi ikili kategorik özellikler için, t.-testi iki grubun karşılaştırılmasında orantı testine benzer sonuçlar verir. cp ve thal gibi çok kategorik özellikler tek bir sıcak kodlandı ve her ikili gösterge sonuç değişkenine karşı ayrı ayrı test edildi. Bu yaklaşım, Cleveland veri setinde 30'dan fazla örnek bulunduğu, özelliklerin analizden önce standartlaştırıldığı ve equal_var = Yanlış gruplar arasındaki eşit olmayan varyansları hesaba kattığı için uygun görüldü. Normalliği ciddi ihlal eden özellikler için Mann-Whitney U testi alternatif bir parametrik olmayan test olarak değerlendirildi.
Eşik p < 0.05 geleneksel istatistiksel anlamlılığı takip ederken, |Cohen'in d| ≥ 0.5, orta ila büyük bir etki boyutuna karşılık geliyordu. Küçük örneklem büyüklüklerine veya nadir sonuçlara sahip veri setleri için, bootstrap tabanlı ayarlama, Hedges g düzeltmesi veya gevşetmiş keşif eşikleri uzman klinik katkılarıyla önerildi. Örneğin, Cohen'in d güven aralıklarını hesaplamak için 1.000 bootstrap yeniden örnekleme kullanılabilir ve küçük örneklem yanlılığını düzeltmek için Hedges'in g'si uygulanabilir. Sınırda istatistiklere sahip özellikler, örneğin 0.03 ile 0.08 arasında p-değerler veya |d| 0.4 ile 0.6 arasında değerler, hariç tutmadan önce olası klinik uzman incelemesi için belgelendi.
İkinci aşamada, istatistiksel olarak filtrelenen özellik setine Harris Hawk Optimizasyonu (HHO) uygulandı. HHO nüfus büyüklüğü 20 olarak belirlendi ve maksimum iterasyon sayısı 50 olarak belirlendi. Her çözüm, Xfiltered'deki özellik sayısına eşit uzunluğu olan ikili bir vektör olarak temsil edildi; burada 1, bir özelliğin seçildiğini, 0 ise seçilmediğini belirtirdi. Sürekli HHO pozisyonları, V-şekilli transfer fonksiyonu kullanılarak ikili vektörlere eşlenmiştir:
T(x) = |tanh(x)|
İkili değer T(x) 0.5 > 0 olarak ayarlanmıştı. V şeklindeki fonksiyon, ikili dönüşüm sırasında dengeli keşif ve sömürü desteklediği için seçilmiştir.
Her çözüm için uygunluk fonksiyonu lojistik regresyon kullanılarak tanımlanmıştır. Lojistik regresyon modeli yalnızca ikili vektör tarafından seçilen özellikler kullanılarak eğitildi ve scikit-learn'den cross_val_score kullanılarak 5 katlı çapraz doğrulama yapıldı. Uygunluk şu şekilde hesaplandı:
uygunluk = 1 − ortalama doğruluk
Şahin pozisyonlarının popülasyonu, [−1, 1] aralığında numpy.random.uniform(−1, 1, (population_size, n_features)) kullanılarak tekiz şekilde başlatıldı ve tekrarlanabilirlik için sabit rastgele tohum 42 oldu. Her iterasyonda tüm şahinlerin uygunluğu değerlendirildi, en iyi şahin pozisyonu tavşan olarak belirlendi ve kaçış enerjisine dayalı HHO keşif ve kullanım denklemleri kullanılarak şahin pozisyonları güncellendi. Yakınsamadan sonra, en iyi performanslı ikili vektör, nihai özellik alt kümesi olan Xfinal olarak seçilmiştir.
Seçilen özellikler, sabit rastgele tohumla tek bir HHO optimizasyon çalışmasından kaydedildi. Daha yüksek istatistiksel güven gerektiren uygulamalar için, farklı rastgele tohumlarla 30 bağımsız çalışma önerildi ve en az %80'inde görülen uzlaşı özellikleri seçilebildi. Bildirilen uygulama, tek bir temsilci çalışmaya dayanıyordu; ön testler tutarlı yakınsamayı gösterdi.
Model eğitimi ve optimizasyonu
Üç model değerlendirildi: Lojistik Regresyon, Rastgele Orman ve PSO ile optimize edilmiş Yapay Sinir Ağı (ANN). Lojistik Regresyon, sınıf dağılımını korumak için katmanlı 5 katlı çapraz doğrulama kullanılarak eğitilmiştir. Düzenleme gücü C, arama alanı C
kullanılarak optimize edildi [0.001, 0.01, 0.1, 1, 10]. Her katlama ve her C değeri için, model eğitim katında eğitildi ve doğrulama katında değerlendirildi. Kıvrımlar arasında ortalama doğrulama doğruluğunu en üst düzeye çıkaran C değeri seçildi.
Random Forest modeli, hiperparametre ayarlaması kullanılarak eğitildi. Arama alanı max_depth = [5, 10, 15, Hiçbiri] ve min_samples_split = [2, 5, 10] içeriyordu. 5 katlı çapraz doğrulama ile ızgara araması, GridSearchCV üzerinden optimizasyon metriği olarak ROC-AUC kullanılarak puanlama = 'roc_auc' ile gerçekleştirilmiştir. Seçilen Rastgele Orman modeli max_depth = 10 ve min_samples_split = 5 kullandı. Çantadan çıkan (OOB) skor tahmini oob_score = Doğru kullanılarak etkinleştirildi.
Aşırı uyum, eğitim doğruluğu ile OOB puanı arasındaki fark hesaplanarak değerlendirildi:
overfitting_gap = training_accuracy − oob_score
0,05'in altında bir aşırı uyum aralığı iyi genellemenin göstergesi olarak kabul edilirken, 0,10'dan büyük bir boşluk max_depth azaltma veya min_samples_split artırma ihtiyacını gösteriyordu. OOB puanı 0.9296 ve tipik eğitim doğruluğu 0.94 ile 0.96 arasında olduğunda, fark yaklaşık 0.01–0.03 arasındaydı.
Bir ANN sınıflandırıcısı da Parçacık Sürüsü Optimizasyonu (PSO) kullanılarak optimize edilmiştir. ANN mimarisi, bir giriş katmanı, ReLU aktivasyonu kullanan 64 nöronun olduğu bir gizli katman ve sigmoid aktivasyon kullanan bir nöronlu çıkış katmanından oluşuyordu. PSO, 50 parçacık ve 50 iterasyonla başlatıldı ve ilk ağ ağırlıklarını optimize etmek için kullanıldı. ANN, daha sonra standart geri yayılma ile eğitildi. PSO optimizasyonu, iç içe çapraz doğrulama olmadan aynı eğitim verisi üzerinde gerçekleştirildiği için bu bileşen temkinli bir şekilde ele alındı. Gelecekteki uygulamalar için, iç içe çapraz doğrulama önerildi; değerlendirme için dış 10 katlı döngü ve PSO hiperparametre seçimi için iç 10 katlık döngü kullanıldı. 0.08'in altında genelleştirme boşluğu kabul edilebilir kabul edilirken, 0.15'in üzerindeki boşluk model basitleştirilmesi gerektiren potansiyel aşırı uyum anlamına gelir.
Model değerlendirmesi
Model değerlendirmesi, son özellik seti Xfinal üzerinde katmanlı 10 kat çapraz doğrulama kullanılarak gerçekleştirildi. Her katmanda, Lojistik Regresyon ve Rastgele Orman modelleri eğitim verileri üzerinde eğitildi ve doğrulama verileri üzerinde değerlendirildi. Doğruluk, Hassasiyet, Hatırlama, F1-puanı ve ROC-AUC scikit-learn'den classification_report ve roc_auc_score kullanılarak hesaplandı. Tüm metriklerin ortalama ve standart sapmaları 10 kat üzerinden hesaplandı.
Genelleştirme boşluğu her katlama için de şu şekilde hesaplandı:
generalization_gap = training_accuracy − validation_accuracy
Tüm 10 katlama arasındaki ortalama genelleme farkı rapor edildi. 0.08'in altında ortalama boşluk minimum aşırı uyumu gösterirken, 0.15'in üzerindeki boşluk aşırı uyum ve düzenlendirme veya azaltılmış model karmaşıklığı gerekliliğini gösteriyordu. Wilcoxon imzalı sıralama testleri, önerilen çerçeveyi 10 katlama üzerinden temel yöntemlerle karşılaştırmak için α = 0.01 kullanılarak gerçekleştirildi.
Açıklanabilirlik analizi
Açıklanabilirlik analizi, modele özgü ve modelden bağımsız yöntemlerle gerçekleştirildi. Lojistik Regresyon için nihai model takıldı ve seçilen her özellik için katsayılı değerler çıkarıldı. Olasılık oranları exp(katsayı) olarak hesaplandı ve %95 güven aralıkları katsayıların standart hataları kullanılarak hesaplandı.
Random Forest için, Gini önem puanları feature_importances_ özniteliği kullanılarak eğitilen modelden çıkarıldı ve toplamı 1'e ayarlandı. SHAP açıklamaları SHAP kütüphanesi kullanılarak oluşturuldu. Bir KernelExplainer nesnesi, eğitilen model ve 100 rastgele seçilmiş eğitim örneği gibi bir arka plan veri seti kullanılarak oluşturuldu. SHAP değerleri, test kümesindeki tüm örnekler için shap_values kullanılarak hesaplandı. Beeswarm özet grafikleri shap.summary_plot kullanılarak oluşturuldu ve shap.bar_plot kullanılarak ortalama mutlak SHAP değerlerinin çubuk grafikleri oluşturuldu.
SHAP analiziyle belirlenen en üst özellikler için Kısmi Bağımlılık Grafikleri (PDP) oluşturuldu. Her seçilen özellik için, özellik aralığını kapsayan bir değer dizisi oluşturulurdu. Her değer, diğer özellikler sabit tutularak özellik sütununa yerleştirildi ve tüm örnekler için ortalama tahmin edilen olasılık hesaplandı. Özellik değerleri matplotlib kullanılarak ortalama tahminlerle karşılaştırıldı. %95 güven aralıkları 100 bootstrap yeniden örnekleme yinelemesi kullanılarak eklendi.
Seçilen özellikler için bireysel Koşullu Beklenti (ICE) grafikleri, özellik değerleri değiştikçe bireysel örnekler için tahmin yörüngeleri çizerek oluşturuldu. PDP hattı ICE arsasının üzerine konmuştu. Açıklama yöntemleri, Spearman'ın Lojistik Regresyon oranları ile Rastgele Orman SHAP değerleri arasındaki sıralama korelasyonu scipy.stats.spearmanr kullanılarak hesaplanarak karşılaştırıldı. Klinik yorum için açıklama yöntemleri arasındaki tutarsızlıklar belgelendi. SHAP ve lojistik regresyon katsayıları çeliştiğinde, bu özellik için PDP incelendi. PDP doğrusal olmayan bir eğilim gösterdiyse, SHAP açıklaması lojistik regresyon katsayısına göre önceliklendirilmiştir çünkü Random Forest, doğrusal modellerin yakalayamadığı doğrusal olmayan ilişkileri yakalayabilir.
MIMIC-III kullanılarak harici doğrulama için çerçeve genelleme protokolü
Çerçevenin MIMIC-III veritabanına uygulanması için harici bir doğrulama protokolü hazırlandı. MIMIC-III'e erişim için PhysioNet onayı ve gerekli insan denek eğitiminin tamamlanması gerekir. Önerilen kohort, ilk yoğun bakıma yatan 18 yaş ve üzeri yetişkin hastaları ve akut miyokard enfarktüsü için ICD-9 kodları 410–414 veya iskemik kalp hastalığı için ICD-10 kodları I20–I25 içerecektir. Dışlama kriterleri arasında hedef özelliklerdeki %30'dan fazla eksik değerler, 24 saatin altında kalma süresi, 90 yaşın üzeri yaş, önceki kalp cerrahisi veya doğuştan kalp hastalığı yer alacaktır.
Önerilen sonuç, hastane içi ölüm, kardiyojenik şok veya müdahale gerektiren ventriküler aritmi bileşimi olarak tanımlanan, yatıştan sonraki 72 saat içinde büyük olumsuz kardiyak olaylar (MACE) oldu. Kalp atış hızı ve kan basıncı gibi zaman serisi özellikleri, yoğun bakımda kalmanın ilk 24 saati boyunca ortalama, medyan, minimum, maksimum ve trend kullanılarak toplanır; burada trend, zaman içinde doğrusal regresyondan alınan eğim olarak tahmin edilir. Maksimum kalp atış hızı, haritalanmış thalach'ın eşdeğeri olarak kullanılır.
Cleveland veri seti özellikleri MIMIC-III değişkenleriyle eşlenecek. Örneğin, talak, yoğun bakımda kalmanın ilk 24 saatinde kaydedilen maksimum kalp atış hızına eşlenir, cp yapılandırılmış ağrı değerlendirmelerine ve NLP çıkarılmış göğüs ağrısı anımlarına eşlenir, oldpeak ise EKG raporlarından ST-segment sapmasına eşlenir. Tüm özellik hizalamalarını belgelemek için bir haritalama tablosu oluşturulur.
Tam boru hattı uygulanmadan önce, oldpeak için NLP çıkarımı 100 rastgele seçilmiş EKG raporunda doğrulanırdı. Hassasiyet, hatırlama ve F1 puanı, iki klinisyen tarafından manuel notlama ile hesaplanacaktı. F1 puanı 0.85'in altında ise, regex desenleri revize edilir veya alternatif olarak chartevents'ten alınan yapılandırılmış EKG verileri kullanılır. Ön işleme boru hattı çıkarılan MIMIC-III verilerinde tekrarlanacak, GAN artırım için yeniden eğitilecek, hibrit özellik seçimi yeniden uygulanacak, modeller yeniden eğitilecek, açıklamalar oluşturulacak ve performans metrikleri Cleveland veri seti sonuçlarıyla karşılaştırılacaktı.
Klinik gösterge paneli uygulaması
Web tabanlı bir klinik gösterge paneli prototipi, Flask veya Django gibi bir çerçeve kullanılarak tasarlandı. HL7/FHIR API uç noktaları EHR entegrasyonu için planlandı; kimlik doğrulama ve yetkilendirme kurumsal güvenlik politikalarına göre yapılandırıldı. Veri eşleme fonksiyonları, EHR verilerini model giriş formatına dönüştürmek için tasarlanmıştır.
Kullanıcı arayüzü üç ana görünümden oluşuyordu. Ön tarama görünümü, hasta demografisini ve renk kodlu risk seviyeleriyle hesaplanmış risk puanlarını gösterdi. Karar destek görünümü, belirli bir hasta için en çok katkıda bulunan faktörleri gösteren bir SHAP şelale tablosu gösterdi. Müdahale-planlama görünümü, değiştirilebilir risk faktörlerini ayarlayarak ve güncellenmiş risk tahminlerini göstererek 'ya şöyle' analizini mümkün kıldı. Raporları PDF dosyası olarak kaydetmek veya EHR dokümantasyon sistemleriyle entegre etmek için dışa aktarma işlevi de dahil edildi.
Gelecekteki klinik uygulama için, en az beş klinisyenle birlikte dashboard kullanılabilirlik değerlendirmesi planlandı. Değerlendirme, hedef puanı 68'in üzerine, görev tamamlanma süresine ve yalnızca EHR kullanımına kıyasla en az %20 oranında hedef azalmaya sahip Sistem Kullanılabilirlik Ölçeği'ni ve açıklama netliği ile güven için 5 puanlık memnuniyet ölçeğini kullanacaktır. Bu kullanılabilirlik değerlendirmesi gelecekteki bir adım olarak planlanmış ve mevcut çalışmada uygulanmamıştır.
Access restricted. Please log in or start a trial to view this content.
Deneysel ortamlar ve performans metrikleri
Tüm deneyler scikit-learn, TensorFlow ve SHAP kütüphaneleri kullanılarak Python 3.9'da gerçekleştirildi. Katmanlı 10 katlı çapraz doğrulama uygulandı. Değerlendirme metrikleri arasında Doğruluk, Hassasiyet, Hatırma, F1-puan ve ROC-AUC yer alıyordu.
Seçilmiş temel yöntemlerle performans karşılaştırması
Access restricted. Please log in or start a trial to view this content.
Burada belirtilen çerçeve, yorumlanabilir kalp hastalığı tahmin modelleri geliştirmek için tekrarlanabilir bir yaklaşım sunar. Bu açıklamaları entegre eden bir prototip klinik gösterge paneli, üç aşamalı bir iş akışı uygulayan Şekil 4'te gösterilmiştir: ön tarama, SHAP ile karar desteği ve müdahale planlaması [Şekil 4 burada]. Bu çerçevenin başarılı bir şekilde uygulanmasını sağlamak için birkaç kritik adım yakından takip edilmesi gerekir.
Access restricted. Please log in or start a trial to view this content.
Yazarların beyan edecek çıkar çatışmaları yoktur.
Yazarlar, araştırma olanakları sağlama konusundaki Capital (Helwan) Üniversitesi ve Arap Açık Üniversitesi'nin desteğini takdir etmektedir. Bu araştırma, kamu, ticari veya kar amacı gütmeyen sektörlerdeki finansman kuruluşlarından özel bir hibe almamıştır.
Access restricted. Please log in or start a trial to view this content.
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| Cleveland Kalp Hastalığı Veri Seti | UCI Makine Öğrenme Deposu | https://archive.ics.uci.edu/ml/datasets/heart+disease | Model geliştirme/değerlendirme için kullanılan kıyaslama kalp hastalığı veri seti |
| Django | Django Yazılım Vakfı | Yok | Dashboard uygulaması için alternatif web çerçevesi |
| hayal ürünü | fancyimpute geliştiriciler | Yok | Isteğe bağlı MICE ve KNN ödüm hassasiyet analizi |
| Matla | Palet Projeleri | Yok | Dashboard uygulaması için web çerçevesi |
| HL7/FHIR API standardı | HL7 International | Yok | EHR/dashboard entegrasyonu için planlanan standart |
| Keras | Keras geliştiricileri | Yok | GAN mimarisi için TensorFlow/Keras ile kullanılan sinir ağı API'si |
| matplotlib | matplotlib geliştiricileri | Yok | Çizim kütüphanesi |
| MIMIC-III Veritabanı | PhysioNet | https://physionet.org/content/mimiciii/1.4/ | Planlı dış doğrulama için kritik bakım veritabanı |
| missingno | missingno geliştiriciler | Yok | Eksiklik matrisi görselleştirmesi |
| NumPy | NumPy geliştiricileri | Yok | Sayısal hesaplama |
| pandalar | Pandas Geliştiricileri | Yok | Veri işleme |
| PhysioNet | PhysioNet | https://physionet.org/ | MIMIC-III için erişim platformu/kaynak |
| Python | Python Yazılım Vakfı | Yok | Sürüm 3.9/3.9.7 |
| scikit-learn | scikit-learn geliştiricileri | Yok | Makine öğrenimi kütüphanesi; ön işleme, model eğitimi, çapraz doğrulama ve metrikler dahil olmak üzere |
| SciPy | SciPy geliştiricileri | Yok | İstatistiksel testler, Welch dahil s t-testi ve Spearman korelasyonu |
| SHAP | SHAP geliştiricileri | Yok | Açıklanabilir yapay zeka kütüphanesi |
| Statlog Kalp Hastalığı Veri Seti | UCI Makine Öğrenme Deposu | https://archive.ics.uci.edu/ml/datasets/statlog+(kalp) | Kıyaslama kalp hastalığı veri seti |
| TensorFlow | Yok | GAN uygulaması için derin öğrenme çerçevesi | |
| UCI Makine Öğrenme Deposu | Kaliforniya Üniversitesi, Irvine | https://archive.ics.uci.edu/ | Cleveland ve Statlog veri setleri için depo kaynağı |
Request permission to reuse the text or figures of this JoVE article
Request Permission