$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Veri seti edinimi
UCI Kalp Hastalığı veri seti, kalp hastalıklarını tahmin etmek için tıbbi ve makine öğrenimi araştırmalarında yaygın olarak kullanılan bir veri setidir. Hastaların çeşitli klinik ve tanısal özelliklerini içerir ve sağlık profesyonelleri ile araştırmacıların veri odaklı tahmin modelleri geliştirmelerini sağlar. Veri seti, yaş, cinsiyet, göğüs ağrısı tipi, kan basıncı, kolesterol seviyeleri ve elektrokardiyogram sonuçları gibi çeşitli hasta özelliklerine dayanarak bireyleri kalp hastalığı olma olasılığı veya olasılığı düşük olarak sınıflandırıyor (https://archive.ics.uci.edu/dataset/45/heart+disease)29. Önerilen kalp hastalığı tahmin çerçevesinin genel iş akışı, veri ön işleme, dağıtık model uygulaması ve değerlendirme aşamaları dahil olmak üzere, Şekil 1'de gösterilmiştir.
Deneysel ortam kurulumları
Deneysel ortam, tüm uygulamalar için çekirdek dağıtık hesaplama çerçevesi olarak Apache Hadoop 3.x üzerinde devreye alındı. Küme, bir özel ana düğüm ve birden fazla işçi düğümü olan bir ana çalışan mimarisi kullanıyordu. Ana düğüm, YARN (Yet Another Resource Negotiator) kullanarak iş zamanlama, kaynak tahsisi ve küme koordinasyonunu yönetirken, işçi düğümleri büyük ölçekli tıbbi veri setlerini verimli bir şekilde işlemek için dağıtık hesaplama görevlerini paralel yürütür. Kümedeki her düğüm, Intel Core i7 işlemcileri (veya eşdeğeri), 16–32 GB RAM ve yaklaşık 1 TB depolama ile sağlandı.
HDFS'ye veri girişi
Veri Seti Depolama
Deneysel veri seti, HDFS'de blok dağıtılmış formatta saklandı; hedef değişken kalp hastalığının varlığını veya yokluğunu bağımsız özellik setinden ayrı olarak gösteriyordu, ardından küme düğümleri arasında depolandı. Özellik spesifik ön işleme, MapReduce iş akışları kullanılarak tüm depolanmış veri bloklarına uygulandı. Yaş, kan basıncı, kolesterol seviyeleri ve kalp atış hızı gibi sayısal özellikler, interquartil aralığına dayalı sağlam bir ölçekleyici kullanılarak normalleştirildi; bu durum, nadir veya şiddetli klinik durumları temsil edebileceği aşırı değerlerin özellikle tıbbi veri setlerinde yaygın olan istisnaların etkisini azalttı. cp, restecg ve thal gibi ikiden fazla kategoriye sahip kategorik değişkenler, tek sıcak kodlama kullanılarak dönüştürülerek kategorik özellikler, makine öğrenimi algoritmasıgirdileri 30,31,32 ile uyumlu ikili sayısal temsillere dönüştürüldü. Tüm ön işleme işlemleri, HDFS veri blokları arasında dağıtık MapReduce işleri olarak yürütüldü; böylece ham veri tek bir noktada merkezileşmeden tam boru hattının eşit şekilde uygulanmasını sağladı.
Düğümler arasında bölümleme
Veri seti, 80:20 bölünmesiyle eğitim ve test setlerine ayrıldı; %80'i eğitime ayrıldı, %20'si ise görünmeyen veriler üzerinde değerlendirme için ayrıldı. Bu bölümleme, her düğümün tam veri setinin orantılı ve temsilci bir parçasını işlemesini sağlamak için tüm dağıtık işçi düğümlerinde tutarlı şekilde uygulandı; veri çarpıklığını önledi ve dengeli model genellemesini destekledi. Ölçeklendirme, tüm sayısal değişkenlerin dağıtık eğitimde eşit katkı sağlamasını sağladı ve düğümler arasında öğrenme sürecine daha büyük özelliklerin hakim olmasını engelledi. Bu yapılandırılmış bölme stratejisi, dağıtık küme genelinde eğitim ve değerlendirme verileri arasında net bir ayrım sağlayarak tahmin güvenilirliğini artırdı ve aşırı uyumlamayı önlemeye yardımcı oldu.
Veri ön işleme
Eksik değer yönetimi
Tıbbi veri setleri, klinik veri toplama sırasında veri girişi hataları, cihaz arızaları veya hastanın yanıt vermemesi nedeniyle eksik kayıtlar içerir. Model eğitiminden önce, tüm veri seti özellikleri eksik veya null değerler açısından incelendi. Tansiyon, kolesterol ve kalp atış hızı gibi kritik klinik özelliklerde eksik değerlerin olduğu satırlar, sayısal değişkenler için ortalama atama ve kategorik değişkenler için mod atama kullanılarak belirlendi ve ele alındı. Bu yaklaşım, veri setinin istatistiksel dağılımını korurken, hiçbir eğitim örneğinin gereksiz yere atılmamasını sağladı ve dağıtık HDFS düğümleri arasında model öğrenimi için maksimum veri erişilebilirliğini korudu.
Özellik ölçeklendirme
Yaş, kan basıncı, kolesterol seviyeleri ve maksimum kalp atış hızı gibi sayısal özellikler, önemli ölçüde farklı değer aralıkları gösterir; bu da daha büyük özelliklerin model eğitimini orantısız şekilde etkilemesine neden olabilir. Bunu çözmek için, tüm sürekli sayısal özelliklere çeyreklerarası aralık tabanlı sağlam bir ölçekleyici uygulandı. Bu ölçeklendirme stratejisi, nadir veya ağır durumları temsil eden aşırı klinik değerlerin öğrenme sürecini çarpıtabileceği tıbbi veri setleri için özellikle uygundur. Ölçeklendirme, tüm sayısal değişkenlerin model eğitimi sırasında eşit katkı sağlamasını sağladı ve MapReduce iş akışları kullanılarak tüm dağıtık işçi düğümlerinde tutarlı şekilde uygulandı.
Kodlama
cp (göğüs ağrısı tipi), restecg (dinlenme elektrokardiyografik sonuçları) ve thal (talasemi tipi) dahil olmak üzere ikiden fazla farklı kategoriye sahip kategorik değişkenler, tek sıcak kodlama kullanılarak dönüştürüldü. Bu süreç, her kategorik özniteliği ikili sayısal gösterge sütunlarına dönüştürerek, makine öğrenimi algoritmalarının kategori değerleri arasında yapay sıralı ilişkiler kurmadan etkili şekilde işleyebildiği temsiller üretir. İkili kategorik değişkenler orijinal sayısal formlarında korundu. Tüm kodlama işlemleri, HDFS veri blokları arasında dağıtık MapReduce işleri olarak yürütülerek tüm bölümlenmiş veri seti parçaları arasında tutarlı dönüşüm sağlandı.
Tren/test bölünmesi
Ön işlenmiş veri seti, 80:20 bölünmesiyle eğitim ve test alt kümelerine ayrıldı; %80'i model eğitimine, %20'si ise görünmeyen veriler üzerinde performans değerlendirmesine ayrıldı. Kalp hastalığının varlığını veya yokluğunu gösteren hedef değişken, bölünmeden önce bağımsız özellik setinden ayrılmıştı. Bu bölümleme, tüm dağıtık HDFS düğümlerinde eşit şekilde uygulanarak her işçi düğümünün tam veri setinin orantılı ve temsilci bir parçasını işlemesini sağladı ve veri çarpıklığını önledi. 80:20 bölünme stratejisi, tahmin güvenilirliğini artırdı, model genellemesini geliştirdi ve dağıtık küme ortamında eğitim ile değerlendirme verileri arasında net bir ayrım sağladı, böylece aşırı uyumu önledi.
Model uygulaması
Küme Görselleştirilmiş Hadoop Dağıtılmış Karar Ağacı (CViHDDT) modeli, dağıtık karar ağacı kullanarak hastaları risk kategorilerine sınıflandırır. Karar ağacı algoritması, veri setini en bilgilendirici özelliklere göre özyinelemeli olarak bölerek kalp hastalığı olan ve olmayan hastalar arasındaki ayrımı en üst düzeye çıkarır. Hadoop dağıtık çerçevesi içinde, bu süreç birden fazla hesaplama düğümünde yürütülür ve büyük veri setlerinin verimli şekilde işlenmesini sağlar. Dağıtık mimari, hesaplama süresini azaltırken ölçeklenebilirliği artırır. Küme Görselleştirilmiş Hadoop Dağıtılmış K-En Yakın Komşu (CViHDKNN) algoritması aynı veri setini kullanır ancak farklı bir sınıflandırma stratejisi uygular. Bir karar ağacı oluşturmak yerine, model en yakın komşu hastaları kan basıncı, kolesterol seviyeleri ve egzersiz kaynaklı angina gibi tıbbi özelliklere göre tanımlar. Dağıtık hesaplama kullanılarak, KNN algoritması benzer tıbbi özelliklere sahip hastaları verimli bir şekilde kümeler ve hesaplama karmaşıklığını yönetir.
Dağıtılmış K-en yakın komşu modelinin sınıflandırma prensibi, en yakın komşuları arasındaki çoğunluk sınıfına göre yeni bir sınıfa atandığı Şekil 2'de gösterilmiştir. Küme görselleştirme teknikleri, sağlık profesyonellerinin benzer klinik özelliklere sahip hasta gruplarını belirlemesini sağlar; böylece yorumlanabilirliği artırır ve kişiselleştirilmiş tedavi önerilerini destekler. Önerilen kalp hastalığı tahmin çerçevesi, veri ön işlemesini, dağıtık makine öğrenimi algoritmalarını ve küme görselleştirme tekniklerini entegre ediyor. Hadoop'un dağıtık hesaplama yeteneklerinden yararlanarak, çerçeve büyük sağlık veri setlerini verimli bir şekilde işliyor ve yüksek tahmin doğruluğunu ve yorumlanabilirliğini koruyarak erken kalp hastalığı tespitini ve klinik karar alma süreçlerini iyileştiriyor.
Cluster visualized Hadoop Distributed decision tree (CViHDDT):
Dağıtılmış Karar Ağacı Eğitimi
Önerilen Küme Görselleştirilmiş Hadoop Dağıtık Karar Ağacı (CViHDDT) modeli, geleneksel karar ağacı yapımından temel olarak farklıdır; ağaç oluşturma sürecini Hadoop ekosistemindeki birden fazla düğüm arasında dağıtır; tüm ağacı tek bir makinede inşa etmek yerine. Bireysel işçi düğümleri, paralel işlem için MapReduce veya Apache Spark kullanarak veri setinin kendi atanan alt kümesinde kısmi karar ağaçları yerel olarak oluşturur. Bu yerel olarak oluşturulmuş kısmi ağaçlar, daha sonra tam dağıtık veri setini kapsayan tam bir küresel karar ağacı olarak birleştirilir. Bu dağıtık eğitim stratejisi, model eğitimini önemli ölçüde hızlandırır ve çerçevenin çok terabaytlık tıbbi veri setlerini ölçekli ölçekte verimli şekilde işlemesini sağlar. Hadoop tarafından sağlanan paralel hesaplama altyapısı, CViHDDT modelinin doğası gereği ölçeklenebilir ve büyük veri odaklı sağlık çözümleri için iyi uygun olmasını sağlar. Dağıtık ağaç yapımının ardından, küme görselleştirme teknikleri, k-ortalamaları ve hiyerarşik kümeleme gibi algoritmalar kullanılarak benzer tıbbi duruma sahip hasta kümelerine gruplanarak model yorumlanabilirliğini artırmak için uygulanır. Bu kümeleme süreci, hafif, orta ve şiddetli kalp hastalığı gibi klinik olarak anlamlı risk kategorileri üretir ve sağlık profesyonellerinin hasta verilerindeki kalıpları belirlemesini, hastalık ilerlemesini anlamasını ve kişiselleştirilmiş tedavi planları oluşturmasını sağlar.
Özellik Seçimi
Dağıtık karar ağacı eğitiminden önce, CViHDDT modeli, HDFS'den alınan ham tıbbi verilere yapılandırılmış ön işleme ve özellik seçimi boru hattı uygular. Eksik değerler, eksik klinik kayıtları yönetmek ve hasta örnekleri atmadan veri kaybını önlemek için imputasyon algoritmalarıyla giderilir. Sağlam Ölçekleyici normalizasyonu, kan basıncı ve kolesterol seviyeleri gibi sayısal özelliklere uygulanarak tıbbi veri setlerinde yaygın olan istisnaların orantısız etkisini azaltır. Cinsiyet ve kalp hastalığı aile öyküsü gibi kategorik değişkenler, makine öğrenimi algoritmalarıyla uyumlu sayısal temsiller oluşturmak için tek bir sıcak veya etiket kodlaması kullanılarak dönüştürülür. Ön işlemeden sonra, kalp hastalığını en çok öngören temel klinik özellikler belirlemek için özellik çıkarımı yapılır. Bu aşama, veri setinden alakasız ve gereksiz özellikleri ortadan kaldırır, sonraki dağıtık eğitim aşamalarında hesaplama maliyetlerini azaltır ve yalnızca göğüs ağrısı tipi, dinlenme tansiyonu, serum kolesterolü, maksimum kalp atış hızı ve ST depresyonu gibi en tanısal bilgilendirici özelliklerin dağıtık karar ağacı oluşturma sürecine girdi olarak korunmasını sağlar. Bu sistematik özellik azaltımı, model verimliliğini artırır, dağıtık düğümler arasında eğitim süresini azaltır ve öğrenme sürecini en güçlü klinik ayırtıcı güce sahip özelliklere odaklayarak CViHDDT çerçevesinin genel öngörü güvenilirliğini artırır.
MapReduce İş Akışı
MapReduce programlama modeli, CViHDDT dağıtık eğitim hattının hesaplama omurgasını oluşturur ve Hadoop kümesindeki tüm çalışan düğümlerinde kalp hastalığı veri setinin paralel işlenmesini sağlar. Harita aşamasında, her işçi düğümü bağımsız olarak kendisine atanan HDFS veri parçasını işler, kısmi karar ağacı yapılarını ve yerel bölme istatistiklerini — Bilgi Kazancı ve Gini Index değerleri dahil — her aday özniteliği için hesaplar; diğer düğümlerde depolanan verilere erişim gerekmeden hesaplar. İndüksiyon aşamasında, yerel olarak hesaplanan kısmi ağaçlar ve yeterli istatistikler tüm düğümlerde toplanarak tam küresel karar ağacı oluşturulur ve her düğümde öğrenilen dağıtık bilgi tek bir birleşik tahmin modelinde birleştirilir. Ağaç oluşturma sürecinin bu harita azaltma ayrıştırması, CViHDDT modelinin işçi düğüm sayısıyla doğrusal ölçeklendirmesini sağlar ve böylece büyük ölçekli tıbbi veri setlerinin gerçek zamanlı analizini hesaplamalı olarak mümkün kılar. MapReduce iş akışı ayrıca, küme algoritmalarının HDFS veri blokları arasında paralel olarak uygulandığı küme görselleştirme prosedürlerinin dağıtık yürütülmesini destekler; bu süreçte küme algoritmaları paralel olarak uygulanarak hasta kayıtlarını karar ağacı düğüm atamalarına göre risk kategorilerine gruplar. Ortaya çıkan modelin performans değerlendirmesi, birincil metrikler olarak hassasiyet, hatırlama, F1-puanı ve sınıflandırma doğruluğunu kullanır; dağıtık küme görselleştirmesi, ağac içinde daha ince karar sınırları sağlayarak yanlış negatifleri daha da azaltır — risk altındaki hastaların belirlenmesinde hassasiyeti doğrudan artırır ve CViHDDT kalp hastalığı tahmin çerçevesinin klinik güvenilirliğini artırır.
Küme Görselleştirilmiş Hadoop Dağıtık K-En Yakın Komşu (CViHDKNN)
Kümelenme
CViHDKNN (Küme Görselleştirilmiş Hadoop Dağıtılmış K-En Yakın Komşu) çerçevesi, sınıflandırmadan önce kalp hastalığı veri setine kümeleme teknikleri uygular; benzer tıbbi özelliklere sahip hastaları tutarlı kümelere gruplarak, KNN araması yapılmadan önce toparlar. Yaş, kolesterol seviyesi, kan basıncı, EKG sonuçları ve kalp atış hızı gibi klinik özellikleri içeren kalp hastalığı veri seti, HDFS kullanılarak Hadoop kümesindeki düğümler arasında önceden işlenmiş ve dağıtılmıştır. K-Means ve Hiyerarşik Kümeleme gibi kümeleme algoritmaları, bu dağıtık veri bölümleri boyunca uygulanarak veri setini, ilgili tıbbi profilleri paylaşan hasta gruplarına ayırır. Bu sınıflandırma öncesi kümeleme adımı, kritik bir hesaplama amacına hizmet eder: KNN arama alanını tüm veri seti yerine sadece en ilgili kümeyle sınırlandırarak, algoritma her sorgu örneği için gereken mesafe hesaplama sayısını dramatik şekilde azaltır. Bu kümelerin görselleştirilmesi, yakın tıbbi özelliklere sahip hasta alt gruplarının tanımlanmasını mümkün kılarak ve en yakın komşu sınıflandırma aşamasından önce risk profillerinin daha anlamlı kategorize edilmesini destekleyerek ek klinik fayda sağlar. Kümeleme tabanlı optimizasyon, hesaplama maliyetini azaltmakla kalmaz, aynı zamanda her sorgu örneğinin yalnızca en bağlamsal olarak benzer hasta kayıtlarıyla karşılaştırılmasını sağlayarak sınıflandırma doğruluğunu artırır; bu da yaklaşımı, tam veri setinde kapsamlı mesafe hesaplamalarının hesaplama açısından zor olacağı büyük ölçekli kalp hastalığı veri setleri için özellikle uygundur.
Dağıtılmış KNN
CViHDKNN'in dağıtık KNN bileşeni, geleneksel KNN'nin temel ölçeklenebilirlik sınırlamasını ele alır; bu sınırlama, sorgu örneği ile tüm depolanan veri noktaları arasındaki mesafeleri hesaplamadan önce tüm veri setinin belleğe yüklenmesini gerektirir. CViHDKNN çerçevesinde, bu mesafe hesaplaması, HDFS dağıtılmış veri bölümleri kullanılarak Hadoop kümesinde birden fazla işçi düğümü arasında paralel olarak düzenlenir; böylece tüm veri setini işlemek için tek bir düğüm gerekmez. Her işçi düğümü, sorgu örneği ile yerel olarak atanan HDFS veri parçasında saklanan hasta kayıtları arasındaki mesafeyi bağımsız olarak hesaplar ve bölümündeki yerel olarak en yakın komşuları belirler. Hadoop'un paralel işleme yeteneklerini kullanarak, CViHDKNN ölçeklenebilirliği önemli ölçüde artırır ve büyük miktarda sağlıkla ilgili hasta verisinin verimli yönetimini sağlar. Bu dağıtık mimari, hassas hasta kayıtlarının harici bulut sunucularına veya merkezi yerel makinelere aktarılmak yerine dağıtık küme ortamında kalması nedeniyle veri güvenliğini de artırır. Kümeleme yönlendirmeli arama alanı küçümleme ve Hadoop dağıtılı mesafe hesaplamasının birleşimi, hem hesaplama verimliliği hem de öngörücü doğruluk sağlayan bir sistem ortaya çıkarır ve büyük ölçekli tıbbi veri setlerinde gerçek zamanlı kalp hastalığı tahminini mümkün kılar. Deneysel sonuçlar, dağıtık uygulamanın %85,25 sınıflandırma doğruluğuna ulaştığını doğrulamaktadır; bu, doğrudan dağıtılı, kümeleme ile güçlendirilmiş işlem stratejisine atfedilebilir geleneksel dağıtılmamış KNN temeline göre önemli bir performans artışını temsil etmektedir.
Sınıflandırma
CViHDKNN'in sınıflandırma aşaması, her sorgu hastasını, dağıtık arama süreciyle belirlenen en yakın K komşusunun çoğunluk oylarına göre kalp hastalığı sınıfına atar. K değerinin seçimi, sınıflandırma sonuçlarını ve tahmin kesinliğini doğrudan etkiler. K = 1 olduğunda, sorgu örneği en yakın komşusunun sınıf etiketine atanır ve bu da eğitim verisindeki gürültüye duyarlı olabilecek yüksek derecede yerel bir karar sınırı oluşturur. K = 3 olduğunda, sınıflandırma en yakın üç komşu arasındaki çoğunluk sınıfı tarafından belirlenir — örneğin, iki komşu Sınıf 1'e (kalp hastalığı yok) ve biri Sınıf 2'ye (kalp hastalığı varsa) ise, sorgu örneği Sınıf 1 olarak sınıflandırılır ve daha sağlam ve gürültüye dayanıklı bir karar sağlar. MapReduce aşaması, tüm işçi düğümlerinden yerel olarak tanımlanan en yakın komşuları küresel sıralanmış bir listeye toplar; buradan en yakın K komşu seçilir ve ardından çoğunluk oyu hesaplayarak nihai sınıf tahminini oluşturur. CViHDKNN sınıflandırma çerçevesinin performansı, birincil ölçütler olarak hassasiyet, geri çağırma, F1-puanı ve genel sınıflandırma doğruluğu kullanılarak değerlendirilir. Küme kısıtlı aramanın dağıtık çoğunluk oyu ile entegrasyonu, standart KNN'den daha ince ve daha doğru karar sınırları üretir; risk altındaki hasta tespitinde yanlış negatifleri azaltır ve hassasiyeti artırır; bunlar da büyük ölçekli dağıtık sağlık analitik ortamlarında klinik olarak güvenilir kalp hastalığı tahmini için kritik gereksinimlerdir.