Araştırma makalesi

Güvenli Sağlık Hizmetleri İçin Küme-görselleştirilmiş dağıtık makine öğrenimi paradigmalarıyla kalp hastalığı tahminini geliştirmek

DOI:

10.3791/69857

7 Temmuz 2026

Bu makalede

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma, Hadoop MapReduce ve K-Means kümeleme kullanarak kalp hastalıkları tahmini için ölçeklenebilir bir çerçeve geliştirmektedir. Sınıflandırma kesme sınırlarının ayarlanması algılama hassasiyetini etkiler. CViHDKNN, yanlış pozitifleri kontrol ederken gerçek pozitif tespitini artırırken, CViHDDT yanlış pozitifleri azaltır ancak bazı kalp hastalığı vakalarını gözden kaçabilir.

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Kalp hastalığı, dünya çapında ölümlerin önde gelen nedenlerinden biri olmaya devam etmekte olup, erken tanı ve zamanında klinik müdahaleyi mümkün kılan doğru ve ölçeklenebilir öngörücü sistemlere acil bir ihtiyaç yaratmaktadır. Geleneksel makine öğrenimi yaklaşımları genellikle büyük ölçekli tıbbi veri setlerini verimli işlemekte zorlanır ve yorumlanabilirlikten yoksundur; bu da klinik karar alma süreçlerini desteklemede faydalarını sınırlar. Bu zorlukları ele almak için, bu çalışma kalp hastalığı tahmini için Küme Görselleştirilmiş Dağıtık Makine Öğrenimi çerçevesi önermektedir. Çerçeve iki dağıtık algoritmayı içerir: Küme Görselleştirilmiş Hadoop Dağıtık Karar Ağacı (CViHDDT) ve Küme Görselleştirilmiş Hadoop Dağıtık K-En Yakın Komşu (CViHDKNN). Önerilen modeller, büyük veri setleri arasında dağıtık hesaplama için Hadoop'un MapReduce çerçevesini kullanırken, veri organizasyonu ve görselleştirmeyi iyileştirmek için K-Means kümeleme entegrasyonunu sağlar. Bu küme tabanlı görselleştirme, klinisyenlerin hasta risk faktörleri ile tahmin sonuçları arasındaki ilişkileri daha iyi anlamalarını sağlayarak yorumlanabilirliği artırır. Deneysel değerlendirme, UCI Kalp Hastalığı veri seti kullanılarak Hadoop tabanlı dağıtık bir ortamda gerçekleştirilmiştir. Sonuçlar, CViHDKNN'in üstün öngörü performansı elde ettiğini, %85,25 doğruluk ve %88 geri çağırma sağladığını ve %80,33 doğruluk sağlayan CViHDDT modelini geride bıraktığını göstermektedir. Sınıflandırma kesme değerlerinin ayarlanması da hassasiyet ve tespit oranlarını etkiledi: daha düşük kesim noktaları gerçek pozitif tespitini iyileştirirken kabul edilebilir yanlış pozitif seviyeleri korundu. Bu bulgular, kümeleme ile güçlendirilmiş dağıtık öğrenmenin kalp hastalığı tahmini için ölçeklenebilirliği, öngörücü doğruluğu ve klinik yorumlanabilirliği artırdığını göstermektedir.

Giriş

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Kalp hastalığı, dünya çapında ölümün önde gelen nedenlerinden biridir ve büyük bir halk sağlığı sorunu oluşturur. Kardiyovasküler hastalıkların artan yaygınlığı, erken tespit ve tedaviyi destekleyen gelişmiş tanı modellerine acil ihtiyacı ortaya koyuyor. Geleneksel tanı yaklaşımları, büyük miktarda tıbbi veri yönetiminde genellikle zorlanan manuel değerlendirme ve klinik yargıya dayanır. Son zamanlarda, yapay zeka (AI) ve makine öğrenimi (ML) teknikleri, öngörücü sağlık analizinde önemli bir rol oynamış, veri odaklı hastalık tahminini mümkün kılmış ve tıbbi sistemlerde risk değerlendirme doğruluğunuartırmıştır 1,2.

Geleneksel tanı yöntemleri ve kural tabanlı karar sistemleri, karmaşık tıbbi veri setlerine uygulandığında genellikle sınırlı ölçeklenebilirlik ve daha düşük hassasiyetle mücadele eder. Makine öğrenimi teknikleri tahmin performansını geliştirmiş olsa da, birçok model büyük ölçekli tıbbi verileri işlemede ve klinik karar alma için yorumlanabilirliği korumada hâlâ zorluklarla karşı karşıyadır. Derin öğrenme modelleri yüksek tahmin doğruluğu sağlayabilir ancak genellikle "kara kutu" sistemleri olarak işlev görür ve sağlık profesyonellerinin tahminlerin arkasındaki gerekçeleri anlamalarını zorlaştırır 3,4,5. Bu şeffaflık eksikliği, açıklanabilirliğin önemli olduğu klinik ortamlarda benimsenmesinisınırlar 6,7,8,9,10.

Bu zorlukların üstesinden gelmek için, Hadoop gibi dağıtık hesaplama çerçeveleri büyük ölçekli sağlık analizleri için giderek daha fazla benimsenmiştir. Hadoop'un dağıtık mimarisi, Hadoop Dağıtık Dosya Sistemi (HDFS) ve MapReduce kullanılarak büyük veri setlerinin paralel işlenmesini sağlar; bu da tıbbi veri analizinde hesaplama verimliliğini ve ölçeklenebilirliğini artırır. Ancak, dağıtık makine öğrenimi modelleri hala yorumlanabilirlik ve şeffaflığı artıran mekanizmalar gerektirir. Kümeleme ve görselleştirme tekniklerinin entegre edilmesi, hasta verilerindeki gizli kalıpları ortaya çıkarmaya ve klinisyenlerin öngörücü sonuçları daha etkili anlamalarına yardımcıolabilir 11,12,13,14,15,16.

Birçok araştırmacı, karar ağaçları ve K-En Yakın Komşu (KNN) gibi algoritmalar kullanarak kalp hastalığı tahmini için dağıtık makine öğrenimi tekniklerini araştırmıştır. Hadoop çerçevelerinde uygulanan Dağıtık Karar Ağacı (HDDT) modelleri, geleneksel karar ağacıyaklaşımlarına kıyasla daha iyi ölçeklenebilirlik ve sınıflandırma doğruluğu göstermiştir (17,18,19,20,21,22,23). Benzer şekilde, Hadoop Dağıtılmış KNN (HDKNN) yöntemleri, büyük, yüksek boyutlu tıbbi veri setleri için sınıflandırma verimliliğini artırmak için paralel işlemeyikullanır 24,25,26. Ancak, bu modeller genellikle etkili klinik karar alma ve hasta risk profillerini anlamak için gerekli olan güçlü yorumlanabilirlik ve görselleştirme mekanizmalarından yoksundur. Bu gelişmelere rağmen, mevcut dağıtık modeller hâlâ hasta risk kalıplarının yorumlanabilirliği ve görsel olarak anlaşılması için entegre mekanizmalardan yoksundur.

Bu sınırlamaları gidermek için, bu çalışma kalp hastalığı tahmini için Küme Görselleştirilmiş Dağıtılmış Makine Öğrenimi (CVDML) çerçevesi önermektedir. Çerçeve, iki dağıtık öngörücü model sunar: Küme Görselleştirilmiş Hadoop Dağıtık Karar Ağacı (CViHDDT) ve Küme Görselleştirilmiş Hadoop Dağıtık K-En Yakın Komşu (CViHDKNN). CViHDDT, semptomlar ve önceki tıbbi geçmiş gibi tıbbi özelliklerin seçimini optimize etmek için dağıtık karar ağacı yapısı uygularken, CViHDKNN benzer tıbbi özelliklere göre hastaları sınıflandırmak için dağıtık, paralel bir KNN yaklaşımı uygular. Kümeleme ve görselleştirme tekniklerinin entegrasyonu, benzer hastalık kalıplarına sahip hastaları gruplayarak sınıflandırma performansını artırır ve yorumlanabilirliği artırır.

Bu araştırmanın temel amacı, büyük tıbbi veri setleri kullanılarak doğru kalp hastalığı tahmini için ölçeklenebilir ve yorumlanabilir dağıtık bir makine öğrenimi çerçevesi geliştirmektir. Bu çalışmanın temel katkıları şunlardır: (1) Büyük sağlık veri setlerini verimli bir şekilde işleyebilecek Hadoop tabanlı dağıtık makine öğrenimi çerçevesinin geliştirilmesi. (2) Tahminli sağlık analitiğinde yorumlanabilirliği ve şeffaflığı artırmak için küme görselleştirme tekniklerinin dağıtık karar ağacı ve KNN modelleriyleentegrasyonu 27. (3) Geleneksel makine öğrenimi yaklaşımlarına kıyasla geliştirilmiş doğruluk, hatırlama ve anomli tespit yeteneğiyle gelişmiş tahmin performansınıngösterilmesi 28.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Protokol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Veri seti edinimi

UCI Kalp Hastalığı veri seti, kalp hastalıklarını tahmin etmek için tıbbi ve makine öğrenimi araştırmalarında yaygın olarak kullanılan bir veri setidir. Hastaların çeşitli klinik ve tanısal özelliklerini içerir ve sağlık profesyonelleri ile araştırmacıların veri odaklı tahmin modelleri geliştirmelerini sağlar. Veri seti, yaş, cinsiyet, göğüs ağrısı tipi, kan basıncı, kolesterol seviyeleri ve elektrokardiyogram sonuçları gibi çeşitli hasta özelliklerine dayanarak bireyleri kalp hastalığı olma olasılığı veya olasılığı düşük olarak sınıflandırıyor (https://archive.ics.uci.edu/dataset/45/heart+disease)29. Önerilen kalp hastalığı tahmin çerçevesinin genel iş akışı, veri ön işleme, dağıtık model uygulaması ve değerlendirme aşamaları dahil olmak üzere, Şekil 1'de gösterilmiştir.

Deneysel ortam kurulumları

Deneysel ortam, tüm uygulamalar için çekirdek dağıtık hesaplama çerçevesi olarak Apache Hadoop 3.x üzerinde devreye alındı. Küme, bir özel ana düğüm ve birden fazla işçi düğümü olan bir ana çalışan mimarisi kullanıyordu. Ana düğüm, YARN (Yet Another Resource Negotiator) kullanarak iş zamanlama, kaynak tahsisi ve küme koordinasyonunu yönetirken, işçi düğümleri büyük ölçekli tıbbi veri setlerini verimli bir şekilde işlemek için dağıtık hesaplama görevlerini paralel yürütür. Kümedeki her düğüm, Intel Core i7 işlemcileri (veya eşdeğeri), 16–32 GB RAM ve yaklaşık 1 TB depolama ile sağlandı.

HDFS'ye veri girişi

Veri Seti Depolama

Deneysel veri seti, HDFS'de blok dağıtılmış formatta saklandı; hedef değişken kalp hastalığının varlığını veya yokluğunu bağımsız özellik setinden ayrı olarak gösteriyordu, ardından küme düğümleri arasında depolandı. Özellik spesifik ön işleme, MapReduce iş akışları kullanılarak tüm depolanmış veri bloklarına uygulandı. Yaş, kan basıncı, kolesterol seviyeleri ve kalp atış hızı gibi sayısal özellikler, interquartil aralığına dayalı sağlam bir ölçekleyici kullanılarak normalleştirildi; bu durum, nadir veya şiddetli klinik durumları temsil edebileceği aşırı değerlerin özellikle tıbbi veri setlerinde yaygın olan istisnaların etkisini azalttı. cp, restecg ve thal gibi ikiden fazla kategoriye sahip kategorik değişkenler, tek sıcak kodlama kullanılarak dönüştürülerek kategorik özellikler, makine öğrenimi algoritmasıgirdileri 30,31,32 ile uyumlu ikili sayısal temsillere dönüştürüldü. Tüm ön işleme işlemleri, HDFS veri blokları arasında dağıtık MapReduce işleri olarak yürütüldü; böylece ham veri tek bir noktada merkezileşmeden tam boru hattının eşit şekilde uygulanmasını sağladı.

Düğümler arasında bölümleme

Veri seti, 80:20 bölünmesiyle eğitim ve test setlerine ayrıldı; %80'i eğitime ayrıldı, %20'si ise görünmeyen veriler üzerinde değerlendirme için ayrıldı. Bu bölümleme, her düğümün tam veri setinin orantılı ve temsilci bir parçasını işlemesini sağlamak için tüm dağıtık işçi düğümlerinde tutarlı şekilde uygulandı; veri çarpıklığını önledi ve dengeli model genellemesini destekledi. Ölçeklendirme, tüm sayısal değişkenlerin dağıtık eğitimde eşit katkı sağlamasını sağladı ve düğümler arasında öğrenme sürecine daha büyük özelliklerin hakim olmasını engelledi. Bu yapılandırılmış bölme stratejisi, dağıtık küme genelinde eğitim ve değerlendirme verileri arasında net bir ayrım sağlayarak tahmin güvenilirliğini artırdı ve aşırı uyumlamayı önlemeye yardımcı oldu.

Veri ön işleme

Eksik değer yönetimi

Tıbbi veri setleri, klinik veri toplama sırasında veri girişi hataları, cihaz arızaları veya hastanın yanıt vermemesi nedeniyle eksik kayıtlar içerir. Model eğitiminden önce, tüm veri seti özellikleri eksik veya null değerler açısından incelendi. Tansiyon, kolesterol ve kalp atış hızı gibi kritik klinik özelliklerde eksik değerlerin olduğu satırlar, sayısal değişkenler için ortalama atama ve kategorik değişkenler için mod atama kullanılarak belirlendi ve ele alındı. Bu yaklaşım, veri setinin istatistiksel dağılımını korurken, hiçbir eğitim örneğinin gereksiz yere atılmamasını sağladı ve dağıtık HDFS düğümleri arasında model öğrenimi için maksimum veri erişilebilirliğini korudu.

Özellik ölçeklendirme

Yaş, kan basıncı, kolesterol seviyeleri ve maksimum kalp atış hızı gibi sayısal özellikler, önemli ölçüde farklı değer aralıkları gösterir; bu da daha büyük özelliklerin model eğitimini orantısız şekilde etkilemesine neden olabilir. Bunu çözmek için, tüm sürekli sayısal özelliklere çeyreklerarası aralık tabanlı sağlam bir ölçekleyici uygulandı. Bu ölçeklendirme stratejisi, nadir veya ağır durumları temsil eden aşırı klinik değerlerin öğrenme sürecini çarpıtabileceği tıbbi veri setleri için özellikle uygundur. Ölçeklendirme, tüm sayısal değişkenlerin model eğitimi sırasında eşit katkı sağlamasını sağladı ve MapReduce iş akışları kullanılarak tüm dağıtık işçi düğümlerinde tutarlı şekilde uygulandı.

Kodlama

cp (göğüs ağrısı tipi), restecg (dinlenme elektrokardiyografik sonuçları) ve thal (talasemi tipi) dahil olmak üzere ikiden fazla farklı kategoriye sahip kategorik değişkenler, tek sıcak kodlama kullanılarak dönüştürüldü. Bu süreç, her kategorik özniteliği ikili sayısal gösterge sütunlarına dönüştürerek, makine öğrenimi algoritmalarının kategori değerleri arasında yapay sıralı ilişkiler kurmadan etkili şekilde işleyebildiği temsiller üretir. İkili kategorik değişkenler orijinal sayısal formlarında korundu. Tüm kodlama işlemleri, HDFS veri blokları arasında dağıtık MapReduce işleri olarak yürütülerek tüm bölümlenmiş veri seti parçaları arasında tutarlı dönüşüm sağlandı.

Tren/test bölünmesi

Ön işlenmiş veri seti, 80:20 bölünmesiyle eğitim ve test alt kümelerine ayrıldı; %80'i model eğitimine, %20'si ise görünmeyen veriler üzerinde performans değerlendirmesine ayrıldı. Kalp hastalığının varlığını veya yokluğunu gösteren hedef değişken, bölünmeden önce bağımsız özellik setinden ayrılmıştı. Bu bölümleme, tüm dağıtık HDFS düğümlerinde eşit şekilde uygulanarak her işçi düğümünün tam veri setinin orantılı ve temsilci bir parçasını işlemesini sağladı ve veri çarpıklığını önledi. 80:20 bölünme stratejisi, tahmin güvenilirliğini artırdı, model genellemesini geliştirdi ve dağıtık küme ortamında eğitim ile değerlendirme verileri arasında net bir ayrım sağladı, böylece aşırı uyumu önledi.

Model uygulaması

Küme Görselleştirilmiş Hadoop Dağıtılmış Karar Ağacı (CViHDDT) modeli, dağıtık karar ağacı kullanarak hastaları risk kategorilerine sınıflandırır. Karar ağacı algoritması, veri setini en bilgilendirici özelliklere göre özyinelemeli olarak bölerek kalp hastalığı olan ve olmayan hastalar arasındaki ayrımı en üst düzeye çıkarır. Hadoop dağıtık çerçevesi içinde, bu süreç birden fazla hesaplama düğümünde yürütülür ve büyük veri setlerinin verimli şekilde işlenmesini sağlar. Dağıtık mimari, hesaplama süresini azaltırken ölçeklenebilirliği artırır. Küme Görselleştirilmiş Hadoop Dağıtılmış K-En Yakın Komşu (CViHDKNN) algoritması aynı veri setini kullanır ancak farklı bir sınıflandırma stratejisi uygular. Bir karar ağacı oluşturmak yerine, model en yakın komşu hastaları kan basıncı, kolesterol seviyeleri ve egzersiz kaynaklı angina gibi tıbbi özelliklere göre tanımlar. Dağıtık hesaplama kullanılarak, KNN algoritması benzer tıbbi özelliklere sahip hastaları verimli bir şekilde kümeler ve hesaplama karmaşıklığını yönetir.

Dağıtılmış K-en yakın komşu modelinin sınıflandırma prensibi, en yakın komşuları arasındaki çoğunluk sınıfına göre yeni bir sınıfa atandığı Şekil 2'de gösterilmiştir. Küme görselleştirme teknikleri, sağlık profesyonellerinin benzer klinik özelliklere sahip hasta gruplarını belirlemesini sağlar; böylece yorumlanabilirliği artırır ve kişiselleştirilmiş tedavi önerilerini destekler. Önerilen kalp hastalığı tahmin çerçevesi, veri ön işlemesini, dağıtık makine öğrenimi algoritmalarını ve küme görselleştirme tekniklerini entegre ediyor. Hadoop'un dağıtık hesaplama yeteneklerinden yararlanarak, çerçeve büyük sağlık veri setlerini verimli bir şekilde işliyor ve yüksek tahmin doğruluğunu ve yorumlanabilirliğini koruyarak erken kalp hastalığı tespitini ve klinik karar alma süreçlerini iyileştiriyor.

Cluster visualized Hadoop Distributed decision tree (CViHDDT):

Dağıtılmış Karar Ağacı Eğitimi

Önerilen Küme Görselleştirilmiş Hadoop Dağıtık Karar Ağacı (CViHDDT) modeli, geleneksel karar ağacı yapımından temel olarak farklıdır; ağaç oluşturma sürecini Hadoop ekosistemindeki birden fazla düğüm arasında dağıtır; tüm ağacı tek bir makinede inşa etmek yerine. Bireysel işçi düğümleri, paralel işlem için MapReduce veya Apache Spark kullanarak veri setinin kendi atanan alt kümesinde kısmi karar ağaçları yerel olarak oluşturur. Bu yerel olarak oluşturulmuş kısmi ağaçlar, daha sonra tam dağıtık veri setini kapsayan tam bir küresel karar ağacı olarak birleştirilir. Bu dağıtık eğitim stratejisi, model eğitimini önemli ölçüde hızlandırır ve çerçevenin çok terabaytlık tıbbi veri setlerini ölçekli ölçekte verimli şekilde işlemesini sağlar. Hadoop tarafından sağlanan paralel hesaplama altyapısı, CViHDDT modelinin doğası gereği ölçeklenebilir ve büyük veri odaklı sağlık çözümleri için iyi uygun olmasını sağlar. Dağıtık ağaç yapımının ardından, küme görselleştirme teknikleri, k-ortalamaları ve hiyerarşik kümeleme gibi algoritmalar kullanılarak benzer tıbbi duruma sahip hasta kümelerine gruplanarak model yorumlanabilirliğini artırmak için uygulanır. Bu kümeleme süreci, hafif, orta ve şiddetli kalp hastalığı gibi klinik olarak anlamlı risk kategorileri üretir ve sağlık profesyonellerinin hasta verilerindeki kalıpları belirlemesini, hastalık ilerlemesini anlamasını ve kişiselleştirilmiş tedavi planları oluşturmasını sağlar.

Özellik Seçimi

Dağıtık karar ağacı eğitiminden önce, CViHDDT modeli, HDFS'den alınan ham tıbbi verilere yapılandırılmış ön işleme ve özellik seçimi boru hattı uygular. Eksik değerler, eksik klinik kayıtları yönetmek ve hasta örnekleri atmadan veri kaybını önlemek için imputasyon algoritmalarıyla giderilir. Sağlam Ölçekleyici normalizasyonu, kan basıncı ve kolesterol seviyeleri gibi sayısal özelliklere uygulanarak tıbbi veri setlerinde yaygın olan istisnaların orantısız etkisini azaltır. Cinsiyet ve kalp hastalığı aile öyküsü gibi kategorik değişkenler, makine öğrenimi algoritmalarıyla uyumlu sayısal temsiller oluşturmak için tek bir sıcak veya etiket kodlaması kullanılarak dönüştürülür. Ön işlemeden sonra, kalp hastalığını en çok öngören temel klinik özellikler belirlemek için özellik çıkarımı yapılır. Bu aşama, veri setinden alakasız ve gereksiz özellikleri ortadan kaldırır, sonraki dağıtık eğitim aşamalarında hesaplama maliyetlerini azaltır ve yalnızca göğüs ağrısı tipi, dinlenme tansiyonu, serum kolesterolü, maksimum kalp atış hızı ve ST depresyonu gibi en tanısal bilgilendirici özelliklerin dağıtık karar ağacı oluşturma sürecine girdi olarak korunmasını sağlar. Bu sistematik özellik azaltımı, model verimliliğini artırır, dağıtık düğümler arasında eğitim süresini azaltır ve öğrenme sürecini en güçlü klinik ayırtıcı güce sahip özelliklere odaklayarak CViHDDT çerçevesinin genel öngörü güvenilirliğini artırır.

MapReduce İş Akışı

MapReduce programlama modeli, CViHDDT dağıtık eğitim hattının hesaplama omurgasını oluşturur ve Hadoop kümesindeki tüm çalışan düğümlerinde kalp hastalığı veri setinin paralel işlenmesini sağlar. Harita aşamasında, her işçi düğümü bağımsız olarak kendisine atanan HDFS veri parçasını işler, kısmi karar ağacı yapılarını ve yerel bölme istatistiklerini — Bilgi Kazancı ve Gini Index değerleri dahil — her aday özniteliği için hesaplar; diğer düğümlerde depolanan verilere erişim gerekmeden hesaplar. İndüksiyon aşamasında, yerel olarak hesaplanan kısmi ağaçlar ve yeterli istatistikler tüm düğümlerde toplanarak tam küresel karar ağacı oluşturulur ve her düğümde öğrenilen dağıtık bilgi tek bir birleşik tahmin modelinde birleştirilir. Ağaç oluşturma sürecinin bu harita azaltma ayrıştırması, CViHDDT modelinin işçi düğüm sayısıyla doğrusal ölçeklendirmesini sağlar ve böylece büyük ölçekli tıbbi veri setlerinin gerçek zamanlı analizini hesaplamalı olarak mümkün kılar. MapReduce iş akışı ayrıca, küme algoritmalarının HDFS veri blokları arasında paralel olarak uygulandığı küme görselleştirme prosedürlerinin dağıtık yürütülmesini destekler; bu süreçte küme algoritmaları paralel olarak uygulanarak hasta kayıtlarını karar ağacı düğüm atamalarına göre risk kategorilerine gruplar. Ortaya çıkan modelin performans değerlendirmesi, birincil metrikler olarak hassasiyet, hatırlama, F1-puanı ve sınıflandırma doğruluğunu kullanır; dağıtık küme görselleştirmesi, ağac içinde daha ince karar sınırları sağlayarak yanlış negatifleri daha da azaltır — risk altındaki hastaların belirlenmesinde hassasiyeti doğrudan artırır ve CViHDDT kalp hastalığı tahmin çerçevesinin klinik güvenilirliğini artırır.

Küme Görselleştirilmiş Hadoop Dağıtık K-En Yakın Komşu (CViHDKNN)

Kümelenme

CViHDKNN (Küme Görselleştirilmiş Hadoop Dağıtılmış K-En Yakın Komşu) çerçevesi, sınıflandırmadan önce kalp hastalığı veri setine kümeleme teknikleri uygular; benzer tıbbi özelliklere sahip hastaları tutarlı kümelere gruplarak, KNN araması yapılmadan önce toparlar. Yaş, kolesterol seviyesi, kan basıncı, EKG sonuçları ve kalp atış hızı gibi klinik özellikleri içeren kalp hastalığı veri seti, HDFS kullanılarak Hadoop kümesindeki düğümler arasında önceden işlenmiş ve dağıtılmıştır. K-Means ve Hiyerarşik Kümeleme gibi kümeleme algoritmaları, bu dağıtık veri bölümleri boyunca uygulanarak veri setini, ilgili tıbbi profilleri paylaşan hasta gruplarına ayırır. Bu sınıflandırma öncesi kümeleme adımı, kritik bir hesaplama amacına hizmet eder: KNN arama alanını tüm veri seti yerine sadece en ilgili kümeyle sınırlandırarak, algoritma her sorgu örneği için gereken mesafe hesaplama sayısını dramatik şekilde azaltır. Bu kümelerin görselleştirilmesi, yakın tıbbi özelliklere sahip hasta alt gruplarının tanımlanmasını mümkün kılarak ve en yakın komşu sınıflandırma aşamasından önce risk profillerinin daha anlamlı kategorize edilmesini destekleyerek ek klinik fayda sağlar. Kümeleme tabanlı optimizasyon, hesaplama maliyetini azaltmakla kalmaz, aynı zamanda her sorgu örneğinin yalnızca en bağlamsal olarak benzer hasta kayıtlarıyla karşılaştırılmasını sağlayarak sınıflandırma doğruluğunu artırır; bu da yaklaşımı, tam veri setinde kapsamlı mesafe hesaplamalarının hesaplama açısından zor olacağı büyük ölçekli kalp hastalığı veri setleri için özellikle uygundur.

Dağıtılmış KNN

CViHDKNN'in dağıtık KNN bileşeni, geleneksel KNN'nin temel ölçeklenebilirlik sınırlamasını ele alır; bu sınırlama, sorgu örneği ile tüm depolanan veri noktaları arasındaki mesafeleri hesaplamadan önce tüm veri setinin belleğe yüklenmesini gerektirir. CViHDKNN çerçevesinde, bu mesafe hesaplaması, HDFS dağıtılmış veri bölümleri kullanılarak Hadoop kümesinde birden fazla işçi düğümü arasında paralel olarak düzenlenir; böylece tüm veri setini işlemek için tek bir düğüm gerekmez. Her işçi düğümü, sorgu örneği ile yerel olarak atanan HDFS veri parçasında saklanan hasta kayıtları arasındaki mesafeyi bağımsız olarak hesaplar ve bölümündeki yerel olarak en yakın komşuları belirler. Hadoop'un paralel işleme yeteneklerini kullanarak, CViHDKNN ölçeklenebilirliği önemli ölçüde artırır ve büyük miktarda sağlıkla ilgili hasta verisinin verimli yönetimini sağlar. Bu dağıtık mimari, hassas hasta kayıtlarının harici bulut sunucularına veya merkezi yerel makinelere aktarılmak yerine dağıtık küme ortamında kalması nedeniyle veri güvenliğini de artırır. Kümeleme yönlendirmeli arama alanı küçümleme ve Hadoop dağıtılı mesafe hesaplamasının birleşimi, hem hesaplama verimliliği hem de öngörücü doğruluk sağlayan bir sistem ortaya çıkarır ve büyük ölçekli tıbbi veri setlerinde gerçek zamanlı kalp hastalığı tahminini mümkün kılar. Deneysel sonuçlar, dağıtık uygulamanın %85,25 sınıflandırma doğruluğuna ulaştığını doğrulamaktadır; bu, doğrudan dağıtılı, kümeleme ile güçlendirilmiş işlem stratejisine atfedilebilir geleneksel dağıtılmamış KNN temeline göre önemli bir performans artışını temsil etmektedir.

Sınıflandırma

CViHDKNN'in sınıflandırma aşaması, her sorgu hastasını, dağıtık arama süreciyle belirlenen en yakın K komşusunun çoğunluk oylarına göre kalp hastalığı sınıfına atar. K değerinin seçimi, sınıflandırma sonuçlarını ve tahmin kesinliğini doğrudan etkiler. K = 1 olduğunda, sorgu örneği en yakın komşusunun sınıf etiketine atanır ve bu da eğitim verisindeki gürültüye duyarlı olabilecek yüksek derecede yerel bir karar sınırı oluşturur. K = 3 olduğunda, sınıflandırma en yakın üç komşu arasındaki çoğunluk sınıfı tarafından belirlenir — örneğin, iki komşu Sınıf 1'e (kalp hastalığı yok) ve biri Sınıf 2'ye (kalp hastalığı varsa) ise, sorgu örneği Sınıf 1 olarak sınıflandırılır ve daha sağlam ve gürültüye dayanıklı bir karar sağlar. MapReduce aşaması, tüm işçi düğümlerinden yerel olarak tanımlanan en yakın komşuları küresel sıralanmış bir listeye toplar; buradan en yakın K komşu seçilir ve ardından çoğunluk oyu hesaplayarak nihai sınıf tahminini oluşturur. CViHDKNN sınıflandırma çerçevesinin performansı, birincil ölçütler olarak hassasiyet, geri çağırma, F1-puanı ve genel sınıflandırma doğruluğu kullanılarak değerlendirilir. Küme kısıtlı aramanın dağıtık çoğunluk oyu ile entegrasyonu, standart KNN'den daha ince ve daha doğru karar sınırları üretir; risk altındaki hasta tespitinde yanlış negatifleri azaltır ve hassasiyeti artırır; bunlar da büyük ölçekli dağıtık sağlık analitik ortamlarında klinik olarak güvenilir kalp hastalığı tahmini için kritik gereksinimlerdir.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Sonuçlar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deneysel değerlendirme, CViHDKNN modelinin kalp hastalığı sınıflandırmasında CViHDDT modelinden daha yüksek öngörücü performans sağladığını göstermektedir. CViHDKNN modeli % 85,25 test doğruluğu elde ederken, CViHDDT modeli %80,33 doğruluk elde etti; bu da dağıtık K-en yakın komşu yaklaşımı için gelişmiş tahmin yeteneğini gösterdi. Bu karşılaştırmalı performans sonuçları Tablo 1'de özetlenmiştir.

CViHDDT model...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Tartışma

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Kümeleme tekniği CViHDDT'ye dayalı etkili bir kalp hastalığı tahmin yöntemi geliştirildi ve Hadoop tabanlı dağıtık karar ağacı çerçevesi kullanılarak değerlendirildi. Model, yaklaşık %75,62 eğitim doğruluğu ve %80,33 test doğruluğu elde ederek görünmeyen verilere genelleme yeteneğini gösterdi. Biraz daha yüksek test doğruluğu, Hadoop'un paralel işlemesinin büyük veri setlerini verimli bir şekilde yönettiğini ve aşırı uyumu en aza indirdiğini gösteriyor. Önceki çalışmalar benzer şekilde, ...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Açıklamalar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarların beyan edecek çıkar çatışmaları yoktur.

Teşekkürler

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarlar, bu araştırma çalışmaları boyunca izin verdikleri ve sürekli destek ve teşvik sağladıkları için Hindistan'ın Warangal kentindeki SR Üniversitesi'ne içten teşekkürlerini sunarlar. Yazarlar ayrıca, bu araştırma makalesinin başarıyla tamamlanmasına büyük katkı sağlayan değerli rehberlik, teknik destek ve motivasyon için Üniversite Araştırma ve Geliştirme (Ar-Ge) Ekibi, Ar-Ge laboratuvarları, kıdemli öğretim üyeleri ve mentorlarına teşekkür etmektedir.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
Apache SparkApache Software Foundation3.xDağıtılmış veri işleme
HDFSApache Software FoundationHadoop 3.x'de dahilDağıtılmış dosya depolama
YARNApache Software FoundationHadoop 3.x'de dahilKaynak yönetimi ve iş planlama
MatplotlibMatplotlib Development TeamVeri görselleştirme
SeabornSeaborn Developersİstatistiksel çizim
Ubuntu OSCanonical Ltd.20.04 LTSİşletim sistemi
RobustScalerScikit-learnÖzellik normalleştirme
UCI Heart Disease DatasetUCI Machine Learning RepositoryVeri Seti ID 45Deneysel veri seti

Yeniden basım ve izinler

Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste

İzin iste

Etiketler

EngineeringHadoopDistributed systemshealth careAI
Video yakında

İlgili makaleler