Araştırma makalesi

Astım Hastalığının Hesaplamalı Zekaya Dayalı Erken Teşhisi: Suudi Arabistan Vaka Çalışması

DOI:

10.3791/70040

16 Haziran 2026

Bu makalede

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Mevcut çalışma, astım tespiti için Suudi Arabistan veri setinde birkaç makine öğrenimi algoritmasını inceliyor. Astım tanısında makine öğrenimi kullanan klinik veri setlerine göre en son yöntemlerin aksine, önerilen şema daha iyi performans sağlamış ve tanı doğruluğunda %3,9 artış sağlamaktadır.

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Araştırmalara göre, astım da dahil olmak üzere kronik hastalıklarda artış tespit edilmiştir. Suudi Arabistan'daki astım hastası sayısı, özellikle pandemi sonrası dönemde hava koşulları ve yaşam tarzı nedeniyle endişe kaynağıdır. Astımı erken aşamada tespit edecek akıllı bir sistem geliştirerek enfeksiyonları azaltmak için bir çözüm gerektirir; böylece hastalığı önler veya erken tedavi mümkün kılar. Bu çalışmada, makine öğrenimi, astım semptomlarını erken aşamada takip etmek için araçlar geliştirmek amacıyla kullanılmıştır. Astım oluşumunu tahmin etmek için makine öğrenimini uygulamaya yönelik daha önce çeşitli girişimler olmuştur. Buna rağmen, hastalığın özellikle Suudi Arabistan bağlamında, semptom öncesi aşamada tanımlanmasına odaklanmak nispeten ihmal edilen bir alandır. Mevcut çalışmanın veri seti Suudi Arabistan'ın Dammam kentindeki King Fahad Üniversitesi Hastanesi'nden alındı ve hastalar üzerinde yapılan standart testleri içeren kan testleri, viral testler ve biyokimya testlerini içeriyordu. Veri seti 17 önemli özellik içerir ve 328 astım hastası için bilgi içerir: 165'i pozitif, 163'ü negatiftir. Burada uygulanacak yöntemler rastgele ormanlar (RF), yapay sinir ağları (ANN), destek vektör makineleri (SVM) ve saf Bayes (NB)'dir. Bu yöntemlerin her biri kendine özgü özelliklerine göre seçilmiştir. Deneysel sonuçlar, RF, SVM ve ANN yaklaşımlarının %94 verdiğini ortaya koydu; bu en yüksek doğruluk ve en son teknolojiyi %3,9 oranında geliştirdi. Yukarıdaki doğruluğu sağlamak için on yedi olası özelliğin dokuzunun kullanıldığını belirtmekte fayda var. RF, SVM ve ANN aynı doğruluğa ulaşmasına rağmen, ANN'nin hata maliyeti daha yüksektir. Bu nedenle, RF ve SVM sonuç desenine göre üstündür ve bu nedenle bu sorun için önerilirler.

Giriş

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Kapsamlı araştırmalar yaptıktan sonra, araştırmacılar kronik hastalıkların giderek yaygınlaştığınıgözlemlediler 1. Astım, nefes darlığı ve hırıltı ataklarıyla karakterize edilen kronik bir hava yolu inflamatuar hastalığıdır. Astım yaygınlığı küresel olarak değişir; hem çocuklar hem yetişkinler için %1–20 arasında değişir ve dünya çapında milyonlarca insanı etkiler2. Bu büyük ölçekli değişiklikler, çeşitli ülkelerdeki değişiklikler dahil çevresel değişimlerle, ayrıca farklı değerlendirme araçlarının kullanımı ve astımın çeşitli epidemiyolojik tanımlarıyla ilgilidir. Astım, diğer birçok iyi bilinen kronik hastalığa kıyasla nispeten düşük bir ölümoranına sahiptir 2. Ancak raporlar, Suudi Arabistan Krallığı'nda astım deseninin 3,4 arttığını belirtiyor.

Astım, daralan lümenle sonuçlanan kronik bir inflamatuar durumdur. Havacılık güzergahının daralması, vücut sıvısı emisyonunun genişlemesi ve ödem, subepitel fibrozi ve düz kas hipertrofisi nedeniyle bronşiyal bölücü kalınlaşmasıyla ortaya çıkar. Bu durumları değerlendirmek için bağışıklık hücreleri dahil olmak üzere çeşitli hücre tipleri tarafından yönlendirilen patofizyolojik cihazlarkullanılmıştır 5. Şiddetli hava koşulları ve ağırlıklı olarak Suudi Arabistan'da kapalı yaşam tarzı nedeniyle, astım en yaygın kronik hastalıklardan biridir. Birçok anket,astım 6'nın ezici oranını göstermiştir. Hastalık önemli bir sorun haline geldi ve olay sayısını azaltmaya yardımcı olacak ve hastalığın erken aşamada önlenmesi veya iyileştirilmesi için erken arabuluculuğu mümkün kılmak için erken müdahale sistemi gerektiriyor.

Bireylerin aksine, astım topluluklar ve aileler üzerinde derin bir etkiye sahiptir. Kontrol edilmezse, hastanın hayatına sert sınırlamalar getirir ve birçok günlük aktiviteye katılmasını engeller. Suudi Arabistan'da, sıcak atmosfer, yaygın kum fırtınaları ve kapalı hava kondisioneri/soğutma sistemlerinin aşırı kullanımı gibi zorlu hava koşulları astımın önemli nedenleridir. Suudi göğüs toplumu (STS), solunum yolu enfeksiyonları için en iyi ilaçları sağlamak için belirgin çabalarkaydetmiştir 7. Ancak, özellikle pandemi sonrası (COVID-19) senaryosunda enfeksiyon oranını azaltmak için proaktif bir astım teşhisi gereklidir. Ayrıca, aile öyküsü, sigara içmek ve alerjik rinitin Suudi yetişkinler arasında astım gelişimi için en önemli risk faktörleri olduğu ortaya çıktı. Çalışmanın temelini oluşturan diğer faktörleri incelemek için ek araştırmalar önerildi.

Bu araştırmada, astım teşhisiyle ilgili önceki çalışmalar dikkate alınarak, amaç tanı doğruluğunu artırmaktır. Önerilen teknikler, rastgele orman (RF), yapay sinir ağı (ANN), destek vektör makinesi (SVM) ve naif Bayes (NB) gibi daha önceki çalışmalarda kullanıldı ve tanı sonuçlarında belirgin iyileşmeler sağladı. Örneğin, araştırmacılarANN, SVM ve NB'yi 8,9,10 numaralı çalışmalarda kullanmıştır. Mevcut çalışmada, makine öğrenimi yaklaşımları, astım hastalığının küçük göstergelerini en erken aşamalarda (presemptomatik evre) tespit eden erken uyarı sistemi olarak incelenmiştir. Suudi Arabistan'da, özellikle pandemi sonrası dönemde, şiddetli hava koşulları nedeniyle kapalı yaşam tarzı gibi faktörler, klima kanalları ve kum fırtınaları gibi faktörler başlıca faktörler arasındadır. Ancak, yakın geçmişte görülen kritik faktörleri inceleyen önemli bir çalışma bulunmamaktadır. Bu araştırma açığını gidermek için mevcut çalışma, Suudi yetişkinlerde astımın erken tespitinde makine öğreniminin rolünü araştırmayı amaçlamaktadır. Ayrıca, birincil hedef en az özellikle mümkün olan en yüksek doğruluğu sağlamaktır. Geçmişte astım hastalığının varlığını tahmin etmek için makine öğrenimini kullanmaya yönelik tanınmışgirişimler olmuş olsa da, 8,9,10. Mevcut çalışma, doğu eyaletindeki bir kamu hastanesinden ilk kez elde edilen Suudi Arabistan veri setini kullanmayı ve hastalığın erken aşamasında teşhis edilmesine (önleyici teşhis) odaklanmayı hedefliyor. Makine öğrenimi (ML), toplanan verilerden bilgi çıkarma yöntemiolarak kabul edilir 11,12. Çeşitli makine öğrenimi teknikleri kullanılarak önceki örneklerin öğrenme sürecinden elde edilen tahmin doğruluğunu sağlar. ML, hastalıkların erken tespiti gibi geniş tıbbi alanlarda analitik ve öngörücü sorunları ele almak için birden fazla yöntem, algoritma ve stratejiyi kapsar.

Astım hastalığını çeşitli tekniklerle tahmin etmek için çeşitli çalışmalar yapılmıştır. Araştırmacılar, dinamik ve statik hasta testlerine bağlı olarak astım sınıflandırması için yapay sinir ağı (ANN)geliştirdiler 8. ANN'de ölçülen spirometri, impuls osilometrisi (IOS), auskultasyon, alerji sonuçları ve semptomlar bilgileri kullanılır. Tanımlanmış bilgiler, ANN'nin uygun astım sınıflandırmasını önermesini sağlar. Benzer şekilde, araştırmacılar göğüs hastalıklarının teşhisindeki zorlukları ele almak için bir çalışmayürüttü 7. Astım gibi göğüs hastalıklarının teşhisinde destek vektör makineleri (SVM) ve uyarlanabilir SVM (ASVM) yöntemleri kullanıldı. Tüm göğüs hastalıkları için en iyi sınıflandırma doğruluğu ASVM yöntemiyle elde edilmiştir. Araştırmacılar, göğüs hastalığı teşhisi için çok katmanlı NN (MLNN) ve geri yayılma algoritması (BPA) ile bir ve iki gizli katmanlı birçok sinir ağı yapısı, olasılıksal NN (PNN), öğrenme vektör kuantizasyonu (LVQ) ve genel regresyon NN (GRNN) gibi çeşitli sinir ağı yapılarını kullandılar; bunlar arasında astımhastalığı 15 de vardı. Ayrıca, bazıları yapay bağışıklık sistemi (AIS) kullanarak göğüs hastalıklarını teşhis etmeye yönelik karşılaştırmalı bir çalışma yürüttü. Bahsedilen çalışmalar, farklı veri setleri kullanarak göğüs hastalığı problemlerinin teşhisi için çeşitli yapılar uygulamıştır. Astım için en yüksek sonuç AIS kullanılarak elde edildi ve genel doğruluk %90,91 idi16. Ayrıca, araştırmacılar astım teşhisinde doğruluğu artırmak için derin bir NN'nin (DNN) etkinliğini araştırmış ve özellikle lojistik regresyon ve SVM ile farklı makine öğrenimi algoritmalarının tahmin performansını karşılaştırmıştır. Çalışma, astım belirtileri modelini kullanan ampirik testinastım 9'un doğru tanısı için daha etkili olduğunu gösterdi. Başka bir çalışma, makine öğreniminin tele-izleme verilerini kullanarak astım alevlenmelerini ortaya çıkmadan önce tahmin etmesini, SVM ve Naïve Bayes gibi seçilmiş makine öğrenimi yaklaşımlarıyla deneylerini uygulamaya yönelik önemli bir kapasitegöstermiştir.

Bunun dışında, araştırmacular Alzheimer hastalığını (AD) önleyici olarak teşhis etmek için SVM, k-NN, adaptif güçlendirme (AdaBoost) ve eXtreme gradyan güçlendirme (XGBoost) dahil olmak üzere çeşitli makine öğrenimi teknikleri kullandılar17. Araştırmacılar, diyabeti ön tanı koymak için NB, SVM, K-NN ve ANN olmak üzere dört makine öğrenimi yaklaşımını inceleyerek bir çalışma yürüttüler. Suudi Arabistan veri setinin en üst üç özelliği %68 ile en yüksek ortalama doğruluk oranına sahipti. Ölçüm tekniklerinin performansı doğruluk, hassasiyet, hatırlama ve F1 puanına göre karşılaştırıldı. ANN, %77,5 ile en yüksek sınıflandırma doğruluğunu elde etti18. Aynı araştırmacı grubu, kronik böbrek hastalığını önceden teşhis etmek için dört sınıflandırma tekniğinin — yani NB, SVM, K-NN ve ANN — performansını Suudi Arabistanveri seti 19'a uygulamak için deneyler yaptı. Ayrıca, yazarlar tiroid kanserini dört makine öğrenimi tekniği kullanarak ilkel olarak teşhis etmek için bir çalışma yürütmüştürler: ANN, SVM, RF ve NB. Suudi Arabistan veri setinin 14 özelliğini kullanarak, yazarlar en yüksek ortalama doğruluk olan %95'i elde ettiler. Ölçüm tekniklerinin performansı doğruluk, hassasiyet, hatırlama ve F1 puanı kullanılarak karşılaştırıldı. RF, %90,91 ile en yüksek sınıflandırma doğruluğunu elde etti. Araştırmacılar ayrıca romatoid artritin proaktif teşhisinde dikkat çekici sonuçlar veren iki çalışma yürüttü. SVM, lojistik regresyon (LR) ve AdaBoost gibi birkaç makine öğrenimi tekniği kısa listeye alındı ve oy topluluğu için aday teknikleri olarak kullanıldı. Başlangıçta bir veri seti kullanıldı, diğeri SMOTE uygulanarak dengelendi. Yeni oy topluluğu tekniği, iki ardışık özellik seçme yöntemiyle test edilmiştir. Yani, ileri ve geri seçimi, her teknik için en yüksek göstergeleri sunan özellik alanının en iyi alt kümesini bulmak için kullanılır. Orijinal verinin 30 özelliği ve ardışık ileri özellik seçimi tekniği kullanılarak, elde edilen yüzdeler umut vericiydi; doğruluk, hatırlama ve hassasiyet değerleri sırasıyla %94,03, %96 ve %93,51olarak %94,01 olarak belirlenmiştir 21. Benzer şekilde, tıp ve ilgili alanlarda diğer akıllı yöntemler birçokçalışmada bulunabilir 22,23,24,25,26.

Bu çalışmada önerilen teknikler, benzer sorunlar için üstün sonuçları nedeniyle RF, SVM, ANN ve NB'dir. Mevcut çalışmada, deneyler sonucunda elde edilen sonuçlar. Çeşitli optimizasyon adımları ve özellik seçimi sonrası, önerilen tekniklerin hedeflenen veri setiyle astım teşhisi için umut vaat eden olduğu gösterilmiştir.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Protokol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu bölüm, önerilen astım tanı yaklaşımında incelenen makine öğrenimi algoritmalarını tanımlar. Önerilen yöntemin seçilmesinin kriterleri ve nedenleri, kapsamlı bir literatür incelemesine ve birkaç kronik hastalığın önleyici teşhisiyle uğraşma geçmişinedayanmaktadır (27,28,29,30,31). Bu algoritmalar umut verici sonuçlar verdi. Bu çalışmada kullanılan tüm malzeme ve araçlar Materyaller Tablosu'nda listelenmiştir.

Destek vektör makineleri (SVM)
SVM algoritması, desen tanıma ve sınıflandırmada en başarılıalgoritmalardan biridir 32. İkili sınıflandırma kullanır; burada bir eğitim vektör kümesini iki sınıfa ayırır. Denetli öğrenme algoritmaları ailesine aiddir; istenen çıktı denetimaltında üretilir 32. Makine öğrenimindeki diğer sınıflandırma algoritmalarına kıyasla, SVM sınıflandırma performansı açısından daha iyi sonuçlar sağlar. Bu nedenle, konuşma, yüz ve el yazısı tanıma gibi birçok uygulamada yaygın olarak kullanılmıştır. Ayrıca, SVM hastalık tahmini ve stok tahmini gibi çeşitli alanlarda da uygulanmıştır. Ayrıca, gürültüye veya aşırı uyum hissetmesine karşı duyarsızlığı nedeniyle, SVM dengesiz verileri işleyebiliyor; bu, tıbbi tanıda tipik bir durumdur; pozitif vakalar negatif vakalardandaha az olur 32.

Sınıflandırmada, SVM iki sınıfı bir karar sınırı çizerek ayırır ve bu sınırda bir veya daha fazla özellik vektörünü ayırt ederek etiketleri tahminedebilir 32. Karar sınırı, her sınıfın en yakın veri noktalarından en uzak olan hiper düzlem olarak adlandırılır. Bu veri noktalarına destek vektörleri denir. Şekil 1, doğrusal olarak ayrılabilir verilerde bazı aday hiperdüzlemleri göstermektedir. Denklem 1 hiper düzlem denklemini gösterirken, denklemler 2 ve 3 düzlemin üstünde ve altında bulunan elemanlarıgösterir:

figure-protocol-1Hiper Düzlem Denklemi (1)

Burada, w ağırlığı temsil eden bir vektördür, x girdiyi temsil eden bir vektördür ve b. potansiyel bir yanlılığı temsil eder.

figure-protocol-2Tüm j için, böylece figure-protocol-3 = +1 (2)

figure-protocol-4Tüm i için, öyle ki figure-protocol-5 = -1 (3)

figure-protocol-6
Şekil 1: İki ayrılabilir sınıfa sahip tipik bir SVM. Bu figür, iki ayrılabilir sınıfa sahip tipik bir SVM'yi görselleştirir. Kısaltmalar; SVM = destek vektör makinesi. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Yapay sinir ağı (ANN)
ANN, insan beyin sisteminin işlevselliğini taklit eden yumuşak hesaplamada kullanılan bir hesaplamalı zeka tekniğidir. Çok sayıda birbirine bağlı nöronvardır 33. Örnek veri setlerinden öğrenebilen ve performanslarını öğrenerek geliştirebilen, faydalı çıktılar üretebilen denetli makine öğrenimialgoritmalarından biridir 33. ANN'nin mimarisi birden fazla katmandan oluşur: bir giriş katmanı, bir gizli bir katman ve bir çıkış katmanı. Her biri birbirine bağlı bir dizinöron 33 tarafından oluşur.

Dışarıdan gelen veriyi alan nöron bazı işlemler yapar ve ardından veriyi giriş katmanı olarak bilinen başka bir katmana gönderir. Giriş katmanının amacı, veri üzerinde karmaşık bir süreç gerçekleştirmek değildir; sadece giriş değerini çoğaltmak ve bir sonrakikatman 33'e göndermektir. Çıkış katmanı, kullanıcı programı için veri üreten nöronları içerir. Bu iki katman arasında, gizli katman hesaplama süreçlerini gerçekleştirmek için isteğe bağlı bir katman olarak yer alır. Gizli katman, giriş nöronlardan gelen girdileri alan, onlar üzerinde matematiksel işlemler yapan ve ardından sonuçları başkabir katman 33'e ileten ara katman olarak hizmet eder. Şekil 2 ANN mimarisini göstermektedir.

figure-protocol-7
Şekil 2: Tipik bir ANN yapısında ileri besleme ve geri yayılma. Bu şekil, tipik bir ANN yapısında geri yayılma ile ile-ileri besleme ağını görselleştirir. Kısaltmalar; ANN = yapay sinir ağı. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

İleriye besleme NN, girdi verilerini ileri yönlü bir şekilde depolayan bir yaklaşımdır. Ters yönde, geri yayılma süreci, sinir ağı ağırlıklarının geri dönük bir yaklaşımla güncellenerek gradyanları elde etmek için birkaç gizli katmanlı sinir ağı kullanılarak gerçekleşir. Bu sürecin dezavantajı, gradyanların kaybolması veya patlamasıdır. Aktivasyon fonksiyonu, ANN'nin doğrusal olmayan özelliklerini korur; bu da giriş ve çıkış verileri arasındaki detaylı ilişkileri öğrenmesini sağlar; evrensel bir yaklaşım olarak ilan edilir. Şekil 3 , yapay sinir ağının ana mimarisini göstermektedir. Ayrıca, tüm girdi ağırlıklarının toplamını temsil eden her nöronun çıktısına uygulanan aktivasyon fonksiyonunu da gösterir. Bu yanlılık tüm ağırlıkların toplamını tutar ve nörongirişi 33'e dahil edilir.

figure-protocol-8
Şekil 3: ANN için tipik bir tek perceptron nöronu. Bu figür, tipik bir ANN'nin tek bir perceptron nöronunu tasvir eder. Kısaltmalar; ANN = yapay sinir ağı. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Rastgele orman (RF)
RF, makine öğreniminde önde gelen sınıflandırma algoritmalarından biridir. Birkaç ayrı Karar Ağacı'nın birlikte bir topluluk olarak çalışmasından ve nihaiçıktı 29'u üretmesinden oluşur. RF'nin başarılı performansının temel kavramı, birçok orta derecede ilişkisiz ağaçtan (orman oluşturan) ve bir komite olarak görev yapan ağaçlardan oluşmasıdır. Bu nedenle, bağımsız çalışan tüm modellerdendaha verimli olurlar 34. RF algoritması esas olarak bir grup araştırmacıtarafından geliştirilmiştir 35. RF'nin nasıl çalıştığını daha iyi anlamak için, kararağaçları 35'i anlamak çok önemlidir. Hem ayrık hem de sürekli problemlere, özellikle sınıflandırma, tespit ve regresyon gibi sorunlara eşit derecedeuygulanabilir, sırasıyla 36. Ormanda ne kadar çok ağaç olursa, sonuç o kadar doğruya daha yakın olur, ancak Şekil 4'te gösterildiği gibi hesaplamakarmaşıklığı 36 eklenir.

figure-protocol-9
Şekil 4: Rastgele Orman şeması. Bu figür, tipik rastgele bir ormanın şemasını gösterir. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Naive Bayes (NB)
Naïve Bayes (NB), nesneleri sınıflandırmak için Bayes teoremini kullanan bir sınıflandırma algoritmasıdır. Çoğu tıp alanında, özellikle semptomların teşhisi için çok popüler bir yöntemdir. Bu yöntemde, nesneler temel bağımsızlık varsayımlarını alır; bu da öznitelikler arasındaki ilişkiyi birbirinden bağımsız kılar. Naif doğası nedeniyle, makine öğrenimindeki en basit sınıflandırmaalgoritmalarından biridir 37. Verilen veri setine dayanarak, NB belirli bir çıktının olasılığını belirler. NB modeli geliştirilmesi kolaydır, önemli verileri yönetebilir ve sofistike ve hesaplama açısından hafif bir algoritmadır. Ayrıca, sayısal ve nominal bilgi elde eden mütevazı işlevler sunar. Dayanıklılık ve basit öğrenme yorumları da NB sınıflandırıcısının potansiyel avantajlarıdır. Sınırlı miktarda veri üzerinde kullanılırsa, nispeten yanlış bir sonuç ortaya çıkar. Bu, diğer tekniklere kıyasla daha az kesin kabul edilen devasa kayıtlarabağlıdır 37.

İstatistiksel analiz
Veri setinin istatistiksel analizi, veri setinin desenini görselleştirmeye ve anlamaya yardımcı olur; böylece veri ön işleme ve modelleme daha iyi hale getirilir. Bu bağlamda, aşağıdaki adımlar gerçekleştirildi. İlk olarak, yaş ve cinsiyet dahil olmak üzere pozitif ve olumsuz gruplar arasında demografik özelliklerin dengesiz olup olmadığını araştırmak için SPSS yazılımında istatistiksel bir analiz yapılır. İkinci olarak, normal dağılım ve varyansın homojenliği sağlandıysa bağımsız bir örneklem t-testi veya Man-Whitney U testi kullanılarak nicel verileri derleyin. Son olarak, kategorik veriler ki-kare testi veya Fisher'ın tam testi38 kullanılarak derlenmiştir.

Uygulama
Veri seti açıklaması
Mevcut çalışmanın veri seti, kurumsal inceleme kurulu (IRB) tarafından onaylandıktan sonra Suudi Arabistan'ın Dammam kentindeki King Fahad Üniversitesi Hastanesi'nden alınmıştır. Bahsedilen veriler, hastalar arasında yapılan standart testlere göre toplanmıştır. Astım genellikle hastalar arasında kan testleri, virüs testleri ve biyokimya testleri gibi standart testlerle teşhis edilir. Mevcut çalışma için, hastalar ve sağlıklı kontrol grupları (HC) bölümdeki hekimlerin tavsiyesi altında hastanede yapılan standart triaj ve patolojik testlere dayanarak seçildi ve klinik olarak değerlendirildi. Klinik dahil etme ve dışlama kriterleri laboratuvar sonuçlarına dayanarak doktorlar tarafından belirlenmiştir. Daha sonra, çalışma için nitelikli ve doğrulanmış veriler sağlandı. Veri seti on yedi özellik içerir ve tüm astım hastaları için mevcuttur. Veri seti, toplam 328 vakayı içerir; bunların 165'i astım pozitif ve 163 astım negatif vakası vardır. Pozitif ve negatif gruplar arasındaki cinsiyet ve yaş dağılımı Tablo 1'de listelenmiştir.

ÖrneklerOlumluOlumsuz
Erkek14510738
Kadın18357126
Toplam328164164

Tablo 1: Veri seti cinsiyet dağılımı. Bu tablo, veri setindeki cinsiyet dağılımını gösterir.

Tablo 2 , iki sınıf arasındaki yaş dağılımını gösterir.

Yaş AralığıYaş Dağılımı (Sınıf = 1)Yaş Dağılımı (Sınıf = 0)
1–100.0591130
11–200.1133010.060869
21–300.0837430.177947
31–400.1576320.164912
41–500.177340.164912
51–600.1970440.099566
61–700.1083740.047619
71–800.0788170.025974
81–900.0197040.012987
91–1000.0049260.012987

Tablo 2: Veri seti yaş dağılımı. Bu tablo, veri setindeki yaş dağılımını gösterir.

Yaş (Man-Whitney U testinde p < 0.001) ve cinsiyet (p < Chi-kare testinde 0.001) pozitif ve negatif gruplar arasında dengesizdi. Ancak, işe alım sürecinde bir önyargı yoktur. Dengesiz dağılımın, bu hasta grubunun benzersiz yaş dağılımını yansıtabileceğine inanılmaktadır. Dahil etme kriterleri arasında hastalığın varlığı ve yokluğu için klinik faktörler; Cinsiyet, yaş ve yerel nüfus dahil olmak üzere demografik faktörler dikkate alınır. Ayrıca, veriler bilgilendirilmiş onay ile toplanmıştır. Yaş ve cinsiyet, aşağıda belirtildiği gibi, özellikler setinde potansiyel özellikler olarak dahil edilmiştir. Ancak, açıkça yaş ve cinsiyete dayalı analizler çalışmanın kapsamında değildir ve gelecekteki çalışmalar olarak bırakılır.

Veri seti sayısal değerler olarak saklanır. "Sınıf" sütununda 0 ve 1 değerleri bulunur; burada 0 "Normal hasta"yı, 1 ise "Astım hastası"nı temsil eder.
Bu bağlamda, aşağıdaki on yedi özellik kullanılmıştır:
Sınıf: (0 = "Normal", 1 = "Astım Hastası")

1. yaş (YAŞ)

2. cinsiyet (1 = erkek, 0 = kadın): CINSİYyet

3. Basofiller (BASO)

4. Eozinofiller (EOS)

5. Hematokrit (HCT)

6. Hemoglobin (HGB)

7. Lenfositler (LYM)

8. Ortalama kâpüsküler hemoglobin (MCH)

9. Ortalama kâpüstüler hemoglobin konsantrasyonu (MCHC)

10. Ortalama koptik hacim (MCV)

11. Monositler (MONO)

12. Ortalama trombosit hacmi (MPV)

13. Nötrofil Fonksiyonu (NEUT)

14. Trombosit sayısı (PLATELET_COUNT)

15. Kırmızı kan hücresi sayısı (RBC)

16. Kırmızı hücre dağılım genişliği (RDW)

17. Beyaz Kan Hücresi (WBC)

Veri setinin istatistiksel özellikleri
Daha iyi anlamak için, veri setinin istatistiksel analizi aşağıdakitablolarda 38 gösterilmiştir. Tablo 3 , ele alınan veri seti için ortalama, Medyan, Standart Sapma, Maksimum ve minimum değerleri göstermektedir.

AcımasızMedyanStandart sapmaMaxMin
YAŞ39.13618.136932
CINSIYET0.44200.497410
BASO0.070.070.07010.720
EOS0.2310.2290.204820
HCT40.8840.76.031356.53.4
HGB13.6713.454.344681.35.9
LYMP2.5952.332.184333.40.4
MCH26.78273.317734.52.6
MCHC32.71332.101743.115
MCV81.1582.89.442610213
MONO1.1890.6136.1198950.2
MPV9.2179.2171.729713.40
NEUT4.234.232.3074160.6
PLATELET_COUNT279.7272.585.4736850
RBC5.677511.6152152.1
RDW14.7213.415.7692960
WBC6.7776.5053.583633.41.1
Sınıf0.50.50.500810

Tablo 3: Veri setinin istatistiksel özellikleri. Bu tablo, verilerin istatistiksel özelliklerini listeler.

Ayrıca, Tablo 4 her öznitelik ile sınıf özniteliği arasındaki elde edilen korelasyon katsayısını gösterir. Değerleri 0 (en az korelasyonlu) ile 1 (en çok korelasyonlu) arasında yer alır. Veri seti özelliklerini açıklamak için ön istatistiksel analiz olarak eklenmiştir. MPV, Cinsiyet, HGB, MCHC ve yaş en önemli özellikler arasındadır.

Özniteliklerin çiftleriKorelasyon katsayısı
YAŞ0.212473
CINSIYET0.423584
BASO-0.33242
EOS0.048184
HCT-0.376843
HGB0.275277
LYMP0.055856
MCH0.128111
MCHC0.272635
MCV0.013022
MONO0.055476
MPV0.564992
NEUT0.031185
PLATELET_COUNT0.095253
RBC0.030787
RDW0.025979
WBC0.148842
Sınıf1

Tablo 4: Sınıf özniteliği ile korelasyon. Bu tablo, özellikler (özellikler) ile sınıf özniteliği arasındaki korelasyonu gösterir.

Deneysel kurulum
Mevcut çalışmada, toplanan veri setini ön işlemek için Python programlama dili kullanılıyor. İnsan hatası nedeniyle, veri girişi ve seçimi sırasında belirli değerler eksiktir. Veri setinde eksik değerleri yönetmek için emputasyon teknikleri kullanılmıştır. Bu, eksik değerleri özniteliğin ortalamasıyla değiştirerek yapılır. Sadeliği, model uyumluluğu ve örneklem ortalama değerlerinin korunması nedeniyle, sağlık profesyonelleriyle görüşülmüştür. Ayrıca, özellik seçimi korelasyon katsayıları kullanılarak yapılır ve nitelikler sıralanır. Daha yüksek korelasyon değerlerine sahip özellikler, tüm özellik setiyle birlikte analiz için seçildi. Önerilen yaklaşımın uygulanması, hiperparametre ayarlaması ve sonuç elde edilmesi için Python kütüphaneleri kullanılmıştır. Özellik seçimi ve elemesi, özellik seçme yöntemiyle gerçekleştirilerek en yüksek doğruluğa sahip özellik gruplarını tespit etti. Ayrıca, Python, verilen denklemler 39,40'ta belirtildiği şekilde, 10 katlı çapraz doğrulama ve Doğrudan Bölüm Oranı değerlendirme yöntemleriyle doğruluğu değerlendirmek için kullanılmıştır. Son olarak, tüm değerlendirme yöntemlerinin çıktılarının ortalaması, kullanılan değerlendirme yöntemlerini karşılaştırmak ve en iyi ortalama doğruluğasahip yöntem belirlemek için hesaplandı 38. Ayrıca, SVM, ANN, RF ve NB'nin optimal parametreleri kullanılarak karışıklık matrisleri oluşturuldu. Daha sonra, yanlış pozitifler (FP), yanlış negatifler (FN), gerçek pozitifler (TP) ve gerçek negatif (TN) oranlarının karşılaştırılması, en iyi yöntem 41,42'yi karşılaştırmak için verimli bir ölçüt olan F1-puanı hesaplanarak gerçekleştirilmiştir.

Değerlendirme metrikleri
Önerilen yaklaşımın performansını değerlendirmek için dört iyi bilinen performans ölçütü dikkate alınır. Yani, doğruluk, hassasiyet, geri çağırma ve F1 puanı. Sınıflandırma doğruluğu birincil ölçüttür; çünkü her örnek için doğru sınıflandırılmış örneklerin yüzdesi hesaplanır. Hassasiyet, beklenen toplam TP puanlarının sayısıdır. Geri çağırma, her gerçek pozitiften daha fazla TP sayısıdır. Her sınıfın F1 puanı performansı. Çıktıların kapasitesine göre, aşağıdaki metriklerelde edilmiştir 43,44,45:

Gerçek pozitif (TP): Doğru teşhis edilen astım sonucu.

Yanlış pozitif (FP): Yanlış şekilde astım teşhisi konmasının sonucu.

Gerçek negatif (TN): Astım olmayan doğru vakaların sonucu.

Yanlış negatif (FN): Yanlış şekilde astım olmayan olarak teşhis edilmesinin sonucu.

figure-protocol-10(4)

figure-protocol-11(5)

figure-protocol-12(6)

Optimizasyon stratejisi
Önerilen yaklaşımların her biri için optimal parametreleri belirlemek amacıyla Grid Search tekniği kullanıldı. Grid Search yöntemine belirli parametre ve olası değerler yerleştirilir. Bu nedenle, hassasiyet iyileştirmesi için en iyi performansı geliştirebilir.

Şekil 5–7 , önerilen dört yaklaşımın tamamı için Grid Search tekniğinin sonucunu ve veri setindeki uygulama prosedürünü en üst on sekiz öznelliğin yardımıyla göstermektedir. Şekil 5, çeşitli parametre değerleriyle elde edilen SVM doğruluklarını sunmaktadır. Birden fazla çekirdek türüne karşılık gelen Maliyet ve Gamma için giriş değerleri şunlardır:

Çekirdek türleri: Linear, Radial, Sigmoid ve Polynomial.

Gamma: 0.001 ve 0.0001.

Maliyet: 1, 10, 100 ve 1000.

figure-protocol-13
Şekil 5: Farklı maliyet ve gama tiplerine sahip SVM. Bu şekil, farklı maliyet ve gama tipleriyle SVM davranışını gösterir. Kısaltmalar; SVM = destek vektör makinesi. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

RF için, Şekil 6'da sistematik olarak belirtilen giriş değerleri aşağıdaki gibidir:

Parametre isimleri ve ilgili değerleri aşağıda verilmiştir:

Özellik sayısı: 'auto', 'sqrt'.

Maksimum derinlik: 1, 3, 5, 7.

Minimum örnekler bölünmesi: 2, 3, 4, 5.

MINIMUM örnekler yaprak: 2, 3, 4, 5.

figure-protocol-14
Şekil 6: Farklı derinlik değerleri ve minimum örnek yaprakları ile RF. Bu şekil, farklı derinliklerde ve minimum numune yaprak değerlerinde RF davranışını gösterir. Kısaltmalar; RF = rastgele orman. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

ANN için analitik giriş değerleri Şekil 7'de gösterilmiştir.

Parametre isimleri ve ilgili değerleri şunlardır:

Gizli katman boyutları: (50, 50, 50), (50, 100, 50) ve (100).
Aktivasyon: 'tanh' ve 'relu'.
Çözücü: 'sgd' ve 'adam'.
Alfa: 0.1, 0.01, 0.001, 0.0001, 0.5, 0.005, 0.0005 ve 0.05.
Öğrenme hızı: 'sabit' ve 'uyumlanabilir'.

figure-protocol-15
Şekil 7: Farklı alfa değerleri ve gizli katman boyutlarına sahip ANN. Bu şekil, ANN'nin farklı alfa değerleri ve gizli katman boyutlarıyla davranışını gösterir. Kısaltmalar; ANN = yapay sinir ağı. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

SınıflandırıcıParametreDeğer
SVMGamma0.0001
Çekirdek tipi'rbf'
Maliyet 'C'10
Rastgele durum42
RFMaksimum derinlik3
Min örnekler yaprak2
Min örnekler bölünmesi2
Rastgele durum42
ANNAktivasyon'relu'
alfa0.001
Gizli Katman Boyutu(50,50,50)
Öğrenme hızı'Sürekli'
çözücü'Adam'
Rastgele durum42

Tablo 5: Önerilen sınıflandırıcılar için optimal parametrelerin özeti. Bu tablo, önerilen sınıflandırıcılar için elde edilen optimal parametreleri özetler.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Sonuçlar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Özellik seçiminin etkisi
Mevcut çalışmada, özellik seçimi için özyinelemeli özellik eleme tabanlı korelasyon katsayısı yöntemi kullanılmıştır. Korelasyon katsayısı, özelliklerin en yüksekten en düşükten en düşük seviyesine korelasyon değerlerine göre sıralanması için kullanılır. Modele uygun özelliklerin seçilmesine yardımcı olmak için özyinelemeli özellik ortadan kaldırılır; böylece en zayıf özellikler kademeli olarak ortadan kaldırılır ve geriye sadece bir özellik k...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Tartışma

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Mevcut çalışma, SVM, ANN, RF ve NB dahil olmak üzere çeşitli makine öğrenimi algoritmalarını kullanmaktadır. Birkaç deney yapıldıktan sonra, hiperparametreler ince ayarlandı ve özellik seçimi yapıldıktan sonra, SVM, ANN ve RF'nin %94 tanı doğruluğu gösterdiği sonucuna varıldı; NB ise %83,33 ile karşılaştırmalı olarak daha düşük olduğu sonucuna varıldı. Sonuçlar, 10 kat çapraz doğrulama ve optimize edilmiş özellik seçimi ile en iyi bölünme oranı kullanılarak doğrulandı. Verilen verilere g...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Açıklamalar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Veri seti, hastaneden IRB-2020-09-429 kapsamında alınmıştır. Yazarlar, mevcut çalışmayla ilgili rapor edecek çıkar çatışmaları olmadığını belirtiyor. Çalışma, Research Square deposuna ön baskı olarak eklendive aşağıdaki 50 alıntı belirtilmiştir.

YAZARLARIN KATKILARI:
Kavramsallaştırma S.O., M.I.B.A. ve A.R. tarafından yapılmıştır; Denetim S.O., M.I.B.A. ve J.A. tarafından gerçekleştirilmiştir; Orijinal taslağı S.S.A., E.A. ve Z.A. tarafından yazıldı; Uygulama S.A.A., Y.A. ve R.A. tarafından gerçekleştirildi; Doğrulama J.A., M.A. ve S.D. tarafından yapıldı; Veri kürasyonu A.B., Y.A., E.A. ve Z.A. tarafından gerçekleştirildi; İnceleme ve Düzenleme A.R., S.D. ve A.B. tarafından gerçekleştirildi; Proje yönetimi A.R., S.D. ve M.A. tarafından, fon edinimi ise A.B., S.D. ve A.R. tarafından gerçekleştirildi.

Teşekkürler

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarlar, çalışmanın bulgularını doğrulamada sağlık profesyonellerinin desteğini takdir etmek isterler.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
Excel 365MicrosoftExcel 365Csv formatında ham veri depolamak için kullanılır
Laptop/MakineDellXPS9320RAM 16GB, 12. Nesil Intel(R) Core(TM) i7-1260P
Mlxtend 0.23.4Google colab Notebook Mlxtend 0.23.4Model oluşturma eğitimi için kullanılır 
Numpy 2.0.2Google colab Notebook Numpy 2.0.2Model oluşturma eğitimi için kullanılır 
Pandas 2.2.2Google colab Notebook Pandas 2.2.2Model oluşturma eğitimi için kullanılır 
Python 3.12.12Google colab Notebook Python 3.12.12Model oluşturma eğitimi için kullanılır 
Sklearn 1.6.1Google colab Notebook Sklearn 1.6.1Model oluşturma eğitimi için kullanılır 
SPSS IBM, USAVersiyon 26.0İstatistiksel analiz için kullanılır
XGbbost 3.1.2Google colab Notebook XGbbost 3.1.2Model oluşturma eğitimi için kullanılır 

Yeniden basım ve izinler

Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste

İzin iste

Etiketler

Ast m Tan sMakine renmesiErken Te hisSuudi Arabistan Ast mRastgele OrmanlarDestek Vekt r MakineleriYapay Sinir A larT bbi Veri AnaliziKronik Hastal k ng r s

İlgili makaleler