$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Bu bölüm, önerilen astım tanı yaklaşımında incelenen makine öğrenimi algoritmalarını tanımlar. Önerilen yöntemin seçilmesinin kriterleri ve nedenleri, kapsamlı bir literatür incelemesine ve birkaç kronik hastalığın önleyici teşhisiyle uğraşma geçmişinedayanmaktadır (27,28,29,30,31). Bu algoritmalar umut verici sonuçlar verdi. Bu çalışmada kullanılan tüm malzeme ve araçlar Materyaller Tablosu'nda listelenmiştir.
Destek vektör makineleri (SVM)
SVM algoritması, desen tanıma ve sınıflandırmada en başarılıalgoritmalardan biridir 32. İkili sınıflandırma kullanır; burada bir eğitim vektör kümesini iki sınıfa ayırır. Denetli öğrenme algoritmaları ailesine aiddir; istenen çıktı denetimaltında üretilir 32. Makine öğrenimindeki diğer sınıflandırma algoritmalarına kıyasla, SVM sınıflandırma performansı açısından daha iyi sonuçlar sağlar. Bu nedenle, konuşma, yüz ve el yazısı tanıma gibi birçok uygulamada yaygın olarak kullanılmıştır. Ayrıca, SVM hastalık tahmini ve stok tahmini gibi çeşitli alanlarda da uygulanmıştır. Ayrıca, gürültüye veya aşırı uyum hissetmesine karşı duyarsızlığı nedeniyle, SVM dengesiz verileri işleyebiliyor; bu, tıbbi tanıda tipik bir durumdur; pozitif vakalar negatif vakalardandaha az olur 32.
Sınıflandırmada, SVM iki sınıfı bir karar sınırı çizerek ayırır ve bu sınırda bir veya daha fazla özellik vektörünü ayırt ederek etiketleri tahminedebilir 32. Karar sınırı, her sınıfın en yakın veri noktalarından en uzak olan hiper düzlem olarak adlandırılır. Bu veri noktalarına destek vektörleri denir. Şekil 1, doğrusal olarak ayrılabilir verilerde bazı aday hiperdüzlemleri göstermektedir. Denklem 1 hiper düzlem denklemini gösterirken, denklemler 2 ve 3 düzlemin üstünde ve altında bulunan elemanlarıgösterir:
Hiper Düzlem Denklemi (1)
Burada, w ağırlığı temsil eden bir vektördür, x girdiyi temsil eden bir vektördür ve b. potansiyel bir yanlılığı temsil eder.
Tüm j için, böylece
= +1 (2)
Tüm i için, öyle ki
= -1 (3)

Şekil 1: İki ayrılabilir sınıfa sahip tipik bir SVM. Bu figür, iki ayrılabilir sınıfa sahip tipik bir SVM'yi görselleştirir. Kısaltmalar; SVM = destek vektör makinesi. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Yapay sinir ağı (ANN)
ANN, insan beyin sisteminin işlevselliğini taklit eden yumuşak hesaplamada kullanılan bir hesaplamalı zeka tekniğidir. Çok sayıda birbirine bağlı nöronvardır 33. Örnek veri setlerinden öğrenebilen ve performanslarını öğrenerek geliştirebilen, faydalı çıktılar üretebilen denetli makine öğrenimialgoritmalarından biridir 33. ANN'nin mimarisi birden fazla katmandan oluşur: bir giriş katmanı, bir gizli bir katman ve bir çıkış katmanı. Her biri birbirine bağlı bir dizinöron 33 tarafından oluşur.
Dışarıdan gelen veriyi alan nöron bazı işlemler yapar ve ardından veriyi giriş katmanı olarak bilinen başka bir katmana gönderir. Giriş katmanının amacı, veri üzerinde karmaşık bir süreç gerçekleştirmek değildir; sadece giriş değerini çoğaltmak ve bir sonrakikatman 33'e göndermektir. Çıkış katmanı, kullanıcı programı için veri üreten nöronları içerir. Bu iki katman arasında, gizli katman hesaplama süreçlerini gerçekleştirmek için isteğe bağlı bir katman olarak yer alır. Gizli katman, giriş nöronlardan gelen girdileri alan, onlar üzerinde matematiksel işlemler yapan ve ardından sonuçları başkabir katman 33'e ileten ara katman olarak hizmet eder. Şekil 2 ANN mimarisini göstermektedir.

Şekil 2: Tipik bir ANN yapısında ileri besleme ve geri yayılma. Bu şekil, tipik bir ANN yapısında geri yayılma ile ile-ileri besleme ağını görselleştirir. Kısaltmalar; ANN = yapay sinir ağı. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
İleriye besleme NN, girdi verilerini ileri yönlü bir şekilde depolayan bir yaklaşımdır. Ters yönde, geri yayılma süreci, sinir ağı ağırlıklarının geri dönük bir yaklaşımla güncellenerek gradyanları elde etmek için birkaç gizli katmanlı sinir ağı kullanılarak gerçekleşir. Bu sürecin dezavantajı, gradyanların kaybolması veya patlamasıdır. Aktivasyon fonksiyonu, ANN'nin doğrusal olmayan özelliklerini korur; bu da giriş ve çıkış verileri arasındaki detaylı ilişkileri öğrenmesini sağlar; evrensel bir yaklaşım olarak ilan edilir. Şekil 3 , yapay sinir ağının ana mimarisini göstermektedir. Ayrıca, tüm girdi ağırlıklarının toplamını temsil eden her nöronun çıktısına uygulanan aktivasyon fonksiyonunu da gösterir. Bu yanlılık tüm ağırlıkların toplamını tutar ve nörongirişi 33'e dahil edilir.

Şekil 3: ANN için tipik bir tek perceptron nöronu. Bu figür, tipik bir ANN'nin tek bir perceptron nöronunu tasvir eder. Kısaltmalar; ANN = yapay sinir ağı. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Rastgele orman (RF)
RF, makine öğreniminde önde gelen sınıflandırma algoritmalarından biridir. Birkaç ayrı Karar Ağacı'nın birlikte bir topluluk olarak çalışmasından ve nihaiçıktı 29'u üretmesinden oluşur. RF'nin başarılı performansının temel kavramı, birçok orta derecede ilişkisiz ağaçtan (orman oluşturan) ve bir komite olarak görev yapan ağaçlardan oluşmasıdır. Bu nedenle, bağımsız çalışan tüm modellerdendaha verimli olurlar 34. RF algoritması esas olarak bir grup araştırmacıtarafından geliştirilmiştir 35. RF'nin nasıl çalıştığını daha iyi anlamak için, kararağaçları 35'i anlamak çok önemlidir. Hem ayrık hem de sürekli problemlere, özellikle sınıflandırma, tespit ve regresyon gibi sorunlara eşit derecedeuygulanabilir, sırasıyla 36. Ormanda ne kadar çok ağaç olursa, sonuç o kadar doğruya daha yakın olur, ancak Şekil 4'te gösterildiği gibi hesaplamakarmaşıklığı 36 eklenir.

Şekil 4: Rastgele Orman şeması. Bu figür, tipik rastgele bir ormanın şemasını gösterir. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Naive Bayes (NB)
Naïve Bayes (NB), nesneleri sınıflandırmak için Bayes teoremini kullanan bir sınıflandırma algoritmasıdır. Çoğu tıp alanında, özellikle semptomların teşhisi için çok popüler bir yöntemdir. Bu yöntemde, nesneler temel bağımsızlık varsayımlarını alır; bu da öznitelikler arasındaki ilişkiyi birbirinden bağımsız kılar. Naif doğası nedeniyle, makine öğrenimindeki en basit sınıflandırmaalgoritmalarından biridir 37. Verilen veri setine dayanarak, NB belirli bir çıktının olasılığını belirler. NB modeli geliştirilmesi kolaydır, önemli verileri yönetebilir ve sofistike ve hesaplama açısından hafif bir algoritmadır. Ayrıca, sayısal ve nominal bilgi elde eden mütevazı işlevler sunar. Dayanıklılık ve basit öğrenme yorumları da NB sınıflandırıcısının potansiyel avantajlarıdır. Sınırlı miktarda veri üzerinde kullanılırsa, nispeten yanlış bir sonuç ortaya çıkar. Bu, diğer tekniklere kıyasla daha az kesin kabul edilen devasa kayıtlarabağlıdır 37.
İstatistiksel analiz
Veri setinin istatistiksel analizi, veri setinin desenini görselleştirmeye ve anlamaya yardımcı olur; böylece veri ön işleme ve modelleme daha iyi hale getirilir. Bu bağlamda, aşağıdaki adımlar gerçekleştirildi. İlk olarak, yaş ve cinsiyet dahil olmak üzere pozitif ve olumsuz gruplar arasında demografik özelliklerin dengesiz olup olmadığını araştırmak için SPSS yazılımında istatistiksel bir analiz yapılır. İkinci olarak, normal dağılım ve varyansın homojenliği sağlandıysa bağımsız bir örneklem t-testi veya Man-Whitney U testi kullanılarak nicel verileri derleyin. Son olarak, kategorik veriler ki-kare testi veya Fisher'ın tam testi38 kullanılarak derlenmiştir.
Uygulama
Veri seti açıklaması
Mevcut çalışmanın veri seti, kurumsal inceleme kurulu (IRB) tarafından onaylandıktan sonra Suudi Arabistan'ın Dammam kentindeki King Fahad Üniversitesi Hastanesi'nden alınmıştır. Bahsedilen veriler, hastalar arasında yapılan standart testlere göre toplanmıştır. Astım genellikle hastalar arasında kan testleri, virüs testleri ve biyokimya testleri gibi standart testlerle teşhis edilir. Mevcut çalışma için, hastalar ve sağlıklı kontrol grupları (HC) bölümdeki hekimlerin tavsiyesi altında hastanede yapılan standart triaj ve patolojik testlere dayanarak seçildi ve klinik olarak değerlendirildi. Klinik dahil etme ve dışlama kriterleri laboratuvar sonuçlarına dayanarak doktorlar tarafından belirlenmiştir. Daha sonra, çalışma için nitelikli ve doğrulanmış veriler sağlandı. Veri seti on yedi özellik içerir ve tüm astım hastaları için mevcuttur. Veri seti, toplam 328 vakayı içerir; bunların 165'i astım pozitif ve 163 astım negatif vakası vardır. Pozitif ve negatif gruplar arasındaki cinsiyet ve yaş dağılımı Tablo 1'de listelenmiştir.
| Örnekler | Olumlu | Olumsuz |
| Erkek | 145 | 107 | 38 |
| Kadın | 183 | 57 | 126 |
| Toplam | 328 | 164 | 164 |
Tablo 1: Veri seti cinsiyet dağılımı. Bu tablo, veri setindeki cinsiyet dağılımını gösterir.
Tablo 2 , iki sınıf arasındaki yaş dağılımını gösterir.
| Yaş Aralığı | Yaş Dağılımı (Sınıf = 1) | Yaş Dağılımı (Sınıf = 0) |
| 1–10 | 0.059113 | 0 |
| 11–20 | 0.113301 | 0.060869 |
| 21–30 | 0.083743 | 0.177947 |
| 31–40 | 0.157632 | 0.164912 |
| 41–50 | 0.17734 | 0.164912 |
| 51–60 | 0.197044 | 0.099566 |
| 61–70 | 0.108374 | 0.047619 |
| 71–80 | 0.078817 | 0.025974 |
| 81–90 | 0.019704 | 0.012987 |
| 91–100 | 0.004926 | 0.012987 |
Tablo 2: Veri seti yaş dağılımı. Bu tablo, veri setindeki yaş dağılımını gösterir.
Yaş (Man-Whitney U testinde p < 0.001) ve cinsiyet (p < Chi-kare testinde 0.001) pozitif ve negatif gruplar arasında dengesizdi. Ancak, işe alım sürecinde bir önyargı yoktur. Dengesiz dağılımın, bu hasta grubunun benzersiz yaş dağılımını yansıtabileceğine inanılmaktadır. Dahil etme kriterleri arasında hastalığın varlığı ve yokluğu için klinik faktörler; Cinsiyet, yaş ve yerel nüfus dahil olmak üzere demografik faktörler dikkate alınır. Ayrıca, veriler bilgilendirilmiş onay ile toplanmıştır. Yaş ve cinsiyet, aşağıda belirtildiği gibi, özellikler setinde potansiyel özellikler olarak dahil edilmiştir. Ancak, açıkça yaş ve cinsiyete dayalı analizler çalışmanın kapsamında değildir ve gelecekteki çalışmalar olarak bırakılır.
Veri seti sayısal değerler olarak saklanır. "Sınıf" sütununda 0 ve 1 değerleri bulunur; burada 0 "Normal hasta"yı, 1 ise "Astım hastası"nı temsil eder.
Bu bağlamda, aşağıdaki on yedi özellik kullanılmıştır:
Sınıf: (0 = "Normal", 1 = "Astım Hastası")
1. yaş (YAŞ)
2. cinsiyet (1 = erkek, 0 = kadın): CINSİYyet
3. Basofiller (BASO)
4. Eozinofiller (EOS)
5. Hematokrit (HCT)
6. Hemoglobin (HGB)
7. Lenfositler (LYM)
8. Ortalama kâpüsküler hemoglobin (MCH)
9. Ortalama kâpüstüler hemoglobin konsantrasyonu (MCHC)
10. Ortalama koptik hacim (MCV)
11. Monositler (MONO)
12. Ortalama trombosit hacmi (MPV)
13. Nötrofil Fonksiyonu (NEUT)
14. Trombosit sayısı (PLATELET_COUNT)
15. Kırmızı kan hücresi sayısı (RBC)
16. Kırmızı hücre dağılım genişliği (RDW)
17. Beyaz Kan Hücresi (WBC)
Veri setinin istatistiksel özellikleri
Daha iyi anlamak için, veri setinin istatistiksel analizi aşağıdakitablolarda 38 gösterilmiştir. Tablo 3 , ele alınan veri seti için ortalama, Medyan, Standart Sapma, Maksimum ve minimum değerleri göstermektedir.
| Acımasız | Medyan | Standart sapma | Max | Min |
| YAŞ | 39.1 | 36 | 18.136 | 93 | 2 |
| CINSIYET | 0.442 | 0 | 0.4974 | 1 | 0 |
| BASO | 0.07 | 0.07 | 0.0701 | 0.72 | 0 |
| EOS | 0.231 | 0.229 | 0.2048 | 2 | 0 |
| HCT | 40.88 | 40.7 | 6.0313 | 56.5 | 3.4 |
| HGB | 13.67 | 13.45 | 4.3446 | 81.3 | 5.9 |
| LYMP | 2.595 | 2.33 | 2.1843 | 33.4 | 0.4 |
| MCH | 26.78 | 27 | 3.3177 | 34.5 | 2.6 |
| MCHC | 32.71 | 33 | 2.1017 | 43.1 | 15 |
| MCV | 81.15 | 82.8 | 9.4426 | 102 | 13 |
| MONO | 1.189 | 0.613 | 6.1198 | 95 | 0.2 |
| MPV | 9.217 | 9.217 | 1.7297 | 13.4 | 0 |
| NEUT | 4.23 | 4.23 | 2.3074 | 16 | 0.6 |
| PLATELET_COUNT | 279.7 | 272.5 | 85.473 | 685 | 0 |
| RBC | 5.677 | 5 | 11.615 | 215 | 2.1 |
| RDW | 14.72 | 13.4 | 15.769 | 296 | 0 |
| WBC | 6.777 | 6.505 | 3.5836 | 33.4 | 1.1 |
| Sınıf | 0.5 | 0.5 | 0.5008 | 1 | 0 |
Tablo 3: Veri setinin istatistiksel özellikleri. Bu tablo, verilerin istatistiksel özelliklerini listeler.
Ayrıca, Tablo 4 her öznitelik ile sınıf özniteliği arasındaki elde edilen korelasyon katsayısını gösterir. Değerleri 0 (en az korelasyonlu) ile 1 (en çok korelasyonlu) arasında yer alır. Veri seti özelliklerini açıklamak için ön istatistiksel analiz olarak eklenmiştir. MPV, Cinsiyet, HGB, MCHC ve yaş en önemli özellikler arasındadır.
| Özniteliklerin çiftleri | Korelasyon katsayısı |
| YAŞ | 0.212473 |
| CINSIYET | 0.423584 |
| BASO | -0.33242 |
| EOS | 0.048184 |
| HCT | -0.376843 |
| HGB | 0.275277 |
| LYMP | 0.055856 |
| MCH | 0.128111 |
| MCHC | 0.272635 |
| MCV | 0.013022 |
| MONO | 0.055476 |
| MPV | 0.564992 |
| NEUT | 0.031185 |
| PLATELET_COUNT | 0.095253 |
| RBC | 0.030787 |
| RDW | 0.025979 |
| WBC | 0.148842 |
| Sınıf | 1 |
Tablo 4: Sınıf özniteliği ile korelasyon. Bu tablo, özellikler (özellikler) ile sınıf özniteliği arasındaki korelasyonu gösterir.
Deneysel kurulum
Mevcut çalışmada, toplanan veri setini ön işlemek için Python programlama dili kullanılıyor. İnsan hatası nedeniyle, veri girişi ve seçimi sırasında belirli değerler eksiktir. Veri setinde eksik değerleri yönetmek için emputasyon teknikleri kullanılmıştır. Bu, eksik değerleri özniteliğin ortalamasıyla değiştirerek yapılır. Sadeliği, model uyumluluğu ve örneklem ortalama değerlerinin korunması nedeniyle, sağlık profesyonelleriyle görüşülmüştür. Ayrıca, özellik seçimi korelasyon katsayıları kullanılarak yapılır ve nitelikler sıralanır. Daha yüksek korelasyon değerlerine sahip özellikler, tüm özellik setiyle birlikte analiz için seçildi. Önerilen yaklaşımın uygulanması, hiperparametre ayarlaması ve sonuç elde edilmesi için Python kütüphaneleri kullanılmıştır. Özellik seçimi ve elemesi, özellik seçme yöntemiyle gerçekleştirilerek en yüksek doğruluğa sahip özellik gruplarını tespit etti. Ayrıca, Python, verilen denklemler 39,40'ta belirtildiği şekilde, 10 katlı çapraz doğrulama ve Doğrudan Bölüm Oranı değerlendirme yöntemleriyle doğruluğu değerlendirmek için kullanılmıştır. Son olarak, tüm değerlendirme yöntemlerinin çıktılarının ortalaması, kullanılan değerlendirme yöntemlerini karşılaştırmak ve en iyi ortalama doğruluğasahip yöntem belirlemek için hesaplandı 38. Ayrıca, SVM, ANN, RF ve NB'nin optimal parametreleri kullanılarak karışıklık matrisleri oluşturuldu. Daha sonra, yanlış pozitifler (FP), yanlış negatifler (FN), gerçek pozitifler (TP) ve gerçek negatif (TN) oranlarının karşılaştırılması, en iyi yöntem 41,42'yi karşılaştırmak için verimli bir ölçüt olan F1-puanı hesaplanarak gerçekleştirilmiştir.
Değerlendirme metrikleri
Önerilen yaklaşımın performansını değerlendirmek için dört iyi bilinen performans ölçütü dikkate alınır. Yani, doğruluk, hassasiyet, geri çağırma ve F1 puanı. Sınıflandırma doğruluğu birincil ölçüttür; çünkü her örnek için doğru sınıflandırılmış örneklerin yüzdesi hesaplanır. Hassasiyet, beklenen toplam TP puanlarının sayısıdır. Geri çağırma, her gerçek pozitiften daha fazla TP sayısıdır. Her sınıfın F1 puanı performansı. Çıktıların kapasitesine göre, aşağıdaki metriklerelde edilmiştir 43,44,45:
Gerçek pozitif (TP): Doğru teşhis edilen astım sonucu.
Yanlış pozitif (FP): Yanlış şekilde astım teşhisi konmasının sonucu.
Gerçek negatif (TN): Astım olmayan doğru vakaların sonucu.
Yanlış negatif (FN): Yanlış şekilde astım olmayan olarak teşhis edilmesinin sonucu.
(4)
(5)
(6)
Optimizasyon stratejisi
Önerilen yaklaşımların her biri için optimal parametreleri belirlemek amacıyla Grid Search tekniği kullanıldı. Grid Search yöntemine belirli parametre ve olası değerler yerleştirilir. Bu nedenle, hassasiyet iyileştirmesi için en iyi performansı geliştirebilir.
Şekil 5–7 , önerilen dört yaklaşımın tamamı için Grid Search tekniğinin sonucunu ve veri setindeki uygulama prosedürünü en üst on sekiz öznelliğin yardımıyla göstermektedir. Şekil 5, çeşitli parametre değerleriyle elde edilen SVM doğruluklarını sunmaktadır. Birden fazla çekirdek türüne karşılık gelen Maliyet ve Gamma için giriş değerleri şunlardır:
Çekirdek türleri: Linear, Radial, Sigmoid ve Polynomial.
Gamma: 0.001 ve 0.0001.
Maliyet: 1, 10, 100 ve 1000.

Şekil 5: Farklı maliyet ve gama tiplerine sahip SVM. Bu şekil, farklı maliyet ve gama tipleriyle SVM davranışını gösterir. Kısaltmalar; SVM = destek vektör makinesi. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
RF için, Şekil 6'da sistematik olarak belirtilen giriş değerleri aşağıdaki gibidir:
Parametre isimleri ve ilgili değerleri aşağıda verilmiştir:
Özellik sayısı: 'auto', 'sqrt'.
Maksimum derinlik: 1, 3, 5, 7.
Minimum örnekler bölünmesi: 2, 3, 4, 5.
MINIMUM örnekler yaprak: 2, 3, 4, 5.

Şekil 6: Farklı derinlik değerleri ve minimum örnek yaprakları ile RF. Bu şekil, farklı derinliklerde ve minimum numune yaprak değerlerinde RF davranışını gösterir. Kısaltmalar; RF = rastgele orman. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
ANN için analitik giriş değerleri Şekil 7'de gösterilmiştir.
Parametre isimleri ve ilgili değerleri şunlardır:
Gizli katman boyutları: (50, 50, 50), (50, 100, 50) ve (100).
Aktivasyon: 'tanh' ve 'relu'.
Çözücü: 'sgd' ve 'adam'.
Alfa: 0.1, 0.01, 0.001, 0.0001, 0.5, 0.005, 0.0005 ve 0.05.
Öğrenme hızı: 'sabit' ve 'uyumlanabilir'.

Şekil 7: Farklı alfa değerleri ve gizli katman boyutlarına sahip ANN. Bu şekil, ANN'nin farklı alfa değerleri ve gizli katman boyutlarıyla davranışını gösterir. Kısaltmalar; ANN = yapay sinir ağı. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
| Sınıflandırıcı | Parametre | Değer |
| SVM | Gamma | 0.0001 |
| Çekirdek tipi | 'rbf' |
| Maliyet 'C' | 10 |
| Rastgele durum | 42 |
| RF | Maksimum derinlik | 3 |
| Min örnekler yaprak | 2 |
| Min örnekler bölünmesi | 2 |
| Rastgele durum | 42 |
| ANN | Aktivasyon | 'relu' |
| alfa | 0.001 |
| Gizli Katman Boyutu | (50,50,50) |
| Öğrenme hızı | 'Sürekli' |
| çözücü | 'Adam' |
| Rastgele durum | 42 |
Tablo 5: Önerilen sınıflandırıcılar için optimal parametrelerin özeti. Bu tablo, önerilen sınıflandırıcılar için elde edilen optimal parametreleri özetler.