EEG ön işleme, öznitelik çıkarımı ve sınıflandırma iş akışının şematik bir genel görünümü Şekil 1'de gösterilmiştir. Çalışmada kullanılan materyaller ve yazılımlar Materyaller Tablosunda listelenmiştir.

Şekil 1: EEG ön işleme, özellik çıkarımı ve sınıflandırma boru hattının iş akışı. EEG veri doğrulaması, bant geçiren filtreleme ve yeniden referanslama, karekök ortalama (RMS), güç spektral yoğunluğu (PSD) ve entropi özelliklerinin çıkarılması, yaş bilgisinin eklenmesi, eğitim-test ayırımı, Random Forest model geliştirme, özellik stabilitesi analizi, SHAP analizi, Cohen’s d etki büyüklüğü analizi, entegre özellik seçimi, entropi özelliği ablasyonu, modelin yeniden eğitilmesi ve performans değerlendirmesini içeren çalışma iş akışının şematik genel görünümü. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
1. Veri edinimi
Kamuya açık dinlenme durumu EEG veri seti, OpenNeuro deposundan (veri seti ds004504, sürüm 1.0.9) elde edilmiştir33. Katılımcı etiketleri ve demografik bilgiler doğrulanmıştır. Veri seti; 36 Alzheimer hastalığı (AD) olan katılımcı, 23 frontotemporal demans (FTD) olan katılımcı ve 29 sağlıklı kontrol (HC) olmak üzere toplam 88 katılımcıdan oluşmaktadır.
2. EEG kaydı içe aktarma
Her katılımcı için EEG kaydı MNE-Python kütüphanesi kullanılarak yüklendi. Her EEG dosyasının erişilebilir olduğu, başarıyla içe aktarılabildiği ve geçerli bir katılımcı tanımlayıcısı içerdiği doğrulandı. Dosyaları eksik veya bozuk olan kayıtlar çalışma dışı bırakıldı. Bu aşamada 500 Hz olan orijinal EEG örnekleme frekansı korundu. Hesaplama yükünü azaltmak amacıyla, bu çalışma için klinik olarak ilgili tüm EEG bilgileri korunarak sinyallerin örnekleme hızı düşürüldü.
3. Bant geçiren filtreleme
Sürekli EEG kayıtları, 0.5 Hz alt kesim frekansına ve 40 Hz üst kesim frekansına sahip dördüncü dereceden bir bant geçiren filtre kullanılarak filtrelenmiştir.
4. Ortak ortalama referanslama ve epoklama
Filtrelenmiş EEG kayıtlarına ortak ortalama referanslama (CAR) uygulandı. Her zaman örneğinde, mevcut tüm EEG kanalları genelindeki ortalama sinyal hesaplandı ve her bir kanaldan çıkarıldı. Referanslanmış EEG sinyalleri sonraki analizler için saklandı. Her bir referanslanmış EEG kaydı, MNE-Python'daki make_fixed_length_epochs() fonksiyonu kullanılarak sabit uzunluktaki epoklara bölündü. 0 s örtüşmeli 10 s'lik bir epok süresi kullanıldı.
5. Epok doğrulaması
Her katılımcı için yalnızca tamamlanmış 10s epoklar tutuldu. Bir kaydın sonunda kalan 10 s'den kısa olan tüm EEG segmentleri atıldı. Tutulan her epok, daha sonra öznitelik çıkarımı için bireysel bir örnek olarak kullanıldı.
6. Özellik hazırlama
Kaynak veri setinde Mini-Mental Durum Muayenesi (MMSE) verileri mevcut olsa da, bunlar mevcut analizden hariç tutulmuştur. Çıkartılan EEG özellikleri, participants.csv meta veri dosyasından elde edilen yaş ve tanı etiketleri dahil katılımcı demografik bilgileriyle birleştirilmiştir. Katılımcı tanımlayıcısı ortak anahtar olarak kullanılmış ve yalnızca hem EEG özellik kayıtları hem de karşılık gelen demografik bilgileri olan katılımcılar tutulmuştur.
Çok alanlı özellik matrisi; beş kök ortalama kare (RMS) özelliğini (delta_rms, theta_rms, alpha_rms, beta_rms ve gamma_rms), beş güç spektral yoğunluğu (PSD) özelliğini (delta_psd, theta_psd, alpha_psd, beta_psd ve gamma_psd) ve beş entropi özelliğini (delta_entropy, theta_entropy, alpha_entropy, beta_entropy ve gamma_entropy) içermekteydi. Yaş, tamamlayıcı bir demografik değişken olarak eklenmiştir. Yaş dağılımları tanı grupları arasında farklılık gösterebileceğinden, demografik karıştırıcı etkiler tamamen dışlanamamıştır. AD, HC veya FTD olarak tanımlanan tanı grubu, hedef etiket olarak atanmıştır.
7. Veri ön işleme ve eğitim-test bölümleme
Ön işleme sırasında, ilgilenilen EEG frekans bilgileri korunurken hesaplama gereksinimlerini azaltmak için kayıtlar 500 Hz'den 250 Hz'e düşürülmüştür.
Veri seti, gruplandırılmış bölme stratejisi kullanılarak denek düzeyinde eğitim (%80) ve test (%20) alt kümelerine ayrılmıştır. Denek düzeyindeki tahminler, daha sonra her bir katılımcıya ait tahmin edilen epoklar üzerinden çoğunluk oylamasıyla elde edilmiştir. Birincil değerlendirmede, aynı katılımcıya ait epokların her iki alt kümede birden yer almasını önlemek için denek düzeyinde gruplandırılmış eğitim-test bölmesi kullanılmıştır. Denek düzeyindeki tahminler, her bir katılımcıya ait tahmin edilen epoklar üzerinden çoğunluk oylamasıyla elde edilmiştir. Veri seti eksik değerler açısından incelenmiş ve eksik gözlemler uygun şekilde kaldırılmış veya atanmıştır. Tanı etiketleri kodlanmıştır. Eğitim verileri üzerinde bir StandardScaler eğitilmiş ve ardından hem eğitim hem de test veri setlerine uygulanmıştır.
8. Rastgele orman modelinin geliştirilmesi
80 ağaç, 10 maksimum ağaç derinliği, maksimum dört özellik, yaprak başına minimum beş örnek ve 42 rastgele durum (random state) kullanılarak bir Rastgele Orman (Random Forest) sınıflandırıcısı başlatıldı. Sınıflandırıcı, standardize edilmiş eğitim veri seti kullanılarak eğitildi.
9. Model değerlendirmesi
Hem eğitim hem de test veri setleri için sınıf etiketleri tahmin edildi. Bir hata matrisi oluşturuldu ve sınıflandırma raporu ile birlikte doğruluk, kesinlik, duyarlılık ve F1-skoru hesaplandı. Eğitim ve test doğrulukları kaydedildi.
Katılımcı bazlı değerlendirme için, belirli bir katılımcıya ait tüm epokların yalnızca eğitim veya test alt kümesine atandığından emin olun. Random Forest sınıflandırıcı, birincil analizdekiyle aynı hiperparametreler kullanılarak eğitilmiştir.
10. Çapraz doğrulama
Ek bir model değerlendirme prosedürü olarak, shuffle = True ve random_state = 30 kullanılarak beş katlı tabakalı çapraz doğrulama gerçekleştirilmiştir. Beş kat arasındaki ortalama doğruluk ve standart sapma hesaplanmıştır. Bu analiz, birincil denek düzeyindeki ayrılmış veri seti (holdout) değerlendirmesinden ayrı olarak ele alınmıştır.
11. Özellik kararlılık analizi
Özellik kararlılığı, 0'dan 9'a kadar rastgele tohumlar kullanılarak Rastgele Orman (Random Forest) eğitimi 10 kez tekrarlanarak değerlendirilmiştir. Her çalışma için test doğruluğu ve özellik önem skorları kaydedilmiştir. Her bir öngörücü için özellik önem skorunun ortalaması ve standart sapması 10 çalışma boyunca hesaplanmış ve öngörücüler kararlılıklarına göre sıralanmıştır. Bu analiz, birincil denek düzeyindeki değerlendirmenin yerini almaktan ziyade, özellik sıralamalarının tutarlılığını değerlendirmek için kullanılmıştır.
12. Açıklanabilir yapay zeka analizi
Eğitilmiş Random Forest modeline SHAP TreeExplainer uygulandı. Her bir özelliğin model tahminlerine olan katkısını tahmin etmek için SHAP değerleri hesaplandı. Her özellik için ortalama mutlak SHAP değeri hesaplandı ve özellikler SHAP katkılarına göre sıralandı. Tutarlı şekilde düşük SHAP değerlerine sahip özellikler belirlendi ve özellik stabilitesi ile Cohen’s d analizlerinin sonuçlarıyla karşılaştırıldı. Sürekli olarak düşük katkı gösteren özellikler, sonraki ablasyon ve model yeniden eğitimi işlemleri için seçildi.
13. İstatistiksel etki büyüklüğü analizi
AD için her bir EEG biyobelirteci için Cohen’s d hesaplanmıştır karşı SC, AD karşısında FTD ve FTD karşı HC karşılaştırmaları. Etki büyüklükleri; küçük etki için 0,20, orta etki için 0,50 ve büyük etki için 0,80 eşik değerleri kullanılarak yorumlanmıştır.
14. Entegre özellik seçimi
Random Forest özellik önemi analizi, SHAP analizi ve Cohen’s d analizi sonuçları karşılaştırıldı. Tutarlı bir şekilde düşük özellik önemi, düşük SHAP katkısı ve küçük etki boyutları sergileyen öngördürücüler, çıkarılacak adaylar olarak belirlendi.
15. Özellik ablasyonu
Entropi özellikleri keşifsel bir ablasyon analizinde değerlendirilmiş ve RMS, PSD ve yaş içeren indirgenmiş bir özellik matrisi oluşturulmuştur. Random Forest sınıflandırıcısı aynı hiperparametreler kullanılarak yeniden eğitilmiştir. Model eğitimi, test etme, çapraz doğrulama ve alıcı işletim karakteristik (ROC) analizi, indirgenmiş özellik seti kullanılarak tekrarlanmıştır.
16. ROC analizi
Sınıf olasılıkları, optimize edilmiş Random Forest sınıflandırıcısından elde edilmiştir. Çok sınıflı ROC eğrileri, bir-karşı-dinlenme stratejisi. Sınıfa özgü eğri altı alan (AUC) değerleri ve ortalama AUC hesaplandı.
17. Performans karşılaştırması
Tam öznitelik modelinin performansı, entropi-öznitelik ablasyonu sonrası elde edilen indirgenmiş öznitelik modelinin performansıyla karşılaştırılmıştır.