Схематический обзор процесса предобработки ЭЭГ, извлечения признаков и классификации представлен на Рисунке 1. Материалы и программное обеспечение, использованные в исследовании, перечислены в Таблице материалов.

Рисунок 1: Алгоритм предварительной обработки ЭЭГ, извлечения признаков и классификации. Схематический обзор рабочего процесса исследования, включающий проверку данных ЭЭГ, полосовую фильтрацию и переопределение референса, извлечение признаков среднеквадратичного значения (RMS), спектральной плотности мощности (PSD) и энтропии, добавление возраста, разделение данных на обучающую и тестовую выборки, разработку модели Random Forest, анализ стабильности признаков, анализ SHAP, анализ размера эффекта по d Коэна, интегрированный отбор признаков, абляцию признаков энтропии, повторное обучение модели и оценку эффективности. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
1. Сбор данных
Общедоступный набор данных ЭЭГ в состоянии покоя был получен из репозитория OpenNeuro (набор данных ds004504, версия 1.0.9)33. Метки участников и демографическая информация были проверены. Набор данных включал 88 участников, в том числе 36 участников с болезнью Альцгеймера (AD), 23 с фронтотемпоральной деменцией (FTD) и 29 здоровых добровольцев (HC).
2. Импорт записей ЭЭГ
Для каждого участника запись ЭЭГ была загружена с помощью библиотеки MNE-Python. Каждый файл ЭЭГ проверялся на доступность, успешность импорта и наличие корректного идентификатора участника. Записи с отсутствующими или поврежденными файлами были исключены. На данном этапе сохранялась исходная частота дискретизации ЭЭГ 500 Hz. Сигналы подвергались даунсемплированию для снижения вычислительной нагрузки при сохранении всей клинически значимой информации ЭЭГ для данного исследования.
3. Полосовая фильтрация
Непрерывные записи ЭЭГ фильтровали с помощью полосового фильтра четвертого порядка с нижней граничной частотой 0.5 Hz и верхней граничной частотой 40 Hz.
4. Общее среднее referencing и эпохирование
К отфильтрованным записям ЭЭГ было применено общее среднее referencing (CAR). Для каждого временного отсчета вычислялся средний сигнал по всем доступным каналам ЭЭГ, который затем вычитался из каждого канала. Реферированные сигналы ЭЭГ были сохранены для последующего анализа. Каждая реферированная запись ЭЭГ была разделена на эпохи фиксированной длительности с помощью функции make_fixed_length_epochs() в MNE-Python. Использовалась длительность эпохи 10 s с перекрытием 0 s.
5. Валидация эпох
Для каждого участника были сохранены только полные эпохи продолжительностью 10 s. Любые оставшиеся сегменты ЭЭГ короче 10 s в конце записи были удалены. Каждая сохраненная эпоха в дальнейшем использовалась в качестве отдельного образца для извлечения признаков.
6. Подготовка признаков
Несмотря на наличие данных краткого исследования психического статуса (MMSE) в исходном наборе данных, они были исключены из настоящего анализа. Извлеченные признаки ЭЭГ были объединены с демографической информацией участников, включая возраст и диагностические метки, полученные из файла метаданных participants.csv. В качестве общего ключа использовался идентификатор участника; были оставлены только те участники, для которых имелись как записи признаков ЭЭГ, так и соответствующая демографическая информация.
Многодоменная матрица признаков включала пять признаков среднеквадратичного значения (RMS) (delta_rms, theta_rms, alpha_rms, beta_rms и gamma_rms), пять признаков спектральной плотности мощности (PSD) (delta_psd, theta_psd, alpha_psd, beta_psd и gamma_psd) и пять признаков энтропии (delta_entropy, theta_entropy, alpha_entropy, beta_entropy и gamma_entropy). Возраст был включен в качестве дополнительной демографической переменной. Поскольку распределение по возрасту может различаться в разных диагностических группах, влияние демографических факторов не могло быть полностью исключено. Диагностическая группа, определенная как AD, HC или FTD, была назначена в качестве целевой метки.
7. Предобработка данных и разделение на обучающую и тестовую выборки
В ходе предобработки частота дискретизации записей была снижена с 500 Hz до 250 Hz для уменьшения вычислительных затрат при сохранении интересующей информации о частотах ЭЭГ.
Набор данных был разделен на обучающую (80%) и тестовую (20%) выборки на уровне субъектов с использованием стратегии группового разделения. Прогнозы на уровне субъектов впоследствии были получены путем мажоритарного голосования по всем предсказанным эпохам, принадлежащим каждому участнику. Основная оценка проводилась с использованием группового разделения на обучающую и тестовую выборки на уровне субъектов, чтобы исключить попадание эпох одного и того же участника в обе выборки. Прогнозы на уровне субъектов были получены путем мажоритарного голосования по всем предсказанным эпохам, принадлежащим каждому участнику. Набор данных был проверен на наличие пропущенных значений; пропущенные наблюдения были удалены или импутированы, где это было применимо. Диагностические метки были закодированы. StandardScaler был обучен на обучающих данных, а затем применен как к обучающему, так и к тестовому наборам данных.
8. Разработка модели случайного леса
Классификатор случайного леса (Random Forest) был инициализирован с использованием 80 деревьев, максимальной глубины дерева 10, максимального количества признаков 4, минимального количества выборок на лист 5 и случайного состояния (random state) 42. Классификатор был обучен на стандартизированном тренировочном наборе данных.
9. Оценка модели
Для обучающей и тестовой выборок были предсказаны метки классов. Построена матрица ошибок (confusion matrix), а также рассчитаны точность (accuracy), прецизионность (precision), полнота (recall) и F1-мера (F1-score) вместе с отчетом о классификации. Были зафиксированы показатели точности на обучающей и тестовой выборках.
При оценке по каждому участнику убедитесь, что все эпохи конкретного участника были распределены исключительно либо в обучающую, либо в тестовую подвыборку. Классификатор Random Forest был обучен с использованием тех же гиперпараметров, что и в основном анализе.
10. Перекрестная проверка
В качестве дополнительной процедуры оценки модели была выполнена пятикратная стратифицированная перекрестная проверка с параметрами shuffle = True и random_state = 30. Были рассчитаны средняя точность и стандартное отклонение по пяти фолдам. Данный анализ рассматривался отдельно от основной оценки на отложенной выборке на уровне субъектов.
11. Анализ стабильности признаков
Стабильность признаков оценивали путем десятикратного повторения обучения Random Forest с использованием случайных значений seed от 0 до 9. Для каждого запуска регистрировали точность тестирования и показатели значимости признаков. Для каждого предиктора рассчитывали среднее значение и стандартное отклонение показателя значимости по результатам 10 запусков, после чего предикторы ранжировали в соответствии с их стабильностью. Данный анализ использовался для оценки согласованности ранжирования признаков, а не для замены основной оценки на уровне субъектов.
12. Анализ с помощью объяснимого искусственного интеллекта
Для обученной модели Random Forest был применен инструмент SHAP TreeExplainer. Были рассчитаны значения SHAP для оценки вклада каждого признака в прогнозы модели. Для каждого признака вычислялось среднее абсолютное значение SHAP, после чего признаки были ранжированы в соответствии с их вкладом в SHAP. Были выявлены признаки со стабильно низкими значениями SHAP, которые затем сравнивали с результатами анализа стабильности признаков и коэффициента d Коэна. Признаки, демонстрирующие стабильно низкий вклад, были отобраны для последующей абляции и переобучения модели.
13. Анализ статистического размера эффекта
Для каждого биомаркера ЭЭГ был рассчитан d-критерий Коэна для сравнений БА против ЗК, БА против ЛПД и ЛПД против ЗК. Величины размера эффекта интерпретировались с использованием следующих пороговых значений: 0,20 для малого эффекта, 0,50 для среднего эффекта и 0,80 для большого эффекта.
14. Интегративный отбор признаков
Было проведено сравнение результатов анализа важности признаков методом Random Forest, анализа SHAP и анализа коэффициента d Коэна. Предикторы, которые последовательно демонстрировали низкую важность признаков, низкий вклад по SHAP и малые значения размера эффекта, были определены как кандидаты на удаление.
15. Абляция признаков
Признаки энтропии были оценены в ходе исследовательского анализа абляции, и была построена сокращенная матрица признаков, содержащая RMS, PSD и возраст. Классификатор Random Forest был переобучен с использованием тех же гиперпараметров. Обучение модели, тестирование, кросс-валидация и анализ рабочих характеристик приемника (ROC-анализ) были повторены с использованием сокращенного набора признаков.
16. ROC-анализ
Вероятности классов были получены с помощью оптимизированного классификатора Random Forest. Многоклассовые ROC-кривые были построены с использованием метода one-в сравнении с—стратегии отдыха. Были рассчитаны значения площади под кривой (AUC) для каждого класса и среднее значение AUC.
17. Сравнение эффективности
Эффективность полной модели признаков была сравнена с эффективностью сокращенной модели признаков, полученной после абляции признаков на основе энтропии.