$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Предлагаемый метод стратегически сегментирует сигналы ЭЭГ в частотную область для улучшения спектрального разрешения. Впоследствии захваченные ЭЭГ-сигналы разбиваются на 10 сегментов для повышения временного разрешения и согласованности в вычислениях признаков. Предлагаемый метод реализует классификаторы на основе RF, XGBost и SVM на производных признаках ЭЭГ, что способствует разработке надёжных и масштабируемых методов анализа ЭЭГ. Модель RF с некоторыми изменениями гиперпараметров оказалась лучшей среди других стандартных моделей. Поэтому предлагается гибридная, сплавленная, стекированная модель металлорена, объединяющая RF и XG-Boost для дальнейшего повышения точности прогнозирования.
Набор данных, использованный в этом методе, был собран в соответствии с институциональными этическими стандартами. Поставщики наборов данных получили согласие участников до начала сбора данных.
1. Спецификация набора данных
Для подтверждения надёжности системы были использованы два набора данных. Первый набор данных собран из репозитория данныхЭЭГ 20, включающего 88 участников в состоянии покоя с закрытыми глазами, из которых 36 были диагностированы как АД, 23 из них — ФТД, и 29 — здоровые. ЭЭГ-записи были получены в состоянии покоя с закрытыми глазами с использованием 19-канальной системы после международного монтажа 10-20. В наборе данных, показанном на рисунке 2, все сигналы были отобраны с частотой 500 Гц и предоставлены в формате BIDS с предварительной предварительной обработкой участниками набора данных.
Второй набор данных собран из внешнего публичногорепозитория 21 , включающего 35 участников в состоянии покоя. Из 13 участников диагностированы болезнь Альцгеймера (АД), 7 — пациенты с лёгкими когнитивными нарушениями (МКТ), и 15 — здоровые пожилые люди. Для поддержания согласованности с первым наборомданных 20 использовались только сегменты базовой линии состояния покоя. Второй набор данных21 требовал полного конвейера предварительной обработки, как указано на рисунке 3.
2. Предварительная обработка
Существующие исследования сильно опираются на сложные процессы предварительной обработки, ручные шаги коррекции артефактов или ICA-ASR для удаления мышечных движений, что ограничивает воспроизводимость в рутинных клинических процессах. Для устранения этих ограничений предлагаемый конвейер сосредоточен на упрощённом подходе только с использованием ЭЭГ, который устраняет необходимость в вычислительно трудоёмких процедурах удаления артефактов и вместо этого делает акцент на контролируемой фильтрации, эпохальной сегментации и частотно-специфическом вычислении признаков.
- Сортировка файлов ЭЭГ
До предварительной обработки все файлы EEG автоматически сортировались для поддержания согласованности порядка по участникам и сессиям. Это обеспечивало одинаковое распределение признаков, эпоху и выравнивание меток для всех субъектов и предотвращало ошибки несоответствия файлов. Этот шаг показан на рисунке 3 как «Сортировка ЭЭГ-файла». Вся предобработка выполняется с использованием стандартного открытого набора инструментов для обработки ЭЭГ.
- Пропускная фильтрация и повторное ссылание
Был применён полосный фильтр Баттерворта в диапазоне 0,5-40 Гц для сохранения соответствующих компонентов ЭЭГ при одновременном снижении дрейфа и высокочастотного шума. Сигналы были переориентированы на среднее значение всех ЭЭГ-каналов, что минимизировало пространственное смещение и улучшало отношение сигнал/шум.
- Сдвиг частоты Найквиста
Для улучшения разрешения низкочастотных компонентов было применено усиление сдвига Найквиста путём уменьшения частоты дискретизации вдвое с 500 Гц до 250 Гц. Следуя вышеуказанному шагу, модификация Найквиста снижает частоту до 125 Гц. Поскольку частоты Дельта, Тета, Альфа, Бета и Гамма — это медленные волны от 0,5 до 40 Гц, это смещает эффективный предел Найквиста и повышает чёткость низкочастотных колебаний, характерных для деменции. Эта модификация помогла более точно захватывать медленные мозговые волны. Уравнение (1) ясно показывает результат препарата Найквиста.
Дискретизация F= 500 Гц
N выборка = Fдискретизация/2
Nnyquist = Nвыборка/2 (1)
Важно отметить, чтоN Найквист — это не рабочая частота дискретизации, а просто максимальная представленная частота , и поэтому не влияет на эпохальную сегментацию. Это лишь теоретический предел, который гарантирует полное сохранение интересующего частотного содержания (0,5–40 Гц).
- Эпохальная частота дискретизации до 10 сегментов
Записи ЭЭГ делятся на 10 одинаковых сегментов. Этот шаг необходим для фиксации нестационарной активности сигнала ЭЭГ со временем. Короткие, однородные сегменты позволяют стабильно вычислять специфические для полос признаки и обогащают обучающие образцы для классификации машинного обучения. Таким образом, 250 образцов в секунду становятся 250 × 10 = 2500 образцов. Наконец, для стратегий анализа по эпохам берутся 10 эпох одинаковой длины на каждого участника. Эта стратегия анализа сгенерировала 880 образцов из 88 реальных участников.
Необходимость анализа по эпохам заключается в минимальном мониторинге изменений сигналов мозга, что обеспечивает модели достаточным объёмом временных данных для обучения и предотвращения перенагона. Значимость такого подхода заключается в обеспечении более детализированных данных эпохи ЭЭГ, что позволяет проводить анализы, требующие более высокого временного разрешения без ущерба общим значениям признаков. Генерируя 10-секундные эпохи, методология поддерживает улучшенное моделирование динамики ЭЭГ и соответствует стандартным эпохам в протоколах анализа ЭЭГ.
3. Извлечение признаков
Предварительно обработанные сигналы ЭЭГ передаются методам извлечения признаков. ЭЭГ-сигналы фильтруются полосой в 5 стандартных частотных диапазонах: дельта (0,5-4 Гц), тета (4-8 Гц), альфа (8-13 Гц), бета (13-25 Гц) и гамма (25-40 Гц).
Для каждого отфильтрованного сигнала значение Root Average Square (RMS) вычислялось по всем каналам EEG. Математическая формулировка RMS приведена в уравнении (1):
RMS =
(1)
Здесь xi — амплитуда сигнала ЭЭГ на i-й пробе времени. N — общее количество отсплов в сегменте сигнала.
RMS был выбран в качестве основной особенности благодаря способности количественно оценивать энергию колебательной активности в каждом диапазоне частот. Болезнь Альцгеймера часто связана с повышенной активностью дельта и тета, а также снижением активности альфа и бета. Фронто-височная деменция (ФТД) может проявлять характерные закономерности в этихдиапазонах 20,21. Поскольку PSD математически дублирует RMS, он не считается особенностью. Для поддержания компактного набора данных исключаются оставшиеся признаки, такие как Хьёрт и энтропия.
4. Гибридный синтез
Извлеченные признаки RMS во временной области комбинировались с частотными характеристиками, полученными через пропускную фильтрацию, сделав это гибридным пространством для ввода моделей. Детали компиляции показаны на рисунке 3. Окончательный нормализованный набор данных организован в табличный формат с строками, представляющими участников, и столбцами, представляющими временно-частотные диапазоны и демографические особенности, такие как возраст, пол и группа. Конвейер, показанный на рисунке 2 , эффективно извлекает особенности ЭЭГ, важные для исследований болезни Альцгеймера. Извлеченные признаки дают представление о нейронной активности в ключевых частотных диапазонах и могут использоваться для машинного обучения и статистического анализа.
5. Выбор функций
Для повышения производительности модели и снижения размерности признаков был применён двухсторонний анализ дисперсии (ANOVA). Выбор на основе ANOVA применялся с группой и возрастом как независимыми факторами, а частотными диапазонами RMS — как зависимыми признаками. В этом анализе оценивалось влияние взаимодействия группы, возраста и возрастных групп на каждую особенность. Для дальнейшей классификации были выбраны признаки с p-значениями < 0,05 хотя бы для одного фактора. Подробные результаты на основе ANOVA приведены в разделе с результатами. Эти признаки являются самыми информативными переменными для классификации, что помогло повысить точность и обобщение конечной предсказательной модели. В результате теста ANOVA для создания модели были выбраны только самые информативные функции. А дополнительные нечисловые атрибуты — Гендер и participant_id — были исключены из анализа. Целевой переменной был закодирован метками для классификации.
6. Описание модели
Для классификации заболевания на 3 класса: болезнь Альцгеймера, Контрольная и Фронтальная деменция — были разработаны три контролируемые модели машинного обучения, такие как XG-Boost, Random Forest, Support Vector Machine SVM и модель Stacked. Все упомянутые модели использовали 70% обучающего набора данных и 30% тестового набора данных. Каждая модель была выбрана за проверенную эффективность в анализе данных в здравоохранении и способность работать с нелинейными и высокоразмерными пространствами признаков. Оценка модели проводилась на основе валидационного набора данных для оценки её обобщимости.
Производительность модели оценивалась с помощью матрицы путаницы, включающей истинно положительный (TP), ложноположительный (FP), истинно отрицательный (TN) и ложноотрицательный (FN). Показатели эффективности включали точность и отчёт по классификации с подробной точностью, отзывом и результатами F1 для каждого класса. Следующее уравнение иллюстрирует метрики эффективности.
(2)
(3)
(4)
(5)
1. Классификатор XG-Boost
Этот метод реализовал многоклассовую модель классификации с использованием алгоритма XGBoost для прогнозирования когнитивных состояний, выведенных с помощью ЭЭГ, из извлечённых признаков, как показано на выводе 1 рисунка 3. Выход 1 содержит функции RMS и балл MMSE. При создании модели XGBoost балл MMSE включается для проверки нелинейного поведения характеристик RMS. Он используется как ориентир и базовый этап для разработки системы. MMSE был исключён на более поздних этапах для достижения цели полностью автоматизированной, независимой от клинициста системы.
XG-Boost — это фреймворк градиентного бустинга, оптимизированный для эффективности и точности, что делает его отлично подходящим для обработки структурированных данных в задачах классификации. Несколько гиперпараметров настраиваются на наборе данных ЭЭГ с помощью таких методов, как перекрёстная валидация и поиск по сетке. Ключевые значения параметров, определённые ниже, выбираются для контроля перенагона с помощью регуляризации и для отражения сложности признаков EEG без чрезмерной сложности.
Ключевые параметры модели: (1) максимальная глубина дерева = 8, что ограничивает глубину деревьев принятия решений для снижения перенастройки и улучшения обобщения. Потому что неглубокое дерево упустит ненужную информацию, так как более глубокое дерево может перерасти. (2) Регуляризация L2 (λ = 10) добавляет штраф для больших коэффициентов, минимизируя переподгонку за счёт контроля сложности модели. (2) Введена L1-регуляризация (α = 5) для дополнительной разрежённости модели с целью повышения интерпретируемости и прочности. Количество оценщиков (n_estimators=8) ограничивало количество бустерных итераций для поддержания вычислительной эффективности при балансе производительности.
2. Классификатор случайных лесов
Случайный лес — это ансамблевой классификатор, который строит несколько деревьев решений на случайных подмножествах данных и признаков, агрегируя их результаты для окончательного прогноза. Он обеспечивает устойчивость к шуму, хорошо обрабатывает нелинейные данные и снижает переподгонку за счёт усреднения различных деревьев предсказаний. В этой работе модель случайного леса была настроена с ключевыми параметрами с помощью метода проб и ошибок. Такие параметры объяснены ниже:
1) n_estimators=100
Он выбран для ограничения количества деревьев принятия решений в лесу. Чем больше деревьев, тем лучше обобщение и тем стабильнее прогнозы.
2) max_depth=10
Он показывает максимальную глубину каждого дерева. Если у дерева низкая глубина, есть вероятность недоприспособления. В то время как высокая глубина может фиксировать детали и запоминать обучающие данные, она может быть переоценена. Поэтому выбор 10 — оптимальная середина, особенно для шумных или сложных сигналов, таких как ЭЭГ.
3) random_state=40
Он исправляет генерацию случайных чисел, используемую для выборки Bootstrap и построения дерева. Это обеспечивает воспроизводимость
4) n_jobs=-1
Установив значение n_jobs равным -1, модель эффективно использует все ядра процессора.
7. Поддерживающая векторная машина (SVM)
Support Vector Machine — это классификатор, основанный на маржи, известный своей линейной производительностью в бинарной и многоклассовойклассификации 22. В этой модели использовалось ядро радиальной базисной функции благодаря его способности захватывать нелинейные сигналы ЭЭГ. Однако модель демонстрировала неоптимальную производительность, вероятно, из-за отсутствия масштабирования признаков и ограниченного размера набора данных. Хотя SVM теоретически мощен, его чувствительность к настройке гиперпараметров и распределению данных может объяснять более низкую точность по сравнению с моделями на основе деревьев.
8. Предлагаемая модель HY-синтеза
Хотя модель Random Forest достигла высокой точности, для обеспечения обобщённости и масштабируемости была построена стекированная модель с использованием Random Forest и XG-Boost. Выход подаётся в качестве входа в логистическую регрессионную модель. А логистическая регрессия действует как источник металла. Архитектурная схема модели приведена на рисунке 4.
Вместе содним набором входа 20, стекированная модель также принимала входы из второго набораданных 23. Набор данных изMendely 21 предварительно обрабатывается до формы, понятной модели, путем извлечения RMS и эпохи до 10 с. Результаты, полученные каждой моделью, показаны в разделе результатов.