Современное здравоохранение всё больше опирается на интеграцию различных биомедицинских источников данных для повышения точности диагностики и принятия клинических решений. Физиологические сигналы, такие как электрокардиограммы (ЭКГ), электроэнцефалограммы (ЭЭГ), а также медицинские методы визуализации, включая магнитно-резонансную томографию (МРТ) и компьютерную томографию (КТ), предоставляют дополнительную физиологическую информацию, поддерживающую диагностику заболеваний и персонализированное лечение. Однако биомедицинские сигналы по своей природе сложны и часто содержат шум, отсутствующие значения и высокоразмерные структуры, что затрудняет их анализ и интерпретацию. Мультимодальное биомедицинское синтез сигналов, интегрирующий информацию из нескольких физиологических потоков данных, стал важным подходом для повышения диагностической эффективности, повышения устойчивости к вариациям качества данных и обеспечения комплексного мониторинга пациентов в клинических условиях, таких как отделения интенсивной терапии (ICU)1.
Традиционные методы мультимодального синтеза сигналов в значительной степени опирались на статистические и линейные методы. Анализ основных компонентов (PCA) уменьшает размерность данных, превращая сигналы в ортогональные компоненты, тогда как канонический корреляционный анализ (CCA) выявляет линейные связи между модальностями для выравнивания мультимодальных наборовданных 2. Эти методы успешно применяются в биомедицинских мультимодальных условияхслияния 3. Однако их зависимость от линейных предположений ограничивает способность фиксировать сложные нелинейные связи, которые часто существуют среди физиологических сигналов. На практике биомедицинские данные редко бывают полностью линейными. Традиционные методы мультимодального слияния часто не способны захватить значимые взаимодействия между модальностями из-за этих нелинейныхзависимостей 4,5. В результате традиционные методы слияния могут не учитывать значимые взаимодействия между методами, что ограничивает их эффективность в таких задачах, как диагностика заболеваний и принятие клинических решений в реальном времени.
Недавние достижения в области глубокого обучения значительно преобразили обработку биомедицинских сигналов, позволив нейронным сетям автоматически извлекать иерархические представления из исходных данных. Сверточные нейронные сети (CNN) продемонстрировали высокие результаты анализа пространственных закономерностей на медицинскихизображениях 5,6. Мультимодальные архитектуры CNN использовались для интеграции методов визуализации, таких как МРТ и КТ, с целью повышения точностидиагностики 3. Аналогично, рекуррентные нейронные сети (RNN) и долгосрочная кратковременная память (LSTM) применяются к последовательным биомедицинским сигналам, включая ЭКГ и ЭЭГ, для задач классификациизаболеваний 7. Несмотря на эти достижения, многие подходы слияния на основе глубокого обучения опираются на фиксированные стратегии синтеза, такие как конкатенация признаков или взвешенное усреднение. Эти механизмы статического синтеза плохо адаптируются к вариациям качества сигнала. В реальных клинических условиях сигналы могут ухудшаться из-за артефактов движения, смещения электродов, искажений или шума окружающей среды. Такие вариации могут снижать надёжность отдельных методов и негативно влиять на общий процесс синтеза. Решение этих задач требует адаптивных стратегий слияния, способных реагировать на динамические условия данных в клинических условиях реальноговремени 8.
Обучение с подкреплением (RL) предоставляет мощную основу для последовательного принятия решений в условиях неопределённости. В RL агент учится выбирать действия, которые максимизируют накопленное вознаграждение через взаимодействие с окружающей средой. Этот процесс принятия решений обычно формулируется с помощью уравнения Беллмана, которое определяет значение состояния как сумму немедленной награды и дисконтированного значения будущихвознаграждений 9. Методы, такие как глубокие Q-сети (DQN), расширяют обучение с подкреплением на высокомерные задачи, приближая функцию значения действия с помощью глубоких нейронныхсетей 10. Аналогично, методы глубокого подкрепления на основе политики обеспечивают стабильное и эффективное обучение политике через итеративные обновления политикиагента 11. Методы обучения с подкреплением уже исследованы в нескольких медицинских приложениях, включая оптимизацию лечения и обнаружениеаномалий 12, но их применение для адаптивного мультимодального синтеза сигналов остаётся относительно ограниченным.
Гибридное глубокое подкрепляющее обучение (HDRL) интегрирует глубокое обучение с подкреплением для объединения извлечения признаков и адаптивного принятия решений. В этой структуре глубокие нейронные сети преобразуют мультимодальные биомедицинские сигналы в высокоуровневые представления признаков, в то время как агенты усиленного обучения динамически выбирают стратегии слияния на основе выполнения задачи4. Этот адаптивный механизм позволяет системе реагировать на различия в качестве сигнала и доступности модальности, обеспечивая более надёжную работу в сложных клинических условиях, таких как мониторинг реанимации и носимые диагностическиесистемы 8.
В дополнение к классическим методам обучения с подкреплением были исследованы несколько гибридных методов обучения, сочетающих нечеткую логику, генетические алгоритмы и обучение с подкреплением для задач биомедицинской классификации. Например, нечеткое Q-обучение в сочетании с генетическими алгоритмами применялось к классификации эпилептических приступов с помощью сигналов ЭЭГ, демонстрируя улучшенную адаптивность к неопределённым временнымпаттернам 13. Аналогично, для классификации заболеваний лёгких с использованием медицинских изображений были предложены эволюционные методы обучения на основе нечеткой решётки. Другие исследования изучали подходы на основе подкрепляющего обучения для распознавания судорог15 и модифицированные классификаторы нечеткого Q-обучения для обнаружения пневмонии и туберкулёза по рентгеновским снимкамгрудной клетки 16. Хотя эти исследования демонстрируют потенциал гибридных методов обучения в биомедицинском анализе, большинство существующих подходов сосредоточены на одномодальной классификации, а не на мультимодальном синтезе сигналов.
Недавние достижения в мультимодальном машинном обучении также исследуют архитектуры на основе трансформаторов для кроссмодальных медицинских приложений. Эти модели показали многообещающие результаты в таких задачах, как синтез изображений в здравоохранении и анализ гетерогенных биомедицинских наборов данных, в которых одна или несколько методов могут быть неполными илиотсутствовать 17 .Однако, несмотря на эти достижения, необходимость в адаптивных механизмах слияния, динамически реагирующей на вариации в мультимодальных данных, остаётся важной исследовательской задачей.
В этой работе предложена гибридная фреймворк глубокого подкрепления (HDRL) для мультимодального биомедицинского синтеза сигналов. Модально-специфические модели CNN используются для извлечения признаков из данных ЭКГ, ЭЭГ и МРТ, которые затем объединяются в единое мультимодальное представление. Агент глубокой Q-сети (DQN) динамически выбирает стратегии слияния, такие как конкатенация признаков или взвешенная комбинация, в зависимости от текущего состояния признаков. Нижний классификатор предоставляет сигнал вознаграждения на основе эффективности классификации, позволяя агенту с подкреплением оптимизировать политику слияния через непрерывную обратную связь. Эта адаптивная структура позволяет модели адаптироваться к вариациям качества сигнала и доступности модальности. Предлагаемый подход оценивается с использованием наборов данных PhysioNet 2016, CHB-MIT EEG и OASIS-3 и сравнивается с традиционными методами синтеза на основе PCA и глубокого обучения.

Рисунок 1: Блок-схема, иллюстрирующая архитектуру предлагаемой мультимодальной системы синтеза сигналов на основе HDRL. Схематическое представление мультимодального фреймворка слияния, показывающее входные данные ЭКГ, ЭЭГ и медицинских изображений, обработанные через экстракторы признаков глубоких нейронных сетей, за которыми следует адаптивное слияние на основе подкрепляющего обучения и обратная связь по вознаграждениям. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Архитектура предлагаемого фреймворка мультимодального синтеза сигналов показана на рисунке 1. В этой архитектуре модально-специфические модели CNN независимо извлекают признаки из сигналов ЭКГ, ЭЭГ и МРТ. Эти признаки затем объединяются в унифицированное представление, которое агент обучения с подкреплением использует для определения оптимальной стратегии слияния.
Обработка биомедицинских сигналов играет ключевую роль в современном здравоохранении, обеспечивая точную диагностику, мониторинг и планирование лечения посредством анализа физиологических сигналов, полученных из различных методов. Интеграция таких сигналов, как ЭКГ, ЭЭГ и медицинские данные визуализации, требует сложных методов синтеза, которые собирают дополнительную информацию из разных источников. Таблица 1 обобщает широко используемые подходы мультимодального синтеза сигналов, включая их ключевые характеристики, преимущества и ограничения, а также подчёркивает мотивацию предложенной структуры на основе HDRL.
| Метод | Ключевые особенности | Преимущества | Ограничения |
| PCA | Линейное уменьшение размерности | Быстро, просто | Ограничено линейными отношениями |
| DNN | Нелинейное обучение признаков | Фиксирует сложные закономерности | Стратегия фиксированного синтеза |
| DRL | Динамическое обучение политике | Адаптация к данным | Высокие вычисления |
| HDRL | Гибрид DNN + RL | Адаптивный, надёжный, эффективный | Требует тщательной настройки |
Таблица 1: Сравнение методов мультимодального синтеза. Краткое изложение широко используемых подходов мультимодального синтеза сигналов, изложение их ключевых характеристик, преимуществ и ограничений.