Research Article

Мультимодальные молекулярные биомаркеры на основе машинного обучения для предиктивной аналитики здоровья

DOI:

10.3791/69241

January 16th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Машинное обучение с мультимодальными биомаркерами улучшает прогнозирование и мониторинг заболеваний, предлагая перспективы для достижений в различных областях здравоохранения и улучшая результаты за счет точного прогнозирования заболеваний.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Каждый год многие люди по всему миру постепенно сталкиваются с разрушительными состояниями здоровья, такими как болезни сердца, респираторные инфекции, неврологические нарушения, когнитивный стресс, рак, инсульт, диабет и др., что приводит к серьёзным осложнениям со здоровьем и сопутствующим аномалиям. Поэтому ранняя медицинская аналитика крайне важна, так как она позволяет своевременно вмешиваться с помощью таргетных терапий, потенциально обеспечивая немедленное облегчение и устойчивые долгосрочные преимущества, которые могут замедлить прогрессирование заболевания. Из-за сложных патофизиологических процессов и гетерогенных клинических испытаний при различных заболеваниях возникает необходимость в высокочувствительных мультимодальных биомаркерах и эффективных исследовательских подходах для точного выявления и мониторинга исходов здоровья пациентов. Поэтому для прогнозирования исходов рассматриваются алгоритмы машинного обучения с различными категориями и методами, включая прогноз, оценку риска, стратификацию пациентов и мониторинг заболеваний. Поток предлагаемой работы делится на три этапа: первый этап определяет важность здравоохранения с помощью кейс-стади, за ним следуют традиционные алгоритмы машинного обучения (ML), традиционные подходы глубокого обучения (DL) и современные методы DL (TabNet и AutoInt) на втором. Наконец, эксперименты проводятся для обоснования результатов. В данной работе выделяется группировка модальностей путём интеграции молекулярных белковых, химических и генетических биомаркеров с новыми признаками машинного обучения. Результаты показывают значительное улучшение в прогнозировании точности с использованием предлагаемой методологии.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Система здравоохранения всё чаще использует предиктивную аналитику для мониторинга пациентов и своевременной диагностики исходов для здоровья, что способствует проактивному уходу и улучшает результаты лечения пациентов. Интегрируя предиктивную аналитику с биомаркерами, клиницисты могут повысить точность диагностики, выявлять эффективные методы лечения, отслеживать ход терапии и получать ценные знания о механизмах заболевания, что в конечном итоге приводит к более обоснованным и эффективным решениям по лечению. Биомаркеры относятся к характеристикам биологических молекул или индикаторов, обнаруженных в образцах, таких как биожидкости, ткани, клетки, ДНК, РНК, кровь и моча, которые измеряют наличие или прогрессирование заболевания в организме человека, помогая оценить эффективностьлечения 1.

Достижения в применении молекулярных биомаркеров играют ключевую роль в персонализированной медицине, точно измеряя конкретные молекулы для выявления уникальных проблем со здоровьем у пациентов, что позволяет с начальных стадий применять целенаправленные стратегиилечения 2. В дальнейшем мультимодальные подходы помогут интегрировать множество модальностей сложных заболеваний, позволяя более точно определить прогноз заболевания при раке и нейродегенеративных заболеваниях с помощью передовых предиктивных аналитическихметодов 3. Передовая методология использует мультиомические данные, биоинформатику и алгоритмы машинного обучения для выявления новых биомаркеров, позволяя разрабатывать специфические для пациента профилирование рисков и субъективные стратегии лечения сердечно-сосудистых заболеваний (ССЗ) и других сложных заболеваний4. Сочетание молекулярных биомаркеров и мультиомических подходов даёт надежды для повышения точности диагностики и терапевтической стратификации при неврологическихзаболеваниях 5.

С развитием методов машинного обучения мультимодальные молекулярные биомаркеры могут интегрировать различные типы данных для выявления новых заболеваний в различных состояниях здоровья, что позволяет более точно диагностировать и персонализировать стратегии лечения. Опираясь на этот потенциал, автор исследует различные методы машинного обучения в здравоохранении для прогнозирования факторов риска диагностики заболеваний и подчёркивает их важность в различных секторахздравоохранения 6. С трансформацией ML диагностики и лечения заболеваний фармацевтические практики всё чаще используют алгоритмы принятия решений для анализа исходов здоровья пациентов и удовлетворения их ежедневных потребностей, обеспечивая более информированную и эффективную помощь7. Используя потенциальную необходимость мультимодальной интеграции данных, в этом исследовании были разработаны биомаркеры с использованием мультимодальных данных (МРТ и генетика) для прогнозирования развития и прогрессирования болезни Альцгеймера, показав, что генетические данные лучше предсказывают дальнейшее развитие болезни Альцгеймера у нормальных контрольных участников, а данные МРТ лучше характеризуют стабильные лёгкие когнитивные нарушения и объединяют их с более качественнойклассификацией 8.

Дальнейшее развитие применения мультимодального анализа данных мультимодальное глубокое обучение использует данные экспрессии генов для выявления лекарств, направленных на конкретные клеточные линии новых биологических молекул, тем самым проясняя, как геномные вариации влияют на ответ на лечение9. В сочетании с достижениями в мультимодальном анализе данных неинвазивные биомаркеры, оцениваемые с помощью ИИ и МН, становятся перспективными инструментами диагностики с разной специфичностью и чувствительностью по сравнению с инвазивными биомаркерами, в зависимости от конкретного применения и контекста данных10. В соответствии с растущей значимостью мультимодального анализа данных, ансамблевые модели глубокого обучения (DL) могут эффективно обрабатывать сложные данные, интегрируя новые биомаркеры, включая взаимодействие генов и белков, для улучшения исследований рака и оптимизации стратегийлечения 11. По мере того как модели ансамбля DL продолжают развивать исследования рака, предиктивная аналитика играет ключевую роль в диагностике и лечении заболеваний, анализируя большие объёмы коллективных данных из различных источников, включая различные состояния здоровья, чтобы дать всесторонний обзор состояния, например, оценка риска идиагностика 12.

Цель предлагаемого протокола — реализовать алгоритмы на основе машинного обучения и DL, которые интегрируют отдельные биологические маркеры для повышения точности аналитики в здравоохранении. Традиционные методы прогнозирования, использующие биомаркеры, обычно опираются на одномодальные данные и линейные статистические модели, которые могут недостаточно отражать сложные, нелинейные взаимосвязи, влияющие на развитие заболеваний и индивидуальные различия. Включение огромного объёма данных из наблюдений, электронных медицинских записей, лабораторных показаний, физических измерений и клинических оценок предоставляет значительную возможность синтезировать и оптимизировать оценку рисков при диагностикепациентов 13. Биомаркеры играют ключевую роль в прецизионной медицине, позволяя проводить целенаправленное лечение в нужное время. Хотя биомаркеры сложны и представляют трудности при измерении подтипов заболеваний и молекулярного роста, они бесценны для оценки токсичных реакций при различных аномальных условиях, что облегчает дальнейший анализ. Используя биомаркеры во время клинического наблюдения, медицинские работники могут более точно предсказывать прогрессирование заболевания и контролировать ответы на лечение. В конечном итоге конвергенция мультимодальных молекулярных биомаркеров в аналитике здравоохранения с ИИ позволяет более эффективно распознавать образцы, сопоставляя существующие характеристики для снижения клинического воздействия.

В сравнении с передовыми подходами, особенно с работами Сопелли и др.14, где авторы предложили алгоритмы машинного обучения на геномных данных, таких как метаболические, эпигенетические и протеомные, а также предложили общие рекомендации по выбору алгоритмов машинного обучения. Однако существует ограничение на анализ данных. В существующейработе 15 методов неконтролируемой интеграции применялись к данным омиксов с акцентом на вычислительные задачи. В отличие от этого, существуют ограничения по объему и анализу методов. Кроме того, Хуанг и др.16 охватили большинство методов DL для анализа различных приложений, стремясь понять возможности больших данных и вычислительных фреймворков. Недостатками были дисбаланс данных, перенастройка и проблемы с интерпретацией. Предлагаемый протокол имеет решающее значение для устранения критического пробела в исследованиях интегративных биомаркеров, поскольку современные методы не способны эффективно объединять высокоразмерные и разнообразные биологические данные. Используя сложные методы ML и DL, которые превосходят распознавание образов, выбор признаков и мультимодальное слияние, предлагаемая работа направлена на выявление надёжных предиктивных сигнатур, улучшающих раннюю диагностику, прогноз и индивидуальные варианты лечения. Этот протокол напрямую решает ограничения разрозненных оценок биомаркеров, представляя комплексную, основанную на данных модель, позволяющую делать масштабируемые, интерпретируемые и клинически значимые прогнозы здоровья.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Экспериментальный рабочий процесс

Рисунок 1 иллюстрирует организованный и модульный конвейер рабочих процессов, предназначенный для категоризации молекулярных биомаркеров на категории риска или диагностических индикаций с использованием методов машинного обучения и глубокого обучения. Вот подробное пошаговое объяснение процесса:

  1. Сбор наборов данных
    Набор данных собран из MarkerDB 2.0 — курируемой базы данных молекулярных биомаркеров.
  2. Предварительная обработка данных
    Это обеспечивает качество и согласованность данных, обрабатывая нулевые значения и отсутствующие записи, кодируя категориальные признаки с помощью LabelEncoder и масштабируя численные признаки (например, entrez_gene_id) с помощью StandardScaler.
  3. Инженерия особенностей
    Рекомендуется выбирать релевантные признаки, влияющие на классификацию биомаркеров, предотвращающие утечку данных и улучшающие производительность модели.
  4. Разработка модели
    Используемые подходы включают логистическую регрессию, случайный лес, XGBoost, а в DL: MLP, MLP с LR Scheduler, AutoInt, TabNet. Выполняемые задачи включают настройку гиперпараметров, кросс-валидацию и оптимизацию для задач классификации.
  5. Разделение данных
    Здесь тренировочный набор (80%) используется для изучения параметров модели, а тестовый набор (20%) — для оценки модели на невидимых данных. На финальной стадии используются метрики оценки, чтобы обеспечить комплексное измерение результатов, особенно в ситуациях с дисбалансом классов.

figure-protocol-1
Рисунок 1: Блок-схема предлагаемой работы. Рабочий процесс предлагаемой задачи изображен на этой рисунке. Этапы включают предварительную обработку данных, инженерию признаков, разработку моделей, разбиение, оценку модели с использованием метрик и анализ биомаркеров. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

2. Описание набора данных

Название набора данных all_sequence_variants с расширением csv. Есть столбцы с названиями 'id', 'variation', 'position', 'external_link', 'gene_symbol', 'entrez_gene_id', 'reference', conditions', 'indication_types', где все объектные типы, кроме id как int type и entrez_gene_id как float type. Общее количество строк составляет 42818 с 9 столбцами. Кроме того, набор данных содержит нулевые значения для вариации, положения, external_link, entrez_gene_id, ссылки, условий и indication_types. Набор данных взят по ссылке, указанной как: https://markerdb.ca/downloads17

3. Предварительная обработка наборов данных

На этом этапе начинается предобработка данных с сбора информации о наборах данных, описания, выявления дубликата и поиска отсутствующих/нулевых значений. При измерении коэффициентом корреляции external_link не влияет на неё, поэтому она убирается. Нулевые значения категориальных и числовых столбцов заполняются соответственно медианой и средней. Наконец, форма входа и вывода в наборе данных: (42787, 6)(42787,). Входные столбцы — «id», «variation», «position», «gene_symbol», «entrez_gene_id», «conditions», тогда как целевой столбец — indication_types.

4. Биомаркеры: категории, проблемы с даними и роль молекулярного риска

Биомаркер — это количественно измеримый признак, который обозначает либо нормальную, либо аномальную биологическую активность или реакцию на различные воздействия или вмешательства. Биомаркеры могут быть молекулярными, гистологическими, рентгенографическими или физиологическими и делятся на семь основных категорий: (1) Диагностический биомаркер определяет, есть ли у человека конкретное заболевание или расстройство и относится ли оно к подтипу, (2) мониторинговый биомаркер указывает на прогрессирование заболевания и его реакцию на лечение, (3) Биомаркер ответа показывает, реагирует ли пациент на препарат или терапию, например, изменение частоты сердечных сокращений, (4) Предиктивный биомаркер может определить, находится ли человек в группе риска развития определённого заболевания и как он может реагировать на конкретное лечение, (5) Прогностический биомаркер может дать представление о вероятности прогрессирования или рецидива заболевания, если пациент склонен к определённому исходу здоровья, (6) Биомаркер риска оценивает потенциальный уровень риска заболевания до того, как пациент получит официальный диагноз, и (7) Биомаркер безопасности оценивает потенциал токсичных или нежелательных реакций, которые могут возникнуть в результате лечения. Это исследование в основном сосредоточено на анализе молекулярных биомаркеров, связанных с оценкой риска и диагностикой, как показано на рисунке 2. Учитывая огромное количество медицинских данных, доступных по всему миру, биомаркеры необходимы для принятия клинических решений, продвижения исследований и содействия персонализированной медицине.

figure-protocol-2
Рисунок 2: Категория биомаркеров для клинического принятия решений. Решения биомаркера представлены на этой диаграмме. На основе аналитики, применённой к биомаркерам, принимаются клинические решения и внедряются алгоритмы машинного обучения. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Поиск и понимание клинически полезной информации о биомаркерах сложно из-за широкого спектра типов, характеристик и качества биомаркеров. Быстрый рост исследований биомаркеров за последние два десятилетия ещё больше усложнил доступ к комплексным и актуальным данным, особенно по молекулярным биомаркерам. Это привело к таким проблемам, как непоследовательные результаты, повторное повторное обнаружение существующих биомаркеров, противоречивые результаты и упущенные возможности использования установленныхбиомаркеров 18. Появление «омических» измерений усугубило эту проблему, что привело к распространению новых молекулярных биомаркеров в клинических испытаниях и литературе, что усложняет навигацию и эффективное применение знаний обиомаркерах 19.

MarkerDB 2.0 предоставляет доступ к разнообразным молекулярным биомаркерам дляэкспериментальных целей 20. Различные биомаркеры используются в клинических исследованиях и медицинских приложениях для диагностики, прогнозирования и мониторинга заболеваний. Среди них белоковые биомаркеры используют такие биожидкости, как сыворотка, кровь, спинномозговая жидкость (СМЖ), брюшинная жидкость, амниотическая жидкость, плазма и моча, для анализа таких состояний, как сахарный диабет, туберкулёз, синдром Дауна и миопатии. Аналогично, генетические биомаркеры используют генные символы, такие как LRP1, LPP, MAPT и SPI1, для анализа состояний, таких как возрастная макулярная дегенерация, аллергические заболевания, болезнь Альцгеймера, рак и астма. Кроме того, мультимодальные молекулярные биомаркеры помогают измерять риски пациентов и диагностическиепоказатели 21. Эта работа подчёркивает необходимость медицинской аналитики с использованием методов машинного обучения для улучшения диагностики, прогнозирования заболеваний и персонализированного лечения.

5. Моделирование статистических методов машинного обучения для обнаружения биомаркеров

Применение методов машинного обучения во многих аспектах изменило сферу здравоохранения. В частности, молекулярные биомаркеры анализировались с использованием различных методов машинного обучения, включая анализ основных компонентов (PCA), кластеризацию K-средних (KMA), анализ ближайших соседей (NNA) и алгоритмы нейронныхсетей 22. Эти модели выявляют сложные закономерности из выбранных признаков, управляют неполными или противоречивыми данными и поддерживают отслеживание прогрессирования заболевания в реальном времени. Помимо диагностики заболеваний, алгоритмы машинного обучения предоставляют значимую информацию о проблемах пациентов посредством анализа данных и визуализации, что позволяет своевременно и целенаправленно оказыватьпомощь 23. В результате это улучшает результаты здоровья пациентов в необычных условиях. Кроме того, способность машинного обучения революционизировать открытие биомаркеров и терапевтические результаты при различных заболеваниях, включая анализ молекулярных биомаркеров, становится всё более активной.

Алгоритмы машинного обучения классифицируются на пять основных типов, как показано на рисунке 3. Контролируемое обучение — это процесс обучения на маркированных наборах данных для понимания взаимосвязей вход-выход, что делает его идеальным для задач, таких как классификация и регрессия, например, деревья решений и вспомогательные векторные машины. Неконтролируемое обучение выявляет закономерности в немаркированных данных и часто применяется для кластеризации и уменьшения размерности, с помощью таких методов, как кластеризация k-средних и анализ основных компонентов. Полусупервизированное обучение объединяет как маркированные, так и немаркированные данные для генерации прогнозов. Обучение с подкреплением сосредоточено на принятии решений, основанных на обратной связи от окружающей среды, и часто используется в играх и робототехнике, с такими методами, как Q-обучение и сети глубокого обучения с подкреплением. Глубокое обучение использует искусственные нейронные сети с несколькими слоями для выявления сложных закономерностей в данных. Этот метод помогает прогнозировать биомаркеры распространённых заболеваний, включая рак, инсульт, болезнь Альцгеймера и болезнь Паркинсона. Множество клинически одобренных приложений используют этутехнологию 24,25. Точный диагноз пациентов с злокачественными опухолями обычно зависит от сбора и патологического анализа образцов тканей, которые дают критически важную информацию о гистологической степени, подтипе, стадии и различных других биомаркерах опухоли.

figure-protocol-3
Рисунок 3: Категоризация алгоритмов машинного обучения для клинического принятия решений. Типы алгоритмов машинного обучения на диаграмме иллюстрируются для понимания применяемой методологии. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Статистика и машинное обучение — это две отдельные дисциплины, которые часто пересекаются. Статистика включает сбор, анализ и интерпретацию данных, обычно работая с меньшими, чётко определёнными наборами данных, и в первую очередь сосредоточена на сравнении и суммировании информации. С другой стороны, машинное обучение — это подмножество искусственного интеллекта, которое создаёт предсказательные модели, часто работающие с большими и сложными наборами данных. Хотя статистика играет важную роль в подтверждающих исследованиях и понимании основных механизмов, машинное обучение более эффективно в исследовательских исследованиях, выявлении сложных закономерностей и управлении недостающими данными. Методы, такие как логистическая регрессия, можно рассматривать как статистические модели и контролируемые модели машинного обучения, иллюстрируя размытые различия между этими двумя областями. В конечном итоге исследователям необходимо оценить свои исследовательские цели и характер данных, чтобы выбрать наиболее подходящий метод.

6. Моделирование MLP и его вариантов

MLP, также известный как многослойный перцептрон, представляет собой тип архитектуры нейронных сетей с множеством нейронных слоёв между входным и выходным слоями, как показано на рисунке 4. MLP была введена в 1950-х годах и получила широкое распространение благодаря прогрессу и достижениям в области обратного распространения в 1980-х, что помогло минимизировать потери. Основные принципы обучения MLP — это нейронные сети, веса и значения смещения для вычисления результата. Наконец, чтобы узнать функцию активации и пороговое значение для получения выходного слоя. В предлагаемой методологии узлы на входном, скрытом и выходном слоях соответствуют клиническим и генным признакам, полностью связанным слоям с активацией ReLU и одному нейрону с сигмовидной активацией для прогнозирования бинарного исхода типа показаний (риск, диагностика) соответственно. Главное преимущество — это простота обучения и интерпретации. Однако простой MLP не может работать с большими наборами данных и чувствителен к скоростиобучения 26. Поэтому для преодоления этих недостатков рассматривается MLP с планировщиком скорости обучения с архитектурой, приведённой на рисунке 3B. MLP с LR — это мощный динамический механизм с резким распадом, экспоненциальным затухаем, обратным временным затухателем, ReduceLROnPlateau и косинусным отжигом. Вместо фиксированного значения LR скорость обучения меняется в зависимости от производительности и обучения модели.

figure-protocol-4
Рисунок 4: Моделирование многоуровневого Perceptron и MLP с помощью планировщика LR. (A) Многослойный перцептрон: структура MLP иллюстрируется с помощью входного слоя, скрытого слоя и выходного слоя. Первый слой принимает входные данные и обрабатывает его во втором слое с активациями, а выход поступает на последнем слое. MLP просто реализовать. (B) MLP с LR Scheduler: Это похоже на MLP; однако добавляется планировщик скорости обучения для управления скоростью тренировки для лучшей скорости сходимости. Скорость обучения снижается на плато. Это снижает минимальные значения превышения. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Этот подход более эффективен, надёжен и эффективен для табличных данных. Кроме того, есть преимущества, такие как стабильное улучшение сходимости на шумных данных, улучшение обобщения и снижение усилий при настройке гиперпараметров. Однако для некоторых заданий прогнозирования могут возникнуть трудности, например, застрять в локальных минимумах. Кроме того, в широкой и глубокой архитектуре MLP, представленной на рисунке 5, в MLP вводятся широкие и глубокие компоненты, которые преуспевают в корреляционном отображении, запоминании правил и изучении новых шаблонов, сохраняя при этом высокие стандарты обобщения. Объединяя эти аспекты в выходной слой, двоичный выход предсказываетсякак 27. Однако существуют ограничения на обобщение невидимых признаков и чрезмерное обобщение. В заключение, для нормализации процесса обучения используется MLP с пакетной нормой и отчислением, включая выбросание для обучения и обобщения неизвестных атрибутов. В частности, этот метод может применяться к данным с высокой размерностью и помогает предотвратить перенагон. Тем не менее, эта техника страдает от ограничений по размеру пакета, увеличенного потребления памяти (из-за слоёв пакетной нормализации) и не является универсальнымрешением 28,29.

figure-protocol-5
Рисунок 5: Моделирование MLP по всей и глубокой сети. Диаграмма иллюстрирует глубокий путь MLP, который может фиксировать нелинейные связи и объединяет результат с сигмовидной единицей для классификации. Эта архитектура фиксирует обучение паттернов и знания для гетерогенных данных биомаркеров. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

7. TabNet

TabNet — это модель глубокого обучения, известная как Tabular Network, разработанная исследовательской командойGoogle 30. Основная мотивация модели TabNet — примирить различия между подходами DL для подходов изображения, текста, речи (CNN, Autoencoder, Transformers) и деревочного ML (XGBoost, Random Forest, LightGBM). Кроме того, ограничения подходов DL оказывают огромное влияние на модель TabNet, поскольку MLP является параметризованной моделью. Прежде всего, подходы DL не обладают интерпретацией в реальных задачах, самоконтролируемым обучением и последовательной образовательнойвозможностью 31. Модели TabNet ограничены такими приложениями, как прогнозирование страховых рисков32, оценка содержания золыугля 33, прогноз химическойтоксичности 34 и обнаружение образовательного тестового мошенничества35. Архитектура TabNet показана на рисунке 6.

figure-protocol-6
Рисунок 6: Моделирование табличной сети. Табличная сеть принимает входные признаки в табличном формате и применяет технику трансформатора последовательно в каждом блоке. Блок GLU, также известный как блок Gated Linear Unit, управляет потоком информации по сети, облегчая выбор признаков и стабильное обучение. Выход представлен на выходном слое из накопленного выхода. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Согласно приведённой выше архитектурной диаграмме, система делится на четыре компонента: входной блок, преобразователь общих признаков, последовательные шаги принятия решений и расчёт потерь с помощью оптимизации. В категориальных признаках признаки преобразуются в целые числа после слоя вложения. В то же время непрерывные признаки принимаются такими, какие они есть. Наконец, признаки преобразуются в единый вектор признаков, где x ∈ Rd. На следующем этапе реализуются полностью связанные слои с функциями активации, затем преобразование данных в вектор, после чего принимается решение. На третьем этапе последовательно используются трансформер внимания, маскировка, преобразователь принятия решений и накопление предсказаний. Цели этого шага — избирательное внимание, последовательное мышление и пути принятия решений. На последнем этапе используются либо бинарная кросс-энтропия, либо аналогичные методы для поиска потерь и оптимизации значения. Кроме того, регуляризация выполняется с использованием sparse attention для предотвращения перенагона.

8. AutoInt

Автоматическое обучение взаимодействия с функциями с помощью самовнимательных нейронных сетей (AutoInt) — это полная форма AutoInt, введённая в предсказание частоты кликов(CTR) 36 и позже применённая в различных приложениях, включая прогнозирование дефектов программногообеспечения 37, системырекомендаций 38 и обнаружениегеномов 39. Существуют ограничения в существующих методах машинного обучения, включая обработку разреженных данных с высоким уровнем измерения, комбинаторные признаки более высокого порядка, понимание возможностей функции в прогнозировании и необходимость ручного проектирования признаков. Все эти проблемы решаются моделью AutoInt с эффективностью, результативностью и объяснимостью. Цель AutoInt в предлагаемой методологии — предсказать, относится ли данный вариант к риску или диагностическому индикативному типу. Для данного набора данных предложено семь шагов, как показано на рисунке 6, вместе с исходным кодом. Во-первых, чтение данных и предобработка реализуются для кодирования всех категориальных признаков в виде целых чисел и сопоставления меток в 0 и 1 для Risk и Diagnostic соответственно. На втором этапе выполняется представление признаков для создания матрицы вложения; в свою очередь, матрица преобразуется для нормализации числовых признаков. Существуют взаимодействующие уровни, где нейтральное автоматическое взаимодействие между элементами обучается без ручного взаимодействия с трансформаторами. Кроме того, несколько голов изучают разные типы взаимодействий, и, наконец, эти признаки объединяются, усиливая представление. Существуют остаточные связи для изучения взаимодействий как нижнего, так и высокого порядка, таких как 1 признак, 2 признака, 3 признака и так далее. Наконец, из остаточной сети выходы передаются в сигмоидную функцию для вычислений бинарных значений, как показано на рисунке 7.

figure-protocol-7
Рисунок 7: Моделирование сети AutoInt. Сеть AutoInt автоматически изучает особенности, где уровень встраивания берёт эти признаки и отображает их в следующий слой с помощью механизма самовнимания и остаточных соединений. Последний компонент содержит уровень MLP и функции активации для получения результата. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Эксперименты проводятся с использованием методов машинного обучения и линейного обучения для сравнения их эффективности. В то же время рассматривается создание моделей машинного обучения, использующих как контролируемое, так и неконтролируемое обучение. В этой методологии используются контролируемые методы: логистическая регрессия, дерево принятия решений, случайный лес, усиление градиента, опорная векторная машина и k-ближайшие соседи. Эти алгоритмы варьируются от простых статистических...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В предлагаемой работе чётко обсуждается важность биомаркеров в идентификации и мониторинге заболевания и его характеристик. Предлагаемый подход к методологии биомаркеров основан на четырёх основных этапах: тщательная подготовка данных (очистка, кодирование, устранение идентификаторов); однородное кодирование целей (Risk=0, Диагностика=1); нормализация функций и высококачественное глубокое встраивание для моделей, таких как AutoInt37/TabNet; и надёжную целостность ...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторам нечего раскрывать.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы не получали внешнего финансирования.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Модель AutoIntПекинский университетhttps://github.com/shichence/AutoIntАвтоматическое обучение взаимодействия признаков с помощью самовнимательных нейронных сетей: эффективный алгоритм для автоматического изучения взаимодействий признаков высокого порядка для (редких) категориальных и числовых признаков
deepctr_torch.modelsОткрытый исходный кодhttps://github.com/shenweichen/DeepCTR-TorchМодульный и расширяемый пакет CTR-моделей на основе глубокого обучения для легкого создания собственной собственной модели.
Google ColaboratoryGooglehttps://colab.research.google.com/Облачные  среда для написания и выполнения кода на Python через браузер для машинного обучения и анализа данных
Keras 2.6.0Керасhttps://keras.io/Предоставляет интерфейс на Python для запуска нейронных сетей, который работает поверх Tensorflow
MarkerDB 2.0MarkerDBhttps://markerdb.ca/downloadsПублично доступная база данных молекулярных биомаркеров
Matplotlib 3.4.3Matplotlib https://matplotlib.org/Библиотека визуализации для python
Numpy 1.21.4Numpyhttps://numpy.org/Фундаментальный пакет для научных вычислений на Python
Панды 1.3.4Пандыhttps://pandas.pydata.org/Мощный, гибкий и простой в использовании инструмент для анализа и обработки данных с открытым исходным кодом, построенный на языке программирования Python.
Python 3.8.10Фонд программного обеспечения Pythonhttps://www.python.org/Популярный язык программирования, который эффективнее интегрирует системы глубокого обучения.
pytorch_tabnet.tab_modelPytorchhttps://pypi.org/project/pytorch-tabnet/Для реализации задач бинарной/многоклассовой классификации и регрессии.
Scikit-learnScikit-learnhttps://scikit-learn.org/stable/Модуль Python для алгоритмов машинного обучения
СиборнСиборнhttps://seaborn.pydata.org/Библиотека визуализации данных высокого уровня для создания привлекательной и информативной статистической графики
Модель TabNetGooglehttps://github.com/dreamquark-ai/tabnetTabNet — это сквозная нейронная сеть, предназначенная для прямой обработки табличных данных
Tensorflow 2.6.0Googlehttps://www.tensorflow.org/Сквозная платформа для машинного обучения

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Mollarasouli, F., Bakirhan, N. K., Ozkan, S. A. Introduction to biomarkers. The detection of biomarkers. , Academic Press. 1-22 (2022).
  2. Doroszkiewicz, J., Groblewska, M., Mroczko, B. Molecular biomarkers and their implications for the early diagnosis of selected neurodegenerative diseases. Int J Mol Sci. 23 (9), 4610(2022).
  3. Steyaert, S., et al. Multimodal data fusion for cancer biomarker discovery with deep learning. Nat Mach Intell. 5 (4), 351-362 (2023).
  4. DeGroat, W., et al. Multimodal AI/ML for discovering novel biomarkers and predicting disease using multi-omics profiles of patients with cardiovascular diseases. Sci Rep. 14 (1), 26503(2024).
  5. Myrou, A., Barmpagiannos, K., Ioakimidou, A., Savopoulos, C. Molecular biomarkers in neurological diseases: advances in diagnosis and prognosis. Int J Mol Sci. 26 (5), 2231(2025).
  6. Bansal, A., Shukla, A. K., Bansal, S. Machine learning methods for predictive analytics in health care. Proc IEEE Int Conf Syst Modeling Adv Res Trends. , 258-262 (2021).
  7. Adeghe, E. P., Okolo, C. A., Ojeyinka, O. T. A review of the use of machine learning in predictive analytics for patient health outcomes in pharmacy practice. OARJ Life Sci. 7 (1), 052-058 (2024).
  8. Mirabnahrazam, G., et al. Machine learning based multimodal neuroimaging genomics dementia score for predicting future conversion to Alzheimer's disease. J Alzheimers Dis. 87 (3), 1345-1365 (2022).
  9. Taj, F., Stein, L. D. MMDRP: drug response prediction and biomarker discovery using multimodal deep learning. Bioinform Adv. 4 (1), vbae010(2024).
  10. Lazaros, K., et al. Non-invasive biomarkers in the era of big data and machine learning. Sens. 25 (5), 1396(2025).
  11. Mathema, V. B., Sen, P., Lamichhane, S., Orešič, M., Khoomrung, S. Deep learning facilitates multi-data type analysis and predictive biomarker discovery in cancer precision medicine. Comput Struct Biotechnol J. 21, 1372-1382 (2023).
  12. Pearson, T. A., et al. Precision health analytics with predictive analytics and implementation research: JACC state-of-the-art review. JACC. 76 (3), 306-320 (2020).
  13. Parvin, N., Joo, S. W., Jung, J. H., Mandal, T. K. Multimodal AI in biomedicine: Pioneering the future of biomaterials, diagnostics, and personalized healthcare. Nanomaterials. 15 (12), 895(2025).
  14. Somepalli, G., Goldblum, M., Schwarzschild, A., Bruss, C. B., Goldstein, T. SAINT: Improved neural networks for tabular data via row attention and contrastive pre-training. arXiv. , (2021).
  15. Libbrecht, M. W., Noble, W. S. Machine learning applications in genetics and genomics. Nat Rev Genet. 16 (6), 321-332 (2015).
  16. Huang, S., Chaudhary, K., Garmire, L. X. More is better: Recent progress in multi-omics data integration methods. Front Genet. 8, 84(2017).
  17. Li, Y., Huang, C., Ding, L., Li, Z., Pan, Y., Gao, X. Deep learning in bioinformatics: introduction, application, and perspective in the big data era. Methods. 166, 4-21 (2019).
  18. Frangogiannis, N. G. Biomarkers: Hopes and challenges in the path from discovery to clinical practice. Transl Res. 159 (4), 197-204 (2012).
  19. Frantzi, M., et al. Omics-derived biomarkers and novel drug targets for improved intervention in advanced prostate cancer. Diagn. 10 (9), 658(2020).
  20. Jackson, H., et al. MarkerDB 2.0: A comprehensive molecular biomarker database for 2025. Nucleic Acids Res. 53, D1415-D1426 (2025).
  21. DeGroat, W., et al. IntelliGenes: A novel machine learning pipeline for biomarker discovery and predictive analysis using multi-genomic profiles. Bioinform. 39 (12), btad755(2023).
  22. Thelagathoti, R. K., et al. A hybrid sequential feature selection approach for identifying new potential mRNA biomarkers for Usher syndrome using machine learning. Biomol. 15 (7), 963(2025).
  23. Ng, S., Masarone, S., Watson, D., Barnes, M. R. The benefits and pitfalls of machine learning for biomarker discovery. Cell Tissue Res. 394 (1), 17-31 (2023).
  24. Chudzik, A., Śledzianowski, A., Przybyszewski, A. W. Machine learning and digital biomarkers can detect early stages of neurodegenerative diseases. Sens. 24 (5), 1572(2024).
  25. Chang, C. H., Lin, C. H., Lane, H. Y. Machine learning and novel biomarkers for the diagnosis of Alzheimer's disease. Int J Mol Sci. 22 (5), 2761(2021).
  26. Bzdo, D., Altman, N., Krzywinski, M. Statistics versus machine learning. Nat Methods. 15 (4), 233-234 (2018).
  27. Bikku, T. Multi-layered deep learning perceptron approach for health risk prediction. J Big Data. 7 (1), 50(2020).
  28. Smith, L. N. A disciplined approach to neural network hyper-parameters: part 1-learning rate, batch size, momentum, and weight decay. arXiv. , (2018).
  29. Kim, T. Generalizing MLPs with dropouts, batch normalization, and skip connections. arXiv. , (2021).
  30. Chen, G., Chen, P., Shi, Y., Hsieh, C. Y., Liao, B., Zhang, S. Rethinking the usage of batch normalization and dropout in the training of deep neural networks. arXiv. , (2019).
  31. Arik, S. Ö, Pfister, T. Tabnet: attentive interpretable tabular learning. Proc AAAI Conf Artif Intell. 35 (8), 6679-6687 (2021).
  32. Qamar, T., Bawany, N. Z. Understanding the black-box: towards interpretable and reliable deep learning models. PeerJ Comput Sci. 9, e1629(2023).
  33. McDonnell, K., Murphy, F., Sheehan, B., Masello, L., Castignani, G. Deep learning in insurance: accuracy and model interpretability using TabNet. Expert Syst Appl. 217, 119543(2023).
  34. Zhou, M., Wen, Z., Xu, G., Zhang, Z., Zhou, C. Deep learning with TabNet: Rapid coal ash content estimation via X-ray fluorescence. Int J Coal Prep Util. 45 (3), 523-547 (2025).
  35. Mustafa, F. M., et al. TabNet and TabTransformer: Novel deep learning models for chemical toxicity prediction in comparison with machine learning. J Appl Toxicol. , (2025).
  36. Zhen, Y., Zhu, X. An ensemble learning approach based on TabNet and machine learning models for cheating detection in educational tests. Educ Psychol Meas. 84 (4), 780-809 (2024).
  37. Song, W., et al. Autoint: Automatic feature interaction learning via self-attentive neural networks. Proc ACM Int Conf Inf Knowl Manage. , 1161-1170 (2019).
  38. Jadhav, S., Manikandan, S., Ryu, D. Enhancing the software defect prediction using AutoInt. IEEE Int Conf Big Data Smart Comput. , 103-104 (2025).
  39. He, H., Zhang, R., Zhang, Y., Ren, J. AAIN: Attentional aggregative interaction network for deep learning based recommender systems. Neurocomputing. 547, 126374(2023).
  40. Fan, Y., Waldmann, P. Tabular deep learning: A comparative study applied to multi-task genome-wide prediction. BMC Bioinform. 25 (1), 22(2024).
  41. Kanász, R., Drotár, P., Gnip, P., Zoričák, M. Clash of titans on imbalanced data: TabNet vs XGBoost. Conf IEEE Trans Artif. , 320-325 (2024).
  42. Hwang, Y., Song, J. Recent deep learning methods for tabular data. Commun Stat Appl Methods. 30 (2), 215-226 (2023).
  43. Gorishniy, Y., et al. TabR: Tabular deep learning meets nearest neighbors in 2023. arXiv. , (2023).
  44. Kalidindi, A., Arrama, M. B. A TabTransformer based model for detecting botnet-attacks on internet of things using deep learning. J Theor Appl Inf Technol. 101 (13), 5206-5218 (2023).
  45. Holzmüller, D., Grinsztajn, L., Steinwart, I. RealMLP: Advancing MLPs and default parameters for tabular data. ELLIS Workshop on Representation Learning and Generative Models for Structured Data. , (2025).
  46. Zhu, B., et al. Xtab: cross-table pretraining for tabular transformers. arXiv. , (2023).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Machine Learning BiomarkersMultimodal BiomarkersPredictive Health AnalyticsMolecular BiomarkersDisease MonitoringRisk AssessmentPatient StratificationDeep Learning TechniquesProtein BiomarkersGenetic Biomarkers

Related Articles