Для просмотра этого контента требуется подписка на JoVE. Войдите или начните свой бесплатный пробный период.

Методическая статья

Идентификация иммунозависимых молекулярных биомаркеров при расстройствах аутистического спектра с использованием независимой от данных протеомики и машинного обучения

565 просмотров

DOI:

10.3791/68949

26 сентября 2025 г.

* These authors contributed equally

В этой статье

Краткое содержание

В этой статье мы представляем протокол с использованием масс-спектрометрии, не зависящей от данных, и машинного обучения, который идентифицировал восемь иммунородственных белков в качестве точных биомаркеров для ранней диагностики расстройств аутистического спектра, подтвержденных с помощью иммуноферментного анализа.

Аннотация

В этом исследовании представлен воспроизводимый протокол для идентификации биомаркеров сывороточных белков, связанных с расстройствами аутистического спектра (РАС), с использованием масс-спектрометрии, независимой от сбора данных (DIA) в сочетании с машинным обучением (ML). DIA обеспечивает несмещенное профилирование протеома сыворотки с высоким разрешением, включая белки с низким содержанием белка, обеспечивая при этом воспроизводимость образцов. Подходы ML были применены для выбора диагностически информативных белковых панелей и повышения надежности модели. В анализ была включена сыворотка крови 99 детей с РАС и 70 детей соответствующего возраста. Белки с высоким содержанием были истощены, пептиды были получены с использованием стандартизированных процедур разложения и фракционирования, а DIA была выполнена на масс-спектрометре с высоким разрешением. Обработка данных и количественное определение идентифицировали дифференциально экспрессируемые белки, которые подверглись анализу функционального обогащения. Восемь иммунных белков оказались сильными кандидатами на разработку биомаркеров. Модель логистической регрессии, обученная на этих белках, достигла точности 95,27%, значения Каппа 0,9025 и AUC 1,000 при перекрестной валидации. Эти результаты демонстрируют потенциал протеомики на основе DIA в сочетании с машинным обучением в качестве надежной основы для обнаружения биомаркеров при РАС и для адаптации в более широких клинических исследованиях.

Введение

Расстройство аутистического спектра (РАС) — это группа расстройств нервного развития с ранним началом, характеризующихся гетерогенностью этиологии и клинической картины. К основным особенностям относятся стойкий дефицит социальной коммуникации и взаимодействия, а также ограниченное, повторяющееся поведение, интересы или виды деятельности. В Соединенных Штатах распространенность составляет примерно 2,3% среди детей в возрасте 8 лет и около 2,2% среди взрослых, что подчеркивает его влияние на общественное здравоохранение 1,2,3,4. Факторы риска разнообразны, включая генетическую предрасположенность, иммунную дисрегуляцию и пренатальное воздействие окружающей среды 5,6,7. Ранняя диагностика и вмешательство могут значительно улучшить исходы развития, что делает идентификацию объективных и надежных биомаркеров основным направлением исследований РАС 8,9,10. Этот протокол основан на нашей ранее опубликованной работе по применению протеомики и машинного обучения, не зависящих от данных (DIA) для идентификации иммунозависимых белков в качестве потенциальных биомаркеров для ранней диагностики РАС11.

Несмотря на обширные усилия, в настоящее время не существует специфических и универсально валидированных биомаркеров для клинической диагностики РАС12. Предложенные кандидаты, такие как изменения в микробиомекишечника13, повышенный уровень интерлейкина-6 (IL-6)14, изменения нейротрофического фактора мозга (BDNF)15 и маркеры окислительного стресса, такие как глутатион16, остаются предварительными и не могут быть воспроизведены для клинического использования. Протеомика стала многообещающим подходом к идентификации специфических для заболевания молекулярных сигнатур, и в нескольких исследованиях изучались различные биологические образцы (кровь, слюна, моча, PBMC) для дифференциально экспрессируемых белков 8,17,18,19,20,21,22 . Например, Bao et al. продемонстрировали, что воспалительные белки, идентифицированные с помощью протеомики Olink, могут помочь в ранней диагностике РАС (17), в то время как другие исследования показывают, что общие протеомные и метаболические пути могут давать надежные биомаркеры, несмотря на генетическую гетерогенностьРАС.

Масс-спектрометрия DIA привлекает все большее внимание благодаря своему всестороннему и воспроизводимому профилированию белков. В отличие от традиционного сбора данных, зависимого от данных (DDA), который селективно фрагментирует наиболее интенсивные ионы, DIA фрагментирует все ионы-предшественники в заранее определенных m/z окнах. Это обеспечивает более глубокий протеомный охват и улучшенную воспроизводимость в больших когортах, что является ключевым преимуществом для клинических сравнений14. Сравнительные исследования показывают, что DIA обнаруживает больше поддающихся количественной оценке пептидов, чем DDA, особенно для белков с низким содержанием и меньшей вариацией между прогонами.

Основываясь на этих достижениях, мы применили протеомный анализ на основе DIA к образцам сыворотки крови 99 детей с РАС и 70 детей из контрольной группы после истощения белков с высоким содержанием. Наши результаты подчеркивают потенциал иммунородственных белков в качестве молекулярных маркеров для ранней диагностики РАС и демонстрируют ценность протеомики на основе DIA в поиске биомаркеров в сочетании со строгойметодологией.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Протокол был составлен в соответствии с Хельсинкской декларацией, и протокол был одобрен Наблюдательным советом по институциональным вопросам в Больнице охраны здоровья матери и ребенка в Чанше; От испытуемых было получено информированное согласие.

1. Выявление детей с аутизмом с помощью DSM-5

  1. Сбор анамнеза и справочной информации
    1. История развития
      1. Соберите информацию о раннем развитии пациента, включая развитие речи, социальных и двигательных навыков.
      2. Обратите внимание на любые задержки развития или аномалии (например, задержку речи, трудности в социальном взаимодействии).
    2. Семейный анамнез
      1. Узнайте о семейном анамнезе аутизма или других нарушений развития нервной системы.
    3. Текущий функциональный уровень
      1. Оцените производительность пациента в повседневной жизни, включая обучение, работу, социальное взаимодействие и навыки самостоятельной жизни.
  2. Использование диагностических критериев DSM-5
    1. Стойкий дефицит социальной коммуникации и социального взаимодействия
      1. Убедитесь, что соблюдены по крайней мере два из следующих трех критериев:
        1. Дефицит социально-эмоциональной взаимности проявляется в отсутствии нормального зрительного контакта, мимики или языка тела, а также в трудностях с формированием соответствующих возрасту дружеских отношений или отношений.
        2. Дефицит невербального коммуникативного поведения – ищите проблемы с использованием жестов, мимики или тона голоса для передачи эмоций и ограниченного понимания невербальных сигналов от других людей.
        3. Дефицит в развитии, поддержании и понимании отношений – это трудности с адаптацией к различным социальным контекстам, отсутствие интереса к сверстникам или неспособность участвовать в творческих играх.
    2. Ограниченные, повторяющиеся модели поведения, интересов или действий
      1. Убедитесь, что соблюдены по крайней мере два из следующих четырех критериев:
        1. Стереотипные или повторяющиеся двигательные движения (например, взмахи руками, раскачивание тела или использование повторяющихся предметов).
        2. Настаивайте на однообразии или ритуализированных моделях поведения — ищите крайнее расстройство из-за незначительных изменений в распорядке дня.
        3. Сильно ограниченные, зацикленные интересы – ищите аномально интенсивную концентрацию на конкретных темах или занятиях.
        4. Гипер- или гипореактивность к сенсорным входным сигналам — поиск нетипичных реакций на сенсорные стимулы, такие как звуки, свет или прикосновения.
  3. Оценка начала и тяжести симптомов
    1. Время появления симптомов – подтверждает, что симптомы присутствовали в раннем детстве (обычно до 3 лет), даже если они становятся более очевидными позже.
    2. Воздействие симптомов – подтвердите, что симптомы вызывают значительные нарушения в социальной, профессиональной или других важных сферах функционирования.
    3. Уровни серьезности
      ПРИМЕЧАНИЕ: Согласно DSM-5, степень тяжести РАС подразделяется на три уровня (Дополнительная таблица S1).
      1. Классифицируйте как уровень 1, если пациенту требуется только легкая поддержка.
      2. Классифицируйте как уровень 2, если пациент нуждается в существенной поддержке (умеренной).
      3. Классифицируйте как уровень 3, если пациент нуждается в очень существенной поддержке (тяжелая).
  4. Исключение других потенциальных причин
    1. Медицинское обследование Проведите необходимые медицинские обследования (например, генетическое тестирование, визуализация мозга), чтобы исключить другие состояния, которые могут вызывать подобные симптомы (например, генетические синдромы, нарушения слуха, интеллектуальные нарушения).
    2. Оценка коморбидности: Оцените наличие коморбидных состояний (например, синдром дефицита внимания и гиперактивности, тревожные расстройства, депрессия, эпилепсия и т. д.).

2. Пробоподготовка для масс-спектрометрического анализа методом DIA

  1. Соблюдение этических норм и отбор проб
    1. Получить информированное согласие родителей или законных опекунов детей в возрасте 3-7 лет с диагнозом расстройство аутистического спектра (РАС).
    2. Классифицируйте пациентов по уровням тяжести от 1 до 3 в соответствии с диагностическими критериями, изложенными в американском стандарте DSM-5 для аутизма (шаг 1.3.3).
    3. Соберите образцы сыворотки крови у участников. Убедитесь, что все образцы обработаны в течение четырех часов после забора крови, чтобы предотвратить расщепление белка. Во время обработки держите образцы на льду.
  2. Удаление белков с высоким содержанием
    1. Используйте коммерческий набор для истощения белков с высоким содержанием из 60 мкл сыворотки на образец, следуя инструкциям производителя. Вкратце, уравновесьте истощенную колонну связывающим буфером, загрузите образец сыворотки и дайте ему пройти через колонку под действием гравитационного потока. Соберите проток, в котором содержится малообильная белковая фракция.
    2. Измерьте общую концентрацию белка с помощью анализа BCA. Нормализовать все образцы до конечной концентрации 0,5-1,0 мкг/мкл перед разложением в растворе. Убедитесь, что каждый образец содержит не менее 100 μг белка для последующего анализа.
  3. Переваривание белка
    Примечание: Расщепление белка проводили с использованием метода FASP, описанного Wisniewski et al.24.
    1. Добавьте моющее средство, дитиотреитол (DTT) и йодоацетамид (IAA) в буфер UA (буфер мочевины) для блокирования восстановленного цистеина.
    2. Переварить белковую суспензию с трипсином в соотношении 50:1 в течение ночи при 37 °C.
  4. Обессоливание пептидов, очистка и обратнофазное фракционирование с высоким pH
    1. Центрифугируйте пептидные смеси при давлении 16 000 × г в течение 15 мин при °C для удаления нерастворимых загрязнений.
    2. Перенесите надосадочную жидкость (содержащую переваренные пептиды) в новую микроцентрифужную пробирку с низким уровнем связывания, чтобы свести к минимуму потери адсорбции.
    3. . Подготовьте микроколонки C18 (собственные в упаковке со смолой C18) путем предварительного кондиционирования 100% метанолом (20 μл) и уравновешивания 0,1% (v/v) трифторуксусной кислоты (TFA) в воде (буфер A; 20 μL).
    4. Загрузите образец пептида в микроколонку. Промойте колонку 20 мкл буфера А для удаления солей, моющих средств и непептидных загрязнений.
    5. Элюированные очищенные пептиды с 20 мкл 80% ацетонитрила, содержащего 0,1% ТЖК.
    6. Высушите элюированные пептиды под вакуумом с помощью центробежного вакуумного концентратора. Храните высушенные пептиды при температуре -8 °C до дальнейшего использования.
    7. Восстановите высушенные пептиды в 0,1% муравьиной кислоте перед анализом ЖХ-МС/МС.
    8. 2.4.8.Количественно определить концентрацию пептида путем измерения абсорбции на длине волны 280 нм (наружный диаметр280) с помощью спектрофотометра с учетом вклада триптофана и остатков тирозина для точного количественного определения.
      Для фракционирования пептидных смесей с использованием обратимых фаз ВЭЖХ с высоким pH используют колонку C18 (3,5 мкм, 2,1 x 150 мм) на системе ВЭЖХ с расходом 0,3 мл/мин, подвижная фаза А: 10 мМ формиат аммония в воде, pH 10 (скорректированный с помощью гидроксида аммония), подвижная фаза B: 10 мМ формиат аммония в 90% ацетонитриле, pH 10. Выполните градиентное элюирование, чтобы собрать 60 фракций на образец в течение ~60 минут.
    9. Объедините каждую третью фракцию, чтобы уменьшить избыточность, в результате чего получится 20 объединенных фракций на образец. Высушите каждую объединенную фракцию под вакуумом для последующего анализа.
      ПРИМЕЧАНИЕ: Полученные пептидные фракции теперь готовы к анализу нано-ЖХ-МС/МС.

3. Подача заявки на масс-спектрометрический анализ DIA

  1. Масс-спектрометрический анализ DIA
    1. Спайкнуть пептид Data-dependent Acquisition (DDA) из фракции HPRP стандартными пептидами iRT и разделить их с помощью реверсионной высокоэффективной жидкостной хроматографии (RP-HPLC) в системе нано-ВЭЖХ с колонкой (75 мкм x 150 мм; 2 мкм гранул C18, 120 Å) со скоростью потока 300 нл/мин с подвижной фазой А: 0,1% муравьиной кислоты в воде, подвижная фаза В: 0,1% муравьиной кислоты в 95% ацетонитриле.
    2. Элюируют пептиды в течение 60 мин с линейным градиентом буфера В, заданным следующим образом: 0 - 2 мин, линейным градиентом от 2% до 5% буфера В; 2 - 42 мин, линейный градиент от 5% до 20% буфера В; 42 - 50 мин, линейный градиент от 20% до 35% буфера В; 50 - 52 мин, линейный градиент от 35% до 90% буфера В; 52 - 60 мин, буфер B поддерживается на уровне 90%.
    3. Проанализируйте элюированные пептиды на эталонном масс-спектрометре. Получение данных МС с помощью метода top20, зависящего от данных, динамического выбора наиболее распространенных ионов-предшественников из сканирования (350 - 1500 м/з) для фрагментации HCD.
    4. Запустите прибор с включенным режимом распознавания пептидов . Используйте массу замка 445.120025 Да в качестве внутреннего стандарта для калибровки массы. Получите полные MS-сканы с разрешением 70 000 при m/z 200 и 17 500 при m/z 200 для MS/MS сканов. Установите максимальное время инжекции равным 50 мс для MS и 30 мс для MS/MS, нормализованную энергию столкновения равной 28, окно изоляции равной 1,6 Th, а продолжительность динамического исключения равной 30 с.
  2. Анализ ЖХ-МС/МС для независимого сбора данных (DIA)
    1. Вносите пептиды из каждого образца в iRT поровну и по отдельности.
    2. Выполнение ЖХ-МС/МС на квадрупольном масс-спектрометре в сочетании с системой нано-ВЭЖХ. Установите условие LC так же, как и для метода DDA, описанного выше. Сканирование в диапазоне от 400 до 1 200 м/з с разрешением 60 000 с целевым значением АРУ 3E6 и временем впрыска 30 мс. Получение сканов DIA MS/MS с разрешением 15 000 с окном изоляции 20 м/з и с целевым значением AGC 1E6 и временем инжекции 50 мс. Установите нормализованную энергию столкновения равной 30.
    3. Записывайте спектры полных МС и DIA сканов в профилях и центроидах соответственно.
  3. Поиск в базе данных последовательностей
    1. Анализ данных DDA MS с помощью программного обеспечения DIA2.
    2. Поиск данных о РС в базе данных человека UniProtKB (всего 186 532 записи, загружено 10/2019), содержащей белки, состоящие из 11 последовательностей пептидов iRT.
    3. Выберите трипсин в качестве фермента пищеварения. Определите максимальное значение двух пропущенных сайтов расщепления и допуск по массе 4,5 ppm для ионов-предшественников и 20 ppm для ионов фрагментов для поиска в базе данных. Определите карбамидометилирование цистеинов как фиксированную модификацию и ацетилирование N-концевого белка и окисление метионина как вариабельные модификации для поиска в базе данных.
    4. Отфильтруйте результаты поиска в базе данных и экспортируйте их с коэффициентом ложных открытий (FDR) <1% на уровнях пептидного спектра и белка соответственно.
  4. Выполнение обработки необработанных данных
    1. Анализ данных DIA MS были проанализированы с помощью программного обеспечения DIA [34, 35] для генерации спектральной библиотеки из результатов поиска. Используйте настройки по умолчанию для поиска и динамический iRT для прогнозирования времени хранения. Убедитесь, что коррекция помех для сканирования MS/MS включена.
    2. Экспортируйте результаты с <1% FDR на пептидном уровне.

4. Дифференциальный анализ белков

  1. Проведите проверку гипотез с помощью t-критерия Стьюдента в сочетании с изменением складки (FC) на http://www.omickits.com/open/tooldetail?id=70.
    1. Войдите в облачную платформу и перейдите к инструменту анализа проверки гипотез . Загрузите файл с предварительно обработанными данными количественного определения белка (например, в формате CSV или TXT).
    2. В настройках параметра в качестве статистического метода выберите t-критерий Стьюдента и порог значимости при p-значении < 0,05. Определите порог изменения сгиба как FC > 1,5 или FC < 1/1,5. Нажмите Run Analysis и дождитесь генерации результатов.
    3. Загрузите выходной файл, содержащий p-значения, log2(FC) и статус значимости для каждого белка.
      ПРИМЕЧАНИЕ: Этот двухкритериальный подход уравновешивает статистическую значимость с биологической значимостью, обеспечивая надежную идентификацию дифференциально экспрессируемых белков (ДЭП).

5. Анализ сигнального тракта

  1. Визуализация графика вулкана
    1. Перейдите к инструменту в http://www.omickits.com/open/tooldetail?id=63 а затем перейдите на страницу инструмента построения графика вулкана .
      1. Загрузите файл с результатами анализа DEP из раздела 4.
      2. Настройка параметра визуализации: X-axis: log2(Fold Change) - указывает направление изменения; Ось Y: -log10(p-значение) - отражает статистическую значимость; Цветовое кодирование: Красный : значительно повышенная регуляция белков (p < 0,05 и FC > 1,5); Синий : значительно сниженная регуляция белков (p < 0,05 и FC < 0,667); Грей : незначимые белки (p ≥ 0,05 или 1/1,5 ≤ FC ≤ 1,5).
      3. Нажмите «Создать изображение» и загрузите изображение с высоким разрешением (формат PDF/SVG) для публикации.
  2. Тепловая карта иерархической кластеризации
    1. Перейдите к инструменту на http://www.omickits.com/open/tooldetail?id=17
      1. Получите доступ к инструменту тепловой карты кластеризации .
      2. Загрузите отфильтрованную матрицу выражений DEP.
      3. Установите следующие параметры: Метод нормализации: Z-оценка по строкам для устранения различий в масштабе; Метрика расстояния: евклидово расстояние; Метод кластеризации: полная связка иерархической кластеризации; Необязательно: включите кластеризацию столбцов и/или строк в зависимости от группировки выборки.
      4. Нажмите кнопку Выполнить, чтобы создать тепловую карту.
      5. Загрузите и сохраните тепловую карту в виде готового к публикации изображения.
        ПРИМЕЧАНИЕ: Тепловая карта визуально представляет сходство и расхождение паттернов экспрессии белка в образцах.
  3. Анализ функционального аннотирования и обогащения GO
    1. Установите и загрузите необходимые пакеты R:
      library(clusterProfiler)
      библиотека(орг. Hs.eg.db)

      библиотека(ggplot2)
    2. Преобразуйте идентификаторы белков (например, Uniprot или символы генов) в идентификаторы Entrez:
      entrez_ids <- bitr(diff_proteins, fromType = "UNIPROT", toType = "ENTREZID", OrgDb = org. Hs.eg.db)
    3. Выполните анализ обогащения ГО:
      go_enrich <- enrichGO(gene = entrez_ids$ENTREZID, OrgDb = org. Hs.eg.db, keyType = "ENTREZID", ont = "BP")
    4. Визуализируйте результаты с помощью точечных диаграмм:
      1. dotplot(go_enrich, showCategory = 20)
        Формула:
        Коэффициент обогащения = (a/b) / (c/d)
        Где:
        a = количество DEP, аннотированных к термину;
        b = общее число ДЭП;
        c = количество фоновых белков, аннотированных к термину;
        d = общее количество фоновых белков.
  4. Аннотирование путей KEGG и анализ обогащения
    1. Проведите анализ обогащения KEGG:
      kegg_enrich <- enrichKEGG(gene = entrez_ids$ENTREZID, organism = "имеет")
    2. Визуализируйте результаты пути KEGG:
      barplot(kegg_enrich, showCategory = 20)
    3. Настройте графики с помощью ggplot2 для форматирования публикации.

6. Первичный скрининг белков с помощью анализа ROC-кривой

  1. Подготовка данных: Загрузите набор данных по протеомике, содержащий все дифференциально экспрессируемые белки (ДЭП), идентифицированные в группах расстройства аутистического спектра (РАС) и контрольных группах. Убедитесь, что набор данных включает значения экспрессии белка для обеих групп с четкими метками, указывающими на РАС и контрольные образцы.
  2. Выполнение анализа ROC-кривой.
    1. Используйте пакет pROC в R для проведения анализа кривой рабочих характеристик приемника (ROC) для каждого белка.
    2. Оцените способность каждого белка различать группы с РАС и контрольную группу, рассчитав площадь под кривой (AUC).
      AUC = 0,5: Отсутствие дискриминации (эквивалентно случайности).
      0,7 ≤ AUC < 0,8: Приемлемая дискриминация.
      0,8 ≤ AUC < 0,9: Отличная дискриминация.
      AUC ≥ 0,9: Выдающаяся дискриминация.
      ПРИМЕЧАНИЕ: AUC представляет собой вероятность того, что случайно выбранный индивидуум из группы РАС имеет более высокий уровень белка, чем случайно выбранный индивидуум из контрольной группы. Более высокая AUC указывает на лучшую диагностическую эффективность, при этом значения выше 0,8 обычно считаются клинически значимыми в исследованиях биомаркеров.
    3. Запишите значения AUC для всех белков.
  3. Выберите биомаркеры-кандидаты.
    1. Определите белки с AUC более 0,7 в качестве биомаркеров-кандидатов.
    2. Экспортируйте список биомаркеров-кандидатов для дальнейшего анализа.
  4. Визуализируйте результаты.
    1. Используйте пакет ggplot2 в R для создания визуализаций кривых ROC для белков с наибольшей производительностью.
    2. Для наглядности включите значения AUC в легенды графиков.

7. Вторичный скрининг с помощью Random Forest

  1. Подготовьте входные данные.
    1. Используйте список биомаркеров-кандидатов, полученный в результате анализа ROC, в качестве входных данных для анализа случайного леса.
    2. Убедитесь, что набор данных отформатирован соответствующим образом, строки представляют выборки, а столбцы — значения экспрессии белка.
  2. Обучите модель Random Forest.
    1. Примените алгоритм случайного леса с помощью пакета randomForest в R.
    2. Установите количество деревьев (ntree) равным 500 и количество переменных, случайно выбранных при каждом разбиении (mtry), в квадратный корень из общего числа признаков.
    3. Оцените важность функции с помощью метрики MeanDecreaseAccuracy, которая измеряет снижение точности модели при удалении определенного элемента.
    4. Обучите модель случайного леса с помощью пакета randomForest в R:
      R. библиотека(randomForest)
      # Пример: прогнозирование группы (например, РАС против контроля) с использованием уровня белка

      rf_model <- randomForest(x = protein_data,
      y = as.factor(группа),
      importance = TRUE, # Требуется для вычисления важности функции
      ntree = 500) # Количество деревьев
    5. Извлеките метрики важности функций с помощью функции importance():
      Р. importance_scores <- важность(rf_model)
    6. Извлекем значения MeanDecreaseAccuracy и отсортируем их в порядке убывания:
      R. mean_dec_acc <- importance_scores[ , "MeanDecreaseAccuracy"]
      importance_rank <- sort(mean_dec_acc, убывающий = TRUE)
    7. Визуализируйте важность функций с помощью встроенной функции varImpPlot():
      R. varImpPlot(rf_model, main = "Важность функции (среднее снижение точности)")
      ПРИМЕЧАНИЕ: Метрика MeanDecreaseAccuracy показывает, насколько важен каждый признак для прогнозной производительности модели. Значительное снижение точности при удалении указывает на высокую важность. Этот подход особенно полезен для обнаружения биомаркеров, поскольку он помогает определить приоритеты белков или генов с наибольшей дискриминирующей способностью между группами.
    8. Экспорт оценок важности для отчетности или последующего анализа:
      R. importance_table <- data.frame(
      Функция = имена(importance_rank),
      MeanDecreaseAccuracy = importance_rank
      )
      write.csv(importance_table, "feature_importance.csv", row.names = FALSE)
    9. Ранжируйте белки на основе их оценки MeanDecreaseAccuracy.
    10. Выберите 15 белков с самыми высокими показателями MeanDecreaseAccuracy в качестве наиболее значимых признаков для последующего моделирования.
    11. Экспортируйте список этих белков для дальнейшей проверки.
      ПРИМЕЧАНИЕ: Белки с низкими значениями MeanDecreaseAccuracy могут оказывать минимальное влияние на производительность модели при удалении.
    12. Подчеркните биологическую значимость выбранных белков, особенно тех, которые связаны с иммунными функциями или путями, участвующими в развитии РАС.

8. Объедините результаты для окончательного выбора биомаркеров.

ПРИМЕЧАНИЕ: Убедитесь, что R установлен со следующими пакетами: pROC, randomForest и ggplot2. Убедитесь, что набор данных протеомики предварительно обработан и нормализован перед анализом. Сохраняйте списки биомаркеров-кандидатов и графики визуализации в виде отдельных файлов для справки.

  1. Интегрируйте полученные данные.
    1. Сопоставьте результаты анализа ROC и случайного скрининга леса для выявления перекрывающихся белков.
    2. Отдавайте предпочтение белкам, которые фигурируют в обоих анализах в качестве высоконадежных биомаркеров-кандидатов.
    3. Выполните дополнительные шаги проверки, такие как перекрестная проверка по принципу «не допускай одного исключения» (LOOCV), чтобы подтвердить надежность выбранных биомаркеров.
    4. Используйте модели логистической регрессии для оценки прогностической точности объединенного набора биомаркеров.
    5. Создавайте ROC-кривые и графики точности-полноты для окончательного набора биомаркеров с помощью пакета ggplot2.
    6. Включите такие метрики, как AUC и значения точности-полноты, чтобы продемонстрировать диагностический потенциал выбранных биомаркеров.

9. Двунаправленный выбор функций

  1. Подготовьте данные и определите модель.
    1. Загрузите набор данных, содержащий значения экспрессии белка и соответствующие метки (например, ASD против контрольной). Убедитесь, что набор данных предварительно обработан и нормализован.
    2. Определение исходной модели: Используйте для классификации обобщенную линейную модель (GLM) с биномиальным семейством.
    3. Используйте AIC в качестве метрики оценки для сравнения моделей во время выбора функции.
  2. Выполнение прямого выбора элемента.
    1. Начните с пустой модели, содержащей только член пересечения.
    2. Добавляйте по одному объекту за раз в зависимости от наибольшего снижения AIC.
    3. Записывайте значение AIC после каждого сложения. Остановитесь, когда дальнейшего снижения AIC не наблюдается.
  3. Выполнение обратного выбора элемента.
    1. Обучайте модель, используя все доступные функции.
    2. Удаляйте по одному объекту за раз в зависимости от наименьшего увеличения AIC.
    3. Записывайте значение AIC после каждого удаления. Остановитесь, когда дальнейшего снижения AIC не наблюдается.
    4. Комбинируйте шаги вперед и назад.
  4. Чередуйте прямое и обратное выделение.
    1. Выполните один раунд прямого выбора элемента, за которым сразу же следует один раунд обратного выбора элемента. Повторяйте этот процесс до тех пор, пока в AIC не будет замечено больше улучшений.
    2. Альтернативный подход: начните с выбора объектов в обратном направлении, а затем выполните выбор объектов в прямом направлении. Оцените эффект от добавления ранее удаленных элементов обратно в модель.
  5. Доработайте выбранные функции.
    1. Экспортируйте окончательный список выбранных объектов и соответствующие им коэффициенты (дополнительный рисунок S1).

10. Перекрестная валидация двунаправленного выбора признаков с использованием логистической регрессии с методом «не выходить»

ПРИМЕЧАНИЕ: Убедитесь, что R установлен со следующими пакетами: caret, pROC и ggplot2. Набор данных протеомики должен быть предварительно обработан и нормализован перед анализом. Сохраните матрицу несоответствий, ROC-кривую и сводку модели в виде отдельных файлов для справки.

  1. Подготовьте данные и определите модель.
    1. Загрузите набор данных, содержащий значения экспрессии белка и соответствующие метки (например, ASD или контроль) из файла GLMSTEP/bothFitModel.txt. Убедитесь, что набор данных предварительно обработан и нормализован.
    2. Определите исходную модель с помощью обобщенной линейной модели (GLM) с биномиальным семейством для классификации.
    3. Используйте точность и коэффициент Каппа в качестве метрик оценки для оценки производительности модели во время перекрестной проверки.
  2. Выполните перекрестную проверку.
    1. Инициализируйте перекрестную проверку с помощью пакета caret в R, чтобы реализовать перекрестную проверку (LOOCV).
    2. Подгонка модели логистической регрессии с помощью восьми выбранных признаков.
    3. Запишите точность и коэффициент Каппа для каждой итерации перекрестной проверки.
  3. Проанализируйте результаты перекрестной проверки.
    1. Подведите итоги.
      ПРИМЕЧАНИЕ: Результаты процесса LOOCV будут выглядеть следующим образом (как и в этом исследовании): Обобщенная линейная модель, 169 выборок, 8 предикторов, 2 класса: 'A', 'B', Перевыборка: Перекрестная валидация без исключения, Сводка размеров выборки: 168, 168, 168, 168, 168, 168, ... , Результаты повторной выборки: Точность Kappa 0.9526627 0.9024531.
    2. Интерпретируйте метрики.
      ПРИМЕЧАНИЕ: Здесь модель достигла точности 0,9527 и коэффициента Каппа 0,9025, что указывает на отличное соответствие между прогнозируемыми и наблюдаемыми результатами.
      1. Посмотрите на коэффициент Каппа, чтобы оценить предсказательную силу модели. Коэффициент Каппы колеблется от -1 до 1, где 0 указывает на случайное предсказание, а 1 — на полное согласие.
        ПРИМЕЧАНИЕ: В данном исследовании значение Каппа, равное 0,9025, отражает сильную предсказательную силу модели.
  4. Оцените коэффициенты модели.
    1. Изучите коэффициенты модели логистической регрессии, чтобы понять вклад каждого признака. Оцените нулевое отклонение, остаточное отклонение и AIC, чтобы подтвердить соответствие модели.
      ПРИМЕЧАНИЕ: Например, в этом исследовании мы получили нулевое отклонение: 2.2928e+02 на 168 степенях свободы, остаточное отклонение: 2.2378e-07 на 160 степенях свободы, AIC: 18, количество итераций по шкале Фишера: 25.
  5. Визуализируйте результаты.
    1. Создайте матрицу несоответствий, чтобы визуализировать прогностическую эффективность модели.
    2. Постройте кривую рабочих характеристик приемника (ROC) для оценки классификационных характеристик модели.
    3. Интерпретируем результат. Вычислите площадь под кривой (AUC) для получения классификационного индекса производительности модели.
      ПРИМЕЧАНИЕ: Кривая ROC демонстрирует компромисс между истинно положительным и ложноположительным коэффициентом. Площадь под кривой (AUC) должна быть близка к 1, что указывает на отличные показатели классификации. Кривая ROC отражает изменения коэффициента истинно положительных и ложных срабатываний модели при различных пороговых значениях. Чем больше значение AUC, тем выше производительность модели.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

В исследование были включены 99 детей с РАС и 70 детей из контрольной группы соответствующего возраста (3-7 лет) со сбалансированным распределением полов (Дополнительная таблица S2). Сыворотку собирали после ночного голодания с использованием стандартизированных протоколов: кровь набирали в пробирки-сепараторы сыворотки, давали ей свертываться при комнатной температуре в течение 30 минут, затем центрифугировали при 1500 × г в течение 10 минут при 4 °C. Надосадоч...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Протокол, описанный в этой рукописи, описывает комплексный подход к идентификации иммунозависимых молекулярных биомаркеров при расстройствах аутистического спектра (РАС) с использованием масс-спектрометрии и методов машинного обучения, независимого от сбора данных (DIA). Важные шаги в рамках протокола обеспечивают надежные и воспроизводимые результаты, а также выделяют области, в которых могут потребоваться модификации или устранение неполадок (Таблица 2).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

У авторов нет конфликта интересов, о котором можно было бы заявить.

Благодарности

Спасибо всем сотрудникам центральной лаборатории и тем, кто помогал в этом проекте.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
<сильно>Реактивы и химикатыАцетонитрил (класс ВЭЖХ)Научный центр ФишераА18-50
<сильно>Реактивы и химикатыБикарбонат аммония (NH? HCO?)Сигма-Олдрич38939
<сильно>Реактивы и химикатыФормиат аммонияСигма-Олдрич90265
<сильно>Реактивы и химикатыБычий сывороточный альбумин (BSA)Thermo Fisher Scientific23212
<сильно>Реактивы и химикатыДитиотреитол (DTT)Сигма-Олдрич43815
<сильно>Реактивы и химикатыМуравьиная кислота (0,1%)Thermo Fisher Scientific28905
<сильно>Реактивы и химикатыЙодоацетамид (ИУК)Сигма-ОлдричИ1149
<сильно>Реактивы и химикатыМетанол (марка ВЭЖХ)Научный центр ФишераА452-4
<сильно>Реактивы и химикатыТрифторуксусная кислота (ТЖК)Сигма-ОлдричТ6508
<сильно>Реактивы и химикатыМочевинаСигма-ОлдричУ5378
<сильно>наборы и специализированные реагентыНабор для анализа белка BCAThermo Fisher Scientific23227
<сильно>наборы и специализированные реагентыПатроны C18 Sep-PakВодыWAT023590
<сильно>наборы и специализированные реагентыC18 StageTips (домашний)3M Empore™
<сильно>наборы и специализированные реагентыНабор для истощения белка с высоким содержанием белкаМиллипора Сигма122642
<сильно>наборы и специализированные реагентыСтандартные пептиды iRTБиогносис АГ
<сильно>наборы и специализированные реагентыНабор для лизоцима ИФАУхань Файн Биотек Ко.ООО
<сильно>наборы и специализированные реагентыСмесь ферментов трипсина/LysCКомпания PromegaВ5071
<сильный>ОборудованиеЦентрифугаЭппендорф5430Р
<сильный>ОборудованиеСистема Easy-nLC 1200Thermo Fisher Scientific
<сильный>ОборудованиеСпектрофотометр Nanodrop OneThermo Fisher ScientificНД-ОДИН-В
<сильный>ОборудованиеQ Эксактивный масс-спектрометр HF-XThermo Fisher Scientific
<сильный>ОборудованиеКонцентратор SpeedVacThermo Fisher ScientificSPD131DDA
<сильный>ОборудованиеРоторная центрифуга с победным ковшомРазличный
<сильный>ОборудованиеУотерс XBridge BEH130 КолоннаВодыC18, 3.5 μ м, в 2,1 раза; 150 мм
<сильный>ОборудованиеСистема ВЭЖХ Agilent 1260Agilent1260 Бесконечность II
программное обеспечение и онлайн-инструментыБиопроводник (пакеты R)bioconductor.org
программное обеспечение и онлайн-инструментыкарет (пакет R)КРАНcaret_6.0-93
программное обеспечение и онлайн-инструментыclusterProfiler (пакет R)Биопроводник4.0.5
программное обеспечение и онлайн-инструментыДИА-ННПрограммное обеспечение DIA-NNВерсия 1.8
программное обеспечение и онлайн-инструментыggplot2 (пакет R)КРАН3.4.0
программное обеспечение и онлайн-инструментыМаксКвантИнститут Макса Планка1.6.17
программное обеспечение и онлайн-инструментыomickits.comОблачная платформа OmiKitshttp://www.omickits.com
программное обеспечение и онлайн-инструментыpROC (пакет R)КРАН1.18.0
программное обеспечение и онлайн-инструментыrandomForest (пакет R)КРАН4.7-1.1
программное обеспечение и онлайн-инструментыСпектронавт Pulsar XБиогносис АГ17
программное обеспечение и онлайн-инструментыЧеловеческая база данных UniProtKBuniprot.orgРелиз 2019_10
<прочные>другие материалыМикроцентрифужные пробирки с низким уровнем связыванияЭппендорф30120094
<прочные>другие материалыПробирки для сепаратора сыворотки (SST)BD Biosciences367988
<прочные>другие материалы3M Empore™ Диски C183 МИН.

Ссылки

  1. Ophir, Y., Rosenberg, H., Tikochinski, R., Dalyot, S., Lipshits-Braziler, Y. Screen time and autism spectrum disorder: A systematic review and meta-analysis. JAMA Netw Open. 6 (12), e2346775(2023).
  2. He, S., Zhou, F., Tian, G., Cui, Y., Yan, Y. Effect of anesthesia during pregnancy, delivery, and childhood on autism spectrum disorder: A systematic review and meta-analysis. J Autism Dev Disord. 54 (12), 4540-4554 (2024).
  3. Alkhonezan, S. M., Alkhonezan, M. M., Alshayea, Y., Bukhari, H., Almhizai, R. Factors influencing the lives of parents of children with autism spectrum disorder in saudi arabia: A comprehensive review. Cureus. 15 (11), e48325(2023).
  4. Larson, C., Thomas, H. R., Crutcher, J., Stevens, M. C., Eigsti, I. M. Language networks in autism spectrum disorder: A systematic review of connectivity-based fmri studies. Rev J Autism Dev Disord. 12 (1), 110-137 (2025).
  5. Kodak, T., Bergmann, S. Autism spectrum disorder: Characteristics, associated behaviors, and early intervention. Pediatr Clin North Am. 67 (3), 525-535 (2020).
  6. Zwaigenbaum, L., et al. Early intervention for children with autism spectrum disorder under 3 years of age: Recommendations for practice and research. Pediatrics. 136 (Suppl 1), S60-S81 (2015).
  7. Whitehouse, A. J. O., et al. Effect of preemptive intervention on developmental outcomes among infants showing early signs of autism: A randomized clinical trial of outcomes to diagnosis. JAMA Pediatr. 175 (11), e213298(2021).
  8. Ngounou Wetie, A. G., et al. A pilot proteomic analysis of salivary biomarkers in autism spectrum disorder. Autism Res. 8 (3), 338-350 (2015).
  9. Mota, F. S. B., et al. Potential protein markers in children with autistic spectrum disorder (asd) revealed by salivary proteomics. Int J Biol Macromol. 199, 243-251 (2022).
  10. Corbett, B. A., et al. A proteomic study of serum from children with autism showing differential expression of apolipoproteins and complement proteins. Mol Psychiatry. 12 (3), 292-306 (2007).
  11. Hu, E., et al. Data independent acquisition proteomics and machine learning reveals that proteins associated with immunity are potential molecular markers for early diagnosis of autism. Clin Chim Acta. 573, 120238(2025).
  12. Shen, L., et al. Biomarkers in autism spectrum disorders: Current progress. Clin Chim Acta. 502, 41-54 (2020).
  13. Yap, C. X., et al. Autism-related dietary preferences mediate autism-gut microbiome associations. Cell. 184 (24), 5916-5931.e17 (2021).
  14. Zhang, H., et al. The use of data independent acquisition based proteomic analysis and machine learning to reveal potential biomarkers for autism spectrum disorder. J Proteomics. 278, 104872(2023).
  15. Francis, K., et al. Brain-derived neurotrophic factor (bdnf) in children with asd and their parents: A 3-year follow-up. Acta Psychiatr Scand. 137 (5), 433-441 (2018).
  16. Bjorklund, G., et al. The impact of glutathione metabolism in autism spectrum disorder. Pharmacol Res. 166, 105437(2021).
  17. Bao, X. H., et al. Olink proteomics profiling platform reveals non-invasive inflammatory related protein biomarkers in autism spectrum disorder. Front Mol Neurosci. 16, 1185021(2023).
  18. Ngounou Wetie, A. G., et al. Comparative two-dimensional polyacrylamide gel electrophoresis of the salivary proteome of children with autism spectrum disorder. J Cell Mol Med. 19 (11), 2664-2678 (2015).
  19. Suganya, V., Geetha, A., Sujatha, S. Urine proteome analysis to evaluate protein biomarkers in children with autism. Clin Chim Acta. 450, 210-219 (2015).
  20. Shen, L., et al. Itraq-based proteomic analysis reveals protein profile in plasma from children with autism. Proteomics Clin Appl. 12 (3), e1700085(2018).
  21. Shen, L., et al. Proteomics study of peripheral blood mononuclear cells (pbmcs) in autistic children. Front Cell Neurosci. 13, 105(2019).
  22. Mesleh, A., et al. Blood proteomics analysis reveals potential biomarkers and convergent dysregulated pathways in autism spectrum disorder: A pilot study. Int J Mol Sci. 24 (8), 7443(2023).
  23. Yang, J., et al. Association between plasma proteome and childhood neurodevelopmental disorders: A two-sample mendelian randomization analysis. EBioMedicine. 78, 103948(2022).
  24. Wisniewski, J. R., Zougman, A., Nagaraj, N., Mann, M. Universal sample preparation method for proteome analysis. Nat Methods. 6 (5), 359-362 (2009).
  25. Wu, Y., et al. Quantitative proteomics analysis of serum and urine with dia mass spectrometry reveals biomarkers for pediatric obstructive sleep apnea. Arch Bronconeumol. 61 (2), 67-75 (2025).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Теги