Методическая статья

Протокол NetDecoder для построения контекстно-специфических сетей взаимодействия белков на основе транскриптомических данных с использованием моделирования информационных потоков

DOI:

10.3791/70869

31 июля 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Здесь мы представляем протокол для использования NetDecoder — инструмента моделирования сетей — для построения контекстно-специфических сетей взаимодействия белков и построения моделей полезности генов (GUM). Используя данные транскриптомики в сочетании с кураторскими сетями взаимодействия белков и белков (PPI), NetDecoder позволяет выявлять ключевые цели и подсети.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Дифференциальный анализ экспрессии — это широко используемая техника для определения потенциальных терапевтических целей, но он упускает из виду сложность генных сетей на разных биологических путях. Часто высокоэкспрессированные гены не обязательно объясняют свойства биологического фенотипа. NetDecoder — инструмент сетевой биологии, интегрирующий транскриптомные данные с сетями взаимодействия белков и белков (PPI) для моделирования контекстно-специфического потока информации, полезности генов, ключевых границ, а также дифференциально используемых генных сетей, который был разработан для решения этого ограничения анализа дифференциальной экспрессии.

Этот протокол является удобным для начинающих, пошаговое руководство по использованию NetDecoder с комплексными рекомендациями, охватывающими предварительную обработку данных, выполнение NetDecoder и анализ выходных данных. Рабочий процесс включает конфигурацию программного обеспечения, построение сетей и анализ моделирования на основе потоков для количественной оценки различий между генами (узлом) и взаимодействием ген-ген (на уровне периферии) между биологическими условиями. Полученные результаты включают ключевые мишени и маршрутизаторы, дифференциальные подсети потоков и распределения крайних потоков, что позволяет идентифицировать ключевые регуляторные гены и пути, связанные с конкретными биологическими состояниями. После выполнения описанных шагов исследователи смогут провести независимые исследования для выявления фенотипического потока генов между фенотипами с использованием транскриптомических данных и тщательных сетей ИПП.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Выбор генов и связанных с ними путей для терапевтических исследований часто определяется дифференциальным анализомэкспрессии 1. Этот метод анализа эффективен для определения различий экспрессии генов между двумя или более состояниями. Однако гены функционируют в сложных взаимосвязанных биологических сетях, то есть экспрессия отдельных генов не полностью отражает взаимодействие генов в сети и их гено-генныевзаимоотношения 2. Методы сетевого распространения интегрируют экспрессию генов с сетями взаимодействия для выявления биологически важных генов, которые могут быть упущены только при дифференциальнойэкспрессии 3. Современные подходы не количественно определяют функциональную важность генов и то, как биологическая информация перераспределяется в сетях взаимодействия белков и белков (PPI) между биологическими условиями. Поэтому был необходим метод моделирования поведения сетей, специфичных для условий, и количественной оценки изменений информационного потока между биологическими системами. Чтобы объяснить, как гены взаимодействуют в более широкой биологической сети, была разработана платформа сетевой биологии NetDecoder для выявления генов с наибольшей разницей в информационных потоках между условиями. NetDecoder использует алгоритм потока, управляемый процессом, для трансляции существующих знаний о человеческой сети PPI в сочетании с данными секвенирования РНК с целью построения модели взаимодействий, управляемых потокамиинформации 4.

Используя данные информационных потоков для фенотипических сетей, можно разработать модель полезности генов (GUM)5, чтобы определить гены с высоким информационным потоком как обладающие наибольшей общей полезностью генов внутри сети, независимо от их дифференциальных значений экспрессии. Этот подход поддерживает более эффективные стратегии приоритизации и идентификацию целей, предоставляя инсайты, которые традиционный анализ часто упускает. В отличие от традиционных методов дифференциальной экспрессии или корреляционных сетевых методов, NetDecoder количественно оценивает как генные (на уровне узла), так и изменения взаимодействия (на уровне краёв) в потоке информации, что позволяет идентифицировать функционально важные гены даже при отсутствии крупных измененийэкспрессии 4,5. NetDecoder широко применим к массовым наборам данных секвенирования РНК, которые включают сравнительный анализ двух биологических условий, позволяя выявлять изменения в потоке информации и организации сети. Хотя NetDecoder поддерживает интеграцию других наборов данных омиксов, включая протеомику и эпигеномику, настоящий протокол конкретно демонстрирует рабочий процесс с использованием транскриптомических данных. В этих приложениях пользователи могут определять исходные гены на основе белков или эпигенетически регулируемых генов, что позволяет инициировать анализ потоков информации на основе этих молекулярных признаков. Эта гибкость позволяет включать мультиомические данные в сетевые анализы и способствует обнаружению кроссмодальных регуляторных механизмов, лежащих в основе фенотипических различий.

Распространённые дизайны исследований включают бинарные сравнения, включая, но не ограничиваясь, заболеваниями и здоровыми состояниями, реагирующими на лечение и нереагирующими, медикаментозными методами, экспериментами с нокдауном или нокаутированием против контрольных экспериментов, а также анализом переходов в состоянии развития или клеток. Цель этого протокола — проиллюстрировать воспроизводимую основу для применения NetDecoder для выявления генов с изменённым влиянием сети в биологических условиях. Это достигается с помощью простых для понимания шагов для настройки и запуска NetDecoder, а также примеров базовых методов устранения неполадок, а также методы интерпретации результатов изложены в протоколе.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом исследовании использовались общедоступные наборы данных секвенирования РНК и не включали непосредственно человека или животных. Поэтому одобрение институционального контрольного совета и информированное согласие не требовались.

ПРИМЕЧАНИЕ: NetDecoder требует следующих входных файлов: нормализованная экспрессия генов в двух определённых биологических условиях; файл метаданных, описывающий биологические условия; список исходных генов для построения и моделирования сетей; сеть взаимодействия белков и белков (PPI) из общественного достояния; и сеть с взвешенным по краям (EWN), созданная для каждого биологического состояния.

1. Подготовка данных

  1. Получить данные и метаданные массового секвенирования РНК
    1. Скачайте данные секвенирования РНК (матрица исходных счетов экспрессии генов и названия образцов) и соответствующие метаданные (названия образцов, состояния и т.д.) из публичного репозитория, такого как Gene Expression Omnibus (GEO), либо используйте лабораторно сгенерированные экспериментальные наборы данных. Обычно это матрица, в которой строки соответствуют названиям генов, а столбцы — названиям выборок.
      ПРИМЕЧАНИЕ: Пример набора данных, использованный для демонстрации этого протокола, был получен из репозитория National Omics Data Encyclopedia (NODE) (база данных BioSino), входящего в OEP0011056. Пользователи могут заменить свои собственные массовые наборы данных секвенирования РНК.
    2. Сгенерировать файл аннотаций образца (метаданные), включив имена образцов и их группы или связанные условия; Например, «контроль» и «болезнь» — распространённые типы состояний. Убедитесь, что имена выборок совпадают между метаданными и файлами выражений.
  2. Агрегированные данные выражений и метаданные
    1. Убедитесь, что в сгенерированной матрице данных есть количество экспрессий, названия генов и файл метаданных с названиями и условиями выборок. При необходимости используйте пакет R, например org. Hs.eg.db (человек) или AnnotationDbi для сопоставления различных идентификаторов генов.
    2. Вырезать несущественную информацию из файла метаданных с помощью R или аналогичного языка программирования.
    3. Объедините информацию из файлов с подсчётом выражений в один файл для удобства обработки.
  3. Данные фильтрованного выражения
    1. Предварительно обработайте матрицу данных экспрессии генов, исключая дубликаты генов, нулевые значения (NA), низкую экспрессию (<всего 10 подсчетов) и/или гены с низкой дисперсией и т.д.
  4. Предобработка данных
    1. Нормализация секвенирования РНК и дифференциальный анализ экспрессии
      ПРИМЕЧАНИЕ: Этот шаг является одним из двух (1.4.1) подходов (1.4.2) для выбора генов для создания Edge Weighted Network (EWN) и выбора исходного гена (шаги 1.5–1.6) при начале анализа на основе данных секвенирования объёмной РНК. В качестве альтернативы можно использовать сопоставление шаблонов на основе корреляции Пирсона, переходя к шагу 1.4.3.
      1. На этом этапе выполните преобразования идентификатора гена с помощью R-пакета AnnotationDbi в соответствии с отдельными пакетами организмов. NetDecoder использует символы генов (то есть Gene ID), которые совпадают с примером PPI.
      2. Выполните нормализацию и дифференциальный анализ выражений между двумя условиями с помощью R-пакетов limma, edgeR, DESeq2 или аналогичных инструментов.
      3. Если используете DESeq2, постройте набор данных DESeq, используя функцию DESeqDataSetFromMatrix() с матрицей счёта (гены и образцы) и метаданными выборки (условия) в качестве входных данных.
      4. Используйте функцию DESeq() с настройками по умолчанию на объекте, созданном на шаге 1.4.1.3, чтобы вычислить дифференциальные значения выражений.
      5. Сохраните результаты в матрице данных с идентификаторами генов (Gene ID) в виде названий строк и ключевых выходов, включая log2fold change (log2FC), p-значение и скорректированное p-значение в виде столбцов.
      6. По желанию отфильтруйте результаты по скорректированному p-значению (<0.05) и/или log2FC значениям (например: |log2FC| > 1) с помощью dplyr или аналогичного инструмента.
      7. Убедитесь, что все обработанные списки генов и матрицы изменений log2 fold экспортируются в виде файлов с разделением по табуляциям (.txt или .csv) для ввода в NetDecoder.
      8. Выполните попарные сравнения для шага 1.4.1, если используются более двух биологических условий, и получите попарные результаты, используя функцию results() из объекта DESeq, сгенерированную на шаге 1.4.1.5.
    2. Нормализация выражения микрочипов — необязательно
      ПРИМЕЧАНИЕ: Если используете данные микрочипов, выполните этот шаг для нормализации данных.
      1. Нормализуйте данные, открыв скрипт нормализации NetDecoder (HuLiLab/NetDecoder_Example/raw_data/NetDecoder_normalize. R), доступных из https://github.com/HuLiLab/NetDecoder_Example/tree/main, на платформе R-разработки и редактировать курсивную часть так, чтобы она соответствовала рабочему каталогу с файлами интенсивности ячеек (CEL).
        setwd(~/NetDecoder_Example/raw_data/CEL_files)
    3. Сопоставление шаблонов — необязательно
      ПРИМЕЧАНИЕ: Это второй необязательный подход, если не проводится дифференциальный анализ выражений (как изложено в шагах 1.1–1.4.1 раздела «Подготовка данных»).
      1. Для данных секвенирования РНК, не обработанных через лимму, edgeR и DESeq2, выполните внешнюю нормализацию перед применением шаблонного сопоставления. Для данных микрочипов используйте нормированные значения выражения, полученные в шагах 1.1–1.4.2.
      2. Выберите контрольное условие в качестве исходного шаблона экспрессии генов и сравните нормализованные значения экспрессии генов по всем другим интересующим состояниям.
      3. Рассчитайте коэффициенты корреляции Пирсона между профилем экспрессии каждого гена и выбранным шаблоном. Рекомендуется сохранять гены, демонстрирующие статистически значимые корреляции (p < 0,05) и абсолютный коэффициент корреляции выше пользовательского порога (например, |r| > 0,7).
  5. Отбор исходных генов
    ПРИМЕЧАНИЕ: Входные данные для этого этапа состоят из нормированной матрицы экспрессии генов, разработанной на этапах 1.1–1.4.
    1. Выберите набор значимых генов, которые будут использоваться в качестве исходных генов. Для рабочих процессов на основе дифференциальных выражений выбирайте скорректированные p-значения и пороговые значения log2FC (например, adj p-значение < 0.05 и |log2FC| > 2). Для рабочих процессов сопоставления шаблонов выбирайте исходные гены из значительно коррелированных генов, выявленных на шаге 1.4.3.3, используя выбранные пороги корреляции и значимости. Пороги должны быть выбраны так, чтобы получить примерно 300–1 000 генов для строительства нижней сети.
      ПРИМЕЧАНИЕ: Исходные гены — это то, с чего начинается и распространяется информационный поток по сети.
  6. Постройте сеть с взвешенными краями (EWN) для каждого фенотипа
    ПРИМЕЧАНИЕ: Для этого этапа требуются следующие входные данные: нормализованная матрица экспрессии генов, разработанная на этапах 1.1–1.4; сеть взаимодействия белков и белков (PPI), отформатированную в виде списка краёв (пары гена A-генB); Файл аннотации образца (метаданные), указывающий метки биологических состояний для каждого образца. Сеть PPI используется как объект R и построена на базе данных белков iRefIndex. Версия, используемая в этом протоколе, включает все прямые взаимодействия, но самопетли и несколько рёбер были исключены. Сеть ИПП содержит 15 608 белков и 180 044 взаимодействия. Для дополнительной информации см. раздел4 NetDecoder-Methods.
    1. Откройте скрипт NetDecoder Edge Weighted Network (EWN) (HuLiLab/NetDecoder_Example/input/NetDecoder_Create_EWN. R, доступна с https:/github.com/HuLiLab/NetDecoder_Example/tree/main)4, на платформе R-разработки.
    2. Отредактировать части скрипта, указанные комментариями (курсивом ниже), чтобы задать пользовательские пути и файлы ввода для разработки EWN.
      путь<~/NetDecoder_Example/input/
      Это путь к рабочему каталогу
      expQuery <- get(load("expBreastCancer_15Set2014.R"))
      Это пример нормализованного объекта выражения с матрицей выражений Rdata
      stQuery < read.csv("s tBreastCancer.csv")
      Это примерные метаданные
    3. Фильтруйте экспрессионную матрицу, чтобы сохранить только гены, присутствующие в сети PPI.
    4. Для каждого состояния подмножества образцов по фенотипу вычисляют попарные корреляции ген-ген по всем рёбрам, определённым в сети PPI, с помощью корреляции Пирсона. Вычислите корреляции с помощью обработанной, нормализованной матрицы выражений, сгенерированной на шаге 1.4.
    5. Для каждой пары генов вычислите коэффициент корреляции, абсолютную корреляцию и связанное p-значение.
    6. Удалить неполные случаи (например, значения NA).
    7. Экспортируйте одну сеть с взвешенным по краям на каждое условие в файле с разделением по табуляциям (без заголовка) со следующими столбцами: proteinA, proteinB, abs_cor, cor и pvalue.
    8. Выполните скрипт R, чтобы создать сети ко-выражений для всех соответствующих условий.

2. Установка и настройка NetDecoder

  1. Скачать NetDecoder
    1. Получите доступ к программному обеспечению NetDecoder по адресу (https://netdecoder.hulilab.org/#ver), выбрав R или Java.
  2. Установка необходимого программного обеспечения
    1. Установите Oracle JDK и R для рабочих и аналитических сред.
    2. Устанавливайте необходимые R-пакеты, указанные в документации NetDecoder, используя Bioconductor (https://netdecoder.hulilab.org/#ver)4.
  3. Зависимости для скачивания
    1. Скачайте необходимые зависимости для NetDecoder, которые включают данные генной онтологии (доступны из https://geneontology.org/docs/download-ontology/), а также справочник по ассоциациям генов (доступен в https://www.ebi.ac.uk/GOA/human_release).
  4. Настройте рабочий каталог
    1. Переместите все загруженные файлы (данные экспрессии, сгенерированные сети коэкспрессии для каждого состояния, данные генной онтологии и руководство по ссылке на ассоциации) в одну папку, которая станет рабочей папкой NetDecoder.
  5. Добавьте необходимую папку
    1. Скачайте папку NetDecoder (https://netdecoder.hulilab.org/wp-content/uploads/2025/07/NetDecoder_Example.zip) в рабочую директорию NetDecoder.
    2. Распаковайте папку NetDecoder.

3. Запуск NetDecoder

  1. Откройте скрипт анализа bash
    1. Откройте терминал с GNU Bash и перейдите в рабочую директорию NetDecoder.
    2. Запустите команду nano NetDecoder_Analysis.sh , чтобы открыть bash-скрипт.
  2. Модифицировать скрипты
    ПРИМЕЧАНИЕ: Большая часть кода уже написана. На этом этапе требуемые параметры указываются в скрипте в указанных местах.
    1. Сделайте короткое имя:
      Отредактируйте курсив, чтобы сравниваемые условия: myshortname='Your_shortname_here'
    2. Задайте программные пути:
      Отредактируйте следующие три определения путей с правильными путями, отредактировав курсивные части:
      JAVA="/ваш/путь/здесь"
      экспорт R="/твой/путь/здесь»
      псевдоним R="/ваш/путь/здесь"
    3. Рабочий каталог декораций:
      Отредактируйте курсивную часть, чтобы она стала рабочей директорией, откуда будут доступны все файлы: INPUT_DIR="/your/path/here"
    4. Сетить библиотеку NetDecoder:
      Отредактируйте курсивную часть, чтобы она стала путём к библиотеке NetDecoder, установленной на шаге 2.4 из zip-файла: LIB_DIR="/your/path/here/netdecoder_lib"
    5. Онтология сета генов и пути ассоциаций:
      Отредактируйте следующие курсивные части двух каталогов с расположением предпочтительных онтологий/ассоциаций генов.
      СИМВОЛ=$LIB_DIR/gene_association_file
      GO=$INPUT_DIR/gene_ontology_file
    6. Задайте входные аргументы:
      Обновите курсивные части следующих пяти строк в соответствии с данными, согласно прокомментированным инструкциям, содержащимся в эталонном скрипте NetDecoder.
      geneList=$INPUT_DIR/gene_file
      state_trt=Лечебное состояние
      state_ref=Эталонное условие

      PPI_trt=$INPUT_DIR/treated_co_expression_network_file
      PPI_ref=$INPUT_DIR/ссылка_co_expression_network_file
    7. Подготовьте правильную сцену:
      Отменьте комментарий (убрав символ #) на желаемом этапе выполнения и оставьте повторный комментарий после завершения этапа. Первый этап — это gen_net_trt, затем gen_net_ref, затем этап анализа и, наконец, этап сбора.
      Задайте желаемый этап для выполнения, начиная с первого этапа.
      #STAGE="gen_net_trt"
      #STAGE="gen_net_ref"
      #STAGE=«анализ»
      #STAGE="collect"
    8. Перейти к основному терминалу Bash:
      Нажмите Ctrl+X, затем Y, чтобы сохранить и выйти из bash-скрипта.
  3. Execute NetDecoder
    ПРИМЕЧАНИЕ: Если система успешно запущена, в терминале появляются сообщения логирования.
    1. Перейдите к терминалу и запустите ./NetDecoder_Analysis.sh.
    2. Выполняйте этапы в порядке, указанном в шаге 3.2.7, пока все четыре не будут выполнены по отдельности.
  4. Получить результаты
    1. Перейдите к выходным файлам и графическим сводкам.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Как показано на рисунке 1, NetDecoder работает через структурированный рабочий процесс, включающий обработку данных, конфигурацию сети и анализ на основе потоков, при этом выходы организованы в отдельные каталоги, соответствующие каждому этапу конвейера. Такая модульная структура позволяет систематически проверять результаты, обеспечивая отслеживание результатов на каждом этапе вычислений и поддерживая общую воспроизводимость.

Успешное выполнение NetDecoder (рисунок 2) даёт результаты по четырём каталогам (анализ, сбор, сети и «your_shortname»), содержащие данные, соответствующие различным условиям, включая цифры и количественные выходы для значений потока, подсетей и других выходов взаимодействия потока (рисунок 1, рисунок 2 и рисунок 3). Наличие заполненных файлов и фигур в этих каталогах указывает на корректную работу конвейера. В отличие от этого, неудачные запуски характеризуются отсутствующими выходами и/или неполными цифрами. Поскольку NetDecoder оценивает тысячи генов в сети PPI, успешные запуски обычно требуют нескольких часов вычислений, в зависимости от размера набора данных и доступных ресурсов. Для представленного здесь репрезентативного анализа рака желчных путей человека выполнение NetDecoder требовало примерно 4–6 часов на рабочей станции Puget3 (Puget Systems) на базе Linux. Необычно короткие времена выполнения могут указывать на неправильно отформатированные входные данные или неполное выполнение конвейера. Неправильное форматирование входных данных или неудачное выполнение конвейера могут привести к появлению сообщений об ошибках, которые можно проследить до причины проблемы. Рисунок 3 иллюстрирует репрезентативные выходы, которые появляются после успешного выполнения NetDecoder. Представленный здесь репрезентативный анализ использовал данные секвенирования РНК из 255 образцов рака желчных путей (OEP001105)6, что позволило сравнивать состояния заболевания стадий I–II и III–IV стадий и изменённый информационный поток между состояниями.

Три тепловые карты на рисунке 4 суммируют общие изменения в потоке сетевой информации между генами в разных условиях, включая маршрутизирующие гены, передающие значительный информационный поток внутри сети, важные целевые гены ниже по цепочке или сильно затронутые гены. Широкое распределение как положительного, так и отрицательного дифференциального потока указывает на то, что информация перераспределяется по сети, а не равномерно увеличивается или уменьшается. Эта гетерогенность и разнообразие типов генов поддерживают способность NetDecoder выявлять гены с изменённой функциональной значимостью между фенотипами.

На рисунке 4 также показаны графические графики на уровне краёв, которые количественно оценивают изменения потока для взаимодействия отдельных пар генов между условиями. Эти результаты показывают, что поток через конкретные взаимодействия может варьироваться в зависимости от условий, отражая контекстно-зависимую перепроводку сети. Таким образом, поток по краям фиксирует изменения на уровне взаимодействия в передаче информации, тогда как дифференциальный поток предоставляет сводку этих изменений на уровне узлов, что позволяет приоритизировать гены с наибольшим общим сдвигом влияния сети.

Вместе эти результаты демонстрируют, что NetDecoder фиксирует генные (узловый), ген-ген (на уровне краёв) и сетевые изменения в потоке информации внутри биологических сетей (рисунок 4). Тепловые карты выявляют гены с изменённым распространением, маршрутизацией и приёмом информации в сети, тогда как анализ на уровне периферии выявляет конкретные взаимодействия, вызывающие эти изменения. Фенотип-специфические информационные сети наглядно отражают переподключение сетей между условиями, где узлы представляют гены, а толщина краёв соответствует величине информационного потока (рисунок 4). Такое представление на уровне системы способствует идентификации ключевых регуляторных генов и путей, связанных с изучаемыми состояниями. Кроме того, успешное производство этих фигурок свидетельствует о правильном выполнении NetDecoder.

Поскольку NetDecoder создаёт большое количество выходных файлов, выявление наиболее релевантных результатов крайне важно для интерпретации. Например, для изучения различий в потоках между условиями (например, низкий и высокий ступень) можно использовать два ключевых файла (шаги навигации определяются структурой файла на рисунке 3). Первая, «EDGE_CENTERED_SUBNET_flowDifference_Болезнь.txt (расположена в анализе/справочнике заболеваний ), выявляет взаимодействия (края) с наибольшими изменениями потока между состояниями. Вторая, «flowDifference_PRIORITIZED_NETWORK.txt» (расположенная в каталоге «your_shortname» ), определяет гены (узлы) с наибольшими разницами в потоке. Вместе эти файлы предоставляют всестороннее представление об изменениях поведения сети на уровне взаимодействия и генов.

В более широком смысле, папка «анализ» содержит информацию о сетевых маршрутизаторах, ключевых целях и важных генах дифференциального потока. Папка «your_shortname» содержит необработанные текстовые файлы с фенотип-специфическими данными, такими как общие значения потока, ключевые цели и маршрутизаторы. Папка сетей содержит подсети, сгенерированные NetDecoder, которые можно дополнительно проанализировать и визуализировать в Cytoscape7. Наконец, папка «collect» содержит объединённые данные и цифры, предоставляющие общее резюме результатов. Дальнейшая визуализация и анализ результатов NetDecoder могут осуществляться с помощью R-пакетов, таких как ggplot2, igraph, pheatmap и др.

figure-results-1
Рисунок 1: Представление конвейера и общей функциональности NetDecoder. NetDecoder требует трёх основных этапов (жёлтый блок): обработка данных, конфигурация NetDecoder и выполнение NetDecoder. Каждый этап этих этапов должен тщательно следить для успешных результатов. NetDecoder требует данные экспрессии из двух состояний (примеры в зелёной коробке), чтобы предсказать, какие гены могут быть связаны с высоким информационным потоком и полезностью генов. В аналогии с водяным краном уровень экспрессии генов иллюстрируется размером крана, то есть насколько широко он может открыться, а полезность или активность гена отражает фактический поток воды, поступающей через кран, что показывает, насколько эффективно используется этот путь. Как показано на рисунке, ген с высокой экспрессией (большой размер крана) может иметь низкую полезность генов (низкий уровень потока воды), тогда как ген с низким уровнем экспрессии (маленький размер крана) может иметь высокую генную полезность (высокий уровень водного потока). Это иллюстрирует, как гены могут иметь более высокую общую значимость в данном состоянии, даже если уровень экспрессии ниже, чем у другого гена. Иллюстрация внизу в центре показывает, как гены могут быть взаимосвязаны и испытывать разные уровни течения (цвета), независимо от того, насколько они экспрессированы (размер). Создано в BioRender. Блиссенбах, Э. (2026) https://BioRender.com/8okynbu. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-2
Рисунок 2: Общий рабочий процесс NetDecoder. Основной принцип алгоритма NetDecoder заключается в моделировании полезности генов в сети взаимодействия белков и белков (PPI) с помощью анализа информационных потоков. Рабочий процесс начинается с предварительной обработки данных и построения сетей с взвешенными краями (EWN). Данные экспрессии генов из двух биологических условий — фенотипа 1 (P1) и фенотипа 2 (P2) — обрабатываются для идентификации исходных генов с помощью дифференциальной экспрессии или шаблонного сопоставления. Нормализованные матрицы экспрессии затем используются для построения условно-специфических EWN, где веса рёбер отражают взаимоотношения пар генов в каждом фенотипе. NetDecoder затем количественно оценивает различия в потоке информации между условиями, позволяя выявлять события переподключения сети и изменения в полезности генов. Результаты включают дифференциальные показатели информационных потоков, контекстно-специфические информационные сети, тепловые карты баллов воздействия, а также дополнительные метрики на уровне сети и генов, которые способствуют биологической интерпретации и механистическому открытию. Создано в BioRender. Коррея, К. (2026) https://BioRender.com/29cmswf. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-3
Рисунок 3: Выводы NetDecoder и структура папок. Эта диаграмма представляет структуру каталогов выхода, используемую для доступа к файлам результатов для интерпретации. Курсивом представлены имена папок (на иконках папок), а названия в кавычках специфичны для номенклатуры анализа. Значения на иконках входящих указывают либо на файлы, либо на типы файлов, в зависимости от цветового кодирования. Красный обозначает типы файлов, которые можно найти в каждой папке, а ключевые файлы выделены жирным шрифтом и подчеркнуты (flowDifference_PRIORITIZED_NETWORK.txt и EDGE_CENTERED_SUBNET_flowDifference_Болезнь.txt). Иконки папок были взяты из icons8 (https://icons8.com). Создано в BioRender. Блиссенбах, Э. (2026) https://BioRender.com/8okynbu. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-4
Рисунок 4: Пример результатов, сгенерированных NetDecoder. Гены удара (A), сетевые маршрутизаторы (B) и тепловые карты ключевых целей (C), а также контекстно-специфические сети (D) и графы потока краёв (E) — это ключевые выходы из NetDecoder. В этом примере был использован набор данных по экспрессии рака желчных путей (OEP001105) для сравнения пациентов с ранними стадиями заболевания (стадии I-II, низкая) и задуженной стадии заболевания (стадии III-IV, высокий), а NetDecoder применялся для выявления генов с высокой дифференциальной информацией между двумя группами. Каждый график показывает красный — увеличение потока, а синий — уменьшение потока. Сетевые маршрутизаторы (B) — это ключевые промежуточные гены, через которые проходит большое количество потока (collect/Disease_Network_routers.pdf), ключевые мишени (C) являются важными регуляторами ниже по потоку (collect/Disease_Key_targets.pdf), а тепловая карта разности потока отражает общее изменение генного информационного потока между условиями (анализ/flowDifference_heatmap.pdf). Можно визуализировать информационную сеть (D), специфичную для фенотипа, где каждый ген представляет узел, а взаимодействия ген-ген — в виде рёбер (линий) (анализ/EDGE_CENTERED_SUBNET_Disease). Толщина краёв соответствует величине потока информации между генами. Столбчатая диаграмма (E) показывает различия в потоке краёв между взаимодействиями ген-ген между двумя выбранными фенотипами, при этом пары низких стадий представлены в бирюзовом цвете, а пары высокой стадии — в оранжевым (анализ/Disease_keyEdges.pdf). Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Этот протокол описывает реализацию NetDecoder — сетевой биологической структуры, которая интегрирует данные экспрессии генов с сетями взаимодействия белков и белков (PPI) для моделирования информационного потока, специфичного для условий, и приоритизирования генов на основе их функционального влияния в биологических системах. Успешное применение этого метода зависит от нескольких критических шагов, тщательного методологического выбора и правильной интерпретации результатов.

Начальные этапы протокола включают получение выраженных данных, генерацию метаданных и построение единой матрицы выражений. Эти шаги критически важны для обеспечения совместимости с дальнейшим анализом. Матрица экспрессии должна форматироваться с генами в виде строк и выборок в виде столбцов, при этом имена выборок в матрице и файл метаданных будут одинаково совпадать с этими свойствами. Любые несоответствия на этом этапе (например, несовпадающие идентификаторы выборок или дублированные имена генов) будут распространяться по конвейеру и приводить к сбоям на последующих этапах.

Фильтрация данных низкого качества (например, генов с низким количеством, отсутствующими значениями или генами с низкой дисперсией) особенно важна, поскольку эти особенности могут вносить шум в корреляционное построение сетей. Успешный этап предварительной обработки обозначается чистой матрицей экспрессии без отсутствующих значений и согласованными идентификаторами генов, соответствующими используемым в сети PPI.

Ключевым моментом принятия решения в протоколе является выбор между анализом дифференциальной экспрессии и шаблонным сопоставлением для выбора исходных генов, используемых в построении Edge Weighted Network (EWN). Дифференциальный экспрессионный анализ наиболее уместен при сравнении хорошо определённых экспериментальных групп с достаточным числом репликат. Этот подход выявляет гены с статистически значимыми изменениями экспрессии между условиями и даёт количественные результаты, такие как лог2-кратное изменение (log2FC) и скорректированные p-значения. Успешное исполнение обозначается распределением как значимых, так и незначимых генов, а не однородными нулевыми результатами. В отличие от этого, шаблонное сопоставление лучше подходит, когда цель — выявить гены с паттернами экспрессии, коррелированными с непрерывным или эталонным профилем. Этот метод сохраняет гены, основанные на силе корреляции, а не на величине дифференциальной экспрессии. Успешный этап сопоставления шаблонов даёт набор генов с статистически значимой корреляцией с эталонным условием. Выбор между этими подходами влияет на топологию нижней сети; Дифференциальное выражение делает акцент на изменениях величины, тогда как шаблонное сопоставление — на согласованных узорах выражения.

Этап построения EWN является одним из важнейших компонентов протокола. Здесь нормализованные данные экспрессии генов интегрируются с сетью PPI для вычисления парных корреляций ген-ген для всех взаимодействий, присутствующих в сети. Сохраняются только гены, разделённые между набором данных экспрессии и сетью PPI, что гарантирует биологическую значимость и вычислительную согласованность. Для каждого условия рассчитываются коэффициенты корреляции Пирсона по всем рёбрам, а также соответствующие p-значения и абсолютные значения корреляции. Эти метрики определяют веса ребер, используемые NetDecoder. Успешное построение EWN подтверждается тысячами корреляций ген-ген, широким распределением корреляционных значений и минимальным отсутствием значений после фильтрации. Отказ на этом этапе часто связан с несовпадающими идентификаторами генов, недостаточным размером выборки или неправильно нормализованными данными экспрессии. Распространённые точки отказа NetDecoder часто можно устранить методической проверкой входных файлов и конфигурации программного обеспечения. Если NetDecoder неожиданно завершает работу или производит неполные результаты, пользователям необходимо проверить, что идентификаторы выборок идентичны между матрицами экспрессии и файлами метаданных, что идентификаторы генов согласованы между наборами данных экспрессии, списками исходных генов и сетью PPI, а также что матрицы экспрессии не содержат пропущенных значений. Если возникают ошибки или усеченные результаты, пользователи могут проверить установку программного обеспечения и совместимость версий, проверить лог-сообщения, сгенерированные во время выполнения, и подтвердить успешное выполнение каждого промежуточного шага перед переходом к следующему анализу. Проверка выходных файлов и/или консольных сообщений может помочь локализовать источник ошибки до последующего анализа. NetDecoder требует тщательной конфигурации путей к файлам, входных аргументов и зависимостей. Ключевые шаги включают указание путей рабочих каталогов и библиотек, файлов генной онтологии и аннотаций, условно-специфических входных данных EWN и списков исходных генов.

Поскольку конвейер выполняется поэтапно (генерация обеих условий в сети, анализ и сбор результатов), ошибки на ранних этапах препятствуют успешному завершению последующих этапов. Корректно работающий запуск даёт четыре каталога (анализ, сбор, сети, «your_shortname»), каждый из которых содержит результаты, специфичные для условий. Ещё одним практическим показателем правильного выполнения является время выполнения. Успешные запуски обычно требуют нескольких часов обработки, поскольку NetDecoder оценивает большие сети взаимодействия; Крайне короткие времена выполнения часто указывают на неправильную конфигурацию входов или пропуск вычислительных шагов.

NetDecoder принципиально отличается от традиционных подходов к приоритизации генов и анализу сетей. Методы, такие как Weighted Gene Co-expression Network Analysis (WGCNA)8 , кластерируют гены на основе корреляционной структуры, но не включают направленный поток и не количественно определяют, как информация распространяется по сети. Аналогично, анализ обогащенияпутей 9 выявляет функциональное сверхпредставление, но не учитывает динамику взаимодействия на уровне взаимодействия или изменения сетевой связности.

NetDecoder использует интегрированный подход, объединяя данные экспрессии генов с сетями PPI для моделирования информационного потока, специфичного для условий. Количественно оценивая как индивидуальные оценки генов (на уровне узлов), так и изменения потоков взаимодействия (на уровне краёв), он фиксирует, как структура сети и маршрутизация информации перепрограммируются между условиями. Это позволяет выявлять гены, которые могут не проявлять сильную дифференциальную экспрессию, но при этом играть центральную роль в опосредовании поведения сети, что соответствует модели полезности генов (GUM)5, согласно которой гены с высоким дифференциальным информационным потоком управляют функцией сети, специфической для условий.

Несмотря на свои сильные стороны, у NetDecoder есть несколько ограничений. Во-первых, это вычислительная структура, которая делает выводы о важности генов на основе моделируемого потока сетевой информации, а не прямых экспериментальныхдоказательств 10. Таким образом, его предсказания следует интерпретировать как гипотезы, требующие проверки с помощью биологических экспериментов. Методы функциональной валидации, такие как исследования с нокаутомгена 11 или целенаправленные тестывозмущений 12, необходимы для подтверждения того, действительно ли гены, выявленные NetDecoder как высокополезные, влияют на изученные биологические процессы или состояния заболеваний. Во-вторых, метод сильно зависит от качества и полноты базовой сети PPI. Поскольку базы данных PPI часто склоняются к хорошо изученным генам, менее характерные взаимодействия могут быть недостаточно представлены, что потенциально ограничивает открытие новых регуляторных связей. Вариабельность размера выборки, экспериментального проектирования и качества данных также может влиять на построение сети и расчёты последующих потоков. В-третьих, NetDecoder не предполагает, что статические рёбра полностью захватывают динамический поток информации. Вместо этого NetDecoder делает выводы о контекстно-специфической активности и количественно оценивает информационный поток с помощью сети PPI в качестве структурного априора, которая служит каркасом для определения пространства биологически правдоподобных взаимодействий. Динамическое поведение затем вводится путем наложения молекулярных данных, специфичных для состояния (например, экспрессии генов), что фактически перевзвешивает или активирует подмножества сети в зависимости от контекста.

Основная цель NetDecoder — моделировать распространение информации через статический каркас PPI при сохранении количественных и непрерывных связей между генами (узлами). В отличие от этого, такие подходы, как булевые сети, предлагают упрощённое и интерпретируемое представление динамики, моделируя активность белка как дискретные состояния включения/выключения, управляемые логическимивзаимодействиями 13. Эти подходы широко используются для изучения регуляторных и сигнальных сетей генов при различныхусловиях 14,15,16. Однако обычно они требуют заранее заданных логических правил и дискретизации состояний белка, что бывает сложно определить в масштабах для крупных, гетерогенных биологических сетейPPI 17. В этом контексте булевое моделирование сети представляет собой дополнительное направление к NetDecoder. Хотя NetDecoder фиксирует непрерывный количественный поток информации, интеграция логической динамики на основе правил или гибридных дискретно-непрерывных моделей может повысить интерпретируемость специфических условий сигнальных поведений. Разработка булевых алгоритмов потока информации представляет собой перспективный путь для будущих исследований.

Будущие направления NetDecoder включают интеграцию с дополнительными типами омических данных и расширение на одноклеточную транскриптомику для улучшения разрешения и биологического контекста. Например, подходы на основе глубокого обучения для пространственного транскриптомного экспрессии и импутации направлены на улучшение качества данных и восстановление сигнала, но не моделируют явно информационный поток между сетямивзаимодействия 18,19. Включение мультиомических уровней анализа может как ещё больше повысить его предсказательную силу, так и привести к более надёжным результатам. Благодаря дальнейшему методологическому развитию NetDecoder сможет создавать несколько слоёв потока информации, предоставляя научным учёным мультиомическую валидацию интересующих данных.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

У авторов нет финансовых конкурирующих интересов.
Иллюстрации для рисунков 1 и 2 были созданы с помощью BioRender (BioRender.com).

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Эта работа была поддержана грантами от Центра биомедицинских открытий клиники Майо, Комплексного онкологического центра клиники Майо (NIH; P30 CA015083), Центр клеточной сигнализации в гастроэнтерологии клиники Майо (NIH: P30DK084567), Фонд медицинских исследований Гленна, Фонд V по исследованию рака (S.Z.), программа исследований питания и ожирения клиники Майо, программа иммунологии и иммунотерапии рака имени Дэвида Ф. и Маргарет Т. Гроне, Schmidt Sciences and Innovation, а также Национальные институты здравоохранения (NIH; U19AG74879, P50CA136393, R01CA240323, R03OD038392).

Материалы

```html

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
AnnotationDbiBioconductorversion 1.68.0Аннотация и картирование генов
BioconductorBioconductorversion 3.19Фреймворк для анализа транскриптомных данных и экосистема пакетов, поддерживающих DESeq2, edgeR, limma, AnnotationDbi и базы данных организмов и т.д.
CytoscapeThe Cytoscape Consoritumversion 3.10.4Визуализация и анализ сетей
DESeq2Bioconductorversion 1.46.0Анализ дифференциальной экспрессии (с моделированием отрицательного биномиального распределения)
dplyrPosit Software, PBC formerly RStudio, PBCversion 1.1.4Манипуляции и трансформация данных
edgeRBioconductorversion 4.4.2Анализ дифференциальной экспрессии на основе подсчета
ggplot2Posit Software, PBC formerly RStudio, PBCversion 4.0.0Визуализация и построение графиков
GNU BashGNU ProjectSystem defaultBash, выполнение скриптов пайплайна NetDecoder
igraphigraph Development Teamversion 2.1.4Построение сетей и анализ графов
LimmaBioconductorversion 3.62.2Линейное моделирование для анализа экспрессии генов
NetDecoderHu Li Laboratory, Mayo Clinic(2024 Hu Li Lab)Построение контекстно-специфичных сетей взаимодействий белков через моделирование потока информации
org.Hs.eg.dbBioconductorversion 3.20.0База данных аннотации генов человека
Oracle JDKOracle Corporation≥ version 1.8Среда выполнения для запуска NetDecoder
pheatmapRaivo Koldeversion 1.0.13Визуализация структуры экспрессии и корреляции
RThe R Foundationversion 4.4.2Основная среда для транскриптомного и сетевого анализа
```

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

MedicineNetworkscontext specificmodellingtranscriptomicsflow algorithmintegration
Видео скоро будет доступно

Похожие статьи