Artigo de método

Protocolo NetDecoder para Construção de Redes de Interação Proteica Específicas de Contexto a partir de Dados Transcriptômicos Usando Modelagem de Fluxo de Informação

DOI:

10.3791/70869

31 de julho de 2026

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aqui, apresentamos um protocolo para usar o NetDecoder, uma ferramenta de modelagem de rede, para construir redes de interação proteica específicas do contexto e construir modelos de utilidade gênica (GUMs). Utilizando dados transcriptômicos, em combinação com redes de interação proteína-proteína (PPI) curadas, o NetDecoder permite a identificação de alvos e subredes-chave.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A análise de expressão diferencial é uma técnica comumente usada para determinar potenciais alvos terapêuticos, mas ignora a complexidade das redes gênicas entre vias biológicas. Frequentemente, genes altamente expressos não necessariamente explicam as propriedades de um fenótipo biológico. O NetDecoder, uma ferramenta de biologia de redes que integra dados transcriptômicos com redes de interação proteína-proteína (PPI) para modelar o fluxo de informação específico do contexto, utilidade gênica, arestas principais e redes gênicas utilizadas diferencialmente, foi desenvolvida para abordar essa limitação da análise de expressão diferencial.

Este protocolo é um guia passo a passo amigável para iniciantes, com diretrizes abrangentes que abrangem pré-processamento de dados, execução do NetDecoder e análise de saídas. O fluxo de trabalho inclui configuração de software, construção de redes e análise de modelagem baseada em fluxo para quantificar diferenças entre genes (nódulos) e interações gene-gene (nível de borda) entre condições biológicas. Os resultados resultantes incluem alvos e roteadores-chave, sub-redes de fluxo diferencial e distribuições de fluxo de borda, permitindo a identificação de genes reguladores chave e vias associadas a estados biológicos específicos. Após seguir os passos descrevidos, os pesquisadores poderão conduzir pesquisas independentes para descobrir o fluxo fenotípico de genes entre fenótipos, utilizando dados transcriptômicos e redes de IBP curadas.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A seleção de genes e vias associadas para investigação terapêutica é frequentemente orientada por análises de expressãodiferencial. Esse método de análise é eficaz para determinar como a expressão gênica difere entre duas ou mais condições. No entanto, os genes funcionam dentro de redes biológicas complexas e interconectadas, o que significa que a expressão gênica individual não captura totalmente como os genes interagem em uma rede e suas relaçõesgene-gene 2. Métodos de propagação de redes integram expressão gênica com redes de interação para identificar genes biologicamente importantes que podem ser perdidos apenas pela expressãodiferencial 3. As abordagens atuais não quantificam explicitamente a importância funcional dos genes e como a informação biológica é redistribuída dentro das redes de interação proteína-proteína (PPI) entre condições biológicas. Portanto, era necessário um método para modelar o comportamento específico da rede e quantificar mudanças no fluxo de informação entre sistemas biológicos. Para explicar como os genes interagem dentro de uma rede biológica mais ampla, o NetDecoder, uma plataforma de biologia em rede, foi desenvolvido para descobrir genes com a maior diferença de fluxo de informação entre condições. O NetDecoder utiliza um algoritmo de fluxo guiado por processos para traduzir o conhecimento existente da rede PPI humana, em combinação com dados de sequenciamento de RNA em massa, para construir um modelo de interações orientadas pelo fluxo de informação4.

Utilizando dados de fluxo de informação para redes fenotípicas, um modelo de utilidade gênica (GUM)5 pode ser desenvolvido para identificar genes com alto fluxo de informação como tendo a maior utilidade geral dentro de uma rede, independentemente de seus valores diferenciais de expressão. Essa abordagem apoia estratégias de priorização e identificação de alvos mais eficazes, fornecendo insights que a análise tradicional frequentemente deixa de lado. Diferentemente dos métodos tradicionais de expressão diferencial ou redes baseadas em correlação, o NetDecoder quantifica tanto as mudanças de genes (nível de nó) quanto de interação (nível de borda) no fluxo de informação, permitindo a identificação de genes funcionalmente importantes, mesmo na ausência de grandes mudanças deexpressão 4,5. O NetDecoder é amplamente aplicável a conjuntos de dados de sequenciamento de RNA em massa que envolvem análise comparativa entre duas condições biológicas, permitindo a identificação de mudanças no fluxo de informação e na organização da rede. Embora o NetDecoder suporte a integração de outros conjuntos de dados ômicos, incluindo proteômica e epigenômica, o presente protocolo demonstra especificamente o fluxo de trabalho usando dados transcriptômicos. Nessas aplicações, os usuários podem definir genes de origem com base em proteínas ou genes regulados epigeneticamente, permitindo que a análise do fluxo de informação seja iniciada a partir dessas características moleculares. Essa flexibilidade permite a incorporação de evidências multi-ômicas em análises baseadas em redes e facilita a descoberta de mecanismos regulatórios intermodais subjacentes às diferenças fenotípicas.

Os desenhos comuns de estudo envolvem comparações binárias, incluindo, mas não se limitando a, doença versus condições saudáveis, respondentes ao tratamento versus não respondedores, tratamentos medicamentosos, experimentos knockdowns ou knockouts versus controle, e análises de transições de estado de desenvolvimento ou celulares. O objetivo deste protocolo é ilustrar uma estrutura reprodutível para aplicar o NetDecoder e descobrir genes com influência alterada da rede em condições biológicas. Isso é alcançado por meio de etapas simples de seguir para configurar e executar o NetDecoder, assim como exemplos a serem seguidos junto com técnicas básicas de solução de problemas, e métodos para interpretação de resultados também são apresentados no protocolo.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo utilizou conjuntos de dados de sequenciamento de RNA disponíveis publicamente e não envolveu diretamente indivíduos humanos ou animais. Portanto, não era necessário aprovar o conselho de revisão institucional nem o consentimento informado.

NOTA: O NetDecoder requer os seguintes arquivos de entrada: expressão gênica normalizada em duas condições biológicas definidas; um arquivo de metadados que descreve as condições biológicas; uma lista de genes fonte para construção e modelagem de redes; uma rede de interação proteína-proteína (PPI) do domínio público; e uma rede ponderada por arestas (EWN) construída para cada condição biológica.

1. Preparação de dados

  1. Recuperar dados de expressão e metadados do sequenciamento de RNA em massa
    1. Baixe dados de sequenciamento de RNA (matriz de contagens brutas de expressão gênica e nomes de amostras) e metadados correspondentes (nomes de amostras, condições, etc.) de um repositório público, como o Gene Expression Omnibus (GEO), ou utilize conjuntos de dados experimentais gerados em laboratório. Normalmente, trata-se de uma matriz em que as linhas correspondem a nomes de genes e as colunas correspondem a nomes de amostras.
      NOTA: O conjunto de dados de exemplo usado para demonstrar este protocolo foi obtido do repositório da National Omics Data Encyclopedia (NODE) (banco de dados BioSino) sob acesso OEP0011056. Os usuários podem substituir seus próprios conjuntos de dados de sequenciamento de RNA em massa.
    2. Gerar um arquivo de anotação de exemplo (metadados) incluindo nomes de amostras e seus grupos ou condições associadas; Por exemplo, "controle" e "doença" são tipos comuns de condição. Confirme se os nomes das amostras correspondem entre os metadados e os arquivos de expressão.
  2. Dados agregados de expressão e metadados
    1. Certifique-se de que a matriz de dados gerada inclua contagens de expressões, nomes de genes e um arquivo de metadados com nomes de amostras e condições. Se necessário, use um pacote R, como org. Hs.eg.db (humano) ou AnnotationDbi para combinar diferentes identificadores de genes.
    2. Corte informações não essenciais do arquivo de metadados usando R ou uma linguagem de programação similar.
    3. Combine as informações dos arquivos de contagem de expressões em um único arquivo para facilitar a manipulação.
  3. Dados de expressão do filtro
    1. Pré-processe a matriz de dados de expressão gênica excluindo duplicados gênicos, valores nulos (NA), baixa expressão (<10 contagens totais) e/ou genes de baixa variância, etc.
  4. Pré-processamento de dados
    1. Normalização por sequenciamento de RNA e análise de expressão diferencial
      NOTA: Esta etapa é uma (1.4.1) de duas (1.4.2) abordagens para selecionar genes para criação de Redes Ponderadas em Borda (EWN) e seleção do gene fonte (etapas 1.5–1.6) ao iniciar a análise a partir dos dados de sequenciamento de RNA em massa. Como alternativa, o modelo de correspondência baseado em correlação de Pearson pode ser utilizado pulando para a etapa 1.4.3.
      1. Realize conversões de identificação gênica neste estágio usando o pacote R, AnnotationDbi, em conjunto com os pacotes individuais de organismos. O NetDecoder usa símbolos de genes (ou seja, ID de Gene) que correspondem ao PPI de exemplo.
      2. Realize normalização e análise de expressão diferencial entre duas condições usando os pacotes R limma, edgeR, DESeq2 ou ferramentas comparáveis.
      3. Se estiver usando DESeq2, construa um conjunto de dados DESeq usando a função DESeqDataSetFromMatrix() com uma matriz de contagem (genes e amostras) e metadados da amostra (condições) como entrada.
      4. Use a função DESeq() com as configurações padrão no objeto criado no passo 1.4.1.3 para calcular valores diferenciais de expressão.
      5. Salve os resultados em uma matriz de dados com identificadores de genes (ID do Gene) como nomes de linha e saídas de chave, incluindo a mudança de fold log2 (log2FC), valor p e valor p ajustado como colunas.
      6. Opcionalmente, filtre os resultados por p-valor ajustado (<0,05) e/ou valores log2FC (por exemplo: |log2FC| > 1) usando dplyr ou uma ferramenta comparável.
      7. Certifique-se de que todas as listas de genes processadas e matrizes de mudança log2 fold sejam exportadas como arquivos delimitados por tabulação (.txt ou .csv) para entrada no NetDecoder.
      8. Realize comparações par a par para a etapa 1.4.1 se mais de 2 condições biológicas forem usadas e obtenha resultados par a par usando a função results() do objeto DESeq gerado na etapa 1.4.1.5.
    2. Normalização de expressão em microarray - Opcional
      NOTA: Se estiver usando dados de microarrays, execute esta etapa para normalização de dados.
      1. Normalize os dados abrindo o script de normalização do NetDecoder (HuLiLab/NetDecoder_Example/raw_data/NetDecoder_normalize. R), acessível a partir de https://github.com/HuLiLab/NetDecoder_Example/tree/main, em uma plataforma de desenvolvimento R, e editar a parte itálica para corresponder ao diretório de trabalho contendo arquivos de intensidade celular (CEL).
        setwd(~/NetDecoder_Example/raw_data/CEL_files)
    3. Correspondência de modelos - Opcional
      NOTA: Esta é a segunda abordagem opcional se a análise diferencial de expressão (conforme descrito nos passos 1.1–1.4.1 de "Preparação de Dados") não for realizada.
      1. Para dados de sequenciamento de RNA que não sejam processados por limma, edgeR e DESeq2, realize a normalização externamente antes de aplicar o ajuste de template. Para dados de microarrays, use diretamente os valores de expressão normalizados gerados nas etapas 1.1–1.4.2.
      2. Escolha a condição controle como modelo de base para a expressão gênica e compare valores normalizados de expressão gênica de todas as outras condições de interesse.
      3. Calcule os coeficientes de correlação de Pearson entre o perfil de expressão de cada gene e o modelo selecionado. Recomenda-se manter genes que exibam correlações estatisticamente significativas (p < 0,05) e um coeficiente absoluto de correlação acima de um limiar definido pelo usuário (como |r| > 0,7).
  5. Seleção dos genes de origem
    NOTA: A entrada para esta etapa consiste na matriz de expressão gênica normalizada desenvolvida nos passos 1.1–1.4.
    1. Escolha um conjunto de genes significativos para serem usados como genes fonte. Para fluxos de trabalho baseados em expressões diferenciais, escolha limiares ajustados de p-valor e log2FC (como o valor p adj < 0,05 e |log2FC| > 2). Para fluxos de trabalho de correspondência de templates, selecione genes de origem entre os genes significativamente correlacionados identificados na etapa 1.4.3.3, usando os limiares de correlação e significância escolhidos. Devem ser escolhidos limiares para gerar aproximadamente 300–1.000 genes para construção de redes a jusante.
      NOTA: Os genes de origem são onde o fluxo de informação começa e se propaga pela rede.
  6. Construa uma rede ponderada por bordas (EWN) para cada fenótipo
    NOTA: As seguintes entradas são necessárias para esta etapa: a matriz de expressão gênica normalizada desenvolvida nos passos 1.1–1.4; uma rede de interação proteína-proteína (PPI) formatada como uma lista de arestas (pares geneA-geneB); um arquivo de anotação de amostra (metadados) especificando rótulos de condição biológica para cada amostra. A rede PPI é compartilhada como um objeto R e foi construída com base no banco de dados de proteínas iRefIndex. A versão usada neste protocolo inclui todas as interações diretas, mas auto-loops e múltiplas arestas foram excluídos. A rede de IBPs contém 15.608 proteínas e 180.044 interações. Para detalhes adicionais, veja a seção4 de NetDecoder-Methods.
    1. Abra o script NetDecoder Edge Weighted Network (EWN) (HuLiLab/NetDecoder_Example/input/NetDecoder_Create_EWN. R, acessível em https:/github.com/HuLiLab/NetDecoder_Example/tree/main)4, em uma plataforma de desenvolvimento R.
    2. Edite as partes do script, indicadas pelos comentários (e em itálico abaixo), para definir caminhos e arquivos de entrada específicos do usuário para o desenvolvimento do EWN.
      caminho<~/NetDecoder_Example/entrada/
      Esse é o caminho para o diretório de trabalho
      expQuery <- get(load("expBreastCancer_15Set2014.R"))
      Este é um exemplo de um objeto Rdata de matriz de expressão normalizada
      stQuery < read.csv("stBreastCancer.csv")
      Estes são os metadados de exemplo
    3. Filtre a matriz de expressão para reter apenas genes presentes na rede PPI.
    4. Para cada condição, subconjunto amostra por fenótipo e calcula correlações geno-gene par a par em todas as arestas definidas na rede PPI usando correlação de Pearson. Calcule as correlações usando a matriz de expressão processada e normalizada gerada na etapa 1.4.
    5. Para cada par de genes, calcule o coeficiente de correlação, a correlação absoluta e o valor p associado.
    6. Remova casos incompletos (por exemplo, valores NA).
    7. Exporte uma rede ponderada por arestas por condição como um arquivo delimitado por tabulação (sem cabeçalho) com as seguintes colunas: proteinA, proteinB, abs_cor, cor e pvalue.
    8. Execute o script R para criar redes de coexpressões para todas as condições relevantes.

2. Instalação e Configuração do NetDecoder

  1. Baixe NetDecoder
    1. Acesse o software NetDecoder em (https://netdecoder.hulilab.org/#ver), escolhendo R ou Java.
  2. Instale o software necessário
    1. Instale o Oracle JDK e R para ambientes de trabalho/análise.
    2. Instale os pacotes R necessários conforme listado na documentação do NetDecoder, usando o Bioconductor (https://netdecoder.hulilab.org/#ver)4.
  3. Dependências de download
    1. Baixe as dependências necessárias para o NetDecoder, que incluem dados de ontologia gênica (acessíveis pela https://geneontology.org/docs/download-ontology/), assim como o guia de referência de associação gênica (acessível pela https://www.ebi.ac.uk/GOA/human_release).
  4. Configurar o diretório de trabalho
    1. Mova todos os arquivos baixados (dados de expressão, redes de coexpressões geradas para cada condição, dados de ontologia genética e guia de referência de associação) para uma única pasta, que será o diretório de trabalho NetDecoder.
  5. Adicionar a pasta necessária
    1. Baixe a pasta NetDecoder (https://netdecoder.hulilab.org/wp-content/uploads/2025/07/NetDecoder_Example.zip) para o diretório de trabalho NetDecoder.
    2. Descompacte a pasta NetDecoder.

3. Executando NetDecoder

  1. Abra o script de análise bash
    1. Abra um terminal rodando GNU Bash e navegue até o diretório de trabalho NetDecoder.
    2. Execute o comando nano NetDecoder_Analysis.sh para abrir o script bash.
  2. Modificar os scripts
    NOTA: A maior parte do código já está escrita. Nessa etapa, os parâmetros necessários são especificados no script nos locais indicados.
    1. Faça um nome curto:
      Edite a parte em itálico para que as condições estejam sendo comparadas: myshortname='Your_shortname_here'
    2. Defina caminhos de software:
      Edite as seguintes três definições de caminho para os caminhos corretos editando as partes em itálico:
      JAVA="/seu/caminho/aqui"
      exportar: R="/seu/caminho/aqui"
      pseudônimo R="/seu/caminho/aqui"
    3. Definir diretório de trabalho:
      Edite a parte em itálico para ser o diretório de funcionamento de onde todos os arquivos serão acessados: INPUT_DIR="/seus/caminho/aqui"
    4. Definir a biblioteca NetDecoder:
      Edite a parte em itálico para ser o caminho para a biblioteca NetDecoder instalado no passo 2.4 a partir do arquivo zip: LIB_DIR="/seus/caminho/aqui/netdecoder_lib"
    5. Ontologia do gene de conjunto e caminhos de associação:
      Edite as seguintes partes em itálico dos dois diretórios para as localizações dos arquivos de ontologia/associação genética preferenciais.
      SYMBOL=$LIB_DIR/gene_association_file
      GO=$INPUT_DIR/gene_ontology_file
    6. Argumentos de entrada de estabelecimento:
      Atualize as partes em itálico das cinco linhas seguintes de acordo com os dados, conforme as instruções comentadas encontradas no script de referência NetDecoder.
      geneList=$INPUT_DIR/gene_file
      state_trt=Condição Tratada
      state_ref=Condição de Referência

      PPI_trt=$INPUT_DIR/treated_co_expression_network_file
      PPI_ref=$INPUT_DIR/referência_co_expression_network_file
    7. Defina o cenário adequado:
      Remova o comentário (removendo o símbolo #) da fase desejada de execução e comente novamente assim que a fase estiver concluída. A primeira etapa é a gen_net_trt, seguida pela gen_net_ref, depois a fase de análise e, por fim, a etapa de coleta.
      Defina o palco desejado a ser executado, começando pelo primeiro estágio.
      #STAGE="gen_net_trt"
      #STAGE="gen_net_ref"
      #STAGE="análise"
      #STAGE="coletar"
    8. Navegue até o terminal principal do Bash:
      Pressione Ctrl+X, depois Y, para salvar e sair do script bash.
  3. Executar NetDecoder
    NOTA: Se rodar com sucesso, mensagens de registro aparecem no terminal.
    1. Navegue até o terminal e corra ./NetDecoder_Analysis.sh.
    2. Execute as etapas na ordem listada no passo 3.2.7 até que as quatro sejam concluídas individualmente.
  4. Recuperar resultados
    1. Navegue até os arquivos de saída e resumos gráficos.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Como mostrado na Figura 1, o NetDecoder opera por meio de um fluxo de trabalho estruturado composto por processamento de dados, configuração de rede e análise baseada em fluxo, com as saídas organizadas em diretórios distintos correspondentes a cada estágio do pipeline. Essa estrutura modular permite a validação sistemática das saídas, garantindo que os resultados possam ser rastreados até cada etapa computacional e apoiando a reprodutibilidade geral.

A execução bem-sucedida do NetDecoder (Figura 2) produz saídas em quatro diretórios (análise, coletar, redes e "your_shortname") contendo dados correspondentes a várias condições, incluindo números e saídas quantitativas para valores de fluxo, sub-redes e outras saídas fluxo-interação (Figura 1, Figura 2 e Figura 3). A presença de arquivos e figuras preenchidos entre esses diretórios indica que o pipeline foi executado corretamente. Em contraste, execuções fracassadas são caracterizadas por resultados ausentes e/ou números incompletos. Como o NetDecoder avalia milhares de genes dentro de uma rede PPI, execuções bem-sucedidas normalmente exigem várias horas de cálculo, dependendo do tamanho do conjunto de dados e dos recursos disponíveis. Para a análise representativa do câncer do trato biliar humano apresentada aqui, a execução do NetDecoder exigiu um tempo de execução de aproximadamente 4–6 horas na estação de trabalho Puget3 (Puget Systems) baseada em Linux. Tempos de execução incomumente curtos podem indicar dados de entrada formatados incorretamente ou execução incompleta do pipeline. Dados de entrada formatados incorretamente ou falha na execução do pipeline podem resultar em mensagens de erro que podem ser rastreadas até a causa do problema. A Figura 3 ilustra saídas representativas que estão presentes após a execução bem-sucedida do NetDecoder. A análise representativa apresentada aqui utilizou dados de sequenciamento de RNA de 255 amostras de câncer do trato biliar (OEP001105)6, permitindo a comparação dos estados doençais dos estágios I–II e III–IV e do fluxo alterado de informações entre as condições.

Os três mapas de calor na Figura 4 resumem as mudanças gerais no fluxo de informação da rede entre genes em diferentes condições, incluindo genes roteadores que transmitem fluxo substancial de informação dentro da rede, genes-alvo importantes a jusante ou genes gerais altamente impactados. Uma ampla distribuição de fluxo diferencial positivo e negativo indica que a informação é redistribuída pela rede, em vez de aumentada ou diminuída uniformemente. Essa heterogeneidade e variedade de tipos de genes apoiam a capacidade do NetDecoder de identificar genes com importância funcional alterada entre fenótipos.

A Figura 4 também mostra gráficos de barras em nível de aresta que quantificam mudanças de fluxo para interações individuais gene-gene entre pares entre condições. Esses resultados demonstram que o fluxo através de interações específicas pode variar entre condições, refletindo a reprogramação da rede dependente do contexto. Assim, o fluxo de borda captura mudanças em nível de interação na transferência de informação, enquanto o fluxo diferencial fornece um resumo em nível de nó dessas mudanças, permitindo a priorização dos genes com a maior mudança geral na influência da rede.

Juntos, esses resultados demonstram que o NetDecoder captura alterações de gene (nível de nó), gene-gene (nível de borda) e de nível de rede no fluxo de informação dentro de redes biológicas (Figura 4). Os mapas de calor identificam genes com propagação, roteamento e recepção de informação alterados na rede, enquanto análises em nível de borda revelam as interações específicas que impulsionam essas mudanças. As redes de informação específicas de fenótipo fornecem uma representação visual da reconfiguração da rede entre condições, onde os nós representam genes e a espessura das arestas corresponde à magnitude do fluxo de informação (Figura 4). Essa representação em nível de sistema apoia a identificação de genes reguladores chave e vias associadas às condições estudadas. Além disso, a produção bem-sucedida desses números indica que o NetDecoder foi executado corretamente.

Como o NetDecoder produz um grande número de arquivos de saída, identificar os resultados mais relevantes é essencial para a interpretação. Por exemplo, para examinar diferenças de fluxo entre condições (por exemplo, estágio baixo vs. estágio alto), dois arquivos-chave podem ser usados (os passos de navegação são guiados pela estrutura de arquivos da Figura 3). A primeira, "EDGE_CENTERED_SUBNET_flowDifference_Doença.txt" (localizada no diretório de análise/Doença ), identifica interações (bordas) com as maiores mudanças no fluxo entre condições. O segundo, "flowDifference_PRIORITIZED_NETWORK.txt" (localizado no diretório "your_shortname"), identifica genes (nós) com as maiores diferenças de fluxo. Juntos, esses arquivos fornecem uma visão abrangente tanto das mudanças no comportamento da rede tanto em nível de interação quanto em nível de gene.

De forma mais ampla, a pasta "análise" contém informações sobre roteadores de rede, alvos-chave e genes importantes de fluxo diferencial. A pasta "your_shortname" contém arquivos de texto bruto com dados específicos do fenótipo, como valores de fluxo total e alvos de chave e roteadores. A pasta redes contém as subredes geradas pelo NetDecoder, que podem ser analisadas e visualizadas posteriormente no Cytoscape7. Por fim, a pasta "coletar" contém dados e números consolidados que fornecem um resumo geral dos resultados. Visualizações e análises adicionais dos resultados do NetDecoder podem ser realizadas usando pacotes R como ggplot2, igraph, pheatmap, etc.

figure-results-1
Figura 1: Representação do Pipeline NetDecoder e funcionalidades gerais. O NetDecoder requer três estágios gerais (caixa amarela): processamento de dados, configuração do NetDecoder e execução do NetDecoder. Cada etapa dessas etapas deve ser seguida de perto para garantir resultados bem-sucedidos. O NetDecoder requer dados de expressão de duas condições (exemplos na caixa verde) para prever quais genes podem estar associados a alto fluxo de informação e utilidade gênica. Na analogia da torneira d'água, os níveis de expressão gênica são ilustrados pelo tamanho da torneira, ou seja, quão largamente ela pode abrir, enquanto a utilidade ou atividade do gene reflete o fluxo real de água que passa pela torneira, ilustrando o quanto essa rota está sendo funcionalmente utilizada. Como mostrado na figura, um gene altamente expresso (tamanho grande da torneira) pode ter baixa utilidade gênica (baixo fluxo de água), enquanto um gene com baixo nível de expressão (tamanho pequeno da torneira) pode ter alta utilidade gênica (altos níveis de fluxo de água). Isso ilustra como os genes podem ter maior importância geral em uma determinada condição, mesmo que os níveis de expressão sejam menores que os de outro gene. A ilustração no centro inferior mostra como os genes podem estar interconectados e experimentar diferentes níveis de fluxo (cor), independentemente de quanto eles sejam expressos (tamanho). Criado no BioRender. Blissenbach, E. (2026) https://BioRender.com/8okynbu. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-2
Figura 2: Fluxo de Trabalho Geral do NetDecoder. O princípio central do algoritmo NetDecoder é modelar a utilidade gênica em uma rede de interação proteína-proteína (PPI) por meio da análise de fluxo de informação. O fluxo de trabalho começa com o pré-processamento de dados e a construção de redes ponderadas em borda (EWN). Dados de expressão gênica de duas condições biológicas, fenótipo 1 (P1) e fenótipo 2 (P2), são processados para identificar genes de origem utilizando abordagens de expressão diferencial ou de correspondência de moldes. Matrizes de expressão normalizadas são então usadas para construir EWNs específicas para cada condição, onde os pesos das arestas refletem relações entre pares de genes em cada fenótipo. O NetDecoder subsequentemente quantifica diferenças no fluxo de informação entre condições, permitindo a identificação de eventos de reprogramação da rede e alterações na utilidade do gene. Os resultados incluem pontuações diferenciais de fluxo de informação, redes de informação específicas para contexto, mapas de calor de impactos e métricas adicionais em nível de rede e gene que facilitam a interpretação biológica a jusante e a descoberta mecanicista. Criado no BioRender. Correia, C. (2026) https://BioRender.com/29cmswf. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-3
Figura 3: Saídas e Estrutura de Pastas. Este diagrama representa a estrutura de diretórios de saída usada para acessar arquivos de resultados para interpretação. Representados em itálico estão os nomes das pastas (nos ícones de pasta), sendo os entre aspas específicos da nomenclatura de análise. Valores nos ícones da caixa de entrada indicam arquivos ou tipos de arquivo, dependendo da codificação por cores. Vermelho indica os tipos de arquivos que podem ser encontrados em cada pasta, enquanto arquivos-chave são mostrados em negrito e sublinhados (flowDifference_PRIORITIZED_NETWORK.txt e EDGE_CENTERED_SUBNET_flowDifference_Doença.txt). Os ícones das pastas foram originados de icons8 (https://icons8.com). Criado no BioRender. Blissenbach, E. (2026) https://BioRender.com/8okynbu. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-4
Figura 4: Exemplo de resultados gerados pelo NetDecoder. Genes de impacto (A), roteadores de rede (B) e heatmaps de alvos-chave (C), assim como redes específicas de contexto (D) e gráficos de barras de fluxo de arestas (E), são saídas chave do NetDecoder. Neste exemplo, um conjunto de dados de expressão do câncer do trato biliar (OEP001105) foi usado para comparar pacientes com doença em estágio inicial (estágios I-II, baixo) e doença em estágio avançado (estágios III-IV, alto), e o NetDecoder foi aplicado para identificar genes com alta informação diferencial entre os dois grupos. Cada gráfico mostra vermelho indicando aumento do fluxo e azul indicando diminuição do fluxo. Roteadores de rede (B) são genes-chave intermediários onde grandes quantidades de fluxo passam (coletar/Disease_Network_routers.pdf), alvos-chave (C) são reguladores importantes a jusante (coletar/Disease_Key_targets.pdf), e o mapa de calor da diferença de fluxo representa a mudança geral no fluxo de informação em nível de gene entre condições (análise/flowDifference_heatmap.pdf). Uma rede de informação específica para fenótipo (D) pode ser visualizada, com cada gene representando um nó e as interações gene-gene representadas como arestas (linhas) (análise/EDGE_CENTERED_SUBNET_Disease). A espessura das bordas corresponde à magnitude do fluxo de informação entre os genes. O gráfico de barras (E) mostra diferenças no fluxo de arestas entre as interações gene-gene entre os dois fenótipos selecionados, com pares de estágios baixos representados em azul-petróleo e pares de estágios altos em laranja (análise/Disease_keyEdges.pdf). Por favor, clique aqui para ver uma versão ampliada desta figura.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo descreve a implementação do NetDecoder, uma estrutura de rede-biologia que integra dados de expressão gênica com redes de interação proteína-proteína (PPI) para modelar o fluxo de informação específico da condição e priorizar genes com base em sua influência funcional dentro dos sistemas biológicos. A aplicação bem-sucedida desse método depende de várias etapas críticas, escolhas metodológicas cuidadosas e a interpretação adequada dos resultados.

As etapas iniciais do protocolo incluem a recuperação de dados de expressão, geração de metadados e construção de uma matriz de expressão unificada. Essas etapas são críticas para garantir a compatibilidade com análises a jusante. A matriz de expressão deve ser formatada com genes como linhas e amostras como colunas, com nomes de amostras na matriz e arquivo de metadados correspondendo de forma idêntica. Quaisquer inconsistências nessa etapa (por exemplo, identificadores de amostra incompatíveis ou nomes de genes duplicados) se propagarão pelo pipeline e resultarão em falhas em etapas posteriores.

Filtrar dados de baixa qualidade (por exemplo, genes com pouca contagem, valores ausentes ou genes de baixa variância) é particularmente importante, pois essas características podem introduzir ruído na construção de redes baseadas em correlação. Uma etapa de pré-processamento bem-sucedida é indicada por uma matriz de expressão limpa, sem valores faltantes e identificadores genéticos consistentes que correspondem aos usados na rede PPI.

Um ponto chave de decisão no protocolo é a escolha entre análise diferencial de expressão e correspondência de modelos para selecionar genes de origem usados na construção da Edge Weighted Network (EWN). A análise diferencial de expressão é mais adequada ao comparar grupos experimentais bem definidos com réplicas suficientes. Essa abordagem identifica genes com mudanças estatisticamente significativas na expressão entre condições e fornece resultados quantitativos como a variação de log2 fold (log2FC) e valores p ajustados. A execução bem-sucedida é indicada por uma distribuição de genes significativos e não significativos, em vez de resultados uniformemente nulos. Em contraste, a correspondência de modelos é mais adequada quando o objetivo é identificar genes com padrões de expressão correlacionados com um perfil contínuo ou de referência. Esse método mantém genes baseados na força de correlação, e não na magnitude da expressão diferencial. Uma etapa bem-sucedida de correspondência de modelos resulta em um conjunto de genes com correlações estatisticamente significativas com a condição de referência. A escolha entre essas abordagens afeta a topologia da rede a jusante; A expressão diferencial enfatiza mudanças de magnitude, enquanto o ajuste de modelos enfatiza padrões coordenados de expressão.

A etapa de construção do EWN é um dos componentes mais críticos do protocolo. Aqui, dados normalizados de expressão gênica são integrados a uma rede PPI para calcular correlações gene-gene par a par para todas as interações presentes na rede. Apenas genes compartilhados entre o conjunto de dados de expressão e a rede PPI são mantidos, garantindo relevância biológica e consistência computacional. Para cada condição, os coeficientes de correlação de Pearson são calculados em todas as arestas, juntamente com os valores p correspondentes e valores de correlação absoluta. Essas métricas definem os pesos das arestas usados pelo NetDecoder. A construção bem-sucedida de EWN é indicada por milhares de correlações gene-gene, ampla distribuição de valores de correlação e valores mínimos ausentes após a filtragem. A falha nessa fase geralmente ocorre devido a identificadores gênicos inadequados, tamanho insuficiente da amostra ou dados de expressão normalizados de forma inadequada. Pontos comuns de falha do NetDecoder podem frequentemente ser resolvidos por meio de verificação metódica dos arquivos de entrada e da configuração do software. Se o NetDecoder terminar inesperadamente ou produzir saídas incompletas, os usuários precisarão verificar se os identificadores de amostra são idênticos entre matrizes de expressão e arquivos de metadados, que os identificadores de genes são consistentes entre conjuntos de dados de expressão, listas de genes de origem e rede PPI, e que as matrizes de expressão não contêm valores ausentes. Se ocorrerem erros ou resultados truncados, os usuários podem verificar a compatibilidade de instalação e versões do software, inspecionar mensagens de log geradas durante a execução e confirmar a conclusão bem-sucedida de cada etapa intermediária antes de prosseguir para análises posteriores. A inspeção dos arquivos de saída e/ou das mensagens do console pode ajudar a localizar a origem de um erro antes que análises subsequentes sejam tentadas. O NetDecoder exige uma configuração meticulosa dos caminhos dos arquivos, argumentos de entrada e dependências. Passos-chave incluem especificar os caminhos de diretório e biblioteca de trabalho, ontologia genética e arquivos de anotação, entradas EWN específicas para condição e listas de genes fonte.

Como o pipeline é executado em etapas (geração de rede de ambas as condições, análise e coleta de resultados), erros em estágios anteriores impedirão a conclusão bem-sucedida dos seguintes. Uma execução funcional corretamente produz quatro diretórios (análise, coletar, redes, "your_shortname"), cada um contendo resultados específicos de cada condição. Outro indicador prático de execução correta é o tempo de execução. Execuções bem-sucedidas normalmente exigem várias horas para serem processadas porque o NetDecoder avalia grandes redes de interação; Tempos de execução extremamente curtos frequentemente indicam entradas mal configuradas ou etapas computacionais puladas.

O NetDecoder difere fundamentalmente das abordagens tradicionais de priorização gênica e análise de rede. Métodos como a Weighted Gene Co-expression Network Analysis (WGCNA)8 agrupam genes baseados na estrutura de correlação, mas não incorporam fluxo direcional nem quantificam como a informação se propaga através de uma rede. De forma semelhante, análises de enriquecimento devias identificam superrrepresentação funcional, mas não levam em conta dinâmicas em nível de interação ou mudanças na conectividade da rede.

O NetDecoder utiliza uma abordagem integrada combinando dados de expressão gênica com redes PPI para modelar o fluxo de informação específico de cada condição. Ao quantificar tanto as pontuações individuais dos genes (nível de nós) quanto as mudanças de fluxo de interação (nível de borda), ele captura como a estrutura da rede e o roteamento de informações são reconfigurados entre condições. Isso permite a identificação de genes que podem não apresentar forte expressão diferencial, mas ainda assim desempenham um papel central na mediação do comportamento da rede, consistente com o modelo de utilidade gênica (GUM)5, que postula que genes com alto fluxo de informação diferencial conduzem a função específica da rede da condição.

Apesar de seus pontos fortes, o NetDecoder apresenta várias limitações. Primeiro, é uma estrutura computacional que infere importância gênica com base no fluxo de informação modelado da rede, em vez de evidências experimentaisdiretas 10. Assim, suas previsões devem ser interpretadas como hipóteses que exigem validação por meio de experimentos biológicos. Abordagens de validação funcional, como estudos de knockout gênico11 ou ensaios de perturbaçãodirecionada 12, são essenciais para confirmar se genes identificados como de alta utilidade pelo NetDecoder realmente influenciam os processos biológicos ou estados de doença estudados. Segundo, o método depende fortemente da qualidade e completude da rede de PPI subjacente. Como bancos de dados de IBP frequentemente tendem a favorecer genes bem estudados, interações menos caracterizadas podem estar sub-representadas, potencialmente limitando a descoberta de novas relações regulatórias. A variabilidade no tamanho da amostra, no desenho experimental e na qualidade dos dados também pode influenciar a construção da rede e os cálculos de fluxo a jusante. Terceiro, o NetDecoder não assume que as arestas estáticas capturam totalmente o fluxo dinâmico de informação. Em vez disso, o NetDecoder infere atividade específica do contexto e quantifica o fluxo de informação usando uma rede PPI como prior estrutural, que serve como um andaime para definir o espaço de interações biologicamente plausíveis. O comportamento dinâmico é então introduzido sobrepor dados moleculares específicos de estado (por exemplo, expressão gênica), reponderando ou ativando efetivamente subconjuntos da rede de forma dependente do contexto.

O principal objetivo do NetDecoder é modelar a propagação da informação sobre um andaime estático de PPI, preservando relações quantitativas e contínuas entre genes (nós). Em contraste, abordagens como redes booleanas oferecem uma representação simplificada e interpretável da dinâmica ao modelar a atividade proteica como estados discretos ligado/desligado governados por interaçõeslógicas 13. Essas abordagens têm sido amplamente utilizadas para estudar redes reguladoras e de sinalização gênica sob condiçõesvariadas 14,15,16. No entanto, normalmente exigem regras lógicas pré-definidas e discretização dos estados proteicos, o que pode ser difícil de definir em larga escala para grandes redes biológicas heterogêneas dePPI. Nesse contexto, a modelagem de redes booleana representa uma direção complementar ao NetDecoder. Embora o NetDecoder capture fluxo contínuo e quantitativo de informações, integrar dinâmicas lógicas baseadas em regras ou modelos híbridos discreto-contínuo pode melhorar a interpretabilidade dos comportamentos de sinalização específicos de cada condição. Desenvolver algoritmos de fluxo de informação no estilo booleano, portanto, representa uma via promissora para trabalhos futuros.

As direções futuras do NetDecoder incluem a integração com tipos de dados ômicos adicionais e a expansão para transcriptômica de célula única para melhorar a resolução e o contexto biológico. Por exemplo, abordagens baseadas em aprendizado profundo para previsão e imputação de expressões transcriptômicas espaciais visam melhorar a qualidade dos dados e a recuperação de sinais, mas não modelam explicitamente o fluxo de informação entre redes de interação18,19. Incorporar níveis multi-ômicos de análise pode tanto aumentar ainda mais seu poder preditivo quanto levar a resultados mais confiáveis. Com o desenvolvimento metodológico contínuo, o NetDecoder será capaz de produzir múltiplas camadas de fluxo de informação, fornecendo aos pesquisadores validação multiômica para seus dados de interesse.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores não têm interesses financeiros concorrentes.
As ilustrações das Figuras 1 e 2 foram criadas com o BioRender (BioRender.com).

Agradecimentos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esse trabalho foi apoiado por bolsas do Centro de Descoberta Biomédica da Mayo Clinic, do Centro Abrangente de Câncer da Mayo Clinic (NIH; P30 CA015083), o Centro de Sinalização Celular em Gastroenterologia da Mayo Clinic (NIH: P30DK084567), a Fundação Glenn para Pesquisa Médica, a Fundação V para Pesquisa em Câncer (S.Z.), o Programa de Pesquisa em Nutrição e Obesidade da Mayo Clinic, o Programa de Imunologia e Imunoterapia do Câncer David F. e Margaret T. Grohne, a Schmidt Sciences e a Inovação e os Institutos Nacionais de Saúde (NIH; U19AG74879, P50CA136393, R01CA240323, R03OD038392).

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
AnnotationDbiBioconductorversão 1.68.0Anotação e mapeamento de genes
BioconductorBioconductorversão 3.19Framework para análise de dados transcriptômicos e ecossistema de pacotes que suporta DESeq2, edgeR, limma, AnnotationDbi e bancos de dados de organismos, etc.
CytoscapeThe Cytoscape Consoritumversão 3.10.4Visualização e análise de rede
DESeq2Bioconductorversão 1.46.0Análise de expressão diferencial (com modelagem binomial negativa)
dplyrPosit Software, PBC formerly RStudio, PBCversão 1.1.4Manipulação e transformação de dados
edgeRBioconductorversão 4.4.2Análise de expressão diferencial baseada em contagem
ggplot2Posit Software, PBC formerly RStudio, PBCversão 4.0.0Visualização e plotagem de dados
GNU BashGNU ProjectPadrão do sistemaBash, Execução de scripts do pipeline NetDecoder
igraphigraph Development Teamversão 2.1.4Construção de rede e análise de grafo
LimmaBioconductorversão 3.62.2Modelagem linear para análise de expressão gênica
NetDecoderHu Li Laboratory, Mayo Clinic(2024 Hu Li Lab)Construção de redes de interação proteica específicas ao contexto via modelagem de fluxo de informações
org.Hs.eg.dbBioconductorversão 3.20.0Banco de dados de anotação gênica humana
Oracle JDKOracle Corporationversão 1.8 ou superiorAmbiente de execução para execução do NetDecoder
pheatmapRaivo Koldeversão 1.0.13Visualização da estrutura de expressão e correlação
RThe R Foundationversão 4.4.2Ambiente central para análise transcriptômica e de rede

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

MedicineNetworkscontext specificmodellingtranscriptomicsflow algorithmintegration
Vídeo em breve

Artigos relacionados