Artículo de método

Protocolo NetDecoder para construir redes de interacción proteica específicas de contexto a partir de datos transcriptómicos utilizando modelado de flujo de información

DOI:

10.3791/70869

31 de julio de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aquí presentamos un protocolo para usar NetDecoder, una herramienta de modelado de redes, para construir redes de interacción proteica específicas del contexto y construir modelos de utilidad génica (GUMs). Utilizando datos transcriptómicos, en combinación con redes de interacción proteína-proteína (PPI) seleccionadas, NetDecoder permite identificar objetivos y subredes clave.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El análisis de expresión diferencial es una técnica comúnmente utilizada para determinar posibles objetivos terapéuticos, pero pasa por alto la complejidad de las redes génicas a través de las vías biológicas. A menudo, los genes altamente expresados no explican necesariamente las propiedades de un fenotipo biológico. NetDecoder, una herramienta de biología de redes que integra datos transcriptómicos con redes de interacción proteína-proteína (PPI) para modelar el flujo de información específico del contexto, la utilidad génica y los bordes clave y redes génicas utilizadas diferencialmente, se desarrolló para abordar esta limitación del análisis de expresión diferencial.

Este protocolo es una guía paso a paso para principiantes y accesible para el uso de NetDecoder, con directrices completas que abarcan el preprocesamiento de datos, la ejecución de NetDecoder y el análisis de salidas. El flujo de trabajo incluye la configuración de software, la construcción de redes y el análisis de modelado basado en flujos para cuantificar diferencias de interacción génica (nodo) y entre genes (a nivel de borde) entre condiciones biológicas. Los resultados resultantes incluyen objetivos y routers clave, subredes de flujo diferencial y distribuciones de flujo en los bordes, lo que permite identificar genes reguladores clave y vías asociadas a estados biológicos específicos. Tras seguir los pasos dobtuos, los investigadores podrán realizar investigaciones independientes para descubrir el flujo fenotípico de genes entre fenotipos utilizando datos transcriptómicos y redes de IBP seleccionadas.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La selección de genes y las vías asociadas para la investigación terapéutica suele estar impulsada por análisis de expresióndiferencial. Este método de análisis es eficaz para determinar cómo difiere la expresión génica entre dos o más condiciones. Sin embargo, los genes funcionan dentro de redes biológicas complejas e interconectadas, lo que significa que la expresión génica individual no captura completamente cómo interactúan los genes en una red ni sus relacionesgen-gen. Los métodos de propagación de redes integran la expresión génica con redes de interacción para identificar genes biológicamente importantes que podrían pasar desapercibidos solo por la expresióndiferencial 3. Los enfoques actuales no cuantifican explícitamente la importancia funcional de los genes ni cómo la información biológica se redistribuye dentro de las redes de interacción proteína-proteína (PPI) a través de condiciones biológicas. Por ello, era necesario un método para modelar el comportamiento específico de la red y cuantificar los cambios en el flujo de información entre sistemas biológicos. Para explicar cómo interactúan los genes dentro de una red biológica más amplia, se desarrolló NetDecoder, una plataforma de biología de redes, para descubrir genes con la mayor diferencia de flujo de información entre condiciones. NetDecoder utiliza un algoritmo de flujo guiado por procesos para traducir el conocimiento existente de la red humana PPI, en combinación con datos de secuenciación masiva de ARN, para construir un modelo de interacciones impulsadas por flujo de información4.

Utilizando datos de flujo de información para redes fenotípicas, se puede desarrollar un modelo de utilidad génica (GUM)5 para identificar genes con alto flujo de información como los que tienen la mayor utilidad génica global dentro de una red, independientemente de sus valores diferenciales de expresión. Este enfoque apoya estrategias de priorización de objetivos y la identificación más efectivas, proporcionando conocimientos que el análisis tradicional a menudo pasa por alto. A diferencia de los métodos tradicionales de expresión diferencial o redes basadas en correlación, NetDecoder cuantifica tanto los cambios génicos (a nivel de nodo) como los de interacción (a nivel de borde) en el flujo de información, permitiendo la identificación de genes funcionalmente importantes, incluso en ausencia de cambios de expresióngrandes 4,5. NetDecoder es ampliamente aplicable a conjuntos de datos de secuenciación masiva de ARN que implican análisis comparativos entre dos condiciones biológicas, permitiendo la identificación de cambios en el flujo de información y la organización de la red. Aunque NetDecoder soporta la integración de otros conjuntos de datos ómicos, incluyendo proteómica y epigenómica, el presente protocolo demuestra específicamente el flujo de trabajo utilizando datos transcriptómicos. En estas aplicaciones, los usuarios pueden definir genes fuente basándose en proteínas o genes regulados epigenéticamente, permitiendo iniciar el análisis del flujo de información a partir de estas características moleculares. Esta flexibilidad permite la incorporación de evidencia multiómica en análisis basados en redes y facilita el descubrimiento de mecanismos regulatorios intermodales que subyacen a las diferencias fenotípicas.

Los diseños comunes de estudio incluyen comparaciones binarias, incluyendo pero no limitándose a enfermedad frente a condiciones saludables, respondedores al tratamiento frente a no respondedores, tratamientos farmacológicos, experimentos knockdowns o knockouts frente a experimentos control, y análisis de transiciones de estado del desarrollo o celulares. El objetivo de este protocolo es ilustrar un marco reproducible para aplicar NetDecoder y descubrir genes con influencia alterada de la red a través de condiciones biológicas. Esto se consigue mediante pasos fáciles de seguir para configurar y ejecutar NetDecoder, así como ejemplos a seguir, técnicas básicas de resolución de problemas y métodos para la interpretación de resultados que también se detallan en el protocolo.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio utilizó conjuntos de datos de secuenciación de ARN disponibles públicamente y no involucró directamente a sujetos humanos o animales. Por lo tanto, no se requería la aprobación del comité de revisión institucional ni el consentimiento informado.

NOTA: NetDecoder requiere los siguientes archivos de entrada: expresión génica normalizada a través de dos condiciones biológicas definidas; un archivo de metadatos que describe las condiciones biológicas; una lista de genes fuente para la construcción y modelado de redes; una red de interacción proteína-proteína (IBP) del dominio público; y una red ponderada por bordes (EWN) construida para cada condición biológica.

1. Preparación de datos

  1. Recuperar datos y metadatos de la secuenciación de ARN a granel
    1. Descarga datos de secuenciación de ARN (matriz de recuentos de expresión génica en bruto y nombres de muestras) y metadatos correspondientes (nombres de muestras, condiciones, etc.) de un repositorio público, como el Gene Expression Omnibus (GEO), o utiliza conjuntos de datos experimentales generados en laboratorio. Normalmente, se trata de una matriz en la que las filas corresponden a nombres de genes y columnas a nombres de muestras.
      NOTA: El conjunto de datos de ejemplo utilizado para demostrar este protocolo se obtuvo del repositorio de la National Omics Data Encyclopedia (NODE) (base de datos BioSino) bajo la OEP0011056. Los usuarios pueden sustituir sus propios conjuntos de datos de secuenciación de ARN a granel.
    2. Generar un archivo de anotación de muestra (metadatos) incluyendo nombres de muestras y sus grupos o condiciones asociadas; Por ejemplo, "control" y "enfermedad" son tipos de condiciones comunes. Confirma que los nombres de las muestras coinciden entre los archivos de metadatos y expresión.
  2. Datos agregados de expresiones y metadatos
    1. Asegúrese de que la matriz de datos generada incluya recuentos de expresiones, nombres de genes y un archivo de metadatos con nombres de muestras y condiciones. Si es necesario, usa un paquete R como org. Hs.eg.db (humano) o AnnotationDbi para coincidir con diferentes identificadores génicos.
    2. Elimina la información no esencial del archivo de metadatos usando R o un lenguaje de programación similar.
    3. Combina la información de los archivos de conteo de expresiones en un solo archivo para facilitar la manipulación.
  3. Datos de expresión de filtros
    1. Preprocesa la matriz de datos de expresión génica excluyendo duplicados génicos, valores nulos (NA), bajas expresiones (<10 conteos totales) y/o genes de baja varianza, etc.
  4. Preprocesamiento de datos
    1. Normalización por secuenciación de ARN y análisis de expresión diferencial
      NOTA: Este paso es uno (1.4.1) de dos (1.4.2) enfoques para seleccionar genes para la creación de redes ponderadas en bordes (EWN) y la selección de genes fuente (pasos 1.5–1.6) al comenzar el análisis a partir de datos de secuenciación masiva de ARN. Como alternativa, se puede utilizar la coincidencia de plantillas basada en correlación de Pearson saltando al paso 1.4.3.
      1. Realiza conversiones de identificación génica en esta etapa usando el paquete R, AnnotationDbi, en conjunto con los paquetes individuales de organismos. NetDecoder utiliza símbolos genéticos (es decir, ID Genético) que coinciden con el PPI de ejemplo.
      2. Realizar normalización y análisis de expresión diferencial entre dos condiciones utilizando los paquetes R limma, edgeR, DESeq2 o herramientas similares.
      3. Si usas DESeq2, construye un conjunto de datos DESeq usando la función DESeqDataSetFromMatrix() con una matriz de recuento (genes y muestras) y metadatos de muestra (condiciones) como entrada.
      4. Utiliza la función DESeq() con los ajustes predeterminados en el objeto creado en el paso 1.4.1.3 para calcular valores diferenciales de expresiones.
      5. Guarda los resultados en una matriz de datos con identificadores de genes (ID de gen) como nombres de filas y salidas clave incluyendo el cambio de fold log2 (log2FC), el valor p y el valor p ajustado como columnas.
      6. Opcionalmente, filtrar los resultados por valores p ajustados (<0,05) y/o valores log2FC (por ejemplo: |log2FC| > 1) usando dplyr o una herramienta similar.
      7. Asegúrese de que todas las listas de genes procesadas y matrices de cambio de fold log2 se exporten como archivos delimitados por tabulación (.txt o .csv) para su entrada en NetDecoder.
      8. Realizar comparaciones por pares para el paso 1.4.1 si se usan más de 2 condiciones biológicas y obtener resultados por pares usando la función results() del objeto DESeq generado en el paso 1.4.1.5.
    2. Normalización de expresión en microarrays - Opcional
      NOTA: Si se utilizan datos de microarrays, realice este paso para la normalización de datos.
      1. Normaliza los datos abriendo el script de normalización NetDecoder (HuLiLab/NetDecoder_Example/raw_data/NetDecoder_normalize. R), accesible desde https://github.com/HuLiLab/NetDecoder_Example/tree/main, en una plataforma de desarrollo R y editar la parte en cursiva para que coincida con el directorio de trabajo que contiene archivos de intensidad de celda (CEL).
        setwd(~/NetDecoder_Example/raw_data/CEL_files)
    3. Coincidencia de plantillas - Opcional
      NOTA: Este es el segundo enfoque opcional si no se realiza el análisis diferencial de expresión (como se expone en los pasos 1.1–1.4.1 de "Preparación de Datos").
      1. Para datos de secuenciación de ARN que no se procesan mediante limma, edgeR y DESeq2, realice la normalización externamente antes de aplicar la compatibilidad de plantillas. Para los datos de microarrays, utilice directamente los valores de expresión normalizados generados en los pasos 1.1–1.4.2.
      2. Elige la condición de control como plantilla base para la expresión génica y compara los valores normalizados de expresión génica de todas las demás condiciones de interés.
      3. Calcular los coeficientes de correlación de Pearson entre el perfil de expresión de cada gen y la plantilla seleccionada. Se recomienda conservar genes que presenten correlaciones estadísticamente significativas (p < 0,05) y un coeficiente absoluto de correlación por encima de un umbral definido por el usuario (como |r| > 0,7).
  5. Selección de genes fuente
    NOTA: La entrada para este paso consiste en la matriz de expresión génica normalizada desarrollada en los pasos 1.1–1.4.
    1. Elige un conjunto de genes significativos para usarlos como genes fuente. Para flujos de trabajo diferenciales basados en expresiones, elige umbrales ajustados de valor p y log2FC (como el valor p adj < 0,05 y |log2FC| > 2). Para los flujos de trabajo de emparejamiento de plantillas, selecciona los genes fuente de los genes significativamente correlacionados identificados en el paso 1.4.3.3 utilizando los umbrales de correlación y significancia elegidos. Se deben elegir umbrales para obtener aproximadamente entre 300 y 1.000 genes para la construcción de redes aguas abajo.
      NOTA: Los genes fuente son donde comienza y se propaga el flujo de información a través de la red.
  6. Construye una red ponderada por bordes (EWN) para cada fenotipo
    NOTA: Se requieren las siguientes entradas para este paso: la matriz de expresión génica normalizada desarrollada en los pasos 1.1–1.4; una red de interacción proteína-proteína (PPI) formateada como una lista de aristas (pares geneA-geneB); un archivo de anotación de muestra (metadatos) que especifica etiquetas de condiciones biológicas para cada muestra. La red PPI se comparte como un objeto R y fue construida a partir de la base de datos de proteínas iRefIndex. La versión utilizada en este protocolo incluye todas las interacciones directas, pero se excluyeron los autobucles y múltiples aristas. La red de IBP contiene 15.608 proteínas y 180.044 interacciones. Para más detalles, véase la sección4 de NetDecoder-Methods.
    1. Abre el script NetDecoder Edge Weighted Network (EWN) (HuLiLab/NetDecoder_Example/input/NetDecoder_Create_EWN. R, accesible desde https:/github.com/HuLiLab/NetDecoder_Example/tree/main)4, en una plataforma de desarrollo R.
    2. Edita las partes del script, indicadas por comentarios (y en cursiva abajo), para establecer rutas y archivos de entrada específicos para el usuario y el desarrollo de EWN.
      camino<~/NetDecoder_Example/entrada/
      Este es el camino hacia el directorio de trabajo
      expQuery <- get(load("expBreastCancer_15Set2014.R"))
      Este es un ejemplo de un objeto Rdata de matriz de expresión normalizada
      stQuery < read.csv("stBreastCancer.csv")
      Estos son los metadatos de muestra
    3. Filtra la matriz de expresión para conservar solo los genes presentes en la red PPI.
    4. Para cada condición, subconjunto muestrea por fenotipo y calcula correlaciones gen-gen par a par en todas las aristas definidas en la red PPI usando correlación Pearson. Calcula las correlaciones usando la matriz de expresión procesada y normalizada generada en el paso 1.4.
    5. Para cada par de genes, calcula el coeficiente de correlación, la correlación absoluta y el valor p asociado.
    6. Elimina casos incompletos (por ejemplo, valores NA).
    7. Exporta una red ponderada por aristas por condición como un archivo delimitado por tabulación (sin cabecera) con las siguientes columnas: proteinA, proteinB, abs_cor, cor y pvalue.
    8. Ejecuta el script R para crear redes de coexpresiones para todas las condiciones relevantes.

2. Instalación y configuración de NetDecoder

  1. Descargar NetDecoder
    1. Accede al software NetDecoder en (https://netdecoder.hulilab.org/#ver), eligiendo R o Java.
  2. Instala el software necesario
    1. Instala Oracle JDK y R para entornos de trabajo/análisis.
    2. Instala los paquetes R necesarios según la documentación de NetDecoder, usando Bioconductor (https://netdecoder.hulilab.org/#ver)4.
  3. Dependencias de descarga
    1. Descarga las dependencias necesarias para NetDecoder, que incluyen datos de ontologías génicas (accesibles desde https://geneontology.org/docs/download-ontology/), así como la guía de referencia de asociaciones génicas (accesible desde https://www.ebi.ac.uk/GOA/human_release).
  4. Configurar el directorio de trabajo
    1. Mueve todos los archivos descargados (datos de expresión, redes de coexpresiones generadas para cada condición, datos de ontología génica y guía de referencia de asociaciones) a una sola carpeta, que será el directorio de trabajo NetDecoder.
  5. Añadir la carpeta necesaria
    1. Descarga la carpeta NetDecoder (https://netdecoder.hulilab.org/wp-content/uploads/2025/07/NetDecoder_Example.zip) en el directorio de trabajo NetDecoder.
    2. Descomprime la carpeta NetDecoder.

3. Ejecutar NetDecoder

  1. Abre el script de análisis bash
    1. Abre un terminal que ejecute GNU Bash y navega hasta el directorio de trabajo NetDecoder.
    2. Ejecuta el comando nano NetDecoder_Analysis.sh para abrir el script bash.
  2. Modificar los scripts
    NOTA: La mayor parte del código ya está escrito. En este paso, los parámetros requeridos se especifican en el script en las ubicaciones indicadas.
    1. Haz un nombre corto:
      Edita la parte en cursiva para que sean las condiciones que se están comparando: minombrecorto='Your_shortname_here'
    2. Establecer rutas de software:
      Edita las siguientes tres definiciones de camino para las rutas correctas editando las partes en cursiva:
      JAVA="/tu/path/here"
      exportar: R="/tu/camino/aquí"
      alias R="/tu/camino/aquí"
    3. Definir directorio de trabajo:
      Edita la parte en cursiva para que sea el directorio de trabajo desde donde se accederá a todos los archivos: INPUT_DIR="/tu/ruta/aquí"
    4. Set NetDecoder:
      Edita la parte en cursiva para que sea la ruta a la biblioteca NetDecoder instalada en el paso 2.4 desde el archivo zip: LIB_DIR="/tu/camino/aquí/netdecoder_lib"
    5. Ontología genética de conjunto y rutas de asociación:
      Edita las siguientes porciones en cursiva de los dos directorios para las ubicaciones de la ontología/archivos de asociación genética preferidos.
      SYMBOL=$LIB_DIR/gene_association_file
      GO=$INPUT_DIR/gene_ontology_ archivo
    6. Argumentos de entrada de conjunto:
      Actualizar las partes en cursiva de las siguientes cinco líneas según los datos, según las instrucciones comentadas que se encuentran en el script de referencia NetDecoder.
      geneList=$INPUT_DIR/gene_file
      state_trt=Condición tratada
      state_ref=Condición de referencia

      PPI_trt=$INPUT_DIR/treated_co_expression_network_file
      PPI_ref=$INPUT_DIR/reference_co_expression_network_file
    7. Establece el escenario adecuado:
      Elimina el comentario (eliminando el símbolo #) de la etapa deseada de ejecución y vuelve a comentarla una vez que la etapa esté completada. La primera etapa es gen_net_trt, seguida de gen_net_ref, luego la etapa de análisis y finalmente la etapa de recogida.
      Establece la fase deseada para ejecutarse, empezando por la primera fase.
      #STAGE="gen_net_trt"
      #STAGE="gen_net_ref"
      #STAGE="análisis"
      #STAGE="recoger"
    8. Navega hasta la terminal principal de Bash:
      Pulsa Ctrl+X, luego Y, para guardar y salir del script bash.
  3. Ejecutar NetDecoder
    NOTA: Si se ejecuta correctamente, aparecen mensajes de registro en el terminal.
    1. Navega hasta la terminal y corre ./NetDecoder_Analysis.sh.
    2. Ejecuta las etapas en el orden indicado en el paso 3.2.7 hasta que las cuatro se hayan completado individualmente.
  4. Resultados de recuperación
    1. Navega a los archivos de salida y resúmenes gráficos.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Como se muestra en la Figura 1, NetDecoder opera mediante un flujo de trabajo estructurado que consiste en procesamiento de datos, configuración de red y análisis basado en flujos, con salidas organizadas en directorios distintos correspondientes a cada etapa de la canalización. Esta estructura modular permite una validación sistemática de los resultados, asegurando que los resultados puedan rastrearse hasta cada paso computacional y apoyando la reproducibilidad general.

La ejecución exitosa de NetDecoder (Figura 2) produce salida en cuatro directorios (análisis, recogida, redes y "your_shortname") que contienen datos correspondientes a diversas condiciones, incluyendo cifras y salidas cuantitativas para valores de flujo, subredes y otras salidas de interacción flujo-interacción (Figura 1, Figura 2 y Figura 3). La presencia de archivos y cifras poblados en estos directorios indica que la tubería se ejecutó correctamente. En cambio, las ejecuciones fallidas se caracterizan por resultados faltantes y/o cifras incompletas. Debido a que NetDecoder evalúa miles de genes dentro de una red PPI, las ejecuciones exitosas suelen requerir varias horas de cálculo, dependiendo del tamaño del conjunto de datos y los recursos disponibles. Para el análisis representativo del cáncer del tracto biliar humano presentado aquí, la ejecución de NetDecoder requirió un tiempo de ejecución de aproximadamente 4–6 horas en la estación de trabajo Puget3 (Puget Systems) basada en Linux. Tiempos de ejecución inusualmente cortos pueden indicar datos de entrada mal formateados o ejecución incompleta de la canalización. Un formato incorrecto de datos de entrada o una ejecución fallida de la tubería pueden resultar en mensajes de error que pueden rastrearse hasta la causa del problema. La Figura 3 ilustra las salidas representativas que están presentes tras la ejecución exitosa de NetDecoder. El análisis representativo presentado aquí utilizó datos de secuenciación de ARN de 255 muestras de cáncer del tracto biliar (OEP001105)6, lo que permitió comparar los estados de enfermedad en estadios I–II y III–IV y el flujo alterado de información entre condiciones.

Los tres mapas de calor de la Figura 4 resumen los cambios generales en el flujo de información de la red entre genes a través de las condiciones, incluyendo genes router que transmiten un flujo sustancial de información dentro de la red, genes objetivo importantes aguas abajo o genes globales altamente impactados. Una amplia distribución de flujo diferencial positivo y negativo indica que la información se redistribuye a lo largo de la red, en lugar de aumentar o disminuir de forma uniforme. Esta heterogeneidad y variedad de tipos de genes apoyan la capacidad de NetDecoder para identificar genes con alteración de importancia funcional entre fenotipos.

La Figura 4 también muestra gráficos de barras a nivel de aristas que cuantifican los cambios de flujo para las interacciones individuales gen-gen entre parejas en distintas condiciones. Estos resultados demuestran que el flujo a través de interacciones específicas puede variar según las condiciones, reflejando el recableado de red dependiente del contexto. Así, el flujo de bordes captura los cambios a nivel de interacción en la transferencia de información, mientras que el flujo diferencial proporciona un resumen a nivel de nodo de estos cambios, permitiendo la priorización de genes con el mayor cambio global en la influencia de la red.

En conjunto, estos resultados demuestran que NetDecoder captura alteraciones en el flujo de información a nivel de red (a nivel de nodo), gen-gen (a nivel de borde) y a nivel de red en el flujo de información dentro de las redes biológicas (Figura 4). Los mapas de calor identifican genes con alteración en la propagación, enrutamiento y recepción de información en la red, mientras que los análisis a nivel de borde revelan las interacciones específicas que impulsan estos cambios. Las redes de información específicas por fenotipo proporcionan una representación visual del recableado de la red entre condiciones, donde los nodos representan genes y el grosor de las aristas corresponde a la magnitud del flujo de información (Figura 4). Esta representación a nivel de sistemas permite la identificación de genes reguladores clave y vías asociadas a las condiciones estudiadas. Además, la producción exitosa de estas figuras indica que NetDecoder se ha ejecutado correctamente.

Dado que NetDecoder produce un gran número de archivos de salida, identificar los resultados más relevantes es esencial para la interpretación. Por ejemplo, para examinar diferencias de flujo entre condiciones (por ejemplo, etapa baja vs. etapa alta), se pueden usar dos archivos clave (los pasos de navegación se guían por la estructura de archivos de la Figura 3). La primera, "EDGE_CENTERED_SUBNET_flowDifference_Enfermedad.txt" (ubicada en el directorio de análisis/Enfermedades ), identifica las interacciones (bordes) con los mayores cambios en el flujo entre condiciones. La segunda, "flowDifference_PRIORITIZED_NETWORK.txt" (ubicada en el directorio "your_shortname"), identifica los genes (nodos) con las mayores diferencias de flujo. En conjunto, estos archivos proporcionan una visión completa tanto de los cambios a nivel de interacción como de genes en el comportamiento de la red.

De forma más amplia, la carpeta "análisis" contiene información sobre routers de red, objetivos clave y genes importantes de flujo diferencial. La carpeta "your_shortname" contiene archivos de texto en bruto con datos específicos de cada fenotipo, como valores de flujo total y objetivos clave y routers. La carpeta de redes contiene las subredes generadas por NetDecoder, que pueden analizarse y visualizarse más a fondo en Cytoscape7. Finalmente, la carpeta "recoger" contiene datos y cifras consolidadas que proporcionan un resumen general de los resultados. Se puede realizar una visualización y análisis adicionales de los resultados de NetDecoder utilizando paquetes R como ggplot2, igraph, pheatmap, etc.

figure-results-1
Figura 1: Representación de la Pipeline NetDecoder y funcionalidad general. NetDecoder requiere tres etapas generales (caja amarilla): procesamiento de datos, configuración de NetDecoder y ejecución de NetDecoder. Cada paso de estas etapas debe seguirse de cerca para garantizar resultados exitosos. NetDecoder requiere datos de expresión de dos condiciones (ejemplos en la caja verde) para predecir qué genes pueden estar asociados con un alto flujo de información y utilidad génica. En la analogía del grifo de agua, los niveles de expresión génica se ilustran por el tamaño del grifo, es decir, lo ancho que puede abrirse, mientras que la utilidad o actividad génica refleja el flujo real de agua que entra por el grifo, ilustrando cuánto se está utilizando funcionalmente esta vía. Como se muestra en la figura, un gen altamente expresado (grifo grande) puede tener baja utilidad génica (bajo flujo de agua), mientras que un gen con bajo nivel de expresión (tamaño pequeño del grifo) puede tener una alta utilidad génica (altos niveles de flujo de agua). Esto ilustra cómo los genes pueden tener mayor importancia global en una condición determinada, incluso si los niveles de expresión son inferiores a los de otro gen. La ilustración en la parte inferior central muestra cómo los genes pueden estar interconectados y experimentar diferentes niveles de flujo (color), independientemente de cuánto se expresen (tamaño). Creado en BioRender. Blissenbach, E. (2026) https://BioRender.com/8okynbu. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-2
Figura 2: Flujo de trabajo general de NetDecoder. El principio fundamental del algoritmo NetDecoder es modelar la utilidad génica en una red de interacción proteína-proteína (PPI) mediante el análisis de flujo de información. El flujo de trabajo comienza con el preprocesamiento de datos y la construcción de redes ponderadas en bordes (EWN). Los datos de expresión génica de dos condiciones biológicas, fenotipo 1 (P1) y fenotipo 2 (P2), se procesan para identificar genes fuente utilizando enfoques de expresión diferencial o de compatibilidad de plantillas. A continuación, se utilizan matrices de expresión normalizadas para construir EWNs específicas de cada condición, donde los pesos de las aristas reflejan las relaciones de pares de genes en cada fenotipo. NetDecoder cuantifica posteriormente diferencias en el flujo de información entre condiciones, permitiendo la identificación de eventos de reconfiguración de red y alteraciones en la utilidad génica. Los resultados incluyen puntuaciones diferenciales de flujo de información, redes de información específicas para contexto, mapas de calor de puntuaciones de impacto y métricas adicionales a nivel de red y genética que facilitan la interpretación biológica posterior y el descubrimiento mecanicista. Creado en BioRender. Correia, C. (2026) https://BioRender.com/29cmswf. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-3
Figura 3: Salidas de NetDecoder y estructura de carpetas. Este diagrama representa la estructura de directorios de salida utilizada para acceder a los archivos de resultados y su interpretación. Representados en cursiva están los nombres de las carpetas (en los iconos de carpetas), siendo los entre comillas específicos de la nomenclatura de análisis. Los valores en los iconos de la bandeja de entrada indican archivos o tipos de archivo, dependiendo de la codificación de colores. El rojo indica los tipos de archivos que se pueden encontrar en cada carpeta, mientras que los archivos clave se muestran en negrita y subrayados (flowDifference_PRIORITIZED_NETWORK.txt y EDGE_CENTERED_SUBNET_flowDifference_Enfermedad.txt). Los iconos de las carpetas se obtuvieron de icons8 (https://icons8.com). Creado en BioRender. Blissenbach, E. (2026) https://BioRender.com/8okynbu. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-4
Figura 4: Ejemplo de resultados generados por NetDecoder. Los genes de impacto (A), los routers de red (B) y los mapas de calor de objetivos clave (C), así como las redes específicas de contexto (D) y los gráficos de barras de flujo de aristas (E), son salidas clave de NetDecoder. En este ejemplo, se utilizó un conjunto de datos de expresión del cáncer del tracto biliar (OEP001105) para comparar pacientes con enfermedad en estadio temprano (estadios I-II, bajos) y en estadio avanzado (estadios III-IV, alto), y se aplicó NetDecoder para identificar genes con alta información diferencial entre ambos grupos. Cada gráfico muestra rojo indicando aumento del caudal y azul indicando disminución del caudal. Los routers de red (B) son genes intermediarios clave por donde pasan grandes cantidades de flujo (recoger/Disease_Network_routers.pdf), los objetivos clave (C) son reguladores importantes aguas abajo (recoger/Disease_Key_targets.pdf), y el mapa de calor por diferencia de flujo representa el cambio global en el flujo de información a nivel génico entre condiciones (análisis/flowDifference_heatmap.pdf). Se puede visualizar una red de información específica del fenotipo (D), donde cada gen representa un nodo y las interacciones gen-gen representadas como aristas (líneas) (análisis/EDGE_CENTERED_SUBNET_Disease). El grosor de los bordes corresponde a la magnitud del flujo de información entre genes. El gráfico de barras (E) muestra diferencias en el flujo de aristas entre las interacciones gen-gen entre los dos fenotipos seleccionados, con pares de estadios bajos representados en azul verdoso y pares de estadios altos en naranja (análisis/Disease_keyEdges.pdf). Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo describe la implementación de NetDecoder, un marco de red-biología que integra datos de expresión génica con redes de interacción proteína-proteína (PPI) para modelar el flujo de información específico de la condición y priorizar genes según su influencia funcional dentro de los sistemas biológicos. La aplicación exitosa de este método depende de varios pasos críticos, elecciones metodológicas cuidadosas y una correcta interpretación de los resultados.

Las etapas iniciales del protocolo incluyen la recuperación de datos de expresión, la generación de metadatos y la construcción de una matriz de expresión unificada. Estos pasos son fundamentales para garantizar la compatibilidad con el análisis posterior. La matriz de expresión debe estar formateada con genes como filas y muestras como columnas, con nombres de muestras en la matriz y archivo de metadatos coincidiendo de forma idéntica. Cualquier inconsistencia en esta etapa (por ejemplo, identificadores de muestra desajustados o nombres de genes duplicados) se propagará a través de la tubería y provocará fallos en etapas posteriores.

Filtrar datos de baja calidad (por ejemplo, genes con pocos conteos, valores faltantes o genes de baja varianza) es especialmente importante, ya que estas características pueden introducir ruido en la construcción de redes basadas en correlación. Un paso de preprocesamiento exitoso se indica mediante una matriz de expresión limpia, sin valores faltantes y identificadores genéticos consistentes que coinciden con los utilizados en la red PPI.

Un punto clave de decisión en el protocolo es la elección entre análisis de expresión diferencial y la correspondencia de plantillas para seleccionar genes fuente utilizados en la construcción de Redes Ponderadas en Bordes (EWN). El análisis diferencial de expresión es más adecuado al comparar grupos experimentales bien definidos con réplicas suficientes. Este enfoque identifica genes con cambios estadísticamente significativos en la expresión entre condiciones y proporciona resultados cuantitativos como el cambio de pliegue log2 (log2FC) y valores p ajustados. La ejecución exitosa se indica mediante una distribución de genes tanto significativos como no significativos, en lugar de resultados uniformemente nulos. En cambio, la compatibilidad de plantillas es más adecuada cuando el objetivo es identificar genes con patrones de expresión correlacionados con un perfil continuo o de referencia. Este método retiene los genes basándose en la fuerza de correlación más que en la magnitud de la expresión diferencial. Un paso exitoso de comparación de plantillas produce un conjunto de genes con correlaciones estadísticamente significativas con la condición de referencia. La elección entre estos enfoques afecta a la topología de la red aguas abajo; La expresión diferencial enfatiza los cambios de magnitud, mientras que la coincidencia de plantillas enfatiza patrones de expresión coordinados.

El paso de construcción de EWN es uno de los componentes más críticos del protocolo. Aquí, los datos normalizados de expresión génica se integran con una red PPI para calcular las correlaciones gen-gen par a par para todas las interacciones presentes en la red. Solo se conservan los genes compartidos entre el conjunto de datos de expresión y la red de PPI, asegurando la relevancia biológica y la consistencia computacional. Para cada condición, se calculan los coeficientes de correlación de Pearson en todas las aristas, junto con los valores p correspondientes y valores de correlación absoluta. Estas métricas definen los pesos de las aristas que utiliza NetDecoder. La construcción exitosa de EWN se indica por miles de correlaciones gen-gen, una amplia distribución de valores de correlación y valores mínimos ausentes tras el filtrado. El fallo en esta etapa suele deberse a identificadores génicos incorrectos, tamaño de muestra insuficiente o datos de expresión normalizados incorrectamente. Los puntos comunes de fallo de NetDecoder a menudo pueden resolverse mediante verificación metódica de los archivos de entrada y la configuración del software. Si NetDecoder termina inesperadamente o produce salidas incompletas, los usuarios deberán comprobar que los identificadores de muestra sean idénticos entre matrices de expresión y archivos de metadatos, que los identificadores de genes sean consistentes entre conjuntos de datos de expresión, listas de genes fuente y red PPI, y que las matrices de expresión no contengan valores faltantes. Si se producen errores o resultados truncados, los usuarios pueden verificar la compatibilidad de instalación y versiones del software, inspeccionar los mensajes de registro generados durante la ejecución y confirmar la finalización exitosa de cada paso intermedio antes de pasar a los análisis posteriores. La inspección de los archivos de salida y/o los mensajes de consola puede ayudar a localizar la fuente de un error antes de intentar análisis posteriores. NetDecoder requiere una configuración meticulosa de rutas de archivos, argumentos de entrada y dependencias. Los pasos clave incluyen especificar los directorios y rutas de biblioteca de trabajo, los archivos de ontología y anotación génica, las entradas EWN específicas por condición y las listas de genes fuente.

Dado que la tubería se ejecuta por etapas (generación de condiciones en red, análisis y recogida de resultados), los errores en etapas anteriores impedirán la finalización exitosa de las siguientes. Una ejecución que funcione correctamente produce cuatro directorios (análisis, recogida, redes, "your_shortname"), cada uno con resultados específicos de cada condición. Otro indicador práctico de la ejecución correcta es el tiempo de ejecución. Las ejecuciones exitosas suelen requerir varias horas para procesarse porque NetDecoder evalúa grandes redes de interacción; Tiempos de ejecución extremadamente cortos a menudo indican entradas mal configuradas o pasos computacionales saltados.

NetDecoder difiere fundamentalmente de los enfoques tradicionales de priorización genética y análisis de redes. Métodos como el Análisis de Redes de Coexpresión Génica Ponderada (WGCNA)8 agrupan genes basados en la estructura de correlación, pero no incorporan el flujo direccional ni cuantifican cómo se propaga la información a través de una red. De manera similar, los análisis de enriquecimiento devías 9 identifican la sobrrepresentación funcional, pero no tienen en cuenta la dinámica a nivel de interacción ni los cambios en la conectividad de la red.

NetDecoder utiliza un enfoque integrado combinando datos de expresión génica con redes PPI para modelar el flujo de información específico de cada condición. Al cuantificar tanto las puntuaciones individuales de genes (a nivel de nodo) como los cambios de flujo de interacción (a nivel de borde), se captura cómo la estructura de la red y el enrutamiento de la información se reconfiguran entre condiciones. Esto permite identificar genes que pueden no mostrar una fuerte expresión diferencial, pero que siguen desempeñando un papel central en la mediación del comportamiento de la red, en consonancia con el modelo de utilidad génica (GUM)5, que postula que los genes con alto flujo de información diferencial impulsan la función específica de la red.

A pesar de sus fortalezas, NetDecoder presenta varias limitaciones. En primer lugar, es un marco computacional que infiere la importancia génica basándose en el flujo de información de red modelado en lugar de la evidencia experimentaldirecta 10. Por ello, sus predicciones deben interpretarse como hipótesis que requieren validación mediante experimentos biológicos. Los enfoques de validación funcional, como los estudios de knockoutgénico 11 o los ensayos de perturbacióndirigida 12, son esenciales para confirmar si los genes identificados como de alta utilidad por NetDecoder influyen realmente en los procesos biológicos o estados patológicos estudiados. En segundo lugar, el método depende en gran medida de la calidad y completitud de la red de PPI subyacente. Dado que las bases de datos de IBP suelen estar sesgadas hacia genes bien estudiados, las interacciones menos caracterizadas pueden estar infrarrepresentadas, lo que podría limitar el descubrimiento de nuevas relaciones reguladoras. La variabilidad en el tamaño de la muestra, el diseño experimental y la calidad de los datos también puede influir en la construcción de la red y en los cálculos de flujo aguas abajo. En tercer lugar, NetDecoder no asume que los bordes estáticos capturen completamente el flujo dinámico de información. En su lugar, NetDecoder infiere actividad específica del contexto y cuantifica el flujo de información usando una red PPI como prior estructural, que sirve como andamiaje para definir el espacio de interacciones biológicamente plausibles. El comportamiento dinámico se introduce entonces superponiendo datos moleculares específicos de estado (por ejemplo, expresión génica), reponderando o activando efectivamente subconjuntos de la red de manera dependiente del contexto.

El objetivo principal de NetDecoder es modelar la propagación de la información sobre un andamiaje estático de PPI, preservando al mismo tiempo relaciones cuantitativas y continuas entre genes (nodos). En contraste, enfoques como las redes booleanas ofrecen una representación simplificada e interpretable de la dinámica al modelar la actividad proteica como estados discretos encendido/apagado gobernados por interaccioneslógicas 13. Estos enfoques se han utilizado ampliamente para estudiar redes reguladoras y de señalización génica bajo condicionesvariables 14,15,16. Sin embargo, normalmente requieren reglas lógicas predefinidas y discretización de estados proteicos, lo cual puede ser difícil de definir a gran escala para grandes redes biológicas heterogéneasde PPI 17. En este contexto, el modelado de redes booleano representa una dirección complementaria a NetDecoder. Aunque NetDecoder captura un flujo de información continuo y cuantitativo, integrar dinámicas lógicas basadas en reglas o modelos híbridos discreto-continuo podría mejorar la interpretabilidad de comportamientos de señalización específicos de cada condición. Por tanto, desarrollar algoritmos de flujo de información al estilo booleano representa una vía prometedora para trabajos futuros.

Las futuras direcciones de NetDecoder incluyen la integración con tipos de datos ómicos adicionales y la expansión a transcriptómica de células únicas para mejorar la resolución y el contexto biológico. Por ejemplo, los enfoques basados en aprendizaje profundo para la predicción e imputación de expresiones transcriptómicas espaciales buscan mejorar la calidad de los datos y la recuperación de señales, pero no modelan explícitamente el flujo de información a través de redes deinteracción 18,19. Incorporar niveles de análisis multiómicos podría potenciar aún más su poder predictivo y conducir a resultados más fiables. Con el desarrollo metodológico continuo, NetDecoder podrá producir múltiples capas de flujo de información, proporcionando a los investigadores validación multiómica para sus datos de interés.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen intereses financieros en competencia.
Las ilustraciones de las Figuras 1 y 2 se crearon con BioRender (BioRender.com).

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este trabajo fue apoyado por subvenciones del Centro de Descubrimiento Biomédico de la Clínica Mayo, del Centro Integral de Cáncer de la Clínica Mayo (NIH; P30 CA015083), el Centro de Señalización Celular en Gastroenterología de la Clínica Mayo (NIH: P30DK084567), la Fundación Glenn para la Investigación Médica, la Fundación V para la Investigación del Cáncer (S.Z.), el Programa de Investigación en Nutrición y Obesidad de la Clínica Mayo, el Programa de Inmunología e Inmunoterapia del Cáncer David F. y Margaret T. Grohne, Schmidt Sciences e Innovación y los Institutos Nacionales de Salud (NIH; U19AG74879, P50CA136393, R01CA240323, R03OD038392).

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
AnnotationDbiBioconductorversión 1.68.0Anotación y mapeo de genes
BioconductorBioconductorversión 3.19Marco para análisis de datos transcriptómicos y ecosistema de paquetes que soporta DESeq2, edgeR, limma, AnnotationDbi y bases de datos de organismos, etc.
CytoscapeThe Cytoscape Consoritumversión 3.10.4Visualización y análisis de redes
DESeq2Bioconductorversión 1.46.0Análisis de expresión diferencial (con modelado binomial negativo)
dplyrPosit Software, PBC formerly RStudio, PBCversión 1.1.4Manipulación y transformación de datos
edgeRBioconductorversión 4.4.2Análisis de expresión diferencial basado en conteo
ggplot2Posit Software, PBC formerly RStudio, PBCversión 4.0.0Visualización de datos y trazado  
GNU BashGNU ProjectPredeterminado del sistemaBash, Ejecución de scripts del pipeline NetDecoder
igraphigraph Development Teamversión 2.1.4Construcción de redes y análisis gráfico
LimmaBioconductorversión 3.62.2Modelado lineal para análisis de expresión génica
NetDecoderHu Li Laboratory, Mayo Clinic(2024 Hu Li Lab)Construcción de redes de interacción proteica específicas al contexto mediante modelado de flujo de información
org.Hs.eg.dbBioconductorversión 3.20.0Base de datos de anotación génica humana
Oracle JDKOracle Corporation≥ versión 1.8Entorno de ejecución para la ejecución de NetDecoder
pheatmapRaivo Koldeversión 1.0.13Visualización de la estructura de expresión y correlación
RThe R Foundationversión 4.4.2Entorno principal para análisis transcriptómico y de redes

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

MedicineNetworkscontext specificmodellingtranscriptomicsflow algorithmintegration
Video próximamente

Artículos relacionados