Article de méthode

Protocole NetDecoder pour la construction de réseaux d’interactions protéiques spécifiques au contexte à partir de données transcriptomiques utilisant la modélisation du flux d’information

DOI :

10.3791/70869

31 juillet 2026

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ici, nous présentons un protocole pour utiliser NetDecoder, un outil de modélisation de réseau, afin de construire des réseaux d’interactions protéiques spécifiques au contexte et de construire des modèles d’utilité génique (GUM). En utilisant des données transcriptotiques, en combinaison avec des réseaux d’interactions protéine-protéine (PPI) sélectionnés, NetDecoder permet d’identifier des cibles et sous-réseaux clés.

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L’analyse d’expression différentielle est une technique couramment utilisée pour déterminer les cibles thérapeutiques potentielles, mais elle néglige la complexité des réseaux géniques à travers les voies biologiques. Souvent, des gènes fortement exprimés n’expliquent pas nécessairement les propriétés d’un phénotype biologique. NetDecoder, un outil de biologie des réseaux qui intègre des données transcriptomiques avec des réseaux d’interaction protéine-protéine (PPI) pour modéliser le flux d’information contextuel, l’utilité des gènes, les arêtes clés et les réseaux géniques utilisés différemment, a été développé pour répondre à cette limitation de l’analyse d’expression différentielle.

Ce protocole est un guide adapté aux débutants, étape par étape, pour utiliser NetDecoder, avec des directives complètes couvrant le prétraitement des données, l’exécution de NetDecoder et l’analyse des sorties. Le flux de travail comprend la configuration logicielle, la construction de réseaux et l’analyse de modélisation basée sur le flux afin de quantifier les différences entre gènes (nœuds) et interactions gène-gène (au niveau des bords) entre les conditions biologiques. Les résultats ainsi obtenus incluent des cibles et routeurs clés, des sous-réseaux à flux différentiel et des distributions de flux en périphérie, permettant d’identifier les gènes régulateurs clés et les voies associées à des états biologiques spécifiques. Après avoir suivi les étapes décrites, les chercheurs pourront mener des recherches indépendantes pour découvrir le flux phénotypique des gènes entre phénotypes en utilisant des données transcriptomiques et des réseaux IPP sélectionnés.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La sélection des gènes et des voies associées à l’investigation thérapeutique est souvent pilotée par des analyses d’expressiondifférentielle 1. Cette méthode d’analyse est efficace pour déterminer comment l’expression génique diffère entre deux affections ou plus. Cependant, les gènes fonctionnent au sein de réseaux biologiques complexes et interconnectés, ce qui signifie que l’expression génique individuelle ne capture pas pleinement la manière dont les gènes interagissent dans un réseau et leurs relationsgène-gène 2. Les méthodes de propagation de réseaux intègrent l’expression génique avec les réseaux d’interactions pour identifier des gènes biologiquement importants qui pourraient être manqués par une expression différentielleseule 3. Les approches actuelles ne quantifient pas explicitement l’importance fonctionnelle des gènes ni la manière dont l’information biologique est redistribuée au sein des réseaux d’interactions protéine-protéine (IPP) à travers les conditions biologiques. Par conséquent, une méthode pour modéliser le comportement des réseaux spécifiques à chaque condition et quantifier les changements dans le flux d’information à travers les systèmes biologiques était nécessaire. Pour expliquer comment les gènes interagissent au sein d’un réseau biologique plus large, NetDecoder, une plateforme de biologie de réseau, a été développée pour découvrir les gènes présentant la plus grande différence de flux d’information entre les conditions. NetDecoder utilise un algorithme de flux guidé par les processus pour traduire les connaissances existantes du réseau humain PPI, en combinaison avec des données de séquençage d’ARN en masse, afin de construire un modèle d’interactions pilotées par le fluxd’information 4.

En utilisant les données de flux d’information pour les réseaux phénotypiques, un modèle d’utilité génique (GUM)5 peut être développé pour identifier les gènes à fort flux d’information comme ayant la plus grande utilité globale dans un réseau, indépendamment de leurs valeurs d’expression différentielles. Cette approche soutient des stratégies de priorisation et d’identification des cibles plus efficaces, fournissant des informations que l’analyse traditionnelle manque souvent. Contrairement aux méthodes traditionnelles basées sur l’expression différentielle ou les réseaux basés sur la corrélation, NetDecoder quantifie à la fois les changements du flux d’information du gène (niveau nœud) et d’interaction (niveau arête), permettant d’identifier des gènes fonctionnellement importants, même en l’absence de grands changements d’expression 4,5. NetDecoder est largement applicable aux ensembles de données de séquençage d’ARN en masse qui impliquent une analyse comparative entre deux conditions biologiques, permettant d’identifier les changements dans le flux d’information et l’organisation du réseau. Bien que NetDecoder supporte l’intégration d’autres ensembles de données omiques, y compris la protéomique et l’épigénomique, le protocole actuel démontre spécifiquement le flux de travail à partir de données transcriptomiques. Dans ces applications, les utilisateurs peuvent définir des gènes sources à partir de protéines ou de gènes régulés épigénétiquement, permettant d’initier une analyse du flux d’information à partir de ces caractéristiques moléculaires. Cette flexibilité permet d’intégrer des preuves multi-omiques dans des analyses basées sur des réseaux et facilite la découverte de mécanismes régulateurs inter-modaux sous-jacents aux différences phénotypiques.

Les plans d’étude courants impliquent des comparaisons binaires, incluant mais sans s’y limiter maladie versus conditions saines, répondants au traitement vs non-répondeurs, traitements médicamenteux, tests knockdowns ou knockouts versus expériences témoins, ainsi que des analyses des transitions d’état développemental ou cellulaire. L’objectif de ce protocole est d’illustrer un cadre reproductible pour appliquer NetDecoder afin de découvrir des gènes avec une influence modifiée du réseau à travers des conditions biologiques. Cela est réalisé grâce à des étapes faciles à suivre pour configurer et exécuter NetDecoder, ainsi que des exemples à suivre, ainsi que des techniques de dépannage de base, et des méthodes d’interprétation des résultats sont également présentées dans le protocole.

Protocole

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude a utilisé des ensembles de données de séquençage ARN disponibles publiquement et n’a pas impliqué directement des sujets humains ou animaux. Par conséquent, l’approbation du comité d’examen institutionnel et le consentement éclairé n’étaient pas requis.

REMARQUE : NetDecoder nécessite les fichiers d’entrée suivants : expression génique normalisée à travers deux conditions biologiques définies ; un fichier de métadonnées décrivant les conditions biologiques ; une liste des gènes sources pour la construction et la modélisation de réseaux ; un réseau d’interactions protéine-protéine (IPP) issu du domaine public ; et un réseau pondéré en arêtes (EWN) construit pour chaque condition biologique.

1. Préparation des données

  1. Récupérer les données d’expression et métadonnées du séquençage d’ARN en vrac
    1. Téléchargez les données de séquençage de l’ARN (matrice des décomptes bruts d’expression génique et des noms d’échantillons) et les métadonnées correspondantes (noms d’échantillons, conditions, etc.) depuis un dépôt public, tel que le Gene Expression Omnibus (GEO), ou utilisez des ensembles de données expérimentaux générés en laboratoire. Typiquement, il s’agit d’une matrice dans laquelle les lignes correspondent aux noms des gènes et les colonnes aux noms d’échantillons.
      REMARQUE : L’ensemble de données exemple utilisé pour démontrer ce protocole a été obtenu dans le dépôt de la National Omics Data Encyclopedia (NODE) (base de données BioSino) sous accession OEP0011056. Les utilisateurs peuvent substituer leurs propres ensembles de données de séquençage d’ARN en masse.
    2. Générer un fichier d’annotation d’échantillon (métadonnées) en incluant les noms d’échantillons et leurs groupes ou conditions associées ; Par exemple, « contrôle » et « maladie » sont des types de pathologies courants. Confirmez que les noms des échantillons correspondent entre les métadonnées et les fichiers d’expression.
  2. Données d’expression et métadonnées agrégées
    1. Assurez-vous que la matrice de données générée inclut les décomptes d’expression, les noms des gènes et un fichier de métadonnées avec les noms d’échantillons et les conditions. Si nécessaire, utilisez un package R tel que org. Hs.eg.db (humain) ou AnnotationDbi pour correspondre à différents identifiants génétiques.
    2. Supprimez les informations non essentielles du fichier de métadonnées en utilisant R ou un langage de programmation similaire.
    3. Combinez les informations des fichiers de nombre d’expressions en un seul fichier pour faciliter la manipulation.
  3. Données d’expression des filtres
    1. Pré-traiter la matrice de données d’expression génique en excluant les doublons géniques, les valeurs nulles (NA), les faibles expressions (<10 décomptes au total) et/ou les gènes à faible variance, etc.
  4. Prétraitement des données
    1. Normalisation du séquençage ARN et analyse différentielle de l’expression
      REMARQUE : Cette étape est l’une des deux approches (1.4.1) pour sélectionner des gènes pour la création d’un réseau pondéré en bordure (EWN) et la sélection des gènes sources (étapes 1.5–1.6) lors du début de l’analyse à partir des données de séquençage d’ARN en masse. En alternative, la correspondance de modèles basée sur la corrélation Pearson peut être utilisée en sautant à l’étape 1.4.3.
      1. Effectuez des conversions d’identification génique à ce stade en utilisant le paquet R, AnnotationDbi, en concurrence avec les paquets d’organismes individuels. NetDecoder utilise des symboles de gènes (c’est-à-dire l’identifiant génétique) correspondant à l’exemple de PPI.
      2. Effectuer la normalisation et l’analyse d’expression différentielle entre deux conditions en utilisant les paquets R limma, edgeR, DESeq2 ou des outils comparables.
      3. Si vous utilisez DESeq2, construisez un jeu de données DESeq en utilisant la fonction DESeqDataSetFromMatrix() avec une matrice de comptage (gènes et échantillons) et des métadonnées d’échantillon (conditions) en entrée.
      4. Utilisez la fonction DESeq() avec les paramètres par défaut sur l’objet créé à l’étape 1.4.1.3 pour calculer les valeurs d’expression différentielles.
      5. Enregistrez les résultats dans une matrice de données avec des identifiants de gènes (identifiant de gène) comme noms de lignes et des sorties clés incluant le changement de fold log2 (log2FC), la valeur p et la valeur p ajustée sous forme de colonnes.
      6. En option, filtrez les résultats par valeur p ajustée (<0,05) et/ou valeurs log2FC (par exemple : |log2FC| > 1) à l’aide de dplyr ou d’un outil comparable.
      7. Assurez-vous que toutes les listes de gènes traitées et les matrices de changement de fold log2 sont exportées sous forme de fichiers délimités par tabulation (.txt ou .csv) pour être saisies dans NetDecoder.
      8. Effectuer des comparaisons par paires pour l’étape 1.4.1 si plus de 2 conditions biologiques sont utilisées et obtenir des résultats par paires en utilisant la fonction results() de l’objet DESeq généré à l’étape 1.4.1.5.
    2. Normalisation de l’expression des microtableaux - Optionnelle
      REMARQUE : Si vous utilisez des données de micro-tableaux, effectuez cette étape pour la normalisation des données.
      1. Normalisez les données en ouvrant le script de normalisation NetDecoder (HuLiLab/NetDecoder_Example/raw_data/NetDecoder_normalize. R), accessible depuis https://github.com/HuLiLab/NetDecoder_Example/tree/main, dans une plateforme R-development et modifier la partie en italique pour qu’elle corresponde au répertoire de travail contenant les fichiers d’intensité cellulaire (CEL).
        setwd(~/NetDecoder_Example/raw_data/CEL_files)
    3. Correspondance de modèles - Optionnel
      REMARQUE : Il s’agit de la deuxième approche optionnelle si l’analyse différentielle de l’expression (telle qu’exposée aux étapes 1.1–1.4.1 de « Préparation des données ») n’est pas réalisée.
      1. Pour les données de séquençage ARN non traitées via limma, edgeR et DESeq2, effectuer la normalisation externe avant d’appliquer l’appariement des gabarits. Pour les données de micro-tableaux, utilisez directement les valeurs d’expression normalisées générées aux étapes 1.1–1.4.2.
      2. Choisissez la condition témoin comme modèle de base pour l’expression génique et comparez les valeurs normalisées d’expression génique de toutes les autres conditions d’intérêt.
      3. Calculez les coefficients de corrélation de Pearson entre le profil d’expression de chaque gène et le modèle sélectionné. Il est recommandé de conserver des gènes présentant des corrélations statistiquement significatives (p < 0,05) et un coefficient de corrélation absolu au-dessus d’un seuil défini par l’utilisateur (comme |r| > 0,7).
  5. Sélection des gènes sources
    REMARQUE : L’entrée pour cette étape consiste en la matrice d’expression génique normalisée développée aux étapes 1.1 à 1.4.
    1. Choisissez un ensemble de gènes significatifs à utiliser comme gènes sources. Pour les flux de travail basés sur des expressions différentielles, choisissez des seuils de valeur p ajustée et log2FC (comme la valeur p adj < 0,05 et |log2FC| > 2). Pour les flux de travail de correspondance de modèles, sélectionnez les gènes sources parmi les gènes significativement corrélés identifiés à l’étape 1.4.3.3 en utilisant les seuils de corrélation et de signification choisis. Des seuils doivent être choisis pour fournir environ 300 à 1 000 gènes pour la construction de réseaux en aval.
      REMARQUE : Les gènes sources sont l’endroit où le flux d’information commence et se propage à travers le réseau.
  6. Construisez un réseau pondéré par les arêtes (EWN) pour chaque phénotype
    REMARQUE : Les entrées suivantes sont requises pour cette étape : la matrice d’expression génique normalisée développée aux étapes 1.1–1.4 ; un réseau d’interaction protéine-protéine (PPI) formaté en liste d’arêtes (paires gèneA-gèneB) ; un fichier d’annotation d’échantillon (métadonnées) spécifiant les labels de conditions biologiques pour chaque échantillon. Le réseau PPI est partagé sous forme d’objet R et a été construit à partir de la base de données protéique iRefIndex. La version utilisée dans ce protocole inclut toutes les interactions directes, mais les auto-boucles et les multiples arêtes étaient exclues. Le réseau IPP contient 15 608 protéines et 180 044 interactions. Pour plus de détails, voir la section4 des méthodes NetDecoder.
    1. Ouvrez le script NetDecoder Edge Weighted Network (EWN) (HuLiLab/NetDecoder_Example/input/NetDecoder_Create_EWN. R, accessible depuis https :/github.com/HuLiLab/NetDecoder_Example/tree/main)4, sur une plateforme de développement R.
    2. Modifiez les parties du script, indiquées par des commentaires (et en italique ci-dessous), pour définir des chemins et fichiers d’entrée spécifiques à l’utilisateur pour le développement EWN.
      chemin <~/NetDecoder_Example/entrée/
      C’est le chemin vers le répertoire de travail
      expQuery <- get(load(« expBreastCancer_15Set2014.R »))
      Ceci est un exemple d’objet Rdata matrice d’expression normalisée
      stQuery < read.csv(« stBreastCancer.csv »)
      Voici les métadonnées d’exemple
    3. Filtrez la matrice d’expression pour ne conserver que les gènes présents dans le réseau PPI.
    4. Pour chaque condition, un sous-ensemble échantillonne par phénotype et calcule les corrélations gène-gène par paires sur toutes les arêtes définies dans le réseau PPI en utilisant la corrélation de Pearson. Calculez les corrélations à l’aide de la matrice d’expression traitée et normalisée générée à l’étape 1.4.
    5. Pour chaque paire de gènes, calculez le coefficient de corrélation, la corrélation absolue et la valeur p associée.
    6. Supprimez les cas incomplets (par exemple, les valeurs NA).
    7. Exportez un réseau pondéré en arêtes par condition sous forme de fichier délimité par tabulation (sans en-tête) avec les colonnes suivantes : protéine A, protéine B, abs_cor, cor et pvalue.
    8. Exécutez le script R pour créer des réseaux de co-expressions pour toutes les conditions pertinentes.

2. Installation et configuration de NetDecoder

  1. Télécharger NetDecoder
    1. Accédez au logiciel NetDecoder à (https://netdecoder.hulilab.org/#ver), en choisissant R ou Java.
  2. Installer le logiciel requis
    1. Installez Oracle JDK et R pour les environnements de travail/analyse.
    2. Installez les paquets R requis tels que listés dans la documentation NetDecoder, en utilisant Bioconductor (https://netdecoder.hulilab.org/#ver)4.
  3. Dépendances de téléchargement
    1. Téléchargez les dépendances nécessaires pour NetDecoder, qui incluent les données d’ontologie génique (accessibles depuis https://geneontology.org/docs/download-ontology/), ainsi que le guide de référence sur l’association génique (accessible depuis https://www.ebi.ac.uk/GOA/human_release).
  4. Configurez le répertoire de travail
    1. Déplacez tous les fichiers téléchargés (données d’expression, réseaux de co-expressions générés pour chaque condition, données d’ontologie génique et guide de référence d’association) dans un seul dossier, qui sera le répertoire de travail NetDecoder.
  5. Ajouter le dossier nécessaire
    1. Téléchargez le dossier NetDecoder (https://netdecoder.hulilab.org/wp-content/uploads/2025/07/NetDecoder_Example.zip) dans le répertoire de travail NetDecoder.
    2. Décompressez le dossier NetDecoder.

3. Exécution de NetDecoder

  1. Ouvre le script bash d’analyse
    1. Ouvrez un terminal sous GNU Bash et naviguez vers le répertoire de travail NetDecoder.
    2. Lance la commande nano NetDecoder_Analysis.sh pour ouvrir le script bash.
  2. Modifier les scripts
    NOTE : La plupart du code est déjà écrit. À cette étape, les paramètres requis sont spécifiés dans le script aux emplacements indiqués.
    1. Faites un court nom :
      Modifier la partie en italique pour qu’elle compare les conditions : monnomcourte= 'Your_shortname_here'
    2. Définir les chemins logiciels :
      Modifiez les trois définitions de chemin suivantes pour les suivre correctement en modifiant les parties en italique :
      JAVA="/votre/chemin/ici »
      export R="/ton/chemin/ici"
      alias R="/votre/chemin/ici »
    3. Définir le répertoire de travail :
      Modifier la partie en italique pour qu’elle devienne le répertoire de travail d’où tous les fichiers seront accessibles : INPUT_DIR="/your/path/here »
    4. Définir la bibliothèque NetDecoder :
      Modifiez la partie en italique pour qu’elle soit le chemin vers la bibliothèque NetDecoder installée à l’étape 2.4 depuis le fichier zip : LIB_DIR="/votre/chemin/ici/netdecoder_lib »
    5. Ontologie des gènes et chemins d’association :
      Modifier les parties en italique suivantes des deux répertoires vers les emplacements des ontologies/fichiers d’association des gènes préférés.
      SYMBOL=$LIB_DIR/gene_association_file
      GO=$INPUT_DIR/gene_ontology_fichier
    6. Définir les arguments d’entrée :
      Mettez à jour les parties en italique des cinq lignes suivantes selon les données, conformément aux instructions commentées trouvées dans le script de référence NetDecoder.
      geneList=$INPUT_DIR/gene_file
      state_trt=Condition traitée
      state_ref=Condition de référence

      PPI_trt=$INPUT_DIR/treated_co_expression_network_file
      PPI_ref=$INPUT_DIR/référence_co_expression_network_file
    7. Posez le bon décor :
      Retirez le commentaire (en supprimant le symbole #) de l’étape d’exécution souhaitée, puis recommentez-la une fois l’étape terminée. La première étape est gen_net_trt, suivie de gen_net_ref, puis de l’analyse et enfin de la collecte de la stade.
      Définissez la phase souhaitée à exécuter, en commençant par la première étape.
      #STAGE="gen_net_trt »
      #STAGE="gen_net_ref »
      #STAGE="analyse »
      #STAGE="collecter »
    8. Naviguez jusqu’au terminal principal de Bash :
      Appuyez sur Ctrl+X, puis sur Y, pour sauvegarder et quitter le script bash.
  3. Exécuter NetDecoder
    REMARQUE : Si elle s’exécute avec succès, les messages de journalisation apparaissent dans le terminal.
    1. Naviguez jusqu’au terminal et courez ./NetDecoder_Analysis.sh.
    2. Exécutez les étapes dans l’ordre indiqué à l’étape 3.2.7 jusqu’à ce que les quatre soient terminées individuellement.
  4. Résultats de récupération
    1. Naviguez vers les fichiers de sortie et les résumés graphiques.

Résultats

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Comme illustré à la Figure 1, NetDecoder fonctionne à travers un flux de travail structuré composé de traitement des données, de configuration réseau et d’analyse basée sur les flux, avec des sorties organisées en répertoires distincts correspondant à chaque étape du pipeline. Cette structure modulaire permet une validation systématique des résultats, garantissant que les résultats peuvent être retracés jusqu’à chaque étape de calcul et soutenant la reproductibilité globale.

L’exécution réussie de NetDecoder (Figure 2) produit des sorties sur quatre répertoires (analyse, collect, réseaux et « your_shortname ») contenant des données correspondant à diverses conditions, incluant des chiffres et des sorties quantitatives pour les valeurs de flux, les sous-réseaux et autres sorties flux-interaction (Figure 1, Figure 2 et Figure 3). La présence de fichiers et de chiffres remplis dans ces répertoires indique que le pipeline a bien fonctionné. En revanche, les essais ratés se caractérisent par des résultats manquants et/ou des chiffres incomplets. Parce que NetDecoder évalue des milliers de gènes au sein d’un réseau PPI, les exécutions réussies nécessitent généralement plusieurs heures de calcul, selon la taille du jeu de données et les ressources disponibles. Pour l’analyse représentative du cancer des voies biliaires humaines présentée ici, l’exécution de NetDecoder nécessitait un temps d’exécution d’environ 4 à 6 heures sur la station de travail Puget3 (Puget Systems) basée sur Linux. Des temps d’exécution exceptionnellement courts peuvent indiquer des données d’entrée mal formatées ou une exécution incomplète du pipeline. Des données d’entrée mal formatées ou une exécution ratée du pipeline peuvent entraîner des messages d’erreur qui peuvent être retracés jusqu’à la cause du problème. La figure 3 illustre les sorties représentatives présentes après une exécution réussie de NetDecoder. L’analyse représentative présentée ici a utilisé des données de séquençage ARN provenant de 255 échantillons de cancer des voies biliaires (OEP001105)6, permettant de comparer les états pathologiques de stade I–II et III–IV ainsi que le flux d’information modifié entre les conditions.

Les trois cartes thermiques de la Figure 4 résument les changements globaux du flux d’information réseau entre les gènes selon les conditions, y compris les gènes routeurs qui transmettent un flux d’information substantiel au sein du réseau, des gènes cibles importants en aval, ou des gènes globaux fortement impactés. Une large distribution de flux différentiel positif et négatif indique que l’information est redistribuée à travers le réseau, plutôt qu’augmentée ou diminuée de manière uniforme. Cette hétérogénéité et cette variété de types de gènes soutiennent la capacité de NetDecoder à identifier des gènes ayant une importance fonctionnelle modifiée entre les phénotypes.

La Figure 4 montre également des graphiques en barres au niveau des arêtes qui quantifient les variations de flux pour les interactions individuelles entre les paires gène et gène selon les conditions. Ces résultats démontrent que le flux à travers des interactions spécifiques peut varier selon les conditions, reflétant un recâblage du réseau dépendant du contexte. Ainsi, le flux en périphérie capture les changements au niveau de l’interaction dans le transfert d’information, tandis que le flux différentiel fournit un résumé au niveau du nœud de ces changements, permettant la priorisation des gènes ayant le plus grand changement global d’influence du réseau.

Ensemble, ces résultats démontrent que NetDecoder capture les altérations géniques (niveau nœud), gène-gène (niveau arête) et réseau dans le flux d’information au sein des réseaux biologiques (Figure 4). Les cartes thermiques identifient les gènes avec une propagation, un routage et une réception d’information modifiés dans le réseau, tandis que les analyses au niveau des arêtes révèlent les interactions spécifiques à l’origine de ces changements. Les réseaux d’information spécifiques au phénotype fournissent une représentation visuelle du recâblage du réseau entre conditions, où les nœuds représentent les gènes et l’épaisseur des arêtes correspond à la magnitude du flux d’information (Figure 4). Cette représentation au niveau des systèmes permet d’identifier les principaux gènes régulateurs et voies associées aux conditions étudiées. De plus, la production réussie de ces chiffres indique que NetDecoder a été exécuté correctement.

Parce que NetDecoder produit un grand nombre de fichiers de sortie, l’identification des résultats les plus pertinents est essentielle pour l’interprétation. Par exemple, pour examiner les différences de flux entre les conditions (par exemple, bas étage vs. haut étage), deux fichiers clés peuvent être utilisés (les étapes de navigation sont guidées par la structure des fichiers de la Figure 3). Le premier, « EDGE_CENTERED_SUBNET_flowDifference_ Maladie .txt » (situé dans le répertoire analyse/Maladie ), identifie les interactions (bords) avec les plus grands changements de flux entre les conditions. Le second, « flowDifference_PRIORITIZED_NETWORK.txt » (situé dans le répertoire « your_shortname » ), identifie les gènes (nœuds) présentant les plus grandes différences de flux. Ensemble, ces fichiers offrent une vue complète des changements au niveau des interactions et des gènes dans le comportement du réseau.

Plus largement, le dossier « analyse » contient des informations sur les routeurs réseau, les cibles clés et les gènes importants du flux différentiel. Le dossier « your_shortname » contient des fichiers texte bruts contenant des données spécifiques au phénotype, telles que les valeurs de flux total, les cibles clés et les routeurs. Le dossier réseaux contient les sous-réseaux générés par NetDecoder, qui peuvent être analysés et visualisés davantage dans Cytoscape7. Enfin, le dossier « collect » contient des données et des chiffres consolidés qui fournissent un résumé général des résultats. Une visualisation et une analyse supplémentaires des résultats NetDecoder peuvent être effectuées à l’aide de packages R tels que ggplot2, igraph, pheatmap, etc.

figure-results-1
Figure 1 : Représentation du pipeline NetDecoder et fonctionnalités générales. NetDecoder nécessite trois étapes générales (boîte jaune) : traitement des données, configuration NetDecoder et exécution NetDecoder. Chaque étape de ces étapes doit être suivie de près pour garantir des résultats réussis. NetDecoder nécessite des données d’expression issues de deux conditions (exemples dans la boîte verte) pour prédire quels gènes peuvent être associés à un flux d’information élevé et à une grande utilité du gène. Dans l’analogie du robinet d’eau, les niveaux d’expression génique sont illustrés par la taille du robinet, c’est-à-dire la largeur à laquelle il peut s’ouvrir, tandis que l’utilité ou l’activité du gène reflète le débit réel d’eau qui passe par le robinet, illustrant à quel point cette voie est utilisée fonctionnellement. Comme montré sur la figure, un gène fortement exprimé (grande taille de robinet) peut avoir une faible utilité génique (faible débit d’eau) tandis qu’un gène à faible niveau d’expression (petite taille du robinet) peut avoir une grande utilité (niveaux élevés de débit d’eau). Cela illustre comment les gènes peuvent avoir une importance globale plus élevée dans une condition donnée, même si les niveaux d’expression sont inférieurs à ceux d’un autre gène. L’illustration au centre inférieur montre comment les gènes peuvent être interconnectés et expérimenter différents niveaux de flux (couleur), peu importe leur intensité (taille). Créé dans BioRender. Blissenbach, E. (2026) https://BioRender.com/8okynbu. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

figure-results-2
Figure 2 : Flux de travail général de NetDecoder. Le principe fondamental de l’algorithme NetDecoder est de modéliser l’utilité des gènes dans un réseau d’interaction protéine-protéine (PPI) via l’analyse du flux d’information. Le flux de travail commence par le prétraitement des données et la construction de réseaux pondérés en périphérie (EWN). Les données d’expression génique issues de deux conditions biologiques, le phénotype 1 (P1) et le phénotype 2 (P2), sont traitées pour identifier les gènes sources en utilisant soit des approches d’expression différentielle, soit de correspondance de modèles. Des matrices d’expression normalisées sont ensuite utilisées pour construire des EWN spécifiques à chaque condition, où les poids des arêtes reflètent les relations entre paires de gènes dans chaque phénotype. NetDecoder quantifie ensuite les différences dans le flux d’information entre les conditions, permettant d’identifier les événements de recâblage du réseau et les altérations de l’utilité du gène. Les résultats incluent des scores différentiels de flux d’information, des réseaux d’information spécifiques au contexte, des cartes de chaleur des scores d’impact, ainsi que des métriques supplémentaires au niveau du réseau et du gène facilitant l’interprétation biologique en aval et la découverte mécanistique. Créé dans BioRender. Correia, C. (2026) https://BioRender.com/29cmswf. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

figure-results-3
Figure 3 : Sorties NetDecoder et structure de dossiers. Ce diagramme représente la structure de répertoire de sortie utilisée pour accéder aux fichiers de résultats afin d’interpréter. Sont représentés en italique les noms de dossiers (sur les icônes de dossier), ceux entre guillemets étant spécifiques à la nomenclature d’analyse. Les valeurs sur les icônes de la boîte de réception indiquent soit des fichiers, soit des types de fichiers, selon le code couleur. Le rouge indique les types de fichiers que l’on trouve dans chaque dossier, tandis que les fichiers clés sont indiqués en gras et soulignés (flowDifference_PRIORITIZED_NETWORK.txt et EDGE_CENTERED_SUBNET_flowDifference_Maladie .txt). Les icônes de dossier proviennent d’icons8 (https://icons8.com). Créé dans BioRender. Blissenbach, E. (2026) https://BioRender.com/8okynbu. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

figure-results-4
Figure 4 : Exemple de résultats générés par NetDecoder. Les gènes d’impact (A), les routeurs réseau (B) et les cartes thermiques des cibles clés (C), ainsi que les réseaux contextuels spécifiques (D) et les graphiques à barres de flux d’arête (E), sont des sorties clés de NetDecoder. Dans cet exemple, un jeu de données d’expression du cancer des voies biliaires (OEP001105) a été utilisé pour comparer les patients atteints de maladie à un stade précoce (stades I-II, bas) et une maladie avancée (stades III-IV, élevé), et NetDecoder a été appliqué pour identifier des gènes présentant une information différentielle élevée entre les deux groupes. Chaque graphique montre le rouge indiquant un débit accru et le bleu indiquant un débit diminué. Les routeurs réseau (B) sont des gènes intermédiaires clés où de grandes quantités de flux passent (collecter/Disease_Network_routers.pdf), les cibles clés (C) sont des régulateurs en aval importants (collecter/Disease_Key_targets.pdf), et la carte thermique de la différence de flux représente le changement global du flux d’information au niveau des gènes entre les conditions (analyse/flowDifference_heatmap.pdf). Un réseau d’information spécifique au phénotype (D) peut être visualisé, chaque gène représentant un nœud et les interactions gène-gène représentées par des arêtes (lignes) (analyse/EDGE_CENTERED_SUBNET_Disease). L’épaisseur des bords correspond à l’amplitude du flux d’information entre les gènes. Le graphique à barres (E) montre les différences dans le flux des arêtes entre les interactions gène-gène entre les deux phénotypes sélectionnés, avec des paires de stades faibles représentées en sarcelle et des paires de stade haut en orange (analyse/Disease_keyEdges.pdf). Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ce protocole décrit la mise en œuvre de NetDecoder, un cadre réseau-biologie qui intègre les données d’expression génique avec des réseaux d’interaction protéine-protéine (PPI) pour modéliser le flux d’information spécifique à chaque condition et prioriser les gènes en fonction de leur influence fonctionnelle au sein des systèmes biologiques. La réussite de cette méthode dépend de plusieurs étapes critiques, de choix méthodologiques soigneux et d’une interprétation appropriée des résultats.

Les premières étapes du protocole incluent la récupération des données d’expression, la génération de métadonnées et la construction d’une matrice d’expression unifiée. Ces étapes sont essentielles pour garantir la compatibilité avec l’analyse en aval. La matrice d’expression doit être formatée avec des gènes en lignes et des échantillons en colonnes, avec des noms d’échantillons dans la matrice et le fichier de métadonnées correspondant de manière identique. Toute incohérence à ce stade (par exemple, identifiants d’échantillons mal adaptés ou noms de gènes dupliqués) se propagera dans le pipeline et entraînera des défaillances aux étapes suivantes.

Le filtrage des données de faible qualité (par exemple, les gènes à faible nombre, des valeurs manquantes ou des gènes à faible variance) est particulièrement important, car ces caractéristiques peuvent introduire du bruit dans la construction de réseaux basés sur la corrélation. Une étape de prétraitement réussie est indiquée par une matrice d’expression propre sans valeurs manquantes et des identifiants génétiques cohérents correspondant à ceux utilisés dans le réseau PPI.

Un point clé de décision dans le protocole est le choix entre l’analyse différentielle de l’expression et la correspondance des modèles pour sélectionner les gènes sources utilisés dans la construction du réseau pondéré par les bords (EWN). L’analyse d’expression différentielle est la plus appropriée lorsqu’on compare des groupes expérimentaux bien définis avec suffisamment de répliques. Cette approche identifie les gènes présentant des variations d’expression statistiquement significatives entre les conditions et fournit des résultats quantitatifs tels que le changement de log2 fold (log2FC) et des valeurs p ajustées. La réussite de l’exécution s’explique par une distribution des gènes significatifs et non significatifs, plutôt que par des résultats uniformement nuls. En revanche, la correspondance de modèles est mieux adaptée lorsque l’objectif est d’identifier des gènes dont les schémas d’expression sont corrélés à un profil continu ou de référence. Cette méthode conserve les gènes basés sur la force de corrélation plutôt que sur l’ampleur de l’expression différentielle. Une étape réussie de correspondance de gabarit donne un ensemble de gènes avec des corrélations statistiquement significatives avec la condition de référence. Le choix entre ces approches influence la topologie du réseau en aval ; L’expression différentielle met l’accent sur les changements de magnitude, tandis que l’appariement de gabarit met l’accent sur les schémas d’expression coordonnés.

L’étape de construction de l’EWN est l’un des composants les plus critiques du protocole. Ici, les données d’expression génique normalisées sont intégrées à un réseau PPI pour calculer les corrélations entre gènes par paires pour toutes les interactions présentes dans le réseau. Seuls les gènes partagés entre le jeu de données d’expression et le réseau PPI sont conservés, assurant leur pertinence biologique et une cohérence computationnelle. Pour chaque condition, les coefficients de corrélation de Pearson sont calculés sur toutes les arêtes, ainsi que les valeurs p et les valeurs de corrélation absolues correspondantes. Ces métriques définissent les poids des arêtes utilisés par NetDecoder. La réussite de la construction d’un EWN est indiquée par des milliers de corrélations gène-gène, une large distribution des valeurs de corrélation et des valeurs manquantes minimales après filtrage. L’échec à ce stade est souvent dû à des identifiants génétiques inadéquats, à une taille d’échantillon insuffisante ou à des données d’expression mal normalisées. Les points de défaillance courants du NetDecoder peuvent souvent être résolus par une vérification méthodique des fichiers d’entrée et de la configuration logicielle. Si NetDecoder se termine de manière inattendue ou produit des sorties incomplètes, les utilisateurs devront vérifier que les identifiants d’échantillons sont identiques entre les matrices d’expression et les fichiers de métadonnées, que les identifiants de gènes sont cohérents entre les jeux de données d’expression, les listes de gènes sources et le réseau PPI, et que les matrices d’expression ne contiennent aucune valeur manquante. Si des erreurs ou des résultats tronqués surviennent, les utilisateurs peuvent vérifier la compatibilité des systèmes d’installation et de version, inspecter les messages de journal générés lors de l’exécution, et confirmer la réussite de chaque étape intermédiaire avant de passer aux analyses en aval. L’inspection des fichiers de sortie et/ou des messages de la console peut aider à localiser la source d’une erreur avant que des analyses ultérieures ne soient tentées. NetDecoder nécessite une configuration méticuleuse des chemins de fichiers, des arguments d’entrée et des dépendances. Les étapes clés incluent la spécification des chemins de répertoire et de bibliothèque de travail, les fichiers d’ontologie et d’annotation des gènes, les entrées EWN spécifiques à chaque condition, ainsi que les listes de gènes sources.

Parce que le pipeline est exécuté par étapes (génération réseau des deux conditions, analyse et collecte des résultats), les erreurs dans les étapes antérieures empêcheront la réussite des étapes suivantes. Une exécution correctement fonctionnelle produit quatre répertoires (analyse, collecte, réseaux, « your_shortname »), chacun contenant des résultats spécifiques à chaque condition. Un autre indicateur pratique d’une exécution correcte est le temps d’exécution. Les exécutions réussies nécessitent généralement plusieurs heures de traitement car NetDecoder évalue les grands réseaux d’interaction ; des temps d’exécution extrêmement courts indiquent souvent des entrées mal configurées ou des étapes de calcul sautées.

NetDecoder diffère fondamentalement des approches traditionnelles de priorisation génétique et d’analyse de réseau. Des méthodes telles que l’analyse pondérée des réseaux de co-expression génique (WGCNA)8 regroupent des gènes basés sur la structure de corrélation, mais n’intègrent pas le flux directionnel ni ne quantifient la propagation de l’information à travers un réseau. De même, les analyses d’enrichissement desvoies 9 identifient la surreprésentation fonctionnelle, mais ne prennent pas en compte la dynamique au niveau d’interaction ni les changements de connectivité réseau.

NetDecoder utilise une approche intégrée en combinant les données d’expression génique avec des réseaux PPI pour modéliser le flux d’information spécifique à chaque condition. En quantifiant à la fois les scores individuels des gènes (niveau nœud) et les changements d’interaction (au niveau des arêtes), il capture comment la structure du réseau et le routage de l’information sont reconfigurés entre les conditions. Cela permet d’identifier des gènes qui peuvent ne pas présenter une forte expression différentielle tout en jouant un rôle central dans la médiation du comportement du réseau, conformément au modèle d’utilité génique (GUM)5, qui postule que les gènes à flux d’information différentiel élevé entraînent une fonction spécifique au réseau de la condition.

Malgré ses points forts, NetDecoder présente plusieurs limitations. Premièrement, il s’agit d’un cadre computationnel qui déduit l’importance des gènes à partir du flux d’information modélisé sur le réseau plutôt que sur des preuves expérimentalesdirectes 10. Ainsi, ses prédictions doivent être interprétées comme des hypothèses nécessitant une validation par des expériences biologiques. Les approches de validation fonctionnelle, telles que les études de knockoutgénique 11 ou les tests de perturbationciblée 12, sont essentielles pour confirmer si les gènes identifiés comme étant très utiles par NetDecoder influencent réellement les processus biologiques ou les états pathologiques étudiés. Deuxièmement, la méthode dépend fortement de la qualité et de l’exhaustivité du réseau IPP sous-jacent. Parce que les bases de données IPP sont souvent biaisées en faveur de gènes bien étudiés, les interactions moins caractérisées peuvent être sous-représentées, limitant potentiellement la découverte de nouvelles relations régulatrices. La variabilité de la taille de l’échantillon, de la conception expérimentale et de la qualité des données peut également influencer la construction du réseau et les calculs de flux en aval. Troisièmement, NetDecoder ne suppose pas que les arêtes statiques capturent pleinement le flux d’information dynamique. Au lieu de cela, NetDecoder déduit une activité spécifique au contexte et quantifie le flux d’information en utilisant un réseau PPI comme prior structurel, qui sert d’échafaudage pour définir l’espace des interactions biologiquement plausibles. Le comportement dynamique est ensuite introduit en superposant des données moléculaires spécifiques à l’état (par exemple, l’expression génique), repondérant ou activant effectivement des sous-ensembles du réseau de manière dépendante du contexte.

L’objectif principal de NetDecoder est de modéliser la propagation de l’information sur un échafaudage statique de PPI tout en préservant les relations quantitatives et continues entre les gènes (nœuds). En revanche, des approches telles que les réseaux booléens offrent une représentation simplifiée et interprétable de la dynamique en modélisant l’activité protéique comme des états discrets on/off régis par des interactionslogiques 13. Ces approches ont été largement utilisées pour étudier les réseaux de régulation et de signalisation génique dans des conditionsvariables 14,15,16. Cependant, ils nécessitent généralement des règles logiques prédéfinies et la discrétisation des états protéiques, ce qui peut être difficile à définir à grande échelle pour de grands réseaux biologiques HPIhétérogènes 17. Dans ce contexte, la modélisation de réseau booléen représente une direction complémentaire à NetDecoder. Bien que NetDecoder capture un flux d’information continu et quantitatif, l’intégration de dynamiques logiques basées sur des règles ou de modèles hybrides discret-continu pourrait améliorer l’interprétabilité des comportements de signalisation spécifiques à chaque condition. Le développement d’algorithmes de flux d’information de type booléen représente donc une voie prometteuse pour des travaux futurs.

Les orientations futures pour NetDecoder incluent l’intégration avec d’autres types de données omiques et l’expansion vers la transcriptomique unicellulaire afin d’améliorer la résolution et le contexte biologique. Par exemple, les approches basées sur l’apprentissage profond pour la prédiction et l’imputation d’expressions transcriptomiques spatiales visent à améliorer la qualité des données et la récupération des signaux, mais ne modélisent pas explicitement le flux d’information à travers les réseauxd’interaction 18,19. L’intégration de niveaux d’analyse multi-omiques pourrait à la fois renforcer son pouvoir prédictif et conduire à des résultats plus fiables. Avec le développement méthodologique continu, NetDecoder pourra produire plusieurs couches de flux d’information, offrant aux chercheurs une validation multi-omique pour leurs données d’intérêt.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs n’ont aucun intérêt financier concurrent.
Les illustrations des figures 1 et 2 ont été créées avec BioRender (BioRender.com).

Remerciements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ce travail a été soutenu par des subventions du Mayo Clinic Center for Biomedical Discovery, du Mayo Clinic Comprehensive Cancer Center (NIH ; P30 CA015083), le Centre de signalisation cellulaire en gastroentérologie de la Mayo Clinic (NIH : P30DK084567), la Fondation Glenn pour la recherche médicale, la Fondation V pour la recherche sur le cancer (S.Z.), le programme de recherche sur la nutrition et l’obésité de la Mayo Clinic, le programme David F. et Margaret T. Grohne en immunologie et immunothérapie du cancer, Schmidt Sciences, Innovation et les National Institutes of Health (NIH ; U19AG74879, P50CA136393, R01CA240323, R03OD038392).

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
AnnotationDbiBioconductorversion 1.68.0Annotation et cartographie des gènes
BioconductorBioconductorversion 3.19Cadre pour l'analyse des données transcriptomiques et écosystème de packages supportant DESeq2, edgeR, limma, AnnotationDbi, et les bases de données d'organismes, etc.
CytoscapeThe Cytoscape Consoritumversion 3.10.4Visualisation et analyse de réseau
DESeq2Bioconductorversion 1.46.0Analyse d'expression différentielle (avec modélisation binomiale négative)
dplyrPosit Software, PBC anciennement RStudio, PBCversion 1.1.4Manipulation et transformation des données
edgeRBioconductorversion 4.4.2Analyse d'expression différentielle basée sur les comptes
ggplot2Posit Software, PBC anciennement RStudio, PBCversion 4.0.0Visualisation des données et tracé
GNU BashGNU ProjectSystème par défautBash, Exécution des scripts du pipeline NetDecoder
igraphigraph Development Teamversion 2.1.4Construction de réseaux et analyse de graphes
LimmaBioconductorversion 3.62.2Modélisation linéaire pour l'analyse de l'expression génique
NetDecoderHu Li Laboratory, Mayo Clinic(2024 Hu Li Lab)Construction de réseaux d'interactions protéiques spécifiques au contexte via la modélisation du flux d'information
org.Hs.eg.dbBioconductorversion 3.20.0Base de données d'annotation des gènes humains
Oracle JDKOracle Corporation≥ version 1.8Environnement d'exécution pour l'exécution de NetDecoder
pheatmapRaivo Koldeversion 1.0.13Visualisation de la structure d'expression et de corrélation
RThe R Foundationversion 4.4.2Environnement de base pour l'analyse transcriptomique et des réseaux

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

MedicineNetworkscontext specificmodellingtranscriptomicsflow algorithmintegration
Vidéo bientôt disponible

Articles connexes