L'évaluation par étape d'ancrage a séparé les effets géniques spécifiques à un tissu des effets géniques pan-tissulaires
La matrice d'ancrage curatée GSE117827 contenait 27 685 gènes approuvés par HGNC. Le contraste nasal principal comprenait 15 échantillons infectés symptomatiques et 6 échantillons témoins négatifs au virus ; le contraste sanguin comprenait 13 échantillons infectés symptomatiques et 6 témoins (Tableau 1). Étant donné que cette petite cohorte ne permet pas une découverte stable au niveau des gènes individuels, elle a été utilisée comme ancrage apparié par compartiment. La stabilité a été évaluée au niveau des modules par rééchantillonnage bootstrap, tests nuls aléatoires sur les gènes, validation externe et analyses de sensibilité à la taille des modules.
| Source | Groupe | Condition | Contraste principal | n |
| Sang | RSV | Infected | Oui | 4 |
| Sang | Picornavirus asymptomatique | Secondaire | Non | 5 |
| Sang | Picornavirus symptomatique | Infected | Oui | 9 |
| Sang | Témoin négatif pour le virus | Témoin | Oui | 6 |
| Nasal | RSV | Infected | Oui | 6 |
| Nasal | Picornavirus asymptomatique | Secondaire | Non | 5 |
| Nasal | Picornavirus symptomatique | Infected | Oui | 9 |
| Nasal | Témoin négatif pour le virus | Témoin | Oui | 6 |
Tableau 1 : Conception de l'ancrage pour GSE117827 après curation du contraste principal. Répartition des échantillons entre les compartiments sanguin et nasal dans le jeu de données à ancrage apparié après curation du contraste principal. Les échantillons de virus respiratoire syncytial (VRS) symptomatiques et les échantillons de picornavirus symptomatiques ont été classés comme infectés et inclus dans le contraste principal, tandis que les témoins négatifs pour les virus ont été classés comme témoins et inclus dans le contraste principal. Les échantillons de picornavirus asymptomatiques ont été désignés comme secondaires et exclus de la construction des modules ; ils ont été utilisés uniquement dans l'analyse exploratoire du gradient de symptômes. Deux cas de VRS ne disposaient pas d'échantillons sanguins, ce qui donne un total de quatre échantillons sanguins et six échantillons nasaux de VRS.
Parmi les 27 685 gènes partagés, les estimations de Hedges g pour le nez et le sang étaient presque non corrélées (Pearson r = 0,015 ; Figure 1). Ce résultat provient d'une seule étude et est moins exposé aux différences entre études qu'une comparaison groupée transversale entre cohortes. Le nuage dense central montre que la plupart des gènes ne se sont pas déplacés de manière similaire dans les deux compartiments. Les gènes de recouvrement mis en évidence constituaient des exceptions situées en haut des deux listes de classement. Ce schéma soutient la construction séparée de modules nasaux et sanguins.

Figure 1. Tailles d'effet au niveau des gènes dans le nez et le sang dans la cohorte ancre appariée GSE117827. Les valeurs de Hedges g comparent l'infection symptomatique à des contrôles négatifs au virus pour 27 685 gènes. Les estimations nasales (15 infectés, 6 contrôles) sont indiquées sur l'axe des abscisses, et les estimations sanguines (13 infectés, 6 contrôles) sur l'axe des ordonnées. La teinte des hexagones indique le nombre de gènes par bin. Les points rouges indiquent les six gènes partagés entre les modules nasaux et sanguins du top 50. Pearson r = 0,015. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
La construction des modules a produit un petit chevauchement centré sur l'interféron
Les 50 premiers modules nasaux et sanguins partageaient six gènes : ISG15, ACRBP, IFIT1, RSAD2, CCRL2 et XAF1 (indice de Jaccard = 0,064 ; Tableau 2 ; Figure 2). ISG15, IFIT1, RSAD2 et XAF1 sont compatibles avec une biologie antivirale liée à l'interféron32,33,34. CCRL2 s'interprète mieux dans le contexte de la migration des leucocytes inflammatoires35. ACRBP n'a aucun rôle antiviral établi. Les six gènes sont indiqués par souci de transparence, mais aucun n'est revendiqué comme biomarqueur validé traversant les tissus. Leurs valeurs de FDR au niveau individuel n'étaient pas significatives dans le petit groupe témoin. L'inférence principale repose donc sur la validation au niveau des modules verrouillés, et non sur la liste des chevauchements.
| Gène | Hedges nasal g | FDR nasal | Hedges sanguin g | FDR sanguin | Interprétation |
| ISG15 | 2.215 | 0.213 | 1.369 | 0.442 | Gène antiviral induit par l'interféron ; chevauchement exploratoire |
| ACRBP | 1.69 | 0.205 | 1.748 | 0.429 | Aucun rôle antiviral établi ; conservé par transparence |
| IFIT1 | 1.875 | 0.213 | 1.35 | 0.442 | Gène antiviral induit par l'interféron ; chevauchement exploratoire |
| RSAD2 | 1.663 | 0.213 | 1.532 | 0.442 | Gène antiviral induit par l'interféron ; chevauchement exploratoire |
| CCRL2 | 1.396 | 0.217 | 1.782 | 0.442 | Contexte de migration des leucocytes inflammatoires ; non spécifique aux virus |
| XAF1 | 1.603 | 0.226 | 1.47 | 0.442 | Facteur d'apoptose lié à l'interféron ; chevauchement exploratoire |
Tableau 2 : Chevauchement exploratoire complet entre les modules nasaux et sanguins les mieux classés. Les six gènes partagés sont indiqués avec les valeurs de Hedges g nasales et sanguines ainsi que les valeurs de FDR par gène. Les six gènes sont considérés comme des candidats exploratoires de chevauchement de classement, car les valeurs de FDR par gène n'étaient pas significatives dans le petit groupe témoin. Le gène ACRBP est conservé par transparence, malgré l'absence de rôle antiviral établi. Aucun des six gènes n'est présenté comme un biomarqueur universel validé ; les preuves principales reposent sur une validation externe au niveau du module.

Figure 2. Tailles d'effet des six gènes exploratoires présentant un chevauchement entre nez et sang. Les estimations de Hedges g dans les échantillons nasaux et sanguins sont présentées pour ACRBP, CCRL2, IFIT1, ISG15, RSAD2 et XAF1 dans GSE117827. Des valeurs positives indiquent une expression plus élevée lors d'une infection symptomatique par rapport aux témoins négatifs au virus. Le chevauchement complet est montré à des fins de transparence ; les valeurs de FDR au niveau du gène unique n'étaient pas significatives, et ces gènes ne sont pas présentés comme des biomarqueurs universels validés. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
L'enrichissement fonctionnel a fourni un contrôle biologique sur le contenu des modules
Les deux modules étaient enrichis pour les voies de l'interféron et antivirales, bien que la composition génique et l'intensité d'enrichissement diffèrent (Figure 3). Les huit termes les plus significatifs par module sont affichés. Pour le module nasal, la réponse Hallmark à l'interféron-gamma (ajusté P = 2,23 × 10⁻24), la réponse Hallmark à l'interféron-alpha (ajusté P = 1,40 × 10⁻22), la signalisation Reactome de l'interféron-alpha/bêta (ajusté P = 3,64 × 10⁻19) et la réponse à la défense contre les virus selon GO (ajusté P = 5,47 × 10⁻15) figuraient parmi les termes principaux. Le module sanguin présentait la même biologie générale, mais avec une intensité d'enrichissement moindre : réponse à l'interféron-alpha (ajusté P = 3,87 × 10⁻6), signalisation Reactome de l'interféron-alpha/bêta (ajusté P = 5,70 × 10⁻6), réponse à l'interféron-gamma (ajusté P = 8,89 × 10⁻6) et réponse à la défense contre les virus (ajusté P = 1,07 × 10⁻4). Ces résultats confirment la cohérence biologique sans impliquer une hiérarchisation identique des gènes selon les compartiments.

Figure 3. Termes d'enrichissement sélectionnés pour les modules nasaux et sanguins. Une analyse de sur-représentation a été réalisée à l'aide d'Enrichr avec Hallmark 2020, Reactome 2022 et GO Biological Process 2023. Les huit termes présentant les valeurs de P ajustées selon Benjamini–Hochberg les plus faibles pour chaque module sont indiqués. La longueur des barres représente −log10(valeur de P ajustée). Les panneaux gauche et droit montrent respectivement les modules nasaux et sanguins. Les termes sont affichés en casse de phrase. L'analyse d'enrichissement n'a pas modifié l'appartenance aux modules. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
Les modules verrouillés ont été testés lors d'une validation externe appariée aux tissus
Le module nasal verrouillé a atteint des AUC-ROC de 0,749 dans GSE41374, 0,693 dans GSE152075 et 0,609 dans GSE156063 (Tableau 3 ; Figure 4). Le module sanguin verrouillé a atteint des AUC-ROC de 0,832 dans GSE171110, 0,924 dans l'unité GSE38900 GPL10558 et 0,870 dans l'unité GPL6884. Les performances internes des ancres ne sont pas indiquées car elles sont biaisées de manière optimiste par construction. Les AUC-ROC externes sont considérées comme des résumés de portabilité. Elles n'établissent pas la sensibilité clinique, la spécificité ou l'aptitude au diagnostic.
| Cohorte | Échantillon/virus | Module | n positif | n négatif | Gènes représentés | AUROC | Précision moyenne | FDR du test de Welch |
| GSE152075 | SARS-CoV-2 voies respiratoires supérieures | Nasal | 430 | 54 | 50 | 0.693 | 0.935 | 2.20 × 10⁻⁴ |
| GSE156063 | SARS-CoV-2 voies respiratoires supérieures | Nasal | 93 | 100 | 49 | 0.609 | 0.551 | 1.38 × 10⁻² |
| GSE171110 | SARS-CoV-2 sang total | Sang | 44 | 10 | 50 | 0.832 | 0.959 | 7.94 × 10⁻⁴ |
| GSE38900-GPL10558 | RSV sang total | Sang | 28 | 8 | 50 | 0.924 | 0.979 | 7.94 × 10⁻⁴ |
| GSE38900-GPL6884 | RSV sang total | Sang | 107 | 31 | 49 | 0.87 | 0.962 | 3.47 × 10⁻¹⁵ |
| GSE41374 | Lavage nasal RSV | Nasal | 76 | 10 | 50 | 0.749 | 0.951 | 2.63 × 10⁻² |
Tableau 3 : Validation externe des scores de modules appariés aux tissus. Le module nasal verrouillé a été testé dans les séries GSE41374, GSE152075 et GSE156063, et le module sanguin verrouillé a été testé dans les unités de plateforme GSE171110 et GSE38900, GPL10558 et GPL6884. Le tableau indique les nombres d'échantillons positifs et négatifs, les gènes du module représentés, l'AUROC, la précision moyenne et la FDR du test de Welch. Les performances des ancres internes sont omises. L'AUROC et la précision moyenne sont indiquées comme résumés de portabilité et non comme des estimations de la performance diagnostique clinique.

Figure 4. Transférabilité des scores de module appariés aux tissus externes. Les AUROC sont présentés pour le module nasal dans GSE41374 (76 RSV, 10 témoins), GSE152075 (430 SARS-CoV-2, 54 témoins) et GSE156063 (93 SARS-CoV-2, 100 témoins), ainsi que pour le module sanguin dans GSE171110 (44 SARS-CoV-2, 10 témoins), GSE38900-GPL10558 (28 RSV, 8 témoins) et GSE38900-GPL6884 (107 RSV, 31 témoins). Les scores correspondent aux moyennes non pondérées des valeurs z par gène représentées. La ligne en pointillés indique un AUROC = 0,5. Les valeurs constituent des résumés de transférabilité, et non des estimations diagnostiques cliniques. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
La validation longitudinale a testé si les scores diminuent pendant la récupération
Les jeux de données complémentaires GSE97741/GSE97742 ont fourni un cadre de validation indépendant basé sur une infection naturelle, comprenant des échantillons prélevés en phase aiguë et au moment de la sortie chez des enfants hospitalisés27. Ces échantillons n'ont pas été utilisés comme données de découverte de contrôles sains. Ils ont servi à évaluer si les scores des modules dérivés des ancres diminuaient entre la phase aiguë de la maladie et la sortie hospitalière.
Pour le groupe combiné prédéfini d'infection unique par le VRS et le rhinovirus, 68 sujets appariés ont été analysés pour chaque tissu (Tableau 4 ; Figure 5). Le module sanguin a diminué de la phase aiguë à la sortie pour le sang (delta moyen = 0,330 ; Cohen dz = 0,740 ; FDR du test apparié = 1,98 × 10⁻7 ; AUROC = 0,765). Le module nasal a également diminué dans les échantillons nasopharyngés (delta moyen = 0,436 ; Cohen dz = 0,477 ; FDR du test apparié = 3,06 × 10⁻4 ; AUROC = 0,679). Les trajectoires appariées et leurs erreurs standard montrent que la baisse au niveau du groupe n'était pas due à quelques valeurs extrêmes non appariées.
| Jeu de données | Source de l'échantillon | Module | Tissu apparié | Nombre de paires | Delta moyen aigu-décharge | Cohen dz | AUROC | FDR du test apparié |
| GSE97741 | Sang | Sang | Oui | 68 | 0,330 | 0,740 | 0,765 | 1,98 × 10⁻⁷ |
| GSE97741 | Sang | Nasal | Non | 68 | 0,479 | 0,721 | 0,755 | 3,19 × 10⁻⁷ |
| GSE97742 | Nasopharyngé | Sang | Non | 68 | 0,361 | 0,914 | 0,845 | 9,42 × 10⁻¹⁰ |
| GSE97742 | Nasopharyngé | Nasal | Oui | 68 | 0,436 | 0,477 | 0,679 | 3,06 × 10⁻⁴ |
Tableau 4 : Validation longitudinale indépendante aiguë par rapport au moment du congé. Le tableau indique le nombre de paires complètes, la différence moyenne entre les scores aigu et au congé, le dz de Cohen, l'AUROC et la FDR du test apparié pour les modules fixes dans les jeux de données GSE97741 et GSE97742. Un delta positif indique un score de module plus élevé durant la phase aiguë de la maladie. Les valeurs de FDR du test apparié correspondent à des P valeurs ajustées selon Benjamini–Hochberg pour des tests t appariés bilatéraux, calculées sur l'ensemble des 20 tests t appariés valides présents dans la sortie longitudinale complète.

Figure 5. Évolution appariée des scores des modules de la maladie aiguë au congé. (A) Scores des modules sanguins dans le sang total (GSE97741). (B) Scores des modules nasaux dans les échantillons nasopharyngés (GSE97742). Chaque graphique comprend 68 paires complètes de sujets : 38 infections simples à VRS et 30 infections à rhinovirus. Des lignes fines relient les mesures appariées par sujet. Les points orange indiquent les moyennes du groupe, et les barres d'erreur oranges indiquent l'erreur-type de la moyenne. Des tests t appariés bilatéraux et des tests de Wilcoxon pour échantillons appariés ont été réalisés ; une correction FDR de Benjamini–Hochberg a été appliquée sur l'ensemble des 20 tests t appariés longitudinaux valides. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
Les tests intercompartiments ont révélé une nuance utile. Le module sanguin appliqué aux échantillons nasopharyngés a donné une AUC-ROC de 0,845, bien que les effets individuels du nez et du sang aient été faiblement concordants dans l'élément de référence. L'analyse des trajectoires appariées a montré une diminution constante des scores, plutôt qu'une distribution inversée des étiquettes. Ainsi, ce résultat ne constitue pas une preuve que les mêmes gènes individuels dominent dans les deux tissus. Il indique plutôt qu'un programme coordonné d'interféron/inflammation peut être résumé par des ensembles de gènes différents mais partiellement redondants. La spécificité par compartiment est la plus marquée au niveau du classement des gènes et n'est pas absolue au niveau des voies ou des scores.
Les détections asymptomatiques exclues ont été testées pour évaluer le comportement selon le gradient des symptômes
Les détections asymptomatiques de picornavirus dans GSE117827 ont été exclues de la construction du module afin d'éviter leur inclusion dans le groupe témoin principal. Ce groupe exclu a ensuite servi de contrôle biologique. Dans les deux compartiments, les scores des modules ont augmenté progressivement à travers les groupes ordonnés suivants : contrôles négatifs au virus, détections asymptomatiques de picornavirus et infections symptomatiques (Figure 6A,B).

Figure 6. Scores des modules selon le gradient de symptômes conservé. (A) Module nasal : 6 témoins négatifs pour les virus, 5 détections asymptomatiques de picornavirus et 15 infections symptomatiques. (B) Module sanguin : 6 témoins négatifs pour les virus, 5 détections asymptomatiques de picornavirus et 13 infections symptomatiques. Les points représentent des échantillons individuels. Les lignes centrales indiquent les médianes ; les boîtes s'étendent du 25e au 75e centile ; les moustaches vont jusqu'aux valeurs les plus extrêmes dans un intervalle de 1,5 fois l'écart interquartile. Les étiquettes indiquent les comparaisons a posteriori bilatérales de Mann-Whitney U avec correction de Benjamini-Hochberg pour les trois comparaisons par compartiment. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
Le module nasal était corrélé au score ordinal des symptômes (rho de Spearman = 0,818, P = 3,28 × 10⁻7 ; Kruskal-Wallis P = 1,57 × 10⁻4). Le module sanguin présentait un gradient similaire (rho = 0,861, P = 6,89 × 10⁻8 ; Kruskal-Wallis P = 1,92 × 10⁻4). Après correction au sein de chaque famille de trois comparaisons, l'infection symptomatique différait des témoins et des détections asymptomatiques dans les deux compartiments. Les détections asymptomatiques ne différaient pas des témoins négatifs au virus (FDR nasal = 0,792 ; FDR sanguin = 0,082). Les modules reflétaient donc l'activité de la réponse hôte symptomatique de manière plus nette que la détection virale seule.
Des critères cliniques ont défini la limite entre la réponse de l'hôte et la spécificité du pathogène
Les critères cliniques ont établi la distinction entre l'activité de la réponse de l'hôte et la classification des pathogènes (Tableau 5 ; Figure 7). Dans GSE63990, le module nasal a donné des AUC-ROC de 0,782 pour la distinction maladie virale/maladie bactérienne et de 0,791 pour maladie virale/maladie non infectieuse. Le module sanguin a donné respectivement des AUC-ROC de 0,678 et 0,753. Le comparateur à 33 ARNm de Pandya a donné de meilleurs résultats, avec des AUC-ROC respectives de 0,867 et 0,852. Ce résultat était attendu pour un ensemble conçu pour discriminer les infections virales des non virales, et montre que les modules d'ancrage ne doivent pas être présentés comme des classificateurs diagnostiques de remplacement.
| Jeu de données | Contraste | Repère nasal | Repère sanguin | ARNm Pandya 33 | ISG Andres-Terre | Interféron-alpha caractéristique |
| GSE63990 | Viral contre bactérien | 0,782 | 0,678 | 0,867 | 0,833 | 0,831 |
| GSE63990 | Viral contre non infectieux | 0,791 | 0,753 | 0,852 | 0,851 | 0,848 |
| GSE40012 | Pneumonie virale contre pneumonie bactérienne | 0,755 | 0,789 | 0,893 | 0,867 | 0,872 |
| GSE40012 | Pneumonie virale contre SIRS | 0,897 | 0,907 | 0,985 | 0,965 | 0,956 |
| GSE40012 | Pneumonie virale contre état sain | 0,804 | 0,986 | 0,923 | 0,906 | 0,891 |
| GSE40012 | Pneumonie bactérienne contre état sain | 0,476 | 0,917 | 0,465 | 0,391 | 0,378 |
| GSE53543 | GBMC stimulés ex vivo par le rhinovirus contre non stimulés | 1 | 0,957 | 1 | 1 | 1 |
Tableau 5 : Référence AUROC pour les modules d'ancrage et les jeux de référence de la réponse hôte. GSE63990 et GSE40012 sont des cohortes cliniques de sang total. GSE53543 est une expérience de perturbation ex vivo sur des PBMC impliquant 98 sujets appariés et est rapportée séparément des cohortes cliniques naturelles. Les jeux de référence ont été notés selon la moyenne non pondérée des gènes plutôt que selon leurs classificateurs pondérés d'origine. Les valeurs AUROC sont indiquées comme métriques de référence et non comme estimations de la performance diagnostique clinique.

Figure 7. Évaluation comparative par AUROC des modules d'ancrage et des jeux de référence de la réponse hôte. Les lignes représentent des comparaisons prédéfinies dans les jeux de données GSE63990, GSE40012 et GSE53543 ; les colonnes représentent les deux modules d'ancrage et les trois jeux de référence non pondérés. Le jeu GSE53543 est étiqueté comme cellules mononucléées du sang périphérique (PBMC) stimulées ex vivo par le rhinovirus par rapport aux PBMC non stimulées, et est présenté séparément des cohortes cliniques naturelles. Le comparateur Hallmark est étiqueté Hallmark interféron-alpha. Les valeurs dans les cellules indiquent les AUROC utilisées pour l'évaluation comparative des méthodes et ne doivent pas être interprétées comme des estimations de la performance diagnostique clinique. Veuillez cliquer ici pour afficher une version agrandie de cette figure.
GSE40012 a précisé cette limite. Le comparateur Pandya a atteint des AUROC de 0,893 pour la pneumonie virale contre bactérienne et de 0,985 pour la pneumonie virale contre le SIRS. Le module sanguin a distingué la pneumonie à influenza A des témoins sains (AUROC = 0,986) et du SIRS (AUROC = 0,907), mais il a également différencié la pneumonie bactérienne des témoins sains (AUROC = 0,917). Le module sanguin mesure donc une activité inflammatoire systémique générale et associée à l'interféron. Il n'est pas spécifique aux virus, et un score élevé ne permet pas d'attribuer une classe de pathogène.
Dans le test témoin ex vivo GSE53543 distinct, le module nasal et les comparateurs d'interféron ont atteint une AUROC de 1,000 pour les PBMC stimulés par le rhinovirus par rapport aux PBMC traités au milieu seul ; le module sanguin a atteint une AUROC de 0,957. Les 98 sujets ont tous fourni des conditions appariées. Ce résultat contrôlé soutient la réactivité des programmes évalués à la stimulation par le rhinovirus. Il n'estime pas la performance diagnostique clinique.
Des vérifications de robustesse ont testé la taille des modules, les alternatives aléatoires et la stabilité de la sélection
La séparation des ancres est restée inchangée pour les 10, 25, 50, 100 et 200 gènes les mieux classés (Figure 8A). Ces AUC-ROC internes ne constituent pas une validation externe, mais montrent que le résultat qualitatif ne dépendait pas du choix exact de 50 gènes. Dans 500 ensembles aléatoires de 50 gènes, les médianes d’AUC-ROC sous l’hypothèse nulle étaient de 0,489 pour le tissu nasal et de 0,705 pour le sang ; les 99e percentiles correspondants étaient respectivement de 0,722 et 0,872 (Figure 8B). Les modules observés dépassaient ces distributions nulles. Les fréquences de sélection par rééchantillonnage bootstrap étaient réparties plutôt que concentrées dans une liste unique invariante (Figure 8C). Cette observation reflète directement la petite taille de l’échantillon d’ancrage. Elle soutient l’existence d’un signal agrégé stable, tout en mettant en garde contre le fait de considérer chaque gène sélectionné comme fixe.

Figure 8. Analyses de robustesse de la taille du module, des gènes aléatoires et du bootstrap. (A) AUROC d'ancrage selon différentes tailles de module : 10, 25, 50, 100 et 200 gènes ; ces valeurs représentent des contrôles internes de sensibilité. (B) Distributions de l'AUROC obtenues à partir de 500 ensembles aléatoires de 50 gènes codant des protéines, échantillonnés sans remise parmi les gènes présents dans GSE117827 (graine = 20260622). Les points orange indiquent les AUROC observés pour les modules. Les lignes horizontales à l'intérieur de chaque tracé en violon indiquent le 25e percentile, la médiane et le 75e percentile. (C) Le rééchantillonnage par bootstrap a été restreint aux 1 000 gènes codant des protéines ayant un effet positif, classés comme les mieux placés dans l'analyse d'ancrage initiale pour chaque compartiment. Les barres montrent les 20 gènes ayant la fréquence de sélection la plus élevée par compartiment ; la fréquence de sélection a été calculée comme le nombre de sélections divisé par 100. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
Les analyses des programmes marqueurs et de la variance ont précisé ce que mesurent les scores
Dans les jeux de données GSE40012, GSE53543 et GSE63990, les deux modules étaient le plus régulièrement corrélés au programme interféron myéloïde (Figure 9A). Les corrélations pour le module nasal étaient de 0,812, 0,878 et 0,882 ; celles du module sanguin étaient de 0,517, 0,843 et 0,774. La partition de la variance était descriptive (Tableau 6 ; Figure 9B). Pour le module sanguin, la condition et le groupe détaillé expliquaient davantage de variance (éta² = 0,282 et 0,250, respectivement) que le jeu de données (0,066), le type d'échantillon (0,026) ou le groupe d'origine (0,025). Pour le module nasal, le groupe détaillé et la condition expliquaient également plus de variance que le jeu de données, le type d'échantillon ou le groupe d'origine. La condition biologique et le groupe détaillé expliquaient donc des fractions plus importantes de la variance des scores des modules que le jeu de données ou le type d'échantillon, bien que des effets non nuls liés au jeu de données et à la composition restent une limite à la réutilisation de données publiques en bulk.

Figure 9. Corrélations entre les programmes marqueurs et partition descriptive de la variance. (A) Corrélations de Spearman entre les scores de module et les six scores de programme marqueur dans GSE40012, GSE53543 et GSE63990. Les programmes nécessitaient au moins trois gènes représentés. Les valeurs P ont été ajustées pour l'ensemble des corrélations jeu de données-module-programme. Les cellules vides indiquent des combinaisons non disponibles ou non estimables après application des critères relatifs aux gènes et aux échantillons. (B) Éta-carré unidirectionnel (η2 ; somme des carrés intergroupes / somme totale des carrés) pour la condition, le groupe détaillé, le jeu de données, le type d'échantillon et le groupe d'origine. L'analyse a inclus 934 scores de module sanguin et 1 469 scores de module nasal et est descriptive, non causale. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
| Module | Facteur | Éta-carré | n échantillons |
| Anchor blood | Condition | 0.282 | 934 |
| Anchor blood | Groupe détaillé | 0.25 | 934 |
| Anchor blood | Jeu de données | 0.066 | 934 |
| Anchor blood | Type d'échantillon | 0.026 | 934 |
| Anchor blood | Groupe source | 0.025 | 934 |
| Anchor nasal | Groupe détaillé | 0.17 | 1469 |
| Anchor nasal | Condition | 0.13 | 1469 |
| Anchor nasal | Jeu de données | 0.021 | 1469 |
| Anchor nasal | Type d'échantillon | 0.006 | 1469 |
| Anchor nasal | Groupe source | 0.002 | 1469 |
Tableau 6 : Partition descriptive de la variance des scores des modules. Une ligne est fournie pour chaque paire module-facteur, avec la valeur d'êta-carré correspondante et la taille de l'échantillon. L'êta-carré a été calculé comme le rapport de la somme des carrés intergroupes divisée par la somme totale des carrés, après exclusion des lignes manquantes le score du module ou du facteur concerné. Les facteurs ont été évalués individuellement ; par conséquent, l'analyse est descriptive, n'ajuste pas pour les facteurs mutuellement corrélés et ne doit pas être interprétée de manière causale.
Disponibilité des données :
Tous les jeux de données transcriptomiques analysés dans cette étude sont accessibles publiquement à partir de Gene Expression Omnibus sous les numéros d'accès GSE117827, GSE41374, GSE152075, GSE156063, GSE171110, GSE38900, GSE97741, GSE97742, GSE63990, GSE40012 et GSE53543. Les données issues des analyses qui sous-tendent les principales figures et tableaux, ainsi que le code d'analyse, sont disponibles auprès de l'auteur correspondant sur demande raisonnable. Aucune donnée individuelle restreinte ou nouvellement générée n'a été utilisée dans cette étude.