La evaluación por etapa de anclaje separó los efectos génicos específicos de tejido de los efectos génicos pan-tejido
La matriz de anclaje curada GSE117827 contenía 27.685 genes aprobados por HGNC. El contraste principal nasal incluyó 15 muestras de individuos infectados sintomáticos y 6 muestras de control negativas al virus; el contraste sanguíneo incluyó 13 muestras de individuos infectados sintomáticos y 6 controles (Tabla 1). Dado que esta pequeña cohorte no puede sustentar un descubrimiento estable a nivel de un solo gen, se utilizó como anclaje por compartimentos apareados. La estabilidad se evaluó a nivel de módulo mediante remuestreo bootstrap, pruebas nulas con genes aleatorios, validación externa y análisis de sensibilidad al tamaño de los módulos.
| Origen | Grupo | Condición | Contraste principal | n |
| Sangre | RSV | Infectado | Sí | 4 |
| Sangre | Picornavirus asintomático | Secundario | No | 5 |
| Sangre | Picornavirus sintomático | Infectado | Sí | 9 |
| Sangre | Control negativo para virus | Control | Sí | 6 |
| Nasal | RSV | Infectado | Sí | 6 |
| Nasal | Picornavirus asintomático | Secundario | No | 5 |
| Nasal | Picornavirus sintomático | Infectado | Sí | 9 |
| Nasal | Control negativo para virus | Control | Sí | 6 |
Tabla 1: Diseño del ancla GSE117827 tras la curación del contraste principal. Distribución de muestras entre los compartimentos sanguíneo y nasal en el conjunto de datos de anclas pareadas tras la curación del contraste principal. Las muestras de virus respiratorio sincitial (VRS) sintomáticas y las de picornavirus sintomáticas se clasificaron como infectadas e incluyeron en el contraste principal, mientras que los controles negativos para virus se clasificaron como controles e incluyeron en el contraste principal. Las muestras de picornavirus asintomáticas se designaron como secundarias y se excluyeron de la construcción del módulo; solo se utilizaron en el análisis exploratorio del gradiente de síntomas. Dos casos de VRS carecían de muestras sanguíneas, lo que resultó en cuatro muestras de VRS en sangre y seis en nasales.
Entre los 27.685 genes compartidos, las estimaciones de Hedges g en nariz y sangre presentaron una correlación casi nula (Pearson r = 0,015; Figura 1). Este resultado se obtuvo dentro de un solo estudio y está menos expuesto a diferencias entre estudios que una comparación agrupada entre cohortes. La densa nube central muestra que la mayoría de los genes no se expresaron de manera similar en ambos compartimentos. Los genes superpuestos resaltados fueron excepciones situadas en la parte superior de ambas listas de clasificación. Este patrón respalda la construcción separada de módulos para nariz y sangre.

Figura 1. Tamaños del efecto a nivel génico en la nariz y la sangre en la cohorte ancla pareada GSE117827. Los valores de Hedges g comparan la infección sintomática con controles negativos al virus para 27.685 genes. Las estimaciones nasales (15 infectados, 6 controles) se muestran en el eje x, y las estimaciones sanguíneas (13 infectados, 6 controles) en el eje y. El sombreado de los hexágonos indica el número de genes por casilla. Los puntos rojos indican los seis genes compartidos entre los módulos principales 50 de la nariz y la sangre. Pearson r = 0,015. Haga clic aquí para ver una versión más grande de esta figura.
La construcción de módulos produjo una pequeña superposición centrada en interferón
Los 50 módulos principales nasales y sanguíneos compartieron seis genes: ISG15, ACRBP, IFIT1, RSAD2, CCRL2 y XAF1 (índice de Jaccard = 0,064; Tabla 2; Figura 2). ISG15, IFIT1, RSAD2 y XAF1 son compatibles con la biología antiviral relacionada con interferón32,33,34. CCRL2 se interpreta mejor en el contexto de la migración inflamatoria de leucocitos35. ACRBP no tiene un papel antiviral establecido. Se informa sobre los seis genes por transparencia, pero no se afirma que ninguno sea un biomarcador cruzado entre tejidos validado. Sus valores de FDR individuales por gen no fueron significativos en la cohorte ancla pequeña. Por lo tanto, la principal inferencia se basa en la validación a nivel de módulo bloqueado, no en la lista de superposición.
| Gen | Hedges nasal g | FDR nasal | Hedges sanguíneo g | FDR sanguíneo | Interpretación |
| ISG15 | 2.215 | 0.213 | 1.369 | 0.442 | Gen antiviral estimulado por interferón; solapamiento exploratorio |
| ACRBP | 1.69 | 0.205 | 1.748 | 0.429 | Sin función antiviral establecida; retenido por transparencia |
| IFIT1 | 1.875 | 0.213 | 1.35 | 0.442 | Gen antiviral estimulado por interferón; solapamiento exploratorio |
| RSAD2 | 1.663 | 0.213 | 1.532 | 0.442 | Gen antiviral estimulado por interferón; solapamiento exploratorio |
| CCRL2 | 1.396 | 0.217 | 1.782 | 0.442 | Contexto inflamatorio de migración de leucocitos; no específico de virus |
| XAF1 | 1.603 | 0.226 | 1.47 | 0.442 | Factor de apoptosis vinculado a interferón; solapamiento exploratorio |
Tabla 2: Solapamiento exploratorio completo entre los módulos nasales y sanguíneos mejor clasificados. Los seis genes compartidos se presentan junto con los valores de Hedges g nasales y sanguíneos y los valores de FDR por gen. Los seis genes se consideran candidatos exploratorios de solapamiento por rango porque los valores de FDR por gen no fueron significativos en la pequeña cohorte de referencia. Se incluye ACRBP por transparencia, a pesar de carecer de un papel antiviral establecido. Ninguno de los seis genes se presenta como un biomarcador universal validado; la evidencia principal se basa en la validación externa a nivel de módulo.

Figura 2. Tamaños del efecto de los seis genes exploratorios de superposición nasal-sanguínea. Vallas nasales y sanguíneas g se muestran estimaciones para ACRBP, CCRL2, IFIT1, ISG15, RSAD2 y XAF1 en GSE117827. Los valores positivos indican una expresión mayor en la infección sintomática que en los controles negativos para el virus. Se muestra la superposición completa por transparencia; los valores de FDR para genes individuales no fueron significativos, y estos genes no se presentan como biomarcadores universales validados. Haga clic aquí para ver una versión más grande de esta figura.
El enriquecimiento funcional proporcionó una verificación biológica del contenido de los módulos
Ambos módulos mostraron enriquecimiento en vías de interferón y antivirales, aunque difirieron en la composición génica y en la intensidad del enriquecimiento (Figura 3). Se muestran los ocho términos más significativos por módulo. Para el módulo nasal, los términos principales incluyeron la respuesta al interferón gamma de Hallmark (valor P ajustado = 2,23 × 10⁻24), la respuesta al interferón alfa de Hallmark (valor P ajustado = 1,40 × 10⁻22), la señalización de interferón alfa/beta de Reactome (valor P ajustado = 3,64 × 10⁻19) y la respuesta de defensa frente al virus de GO (valor P ajustado = 5,47 × 10⁻15). El módulo sanguíneo mostró la misma biología general, pero con menor intensidad de enriquecimiento: respuesta al interferón alfa (valor P ajustado = 3,87 × 10⁻6), señalización de interferón alfa/beta de Reactome (valor P ajustado = 5,70 × 10⁻6), respuesta al interferón gamma (valor P ajustado = 8,89 × 10⁻6) y respuesta de defensa frente al virus (valor P ajustado = 1,07 × 10⁻4). Estos resultados respaldan la coherencia biológica sin implicar una clasificación idéntica de los genes en los compartimentos.

Figura 3. Términos de enriquecimiento seleccionados para los módulos nasales y sanguíneos. Se realizó un análisis de sobre-representación utilizando Enrichr con Hallmark 2020, Reactome 2022 y GO Biological Process 2023. Se muestran los ocho términos con los valores de P ajustados por Benjamini–Hochberg más pequeños para cada módulo. La longitud de las barras representa −log10(valor de P ajustado). Los paneles izquierdo y derecho muestran los módulos nasales y sanguíneos, respectivamente. Los términos se muestran en minúsculas iniciales. El análisis de enriquecimiento no alteró la pertenencia a los módulos. Haga clic aquí para ver una versión más grande de esta figura.
Los módulos bloqueados se probaron en una validación externa con tejidos coincidentes
El módulo nasal bloqueado alcanzó valores de AUCOR de 0,749 en GSE41374, 0,693 en GSE152075 y 0,609 en GSE156063 (Tabla 3; Figura 4). El módulo sanguíneo bloqueado alcanzó valores de AUCOR de 0,832 en GSE171110, 0,924 en la unidad GSE38900 GPL10558 y 0,870 en la unidad GPL6884. No se incluye el rendimiento interno del ancla porque está sesgado optimistamente por diseño. Los AUCOR externos se consideran resúmenes de portabilidad. Estos no establecen la sensibilidad clínica, especificidad ni idoneidad para el diagnóstico.
| Cohorte | Muestra/virus | Módulo | n positivos | n negativos | Genes representados | AUROC | Precisión media | FDR del test de Welch |
| GSE152075 | SARS-CoV-2 vías respiratorias altas | Nasal | 430 | 54 | 50 | 0.693 | 0.935 | 2.20 × 10⁻⁴ |
| GSE156063 | SARS-CoV-2 vías respiratorias altas | Nasal | 93 | 100 | 49 | 0.609 | 0.551 | 1.38 × 10⁻² |
| GSE171110 | SARS-CoV-2 sangre total | Sangre | 44 | 10 | 50 | 0.832 | 0.959 | 7.94 × 10⁻⁴ |
| GSE38900-GPL10558 | RSV sangre total | Sangre | 28 | 8 | 50 | 0.924 | 0.979 | 7.94 × 10⁻⁴ |
| GSE38900-GPL6884 | RSV sangre total | Sangre | 107 | 31 | 49 | 0.87 | 0.962 | 3.47 × 10⁻¹⁵ |
| GSE41374 | RSV lavado nasal | Nasal | 76 | 10 | 50 | 0.749 | 0.951 | 2.63 × 10⁻² |
Tabla 3: Validación externa del puntaje del módulo emparejado con tejido. El módulo nasal bloqueado se probó en GSE41374, GSE152075 y GSE156063, y el módulo sanguíneo bloqueado se evaluó en GSE171110 y en las plataformas GSE38900 GPL10558 y GPL6884. La tabla muestra los números de muestras positivas y negativas, los genes del módulo representados, el área bajo la curva (AUROC), la precisión media y el FDR del test de Welch. No se incluye el rendimiento del ancla interno. El AUROC y la precisión media se presentan como resúmenes de portabilidad y no como estimaciones del rendimiento diagnóstico clínico.

Figura 4. Portabilidad de los puntajes de módulos emparejados por tejido externo. Se muestran los AUROC para el módulo nasal en GSE41374 (76 RSV, 10 controles), GSE152075 (430 SARS-CoV-2, 54 controles) y GSE156063 (93 SARS-CoV-2, 100 controles), y para el módulo sanguíneo en GSE171110 (44 SARS-CoV-2, 10 controles), GSE38900-GPL10558 (28 RSV, 8 controles) y GSE38900-GPL6884 (107 RSV, 31 controles). Los puntajes son medias no ponderadas de los valores z por gen representados. La línea discontinua indica AUROC = 0,5. Los valores son resúmenes de portabilidad, no estimaciones diagnósticas clínicas. Haga clic aquí para ver una versión más grande de esta figura.
La validación longitudinal evaluó si las puntuaciones disminuyen durante la recuperación
Los conjuntos de datos complementarios GSE97741/GSE97742 proporcionaron un entorno de validación independiente mediante infección natural, con muestras agudas y de alta de niños hospitalizados27. Estas muestras no se utilizaron como datos de descubrimiento de controles sanos. Se emplearon para evaluar si las puntuaciones de los módulos derivadas de los anclajes disminuyeron desde la enfermedad aguda hasta el alta.
Para el grupo preespecificado combinado de infección única por VSR y rinovirus, se analizaron 68 sujetos apareados en cada tejido (Tabla 4; Figura 5). El módulo sanguíneo disminuyó desde la enfermedad aguda hasta el alta en sangre (delta medio = 0,330; Cohen dz = 0,740; FDR del test apareado = 1,98 × 10⁻7; AUROC = 0,765). El módulo nasal también disminuyó en las muestras nasofaríngeas (delta medio = 0,436; Cohen dz = 0,477; FDR del test apareado = 3,06 × 10⁻4; AUROC = 0,679). Las trayectorias apareadas y sus errores estándar muestran que la disminución a nivel grupal no fue impulsada por unos pocos valores extremos no apareados.
| Conjunto de datos | Origen de la muestra | Módulo | Tejido coincidente | n pares | Delta medio agudo-de alta | Cohen dz | AUROC | FDR del test pareado |
| GSE97741 | Sangre | Sangre | Sí | 68 | 0.330 | 0.740 | 0.765 | 1.98 × 10⁻⁷ |
| GSE97741 | Sangre | Nasal | No | 68 | 0.479 | 0.721 | 0.755 | 3.19 × 10⁻⁷ |
| GSE97742 | Nasofaríngeo | Sangre | No | 68 | 0.361 | 0.914 | 0.845 | 9.42 × 10⁻¹⁰ |
| GSE97742 | Nasofaríngeo | Nasal | Sí | 68 | 0.436 | 0.477 | 0.679 | 3.06 × 10⁻⁴ |
Tabla 4: Validación longitudinal independiente agudo-frente-a-alta. La tabla muestra el número de pares completos, la diferencia media entre la puntuación aguda y la de alta, el Cohen dz, el AUROC y el FDR del test pareado para los módulos fijos en GSE97741 y GSE97742. Un delta positivo indica una puntuación del módulo más alta durante la enfermedad aguda. Los valores de FDR del test pareado son los valores P ajustados mediante el método de Benjamini–Hochberg del test t pareado bilateral, calculados en los 20 test t pareados válidos del resultado longitudinal completo.

Figura 5. Cambios emparejados en las puntuaciones de los módulos desde la enfermedad aguda hasta el alta. (A) Puntuaciones de los módulos sanguíneos en sangre total (GSE97741). (B) Puntuaciones de los módulos nasales en muestras nasofaríngeas (GSE97742). Cada panel contiene 68 pares completos de sujetos: 38 infecciones simples por VSR y 30 infecciones por rinovirus. Líneas delgadas conectan las mediciones emparejadas por sujeto. Los puntos naranjas indican las medias del grupo, y las barras de error naranjas indican el error estándar de la media. Se realizaron pruebas t pareadas bilaterales y pruebas de rangos con signo de Wilcoxon; se aplicó la corrección FDR de Benjamini–Hochberg en las 20 pruebas t pareadas longitudinales válidas. Haga clic aquí para ver una versión más grande de esta figura.
Las pruebas entre compartimentos revelaron un matiz útil. El módulo sanguíneo aplicado a muestras nasofaríngeas produjo un AUROC de 0,845, aunque los tamaños del efecto individuales en la nariz y la sangre mostraron una concordancia débil en el grupo de referencia. El examen de las trayectorias emparejadas mostró una disminución constante de las puntuaciones, en lugar de una distribución de etiquetas invertida. Por lo tanto, el resultado no constituye evidencia de que los mismos genes individuales dominen en ambos tejidos. Indica que un programa interferónico/inflamatorio coordinado puede resumirse mediante conjuntos de genes diferentes pero parcialmente redundantes. La especificidad del compartimento es más marcada a nivel de clasificación de genes y no es absoluta a nivel de vías o puntuaciones.
Las detecciones asintomáticas excluidas evaluaron el comportamiento del gradiente de síntomas
Las detecciones asintomáticas de picornavirus en GSE117827 se excluyeron de la construcción del módulo para evitar su inclusión en el grupo control principal. Este grupo excluido proporcionó entonces una verificación biológica. En ambos compartimentos, las puntuaciones del módulo aumentaron a través de los grupos ordenados de controles negativos para virus, detección asintomática de picornavirus e infección sintomática (Figura 6A,B).

Figura 6. Puntuaciones del módulo a lo largo del gradiente de síntomas excluidos. (A) Módulo nasal: 6 controles negativos para virus, 5 detecciones asintomáticas de picornavirus y 15 infecciones sintomáticas. (B) Módulo sanguíneo: 6 controles negativos para virus, 5 detecciones asintomáticas de picornavirus y 13 infecciones sintomáticas. Los puntos representan muestras individuales. Las líneas centrales indican las medianas; los cuadros abarcan del percentil 25 al 75; y los bigotes se extienden hasta los valores más extremos dentro de 1,5 veces el rango intercuartílico. Las etiquetas muestran comparaciones posteriores de Mann-Whitney U bilaterales con corrección de Benjamini-Hochberg en tres comparaciones por compartimento. Haga clic aquí para ver una versión más grande de esta figura.
El módulo nasal se correlacionó con la puntuación ordinal de los síntomas (rho de Spearman = 0,818, P = 3,28 × 10⁻7; Kruskal-Wallis P = 1,57 × 10⁻4). El módulo sanguíneo mostró un gradiente similar (rho = 0,861, P = 6,89 × 10⁻8; Kruskal-Wallis P = 1,92 × 10⁻4). Tras la corrección dentro de cada familia de tres comparaciones, la infección sintomática difirió de los controles y de las detecciones asintomáticas en ambos compartimentos. Las detecciones asintomáticas no difirieron de los controles negativos al virus (FDR nasal = 0,792; FDR sanguíneo = 0,082). Por lo tanto, los módulos reflejaron con mayor claridad la actividad de la respuesta del huésped sintomática que la detección viral por sí sola.
Los puntos de referencia clínicos definieron el límite entre la respuesta del huésped y la especificidad del patógeno
Los puntos de referencia clínicos definieron la distinción entre la actividad de la respuesta del huésped y la clasificación del patógeno (Tabla 5; Figura 7). En GSE63990, el módulo nasal produjo AUROCs de 0,782 para enfermedad viral frente a bacteriana y de 0,791 para enfermedad viral frente a no infecciosa. El módulo sanguíneo produjo AUROCs de 0,678 y 0,753, respectivamente. El comparador de ARNm de 33 genes de Pandya tuvo un mejor desempeño, con AUROCs de 0,867 y 0,852, respectivamente. Este resultado era esperable en un conjunto diseñado para discriminación entre viral y no viral, y muestra que los módulos ancla no deben presentarse como clasificadores diagnósticos sustitutivos.
| Conjunto de datos | Contraste | Nasal de referencia | Sangre de referencia | Pandya 33 mRNA | ISG de Andres-Terre | Interferón-alfa característico |
| GSE63990 | Viral frente a bacteriano | 0.782 | 0.678 | 0.867 | 0.833 | 0.831 |
| GSE63990 | Viral frente a no infeccioso | 0.791 | 0.753 | 0.852 | 0.851 | 0.848 |
| GSE40012 | Neumonía viral frente a bacteriana | 0.755 | 0.789 | 0.893 | 0.867 | 0.872 |
| GSE40012 | Neumonía viral frente a SIRS | 0.897 | 0.907 | 0.985 | 0.965 | 0.956 |
| GSE40012 | Neumonía viral frente a sano | 0.804 | 0.986 | 0.923 | 0.906 | 0.891 |
| GSE40012 | Neumonía bacteriana frente a sano | 0.476 | 0.917 | 0.465 | 0.391 | 0.378 |
| GSE53543 | PMBC estimulados ex vivo con rinovirus frente a no estimulados | 1 | 0.957 | 1 | 1 | 1 |
Tabla 5: Referencia de AUROC para módulos ancla y conjuntos de respuesta del huésped de referencia. GSE63990 y GSE40012 son cohortes clínicas de sangre completa. GSE53543 es un experimento de perturbación de PBMC ex vivo que involucra a 98 sujetos apareados y se informa por separado de las cohortes clínicas naturales. Los conjuntos de referencia se puntuaron como promedios de genes no ponderados en lugar de como sus clasificadores ponderados originales. Los valores de AUROC se reportan como métricas de referencia y no como estimaciones del desempeño diagnóstico clínico.

Figura 7. Evaluación de AUROC de los módulos ancla y conjuntos de respuesta del huésped de referencia. Las filas representan contrastes preespecificados en GSE63990, GSE40012 y GSE53543; las columnas representan los dos módulos ancla y tres conjuntos de referencia no ponderados. GSE53543 se etiqueta como PBMC estimulados ex vivo con rinovirus frente a no estimulados y se presenta por separado de los cohortes clínicos naturales. El comparador Hallmark se etiqueta como interferón-alfa de Hallmark. Los valores en las celdas indican AUROC utilizados para la evaluación de métodos y no deben interpretarse como estimaciones del rendimiento diagnóstico clínico. Haga clic aquí para ver una versión más grande de esta figura.
GSE40012 precisó aún más este límite. El comparador Pandya alcanzó valores de AUROC de 0,893 para neumonía viral frente a neumonía bacteriana y de 0,985 para neumonía viral frente a SIRS. El módulo sanguíneo diferenció la neumonía por influenza A de los controles sanos (AUROC = 0,986) y de SIRS (AUROC = 0,907), pero también separó la neumonía bacteriana de los controles sanos (AUROC = 0,917). Por lo tanto, el módulo sanguíneo mide una actividad inflamatoria sistémica generalizada y asociada a interferón. No es específico de virus, y una puntuación alta no puede asignar la clase de patógeno.
En el conjunto de referencia ex vivo de PBMC GSE53543 independiente, el módulo nasal y los comparadores de interferón alcanzaron un AUROC de 1.000 para los PBMC estimulados con rinovirus frente a los PBMC con medio únicamente; el módulo sanguíneo alcanzó un AUROC de 0.957. Los 98 sujetos contribuyeron con condiciones apareadas. Este resultado controlado respalda la respuesta de los programas puntuados a la estimulación con rinovirus. No estima el rendimiento diagnóstico clínico.
Las pruebas de robustez evaluaron el tamaño del módulo, alternativas aleatorias y estabilidad de la selección
La separación de los anclajes permaneció sin cambios a través de los 10, 25, 50, 100 y 200 genes mejor clasificados (Figura 8A). Estas AUROC internas no constituyen una validación externa, pero indican que el resultado cualitativo no dependió de elegir exactamente 50 genes. En 500 conjuntos aleatorios de 50 genes, las medianas de AUROC bajo la hipótesis nula fueron 0.489 para la muestra nasal y 0.705 para la sanguínea; los percentiles 99 correspondientes fueron 0.722 y 0.872 (Figura 8B). Los módulos observados superaron estas distribuciones nulas. Las frecuencias de selección mediante bootstrap se distribuyeron de forma dispersa, en lugar de concentrarse en una única lista invariable (Figura 8C). Este hallazgo refleja directamente el pequeño tamaño de la muestra de anclaje. Apoya la existencia de una señal agregada estable, aunque advierte contra considerar cada gen seleccionado como fijo.

Figura 8. Análisis de robustez según tamaño del módulo, genes aleatorios y bootstrap. (A) AUROC del ancla en módulos de tamaño 10, 25, 50, 100 y 200 genes; estos valores representan verificaciones internas de sensibilidad. (B) Distribuciones de AUROC a partir de 500 conjuntos aleatorios de 50 genes codificadores de proteínas, seleccionados sin reemplazo entre los genes representados en GSE117827 (semilla = 20260622). Los puntos naranjas indican los AUROC observados de los módulos. Las líneas horizontales dentro de cada violín indican el percentil 25, la mediana y el percentil 75. (C) La reselección mediante bootstrap se limitó a los 1.000 genes codificadores de proteínas con efecto positivo mejor clasificados en el análisis original del ancla para cada compartimento. Las barras muestran los 20 genes con mayor frecuencia de selección por compartimento; la frecuencia de selección se calculó como el número de selecciones dividido por 100. Haga clic aquí para ver una versión más grande de esta figura.
Los análisis de programas marcadores y de varianza aclararon qué miden las puntuaciones
En los conjuntos GSE40012, GSE53543 y GSE63990, ambos módulos se correlacionaron de manera más consistente con el programa de interferón mieloide (Figura 9A). Las correlaciones del módulo nasal fueron 0.812, 0.878 y 0.882; las correlaciones del módulo sanguíneo fueron 0.517, 0.843 y 0.774. La partición de la varianza fue descriptiva (Tabla 6; Figura 9B). Para el módulo sanguíneo, la condición y el grupo detallado explicaron más varianza (eta al cuadrado = 0.282 y 0.250, respectivamente) que el conjunto de datos (0.066), el tipo de muestra (0.026) o el grupo de origen (0.025). Para el módulo nasal, el grupo detallado y la condición también explicaron más varianza que el conjunto de datos, el tipo de muestra o el grupo de origen. Por lo tanto, la condición biológica y el grupo detallado representaron fracciones mayores de la varianza de las puntuaciones del módulo que el conjunto de datos o el tipo de muestra, aunque los efectos no nulos del conjunto de datos y de la composición siguen siendo una limitación del reuso masivo de datos públicos.

Figura 9. Correlaciones entre marcadores y programas, y partición descriptiva de la varianza. (A) Correlaciones de Spearman entre las puntuaciones de módulos y las puntuaciones de seis programas de marcadores en GSE40012, GSE53543 y GSE63990. Los programas requerían al menos tres genes representados. Los valores de P se ajustaron en todas las correlaciones entre conjunto de datos, módulo y programa. Las celdas vacías indican combinaciones no disponibles o no estimables tras cumplir los requisitos de genes y muestras. (B) Eta al cuadrado unidireccional (η2; suma de cuadrados entre grupos / suma total de cuadrados) para la condición, grupo detallado, conjunto de datos, tipo de muestra y grupo de origen. El análisis incluyó 934 puntuaciones de módulos sanguíneos y 1.469 puntuaciones de módulos nasales, y es descriptivo, no causal. Haga clic aquí para ver una versión más grande de esta figura.
| Módulo | Factor | Eta al cuadrado | n muestras |
| Sangre de referencia | Condición | 0.282 | 934 |
| Sangre de referencia | Grupo detallado | 0.25 | 934 |
| Sangre de referencia | Conjunto de datos | 0.066 | 934 |
| Sangre de referencia | Tipo de muestra | 0.026 | 934 |
| Sangre de referencia | Grupo de origen | 0.025 | 934 |
| Nasal de referencia | Grupo detallado | 0.17 | 1469 |
| Nasal de referencia | Condición | 0.13 | 1469 |
| Nasal de referencia | Conjunto de datos | 0.021 | 1469 |
| Nasal de referencia | Tipo de muestra | 0.006 | 1469 |
| Nasal de referencia | Grupo de origen | 0.002 | 1469 |
Tabla 6: Partición descriptiva de la varianza de las puntuaciones de los módulos. Se incluye una fila para cada par módulo-factor, con el valor correspondiente de eta al cuadrado y el tamaño de la muestra. El eta al cuadrado se calculó como la suma de cuadrados entre grupos dividida por la suma total de cuadrados tras excluir las filas con puntuaciones de módulo o factor faltantes. Los factores se evaluaron individualmente; por lo tanto, el análisis es descriptivo, no ajusta por factores mutuamente correlacionados y no debe interpretarse de forma causal.
Disponibilidad de datos:
Todos los conjuntos de datos transcriptómicos analizados en este estudio están disponibles públicamente en el Gene Expression Omnibus bajo los números de acceso GSE117827, GSE41374, GSE152075, GSE156063, GSE171110, GSE38900, GSE97741, GSE97742, GSE63990, GSE40012 y GSE53543. Los datos derivados del análisis que sustentan las figuras y tablas principales, así como el código de análisis, están disponibles a solicitud razonable al autor correspondiente. En este estudio no se utilizaron datos a nivel de participantes restringidos ni recién generados.