Бенчмаркинг с использованием опорных этапов позволил разделить тканеспецифические и общетканевые эффекты генов
Курированная опорная матрица GSE17827 содержала 27 685 генов, одобренных HGNC. Основное сравнение по назальным пробам включало 15 образцов от инфицированных пациентов с симптомами и 6 контрольных образцов с отрицательным результатом на вирус; сравнение по крови включало 13 образцов от инфицированных пациентов с симптомами и 6 контрольных образцов (Таблица 1). Поскольку данная малая когорта не может обеспечить стабильное обнаружение отдельных генов, она была использована в качестве опорной для парных компартментов. Стабильность оценивалась на уровне модулей с помощью бутстрэп-ресемплинга, проверки нулевой гипотезы с использованием случайных генов, внешней валидации и анализа чувствительности к размеру модуля.
| Пожалуйста, предоставьте исходный текст для перевода. | Группа | Условие | Основной контраст | н |
| Кровь | РСВ | Инфицированный | Да | 4 |
| Кровь | Бессимптомный пикорнавирус | Вторичный | Нет | 5 |
| Кровь | Симптоматический пикорнавирус | Инфицированный | Да | 9 |
| Кровь | Вирус-отрицательный контроль | Контроль | Да | 6 |
| Носовой | РСВ | Инфицированный | Да | 6 |
| Назальный | Бессимптомный пикорнавирус | Вторичный | Нет | 5 |
| Носовой | Симптоматический пикорнавирус | Инфицированный | Да | 9 |
| Назальный | Вирус-отрицательный контроль | Контроль | Да | 6 |
Таблица 1: Дизайн якорей GSE17827 после первичной курации контраста. Распределение образцов по кровяному и назальному компартментам в парном наборе данных якорей после первичной курации контраста. Образцы с симптоматическим респираторно-синцитиальным вирусом (RSV) и симптоматическим пикорнавирусом были классифицированы как инфицированные и включены в первичный контраст, тогда как вирус-отрицательные контроли были классифицированы как контроли и включены в первичный контраст. Бессимптомные образцы с пикорнавирусом были обозначены как вторичные и исключены из построения модуля; они использовались только в эксплораторном анализе градиента симптомов. В двух случаях RSV отсутствовали образцы крови, в результате чего было получено четыре образца крови и шесть назальных образцов RSV.
Среди 27 685 общих генов оценки g Хеджеса для носа и крови оказались практически не скоррелированы (коэффициент Пирсона r = 0,015; Рисунок 1). Этот результат был получен в рамках одного исследования и в меньшей степени подвержен межисследовательским различиям, чем совокупное сравнение разных когорт. Плотное центральное облако показывает, что большинство генов не демонстрировали схожей динамики в обоих компартментах. Выделенные перекрывающиеся гены были исключениями, находившимися в верхней части обоих ранжированных списков. Такая закономерность обосновывает раздельное построение модулей для носа и крови.

Рисунок 1. Размеры эффектов на уровне генов в мазках из носа и образцах крови в парной когорте-якоре GSE17827. Хеджирование г значения сравнивают симптоматическую инфекцию с вирус-отрицательным контролем для 27 685 генов. По оси x представлены оценки для назальных мазков (15 инфицированных, 6 контрольных), по оси y — оценки для крови (13 инфицированных, 6 контрольных). Гексагональное заштрихованное разбиение указывает количество генов в каждом бине. Красные точки обозначают шесть генов, общих для топ-50 модулей в носовых мазках и крови. Коэффициент Пирсона Пожалуйста, предоставьте текст для перевода. = 0.015. Нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Построение модулей выявило небольшое перекрытие, сосредоточенное вокруг интерферонов
Топ-50 модулей назального секрета и крови имели шесть общих генов: ISG15, ACRBP, IFIT1, RSAD2, CCRL2 и XAF1 (индекс Жаккара = 0.064; Таблица 2; Рисунок 2). ISG15, IFIT1, RSAD2 и XAF1 согласуются с интерферон-зависимой противовирусной биологией32,3,34. CCRL2 правильнее интерпретировать в контексте воспалительной миграции лейкоцитов35. Для ACRBP установленной противовирусной роли не описано. Все шесть генов приведены для прозрачности данных, однако ни один из них не заявляется как валидированный межтканевый биомаркер. Значения FDR для каждого отдельного гена в небольшой опорной когорте не были значимыми. Таким образом, основной вывод основывается на фиксированной валидации на уровне модулей, а не на списке перекрывающихся генов.
| Ген | Назальные Hedges g | Назальные FDR | Кровь Hedges g | Кровь FDR | Интерпретация |
| ISG15 | 2.215 | 0.213 | 1.369 | 0.42 | Стимулируемый интерфероном противовирусный ген; исследовательское перекрытие |
| ACRBP | 1.69 | 0.205 | 1.748 | 0.429 | Установленная противовирусная роль отсутствует; сохранен для прозрачности |
| IFIT1 | 1.875 | 0.213 | 1.35 | 0.42 | Стимулируемый интерфероном противовирусный ген; исследовательское перекрытие |
| RSAD2 | 1.63 | 0.213 | 1.532 | 0.42 | Стимулируемый интерфероном противовирусный ген; исследовательское перекрытие |
| CCRL2 | 1.396 | 0.217 | 1.782 | 0.42 | Контекст воспалительной миграции лейкоцитов; не вирус-специфичный |
| XAF1 | 1.603 | 0.26 | 1.47 | 0.42 | Связанный с интерфероном фактор апоптоза; исследовательское перекрытие |
Таблица 2: Полное эксплораторное перекрытие между наиболее значимыми модулями в носовых выделениях и крови. Для всех шести общих генов указаны значения Hedges g для носа и крови, а также значения FDR для каждого гена. Все шесть генов рассматриваются как эксплораторные кандидаты с перекрытием по рангу, поскольку значения FDR для отдельных генов не были значимыми в малой якорной когорте. ACRBP сохранен для обеспечения прозрачности, несмотря на отсутствие установленной противовирусной роли. Ни один из шести генов не представлен в качестве валидированного универсального биомаркера; основные доказательства основаны на внешней валидации на уровне модулей.

Рисунок 2Размеры эффектов для шести эксплораторных генов с перекрытием в назальном секрете и крови. Назальные и кровяные геджи г представлены оценки для ACRBP, CCRL2, IFIT1, ISG15, RSAD2 и XAF1 в GSE17827. Положительные значения указывают на более высокую экспрессию при симптоматической инфекции, чем в вирусонегативных контролях. Полное перекрытие показано для прозрачности; значения FDR для отдельных генов не были значимыми, и данные гены не представлены в качестве валидированных универсальных биомаркеров. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Функциональный анализ обогащения обеспечил биологическую проверку содержания модулей
Оба модуля были обогащены путями интерферона и противовирусными путями, хотя генный состав и степень обогащения различались (Рисунок 3). Представлены восемь наиболее значимых терминов для каждого модуля. Для назального модуля среди ведущих терминов были: Hallmark interferon-gamma response (скорректированное P = 2.23 × 10⁻24), Hallmark interferon-alpha response (скорректированное P = 1.40 × 10⁻22), Reactome interferon-alpha/beta signalling (скорректированное P = 3.64 × 10⁻19) и GO defense response to virus (скорректированное P = 5.47 × 10⁻15). Модуль крови продемонстрировал те же общие биологические характеристики, но с меньшей степенью обогащения: interferon-alpha response (скорректированное P = 3.87 × 10⁻6), Reactome interferon-alpha/beta signaling (скорректированное P = 5.70 × 10⁻6), interferon-gamma response (скорректированное P = 8.89 × 10⁻6) и defense response to virus (скорректированное P = 1.07 × 10⁻4). Эти результаты подтверждают биологическую согласованность, не подразумевая при этом идентичного ранжирования генов в разных компартментах.

Рисунок 3. Отобранные термины обогащения для назального модуля и модуля крови. Анализ избыточного представления был выполнен с помощью Enrichr с использованием баз данных Hallmark 2020, Reactome 202 и GO Biological Process 2023. Восемь терминов с наименьшими значениями, скорректированными по методу Бенджамини — Хохберга, P представлены значения для каждого модуля. Длина столбца соответствует −log10(скорректированный P значение). На левой и правой панелях представлены модули носа и крови соответственно. Термины приведены строчными буквами (с заглавной только первая буква). Анализ обогащения не изменил принадлежность к модулю. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Закрепленные модули были протестированы в ходе внешней валидации на соответствующих типах тканей
Закрепленный назальный модуль достиг значений AUROC 0,749 в GSE41374, 0,693 в GSE152075 и 0,609 в GSE156063 (Таблица 3; Рисунок 4). Закрепленный модуль для крови достиг значений AUROC 0,832 в GSE1710, 0,924 в блоке GPL1058 набора GSE3890 и 0,870 в блоке GPL684. Данные по эффективности внутренних якорей опущены, так как они имеют оптимистическое смещение по определению. Внешние значения AUROC рассматриваются как сводные показатели переносимости. Они не устанавливают клиническую чувствительность, специфичность или готовность к диагностике.
| Когорта | Образец/вирус | Модуль | n-положительный | n-отрицательный | Представленные гены | AUROC (площадь под ROC-кривой) | Средняя точность | FDR-исправление для критерия Уэлча |
| GSE152075 | SARS-CoV-2 в верхних дыхательных путях | Носовой | 430 | 54 | 50 | 0.693 | 0.935 | 2,20 × 10⁻⁴ |
| GSE156063 | SARS-CoV-2 в верхних дыхательных путях | Назальный | 93 | 100 | 49 | 0.609 | 0.551 | 1,38 × 10⁻² |
| GSE1710 | цельная кровь на SARS-CoV-2 | Кровь | 44 | 10 | 50 | 0.832 | 0.959 | 7,94 × 10⁻⁴ |
| GSE3890-GPL1058 | цельная кровь на РСВ | Кровь | 28 | 8 | 50 | 0.924 | 0.979 | 7,94 × 10⁻⁴ |
| GSE3890-GPL6884 | цельная кровь на РСВ | Кровь | 107 | 31 | 49 | 0.87 | 0.962 | 3,47 × 10⁻¹⁵ |
| GSE41374 | Промывание носа при РСВ | Назальный | 76 | 10 | 50 | 0.749 | 0.951 | 2,63 × 10⁻² |
Таблица 3: Внешняя валидация модуля с учетом соответствия тканей. Заблокированный назальный модуль был протестирован в GSE41374, GSE152075 и GSE156063, а заблокированный модуль крови — в GSE1710 и в единицах платформы GSE3890 GPL1058 и GPL6884. В таблице указано количество положительных и отрицательных образцов, представленные гены модуля, AUROC, средняя точность (average precision) и FDR по тесту Уэлча. Показатели внутреннего якоря опущены. AUROC и средняя точность представлены в качестве показателей переносимости, а не как оценки клинической диагностической эффективности.

Рисунок 4Внешняя переносимость оценки модуля с сопоставлением по типу ткани. Представлены значения AUROC для назального модуля в наборах GSE41374 (76 случаев RSV, 10 контролей), GSE152075 (430 случаев SARS-CoV-2, 54 контроля) и GSE156063 (93 случая SARS-CoV-2, 10 контролей), а также для модуля крови в наборах GSE17110 (4 случая SARS-CoV-2, 10 контролей), GSE38900-GPL1058 (28 случаев RSV, 8 контролей) и GSE3890-GPL6884 (107 случаев RSV, 31 контроль). Показатели представляют собой невзвешенные средние значения соответствующих z-показателей для каждого гена. Пунктирная линия соответствует AUROC = 0,5. Приведенные значения являются сводными данными по переносимости модели, а не клиническими диагностическими оценками. Пожалуйста, нажмите здесь, чтобы просмотреть эту иллюстрацию в увеличенном размере.
Продольная валидация позволила проверить, снижаются ли показатели в процессе выздоровления
Сопутствующие наборы данных GSE9741/GSE9742 обеспечили независимую среду валидации при естественном инфицировании, включая образцы, полученные от госпитализированных детей в острой фазе и при выписке27. Эти образцы не использовались в качестве данных группы здорового контроля при поиске. Они применялись для оценки того, снижались ли баллы модулей, производных от анкеров, при переходе от острой фазы заболевания к выписке.
Для заранее определенной комбинированной группы с однократной инфекцией RSV и риновирусом в каждой ткани было проанализировано 68 пар испытуемых (Таблица 4; Рисунок 5). Показатели кровяного модуля снизились от стадии острой болезни до выписки в крови (средняя дельта = 0.30; Cohen dz = 0.740; FDR парного теста = 1.98 × 10⁻7; AUROC = 0.765). Назальный модуль также снизился в образцах из носоглотки (средняя дельта = 0.436; Cohen dz = 0.477; FDR парного теста = 3.06 × 10⁻4; AUROC = 0.679). Парные траектории и их стандартные ошибки показывают, что снижение на уровне группы не было вызвано несколькими единичными экстремальными значениями.
| Набор данных | Образец источника | Модуль | Соответствие по типу ткани | n пар | Средняя дельта при выписке в остром периоде | Коэн Пожалуйста, предоставьте исходный текст для перевода. | AUROC | FDR для парного теста |
| GSE9741 | Кровь | Кровь | Да | 68 | 0.330 | 0.740 | 0.765 | 1,98 × 10⁻⁷ |
| GSE97741 | Кровь | Носовой | Нет | 68 | 0.479 | 0.721 | 0.755 | 3,19 × 10⁻⁷ |
| GSE97742 | Носоглоточный | Кровь | Нет | 68 | 0.361 | 0.914 | 0.845 | 9,42 × 10⁻¹⁰ |
| GSE97742 | Носоглоточный | Носовой | Да | 68 | 0.436 | 0.477 | 0.679 | 3,06 × 10⁻⁴ |
Таблица 4: Независимая лонгитюдная валидация: острый период в сравнении с моментом выписки. В таблице представлены количество полных пар, средняя разница показателей между острым периодом и моментом выписки, Cohen dz, AUROC и FDR парного теста для фиксированных модулей в GSE9741 и GSE9742. Положительное значение дельты указывает на более высокий показатель модуля во время острого заболевания. Значения FDR парного теста представляют собой двухсторонние P-значения парного t-критерия, скорректированные по методу Бенджамини — Хохберга и рассчитанные по всем 20 валидным парным t-тестам в полном лонгитюдном массиве данных.

Рисунок 5Парные изменения баллов по модулям от стадии острого заболевания до выписки. (A) Баллы показателей модуля крови в цельной крови (GSE9741). (B) Показатели назального модуля в образцах из носоглотки (GSE9742). На каждой панели представлены 68 полных пар субъектов: 38 случаев первичной инфекции РСВ и 30 случаев инфекции риновирусом. Тонкие линии соединяют согласованные измерения одного и того же субъекта. Оранжевые точки обозначают средние значения по группе, а оранжевые планки погрешностей — стандартную ошибку среднего. Двусторонний парный t были проведены t-критерии и критерии знаковых рангов Вилкоксона; для 20 валидных продольных парных сравнений была применена поправка Бенджамини–Хохберга для контроля доли ложноположительных результатов (FDR) t тесты Пожалуйста, нажмите здесь, чтобы просмотреть эту фигуру в большем размере.
Тесты между различными компартментами выявили важный нюанс. Модуль крови, примененный к образцам из носоглотки, показал значение AUROC 0,845, несмотря на то что величины эффекта для отдельных образцов из носа и крови в анкоре были слабо согласованы. Анализ парных траекторий показал последовательное снижение показателей, а не инверсию распределения меток. Таким образом, данный результат не является доказательством того, что в обеих тканях доминируют одни и те же гены. Он указывает на то, что скоординированная интерфероновая/воспалительная программа может быть описана различными, но частично избыточными наборами генов. Специфичность компартментов наиболее выражена на уровне ранжирования генов и не является абсолютной на уровне путей или итоговых показателей.
Тестирование поведения градиента симптомов на исключенных бессимптомных случаях
Случаи обнаружения бессимптомного пикорнавируса в GSE17827 были исключены из построения модуля, чтобы избежать их включения в основную контрольную группу. Эта отделенная группа затем была использована для биологической проверки. В обоих компартментах показатели модулей возрастали в упорядоченных группах: вирус-отрицательный контроль, бессимптомное обнаружение пикорнавируса и симптоматическая инфекция (Рисунок 6A,B).

Рисунок 6Показатели модулей по всему градиенту симптомов в отложенной выборке. (A) Назальный модуль: 6 вирусотрицательных контролей, 5 случаев обнаружения пикорнавирусов у бессимптомных пациентов и 15 случаев симптоматических инфекций. (B) Модуль крови: 6 вирус-отрицательных контролей, 5 случаев обнаружения пикорнавирусов у бессимптомных особей и 13 случаев симптоматических инфекций. Точки представляют отдельные образцы. Центральные линии обозначают медианы; прямоугольники охватывают диапазон от 25-го до 75-го перцентиля; «усы» extending до наиболее экстремальных значений в пределах 1,5 межквартильного размаха. Метки содержат результаты двусторонних апостериорных сравнений по U-критерию Манна–Уитни с поправкой Бенджамини–Хохберга для трех сравнений в каждом отделе. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Назальный модуль коррелировал с порядковым баллом симптомов (Spearman rho = 0.818, P = 3.28 × 10⁻7; Kruskal-Wallis P = 1.57 × 10⁻4). Модуль крови продемонстрировал аналогичный градиент (rho = 0.861, P = 6.89 × 10⁻8; Kruskal-Wallis P = 1.92 × 10⁻4). После коррекции внутри каждой группы из трех сравнений симптомная инфекция значимо отличалась от контрольной группы и случаев бессимптомного обнаружения вируса в обоих компартментах. Бессимптомные случаи не отличались от вирус-отрицательных контролей (назальный FDR = 0.792; кровь FDR = 0.082). Таким образом, модули более четко отслеживали активность симптомного ответа хозяина, чем простое обнаружение вируса.
Клинические контрольные показатели определили границу между ответом хозяина и специфичностью патогена
Клинические контрольные показатели позволили разграничить активность ответа хозяина и классификацию патогенов (Таблица 5; Рисунок 7). В наборе данных GSE6390 назальный модуль обеспечил значения AUROC 0,782 для дифференциации вирусных и бактериальных заболеваний и 0,791 для дифференциации вирусных и неинфекционных заболеваний. Модуль крови обеспечил значения AUROC 0,678 и 0,753 соответственно. Компаратор Pandya 3-mRNA показал более высокие результаты с AUROC 0,867 и 0,852 соответственно. Такой результат ожидаем для набора, разработанного для разграничения вирусных и невирусных состояний, и показывает, что опорные модули не следует представлять в качестве заменяющих диагностических классификаторов.
| Набор данных | Контраст | Назальный анкер | Фиксация крови | мРНК Pandya 3 | ISG Андрес-Терре | Характерный интерферон-альфа |
| GSE6390 | Вирусная и бактериальная инфекции | 0.782 | 0.678 | 0.867 | 0.833 | 0.831 |
| GSE6390 | Вирусные и неинфекционные препараты | 0.791 | 0.753 | 0.852 | 0.851 | 0.848 |
| GSE40012 | Вирусная пневмония в сравнении с бактериальной пневмонией | 0.755 | 0.789 | 0.893 | 0.867 | 0.872 |
| GSE40012 | Вирусная пневмония в сравнении с СРВС | 0.897 | 0.907 | 0.985 | 0.965 | 0.956 |
| GSE40012 | Вирусная пневмония в сравнении со здоровым состоянием | 0.804 | 0.986 | 0.923 | 0.906 | 0.891 |
| GSE4012 | Бактериальная пневмония в сравнении со здоровым состоянием | 0.476 | 0.917 | 0.465 | 0.391 | 0.378 |
| GSE53543 | PBMC, стимулированные риновирусом ex vivo, в сравнении с нестимулированными PBMC | 1 | 0.957 | 1 | 1 | 1 |
Таблица 5: Контрольные показатели AUROC для якорных модулей и эталонных наборов ответов хозяина. GSE63990 и GSE4012 представляют собой клинические когорты цельной крови. GSE53543 является экспериментом по пертурбации PBMC ex vivo с участием 98 пар субъектов и приводится отдельно от естественных клинических когорт. Эталонные наборы оценивались как невзвешенные средние значения по генам, а не как их исходные взвешенные классификаторы. Значения AUROC приводятся в качестве контрольных показателей и не являются оценками клинической диагностической эффективности.

Рисунок 7Сравнительный анализ AUROC для анкерных модулей и эталонных наборов ответов хозяина. Строки представляют собой предварительно определенные контрасты в наборах GSE63990, GSE4012 и GSE53543; столбцы представляют два якорных модуля и три невзвешенных референтных набора. Набор GSE53543 обозначен как PBMCs, стимулированные риновирусом ex vivo, в сравнении с нестимулированными PBMCs, и представлен отдельно от естественных клинических когорт. Компаратор Hallmark обозначен как Hallmark interferon-alpha. Значения в ячейках указывают AUROC, использованные для бенчмаркинга метода, и не должны интерпретироваться как оценки клинической диагностической эффективности. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Набор данных GSE4012 позволил уточнить эту границу. Компаратор Пандьи достиг значений AUROC 0,893 при сравнении вирусной и бактериальной пневмонии и 0,985 при сравнении вирусной пневмонии с SIRS. Модуль анализа крови позволил дифференцировать пневмонию, вызванную гриппом А, от здорового контроля (AUROC = 0,986) и от SIRS (AUROC = 0,907), однако он также дифференцировал бактериальную пневмонию от здорового контроля (AUROC = 0,917). Таким образом, модуль анализа крови измеряет общую системную воспалительную активность и активность, связанную с интерфероном. Он не является вирус-специфичным, и высокий балл не позволяет определить класс патогена.
В отдельном сравнительном анализе ex vivo PBMC (GSE53543) назальный модуль и компараторы интерферона достигли показателя AUROC 1,0 при сравнении PBMC, стимулированных риновирусом, с PBMC в среде; модуль крови достиг AUROC 0,957. Все 98 субъектов предоставили парные образцы. Этот контролируемый результат подтверждает чувствительность оцениваемых программ к стимуляции риновирусом. Данные результаты не являются оценкой клинической диагностической эффективности.
Проверки робастности позволили протестировать размер модуля, случайные альтернативы и стабильность отбора
Разделение якорей оставалось неизменным для 10, 25, 50, 100 и 20 наиболее высокорейтинговых генов (Рисунок 8A). Эти внутренние показатели AUROC не являются внешней валидацией, однако они демонстрируют, что качественный результат не зависел от выбора именно 50 генов. В 50 случайных наборах из 50 генов медианы нулевого AUROC составили 0,489 для назальных проб и 0,705 для крови; соответствующие 9-й процентили составили 0,72 и 0,872 (Рисунок 8B). Наблюдаемые модули превысили эти нулевые распределения. Частоты отбора при бутстрэппинге были распределены, а не сконцентрированы в одном инвариантном списке (Рисунок 8C). Этот результат напрямую отражает малый размер выборки якорей. Он подтверждает наличие стабильного совокупного сигнала, предостерегая при этом от рассмотрения каждого отобранного гена как фиксированного.

Рисунок 8Анализ устойчивости к размеру модуля, случайному выбору генов и бутстреп-анализ. (A) Значения Anchor AUROC для модулей размером 10, 25, 50, 10 и 20 генов; эти значения представляют собой результаты внутренней проверки чувствительности. (B) Распределения AUROC для 500 случайных наборов из 50 белок-кодирующих генов, отобранных без возвращения из числа генов, представленных в GSE17827 (seed = 2026062). Оранжевые точки обозначают наблюдаемые значения AUROC модулей. Горизонтальные линии внутри каждой скрипичной диаграммы указывают на 25-й процентиль, медиану и 75-й процентиль. (C) Повторный отбор методом бутстрэппинга был ограничен 1 0 кодирующими белками генами с положительным эффектом, имевшими самые высокие ранги в исходном базовом анализе для каждого компартмента. Столбцы отображают 20 генов с наибольшей частотой отбора для каждого компартмента; частота отбора рассчитывалась как количество выборок, деленное на 10. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Анализ программ-маркеров и дисперсионный анализ позволили уточнить, что именно измеряют полученные показатели
В наборах данных GSE4012, GSE53543 и GSE6390 оба модуля наиболее последовательно коррелировали с миелоидной интерфероновой программой (Рисунок 9A). Коэффициенты корреляции для назального модуля составили 0,812, 0,878 и 0,82; для модуля крови — 0,517, 0,843 и 0,74. Разделение дисперсии носило описательный характер (Таблица 6; Рисунок 9B). Для модуля крови состояние и детальная группа объясняли большую часть дисперсии (эта-квадрат = 0,282 и 0,250 соответственно), чем набор данных (0,06), тип образца (0,026) или исходная группа (0,025). Для назального модуля детальная группа и состояние также объясняли большую часть дисперсии, чем набор данных, тип образца или исходная группа. Таким образом, биологическое состояние и детальная группа определяли более значительные доли дисперсии показателей модулей, чем набор данных или тип образца, хотя ненулевые эффекты набора данных и состава остаются ограничением при повторном использовании общедоступных данных секвенирования совокупной РНК (bulk RNA-seq).

Рисунок 9Корреляции между маркерами и программами и дескриптивное разделение дисперсии. (A) Корреляции Спирмена между показателями модулей и показателями шести маркерных программ в наборах данных GSE4012, GSE53543 и GSE6390. Для программ требовалось наличие как минимум трех представленных генов. P значения были скорректированы для всех корреляций «набор данных — модуль — программа». Пустые ячейки указывают на недоступные или не подлежащие оценке комбинации после учета требований к генам и образцам. (B) Однофакторная эта-квадрат (η2; межгрупповая сумма квадратов/общая сумма квадратов) для условий, детальных групп, наборов данных, типов образцов и исходных групп. Анализ включал 934 показателя модуля крови и 1469 показателей назального модуля; данный анализ является описательным, а не причинно-следственным. Пожалуйста, нажмите здесь, чтобы просмотреть эту фигуру в увеличенном масштабе.
| Модуль | Фактор | Эта-квадрат | Кол-во образцов (n) |
| Anchor blood | Состояние | 0.282 | 934 |
| Anchor blood | Подробная группа | 0.25 | 934 |
| Anchor blood | Набор данных | 0.066 | 934 |
| Anchor blood | Тип образца | 0.026 | 934 |
| Anchor blood | Исходная группа | 0.025 | 934 |
| Anchor nasal | Подробная группа | 0.17 | 1469 |
| Anchor nasal | Состояние | 0.13 | 1469 |
| Anchor nasal | Набор данных | 0.021 | 1469 |
| Anchor nasal | Тип образца | 0.006 | 1469 |
| Anchor nasal | Исходная группа | 0.02 | 1469 |
Таблица 6: Описательный анализ распределения дисперсии показателей модулей. Для каждой пары «модуль-фактор» приведена одна строка с соответствующим значением эта-квадрат и размером выборки. Эта-квадрат рассчитывался как сумма квадратов между группами, деленная на общую сумму квадратов, после исключения строк с отсутствующими показателями соответствующего модуля или фактора. Факторы оценивались индивидуально; следовательно, данный анализ является описательным, не учитывает взаимосвязанные факторы и не должен интерпретироваться как причинно-следственный.
Доступность данных:
Все транскриптомные наборы данных, проанализированные в этом исследовании, находятся в открытом доступе в базе Gene Expression Omnibus под номерами доступа GSE17827, GSE41374, GSE152075, GSE156063, GSE17110, GSE38900, GSE9741, GSE9742, GSE6390, GSE4012 и GSE53543. Данные, полученные в результате анализа и легшие в основу основных рисунков и таблиц, а также код анализа могут быть предоставлены автором для корреспонденции по обоснованному запросу. В данном исследовании не использовались ограниченные или вновь сгенерированные данные на уровне отдельных участников.