$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Валидация клинических когорт и секвенирования
Успешное выполнение верхнего протокола экстракции РНК и подготовки библиотеки (рисунок 1) было подтверждено показателями выхода и качества секвенирования. В этом репрезентативном наборе данных образцы костного мозга пяти недавно диагностированных пациентов с ОМЛ и четырёх рецидивов пациентов с ОМЛ дали в среднем около 6,0 ГБ сырых данных на выборку. Оценка контроля качества (Таблица 2) подтвердила, что базовое качество и глубина чтения соответствуют пороговым требованиям для дальнейшего биоинформатического анализа9. Низкая целостность РНК (например, RIN < 6.0), низкая скорость отображения или высокая смещённость деградации транскрипта будут представлять неоптимальное качество входа и снижать надёжность дальнейшего дифференциального анализа экспрессии.
Глобальная транскриптомическая дисперсия и PCA
Для оценки глобальной дисперсии транскриптома и изучения клинической группировки на нормализованных данных экспрессии была проведена PCA. В этом репрезентативном наборе данных недавно диагностированные и рецидивированные группы показали разделение в двумерном пространстве (рисунок 2A)20, при этом PC1 и PC2 составляли соответственно 23,82% и 18,75% от общей дисперсии. Диаграммы Венна на рисунке 2B,C предоставляют дополнительное описательное описание генов, обнаруженных в образцах в недавно диагностированных и рецидивировавших группах, поддерживая проверки воспроизводимости на уровне выборки перед дальнейшим дифференциальным анализом экспрессии. Поскольку когорта была небольшой и не парной, разделение PCA интерпретировалось как иллюстративный результат рабочего процесса, а не как окончательное свидетельство биологии, специфичной для состояния заболевания.
Анализ дифференциального экспрессионного гена (DEG)
Применение установленных пороговых норм протокола (|log2FC| ≥ 1 и скорректированное P-значение ≤ 0,05) к выходу DESeq2 выявило 2 025 DEG, включая 772 повышенных и 1 253 пониженных гена в рецидивирующей группе (рисунок 3A). Кандидатные транскрипты с высокой вариацией включали FOXC1 (log2FC = 7,55, P = 4,92 x 10-5), HOXA11 (log2FC = 7,76), HOXA11-AS (log2FC = 7,23) и AXL (log2FC = 3,50), а также пониженные RHOB, PTX3 и CXCL8. Существующая литература связывает несколько таких генов с стволом ОМЛ, сигнальным или терапевтическим ответом13,29; Однако текущий рабочий процесс идентифицирует их только как транскрипты, связанные с рецидивом. Любая окончательная механистическая роль в клинической устойчивости требует последующего независимого функционального подтверждения.
Функциональное и обогащение путей (GO, KEGG и GSEA)
Протокол функциональных аннотаций сопоставил DEG с более широкими биологическими системами. Анализ GO выявил обогащение терминов, связанных с сигнальной трансдукцией, опосредованной малыми GTPазами, транспортом ионов металлов и сборкой хроматина (рисунок 4A–C). Картирование путей KEGG выявило связи с взаимодействиями ЭКМ-рецепторов и взаимодействием цитокин-цитокиновых рецепторов (рисунок 4D). GSEA показала обогащение биосинтетических процессов РНК в рецидивирующей группе и обогащение энергетических метаболических путей в недавно диагностированной группе (рисунок 5A). Эти результаты обогащения предоставляют описательную дорожную карту изменённых наборов генов и должны интерпретироваться как ассоциации, генерирующие гипотезы, а не как проверенные причины рецидива.
Построение сети взаимодействия белков и белков (PPI)
Начальная сеть STRING включала 56 узлов и 193 взаимодействия. После удаления отключённых или осырённых узлов отображаемая подсеть Cytoscape содержала 42 узла и 136 взаимодействий (рисунок 5B). Модульный анализ сети отдал приоритет TP53, CCL2, CXCL8 и IL6 как центральным математическим узлам с наибольшим количеством взаимодействий. Поскольку сеть PPI опирается на прогнозируемые базой данных баллы взаимодействия (например, балл ATF3: 0,982), идентификацию хаба следует интерпретировать как приоритетное определение целей для будущих эмпирических исследований, а не как прямые доказательства обхода апоптоза, опосредованного p53, или других механизмов устойчивости.
Сырые данные секвенирования РНК, полученные в этом протоколе, были размещены в репозитории Figshare и доступны для общественности через следующий DOI: https://doi.org/10.6084/m9.figshare.30655814. Обработанные данные и связанные аналитические файлы включены в статью и её дополнительные материалы. Репрезентативные параметры командной строки и настройки анализа, используемые для воспроизведения вычислительного рабочего процесса, предоставляются в виде дополнительного файла 1. Все данные, подтверждающие результаты данного исследования, доступны без ограничений.
| Идентификатор пациента | Возраст (годы) | Пол | Молекулярные мутации | Выживание/Контроль (месяцы) | Клинический статус |
| R_AML_1 | 70 | Мужской | FLT3-ITD (+) | 22 | Умерший |
| R_AML_2 | 29 | Женский | NPM1 (+) | 11 | Живой |
| R_AML_3 | 40 | Мужской | CEBPA (+) | 17 | Живой |
| R_AML_4 | 55 | Женский | Тройной отрицательный* | 24 | Умерший |
Таблица 1: Демографические и клинические характеристики пациентов в группе рецидивирующей ОМЛ (R_AML). Таблица 1 суммирует демографические и клинические особенности рецидивирующей когорты ОМЛ, используемой в репрезентативном анализе, включая клинические характеристики на уровне пациента, релевантные для интерпретации транскриптомического рабочего процесса.
| Образец | Библиотека | Raw_reads | Raw_bases | Clean_reads | Clean_bases | Error_rate | Q20 | Q30 | GC_pct |
| AML_1 | FRAS25 0244891-1r | 48705066 | 7.31G | 47807532 | 7.17G | 0.01 | 99.35 | 97.48 | 47.48 |
| AML_2 | FRAS25 0244896-1r | 42969940 | 6,45G | 42237962 | 6.34G | 0.01 | 99.35 | 97.44 | 46.74 |
| AML_3 | FRAS2502 44906-1r | 48738386 | 7.31G | 47744462 | 7.16G | 0.01 | 99.36 | 97.48 | 47.28 |
| AML_4 | FRAS250 244915-1r | 48723650 | 7.31G | 47688240 | 7.15G | 0.01 | 99.29 | 97.26 | 47.45 |
| AML_5 | FRAS2502 44920-1r | 49508198 | 7.43G | 47740308 | 7.16G | 0.01 | 99.37 | 97.53 | 47.73 |
| R_AML_1 | FRAS2502 44892-1r | 47879408 | 7.18G | 46671584 | 7.0G | 0.01 | 99.39 | 97.49 | 47.63 |
| R_AML_2 | FRAS2502 70005-1r | 47657378 | 7.15G | 46957882 | 7.04G | 0.01 | 99.39 | 97.49 | 50.5 |
| R_AML_3 | FRAS250 405722-1r | 58754766 | 8.81G | 56867112 | 8,53G | 0.01 | 99.38 | 97.42 | 46.52 |
| R_AML_4 | FRAS2502 44902-1r | 48491122 | 7.27G | 47469334 | 7.12G | 0.01 | 99.23 | 97.21 | 46.43 |
Таблица 2: Сводка качества данных. Таблица 2 содержит показатели секвенирования качества для каждого образца, включая доходность чтения, базовое качество, содержание GC и информацию о контроле качества, связанную с картированием, используемую для определения пригодности образцов для дальнейшего анализа.

Рисунок 1: Рабочий процесс протокола. Рабочий процесс обобщает основные экспериментальные и вычислительные этапы, включая сбор клинических образцов, контроль качества РНК, подготовку и секвенирование библиотек, обработку и выравнивание чтений, количественную оценку транскриптов, анализ дифференциальной экспрессии, обогащение GO/KEGG, GSEA и построение сетей PPI. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 2: Количественный анализ образцов. (A) Был проведен анализ основных компонентов (PCA) для оценки межгрупповых различий и воспроизводимости внутригрупповых образцов. PCA проводился с использованием линейных алгебраических методов, основанных на нормализованных значениях экспрессии генов во всех образцах. (B, C) Диаграммы Венна, показывающие гены, обнаруженные в образцах в группах ОМЛ и R_AML соответственно. Регионы, ограниченные в образце, указывают на гены, обнаруженные в отдельных образцах, тогда как перекрывающиеся области — это гены, обычно обнаруженные в двух или более образцах. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 3: Дифференциальный анализ экспрессии генов. (A) Столбочный график, показывающий количество дифференциально экспрессированных генов (DEG) между сравнительными группами, идентифицированных DESeq2 с порогами скорректированного P-значения ≤ 0,05 и |log2FoldChange| ≥ 1. (B) Вулканический график DEGs. Ось x представляет значенияFoldChange log 2, а ось y — -log10(P-значение). Синие пунктирные линии обозначают пороговые линии, используемые для выбора DEG. (C) Иерархическая кластеризация тепловых карт ДЭГ. Ось x обозначает имена образцов, а ось y показывает нормализованные значения выражения DEG. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 4: Анализ функционального обогащения дифференциально экспрессированных генов. (A) Участок обогащения GO. Ось x представляет члены GO, а ось y — значимость обогащения, выраженную как -log10(padj). Цвета обозначают BP (биологический процесс), CC (клеточный компонент) и MF (молекулярная функция). (B) Пузырь обогащения GO. Ось x представляет отношение DEG, аннотированных к каждому члену GO, относительно общего числа DEG, а ось y указывает на члены GO. Размер пузыря соответствует количеству аннотированных генов, а цветовые градиенты отражают значимость обогащения. (C) Участок обогащения КЕГГа. Ось x представляет собой пути KEGG, а ось y — значимость обогащения. (D) График пузыря обогащения KEGG. Размер пузыря указывает количество аннотированных генов, а цветовые градиенты отражают значимость обогащения. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 5: Анализ сетей обогащения GSEA и взаимодействия белков и белков (PPI). (A) Бар-график, показывающий нормализованные показатели обогащения (NES) для выбранных значимых наборов генов. Положительные значения NES указывают на обогащение в R_AML группе, тогда как отрицательные значения NES указывают на обогащение в недавно диагностированной группе ОМЛ. (B) Сеть взаимодействия белков и белков (PPI). Каждый узел представляет собой белок, а каждое ребро — взаимодействие между связанными белками. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.