Методическая статья

Транскриптомическое профилирование и биоинформатический анализ образцов костного мозга для выявления сигнатур устойчивости к химиотерапии при остром миелоидном лейкозе

DOI:

10.3791/70750

4 августа 2026 г.

* These authors contributed equally

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Этот протокол представляет собой стандартизированный биоинформатический рабочий процесс для анализа транскриптомических изменений при остром миелоидном лейкозе (ОМЛ). Цель — сравнить недавно диагностированные и рецидивированные образцы костного мозга и приоритизировать молекулярные сигнатуры, связанные с устойчивостью к химиотерапии и прогрессированием заболевания, для последующих исследований.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Острый миелоидный лейкоз (ОМЛ) — это высокогетерогенная гематологическая злокачественная опухоль, при которой рецидив и приобретённая химиорезистентность остаются основными причинами неудачи лечения. В этой статье представлен биоинформатический протокол транскриптомного анализа аспиратов костного мозга. Основная цель протокола — обеспечить стандартизированный рабочий процесс для выявления молекулярных сигнатур, связанных с прогрессированием заболевания и устойчивостью к терапии при рецидиве ОМЛ. Конвейер подробно описывает вычислительные процедуры сравнения непарных образцов костного мозга, продемонстрированные с помощью секвенирования пяти недавно диагностированных случаев и четырёх рецидивов. Этот метод описывает основные этапы обработки данных секвенирования РНК, проведения дифференциального анализа экспрессии генов и проведения последующих функциональных оценок. Применение этого процесса позволило выявить 2 025 дифференциально экспрессированных генов (DEG), включая FOXC1, HOXA11, HOXA11-AS и AXL, в качестве кандидатов в транскрипты, связанные с рецидивом, в этом репрезентативном наборе данных. Функциональный и сетевой анализ дополнительно приоритизировал генные наборы и узлы взаимодействия, связанные с малой ГТФазной сигнализацией, воспалительными сигналами, внеклеточными матриксовыми взаимодействиями и биосинтетическими процессами РНК. В целом эта методология обеспечивает воспроизводимый вычислительный конвейер для отображения транскриптомических сигнатур, связанных с рецидивом ОМЛ, и для генерации гипотез, требующих последующего экспериментального подтверждения.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Острый миелоидный лейкоз (ОМЛ) — это группа клональных злокачественных новообразований, возникающих из гемопоэтических стволовых или прогениторных клеток, характеризующихся аномальным пролиферацијей незрелых миелоидных клеток в костном мозге и подавлением гемопоэтической дифференцировки 1,2,3. Хотя современная стандартная индукционная химиотерапия (например, цитарабин в сочетании с антрациклинами) может вызывать полную ремиссию у большинства пациентов, уровень рецидива остаётся до 50%–70%, а прогноз для рецидивных пациентов значительноухудшён 4,5,6. Приобретённая резистентность к химиотерапии связана с неудачей лечения ОМЛ, что требует глубокого анализа молекулярных сигнатур, связанных с этим процессом, для улучшения терапевтических стратегий и показателей выживаемостипациентов 7,8.

В более широкой литературе существующие исследования показывают, что устойчивость к химиотерапии при ОМЛ не ограничивается повышением эффективности насосов вылива препаратов или аномальным метаболизмом препаратов, а также связана с поддержанием выживаемости стволовых клеток лейкемии (LSC), формированием эпителиально-мезенхимальных переходных фенотипов (EMT) в гематологической нише и взаимодействием с микроокружением костногомозга 9, 10,11. Например, популяции LSC демонстрируют высокую способность к самообновлению и покой, что связано с врожденной устойчивостью к химиотерапевтическим препаратам, специфичным для клеточногоцикла 12. Кроме того, повышение уровня тирозинкиназ рецепторов, таких как AXL, связано с резистентностью к FLT3-ITD+ AML, что происходит параллельно с активацией путей PI3K/AKT и MAPK и усилением антиапоптотическихвозможностей 13,14. Метаболическое перепрограммирование и эпигенетическая ремоделирование также признаны важными регуляторными осями формирования резистентности. Данные свидетельствуют о том, что клетки ОМЛ во время рецидива могут адаптироваться к окислительному стрессу и повреждению ДНК, вызванным химиотерапией, за счёт усиленной активности оксидативного фосфорилирования (OXPHOS), модуляции соотношений NAD⁺/NADH и изменённых состояний модификациигистонов 15,16,17. Воспалительные факторы в микросреде костного мозга, такие как IL-6 и CXCL8, также связаны с выживаемостью к LSC и устойчивостью к химиотерапии, часто происходя в координации с активацией сигнальных путей STAT3/NF-κB 11,18.

Несмотря на эти признанные механизмы, транскриптомические изменения, связанные с рецидивом ОМЛ и хеморезистентностью, остаются неполностью охарактеризованы, особенно при совместной оценке метаболических, эпигенетических и сигналов, связанных с микроокружением костного мозга, в клинических образцах. Этот рабочий процесс удовлетворяет эту потребность, отдавая приоритет кандидатам DEG, путям и регуляторным сетям, связанным с переходом от первоначального диагноза к клиническому рецидиву. Подход интегрирует анализ дифференциальной экспрессии, анализ обогащения множеств генов (GSEA) и построение сетей взаимодействия белков и белков (PPI) для картирования системного транскрипционного перепрограммирования и номинирования кандидатов для последующего механистического валидирования.

Общая цель этого метода — представить стандартизированный, воспроизводимый биоинформатический конвейер для сравнения объёмных транскриптомов недавно диагностированных и рецидивированных образцов костного мозга с ОМЛ. Причиной использования этой технологии in silico является её способность фиксировать беспристрастные, геномные транскрипционные события, выходя за пределы ограничений однопутного анализа и приоритизируя сложные, многомерные регуляторные сети. Эта техника обладает значительными преимуществами по сравнению с альтернативными методами, такими как микрочипы или целевые мультиплексные qPCR-панели, обеспечивая более высокий динамический диапазон, возможность обнаруживать новые транскрипты и точную количественную оценку экспрессии генов без ограничений заранее разработанныхзондов 19,20. Чтобы определить, подходит ли этот метод для их применения, читателям следует обратить внимание, что этот конвейер специально разработан для исследователей, обрабатывающих объёмные данные секвенирования РНК из парных или непарных клинических когорт, таких как тканевые аспираты. Он подходит для выявления широких сигнатур, связанных с сопротивлением, и кандидатов в регуляторные сети, тогда как исследователям, требующим разрешения, специфичного для типа клеток или пространственного разрешения, необходимо использовать комплементарные процессы секвенирования с одной ячейкой или пространственной секвенировкой. В конечном итоге этот вычислительный протокол позволяет приоритизировать кандидатные гены, пути и регуляторные сети для последующих экспериментальных исследований.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Все методы, связанные с отбором образцов человеческих тканей, были выполнены в соответствии с институциональными рекомендациями и Хельсинкской декларацией (пересмотренной в 2013 году). Клинические образцы костного мозга были получены с одобрения институционального комитета по этике (Одобрения No TY-ZKY2024-116-01 и TY-ZKY2024-116-02).

1. Клинический сбор образцов и классификация пациентов

  1. Выберите образцы аспирации костного мозга от пациентов, официально диагностированных с острой миелоидной лейкозом (ОМЛ) на основе критериев классификации Всемирной организации здравоохранения (ВОЗ).
  2. Применять конкретные критерии включения и исключения при отборе пациентов для обеспечения однородности и воспроизводимости когорты. Включать взрослых пациентов с первичным ОМЛ и исключать пациентов с вторичным ОМЛ, острым промиелоцитарным лейкозом или предыдущим анамнезом других злокачественных заболеваний (Таблица 1).
  3. Отнести взятую образцу к недавно диагностированной группе, если у пациента на момент первоначального клинического диагноза ранее не лечился ОМЛ.
  4. Отнесите взятый образец к рецидивировавшей группе, если у пациента наблюдается повторное появление лейкемических бластов в периферической крови или более 5% бластов в костном мозге после задокументированной полной ремиссии.
  5. Соберите неидентифицированные остаточные образцы костного мозга сразу после рутинной клинической процедуры аспирации костного мозга.
    ПРИМЕЧАНИЕ: В демонстрации этого конкретного протокола с сентября 2024 по сентябрь 2025 года было собрано девять последовательных образцов (пять недавно диагностированных и четыре рецидивных). Поскольку это использовало только деидентифицированные остаточные клинические образцы, этический комитет отменил требование письменного информированного согласия.
  6. Немедленно обработайте собранный аспират костного мозга для сохранения РНК стандартным методом лизиса фенол-гуанидиний21.
    1. Переложите свежесобранный аспират костного мозга в сборную трубку с антикоагулянтом. Встряхните трубку, чтобы тщательно смешать аспиратор и антикоагулянт.
    2. Извлеките измеренный объём антикоагулянного образца и добавьте его в коммерческий реагент для лиза фенол-гуанидиния. Поддерживайте соотношение объёма 3 части лизисного реагента к одной части образца.
      ВНИМАНИЕ: Реагент на лизис фенол-гуанидиний содержит токсичные и коррозионные вещества, которые могут вызвать серьёзные ожоги и повреждение тканей. Выполняйте все обращения с реагентами внутри вытяжной вытяжки с химическим паром, надевая соответствующие средства индивидуальной защиты.
    3. Энергично встряхните пробирку, чтобы полностью униформировать образец и реагент для лизис. Убедитесь, что смесь полностью растушована, и убедитесь, что в растворе не осталось видимых сгустков.
    4. Мгновенно заморозьте гомогенизированный образец, погрузив трубку в жидкий азот.
      ВНИМАНИЕ: Жидкий азот очень холоден и может вызвать сильное обморожение при контакте. При работе с жидким азотом надевайте криогенные перчатки и полноценный защитный экран.
  7. Переместить замороженные образцы в морозильник при температуре -80 °C для длительного хранения перед последующим конвейером изоляции РНК и секвенирования транскриптома. Это представляет собой безопасную точку, в которой эксперимент можно приостановить и запустить заново позже.
    ПРИМЕЧАНИЕ: Рабочий процесс, представленный в этом протоколе, полностью сосредоточен на создании сигнатур вычислительного сопротивления. Независимая экспериментальная валидация, такая как количественная ПЦР в реальном времени (RT-qPCR), не проводилась ключевых дифференциально экспрессируемых генов, выявленных через этот конкретный конвейер.

2. Контроль качества РНК и подготовка библиотеки

  1. Оценить целостность РНК с помощью микрофлюидной капиллярной электрофорезной системы. Для такого репрезентативного рабочего процесса включайте образцы РНК с числом целостности РНК (RIN) ≥ 6,0, соотношением A260/280 между 1,8 и 2,1 и отсутствием видимого пика деградации. Запишите измеренные соотношения RIN и чистоты для каждого образца перед подготовкой библиотеки.
  2. Ввод 1 мкг общей РНК на образец для подготовки библиотеки. Очистить мРНК из общей РНК с помощью магнитных шариков, прикреплённых к поли-Т, для обогащения для получения транскриптов с полиА-хвостом.
  3. Фрагментировать обогащённую мРНК с помощью двухвалентных катионов. Инкубировать смесь при 94 °C в течение 15 минут в буфере реакции синтеза первой цепи 5X.
  4. Синтезировать кДНК первой цепочки с использованием случайных праймеров гексамеров и обратной транскриптазы, не имеющей активности РНазы H.
  5. Разложить шаблонную цепь РНК с помощью РНазы H. Синтезировать кДНК второй цепочки с использованием ДНК-полимеразы I и dNTP в реакционной системе объёмом 20 мкл.
  6. Инкубировать реакцию синтеза второй цепи при 16 °C в течение 1 часа. Кратковременно центрифугуйте реакционную смесь при 2 000 x g, чтобы собрать жидкость на дне трубки.
  7. Преобразуйте оставшиеся выступы в тупые концы с помощью экзонуклеазы и полимеразных эффектов. Аденилировать 3'-концы фрагментов ДНК и перевязывать адаптеры с петельными структурами для подготовки к гибридизации.
  8. Очистить фрагменты библиотеки с помощью магнитных твёрдофазных обратимых иммобилизационных шариков для предпочтетельного выбора фрагментов cDNA длиной 370–420 п.п.
  9. Проводите промывку этанолом во время очистки шарика. Центрифугуйте трубки при 2000 г в течение 30 секунд, чтобы собрать и полностью удалить остатки этанола до окончательного сливания.
  10. Проведите амплификацию ПЦР с использованием высокоточной ДНК-полимеразы, универсальных ПЦР-праймеров и образцов-специфических индексных праймеров.
  11. Выполните ПЦР-термический профиль с начальной денатурацией при 98 °C в течение 30 секунд. Затем следует 12 циклов: 98 °C в течение 10 с, 60 °C 30 с и 72 °C 30 секунд, завершая финальное продление при 72 °C на 5 минут.
  12. Снова очистите продукты ПЦР с помощью магнитных шариков. Примените идентичные параметры центрифугации из шага 2.9, чтобы получить итоговую библиотеку.
  13. Количественно определите начальную концентрацию библиотеки с помощью флюорометра. Разведите окончательную библиотеку до концентрации 1,5 нг/мкл.
  14. Тщательно перемешайте разбавленную библиотеку. Центрифугуйте смесь при 10 000 x g в течение 1 минуты при 4 °C, чтобы удалить остатки мусора перед окончательным анализом.
  15. Оценить размер вставки библиотеки с помощью микрофлюидной капиллярной электрофорезной системы.
  16. Точно количественно определить эффективную концентрацию библиотеки с помощью количественного ПЦР в реальном времени (qRT-PCR) после подтверждения соответствия размера вкладки ожидаем. Убедитесь, что концентрация превышает 1,5 нм, чтобы гарантировать стабильность библиотеки и качество секвенирования.
    ПРИМЕЧАНИЕ: Это безопасная точка, в которой эксперимент можно приостановить. Подготовленные библиотеки можно хранить при -20 °C до кластеризации и секвенирования.

3. Кластеризация и секвенирование транскриптома

  1. Выполните кластеризацию индексно-кодированных выборок в автоматизированной системе генерации кластеров. Используйте коммерческий комплект кластера с парным концом согласно инструкциям производителя.
  2. Последовательность подготовки библиотеки на высокопроизводительной платформе секвенирования после успешной генерации кластеров. Генерируйте 150 парных концов с парой базовых пар (bp).

4. Контроль качества данных и отображение чтений

  1. Оценивайте качество исходных данных (формат FASTQ) с помощью fastp v0.23.2 для контроля качества и фильтрации при чтении при сыром чтении. Запишите параметры командной строки в журнал анализа. В этом рабочем процессе чистые чтения генерировались путём удаления чтений с адаптером, чтений с poly-N-последовательностями и низкого качества с одинаковыми настройками фильтрации по всей сэмпли. В Дополнительном файле 1 предоставлена представительная команда парного конца.
  2. Обрабатывайте исходные данные через автоматизированное программное обеспечение предварительной обработки. Получите чистые считывания, удаляя чтения с адаптерами, считывания с поли-N последовательностями и чтения низкого качества. Используйте одинаковые параметры фильтрации для всех образцов и записывайте содержимое сохранённого считывания, содержимое Q20, Q30 и GC после фильтрации.
  3. Рассчитайте содержимое чистых данных в Q20, Q30 и GC. Определите потенциальные переменные пакета до дальнейшего анализа, включая дату сбора образцов, дату экстракции РНК, партию подготовки библиотеки, путь секвенирования и запуск секвенирования.
  4. Оценить эффекты пакетов с помощью PCA и анализа корреляции между выборками с использованием нормализованных значений экспрессии. Если образцы кластерируются преимущественно по техническим переменным, а не клиническому состоянию, задокументируйте затронутую переменную и включите её в формулу проектирования дифференциального выражения или примените установленный метод партийной корректировки перед следующей визуализацией.
  5. Получите референсный геном (Homo sapiens, GRCh38) и соответствующие файлы аннотации генов Ensembl release 109 для выравнивания чтения.
  6. Постройте индекс эталонного генома с помощью HISAT2 версии 2.0.5.
  7. Выровняйте чистые считывания парных концов с эталонным геномом с помощью HISAT2 версии 2.0.5. Используйте этот метод выравнивания, учитывающий сплетение, чтобы создать базу данных соединений на основе файла аннотации генной модели.

5. Новое предсказание транскриптов и количественная оценка экспрессии генов

  1. Собрать отображённые чтения каждого сэмпла с помощью StringTie v1.3.3b в эталонном подходе. Используйте этот инструмент для сборки и количественной оценки полноразмерных транскриптов, представляющих несколько вариантов сплайса для каждого генного локуса.
  2. Подсчитайте количество чтений, отображённых на каждый ген с помощью featureCounts v1.5.0-p3. Используйте полученную исходную матрицу чтения-счёта целых чисел в качестве входа для дальнейшего дифференциального анализа выражений.
  3. Настройте featureCounts v1.5.0-p3 для данных секвенирования парных концов с помощью опции парного конца (например, -p). Предоставьте загруженный файл аннотации GRCh38 GTF для определения правильных границ геномных признаков.
  4. Рассчитать фрагменты транскрипта на килобазу на миллион отображённых чтений (FPKM) для каждого гена. Используйте значения FPKM только для описательной визуализации, PCA, отображения тепловых карт и исследовательских резюме выражений; не использовать значения FPKM в качестве входной матрицы для дифференциального тестирования DESeq2.

6. Анализ дифференциальной экспрессии генов

  1. Проведите дифференциальный анализ экспрессии между недавно диагностированной и рецидивирующей группами с использованием R v3.5.0 и пакета DESeq2 R v1.20.0. Импортировать исходную матрицу считывания, сгенерированную на шаге 5.2, в среду R и сохранять значения FPKM только для визуализации и исследовательского анализа.
  2. Постройте специализированный объект набора данных, необходимый для аналитического пакета. Выполните конкретную команду (например, DESeqDataSetFromMatrix()), чтобы связать матрицу данных count-data с соответствующей таблицей метаданных.
  3. Определите формулу экспериментального проектирования внутри программного объекта. Укажите клиническое состояние (недавно диагностированное против рецидивированного) в качестве основной переменной для сравнения (например, дизайн = ~ состояние). Если техническая переменная пакета идентифицирована на шаге 4.3 и не полностью связана с клиническим состоянием, включите её в формулу проектирования (например, проект = ~ партия + состояние).
  4. Выполните основную функцию анализа дифференциального выражения (например, DESeq()). Позволяет программному обеспечению автоматически выполнять оценку коэффициента размера, дисперсионную оценку и отрицательную биномиальную тестовую подгонкуВальда 22.
  5. Извлеките таблицу результатов с помощью функции извлечения результатов (например, results()). Укажите аргумент контраста, чтобы определить точное сравнение (рецидив против недавно диагностированных).
  6. Скорректируйте полученные значения P, чтобы контролировать скорость ложного обнаружения. Используйте интегрированную процедуру Бенджамини и Хохберга, автоматически применяемую программнымпакетом 23.
  7. Фильтруйте таблицу извлеченных результатов для выделения значимых дифференциально экспрессируемых генов (DEG). Присвоить любому гену с скорректированным P-значением < 0,05 и абсолютнымлогарифмическим двухкратным изменением > 1 как значительно дифференцированно экспрессированный.

7. Анализ обогащения генной онтологии (GO)

  1. Проведите анализ обогащения генной онтологии (GO) выявленных DEGs с помощью clusterProfiler v3.8.1 и org. Hs.eg.db версии 3.6.0. Введите список идентификаторов генов Entrez, соответствующих значимым DEG, выявленным на шаге 6.7.
  2. Выполните функцию обогащения GO (например, enrichGO()). Укажите необходимые параметры, включая соответствующую базу данных фоновых организмов (например, OrgDb = org. Hs.eg.db), специфической области онтологии (биологический процесс, клеточная компонента или молекулярная функция) и скорректированный порог P-значения (0,05).
  3. Убедитесь, что алгоритм применяет необходимые корректировки при расчёте обогащения. Подтвердите, что программное обеспечение внутренне корректирует смещение длины гена и корректирует P-значения с помощью метода Бенджамини иХохберга 24.
  4. Рассмотрим термины GO с скорректированным P-значением менее 0,05 как существенно обогащённые. Сгенерируйте точечный график или столбчатую диаграмму с использованием встроенных функций визуализации пакета для отображения наиболее обогатённых терминов GO.

8. Анализ путей обогащения путей Киотской энциклопедии генов и геномов (KEGG)

  1. Используйте комплексный ресурс базы данных, посвящённый пониманию функций биологических систем высокого уровня, чтобы выявить дисрегулированные пути. Подготовьте тот же список основных идентификаторов DEG Entrez, используемых в шаге 7.1.
  2. Выполните функцию обогащения KEGG (например, enrichKEGG()) в функциональном пакете аннотации R.
  3. Определите критические параметры внутри вызова функции. Установите код организма строго на человеческий (например, организм = «имеет») и определите метод корректировки P-значения (например, pAdjustMethod = «BH»).
  4. Выделите статистически значимые пути KEGG. Фильтруйте выход так, чтобы сохранить только те пути, показывающие скорректированное P-значение менее 0,05.
  5. Визуализируйте наиболее обогащённые пути KEGG. Используйте интегрированные функции построения графиков (например, dotplot()) для отображения статистической значимости и количества генов, связанных с каждым путём.

9. Анализ обогащения множества генов (GSEA)

  1. Подготовьте заранее ранжированный список генов, необходимый для анализа. Вычислите показатель ранжирования для всех экспрессированных генов с помощью знакового -log10(P-значения), умноженного на знаклогарифмического 2-кратного изменения, полученного в результате дифференциального анализа экспрессии.
  2. Запустите локальную установку программного обеспечения Broad Institute GSEA версии 4.2.3. Введите новый заранее ранжированный список генов впрограммный интерфейс 25.
  3. Скачайте необходимые заранее определённые наборы генов. Получите наборы данных Gene Ontology (GO) и Kyoto Encyclopedia of Genes and Genomes (KEGG) из базы данных Molecular Signatures Database (MSigDB, версия 7.5.1)26.
  4. Настройте параметры программного обеспечения для проведения статистического теста обогащения. Установите количество перестановок на 1 000 и выберите тип перестановки как 'gene_set'.
  5. Выполните алгоритм анализа, чтобы определить, показывают ли заранее определённые наборы генов статистически значимое, согласованное различие между недавно диагностированным и рецидивированным биологическим состоянием.
  6. Оценить статистическую значимость сгенерированных профилей обогащения. Определите значимые наборы генов с помощью строгих порогов: нормированное обогащение (NES) абсолютное значение > 1,0, номинальное P-значение < 0,05 и q-значение коэффициента ложного обнаружения (FDR) < 0,25.

10. Анализ сетей взаимодействия белков и белков (PPI)

  1. Получите доступ к базе данных STRING для известных и предсказанных взаимодействий белков и белков. В этом рабочем процессе анализ PPI проводился с использованием STRING v11.527.
  2. Введите список идентификаторов генов Entrez или официальных символов для значимых дифференциально экспрессируемых генов (выявленных на шаге 6.7) в интерфейс поиска базы данных. Выберите Homo sapiens в качестве целевого организма.
  3. Настройте параметры построения сети, чтобы обеспечить получение высококачественных взаимодействий. Установите минимальный требуемый балл взаимодействия на высокий порог доверия (балл > 0,700).
  4. Экспортировать полученные данные сети взаимодействия в локальный каталог. Сохраните карту взаимодействия в стандартном табличном файле (например, в формате TSV).
  5. Импортировать экспортированные данные взаимодействия в Cytoscape версии 3.9.1 для визуализации и анализа сети28.
  6. Фильтруйте созданную сеть для повышения прозрачности визуализации и выделения ключевых регуляторных центров. Удалять любые разъединённые узлы или орфанные гены, которые не проявляют непрерывных взаимодействий, соответствующих установленному порогу доверия.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Валидация клинических когорт и секвенирования

Успешное выполнение верхнего протокола экстракции РНК и подготовки библиотеки (рисунок 1) было подтверждено показателями выхода и качества секвенирования. В этом репрезентативном наборе данных образцы костного мозга пяти недавно диагностированных пациентов с ОМЛ и четырёх рецидивов пациентов с ОМЛ дали в среднем около 6,0 ГБ сырых данных на выборку. Оценка контроля качества (Таблица 2) подтвердила, что базовое качество и глубина чтения соответствуют пороговым требованиям для дальнейшего биоинформатического анализа9. Низкая целостность РНК (например, RIN < 6.0), низкая скорость отображения или высокая смещённость деградации транскрипта будут представлять неоптимальное качество входа и снижать надёжность дальнейшего дифференциального анализа экспрессии.

Глобальная транскриптомическая дисперсия и PCA

Для оценки глобальной дисперсии транскриптома и изучения клинической группировки на нормализованных данных экспрессии была проведена PCA. В этом репрезентативном наборе данных недавно диагностированные и рецидивированные группы показали разделение в двумерном пространстве (рисунок 2A)20, при этом PC1 и PC2 составляли соответственно 23,82% и 18,75% от общей дисперсии. Диаграммы Венна на рисунке 2B,C предоставляют дополнительное описательное описание генов, обнаруженных в образцах в недавно диагностированных и рецидивировавших группах, поддерживая проверки воспроизводимости на уровне выборки перед дальнейшим дифференциальным анализом экспрессии. Поскольку когорта была небольшой и не парной, разделение PCA интерпретировалось как иллюстративный результат рабочего процесса, а не как окончательное свидетельство биологии, специфичной для состояния заболевания.

Анализ дифференциального экспрессионного гена (DEG)

Применение установленных пороговых норм протокола (|log2FC| ≥ 1 и скорректированное P-значение ≤ 0,05) к выходу DESeq2 выявило 2 025 DEG, включая 772 повышенных и 1 253 пониженных гена в рецидивирующей группе (рисунок 3A). Кандидатные транскрипты с высокой вариацией включали FOXC1 (log2FC = 7,55, P = 4,92 x 10-5), HOXA11 (log2FC = 7,76), HOXA11-AS (log2FC = 7,23) и AXL (log2FC = 3,50), а также пониженные RHOB, PTX3 и CXCL8. Существующая литература связывает несколько таких генов с стволом ОМЛ, сигнальным или терапевтическим ответом13,29; Однако текущий рабочий процесс идентифицирует их только как транскрипты, связанные с рецидивом. Любая окончательная механистическая роль в клинической устойчивости требует последующего независимого функционального подтверждения.

Функциональное и обогащение путей (GO, KEGG и GSEA)

Протокол функциональных аннотаций сопоставил DEG с более широкими биологическими системами. Анализ GO выявил обогащение терминов, связанных с сигнальной трансдукцией, опосредованной малыми GTPазами, транспортом ионов металлов и сборкой хроматина (рисунок 4AC). Картирование путей KEGG выявило связи с взаимодействиями ЭКМ-рецепторов и взаимодействием цитокин-цитокиновых рецепторов (рисунок 4D). GSEA показала обогащение биосинтетических процессов РНК в рецидивирующей группе и обогащение энергетических метаболических путей в недавно диагностированной группе (рисунок 5A). Эти результаты обогащения предоставляют описательную дорожную карту изменённых наборов генов и должны интерпретироваться как ассоциации, генерирующие гипотезы, а не как проверенные причины рецидива.

Построение сети взаимодействия белков и белков (PPI)

Начальная сеть STRING включала 56 узлов и 193 взаимодействия. После удаления отключённых или осырённых узлов отображаемая подсеть Cytoscape содержала 42 узла и 136 взаимодействий (рисунок 5B). Модульный анализ сети отдал приоритет TP53, CCL2, CXCL8 и IL6 как центральным математическим узлам с наибольшим количеством взаимодействий. Поскольку сеть PPI опирается на прогнозируемые базой данных баллы взаимодействия (например, балл ATF3: 0,982), идентификацию хаба следует интерпретировать как приоритетное определение целей для будущих эмпирических исследований, а не как прямые доказательства обхода апоптоза, опосредованного p53, или других механизмов устойчивости.

Сырые данные секвенирования РНК, полученные в этом протоколе, были размещены в репозитории Figshare и доступны для общественности через следующий DOI: https://doi.org/10.6084/m9.figshare.30655814. Обработанные данные и связанные аналитические файлы включены в статью и её дополнительные материалы. Репрезентативные параметры командной строки и настройки анализа, используемые для воспроизведения вычислительного рабочего процесса, предоставляются в виде дополнительного файла 1. Все данные, подтверждающие результаты данного исследования, доступны без ограничений.

Идентификатор пациентаВозраст (годы)ПолМолекулярные мутацииВыживание/Контроль (месяцы)Клинический статус
R_AML_170МужскойFLT3-ITD (+)22Умерший
R_AML_229ЖенскийNPM1 (+)11Живой
R_AML_340МужскойCEBPA (+)17Живой
R_AML_455ЖенскийТройной отрицательный*24Умерший

Таблица 1: Демографические и клинические характеристики пациентов в группе рецидивирующей ОМЛ (R_AML). Таблица 1 суммирует демографические и клинические особенности рецидивирующей когорты ОМЛ, используемой в репрезентативном анализе, включая клинические характеристики на уровне пациента, релевантные для интерпретации транскриптомического рабочего процесса.

ОбразецБиблиотекаRaw_readsRaw_basesClean_readsClean_basesError_rateQ20Q30GC_pct
AML_1FRAS25
0244891-1r
487050667.31G478075327.17G0.0199.3597.4847.48
AML_2FRAS25
0244896-1r
429699406,45G422379626.34G0.0199.3597.4446.74
AML_3FRAS2502
44906-1r
487383867.31G477444627.16G0.0199.3697.4847.28
AML_4FRAS250
244915-1r
487236507.31G476882407.15G0.0199.2997.2647.45
AML_5FRAS2502
44920-1r
495081987.43G477403087.16G0.0199.3797.5347.73
R_AML_1FRAS2502
44892-1r
478794087.18G466715847.0G0.0199.3997.4947.63
R_AML_2FRAS2502
70005-1r
476573787.15G469578827.04G0.0199.3997.4950.5
R_AML_3FRAS250
405722-1r
587547668.81G568671128,53G0.0199.3897.4246.52
R_AML_4FRAS2502
44902-1r
484911227.27G474693347.12G0.0199.2397.2146.43

Таблица 2: Сводка качества данных. Таблица 2 содержит показатели секвенирования качества для каждого образца, включая доходность чтения, базовое качество, содержание GC и информацию о контроле качества, связанную с картированием, используемую для определения пригодности образцов для дальнейшего анализа.

figure-results-1
Рисунок 1: Рабочий процесс протокола. Рабочий процесс обобщает основные экспериментальные и вычислительные этапы, включая сбор клинических образцов, контроль качества РНК, подготовку и секвенирование библиотек, обработку и выравнивание чтений, количественную оценку транскриптов, анализ дифференциальной экспрессии, обогащение GO/KEGG, GSEA и построение сетей PPI. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-2
Рисунок 2: Количественный анализ образцов. (A) Был проведен анализ основных компонентов (PCA) для оценки межгрупповых различий и воспроизводимости внутригрупповых образцов. PCA проводился с использованием линейных алгебраических методов, основанных на нормализованных значениях экспрессии генов во всех образцах. (B, C) Диаграммы Венна, показывающие гены, обнаруженные в образцах в группах ОМЛ и R_AML соответственно. Регионы, ограниченные в образце, указывают на гены, обнаруженные в отдельных образцах, тогда как перекрывающиеся области — это гены, обычно обнаруженные в двух или более образцах. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-3
Рисунок 3: Дифференциальный анализ экспрессии генов. (A) Столбочный график, показывающий количество дифференциально экспрессированных генов (DEG) между сравнительными группами, идентифицированных DESeq2 с порогами скорректированного P-значения ≤ 0,05 и |log2FoldChange| ≥ 1. (B) Вулканический график DEGs. Ось x представляет значенияFoldChange log 2, а ось y — -log10(P-значение). Синие пунктирные линии обозначают пороговые линии, используемые для выбора DEG. (C) Иерархическая кластеризация тепловых карт ДЭГ. Ось x обозначает имена образцов, а ось y показывает нормализованные значения выражения DEG. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-4
Рисунок 4: Анализ функционального обогащения дифференциально экспрессированных генов. (A) Участок обогащения GO. Ось x представляет члены GO, а ось y — значимость обогащения, выраженную как -log10(padj). Цвета обозначают BP (биологический процесс), CC (клеточный компонент) и MF (молекулярная функция). (B) Пузырь обогащения GO. Ось x представляет отношение DEG, аннотированных к каждому члену GO, относительно общего числа DEG, а ось y указывает на члены GO. Размер пузыря соответствует количеству аннотированных генов, а цветовые градиенты отражают значимость обогащения. (C) Участок обогащения КЕГГа. Ось x представляет собой пути KEGG, а ось y — значимость обогащения. (D) График пузыря обогащения KEGG. Размер пузыря указывает количество аннотированных генов, а цветовые градиенты отражают значимость обогащения. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-5
Рисунок 5: Анализ сетей обогащения GSEA и взаимодействия белков и белков (PPI). (A) Бар-график, показывающий нормализованные показатели обогащения (NES) для выбранных значимых наборов генов. Положительные значения NES указывают на обогащение в R_AML группе, тогда как отрицательные значения NES указывают на обогащение в недавно диагностированной группе ОМЛ. (B) Сеть взаимодействия белков и белков (PPI). Каждый узел представляет собой белок, а каждое ребро — взаимодействие между связанными белками. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Критические шаги в протоколе

Успешное выполнение этого биоинформатического рабочего процесса зависит от нескольких критически важных этапов. Во-первых, немедленное мгновенное замораживание и правильный лиз аспирата костного мозга (шаг 1.6) имеют первостепенное значение, поскольку микросреда костного мозга богата рибонуклеазами, способными быстро разрушать транскриптомическуюцелостность 30. Во время вычислительной фазы правильная конфигурация формулы экспериментального проектирования в корпусе DESeq2 (шаг 6.3) критически важна для точной дифференциальной экспрессии, особенно когда клиническое состояние (недавно диагностированное и рецидивированное) противопоставлено при учёте потенциальных смешивающих переменных. Наконец, применение строгих порог частоты ложного обнаружения (FDR) во время анализа обогащения множества генов (GSEA) (шаг 9.6) является критически важным статистическим контрольным пунктом для предотвращения чрезмерной интерпретации ложноположительных функциональных сетей.

Модификации и устранение неполадок

Распространённой проблемой в этом методе является наличие пакетных эффектов, которые часто возникают при сборе и секвенировании клинических образцов в течение длительного времени. Пакетные переменные должны быть определены перед анализом, включая дату сбора образца, дату экстракции РНК, пакетную подготовку библиотеки, путь секвенирования и запуск секвенирования. Если PCA или анализ корреляции выборок выявляет кластеризацию на основе даты секвенирования или другой технической переменной, а не клинического фенотипа, пользователям следует модифицировать протокол, включая пакетную переменную в формулу проектирования дифференциального выражения, когда это статистически возможно, или применяя алгоритмы пакетной коррекции, такие как ComBat или SVA, довизуализации 31. Если применение этого протокола к цельной крови вместо костного мозга аспирируется, важной модификацией станет включение этапа истощения глобина мРНК в составе подготовки библиотеки, чтобы предотвратить монополизацию глубины чтения секвенированием очень обильными транскриптами глобина. Версии программного обеспечения и основные параметры репрезентативного рабочего процесса были дополнены следующим образом: fastp v0.23.2, HISAT2 v2.0.5, StringTie v1.3.3b, featureCounts v1.5.0-p3, R v3.5.0, DESeq2 v1.20.0, clusterProfiler v3.8.1, org. Hs.eg.db v3.6.0, парное секвенирование 150 б.п., GSEA v4.2.3 с 1000 перестановок генетических наборов, MSigDB v7.5.1, STRING v11.5 с высокоуверенными взаимодействиями и Cytoscape v3.9.1. Репрезентативные параметры командной строки и настройки анализа приведены в Дополнительном файле 1.

Ограничения метода

Хотя протокол комплексен, он имеет врожденные методологические ограничения. Во-первых, используется массовое секвенирование РНК, которое фиксирует средний транскриптомический профиль всего аспирата костного мозга и не имеет одноклеточного пространственного разрешения. Таким образом, рабочий процесс не может определить, происходит ли усиленная сигнатура, ассоциированная с рецидивом, исходя из стволовых клеток лейкемии, стромальных клеток, иммунных клеток или изменений состава типаклеток 32. Во-вторых, репрезентативный набор данных мал (n = 9) и не парен, что ограничивает статистическую устойчивость и предотвращает окончательный причинный вывод. В-третьих, рабочий процесс полностью в силико. Он генерирует кандидатные регуляторные узлы и сигнальные пути, но не может самостоятельно подтвердить их функциональную необходимость в химиорезистентности без ортогональной in vitro или in vivo экспериментальной валидации.

Недавние исследования одноклеточных и одноклеточных геномных исследований расширили эталонную систему ОМЛ, определив гетерогенность состояний клеток, клональную архитектуру и эволюцию, связанную с терапией, с более высокимразрешением 33,34,35,36. Эти подходы дополняют описанный здесь рабочий процесс с общим РНК-секвенированием: массовое секвенирование обеспечивает практичную и экономичную стратегию скрининга для когортных транскриптомных сигнатур, тогда как одноклеточные и мультиомические методы могут использоваться в последующих исследованиях для назначения кандидатных сигналов конкретным злокачественным или микроэкологическим популяциям клеток.

Значимость с точки зрения существующих методов

Несмотря на эти ограничения, этот транскриптомический конвейер предлагает преимущества по сравнению с альтернативными диагностическими и аналитическими методами. Традиционные клинические оценки рецидива ОМЛ часто основаны на целевых мультиплексных qPCR-панелях или стандартной потоковой цитометрии. Хотя эти методы полезны для быстрой диагностики, они ограничены заранее определёнными зондами и могут оценивать только известные маркерыустойчивости 19. Используя беспристрастное, геномное секвенирование транскриптома в сочетании с сетевым анализом, этот протокол может выявлять новые транскрипты и системные ассоциации, которые существующие целевые методы могут упускать из виду.

Значение и потенциальные применения

Методология, изложенная в этом протоколе, актуальна для трансляционной гематологии и персонализированной медицины, поскольку позволяет приоритизировать транскриптомические сигнатуры, связанные с рецидивом, для дальнейших исследований. Потенциальным дальнейшим применением является назначение поверхностных антигенов или путей ухода от иммунитета, возникающих во время рецидива. Такие кандидаты могут влиять на разработку будущих валидационных исследований и, если будут подтверждены экспериментально, способствовать разработке иммунотерапии следующего поколения, включая стратегии CAR-T или CAR-NKклеток 37. Эти трансляционные применения следует рассматривать скорее как генерирующие гипотезы, чем устоявшиеся выводы из данного набора данных.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы не заявляют о конфликтах интересов.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Это исследование было профинансировано Бюро науки и техники города Ганьчжоу (2022—ZD1368).

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Agilent 2100 BioanalyzerAgilent Technologies, Santa Clara, CA, USARRID:SCR_019389G2939BA
AMPure XP systemBeckman Coulter, Brea, CA, USARRID:SCR_008452A63881
cBot Cluster Generation SystemIllumina, San Diego, CA, USA-SY-301-2002 or institution-specific system ID
clusterProfiler (Software)BioconductorRRID:SCR_016884v3.8.1
Cytoscape (Software)Cytoscape ConsortiumRRID:SCR_003032v3.9.1
DESeq2 (Software)BioconductorRRID:SCR_015687v1.20.0
DNA Polymerase INew England Biolabs (NEB, Ipswich, MA, USA-M0209L
dNTP Solution MixNew England Biolabs (NEB, Ipswich, MA, USA-N0447L
edgeR (Software)BioconductorRRID:SCR_012802v3.22.5
fastp (Software)OpenGeneRRID:SCR_016962v0.23.2
featureCounts / Subread (Software)The Walter and Eliza Hall InstituteRRID:SCR_012919featureCounts v1.5.0-p3
GRCh38 reference genomeGenome Reference Consortium / Ensembl-GRCh38; Ensembl release 109
GSEA softwareBroad InstituteRRID:SCR_003199v4.2.3
HISAT2 (Software)Johns Hopkins UniversityRRID:SCR_015530v2.0.5
M-MuLV Reverse Transcriptase (RNase H-)New England Biolabs (NEB, Ipswich, MA, USA-M0253L
MSigDB gene setsBroad InstituteRRID:SCR_016863v7.5.1
NEBNext Ultra II Directional RNA Library Prep Kit for IlluminaNew England Biolabs (NEB, Ipswich, MA, USA-E7760L/E7765L or laboratory-specific kit
NEBNext Ultra II RNA Library Prep Kit for IlluminaNew England Biolabs (NEB, Ipswich, MA, USA-E7770L
NovaSeq sequencing platformIllumina, San Diego, CA, USARRID:SCR_016387NovaSeq system; service-provider instrument ID
org.Hs.eg.db (Annotation package)Bioconductor-v3.6.0
Phusion High-Fidelity DNA PolymeraseThermo Fisher Scientific, Waltham, MA, USARRID:AB_2756816F530L
Qubit 2.0 FluorometerThermo Fisher Scientific, Waltham, MA, USARRID:SCR_018095Q32866
Qubit dsDNA HS Assay KitThermo Fisher Scientific, Waltham, MA, USA-Q32851
R softwareR Foundation for Statistical ComputingRRID:SCR_001905v3.5.0
Random Hexamer PrimerThermo Fisher Scientific, Waltham, MA, USA-SO142
RNA 6000 Nano KitAgilent Technologies, Santa Clara, CA, USA-5067-1511
RNase HNew England Biolabs (NEB, Ipswich, MA, USA-M0297L
RNA-seq Library Prep Kit / Sequencing ServiceNovogene, Beijing, China-Project No. X101SC25054246-Z01-J003
STRING databaseSTRING ConsortiumRRID:SCR_005223v11.5
StringTie (Software)Johns Hopkins University / Center for Computational BiologyRRID:SCR_016323v1.3.3b
TruSeq PE Cluster Kit v3-cBot-HSIllumina, San Diego, CA, USA-PE-401-3001

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

Cancer ResearchAcute myeloid leukemiaChemoresistancetranscriptomicsleukemia stem cellsepigenetic regulationinflammatory signaling

Похожие статьи