Исследование было одобрено Этическим комитетом Хайнаньского медицинского университета (номер одобрения HMC1984.24) и проводилось в соответствии с Хельсинкской декларацией (в редакции 2013 года).
Объекты исследования
Исследование 50 пациентов с раком легкого, диагностированных в период с 2017 по 2024 год в Центральной больнице города Санья в провинции Хайнань, проводилось в соответствии с Клиническими рекомендациями Китайской медицинской ассоциации по диагностике и лечению рака легкого (издание 2024 года). Стадирование по системе CSCO (2024) было приведено в соответствие с 8-м изданием AJCC для обеспечения сопоставимости результатов с другими исследованиями, что было подтверждено в китайских когортах12; для обеспечения согласованности данных результаты были проверены двумя независимыми онкологами. Процесс отбора пациентов, доступность тканей, оценка качества РНК и окончательный подбор образцов для анализа методом qRT-PCR обобщены на Рисунке 1.
Данные исследования
В данном исследовании использовались методы биоинформатики для анализа уровней экспрессии YTHDC2 при НМРЛ и их связи с клинико-патологическими характеристиками, что позволило получить представление о потенциальных механизмах. Биоинформатический анализ проводился исключительно с использованием общедоступных данных секвенирования РНК из The Cancer Genome Atlas (TCGA), включая образцы аденокарциномы легкого (LUAD), плоскоклеточного рака легкого (LUSC) и соответствующих образцов нормальной ткани легкого, загруженных через портал данных GDC (https://portal.gdc.cancer.gov/). Загруженный набор данных включал данные об экспрессии при секвенировании РНК вместе с имеющимися клиническими переменными (идентификатор пациента, идентификатор образца, возраст, пол, патологическая стадия, статус выживаемости и общая продолжительность выживания) для подходящих случаев TCGA-LUAD и TCGA-LUSC. Образцы, для которых отсутствовала информация об экспрессии генов или выживаемости, были исключены из последующего анализа выживаемости и ROC-анализа. Набор данных, использованный в этом исследовании, представлен в Дополнительном файле 1. Клинические образцы, собранные в Центральной больнице города Санья, для биоинформатического анализа не использовались. Подробные процедуры анализа с помощью GEPIA, Kaplan–Meier Plotter и survivalROC приведены ниже в разделе «Биоинформатический анализ». Полный рабочий процесс биоинформатического анализа, включая получение данных, предварительную обработку, анализ экспрессии генов, анализ выживаемости и ROC-анализ, обобщен на Рисунке 2.
Критерии включения и исключения
Критерии включения и исключения пациентов представлены в Таблице 1. Анализ мощности с использованием специализированного программного обеспечения показал, что для обеспечения 80% мощности при выявлении умеренного размера эффекта (d = 0.8, α = 0.05, двусторонний критерий) потребуется не менее 26 случаев в каждой группе. Хотя изначально планировалось включить 50 пар в группу с раком легкого, в окончательный анализ qRT-PCR вошли 30 образцов опухоли и 19 образцов прилежащей нормальной ткани после исключения проб с неудовлетворительным качеством ткани или РНК. Такое сокращение размера выборки отражает реальные клинические ограничения и подчеркивает важность целостности РНК и доступности тканей в трансляционных исследованиях. При n = 19 для сравнений минимальный обнаруживаемый размер эффекта составляет d = 1.0 (мощность 80%, α = 0.05). Таким образом, мощность эксперимента была достаточной для выявления значительных, но не малых или умеренных различий в экспрессии YTHDC2.
Образцы тканей и количественная ПЦР в реальном времени (кПЦР-РВ)
Патологоанатомические диагнозы были определены двумя разными патологами методом двойного слепого исследования. Чистота опухоли оценивалась патологами (>70% злокачественных клеток) и подтверждалась с помощью ESTIMATE (TCGA). Прилежащие нормальные ткани подвергались макродиссекции для минимизации контаминации стромой. Гистологические типы рака легкого включали аденокарциному легкого и плоскоклеточный рак: 26 случаев аденокарциномы легкого и 4 случая плоскоклеточного рака. Клиническое стадирование 50 пациентов с раком легкого проводилось в соответствии с критериями стадирования, изложенными в «Клинических рекомендациях Китайской медицинской ассоциации по раку легкого (издание 2024 года)». Патологически подтвержденные образцы НМРЛ (n = 50) соответствовали типичному клиническому распределению (см. Таблицу 2). Из 50 первоначально включенных пациентов критериям качества РНК соответствовали 30 образцов опухолевой ткани и 19 соответствующих образцов прилежащей нормальной ткани. Поскольку парный статистический анализ требует соответствующих образцов от одного и того же пациента, сравнение экспрессии в опухоли и прилежащей нормальной ткани проводилось с использованием 19 доступных соответствующих пар. Эти клинические образцы использовались исключительно для экспериментальной валидации методом qRT-PCR и анализировались независимо от публичных наборов данных TCGA, использованных для биоинформатического анализа. Отобранные образцы обрабатывались сразу после патологического подтверждения и обрабатывались в условиях отсутствия РНказ перед экстракцией РНК. Данная подгруппа отражает случаи, в которых удалось получить как достаточное количество ткани, так и высококачественную общую РНК (индекс целостности РНК, RIN >7.0). Концентрация и чистота общей РНК измерялись перед обратной транскрипцией, и для последующего анализа включались только образцы с адекватным качеством РНК (RIN >7.0). Равные количества общей РНК подвергались обратной транскрипции в комплементарную ДНК (кДНК) в соответствии с протоколом производителя перед количественной ПЦР. Этот процесс обеспечил достоверность проанализированных данных экспрессии генов. Эксперименты qRT-PCR проводились на термоциклере для ПЦР в реальном времени с использованием зондового метода количественной ПЦР. Все реакции проводились в трех повторностях вместе с контролем без матрицы для обеспечения аналитической воспроизводимости. Амплификация ПЦР проводилась при следующих условиях циклирования: начальный этап активации фермента/денатурации при 95°C в течение 10 min, затем 40 циклов денатурации при 95°C в течение 15 s и отжига/элонгации при 60°C в течение 60 s. Сигналы флуоресценции регистрировались в конце каждого цикла амплификации. Все реагенты и расходные материалы были получены от коммерческих поставщиков (см. Таблицу материалов). Последовательности праймеров и зондов, использованных в qRT-PCR, приведены в Таблице 3.
Биоинформационный анализ
Анализ экспрессии гена YTHDC2 с помощью базы данных GEPIA
Для анализа экспрессии YTHDC2 при НМРЛ использовали базу данных GEPIA. Доступ к веб-серверу GEPIA (http://gepia.cancer-pku.cn/) осуществлялся через веб-браузер. Был выбран модуль Expression DIY, введен символ гена "YTHDC2", выбраны наборы данных LUAD и LUSC, сохранены стандартные параметры нормализации, и непосредственно через интерфейс GEPIA были построены диаграммы размаха (box plots) дифференциальной экспрессии. Статистическая значимость определялась как p < 0.05.
База данных Kaplan-Meier plotter для анализа выживаемости пациентов с раком легкого
В данном исследовании с помощью базы данных Kaplan-Meier Plotter анализировалась связь между экспрессией YTHDC2 и прогнозом у пациентов с раком легкого. Был выбран набор данных по раку легкого, введен символ гена "YTHDC2", применена опция автоматического выбора оптимального порогового значения (best cutoff), и с использованием стандартных настроек анализа были построены кривые Каплана-Мейера для общей выживаемости и выживаемости после прогрессирования. Пациенты были автоматически разделены на группы с высокой и низкой экспрессией с использованием оптимального порога, определенного платформой Kaplan-Meier Plotter; показатели отношения рисков с соответствующими 95% доверительными интервалами были рассчитаны с использованием настроек платформы по умолчанию.
Запуск пакетов R в программном обеспечении R для построения ROC-кривых
Данные об экспрессии, полученные путем секвенирования РНК, и соответствующие клинические метаданные по подходящим случаям TCGA-LUAD и TCGA-LUSC были загружены с портала данных GDC. Загруженные наборы данных были объединены по идентификатору пациента и импортированы в R для последующего анализа. Пакет survivalROC использовался для построения зависящих от времени ROC-кривых для временных точек прогноза 1, 3 и 5 лет; для оценки прогностической значимости экспрессии YTHDC2 рассчитывались соответствующие значения площади под кривой (AUC). В анализ выживаемости с помощью ROC-кривых были включены только пациенты TCGA-LUAD и TCGA-LUSC, для которых имелись данные экспрессии RNA-seq и сведения о выживаемости. Локальная клиническая когорта не использовалась для прогнозирования выживаемости из-за отсутствия данных долгосрочного наблюдения.
Определение экспрессии YTHDC2 в тканях методом qRT-PCR
Для анализа уровней экспрессии генов была проведена qRT-PCR. В каждую реакцию добавляли равные объемы кДНК в соответствии с условиями реакции, рекомендованными производителем. Амплификацию проводили с использованием количественного ПЦР-анализа на основе зондов, а данные флуоресценции регистрировались автоматически в конце каждого цикла амплификации. Вкратце, процесс экстракции РНК включал несколько этапов, в том числе подготовку образца, депарафинизацию, удаление остатков жидкости, переваривание протеиназой K, инкубацию, центрифугирование, обработку ДНКазой, добавление DNase I и осаждение этанолом. Затем образец связывали с колонкой для очистки РНК на основе силикагеля и центрифугировали при 8,000 × g в течение 30 s. Затем колонку промывали промывочным буфером 1, промывочным буфером 2 и промывочным буфером 2, разведенным этанолом, и высушивали при 13,000 × g в течение 2 min. РНК затем элюировали, добавив 70 µL воды, свободной от РНКаз, в центр мембраны колонки, с последующим центрифугированием при 13,000 × g в течение 1 min. Каждая пара праймеров дала один продукт амплификации, что было подтверждено анализом кривых плавления перед расчетом относительной экспрессии генов. Эффективность праймеров (90–110%) была подтверждена с помощью стандартных кривых перед анализом образцов. Анализ кривых плавления подтвердил наличие одиночных ампликонов и отсутствие димеров праймеров. Относительная экспрессия YTHDC2 рассчитывалась методом 2-ΔCt, при котором значения Ct были нормализованы по эндогенному референсному гену GAPDH. Поскольку значения экспрессии были представлены как нормализованные уровни экспрессии, а не как кратность изменения относительно калибровочного образца, результаты сообщаются в виде значений 2−ΔCt. GAPDH был выбран в качестве ген-контроля (housekeeping gene), так как его экспрессия демонстрировала минимальную вариабельность (CV < 5%) по сравнению с протестированными альтернативами (ACTB, CV = 12%; 18S rRNA, CV = 18%), что соответствует критериям выбора референсного гена в исследованиях m6A.
Статистический анализ
Статистический анализ, включая построение графиков и диаграмм, выполнялся с помощью специализированного программного обеспечения. Для анализа количественных и категориальных данных об экспрессии гена YTHDC2 у пациентов с НМРЛ, а также для биоинформатического анализа и построения ROC-кривых использовалось программное обеспечение R. ROC-кривые и показатель AUC применялись для оценки диагностической эффективности экспрессии YTHDC2 в прогнозировании выживаемости. Для регрессионного анализа, где это было применимо, приводились оценки эффекта (отношение шансов) с соответствующими 95% доверительными интервалами. Для сравнения экспрессии YTHDC2 в парных образцах опухоли и прилегающей нормальной ткани использовался критерий знаковых рангов Вилкоксона, а для оценки связи между экспрессией YTHDC2 и клинико-патологическими характеристиками — корреляционный анализ Пирсона. Приводились коэффициенты корреляции (r) и соответствующие значения p. Поскольку данные qRT-PCR состояли из парных образцов опухоли и прилегающей нормальной ткани от одних и тех же пациентов, а данные об экспрессии генов не имели нормального распределения, для сравнения уровней экспрессии YTHDC2 между парными тканями применялся критерий знаковых рангов Вилкоксона. Данный критерий не предполагает нормальности распределения данных и широко используется для анализа асимметричных биологических данных. Все статистические тесты были двухсторонними, и значение p <0,05 считалось статистически значимым. Перед анализом количественные переменные проверялись на нормальность распределения. Количественные переменные представлены в виде среднего значения ± стандартного отклонения или медианы (межквартильный размах) в зависимости от ситуации.