В этом исследовании использовались только публично доступные, деидентифицированные наборы данных и не включали прямых экспериментов на людях или животных; Поэтому дополнительное одобрение этического комитета и информированное согласие не требовались.
Загрузка и обработка данных
Данные секвенирования РНК и соответствующая клиническая информация по плоскоклеточной карциноме легких (LUSC) были получены из базы данных The Cancer Genome Atlas (TCGA) через портал данных Genomic Data Commons в рамках проекта TCGA-LUSC. Матрица экспрессии TCGA-LUSC, использованная в этом исследовании, была основана на значениях FPKM. Значения экспрессии генов были преобразованы и нормализованы перед последующим анализом. Клинические переменные включали возраст, пол, стадию опухоли, патологическую стадию ТНМ, степень, время выживаемости и статус выживаемости, когда они доступны. Всего было первоначально получено 489 случаев TCGA-LUSC, и 381 пациент с полными профилями экспрессии и общей информацией о выживаемости были включены в прогностическую модель и внутреннюю оценку.
Независимые наборы данных валидации были загружены из базы данных Gene Expression Omnibus (GEO) 3 января 2026 года. GSE30219 была основана на платформе GPL570 и включала 307 пациентов с LUSC с доступной информацией о экспрессии и общей выживаемости. GSE37745 также основывался на платформе GPL570 и включал 196 пациентов с LUSC с доступной информацией о экспрессии и общей выживаемости. GSE57148 была основана на платформе GPL11154 и включала 91 нормальную ткань лёгких и 98 легких от пациентов с хронической обструктивной болезнью лёгких (ХОБЛ), всего 189 образцов. GSE57148 использовался для идентификации генов, связанных с ХОБЛ, дифференциально экспрессируемых генов, тогда как GSE30219 и GSE37745 использовались как независимые когорты внешней валидации.
Для наборов данных GEO аннотация для зонда выполнялась с использованием соответствующего пакета аннотаций R и файлов аннотаций платформы. Идентификаторы зонда были преобразованы в официальные генные символы. Когда несколько зондов отображались на один ген, зонд с наивысшим средним значением экспрессии сохранялся для представления этого гена. В валидационных наборах данных после сопоставления гена и символов не было обнаружено отсутствующих генов модели. TCGA-LUSC, GSE30219 и GSE37745 анализировались как общие когорты LUSC, поскольку статус сопутствующей морбидности ХОБЛ на уровне пациента не был подтверждён в аннотациях, использованных для этого анализа.
Поскольку наборы данных TCGA и GEO генерировались с использованием различных платформ выражения, кроссплатформенная нормализация и пакетная коррекция выполнялись с использованием стандартных методов предварительной обработки на базе R, до применения модели. Модель риска была обучена в когорте TCGA-LUSC, а затем независимо оценивалась в каждой внешней когорте GEO, а не путём прямого объединения всех когорт. Дифференциальный анализ экспрессии проводился с использованием пакета limma R. Дифференциально экспрессированные гены, связанные с ХОБЛ, в GSE57148 были скринингированы с помощью |log2FC| > 0,263, а P < 0,05. Этот порог log2FC соответствует примерно 1,2-кратному изменению и использовался как критерий скрининга для сохранения потенциально релевантных генов, связанных с ПАНоптозом. Всего было отобрано 277 генов, связанных с ПАНоптозом, из ранее опубликованных исследований, связанных с апоптозом, пироптозом, некроптозом и ПАНоптозом, и приведены в Дополнительной таблице 1.
Функциональный анализ генов на обогащение
Для уточнения функциональных последствий выбранных генов PANoptosis, ассоциированных с ХОБЛ, были проведены анализы обогащения Gene Ontology (GO) и Kyoto Encyclopedia of Genes and Genomes (KEGG) с использованием пакета clusterProfiler R и организации. Hs.eg.db пакет аннотации. Были оценены категории биологических процессов GO, клеточных компонентов и молекулярных функций. Анализ обогащения путей KEGG был проведён для выявления сигнальных путей, связанных с выбранными генами. Значения p корректировались для многократного тестирования с использованием метода ложного обнаружения Бенджамини-Хохберга, где это было применимо. Термины обогащения с P < 0,05 были признаны статистически значимыми в этом исследовательском анализе. Графики обогащения были созданы с помощью ggplot2.
Неконтролируемый кластерный анализ паттернов экспрессии генов, ассоциированных с ПАНоптозом
Для изучения молекулярной гетерогенности, связанной с экспрессией генов, ассоциированных с PANoptosis, в LUSC была проведена консенсусная кластеризация с использованием пакета ConsensusClusterPlus R. Образцы LUSC были кластеризованы согласно профилям экспрессии генов PANoptosis, связанных с выживаемостью. Иерархическая кластеризация применялась с использованием расстояния корреляции Пирсона. Максимальное количество кластеров было установлено на уровне шести, и было проведено 1000 повторных итераций для оценки устойчивости кластеризации. Оптимальное число кластера определялось путём оценки консенсусной матрицы, кривой кумулятивной функции распределения, графика площади дельты и биологической интерпретации полученных групп. На основе этих критериев для дальнейшего анализа было выбрано k = 2. Различия в выживаемости между двумя молекулярными группами оценивались с помощью анализа Каплана-Мейера и логарифмического теста.
Анализ различий иммунной микросреды между подтипами
Для сравнения особенностей иммунной микросреды между молекулярными подтипами была оценена инфильтрация иммунных клеток с помощью алгоритма CIBERSORT деконволюции с матриксом лейкоцитного сигназа LM22. Анализ проводился в R с использованием пакетов e1071 и preprocessCore. Значения перестановок CIBERSORT P были записаны для оценки надёжности оценок деконволюции. Поскольку это исследование было исследовательским и основывалось на ретроспективных транскриптомических данных, различия иммунных клеток интерпретировались как вычислительно выводимые паттерны иммунной инфильтрации, а не как прямые клеточные измерения.
Алгоритм ESTIMATE использовался для расчёта стромального балла, иммунного балла, ESTIMATE и чистоты опухоли для каждого образца опухоли. GSVA применялся для оценки показателей обогащения на уровне путей на основе выбранных наборов генов. Групповые различия между фракциями иммунных клеток, генами иммунных контрольных точек, генами семейства HLA и результатами, полученными из ESTIMATE, оценивались с помощью непараметрических тестов. Для множественных сравнений, связанных с иммунитетом, при необходимости применялась коррекция Бенджамини-Хохберга; анализы, представленные с использованием номинальных P-значений, интерпретировались как исследовательские. Анализ корреляции ранга Спирмана был использован для оценки ассоциаций между экспрессией генов и иммунно-связанными маркерами, при этом при необходимости указывались как коэффициенты корреляции, так и значения P. Различия в транскриптах HLA интерпретировались как транскрипционные изменения, связанные с презентацией антигена, а не как прямые функциональные доказательства повышенной способности к презентации антигена.
Установление прогностической подписи, связанной с генами, ассоциированными с ПАНоптозом
Для построения прогностической модели использовалась когорта TCGA-LUSC с полными профилями экспрессии и общей информацией о выживаемости. Из 489 первоначально полученных случаев TCGA-LUSC 381 пациент с полными общими данными о выживаемости были включены в прогностический анализ. Эти пациенты были случайным образом разделены на обучающую когорту и внутреннюю когорту тестирования с соотношением 7:3. Стратифицированная рандомизация проводилась в зависимости от состояния выживаемости для поддержания сопоставимого распределения событий выживания между тренировочной и тестовой когортой.
В обучающей когорте впервые была использована одномерная пропорциональная регрессия Кокса для оценки связи между кандидатом, ассоциированным с ПАНоптозом геном, и общей выживаемостью. Гены с P < 0,05 считались кандидатными прогностическими генами и впоследствии были внесены в регрессию LASSO Cox с использованием корпуса glmnet R. Для выбора оптимального штрафного параметра и уменьшения перенагона использовалась десятикратная перекрёстная валидация. На основе коэффициентов регрессии LASSO Cox и соответствующих нормализованных значений экспрессии гена для каждого пациента был рассчитан индивидуальный риск с использованием формулы:
Оценка риска = Σ(coefi × Xi)
где coefi — коэффициент регрессии каждого выбранного гена, а Xi — нормированное значение экспрессии соответствующего гена. Окончательная прогностическая модель содержала 12 генов: GSDMD, IL18, NFKBIA, PIK3CA, IL1B, BIRC3, MCL1, PSMB10, LMNA, CFLAR, IL1R1 и AKT3. Полное уравнение риска на основе коэффициентов приведено в Дополнительной таблице 2.
Медианный балл риска в обучаемой когорте использовался в качестве порога для классификации пациентов на группы высокого и низкого риска. Та же формула оценки риска применялась к внутренней когорте тестирования и к когортам внешней валидации GSE30219 и GSE37745. Для оценки эффективности модели использовались анализ выживаемости Каплана-Мейера, логарифмическое тестирование и анализ кривой операционных характеристик приёмника, зависящий от времени. Поскольку валидационные наборы данных генерировались с использованием микрочипных платформ и не содержали подтверждённой аннотации сопутствующих ХОБЛ, внешняя валидация интерпретировалась как ретроспективная оценка в независимых когортах LUSC, а не как валидация у клинически подтверждённых пациентов с ХОБЛ и сопутствующей LUSC.
Анализ прогнозирования чувствительности к лекарствам
Чувствительность к лекарствам оценивалась с помощью пакета pRRophetic R, который предсказывает ответ на препарат по профилям экспрессии генов опухолей на основе фармакогеномных референсных данных из базы данных Genomics of Drug Sensitivity in Cancer. Прогнозируемые значения полумаксимальной ингибиторной концентрации (IC50) были рассчитаны для каждого образца пациента. Экспрессионные матрицы обрабатывались в соответствии с требованиями pRRopethic входа, а пакетная коррекция выполнялась с использованием стандартного рабочего процесса, совместимого с pRRophetic. Прогнозируемые значения IC50 были представлены на шкале pRRophetic output.
Восемь кандидатов, включая сорафениб, гефитиниб, блеомицин, бозутиниб, этопозид, леналидомид, камптотецин и метотрексат, были оценены как исследовательская панель по чувствительности к лекарству. Различия в прогнозируемых значениях IC50 между группами высокого и низкого риска сравнивались с помощью теста Wilcoxon rank sum. Эти результаты интерпретировались как вычислительные оценки чувствительности к лекарствам, а не как измеряемый клинический ответ на химиотерапию или экспериментально подтверждённую лекарственную устойчивость.
Статистический анализ
Все статистические анализы проводились с помощью программного обеспечения R. Непрерывные переменные между двумя группами сравнивались с помощью теста ранговой суммы Уилкоксона, тогда как сравнения между более чем двумя группами проводились с помощью теста Крускаля-Уоллиса, когда это было уместно. Общая выживаемость была определена как основная конечная точка выживания. Для сравнения различий в выживаемости между группами были сгенерированы кривые выживаемости Каплана-Мейера, а статистическая значимость оценивалась с помощью логарифмического теста. Одномерное и многомерное
Для оценки прогностических связей между клиническими переменными, группой риска и общей выживаемостью использовались пропорциональные регрессионные анализы Кокса. Переменные, имеющие клиническую значимость или статистическую значимость в одномерном анализе Кокса рассматривались для многомерной регрессии Кокса. Предположение о пропорциональных рисках оценивалось с использованием остаточных данных Шёнфельда. Отсутствующие клинические переменные были обработаны с помощью анализа полного случая для регрессии Кокса и построения номограмм. Коллинеарность клинических переменных оценивалась перед мультивариантным моделированием.
Временно-зависимые кривые ROC использовались для оценки прогностической эффективности модели риска общей выживаемости за 1, 3 и 5 лет. Номограмма была построена с использованием переменных, сохранившихся в многомерной модели, или переменных с достаточной клинической доступностью. Для сравнения прогнозируемых и наблюдаемых общих вероятностей выживаемости использовались калибровочные графики. Анализ кривой принятия решений проводился как исследовательская оценка потенциальной чистой выгоды по выбранным порог вероятностям.
Для оценки ассоциаций между экспрессией генов и иммунно-связанными признаками использовался анализ ранга Спирмана. По мере применения указывались коэффициенты корреляции и значения P. Для множественных сравнений при необходимости применялась коррекция коэффициента ложного обнаружения по методу Бенджамини-Хохберга. Анализы, представленные с использованием номинальных P-значений, считались исследовательскими. Двустороннее значение P < 0,05 считалось статистически значимым.