В этом исследовании использованы общедоступные, деидентифицированные наборы данных из Атласа генома рака (TCGA) и Omnibus по экспрессии генов (GEO), а также установленные коммерческие клеточные линии. Не было задействовано новых человеческих участников, идентифицируемой информации о пациентах или образцов, полученных от пациентов. Все анализы проводились в соответствии с соответствующими институциональными рекомендациями и условиями использования публичных баз данных. Поэтому для этого исследования не требовалось дополнительное институциональное этическое одобрение и информированное согласие.
Источник данных
Данные RNA-seq для когорт IBD (GSE179285; платформа: GPL6480 и GSE24287; платформа: GPL6480), когорт CRC (TCGA-CRC; платформа: Illumina HiSeq 2000 и GSE87211; платформа: GPL13497), а также когорты PAAD (GSE128735; платформа: GPL20301 и GSE62452; платформа: GPL6244) были скачаны из TCGA и GEO. Все наборы данных были доступны 5 декабря 2025 года.
Для каждого набора данных образцы строго делились на две подгруппы: ткани поражения заболевания/опухоли служили группой случаев, а соответствующие нормальные ткани без поражения — контрольной группой. В частности, когорта с ВЗК содержала 297 образцов слизистой кишечной слизистой у пациентов с ВЗК и 56 образцов нормальной кишечной слизистой от здоровых людей; когорта CRC включала 841 первичную ткань колоректальных опухолей и 211 совпадающих смежных нормальных колоректальных эпителиальных тканей; а когорта PAAD включала 114 опухолевых тканей PAAD и 106 нормальных паренхимальных тканей поджелудочной железы.
Все наборы данных в одной категории заболеваний интегрировались равномерно. Функция normalizeBetweenArrays в лимма-пакете была применена для выполнения квантильной нормализации между выборками, эффективно устранив межплатформенные пакетные эффекты и стандартизируя значения экспрессии генов между различными наборами данных для последующего анализа дифференциальной экспрессии.
Скрининг генов, связанных с ВЗК, CRC и PAAD, а также распространённых генов
Во-первых, дифференциально экспрессированные гены (DEG) были скринингированы из когорт IBD, CRC и PAAD с использованием лимма-пакета, а исходные значения P корректировались с помощью метода частоты ложного обнаружения Бенджамини-Хохберга (FDR). В когортах IBD, CRC и PAAD критерии скрининга были установлены на уровне |logFC| > 0,4, а P < 0,05. Кроме того, WGCNA проводился на всех генах, при этом минимальный порог генного модуля составлял 100 (мягкий порог мощности = 0,90; тип сети = подписанный). В результате в трех когортах были выявлены общие ДЭГ-и и модульные гены. Гены, последовательно идентифицированные обоими методами, определялись как общие, тогда как оставшиеся гены классифицировались как родственные гены.
ИПП и анализ функционального обогащения
Эти анализы проводились на генах, связанных с заболеванием. Анализ взаимодействия белков и белков (PPI) проводился с использованием базы данных STRING (балл взаимодействия > 0,40). Функциональный анализ обогащения включал анализы генной онтологии (GO) и Киотской энциклопедии генов и геномов (KEGG), которые проводились с использованием clusterProfiler, enrichplot и org. Hs.eg.db упаковки (P < 0,05 и скорректированное по FDR значение q [метод Бенджамини–Хохберга] < 0,05).
Профилирование иммунной микросреды
CIBERSORT — это надёжный алгоритм для оценки уровней инфильтрации иммунных клеток по данным экспрессии генов с использованием стандартной матрицы сигнатурыLM22 7. В этом исследовании алгоритм CIBERSORT использовался для оценки степени инфильтрации иммунных клеток в образцах когорт IBD, CRC и PAAD, чтобы изучить общие характеристики иммунной микросреды между тремя заболеваниями. Анализ проводился с 1000 перестановками для вычисления P значений для каждого образца, а квантильная нормализация (QN = TRUE) применялась к файлу выражения смеси. Для последующих анализов сохранялись только образцы с CIBERSORT P < 0,05, что обеспечивало надёжность результатов деконволюции.
Оценка диагностической ценности распространённых генов
Диагностическая ценность общих генов в когортах ВЗК, CRC и PAAD была оценена с помощью анализа операционных характеристик приёмника (ROC) с пакетом pROC в R. Оптимальный компромисс между чувствительностью и специфичностью визуализировался с помощью кривых ROC.
qRT-PCR, анализ трансфекции клеток и формирования колоний
qRT-ПЦР и трансфекция клеток проводились согласно предыдущимисследованиям 8,9,10. Транзиентная трансфекция выполнялась с использованием трансфекционного реагента jetPRIME (Polyplus, Китай) согласно инструкциям производителя. Клетки инкубировали с трансфекционной смесью в течение 6 часов, после чего среда заменялась полным DMEM. Последующие эксперименты проводились через 48 часов после трансфекции.
Кратко, полная клеточная РНК была извлечена с помощью реагента TRIzol. РНК была обратно транскрипирована в кДНК с помощью PrimeScript RT Master Mix. Количественная ПЦР проводилась с использованием TB Green qPCR. β-актин использовался как внутренний эталонный ген для нормализации экспрессии. Биологические эксперименты проводились в трёх экземплярах. Праймерные последовательности и siS100P можно найти в предыдущем исследовании 11.
Ячейки NCM460, FHC, HCT116, SW116, PANC1 и BXPC2 были получены согласно таблице материалов. Все клеточные линии прошли идентификацию клеток и тестирование на микоплазму.
Во время экспериментов все клетки проходили через 3–5 поколений. Все клетки культивировались в полном DMEM, содержащем 10% плодовой бычий сыворотки и 1% пенициллин-стрептомицина.
Анализ формирования колоний проводился как описано в предыдущемисследовании 12. Кратко, в каждую скважину пластины с шестью лунками было засеяно по 1000 клеток и культивировано в течение 10 дней, прежде чем эксперимент был завершан. Клетки фиксировались 4% параформальдегида, окрашены 0,1% кристаллическим фиолетом, а колонии подсчитывались с помощью ImageJ.
Анализ распространённых генов на основе данных scRNA-seq
Данные scRNA-seq из набора данных IBD (GSE214695), CRC (GSE166555) и PAAD (GSE154778) были предварительно обработаны, как описано в предыдущихисследованиях 8,13. Матрицы сырого счёта были сведены к экспрессии среднего для дублирующихся генных символов с помощью limma::avereps. Начальная фильтрация сохранила гены, обнаруженные как минимум в трёх клетках и клетках, содержащих не менее 50 уникальных транскриптов. Клетки с фракцией митохондриального транскрипта >5% или менее 50 обнаруженных генов были удалены. Нормализация логарифма проводилась с коэффициентом масштабирования 10 000, после чего последовала стабилизация дисперсии для выявления 1 500 наиболее переменных генов, которые были стандартизированы по Z-шкале до анализа основных компонентов (PCA). Гены, определяющие кластерные маркеры, были отфильтрованы с использованиемлогарифма 2 (изменение fold) > 0,5, доли обнаружения ≥0,25 в целевых кластерах и скорректированного значения P <0,05.
Кратко, предобработка данных проводилась с помощью пакета Seurat, а аннотация типов ячеек — с помощью пакета SingleR (версия 2.6.0). Кластеризация ячеек проводилась в Seurat с использованием построения графа k-ближайших соседей и t-SNE на основе размерностей PCA 1–20. Затем были изучены уровни распространения и экспрессии общих генов между разными типами клеток.
Создание модели IBD
Согласно предыдущимисследованиям 14, липополисахарид (LPS) использовался для индуцирования воспаления в нормальных эпителиальных клетках кишечной кишки человека (FHC и NCM460), создавая модель ВЗК, имитирующая воспаление. Биологические эксперименты проводились в трёх экземплярах. Клетки регулярно культивировались в увлажнённом инкубаторе при 37°C с 5%CO2. Когда слияние клеток достигало примерно 50%–70%, культурная среда заменялась свежей полной средой, а клетки обрабатывались 10 нг/мл LPS в течение 12 часов. В качестве управления автомобиля использовался такой же объем стерильного фосфатно-буферного физиологического раствора (PBS). Объём посева составлял 2 мл на одну скважину в пластинах с 6 колодцами. После обработки среда была удалена, клетки дважды промывались предварительно охлаждённым стерильным ПБС, после чего клетки собирали для последующих анализов.
Статистический анализ
Все биоинформатические анализы проводились с использованием программного обеспечения R (версия 4.1.2). Сравнения между двумя группами проводились с помощью t-теста Стьюдента, тогда как сравнение между несколькими группами — с помощью одностороннего анализа дисперсии (ANOVA). Корреляционный анализ проводился с использованием метода Спирмена. Все клеточные эксперименты повторялись как минимум три раза, а данные представлены как среднее ± стандартного отклонения (SD). Значение P или FDR < 0,05 считалось статистически значимым. NS — не значительный; P < 0,05 (*), P < 0,01 (**), и P < 0,001 (***).