Методическая статья

Анализ на основе данных TCGA и одноячейковых, с примером TRPM4

DOI:

10.3791/69304

5 декабря 2025 г.

* These authors contributed equally

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Здесь мы представляем протокол для тщательного анализа роли одного гена в раке мочевого пузыря (BLCA) на основе анализа транскриптома и одноклеточного анализа, а также с использованием 101 алгоритма машинного обучения, чтобы построить прогностическую модель для указанного одного гена.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этой статье представлен метод анализа, основанный на публичных транскриптомных и одноклеточных наборах данных, которые могут быть использованы для всестороннего описания роли отдельных генов в опухоли, включая формирование иммунной микросреды опухоли, формирование молекулярных подтипов опухолей и прогнозирование прогноза пациентов с опухоли. В то же время введение данных по одному гену не только позволяет избежать случайности и гетерогенности, вызванных анализом одного транскриптома, но и позволить более глубоко изучить, в каких конкретных кластерах клеток экспрессируется ген, а также провести дальнейшие исследования роли гена в этом пути. Учитывая, что многие исследователи могут быть некомпетентны в анализе отдельных клеток, в этой статье был создан онлайн-сайт под названием TISCH2 (http://tisch.compbio.cn/), что помогает каждому завершить анализ на одной клетке. Кроме того, применение 101 метода машинного обучения сыграло незаменимую роль в построении наиболее точной прогностической модели. В заключение, считается, что этот интегрированный метод одногенного анализа, сочетающий биоинформатику, машинное обучение и анализ отдельных клеток, может сыграть незаменимую и решающую роль в изучении функций отдельных генов в прогрессировании опухоли, а также в изучении функций отдельных генов в путях.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Как всем известно, рак мочевого пузыря (BLCA) — одна из самых агрессивных и метастатических злокачественных опухолей в мире, и до сих пор существуют проблемы с текущими биомаркерами рака мочевого пузыря, такие как неточность и такдалее. Для определения прогноза пациентов с BLCA и прогнозирования исходов пациентов с BLCA большое значение имеют поиск биомаркеров рака мочевого пузыря и создание прогностических моделей. Хотя люди разработали некоторые методы исследования биомаркеров, большинство из них в настоящее время ограничены транскриптомикой, что неизбежно приводит к гетерогенностиобразцов 2. Кроме того, изучение данных транскриптомики в одиночку часто не позволяет исследовать роли, которые играют разные клеточные субпопуляции, а также функции генов в различных путях на уровне отдельных клеток, что делает прошлые исследования менее точными иэффективными 3. Учитывая, что анализ отдельных клеток может быть сложным для новичков, была создана онлайн-платформа для анализа отдельных клеток, чтобы помочь им быстро освоить этинавыки 4. И, наконец, даже если один ген будет признан подходящим биомаркером с помощью анализа транскриптома и анализа отдельных клеток, нет гарантии, что биомаркер будет применим ко всем когортам, поэтому необходимо строить прогностические модели, связанные с биомаркером, чтобы сделать выводы более универсальноприменимыми.. Алгоритм машинного обучения 101 относится к построению моделей прогноза 101 с использованием комбинации 10 различных алгоритмов машинного обучения с целью выявления оптимальной модели прогноза. Включение таких алгоритмов, как случайный лес, XGBoost и SVM, которые лучше справляются со сложными данными и обладают большей стабильностью, привело к тому, что этот объединённый алгоритм демонстрирует выдающуюся стабильность. Чтобы сделать эту прогностическую модель более точной и релевантной для биомаркера, сначала проводится корреляционный анализ между всеми генами и биомаркером, затем выбирается около 20-30 генов на основе требований, а затем используется алгоритм машинного обучения 101 для построения прогностической модели, после чего следует серия анализов для окончательного подтверждения результатов.

По сравнению с биомаркерами, предсказанными простым транскриптомическим анализом последних6 лет, биомаркеры одноклеточного и транскриптомного анализа позволяют беспристрастно расщеплять ткани или образцы на их базовые клеточные компоненты. Это позволяет чётко дифференцировать различные типы клеток (таких как Т-клетки, В-клетки и макрофаги), открыть новые субпопуляции (такие как истощённые Т-клетки и регуляторные Т-клетки), а также захватывать непрерывные динамические процессы (например, траектории дифференцировки клеток)4. Это похоже на размывание фруктов и молока отдельно, позволяя чётко визуализировать каждый компонент и его количество компонентов. По сравнению с однокогортными моделямиCox 7, прогностическая модель, построенная с использованием машинного обучения 101, также более точна и научно обоснована, поскольку она автоматически изучает сложные, нелинейные взаимодействия переменных из данных. Например, влияние конкретной генетической мутации может быть значительным только у пациентов определённого возраста и размера опухолей. Модели машинного обучения, такие как случайные леса и нейронные сети, могут автоматически фиксировать эти взаимодействия высокого порядка без необходимости ручнойспецификации 8. Ограничения по применимости ключевых сигналов, которые набор данных для анализа должен включать подавляющее большинство генов, при этом их число не слишком мало, а количество генов, используемых для построения прогностических моделей, не слишком высокое, обычно поддерживается около 20-30, является оптимальным. Стандарт контроля качества одного набора клеток должен превышать 1000, количество UMI на клетку — более 1000, а количество генов на клетку — более 5009.

Здесь предоставляется пошаговый подход к идентификации новых биомаркеров из публичных транскриптомных наборов данных и одноклеточных наборов, например, роль TRPM4 в BLCA. Применяются различные методы исследования и разнообразные наборы данных — включая набор данных Cancer Genome Atlas-Bladder Cancer (TCGA-BLCA), одноклеточный набор данных GSE145281 и наборы данных BLCA GSE32894 и GSE31684 — для повышения точности и применимости биомаркеров в онкологии с разных точек зрения и продвижения изучения TRPM4 в BLCA. Набор данных TCGA-BLCA был получен с сайта Калифорнийского университета в Санта-Крус-Ксена (UCSC Xena). GSE32894 и GSE31684 были скачаны из Gene Expression Omnibus (GEO), а одноклеточные данные GSE145281 получены из Tumor Immune Single-Cell Hub 2 (TISCH2). Кроме того, данные о молекулярных подтипах BLCA и ответах на лечение были извлечены из дополнительных таблиц соответствующей статьи. Затем проводятся биоинформатический анализ, анализ отдельных клеток и машинное обучение, что устанавливает интегрированную методологию исследований с использованием одного гена.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ПРИМЕЧАНИЕ: Все коды, использованные в этой статье, можно найти на сайте https://github.com/YaoGeng-nmu/Analysis-of-TRPM4-based-on-TCGA-data-and-single-cell-data-in-BLCA/blob/main/code.

1. Подготовка транскриптомических данных

  1. Подготовка набора данных TCGA-BLCA
    1. Скачайте все наборы данных TCGA с сайта UCSC Xena (https://xenabrowser.net/datapages/)10. Загруженные наборы данных предварительно обработаны, что устраняет необходимость дополнительной работы, такой как аннотациягенов 11.
    2. Выберите набор данных TCGA , затем нажмите на TCGA-BLCA dataset. Затем перейдите на страницу набора данных TCGA-BLCA, нажмите на Gene Expression RNA-seq и скачайте клинические данные и профили экспрессии генов из набора данных TCGA-BLCA. В этом наборе данных убедитесь, что у пациентов BLCA есть 400 данных о экспрессии мРНК.
    3. Чтобы отличить образцы опухолей от соседних нормальных образцов тканей, разделите образцы с окончаниями 01 и 11, так как образцы с 01 указывают на опухоли, а образцы с 11 — на ткани, смежные с раком (нормальные образцы).
  2. Подготовка GSE32894 и GSE31684
    1. Нажмите на сайт GEO (https://www.ncbi.nlm.nih.gov), чтобы скачать набор данных BLCA GSE32894 и GSE3168412,13.
    2. После нажатия на соответствующие записи в правом верхнем углу обязательно перейдите к страницам с наборами данных GSE32894 и GSE31684.
    3. Далее скачайте соответствующие данные по мРНК, клинические данные и данные о выживаемости GSE32894. Нажмите на кнопку http в наборе данных GSE32894. Также скачайте данные GPL6947 платформы с помощью кнопки платформы. Нажмите кнопку Series Matrix File(s ) и скачайте GSE32894 после нажатия кнопки GSE32894_series_matrix.txt.gz при загрузке данных мРНК, клинических данных и данных о выживаемости для GSE32894.
    4. Скачайте соответствующие данные по мРНК, клинические данные и данные о выживаемости для GSE31684. Нажмите на кнопку http в наборе данных GSE31684. Также скачайте данные платформы GPL570 с помощью кнопки платформы. Нажмите на кнопку Series Matrix File(s ) и скачайте GSE31684 после нажатия кнопки GSE31684_series_matrix.txt.gz при скачивании данных мРНК, клинических данных и данных о выживаемости для GSE31684.
    5. На этапе фильтрации удаляйте бессмысленные гены, например, с уровнем экспрессии нулевым или близким к нулю. Используйте метод ComBat, основанный на пакетеsva 14, для пакетной коррекции.

2. Подготовка одноклеточного анализа

  1. Подготовка GSE145281
    1. Для проведения исследований на уровне отдельных клеток найдите набор данных BLCA, учитывая, что одних данных транскриптома недостаточно для определения, какой клеточный кластер наиболее значимо экспрессирует TRPM4 .
    2. Здесь можно посетить TISCH2 (http://tisch.compbio.cn/) — онлайн-сайт для одноклеточного анализа опухолей.
    3. В зависимости от экспериментальных потребностей выберите нужный тип рака , используя BLCA в данном случае.
    4. Нажмите кнопку BLCA , выбрав набор данных под названием GSE145281.

3. Подготовка молекулярных подтипов BLCA и ответ на данные терапевтических выборов

  1. Скачайте данные о молекулярных подтипах BLCA и его реакции на терапевтические выборы из статьи, на которую ссылается15.
  2. Откройте сайт PubMed (https://pubmed.ncbi.nlm.nih.gov/). Найдите статью и нажмите на дополнительные таблицы. В этом сжатом пакете всего 18 файлов.

4. Анализ иммунной микросреды BLCA TRPM4

  1. Тепловая карта экспрессии 133 иммуномодуляторов в различных группах TRPM4
    1. Согласно выражению TRPM4, разделите все образцы BLCA на группу с высоким TRPM4 и группу с низким TRPM4 .
    2. Скопируйте все названия выборок и данные выражения TRPM4 отдельно, затем отсортируйте их в убывающем порядке экспрессии TRPM4 и отметьте первую половину выборок в группу High-TRPM4 , а вторую половину — в группу Low-TRPM4 в столбце Group согласно выражению TRPM4 . Все идентификаторы пациентов TCGA-BLCA указаны в дополнительной таблице 1.
    3. Установите R-пакеты, необходимые для анализа транскриптомических данных. Внесите небольшие изменения в предоставленный код, например, измените местоположение файла, а затем запустите код. Тщательно проверяйте, совпадают ли идентификаторы генов и идентификаторы иммуномодуляторов, чтобы после идентификаторов генов не было пробелов или других незаметных факторов, так как именно они являются основными причинами неудачной генерации тепловой карты.
  2. Стромальный и иммунологический анализ образцов опухолей с использованием пакета ESTIMATE R
    1. Убедитесь, что все R-пакеты, необходимые для анализа транскриптомических данных, установлены. Согласно требованиям кода, назовите нужные данные соответствующими именами, а затем нажмите кнопку «Запустить».
      ПРИМЕЧАНИЕ: Важно помнить, что этот сайт также предлагает возможности онлайн-анализа. Хотя можно получить желаемый результат, посетив сайт (https://bioinformatics.mdanderson.org/estimate/rpackage.html), этот метод не подходит для анализа данных, собранных самостоятельно.
    2. Нажмите кнопку «Заболевание » и выберите опцию « Карцинома уротелиального мочевого пузыря ». Затем выберите кнопку платформы RNA-seq-V2 . Скачайте все показатели стромы, иммунного балла и оценочную оценку всех образцов.
  3. Скрипичный график выражения между различными группами TRPM4
    1. Установите все R-пакеты, необходимые для анализа транскриптомических данных. Все необходимые пакеты R перечислены в дополнительной таблице 2. Согласно требованиям кода, назовите нужные данные соответствующими именами, а затем нажмите кнопку «Запустить».
    2. Обязательно тщательно проверяйте, что идентификаторы генов введены правильно, чтобы в конце них не было пробелов или других незаметных факторов, так как именно они являются основными причинами неудач при создании скрипичных графиков.
  4. График тепловой карты треугольника между различными группами TRPM4
    1. Установите все R-пакеты, необходимые для анализа транскриптомических данных. Обязательно подготовьте данные экспрессии нескольких генов иммунных контрольных точек, таких как TIGIT и CD80. Откройте данные транскриптома TCGA-BLCA и затем просматривайте каждую запись по отдельности, учитывая, что количество генов иммунных контрольных точек невелико.
    2. Согласно требованиям кода, назовите нужные данные соответствующими именами, а затем нажмите кнопку «Запустить».
  5. График корреляции между разными генами и TRPM4
    1. Установите все R-пакеты, необходимые для анализа транскриптомических данных. Заполните TRPM4 как первый ген и добавьте исследуемый ген как второй ген, который в данном случае является CD3E .
    2. После нажатия кнопки Run обязательно замените CD3E на другие гены, которые нужно анализировать, например , CTLA4.

5. Анализ TRPM4 по отдельной ячейке в наборе данных GSE145281

  1. BLCA GSE145281 анализ наборов данных с использованием одноячейкового анализа
    1. Зайдите на сайт и нажмите BLCA. Анализ на отдельных клетках позволяет более глубоко выяснить, какой клеточный кластер демонстрирует высокую экспрессию TRPM4 по сравнению с анализом транскриптомики. Убедитесь, что данные анализа отдельных клеток собраны из GSE130001, и проверьте по стандартам контроля качества, что количество клеток в наборе данных должно быть больше 1000, количество UMI на клетку — более 1000, а число гена на клетку — более 500. Дифференциально экспрессируемые гены каждого кластера по сравнению с другими клетками определяются на основе логарифм-трансформированного изменения складки (|logFC| >= 0,25), а разрешение кластеризации должно составлять 0,5.
  2. Аннотация клеток для различных кластеров клеток
    1. Убедитесь, что все кластеры клеток имеют аннотации. Например, B-клетки могут быть аннотированы CD19, MS4A1, CD27, IGHD, IGHM, TCL1A и FCRL5. Все гены, используемые для аннотации клеток, представлены в дополнительной таблице 3.
    2. Затем выберите GSE145281 и скачайте все результаты TRPM4. Нажмите кнопку «В целом» и скачайте график UMAP GSE145281 различных кластеров и типов ячеек.
    3. Нажмите кнопку «Ген» и выберите один ген, который будет анализироваться. Нажмите кнопку GSEA и наблюдайте функции этого гена на различных путях, таких как пути KEGG и Hallmark16,17.
    4. Нажмите на кнопку CCI и найдите график чата и пузырькового графика кластера, сильно экспрессирующего один ген.
    5. Нажмите кнопку обогащения TF , чтобы увидеть обогащённый фактор транскрипции для каждого кластера.

6. 101 Машинное обучение для построения прогностической модели, связанной с TRPM4

  1. Установите все R-пакеты, необходимые для анализа транскриптомических данных. Учитывая, что единый подход машинного обучения не всегда является оптимальным для прогнозирования, модель прогноза может быть построена с использованием 101 метода машинного обучения. Проведите корреляционный анализ между всеми генами когорты TCGA-BLCA и когортами GSE32894 и GSE31684 и TRPM4.
  2. Исходя из числа генов, сильно связанных с TRPM4, выберите все гены с корреляцией больше или равной 0,6 или меньше или равной -0,6 с TRPM4. Выберите все гены, сильно связанные с TRPM4 во всех когортах.
  3. Объедините все данные из когорт GSE32894 и GSE31684 в набор валидации и используйте TCGA-BLCA в качестве обучающего набора.
  4. Согласно требованиям кода, назовите нужные данные соответствующими именами, а затем нажмите кнопку «Запустить».

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Хорошо известно, что основное преимущество использования транскриптомики для анализа иммунной микросреды отдельных генов заключается в прямой корреляции между отдельными генами и динамическими взаимодействиями с иммунными клетками и молекулами на уровне экспрессии генов, что позволяет непосредственно наблюдать иммунные характеристики и выявлять различия в доле иммунных клеток, инфильтртирующихся между группами с высокой/низкой экспрессией отдельных генов или изменений в экспрессии молеку...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В предыдущих исследованиях биоинформатический анализ отдельных генов часто сталкивался с такими проблемами, как поверхностность, неточность и ограниченнаяприменимость 19. Кроме того, предыдущие исследования отдельных генов обычно ограничивались данными транскриптома. Кроме того, при сосредоточении исключительно на транскриптомных данных могут возникать такие вопросы, как гетерогенность выборок и случайность, что затрудняет выявление универсальных...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы заявляют, что у них нет конфликта интересов.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Мы хотели бы поблагодарить BioBean Informatics Consortium за разработку интеллектуальной аналитической структуры (доступной по адресу http://www.sxdyc.com/). Их инновационная вычислительная инфраструктура значительно ускорила исследовательский рабочий процесс благодаря точной аналитике и автоматизированным модулям интерпретации данных.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
R 4.3.3нетнетнет

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhang, C., et al. Identification of multicohort-based predictive signature for NMIBC recurrence reveals SDCBP as a novel oncogene in bladder cancer. Ann Med. 57 (1), 2458211(2025).
  2. Han, M. H., et al. Plasma GFAP and Amyloid Pathology Predict Cognitive Response to Multidomain Interventions in MCI. Aging Dis. , (2025).
  3. Xie, S., et al. Towards Precision Aging Biology: Single-Cell Multi-Omics and Advanced AI-Driven Strategies. Aging Dis. , (2025).
  4. Han, Y., et al. TISCH2: expanded datasets and new tools for single-cell transcriptome analyses of the tumor microenvironment. Nucleic Acids Res. 51 (D1), D1425-D1431 (2023).
  5. Yao, Y., et al. Advances in prognostic models for osteosarcoma risk. Heliyon. 10 (7), e28493(2024).
  6. Ding, X., et al. Glutamine metabolism reprogramming promotes bladder cancer progression via PYCR1: a multi-omics and functional validation study. J Transl Med. 23 (1), 1277(2025).
  7. Zhu, T., et al. Methylparaben and propylparaben promote bladder cancer invasion via MMP2 and PPARG modulation. Ecotoxicol Environ Saf. 306, 119383(2025).
  8. Xie, J. H., et al. Deciphering cutaneous melanoma prognosis through LDL metabolism: Single-cell transcriptomics analysis via 101 machine learning algorithms. Exp Dermatol. 33 (4), e15070(2024).
  9. Sun, D., et al. TISCH: a comprehensive web resource enabling interactive single-cell transcriptome visualization of tumor microenvironment. Nucleic Acids Res. 49 (D1), D1420-D1430 (2021).
  10. Cao, X., et al. D-Mannose Upregulates Testin via the NF-κB Pathway to Inhibit Breast Cancer Proliferation. J Biochem Mol Toxicol. 39 (8), e70398(2025).
  11. Goldman, M. J., et al. Visualizing and interpreting cancer genomics data via the Xena platform. Nat Biotechnol. 38 (6), 675-678 (2020).
  12. Yu, Q., et al. GREM1 may be a biological indicator and potential target of bladder cancer. Sci Rep. 14 (1), 23280(2024).
  13. Wu, Q., et al. Membrane palmitoylated protein MPP1 inhibits immune escape by regulating the USP12/ CCL5 axis in urothelial carcinoma. Int Immunopharmacol. 146, 113802(2025).
  14. Johnson, W. E., Li, C., Rabinovic, A. Adjusting batch effects in microarray expression data using empirical Bayes methods. Biostatistics. 8 (1), 118-127 (2007).
  15. Hu, J., et al. Siglec15 shapes a non-inflamed tumor microenvironment and predicts the molecular subtype in bladder cancer. Theranostics. 11 (7), 3089-3108 (2021).
  16. Kanehisa, M., Sato, Y., Morishima, K. BlastKOALA and GhostKOALA: KEGG Tools for Functional Characterization of Genome and Metagenome Sequences. J Mol Biol. 428 (4), 726-731 (2016).
  17. Munkley, J., et al. Hallmarks of glycosylation in cancer. Oncotarget. 7 (23), 35478-35489 (2016).
  18. Da, Y., et al. A high stroma-tumor ratio is associated with an immunosuppressive tumor microenvironment and a poor prognosis in bladder cancer. Front Oncol. 15, 1604609(2025).
  19. Chen, C., et al. Bioinformatics Methods for Mass Spectrometry-Based Proteomics Data Analysis. Int J Mol Sci. 21 (8), 2873(2020).
  20. Jonauskaite, D., et al. Universal Patterns in Color-Emotion Associations Are Further Shaped by Linguistic and Geographic Proximity. Psychol Sci. 31 (10), 1245-1260 (2020).
  21. Zhu, W., et al. Integrated machine learning identifies epithelial cell marker genes for improving outcomes and immunotherapy in prostate cancer. J Transl Med. 21 (1), 782(2023).
  22. Zhao, J., et al. Bioinformatics prediction and experimental verification of key biomarkers for diabetic kidney disease based on transcriptome sequencing in mice. PeerJ. 10, e13932(2022).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

TCGA DataSingle Cell DataTRPM4 GeneTumor Immune MicroenvironmentTumor Molecular SubtypesPrognostic ModelMachine LearningBioinformatics AnalysisSingle Gene AnalysisTISCH2 Website

Похожие статьи