$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Как всем известно, рак мочевого пузыря (BLCA) — одна из самых агрессивных и метастатических злокачественных опухолей в мире, и до сих пор существуют проблемы с текущими биомаркерами рака мочевого пузыря, такие как неточность и такдалее. Для определения прогноза пациентов с BLCA и прогнозирования исходов пациентов с BLCA большое значение имеют поиск биомаркеров рака мочевого пузыря и создание прогностических моделей. Хотя люди разработали некоторые методы исследования биомаркеров, большинство из них в настоящее время ограничены транскриптомикой, что неизбежно приводит к гетерогенностиобразцов 2. Кроме того, изучение данных транскриптомики в одиночку часто не позволяет исследовать роли, которые играют разные клеточные субпопуляции, а также функции генов в различных путях на уровне отдельных клеток, что делает прошлые исследования менее точными иэффективными 3. Учитывая, что анализ отдельных клеток может быть сложным для новичков, была создана онлайн-платформа для анализа отдельных клеток, чтобы помочь им быстро освоить этинавыки 4. И, наконец, даже если один ген будет признан подходящим биомаркером с помощью анализа транскриптома и анализа отдельных клеток, нет гарантии, что биомаркер будет применим ко всем когортам, поэтому необходимо строить прогностические модели, связанные с биомаркером, чтобы сделать выводы более универсальноприменимыми.. Алгоритм машинного обучения 101 относится к построению моделей прогноза 101 с использованием комбинации 10 различных алгоритмов машинного обучения с целью выявления оптимальной модели прогноза. Включение таких алгоритмов, как случайный лес, XGBoost и SVM, которые лучше справляются со сложными данными и обладают большей стабильностью, привело к тому, что этот объединённый алгоритм демонстрирует выдающуюся стабильность. Чтобы сделать эту прогностическую модель более точной и релевантной для биомаркера, сначала проводится корреляционный анализ между всеми генами и биомаркером, затем выбирается около 20-30 генов на основе требований, а затем используется алгоритм машинного обучения 101 для построения прогностической модели, после чего следует серия анализов для окончательного подтверждения результатов.
По сравнению с биомаркерами, предсказанными простым транскриптомическим анализом последних6 лет, биомаркеры одноклеточного и транскриптомного анализа позволяют беспристрастно расщеплять ткани или образцы на их базовые клеточные компоненты. Это позволяет чётко дифференцировать различные типы клеток (таких как Т-клетки, В-клетки и макрофаги), открыть новые субпопуляции (такие как истощённые Т-клетки и регуляторные Т-клетки), а также захватывать непрерывные динамические процессы (например, траектории дифференцировки клеток)4. Это похоже на размывание фруктов и молока отдельно, позволяя чётко визуализировать каждый компонент и его количество компонентов. По сравнению с однокогортными моделямиCox 7, прогностическая модель, построенная с использованием машинного обучения 101, также более точна и научно обоснована, поскольку она автоматически изучает сложные, нелинейные взаимодействия переменных из данных. Например, влияние конкретной генетической мутации может быть значительным только у пациентов определённого возраста и размера опухолей. Модели машинного обучения, такие как случайные леса и нейронные сети, могут автоматически фиксировать эти взаимодействия высокого порядка без необходимости ручнойспецификации 8. Ограничения по применимости ключевых сигналов, которые набор данных для анализа должен включать подавляющее большинство генов, при этом их число не слишком мало, а количество генов, используемых для построения прогностических моделей, не слишком высокое, обычно поддерживается около 20-30, является оптимальным. Стандарт контроля качества одного набора клеток должен превышать 1000, количество UMI на клетку — более 1000, а количество генов на клетку — более 5009.
Здесь предоставляется пошаговый подход к идентификации новых биомаркеров из публичных транскриптомных наборов данных и одноклеточных наборов, например, роль TRPM4 в BLCA. Применяются различные методы исследования и разнообразные наборы данных — включая набор данных Cancer Genome Atlas-Bladder Cancer (TCGA-BLCA), одноклеточный набор данных GSE145281 и наборы данных BLCA GSE32894 и GSE31684 — для повышения точности и применимости биомаркеров в онкологии с разных точек зрения и продвижения изучения TRPM4 в BLCA. Набор данных TCGA-BLCA был получен с сайта Калифорнийского университета в Санта-Крус-Ксена (UCSC Xena). GSE32894 и GSE31684 были скачаны из Gene Expression Omnibus (GEO), а одноклеточные данные GSE145281 получены из Tumor Immune Single-Cell Hub 2 (TISCH2). Кроме того, данные о молекулярных подтипах BLCA и ответах на лечение были извлечены из дополнительных таблиц соответствующей статьи. Затем проводятся биоинформатический анализ, анализ отдельных клеток и машинное обучение, что устанавливает интегрированную методологию исследований с использованием одного гена.