$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Оценка представления mqTrans транскриптомного набора данных
В тестовом коде используются одиннадцать алгоритмов выбора признаков (FS) и семь классификаторов для оценки того, как сгенерированное mqTrans-представление транскриптомного набора данных вносит вклад в задачу классификации (рис. 6). Тестовый набор данных состоит из 317 случаев аденокарциномы толстой кишки (COAD) из базы данных The Cancer Genome Atlas (TCGA)29. Пациенты с КОАД на I или II стадиях считаются отрицательными образцами, а пациенты с III или IV стадиями – положительными.
В тестовом коде реализовано одиннадцать алгоритмов FS. Существует три алгоритма FS на основе фильтров, в том числе: выбрать K лучших признаков по MIC (SK_mic), выбрать K признаков по FPR MIC (SK_fpr) и выбрать K признаков по наибольшему FDR MIC (SK_fpr). Три древовидных алгоритма ФС оценивают отдельные признаки с помощью дерева решений с индексом Джини (DT_gini), адаптивного дерева решений (AdaBoost) и случайного леса (RF_fs) соответственно. Пул FS тестового кода также оценивает две оболочки: рекурсивное исключение признаков (RFE) с классификатором линейных опорных векторов (SVC)(RFE_SVC) и RFE с классификатором логистической регрессии (RFE_LR), а также два алгоритма внедрения: линейный классификатор SVC с самыми ранжированными значениями важности признаков L1 (lSVC_L1) и классификатор логистической регрессии со значениями важности признаков L1 (LR_L1).
Тестовый код строит классификационные модели с использованием семи классификаторов, включая линейный метод опорных векторов (SVC), гауссов наивный байесовский метод (GNB), классификатор логистической регрессии (LR), k-ближайшего соседа, k-5 по умолчанию (KNN), XGBoost, случайный лес (RF) и дерево решений (DT).
На рисунке 6 показана максимальная точность тестирования признаков mqTrans, исходных признаков мРНК и комбинированного подмножества признаков mRNA и mqTrans, рекомендуемых каждым алгоритмом FS.
Комбинированные подмножества признаков (мРНК+mqTrans) достигли наивысшей точности 0,7656 по методу FS «SK_fpr», что лучше, чем отдельные типы признаков mqTrans (0,7188) и исходная мРНК (0,7188). Аналогичные закономерности наблюдаются и для других алгоритмов ФС. Пользователь может проверить выбранные функции в выходном файле Output-SelectedFeatures.csv.
Обнаружение темных биомаркеров
Предыдущие исследования показали существование недифференциально экспрессируемых генов со значимо дифференциально представленными значениями mqTrans между фенотипической и контрольной группами 26,38,39. Эти гены называются темными биомаркерами, потому что традиционные исследования по обнаружению биомаркеров игнорируют их недифференциальную экспрессию. Функция статистического анализа t.test в Microsoft Excel может быть использована для определения признака, который выражается дифференциально, если его статистическое p-значение меньше 0,05.
Среди 3062 признаков со сгенерированными значениями mqTrans был обнаружен 221 темный биомаркер (рис. 7). Ген ENSG00000163697, занявший третье место (APBB2, Amyloid Beta Precursor Protein Binding Family B Member 2), демонстрирует значительно дифференцированные значения mqTrans (mqTrans.P = 2,03 x 10-4), в то время как его исходный уровень экспрессии не показывает дифференциальной экспрессии (mRNA.P = 3,80 x 10-1). Ключевое слово APBB2 попало в 27 публикаций в базе данных PubMed,40, но никаких связей с толстой или кишечной кишкой обнаружено не было.
Другой ген ENSG00000048052 (HDAC9, гистондеацетилазы 9) имеет дифференциально представленные значения mqTrans (mqTrans.P = 6,09 x 10-3) при сохранении практически одинакового нормального распределения между фенотипической и контрольной группами (мРНК.P = 9,62 x 10-1). Ключевое слово HDAC9 попало в 417 публикаций в базе данных PubMed. В трех исследованиях также упоминались ключевые слова «толстая кишка» или «кишечник» в рефератах 41,42,43. Но ни один из них не исследовал роль HDAC9 в развитии рака толстой кишки.
Полученные данные свидетельствуют о необходимости дальнейшей оценки этих темных биомаркеров по их посттранскрипционной активности, например, уровня транслируемого белка44,45.
Панраковое распределение темновых и традиционных биомаркеров, связанных с метаболизмом
Традиционные биомаркеры, связанные с метаболизмом, были проверены и сравнены с темными биомаркерами для 26 типов рака в наборе данных TCGA38. Обе категории биомаркеров прошли статистическую оценку для определения уровней значимости на ранних (I и II стадии) и поздних (III и IV стадии) стадиях рака. В этой оценке использовался t-критерий Стьюдента для p-значений, впоследствии скорректированный для многократного тестирования с использованием коэффициентов ложных обнаружений (FDR). Подробные данные по каждому из 26 типов рака представлены на рисунке 8.
Гены, дающие скорректированные FDR p-значения ниже 0,05, были классифицированы как традиционные биомаркеры. Напротив, темные биомаркеры были определены как те, у которых p-значения, скорректированные FDR, ниже 0,05 в представлении mqTrans, при одновременном отсутствии статистически значимых различий в уровнях экспрессии.
На рисунке 9 показан общий дефицит темных биомаркеров по сравнению с традиционными биомаркерами для большинства типов рака. Следует отметить исключения BRCA, MESO и TGCT, которые демонстрируют большую распространенность темных биомаркеров. Выявлено, что различные факторы, включая факторы транскрипции, паттерны метилирования, генные мутации и условия окружающей среды, могут модулировать транскрипционную дисрегуляцию этих темных биомаркеров. Дальнейшая сложность может возникнуть из-за перекрывающихся некодирующих транскриптов РНК, которые могут сбить с толку уровни экспрессии темных биомаркеров. Транскрипционные дисрегуляции некоторых темновых биомаркеров подтверждались их дифференциальными уровнями белка44,45. Темные биомаркеры часто упускаются из виду в традиционных исследованиях и представляют собой интригующие возможности для будущих механистических исследований.

Рисунок 1: Обзор модулей HealthModel и выбора функций в этом протоколе. Замените конкретные алгоритмы в пуле выбора признаков и пуле классификаторов, если пользователь знаком с программированием на Python. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

Рисунок 2: Полный поток кода для этого протокола. (A) Подготовьте среду Python. Для начала создайте виртуальную среду и установите необходимые пакеты. Подробные инструкции см. в разделе 1. (B) Сгенерируйте объекты mqTrans. Получите функции mqTrans, выполнив предоставленный код шаг за шагом. Подробные объяснения можно найти в разделе 2. (C) Выберите mqTrans Features. Этот раздел посвящен оценке возможностей mqTrans. Более подробную информацию см. в Разделе 3. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

Рисунок 3: Подготовка среды для Python. (A) Команда для создания healthmodel. (B) Введите y в процессе создания VE. (C) Наиболее распространенная команда для активации VE. (D) Команда по установке горелки 1.13.1. (E) Установите дополнительные библиотеки для пакета torch-geometric . (F) Установите геометрический пакет горелки . Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

Рисунок 4: Запустите HealthModel, чтобы получить функцию mqTrans. (A) Загрузите код. (Б) Пример файла данных. В каждом столбце указаны все значения регуляторного фактора, а первым пунктом является идентификатор гена. Каждая строка содержит значения данной выборки, где первым элементом является имя образца. (C) Пример файла этикеток. В первом столбце приведены имена образцов, а метка класса каждого образца указана в столбце label. Значение 0 в столбце label означает, что этот образец жив, 1 — мертв. (D) выходы mqTrans. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

Рисунок 5: Запустите алгоритм выбора признаков для функции mqTrans. Результаты алгоритма выбора признаков показываются пользователю. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

Рисунок 6: Максимальная точность тестового набора для каждого алгоритма выбора признаков. На горизонтальной оси перечислены алгоритмы выбора признаков, а на вертикальной оси — значения точностей. Гистограммы показывают экспериментальные данные по трем параметрам: mqTrans, mRNA, mRNA+mqTrans. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

Рисунок 7: Топ-50 темных биомаркеров с наименьшими p-значениями в представлении mqTrans. В столбце «Темный биомаркер» указаны названия темных биомаркеров. Столбцы "mRNA.P" и "mqTrans.P" представляют собой статистические p-значения t-критерия между фенотипической и контрольной группами. Цвета фона p-значений находятся в диапазоне от 1,00 (синий) до 0,00 (красный), а белый цвет представляет p-значение = 0,05. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

Рисунок 8: Подробная информация о 26 видах рака в Атласе генома рака (TCGA) на разных стадиях. Столбцы «Когорта» и «Патологическая ткань» описывают группу пациентов и ткани с заболеванием для каждого набора данных. В последних четырех столбцах указаны номера образцов на I, II, III и IV стадиях развития соответственно. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

Рисунок 9: Количество темных биомаркеров и традиционных биомаркеров в 26 видах рака. На горизонтальной оси перечислены 26 типов рака. Вертикальная ось показывает количество темных биомаркеров и традиционных биомаркеров для этих типов рака. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.
Дополнительный файл кодирования 1: HealthModel-mqTrans-v1-00.tar Пожалуйста, нажмите здесь, чтобы загрузить этот файл.