$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Этот протокол описывает вычислительный метод определения возможных биомаркеров повреждения печени, вызванного ацетаминофеном, с использованием сетевой токсикологии, транскриптомики, машинного обучения и молекулярного стыкинга (рисунок 1). Протокол предназначен для исследователей, имеющих доступ к инструментам биоинформатики, транскриптомным наборам данных и программному обеспечению для молекулярного докирования.
Процедура
Шаг 1: Идентификация мишеней с парацетаминофена
Получите представление SMILES о ацетаминофене (APAP) на сайте PubChem. Используйте онлайн-платформы (ChEMBL, SwissTargetPrediction, STITCH, SEA) для прогнозирования потенциальных молекулярных целей APAP. Интегрировать и дедупликацией прогнозируемых целей создать список из 140 целей APAP с высокой уверенностью.
Шаг 2: Определение целей гепатотоксичности
Получите гены, связанные с гепатотоксичностью, из базы данных GeneCards. Составьте и дедупликация списка, чтобы получить неизбыточный набор из 657 генов, связанных с гепатотоксичностью. Определите перекрывающиеся гены между мишеньями APAP и генами, связанными с гепатотоксичностью, с помощью диаграммы Венна.
Шаг 3: Транскриптомическая предобработка данных
Скачайте GSE74000 набор данных с GEO. Предварительно обработайте исходные данные экспрессии с помощью DESeq2: удалите гены с низкой экспрессией, нормализуйте с помощью факторов размера и примените трансформацию стабилизации дисперсии (VST). Провести дифференциальный анализ экспрессии с использованием Limma и DESeq2 с порогами скорректированного p-значения < 0,05 и |log2FC| > 1.
Шаг 4: Функциональный анализ обогащения
Загрузка перекрывающихся генов в STRING для анализа онтологии генов (GO), пути KEGG, экспрессии тканей и корреляции заболеваний. Визуализируйте результаты функционального обогащения с помощью пузырьковых графиков и тепловых карт.
Шаг 5: Машинное обучение для выбора признаков гена
Примените классификатор случайного леса (n_estimators=500, max_depth=10) для приоритизации признаков генов из перекрывающихся APAP и гепатотоксичных генов. Оценивайте производительность модели с помощью ошибок Out-of-Bag (OOB) и показателей важности признаков. Выберите 20 лучших признаков для дальнейшего анализа.
Шаг 6: Молекулярная стыковка
Получить структуру APAP (CID 1983) из PubChem и белковые рецепторы (ESR1: PDB ID 1SJ0, PNP: PDB ID 1V2H) из PDB. Подготовьте файлы лигандов и рецепторов: конвертируйте в формат PDB, добавляйте полярные водороды, назначайте заряды и сохраняйте как PDBQT-файлы. Определите стыковочную сетку в AutoDock Tools, покрывающую активный участок белка. Проведите молекулярное стыковение с помощью AutoDock Vina с исчерпывающей точностью 8 и проанализируйте аффинности и взаимодействия связывания. Визуализируйте результаты стыковки с помощью PyMOL для анализа конформаций связывания и взаимодействий ключей.
Шаг 7: Статистический анализ
Определить статистическую значимость с помощью t-тестов и скорректировать p-значения для множественных сравнений с помощью метода Бенджамини-Хохберга31. Визуализируйте статистически значимые ассоциации с помощью тепловых карт и диаграмм рассеяния.
Материалы и методы
Идентификация мишеней с парацетаминофена
Для выявления потенциальных молекулярных мишень APAP мы сначала получили его представление SMILES из базы данных PubChem. Затем мы использовали несколько онлайн-платформ, включая Chemical European Molecular Biology Laboratory (ChemBL)32, Swiss TargetPrediction 33, Search Tool for the Interaction of Chemicals and Targets (STITCH)34 и подход Similarity Ensemble approach (SEA)35, чтобы предсказать возможные цели. После интеграции результатов этих инструментов мы выбрали набор целей с высокой уверенностью для APAP. Таблица 1 определяет ключевые категории генов, используемые в этом исследовании, проясняя их роль в анализе данных и биологической интерпретации. Постоянное использование этих терминов обеспечивает чёткое сообщение о наших результатах.
Выявление гепатотоксичных целей
Потенциальные гены, связанные с гепатотоксичностью, были извлечены из базы данных GeneCards. Все выявленные гены были скомпилированы, дубликаты удалены, а для дальнейших анализов был составлен неизбыточный список. Набор данных GSE74000 был загружен из репозитория GEO 15 марта 2024 года. Исходные экспрессионные данные были обработаны и нормализованы с помощью лимма-пакета (квантильная нормализация). Дифференциальный экспрессионный анализ проводился с использованием линейного моделирования с эмпирическим байесевым усадкой. Гены, соответствующие скорректированному p-значению < 0,05 (Бенджамини-Хохберг FDR) и |log₂FC| > 1 считались значимыми. Визуализация DEG проводилась с использованием вулканических графиков и тепловых карт, сгенерированных с помощью ggplot2.
Предварительная обработка данных
Исходные данные подсчёта предварительно обрабатывались с помощью DESeq2. Гены с низкой экспрессией были удалены с использованием порога обнаружения CPM >1 как минимум в 70% образцов. Нормализация размера библиотеки проводилась с использованием коэффициентов размера DESeq2, как определено в уравнении (1):
(1)
Где медианный коэффициент размера соотношения обозначается какs j. Для стабилизации средне-дисперсионных отношений в уравнении (2) использовалось преобразование, стабилизирующее дисперсию (VST):
(2)
DEGs были идентифицированы с помощью теста Вальда с коррекцией Бенджамини-Хохберга, считая гены значимыми, если использовать их в уравнении (3):
(3)
Множество DEG, полученное из DESeq2, было определено как уравнение (4):
(4)
Этот набор (X) использовался в стратегии консенсуса вместе с Limma Trend (Y) и Limma Voom (Z).
Строительство сети PPI
Диаграммы Венна использовались для выявления общих генов между APAP и гепатотоксичными целями. Перекрывающиеся гены затем загружались в базу данных Search Tool for the Retrieval of Interacting Genes/Proteins (STRING) для создания сетей PPI.
Многомерный функциональный анализ обогащения
Сначала мы провели генную онтологию (GO), Киотскую энциклопедию генов и геномов (KEGG), экспрессию тканей и функциональные анализы перекрывающихся генов APAP и гепатотоксичности, связанные с заболеваниями, используя сайт STRING. Далее мы провели анализ обогащения дифференциальных генов на гепатотоксичность с помощью GO, KEGG и Gene Set Enrichment Analysis (GSEA) (REACTOME) с помощью Sendo Academic Tools.
Анализ случайных лесов
Мы применили машинное обучение для выявления 20 основных признаков из перекрывающихся генов APAP и гепатотоксичности в данных транскриптома гепатотоксичности, индуцированной APAP. Был реализован классификатор Random Forest с 500 деревьями (n_estimators=500), максимальной глубиной дерева 10 (max_depth=10), минимум 2 образцами, необходимыми для разделения узла (min_samples_split=2), и критерием примеси Джини (критерий='джини')36. Производительность модели оценивалась с помощью ошибки Out-of-Bag (OOB), где значение, близкое к 0, указывает на более высокую предсказательную точность. Оценки важности признаков были рассчитаны и визуализированы на основе анализа случайного леса для ранжирования вклада каждого гена, как в уравнении (5).
(5)
N — общее количество выборок, yi — 1(·) — индикаторная функция, 1 — если условие верно, и 0 — в противном случае;
была предсказанной меткой выборки III, используя только деревья, где III не был включён в обучение.
Дифференциальная экспрессия охарактеризованных генов
Различия экспрессии признаков генов в транскриптомных данных визуализировались с помощью скрипичных графиков. Биомаркеры, показывающие статистически значимые различия, были выявлены как потенциальные новые биомаркеры гепатотоксичности, индуцированной APAP, для дальнейших исследований.
Молекулярная стыковка
Малые молекулярные соединения (CID 1983) были извлечены из базы данных PubChem, а белковые рецепторы ESR1 и PNP (PDB IDs 1SJ0 и 1V2H) были скачаны из Protein Data Bank. Структуры лигандов были преобразованы в формат PDB с помощью OpenBabel и предварительно обработаны в AutoDock Tools путём добавления полярных водородов, назначения зарядов Гастайгера, определения вращающихся связей и сохранения в формате PDBQT. Белковые рецепторы были подготовлены с помощью PyMOL путём удаления молекул воды и сокристаллизованных лигандов, затем добавления полярных водородов и назначения зарядов Коллмана с помощью AutoDock Tools, а затем сохранены в виде PDBQT-файлов.
В молекулярном стыковке программное обеспечение AutoDock использовалось для определения стыковочной сетки, покрывающей активный участокбелка 37. Сетка была центрирована по координатам (x = XX·XX, y = YY· YY,z = ZZ· ZZ) с размерами 40 × 40 × 40 Å и сетчатыми интервалами 0,375 Å, обеспечивая полное покрытие кармана для крепления. AutoDock Vina использовался для расчёта режимов связывания лиганд-белков и аффинности связывания, параметр исчерпывавости установлен на 8, и для каждого лиганда были сгенерированы девять верхних поз связывания.
Валидация протокола стыковки проводилась путём повторного стыковки ко-кристаллизованного лиганда в активный участок, что дало значение RMSD < 2,0 Å, подтверждая надёжность процедуры стыковки. Результаты стыковки визуализировались с помощью PyMOL для анализа конформаций связывания и ключевых взаимодействий, включая водородные связывания.
Симуляции стыковки предсказали, что соединение X вписывается в участок связывания белка Y, образуя потенциальные водородные связи и гидрофобные контакты, с предполагаемой энергией связи -8,5 ккал/моль.
Устранение неполадок и возможные модификации
Для повышения надёжности и воспроизводимости предлагаемого рабочего процесса следует отметить несколько аспектов устранения неполадок и возможных изменений. Если выявляется неожиданно низкое количество дифференциально экспрессированных генов (DEG), пользователям рекомендуется проверить процедуру нормализации, подтвердить точную групповую маркировку и рассмотреть возможность корректировки изменения |log2 fold| порога при сохранении соответствующего контроля частоты ложного обнаружения (FDR). Напротив, если получено чрезмерное количество DEG, применение более строгих порогов FDR или фильтрация генов с низкой дисперсией перед анализом дифференциальной экспрессии может повысить специфичность.
Пакетные эффекты могут влиять на паттерны кластеризации в исследовательских анализах, таких как анализ главных компонентов (PCA). Если образцы кластерируются преимущественно по пакетному состоянию, а не по биологическим состояниям, следует применять методы пакетной коррекции (например, эмпирические методы Байеса, такие как ComBat), а метаданные выборок тщательно переоценивать для обеспечения согласованности.
Для выбора признаков на основе случайного леса высокий уровень ошибок Out-of-Bag (OOB) или нестабильные рейтинги признаков могут указывать на неоптимальную конфигурацию модели. В таких случаях увеличение количества деревьев, настройка параметра mtry или повторные запуски моделей с консенсусным выбором признаков могут повысить стабильность модели и прогнозную надёжность. Кроме того, для дальнейшей оценки устойчивости модели могут применяться стратегии перекрёстной валидации.
Для повышения надёжности пользователи могут по желанию повторить анализ с использованием альтернативных порогов DEG или параметров машинного обучения и сравнить согласованность выявленных признаков. Такие анализы чувствительности помогают гарантировать, что ключевые результаты не обусловлены конкретными параметрами, и поддерживают воспроизводимость рабочего процесса на аналогичных транскриптомных наборах данных.
Статистические анализы
Статистическая значимость определялась с помощью t-теста, при этом p-значения были представлены для сравнения. Статистические корреляции между уровнем экспрессии генов и фенотипами, связанными с гепатотоксичностью, оценивались с помощью коэффициентов корреляции Пирсона и Спирмана, в зависимости от нормальности данных. P-значения были скорректированы для множественных сравнений с помощью метода Бенджамини-Хохберга. Значимые связи были визуализированы с помощью тепловых карт и диаграмм рассеяния, что обеспечивало надёжную оценку транскриптомических связей.