Скрининг потенциальных диагностических биомаркеров келоидов с использованием алгоритма машинного обучения
В данное исследование было включено в общей сложности 283 гена, связанных с метаболизмом гема. Анализ дифференциальной экспрессии в наборе данных GSE44270 при сравнении тканей келоида и нормальной кожи позволил выявить 25 значимо дифференциально экспрессируемых генов (Рисунок 1A и Дополнительная таблица S3). Для дальнейшего скрининга биомаркеров, ассоциированных с заболеванием, с помощью регрессии LASSO было выявлено 9 генов-кандидатов (Рисунок 1B,C и Дополнительная таблица S3), в то время как алгоритм случайного леса (RF) отобрал 11 генов с высокой прогностической значимостью (Рисунок 1D и Дополнительная таблица S3). Пересечение результатов LASSO и RF было визуализировано с помощью диаграммы Венна, что позволило выявить шесть основных биомаркеров, а именно: FLVCR1, TMCC2, EIF2AK1, XK, ГПХи КЕЛ (Рисунок 1E и Дополнительная таблица S3). Анализ рабочей характеристики приемника (ROC-анализ) в когорте GSE44270 продемонстрировал благоприятные диагностические показатели для всех шести биомаркеров, при этом значения AUC составили 0,8016 для FLVCR1, 0,7063 для TMCC2, 0,7817 для EIF2AK1, 0,7460 для XK, 0,7500 для HPX, а для [значение/объект] — 0,7857 KEL (Рисунок 1F). На основании этих шести биомаркеров с помощью пакета rms в среде R была построена диагностическая номограмма для келоидов (Рисунок 1G).

Рисунок 1: Идентификация потенциальных генов, связанных с метаболизмом гема и ассоциированных с келоидами, с использованием алгоритмов машинного обучения. (A) Диаграмма размаха, иллюстрирующая дифференциальную экспрессию генов метаболизма гема в тканях келоида и нормальных тканях. (B,C) Логистический регрессионный анализ LASSO для скрининга потенциальных диагностических маркеров. (D) Потенциальные биомаркеры, выбранные алгоритмом RF. (E) Диаграмма Венна, показывающая пересекающиеся гены, идентифицированные двумя алгоритмами машинного обучения. (F) Анализ ROC-кривых для оценки диагностической эффективности потенциальных биомаркеров. (G) Номограмма для прогнозирования келоида на основе сигнатуры из шести генов. Сокращения: LASSO — метод наименьшего абсолютного сжатия и отбора; RF — случайный лес; ROC — рабочая характеристика приемника. Статистическая значимость: ns, P > 0.05; *, P < 0.05; **, P < 0.01; ***, P < 0.001; и ****, P < 0.0001. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Прогностическая эффективность диагностической номограммы была оценена как в обучающей когорте (GSE44270), так и в валидационной когорте (GSE7890). Модель продемонстрировала отличную диагностическую точность, достигнув значений AUC 0,984 (95% CI: 0,950–1,000) и 0,922 (95% CI: 0,806–1,000) соответственно (Рисунок 2A,D). Для дальнейшей оценки робастности и потенциального переобучения диагностической панели из шести генов был проведен дополнительный внутренний валидационный анализ в когорте обнаружения (GSE44270). Пятикратная перекрестная проверка показала стабильную дискриминационную способность во всех подмножествах со средним значением AUC 0,925, что указывает на сохранение моделью стабильной эффективности классификации, несмотря на вариации в обучающих выборках. Кроме того, бутстреп-валидация с 1 000 итерациями ресэмплинга дала среднее значение AUC 0,930 (95% CI: 0,794–1,000). После поправки на возможный оптимизм, вызванный ограниченным размером выборки, скорректированное значение AUC осталось равным 0,930, что свидетельствует об относительной стабильности диагностической эффективности панели из шести генов после внутренней валидации. Более того, анализ кривых принятия решений (DCA) показал, что номограмма обладает более высоким потенциальным чистым преимуществом по сравнению с альтернативными диагностическими стратегиями в диапазоне пороговых вероятностей, хотя эти результаты следует интерпретировать с осторожностью ввиду ограниченного размера выборки (Рисунок 2B,E). Кроме того, образцы келоидов имели значительно более высокие показатели риска, чем здоровый контроль, как в обучающей, так и в валидационной когортах (Рисунок 2C,F), что дополнительно подтверждает стабильность и надежность диагностической модели.

Рисунок 2: Валидация номограммы для прогнозирования келоидов. (A) ROC-кривая, оценивающая прогностическую эффективность номограммы в наборе данных GSE44270. (B) DCA, оценивающая клиническую полезность номограммы в GSE44270. (C) Распределение показателей риска при сравнении образцов с келоидами и здоровых образцов в GSE44270. (D) ROC-кривая, оценивающая прогностическую эффективность номограммы в независимом наборе данных GSE7890. (E) DCA, оценивающая клиническую полезность номограммы в GSE7890. (F) Распределение показателей риска при сравнении образцов с келоидами и здоровых образцов в GSE7890. Сокращения: ROC = рабочая характеристика приемника; DCA = анализ кривых принятия решений. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.
Диагностические биомаркеры связаны с иммунными характеристиками келоида
Для изучения взаимосвязи между шестью диагностическими биомаркерами и иммунным микроокружением был проведен корреляционный анализ для оценки ассоциаций между экспрессией биомаркеров и инфильтрацией иммунных клеток. Результаты показали, что все шесть биомаркеров значимо связаны с несколькими популяциями инфильтрующих иммунных клеток (Рисунок 3A). В частности, экспрессия FLVCR1 была отрицательно связана с Т-фолликулярными хелперными клетками (Рисунок 3B). TMCC2 продемонстрировал положительную корреляцию с натуральными киллерами и активированными дендритными клетками, в то время как наблюдалась отрицательная корреляция с незрелыми дендритными клетками и незрелыми B-клетками (Рисунок 3C–F). Кроме того, экспрессия EIF2AK1 была отрицательно связана с CD56dim натуральными киллерами (Рисунок 3G), а XK был отрицательно связан с эозинофилами (Рисунок 3H).

Рисунок 3Корреляция между генами-кандидатами, связанными с метаболизмом гема, и инфильтрацией иммунных клеток. (A) Тепловая карта, демонстрирующая корреляции между генами-кандидатами и популяциями иммунных клеток. Красным цветом обозначены положительные корреляции, синим — отрицательные. (B). Корреляция между FLVCR1 экспрессия и Т-фолликулярные хелперные клетки. (C-F) Корреляции между TMCC2 экспрессия и натуральные киллеры, активированные дендритные клетки, незрелые дендритные клетки и незрелые B-клетки соответственно. (G) Корреляция между EIF2AK1 экспрессия и CD56dim естественные киллеры. (H). Корреляция между XK экспрессия и эозинофилы. Сокращения: FLVCR1 = рецептор 1 подгруппы C вируса лейкоза кошек; TMCC2 = трансмембранный и спиральный домены 2; EIF2AK1 = эукариотическая киназа фактора инициации трансляции 2 альфа 1; CD56тусклый = CD56 dim (низкая экспрессия кластера дифференцировки 56). Нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Анализ данных транскриптома отдельных клеток
Для характеристики паттернов экспрессии выявленных диагностических биомаркеров в микроокружении келоида мы проанализировали набор данных секвенирования РНК отдельных клеток GSE163973. После контроля качества и интеграции данных для последующего анализа было отобрано 21 488 высококачественных клеток. Клетки с общим количеством уникальных молекулярных идентификаторов (UMI) менее 200 или более 6 000 были исключены; потенциальные дуплеты были выявлены и удалены с помощью пакета DoubletDetection. Были выбраны 2 000 генов с наибольшей вариабельностью экспрессии, после чего было проведено снижение размерности и визуализация с помощью метода Uniform Manifold Approximation and Projection (UMAP). Всего было идентифицировано 10 основных популяций клеток, включая эндотелиальные клетки, фибробласты, мышечные волокна, кератиноциты, иммунные клетки, лимфатические эндотелиальные клетки, железистые клетки, нейральные клетки, меланоциты и неклассифицированную популяцию клеток (Рисунок 4A,B). Профилирование экспрессии выявило отчетливые специфические для типов клеток паттерны распределения диагностических биомаркеров. FLVCR1 экспрессировался преимущественно в эндотелиальных клетках и меланоцитах, тогда как EIF2AK1 демонстрировал относительно высокую экспрессию в нейральных клетках, железистых клетках и фибробластах. HPX был преимущественно обогащен в меланоцитах, в то время как KEL проявлял преимущественную экспрессию в железистых клетках (Рисунок 4C,D).

Рисунок 4: Распределение диагностических биомаркеров, связанных с метаболизмом гема, в одноклеточном транскриптоме келоида. (A) График UMAP, демонстрирующий 21 клеточный кластер, включающий 21 488 клеток из образцов келоида. (B) Аннотации типов клеток на основе данных, представленных в оригинальном исследовании. (C) Feature-графики, показывающие экспрессию диагностических биомаркеров, связанных с метаболизмом гема, в различных типах клеток. (D) Пузырьковая диаграмма, демонстрирующая средние уровни экспрессии и процент клеток, экспрессирующих диагностические биомаркеры метаболизма гема, в различных типах клеток. Сокращение: UMAP = равномерная аппроксимация и проекция многообразия. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Идентификация и анализ сети взаимодействий потенциальных диагностических биомаркеров
Для изучения регуляторных механизмов, лежащих в основе потенциальных диагностических биомаркеров, была построена регуляторная сеть miRNA–mRNA. Для повышения надежности прогнозируемых взаимодействий были выявлены перекрывающиеся miRNA, нацеленные на потенциальные биомаркеры. В общей сложности было получено 282 miRNA, взаимодействующих с шестью диагностическими биомаркерами; resulting регуляторная сеть представлена на Рисунке 5. Примечательно, что hsa-miR-34a-5p, hsa-let-7a-5p, hsa-let-7d-5p, hsa-let-7e-5p и hsa-miR-26b-5p, по прогнозам, одновременно регулируют все шесть потенциальных биомаркеров.

Рисунок 5: Регуляторная сеть миРНК для диагностических биомаркеров, связанных с метаболизмом гема. Сеть иллюстрирует регуляторные связи между шестью генами-биомаркерами диагностики (FLVCR1, HPX, TMCC2, KEL, XK и EIF2AK1) и соответствующими им миРНК. Узлы генов представляют диагностические биомаркеры, тогда как окружающие узлы представляют миРНК. Ребра указывают на экспериментально подтвержденные взаимодействия между миРНК и мРНК. Сокращения: FLVCR1 = рецептор 1 подгруппы С вируса лейкоза кошек; HPX = гемопексин; TMCC2 = трансмембранные и спиральные домены 2; KEL = металлоэндопептидаза Келл; XK = сцепленная с X-хромосомой группа крови Kx; EIF2AK1 = эукариотическая киназа 1 фактора инициации трансляции 2 альфа; miRNA = микроРНК; mRNA = матричная РНК. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Экспериментальное подтверждение экспрессии FLVCR1 и молекулярный докинг потенциальных терапевтических соединений
Чтобы подтвердить биоинформационные результаты и функциональную значимость выявленного узлового гена, мы экспериментально оценили экспрессию FLVCR1 в PKF и NHDF. Анализы методом qRT-PCR и вестерн-блоттинга последовательно показали, что экспрессия FLVCR1 была значительно повышена в фибробластах келоидов по сравнению с нормальным контролем (Рисунок 6A–C, Дополнительный рисунок S1 и Дополнительная таблица S4). Столь высокая клеточная экспрессия подтверждает потенциальную роль нарушений метаболизма гема, связанных с FLVCR1, в патогенезе келоидов.
Учитывая потенциальную роль FLVCR1 в иммунных изменениях, связанных с метаболизмом гема, далее мы стремились идентифицировать потенциальные терапевтические соединения, которые могли бы напрямую воздействовать на FLVCR1 для прерывания этой патогенной оси. Высокопроизводительный виртуальный скрининг был проведен с использованием библиотеки соединений традиционной китайской медицины (TCM) и подготовленной структуры белка. Для дальнейшей оценки были выбраны 20 соединений с наиболее благоприятными показателями докинга (Дополнительная таблица S5). В целом, более низкая энергия связывания указывает на более сильное сродство, а энергия докинга ниже −5 kcal/mol считается признаком стабильных взаимодействий лиганд–белок. Среди проскринированных соединений (+)-галлокатехин, (−)-эпикатехин, (−)-галлокатехин и цианидин (хлорид) продемонстрировали благоприятное сродство к FLVCR1. Примечательно, что (+)-галлокатехин показал самое сильное взаимодействие с FLVCR1, образуя четыре водородные связи с GLU214, ASN245, GLN246 и GLN471, что указывает на стабильный режим связывания лиганда с белком (Рисунок 6D–G). Эти результаты позволяют рассматривать (+)-галлокатехин как перспективного кандидата для механистического терапевтического вмешательства, направленного на FLVCR1.

Рисунок 6: Экспериментальное подтверждение экспрессии FLVCR1 и молекулярный докинг потенциальных соединений, воздействующих на FLVCR1. (A) Репрезентативные изображения вестерн-блоттинга, демонстрирующие экспрессию белка FLVCR1 в группе CON и в келоиде. GAPDH служил контролем нагрузки. (B) Количественное определение уровней белка FLVCR1, нормализованных по GAPDH. (C) Относительные уровни экспрессии мРНК FLVCR1 в фибробластах групп CON и келоида, определенные методом qRT-PCR. GAPDH использовался в качестве внутреннего референса. (D–G) Трехмерные представления предсказанных режимов связывания между FLVCR1 и выбранными низкомолекулярными соединениями: (D) (+)-Gallocatechin. (E) (-)-Epicatechin. (F) (-)-Gallocatechin. (G) Cyanidin (Chloride). Сокращения: FLVCR1 = рецептор 1 подгруппы C вируса лейкоза кошек; CON, контроль; GAPDH, глицеральдегид-3-фосфатдегидрогеназа; qRT-PCR, количественная полимеразная цепная реакция с обратной транскрипцией; SD, стандартное отклонение. Данные представлены как среднее значение ± SD. Статистическая значимость: ns, P > 0.05; *, P < 0.05; **, P < 0.01; ***, P < 0.001; и ****, P < 0.0001. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Подтверждение стабильности комплекса FLVCR1–(+)-галлокатехин с помощью моделирования молекулярной динамики
Для проверки достоверности предсказанного режима связывания лиганда с белком было проведено моделирование молекулярной динамики (МД) для комплекса FLVCR1–(+)-галлокатехин. Анализ был сосредоточен на том, сохранял ли комплекс структурную стабильность с течением времени и изменило ли связывание лиганда конформационное поведение белка, с использованием RMSD, RMSF, радиуса гирации (Rg), SASA, анализа водородных связей и расчетов MM/GBSA. Анализ RMSD (Рисунок 7A) показал, что как апо-белок, так и комплекс с лигандом претерпевали начальные флуктуации в течение первых 20 ns, после чего наступила постепенная стабилизация, что указывает на достижение системами равновесия в ходе симуляции. После уравновешивания значение RMSD комплекса FLVCR1–(+)-галлокатехин оставалось ниже 0.2 nm, что говорит о том, что связывание лиганда способствовало поддержанию структурной стабильности FLVCR1. Анализ RMSF (Рисунок 7B) продемонстрировал, что большинство остатков проявляли ограниченные флуктуации на протяжении всего моделирования, что указывает на сохранение общей целостности белка, в то время как несколько гибких областей могут представлять собой петли, участвующие в размещении лиганда. Кроме того, стабильные профили Rg и SASA (Рисунок 7C,D) показали, что комплекс сохранял компактную конформацию без явного структурного расширения или изменений в доступности растворителю. Анализ водородных связей (Рисунок 7E) выявил, что комплекс FLVCR1–(+)-галлокатехин поддерживал устойчивые межмолекулярные взаимодействия с образованием примерно 3–4 водородных связей в ходе симуляции, что подтверждает стабильность ассоциации лиганда с белком. Анализ MM/GBSA дополнительно показал, что комплекс FLVCR1–(+)-галлокатехин характеризуется благоприятной свободной энергией связывания (ΔGtotal = −34.87 ± 4.13 kcal/mol) (Дополнительная таблица S6). Анализ разложения энергии показал, что ван-дер-ваальсовы взаимодействия (ΔVDWAALS = −46.34 ± 2.16 kcal/mol) и электростатические взаимодействия (ΔEelec = −14.09 ± 3.45 kcal/mol) были основными благоприятными факторами связывания, несмотря на неблагоприятный вклад энергии полярной сольватации (ΔGsolvation = 25.55 ± 0.74 kcal/mol) (Дополнительная таблица S6). В совокупности эти результаты МД-моделирования продемонстрировали, что (+)-галлокатехин образует стабильный комплекс с FLVCR1, и дополнительно подтвердили достоверность режима связывания, предсказанного методом докинга.

Рисунок 7: Анализ молекулярно-динамического моделирования комплекса FLVCR1–(+)-Gallocatechin. (A) Профили RMSD апо-формы FLVCR1 и комплекса FLVCR1–(+)-Gallocatechin в ходе 100 ns молекулярно-динамического моделирования. (B) Профиль RMSF, демонстрирующий флуктуации остатков FLVCR1 во время моделирования. (C) Профиль SASA, показывающий изменения площади доступной растворителю поверхности комплекса FLVCR1–(+)-Gallocatechin. (D) Профиль Rg, оценивающий компактность комплекса FLVCR1–(+)-Gallocatechin во время моделирования. (E) Анализ водородных связей, демонстрирующий динамические межмолекулярные взаимодействия между FLVCR1 и (+)-Gallocatechin на протяжении всего моделирования. Сокращения: FLVCR1 = рецептор 1 подгруппы C вируса лейкоза кошек; RMSD = среднеквадратичное отклонение; RMSF = среднеквадратичная флуктуация; SASA = площадь доступной растворителю поверхности; Rg = радиус инерции. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Доступность данных:
Общедоступные наборы транскриптомных данных, проанализированные в данном исследовании, доступны в базе данных Gene Expression Omnibus (GEO) под номерами доступа GSE44270, GSE7890 и GSE163973. Исходные данные, полученные в ходе данного исследования и легшие в основу экспериментальной валидации, включая результаты qRT-PCR, оригинальные изображения вестерн-блоттинга и данные количественного анализа вестерн-блоттинга, представлены в Дополнительном рисунке S1, Дополнительной таблице S1, Дополнительной таблице S2, Дополнительной таблице S3 и Дополнительной таблице S4. Результаты молекулярного докинга и данные о свободной энергии связывания MM/GBSA также представлены в Дополнительной таблице S5 и Дополнительной таблице S6.
Дополнительный рисунок S1: Исходные данные вестерн-блоттинга.Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица S1: Гены, связанные с метаболизмом гема.Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица S2: Последовательности праймеров выбранных генов. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица S3: Методы машинного обучения для идентификации потенциальных диагностических биомаркеров при келоидах. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица S4: Исходные данные, подтверждающие экспериментальную валидацию экспрессии FLVCR1. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица S5: 20 основных соединений-кандидатов, выявленных методом молекулярного докинга с FLVCR1.Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица S6: Анализ свободной энергии связывания MM/GBSA для комплекса FLVCR1–(+)-галлоктехин.Пожалуйста, нажмите здесь, чтобы скачать этот файл.