$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Рак молочной железы остается наиболее часто диагностируемым раком и второй по значимости причиной смерти от рака среди женщин во всем мире1. Только в Соединенных Штатах на его долю приходится почти 30% всех новых злокачественных новообразований у женщин, при этом ежегодно диагностируется более 280 000 новыхслучаев2. Несмотря на терапевтические достижения, особенно в отношении HER2-положительных и гормонально-рецептор-положительных подтипов, устойчивость к лечению и рецидивы остаются критическими проблемами, особенно для агрессивных подтипов, таких как трижды негативный рак молочной железы (ТНРМЖ), которым не хватает таргетнойтерапии. Это подчеркивает настоятельную необходимость в точном поиске лекарств для определения эффективных терапевтических агентов и комбинаций, адаптированных к индивидуальным молекулярным профилям. Разработка лекарств, традиционно основанная на экспериментальных методах и методах проб и ошибок, значительно ускорилась благодаряинтеграции методов машинного обучения (ML). ML позволяет моделировать сложные, нелинейные отношения между многомерными биомедицинскими данными и может помочь в идентификации мишени, открытии биомаркеров, прогнозировании чувствительности к лекарственным препаратам и разработке комбинированной терапии 7,8. Тем не менее, практическое развертывание ML-моделей в онкологии сталкивается с рядом препятствий, включая интерпретируемость моделей, воспроизводимость, переобучение на разреженных наборах данных и генерализацию по подтипам рака 9,10,11.
Чтобы преодолеть эти ограничения, недавние исследования были сосредоточены на объединении глубокого обучения для извлечения признаков с ансамблевым обучением для надежного прогнозирования. В исследованиях, оценивающих несколько алгоритмов, такие модели, как искусственные нейронные сети (ИНС), достигли уровня точности до 93,2%, превзойдя традиционные классификаторы, такие как наивный Байес и деревья решений12. Кроме того, интегрированные методы интеллектуального анализа признаков позволили выявить ключевые гены-драйверы и молекулярные мишени с помощью баз данных, таких как GEO (Gene Expression Omnibus) и GSE45827, идентифицировав до 1700 дифференциально экспрессируемых генов, некоторые из которых демонстрируют известныелекарственные взаимодействия. Кроме того, новые исследования по перепрофилированию лекарств выявили потенциал неонкологических соединений, таких как кальцитриол, для снижения жизнеспособности клеток рака молочной железы более эффективно, чем стандартные методы лечения, такие как нератиниб, особенно в клеточных линиях HER2+14. Исследования сигнального пути Akt также показали перспективность в преодолении резистентности к трастузумабу, предполагая нацеливание на молекулярные пути в качестве альтернативы терапии, ориентированной на рецепторы15,16. Тем не менее, несмотря на эти достижения, систематическая и объяснимая структура, способная предсказывать непрерывные значения лекарственного ответа, ранжировать эффективные комбинации лекарств и визуализировать фармакологические сходства, остается недостаточно изученной в современной литературе. Многие модели либо основаны на классификации, либо не имеют трансляционной ясности, особенно при применении к реальным наборам данных по фармакогеномике.
Поиск лекарств и принятие решений могут быть улучшены с помощью машинного обучения (ML), которое предлагает инструменты для получения высококачественных данных. Использование машинного обучения может быть полезным на всех этапах разработки лекарств, включая валидацию мишеней, идентификацию биомаркеров и анализ клинических испытаний. Интерпретируемость и воспроизводимость результатов, сгенерированных с помощью машинного обучения, также являются препятствиями17. Снижение частоты отказов и ускорение процесса могут быть достигнуты путем решения этих проблем и повышения осведомленности о переменных валидации. Используя алгоритмы машинного обучения, исследователи оценили образцы биопсии на различных стадиях рака. Согласно полученным данным, точность тестов была высокой: ANN 93,2%, наивный алгоритм Байеса (NB) 90,4%, дерево решений (DT) 87,8% и RF 85,9%. В общей сложности 350 предсказанных генов и 164 дифференциально экспрессируемых гена были найдены путем объединения базы данных GEO Rakhshaninejad et al.18. В объединенном наборе данных алгоритм Binary Grey Wolf Optimization with Simulated Annealing Ensemble (BGWO_SA_Ens) обнаружил 1404 гена, в то время как в наборе данных GSE45827 — 1710. Было обнаружено около 35 превосходных генов, а также их роль в важных путях и взаимосвязь между превосходными генами и противораковыми препаратами. Чтобы найти гены-мишени из сигнального пути сверхэкспрессии рецептора эпидермального фактора роста (EGFR (EGFR) и связанных с ними членов семейства, были проведены исследования молекулярных сетей Nagaraj et al.19 Лекарство под названием кальцитриол, которое разрешено для лечения состояний, не связанных с раком, имеет сильное сродство связывания с каждым из четырех рецепторов. Согласно in vitro В исследованиях цитотоксичности кальцитриол снижал жизнеспособность клеток SK-BR-3 дозозависимым образом, что указывает на превосходную цитотоксичность и снижение пролиферации клеток рака молочной железы по сравнению с нератинибом. Активный и лекарственный сигнальный путь Akt был предложен Jernström et al.20 что две клеточные линии, нечувствительные к трастузумабу, реагируют на ингибитор Akt1/2 киназы. Вместо того, чтобы сосредотачиваться на амплификации или экспрессии HER2, исследование рекомендует нацеливаться на сигнальный путь Akt и учитывать молекулярные аспекты при принятии решений о лечении. Тридцать процентов новых злокачественных опухолей у женщин в США являются раком молочной железы, что делает его наиболее распространенным злокачественным заболеванием среди женщин. Цель компании Witt и Tollefsbol21 заключалась в том, чтобы разработать фундаментальный инструмент, который помог бы исследователям выбрать клеточную линию рака молочной железы для использования в экспериментах с ксенотрансплантатом, профилактике рака и эпигенетических открытиях, а также в других областях. Также рассматриваются дебаты о происхождении конкретных клеточных линий рака молочной железы и преимуществах использования ксенотрансплантата, полученного от пациента (PDX) в отличие от ксенотрансплантата, полученного из клеток (CDX). Использование методов прогнозирования лекарств для создания гипотез о новых лекарствах было рассмотрено в работе Gruener et al.22, с акцентом на трижды негативный рак молочной железы (ТНРМЖ). На основе данных транскриптома клеточной линии были построены модели ответа на лекарственные препараты с помощью машинного обучения, которые затем были применены к данным об опухолях пациентов. Полученные данные показали, что ингибитор Wee1 AZD-1775 оказывает преимущественное действие на ТНРМЖ и что мутации TP53 тесно связаны с его эффективностью. Чтобы предсказать неизвестные взаимодействия лекарств и мишеней в исследованиях рака молочной железы, Сонг и др.23 представляют подход, основанный на признаках, получивший название Pseudo Position-Specific Physicochemical Property-Derived Composition for Drug-Target Interaction Prediction (PsePDC-DTIs), в котором используются белковые последовательности, коэффициент глубокого канонического корреляционного анализа (DCCA) и молекулярный дескриптор отпечатка пальца. Этот метод прогнозирует DTI на четырех наборах данных золотого стандарта с помощью классификатора случайного леса и обрабатывает несбалансированные данные с помощью SMOTE. Кроме того, модель использует гены риска из полногеномных генетических исследований для изучения новых мишеней для терапии рака молочной железы. Превосходство и валидность модели демонстрируются десятью возможными ДТИ, которые она предлагает для терапии. От десяти до двадцати процентов случаев рака молочной железы являются тройным негативным раком молочной железы (ТНРМЖ). В настоящее время не существует таргетной терапии ТНРМЖ, несмотря на достижения в лечении HER2+ и гормональных рецепторов+24. Несмотря на то, что EGFR экспрессируется у большинства пациентов, в ранних исследованиях не было обнаружено какой-либо заметной активности. Будущие экспериментальные методы лечения ТНРМЖ основаны на последних результатах и клинических достижениях25.
Несмотря на растущую интеграцию машинного обучения в разработку лекарств, современным моделям часто не хватает интерпретируемости и воспроизводимости, что ограничивает их трансляционное применение. В то время как в предыдущих исследованиях изучалась точность классификации и добыча генов, лишь немногие систематически предсказывали непрерывную чувствительность к лекарствам (как LN_IC50) с использованием гибридных интерпретируемых моделей. Более того, сочетание методов уменьшения размерности с устойчивыми регрессорами остается недостаточно изученным в контексте лечения рака молочной железы. Данное исследование устраняет этот пробел путем внедрения и оценки стратегии двойного конвейера - XGBoost и Autoencoder-XGBoost - для высокоточного прогнозирования ответа на лекарственные препараты в сочетании с объяснимостью и инструментами картирования синергии для реального клинического применения.