Методическая статья

Оптимизация поиска лекарств для лечения рака молочной железы на основе данных с использованием интерпретируемых моделей машинного обучения

DOI:

10.3791/68705

12 сентября 2025 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Этот протокол представляет собой конвейер машинного обучения с использованием XGBoost и SHAP для прогнозирования чувствительности к лекарствам при раке молочной железы. Рабочий процесс включает в себя предварительную обработку данных, гибридное моделирование, интерпретацию на основе SHAP, синергетическую оценку и кластеризацию PCA для идентификации сильнодействующих препаратов и понимания ключевых биологических факторов, влияющих на терапевтический ответ.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Рак молочной железы остается одним из наиболее распространенных злокачественных новообразований во всем мире, что создает значительные терапевтические проблемы из-за гетерогенности опухоли и лекарственной устойчивости. В этом исследовании представлен воспроизводимый, основанный на данных протокол машинного обучения для прогнозирования чувствительности к лекарствам в клеточных линиях рака молочной железы с двойной целью идентификации мощных одиночных агентов и синергетических комбинаций лекарств. С использованием курируемых наборов данных из Genomics of Drug Sensitivity in Cancer (GDSC) были реализованы два прогностических подхода: автономный регрессор XGBoost и гибридный конвейер Autoencoder-XGBoost. Предварительная обработка включала кодирование меток, одногорячее кодирование, стандартизацию Z-оценки, условный расчет пропущенных значений и уменьшение размерности с помощью PCA. Оценка модели показала, что XGBoost достиг превосходной производительности (MSE = 1,3789, R2 = 0,8145) по сравнению с гибридной моделью (MSE = 4,0322, R2 = 0,4577). Интерпретируемость была рассмотрена с помощью SHapley Additive exPlanations (SHAP), который определил TARGET_PATHWAY, DRUG_ID, TARGET и CELL_LINE_NAME в качестве ключевых прогностических признаков, согласующихся с установленными фармакологическими механизмами. Прогнозируемые оценки синергии, полученные в результате объединения выходных данных модели с данными DrugComb и SynergyDB, выявили перспективные пары препаратов, такие как Бортезомиб + Ромидепсин и Паклитаксел + Бортезомиб. Эти результаты были дополнительно подкреплены фармакологической кластеризацией на основе PCA, выявившей биологически значимые группировки препаратов со схожими механизмами действия. Предлагаемый протокол обеспечивает прозрачную и адаптируемую основу для прецизионных онкологических исследований, обеспечивая как точность прогнозирования, так и биологическую интерпретируемость. Благодаря интеграции тщательной предварительной обработки, валидации модели, объяснимости и анализа синергии лекарств, этот рабочий процесс предлагает масштабируемую основу для трансляционного поиска лекарств и их повторного использования в лечении рака молочной железы.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Рак молочной железы остается наиболее часто диагностируемым раком и второй по значимости причиной смерти от рака среди женщин во всем мире1. Только в Соединенных Штатах на его долю приходится почти 30% всех новых злокачественных новообразований у женщин, при этом ежегодно диагностируется более 280 000 новыхслучаев2. Несмотря на терапевтические достижения, особенно в отношении HER2-положительных и гормонально-рецептор-положительных подтипов, устойчивость к лечению и рецидивы остаются критическими проблемами, особенно для агрессивных подтипов, таких как трижды негативный рак молочной железы (ТНРМЖ), которым не хватает таргетнойтерапии. Это подчеркивает настоятельную необходимость в точном поиске лекарств для определения эффективных терапевтических агентов и комбинаций, адаптированных к индивидуальным молекулярным профилям. Разработка лекарств, традиционно основанная на экспериментальных методах и методах проб и ошибок, значительно ускорилась благодаряинтеграции методов машинного обучения (ML). ML позволяет моделировать сложные, нелинейные отношения между многомерными биомедицинскими данными и может помочь в идентификации мишени, открытии биомаркеров, прогнозировании чувствительности к лекарственным препаратам и разработке комбинированной терапии 7,8. Тем не менее, практическое развертывание ML-моделей в онкологии сталкивается с рядом препятствий, включая интерпретируемость моделей, воспроизводимость, переобучение на разреженных наборах данных и генерализацию по подтипам рака 9,10,11.

Чтобы преодолеть эти ограничения, недавние исследования были сосредоточены на объединении глубокого обучения для извлечения признаков с ансамблевым обучением для надежного прогнозирования. В исследованиях, оценивающих несколько алгоритмов, такие модели, как искусственные нейронные сети (ИНС), достигли уровня точности до 93,2%, превзойдя традиционные классификаторы, такие как наивный Байес и деревья решений12. Кроме того, интегрированные методы интеллектуального анализа признаков позволили выявить ключевые гены-драйверы и молекулярные мишени с помощью баз данных, таких как GEO (Gene Expression Omnibus) и GSE45827, идентифицировав до 1700 дифференциально экспрессируемых генов, некоторые из которых демонстрируют известныелекарственные взаимодействия. Кроме того, новые исследования по перепрофилированию лекарств выявили потенциал неонкологических соединений, таких как кальцитриол, для снижения жизнеспособности клеток рака молочной железы более эффективно, чем стандартные методы лечения, такие как нератиниб, особенно в клеточных линиях HER2+14. Исследования сигнального пути Akt также показали перспективность в преодолении резистентности к трастузумабу, предполагая нацеливание на молекулярные пути в качестве альтернативы терапии, ориентированной на рецепторы15,16. Тем не менее, несмотря на эти достижения, систематическая и объяснимая структура, способная предсказывать непрерывные значения лекарственного ответа, ранжировать эффективные комбинации лекарств и визуализировать фармакологические сходства, остается недостаточно изученной в современной литературе. Многие модели либо основаны на классификации, либо не имеют трансляционной ясности, особенно при применении к реальным наборам данных по фармакогеномике.

Поиск лекарств и принятие решений могут быть улучшены с помощью машинного обучения (ML), которое предлагает инструменты для получения высококачественных данных. Использование машинного обучения может быть полезным на всех этапах разработки лекарств, включая валидацию мишеней, идентификацию биомаркеров и анализ клинических испытаний. Интерпретируемость и воспроизводимость результатов, сгенерированных с помощью машинного обучения, также являются препятствиями17. Снижение частоты отказов и ускорение процесса могут быть достигнуты путем решения этих проблем и повышения осведомленности о переменных валидации. Используя алгоритмы машинного обучения, исследователи оценили образцы биопсии на различных стадиях рака. Согласно полученным данным, точность тестов была высокой: ANN 93,2%, наивный алгоритм Байеса (NB) 90,4%, дерево решений (DT) 87,8% и RF 85,9%. В общей сложности 350 предсказанных генов и 164 дифференциально экспрессируемых гена были найдены путем объединения базы данных GEO Rakhshaninejad et al.18. В объединенном наборе данных алгоритм Binary Grey Wolf Optimization with Simulated Annealing Ensemble (BGWO_SA_Ens) обнаружил 1404 гена, в то время как в наборе данных GSE45827 — 1710. Было обнаружено около 35 превосходных генов, а также их роль в важных путях и взаимосвязь между превосходными генами и противораковыми препаратами. Чтобы найти гены-мишени из сигнального пути сверхэкспрессии рецептора эпидермального фактора роста (EGFR (EGFR) и связанных с ними членов семейства, были проведены исследования молекулярных сетей Nagaraj et al.19 Лекарство под названием кальцитриол, которое разрешено для лечения состояний, не связанных с раком, имеет сильное сродство связывания с каждым из четырех рецепторов. Согласно in vitro В исследованиях цитотоксичности кальцитриол снижал жизнеспособность клеток SK-BR-3 дозозависимым образом, что указывает на превосходную цитотоксичность и снижение пролиферации клеток рака молочной железы по сравнению с нератинибом. Активный и лекарственный сигнальный путь Akt был предложен Jernström et al.20 что две клеточные линии, нечувствительные к трастузумабу, реагируют на ингибитор Akt1/2 киназы. Вместо того, чтобы сосредотачиваться на амплификации или экспрессии HER2, исследование рекомендует нацеливаться на сигнальный путь Akt и учитывать молекулярные аспекты при принятии решений о лечении. Тридцать процентов новых злокачественных опухолей у женщин в США являются раком молочной железы, что делает его наиболее распространенным злокачественным заболеванием среди женщин. Цель компании Witt и Tollefsbol21 заключалась в том, чтобы разработать фундаментальный инструмент, который помог бы исследователям выбрать клеточную линию рака молочной железы для использования в экспериментах с ксенотрансплантатом, профилактике рака и эпигенетических открытиях, а также в других областях. Также рассматриваются дебаты о происхождении конкретных клеточных линий рака молочной железы и преимуществах использования ксенотрансплантата, полученного от пациента (PDX) в отличие от ксенотрансплантата, полученного из клеток (CDX). Использование методов прогнозирования лекарств для создания гипотез о новых лекарствах было рассмотрено в работе Gruener et al.22, с акцентом на трижды негативный рак молочной железы (ТНРМЖ). На основе данных транскриптома клеточной линии были построены модели ответа на лекарственные препараты с помощью машинного обучения, которые затем были применены к данным об опухолях пациентов. Полученные данные показали, что ингибитор Wee1 AZD-1775 оказывает преимущественное действие на ТНРМЖ и что мутации TP53 тесно связаны с его эффективностью. Чтобы предсказать неизвестные взаимодействия лекарств и мишеней в исследованиях рака молочной железы, Сонг и др.23 представляют подход, основанный на признаках, получивший название Pseudo Position-Specific Physicochemical Property-Derived Composition for Drug-Target Interaction Prediction (PsePDC-DTIs), в котором используются белковые последовательности, коэффициент глубокого канонического корреляционного анализа (DCCA) и молекулярный дескриптор отпечатка пальца. Этот метод прогнозирует DTI на четырех наборах данных золотого стандарта с помощью классификатора случайного леса и обрабатывает несбалансированные данные с помощью SMOTE. Кроме того, модель использует гены риска из полногеномных генетических исследований для изучения новых мишеней для терапии рака молочной железы. Превосходство и валидность модели демонстрируются десятью возможными ДТИ, которые она предлагает для терапии. От десяти до двадцати процентов случаев рака молочной железы являются тройным негативным раком молочной железы (ТНРМЖ). В настоящее время не существует таргетной терапии ТНРМЖ, несмотря на достижения в лечении HER2+ и гормональных рецепторов+24. Несмотря на то, что EGFR экспрессируется у большинства пациентов, в ранних исследованиях не было обнаружено какой-либо заметной активности. Будущие экспериментальные методы лечения ТНРМЖ основаны на последних результатах и клинических достижениях25.

Несмотря на растущую интеграцию машинного обучения в разработку лекарств, современным моделям часто не хватает интерпретируемости и воспроизводимости, что ограничивает их трансляционное применение. В то время как в предыдущих исследованиях изучалась точность классификации и добыча генов, лишь немногие систематически предсказывали непрерывную чувствительность к лекарствам (как LN_IC50) с использованием гибридных интерпретируемых моделей. Более того, сочетание методов уменьшения размерности с устойчивыми регрессорами остается недостаточно изученным в контексте лечения рака молочной железы. Данное исследование устраняет этот пробел путем внедрения и оценки стратегии двойного конвейера - XGBoost и Autoencoder-XGBoost - для высокоточного прогнозирования ответа на лекарственные препараты в сочетании с объяснимостью и инструментами картирования синергии для реального клинического применения.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Получение набора данных

  1. Загрузите данные о чувствительности к лекарственным препаратам из GDSC (https://www.cancerrxgene.org/downloads/drug_data). Сводка по использованному набору данных представлена в таблице 1. Используются следующие файлы: gdsc_drug_data.csv (реакция на лекарственное средство), gdsc_expression_data.csv (экспрессия генов) и gdsc_cell_metadata.csv (информация о клеточной линии).
    На рисунке 1 приведен пример структуры набора данных, используемой в этом рабочем процессе.
  2. Отфильтруйте набор данных, чтобы включить в него только клеточные линии рака молочной железы с помощью Python (библиотека Pandas).
    1. Выберите записи, в которых столбец TCGA_DESC равен «Грудь».
    2. Извлекаем соответствующие значения CELL_LINE_NAME.
    3. Обратитесь к Дополнительному коду 1 (Дополнительный файл 1) для реализации.
      ПРИМЕЧАНИЕ: Ограничение набора данных клеточными линиями рака молочной железы обеспечивает обучение модели, специфичной для предметной области, и повышает биологическую валидность. Набор данных, использованный в этом исследовании, был получен из базы данных Genomics of Drug Sensitivity in Cancer (GDSC), а его ключевые характеристики представлены в таблице 2.

2. Предварительная обработка данных

  1. Конвейер предварительной обработки:
    1. Кодируйте категориальные переменные, такие как DRUG_ID, CELL_LINE_NAME и TARGET_PATHWAY, с помощью LabelEncoder для их преобразования в целочисленные форматы, подходящие для ввода XGBoost.
    2. Нормализуйте числовые признаки, включая данные экспрессии генов, изменения числа копий (CNA) и признаки метилирования, используя стандартизацию Z-оценки (StandardScaler) для обеспечения нулевой средней и единичной дисперсии.
    3. Удалите образцы с отсутствующими признаками более чем на 30%.
    4. Импутируйте оставшиеся отсутствующие значения, используя медиану каждого соответствующего столбца признаков с помощью SimpleImputer(strategy='median').
    5. Примените одногорячее кодирование к категориальным переменным (DRUG_ID и TARGET_PATHWAY) с помощью OneHotEncoder от scikit-learn.
    6. Выполняйте уменьшение размерности признаков экспрессии генов с помощью анализа главных компонент (PCA), чтобы уменьшить пространство признаков при сохранении дисперсии.
    7. Разделите окончательный очищенный набор данных на обучающий (80%) и тестовый (20%) наборы с использованием train_test_split из scikit-learn, сохраняя распределение пар лекарство-клетка.
      ПРИМЕЧАНИЕ: Подробное обоснование каждого шага предварительной обработки и результирующие размеры набора данных обсуждаются в разделе «Обсуждение».
  2. Работа с категориальными переменными
    1. Определите категориальные переменные (CELL_LINE_NAME, DRUG_NAME, TARGET_PATHWAY) с помощью Pandas.
    2. Примените кодирование меток к этим переменным с помощью LabelEncoder от scikit-learn.
    3. Реализуйте этот шаг программным способом, как показано в Дополнительном коде 2 (Дополнительный файл 1).
      ПРИМЕЧАНИЕ: Алгоритмы машинного обучения требуют числовых входных данных; Кодирование меток преобразует категориальные переменные в целочисленный формат с сохранением различий между классами.
  3. Стандартизация числовых признаков
    1. Определите числовые переменные по экспрессии генов, изменению числа копий (CNA) и особенностям метилирования.
    2. Примените StandardScaler для нормализации объектов до нулевого среднего и единичной дисперсии.
      ПРИМЕЧАНИЕ: Стандартизация гарантирует, что все числовые признаки вносят одинаковый вклад в модель, изменяя их масштаб таким образом, чтобы они имели нулевое среднее значение и единичную дисперсию. Это предотвращает доминирование функций с большими масштабами при обучении модели и улучшает сходимость алгоритмов оптимизации.
  4. Обработка пропущенных значений
    1. Обнаруживайте отсутствующие записи во всех функциях.
    2. Удаляйте записи, в которых отсутствовало более 30% данных.
    3. Условное исчисление оставшихся отсутствующих значений с помощью стратегии условного расчета медианы.
      ПРИМЕЧАНИЕ: Неполные данные могут привести к систематической ошибке и снижению надежности модели. Удаление сильно отсутствующих записей обеспечивает надежность данных, в то время как медианная импутация обеспечивает стабильный и устойчивый к выбросам метод сохранения пригодной для использования информации без введения строгих предположений о распределении.
  5. Разделение набора данных
    1. Используйте автоматизированный метод (например, train_test_split из sikit-learn) для разделения окончательного очищенного набора данных на обучающее и тестовое подмножества.
    2. Укажите случайное начальное значение (например, random_state=42) для обеспечения воспроизводимости.
    3. Выделите 80% данных для обучающего набора и 20% для тестового набора.
    4. Обратитесь к дополнительному коду 3 (Дополнительный файл 1) для полной реализации кода.
      ПРИМЕЧАНИЕ: Разделение данных на обучающие и тестовые подмножества позволяет объективно оценить обобщаемость модели.

3. Фреймворк моделирования

  1. Определение цели регрессии
    1. Сформулируйте задачу прогнозирования в виде регрессионной задачи для оценки натурального логарифма полумаксимальной ингибирующей концентрации (LN_IC50) для каждой пары лекарственная клетка.
    2. Выберите LN_IC50 в качестве целевой переменной, чтобы стабилизировать дисперсию и улучшить модель.
      ПРИМЕЧАНИЕ: Преобразование IC50 в LN_IC50 уменьшает асимметрию и повышает производительность модели.
  2. Обучение регрессора XGBoost (модель 1)
    1. Выберите XGBoost в качестве основной модели из-за его высокой производительности на структурированных фармакогеномных наборах данных и способности моделировать нелинейные взаимодействия признаков с регуляризацией для предотвращения переобучения.
    2. Программно инициализируйте модель с помощью класса XGBRegressor из библиотеки xgboost. Укажите настроенные гиперпараметры (скорость обучения, максимальную глубину, количество оценок и случайное начальное значение), выявленные с помощью перекрестной проверки.
    3. Обучите модель на обучающем подмножестве (X_train, y_train) с помощью метода fit().
    4. Создание прогнозов на тестовом подмножестве (X_test) с помощью метода predict().
    5. Оценивайте производительность с помощью среднеквадратичной ошибки (MSE) и оценки R² с помощью функций mean_squared_error и r2_score scikit-learn.
      ПРИМЕЧАНИЕ: Обратитесь к Дополнительному коду 4 (Дополнительный файл 1) для полной реализации.
  3. Рассмотрите альтернативные модели
    1. Оцените устойчивость метода опорного вектора (УВО) в условиях малой выборки и многомерных данных.
    2. Оцените гибрид автоэнкодера и XGBoost на предмет потенциального повышения производительности за счет глубокого извлечения скрытых признаков и нелинейного моделирования.
    3. Сравнивайте производительность моделей с помощью идентичных метрик оценки и перекрестной проверки.
      ПРИМЕЧАНИЕ: SVR был исключен из окончательных результатов из-за более низкой предиктивной точности по сравнению с XGBoost, в то время как гибрид Autoencoder-XGBoost был сохранен для сравнения подходов к глубокому и машинному обучению.
  4. Модель 1: Регрессор XGBoost
    1. Выберите XGBoost в качестве базовой модели из-за его высокой производительности при работе со структурированными биомедицинскими данными, его способности моделировать нелинейные взаимодействия элементов и встроенной регуляризации, которая снижает переобучение.
    2. Настройте модель XGBoost с гиперпараметрами learning_rate = 0.05, max_depth = 6 и n_estimators = 100.
    3. Оптимизируйте гиперпараметры с помощью поиска по сетке и проверяйте производительность с помощью 5-кратной перекрестной проверки.
    4. Обучите модель на подготовленном обучающем наборе данных (X_train, y_train).
    5. Оценивайте прогностическую производительность с помощью среднеквадратичной ошибки (MSE) и оценки R², вычисленной с помощью функций mean_squared_error и r2_score scikitlearn.
      ПРИМЕЧАНИЕ: Предыдущие исследования26 показали, что XGBoost неизменно превосходит модели глубокого обучения на табличных биомедицинских наборах данных с более низкими вычислительными затратами.
  5. Сборка гибридного автоэнкодера + модель XGBoost (модель 2)
    1. Разработка автоэнкодера для неконтролируемого уменьшения размерности
      ПРИМЕЧАНИЕ: Энкодер сжимает входные объекты в низкоразмерное латентное представление. Декодер восстанавливает входные данные, чтобы свести к минимуму ошибку восстановления.
    2. Обучите автоэнкодировщик на полной матрице функций для извлечения скрытых признаков.
    3. Передайте выходные данные энкодера (скрытые функции) в качестве входных данных регрессору XGBoost, как показано в дополнительном коде 5A (дополнительный файл 1).
    4. Обучите регрессор XGBoost на закодированном наборе функций с LN_IC50 в качестве целевой переменной, как показано в дополнительном коде 5B (дополнительный файл 1).
    5. Оценивайте производительность модели, используя те же метрики, что и модель 1, для прямого сравнения.
      ПРИМЕЧАНИЕ: Этот гибридный подход использует обучение на основе глубокого обучения и мощные возможности регрессии XGBoost, обеспечивая преимущество для многомерных биологических данных.
  6. Оценка модели
    1. Оцените обученную модель регрессии, спрогнозировав целевые значения с помощью метода predict() в тестовом наборе данных (X_test).
    2. Вычислите среднеквадратичную ошибку (MSE) для измерения среднеквадратичной разницы между прогнозируемыми и фактическими значениями LN_IC50 с помощью mean_squared_error(y_test, y_pred) от scikit-learn.
      Примечание: Вместе эти модели сочетают в себе интерпретируемость и точность, формируя надежную основу для прогнозирования чувствительности к лекарствам в исследованиях рака молочной железы27,28.
      figure-protocol-1
      где yi обозначает истинное LN_IC50 для i-й пары лекарство-клетка, figure-protocol-2 — соответствующее предсказанное значение, а n — общее число наблюдений. Для автоэнкодера потери при реконструкции задаются по формуле:
      figure-protocol-3
      где X — матрица входных признаков, E(·) — функция кодировщика, отображающая X на латентное представление, а D(·) — функция декодера, восстанавливающая X из латентного пространства.
    3. Вычислите оценку R2 , чтобы определить долю дисперсии в целевой переменной, объясняемой моделью, используя r2_score(y_test, y_pred) из scikit-learn.
    4. Запишите вычисленные значения MSE и R2 для отчетности. Вычисленные значения MSE и R² обобщены в таблице 3 , чтобы наглядно представить и напрямую сравнить производительность различных моделей.
    5. Интерпретируйте метрики оценки: более низкое значение MSE указывает на более высокую точность прогнозирования, а оценка R2 , близкая к 1, указывает на более сильную объяснительную силу и лучшую способность модели к обобщению.
  7. Объяснимость SHAP
    1. Установите и импортируйте библиотеку SHAP (import shap). Убедитесь, что версия 0.41.0 для воспроизводимости.
    2. Инициализируйте объясняющий модуль SHAP с помощью обученной модели XGBoost, следуя дополнительному коду 6 (дополнительный файл 1).
    3. Вычисление значений SHAP для тестового набора данных, чтобы получить оценки вклада функций.
    4. Создайте сводный график по важности глобальных признаков, чтобы визуализировать, какие признаки вносят наибольший вклад в прогнозы.
    5. Создайте индивидуальное пояснение прогноза для выбранной выборки с помощью каскадного графика SHAP.
    6. Интерпретируйте графики, чтобы определить ключевые особенности, влияющие на прогнозы. Как показано в таблице 4, критические характеристики включают TARGET_PATHWAY, DRUG_ID, CELL_LINE_NAME, белок TARGET и Screen Medium, что указывает на то, что лекарственно-специфические и клеточно-специфические свойства значительно влияют на прогнозирование лекарственного ответа.
      ПРИМЕЧАНИЕ: Значения SHAP были вычислены с помощью shap. TreeExplainer() для моделей XGBoost. Глобальная важность признаков визуализировалась с помощью shap.summary_plot(), а пояснения для каждого образца были сгенерированы с помощью shap.dependence_plot() и shap.waterfall_plot() (SHAP v0.41.0) Как показано в таблице 4, наиболее влиятельными признаками были TARGET_PATHWAY, DRUG_ID и CELL_LINE_NAME, что указывает на то, что как лекарственно-специфичные, так и клеточно-специфические свойства имеют решающее значение в определении лекарственного ответа. Дополнительными ключевыми факторами были белок TARGET и Screen Medium, что еще больше подчеркивает согласованность модели с факторами, относящимися к домену, в фармакогеномике рака.
  8. Синергия лекарств и кластеризация
    1. Скачать данные о синергии
      1. Скачать данные о синергии комбинаций препаратов из общедоступных репозиториев:
        DrugComb:https://drugcomb.fimm.fi
        SynergyDB: https://synergy.bioinformatics.nl
    2. Объедините данные о синергии с прогнозируемой реакцией.
      1. Используйте комбинации лекарственных препаратов и клеточных линий в качестве уникальных ключей для объединения загруженных показателей синергии (ZIP, Bliss, Loewe, HSA) с прогнозируемыми значениями реакции на лекарственные препараты (LN_IC50).
      2. Обеспечьте согласование идентификаторов лекарств и названий клеточных линий между наборами данных перед объединением.
    3. Вычисление оценок синергии на основе модели.
      1. Для каждой пары препаратов рассчитайте совокупную прогнозируемую эффективность, используя среднее значение отдельных прогнозируемых LN_IC50 модели:
        figure-protocol-4
        Где Scomb обозначает комбинированный прогнозируемый балл LN_IC50 для пары наркотиков, figure-protocol-5 является прогнозируемым LN_IC50 для препарата 1.
      2. Ранжируйте комбинации лекарств на основе показателей синергии.
      3. Определите лучшие комбинации (например, Бортезомиб + Ромидепсин, Винбластин + Дактиномицин), которые демонстрируют самые низкие показатели синергизма, что указывает на более высокую прогнозируемую эффективность.
        ПРИМЕЧАНИЕ: Более низкий показатель синергии отражает больший прогнозируемый терапевтический потенциал, что делает эти пары препаратов кандидатами на дальнейшую экспериментальную валидацию. Выполните действия, указанные в Дополнительном коде 7A и Дополнительном коде 7B (Дополнительный файл 1).
  9. Синергетическое ранжирование и кластеризация на основе PCA
    1. Ранжируйте пары лекарств по показателю синергии.
      1. Объедините показатели синергии (ZIP, Bliss, Loewe, HSA) с прогнозируемыми значениями LN_IC50, используя комбинации лекарственных препаратов и клеточных линий в качестве уникальных ключей.
      2. Рассчитайте показатели синергии для каждой пары лекарств, используя средние прогнозируемые значения LN_IC50:
      3. Ранжируйте пары лекарств на основе вычисленных баллов синергии.
      4. Определите пары препаратов с самыми низкими (наиболее отрицательными) показателями в качестве потенциальных синергических комбинаций (например, Бортезомиб + Ромидепсин, Винбластин + Дактиномицин).
    2. Проводят ПЦА на матрице ответа на лекарственное средство.
      1. Постройте матрицу ответа на лекарственные препараты с использованием прогнозируемых значений LN_IC50 с лекарствами в виде строк и линиями ячеек в качестве столбцов, следуя шагам, показанным в дополнительном коде 8 (дополнительный файл 1).
      2. Стандартизируйте матрицу с помощью нормализации zscore.
      3. Выполнение анализа главных компонент (PCA) с двумя главными компонентами (n_components = 2) для уменьшения размерности и захвата значительной дисперсии.
    3. Визуализация кластеров PCA
      1. Постройте двумерную проекцию PCA с помощью Matplotlib или Seaborn.
      2. Подтвердите, что препараты со схожими механизмами действия (например, доцетаксел и паклитаксел) кластеризуются вместе, подтверждая способность модели фиксировать биологически значимые отношения.
    4. Стабильность модели и баланс функций
      1. Фильтруйте редко встречающиеся категориальные переменные во время кодирования, чтобы избежать проблем с разреженностью.
      2. Настройте скорость обучения автоэнкодера и включите слои выпадения для предотвращения проблем со сходимостью.
      3. Ограничьте анализ SHAP 100 основными функциями, чтобы снизить нагрузку на память и обеспечить эффективность вычислений.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Это исследование было сосредоточено на оптимизации выбора лекарств и прогнозировании комбинаторной эффективности при раке молочной железы с использованием передовых моделей машинного обучения. Набор данных включал в себя тщательно отобранную и отфильтрованную панель клеточных линий рака молочной железы, метрики чувствительности к лекарствам (LN_IC50, AUC, Z-Score) и молекулярные дескрипторы, такие как CNA, метилирование, экспрессия генов, дескрипторы тканей и мишени лекарств. Основная цель состояла в том, чтобы предсказа...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом исследовании представлен интегрированный конвейер машинного обучения для адаптации к выбору препарата, прогнозирования синергетических комбинаций и выявления возможностей повторного использования препарата. Данные из базы данных GDSC и репозиториев синергии (например, SynergyDB, DrugComb) были интегрированы для создания всеобъемлющей панели взаимодействий лекарственных препаратов и клеточных линий, охватывающей молекулярные характеристики (например, экспрессию генов, изменения чис...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы заявляют об отсутствии конфликта интересов, связанного с данной работой. Мы подтверждаем, что технология большой языковой модели (LLM) (ChatGPT, разработанная OpenAI) использовалась в ограниченных масштабах на ранних этапах подготовки рукописи. В частности, ChatGPT использовался для генерации идей и предварительного мозгового штурма концептуальных рамок, которые впоследствии были доработаны, проверены и полностью переписаны авторами. Все основное научное содержание, анализ данных, интерпретация и окончательный вариант были выполнены исключительно авторами. Результаты работы ChatGPT были критически проверены на точность, согласованность и целостность перед включением в соответствии с принципами прозрачности и этики журнала. Все авторы рассмотрели и одобрили окончательную версию рукописи и подтверждают, что не существует финансовых, личных или профессиональных отношений, которые могли бы повлиять на содержание данной публикации.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы искренне признательны за институциональную поддержку, оказанную факультетом компьютерных наук Университета Христа, который способствовал предоставлению вычислительных ресурсов и академической среды, необходимых для проведения этого исследования. Мы также благодарны нашим коллегам и наставникам за совместное руководство и поддержку на протяжении всей этой работы.

ВКЛАД АВТОРА:
Дюти Банерджи задумал исследование, разработал методологию и курировал набор данных. Шиванесан Бала Кришнан и Камаль Упрети реализовали модели машинного обучения и выполнили вычислительный анализ. Сумег Шрикант Таревал (Sumegh Shrikant Tharewal) и Ума Шанкар (Uma Shankar) внесли свой вклад в предварительную обработку данных, проектирование признаков и проверку результатов. Правин Кширсагар провел анализ синергии и кластеризацию на основе PCA. Манодж Кумар помогал с обзором литературы, интерпретацией полученных результатов и составлением рукописей. Все авторы внесли свой вклад в доработку рукописи, утвердили окончательный вариант и соглашаются нести ответственность за все аспекты работы.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Автоэнкодер (модель глубокого обучения)TensorFlow (Google)https://www.tensorflow.orgУменьшение размерности и кодирование признаков для моделирования лекарственного ответа
БортезомибСеллек КемикалсС1013Препарат, используемый в синергетическом анализе
ДактиномицинСигма-ОлдричД1037Препарат, используемый в синергетическом анализе
ДоцетакселСигма-ОлдричД1080Препарат, используемый для валидации кластеризации на основе механизмов
Библиотека MatplotlibИндекс пакетов Python (PyPI)https://matplotlib.orgВизуализация данных и построение графиков в Python
Библиотека NumPyИндекс пакетов Python (PyPI)https://numpy.orgЧисленные вычисления и матричные операции
ПаклитакселСигма-ОлдричТ7191Препарат, используемый для валидации кластеризации на основе механизмов
Библиотека ПандасИндекс пакетов Python (PyPI)https://pandas.pydata.orgМанипулирование и обработка данных
Python 3.10Python Software Foundationhttps://www.python.orgОсновной язык программирования
РомидепсинСеллек КемикалсС3020Препарат, используемый в синергетическом анализе
Библиотека Scikit-learnИндекс пакетов Python (PyPI)https://scikit-learn.orgИнструменты моделирования и предварительной обработки машинного обучения
Библиотека СиборнИндекс пакетов Python (PyPI)https://seaborn.pydata.orgВизуализация данных и построение статистических графиков
Библиотека SHAPИндекс пакетов Python (PyPI)https://shap.readthedocs.ioОбъяснимая интерпретируемость моделей ИИ
Данные Synergy (DrugComb)FIMM, Финляндияhttps://drugcomb.fimm.fiСправочный набор данных по синергии лекарственных препаратов
Данные Synergy (SynergyDB)Университет Гронингенаhttps://synergy.bioinformatics.nlСправочный набор данных по синергии лекарственных препаратов
TensorFlow 2.11Гуглhttps://www.tensorflow.orgРеализация модели глубокого обучения автоэнкодера
ВинбластинСигма-ОлдричВ1377Препарат, используемый в синергетическом анализе
Библиотека XGBoostИндекс пакетов Python (PyPI)https://xgboost.readthedocs.ioРегрессионное моделирование градиентного бустинга

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Vamathevan, J., et al. Applications of machine learning in drug discovery and development. Nat Rev Drug Discov. 18 (6), 463-477 (2019).
  2. Dara, S., Dhamercherla, S., Jadav, S. S., Babu, C. M., Ahsan, M. J. Machine learning in drug discovery: a review. Artif Intell Rev. 55 (3), 1947-1999 (2022).
  3. Drug discovery for breast cancer based on big data analytics techniques. Constantine, R. M., Batouche, M. 5th International Conference on Information & Communication Technology and Accessibility (ICTA), Marrakech, Morocco, , (2015).
  4. Elbadawi, M., Gaisford, S., Basit, A. W. Advanced machine-learning techniques in drug discovery. Drug Discov Today. 26 (3), 769-777 (2021).
  5. Sarkar, C., et al. Artificial intelligence and machine learning technology-driven modern drug discovery and development. Int J Mol Sci. 24 (3), 2026(2026).
  6. Liao, M., et al. Small-molecule drug discovery in triple negative breast cancer: current situation and future directions. J Med Chem. 64 (5), 2382-2418 (2021).
  7. You, Y., et al. Artificial intelligence in cancer target identification and drug discovery. Signal Transduct Target Ther. 7 (1), 156(2022).
  8. Kolahi Azar, H., et al. The progressive trend of modeling and drug screening systems of breast cancer bone metastasis. J Bio Eng. 18 (1), 14(2024).
  9. Singh, A., et al. Coumarin as an elite scaffold in anti-breast cancer drug development: design strategies, mechanistic insights, and structure-activity relationships. Biomedicines. 12 (6), 1192(2024).
  10. Baptista, D., Ferreira, P. G., Rocha, M. Deep learning for drug response prediction in cancer. Brief Bioinform. 22 (1), 360-379 (2021).
  11. Priya, S., et al. Machine learning approaches and their applications in drug discovery and design. Chem Biol Drug Des. 100 (1), 136-153 (2022).
  12. Ferraro, E., et al. Accelerating drug development in breast cancer: new frontiers for ER inhibition. Cancer Treat Rev. 109, 102432(2022).
  13. Arvindekar, A., et al. Unveiling promising bioactives for breast cancer: a novel approach for herbal-based drug discovery. Phytochem Rev. 24, 3221-3264 (2024).
  14. Vatansever, S., et al. AI- and ML-aided drug discovery in CNS diseases: state-of-the-art and future directions. Med Res Rev. 41 (3), 1427-1473 (2021).
  15. Nayarisseri, A., et al. Artificial intelligence, big data, and machine learning approaches in precision medicine and drug discovery. Curr Drug Targets. 22 (6), 631-655 (2021).
  16. Eckhardt, B. L., et al. Strategies for the discovery and development of therapies for metastatic breast cancer. Nat Rev Drug Discov. 11 (6), 479-497 (2012).
  17. Optimizing drug discovery for breast cancer in a laboratory environment using machine learning. Borkhade, G., et al. 2024 International Conference on Wireless Communications Signal Processing and Networking (WiSPNET), Chennai, India, , (2024).
  18. Rakhshaninejad, M., et al. Refining breast cancer biomarker discovery and drug targeting through an advanced data-driven approach. BMC Bioinformatics. 25 (1), 33(2024).
  19. Nagaraj, B. S., et al. Vitamin D analog calcitriol for breast cancer therapy; an integrated drug discovery approach. J Biomol Struct Dyn. 41 (20), 11017-11043 (2023).
  20. Jernström, S., et al. Drug-screening and genomic analyses of HER2-positive breast cancer cell lines reveal predictors for treatment response. Breast Cancer Targets Ther. 9, 185-198 (2017).
  21. Witt, B. L., Tollefsbol, T. O. Molecular, cellular, and technical aspects of breast cancer cell lines as a foundational tool in cancer research. Life. 13 (12), 2311(2023).
  22. Gruener, R. F., et al. Facilitating drug discovery in breast cancer by virtually screening patients using in vitro drug response modeling. Cancers. 13 (4), 885(2021).
  23. Song, J., et al. The discovery of new drug-target interactions for breast cancer treatment. Molecules. 26 (24), 7474(2021).
  24. Costa, R., et al. Targeting EGFR in triple negative breast cancer: new discoveries and insights. Cancer Treat Rev. 53, 111-119 (2017).
  25. Cardoso, F., et al. Bortezomib (PS-341, Velcade) increases the efficacy of trastuzumab (Herceptin) in HER2-positive breast cancer cells synergistically. Mol Cancer Ther. 5 (12), 3042-3051 (2006).
  26. Santo, L., et al. Preclinical activity of a selective HDAC6 inhibitor, ACY-1215, in combination with bortezomib in multiple myeloma. Blood. 119 (11), 2579-2589 (2012).
  27. Martin, M., et al. Activity of docetaxel, carboplatin, and doxorubicin in patient-derived TNBC xenografts. Sci Rep. 11, 7064(2021).
  28. Iorio, F., et al. A landscape of pharmacogenomic interactions in cancer. Cell. 166 (3), 740-754 (2016).
  29. Kuenzi, B. M., et al. Predicting drug response and syn enhances antitumor efficacy in TNBC xenografts. Oncotarget. 10, 25184-25198 (2019).
  30. Kuenzi, B. M., et al. Predicting drug response and synergy using a deep learning model of human cancer cells. Cancer Cell. 38 (5), 672-684.e6 (2020).
  31. XGBoost: a scalable tree boosting system. Chen, T., et al. Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, San Francisco, California, USA, , (2016).
  32. A unified approach to interpreting model predictions. Lundberg, S. M., Lee, S. -I. 31st Conference on Neural Information Processing Systems (NIPS 2017), Long Beach, CA, USA, , (2017).
  33. Preuer, K., et al. DeepSynergy: predicting anti-cancer drug synergy with deep learning. Bioinformatics. 34 (9), 1538-1546 (2018).
  34. Contextualizing explainable machine learning for clinical end use. Tonekaboni, S., et al. Proceedings of the 4th Machine Learning for Healthcare Conference, Ann Arbor, Michigan, , (2019).
  35. Barretina, J., et al. The Cancer Cell Line Encyclopedia enables predictive modelling of anticancer drug sensitivity. Nature. 483, 603-607 (2012).
  36. Malyutina, A., et al. Drug combination sensitivity scoring facilitates discovery of synergistic drug combinations in cancer. PLoS Comput Biol. 15 (5), e1006752(2019).
  37. Menden, M. P., et al. Machine learning prediction of cancer cell sensitivity to drugs. PLoS One. 8 (4), e61318(2013).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

Breast CancerDrug DiscoveryMachine LearningDrug SensitivityXGBoost ModelAutoencoder PipelineDrug SynergySHAP AnalysisPrecision OncologyPharmacological Clustering

Похожие статьи