مقالة منهجية

تحسين اكتشاف الأدوية المستندة إلى البيانات لسرطان الثدي باستخدام نماذج التعلم الآلي القابلة للتفسير

DOI:

10.3791/68705

سبتمبر 12, 2025

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يقدم هذا البروتوكول خط أنابيب التعلم الآلي باستخدام XGBoost و SHAP للتنبؤ بحساسية الأدوية في سرطان الثدي. يتضمن سير العمل المعالجة المسبقة للبيانات ، والنمذجة الهجينة ، والتفسير المستند إلى SHAP ، وتسجيل التآزر ، وتجميع PCA لتحديد الأدوية القوية وفهم العوامل البيولوجية الرئيسية التي تؤثر على الاستجابة العلاجية.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

لا يزال سرطان الثدي أحد أكثر الأورام الخبيثة انتشارا في جميع أنحاء العالم ، ويشكل تحديات علاجية كبيرة بسبب عدم تجانس الورم ومقاومة الأدوية. تقدم هذه الدراسة بروتوكول تعلم آلي قابل للتكرار وقائم على البيانات للتنبؤ بحساسية الأدوية في خطوط خلايا سرطان الثدي ، بهدف مزدوج يتمثل في تحديد العوامل الفردية القوية ومجموعات الأدوية التآزرية. باستخدام مجموعات البيانات المنسقة من علم جينوم حساسية الأدوية في السرطان (GDSC) ، تم تنفيذ نهجين تنبؤيين: مراجع XGBoost مستقل وخط أنابيب هجين Autoencoder-XGBoost. تضمنت المعالجة المسبقة ترميز الملصقات ، والتشفير الساخن مرة واحدة ، وتوحيد درجة Z ، وإسناد القيمة المفقودة ، وتقليل الأبعاد عبر PCA. أظهر تقييم النموذج أن XGBoost حقق أداء فائقا (MSE = 1.3789 ، R2 = 0.8145) مقارنة بالنموذج الهجين (MSE = 4.0322 ، R2 = 0.4577). تمت معالجة قابلية التفسير باستخدام SHapley Additive exPlanations (SHAP) ، والتي حددت TARGET_PATHWAY و DRUG_ID و TARGET و CELL_LINE_NAME كسمات تنبؤية رئيسية ، بما يتماشى مع الآليات الدوائية المعمول بها. سلطت درجات التآزر المتوقعة ، المستمدة من الجمع بين مخرجات النموذج مع بيانات DrugComb و SynergyDB ، الضوء على أزواج الأدوية الواعدة مثل Bortezomib + Romidepsin و Paclitaxel + Bortezomib. تم دعم هذه النتائج بشكل أكبر من خلال التجميع الدوائي القائم على PCA ، والذي كشف عن مجموعات ذات صلة بيولوجيا من الأدوية ذات آليات عمل مماثلة. يوفر البروتوكول المقترح إطارا شفافا وقابلا للتكيف لأبحاث الأورام الدقيقة ، مما يتيح الدقة التنبؤية وقابلية التفسير البيولوجي. من خلال دمج المعالجة المسبقة الصارمة ، والتحقق من صحة النموذج ، وقابلية التفسير ، وتحليل تآزر الأدوية ، يوفر سير العمل هذا أساسا قابلا للتطوير لاكتشاف الأدوية الانتقالية وإعادة استخدامها في علاج سرطان الثدي.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

لا يزال سرطان الثدي هو أكثر أنواع السرطان شيوعا والسبب الرئيسي الثاني للوفاة المرتبطة بالسرطان بين النساء على مستوى العالم1. في الولايات المتحدة وحدها ، يمثل ما يقرب من 30٪ من جميع الأورام الخبيثة الأنثوية الجديدة ، مع تشخيص أكثر من 280.000 حالة جديدة سنويا2. على الرغم من التقدم العلاجي ، لا سيما في الأنواع الفرعية الإيجابية HER2 ومستقبلات الهرمونات الإيجابية ، لا تزال مقاومة العلاج والتكرار تمثل تحديات حرجة - خاصة بالنسبة للأنواع الفرعية العدوانية مثل سرطان الثدي الثلاثي السلبي (TNBC) ، الذي يفتقر إلى العلاجات المستهدفة3،4. وهذا يؤكد الحاجة الملحة لاكتشاف الأدوية المدفوعة بدقة لتحديد العوامل العلاجية الفعالة والتركيبات المصممة خصيصا للملامح الجزيئية الفردية. شهد اكتشاف الأدوية ، المسترشد تقليديا بالطرق التجريبية والتجربة والخطأ ، تسارعا ملحوظا من خلال دمج تقنيات التعلم الآلي (ML)5،6. يتيح ML نمذجة العلاقات المعقدة وغير الخطية عبر البيانات الطبية الحيوية عالية الأبعاد ويمكن أن يساعد في تحديد الهدف ، واكتشاف المؤشرات الحيوية ، والتنبؤ بحساسية الأدوية ، وتصميم العلاج المركب7،8. ومع ذلك ، فإن النشر العملي لنماذج ML في علم الأورام يواجه العديد من العقبات ، بما في ذلك قابلية تفسير النموذج ، وقابلية التكاثر ، والإفراط في تركيب مجموعات البيانات المتناثرة ، والتعميم عبر الأنواع الفرعية للسرطان9،10،11.

للتغلب على هذه القيود ، ركزت الأبحاث الحديثة على الجمع بين التعلم العميق لاستخراج الميزات والتعلم الجماعي للتنبؤ القوي. في الدراسات التي تقيم خوارزميات متعددة ، حققت نماذج مثل الشبكات العصبية الاصطناعية (ANN) مستويات دقة تصل إلى 93.2٪ ، متفوقة على المصنفات التقليدية مثل Naïve Bayes و Decision Trees12. بالإضافة إلى ذلك ، كشفت تقنيات التنقيب عن الميزات المتكاملة عن جينات المحرك الرئيسية والأهداف الجزيئية من خلال قواعد بيانات مثل GEO (Gene Expression Omnibus) و GSE45827 ، وتحديد ما يصل إلى 1,700 جين معبر عنه بشكل تفاضلي ، بعضها يظهر تفاعلات دوائيةمعروفة 13. علاوة على ذلك ، كشفت دراسات إعادة استخدام الأدوية الجديدة عن إمكانات المركبات غير الأورامية مثل الكالسيتريول لتقليل بقاء خلايا سرطان الثدي بشكل أكثر فعالية من العلاجات القياسية مثل نيراتينيب ، خاصة في خطوط خلايا HER2 +14. أظهرت التحقيقات في مسار إشارات Akt أيضا وعدا في التغلب على مقاومة trastuzumab ، مما يشير إلى استهداف المسار الجزيئي كبديل للعلاج الذي يركز على المستقبلات15،16. ومع ذلك ، على الرغم من هذه التطورات ، لا يزال إطار منهجي وقابل للتفسير قادرا على التنبؤ بقيم الاستجابة المستمرة للأدوية ، وتصنيف مجموعات الأدوية الفعالة ، وتصور أوجه التشابه الدوائية غير مستكشف في الأدبيات الحالية. العديد من النماذج إما قائمة على التصنيف أو تفتقر إلى الوضوح الانتقالي ، خاصة عند تطبيقها على مجموعات البيانات الدوائية الجينية في العالم الحقيقي.

يمكن تحسين اكتشاف الأدوية واتخاذ القرار من خلال التعلم الآلي (ML) ، والذي يوفر أدوات لبيانات عالية الجودة. يمكن أن تستفيد جميع مراحل اكتشاف الأدوية ، بما في ذلك التحقق من صحة الهدف وتحديد المؤشرات الحيوية وتحليل التجارب السريرية ، من استخدام التعلم الآلي. تعد قابلية التفسير والتكرار للنتائج التي تم إنشاؤها بواسطة التعلم الآلي من العقبات أيضا17. يمكن تقليل معدلات الفشل وتسريع العملية من خلال معالجة هذه المشكلات وزيادة المعرفة بمتغيرات التحقق من الصحة. باستخدام خوارزميات التعلم الآلي ، قام الباحثون بتقييم عينات الخزعة في مراحل مختلفة من السرطان. كانت دقة الاختبار عالية ، مع ANN 93.2٪ ، و Naïve Bayes (NB) 90.4٪ ، و Decision Tree (DT) 87.8٪ ، و RF 85.9٪ ، وفقا للنتائج. تم العثور على ما مجموعه 350 جينا متوقعا و 164 جينا معبر عنه بشكل تفاضلي من خلال الجمع بين قاعدة بيانات GEO بواسطة Rakhshaninejad et al.18. في مجموعة البيانات المدمجة ، وجدت خوارزمية Binary Grey Wolf Optimization مع محاكاة مجموعة التلدين (BGWO_SA_Ens) 1404 جينا ، بينما في مجموعة البيانات GSE45827 ، وجدت 1710. تم العثور على حوالي 35 جينا متفوقا ، إلى جانب أدوارها في المسارات المهمة والعلاقات بين الجينات المتفوقة والأدوية المضادة للسرطان. للعثور على الجينات المستهدفة من مسار إشارات التعبير المفرط لمستقبلات عامل نمو البشرة (EGFR) وأفراد الأسرة المرتبطين بها ، تم إجراء تحقيقات الشبكات الجزيئية بواسطة Nagaraj et al.19 دواء يسمى كالسيتريول ، المصرح به لعلاج الحالات غير المرتبطة بالسرطان ، كان له صلات قوية مع كل من المستقبلات الأربعة. طبقًا لـ in vitro دراسات السمية الخلوية ، قلل الكالسيتريول من صلاحية خلايا SK-BR-3 بطريقة تعتمد على الجرعة ، مما يشير إلى السمية الخلوية الفائقة وتقليل تكاثر خلايا سرطان الثدي مقارنة بالنيراتينيب. تم اقتراح مسار إشارات Akt نشط وقابل للدواء بواسطة Jernström et al.20 أن خطين من الخلايا اللذين كانا غير حساسين ل trastuzumab كانا يستجيبان لمثبط Akt1 / 2 kinase. بدلا من التركيز على تضخيم HER2 أو التعبير عنه ، توصي الدراسة باستهداف مسار إشارات Akt وأخذ الجوانب الجزيئية في الاعتبار عند اتخاذ قرارات العلاج. ثلاثون بالمائة من الأورام الخبيثة الأنثوية الجديدة في الولايات المتحدة هي سرطانات الثدي ، مما يجعلها أكثر الأمراض الخبيثة شيوعا بين النساء. هدف ويت وتوليفسبول21 كان تطوير أداة أساسية من شأنها أن تساعد الباحثين على اختيار خط خلايا سرطان الثدي لاستخدامه في تجارب xenograft ، والوقاية من السرطان ، والاكتشافات اللاجينية ، من بين مجالات أخرى. كما تمت تغطية المناقشات حول مصدر خطوط خلايا سرطان الثدي المحددة ومزايا استخدام الطعم الغريب المشتق من المريض (PDX) بدلا من الطعوم الغريبة المشتقة من الخلايا (CDX). تم فحص استخدام تقنيات التنبؤ بالأدوية لتوفير فرضيات جديدة لاكتشاف الأدوية في Gruener et al.22، مع التركيز على سرطان الثدي الثلاثي السلبي (TNBC). على أساس بيانات نسخ خط الخلية ، تم إنشاء نماذج التعلم الآلي للاستجابة للأدوية ثم تطبيقها على بيانات ورم المريض. أظهرت النتائج أن مثبط Wee1 AZD-1775 كان له تأثير تفضيلي في TNBC وأن طفرات TP53 كانت مرتبطة ارتباطا وثيقا بفعاليتها. من أجل التنبؤ بالتفاعلات المستهدفة للأدوية غير المعروفة في أبحاث سرطان الثدي ، سونغ وآخرون23 تقديم نهج قائم على الميزات يطلق عليه اسم التركيب المشتق من الخصائص الفيزيائية والكيميائية الخاصة بالموضع الزائف للتنبؤ بالتفاعل بين الدواء والهدف (PsePDC-DTIs) ، والذي يستخدم تسلسل البروتين ، ومعامل تحليل الارتباط الكنسي العميق (DCCA) ، وواصف بصمات الأصابع الجزيئي. تتنبأ هذه التقنية ب DTIs على أربع مجموعات بيانات قياسية ذهبية باستخدام مصنف غابات عشوائي وتتعامل مع البيانات غير المتوازنة باستخدام SMOTE. بالإضافة إلى ذلك ، يستخدم النموذج جينات الخطر من البحث الجيني على مستوى الجينوم للتحقيق في أهداف جديدة لعلاج سرطان الثدي. يتم توضيح تفوق النموذج وصلاحيته من خلال DTIs العشرة الممكنة التي يقدمها للعلاج. من عشرة إلى عشرين بالمائة من حالات سرطان الثدي هي سرطان الثدي ثلاثي السلبيات (TNBC). لا توجد حاليا علاجات مستهدفة ل TNBC ، على الرغم من التقدم في علاجات HER2 + والمستقبلات الهرمونية +24. على الرغم من أن غالبية المرضى يعبر عن EGFR ، إلا أن الدراسات المبكرة لم تجد أي نشاط ملحوظ. يتم اقتراح العلاجات التجريبية المستقبلية ل TNBC من خلال النتائج الحديثة والتطورات السريرية25.

على الرغم من التكامل المتزايد للتعلم الآلي في اكتشاف الأدوية ، غالبا ما تفتقر النماذج الحالية إلى قابلية التفسير والاستنساخ ، مما يحد من تطبيقها الانتقالي. في حين أن الدراسات السابقة قد استكشفت دقة التصنيف وتعدين الجينات ، فقد تنبأ القليل منها بشكل منهجي بالحساسية المستمرة للأدوية (مثل LN_IC50) باستخدام نماذج هجينة قابلة للتفسير. علاوة على ذلك ، لا يزال الجمع بين تقنيات تقليل الأبعاد مع الانحدارات القوية غير مستكشف في سياق علاج سرطان الثدي. تعالج هذه الدراسة هذه الفجوة من خلال تقديم وتقييم استراتيجية خط أنابيب مزدوج - XGBoost و Autoencoder-XGBoost - للتنبؤ عالي الدقة باستجابة الأدوية ، إلى جانب أدوات رسم خرائط التفسير والتآزر للتطبيق السريري في العالم الحقيقي.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. الحصول على مجموعة البيانات

  1. قم بتنزيل بيانات حساسية الدواء من GDSC (https://www.cancerrxgene.org/downloads/drug_data). يتم توفير ملخص لمجموعة البيانات المستخدمة في الجدول 1. الملفات المستخدمة هي gdsc_drug_data.csv (الاستجابة للأدوية) و gdsc_expression_data.csv (التعبير الجيني) و gdsc_cell_metadata.csv (معلومات خط الخلية).
    راجع الشكل 1 للحصول على مثال لبنية مجموعة البيانات المستخدمة في سير العمل هذا.
  2. قم بتصفية مجموعة البيانات لتشمل خطوط خلايا سرطان الثدي فقط باستخدام Python (مكتبة Pandas).
    1. حدد السجلات التي يساوي فيها عمود TCGA_DESC "الثدي".
    2. استخراج قيم CELL_LINE_NAME المقابلة.
    3. ارجع إلى الكود التكميلي 1 (الملف التكميلي 1) للتنفيذ.
      ملاحظة: يضمن تقييد مجموعة البيانات على خطوط خلايا سرطان الثدي تدريبا على نموذج خاص بالمجال ويحسن الصلاحية البيولوجية. تم استرداد مجموعة البيانات المستخدمة في هذه الدراسة من قاعدة بيانات جينوم حساسية الأدوية في السرطان (GDSC) ، ويتم عرض ميزاتها الرئيسية في الجدول 2.

2. المعالجة المسبقة للبيانات

  1. خط أنابيب المعالجة المسبقة:
    1. قم بتشفير المتغيرات الفئوية مثل DRUG_ID و CELL_LINE_NAME و TARGET_PATHWAY باستخدام LabelEncoder لتحويلها إلى تنسيقات قائمة على الأعداد الصحيحة مناسبة لإدخال XGBoost.
    2. تطبيع الميزات العددية ، بما في ذلك بيانات التعبير الجيني ، وتعديلات رقم النسخ (CNA) ، وميزات المثيلة ، باستخدام توحيد Z-score (StandardScaler) لضمان صفر متوسط وتباين الوحدة.
    3. قم بإزالة العينات التي تحتوي على أكثر من 30٪ من الميزات المفقودة.
    4. قم بحساب القيم المفقودة المتبقية باستخدام وسيط كل عمود ميزة معني باستخدام SimpleImputer(strategy='median').
    5. قم بتطبيق ترميز سريع واحد على المتغيرات الفئوية (DRUG_ID و TARGET_PATHWAY) باستخدام OneHotEncoder من scikit-learn.
    6. قم بإجراء تقليل الأبعاد على ميزات التعبير الجيني باستخدام تحليل المكون الرئيسي (PCA) لتقليل مساحة الميزة مع الحفاظ على التباين.
    7. قم بتقسيم مجموعة البيانات النهائية التي تم تنظيفها إلى مجموعات تدريب (80٪) واختبار (20٪) باستخدام train_test_split من scikit-learn ، مع الحفاظ على توزيع أزواج الخلايا الدوائية.
      ملاحظة: تتم مناقشة الأساس المنطقي التفصيلي لكل خطوة معالجة مسبقة وأبعاد مجموعة البيانات الناتجة في قسم المناقشة.
  2. معالجة المتغيرات الفئوية
    1. حدد المتغيرات الفئوية (CELL_LINE_NAME ، DRUG_NAME ، TARGET_PATHWAY) باستخدام Pandas.
    2. قم بتطبيق ترميز التسمية على هذه المتغيرات باستخدام LabelEncoder الخاص ب scikit-learn.
    3. قم بتنفيذ هذه الخطوة برمجيا كما هو موضح في الكود التكميلي 2 (الملف التكميلي 1).
      ملاحظة: تتطلب خوارزميات التعلم الآلي مدخلات رقمية. يحول ترميز التسمية المتغيرات الفئوية إلى تنسيق عدد صحيح مع الحفاظ على فروق الفئة.
  3. توحيد الميزات العددية
    1. تحديد المتغيرات العددية عبر التعبير الجيني ، وتغيير رقم النسخ (CNA) ، وميزات المثيلة.
    2. قم بتطبيق StandardScaler لتسوية المعالم إلى المتوسط الصفري وتباين الوحدة.
      ملاحظة: يضمن التوحيد القياسي أن تساهم جميع الميزات الرقمية بالتساوي في النموذج عن طريق تغيير حجمها بحيث يكون لها تباين متوسط ووحدة صفرية. هذا يمنع الميزات ذات المقاييس الأكبر من السيطرة على تدريب النموذج ويحسن التقارب في خوارزميات التحسين.
  4. معالجة القيم المفقودة
    1. اكتشف الإدخالات المفقودة عبر جميع الميزات.
    2. إزالة السجلات التي تحتوي على أكثر من 30٪ من البيانات المفقودة.
    3. قم بحساب القيم المفقودة المتبقية باستخدام استراتيجية الإسناد المتوسط.
      ملاحظة: يمكن أن تؤدي البيانات غير المكتملة إلى حدوث تحيز وتقليل متانة النموذج. تضمن إزالة السجلات المفقودة بشدة موثوقية البيانات ، بينما يوفر الإحالة المتوسطة طريقة مستقرة ومقاومة للقيم المتطرفة للحفاظ على المعلومات القابلة للاستخدام دون إدخال افتراضات توزيع قوية.
  5. تقسيم مجموعة البيانات
    1. استخدم طريقة آلية (على سبيل المثال ، train_test_split من sikit-learn) لتقسيم مجموعة البيانات النهائية التي تم تنظيفها إلى مجموعات فرعية للتدريب والاختبار.
    2. حدد بذرة عشوائية (على سبيل المثال ، random_state = 42) لضمان قابلية التكاثر.
    3. خصص 80٪ من البيانات لمجموعة التدريب و 20٪ لمجموعة الاختبار.
    4. ارجع إلى الكود التكميلي 3 (الملف التكميلي 1) لتنفيذ الكود بالكامل.
      ملاحظة: يسمح تقسيم البيانات إلى مجموعات فرعية للتدريب والاختبار بتقييم غير متحيز لتعميم النموذج.

3. إطار النمذجة

  1. تحديد هدف الانحدار
    1. قم بتأطير مهمة التنبؤ كمشكلة انحدار لتقدير اللوغاريتم الطبيعي للتركيز المثبط النصف الأقصى (LN_IC50) لكل زوج من خطوط الخلايا الدوائية.
    2. اختر LN_IC50 كمتغير مستهدف لتثبيت التباين وتحسين النموذج.
      ملاحظة: يؤدي تحويل IC50 إلى LN_IC50 إلى تقليل الانحراف وتحسين أداء النموذج.
  2. قطار XGBoost Regressor (موديل 1)
    1. حدد XGBoost كنموذج أساسي نظرا لأدائه القوي على مجموعات البيانات الدوائية الجينية المنظمة وقدرته على نمذجة تفاعلات الميزات غير الخطية مع التنظيم لمنع الإفراط في التركيب.
    2. قم بتهيئة النموذج برمجيا باستخدام فئة XGBRegressor من مكتبة xgboost. تحديد المعلمات الفائقة المضبوطة (معدل التعلم ، والحد الأقصى للعمق ، وعدد المقدرات ، والبذور العشوائية) المحددة من خلال التحقق المتبادل.
    3. تدريب النموذج على مجموعة التدريب الفرعية (X_train ، y_train) باستخدام طريقة fit().
    4. قم بإنشاء تنبؤات على المجموعة الفرعية للاختبار (X_test) باستخدام طريقة predict().
    5. تقييم الأداء باستخدام متوسط الخطأ التربيعي (MSE) ودرجة R² باستخدام وظائف mean_squared_error و r2_score الخاصة ب scikit-learn.
      ملاحظة: ارجع إلى الكود التكميلي 4 (الملف التكميلي 1) للتنفيذ الكامل.
  3. ضع في اعتبارك نماذج بديلة
    1. تقييم انحدار ناقلات الدعم (SVR) لقوته في إعدادات البيانات عالية الأبعاد للعينات الصغيرة.
    2. قم بتقييم هجين Autoencoder-XGBoost لتحقيق مكاسب الأداء المحتملة من خلال استخراج الميزات الكامنة العميقة والنمذجة غير الخطية.
    3. قارن الأداء عبر النماذج باستخدام مقاييس التقييم المتطابقة والتحقق من المتبادل.
      ملاحظة: تم استبعاد SVR من النتائج النهائية بسبب انخفاض دقة التنبؤ مقارنة ب XGBoost ، بينما تم الاحتفاظ بهجين Autoencoder-XGBoost لمقارنة أساليب التعلم العميق والتعلم الآلي.
  4. نموذج 1: XGBoost Regressor
    1. حدد XGBoost كنموذج أساسي نظرا لأدائه القوي في البيانات الطبية الحيوية المنظمة ، وقدرته على نمذجة تفاعلات الميزات غير الخطية ، وتنظيمه المدمج الذي يقلل من الإفراط في التركيب.
    2. قم بتكوين نموذج XGBoost مع المعلمات الفائقة learning_rate = 0.05 و max_depth = 6 و n_estimators = 100.
    3. تحسين المعلمات الفائقة باستخدام البحث في الشبكة والتحقق من الأداء باستخدام التحقق المتبادل 5 أضعاف.
    4. تدريب النموذج على مجموعة بيانات التدريب المعدة (X_train ، y_train).
    5. تقييم الأداء التنبؤي باستخدام متوسط الخطأ التربيعي (MSE) ودرجة R² المحسوبة باستخدام وظائف mean_squared_error و r2_score الخاصة ب scikitlearn.
      ملاحظة: أظهرت الدراساتالسابقة 26 أن XGBoost يتفوق باستمرار على نماذج التعلم العميق على مجموعات البيانات الطبية الحيوية الجدولية بتكلفة حسابية أقل.
  5. بناء جهاز تشفير ذاتي هجين + طراز XGBoost (نموذج 2)
    1. تصميم جهاز تشفير ذاتي لتقليل الأبعاد غير الخاضع للإشراف
      ملاحظة: يقوم برنامج التشفير بضغط ميزات الإدخال في تمثيل كامن منخفض الأبعاد. يقوم وحدة فك التشفير بإعادة بناء المدخلات لتقليل خطأ إعادة البناء.
    2. قم بتدريب Autoencoder على مصفوفة الميزات الكاملة لاستخراج الميزات الكامنة.
    3. قم بتمرير إخراج برنامج التشفير (الميزات الكامنة) كمدخل إلى مراجع XGBoost ، كما هو موضح في الكود التكميلي 5A (الملف التكميلي 1).
    4. قم بتدريب مراجع XGBoost على مجموعة الميزات المشفرة باستخدام LN_IC50 كمتغير هدف ، كما هو موضح في الكود التكميلي 5B (الملف التكميلي 1).
    5. تقييم أداء النموذج باستخدام نفس المقاييس مثل Model 1 للمقارنة المباشرة.
      ملاحظة: يستفيد هذا النهج الهجين من تعلم التمثيل القائم على التعلم العميق وقدرة الانحدار القوية ل XGBoost ، مما يوفر ميزة للبيانات البيولوجية عالية الأبعاد.
  6. تقييم النموذج
    1. قم بتقييم نموذج الانحدار المدرب عن طريق التنبؤ بالقيم المستهدفة باستخدام طريقة predict() في مجموعة بيانات الاختبار (X_test).
    2. احسب متوسط الخطأ التربيعي (MSE) لقياس متوسط الفرق التربيعي بين قيم LN_IC50 المتوقعة والفعلية باستخدام mean_squared_error (y_test ، y_pred) من scikit-learn.
      ملاحظة: تجمع هذه النماذج معا بين قابلية التفسير والدقة ، وتشكل إطارا قويا للتنبؤ بحساسية الأدوية في أبحاث سرطان الثدي27،28.
      figure-protocol-1
      حيث yi يشير إلى LN_IC50 الحقيقي لزوج الخلايا الدوائية ith ، figure-protocol-2 هو القيمة المتوقعة المقابلة ، و n هو العدد الإجمالي للملاحظات. بالنسبة للتشفير الذاتي ، يتم إعطاء خسارة إعادة الإعمار من خلال ،
      figure-protocol-3
      حيث X هي مصفوفة ميزة الإدخال ، و E (·) هي وظيفة التشفير التي تقوم بتعيين X إلى تمثيل كامن ، و D (·) هي وظيفة فك التشفير التي تعيد بناء X من الفضاء الكامن.
    3. احسب درجة R2 لتحديد نسبة التباين في المتغير المستهدف الموضح بواسطة النموذج باستخدام r2_score (y_test ، y_pred) من scikit-learn.
    4. سجل قيم MSE و R2 المحسوبة لإعداد التقارير. يتم تلخيص قيم MSE و R² المحسوبة في الجدول 3 لعرض أداء النماذج المختلفة ومقارنتها مباشرة بوضوح.
    5. تفسير مقاييس التقييم: يشير انخفاض MSE إلى دقة تنبؤية أعلى ، وتشير درجة R2 أقرب إلى 1 إلى قوة تفسيرية أقوى وقدرة تعميم أفضل للنموذج.
  7. شرح SHAP
    1. قم بتثبيت واستيراد مكتبة SHAP (استيراد shap). تأكد من أن الإصدار هو 0.41.0 للتكرار.
    2. قم بتهيئة شرح SHAP باستخدام نموذج XGBoost المدرب باتباع الكود التكميلي 6 (الملف التكميلي 1).
    3. حساب قيم SHAP لمجموعة بيانات الاختبار للحصول على درجات مساهمة الميزة.
    4. قم بإنشاء مخطط ملخص لأهمية الميزة العالمية لتصور الميزات التي تساهم بشكل أكبر في التنبؤات.
    5. قم بإنشاء شرح تنبؤ فردي لعينة محددة باستخدام مخطط شلال SHAP.
    6. تفسير المؤامرات لتحديد السمات الرئيسية التي تؤثر على التنبؤات. كما هو موضح في الجدول 4 ، تشمل الميزات الحرجة TARGET_PATHWAY و DRUG_ID و CELL_LINE_NAME و TARGET و Screen Medium ، مما يشير إلى أن الخصائص الخاصة بالدواء والخلايا الخاصة تؤثر بشكل كبير على تنبؤات استجابة الدواء.
      ملاحظة: تم حساب قيم SHAP باستخدام shap. TreeExplainer () لنماذج XGBoost. تم تصور أهمية الميزة العالمية باستخدام shap.summary_plot () ، وتم إنشاء تفسيرات لكل عينة باستخدام shap.dependence_plot () و shap.waterfall_plot () (SHAP v0.41.0) كما هو موضح في الجدول 4 ، تضمنت السمات الأكثر تأثيرا TARGET_PATHWAY و DRUG_ID و CELL_LINE_NAME ، مما يشير إلى أن كلا من الخصائص الخاصة بالدواء والخلية كانت حاسمة في تحديد استجابة الدواء. كان المساهمون الرئيسيون الإضافيون هم بروتين TARGET و Screen Medium ، مما يؤكد بشكل أكبر على مواءمة النموذج مع العوامل ذات الصلة بالمجال في علم الصيدلة الجيني للسرطان.
  8. التآزر والتجميع الدوائي
    1. تنزيل بيانات التآزر
      1. قم بتنزيل بيانات تآزر التركيبات الدوائية من المستودعات المتاحة للجمهور:
        دومشط المخدرات:https://drugcomb.fimm.fi
        SynergyDB: https://synergy.bioinformatics.nl
    2. دمج بيانات التآزر مع الاستجابة المتوقعة.
      1. استخدم مجموعات خط الخلايا الدوائية كمفاتيح فريدة لدمج درجات التآزر التي تم تنزيلها (ZIP و Bliss و Loewe و HSA) مع قيم استجابة الأدوية المتوقعة (LN_IC50).
      2. تأكد من محاذاة معرفات الأدوية وأسماء خطوط الخلايا بين مجموعات البيانات قبل الدمج.
    3. حساب درجات التآزر المستندة إلى النموذج.
      1. لكل زوج من الأدوية ، احسب الفعالية المتوقعة المجمعة باستخدام متوسط قيم LN_IC50 المتوقعة للنموذج الفردي:
        figure-protocol-4
        حيث يشير Scomb إلى درجة LN_IC50 المتوقعة المجمعة لزوج من الأدوية ، figure-protocol-5 هي LN_IC50 المتوقعة للدواء 1.
      2. ترتيب مجموعات الأدوية بناء على درجات التآزر.
      3. حدد أفضل التركيبات (على سبيل المثال ، بورتيزوميب + روميدبسين ، فينبلاستين + داكتينومايسين) التي تظهر أدنى درجات التآزر ، مما يشير إلى فعالية أعلى متوقعة.
        ملاحظة: تعكس درجة التآزر المنخفضة إمكانات علاجية متوقعة أكبر ، مما يجعل أزواج الأدوية هذه مرشحة لمزيد من التحقق التجريبي. اتبع الخطوات الواردة في الرمز التكميلي 7A والرمز التكميلي 7B (الملف التكميلي 1).
  9. ترتيب التآزر والتجميع القائم على PCA
    1. ترتيب أزواج الأدوية حسب درجة التآزر.
      1. دمج درجات التآزر (ZIP و Bliss و Loewe و HSA) مع قيم LN_IC50 المتوقعة باستخدام مجموعات خط الخلايا الدوائية كمفاتيح فريدة.
      2. احسب درجات التآزر لكل زوج من الأدوية باستخدام متوسط قيم LN_IC50 المتوقعة:
      3. ترتيب أزواج الأدوية بناء على درجات التآزر المحسوبة.
      4. حدد أزواج الأدوية ذات الدرجات الأقل (الأكثر سلبية) كمجموعات تآزرية محتملة (على سبيل المثال ، بورتيزوميب + روميدبسين ، فينبلاستين + داكتينومايسين).
    2. إجراء PCA على مصفوفة استجابة المخدرات.
      1. قم بإنشاء مصفوفة استجابة للدواء باستخدام قيم LN_IC50 المتوقعة مع الأدوية كصفوف وخطوط خلوية كأعمدة ، باتباع الخطوات الموضحة في الرمز التكميلي 8 (الملف التكميلي 1).
      2. توحيد المصفوفة باستخدام تطبيع zscore.
      3. قم بإجراء تحليل المكون الرئيسي (PCA) مع مكونين رئيسيين (n_components = 2) لتقليل الأبعاد والتقاط التباين الرئيسي.
    3. تصور مجموعات PCA
      1. ارسم إسقاط PCA ثنائي الأبعاد باستخدام Matplotlib أو Seaborn.
      2. تأكد من أن الأدوية ذات آليات العمل المتشابهة (على سبيل المثال ، Docetaxel و Paclitaxel) تتجمع معا ، مما يثبت قدرة النموذج على التقاط علاقات ذات مغزى بيولوجي.
    4. ثبات النموذج وتوازن الميزات
      1. قم بتصفية المتغيرات الفئوية غير المتكررة أثناء الترميز لتجنب مشكلات التناثر.
      2. ضبط معدلات تعلم برنامج التشفير الذاتي وتضمين طبقات التسرب لمنع مشكلات التقارب.
      3. قم بتقييد تحليل SHAP على أفضل 100 ميزة لتقليل النفقات العامة للذاكرة وضمان الكفاءة الحسابية.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ركزت هذه الدراسة على تحسين اختيار الأدوية والتنبؤ بالفعالية التوافقية لسرطان الثدي باستخدام نماذج التعلم الآلي المتقدمة. تضمنت مجموعة البيانات لوحة منسقة ومفلترة من خطوط خلايا سرطان الثدي ، ومقاييس حساسية الأدوية (LN_IC50 ، AUC ، و Z-Score) ، والواصفات الجزيئية مثل CNA ، والمثيلة ، والتعبير الجيني ، وواصفات الأنسجة ، وأهداف الأدوية. كان الهدف الأساسي هو التنبؤ ب LN_IC50 (السجل الطبيعي للتركيز المثبط النصف الأقصى) للأدوية الفردية عبر خطوط الخلايا ، وتحديد التركيبات التآزرية ، وتوفير قابلية التفسير باستخدام قابلية تفسير SH...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تقدم هذه الدراسة خط أنابيب متكامل للتعلم الآلي للتكيف مع اختيار الدواء ، والتنبؤ بالتركيبات التآزرية ، وتحديد إمكانيات إعادة استخدام الدواء. تم دمج البيانات من قاعدة بيانات GDSC ومستودعات التآزر (على سبيل المثال ، SynergyDB و DrugComb) لتنظيم لوحة شاملة من تفاعلات خط الخلايا الدوائية ، بما في ذلك الخصائص الجزيئية (على سبيل المثال ، التعبير الجيني ، وتعديلات رقم النسخ) والاستجابات الدوائية31. كان الغرض الأساسي هنا هو التنبؤ الدقيق بحساسية الدواء في خطوط الخلايا ، و...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يعلن المؤلفون أنه لا يوجد تضارب في المصالح يتعلق بهذا العمل. نؤكد أن تقنية نموذج اللغة الكبيرة (LLM) (ChatGPT ، التي طورتها OpenAI) تم استخدامها بسعة محدودة خلال المراحل الأولى من إعداد المخطوطات. على وجه التحديد ، تم استخدام ChatGPT لتوليد الأفكار والعصف الذهني الأولي للأطر المفاهيمية ، والتي تم تحسينها لاحقا والتحقق من صحتها وإعادة كتابتها بالكامل من قبل المؤلفين. تم تنفيذ جميع المحتوى العلمي الأساسي وتحليل البيانات والتفسير والصياغة النهائية حصريا من قبل المؤلفين. تمت مراجعة مخرجات ChatGPT بشكل نقدي للتأكد من الدقة والتماسك والنزاهة قبل التضمين ، وفقا للمبادئ التوجيهية الشفافية والأخلاقية للمجلة. قام جميع المؤلفين بمراجعة النسخة النهائية من المخطوطة والموافقة عليها وأكدوا أنه لا توجد علاقات مالية أو شخصية أو مهنية يمكن تفسيرها على أنها تؤثر على محتوى هذا المنشور.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يقر المؤلفون بصدق بالدعم المؤسسي المقدم من قسم علوم الكمبيوتر بجامعة المسيح ، والذي سهل الموارد الحسابية والبيئة الأكاديمية اللازمة لإجراء هذا البحث. كما أننا ممتنون للتوجيه والتشجيع التعاوني الذي قدمه زملاؤنا ومرشدونا طوال فترة هذا العمل.

مساهمة المؤلف:
صمم ديوتي بانيرجي الدراسة وصمم المنهجية وقام برعاية مجموعة البيانات. قام كل من Sivaneasan Bala Krishnan و Kamal Upreti بتنفيذ نماذج التعلم الآلي وإجراء التحليل الحسابي. ساهم Sumegh Shrikant Tharewal و Uma Shankar في المعالجة المسبقة للبيانات وهندسة الميزات والتحقق من صحة النتائج. أجرى برافين كشيرساجار تحليل التآزر والتجميع القائم على PCA. ساعد مانوج كومار في مراجعة الأدبيات وتفسير النتائج وصياغة المخطوطات. ساهم جميع المؤلفين في مراجعة المخطوطة ، ووافقوا على النسخة النهائية ، ووافقوا على أن يكونوا مسؤولين عن جميع جوانب العمل.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
Autoencoder (نموذج التعلم العميق)TensorFlow (جوجل)https://www.tensorflow.orgتقليل الأبعاد وترميز الميزات لنمذجة الاستجابة للأدوية
بورتيزوميبسيليك للكيماوياتس 1013المخدرات المستخدمة في تحليل التآزر
داكتينومايسينسيجما ألدريتشد 1037المخدرات المستخدمة في تحليل التآزر
دوسيتاكسيلسيجما ألدريتشد1080الدواء المستخدم في التحقق من صحة التجميع القائم على الآلية
مكتبة Matplotlibفهرس حزمة بايثون (PyPI)https://matplotlib.orgتصور البيانات ورسمها في Python
مكتبة NumPyفهرس حزمة بايثون (PyPI)https://numpy.orgالحوسبة العددية وعمليات المصفوفة
باكليتاكسيلسيجما ألدريتشت7191الدواء المستخدم في التحقق من صحة التجميع القائم على الآلية
مكتبة الباندافهرس حزمة بايثون (PyPI)https://pandas.pydata.orgمعالجة البيانات ومعالجتها
بايثون 3.10مؤسسة برامج بايثونhttps://www.python.orgلغة البرمجة الأساسية
روميديبسينسيليك للكيماوياتS3020المخدرات المستخدمة في تحليل التآزر
مكتبة Scikit-learnفهرس حزمة بايثون (PyPI)https://scikit-learn.orgأدوات نمذجة التعلم الآلي والمعالجة المسبقة
مكتبة سيبورنفهرس حزمة بايثون (PyPI)https://seaborn.pydata.orgتصور البيانات والتخطيط الإحصائي
مكتبة SHAPفهرس حزمة بايثون (PyPI)https://shap.readthedocs.ioقابلية تفسير نموذج الذكاء الاصطناعي القابل للتفسير
بيانات التآزر (DrugComb)FIMM, فنلنداhttps://drugcomb.fimm.fiمجموعة البيانات المرجعية للتآزر الدوائي
بيانات التآزر (SynergyDB)جامعة جرونينجنhttps://synergy.bioinformatics.nlمجموعة البيانات المرجعية للتآزر الدوائي
TensorFlow 2.11جوجلhttps://www.tensorflow.orgتنفيذ نموذج التعلم العميق Autoencoder
فينبلاستينسيجما ألدريتشV1377المخدرات المستخدمة في تحليل التآزر
مكتبة XGBoostفهرس حزمة بايثون (PyPI)https://xgboost.readthedocs.ioنمذجة الانحدار المعززة للتدرج

المراجع

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Vamathevan, J., et al. Applications of machine learning in drug discovery and development. Nat Rev Drug Discov. 18 (6), 463-477 (2019).
  2. Dara, S., Dhamercherla, S., Jadav, S. S., Babu, C. M., Ahsan, M. J. Machine learning in drug discovery: a review. Artif Intell Rev. 55 (3), 1947-1999 (2022).
  3. Drug discovery for breast cancer based on big data analytics techniques. Constantine, R. M., Batouche, M. 5th International Conference on Information & Communication Technology and Accessibility (ICTA), Marrakech, Morocco, , (2015).
  4. Elbadawi, M., Gaisford, S., Basit, A. W. Advanced machine-learning techniques in drug discovery. Drug Discov Today. 26 (3), 769-777 (2021).
  5. Sarkar, C., et al. Artificial intelligence and machine learning technology-driven modern drug discovery and development. Int J Mol Sci. 24 (3), 2026(2026).
  6. Liao, M., et al. Small-molecule drug discovery in triple negative breast cancer: current situation and future directions. J Med Chem. 64 (5), 2382-2418 (2021).
  7. You, Y., et al. Artificial intelligence in cancer target identification and drug discovery. Signal Transduct Target Ther. 7 (1), 156(2022).
  8. Kolahi Azar, H., et al. The progressive trend of modeling and drug screening systems of breast cancer bone metastasis. J Bio Eng. 18 (1), 14(2024).
  9. Singh, A., et al. Coumarin as an elite scaffold in anti-breast cancer drug development: design strategies, mechanistic insights, and structure-activity relationships. Biomedicines. 12 (6), 1192(2024).
  10. Baptista, D., Ferreira, P. G., Rocha, M. Deep learning for drug response prediction in cancer. Brief Bioinform. 22 (1), 360-379 (2021).
  11. Priya, S., et al. Machine learning approaches and their applications in drug discovery and design. Chem Biol Drug Des. 100 (1), 136-153 (2022).
  12. Ferraro, E., et al. Accelerating drug development in breast cancer: new frontiers for ER inhibition. Cancer Treat Rev. 109, 102432(2022).
  13. Arvindekar, A., et al. Unveiling promising bioactives for breast cancer: a novel approach for herbal-based drug discovery. Phytochem Rev. 24, 3221-3264 (2024).
  14. Vatansever, S., et al. AI- and ML-aided drug discovery in CNS diseases: state-of-the-art and future directions. Med Res Rev. 41 (3), 1427-1473 (2021).
  15. Nayarisseri, A., et al. Artificial intelligence, big data, and machine learning approaches in precision medicine and drug discovery. Curr Drug Targets. 22 (6), 631-655 (2021).
  16. Eckhardt, B. L., et al. Strategies for the discovery and development of therapies for metastatic breast cancer. Nat Rev Drug Discov. 11 (6), 479-497 (2012).
  17. Optimizing drug discovery for breast cancer in a laboratory environment using machine learning. Borkhade, G., et al. 2024 International Conference on Wireless Communications Signal Processing and Networking (WiSPNET), Chennai, India, , (2024).
  18. Rakhshaninejad, M., et al. Refining breast cancer biomarker discovery and drug targeting through an advanced data-driven approach. BMC Bioinformatics. 25 (1), 33(2024).
  19. Nagaraj, B. S., et al. Vitamin D analog calcitriol for breast cancer therapy; an integrated drug discovery approach. J Biomol Struct Dyn. 41 (20), 11017-11043 (2023).
  20. Jernström, S., et al. Drug-screening and genomic analyses of HER2-positive breast cancer cell lines reveal predictors for treatment response. Breast Cancer Targets Ther. 9, 185-198 (2017).
  21. Witt, B. L., Tollefsbol, T. O. Molecular, cellular, and technical aspects of breast cancer cell lines as a foundational tool in cancer research. Life. 13 (12), 2311(2023).
  22. Gruener, R. F., et al. Facilitating drug discovery in breast cancer by virtually screening patients using in vitro drug response modeling. Cancers. 13 (4), 885(2021).
  23. Song, J., et al. The discovery of new drug-target interactions for breast cancer treatment. Molecules. 26 (24), 7474(2021).
  24. Costa, R., et al. Targeting EGFR in triple negative breast cancer: new discoveries and insights. Cancer Treat Rev. 53, 111-119 (2017).
  25. Cardoso, F., et al. Bortezomib (PS-341, Velcade) increases the efficacy of trastuzumab (Herceptin) in HER2-positive breast cancer cells synergistically. Mol Cancer Ther. 5 (12), 3042-3051 (2006).
  26. Santo, L., et al. Preclinical activity of a selective HDAC6 inhibitor, ACY-1215, in combination with bortezomib in multiple myeloma. Blood. 119 (11), 2579-2589 (2012).
  27. Martin, M., et al. Activity of docetaxel, carboplatin, and doxorubicin in patient-derived TNBC xenografts. Sci Rep. 11, 7064(2021).
  28. Iorio, F., et al. A landscape of pharmacogenomic interactions in cancer. Cell. 166 (3), 740-754 (2016).
  29. Kuenzi, B. M., et al. Predicting drug response and syn enhances antitumor efficacy in TNBC xenografts. Oncotarget. 10, 25184-25198 (2019).
  30. Kuenzi, B. M., et al. Predicting drug response and synergy using a deep learning model of human cancer cells. Cancer Cell. 38 (5), 672-684.e6 (2020).
  31. XGBoost: a scalable tree boosting system. Chen, T., et al. Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, San Francisco, California, USA, , (2016).
  32. A unified approach to interpreting model predictions. Lundberg, S. M., Lee, S. -I. 31st Conference on Neural Information Processing Systems (NIPS 2017), Long Beach, CA, USA, , (2017).
  33. Preuer, K., et al. DeepSynergy: predicting anti-cancer drug synergy with deep learning. Bioinformatics. 34 (9), 1538-1546 (2018).
  34. Contextualizing explainable machine learning for clinical end use. Tonekaboni, S., et al. Proceedings of the 4th Machine Learning for Healthcare Conference, Ann Arbor, Michigan, , (2019).
  35. Barretina, J., et al. The Cancer Cell Line Encyclopedia enables predictive modelling of anticancer drug sensitivity. Nature. 483, 603-607 (2012).
  36. Malyutina, A., et al. Drug combination sensitivity scoring facilitates discovery of synergistic drug combinations in cancer. PLoS Comput Biol. 15 (5), e1006752(2019).
  37. Menden, M. P., et al. Machine learning prediction of cancer cell sensitivity to drugs. PLoS One. 8 (4), e61318(2013).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

Breast CancerDrug DiscoveryMachine LearningDrug SensitivityXGBoost ModelAutoencoder PipelineDrug SynergySHAP AnalysisPrecision OncologyPharmacological Clustering

مقالات ذات صلة