مقالة منهجية

التنبؤ بالتعلم الآلي لبروتينات تبديل المجال ثلاثي الأبعاد في النباتات الطبية

DOI:

10.3791/68519

أغسطس 15, 2025

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تفحص هذه الدراسة البروتينات المشاركة أو المتوقع أن تشارك في مبادلة المجال ثلاثي الأبعاد من جينومات النباتات الطبية المختلفة. يستخدم نماذج التعلم الآلي للتنبؤ بدقة ببروتينات تبديل المجال ثلاثية الأبعاد وتوقع وظائفها وصلتها بإنتاج مستقلبات المستقلب الثانوية.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

مبادلة المجال ثلاثية الأبعاد هي ظاهرة هيكلية بروتينية تتبادل فيها وحدتان فرعيتان أو أكثر من البروتين وحدات فرعية هيكلية متطابقة وتشكل قلة القلة. تلعب البروتينات التي تظهر مبادلة المجال ثلاثي الأبعاد دورا مهما في الوظائف البيولوجية المختلفة ، مثل التخليق الحيوي للمستقلبات الثانوية ، وفي التعامل مع العديد من الضغوط الحيوية واللاأحيائية في النباتات الطبية. تبحث هذه الدراسة في القدرة على التنبؤ بأنماط مبادلة المجال ثلاثية الأبعاد بين جينومات النباتات الطبية باستخدام نماذج مصنفات الغابات العشوائية وأقرب الجار K ، مما يدل على دقة 91.6٪ و 88.7٪ على التوالي. تم التنبؤ بما مجموعه 420 (31٪) من التسلسلات على أنها متورطة في مبادلة المجال ثلاثية الأبعاد. كما تم إجراء تحقيق تخصيب على تسلسلات البروتين ثلاثية الأبعاد المتوقعة من مختلف النباتات الطبية للتعليق التوضيحي للوظيفة بناء على مصطلحات علم الوجود الجيني (GO) ، وتحليل مسارات موسوعة كيوتو للجينات والجينومات (KEGG) ، وتوزيع مجالها في مسارات التخليق الحيوي للمستقلبات الثانوية. يستنتج التعليق التوضيحي الوظيفي للتسلسلات المتوقعة أن التسلسلات المتبادلة للمجال ثلاثي الأبعاد كانت متورطة في وظائف جزيئية متنوعة مثل نقل الإلكترون الضوئي في نظام الصور الثاني وناقلات الإلكترون ، ونقل الإلكترونات داخل مسار نقل الإلكترون الدوري لنشاط التمثيل الضوئي ، والفسفرة المؤكسدة ، والتنظيم الجيني للضغوط البيئية (الحيوية وغير الأحيائية) عن طريق تصنيع المستقلبات الثانوية (التربينويدات ، قلويدات وبولي أمين). تؤكد هذه النتائج على قدرة التعلم الآلي على التنبؤ بمشاركة البروتينات في ظاهرة تبديل المجال ثلاثي الأبعاد ، ووظيفة كل منها ، وقدرتها على تسهيل اكتشاف الأدوية ومبادرات الهندسة الحيوية.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

أحدثت الأساليب الحسابية ثورة في أبحاث البروتين من خلال تمكين التحليل التفصيلي والتنبؤات حول هياكل البروتين ووظائفه وتفاعلاته. يعد التحديد الدقيق لوظائف البروتين وتوضيحها أمرا ضروريا لكشف الآليات الجزيئية للحياة ويحمل أهمية عميقة للتقدم في الطب وتطوير الأدوية. ومع ذلك ، فإن التعقيد والتكلفة المتأصلة في الطرق التجريبية تحد من قابليتها للتوسع لاستيعاب بيانات التسلسل الكبيرة. نتيجة لذلك ، ظهر تطوير الأساليب الحسابية للتنبؤ بوظيفة البروتين كمجال محوري في البيولوجيا الحسابية والجزيئية ، ومعالجة هذه الفجوة من خلال مناهج مبتكرة واسعةالنطاق 1.

مبادلة المجال ثلاثية الأبعاد2 هي ظاهرة هيكلية في البروتينات حيث يتم تبادل أجزاء من بنية مشتركة بين السلاسل الفردية. في عام 1994 ، تم العثور على الوثائق التمهيدية حول آلية مبادلة المجال ثلاثي الأبعاد في ثنائي توكسين الخناق3. ومع ذلك ، يمكن إرجاع المبادئ الأساسية لمبادلة المجال ثلاثي الأبعاد إلى أربعة عقود. لوحظ أن ريبونوكلياز البنكرياس البقري A (RNase A) يشكل ثنائيات أثناء التجميد في حمض الخليك ، من خلال تجارب التعديل الكيميائي المعقدة4. في قلة البروتين ، تتبادل سلسلتان أو أكثر من سلاسل البروتين العناصر الهيكلية المتطابقة من خلال مناطق مفصلية مرنة. يشار إلى جزء البروتين المتبادل بين الوحدات الفرعية الأحادية باسم المجال المبدل ، والذي قد يتكون من مجال كروي كامل أو حلقة أو عنصر هيكلي ثانوي في بروتينات معينة. على العكس من ذلك ، تسمى المناطق التي تظل دون تغيير في مواقعها الأصلية داخل المونومرات المجالات غير المبدلة5. يتم تعريف الاقتران بين المجالات غير المبدلة على أنه واجهة مجال غير مبدلة (NSDI) كما هو موضح في الشكل 1. في مبادلة المجال ثلاثي الأبعاد ، يشار إلى العلاقة بين المجال غير المبدل لوحدة فرعية بروتينية واحدة والمجال الذي تم تبديله بالفعل لوحدة فرعية أخرى باسم واجهة المجال المبدلة (SDI). جانب آخر مهم لهذه الظاهرة هو منطقة المفصلات ، وهي قطعة رابط مرنة تربط بين المجالات غير المبدلة والمبدلة. تلعب منطقة المفصلات هذه وظيفة أساسية في المساعدة على حركة تبديل المجال ثلاثي الأبعاد وتعمل كمحول توافقي ، مما يتيح إعادة التكوين الهيكلي اللازمة لتبديل المجال. تورط مبادلة المجال ثلاثي الأبعاد في عمليات بيولوجية مختلفة ، بما في ذلك تجميع البروتين والتنظيم الوظيفي5. كما أنه يرتبط ببعض أمراض البروتين الخاطئة ، حيث يمكن أن يؤدي التبديل الشاذ إلى تكوين مجاميع أو ألياف أميلويد.

figure-introduction-1
الشكل 1: التمثيل الهيكلي لمبادلة المجال ثلاثية الأبعاد. يوضح التمثيل تبادل العناصر الهيكلية المتطابقة بين اثنين من مونومرات البروتين عبر منطقة مفصلية مرنة ، مما يؤدي إلى تكوين مجموعة ثنائية أو قليلة القلة متبادلة بالمجال الرجاء النقر هنا لعرض نسخة أكبر من هذا الشكل.

تم تحديد أنواع مختلفة من مبادلة المجال ثلاثية الأبعاد بناء على طبيعة المجالات المبدلة والهياكل القلة الناتجة6. في عام 2002 ، حدد أيزنبرغ وزميلهم ثلاثة أنواع من مبادلة المجال ثلاثي الأبعاد: مبادلة المجال الحقيقي (BDS) ، ومبادلة شبه المجال (QDS) ، والمرشح لمبادلة المجال ثلاثي الأبعاد (CDS)7. فئة البروتين الأكثر شيوعا هي مبادلة المجال حسن النية. يشير إلى الحالة التي توجد فيها جزيئات الثنائي والمونومر في شكل مستقر ، حيث من المفترض أن يتبنى الثنائي تكوينا مبدلا بالمجال بينما من المفترض أن يتبنى المونومر تكوينا مغلقا. في مبادلة المجال شبه ، من المعروف أن البروتين موجود في حالة القلة ، ولكن من المعروف أن هيكله المتماثل موجود في الحالة الأحادية. في CDS ، يؤكد فقط تصنيف البروتين ضمن فئات تبديل المجال ، في حين أن المعلومات الهيكلية للمونومرات المعنية أو متماثلاتها الأحادية غيرموجودة 8. في هذا الإجراء ، تكون المونومرات أو متماثلاتها الأحادية غائبة. بدلا من ذلك ، توجد جزيئات البروتين غير المتجانسة. ويبين الجدول 1 مثالا على هذه الفئات الثلاث9.

الجدول 1: أنواع تبديل المجال ثلاثي الأبعاد مع المثال. الرجاء النقر هنا لتنزيل هذا الجدول.

كشفت الدراسات اللاحقة عن العديد من الهياكل التي تم تبديلها بالمجال ، مما يمهد الطريق لفهم مفهوم مبادلة المجال ثلاثي الأبعاد. لوحظ أقدم دليل هيكلي يدعم هذه الظاهرة في جزيء بروتين المثبط Cro من العاثية λ ، والذي يشكل بنية ثنائية من خلال تبادل خيوطه الطرفية C. في عام 1996 ، وجد الباحث أن جزيء Cro الأحادي كان متورطا في تبادل المجالثلاثي الأبعاد 10. كما تم الإبلاغ عن الهيكلالآخر 11 ، مثل βB2-crystallin12 ، و CksHs 2البشري 13 ، وكبد البقركاتالاز 14 ، والإنترلوكين البشري المؤتلف -515 ، كهياكل محتملة ثلاثية الأبعاد متبادلة المجال. بناء على موضع المجال المبدل داخل جزيئات البروتين ، يتم تصنيف تبديل المجال ثلاثي الأبعاد إلى ثلاثة أنواع: مبادلة المجال الطرفي C ، ومبادلة المجال الطرفي N ، ومبادلة المجال المركزي النادرة نسبيا. يستخدم المؤلفون جينوم بشري كامل للتنبؤ بحالة مبادلة المجال. يستخدمون الغابة العشوائية وآلة ناقلات الدعم كمصنفات ثنائية بدقة 81.7٪ و 73.9٪ على التوالي. تم التنبؤ بما يقرب من 44٪ من تسلسل البروتين على أنه مجال ثلاثي الأبعاد في الجينوم البشري6. تم إجراء تحليل التخصيب على الحالات المتوقعة لتوزيعها في المجال وتوزيع المرض والتعليق التوضيحي الوظيفي بناء على علم الوجود الجيني (GO). يبحث نهج آخر في التحليل الكامل على مستوى الجينوم ل Ocimum tenuiforum باستخدام نهج الغابة العشوائية ووجد أن ما يقرب من 25٪ من تسلسلات البروتين في Ocimum tenuiforum من المتوقع أن تشارك في مبادلة المجال ثلاثية الأبعاد. يقوم الباحثون أيضا بإجراء تعليق توضيحي وظيفي باستخدام ارتباط مصطلح GO وارتباط عائلة مجال البروتين الخاص بهم ووجدوا أن 1158 تسلسلا فقط كانت متورطة في الإجهاد اللاأحيائي16.

تظهر النباتات مجموعة متنوعة من عائلات البروتين المميزة ، مع بروتينات محددة معترف بها لقدرتها على الخضوع لإعادة الترتيب الهيكلي ، بما في ذلك تبديل المجال ثلاثي الأبعاد. قد يؤثر تبديل المجال ثلاثي الأبعاد على ظروف الإجهاد الحيوي واللاأحيائي مع إنتاج مستقلبات ثانوية أو مسارات أخرى ذات صلة بيولوجيا تحمل العديد من التطبيقات الدوائية. لذلك ، فإنها توفر تركيزا كبيرا لهذا التحقيق. أظهر التركيب البلوري ل Wal1 تكوينا ثنائيا متبادلا للمجال ، يضم ثنائيتين داخل الوحدة غير المتماثلة وإعادة الترتيب الهيكلي الموجود في السيستاتين C. تلعب Phytocystatins دورا مهما في الإجهاد اللاأحيائي ، كما أنها تحسن مقاومة المحاصيل. تم تحديد ما مجموعه 20,121 بروتينات متوقعة ثلاثية الأبعاد متبادلة المجال من الأدبيات المتاحة ومن مختلف المستودعات ذات الصلة ، منها 17,552 من أصل نباتي و 2569 من الكائنات غير النباتية17,18.

في الأدبيات ، تم الإبلاغ عن أمثلة أخرى مختلفة للتنبؤ بمبادلة المجال ثلاثي الأبعاد للنباتات المختلفة باستخدام نهج التعلم الآلي. مثل نبات الأرابيدوبسيس thaliana الذي يظهر 33.7٪ (4058 من أصل 12,033 تسلسلا تمت مراجعته) ، و Medicago truncatula 20.9٪ (39 من أصل 186 تسلسلا تمت مراجعته) ، و Solanum tuberosum 36.5٪ (146 من أصل 400 تسلسل تمت مراجعته) ، و Solanum lycopersicum 25.5٪ (108 من أصل 423 تسلسلا تمت مراجعته) ، و Ocimum tenuiforum 15.5٪ (5706 من أصل 36841 تسلسلا تمت مراجعته)6. أصبحت الأساليب الحسابية لا تقدر بثمن في استكشاف الجوانب الهيكلية والوظيفية للبروتينات ثلاثية الأبعاد التي تم تبديلها بالمجال. تسهل هذه الأساليب التنبؤ بالتسلسلات على أساس أفضل الميزات الممكنة19 ، والتعليق التوضيحي ، وتحليل التخصيب ، مما يوفر رؤى حول الآليات الجزيئية الأساسية. تم التنبؤ بمبادلة المجال ثلاثي الأبعاد في تسلسلات البروتين المختلفة باستخدام مصنف قائم على آلة ناقلات الدعم (SVM). تم تطوير هذا النهج من خلال دمج التسلسل والميزات الهيكلية ، مما أدى إلى دقة تنبؤ بنسبة 76.33٪ على مجموعة بيانات التدريب و 73.81٪ على مجموعة بيانات الاختبار ، مما يدل على قدرته على تحديد ميول مبادلة المجال في البروتينات20. السبب الرئيسي لاختيار KNN على SVM هو أن KNN لديها عملية تدريب أبسط بكثير. يحتاج فقط إلى معلمة رئيسية واحدة ، K (هو عدد أقرب الجيران الذين يتم أخذهم في الاعتبار عند إجراء تنبؤ) ، ليتم تعيينها ، بينما يتطلب SVM ضبطا دقيقا للعديد من المعلمات مثل نوع kernel و C و gamma. بالإضافة إلى ذلك ، تتعامل KNN مع التصنيف متعدد الفئات بسهولة أكبر ، بينما تحتاج SVM عادة إلى استراتيجيات أكثر تعقيدا ، مثل استراتيجيات واحد مقابل واحد.

التعلم الآلي للتنبؤ الهيكلي للبروتين
يتضمن التنبؤ ببنية البروتين الاستدلال على الشكل ثلاثي الأبعاد للبروتين من تسلسل FASTA الخاص به. كانت التطورات الحديثة في هذا المجال مدفوعة بشكل كبير بتطبيق تقنيات التعلم الآلي المختلفة على البيانات التطورية21،22. اعتمدت الأساليب المبكرة لاستخراج المعلومات من البيانات التطورية المشتركة على طرق التعلم الآلي. غير أن الاستراتيجيات الحديثة، ولا سيما تلك التي تستخدم الشبكات المتبقية العميقة، أظهرت أداء متفوقا في التنبؤ بالهدف23 المحتمل. Alphafold هي قاعدة بيانات قائمة على التعلم العميق ، في حين أن Rosetta هي أداة وظائف الطاقة القائمة على الفيزياء. تستخدم هذه الأدوات للتنبؤ بالبنية الذرية ثلاثية الأبعاد الكاملة التي يمكن تقريبها من الهياكل التجريبية. إنها توفر فقط إحداثيات هيكلية للدقة الذرية ، لكن هذه الأدوات لا تحدد أحداث مبادلة المجال ثلاثي الأبعاد. في المقابل ، فإن النهج المقترح ليس متنبئا كاملا بهيكل ثلاثي الأبعاد بدلا من ذلك ، فهو يتنبأ فقط بما إذا كان من المحتمل أن يخضع البروتين لمبادلة المجال ثلاثي الأبعاد أملا 24،25.

تم استخدام النباتات الطبية لعدة قرون كموارد طبيعية للوقاية من الأمراض المختلفة وعلاجها ، تعزى إلى مركباتها النشطة بيولوجيا. إنها ضرورية في الطب التقليدي وتساهم في تطوير الأدوية الصيدلانية الحديثة. ومع ذلك ، لم يتم تنفيذ أي عمل كبير في مجال مبادلة مجال البروتين للنباتات الطبية لاكتشاف الأدوية. تتعرف الخوارزميات ، بما في ذلك التعلم الآلي ونماذج مجموعتها ، على الأنماط والعلاقات في بيانات التسلسل للتنبؤ بتبديل المجال ثلاثي الأبعاد. السبب وراء اختيار النباتات الطبية لهذه الدراسة هو أنها يمكن أن تكتشف التنوع الوظيفي للبروتين في النباتات المشاركة في تبديل المجال ثلاثي الأبعاد ، مما يؤدي إلى فهم الاستجابة للإجهاد ، والدفاع عن مسببات الأمراض ، والتخليق الحيوي الأيضي. تسلط التحديات التقنية المرتبطة بتحديد مبادلة مجال البروتين ثلاثي الأبعاد بأعداد كبيرة ومطابقات قليلة القلة المعقدة والمتقدمة باستخدام تقنيات الرنين المغناطيسي النووي أو علم البلورات الضوء على ضرورة تطوير مناهج حسابية متقدمة.

الهدف العام من العمل البحثي المقترح هو استخدام منهجية حسابية باستخدام خوارزميات Random Forest (RF) 26 و K-nearest neighbor (KNN) 27 لمهمة التنبؤ بهيكل تسلسل البروتين والتحليل الكامل على مستوى الجينوم للحالات التي تم تبديلها في تسلسلات النباتات الطبية المختلفة. الغابة العشوائية (RF) هي مصنف ثنائي. إنها خوارزمية تعلم آلي قوية ومتعددة الاستخدامات تستخدم على نطاق واسع في تحليل تسلسل البروتين. إنه يعمل من خلال بناء مجموعة من أشجار القرار (DT) ويحقق دقة عالية جدا في كل من مجموعات بيانات التدريب والاختبار. بالنسبة لمهام تسلسل البروتين ، يمكن للترددات اللاسلكية تحليل مجموعة متنوعة من الميزات ، بما في ذلك الخصائص الفيزيائية والكيميائية ، وتكوين التسلسل ، والبنية الثانوية ، والمعلومات التطورية المشتقة من محاذاة التسلسل أو ملفات التعريف. إنه يتفوق في التعامل مع مجموعات البيانات الكبيرة والصاخبة ويوفر مقاييس أهمية الميزة28. مصنف K-Nearest Neighbours (KNN) هو خوارزمية تعلم آلي بسيطة ولكنها فعالة يتم تطبيقها على نطاق واسع في تحليل تسلسل البروتين. إنه يعمل عن طريق تصنيف تسلسل الإدخال بناء على فئة الأغلبية من أقرب جيرانها k في مساحة الميزة. في تحليل تسلسل البروتين ، يمكن استخدام KNN للتنبؤ بالفئات الوظيفية والخصائص الهيكلية والتوطين الخلوي الفرعي. غالبا ما تتضمن ميزات تصنيف KNN تكوين الأحماض الأمينية أو زخارف التسلسل أو الملامح التطورية أو السمات الفيزيائية والكيميائية. KNN هو خيار شائع لتحليل البروتين بسبب بساطته. قابلية التفسير والفعالية تجعله أداة قيمة لتحليل تسلسل البروتين29. توفر هذه الخوارزميات معا نقاط قوة تكميلية ، مما يتيح إطارا حسابيا شاملا لدراسة مبادلة المجال ثلاثي الأبعاد في تسلسلات النباتات الطبية المختلفة. يتنبأ هذان النموذجان فقط بالحالات المحتملة التي قد تخضع لمبادلة المجال. لا يتنبأ بالإحداثيات الهيكلية ثلاثية الأبعاد الكاملة أو أي جزء أو بقايا تشارك بشكل خاص في عملية التبديل هذه. هذه مسألة مزيد من البحث ، حيث أن تحديد مناطق أو بقايا معينة تشارك في المبادلة لتوضيح الآلية والجوانب الوظيفية لمبادلة المجال ثلاثية الأبعاد events.3D تشتمل مبادلة المجال على مجموعة متنوعة من الظواهر المتميزة هيكليا ، مثل تكوينات الحلقة المغلقة ، والمقايضات المفتوحة ، والاختلافات الأخرى التي تشمل مناطق مفصلات مختلفة وبنى مجال. في ضوء ذلك ، يصنف النهج المقترح فقط جميع أنواع أحداث تبديل المجال ثلاثية الأبعاد تحت تصنيف موحد. كان هذا التحديد مدفوعا في البداية بالتوافر المحدود للبيانات المشروحة التي يمكنها تحديد فئة معينة من تبديل المجال ثلاثي الأبعاد. هذا هو النوع الأول من المحاولات على مجموعات البيانات النباتية الطبية المختلفة ، ونشعر أن التمييز بين آليات المبادلة المختلفة يمكن أن يعزز الدقة التنبؤية للنموذج.

يساعد تحليل التخصيب في النباتات الطبية على تحديد الجينات والبروتينات والمسارات الرئيسية المشاركة في تخليق المركبات النشطة بيولوجيا والاستجابة للإجهاد. يوفر نظرة ثاقبة على الآليات الجزيئية. تبحث هذه التحليلات في النباتات الطبية في الجينات والبروتينات والعمليات البيولوجية الأساسية المرتبطة بتخليق المواد الكيميائية النشطة بيولوجيا ومرونة الإجهاد ومقاومة الأمراض. يكشف التعليق التوضيحي الوظيفي للبروتينات المختارة ، مثل علم الوجود الجيني (GO) وتحليل مسار KEGG ، عن الآليات الجزيئية الكامنة وراء إنتاج مستقلبات المستقلبات الثانوية واستجابات الإجهاد البيئي. يساعد هذا النهج بشكل كبير في اكتشاف الأدوية ، ويحسن مرونة المحاصيل ، ويوضح مسارات التمثيل الغذائي للنباتات من أجل الزراعة المستدامة والتطورات الطبية.

مساهمات جديدة للدراسة
تسلط هذه الدراسة الضوء على قدرات التعلم الآلي على الترويج لنماذج أكثر دقة وكفاءة للتنبؤ بالأنماط الهيكلية للبروتين في مجموعات البيانات البيولوجية.

يدمج هذا البحث ميزات جديدة في خوارزميات التعلم الآلي ، مما يحسن قدرتها على التنبؤ بوظائف البروتين بوضوح أكبر. توفر هذه الميزات فهما محسنا للعلاقات بين بنية البروتينات ووظيفتها ، مما يساعد في تصميم أكثر دقة للبروتين وتحسينه في هندسة البروتين.

يساعد تحليل التخصيب للبروتينات المتوقعة على اكتشاف المسارات البيولوجية الرئيسية والعملية الخلوية والوظائف الجزيئية التي توفر أهدافا قيمة لاكتشاف المؤشرات الحيوية وتصميم الأدوية وفهم آلية المرض. يعزز هذا التحليل الدقة في التدخلات القائمة على المسارات وتحديد الأهداف العلاجية.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ملاحظة: يقدم هذا الجزء مخططا شاملا للمنهجية المقترحة، والتي تشمل ست خطوات أولية: (أ) جمع البيانات، (ب) اختيار الخصائص، (ج) المعالجة المسبقة للبيانات، (د) المعالجة اللاحقة للبيانات، (ه) وضع النموذج، (و) تقييم نتائج النموذج المقترح، (ز) تحليل الإثراء على مستويات مختلفة من التسلسلات المتوقعة إيجابيا. Core i5-10500 هو معالج من الجيل العاشر تم استخدامه في هذا العمل البحثي. يحتوي على ستة نوى و 12 خيطا ، بتردد أساسي يبلغ 3.10 جيجاهرتز وسرعة توربو قصوى تبلغ 4.50 جيجاهرتز. يأتي مزودا بذاكرة تخزين مؤقت ذكية بسعة 12 ميجابايت من Intel ، ويدعم ذاكرة DDR4-2666 ، ويتضمن UHD Graphics 630 للمرئيات المدمجة. تم تصميمه لتعدد المهام والإنتاجية بكفاءة ، وهو متوافق مع مقبس LGA 1200 ويعمل بقدرة 65 وات TDP.

1. جمع البيانات

  1. Use3d3dswap-pred (https://caps.ncbs.res.in/3dswap-pred/3dswap-pred.html) و 3DSwap + (https://caps.ncbs.res.in/3Dswapplus/index.html)3030 الجدول التكميلي 1 ، الجدول التكميلي 2 ، الملف التكميلي 1 ، الملف التكميلي 2). استخدم ما مجموعه 573 إدخالا من إدخالات PDB منسقة يدويا لجزيئات ثلاثية الأبعاد مبدلة المجال ، بشكل أساسي من النباتات الطبية.
  2. استخدم طريقة أفضل ملف تعريف تمثيلي (BRP) لإنشاء مجموعة البيانات السلبية عن طريق تعيين أفضل تسلسل تمثيلي (BRS) لكل عائلة بروتين Pfam31 (http://pfam.xfam.org/). ابحث في ما مجموعه 10,112 تسلسلا هيكليا مقابل جميع Pfam BRPs باستخدام HMMER32 (https://www.ebi.ac.uk/Tools/hmmer/) مع عتبة قيمة E تبلغ 0.001. قم بمعالجة التسلسل الناتج باستخدام الاتصال الهاتفي لتحديد المجالات الهيكلية (https://bioinformaticshome.com/db/tool/DIAL). قم بتضمين 575 إدخالا PDB كمجموعة بيانات سلبية (تدريب).
  3. قم بتضمين 314 تسلسلا بروتينا مشتقا من خلال طريقة BRP و 261 تسلسلا منسقا يدويا غير ثلاثي الأبعاد تم تبديله بواسطة 3DSwap + كمجموعة بيانات سلبية.
  4. استرجع ما مجموعه 1,355 إدخالا لتسلسل البروتين تمت مراجعته من نباتات طبية مختلفة من UniProt33 (https://www.uniprot.org/). قم بتضمين 13 نباتا طبيا في هذه الدراسة (مجموعة بيانات الاختبار / التنبؤ): الحمضيات الصينية (RS-102) ، Vitis vinifera (RS-226) ، النعناع (RS-28) ، القنب ساتيفا (RS-21) ، Acorus clamus (RS-511) ، Coffea arabica (RS-104) ، Papaver somniferum (RS-58) ، الكركديه (RS-88) ، الياسمين (RS-89) ، الزعتر (RS-30) ، الغدة الصعترية (RS-14) ، Illicium oligandrum (RS-72) ، والليمون الحمضي (RS-12). يتم إعطاء شجرة النشوء والتطور في الشكل التكميلي 1.

2. استخدام ميزة إنشاء النموذج

  1. استخدم مجموعة ميزات شاملة تتكون من 453 ميزة للتنبؤ بتسلسل البروتين في النباتات الطبية. قم بتضمين 439 ميزة راسخة و 16 ميزة جديدة ، تم اختيارها بعناية بناء على مراجعة شاملة للأدبيات.
  2. استخدم قاعدة بيانات AAindex34 (https://www.genome.jp/aaindex/) لتحديد الخصائص الفيزيائية والكيميائية للأحماض الأمينية. قم بتطبيق منصة التعلم الآلي WEKA35 (https://www.waikato.ac.nz/int/research/institutes-centres-entities/institutes/artificial-intelligence-institute/research/software/) لاختيار الميزات. راجع الجدول 2 للاطلاع على الميزات المدمجة حديثا.

الجدول 2: قائمة الميزات المضافة حديثا مع أوصافها. يلخص هذا الجدول الميزات الجديدة التي تم تصميمها خلال مرحلة استخراج الميزات لتحسين أداء النموذج في التنبؤ بتبديل المجال ثلاثي الأبعاد. تلتقط كل ميزة خصائص محددة قائمة على التسلسل أو فيزيائية وكيميائية أو هيكلية للبروتينات التي يفترض أنها تؤثر على ميلها لمبادلة المجال. يتم توفير أوصاف مفصلة لتوضيح الأهمية البيولوجية والاشتقاق الحسابي لكل ميزة. الرجاء النقر هنا لتنزيل هذا الجدول.

3. المعالجة المسبقة واللاحقة للبيانات

ملاحظة: المعالجة المسبقة للبيانات. تعد المعالجة المسبقة للبيانات خطوة أساسية في التعلم الآلي تتضمن إعداد البيانات الأولية للتحليل. يتضمن ذلك تنظيف البيانات (على سبيل المثال ، إزالة التكرارات ، ومعالجة القيم المفقودة ، وما إلى ذلك).

  1. استخدم ملف الترميز التكميلي 1 لتشفير المتغيرات الفئوية في شكل رقمي ، والذي يتضمن أربع خطوات رئيسية: (1) تحديد إملاءات النتيجة ، (2) معالجة تسلسل fasta بواسطة seq I0. تحليل ، (3) إنشاء إطار بيانات ، (4) التحليل العددي للميزات ثلاثية الأبعاد التي تم تبديلها بالمجال.
  2. صقل وتفسير مخرجات النموذج من خلال المعالجة اللاحقة للبيانات. أعد معايرة التنبؤات وتجميع النتائج وتطبيق حد للتصنيف. تصنيف مجموعة بيانات مبادلة المجال ثلاثي الأبعاد ثنائي النمط باستخدام قيمة عتبة β = 0.5 (النطاق 0-1) ، كما تدعمه الدراسات السابقة36،37،38.
  3. قسم مجموعة البيانات بتقسيم اختبار القطار بنسبة 70:30 ، مع تخصيص 70٪ للتدريب النموذجي و 30٪ للتقييم المستقل.
  4. توحيد بيانات التدريب باستخدام طريقة Standard Scaler لضبط قيم الميزات إلى متوسط 0 وانحراف معياري 1 ، مما يضمن توافقا أفضل مع مقدرات التعلم الآلي. قم بإجراء تحديد الميزات لتحديد المتغيرات الأكثر تأثيرا.
    ملاحظة: يعد توحيد مجموعة البيانات شرطا أساسيا مستخدما على نطاق واسع للعديد من خوارزميات التعلم الآلي لضمان الأداء الأمثل. يمكن أن تؤثر البيانات البعيدة عن التوزيع الطبيعي سلبا على أداء نماذج التعلم الآلي39.
  5. قم بالتحقق. لضمان تقييم نموذج قوي وغير متحيز ، تم أيضا تنفيذ التحقق المتبادل K-fold الجدول التكميلي 3.
  6. قسم مجموعة البيانات إلى مجموعات فرعية K. قم بتدريب النموذج وتقييمه بشكل متكرر على مجموعات فرعية K = 5 أثناء استخدام المجموعة الفرعية المتبقية للاختبار المستقل.

4. إنشاء وتنفيذ النموذج

  1. تنفيذ خوارزميات الغابة العشوائية (RF) وK-Nearest Neighbours (KNN) وضبطها لتحسين الأداء التنبؤي. قم بتدريب النماذج والتحقق من صحتها واختبارها باستخدام 573 و 575 تسلسل بروتيني للتدريب ، و 1,355 تسلسل بروتيني للاختبار.
  2. استخدم برنامج Python النصي (ملف الترميز التكميلي 1) لاستخراج قيم الميزات الرقمية بناء على تسلسل البروتين المحدد. احفظ هذه القيم الرقمية لكلتا مجموعتي البيانات في ملفات CSV وأرسلها إلى مصنفات الترددات اللاسلكية وKNN لإنشاء نموذج التصنيف الثنائي.
  3. استخدم هذه النماذج للتمييز بين البروتينات ثلاثية الأبعاد التي يتم تبديل المجال وغير ثلاثي الأبعاد. راجع الشكل 2 والشكل 3 للحصول على إطار العمل المعمم للتنبؤ بتبديل المجال ثلاثي الأبعاد.
  4. قم بتطبيق المعلمات الفائقة مثل n_estimators = 20 و max_depth = 4 و random_state = 42 لنموذج التردد اللاسلكي.
  5. قم بتطبيق المعلمة الزائدة المجاورة = 5 لنموذج مصنف KNN.
    ملاحظة: تم ضبط إعدادات المعلمات هذه لتحسين أداء النماذج على مجموعة بيانات النباتات الطبية المنسقة يدويا.

figure-protocol-1
الشكل 2: تمثيل تخطيطي توضيحي. يعرض التمثيل نماذج التعلم الآلي Random Forest و K-Nearest Neighbor (KNN) ، ويعرض هيكلها الخوارزمي وسير العمل الوظيفي في سياق مهام التصنيف الثنائي الرجاء النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-protocol-2
الشكل 3: سير العمل القائم على التعلم الآلي. يوضح الرسم التخطيطي سير عمل قائم على التعلم الآلي للتنبؤ بتبديل المجال ثلاثي الأبعاد في بروتينات النباتات الطبية. تبدأ العملية بالحصول على مجموعة البيانات ، والجمع بين مجموعات البيانات المعيارية والوصفية. يتضمن استخراج الميزة اشتقاق كل من الميزات الحالية والجديدة من تسلسل البروتين. في المعالجة المسبقة لمجموعة البيانات ، يتم تحويل تسلسلات FASTA إلى قيم رقمية باستخدام تحليل التسلسل وتعيين القاموس لإنشاء إطارات بيانات منظمة ، بما في ذلك ميزات تبديل المجال ثلاثية الأبعاد محددة. تتضمن المعالجة اللاحقة تعيين حالة تبديل المجال باستخدام عتبة (β = 0.5) ، وتقسيم البيانات إلى مجموعات تدريب واختبار (نسبة 70-30) ، وتوحيد الميزات ، وإجراء تحديد الميزات مع التحقق من صحة k-fold. تم تدريب نموذجين للتعلم الآلي، وهما Random Forest (RF) و K-Nearest Neighbours (KNN)، ويتم تقييم أدائهما باستخدام مقاييس النموذج جنبا إلى جنب مع AUROC و AUPRC لتقييم الدقة والمتانة التنبؤية الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

5. التقييم الثابت والتقييمات النموذجية لمصنفات ML

  1. تنفيذ خوارزميات الغابة العشوائية (RF) وK-Nearest Neighbours (KNN) وضبطها لتحسين الأداء التنبؤي. قم بتدريب النماذج والتحقق من صحتها واختبارها باستخدام 573 و 575 تسلسل بروتيني للتدريب ، و 1,355 تسلسل بروتيني للاختبار.
    figure-protocol-3(1)
    figure-protocol-4(2)
    figure-protocol-5(3)
    figure-protocol-6(4)
    figure-protocol-7(5)
    figure-protocol-8(6)
    ملاحظة: حدد TP (إيجابي حقيقي) على أنه النسبة المئوية للتسلسلات التي تم التنبؤ بها بشكل صحيح على أنها مبادلة المجال بواسطة النماذج. حدد TN (سلبي حقيقي) على أنه النسبة المئوية للتسلسلات التي تم التنبؤ بها بشكل صحيح على أنها غير متبادلة بالمجال. تعريف الإيجابية الكاذبة (FP) على أنها الحالات التي يتم فيها التنبؤ بالبروتينات غير المبدلة بالمجال بشكل غير صحيح على أنها متبادلة بالمجال. تعريف السلبية الكاذبة (FN) على أنها الحالات التي يتم فيها التنبؤ بالبروتينات التي تم تبديلها بالمجال بشكل غير صحيح على أنها غير مبدلة بالمجال.
  2. احسب Xsen كنسبة الإيجابيات الحقيقية المحددة بدقة ، و Xspe كنسبة السلبيات الحقيقية التي تم تحديدها بشكل صحيح بواسطة النموذج.
    ملاحظة: استخدم مركز عملائي لتقييم جودة التصنيفات الثنائية من خلال تحليل الإيجابيات الحقيقية والسلبيات الحقيقية والإيجابيات الخاطئة والسلبيات الكاذبة من مصفوفة الارتباك.
  3. حساب الدقة (ACC) لقياس نسبة التنبؤات الصحيحة بين إجمالي التنبؤات.
    ملاحظة: تقوم الدقة بتقييم نسبة من الإيجابيات المحددة بشكل صحيح بين جميع الإيجابيات المتوقعة ، في حين أن درجة F1 هي المتوسط التوافقي للدقة والحساسية ، وتوازن الإيجابيات الخاطئة والسلبيات الخاطئة.
  4. استخدام AUC لتقييم أداء نماذج التصنيف في مهام التصنيف الثنائي. احسب AUC (المساحة تحت المنحنى) باستخدام مكتبة Scikit-learn Python40 ، بناء على البروتينات المصنفة بشكل إيجابي وسلبي.
  5. استخدم بيانات الاختبار لتقييم هذه المعلمات.

6. تنفيذ نموذج للتنبؤ بتبديل المجال ثلاثي الأبعاد على أنواع النباتات الطبية المختلفة

  1. قم بتطبيق RF و KNN على ما مجموعه 1,355 تسلسلا تمت مراجعته (مجموعة بيانات التنبؤ) من 13 نباتا طبيا مختلفا ، بما في ذلك Citrus sinensis و Mentha و Vitis vinifera و Thyme و Thymeus vulgaris و Jasmine و Hibiscus و Papaver somniferum و Illicium oligandrum و Citrus limon و Acorus calamus و Cannabis sativa و Coffea arabica.
    ملاحظة: ترتبط هذه البروتينات بوظائف مختلفة مثل الحمضيات والنعناع والزعتر يساعد على عسر الهضم. يعتبر Vitis vinifera والياسمين والكركديه مصدرا غنيا جدا بمضادات الأكسدة كما أنه يحسن صحة الجلد. تشتهر Illicium oligandrum بخصائصها المضادة للفطريات والبكتيريا وما إلى ذلك.

7. تحقيق التخصيب للبروتينات المبدلة بالمجال ثلاثي الأبعاد المتوقعة بشكل إيجابي من النباتات الطبية

  1. قم بتعيين رموز الانضمام لتسلسلات البروتين هذه إلى فئات مستقلبات ثانوية باستخدام بيانات من UniProt.
  2. استخراج معرف الجين من التسلسلات المتوقعة.
  3. افتح خادم الويب KEGGعبر الإنترنت 41 (https://www.genome.jp/kegg/) لإجراء تحليل تخصيب مسار KEGG عن طريق لصق معرف الجين الفردي أو اسم البروتين للتحقق من المسارات الخاصة بهما.
  4. قم بإجراء تحليل مقارن من خلال مقارنة بروتينات تبديل المجال ثلاثية الأبعاد المتوقعة مقابل مجموعة بيانات التنبؤ للكشف عن التمثيل المفرط ذي الدلالة الإحصائية لمصطلحات الأنطولوجيا الجينية المحددة (GO) والمسارات البيولوجية. الصق معرف الجين للتسلسل المتوقع في ShinyGO v0.742 (https://bioinformatics.sdstate.edu/go74/) وحدد الوظيفة أو فئة المسار المطلوبة (الوظيفة البيولوجية ، المكون الخلوي ، الوظيفة الجزيئية ، KEGG ، إلخ).
    ملاحظة: تصور هذه التعليقات التوضيحية باستخدام نظام أساسي قائم على السحابةعبر الإنترنت 43 يسمح للمستخدمين بكتابة وتنفيذ كود Python.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

غالبا ما ترتبط البروتينات التي تظهر مبادلة المجال ثلاثي الأبعاد بمجموعة متنوعة من الوظائف البيولوجية. ومع ذلك ، فإن التحليل المنهجي على مستوى الجينوم لتسلسلات البروتين التي شاركت في مبادلة المجال ثلاثي الأبعاد لا يزال غير مستكشف إلى حد كبير. في هذا البحث ، أجرينا تحقيقا أوليا للتنبؤ المفترض بالبروتينات ثلاثية الأبعاد التي تم تبديلها بالمجال من 13 نباتا طبيا ، مع التركيز على ارتباطها بمجالات مستقلبات المستقلبات الثانوية ، ومسارات KEGG ، ومصطلحات علم الوجود الجيني (GO). يشير التحليل الشامل للأدبيات التي يمكن الوصول إليها و...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

إن فهم مبادلة المجال ثلاثي الأبعاد في البروتينات عبر جينومها الكامل له أهمية كبيرة في مختلف المجالات. تم استخدام مناهج التعلم الآلي ، وخاصة الغابة العشوائية وأقرب جار K26،27 ، للتنبؤ بمبادلة المجال ثلاثي الأبعاد مباشرة من بيانات تسلسل البروتين على مستوى الجينوم. يتضمن هذان النموذجين للتعلم الآلي خطوات مختلفة مثل جمع مجموعة البيانات ، واختيار الميزات ، والمعالجة المسبقة / اللاحقة للبيانات ، وتنفيذ البرنامج النصي النموذجي المخصص ، ...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يعلن المؤلفون أنه ليس لديهم مصالح مالية متنافسة معروفة أو علاقات شخصية يمكن أن يبدو أنها تؤثر على العمل المبلغ عنه في هذه الورقة.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

لم يتم تلقي أي تمويل لهذا البحث.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
3DSwap +https://caps.ncbs.res.in/3Dswapplus/index.html  ؛
PfamEMBL-EBIhttp://pfam.xfam.org/: 
HMMEREMBL-EBI;
Aaindexhttps://www.genome.jp/aaindex/:
DIALBioinformaticshome.comhttps://bioinformaticshome.com/db/tool/DIAL:  ؛
WEKAجامعة ويكاتوhttps://www.waikato.ac.nz/int/research/institutes-centres-entities/institutes/artificial-intelligence-institute/research/software/
  KEGGhttps://www.genome.jp/kegg/ :
ShinyGOhttps://bioinformatics.sdstate.edu/go/ :
uniprotUniprothttps://www.uniprot.org/ :
https://www.ebi.ac.uk/Tools/hmmer/:  

المراجع

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Radivojac, P., et al. A large-scale evaluation of computational protein function prediction. Nat Methods. 10 (3), 221-227 (2013).
  2. Bennett, M. J., et al. 3D domain swapping: a mechanism for oligomer assembly. Protein Sci. 4, 2455-2468 (1995).
  3. Bennett, M. J., et al. Domain swapping: entangling alliances between proteins. Proc Natl Acad Sci U S A. 91, 3127-3131 (1994).
  4. Liu, Y., et al. The crystal structure of a 3D domain-swapped dimer of RNase A at a 2.1-Å resolution. Proc Natl Acad Sci U S A. 95 (7), 3437-3442 (1998).
  5. Straub, J. E., et al. Principles governing oligomer formation in amyloidogenic peptides. Curr Opin Struct Biol. 20, 187-195 (2010).
  6. Upadhyay, A. K., et al. Genome-wide prediction and analysis of 3D domain-swapped proteins in the human genome from sequence information. PLoS One. 11 (7), e0159627(2016).
  7. Liu, Y., et al. 3D domain swapping: as domains continue to swap. Protein Sci. 11, 1285-1299 (2002).
  8. Schlunegger, M. P., et al. Oligomer formation by 3D domain swapping: a model for protein assembly and misassembly. Adv Protein Chem. 50, 61-122 (1997).
  9. Rousseau, F., et al. Implications of 3D domain swapping for protein folding, misfolding and function. Adv Exp Med Biol. 747, 137-152 (2012).
  10. Anderson, W. F., et al. Structure of the Cro repressor from bacteriophage λ and its interaction with DNA. Nature. 290 (5809), 754-758 (1981).
  11. Albright, R. A., et al. High-resolution structure of an engineered Cro monomer shows changes in conformation relative to the native dimer. Biochemistry. 35, 735-742 (1996).
  12. Bax, B., et al. X-ray analysis of beta B2-crystallin and evolution of oligomeric lens proteins. Nature. 347, 776-780 (1990).
  13. Parge, H. E., et al. Human CksHs2 atomic structure: A role for its hexameric assembly in cell cycle control. Science. 262, 387-395 (1993).
  14. Fita, I., et al. The NADPH binding site on beef liver catalase. Proc Natl Acad Sci U S A. 82 (6), 1604-1608 (1985).
  15. Milburn, M. V., et al. A novel dimer configuration revealed by the crystal structure at 2.4 Å resolution of human interleukin-5. J Biol Chem. 268, 2117-2120 (1993).
  16. Upadhyay, A. K., et al. Genome-wide analysis of domain-swap predicted products in the genome of anti-stress medicinal plant: Ocimum tenuiflorum. Bioinformat Biol Insights. 13, 1177932218821362(2019).
  17. Simpson, G. A., et al. Crystal structure and interconversion of monomers and domain-swapped dimers of the walnut tree phytocystatin. Biochim Biophys Acta Prot Proteom. 1872 (2), 140975(2024).
  18. Tran, L. H., et al. 3D domain swapping dimerization of the receiver domain of cytokinin receptor CRE1 from Arabidopsis thaliana and Medicago truncatula. Front Plant Sci. 24 (12), 756341(2021).
  19. Shameer, K., et al. Insights into protein sequence and structure-derived features mediating 3D domain swapping mechanism using support vector machine-based approach. J Bioinform Comput Biol. 4, 33-42 (2010).
  20. Shameer, K., et al. 3dswap-pred: prediction of 3D domain swapping from protein sequence using Random Forest approach. Protein Pept Lett. 19, 1010-1020 (2012).
  21. Tasnim, F. Protein sequence classification through deep learning and encoding strategies. Proc Comp Sci. 238, 876-881 (2024).
  22. Xu, Y., et al. Deep dive into machine learning models for protein engineering. J Chem Info Modeling. 60 (6), 2773-2790 (2020).
  23. Lilhore, U. K., et al. Optimizing protein sequence classification: integrating deep learning models with Bayesian optimization for enhanced biological analysis. BMC Med Inform Decis Mak. 24, 236(2024).
  24. Jumper, J., et al. Highly accurate protein structure prediction with AlphaFold. Nature. 596 (7873), 583-589 (2021).
  25. Du, Z., et al. The trRosetta server for fast and accurate protein structure prediction. Nat Protoc. 16 (12), 5634-5651 (2021).
  26. Genuer, R., et al. Random forests: Some methodological insights. arXiv. , (2008).
  27. Guo, G., et al. KNN model-based approach in classification. Lect Notes Comput Sci. 2888, 986-996 (2003).
  28. Kathuria, C., et al. Predicting the protein structure using random forest approach. Procedia Comput Sci. 132, 1654-1662 (2018).
  29. Gui, Y., et al. Application of K-nearest neighbors in protein-protein interaction prediction. Highlights Sci Eng Technol. 2, 125-131 (2022).
  30. Joseph, A. P., Shingate, P., Upadhyay, A. K., Sowdhamini, R. 3PFDB+: improved search protocol and update for the identification of representatives of protein sequence domain families. Database. 2014, bau026(2014).
  31. Finn, R. D., et al. The Pfam protein families database. Nucl Acids Res. 41, D211-D222 (2013).
  32. Mistry, J., et al. Challenges in homology search: HMMER3 and convergent evolution of coiled-coil regions. Nucl Acid Res. 41, e121(2013).
  33. Apweiler, A. UniProt: The universal protein knowledgebase. Nucl Acids Res. 46 (5), 2699-2699 (2018).
  34. Kawashima, S., et al. AAindex: amino acid index database, progress report 2008. Nucl Acids Res. 36, D202-D205 (2008).
  35. Frank, E., et al. Data mining in bioinformatics using WEKA. Bioinformatics. 20, 2479-2481 (2004).
  36. Pedregosa, F., et al. Scikit-learn: Machine Learning in Python. J Mach Learn Res. 12, 2825-2830 (2011).
  37. Wu, C., et al. Prediction of DNA methylation site status based on fusion deep learning algorithm. IEEE AEMCSE Proc. 5, 180-183 (2022).
  38. Wilhelm, T., et al. Phenotype prediction based on genome-wide DNA methylation data. BMC Bioinform. 15, 1-15 (2014).
  39. Uddin, S., et al. Dataset meta-level and statistical features affect machine learning performance. Sci Rep. 14 (1), 1F670(2024).
  40. Pedregosa, F., et al. Scikit-learn: Machine Learning in Python. J Mach Learn Res. 12, 2825-2830 (2011).
  41. Kanehisa, M., et al. Kyoto encyclopedia of genes and genomes. Nucl Acid Res. 28 (1), 27-30 (2000).
  42. Ge, S. X., et al. ShinyGO: a graphical gene-set enrichment tool for animals and plants. Bioinformatics. 36 (8), 2628-2629 (2020).
  43. Bisong, E. Google Colaboratory. Building Machine Learning and Deep Learning Models on Google Cloud Platform. , Apress. Berkeley, CA. (2019).
  44. Kirby, G. W. Biosynthesis of the morphine alkaloids. Science. 155 (3759), 170-173 (1967).
  45. Toffolatti, S. L., et al. Role of terpenes in plant defence to biotic stress. Biocont Agents Sec Metabol. , 401-417 (2021).
  46. Boncan, D. A. T., et al. Terpenes and terpenoids in plants: interactions with environment and insects. Int J Mol Sci. 21 (19), 7382(2020).
  47. Mansouri, H., et al. The response of terpenoids to exogenous gibberellic acid in Cannabis sativa L. at vegetative stage. Acta Physiol. Plant.33, 1085-1091 (2011).
  48. Pál, M., et al. Speculation: Polyamines are important in abiotic stress signalling. Plant Sci. 237, 16-23 (2015).
  49. Mattoo, A. K., et al. Higher polyamines restore and enhance metabolic memory in ripening fruit. Plant Sci. 174 (4), 386-393 (2008).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

KEGG
الفيديو قريباً

مقالات ذات صلة