مقالة منهجية

التنقل في البيانات البروتينية القائمة على قياس الطيف الكتلي باستخدام أدوات حسابية مجانية

DOI:

10.3791/68707

أغسطس 19, 2025

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تتوفر البيانات البروتينية القائمة على قياس الطيف الكتلي في قواعد البيانات المفتوحة ويمكن الوصول إليها باستخدام أدوات مجانية. نظرا لتعقيد عمليات البحث في قواعد البيانات وأوصافها ، يفتقر العديد من علماء الأحياء إلى المعرفة اللازمة لاستخدام مجموعات البيانات هذه. هنا ، نقدم دليلا حول استخدام الأدوات المجانية للبحث عن البيانات البروتينية الأساسية.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تستخدم بيانات البروتينات المستندة إلى قياس الطيف الكتلي (MS) ، بما في ذلك الاستحواذ المعتمد على البيانات (DDA) والاكتساب المستقل عن البيانات (DIA) ، على نطاق واسع في البحث البيولوجي. ومع ذلك ، لا يزال تطبيق مجموعات البيانات هذه في دراسات التحقق محدودا بسبب عدم وجود عروض توضيحية واضحة حول كيفية البحث عن البيانات البروتينية وتحليلها بشكل فعال. لسد هذه الفجوة ، اخترنا مجموعة بيانات DDA وواحدة DIA المودعة في مستودع بيانات PRoteomics IDEntifications (PRIDE) لتوضيح سير عمل تحليل البيانات البروتينية بشكل أفضل والمعالجة اللاحقة لنتائج البحث عن البروتين. لأغراض العرض التوضيحي ، استخدمنا أداتين حسابيتين مجانيتين: FragPipe (v22.0) لمجموعات بيانات DDA و DIA-NN (2.1.0) لمجموعات بيانات DIA. تم عرض خطوات المعالجة اللاحقة ، مثل إنشاء مخططات بركانية وقوائم بروتينات غير منظمة ، باستخدام كود R. توفر هذه الدراسة بروتوكولات أساسية للبحث عن البيانات البروتينية وتحليلها ، وتعمل كدليل أساسي للمبتدئين للتعامل بفعالية مع مجموعات البيانات البروتينية. من خلال هذا العمل ، نهدف إلى تمكين الباحثين بالمعرفة اللازمة للاستفادة من البيانات البروتينية في تحقيقاتهم البيولوجية.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

وقد أحدث مجال البروتينات ثورة من خلال الاعتماد الواسع النطاق لمستودعات البيانات ذات الوصول المفتوح وأدوات البرمجيات الحرة1، والتي كانت مفيدة في تعزيز القدرات البحثية وتعزيز ثقافة تبادل البيانات. وقد أتاح إنشاء موارد مركزية، مثل PRIDE2، وتطوير تنسيقات بيانات موحدة من قبل مبادرة معايير البروتينات (PSI) التابعة لمنظمة بروتينات الإنسان (HUPO)3 فرصة غير مسبوقة لإعادة استخدام البيانات وإدماجها. ومع ذلك ، لا يزال تحليل وتفسير البيانات البروتينية يمثل حواجز تقنية كبيرة ، خاصة بالنسبة لعلماء الأحياء والأطباء الذين يرغبون في إجراء التحقق المتعامد من نتائجهم التجريبية4. تعالج هذه المخطوطة هذا التحدي بشكل مباشر من خلال تقديم سير عمل حسابي محايد للبائع لتوفير إطار عمل يمكن الوصول إليه للباحثين للاستعلام بشكل مستقل عن بيانات البروتينات العامة وتحليلها ودمجها مع النتائج التي توصلوا إليها ، وبالتالي تسهيل التحقق من صحة المتعامد القوي دون الحاجة إلى تجارب معملية رطبة إضافية. هذا العمل مناسب بشكل خاص للباحثين الذين يسعون إلى التحقق من صحة التعبير التفاضلي لبروتينات معينة تم تحديدها في تجاربهم الخاصة وتوليد فرضيات جديدة من خلال استكشاف أنماط التعبير عن بروتيناتهم التي تهمهم عبر مجموعة واسعة من الدراسات المنشورة. من خلال توفير دليل تفصيلي ، نهدف إلى تمكين مجموعة واسعة من العلماء من تسخير الإمكانات الكاملة لبيانات البروتينات العامة ، مما يعزز في النهاية متانة وتأثير أبحاثهم.

في البروتينات القائمة على قياس الطيف الكتلي (MS) ، تعد عمليات مسح MS1 و MS2 أساسية للحصول على البيانات. تقوم عمليات مسح MS1 ، أو عمليات المسح ، باكتشاف وقياس نسب الكتلة إلى الشحن (m / z) لجميع الأيونات في العينة ، مما يوفر نظرة عامة شاملة على مجموعة الأيونات5. تتضمن عمليات مسح MS2 ، التي تسمى أيضا عمليات مسح التجزئة ، عزل وتجزئة أيونات سلائف معينة مختارة من فحص MS1 ، مما يؤدي إلى توليد أطياف أيونية شظية لتحديد الببتيد6.

يختار الاستحواذ المعتمد على البيانات (DDA) الأيونات الأكثر وفرة من عمليات مسح MS1 لتجزئة MS2 ، مما ينتج عنه أطياف أبسط تبسط التحليل. ومع ذلك ، يمكن أن يؤدي DDA إلى أخذ عينات عشوائية وقيم مفقودة في العينات المعقدة ، مما يحد من قابلية التكاثر7. في المقابل ، يقوم الاستحواذ المستقل عن البيانات (DIA) بشكل منهجي بتفتيت جميع الأيونات داخل نوافذ m / z محددة مسبقا ، مما يضمن تغطية شاملة ويقلل من القيم المفقودة. هذا يعزز الدقة الكمية وقابلية التكرار8 ، على الرغم من أن DIA تتطلب أدوات حسابية متقدمة لفك أطياف MS29 المعقدة للغاية.

PRIDE (https://www.ebi.ac.uk/pride)2هو مستودع رائد داخل ProteomeXchange Consortium (https://www.proteomexchange.org)10 ، وهو منصة عالمية لمشاركة بيانات البروتينات. يمكن للمستخدمين التنقل بكفاءة في هذا المورد الهائل باستخدام عمليات البحث عن الكلمات الرئيسية لتحديد مجموعات البيانات ذات الأهمية.

DIA-NN11 ، وهي مجموعة برامج تستفيد من الشبكات العصبية العميقة ، هي أداة قياسية ذهبية لتحليل بيانات البروتينات المستقلة عن البيانات (DIA). إنه يتفوق في دقة التحديد والقياس الكمي ، مما يجعله فعالا بشكل خاص في معالجة مجموعات بيانات DIA المعقدة12. بالنسبة لسير عمل الاستحواذ المعتمد على البيانات (DDA) ، يوفر MSFragger13 ، المدمج في خط أنابيب FragPipe ، تحديدا فائق السرعة للببتيد. يتيح نهج فهرسة أيون الشظايا المبتكر المطابقة الطيفية السريعة، متفوقا على الأدوات التقليدية بأكثر من 100 ضعف في السرعة.

مجهزة بقواعد البيانات الشاملة والأدوات المتقدمة هذه ، يمكن للباحثين بسهولة إعادة استخدام البيانات البروتينية للتحقق من صحة الدراسات الشاملة والاكتشافات البيولوجية الجديدة. أدت إمكانية الوصول هذه إلى تحديد العديد من المؤشرات الحيوية للبروتين عبر أمراض متنوعة14،15 ، وتحسين التنبؤ بالتشخيص16 ، ومكنت من تصنيف النوع الفرعي الجزيئي بناء على الملامح البروتينية17.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ملاحظة: انظر الشكل 1للحصول على نظرة عامة على سير العمل وجدول المواد للحصول على أوصاف تفصيلية للبرنامج المستخدم.

figure-protocol-1
الشكل 1: نظرة عامة على تصميم الدراسة. يرجى النقر هنا لعرض نسخة أكبر من هذا الرقم.

1. مثال على إعداد الملفات والبرامج

ملاحظة: جميع التطبيقات مجانية للاستخدام البحثي الفردي ويمكن تشغيلها على جهاز كمبيوتر شخصي (يتم دعم Windows و Linux).

  1. إنشاء دليل جديد لمشروع.
  2. تنزيل JMU_LM2_8526_55.raw ، JMU_LM2_8568_51.raw ، JMU_LM2_8696_37.raw ، JMU_LM2_2112_87.raw ، JMU_LM2_2195_91.raw ، JMU_LM2_2377_73.raw ، 20150127_liver_XH03_T_01.raw ، 20150127_liver_XH03_T_02.raw ، 20150127_liver_XH03_T_03.raw ، 20150127_liver_XH03_P_01.raw ، 20150127_liver_XH03_P_02.raw ، 20150127_liver_XH03_P_03.raw من PRIDE.
    ملاحظة: يمكن تنزيل مجموعتي الملفات من https://www.ebi.ac.uk/pride/archive/projects/PXD039273 و https://www.ebi.ac.uk/pride/archive/projects/PXD006512 بشكل منفصل (الشكل 2).
  3. قم بتنزيل وتثبيت أدوات البرامج المطلوبة.
    1. قم بتنزيل أحدث إصدار من DIA-NN كملف .msi. DIA-NN متاح مجانا كملف .msi لنظام التشغيل Windows أو ملف .zip لنظام التشغيل Linux من https://github.com/vdemichev/DiaNN/releases/tag/2.0
    2. قم بتنزيل أحدث إصدار من MSFileReader كملف .exe. MSFileReader متاح مجانا كملف .exe من https://github.com/thermofisherlsms/MSFileReader/blob/main/MSFileReader_x64.exe ، وهو مطلوب لمعالجة بيانات Thermo Fisher DIA المنسقة الأولية.
    3. قم بتنزيل أحدث إصدار من .NET SDK كملف .exe. يتوفر .NET SDK مجانا كملف .exe من https://dotnet.microsoft.com/en-us/download ، وهو مطلوب في Windows لتنفيذ MSFileReader.
    4. قم بتنزيل أحدث إصدار من FragPipe كملف .zip. FragPipe متاح مجانا كملف .zip من https://github.com/Nesvilab/FragPipe/releases. يوصى باستخدام الملف المضغوط مع jre لأنه يحتوي على وقت تشغيل Java لنظام التشغيل Windows ، وهو أمر ضروري لتنفيذ FragPipe. MSFragger مضمن في FragPipe.
  4. قم بتنزيل أحدث إصدار من ملفات البرامج النصية R و Rstudio و R من الملف التكميلي 1 والملف التكميلي 2. يمكن تنزيل R و RStudio مجانا من https://cran.rstudio.com/bin/windows/base/R-4.5.0-win.exe و https://posit.co/download/rstudio-desktop/.
  5. قم بفك ضغط الملفات المضغوطة وانقر فوق الزر . ملفات exe أو .msi لتثبيت التطبيقات.

2. تحليل بيانات DIA باستخدام DIA-NN

  1. قم بتنزيل ملف proteome fasta المرجعي من UniProt. لتنزيل البروتين المرجعي Homo sapiens (المعلومات الإسوية غير مدرجة) انتقل إلى https://www.uniprot.org/proteomes/UP000005640 (الشكل 3 أ).
  2. انقر فوق الزر "إضافة FASTA" لتحميل ملف البروتيوم المرجعي في DIA-NN.
  3. حدد الخيارين ملخص FASTA للبحث / المكتبة الخالية من المكتبات والأطياف القائمة على التعلم العميق ، التنبؤ RTs و lMs ضمن جزء توليد أيونات السلائف. انقر فوق الزر "تشغيل" لإنشاء مكتبة طيفية متوقعة (الشكل 3 ب).
    1. بمجرد إنشاء ملف المكتبة الطيفية المتوقعة ، أعد استخدامه للتجارب الأخرى ضمن نفس إعدادات الاستحواذ التجريبية من خلال النقر فوق الزر الطيفي لإضافة المكتبة المتوقعة.
  4. قم بإلغاء تحديد الخيارين الموجودين ضمن جزء إنشاء أيون السلائف وانقر فوق الزر "النوع" الذي يرتبط بتنسيق الملف ضمن جزء الإدخال لتحميل بيانات DIA.
  5. اضبط دقة الكتلة ودقة MS1 ضمن الخوارزمية على 0.0 جزء في المليون.
  6. اضبط إعدادات نطاق كتلة السلائف والأجزاء ضمن جزء توليد أيونات السلائف بناء على الإعدادات التجريبية.
  7. احتفظ بالإعدادات الافتراضية الأخرى.
    1. يستخدم جيل السلائف في DIA-NN التربسين / P (الشقوق بعد K / R ما لم يتبعها البرولين) مع انقسام 1 مفقود لنمذجة الهضم الجزئي. تعطيل استئصال M N-term للببتيدات غير الكنسية (على سبيل المثال ، المناعية البيبتيدومية) أو زيادة الانقسامات الفائتة إلى 2 للببتيدات الأطول.
    2. قم بتمكين التعديلات المتغيرة بشكل صريح (معطلة افتراضيا) لدراسات التعديل اللاحق للترجمة (PTM) (على سبيل المثال ، Ox (M) للأكسدة ، K-GG للانتشار في كل مكان) ، وتوسيع مرشحات الببتيد (الطول: 7-30 aa ؛ الشحنة: 1-4+ ؛ السلائف m / z: 300-1800) وفقا للإعدادات التجريبية (على سبيل المثال ، الطول: 5-50 aa ، الشحن = 1-6) ل PTMs الكبيرة أو الهضمات غير التربتية.
    3. تستفيد إعدادات الخوارزمية من المعايرة التلقائية (دقة الكتلة = 0.0 جزء في المليون) لمحاذاة الكتلة الدقيقة - التجاوز باستخدام التفاوتات اليدوية (على سبيل المثال ، 10 جزء في المليون) للأجهزة منخفضة الدقة - وتنقل المطابقة بين الأشواط (MBR) معرفات عبر عمليات التشغيل (تعطيل العينات غير المتجانسة).
    4. يعزز تسجيل الشبكة العصبية ثقة التعريف (الاحتفاظ به ما لم تكن جودة البيانات رديئة) ، بينما يتيح قياس الطيف الكتلي الكمي غير المسمى (UMS) القياس الكمي عالي الدقة الخالي من الملصقات ؛ قم بالتبديل إلى القياس الكمي MS2 للعلامات متساوية الضغط (على سبيل المثال ، TMT). استخدم البحث الخالي من المكتبة فقط مع بيانات DIA عالية الدقة لتجاوز متطلبات المكتبة الطيفية.
  8. انقر فوق الزر "تشغيل ". انتظر النتائج حتى يظهر تم الانتهاء في واجهة العملية مما يشير إلى انتهاء التشغيل (الشكل 3C).

3. تحليل بيانات DDA باستخدام FragPipe

  1. انقر فوق رمز Fragpipe في المجلد ~\FragPipe\fragpipe\bin بعد التثبيت. يمكن رؤية جميع الإعدادات التابعة في علامة التبويب Config. تحقق مما إذا كانت الوحدات الثلاث (MSFragger و IonQuant و diaTracer و DIA-NN و Python) موجودة على جهاز الكمبيوتر الخاص بك. إذا لم يكن الأمر كذلك ، فقم بتنزيلها بالنقر فوق تنزيل / تحديث أو تنزيل (الشكل 4 أ).
  2. قم بالتبديل إلى علامة التبويب التالية، سير العمل. حدد افتراضي لسير العمل وانقر فوق تحميل سير العمل. انقر فوق إضافة ملفات لإضافة مسارات الملفات. قم بتعيين اسم التجربة ورقم التكرار الحيوي ضمن تعيين الملفات أو اتركها فقط (الشكل 4 ب).
  3. الآن ، انقر فوق قاعدة البيانات وانتقل إلى علامة التبويب هذه. قم بتحميل ملف fasta أو قم بتنزيل أي ملفات fasta وفقا لأنواع العينات. أثناء التنزيل ، اختر التسلسلات التي تمت مراجعتها فقط ، وإضافة الأفخاخ وإضافة خيارات الملوثات الشائعة لتشغيل بسيط (الشكل 4C).
  4. ثم انقر فوق MSFragger لتغيير علامة التبويب. اختر التكوين الافتراضي للبحث المغلق وانقر فوق تحميل.
    ملاحظة: البحث المغلق هو في الأساس بحث عن التعديلات التي قمت بتعيينها بينما سيستكشف البحث المفتوح جميع التعديلات المحتملة من البيانات ، والتي تستغرق وقتا أطول وذاكرة
  5. بالنسبة لمطابقة الذروة، احتفظ بالإعدادات الافتراضية باستثناء أنه يوصى باختيار لا شيء للمعايرة والتحسين، حيث سيوفر الوقت.
  6. لهضم البروتين ، اضبط المعلمات وفقا للظروف التجريبية. احتفظ بالإعدادات الافتراضية التالية (الشكل 5 أ).
    ملاحظة: تحدد تفاوتات كتلة السلائف والشظايا (± 20 جزء في المليون) الحد الأقصى المسموح به لخطأ الكتلة لمطابقة الأطياف التجريبية مع الببتيدات النظرية ، مع قيم أكثر إحكاما موصى بها للأجهزة عالية الاستبانة. تحدد قواعد الإنزيم (التربسين الصارم) خصوصية الانقسام (بعد K / R ، ما لم يتبعها P) ، مع الانقسامات المفقودة (2) التي تسمح بالببتيدات المهضومة جزئيا. تستبعد مرشحات طول الببتيد (5-50 بقايا) والكتلة (500-5000 دالتون) المرشحين غير المحتملين. تسمح التعديلات المتغيرة (على سبيل المثال ، +15.9949 Da على الميثيونين للأكسدة ، + 79.96633 Da على S / T / Y للفسفرة) بالكشف عن التغيرات الكيميائية ، بينما تحد المجموعات القصوى (5) من التعديلات المتزامنة لكل ببتيد لإدارة مساحة البحث. الحد الأقصى للتعديلات المتغيرة لكل موقع (على سبيل المثال ، 3 على M) يتحكم في تردد التعديل. تعمل قاعدة البيانات المنقسمة على تحسين كفاءة البروتينات الكبيرة ، ويفسر خطأ النظائر (0/1/2) قمم النظائر الخاطئة. توازن هذه الإعدادات بشكل جماعي بين الحساسية والخصوصية والحمل الحسابي في تحديد الببتيد.
  7. قم بالتغيير إلى علامة التبويب التحقق من الصحة. قم بإلغاء تحديد أطياف التنبؤ RT والتنبؤ ، وهي لبيانات DIA (الشكل 5 ب).
  8. انقر فوق علامة التبويب Quant (MS1 ). حدد تشغيل MS1 quant وانقر فوق تحميل الإعدادات الافتراضية الكمي. حدد IonQuant واحتفظ بالإعدادات الافتراضية (الشكل 6 أ). تعطيل MBR لأوقات الاستبقاء غير المستقرة أو تعطيل تطبيع الشدة إذا نتج عن ذلك تحيزات تحجيم عالمي؛ قم بتمكين الحفاظ على الفهرس على القرص للحفاظ على ذاكرة الوصول العشوائي باستخدام مجموعات البيانات الكبيرة.
    ملاحظة: يتم تعيين Quant (MS1) افتراضيا لتحسين القياس الكمي الخالي من الملصقات باستخدام MaxLPQ (تكميم البروتين المستند إلى MaxLFQ ، وهي خوارزمية توسع طريقة MaxLFQ لتشمل مجموعات البروتين) ، مما يتطلب ≥1 أيون فريد لكل بروتين (زيادة إلى ≥2 لصرامة أعلى على حساب التغطية). تنقل المطابقة بين الأشواط (MBR) التعريفات عبر عمليات التشغيل باستخدام تفاوت وقت الاستبقاء (RT) (الافتراضي 0.4 دقيقة؛ إحكام الربط إلى 0.2 دقيقة للكروماتوغرافيا المستقرة أو التخفيف لتغير التدرج) وتفاوت التنقل الأيوني (الافتراضي 0.05 1/k0 [التنقل العكسي المنخفض]؛ الضبط بناء على دقة المراسلة الفورية)، تمت تصفيتها بنسبة ≤1٪ FDR (معدل الاكتشاف الخاطئ؛ أيون MBR الافتراضي FDR=0.01؛ أقل إلى 0.005 للصرامة). يستخدم استدلال البروتين فريدا + راسكور (تعيين ببتيد الحلاقة لتجميع البروتين). يستخدم اكتشاف الميزات تفاساة كتلية تبلغ 10 أجزاء في المليون (زيادة إلى 20 صفحة في الدقيقة للتصلب المتعدد منخفض الدقة أو التقليل إلى 5 أجزاء في المليون للدقة العالية).
  9. الآن ، انقر فوق علامة التبويب تشغيل . حدد دليل الإخراج. انقر فوق RUN لبدء تحليل البيانات (الشكل 6 ب).
    ملاحظة: بالنسبة لبيانات البروتينات الخالية من الملصقات التي لا تركز على التعديلات أو باستخدام القياس الكمي المستند إلى التسمية، لا يتم استخدام علامات تبويب PTMs وGlyco وQuant (متساوي الضغط (متساوي الضغط).

4. تحليل المصب DIA-NN / FragPipe

ملاحظة: تم تضمين الرموز التفصيلية المستخدمة في هذه الدراسة كملف تكميلي 1 وملف تكميلي 2. يمكن العثور على إصدارات الحزمة المستخدمة في هذه الدراسة في الملف التكميلي 3.

  1. افتح RStudio واقرأ بيانات تعبير البروتين التي تم إنشاؤها بواسطة DIA-NN أو FragPipe. عادة ما تستخدم بيانات مصفوفة مجموعة البروتين التي تنتهي ب .pg_matrix.tsv من DIA-NN وبيانات البروتين المدمجة التي تنتهي ب .tsv من FragPipe للتحليل.
  2. قم بإزالة القيم المفقودة دون ملء NA وقم بتصفية مجموعات البروتين المحددة والمحددة كميا بأقل من ببتيدات فريدة.
    ملاحظة: تم إنشاء أرقام DIA في هذه الدراسة بواسطة مجموعات البروتين المفلترة ، في حين أن أرقام DDA كانت من مجموعات البروتين غير المفلترة.
  3. تطبيع شدة البروتين باستخدام القياس المتوسط أو التطبيع الكمي عبر العينات. تم تطبيع بيانات DIA في هذه الدراسة عن طريق التطبيع المتوسط بينما بيانات DDA عن طريق التطبيع الكمي لإثبات الطريقتين بشكل أفضل.
    ملاحظة: التطبيع المتوسط قوي ضد القيم المتطرفة ومناسب للسيناريوهات التي تظل فيها غالبية البروتينات دون تغيير عبر العينات ، مما يجعل متوسط وفرة البروتين نقطة مرجعية مستقرة. ومع ذلك ، قد يفشل في السيناريوهات ذات البروتينات المعبر عنها تفاضلياللغاية 18. يضمن التطبيع الكمي توزيعا موحدا لوفرة البروتين عبر العينات ، وهو أمر مفيد عند مقارنة العينات ذات التوزيعات المتباينة. لقد ثبت أنه يقلل من القوة الإحصائية وقد يفرط في تطبيع البيانات ، مما قد يخفي الاختلافات البيولوجية الحقيقية18. في البروتينات ، يستخدم التطبيع المتوسط على نطاق واسع في الدراسات الخالية من الملصقات لإزالة التحيزات المنهجية المتعلقة بأداء أداة MS. يفضل التطبيع الكمي لمجموعات البيانات واسعة النطاق وتحليل التعبير التفاضلي والتحليل العنقودي19،20.
  4. احسب تغييرات أضعاف log2 (على سبيل المثال ، مصل PDAC مقابل عادي) وقيم p لاختبار t. احسب القيم p المصححة باستخدام طريقة Benjamini-Hochberg. تحديد عتبات الدلالة (على سبيل المثال، |log2FC| > 1، p_adj (FDR) < 0.05).
    ملاحظة: تمثل قيم p المقطوعة المستخدمة في أرقام هذه الدراسة قيما أولية ، حيث أن استخدام قيم p المعدلة (p_adj) من شأنه أن يلغي جميع البروتينات القابلة للاكتشاف ضمن القوة الإحصائية لمجموعات البيانات المحدودة هذه.
  5. تحقق من وجود قيم مفقودة / NA واستبعدها. قم بإنشاء مؤامرة بركان لتصور الضربات المهمة.
  6. حدد البروتينات غير المنظمة بشكل كبير. تطبيق تطبيع درجة Z على قيم تعبير البروتين. ارسم خريطة تمثيلية مجمعة مع عينة من التعليقات التوضيحية للمجموعة.
  7. قم بتعيين البروتينات إلى معرفات Entrez باستخدام org. Hs.eg.db. إجراء تخصيب GO (العملية البيولوجية) وتحليل مسار KEGG.
    ملاحظة: يتم اختيار فئات العملية البيولوجية (BP) بشكل شائع في تحليل علم الأنطولوجيا الجينية (GO) لأنها تصف العمليات الأكبر أو البرامج البيولوجية التي تم إنجازها بواسطة الأنشطة الجزيئيةالمتعددة 20. تركز هذه المصطلحات على الوظائف الخلوية التي تنحرف في أمراض مثل السرطان ، بما في ذلك العمليات الأساسية مثل تنظيم دورة الخلية ، وعمليات التمثيل الغذائي ، وما إلى ذلك. بالإضافة إلى BP ، يتضمن تحليل GO أيضا فئات الوظيفة الجزيئية (MF) والمكون الخلوي (CC). تحدد مصطلحات MF الأنشطة الكيميائية الحيوية للمنتجات الجينية ، مثل نقل الأيونات أو قدرات ربط الحمض النووي. تحدد مصطلحات CC المواقع الخلوية التي تؤدي فيها المنتجات الجينية وظائفها ، مثل النواة أو غشاء الميتوكوندريا أو الهيكل الخلوي.
  8. الاستعلام عن STRINGdb للتفاعلات (درجة الثقة ≥ 400). قم بإنشاء شبكة تفاعلية باستخدام visNetwork.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

لتوضيح البحث عن مجموعات البيانات البروتينية بشكل أفضل ، اخترنا نوعين من مجموعات البيانات لهذا التحليل. بهدف إظهار البروتينات غير المنظمة في السياقات السريرية ، بحثنا في PRIDE باستخدام كلمات رئيسية مثل العيادة. على وجه التحديد ، اخترنا مجموعة بيانات مناسبة لتحليل DIA من اتحاد تحليل الورم البروتيني السريري (CPTAC) 21 ، وأخرى مناسبة لتحليل DDA من مشروع البروتين البشري الصيني (CNHPP) 22. سهلت هذه الاختيارات تقييما شاملا وعرضا لقدرات البرامج في ت...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يوضح البروتوكول المقدم تحليل البيانات البروتينية من خلال دمج أدوات مجانية مثل DIA-NN و FragPipe. يتوقف النجاح على خطوات حاسمة مثل الاختيار الدقيق لأيون السلائف وإعدادات دقة الكتلة لتوليد المكتبة الطيفية في DIA-NN (الخطوة 2.3)27 ، والتي تعتمد على الأداة وحاسمة لتحديد الببتيد بالكامل. وبالمثل ، يعد الإعداد الدقيق لقاعدة البيانات في FragPipe (الخطوة 3.4) ، بما في ذلك توليد الشرك وتصفية الملوثات ، أمرا حيويا للتحكم في FDR.

غالبا ما تتضمن ا...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

F.Z. هو مؤسس Molemuse Biotech Studio.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

هذا المشروع مدعوم من قبل Molemuse Biotech Studio.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
.NET SDK الإصدار 9.0.203مايكروسوفتhttps://dotnet.microsoft.com/en-us/download
DIA-NN v. 2.1.0https://github.com/vdemichev/DiaNN/releases/tag/2.0 
FragPipe v. 22.0https://github.com/Nesvilab/FragPipe/releases
MSFileReader v. 3.1 ثيرمو فيشرhttps://github.com/thermofisherlsms/MSFileReader/blob/main/MSFileReader_x64.exe
4.5.0 ريالhttps://cran.rstudio.com/bin/windows/base/R-4.5.0-win.exe
Rstudio v. 2024.12.1+563https://posit.co/download/rstudio-desktop/

المراجع

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Pedrioli, P. G. A., et al. A common open representation of mass spectrometry data and its application to proteomics research. Nat Biotechnol. 22 (11), 1459-1466 (2004).
  2. Perez-Riverol, Y., et al. The PRIDE database at 20 years: 2025 update. Nucl Acids Res. 53 (D1), D543-D553 (2025).
  3. Deutsch, E. W., et al. Proteomics Standards Initiative at Twenty Years: Current Activities and Future Work. J Proteome Res. 22 (2), 287-301 (2023).
  4. Schubert, O. T., Röst, H. L., Collins, B. C., Rosenberger, G., Aebersold, R. Quantitative proteomics: challenges and opportunities in basic and applied research. Nat Protoc. 12 (7), 1289-1294 (2017).
  5. Wang, X., Shen, S., Rasam, S. S., Qu, J. MS1 ion current-based quantitative proteomics: A promising solution for reliable analysis of large biological cohorts. Mass Spectro Rev. 38 (6), 461-482 (2019).
  6. Vaudel, M. MS2-Based Quantitation. Proteome Inform. , 155-177 (2016).
  7. Meyer, J. G. Qualitative and Quantitative Shotgun Proteomics Data Analysis from Data-Dependent Acquisition Mass Spectrometry. Shotgun Proteomics. 2259, 297-308 (2021).
  8. Fröhlich, K., et al. Data-Independent Acquisition: A Milestone and Prospect in Clinical Mass Spectrometry-Based Proteomics. Mol Cell Proteomics. 23 (8), 100800(2024).
  9. Zhang, F., Ge, W., Ruan, G., Cai, X., Guo, T. Data-Independent Acquisition Mass Spectrometry-Based Proteomics and Software Tools: A Glimpse in 2020. Proteomics. 20 (17-18), 1900276(2020).
  10. Deutsch, E. W., et al. The ProteomeXchange consortium at 10 years: 2023 update. Nucl Acids Res. 51 (D1), D1539-D1548 (2023).
  11. Demichev, V., Messner, C. B., Vernardis, S. I., Lilley, K. S., Ralser, M. DIA-NN:neural networks and interference correction enable deep proteome coverage in high throughput. Nat Meth. 17 (1), 41-44 (2020).
  12. Zhang, F., et al. A Comparative Analysis of Data Analysis Tools for Data-Independent Acquisition Mass Spectrometry. Mol Cell Proteomics. 22 (9), 100623(2023).
  13. Kong, A. T., Leprevost, F. V., Avtonomov, D. M., Mellacheruvu, D., Nesvizhskii, A. I. MSFragger: ultrafast and comprehensive peptide identification in mass spectrometry-based proteomics. Nat Meth. 14 (5), 513-520 (2017).
  14. Anderson, N. L., Anderson, N. G. The Human Plasma Proteome. Mol Cell Proteomics. 1 (11), 845-867 (2002).
  15. Kowal, J., et al. Proteomic comparison defines novel markers to characterize heterogeneous populations of extracellular vesicle subtypes. Proc Natl Acad Sci. 113 (8), E968-E977 (2016).
  16. Cao, L., et al. Proteogenomic characterization of pancreatic ductal adenocarcinoma. Cell. 184 (19), 5031-5052.e26 (2021).
  17. Dong, L., et al. Proteogenomic characterization identifies clinically relevant subgroups of intrahepatic cholangiocarcinoma. Cancer Cell. 40 (1), 70-87.e15 (2022).
  18. Dubois, E., Galindo, A. N., Dayon, L., Cominetti, O. Comparison of normalization methods in clinical research applications of mass spectrometry-based proteomics. 2020 IEEE Conf Computat Intelligence Bioinfo Computat Biol. , 1-10 (2020).
  19. Dressler, F. F., Brägelmann, J., Reischl, M., Perner, S. Normics: Proteomic Normalization by Variance and Data-Inherent Correlation Structure. Mol Cell Proteomics. 21 (9), 100269(2022).
  20. Dimmer, E. C., et al. The Gene Ontology - Providing a Functional Role in Proteomic Studies. Proteomics. 8 (23-24), pmic.200800002(2008).
  21. Lih, T. M., et al. Detection of Pancreatic Ductal Adenocarcinoma-Associated Proteins in Serum. Mol Cell Proteomics. 23 (1), 100687(2024).
  22. Chinese Human Proteome Project (CNHPP) Consortium. Proteomics identifies new therapeutic targets of early-stage hepatocellular carcinoma. Nature. 567 (7747), 257-261 (2019).
  23. Kanehisa, M., Furumichi, M., Sato, Y., Matsuura, Y., Ishiguro-Watanabe, M. KEGG: biological systems database as a model of the real world. Nucl Acids Res. 53 (D1), D672-D677 (2025).
  24. Campello, E., Ilich, A., Simioni, P., Key, N. S. The relationship between pancreatic cancer and hypercoagulability: a comprehensive review on epidemiological and biological issues. Br J Cancer. 121 (5), 359-371 (2019).
  25. Fang, L., Xu, Q., Qian, J., Zhou, J. Y. Aberrant Factors of Fibrinolysis and Coagulation in Pancreatic Cancer. OncoTargets Ther. 14, 53-65 (2021).
  26. Vlodavsky, I., Elkin, M., Ilan, N. Impact of heparanase and the tumor microenvironment on cancer metastasis and angiogenesis: basic aspects and clinical applications . Rambam Maimonides Med J. 2 (1), (2011).
  27. Fröhlich, K., et al. Benchmarking of analysis strategies for data-independent acquisition proteomics using a large-scale dataset comprising inter-patient heterogeneity. Nat Comm. 13 (1), 2622(2022).
  28. Polasky, D. A., et al. MSFragger-Labile: A Flexible Method to Improve Labile PTM Analysis in Proteomics. Mol Cell Proteomics. 22 (5), 100538(2023).
  29. Gerault, M. A., Camoin, L., Granjeaud, S. DIAgui: a Shiny application to process the output from DIA-NN. Bioinfo Adv. 4 (1), (2024).
  30. Hsiao, Y., et al. Analysis and Visualization of Quantitative Proteomics Data Using FragPipe-Analyst. J Proteome Res. 23 (10), 4303-4315 (2024).
  31. Yu, F., Deng, Y., Nesvizhskii, A. I. MSFragger-DDA+ enhances peptide identification sensitivity with full isolation window search. Nat Comm. 16 (1), 3329(2025).
  32. Li, K., Teo, G. C., Yang, K. L., Yu, F., Nesvizhskii, A. I. diaTracer enables spectrum-centric analysis of diaPASEF proteomics data. Nat Comm. 16 (1), 95(2025).
  33. Qiao, R., Li, H., Bian, H., Xin, L., Shan, B. De Novo sequencing-assisted homology search for DIA data analysis enables low abundance peptide variants discovery. Biorvix. 10, (2025).
  34. Meissner, F., Geddes-McAlister, J., Mann, M., Bantscheff, M. The emerging role of mass spectrometry-based proteomics in drug discovery. Nat Rev Drug Disc. 21 (9), 637-654 (2022).
  35. Zheng, Y., et al. Multi-omics data integration using ratio-based quantitative profiling with Quartet reference materials. Nat Biotechnol. 42 (7), 1133-1149 (2024).
  36. Bubis, J. A., et al. Challenging the Astral mass analyzer to quantify up to 5,300 proteins per single cell at unseen accuracy to uncover cellular heterogeneity. Nat Meth. 22 (3), 510-519 (2025).
  37. Leutert, M., Entwisle, S. W., Villén, J. Decoding Post-Translational Modification Crosstalk With Proteomics. Mol Cell Proteomics. 20, 100129(2021).
  38. Schneider, M., et al. A Scalable, Web-Based Platform for Proteomics Data Processing, Result Storage and Analysis. Proteome Res. 24 (3), 1241-1249 (2025).
  39. Jalili, V., et al. The Galaxy platform for accessible, reproducible and collaborative biomedical analyses: 2020 update. Nucl Acids Res. 48 (W1), W395-W402 (2020).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

KEGG

مقالات ذات صلة