$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
מחקר זה השתמש בנתונים קליניים וטרנסקריפטומיים זמינים לציבור, שלא זוהו מ-The Cancer Genome Atlas ומ-Gene Expression Omnibus. כל המחקרים התורמים קיבלו אישור מוקדם של ועדת ביקורת מוסדית והסכמה מדעת. מכיוון שבוצע רק ניתוח משני של נתונים אנונימיים, לא נדרשה אישור אתי נוסף. מסדי הנתונים והתוכנות בהם משתמשים מופיעים בטבלת החומרים.
1. הורדת נתונים
המחקר השתמש במערך הנתונים EC (TCGA-Carcinoma Body Endometrial Carcinoma (TCGA-UCEC))10, הכולל 589 דגימות, כולל 554 דגימות רקמת גידול ממטופלי UCEC (קבוצת UCEC) ונתוני ריצוף מ-35 רקמות תקינות סמוכות (קבוצה תקינה). מאגר הנתונים של UCSC Xena שימש לשחזור הנתונים הקליניים המתאימים11, למעט אלו שחסרו להם מידע קליני מלא. בסופו של דבר, 577 דגימות עם נתונים קליניים היו זמינות לניתוח. מידע בסיסי מפורט מופיע בטבלה 1.
מערכי נתונים נוספים הקשורים ל-EC, GSE115810ו-GSE63678 12 הורדו באמצעות חבילת GEOquery13. מערך הנתונים GSE115810 ו-GSE63678 אוחדו ליצירת מערכי הנתונים המשולבים להמשך ניתוח (טבלה 2).
גנים הקשורים למטבוליזם של NAD+ (NMRGs) ממוקמים אחרי GeneCardsrecord14 והספרות הרלוונטית15. באמצעות מונח החיפוש "מטבוליזם ניאצינמיד" ב-GeneCards, זיהו 345 NMRGs עם ציוני רלוונטיות מעל 4. שילוב והסרת כפילויות מ-42 ה-NMRG שנמצאו בספרות הרכיבו בסך הכל 371 NMRGs (טבלה משלימה 1). הנתונים הקליניים נאספו כקבצי פנוטיפיים של .tsv; הנתונים הורדו בפורמט HTSeq-FPPM. הדגימות שהוחרגו הכילו יותר מ-20% מהנתונים הקליניים שלהן חסרים. FPKM עבר טרנספורמציה לlog2 והומרה ל-TPM (תמלילים למיליון). מזהי הגשושים מופו לסמלי גנים עבור מערכי נתונים GEO, ובדיקות כפולות נערכו ממוצע.
2. גנים מבוטאים באופן שונה של מטבוליזם ניקוטינמידים
המחקר החל ביישום קבוצתR sva16 כדי לשלול רכישות קבוצה לאחר מערכי הנתונים GSE115810 ו-GSE63678, מה שהוביל למערך נתונים הדדי הכולל 31 דגימות EC (UCEC) ו-8 דגימות נורמליות סמוכות. לאחר מכן, השימוש בקבוצת לימה17 לביצוע בדיקת הבעה גנטית של פערים במאגר הנתונים TCGA-UCEC.
החיתוך בין DEGs מניתוח TCGA-UCEC עם 337 NMRG כדי לאתר DEGs הקשורים למטבוליזם ניקוטינמיד. זה יצר רשימה של גנים מבוטאים באופן דיפרנציאלי (NMRDEGs) הקשורים למטבוליזם של ניאצינמידים, שצוירו באיור של ון. תוצאות בדיקת המראה של הפער הוצגו על ידי חבילת ggplot2 R18, בעוד שנוצרה מפת חום של NMRDEGs באמצעות קבוצת pheatmap19. שונות בין-מערכתית מתבטלת באמצעות תיקון אצווה באמצעות ComBat (בייס אמפירי). מסגרת המודל הלינארי האמפירית של בייס שימשה בניתוח DEG. ספי ביטוי דיפרנציאליים מיושמים במפורש:
|log2FC| ≥ 1
רוזוולט פחות מ-0.05.
רשימת NMRG הצטלבה רק עם DEGs שעמדו בשתי הדרישות. עלילות של הרי געש ומפות חום שנעשו עם ggplot2 ו-pheatmap.
3. בדיקת שיפור תפקוד (GO), מסלול (KEGG) של NMRDEGs
בדיקות שיפור GO20 ו-KEGG21הושלמו על ידי קבוצת clusterProfiler 22. בשני הניתוחים, ספי מובהקות זוהו ב-p. adjust< 0.05 ו-FDR (ערך q) < 0.25. המחקר גם שילב ערכי logFC בניתוח ההעשרה, המייצגים את התוצאות בדיאגרמות מעגליות ואקורדים. ספים למובהקות העשרה: ערך p מותאם < 0.05 FDR < 0.25 (q-value). פרופיילר אשכול שימש למחקרי GO ו-KEGG. כיווני גנים מוצגים באמצעות גרפים של מיתרים ומעגלים המשלבים נתוני שינוילוגריתמי דו-ממדי.
4. ניתוח העשרת קבוצות גנים (GSEA)
סוג קבוצות הגורמים התורשתיות שתרמו הכי הרבה לפנוטיפ ניתן לזיהוי באמצעות GSEA23. לצורך ניתוח זה, מערך הנתונים TCGA-UCEC דורג על פי ערכי logFC, ונערך בדיקת שיפור באמצעות חבילת clusterProfiler . הגבלות מרכזיות כללו ערך זרע של 2022 ו-10,000 פרמוטציות. קבוצת הגנים MSigDB "c2.all.v2022.1.Hs.symbols.gmt" שימשה24. המסלולים המועשרים ביותר, כולל גנים שנגרמו מהיפוקסיה של מנאלו, הזדקנות הנגרמת על ידי לחץ חמצוני, גליקוליזה ונתיבי אפופטוזיס, הוצגו באמצעות גרף הר. לפני GSEA, הגנים סודרו לפי שינויlog 2 fold. נעשה שימוש ב-10,000 פרמוטציות בניתוח. c2.all.v2022.1.Hs.symbols.gmt הוא אוסף MSigDB ששימש. לצורך שחזוריות, נעשה שימוש בזרע אקראי קבוע (2022). מסלולים משמעותיים היו אלו עם p < 0.05 ו-q < 0.25.
5. בניית מודל קוקס ובדיקת תחזית קשורה
כדי לקבוע את הערך החיזוי של גנים מבוטאים באופן שונה (NMRDEGs) הקשורים למטבוליזם ניקוטינמידים בקרצינומה של רירית הרחם (UCEC), השתמשו החוקרים בניתוח רגרסיה חד-משתנית של Cox כדי לסווג תחילה גורמים תורשתיים של המבקשים; אלו עם יחס סיכון (HR) > 1 ו-p-value < 0.1 נקבעו כמתאימים למסגרת הסיכונים היחסיים הרב-משתניים של Cox.
קריטריונים לבחירת קוקס חד-משתנית: p < 0.10 ו-HR > 1. ערכי ביטוי מנורמלים ב-Log2-TPM שימשו במודל Cox הרב-משתני. שילוב ליניארי של מקדמי קוקס × ביטוי גנים משמש לקביעת ציון הסיכון. הסתברויות OS ל-1, 3 ו-5 שנים שימשו בכיול נומוגרמה. ערכי AUC ל-1, 3 ו-5 שנים שימשו ב-ROC תלוי זמן. שיטת הסטטיסטיקה המקסימלית surv_cutpoint שימשה למציאת ערכי חיתוך הישרדות. גם ניתוחי KM וגם ניתוחי ROC השתמשו באותם ספים.
נומוגרף נבנה ממודל Cox הרב-משתני כדי להעריך את דיוקו או יכולת החיזוי שלו ולחשב את הסיכויים לקיום כולל של 1, 3 ו-5 שנים. קשתות סטנדרטיזציה משמשות להערכת היציבות בין הסיכויים החזויים לתוצאות ממשיות, וניתוח עקומות החלטה (DCA) שימש למדידת היעילות הרפואית של המבנה25.
רמות הביטוי של mRNA נקבעו כרשומות מומרת ל-log₂ למיליון (TPM) מנורמלות באמצעות חבילת DESeq2. TPMs לקחו בחשבון את מורכבות הריצוף ומדידת הגנים כדי לספק הערכות חזקות ובלתי מוטות של רמות הביטוי בין הדגימות.
באמצעות מקדמי מודל Cox הרב-משתני, נקבע דירוג הסיכון הפרוגנוסטי של כל מטופל כך:
riskScore = מקדםΣi (גןi) *ביטוי mRNA (גןi) (1)
קשתות קיום קפלן-מאייר (KM) הוכנו כדי להעריך את הסיבלנות הכללית של אשכולות גבוהים ובעלי סיכון נמוך שנוצרו על פי דירוגי סיכון שנקבעו. קשתות מאפיין תפעול מקלט תלויות זמן (ROC) יוצרו בהערכת שגרת מסגרות בתקופות של 1, 3 ו-5 שנים 26,27.
כדי לסווג ביטוי גנים לפי אוספים בעלי ביטוי גבוה ונמוך לצורך שכבת הישרדות, נעשה שימוש בתפקיד הנקודה surv_cut לאחר חבילת ה-SRVMINER R. פונקציה זו קובעת את ערך החיתוך הגדול ביותר על ידי מקסום הסטטיסטיקה הסטנדרטית של דירוג הלוגריתם, ומספקת נקודת חיתוך לא מוטה, אופטימלית סטטיסטית.
ערכי החיתוך שהתקבלו עבור כל גן פרוגנוסטי מסומנים בעקומות ROC כקווים מקווקוקים. המחקר יישם את אותם ספים לכל ניתוחי הישרדות וניתוחי ROC.
TCGA RNA-seq הורד בפורמט HTSeq-FPKM; הנתונים הקליניים יובאו כקבצי פנוטיפ TSV; FPKM הומר ל-TPM והוסב ל-log₂; מערכי הנתונים של GEO מופו ממזהי גלאים לסמלי גנים באמצעות הערות פלטפורמה; בדיקות כפולות נמדדו בממוצע עבור ערך גן יחיד; מדגמים עם יותר מ-20% מידע קליני חסר הוצאו; ComBat (אמפירית בבייס) שימשה לתיקון אצווה למאגרי GSE; PCA ו-boxplots שימשו כדי לוודא שתיקון האצווה הצליח. נרמול TPM באמצעות טכניקות טרנספורמציית ביטוי סטנדרטיות; תיקון אצווה באמצעות ComBat עם מקור מערך הנתונים כמשתנה אצווה; ביטוי דיפרנציאלי שחושב באמצעות מידול ליניארי של לימה (מטריצת גידול לעומת מטריצת עיצוב נורמלית); רשימות גנים מדורגות שנוצרו משינויים ב-log₂ עבור קלט GSEA; ורגרסיות קוקס חד-משתניות ורב-משתניות שבוצעו באמצעות כלי ניתוח הישרדות
6. ניתוח שונות של קבוצות גנים (GSVA)
GSVA28 שימש למדידת הדרך שבה השיפור בין האשכולות. במאגר הנתונים של TCGA-UCEC הועשרו 50 מסלולים בולטים, כאשר 41 מהם הראו שינויים משמעותיים בין ההרכבות הבינאריות. GSVA שימש עם מערכי גנים ייחודיים לקבלת פעילות מסלולים לכל דגימה; נתוני אינטראקציה של חלבוני STRING יובאו ל-Cytoscape; אלגוריתם MCC שימש לזיהוי גנים של ה-hub; ציוני הסיכון חושבו כסכום ערכי ביטוי הגנים מוכפלים במקדמי Cox שלהם; עקומות ROC התלויות זמן נוצרו באמצעות שגרות ROC בזמן הישרדות. עבור כל מדגם, GSVA חישבה ציוני העשרה ברמת המסלול. מבחן סכום הדירוג של וילקוקסון משמש להערכת הבדלים בפעילות מסלולי ההיכר. מתוך חמישים מסלולי החתימה, ארבעים ואחד היו שונים באופן משמעותי (מותאם p < 0.05).
7. מערכת אינטראקציה בין חלבון לחלבון (PPI)
מערכת PPI הכוללת את הגנים החשובים (AURKA, CDKN3, FOXM1, CDKN2A, TK1 ו-CDK1) נוצרה באמצעות קובץ STRING29 וסף ערך תקשורת של 0.70, המצביע על ביטחון גבוה. רשת זו נוצרה באמצעות Cytoscape30, ומדגישה אינטראקציות שעשויות למלא תפקידים מרכזיים בפתוגנזה של UCEC. שיטת מרכזיות הקליקה המקסימלית (MCC)31 הייתה שימושית לדירוג הגורם התורשתי שנוצר בציוני האינטראקציה שלהם ברשת. רצף החלבונים העליונים עם ציוני הממשק העליונים זוהה, כולל CDK2, CDK4, CCNA2, CCNB1, CCNE1, CDK1, TP53 ו-FOXM1. גנים אלו נותחו בהמשך בשל מעורבותם בתהליכים ביולוגיים קריטיים. פלטפורמתGeneMANIA 32 שימשה גם לחיזוי אינטראקציות חלבונים נוספות ולספק הקשר רחב יותר לתפקידי הגנים המרכזיים בהתקדמות UCEC. סף לציון ביטחון ב-STRING: >0.70 (ביטחון גבוה). Cytoscape מציג את הרשת. טכניקת מרכזיות החבורה המקסימלית (MCC) משמשת לדירוג גני ה-hub. דירוג MCC שימש לזיהוי הגנים המובילים באינטראקציה (CDK2, CCNA2, TP53 וכו'). תחזיות אינטראקציה נוספות נעשות באמצעות GeneMANIA.
8. מפת דרכים טכנולוגית
זרימת העבודה הכוללת והשיטות שבהן נעשה שימוש במחקר זה מסוכמות במפת הדרכים הטכנולוגית המוצגת באיור 1. מפת דרכים זו מפרטת את השלבים מרכישת מערכי נתונים וניתוח ביטויים דיפרנציאליים ועד לבניית מודלים פרוגנוסטיים וניתוחי העשרה.
9. ניתוח סטטיסטי
עיבוד נתונים והערכה סטטיסטית בוצעו באמצעות תוכנית R (גרסה 4.3.0). מבחן Mann-Whitney U או מבחן t-סטודנט עצמאי שימש להשוואות בין שתי קבוצות; מבחן קרוסקאל-ווליס שימש לשלוש הרכבות או יותר. הנתונים התיאוריים הוערכו באמצעות חי-ריבוע או מבחן מדויק של פישר. בנוסף, בוצעו קורלציה של ספירמן וניתוח הישרדות קפלן-מאייר; P < 0.05 נחשב משמעותי.
יישום מבחנים סטטיסטיים לפי התפלגות הנתונים: נתונים רגילים באמצעות מבחן t של התלמיד. מבחן Mann-Whitney U לנתונים שאינם נורמליים. מבחן קרוסקל-ווליס ליותר משלוש קבוצות. פישר מדויק וכי-ריבוע לנתונים קטגוריים. מובהקות סטטיסטית מוגדרת כ-p < 0.05.
אמינות הנתונים נשמרת על ידי נקודות הבדיקה לפני הטיפול, שבהן גרפי קופסה צריכים להראות שונות ביטוי עקבית בין הדגימות, וגרפים PCA צריכים להראות היעדר אשכולות ספציפיים לאצווה לאחר התאמת ComBat. מפות חום המדגימות קיבוץ נורמלי של גידול וגרפים של הרי געש שממחישים בבירור ויסות גנים למעלה/למטה נחוצים לאימות DEG. במודל ההקרנה של Cox, גרפים של כיול צריכים להתאים לחזוי ולהישרדות בפועל, ערכי AUC של ROC צריכים להיות גבוהים מ-0.65, וקשתות KM חייבות להראות הבדל הישרדות משמעותי. יש להראות פעילויות מסלול שונות בין קבוצות סיכון באמצעות ניתוח GSVA, בהתאם למנגנונים מבוססים כמו התרחבות או מסלולי מחזור תאים. כדי לאמת את עמידות הרשת, צמתים מחוברים מאוד ברשת PPI חייבים להופיע במרכז, וגנים מרכזיים שנקבעו על ידי MCC צריכים להתאים לווסטורים בעלי חשיבות פיזיולוגית.