$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
מחקר זה ניתח סטטיסטיקות של מחקר אסוציאציות גנומי רחב (GWAS) שאינן מזוהות, ברמת סיכום וזמינות לציבור. בהתאם למדיניות המאגר ולאישורים שהושגו על ידי החוקרים המקוריים, לא נדרשה אישור מועצת ביקורת מוסדית חדשה או הסכמה אישית מדעת נוספת לניתוח משני זה. כל ה-GWAS התורמים דיווחו על הליכי אישור אתיקה והסכמה בפרסומים המקוריים שלהם. כל הניתוחים בוצעו בהתאם להנחיות המוסדיות ולהצהרת הלסינקי.
סקירה כללית והיגיון
המחקר יישם מסגרת דו-כיוונית, דו-דגימית, של מנדליזציה אקראית (MR) המוגבלת לסטטיסטיקות סיכום של מוצא אירופי, כדי להעריך קשרים סיבתיים פוטנציאליים בין טרשת נפוצה (MS) למאירויות המטולוגיות (HM). העיצוב עומד בשלוש ההנחות המרכזיות של MR: רלוונטיות למכשירים, עצמאות מבלבולים, והגבלת החרגות. לכן, זרימת העבודה כוללת (i) גישה ואוצרת מערכי נתונים, (ii) בחירת מכשירים במובהק גנומי כולל עם קיבושים של חוסר שוויון קישורי (LD), (iii) סינון קונבול באמצעות PhenoScanner, (iv) הרמוניזציה של אללים עם טיפול מפורש בווריאנטים פלינדרומיים, (v) הערכת כיוון באמצעות מבחן Steiger¹², (vi) הערכת MR ראשונית עם שיטות משלימות, (vii) סט מלא של אבחון רגישות, ו-(viii) יצירת איורים וטבלאות סטנדרטיים תחת בקרה עם בדיקות מרובות. כל אחד מהשלבים הללו מתואר בפירוט בסעיפי הפרוטוקול הבאים, וסקירה של הצינור מוצגת באיור 1.
חומרים, תוכנה ו-RRID
הניתוחים נערכו בגרסה R 4.3.1 (RRID:SCR_001905) באמצעות RStudio/Posit 2023.12+ (RRID:SCR_000432). ה-LD clumping, כאשר בוצע מקומית, השתמש ב-PLINK v1.9 (build 2.3; RRID:SCR_001757)13. הערכת MR וחילוץ נתונים השתמשו בחבילת R TwoSampleMR v0.5.7 10; חיפושי מכשירים למבלבלים פוטנציאליים שהשתמשו בפנוסקאנר v1.0; זיהוי ותיקון חריגים השתמשו ב-MRPRESSO v1.0. גרסאות מדויקות מדווחות עבור חבילות ללא RRID.
מקורות נתונים וגישה
סטטיסטיקות סיכום של טרשת נפוצה התקבלו ממטא-אנליזה של International Multiple Sclerosis Genetics Consortium, שכללה 47,429 מקרים של טרשת נפוצה ו-68,374 מקרים ביקורת עם בקרת איכות מתואמת ב-15 קבוצות. סטטיסטיקות סיכום HM התקבלו מ-FinnGen (סך כולל n = 218,792; >16 מיליון וריאנטים) וכללו לימפומה הודג'קין (HL), לימפומה של תאי B גדולים מפוזרת (DLBCL), לימפומה זקיקית (FL), לימפומות T/NK בוגרות (MTNKL), לימפומה לא-הודג'קין אחרת או לא מוגדרת (NHL), לוקמיה לימפואידית, לוקמיה מיאלואידית, לוקמיה מסוג תא לא מוגדר, וניאופלזמות מיאלומה/פלזמה מרובה14. מערכי הנתונים ניגשו דרך פורטל OpenGWAS של IEU באמצעות מזהי גישה מתועדים15. לכן, כל הניתוחים במחקר זה התבססו אך ורק על מערכי נתונים זמינים לציבור ברמת סיכום GWAS; לא נעשה שימוש או הופק נתוני מטופלים ברמת קבוצה מוסדית פנימית או ברמת הפרט. מכיוון שלא זיהינו GWAS נוסף עם הגדרות תת-סוג של טרשת נפוצה וממאירה המטולוגית מתואמות שיאפשרו שכפול מלא של הצינור, לא בוצע אימות חיצוני עצמאי באמצעות מערך נתונים נפרד והוא מוכר כמגבלה. הפרוטוקול נכתב כך שניתן יהיה להחילו מחדש ישירות על מערכי נתונים עתידיים של GWAS לצורך אימות עצמאי.
בחירת כלי נגינה וקיבושים ב-LD
לכל חשיפה, נבחרו פולימורפיזמים של נוקלאוטידים בודדים (SNPs) במובהקות כלל-גנומית (P < 5 × 10-8) תוך שימוש בפונקציית extract_instruments ב-TwoSampleMR שהוחלה על מערכי הנתונים של OpenGWAS. כדי להבטיח עצמאות של המכשירים, בוצע ה-LD clumping מול לוח ייחוס ממוצא אירופי באמצעות כלי הקיבושים הפנימיים של TwoSampleMR או מקומית עם PLINK, עם סף r² של 0.001 וחלון פיזי של 10,000 קילובסיסים. כאשר השתמשו ב-PLINK, פרמטרי שורת הפקודה הוגדרו לסף מובהקות ראשונית של 5 × 10-8, r² = 0.001, וחלון של 10Mb כך שהמכשירים המקורבים תואמים בדיוק לקריטריונים אלה. עוצמת המכשיר הוערכה באמצעות סטטיסטיקת F שמקורה בהערכת אפקט החשיפה ושגיאת התקן שלה (F ≈ β²/SE²); וריאנטים עם F < 10 הוצאו מערכות המכשירים הסופיות, ושאר ה-SNPים הועברו לסקר PhenoScanner.
סקר מבלבל עם PhenoScanner
כדי למזער פליאוטרופיה אופקית באמצעות גורמי סיכון ידועים, כל מכשיר מועמד נשאלה ב-PhenoScanner V2 בקטלוג GWAS באמצעות חבילת Phenoscanner R (v1.0)16,17. לכל SNP ביקשנו את כל האסוציאציות המדווחות ב-P < 1 × 10⁻5 ובדקנו ידנית את התכונות שהוחזרו. קשרים המצביעים על קשרים לגורמי סיכון לממאירות המטולוגיים מבוססים—כגון חשיפה הקשורה לעישון או תכונות שומן/אנתרופומטריות (למשל, מדד מסת גוף, היקף מותן ומדידות שומן גוף)—או קשרים ישירים לפנוטיפים של ממאירויות המטולוגיות גרמו להחראת ה-SNP המתאים מערכת הכלים18. קטגוריות תכונות שנחשבו כמניעות התבססו על ראיות קודמות הקשורות להשמנה ועישון לסיכון ללוקמיה, לימפומה או מיאלומה 18,19,20. השאילתות השתמשו בשורשי מילות מפתח רחבים (למשל, עשן, סיגריה, BMI, השמנת יתר, מותן, שומן, ממאיריות המטולוגית, לימפומה, לוקמיה, מיאלומה). כל ההסרות תועדו בגיליון מעקב יחד עם תכונת PhenoScanner שגרמה להחרמה, ורשימות המכשירים המנוקות הועברו לשלב ההרמוניזציה.
הרמוניזציה וטיפול פלינדרומי
אללי ההשפעה לכל SNP הונחו בין מערכי הנתונים של החשיפה והתוצאה באמצעות פונקציית harmonise_data בחבילת TwoSampleMR (v0.5.7, R). יישרנו את כל אללי התוצאה לאלל אפקט החשיפה כך שמקדמי בטא חיוביים תמיד תואמים לאותו אלל בשני מערכי הנתונים. וריאנטים פלינדרומיים (A/T או C/G) עם תדרי אפקט-אלל ביניים (0.42-0.58) בפאנל ההתייחסות של OpenGWAS טופלו כדו-משמעיים של גדיל והוסרו אוטומטית על ידי הגדרת פעולת ההרמוניזציה להפסקת SNPs עמומים. SNPs פלינדרומיים עם תדרי אלל אפקט מחוץ לטווח זה נשמרו ויוארו לפי תדרי האלל המדווחים. מכיוון שזמינות האללים והסטטוס הפאלינדרומי היו שונים במעט בין תוצאות FinnGen, ההרמוניזציה בוצעה בנפרד לכל פנוטיפ HM, ומספר המכשירים הסופי שנכנסו לכל ניתוח תוצאה ספציפי הוצא מאובייקטי R ההרמוניים ודווח בטבלאות.
הערכת כיוונים (סינון שטייגר)
הכיוונים הוערכו באמצעות גישת סטייגר כפי שיושמה בפונקציה steiger_filtering של TwoSampleMR. עבור כל SNP, הפונקציה חישבה תחילה את השונות המוסברת (R²) בחשיפה ובתוצאה ממקדם הבטא של GWAS, שגיאת תקן וגודל המדגם. המחקר הסיר לאחר מכן מכשירים שעבורם R² היה גבוה יותר בתוצאה מאשר בחשיפה, מה שמעיד על כיוון הפוך אפשרי של האפקט. סינון שטייגר יושם בנפרד לכל מאגר תוצאות, והכלים הנותרים (שורות עם steiger_dir == TRUE) נשמרו ושימשו בניתוחי MR הבאים. ספירות המכשירים לאחר סטייגר נרשמו עבור כל תוצאה ומדווחות לצד הערכות ה-MR.
הערכה ראשונית של MR ושליטה בבדיקות מרובות
הערכות סיבתיות ראשוניות הושגו באמצעות MR משוקלל-שונות הפוכית (IVW) תחת מודל אפקטים קבועים באמצעות פונקציית MR ב-TwoSampleMR, כאשר השיטות צוינו כ"mr_ivw", "mr_egger_regression" ו"mr_weighted_median". לכל תוצאה של HM הועברו ל-mr מכשירים הרמוניים ומסוננים על ידי שטייגר, ויחסי סיכויים לוגריתמים ושגיאות סטנדרטיות הופקו והועברו כדי לקבל יחסי סיכויים (ORs) עם רווחי סמך של 95% (CI) עבור תכונות בינאריות21. כדי לבחון עמידות להפרות מתונות של הנחת אי-פליאוטרופיה, השתמשנו גם באומדני הרגרסיה המשוקללים ו-MR-Egger22,23, שיושמו באותה חבילה. כאשר מבחן Q של קוקרן (מ-mr_heterogeneity) הצביע על הטרוגניות משמעותית (P < 0.05), המחקר התאים גם למודלים של IVW עם השפעות אקראיות מוכפלות ודיווח על תוצאות הן עם השפעות קבועות והן בתוצאות אקראיות. טעות משפחתית בין תשעת תוצאות ה-HM נשלטה באמצעות תיקון בונפרוני עם α = 0.05/9 = 5.56 × 10-3; אסוציאציות עם ערכי P מתחת לסף זה נחשבו למובהקות סטטיסטית, בעוד אלו עם 0.0056 ≤ P < 0.05 פורשו כמרמזים ותוארו בזהירות.
אבחון רגישות: הטרוגניות, פליאוטרופיה וחריגים
הסטטיסטיקה Q של קוקרן שימשה להערכת הטרוגניות בין מכשירים עבור מודלים של IVW ו-MR-Egger, ויושמה באמצעות פונקציית mr_heterogeneity ב-TwoSampleMR. פליאוטרופיה אופקית כיוונית הוערכה באמצעות מבחן האינטרספט MR-Egger (mr_pleiotropy_test) והבדיקה הגלובלית בחבילת MR-PRESSO24. MR-PRESSO24 הופעלה עם ההגדרות המומלצות ב-R (NbDistribution ≥ 5,000, SignifThreshold = 0.05) כדי לזהות חריגים משפיעים ולכמת עיוות פוטנציאלי על ידי השוואת הערכות IVW לפני ואחרי הסרת חריגים25. בוצעו ניתוחי השארה-אחד-אאוט (mr_leaveoneout) לכל זוג חשיפה-תוצאה כדי לקבוע האם SNP בודד משפיע באופן לא פרופורציונלי על ההערכה הכוללת. למען שקיפות ושחזור, כל תוצרי האבחון יוצאו מ-R ודווחו יחד עם ספירות המכשירים המתאימות לאחר הרמוניזציה, סינון Steiger והסרת חריגות MR-PRESSO.
חוזק הכלים והערכת NOME
עוצמת המכשיר עבור MR-Egger נמדדה באמצעות סטטיסטיקת I2GX, שחושבה כ-1 פחות ממוצע שגיאות התקן בריבוע של קשרי SNP-חשיפה חלקי השונות שלהם על פני מכשירים26. ערכים הקרובים ל-1 מצביעים על עמידה טובה יותר בהנחת NOME ללא שגיאת מדידה; ערכים נמוכים יותר מצביעים על אפשרות לדילול רגרסיה ופרשנות זהירה מהירה של תוצאות MR-Egger. I2GX חושב ודווח עבור כל ניתוח ספציפי לתוצאה.
אקראיות מנדלית הפוכה
הצינור המלא חזר על עצמו בכיוון ההפוך על ידי התייחסות לכל תת-סוג HM כאל החשיפה ול-MS כתוצאה. כאשר מכשירים משמעותיים כלל-גנומיים לא הספיקו לחשיפה ל-HM נתון, הותר סף ברירה מרופה של P < 5 × 10-6 תוך שמירה על אותם פרמטרים של התלכדות LD, סקר PhenoScanner, הליכי הרמוניזציה, סינון Steiger ואבחון רגישות. ניתוחים שהשתמשו בספים מרוככים תויגו בבירור בטבלאות ובאגדות האיורים המתאימים.
ויזואליזציה וייצוא דמויות
נוצרו גרפים של פיזור, יער, משפך והשארת אחד החוצה, כאשר המונחים הוצבו מתחת לפאנלים וגודל הגופנים הותאמו כדי להבטיח שהתוויות לא יטשטשו את הנתונים שצוירו. גבולות הציר הוגדרו על פני תוצאות דומות כדי להקל על השוואה ויזואלית. הדמויות יוצאו במינימום של 300 dpi בפורמטים ללא אובדן כמו TIFF או PNG. כל הערכים המספריים שנבחרו הושוו מול ההערכות המדווחות כדי להבטיח עקביות בין טקסט, טבלאות ואיורים.
שחזוריות ושיתוף נתונים
זרעים אקראיים תוקנו היכן שניתן, גרסאות תוכנה הוקלטו, וסקריפטי ניתוח יחד עם אובייקטים ביניים נשמרו בארכיון כדי לאפשר הפעלה חוזרת של כל השלבים. מזהי גישה למאגרי נתונים והגדרות פנוטיפ תועדו, ורשימות הכלים בכל שלב סינון - לאחר ההתלכדות, לאחר ההרמוניזציה, סינון לאחר סטייגר ואחרי MR-PRESSO הוכנו להעלאה כקבצי גיליון אלקטרוני בהתאם להנחיות כתב העת.