מאמר שיטה

הערכה מקיפה של כלי אימפוטציה לגנוטיפ עבור נתוני ריצוף גנום מלא בעומק נמוך במיוחד

DOI:

10.3791/68879

12 בדצמבר 2025

במאמר זה

סיכום

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

שלושה כלי אימפוטציה - STITCH, QUILT2 ו-GLIMPSE2 - נבדקו בין עומקי רצף וגודל דגימות משתנים, באמצעות לוחות ייחוס CKB ו-EAS. התוצאות מספקות מסגרת מעשית לבחירת אסטרטגיות אימפוטציה מתאימות בנתוני ריצוף בעומק נמוך במיוחד, ומסייעות על מחקרים גנומיים ותכונות מורכבות בקנה מידה גדול.

תקציר

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ריצוף עומק נמוך במיוחד (ULDS) הוא אסטרטגיה חסכונית למחקרים גנומיים בקנה מידה גדול, אך תועלתו תלויה בהערכה גנטית מדויקת. מחקר זה מעריך שלושה כלי ההטלה — STITCH, QUILT2 ו-GLIMPSE2 — בעומקי ריצוף וגודל דגימות משתנים, תוך שימוש בלוחות הביולוגיה של China Kadoorie Biobank (CKB) ופרויקט 1000 Genomes (1KGP) מזרח אסיה (EAS). הוכחו סטיות קריטיות בביצועים: רגישות גודל המדגם: דיוק STITCH השתפר משמעותית עם דגימות גדולות יותר, בעוד ש-QUILT2 ו-GLIMPSE2 הראו תלות מינימלית בגודל המדגם. אופטימיזציה ללוח ייחוס: CKB ספציפי לאוכלוסייה שיפר משמעותית את הדיוק עבור QUILT2 ו-GLIMPSE2 אך השפיע במידה זניחה על STITCH, שמסתמך על הסקת הפלוטיפ פנימי. ספי עומק: כל הכלים השיגו דיוק עמיד בעומקי ריצוף בינוניים (≥ 0.5x), אך STITCH הציג ביצועים נמוכים משמעותית בעומקים נמוכים במיוחד (≤ 0.1x). GLIMPSE2 עם CKB סיפק את הדיוק הכולל הגבוה ביותר, בעוד QUILT2 איזן בין דיוק ליעילות חישובית. לנתוני בדיקות טרום-לידה לא פולשניות (NIPT), GLIMPSE2+CKB שמרה על דיוק מספק לניתוחים במורד הזרם. מוצעת מסגרת החלטות, המעדיפה פאנלים מותאמים לאוכלוסייה וכלים מותאמים לעומק, ומציעה הנחיות מעשיות לאופטימיזציה של ULDS-WGS בסביבות מחקר מגוונות. תובנות אלו מחברות בין התקדמות מתודולוגית ליישום מעשי, ומאפשרות הרחבה חסכונית של מחקרים גנומיים מבלי לפגוע באיכות הנתונים.

מבוא

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ריצוף עומק נמוך במיוחד (ULDS), המוגדר ככיסוי ריצוף מתחת ל-1x, זכה לפופולריות בזכות עלות נמוכה, כיסוי גנום רחב והתאמה לסוגי דגימות מגוונים. כבר הוכיחו ערך קליני ביישומים כמו בדיקות טרום-לידתיות לא פולשניות (NIPT)1, ניטור סרטן2, וזיהוי שונות במספר העותקים הכרומוזומליים (CNV) 3,4. מעבר לאבחון קליני, הירידה בעלות הריצוף וההתקדמות המהירה בביואינפורמטיקה אפשרו ל-ULDS למלא תפקיד הולך וגדל בגנומיקה אוכלוסית ובמחקר תכונות מורכבות. על ידי שילוב נתוני ULDS עם לוחות ייחוס של הפלוטיפים בקנה מידה אוכלוסייה, אימפוטציה גנוטיפית מאפשרת שחזור מידע על וריאנטים כלל-גנומיים ברמה הפרטנית. כתוצאה מכך, ULDS הפך לחלופה חסכונית למערכי SNP המסורתיים של פולימורפיזם חד-נוקלאוטידי (SNP) ולריצוף גנום מלא בעומק גבוה (WGS)5, במיוחד במחקרים רחבי היקף כמו מחקרי אסוציאציה כלל-גנומיים (GWAS) וניתוחי מבנה אוכלוסייה.

מחקרים קודמים הוכיחו את היתכנות ביצוע מחקרים גנטיים שונים באמצעות נתוני ריצוף NIPT, כולל קריאות וריאנטים, שחזור היסטוריית אוכלוסייה, הסקת דפוסי זיהום ויראליים ו-GWAS6.

למרות יתרונות אלה, אופיים הדליל מאוד של נתוני ULDS מציב אתגרים ייחודיים. ברמת הווריאנט, אתרים רבים אינם נצפים כלל או מיוצגים על ידי אלל אחד בלבד לכל פרט, מה שמוביל לאיכות נתונים לא מספקת לניתוחים במורד הזרם. לכן, העברת גנוטיפ היא חיונית, תוך ניצול מבנה הפלוטיפ מפאנלים גדולים (למשל, 1000 Genomes7 או משאבים ספציפיים לאוכלוסייה) כדי להסיק סטטיסטית גנוטיפים חסרים או לא ודאיים. עבודות קודמות הראו כי העברה מנתוני NIPT יכולה להגיע לדיוק גבוה ולשמור על עוצמה סטטיסטית חזקה ב-GWAS לזיהוי וריאנטים הקשורים לתכונות8. באמצעות אלגוריתם STITCH9 , נתוני NIPT (עומק ממוצע ~0.15x) בקבוצה של 20,900 נשים בהריון סיניות הועברו בהצלחה, מה שהוביל לזיהוי לוקוסי הקשורים להריון. הגנוטיפים שהונחו הראו התאמה חזקה לנתוני WGS בעומק גבוה בתוצאות GWAS (Pearson R² > 0.8)10.

הצלחת ניתוחים מבוססי ULDS תלויה באופן קריטי בדיוק ההשפעה, המושפע מעומק הריצוף, איכות פאנל ייחוס והתאמת אוכלוסייה, ביצועי אלגוריתמים של ההטלה, גודל המדגם וספקטרום תדירות האללים11. מבין אלה, בחירת לוח ההתייחסות היא גורם מרכזי לדיוק ההנחאה. פאנלים נפוצים כוללים משאבים מייצגים עולמיים כגון פרויקט 1000 הגנומים (1KGP)7, TOPMed12, וקונסורציום ההפלוטיפים (HRC)13, וכן פאנלים ספציפיים לאוכלוסייה או אזור הזמינים יותר ויותר כמו Singapore 10,000 Genomes (SG10K)14, הבנק הביולוגי של סין קדורי (CKB)15. גורם מרכזי נוסף בביצועי ההטלה הוא בחירת האלגוריתם. פותחו מספר כלים כדי להתמודד עם האתגרים הייחודיים של ריצוף בעומק נמוך, מה שמקדם משמעותית את השימוש המעשי באימפוטציה במחקר גנטי רחב היקף. בעוד ששיטות הערכה כמו Beagle (v5+)16, Minimac417 ו-IMPUTE511 בשימוש נרחב למערך SNP ונתוני WGS בעומק בינוני עד גבוה, הן לעיתים קרובות מתפקדות בצורה לא אופטימלית בהגדרות ULDS. לאחרונה פותחו כלים מיוחדים להתמודדות עם אתגרים אלו. STITCH9 מסיק הפלוטיפים ישירות מקריאות רצף בעומק נמוך, מה שהופך אותו למתאים במיוחד לקוהורטות הומוגניות גדולות. QUILT218 עושה שימוש בספריית הפלוטיפים דחוסה ובמודל הסתברות מקומית, המאפשרת הערכה יעילה עם לוחות ייחוס עצומים ומציעה יישומים ייחודיים בגנומיקה טרום-לידתית. GLIMPSE219, הרחבה של מסגרת GLIMPSE המקורית, מספקת שיפורים נוספים הן בדיוק והן ביעילות החישובית.

למרות שכלים אלו מהווים התקדמות משמעותית, הביצועים היחסיים שלהם תחת עיצובים ניסיוניים שונים (למשל, עומק ריצוף, גודל קבוצה ובחירת לוח ייחוס) לא הוערכו באופן שיטתי, מה שמשאיר את החוקרים ללא הנחיות ברורות לבחירת האסטרטגיה המתאימה ביותר. כדי לגשר על הפער הזה, שלושה כלים נפוצים לזיהוי ULDS — STITCH, QUILT2 ו-GLIMPSE2 — נמדדו באופן שיטתי תחת עומקי רצף וגודל דגימות שונים. הביצועים שלהם הוערכו באמצעות שני לוחות ייחוס מזרח אסייתיים הרלוונטיים מאוד לאוכלוסיות הסיניות. הממצאים מצביעים על כך שהעברת ULDS אמינה בדרך כלל בעומקי ריצוף ≥0.5x, בעוד שעומקים <0.1x דורשים קוהורטות גדולות בהרבה כדי להגיע לדיוק סביר. בחירת פאנל הייחוס צריכה להיות מותאמת להקשר המחקר, כאשר פאנלים מותאמים לגודל כמו CKB משפרים את דיוק ההטמעה. יתרה מזאת, גישות אלו ישימות ישירות על נתונים בעומק נמוך במיוחד שנוצרו במחקרי אוכלוסייה רחבי היקף וב-NIPT. מחקר זה מקים אפוא מסגרת מעשית לבחירת כלים במחקר מבוסס ULDS, ומספק הנחיות מתודולוגיות ליישומים עתידיים בגנטיקת אוכלוסיות וניתוחי תכונות מורכבות.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

כל המשתתפים סיפקו הסכמה מדעת בכתב לפני ההשתתפות. המחקר, שכלל נתוני WGS מעמיקים מאוד, נבדק ואושר על ידי מועצת הביקורת המוסדית של BGI (BGI-IRB 23058-T2), ואישור לאיסוף משאבי גנטיקה אנושיים התקבל ממנהל משאבי הגנטיקה האנושיים של סין ([2023] CJ0262). המחקר שכלל נתוני ULDS מ-NIPT אושר על ידי מועצת הביקורת המוסדית של בית החולים לילדים ווהאן (2021R062) ועל ידי מועצת הביקורת המוסדית של BGI (BGI-IRB 21088), עם אישור נוסף ממנהל משאבי הגנטיקה האנושיים של סין ([2021] CJ2002).

הערה: מחקר זה כלל שני סוגים של נתוני WGS. הסוג הראשון כלל נתוני WGS בעומק גבוה (30xx) שנאספו מדגימות דם של 500 פרטים שגויסו מקבוצת אוכלוסייה טבעית בשנזן. נתונים אלו שימשו לבניית מאגר אמת קרקעית איכותי ולצורך דגימה נמוכה והערכות דיוק לאחר מכן. הסוג השני כלל נתוני ULDS שנלקחו מ-NIPT של 10,000 נשים בהריון מאזור ווהאן.

1. נתוני ריצוף גנום מלא בעומק גבוה

  1. אסוף 500 דגימות דם היקפיות (5 מ"ל כל אחת) מקבוצת אוכלוסייה כללית לאחר הסכמה מדעת. אחסן דגימות בצינורות EDTA והובילן בטמפרטורה של 2-8 מעלות צלזיוס.
  2. דם צנטריפוגה ב-1,600 x גרם למשך 10 דקות בטמפרטורה של 4 מעלות צלזיוס כדי להפריד בין פלזמה לשכבת באפי. אספו בזהירות את מעיל הבאפי ואחסנו אותו בטמפרטורה של מינוס 80°C עד להוצאת ה-DNA.
  3. להוציא DNA גנומי מ-Buffy Coat באמצעות ערכת חרוזים מגנטית בהתאם להוראות היצרן.
  4. כמת את ריכוז ה-DNA באמצעות מבחן פלואורומטרי והערכת שלמות ה-DNA באמצעות אלקטרופורזה בג'ל אגרוז. דגימות נבחרות עם תפוקת DNA כוללת של ≥1 מיקרוגרם, ריכוז ≥12.5 ng/μL, ואורך קטע >20 קילו-בייט ללא התדרדרות נראית לעין להכנת ספרייה.
  5. גזירה של 80-200 ng של DNA גנומי איכותי לגודל ממוצע של 350-400 bp באמצעות אולטרסוניקציה.
  6. בצע תיקון קצה ב-20 מעלות צלזיוס למשך 30 דקות, קישור מתאם ב-20 מעלות צלזיוס למשך 15 דקות, ומעגלי ב-37 מעלות צלזיוס למשך 30 דקות לבניית ספריות ללא PCR. יצירת ננו-כדורי DNA (DNBs) באמצעות הגברה מעגלית מתגלגלת (RCA). ספריות קצוות זוגיות של רצף (PE100, אורך קריאה 100 bp) על פלטפורמת DNBSEQ לעומק יעד ~30x (ממוצע 100 ג'יגה-בייט לדגימה). שמור קריאות רצף גולמיות בפורמט FASTQ לניתוח במורד הזרם.
    הערה: לטפל בכל הדגימות שמקורן באדם בתנאי מעבדה של BSL-2. הימנעו ממחזורי הקפאה-הפשרה חוזרים כדי למנוע התדרדרות DNA. להשליך חומרים שמקורם בדם כפסולת ביו-מסוכנת; סילוק מחומרים כימיים בהתאם להנחיות מוסדיות לפסולת מסוכנת.

2. נתוני NIPT בעומק נמוך במיוחד (~0.1x WGS)

  1. אספו 10,000 דגימות דם מהאם (5 מ"ל כל אחת) לבדיקות טרום לידתיות שגרתיות (NIPT). השתמש בצינורות EDTA והובלה בטמפרטורה של 2-8 מעלות צלזיוס; עיבוד פלזמה בתוך 8 שעות מאיסוף.
  2. עבור צינורות DNA בסירקולציה מיוצבים (צינורות K או G), יש להובלה בטמפרטורה של 6-35 מעלות צלזיוס באמצעות נשאים מבוקרי טמפרטורה ולעבד תוך 96 שעות בהתאם לנהלי הפעולה הסטנדרטיים של היצרן.
  3. דם בצנטריפוגה ב-1,600 x גרם למשך 10 דקות ב-4 מעלות צלזיוס להפרדת פלזמה. אסוף בזהירות את שכבת הפלזמה העליונה מבלי להפריע לשכבת הבאפי או לכדור התא באמצעות פיפטה ולהעביר אותה לצינור חדש. צנטריפוגה שוב את הפלזמה שנתפסה בעוצמה של 16,000 x גרם למשך 10 דקות בטמפרטורה של 4 מעלות צלזיוס כדי להסיר שאריות תאים או פסולת. העבר בזהירות את הסופרנטנט המובהר (פלזמה ללא תאים) לצינור חדש לצורך חילוץ DNA.
  4. הפקת DNA חסר תאים (cfDNA) מהפלזמה באמצעות ערכת חילוץ חומצות גרעין. לבצע תיקון קצה בטמפרטורה של 20 מעלות צלזיוס למשך 30 דקות, קישור מתאם ב-20 מעלות צלזיוס למשך 15 דקות, והגברה של PCR (12 מחזורים, דנאטורציה של 98 מעלות צלזיוס 10 שניות, אנילינג 60 מעלות צלזיוס 30 שניות, הארכה של 72 מעלות צלזיוס 30 שניות).
  5. מוצרי PCR מטהרים וספריות מעגליות בטמפרטורה של 37 מעלות צלזיוס למשך 30 דקות. יצר DNBs דרך RCA. ספריות רצף חד-קצוות (SE35, אורך קריאה 35 bp) על פלטפורמת BGISEQ-500. אחסן נתוני רצף גולמיים בפורמט FASTQ.
    הערה: לטפל בדגימות פלזמה כחומר שעלול להיות מדבק בתנאי BSL-2. מזעור מחזורי הקפאה-הפשרה כדי להפחית את התדרדרות ה-cfDNA. להשליך פסולת פלזמה ומוצרי פלסטיק כחומר ביו-מזיק.

3. צינור עיבוד נתונים מראש

  1. כדי להעריך באופן שיטתי את ביצועי כלי ההעברה הגנוטיפית בעומקי ריצוף משתנים, לבצע תהליך עיבוד מוקדם סטנדרטי הן על נתוני WGS בעומק גבוה (30x) והן על נתוני NIPT בעומק נמוך במיוחד (<0.1x), כולל דגימה מדומה, בקרת איכות, יישור קריאה, הסרת כפילויות וכיול מחדש של ציון איכות בסיסי (BQSR).
    הערה: השלבים מנקודה זו להערכת דיוק ההטלה מהווים את הפרוטוקול הראשי (איור 1) של מחקר זה. הקוד הספציפי ניתן למצוא בקובץ המשלים 1.
  2. דגימה קטנה
    1. יצר סדרה של מערכי נתונים מדגימה נמוכה מדגימות ריצוף בעומק גבוה של 30x המקוריים. השתמש בשתי אסטרטגיות כדי לחקות באופן ריאלי את מאפייני הריצוף של נתוני NIPT כפי שמתואר להלן.
    2. דגימה תת-אקראית: השתמש ב-seqtk v1.5 (https://github.com/lh3/seqtk) עם זרע אקראי קבוע של 100 ליצירת ארבע רמות של נתונים בעומק נמוך (0.05x, 0.1x, 0.5x ו-1.0x).
    3. סימולציית מבנה קריאה דמוית NIPT: שומרים רק את הקריאה הראשונה (R1) של כל קריאה זוגת-קצה וקוצצים את כל הקריאות שנשמרו ל-35 bp עם seqtk trimfq -L 35, בהתאם לאופי הקריאה הקצרה והחד-קצובית הטיפוסי של רצף NIPT בעומק נמוך מאוד.
  3. בקרת איכות
    1. עבד את כל קבצי FASTQ הגולמיים עם fastp v0.23.420. השתמש בפרמטרים הבאים: --qualified_quality_phred=5 (סף איכות בסיס), --unqualified_percent_limit=50 (אחוז מקסימלי של בסיסים באיכות נמוכה מותר), --n_base_limit=10 (N בסיסים מקסימליים לקריאה), והסרת מתאם מותאם אישית עם --adapter_sequence=AAGTCGGGGCCAAGCGGTCTTAG
      GAAGACAA (R1) ו--adapter_sequence_r2=AAGTCGGATCGTAGCC
      ATGTCGTCTGTGTGAG
      CCAAGGAGGTTG (R2).
    2. כבה את חיתוך הזנב של Poly-G (--disable_trim_poly_g), ויצר דוחות בפורמטים JSON ו-HTML לכל דגימה.
  4. יישור והסרת כפילויות
    1. יישר קריאות באיכות גבוהה לגנום הייחוס האנושי GRCh38 (hg38)21 באמצעות BWA v0.7.16a-r118122.
    2. בצע את היישור עם אלגוריתם aln (-e 10 -t 4 -i 5 -q 0), ואחריו SAMSE ליישור חד-קצה עם מידע קבוצת קריאה.
    3. המרו את קבצי ה-SAM שנוצרו ל-BAM, ממוינים (samtools מיון -@ 8), והסרו כפילויות באמצעות SAMtools v1.323 (samtools rmdup). אנדקס את כל קבצי ה-BAM.
  5. כיול מחדש של ציון איכות בסיסי (BQSR)
    1. בצע BQSR באמצעות GATK v4.0.4.024. אמן את מודל הכיול מחדש על שלושה מערכי נתונים וריאנטים בעלי ביטחון גבוה: dbSNP build 14625, Mills ו-1000G gold standard indels21, וקובץ INDELS הידוע של חבילת המשאבים GATK24 עבור GRCh38. קבצי החבילה בהם משתמשים מתייחסים לדוגמה הרשמית של GATK (https://github.com/gatk-workflows/gatk4-data-processing/blob/master/processing-for-variant-discovery-gatk4.hg38.wgs.inputs.json). בסך הכל, הורד שלושה קבצים ואת קבצי האינדקס המתאימים להם.
    2. הרץ את BaseRecalibrator ואחריו ApplyBQSR ליצירת קבצי BAM מכוילים מחדש. אנדקס את כל ה-BAMs באמצעות SAMtools v1.3.
      הערה: כל מערכי הנתונים המדומים עברו שלבים זהים של עיבוד מוקדם - דגימה מוקדמת, בקרת איכות, יישור, הסרת כפילויות ו-BQSR - כדי להבטיח עקביות והשוואה בהערכות ביצועי ההטלה הבאות.

4. הטלפת גנוטיפ

  1. הכנת נתונים
    1. הגדרת מערך נתונים של אימפוטציה: בנו מספר מערכי הערכה כדי להשוות באופן שיטתי את כלי הערכת הגנוטיפ בעומקים וגדלי דגימות שונים כפי שמתואר להלן. בסך הכל נוצרים תשעה שילובים בהתבסס על גודל המדגם השונים ועומקי הריצוף שהוזכרו לעיל. קבצי הקלט מורכבים מרשימות קבצי BAM (bamlist.txt) של נתוני הרצף עבור תשעת תתי-הקבוצות שהוזכרו לעיל לאחר בקרת איכות, המאוחסנות בקבצי bamlist.txt מתאימים. קבצי קלט נוספים כוללים את הגנום האנושי (GRCh3821) ואת המפה הגנטית מפרויקט 1000 הגנומים7.
      1. דגימה קטנה של נתוני WGS בעומק גבוה: בחר באקראי שתי תת-קבוצות (200 ו-500 דגימות) מתוך 500 פרטים שרוצפו בעומק של 30x. הקטן כל תת-קבוצה לארבעה עומקים (1x, 0.5x, 0.1x ו-0.05x) ליצירת שמונה תנאים ניסיוניים.
      2. מאגר נתוני ULDS מבוסס NIPT: שלבו 10,000 דגימות NIPT בעומק נמוך במיוחד (עומק ממוצע הוא 0.102x, איור 2) עם 50 דגימות בעומק גבוה שנדגמו ל-0.1x.
    2. מפרט אזור ניתוח: הגבל את כל הניתוחים לאזור כרומוזום 1 chr1:150,500,000-160,500,000 (10 Mb), עם מאגר של 500 קילובייט לאימפוטציה, כדי להבטיח השוואה ישירה בין כלים.
    3. בחירת פאנל ייחוסים: השתמש בשני פאנלים (טבלה 1): פאנל CKB, שנבנה מנתוני אוכלוסייה סינית, ופאנל 1KGP-EAS, שמקורו בתת-הקבוצה המזרח-אסייתית של פרויקט 1000 הגנומים.
      הערה: פאנל הייחוסCKB 15 נבנה באמצעות נתוני ריצוף גנום מלא בעומק גבוה (~15x) מ-9,964 מבוגרים סינים בבנק הביולוגי של סין קדורי, מחקר קוהורט פרוספקטיבי גדול. דגימות אלו נגזרות מאוכלוסייה טבעית עם הטיה פנוטיפית מינימלית, מוצא סיני הומוגני של האן ומבנה אוכלוסייה עקבי, מה שהופך אותן למתאימות במיוחד להטלת גנוטיפ בקבוצות סיניות. יו ואח' 15 הראו כי, ב-GWAS פנוטיפ אמיתי לגובה, ההטלה באמצעות פאנל CKB משלשת את מספר SNPs שזוהו והכפילה את מספר הווריאנטים המשמעותיים כלל-הגנומיים. פרויקט 1000 הגנומים (1KGP)7,26, ההפניה הגנומית הנפוצה ביותר, כולל 585 פרטים בתת-הקבוצה של שלב 3 של מזרח אסיה (EAS). תת-קבוצה זו מכסה חמש אוכלוסיות מזרח אסייתיות, שלהן עומק רצף של כ-30 פעמים, כולל האן הסיני בבייג'ינג (CHB), האן הדרומי (CHS), דאי סיני בשישואנגבנה (CDX), קין בעיר הו צ'י מין בווייטנאם (KHV), ויפנים בטוקיו (JPT).
  2. כלי אימפוטציה
    1. הערכו שלושה אלגוריתמים של אימפוצציה, שנבחרו בשל אסטרטגיות המידול הייחודיות שלהם ויישומם לנתוני ריצוף בעומק נמוך במיוחד (ULDS).
      1. STITCH: STITCH (v1.6.6) הוא אלגוריתם אימפוטציה מבוסס הפלוטיפ ללא הפניות, שיכול לשלב באופן אופציונלי הפלוטיפים חיצוניים. כלול רשימות BAM, גנום ייחוס אנושי (GRCh38) כקבצי קלט. הכינו קבצי פאנל ייחוס (hap/legend/pos) בעת ביצוע העברה מבוססת הפניות. כלול את הפרמטרים המרכזיים הבאים: שיטה=דיפלואיד, buffer=500 kb, K=10 haplotypes אבות, ו-nGen=גודל דגימה כפול/K (כפי שמומלץ בתיעוד STITCH). יצירת קבצי פלט המכילים מינוני גנוטיפ לכל SNP לכל הפרטים.
        הערה: לפי התיעוד הרשמי של STITCH, K הוא מספר ההפלוטיפים האבותיים במודל. K גדול יותר משפר את דיוק ההעברה עבור דגימות גדולות וכיסוי גבוה יותר, אך גם מאריך את זמן החישוב, והדיוק עשוי לרדת עם כיסוי נמוך יותר.
      2. QUILT2: QUILT2 מיישם גישה מונחית ייחוס בייסיאנית המותאמת לנתוני ULDS. בצע הכנת לוח ייחוס באמצעות סקריפט prepare_reference שסופק, תוך ציון המפה הגנטית וקואורדינטות האזור. הרץ מצב דיפלואיד אימפוטציה עם אותו גודל בופר (500 קילו-בייט) והגדרת nGen כמו ב-STITCH כדי להבטיח השוואה.
      3. GLIMPSE2: GLIMPSE2 הוא כלי התייחסות מבוסס HMM, המיועד למאגרי ריצוף בקנה מידה גדול ובעומק נמוך מאוד. בצע הערכה עם GLIMPSE2_phase_static, ציון רשימת BAM קלט, פאנל VCF אנושי, מפה גנטית, אזור קלט = chr1:150,000,000-161,000,000, אזור פלט = chr1:150,500,000-160,500,000 (לשמירה על בופר של 500 קילובייטים). קובץ רשימת ה-BAM שמוזן כאן צריך להכיל שתי עמודות: אחת היא נתיב BAM, והעמודה השנייה היא שם הדגימה. אם העמודה השנייה לא מוזנת, כל שם קובץ BAM ישמש כשם הדוגמה בקובץ ה-VCF הפלט.

5. הערכת דיוק ההטלה

  1. הגדרת קבוצת האמת
    1. נבחר 50 פרטים שמסודרים בעומק של 30x כמערך הנתונים של אמת הקרקע. כלול דגימות אלו בתנאי הדגימה הניסיוניים כדי להבטיח השוואה.
    2. בצע קריאת וריאנט עבור קבוצת האמת באמצעות הצינור הבא: SOAPnuke27 לבקרת איכות, BWA ליישור, Picard לסימון כפול, GATK v4.0.4.0 BQSR ו-HaplotypeCaller לקריאת וריאנטים, DPGT (https://github.com/BGI-flexlab/DPGT) לקריאה משותפת, ו-BCFtools v1.1123 לסינון איכות וריאנט.
    3. שמרו רק על גרסאות PASS בעלות ביטחון גבוה כדי ליצור קובץ VCF בנצ'מרק. הגבל את ההערכה ל-chr1:150,500,000-160,500,000, בהתאם למערכי הנתונים המיוחסים.
  2. תיאום וסינון נתונים
    1. עבד קבצי VCF מיוחסים מכל הכלים באמצעות PLINK2.028. חלץ נתוני מינון והמיר לפורמט pgen.
    2. יישם בקרת איכות ברמת SNP עם המסננים הבאים: תדירות אללים מינורית (MAF) ≥ 0.05 (--maf 0.05), שיווי משקל הארדי-ויינברג (HWE) ערך p ≥ 1e-6 (--hwe 1e-6), SNPs ביאלליים בלבד (--max-אללים 2).
    3. ייצוא וריאנטים שמעבירים את QC לפורמט traw להשוואה במורד הזרם.
  3. מדדי דיוק
    1. השווה את המינונים המיוחסים למינונים הבסיסיים של כל SNP. מחשב את מקדמי המתאם של פירסון (R) על בסיס SNP-by-SNP, שמור רק על אתרים משותפים לשני מערכי הנתונים, וחשב את ממוצע מקדמי המתאם בריבוע (R²) בין כל SNPs שנבדקו כדי לכמת את דיוק ההעברה הכולל לכל מצב.
    2. השתמש במדד דיוק זה כדי ללכוד את ההתאמה של הערכות מינון גנוטיפ בין הגנוטיפים המיוחסים לאמיתיים.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

השפעת גודל המדגם על דיוק ההטלה
הגדלת גודל המדגם מ-N = 200 ל-N = 500 שיפרה את דיוק ההטלפה של STITCH, במיוחד בתנאי כיסוי נמוך. לדוגמה, עם פאנל הייחוס של CKB בכיסוי פי 1, STITCH השיגה R2> של 0.916 (N=500) לעומת 0.882 (N=200), המייצג עלייה של 3.4% (איור 3; קובץ משלים 2). באופן דומה, בכיסוי של 0.5x, הדיוק שלו עלה מ-0.800 ל-0.868 (ΔR2> = 8.5%). לעומת זאת, QUILT2 ו-GLIMPSE2 הראו רגישות מיני...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר זה העריך באופן שיטתי את ביצועיהם של שלושה כלים נפוצים לזיהוי גנוטיפ עבור ULDS, כאשר WGS בעומק גבוה שימש כסטנדרט הזהב. חוזקה מתודולוגית מרכזית טמונה באימוץ צינור עיבוד מוקדם מאוחד – הכולל יישור, בקרת איכות וכיול מחדש של ציון איכות בסיסי – שממזער השפעות אצווה ומבטיח השוואה בין כלים ותנאים. על ידי דגימה קטנה של דגימות עם רצף עמוק, נתונים בעומק נמוך במיוחד דומו תחת הגדרות מבוקרות, ובכך סיפקו מסגרת אובייקטיבית למדידת ביצועים. הגבלת הניתוחים לטווח גנומי מוגדר של 10 מגה-מגה על כרומוזום 1 ה...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחברים מצהירים שאין להם אינטרסים מתחרים.

תודות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר זה נתמך על ידי קרן המחקר הרפואי של שנזן (B2404004), תוכנית המחקר והפיתוח המרכזית הלאומית של סין (2023YFC2605400, 2022YFC2502402), תוכנית המדע והטכנולוגיה של שנזן (SYSPG20241211173852024), פרויקט מחקר פתוח במעבדה הממלכתית המרכזית להומאוסטזיס ושיקום כלי דם (אוניברסיטת פקין) (2025-SKLVHR-013), ותוכנית המחקר והפיתוח המרכזית של מחוז גואנגדונג (2023B0303040001).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
<חזק>נתונים
10,000 דגימות NIPT בעומק נמוךמאמר זהנתוני ריצוף גנום מלא בעומק נמוך במיוחד המשמשים למבחן ביצועים של אימפוציאציה.
500 דגימות WGS בעומק גבוהמאמר זה30& מערכת WGS בעומק גבוהה שימשה כסט זהב/סט אמת.
<חזק>פאנל ייעוץ
פאנל ייחוס 1KGP-EASפרויקט 1000 גנומים (מזרח אסיה)תת-קבוצה של 1KGP עבור ייחוס ייחודי למוצא מזרח אסייתי.
לוח ייחוס CKBהבנק הביולוגי צ'יינה קדוריפאנל מותאם אישית לאזור אוכלוסייה להטלת גנוטיפ.
<חזק>תוכנה ואלגוריתמים
BCFtools v1.11GitHub (samtools/bcftools)משמש למיזוג ומיון תוצאות ברמת הכרומוזום, ולסינון וריאנטים.
BQSR של ערכת הכלים GATK 4.0.4.0מכון ברודמשמש לכיול מחדש של ציון איכות בסיסי (BQSR).
BWA-MEM .7.16a-r1181הנג לי / GitHubליישור קריאות גולמיות ל-GRCh38.
DPGT (כלי גנטיקה מבוזרת של אוכלוסייה)BGIכלי ניתוח גנטיקה מבוזרת שאפשר קריאה משותפת למיליוני דגימות WGS. זמין ב-[GitHub - BGI-flexlab/DPGT](https://github.com/BGI-flexlab/DPGT)
fastp.0.23.4קוד פתוח (צ'ן ואח', 2018)לבקרת איכות ולחיתוך מתאמים.
GLIMPSE2אוניברסיטת אוקספורדפייזינג מהיר של גנוטיפ והקצאה ל-WGS עם כיסוי נמוך
קוד מקורי לניתוחיםמאמר זה<חזק>קובץ משלים 1 קוד מקורי לניתוחים
ערכת כלים של פיקארדמכון ברודמשמש לסימון כפילויות והמרת פורמט קבצים.
Plink 2.0סי. צ'אנג, ס. פרסל / מכון ברודלהמרת פורמט גנוטיפ וניתוח אסוציאציה.
פייתון 3.8קרן התוכנה של פייתוןמשמש לסקריפטינג, אוטומציה וניתוח נתונים.
QUILT2מכון הנתונים הגדולים של אוקספורדאיפוטציה מבוססת HMM באמצעות לוחות ייחוס חיצוניים
R 4.1.3קרן Rמשמש להרצת STITCH, QUILT2 וגרפטינג/סטטיסטיקה.
SAMtools v1.3GitHub (samtools/samtools)למניפולציה של קבצי SAM/BAM.
Seqtk-1.5GitHub (lh3/seqtk)ערכת כלים לעיבוד רצפים בפורמטים של FASTA/Q. זמין ב-[GitHub - lh3/seqtk](https://github.com/lh3/seqtk)
SOAPnukeBGIלבקרת איכות וסינון נתוני NGS.
STITCH v1.6.6אוניברסיטת אוקספורדכלי אימפוטציה מותאם לרצף כיסוי נמוך במיוחד
טביקסGitHub (samtools/tabix)משמש לאינדוקס ושאילתות של קבצי VCF עם bgzip.
<חזק>חומרים אחרים
קבצי חבילת GATKGATKזמין בכתובת [https://github.com/gatk-workflows/gatk4-data-processing/blob/master/processing-for-variant-discovery-gatk4.hg38.wgs.inputs.json]
מפה גנטית ל-1000G (GRCh38)פרויקט אוקספורד / 1000 גנומיםנדרש לכלי פאזה/איפוטציה
GRCh38קונסורציום ייחוס גנוםמשמש ליישור קריאה וקריאת וריאנטים

מקורות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhang, H., et al. Non-invasive prenatal testing for trisomies 21, 18 and 13: clinical experience from 146,958 pregnancies. Ultrasound Obstet Gynecol. 45 (5), 530-538 (2015).
  2. Heitzer, E., et al. Tumor-associated copy number changes in the circulation of patients with prostate cancer identified through whole-genome sequencing. Genome Med. 5 (4), 30(2013).
  3. Hyblova, M., et al. Validation of Copy Number Variants Detection from Pregnant Plasma Using Low-Pass Whole-Genome Sequencing in Noninvasive Prenatal Testing-Like Settings. Diagnostics (Basel). 10 (8), (2020).
  4. Kucharik, M., Budis, J., Hyblova, M., Minarik, G., Szemes, T. Copy Number Variant Detection with Low-Coverage Whole-Genome Sequencing Represents a Viable Alternative to the Conventional Array-CGH. Diagnostics (Basel). 11 (4), (2021).
  5. Li, J. H., Mazur, C. A., Berisa, T., Pickrell, J. K. Low-pass sequencing increases the power of GWAS and decreases measurement error of polygenic risk scores compared to genotyping arrays. Genome Res. 31 (4), 529-537 (2021).
  6. Liu, S., et al. Genomic Analyses from Non-invasive Prenatal Testing Reveal Genetic Associations, Patterns of Viral Infections, and Chinese Population History. Cell. 175 (2), 347-359.e14 (2018).
  7. The 1000 Genomes Project Consortium. A global reference for human genetic variation. Nature. 526 (7571), 68-74 (2015).
  8. Liu, S., et al. Utilizing non-invasive prenatal test sequencing data for human genetic investigation. Cell Genom. 4 (10), 100669(2024).
  9. Davies, R. W., Flint, J., Myers, S., Mott, R. Rapid genotype imputation from sequence without reference panels. Nat Genet. 48 (8), 965-969 (2016).
  10. Xiao, H., et al. Genetic analyses of 104 phenotypes in 20,900 Chinese pregnant women reveal pregnancy-specific discoveries. Cell Genom. 4 (10), 100633(2024).
  11. Rubinacci, S., Ribeiro, D. M., Hofmeister, R. J., Delaneau, O. Efficient phasing and imputation of low-coverage sequencing data using large reference panels. Nat Genet. 53 (1), 120-126 (2021).
  12. Taliun, D., et al. Sequencing of 53,831 diverse genomes from the NHLBI TOPMed Program. Nature. 590 (7845), 290-299 (2021).
  13. McCarthy, S., et al. A reference panel of 64,976 haplotypes for genotype imputation. Nat Genet. 48 (10), 1279-1283 (2016).
  14. Wu, D., et al. Large-Scale Whole-Genome Sequencing of Three Diverse Asian Populations in Singapore. Cell. 179 (3), 736-749.e15 (2019).
  15. Yu, C., et al. A high-resolution haplotype-resolved Reference panel constructed from the China Kadoorie Biobank Study. Nucleic Acids Res. 51 (21), 11770-11782 (2023).
  16. Browning, B. L., Zhou, Y., Browning, S. R. A One-Penny Imputed Genome from Next-Generation Reference Panels. Am J Hum Genet. 103 (3), 338-348 (2018).
  17. Das, S., et al. Next-generation genotype imputation service and methods. Nat Genet. 48 (10), 1284-1287 (2016).
  18. Li, Z., Albrechtsen, A., Davies, R. W. Rapid and accurate genotype imputation from low coverage short read, long read, and cell free DNA sequence. bioRxiv. , (2024).
  19. Rubinacci, S., Ribeiro, D. M., Hofmeister, R. J., Delaneau, O. Efficient phasing and imputation of low-coverage sequencing data using large reference panels. Nat Genet. 53 (1), 120-126 (2021).
  20. Chen, S. Ultrafast one-pass FASTQ data preprocessing, quality control, and deduplication using fastp. Imeta. 2 (2), e107(2023).
  21. Zheng-Bradley, X., et al. Alignment of 1000 Genomes Project reads to reference assembly GRCh38. Gigascience. 6 (7), 1-8 (2017).
  22. Li, H., Durbin, R. Fast and accurate short read alignment with Burrows-Wheeler transform. Bioinformatics. 25 (14), 1754-1760 (2009).
  23. Danecek, P., et al. Twelve years of SAMtools and BCFtools. Gigascience. 10 (2), 8(2021).
  24. Van der Auwera, G. A., et al. From FastQ data to high confidence variant calls: the Genome Analysis Toolkit best practices pipeline. Curr Protoc Bioinfo. 43 (1110), 11.10.1-11.10.33 (2013).
  25. Sherry, S. T., et al. dbSNP: the NCBI database of genetic variation. Nucleic Acids Res. 29 (1), 308-311 (2001).
  26. Byrska-Bishop, M., et al. High-coverage whole-genome sequencing of the expanded 1000 Genomes Project cohort including 602 trios. Cell. 185 (18), 3426-3440 (2022).
  27. Chen, Y., et al. SOAPnuke: a MapReduce acceleration-supported software for integrated quality control and preprocessing of high-throughput sequencing data. Gigascience. 7 (1), 1-6 (2018).
  28. Chang, C. C., et al. Second-generation PLINK: rising to the challenge of larger and richer datasets. Gigascience. 4 (7), 8(2015).
  29. Marchini, J., Howie, B. Genotype imputation for genome-wide association studies. Nat Rev Genet. 11 (7), 2796(2010).
  30. Zeng, J., et al. Protocol for genetic analysis of population-scale ultra-low-depth sequencing data. STAR Protoc. 6 (1), 579(2025).
  31. Naito, T., Okada, Y. Genotype imputation methods for whole and complex genomic regions utilizing deep learning technology. J Hum Genet. 69 (10), 481-486 (2024).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תגיות

מאמרים קשורים