מאמר שיטה

זיהוי זיהום בין פרטים ואי-התאמות בנתוני ריצוף מהדור הבא של Multiomics

DOI:

10.3791/69428

17 באפריל 2026

במאמר זה

סיכום

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

פרוטוקול זה מתאר את יישום מסגרת בקרת איכות לזיהוי זיהום וחוסר התאמה בין פרטים בנתוני ריצוף מהדור הבא על ידי אימות הזהות הגנטית של זוגות דגימות בתוך יחידים.

תקציר

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

עיבוד מהיר של דגימות ביולוגיות של מטופלים באמצעות ריצוף מהדור הבא והשוואת נתונים מולקולריים לנתונים קליניים ברמת המטופל והדגימה דורשים מעקב והתאמה מדויקים של מזהי דגימות לאורך שרשרת השמירה של הדגימה הביולוגית והם קריטיים לאפשר פרשנות איתנה של תוצאות ניסויי הסמנים הביולוגיים. בנוסף למעקב אחר שלבים בודדים בתהליכי הדגימות ועיבוד הנתונים, ניתן להשתמש בפתרונות ביואינפורמטיקה כדי לוודא שהדגימות מגיעות מאותו מטופל. כאן מוצג השימוש בתהליך עבודה ביואינפורמטי לזיהוי דגימות תואמות שמקורן באותו אדם. תהליך הניתוח מתאים להשוואה ואימות של שני זוגות או יותר של מערכי נתונים NGS למקור דגימת המטופל. אלגוריתם ניקוד המבוסס על השוואות גנומיות רחבות של דגימות מאפשר למשתמש לקבוע האם שתי דגימות מגיעות מאותו אדם. באופן ספציפי, משתמשים בפולימורפיזמים של נוקלאוטידים בודדים (SNPs) בתוך בלוקים נבחרים של די-שווי משקל קישוריות לזיהוי והשוואת דגימות. זוהו שילובי סף לבחירה מתירה ומחמירה של מדגמים תואמים ולא תואמים. השימושיות של פרוטוקול זה הוכחה באמצעות יישומו בבקרת איכות ואימות של רקמת גידול ודגימות דם קליניות, הכולל מספר שיטות אומיקס מיותר מ-2,000 מטופלים.

מבוא

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

איסוף וניתוח רחב היקף של דגימות קליניות מחייבים מעקב מדויק אחר הדגימות לאורך שרשרת האשמור שלהן, שכן התאמה נכונה של נתונים מולקולריים מאותן שיטות או שונות לבין נתונים קליניים ברמת המטופל והדגימה היא חיונית לפרשנות מדויקת ולקבלת החלטות מושכלות. למרות מאמצים קפדניים לייעל את פרוטוקולי עיבוד הדגימות במסגרת פרקטיקה קלינית תקינה, החלפת דגימות או תיוג שגוי עלולה להתרחש בשלבים שונים, מהביופסיה/חילוץ הדגימה ועד שלבי ההכנה והעיבוד, ועד לשלב ניתוח הנתונים (איור 1). עם עלייה במספר הדגימות ובשלבי עיבוד הדגימות, הסבירות להחלפת דגימות וזיהום צולב עולה. דבר זה עלול להוביל לניתוח נתונים עם יחסי דגימה-מטופל שגויים, ולהשפיע על ניתוחים ומסקנות בהמשך, ולכן זהו היבט חשוב שיש לקחת בחשבון במחקר גנומיקה קלינית. במחקרים קליניים, זיהוי שגוי של דגימות יכול להשפיע מאוד על התוצאות הכוללות, במיוחד במחקרים עם גודל מדגםקטן 1. זיהום בין אנשים עלול לגרום לאובדן כוח לזיהוי הבדלים ותוצאות חיוביות שגויות בהשוואה בין מספר דגימות מאותו מטופל. החלפות דגימות משפיעות על כוח הגילוי של אסוציאציות גנטיות ועלולות להוביל להערכת חסר של תורשתיות של תכונות מורכבות בניתוח אסוציאציות גנומירחב 2.

מחקר סרטן הוא אחד התחומים שבהם מתבצעים ניתוחים גנומיים וטרנסקריפטומיים בקנה מידה רחב, ובמיוחד ניטור הטרוגניות גנומית ופנוטיפית בין חולים ותוך-מטופלים. היבט אחד במחקר הסרטן הוא שדגימות מאותו מטופל עשויות לשאת מוטציות שונות ושינויים במספר העותקים ולכן להציג תדירויות אללים וריאנטיות עצמאיות4. במיוחד כאשר מפרשים נתונים ממספר סוגי אומיקס, האינטגרציה הנכונה של מערכי נתונים מולטימודליים מאותם פרטים חשובה ולכן דורשת ניטור של זיהום בין-אישי 5,6,7,8. מחקרים על מערכי נתונים מתוכנית אטלס הגנום של הסרטן (TCGA) וקונסורציום המחקר הגנומי לריאות (LGRC) זיהו שיעורי זיהוי שגויים של דגימות של 3% בממוצע ועד ~20% במחקריםמסוימים 2,9,10,11. דוגמאות אלו מדגימות את חשיבות ניטור התרחשות החלפות דגימות וזיהום צולב12. מעבר למעקב שגרתי ובקרת איכות בכל שלב תהליך, ניתוח השוואתי של תוצאות הריצוף משמש כבדיקת איכות סופית. זה מבטיח התאמת מדגמים מדויקת לפני המעבר לניתוח ופרשנות נתונים.

מספר גישות ביואינפורמטיקה הוקמו כדי לזהות האם הדגימות מגיעות מאותו יחיד 1,4,13,14,15,16. הגישות הראשוניות השתמשו בחזרות טנדם קצרות כדי לאמת את זהות הדגימה17. נתוני ריצוף מהדור הבא ברמת ה-RNA וה-DNA מאפשרים כעת השוואה בין זוגות דגימות המבוססות על פולימורפיזמים חד-נוקלאוטידיים18. הם שונים ביישום שלהם למודאליות ונתוני ריצוף שונים, למשל עבור ריצוף RNA19 או עבור נתוני רצף אקסום מלא5, היישום שלהם, למשל בדיקה בין נתיבי ריצוף20, ונוחות השימוש. למרות שניתן לזהות דגימות מאותו פרט בהתבסס על 20–45 פולימורפיזמים של נוקלאוטידים בודדים, גישות ריצוף בכיסוי נמוך עד בינוני המשמשות בדרך כלל במחקר סרטן דורשות שילוב של מספר רב של SNPs1.

כאן מתוארים היישום וההתאמות לגישה כזו באמצעות בלוקי אי-שוויון קישור שלSNPs 15, המשמשת לבקרת איכות של דגימות תואמות. הגישה הוכחה כבעלת שיעור דגלים שגויים וקצב התאמה שגויים נמוכים, ותהליך העבודה מאפשר השוואה בין מודאליות, למשל בין רצף אקסום שלם ודגימות ריצוף RNA, וכן לשימוש בפורמטים שונים של נתונים. לצורך יישום רחב היקף של השיטה על פני מערכי נתונים בדגימות ניסויים קליניים, צינור הביואינפורמטיקה יושם בשפת זרימת עבודה משותפת (CWL)21,22. בזכות הקריאות שלו והתחביר הדומה ל-YAML, מדענים עם ניסיון תכנות מוגבל יכולים לפרש בקלות את המבנה הכללי של זרימת העבודה ותוצאות הניתוח. תכונה מרכזית נוספת של CWL היא פונקציונליות הפיזור/איסוף, שמאפשרת מקביליות של תהליכים כדי לנצל במלואם משאבים חישוביים שהוקצאו. המשתמשים יכולים להגדיר את התנאים שבהם מתבצעים שלבים מסוימים, ובכך לשפר את הגמישות של הניתוחים המתקבלים. CWL יכול להיות משולב עם רכיבים נוספים של מערכת ניהול זרימת עבודה שלמה, כגון אחסון מסדי נתונים, ממשק משתמש גרפי ומפעיל משימות, ויוצר פלטפורמה עוצמתית ליצירה, הרצה ותחזוקה של ניתוחים מדעיים שניתן לשחזר. לכן, מימוש זה מאפשר גישה נוחה לזרימת העבודה ועיבוד מהיר של מערכי נתונים בהקשר של מערכות ניהול זרימת עבודה מוגדרות.

יתרה מזאת, נחקרו השפעות סף פרמטרי בחירת הכוונון בין מדגמים תואמים לבלתי תואמים, ונקבעו ספים לבחירה מתירה ומחמירה במקרים לא תואמים. ההשפעות של שינוי פרמטרים אלו על בחירת זוגות המדגם ויישומם בתוך ובין מודאליות אומיקס שונות הוצגו. כיוונון מדויק של פרמטרים אלו יאפשר למשתמשים להתאים את הקפדנות של הפרשנויות שלהם. תהליך העבודה יושם על סט של מאגרי נתונים קליניים בקנה מידה גדול עם אלפי דגימות.

פרוטוקול

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

הצהרת אתיקה: ניתוח זיהום בין-אישי זה בוצע רטרוספקטיבית באמצעות נתוני מטופלים בודדים ממחקרי שלב I ו-II קליניים, בהתאם לתהליך השימוש החוזר האחראי של Roche ובהתאם לטופס ההסכמה המודעת הראשי לכל מחקר. אישורי ועדת אתיקה/מועצת הביקורת המוסדית התקבלו לכל מחקר לפני קיום המחקר שלו. המשתתפים נתנו וחתמו על הסכמה מדעת להשתתף במחקרים אלו.

זרימת עבודה ביואינפורמטית
הערה: מימוש זרימת העבודה בביואינפורמטיקה מתחיל מקבצי fastq גולמיים שמקורם בנתוני ריצוף מהדור הבא, לדוגמה, רצף גנום שלם, אקסום מלא או טרנסקריפטום שלם. השלבים המתוארים כאן משולבים בתהליך העבודה של CWL.

1. חומרי עזר הנדרשים

  1. לגבי זרימת העבודה בביואינפורמטיקה, ספק את הדברים הבאים:
    1. גנום ייחוס אנושי (GRCh38) ב-. פורמט fasta .
    2. קובץ אינדוקס מתאים כ -.fasta.fai.
    3. מילון תואם בפורמט .dict .
    4. מפה הפלוטיפית התואמת אזורים גנומיים המעניינים עבור SNPs ובלוקי חוסר שוויון קישור (למשל, פיקארד build_fingerprint_maps, SCR_006525).
  2. ודא שכותרת מפת ההפלוטיפים תואמת לגנום הייחוס.

2. יישור לגנום ייחוס, מיון ואינדוקס

  1. הרץ את זרימת העבודה של CWL כדי לספק את הפלטים של השלבים המתוארים להלן (רשימת הכלים בטבלת החומרים) (איור 2).
  2. הפעל את זרימת העבודה של CWL על ידי מתן תיקייה של קבצי fastq מזווגים או קבצי bam מיושרים.
  3. ספק את התבנית, למשל R1/R2, כתבנית ביטוי רגולרי קלט בפקודת CWL.
  4. בנוסף, ספק את מיקום ריצת זרימת העבודה, הפניה לגנום וקבצי מיפוי הפלוטיפ.
    הערה: להשוואה כוללת לכולם, משתמשים בתיקיית הקלט המלאה. אם יש להשוות תת-קבוצה של קבצים, יש לספק קובץ מופרד בפסיקים המכיל את שמות הקבצים להשוואה. האופציה המתקדמת מאפשרת בחירת זיכרון גישה אקראית ומספר יחידות עיבוד מרכזיות להרצת התהליך.
  5. מיפוי קבצי fastq לגנום הייחוס האנושי באמצעות אלגוריתם מיפוי.
    הערה: בהתאם לאופן הריצוף, BWA-MEM משמש לתוצאות ריצוף DNA23, וממפה מודע לחיבור STAR משמש לתוצאות ריצוף RNA24. קוד לדוגמה ליישור STAR מסופק להלן:
    STAR \
    --readFilesCommand zcat \
    --runThreadN 8 \
    --outSAMmapqUnique 60 \
    --outSAMattributes All \
    --outReadsUnmapd Fastx \
    --outTmpDir /tmp/STARtmp/ \
    --runDirPerm All_RWX \
    --outSAMtype BAM לא ממוינת \
    --outFileNamePrefix /FILENAME_ \
    --outSAMattrRGline ID:FILEID. L001 SM:SAMPLE \
    --גנוםDir /REF/GENOME/DIR \
    --readFilesIn /path/to/FILENAME. R1.fastq.gz /path/to/FILENAME. R2.fastq.gz
  6. מיין את קבצי מטריצת היישור הבינארי (BAM) המתקבלים לפי קואורדינטות קריאה באמצעות מיון SAMtools (samtools sort -o FILENAME_OUT.bam FILENAME_IN.bam).
  7. אנדקס קבצי BAM הממוינים באמצעות אינדקס SAMtools (samtools index FILENAME_OUT.bam).
  8. סמן והסר כפילויות באמצעות Picard MarkDuplicates.
  9. אנדקס מחדש של קבצי BAM וכולל קבוצות קריאה (RG) באמצעות SAMtools.
    הערה: קבצי BAM חייבים לכלול תגי RG כדי שתהליך העבודה יעבוד.

3. הוצאת טביעות אצבע

  1. השתמש בקבצי BAM הממוינים והממוינים כדי לזהות טביעות אצבע SNP באמצעות Picard ExtractFingerprints.
  2. השתמש באחסון ביניים של קבצי פורמט הקריאה הווריאנטי (VCF) המתקבל אך ורק לצורך השוואה בין דגימות.

4. חישוב ציוני דמיון

  1. השתמש ב-Picard CrossCheckFingerprints כדי לחשב ציוני יחס סיכויים לlog (LOD) של דמיון בהתבסס על בלוקי אי-שוויון קישוריות, המסופקים בפורמט קובץ crosscheck_metrics כ-crosscheck_metrics.txt.
    הערה: מימוש זרימת העבודה מאפשר השוואה צולבת של כל השילובים האפשריים של זוגות דגימות או השוואה נבחרת בין דגימות מתוך רשימה מוגדרת מראש.
  2. מחק קבצי VCF בינוניים.
  3. קובץ crosscheck_metrics מספק ארבע השוואות לכל זוג דגימות שנבדקו. הפרשנות של ציוני LOD היא כדלקמן:
    ציון LOD > 0: סביר שהדגימות מגיעות מאותו אדם (התאמת מדגם)
    ציון LOD ≤ 0: סביר שהדגימות מגיעות מאנשים שונים
  4. אימות ערך החיתוך להתאמות דגימות על ידי הצגת התפלגות הניקוד של LOD כהיסטוגרמה, לדוגמה, ב-R או Python (איור 3).
  5. מוצע צוות שיתופי הכולל מומחיות ביואינפורמטיקה מנוסה כדי לקבוע האם הראיות מספיקות לזיהוי חד-משמעי של זהויות המדגם ולאפשרות להתאים את הספים בהם משתמשים, למשל, על ידי הכללת כל שלושת ציוני LOD או השוואה להתפלגות ציוני LOD של דגימות הידועות שמקורן באנשים שונים.
    הערה: טעויות בדגימה עלולות לגרום למספר התאמות בלתי צפויות (ציון LOD < 0 לדגימות מאותו תורם) ולאי-התאמות (ציון LOD > 0 לדגימות מתורמים שונים). פרשנויות מורכבות דורשות חילופי דברים קרובים בין הצוות הרב-תחומי לבין מומחה הביואינפורמטיקה.

5. זמינות הקוד

תהליך העבודה החישובית יהיה זמין ב-Github: https://github.com/Roche/sample-matching-workflow.

תוצאות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מימוש זרימת עבודה של CWL
תהליך עבודה לזיהוי התאמות מדגם, המבוסס על גישה מוקדמת המשתמשת בבלוקים של חוסר שוויון קישור של פולימורפיזמים חד-נוקלאוטידיים לזיהוי החלפות דגימות,יושם 15. המחברים הראו שיעורי סיווג של 0% FMR ו-0.01% FFR בשיטה זו. השוואה לגישות אחרות הראתה ביצועים דומים ל-NGSCheckmate בכיסוי גבוה ובינוניים ושיפור בביצועים לעומת NGSCheckmate בכיסוי נמוך ולחפיפה גנומית אזורית מינימלית. תוצאות לא חד-משמעיות התקבלו בהשוואה ל-Conpair ו-BAMixChecker 13,15,25. כאן, זרימת העבודה יושמה ב-CWL, נחקרו ואופטימיזציה של ספי LOD, והיא יושמה להשוואה בין זוגות ריצוף RNA לזוגות ריצוף DNA או בין מודאליות בתוך דגימות שנלקחו מרקמה ובין דגימות מהרקמה והדם ההיקפי (איור 3, טבלה 1). מימוש זרימת העבודה אפשר השוואה הדדית של כל השילובים האפשריים של זוגות דגימות או השוואה נבחרת בין דגימות מתוך רשימה מוגדרת מראש.

קלט זרימת העבודה משתמש בקבוצת הפלוטיפים נבחרת. אלו משמשים לחישוב פולימורפיזמים של נוקלאוטידים בודדים בבלוקים של אי-שווי משקל קישוריות. חישוב ציוני יחס לוגריתם-סיכויים (LOD) של בלוקים אלו של SNPs בין זוגות דגימות מאפשר הבדלה בין דגימות תואמות לדגימות לא תואמות. בעבר, הוכח כי ציוני LOD בטווח של LOD <-5 ו-LOD > 5 מסווגים נכון זוגות תואמים של דגימות15. ציוני LOD נוספים (LOD_SCORE_TUMOR_NORMAL, LOD_SCORE_NORMAL_TUMOR) מחושבים תוך התחשבות באובדן פוטנציאלי של ההטרוזיגוטיות בדגימת הגידול עבור אחת מהדגימות (אזורים הטרוזיגוטיים במדגם אחד שזוהו כהומוזיגוטיים בדגימה השנייה).

השפעה של פרמטרי קלט וספים על שיעורי התאמה/אי-התאמה
הערכת זרימת העבודה הזו הדגישה שלושה היבטים קריטיים המשפיעים על הביצועים והדיוק שלה. ראשית, בחירת האזורים הגנומיים המכוסים במפת ההפלוטיפ התבררה כשלב מכריע. בחירת האזורים הללו משפיעה ישירות על כוח ההבחנה של תהליך ההתאמה. שנית, השילוב בין אסטרטגיות יישור קריאה למפות הפלוטיפים הספציפיות ששימשו לחילוץ טביעות אצבע השפיע משמעותית על תוצאות הניתוח הסופי. שינויים בשלבי העיבוד העליונים הללו עלולים ליצור הטיות עדינות שמתפשטות לציונים התואמים (איור 4A–B). שלישית, הערכה מדוקדקת ובחירת ספים לקביעת התאמה של המדגם היו חיוניים. ערכי סף אופטימליים יכולים להשתנות משמעותית בהתאם למודאליות הנתונים הספציפית (למשל, ריצוף אקסום שלם לעומת ריצוף טרנסקריפטום שלם) ולאזורים הגנומיים המוערכים. ספים שונים יכולים להתאים את הקפדנות של הגישה (שיעור חיובי שגוי גבוה לעומת שיעור שלילי שגוי גבוה) (איור 4C). כדי להתמודד עם זה עבור קבוצה גדולה של דגימות קליניות, השיטה הותאמה להגדרת שילובי ציוני התאמת מדגמים מתירים ומחמירים בהתבסס על שילוב ציוני LOD ששימשו והמשווה. גישת סף ראשונה (I) הושגה על ידי התחשבות בכל ערך חיובי בין שלושת ציוני LOD (LOD_SCORE, LOD_SCORE_TUMOR_NORMAL, LOD_SCORE_NORMAL_TUMOR). על ידי הכללת מידע על ציוני TUMOR_NORMAL ו-NORMAL_TUMOR, ניתן להפחית את השפעות אובדן ההטרוזיגוטיות, המתרחשות עקב שינויים במספר העותקים של דגימות סרטן. לעומת זאת, סף מחמיר יותר לאי-התאמות (II) יושם על ידי יישום שני קריטריוני סינון חלופיים, המותאמים להפחתת חיוביים שגויים: (א) סיווג כהתאמה בלבד, אם LOD_SCORE חיובי, ב) קטגוריזציה כהתאמה, אם, עבור מדגימה נתונה, LOD_SCORE גבוה מהציון המקסימלי של LOD_SCOREs הזוגות האחרים של המדגם בין המדגמים שלא צפויים להתאים (בהתבסס על מטופל מוצא מתועד ממנו), גם אם LOD_SCORE עצמו שלילי.

ביישום זה, כדי ליצור סף מתיר, כל זוג דגימה שהוגדר כהתאמה לפי אחד מהקריטריונים לעיל (I, IIa, IIb) נחשב להתאמה. דבר זה סיפק ביטחון גבוה בכל אי-התאמות שזוהו, על חשבון אי-התאמות אמיתיות פוטנציאליות שהוגדרו כהתאמות (כלומר, שליליות שגויות). השוואה בין סף המתיר לספים מחמירים יותר הראתה שינוי באחוז הזוגות שסווגו כאי-התאמות. ההבדל בין הגישות, בין כל המחקרים שנותחו, נע בין 3.9% (כל אחד משלושת ציוני LOD חיובי (I)), 13.3% (LOD_SCORE חייב להיות חיובי (IIa)), 9.2% (LOD_SCORE לעומת זוגות לא תואמים במדגם (IIb)), ו-3.6% (בהתחשב בכלל באחד מהנ"ל כדי לקבוע התאמה) (איור 4C).

השפעת כיסוי אזורי הגנום
ההבדל בין ציוני LOD שליליים לחיוביים עבור דגימות מותאמות ולא תואמות הוא הגבוה ביותר כאשר מכוסים טווח רחב של אזורים גנומיים (ריצוף גנומי מלא (WGS) או השוואת דגימות WGS עם מודאליות אחרות), וכך מקל על בחירת סף (איור 5A). בהשוואות רצף אקסום מלא וריצוף RNA, ציוני LOD יורדים קרוב לאפס כאשר גישות סף משפיעות על התוצאות, מה שמדגיש את חשיבות הערכת הקפדנות של הספים עבור מודאליות עם כיסוי גנומי נמוך יותר. התפלגות תוצאות מדגימות זוגיות ידועות עם ציוני LOD חיוביים מוצגת באיור 5B. ג'אווד ואח' (2020) הראו כי חפיפת גנום של 0.02% בלבד מספיקה להבחנה בין דגימות תואמות לבלתי תואמות כאשר משתמשים בבלוקים של אי-שוויון קישור15.

אימות
הגישה אושתה על מערכי נתונים נוספים של סרטן השד, סרטן המעי הגס והריאות של ריצוף אקסום שלם (WES) וריצוף RNA, שבהם צפוי שסט דגימות ידוע יגיע מאותם פרטים (איור 6A). זוגות דגימות מאותו אדם הראו שיעור התאמה של 100% (איור 6B), בעוד שהשוואות נוספות למדגמים אחרים הידועים שמקורם בפרטים שונים הראו שיעור אי-התאמה של 100%. לא נצפו חיוביים שגויים או שליליים שגויים באף אחד ממערכי הנתונים הללו.

לסיכום, יישום זרימת העבודה של בקרת האיכות מאפשר השוואות בין-אישיות של זוגות דגימות רצף מהדור הבא על ידי מתן גישה סטנדרטית וניתנת לשחזור. ספי דירוג ה-LOD שמתקבלים מניבים שיעורי חיובי שגוי ושלילי שגוי נמוכים עבור דגימות עם חפיפה אזורית גנומית גדולה, וניתן ליישם אופטימיזציה נוספת לסף עבור דגימות עם עומק ריצוף נמוך או שבהן יש מעט חפיפה גנומית.

figure-results-1
איור 1: ייצוג סכמטי של התרחשות החלפות דגימות ותיוג שגוי. (א) החלפת דגימה של דגימה אחת כל אחד בין שני אנשים. (ב) ייצוג שלבי עיבוד הדגימה, החל מחילוץ ביופסיה ועד ניתוח נתוני ריצוף. נוצר ב-BioRender. וויט פון וויתנברג, ל. (2026) https://BioRender.com/xhbp178. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

figure-results-2
איור 2: ייצוג ממשק המשתמש עבור קבצי קלט ופרמטרים הנדרשים להרצת תהליך בקרת איכות התאמת דגימות ב-CWL. ממשק משתמש גרפי להזנת קבצים ופרמטרים. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

figure-results-3
איור 3: תוצאות שהושגו מתהליך התאמת הדגימה. התפלגות ציוני LOD עבור סט דגמי של דגימות ריצוף DNA (רצף גנום שלם וריצוף אקסום שלם) (משמאל), להשוואה בין ריצוף DNA לריצוף RNA (במרכז) כדי להראות כיצד מעט מאוד דגימות לא תואמות מתנהגות לעומת התפלגות דגימות תואמות, ולקבוצה גדולה יותר של זוגות ריצוף RNA (מימין) עם נתונים ידועים שמקורם בפרטים שונים (אי-התאמות, אדום בהיר) ומאותו אדם (התאמות, ירוק בהיר). קיצורים; LOD = יחס סיכויים ללוגריתם. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

figure-results-4
איור 4: נצפו הבדלים לדוגמה בציון LOD. (א) בשילוב גישות שונות ליישור רצפים ומפות הפלוטיפים עבור סט של דגימות ידועות לא תואמות ותואמות, ו-(ב) לניקוד באמצעות אינטגרציה של גידול ומידע תקין. (ג) הופעת מספר ההתאמות והאי-התאמות המוגדרות על ידי גישות סף בעלות חומרה שונה. קיצורים; LOD = יחס סיכויים ללוגריתם. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

figure-results-5
איור 5: התפלגות מופתית של ציוני LOD להשוואת שיטות ריצוף שונות מהדור הבא. (א) התפלגות ציוני LOD של דגימות צפויות לא תואמות והתאמה בין רצף DNA מדם ורקמת גידול לבין ריצוף RNA מרקמת גידול. (B) התפלגות ניקוד LOD של דגימות תואמות עבור שילובים של מודאליות שונות. קיצורים; LOD = יחס סיכויים ללוגריתם. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

figure-results-6
איור 6: התפלגות ציוני LOD לניתוח מאגר נתוני WES וריצוף RNA של סרטן השד. מאגר הנתונים של סרטן השד המזוהה התקבל מ-Caris Life Sciences ונגזר מפרופילינג מקיף של גידולים. (א) הופעה לוגריתמית של ציוני LOD להשוואות בין דגימות WES של גידול (משמאל) ובין דגימות ריצוף RNA (מימין). (B) התפלגויות ניקוד LOD עבור זוגות דגימות צפויים מאותם פרטים (שורה עליונה של WES, שורה תחתונה עם ריצוף RNA). קיצורים; LOD = יחס סיכויים ללוגריתם. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

LEFT_GROUP_VALUERIGHT_GROUP_VALUEתוצאהLOD_SCORELOD_SCORE_
TUMOR_NORMAL
LOD_SCORE_
NORMAL_TUMOR
דוגמה 1דוגמה 1EXPECTED_MATCH38.11926629.64948529.649485
דוגמה 1דוגמה 2EXPECTED_MISMATCH-2.552644-4.574225.283698
דוגמה 2דוגמה 1EXPECTED_MISMATCH-2.5526445.283698-4.57422
דוגמה 2דוגמה 2EXPECTED_MATCH12.3287378.7964578.796457

טבלה 1: תוצאות מופתיות שהושגו מהרצת Crosscheck Fingerprints. הטבלה מציגה תוצאות מופתיות של זוג דגימות שהושוו בשיטת התאמת המדגם.

דיון

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מגוון שיטות לזיהוי התאמות דגימות זמינות 1,4,13,14,15,16. כאן, תוארה היישום של גישה המשתמשת בבלוקים אי-שווי משקל של קישור SNP המיושמים במספר מודאליות אומיקס, עם שיעורי חיובי-שגוי ושליליים-שגויים נמוכים. היישום בוצע ב-CWL כדי להקל על עיבוד בתפוקה גבוהה בין מערכי נתונים בסביבת זרימת עבודה סטנדרטית. הערכת זרימת העבודה זיהתה שלושה היבטים מרכזיים שיש לקחת בחשבון בעת יישום הגישה. שלב מרכזי בתהליך הוא בחירת האזורים הגנומיים המכוסים על ידי מפת ההפלוטיפ. בנוסף, שילוב יישור קריאה עם חילוץ טביעות אצבע באמצעות מפות הפלוטיפים שונות יכול להשפיע על תוצאות הניתוח. יתרה מזאת, הערכה מדוקדקת ובחירת ספים, שעשויים להיות תלויים במודאליות הנתונים ובאזורים המכוסה, הם חיוניים ויכולים להוביל לקריאות התאמת דגימות יותר או פחות מתירות.

להערכת קבוצות גדולות של דגימות קליניות, השיטה הותאמה להגדרת שילובים של ספים לציונים מתירים ומחמירים של התאמת מדגם. השיטה הותאמה לכלול גישת סף מתירה על ידי התחשבות בציון משולב הכולל כל אחד מציוני LOD (LOD_SCORE, LOD_SCORE_TUMOR_NORMAL, LOD_SCORE_NORMAL_TUMOR) או שני קריטריוני סינון חלופיים, מה שהוביל לבחירה מחמירה יותר של דגימות. היישום של הגישה מוגבל לדגימות שבהן זמין מידע SNP במגוון אזורים גנומיים, לדוגמה, נתוני ריצוף מהדור הבא. יתרה מזאת, נדרשים לפחות זוגות דגימות מאותו אדם לניתוח השוואתי והתאמת דגימה. מידע קליני נוסף, כגון מצב מוטציה שהושג בשיטות ממוקדות או מטא-דאטה של מטופלים, כגון מין, עשוי לשמש כדי לספק ראיות נוספות להתאמה בין נתונים מולקולריים בממדים גבוהים לבין נתונים קליניים ברמת המטופל.

יישום הגישה בסביבת ניהול זרימת עבודה, עם אפשרות לאחסון נתונים מקביל, מאפשר ניתוח בקרת איכות בתפוקה גבוהה של דגימות לזיהוי בין יחידים. לכן, היא מגבירה את הנגישות והשחזוריות של הגישה בין מערכי נתונים ודגימות. ההתאמה של קריטריוני הסף בגישה זו מאפשרת עיבוד וניתוח דגימות סרטן עם עומס מוטציה נמוך וגבוה של גידול ושינויים במספר העתקים, העלולים להוביל לאובדן ההטרוזיגוטיות וכך להשפיע על סבירות הגנוטיפ.

השיטה יכולה למצוא יישום רחב בכל סוג של פרויקט הכולל נתוני ריצוף מהדור הבא מאנשים אנושיים, שלגביהם יש יותר מדגם אחד לכל אדם. זה עשוי לנוע מגישות מותאמות אישית למטופלים בודדים ועד ניסויים קליניים גדולים האוספים נתונים מולקולריים בממדים גבוהים עבור תחומי מחלה שונים. ניתן לשלב זאת עם תהליכי בקרת איכות, חקירת זיהום חוצה מינים, וגישות לקישור מאגרי נתונים מולקולריים בממדים גבוהים למידע קליני לשילוב בכל צינור בקרת איכות לנתוני ריצוף מהדור הבא.

גילויים

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

כל המחברים הם עובדים או קבלנים חיצוניים ובעלי מניות של F. Hoffmann-La Roche Ltd. בנוסף, זכרי וויטפילד הוא עובד ב-Rancho Biosciences, ואנה טיישיירה היא עובדת ב-A4Pbio. המחברים מצהירים שאין להם אינטרסים מתחרים.

תודות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

אנו מודים בכנות למטופלים ולבני משפחותיהם על שסיפקו את הדגימות. אנו מביעים את תודתנו העמוקה לכל המעורבים במחקרים הקליניים, במיוחד לחברי צוותי המחקר, צוותי החוקרים וצוותי הפרויקטים בארגוני המחקר הקליני שלנו, על תרומתם היקרה. המחברים מודים ל-N. Nair ו-E. Guarin על קריאתם הביקורתית של כתב היד ועל הערותיהם החשובות. אנו גם מודים ל-A. Cosolo על תמיכתו בהפיכת מערכי נתונים נוספים לנגישים. אנו מודים לרשת EDIS (Enhanced Data and Insights Sharing Share) ברחבי רוש על מאמציהם באיסוף והתאמת נתונים.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
FastQCv0.11.9SCR_014583
MultiQCגרסה 1.8SCR_014982
BWA-MEMv0.7.17SCR_010910
כוכבv2.7.9aSCR_004463
SAMtoolsV1.12, v1.19.2SCR_005227
-  faidx
-  מיין
-  אינדקס
- Addreplacerg
פיקארדV2.25.5, v3.0.0SCR_006525
- CreateSequenceDictionary
- MarkDuplicates
- build_fingerprint_maps
- ExtractFingerprints
- בדיקת טביעות אצבע
CWLגרסה 1.2SCR_015528
RR v4.3.1SCR_001905
DPLYR v1.1.4

מקורות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Westphal, M., et al. SMaSH: sample matching using SNPs in humans. BMC Genomics. 20 (12), 1001(2019).
  2. Westra, H. J., et al. MixupMapper: correcting sample mix-ups in genome-wide datasets increases power to detect small genetic effects. Bioinformatics. 27 (15), 2104-2111 (2011).
  3. Addala, V., et al. Computational immunogenomic approaches to predict response to cancer immunotherapies. Nat. Rev. Clin. Oncol. 21 (1), 28-46 (2024).
  4. Schröder, J., Corbin, V., Papenfuss, A. T. HYSYS: have you swapped your samples. Bioinformatics. 33 (4), 596-598 (2017).
  5. Pengelly, R. J., et al. A SNP profiling panel for sample tracking in whole-exome sequencing studies. Genome Med. 5 (9), 89(2013).
  6. Subramanian, I., et al. Multi-omics data integration, interpretation, and its application. Bioinform Biol Insights. 14, 117793221989905(2020).
  7. Baião, A. R., et al. A technical review of multi-omics data integration methods: from classical statistical to deep generative approaches. Brief Bioinform. 26 (4), bbaf355(2025).
  8. Wang, Z., Zhao, Y., Zhang, L. Emerging trends and hot topics in the application of multi-omics in drug discovery: A bibliometric and visualized study. Curr Pharm Anal. 21 (1), 20-32 (2024).
  9. Morris, S., et al. Two algorithms for biospecimen comparison and differentiation using SNP genotypes. Pharmacogenomics. 14 (4), 379-390 (2013).
  10. Yoo, S., et al. MODMatcher: multi-omics data matcher for integrative genomic analysis. PLoS Comput Biol. 10 (8), e1003790(2014).
  11. Li, L., et al. SMAP is a pipeline for sample matching in proteogenomics. Nat Commun. 13 (1), 744(2022).
  12. Cibulskis, K., et al. ContEst: estimating cross-contamination of human samples in next-generation sequencing data. Bioinformatics. 27 (18), 2601-2602 (2011).
  13. Chun, H., Kim, S. BAMixChecker: an automated checkup tool for matched sample pairs in NGS cohort. Bioinformatics. 35 (22), 4806-4808 (2019).
  14. Lee, S., et al. NGSCheckMate: software for validating sample identity in next-generation sequencing studies within and across data types. Nucleic Acids Res. 45 (11), e103-e103 (2017).
  15. Javed, N., et al. Detecting sample swaps in diverse NGS data types using linkage disequilibrium. Nature Commun. 11 (1), 3697(2020).
  16. Wang, P. P. S., Parker, W. T., Branford, S., Schreiber, A. W. BAM-matcher: a tool for rapid NGS sample matching. Bioinformatics. 32 (17), 2699-2701 (2016).
  17. Katsanis, S. H., Wagner, J. K. Characterization of the standard and recommended codis markers. J Forensic Sci. 58, s1(2013).
  18. Yousefi, S., et al. BIOS consortium. A SNP panel for identification of DNA and RNA specimens. BMC Genomics. 19 (1), 90(2018).
  19. Huang, J., Chen, J., Lathrop, M., Liang, L. A tool for RNA sequencing sample identity check. Bioinformatics. 29 (11), 1463-1464 (2013).
  20. Goldfeder, R. L., et al. A bioinformatics approach for determining sample identity from different lanes of high-throughput sequencing data. PLoS ONE. 6 (8), e23683(2011).
  21. Crusoe, M. R., et al. Methods included: standardizing computational reuse and portability with the common workflow language. Commun ACM. 65 (6), 54-63 (2022).
  22. Ahmed, A. E., et al. Design considerations for workflow management systems use in production genomics research and the clinic. Scientific Rep. 11 (1), (2021).
  23. Li, H., Durbin, R. Fast and accurate short read alignment with Burrows-Wheeler transform. Bioinformatics. 25 (14), 1754-1760 (2009).
  24. Dobin, A., et al. STAR: ultrafast universal RNA-seq aligner. Bioinformatics. 29 (1), 15-21 (2013).
  25. Bergmann, E. A., et al. Conpair: concordance and contamination estimator for matched tumor–normal pairs. Bioinformatics. 32 (20), 3196-3198 (2016).

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תגיות

מאמרים קשורים