June 23rd, 2012
רצפי DNA ונקווה היא אסטרטגיה מהיר וחסכוני לזהות גרסאות נדירים הקשורים פנוטיפים מורכבים של קבוצות גדולות. כאן אנו מתארים את ניתוח חישובי של רצפי נקווה הדור הבא, של 32 גנים הקשורים בסרטן באמצעות חבילת תוכנה ספלינטר. שיטה זו היא מדרגית, והיא חלה על כל הפנוטיפ של עניין.
המטרה הכוללת של הליך זה היא לזהות גנים בתוך אוכלוסייה של פרטים המראים ריבוי של שונות תפקודית נדירה. זה מושג על ידי איגום אוכלוסייה של דגימות DNA. השלב השני הוא ליצור ולרצף ספריית ריצוף מהדור הבא.
לאחר מכן יישור הקריאות לרצף הייחוס ויצירת מודל שגיאה. השלב האחרון הוא ניתוח חישובי באמצעות אלגוריתם הפיצול. בסופו של דבר נעשה שימוש בניתוח רסיסים של ריצוף הדור הבא כדי להראות גנים בתוך אוכלוסיות המכילים ריבוי של שונות תפקודית נדירה המדגים את ההליך.
היום יהיה פרנצ'סקו וילאניה, שהוא סטודנט לתואר שני במעבדה של המנטור שלי ומשתף הפעולה שלנו, רוב מיטרה, ויצטרף אליו אנריקה ראמוס, סטודנט לתואר שני במעבדה שלי. היתרון העיקרי של טכניקה זו על פני שיטות קיימות כגון גנוטיפים בודדים, הוא שהיא מאפשרת לזהות במדויק וריאנטים נדירים של רצף באוכלוסייה מעורבת של מולקולות DNA מבלי לדרוש מידע מוקדם. שיטה זו יכולה לעזור לענות על שאלות מפתח בתחומי הגנטיקה והגנומיקה, כגון כיצד לקבוע את השכיחות של מחלות חדשות הגורמות לוריאנטים נדירים במחקרי עוקבה גדולים.
כל ניסוי רסיס דורש נוכחות של בקרה שלילית וחיובית כדי להשיג דיוק אופטימלי, להכין את תערובת תגובת ה-PCR באמצעות PFU נאמנות גבוהה במיוחד. DNA פולימראז. הבקרה השלילית היא תוצר PCR מכל רצף DNA הידוע כנטול שונות גנטית, כגון עמוד שדרה וקטורי משובט.
כאן, נעשה שימוש באמפליקון זוג בסיסים של 1,934 מווקטור M 13 MP 18. הבקרה החיובית יכולה להיות כל קבוצה של וריאנטים של רצף שאומתו בעבר הקיימים באוכלוסייה כולה. אם נתונים אלה אינם זמינים, מעבדה זו תכננה בקרה חיובית מלאכותית המורכבת מבסיס 331 לכל מוצר PCR מתערובת של רצפים מהונדסים ששובטו לתוך הווקטור הקל של PGMT כמפורט בטבלה זו.
רצפים אלה משולבים כדי לחקות תדרי אלל מינוריים שונים של וריאנטים אמיתיים בתוך מאגר המטופלים. לאחר הגברת PCR של דגימות כפי שנדון בפרוטוקול הכתוב הנלווה לסרטון זה, נקה כל מוצר PCR מעודפי פריימרים באמצעות טיהור עמודים מהיר של קיאוק קיוגן, או לוחות סינון 96 בארות עם סעפת ואקום לניקוי בקנה מידה גדול. לאחר הטיהור, כמת כל מוצר PCR בטכניקות סטנדרטיות.
התכוננו לשלב את כל מוצרי ה-PCR והבקרות למאגר מנורמל לפי מספר מולקולה. איגום לפי ריכוז יביא לייצוג יתר של אמפליקונים קטנים על פני מוצרים גדולים יותר. במקום זאת, אגדו מספר מנורמל של מולקולות לכל אמפליקון.
בחר מספרים שרירותיים גדולים מספיק כדי לשמור על דיוק במהלך הפיפטינג. משוך את מוצרי ה-PCR והבקרות. קשירת מוצרי ה-PCR נחוצה מכיוון שפיצול של מבקשי PCR קטנים ככל הנראה יטה את הייצוג למטרותיהם.
מסיבה זו, אנו מחברים את מוצרי ה-PCR למשיכה ל-con גדול לפני הפיצול שלהם. הכן תערובת לקשירה קהה באמצעות T ארבע Ligase, T ארבע PNK ו-PEG כמפורט בפרוטוקול. דגרו את התגובה בטמפרטורה של 22 מעלות צלזיוס למשך 17 שעות.
המשיכו עם הדגירה בטמפרטורה של 65 מעלות צלזיוס למשך 20 דקות והחזיקו בארבע מעלות צלזיוס. בדוק את הקשירה על ידי העמסת 50 ננוגרם של דגימה לג'ל ארוזה. קשירה מוצלחת תביא לרצועת משקל מולקולרית גבוהה הקיימת בנתיב.
התכוננו לפיצול DNA באמצעות אסטרטגיית סוניקציה אקראית על ידי דילול הדגימה 10 לאחד במאגר Qiagen PB כדי להפוך אותה לפחות צמיגה. לאחר מכן פרקו את הקונוס הגדול של מוצרי PCR באמצעות קרע ביולוגי של צומת דיאגון של 24 דגימות, סוניקט בעוצמה גבוהה במהלך 25 דקות עם 40 שניות הפעלה ו-20 שניות כיבוי לדקה. בדוק את תוצאות פיצול ה- DNA על ג'ל אגרו והמשך בריצוף מואר כמתואר בטקסט.
כדי להתחיל ברצף, קרא את היישור. המר רצף גולמי, קרא קבצים לפורמט צעיף או דחוס אותם. דחיסה היא אופציונלית.
זה חוסך זמן ומקום לשלבי הניתוח הבאים מבלי לאבד מידע רלוונטי. באמצעות כלי היישור המצורף, יישר את הקריאות הגולמיות לרצף הייחוס המהיר יותר המבואר. ספציפיים לאזורים הממוקדים כוללים את תגובות ה-PCR כמו גם את הבקרות החיוביות והשליליות.
פורמט הקלט חייב להיות בפורמט צעיף או דחוס. לאחר מכן, בצע תיוג קבצים כמתואר בטקסט. כל הפעלה מייצרת פרופיל ייחודי של שגיאת רצף שיש לאפיין עבור קריאת וריאנטים מדויקים לשגיאות מודל עבור כל ריצה.
בקרה פנימית הידועה כפרוסה של וריאציה של רצף כלולה בכל ספריית דוגמאות של מאגר מהקובץ המתויג המיושר. צור קובץ מודל שגיאה באמצעות הכלי הכלול עם רצף הפניה לבקרה שלילית, ניתן להשתמש בכל רצף הבקרה השלילי או לחילופין רק בתת-קבוצה כאשר צוין על ידי חמשת הקצוות הראשוניים ושלושת הקצוות הראשוניים שלו. תמיד יש להחיל קריאות ייחודיות וספירות פסאודו.
הכלי יפיק שלושה קבצים בשם פרמטר שם קובץ הפלט המסתיימים באפס, אחד או שניים. קבצים אלה תואמים למודל שגיאה מסדר ראשון ושני אפס בהתאמה עבור קריאת וריאנטים עם רסיס. יש להשתמש תמיד במודל השגיאה מסדר שני להדמיה של פרופיל שיעור שגיאות ההפעלה.
ניתן להשתמש בסקריפט הפנינה המשמש להתוויית גרף מודל השגיאה כדי ליצור עלילת שגיאות PDF בקובץ מודל השגיאה מסדר אפס. קובץ העלילה יחשוף מגמות שגיאה ספציפיות להפעלה וניתן להשתמש בו כדי להסיק את המספר המרבי של בסיסי קריאה לניתוח. הסעיף הבא ידגים כיצד להפעיל רסיס על הקובץ המיושר באמצעות מודל השגיאה כדי לזהות וריאנטים נדירים של רצף.
השלב הראשון בניתוח הוא להריץ רסיס על הקובץ המיושר באמצעות רצף הייחוס ומודל השגיאה. ניתן להוציא בסיסי קריאה בודדים מהניתוח אם נמצא פגום. חתך ערך ה-P מכתיב עד כמה מחמיר יהיה ניתוח קריאת הווריאנטים.
חתך מינימלי של מינוס 1.301 הוא התחלה טובה. אפשרות גודל הבריכה מייעלת את אות האלגוריתם להבחנת רעש על ידי ביטול שונות פוטנציאלית עם תדרי אלל מינוריים נמוכים מזה של אלל בודד במאגר בפועל. יש להגדיר את אפשרות גודל המאגר לערך הקרוב ביותר הגדול ממספר האללים שנותחו בפועל בניסוי.
שונות הנקראת בתדרים נמוכים יותר תתעלם כרעש. לאחר הזנת כל הפרמטרים ושמות הקבצים הפעל רסיס. קובץ זה מחזיר את כל הכניסות בעלות מובהקות סטטיסטית על פני המדגם עם תיאור של המיקום של סוג הווריאנט של הווריאנט.
ערך P לכל תדירות גדיל DNA של הגרסה וכיסוי כולל לכל גדיל DNA. בקבוקון הרשימה משמש את ספלינטר כדי לנרמל את הכיסוי על פני המדגם. השדה הראשון מציין את האמפליקון המעניין, ואילו השדה השני מציין את המיקום בו קיימת המוטציה.
N מציין ששאר הרצף אינו מכיל מוטציה כלשהי. נורמליזציה, ניתוח הבקרה החיובית הוא המפתח למקסום הרגישות והספציפיות לריצה מסוימת. זה חשוב מכיוון שסביר להניח שהחתך הראשוני של מינוס 1.301 לא יספיק כדי לבטל את כל התוצאות החיוביות השגויות.
כל ניתוח רסיסים יציג את ערך ה-P בפועל עבור כל וריאנט שנקרא, שלא ניתן היה לחזות אותו בעדיפות. עם זאת, ניתן לחזור על הניתוח כולו על ידי שימוש בערך ה-P הפחות מחמיר המוצג בפלט הראשוני עבור מיקומי הבסיס החיוביים האמיתיים הידועים. זה ישמש לשמירה על כל התוצאות החיוביות האמיתיות תוך אי הכללת רוב, אם לא כולן, התוצאות החיוביות השגויות, שבדרך כלל יש להן ערכי P הרבה פחות משמעותיים בהשוואה לחיוביים אמיתיים.
כדי להפוך תהליך זה לאוטומטי, ניתן להשתמש בסקריפט בודק החיתוך. סקריפט בודק הניתוק דורש קובץ פלט מפצל ורשימה של פגיעות בקרה חיוביות בצורה של קובץ מופרד כרטיסיות כמו זה המשמש לנורמליזציה. התפוקה שתתקבל תהיה רשימה של חתכים שמגיעים בהדרגה לאופטימלי.
השורה האחרונה מייצגת את החתך האופטימלי ביותר לריצה ולכן ניתן להשתמש בה לניתוח נתונים. התוצאה האופטימלית היא להשיג רגישות וספציפיות של אחד. עם זאת, אם לא מושג, ניתן לבצע אופטימיזציה של ניתוח הרסיסים על ידי שינוי מספר בסיסי הקריאה המשולבים.
ניתן להחיל את החתך הסופי על הנתונים באמצעות סקריפט חיתוך חתך, אשר יסנן את קובץ הפלט המפצל מלהיטים מתחת לחתך האופטימלי. שלב זה יפיק את קובץ הפלט הסופי של המפצל, שיכיל חיתוכים ואינדלים הקיימים במדגם. שים לב שהפלט עבור הוספות שונה במקצת מאשר עבור החלפות או מחיקות.
דיוק כפונקציה של כיסוי עבור אלל בודד בדגימה מאוגדת מוצג בסוג זה של חלקה. הדיוק מוערך מכיוון שהשטח שמתחת לעקומה קיצור UC של עקומת מפעיל מקלט ונע בין דיוק אקראי של 0.5 לדיוק מושלם של 1.0. בדוגמה זו, UC משורטט כפונקציה של כיסוי לכל אלל לזיהוי אללים מוטנטיים בודדים במאגרים של 200,501,000 אללים.
כאן UC משורטט כפונקציה של סך הכל עבור הוספות, מחיקות והחלפות. תרשים שגיאה זה מראה את ההסתברות לשילוב בסיס שגוי במיקום נתון. פרופיל השגיאה מציג שיעורי שגיאות נמוכים עם מגמת עלייה לקראת שלושת הקצה הראשוני של קריאת הרצף.
יש לציין שנוקלאוטידים ייחוס שונים מציגים הסתברויות שגיאה שונות. תרשים זה חושף את הדיוק של ספלינטר בהערכת תדירות האלל עבור מיקומים בעלי כיסוי גדול מפי 25 לכל אלל. השוואה בין תדירות אלל DNA מאוגדת המוערכת על ידי ספלינטר עם ספירת אללים שנמדדה על ידי מחקרי אסוציאציות רחבות גנום או תוצאות GWAS.
בקורלציה גבוהה מאוד, אוכלוסייה של 974 פרטים נמשכה ומכוונת לריצוף על פני 20 קילו-בסיסים. ספלינטר יושם לזיהוי וריאנטים נדירים. בהתאם לפרוטוקול הסטנדרטי, לכל אדם היה גנוטיפ שבוצע בעבר על ידי התאמה של gwas בין גנוטיפ של וריאנטים מתויגים וחדשים.
נקרא במדגם המאוחד היה מצוין. שלוש גרסאות, ששתיים מהן היו נדירות באוכלוסייה, נקראו denovo מתוצאות הריצוף, ואומתו על ידי ריצוף פירו בודד, תדירות אללים מינוריים או התאמה מתמטית בין ריצוף פיירו לריצוף משוך הייתה מצוינת. לאחר שסיימתם למצוא את השונות הנדירה שלכם במדגם המאוחד שלכם, אנשים רבים רוצים לדעת מהן ההשלכות התפקודיות של השונות שזוהו.
אז הערת השונות שלך הופכת לשלב הבא בתהליך לאחר פיתוח. טכניקה זו סללה את הדרך לחוקרים בתחום ריצוף ה-DNA לחקור וריאנטים נדירים בצורה מהירה וחסכונית כדי לאפיין וריאנטים נדירים במחקרי אוכלוסייה גדולה. לאחר צפייה בסרטון זה, אתה אמור להבין היטב כיצד לזהות וריאנטים נדירים של רצף במאגר, דגימת DNA באמצעות רסיס.
רצף DNA מדגם הוא שיטה יעילה לזיהוי וריאנטים גנטיים נדירים המקושרים לתכונות מורכבות באוכלוסיות גדולות. מאמר זה מפרט את הניתוח החישובי של נתוני רצף מדגם מ-32 גנים הקשורים לסרטן באמצעות חבילת התוכנה SPLINTER.
Detecting rare genomic variants in large populations is critical for target validation in complex disease research, where common variants fail to explain phenotypic variability. The SPLINTER-enabled pooled sequencing approach provides a cost-effective, scalable method to interrogate therapeutic hypotheses by identifying low-frequency functional variants without prior variant knowledge. This supports early discovery de-risking by enabling allele frequency estimation and variant confirmation in disease-relevant cohorts, directly informing portfolio prioritization and mechanistic follow-up.
The method fits within the discovery continuum from hypothesis generation to lead identification, providing variant detection outputs that inform target selection and assay readiness.