December 10th, 2012
נקודת השינוי בייס שלנו (BCP) אלגוריתם בונה על התקדמות מדינה-of-the-art בדוגמנות שינוי נקודות באמצעות מודלי מרקוב נסתרים וחייל אותם על הכרומטין immunoprecipitation ניתוח נתוני רצף (ChIPseq). BCP מבצע היטב בסוגי נתונים רחבים וpunctate, אבל מצטיין בזיהוי איים חזקים, לשעתק של העשרת היסטון מפוזרת באופן מדויק.
המטרה הכוללת של הניסוי הבא היא לנצל את הצפיפות של מיקומי קריאה ממופים מנתוני ריצוף חיסון כרומטין כדי להעריך את צפיפות הקריאה הממוצעת האחורית על פני הגנום. זה מושג על ידי עיבוד מקדים. ה-ChIP-seq הממופה קורא לפרופילי צפיפות חסומים עם אותו מספר קריאות הנופלים בתוך 200 פחים לא חופפים של זוג בסיסים.
כל פחים סמוכים עם אותה צפיפות מתמזגים לבלוק גדול יותר כצעד שני: צפיפות ממוצעת אחורית של כל בלוק מחושבת באופן רקורסיבי בהקשר של כל הבלוקים הסובבים באמצעות מודל בייסיאני עם מסננים קדימה ואחורה. כאשר ספירת הקריאה עבור בלוק מעוצבת עם התפלגות פואסון עם פרמטר תטא שלוקח על עצמו התפלגות גמא קודמת עם פרמטרי אלפא ובטא. הערכות הצפיפות הממוצעת האחוריות הבאות של כל בלוק מוערכות למשמעות על סמך האם הוא חורג מהקוונטיל ה-90 ביחס לצפיפות הרקע של בקרת הקלט על מנת ליצור את מקטעי הגנום המועשרים הסופיים מתקבלות תוצאות הממחישות את ההתקדמות מקריאות רצף גולמיות להערכות צפיפות קריאה ממוצעת אחורית, ולבסוף איים מועשרים בנתוני ChIP-seq במהלך ניתוח BCP.
יתר על כן, התוצאות מראות כי BCP עולה על כלי מתחרה. היתרון העיקרי של טכניקה זו על פני שיטות קיימות כמו CER הוא ש-BCP השתמשה בהתקדמות A העדכנית ביותר במודלים של סמנים נסתרים, כך שהיא מאפיינת טוב יותר את הניואנסים של ניתוח נתוני שבבים מאשר שיטות היוריסטיות קודמות. שיטה זו יכולה לסייע בשאלות מפתח בתחום האפיגנומיקה, כגון תפקידם של שינויים בהיסטו באמצעות אפיון דפוסי ההעשרה הרחבים של הגנום שלהם.
למרות ששיטת מטופל זו יכולה לספק תובנה לגבי ניתוח נתוני ChIP-seq, המסגרת הבסיסית עשויה להיות מיושמת גם על ניתוח נתוני ריצוף אחר של הדור הבא, כגון זיהוי אזורים שעברו מתילציה דיפרנציאלית בנתוני ריצוף סופי bis, מיקומי שעתוק חדשים ב-RNA-Seq, וריאציה של מספר עותק או כל מספר של נתוני אריחי מיקרו-מערך. הדגמה ויזואלית של שיטה זו היא קריטית להבנה ברורה של המתודולוגיה והיא מועילה לדברים. היתרונות התיאורטיים חבויים בתוך התוכנה.
כל השלבים הפרוצדורליים המוצגים כאן נארזו לקובץ הפעלה יחיד בחבילת התוכנה BCP, הזמינה להורדה בסרטון זה. השלבים המבוצעים על ידי התוכנית מתוארים להפעלת התוכנה. נדרשים שלושה פרמטרים.
קובץ המכיל קריאות ממופות באופן ייחודי מדגימת שבב וקובץ דומה לקריאות בקרת קלט, כמו גם שם קובץ פלט להכנת קבצי קלט לניתוח BCP. ראשית, יישר את הקריאות הקצרות המופקות מריצות ריצוף לגנום הייחוס המתאים באמצעות תוכנת יישור הקריאה הקצרה המועדפת. יש להמיר את המיקומים הממופים לנתונים הניתנים להרחבה של דפדפן שש העמודות או לפורמט BED, קו מופרד בכרטיסייה לכל קריאה ממופה המציין את מיקום ההתחלה של הכרומוזום, מיקום הסיום, שם הקריאה, הציון והגדיל.
הרחב את מיקומי השבב ומפת הקלט לאורך שבר שנקבע מראש. לדוגמה, גודל המקטע ממוקד במהלך עיכול אנזים או סוניקציה של ה-DNA, בדרך כלל בסביבות 200 זוגות בסיסים. לאחר מכן ספירת השברים נצברת בסלים סמוכים.
כברירת מחדל, גודל הסל מוגדר לאורך המקטע המשוער של 200 זוגות בסיסים. כל נקודות שינוי אפשריות בקבוצה של סלים עם ספירת סלים זהה תיפול ככל הנראה בגבולות החיצוניים ביותר. בהתאם לכך, לא סביר שנקודת שינוי תתרחש בגבול פנימי בין שני פחים עם אותה ספירת קריאה.
לכן, קבץ סלים סמוכים עם קריאות זהות לכל סל לבלוק יחיד. לאחר הכנת קבצי הקלט, הפעל את הערכת ה-BCP על ידי הקלדת הפקודה המוצגת בתחתית המסך. צפיפות הקריאה של כל בלוק מעוצבת כהתפלגות פואסון עם פרמטר ממוצע תטה בעקבות תערובת של התפלגויות גמא עם פרמטרי אלפא ובטא והסתברות מוקדמת להתרחשות נקודת שינוי בכל בלוק.
גבול P מתנה כל בלוק בדרך זו הופך למעשה מצב אינסופי מוסתר מודל מרקוב או HMM. הפרמטרים ההיפר אלפא, בטא ו-P מוערכים באמצעות סבירות אחורית מקסימלית. הערכות המפרצים מחושבות במפורש עבור כל בלוק תטא תת T כציפייה לתטא תת T בהתחשב בכך שסאב T המסננים המסורתיים יותר אך גוזלי זמן קדימה ואחורה המשמשים לעתים קרובות ב-HMS מוחלפים בקירוב תערובת המורכבות המוגבלת היעילה יותר מבחינה חישובית כדי להעריך את האמצעים האחוריים תטה כובע תת T. האמצעים האחוריים המתקבלים יוחלקו לפרופיל קבוע משוער של חתיכה, לכן יש לחסום בלוקים עם תת-כובע תטא זהה יחד עם קואורדינטות גבול מעודכנות.
BCP משתמש במספר קריאות הקלט לכל בלוק כקצב הרקע וקובע את ההעשרה. שימוש במבחן השערה פשוט המבוסס על האם הצפיפות הממוצעת של מיקום השבב עבור בלוק חורגת מסף מובהקות כלשהו. הקוונטיל ה-90 הוא סף ברירת המחדל והוא מתאים ברוב המקרים.
לאחר מכן BCP ממזג בלוקים סמוכים של צפיפות ממוצעת אחורית החורגים מההעשרה לאזור יחיד ומדווח על הקואורדינטות הממוזגות בדפדפן. פורמט נתונים מורחב BCP מצטיין בזיהוי אזורים של העשרה רחבה בנתוני שינוי היסטון. הנה. תוצאות BCP מושווים לאלו של cser, כלי קיים שהפגין ביצועים חזקים לפני עבודה ממעבדה זו שחקרה טרימתילציה של H 3 K 36 הדגימה נטייה לגודל אי גדול בהרבה ב-BCP מאשר CER.
איים גדולים יותר תואמים יותר את הציפייה המקובלת לאיים מפוזרים רחבים של העשרת טרימתילציה H 3 K 36. איים גדולים יותר אינם מעידים לבדם על דיוק. לכן, הקשר הידוע של איי טרימתילציה H שלושה K 36 עם גופי גנים מתועתקים באופן פעיל כמו גם הבלעדיות ההדדית שלהם עם איי טרימתילציה H 3 K 27 שימש להערכת הביצועים של BCP ו-CER בהשוואה ל-CER BCP הנקראים איים רציפים גדולים יותר הלוכדים טוב יותר גופי גנים מבלי להקריב חפיפה מוגברת עם H three K 27, איי טרימתילציה.
BCP שומר על החפיפה הגבוהה של גנים פעילים על ידי H three K 36 Trimethylation Islands עם גבולות הקשורים באופן הדוק לגופי גנים מבלי להגדיל את מידת החפיפה החיובית השגויה עם גנים בחלל בין-גניים עם שעתוק מודחק או סימן הדיכוי H three K 27 TRIMETHYLATION תוך הערכת יכולת השחזור של קריאות BCP Island בשני מערכי נתונים משוכפלים, נצפה כי BCP לא סבל מתלות כבדה בעומק כיסוי הקנה באלגוריתם המתחרה אלא עדות נוספת לחוסן ושחזור BCPS מסופקת על ידי בחינת אזורים מובחנים נוספים, המדגימים גבולות אי עקביים למרות עומק הכיסוי המופחת. כדי להדגים באופן מלא את הרבגוניות של BCP, הושג ספקטרום רחב של נתוני שינוי היסטון, כולל סימני הניקוב H שלוש K 27 אצטילציה, H שלוש K תשע אצטילציה, ו-H שלוש K ארבע טרימתילציה, והסימן המפוזר H שלוש K תשע טרימתילציה בנוסף ל-H שלוש K 27 טרימתילציה ו-H שלוש K 36 טרימתילציה. מערכי נתונים אלה נותחו באמצעות הגדרות הפרמטרים המוגדרות כברירת מחדל הן עבור BCP והן עבור CSER.
במרכז נמצאת העשרת טרימתילציה H שלוש K 36 בגן PX DN המסמן שעתוק פעיל הנופל באופן צפוי באתר התחלת השעתוק הם הסימנים הפעילים הנוספים H שלוש K 27 אצטילציה, H שלוש K תשע אצטילציה ו- H שלוש K ארבע טרימתילציה. ממש במורד הזרם של PXDN נמצא חלל בין-גני מודחק המסומן על ידי העשרת טרימתילציה H 3 K 27 בצד הנגדי שוכב גן מודחק H 3 K 27 TRIMETHYLATION. מתקדמים עוד צעד אחד החוצה.
הכרומטין המושתק שלנו כפי שמעיד על נוכחות העשרת טרימתילציה H 3 K תשע, מה שנראה כמצביע על השתקה של SN TG two ו-MYT אחד L, אולי במובן פחות חולף מאשר דיכוי טרימתילציה H 3 K 27. אזור זה מקיף את רוב התופעות שנתקלים בהן ב-ChIPseek של שינויים בהיסטונים. הוא ממחיש כיצד האופי הדינמי של BCP יכול לזהות גם אצטילציה מנוקבת וגם H שלוש K ארבעה סימני טרימתילציה, ובמקביל להבחין באיים רציפים גדולים של דיכוי טרימתילציה H שלוש K 27 ודיכוי טרימתילציה H שלוש K תשע, כמו גם שעתוק פעיל של H שלוש K 36
.ניתן לבצע אלגוריתם זה כ-30 דקות בהתאם למספר הקריאות ולתוצאת סימני הגנום. כל אופטימיזציה משמעותית כפי שנדרש לעתים קרובות בשיטות אחרות בעקבות הליך זה. ניתן לחקור חלבוני מטרה רבים ושונים של משקעים חיסוניים של כרומטין באמצעות BBCP כולל שינויים שונים אחרים בהיסון, כמו גם גורמי שעתוק קשירת DNA כדי לענות על שאלות נוספות על מנגנונים אפיגנומיים וויסות גנים.
לאחר צפייה בסרטון זה, אתה אמור להבין היטב כיצד BCP משמש לזיהוי אזורים בהישג יד לסימני חיסון מפוזרים בניתוח נתוני שבבים.
View the full transcript and gain access to thousands of scientific videos
מחקר זה מציג אלגוריתם Bayesian Change Point (BCP) המשפר את ניתוח נתוני רצף immunoprecipitation של כרומטין (ChIP-seq). על ידי שימוש במודלים מרקוביים מוסתרים, BCP מזהה ביעילות אזורים של העשרת היסטון בשני סוגי נתונים רחבים ומנוקדים.
The Bayesian Change Point (BCP) algorithm provides a unified, parameter-light approach to identifying enriched genomic regions across diverse ChIP-seq data types, from punctate transcription factor binding to diffuse histone modification islands. By reducing reliance on heuristic thresholds and model switching, BCP enhances reproducibility and cross-lab comparability in epigenomic target validation. This supports mechanistic de-risking in early discovery by delivering statistically grounded, quantitative read density profiles that inform target confidence and pathway analysis.
The BCP algorithm fits into the discovery continuum from raw sequencing data to biological insight, supporting hypothesis-driven target validation, reproducible epigenomic profiling, and data integration across early screening and preclinical validation stages.