$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
איכות וחיתוך המתאם שומרים על קריאות באיכות רצף גבוהה
טכניקות ריצוף בתפוקה גבוהה נוטות ליצור שגיאות ריצוף כגון 'מוטציות' רצף בקריאה. יתר על כן, ניתן להעשיר דימרים של מתאם רצף בערכות נתונים של רצף עקב הסרת מתאם לקויה במהלך הכנת הספרייה. שגיאות ריצוף מוגזמות, כגון מוטציות קריאה, יצירת קריאות קצרות מהנדרש למיפוי נכון והעשרה של דימרים מתאמים, יכולות להאריך את זמן מיפוי הקריאה ויכולות לייצר קריאות ממופות חיוביות כוזבות שמעוותות את תוצאות הניתוח הביואינפורמטי במורד הזרם. לכן, סינון איכותי וחיתוך מתאמים נדרשים כדי לשמור על קריאות באיכות גבוהה לצורך ניתוח ופרשנות במורד הזרם.
כדי לשמור על קריאות באיכות גבוהה לניתוח, צינור ניתוח CUT&RUN זה (איור 2) משתמש ב- FastQC26 וב- Trim Galore27. סקריפט המעטפת "Script_03_fastQC.sh" מפעיל FastQC עבור כל קבצי fastq בספריית העבודה. תוצאות (איור 3) של שלב זה באמצעות ערכת הנתונים CTCF CUT&RUN הזמינה לציבור מ-GSE126612 (SRR8581589) מזהות חלק מהקריאות עם בסיסי ניקוד באיכות נמוכה (איור 3A,C) וכמה דרגות של אי-התאמה של התפלגות תוכן GC לכל רצף בין אומדן תיאורטי לקריאות בפועל (איור 3E).
ביצוע סקריפט "Script_04_trimming.sh" להפעלת Trim Galore מסיר בהצלחה את הקריאות האלה עם בסיסי ניקוד באיכות נמוכה (מתחת ל-20 באיור 3A) ואיכויות רצף ממוצע נמוכות הניכרות לפני החיתוך (איור 3B-D). בנוסף, "Script_04_trimming.sh" גם מסיר בהצלחה 55~60% העשרת תוכן GC ממוצעת המוצגת בהתפלגות GC 'טרום חיתוך' על פני תרשים רצף (איור 3E,F). תוצאות אלה מראות כי צנרת ניתוח CUT&RUN זו מסננת עבור קריאות באיכות גבוהה כדי להקל על מיפוי קריאה מהיר ומדויק לגנום הייחוס.
הוספת התפלגות גודל יכולה לתת הערכה עבור תוצאות שיא של שיחות
עקב השימוש ב-MNase ב-CUT&RUN (איור 1), קריאות CUT&RUN ממופות צפויות להציג שיאי גודל מונו-(~200 bp) ודי-נוקלאוזומליים (~350 bp) בתוך חלקות התפלגות גודל גודל הכנסה (איור 4). בעיות בזיהוי עבור מטרות מסוימות עלולות לגרום לתוספות קצרות (< 100 bp) (איור 4C). רמה גבוהה של קריאות קצרות מפחיתה את מספר הקריאות שניתן להשתמש בהן לשיחות שיא ברמת ביטחון גבוהה, ובכך מפחיתה את מספרי השיא ומשפיעה על ניתוח במורד הזרם. בצינור ניתוח CUT&RUN זה, "Script_10_insert-size-analysis.sh" מפעילה את הפונקציה "picard.jar CollectInsertSizeMetrics" כדי לבצע את ניתוח התפלגות גודל ההוספה ולייצא היסטוגרמות כפלט תצוגה חזותית (איור 2). בתרשימי הפלט (איור 4A-C), ציר x מציג את טווח גודל ההוספה, הצד השמאלי של ציר y והיסטוגרמה עם מילוי מייצג את מספר התוספות עם הערך על ציר x, והצד הימני של ציר y מציג והקו המקווקו את החלק המצטבר של תוספות עם גודל הוספה שווה או גדול מהערך בציר x. לכן, הן המיקום על ציר ה-X עם השינוי הדרמטי ביותר בשיפוע הקו המקווקו שמצטלב עם רמת הגבוהים בהיסטוגרמה מזהה את גודל ההוספה העיקרי בדגימה. בין הקריאות שמופו על גנום הייחוס המעניין (אדם, hg19), מקטעי דגימה H3K27Ac (סימן היסטון פעיל) מציגים את התפלגות גודל ההוספה הצפויה של CUT&RUN עם הגודל המונו-נוקלאוזומלי הגבוה ביותר ופסגות גודל די-נוקלאוזומליות ניתנות לזיהוי (איור 4B). מקטעי דגימה של CTCF הראו קבוצות נוספות באזורים באורך של 100~200bp (איור 4A). בסך הכל, צינור הניתוח CUT&RUN מספק סקריפטים קלים לשימוש של מעטפת לביצוע ניתוח התפלגות גודל הוספה לאחר מיפוי קריאות בגנומי ייחוס. ניתוחים אלה הופכים חשובים כאשר מעריכים את היעילות של שיחות שיא לפני ניתוח במורד הזרם.
צינור ניתוח CUTnRUN של Easy Shells מספק אפשרויות סינון ונורמליזציה ליצירת ספירות קריאה אמינות
אחת הנקודות הקריטיות של ניתוח CUT&RUN היא להשיג זוגות קריאה ממופים כראוי על ידי סינון זוגות קריאה בעייתיים מפלטי המיפוי הראשוניים ונרמול ספירות הקריאה הממופות המסוננות עם שיטת חישוב נורמליזציה ספציפית שיכולה לענות על המטרות / הצרכים של ניתוח המשתמש. צינור הניתוח CUT&RUN שנדון במחקר זה כולל סקריפט "Script_07_filter-sort-bam.sh" להסרת זוגות קריאה הממופים על כרומוזומים לא קנוניים, אזורי רשימה שחורה מבוארים לציבור23, ו- TA חוזר על אזורים18,22 מזוגות קריאה שמופו על ידי עניבת פרפר2 באמצעות "Script_06_bowtie2-mapping.sh". הסינון הזה נדרש כדי להסיר זוגות קריאה, שיכולים לייצר אותות ספייק חריגים וחיוביים כוזבים, ונקראים שיאים בניתוח במורד הזרם (איור 5; אזורי קופסה צהובה).
בנוסף לסינון, יישום שיטת הנורמליזציה הנכונה הוא גורם חשוב כדי לדמיין את הפרש האות בין הדגימות במדויק. לכן, צינור הניתוח של CUT&RUN כולל סקריפטים של "Script_09_normalization_SFRC.sh" ו-"Script_09_normalization_SRPMC.sh" כדי לספק שתי שיטות נורמליזציה מאומתות באופן ציבורי - הקריאה החלקית בקנה מידה (SFRC)22 וקריאה מנורמלת של ספייק-אין למיליון קריאות ממופות בבקרה השלילית (SRPMC)24,25 (איור 5A-D). מכיוון ש-SFRC אינו כולל בקרה (לדוגמה, IgG) או דגימת ספייק-אין בנוסחה, ניתן להשתמש בנורמליזציה של SFRC עבור דגימות שאינן כוללות דגימת ביקורת כלשהי או צפויות להראות הבדלי אות באזורים מקומיים בלבד ללא הבדל בקנה מידה גנומי רחב. הדגימות המנורמלות של SFRC המעובדות על-ידי צינור הניתוח CUT&RUN (איור 5A-D; מסלולים אדומים) מייצרות את אותם דפוסי התפלגות אותות כמו קריאות ממופות זמינות לציבור מ-GEO (איור 5A-D; מסלולים שחורים), דבר המצביע על כך שצינור זה יכול לשחזר את תוצאות הפרסום.
שיטת SRPMC שימושית לנרמול דגימות הכוללות גם דגימות בקרה וגם דגימות ספייק-אין, וצפויות להראות הפרש אותות גלובלי בין דגימות (איור 5A-D; מסלולים ירוקים). מאחר שדגימת H3K27Ac אחת (SRR8581599) מציגה יחס גבוה בהרבה של "(קריאות CUT&RUN בפועל)/(קריאות ספייק-אין)" (RPS לדוגמה; 997) מאשר משכפלים אחרים (237, 175 ו-161), אותות H3K27Ac יחסיים נראים שונים בין העתקים בדגימות מנורמלות SFRC ו-SRPMC (איור 5A-D; H3K27Ac בהשוואה לכל המסלולים). דגימות RNAPII-S5P מציגות RPS מדגם נמוך יחסית (1.7, 0.8, 2.1) מאשר בקרת IgG (259), ולכן דגימות RNAPII-S5P מציגות אות נמוך יותר מאשר בקרת IgG לאחר נורמליזציה של SRPMC (איור 5A-D; RNAPII-S5P בהשוואה בכל המסלולים). לכן, צינור הניתוח CUT&RUN הנדון כאן ממליץ להשתמש בשיטת SRPMC רק עבור הדגימות שיש להן מספיק קריאות בדגימות ניסיוניות ביחס הן לבקרת IgG והן לקריאות בקרת ספייק-אין.
השוואת דיאגרמת חיתוך קבוצות (Venn) יכולה לתת רעיונות לבחירת שיטה ואפשרויות טובות יותר של שיחות שיא
תוכניות שיחות שיא מרובות מאפשרות זיהוי של תפוסת חלבונים מועשרת משמעותית ברחבי הגנום. תוכניות כאלה המשמשות לניתוח CUT&RUN כוללות תוכניות משפחתיות MACS2 ו- SEACR4 כשיטות עיקריות עד כה. עם זאת, זה יכול להיות מאתגר, במיוחד עבור מתחילים בביואינפורמטיקה, לזהות את שיטת קריאת השיא המתאימה ביותר ואת האפשרויות עבור פרויקט CUT&RUN נתון. לכן, צינור הניתוח CUT&RUN כולל שלבי ניתוח דיאגרמת חיתוך קבוצות (Venn) כדי לתת הזדמנות למשתמשים להשוות את הדמיון והשוני של תוצאות שיחות השיא בין אפשרויות שונות של שיחות שיא (אפשרויות Script_17_intervene) לבין תוכניות שיחות שיא (Script_19_intervene_methods.sh) (איור 6A-H).
על פי ההשוואה, פסגות CTCF, H3K27ac ו-RNAPII-S5P הממוזגות, הנקראות עם ובלי אפשרות בקרת IgG במהלך שלב קריאת שיא, MACS2 ו-MACS3 קראו ליותר פסגות עם אפשרות בקרת IgG (איור 6A), אך SEACR קרא ליותר פסגות ללא אפשרות בקרת IgG באפשרויות מחמירות ורגועות כאחד (איור 6B-D). לכן, צינור הניתוח של CUT&RUN מציע (1) להחיל את אפשרות בקרת IgG עבור MACS2 ו- MACS3, (2) לקרוא לשיאים עבור דגימות CUT&RUN ניסיוניות ודגימות בקרת IgG בנפרד, ולאחר מכן לסנן פסגות IgG מאוחר יותר עבור מתקשר השיא של SEACR. בין MACS2 ל-MACS3, MACS3 קרא מעט יותר פסגות (איור 6A).
יתר על כן, השוואה בין שיאים הנקראים על-ידי MACS2 ו-MACS3 עם אפשרות בקרת IgG לבין SEACR ללא אפשרות בקרת IgG מראה כי פסגות SEACR הנקראות עם האפשרות המחמירה חופפות לפסגות MACS 2 ו-MACS3 יותר מאשר פסגות SEACR הנקראות עם האפשרות הנינוחה (איור 6E,F). לפיכך, יציאות צינור הניתוח של CUT&RUN מצביעות על כך שהאפשרות המחמירה ממקסמת את עקביות SEACR עם קריאות שיא MACS. לבסוף, דיאגרמת חיתוך קבוצות (Venn) להשוואת החפיפה של פסגות הנקראות על-ידי SEACR עם נורמליזציה עבור קבצי CUT&RUN bedGraph של ספירות קריאה גולמיות וללא נורמליזציה עבור ספירות קריאה מנורמלות קבצי CUT&RUN bedGraph אינה מגלה הבדל בין שיטות SFRC ו- SRPMC עבור SEACR עם האפשרות המחמירה. פסגות SFRC מציגות מספרי שיא גבוהים בהרבה וחופפות טוב יותר עם פסגות אופציות מנורמלות ('נורמה' באיור 6) מאשר פסגות SRPMC עבור SEACR עם אפשרויות רגועות (איור 6G,H).
השוואות סטטיסטיות בין שכפולים למדגמים
הסקת מסקנות מדויקות על פני מספר עותקים משוכפלים דורשת הערכה של דמיון משוכפל. צינור הניתוח CUT&RUN המשמש כאן משתמש בחישוב מקדם מתאם סטטיסטי מבוסס Deeptools215, אשכולות מפת חום וניתוח רכיבים עיקריים (PCA) כדי להקל על זיהוי דגימות ושכפולים המתאימים לניתוח תקף במורד הזרם. אשכולות מפת חום המבוססים על מקדמי מתאם פירסון הראו מתאם מובהק סטטיסטית בין העתקים עבור CTCF, H3K27Ac ו-RNAPII-S5P באזורי השיא שלהם (איור 7A-C). אולם PCA הראה שדגימה אחת של CTCF (SRR8581590) ו-H3K27Ac (SRR8581608) ממוקמת רחוק יחסית מהעתקים אחרים (איור 7D) בכל אזורי CTCF, H3K27Ac ו-RNAPII-S5P שנקראים אזורי שיא.
על פי דיאגרמת Venn להשוואה בין פסגות בין עותקים משוכפלים, פסגות CTCF (SRR8581590) הראו הכי פחות חפיפה עם עותקים משוכפלים אחרים בכל שלוש תוצאות קריאת השיא (איור 7E-G), ופסגות H3K27Ac (SRR8581608) הראו הכי פחות חפיפה עם עותקים משוכפלים אחרים בתוצאות קריאת שיא SEACR (איור 7F). פסגות H3K27Ac (SRR8581608) לא הציגו חפיפה מינימלית עם עותקים משוכפלים אחרים בתוצאות קריאות שיא MACS2 ו-MACS3 (איור 7F), מה שעשוי להצביע על כך שהמרחק בין העותקים המשוכפלים ב-PCA אינו מספיק כדי להגדיר מדגם חריג. לכן, צינור הניתוח CUT&RUN מציע להגדיר שכפול חריג כ"מדגם המציג מקדם מתאם פירסון נמוך בקבוצת אשכולות מפת חום, מרחק רב בתרשים PCA עם משכפלים אחרים, וחפיפת שיא נמוכה ביותר בין משכפלים".
שיחות שיא מאפשרות תצוגה חזותית ופרשנות של נתוני CUT&RUN
צינור הניתוח CUT&RUN המפורט במחקר זה מעסיק שני סוגים של מתקשרי שיא הזמינים לציבור: משפחת MACS ו- SEACR. כדי למטב את התצוגה החזותית של פסגות שנקראות, צינור זה בוחר את סל האותות הגבוה ביותר כמרכז השיא עבור ניתוחי מפת חום ומטא-חלקה. כל פסגות CTCF, H3K27Ac ו-RNAPII-S5P שנקראו על-ידי מתקשרי השיא MACS3 ו-SEACR הראו דפוס התפלגות שיא חד יותר במרכז סלי האותות הגבוהים ביותר (איור 8A-F, חלקות 'ממוקדות') מאשר במרכז אזורי שיא שלמים (איור 8A-F, חלקות 'שלמות'). דגימות CUT&RUN שעובדו על-ידי Easy Shells צינור ניתוח CUTnRUN עם נורמליזציה של SFRC (איור 8 A-F, חלקות 'SFRC') מציגות דפוסי התפלגות אותות דומים לאלה של הדגימות המנורמלות של SFRC שזוגות קריאה ממופים גולמיים שלהם זמינים לציבור ב-GEO (איור 8A-F, חלקות 'ציבוריות') בפסגות שנקראות על ידי צינור הניתוח. לפיכך, צינור הניתוח CUT&RUN יכול לשחזר תוצאות פרסום בהצלחה.

איור 1: סכמה של הליך ניסויי CUT&RUN. CUT&RUN היא גישה מבוססת אנזימים לזיהוי אינטראקציות חלבון-דנ"א ברחבי הגנום. הליך CUT&RUN מתחיל בקשירת תאים (או גרעינים מבודדים) ל- Concanavalin A מצומדים לחרוזים מגנטיים כדי לאפשר בידוד ומניפולציה של מספרי תאים נמוכים לאורך כל ההליך. תאים מבודדים עוברים חדירה באמצעות חומר ניקוי עדין כדי להקל על החדרת נוגדן המכוון לחלבון המעניין. נוקלאז מיקרוקוקלי (MNase) הקשור לחלבון A או לתג חלבון A/G מוכנס לאחר מכן לתא החדיר. pA-MNase (או pAG-MNase) מגויס לנוגדן הקשור באמצעות תג חלבון A או חלבון A/G. ברגע ש-MNase ממוקם לאתרי המטרה, הנוקלאז מופעל לזמן קצר באמצעות החדרת סידן כדי לעכל את הדנ"א סביב חלבון המטרה. עיכול MNase גורם לקומפלקסים מונו-נוקלאוזומליים של חלבוני DNA. לאחר מכן הסידן עובר תצבית כדי לסיים את תגובת העיכול, ומקטעי דנ"א קצרים מעיכול MNase משתחררים מהגרעינים על ידי דגירה קצרה בטמפרטורה של 37 מעלות צלזיוס, ולאחר מכן נתונים לטיהור DNA, הכנת ספרייה וריצוף בתפוקה גבוהה1. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.

איור 2: סיכום סכמטי של צינור ניתוח CUT&RUN של Easy-Shell. צינור הניתוח CUT&RUN של Easy-Shell מתוכנן בשלושה חלקים עיקריים - (1) בקרת איכות ומיפוי של קבצי קריאה גולמיים (משמאל; סגול), (2) נורמליזציה של קריאות וספירות קריאה ממופות ושיחות שיא (מרכז; ירוק), ו-(3) אימות של קריאות ממופות ופסגות נקראות (מימין; ורוד). בכל שלב, מספר סקריפט המעטפת המתאים, תיאור קצר וכלי התוכנית המשמש בשלב זה (בסוגריים) מסופקים. חצים פשוטים מראים זרימות ישירות בין השלבים. צינור ניתוח CUT&RUN זה מספק שתי שיטות נורמליזציה של קריאה שיכולות לענות על הצרכים של משתמשים עם ובלי קריאות בקרה, תהליכי אימות רב-שכבתיים לזיהוי עותקים משוכפלים מתאימים לניתוח במורד הזרם, וזיהוי שיא ממוקד ליצירת מפת חום ממוקדת היטב ופלט metaplot. צינור ניתוח זה כתוב בסקריפטים פגזים קלים לשימוש באופן שלב אחר שלב כדי לספק למתחילים ביואינפורמטיקה את ההזדמנות ללמוד ולתרגל ניתוח נתונים בסיסי של CUT&RUN על ידי קריאה ועריכה של הסקריפטים עצמם. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.

תרשים 3: השוואה בין תוצאות בדיקת האיכות לפני לעומת חיתוך האיכות לאחר מכן. בחר פלט דוח בדיקת איכות מ- FastQC מציג את ההשפעה של חיתוך איכות באמצעות קריאות מ- SRR8581589 (GSM3609748, CTCF). התפוקות המוצגות כוללות: (A) ציון איכות בין בסיסים לפני החיתוך. (ב) אותה קריאה כמו א) לאחר החיתוך. (C) התפלגות ציוני האיכות על פני כל הרצפים לפני החיתוך. (D) אותה קריאה כמו C) לאחר החיתוך. (E) התפלגות GC על פני כל הרצפים לפני החיתוך. (ו) אותה קריאה כמו ה) לאחר החיתוך. ציון האיכות המינימלי בכל מיקום בקריאות הרצף (A, B) ואיכות הרצף הממוצע המינימלית (C, D) גדלים לאחר חיתוך איכות. יתר על כן, שלב זה יכול להפחית את ההבדל בין התפלגות ספירת GC תיאורטית לבין ספירת GC בפועל לכל בסיס בקריאות (E, F) על ידי הסרת זוגות קריאות בעלי יחס אי-התאמה בסיסי גבוה. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.

איור 4: הוספת ניתוח התפלגות גודל. הכנס היסטוגרמה בגודל עבור (A) CTCF, (B) H3K27Ac ו-(C) serine 5 phosphorylated RNA polymerase II (RNAPII-S5P). היסטוגרמות מציגות הבדלים יחסיים בהתפלגות גודל ההוספה בין דגימות. הקו המקווקו בהיסטוגרמה מייצג את החלק המצטבר של קריאות עם גודל הוספה גדול או שווה לערך בציר x. N: מספר הקריאות הייחודיות הממופות בהתאמה לכל דגימה לאחר סינון. FR: שברים. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.

איור 5: סקירה כללית לרוחב של דגימות CUT&RUN. קריאות ממופות CUT&RUN הזמינות לציבור מנורמלות על-ידי ספירת השברים המורחבת (SFRC) ללא סינון נוסף (רצועות שחורות), דגימות CUT&RUN המעובדות על-ידי Easy Shells צינור ניתוח CUTnRUN עם נורמליזציה של SFRC (מסלולים אדומים) ו-'Spike-in normalized Reads Per Million mappped reads in the negative Control (SRPMC; green tracks)' מוצגים ב-(A) אזור אשכול גנים של היסטון, ו-(B-D) שלושה אזורים אחרים עם פסגות CTCF, H3K27Ac ו-RNAPII-S5P הנקראות על ידי כל מתקשרי השיא MACS2, MACS3 ו-SEACR. קופסאות צהובות מדגישות את המיקום של אותות ספייק המסוננים במהלך שלב הסינון בצנרת הניתוח Easy Shells CUTnRUN. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.

איור 6: דיאגרמת חיתוך קבוצות (Venn) להשוואה בין שיאים שנקראים על-ידי מתקשרים שונים לשיאים לבין אפשרויות של שיחות שיא. (A) השוואה בין שיאים הנקראים על-ידי MACS2 ו- MACS3 עם וללא אפשרות קלט IgG במהלך שיחות שיא. (ב-ד) השוואה בין שיאים הנקראים על-ידי SEACR עם וללא אפשרות קלט IgG, אפשרויות 'מחמירות' ו'רגועות', ועם אפשרות נורמליזציה באמצעות קבצי זוגות קריאה גולמיים (B), ללא אפשרות נורמליזציה באמצעות קובצי ספירת קריאה מנורמלים של SFRC (C) או קבצי ספירת קריאה מנורמלים של SRPMC (D). (ה,ו) השוואה בין שיאים הנקראים על-ידי MACS2, MACS3 עם אפשרות קלט IgG ו-SEACR עם אפשרות מחמירה (E) או רגועה (F). (ז,ח) השוואה בין פסגות הנקראות על ידי SEACR ללא אפשרות קלט IgG ועם אפשרויות מחמירות (G) או רגועות (H). w/ IgG: פסגות שנקראות עם אפשרות קלט IgG. w/o IgG: פסגות שנקראות ללא אפשרות קלט IgG. נורמה: פסגות שנקראות עם אפשרות נורמליזציה. לא: פסגות שנקראות ללא אפשרות נורמליזציה. SFRC: שיאים הנקראים על-ידי קובצי readcounts שנורמלו על-ידי שיטת 'Scaled Fractional Count (SFRC)'. SRPMC: שיאים הנקראים על ידי קובצי readcounts מנורמלים על ידי 'Spike-in normalized Reads Per Million mappped reads in the negative Control (SRPMC)'. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.

איור 7: מתאם פירסון, ניתוח רכיבים עיקריים ודיאגרמת Venn כדי לאמת את הדמיון בין העותקים המשוכפלים. (A-C) אשכולות מפת חום עם ערכי מקדם מתאם פירסון מציגים את מידת הדמיון בין עותקים משוכפלים בפסגות הנקראות MACS2 (A), MACS3 (B) ו- SEACR (C). מקדם המתאם של פירסון הוא בערך בין -1 ל-1. ערך מקדם מתאם פירסון מוחלט גדול יותר מצביע על מתאם חזק יותר בין שני משתנים, וערך מקדם מתאם פירסון חיובי מצביע על מתאם חיובי, כאשר שני המשתנים נעים באותו כיוון. לכן, דגימות עם דמיון גבוה יותר מציגות אילן יוחסין קרוב יותר באשכולות מפת חום וערך מקדם פירסון גבוה יותר. (D) ניתוח רכיבים ראשי (PCA) מציג את מידת הדמיון בין עותקים משוכפלים ודגימות בכל אזורי השיא CTCF, H3K27Ac ו-RNAPII-S5P הנקראים MACS2 (משמאל), MACS3 (במרכז) ו-SEACR (מימין). דגימות עם דמיון גבוה יותר ממוקמות קרוב יותר זו לזו בתרשים PCA. (ה-ג) ניתוח דיאגרמת חיתוך קבוצות (Venn) כדי להשוות את הפסגות שנמצאו בכל שכפול על-ידי MACS2 (E), MACS3 (F) ו-SEACR (G). צינור ניתוח CUT&RUN של Easy-Shell הציע ליישם את כל שלוש השיטות לזיהוי שכפולים בעלי דמיון גבוה שעשויים להתאים למיזוג הפסגות הנקראות לניתוח במורד הזרם. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.

איור 8: מפת חום והדמיית מטא-תרשים של התפלגות אותות בשיאים. מפת חום ומטא-חלקות מציגות התפלגות של העשרה סביב מרכזי שיא הנקראים באמצעות קוראי שיא שונים. (א,ב) פסגות CTCF CUT&RUN נקראות מהעתק אחד (SRR8581589) על ידי MACS3 (A) ו- SEACR (B). (ג,ד) פסגות H3K27Ac CUT&RUN נקראות מהעתק אחד (SRR8581607) באמצעות MACS3 (C) ו-SEACR (D). (ה,ו) פסגות RNAPII CUT&RUN נקראות מהעתק אחד (SRR8581589) על ידי MACS3 (E) ו- SEACR (F). זוגות הקריאה הממופים הזמינים לציבור ('ציבורי' באיור 8) והקטעים שמופו על-ידי צינור הניתוח CUTnRUN של Easy Shells ('SFRC' באיור 8) מושווים לאחר נורמליזציה של 'ספירת שברים בקנה מידה (SFRC)'. פסגות נקראות על-ידי MACS3 עם אפשרות קלט IgG ('MACS3 w/ IgG' באיור 8) ו-SEACR ללא קלט IgG וללא אפשרות נורמליזציה באמצעות קובצי ספירת קריאה מנורמלים של SFRC במצב מחמיר ('SEACR w/o IgG non SFRC stringent' באיור 8). מכינים שתי גרסאות של קובצי קואורדינטות של הפסגות שנקראות: מההתחלה ועד הסוף של הפסגות שנקראות ('שלם' באיור 8) והמיקום של הסל עם האות הגבוה ביותר בתוך הפסגות שנקראות (פסגות ב-MACS3 שנקראות פסגות; 'ממוקד' באיור 8). אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.
טבלה 1: מידע עבור קובצי fastq של CUT &RUN ב- GSE126612. כל קבצי ה- fastq הגולמיים הנקראים CUT&RUN הכלולים ב- GSE126612 ונבחרים כערכת נתונים לדוגמה עבור Easy Shells צינור ניתוח CUTnRUN מפורטים כטבלה. העמודה 'שם קובץ' מציגה שמות קבצים של קבצי fastq גולמיים של CUT&RUN שיוצגו ב- '~/Desktop/GSE126612/fastq' לאחר הפעלת 'Script_02_download-fastq.sh'. 'md5sum' משתף MD5 (Message-Digest Algorithm 5) עבור ערכת הנתונים לדוגמה, אשר ניתן להשתמש בה כדי לאמת את שלמות הקבצים לאחר הורדת ערכת הנתונים באמצעות הפעלת 'Script_02_download-fastq.sh'. העמודה האחרונה מתארת יעד של CUT&RUN לכל דגימה. אנא לחץ כאן כדי להוריד טבלה זו.