מאמר שיטה

אלגוריתמים של קריאת שיא (WonderPeaks ו-PeakStream) ככלים לשיפור ChIP-seq וניתוח טרנסקריפטומי בפתוגנים פטרייתיים

DOI:

10.3791/68301

8 באוגוסט 2025

במאמר זה

סיכום

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

דוח זה מציג את WonderPeaks, כלי חישובי חדשני לניתוח נתוני RNA-seq ו-ChIP-seq. כלי זה מזהה בהצלחה שיאים (קריאת ערימות) בנתוני ריצוף, ומאפשר אפיון של גבולות אזורים לא מתורגמים ב-RNA-seq וזיהוי העשרת כרומטין ב-ChIP-seq, ומספק תובנות חשובות לחקר פתוגנים פטרייתיים.

תקציר

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

אפיון שינויים בביטוי גנים באמצעות טרנסקריפטומיקה ופעילות מווסת שעתוק הפך לגישה בסיסית להבנת התגובות המגוונות הכרוכות בפתוגנזה פטרייתית. מאמר זה מציג שני כלים חישוביים שנועדו להתמודד עם אתגרים מרכזיים בחקר ויסות שעתוק בפתוגנים פטרייתיים, במיוחד שאינם מודלים עם הערות גנומיות מוגבלות. ראשית, אנו מציגים את WonderPeaks, אלגוריתם חדשני לקריאת שיא הממנף את הנגזרת הראשונה של נתונים גנומיים ממופים מניסויי ריצוף מהדור הבא (NGS) כדי לזהות שיאים מועשרים ב-Chromatin ImmunoPrecipitation ואחריו ריצוף (ChIP-seq). שנית, אנו מציגים את PeakStream, הרחבה של WonderPeaks לביאור אזורים לא מתורגמים של 3' (UTRs) בנתונים טרנסקריפטומיים שנוצרו באמצעות הכנת ספרייה פולי(A)-primed. יחד, כלים אלה מספקים צינור ניתוח נתונים מקצה לקצה, המציע פתרון ידידותי למשתמש לחוקרים החוקרים ויסות שעתוק בפטריות. אנו מדגימים את יעילותם עם נתונים מהפתוגן הפטרייתי קנדידה אלביקנס, זיהוי מוצלח של שיאים מאומתים בנתוני ChIP-seq והערות UTRs מאומתים באמצעות השוואה עם נתוני ריצוף RNA כוללים באותם תנאים. אנו דנים גם במגבלות של WonderPeaks עבור נתוני ChIP-seq בהשוואה לשיטות המתקדמות הנוכחיות ומציעים כיוונים לשיפורים עתידיים. בסופו של דבר, עבודה זו מספקת הדרכה מעשית ומשאבים רבי עוצמה לחקר ויסות שעתוק, עם רלוונטיות מיידית לפטריות פתוגניות ויישומים פוטנציאליים במחקרים גנומיים רחבים יותר.

מבוא

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

פתוגנים פטרייתיים הם דאגה בריאותית עולמית מתפתחת, עם עלייה בזיהומים בשנים האחרונות1. רבים מהפתוגנים הללו מציגים עמידות גבוהה נגד פטריות וקשורים לשיעורי תמותה משמעותיים2. עם זאת, בהשוואה לאורגניזמים פטרייתיים מודלים, פטריות פתוגניות רבות מאופיינות בצורה גרועה, מה שמדגיש את הצורך במחקר נוסף על מנגנוני הפתוגניות שלהן. טכניקות ריצוף מהדור הבא (NGS) כמו ריצוף כרומטין אימונו-משקעים (ChIP-Seq) וריצוף RNA (RNA-Seq) ממלאות תפקיד קריטי בחשיפת המנגנונים המולקולריים של ביטוי גנים העומדים בבסיס פתוגניות פטרייתית.

איכות התובנות הנגזרות מנתוני NGS תלויה מאוד בדיוק התוכנה המשמשת לניתוח נתונים גולמיים. בין האתגרים העיקריים לניתוח נתוני NGS הוא קריאת שיא - זיהוי מדויק של אזורים של קריאות NGS מועשרות - שהוא מורכב במיוחד בשל המגוון הרחב של טכניקות הכנת ספרייה וריצוף, מה שהופך פתרון אוניברסלי לבלתי מעשי. אלגוריתם MACS3, כולל הגרסה העדכנית יותר שלו, MACS3, נחשב לתקן הזהב לניתוח מערכי נתונים של ChIP-seq. עם זאת, MACS מסתמך על פרמטרים המוגדרים על ידי המשתמש - כגון אורך שיא מינימלי ופער מקסימלי - שעשויים שלא להיות ישימים באופן אוניברסלי ולעתים קרובות קשה לקבוע אותם לפני הניתוח. יש לציין כי המהדורה האחרונה של MACS3 כוללת תכונת ניתוח ניתוק המאפשרת למשתמשים להעריך פרמטרים לפני שיחות שיא. לביצועים משופרים, משתמשים יכולים גם לספק רשימה של אזורים גנומיים "ברשימה השחורה" הידועים כמציגים הטיה עקב מבנה הכרומטין או שונות במספר העותקים. בעוד ש-MACS נותר הכלי הנפוץ והמהימן ביותר לשיחות שיא עבור נתוני ChIP-seq, מעט אלגוריתמים חלופיים זמינים, במיוחד עבור מקרים הדורשים הגדרות פרמטרים מותאמות במיוחד.

RNA-Seq היא טכניקה שלא תסולא בפז לחקר תגובות ביטוי הגנים של פטריות פתוגניות במהלך צמיחה in vivo, כגון בתרבית רקמות או במודלים של זיהום עכברים 4,5,6,7. נדרש עומק ריצוף גבוה לניתוח ביטוי דיפרנציאלי מדויק בתנאים אלה, שיכול להיות חסין עלות ומשאבים 8,9. שיטות הכנת ספרייה כמו ריצוף פולי-אדנילציה (poly(A))-priming (3'RNA-Seq), המשתמשת בפריימרים שנועדו לחישול לזנבות הפולי (A) של mRNA ליצירת cDNA, יכולות לעזור להפחית את עומק הריצוף הדרוש לניתוח ביטוי גנים10. עם זאת, גישה זו מסתמכת על הערות גנום באיכות גבוהה, במיוחד של 3' אזורים לא מתורגמים (UTRs), שבהם שיאים מאירועי תחול פולי (A) ממוקמים בדרך כלל11. הערות הגנום של פתוגנים פטרייתיים רבים שלא נחקרו חסרים הערות UTR, מה שמקשה על השימוש ב-3'RNA-Seq באורגניזמים אלה. בנוסף, אורך ה-UTR עבור גן בודד יכול להיות דינמי על פני תנאי גידול שונים וסוגי תאיםשונים 12,13. בעוד שמספר כלי ניתוח חדשים פותחו כדי לזהות ולבאר UTRs, רבים מהם מיועדים למערכי נתונים של יונקים, שארגון הגנים שלהם שונה מאוד מזה של פטריות, או דורשים נתונים מניסויי ריצוף עצמאיים, כגון ריצוף mRNA של תא בודד או הפוך, שיכולים להגדיל את הזמן והעלויות עבור חוקר המעוניין לבצע ניתוח טרנסקריפטום12, 14,15.

במאמר זה, אנו מציגים את WonderPeaks, תוכנה חדשה לקריאת שיא, שתוכננה על פי העקרונות של הנגזרת הראשונה, שניתן להשתמש בה כדי לקרוא באופן דינמי לשיאים במערכי נתונים של NGS (איור 1). WonderPeaks מזהה פסגות על ידי חישוב הנגזרת הראשונה של אות הכיסוי ושימוש בערך זה - שיפוע השיא - כדי להגדיר פסגות פוטנציאליות. האלגוריתם מחפש מקרים שבהם הנגזרת הראשונה מציגה מקסימום מקומי מעל סף שיפוע שסופק על ידי המשתמש או מוסק נתונים (המציין אות עולה), ואחריו מינימום מקומי מעל אותו סף (המציין אות יורד), ובכך מזהה את כל שיאי המועמדים במערך הנתונים. עבור יישומי ChIP-seq, WonderPeaks משווה את כל הפסגות המועמדות בין דגימות בדיקה ובקרה כדי לזהות פסגות מועשרות באופן ייחודי. על ידי יישום WonderPeaks על מערך נתונים ChIP-seq שפורסם בעבר של גורם שעתוק בפתוגן הפטרייתי קנדידה אלביקנס16, הדגמנו את יכולתו לזהות בהצלחה פסגות במעלה הזרם של גנים מרכזיים שהודגשו במחקר המקורי, תוך דיון במגבלות הנוכחיות של האלגוריתם ביישום זה.

אנו מציגים גם את PeakStream, כלי תוכנה הממנף את WonderPeaks כדי לזהות שיאים במערכי נתונים של 3'RNA-Seq. ספריות 3'RNA-Seq תלויות בהערות UTR מדויקות של 3', שכן קריאות שנוצרות באמצעות תחול פולי (A) מתרחבות לעתים קרובות מעבר לקודון העצירה של רצפי הקידוד (CDS) של גנים ולכן אינן נספרות בעת שימוש בהערות סטנדרטיות המתמקדות אך ורק באזורי קידוד. צינור הניתוח של PeakStream תוכנן ליצור הערות גנום חדשות באמצעות נתוני RNA-Seq 3', תוך התמקדות באזורים במורד הזרם של אזורי רצף קידוד גנים (CDS). PeakStream מקצה את הפסגות הללו לגנים, ויוצר הערת גנום חדשה לשימוש בתוכניות ספירת קריאה במורד הזרם. אנו מראים שהשימוש ב-PeakStream יכול לזהות ולהקצות במדויק פסגות שנוצרו על ידי פולי (A) במורד הזרם לגן המתאים במערך נתונים של 3'RNA-Seq C. albicans . PeakStream גם מבאר פסגות שסביר להניח שלא יהיו קשורות להערות גנים נוכחיות, מה שמקל על גילוי תעתיקים חדשים אפשריים. יחד, PeakStream ו-WonderPeaks מייצגים חבילה רבת עוצמה של כלים ידידותיים למשתמש לזיהוי שיא במערכי נתונים של ריצוף מהדור הבא (NGS).

figure-introduction-1
איור 1: נתון סקירה של קריאת שיא על ידי WonderPeaks ו-PeakStream. משמאל: שיא קריאה באמצעות הנגזרת הראשונה. מימין למעלה: שיחות שיא במערכי נתונים של ChIP-Seq באמצעות WonderPeaks. מימין למטה: שיחות שיא במערכי נתונים של RNA-Seq באמצעות PeakStream. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. התקנה (דלג אם הושלם)

  1. דרישות מוקדמות
    1. התקן את Anaconda או Minconda כדי לטעון דרישות להפעלת עיבוד מקדים (סעיף 5) ו-WonderPeaks (סעיף 6 או סעיף 7).
      הערה: למדריך למשתמש עבור אנקונדה, עיין בהפניה16.
    2. התקן את Python: Python בתוך Anaconda או Miniconda.
    3. התקן את Jupyter Notebooks כדי לבצע את כל הפונקציות בשיטה זו.
      הערה: מדריך למשתמש למתחילים עבור מחברות Jupyter ניתן למצוא בהפניה17.
      התראה: עבור גנומים פטרייתיים (≤100 Mbp), הקפידו על סביבת מחשוב עם לפחות 20 ליבות, 8 GB של זיכרון RAM ו-30 GB של שטח דיסק זמין.
  2. התקן פונקציות עיבוד מקדים.
    1. בטרמינל, בצע: conda create -n WP_preprocessing
    2. בטרמינל, בצע: conda activate WP_preprocessing
    3. בטרמינל, בצע: conda env update --file environment.yml --name
      הערה: ה-environment.yml הוא קובץ המכיל את כל יחסי התלות של החבילה ויש להוריד אותו מ-https://github.com/mgarber21/WonderPeaks_preprocessing.git.
    4. בטרמינל, בצע: pip התקן עיבוד מקדים של WonderPeaks
    5. בטרמינל, בצע: conda deactivate WP_preprocessing
  3. התקן פונקציות WonderPeaks:
    1. בטרמינל, בצע: conda create -n WonderPeaks
    2. בטרמינל, בצע: conda הפעל את WonderPeaks
    3. בטרמינל, בצע: conda env update --file environment.yml --name
      הערה: ה-environment.yml הוא קובץ המכיל את כל יחסי התלות של החבילה ויש להוריד אותו מ-https://github.com/mgarber21/WonderPeaks.git.
    4. בטרמינל, בצע: pip התקן את WonderPeaks
    5. בטרמינל, בצע: conda השבת את WonderPeaks
      הערה: שלבים 1.2 ו-1.3 משיגים את הדברים הבאים: הם יוצרים סביבת Conda ייעודית לעיבוד מקדים (סעיף 5) ו-WonderPeaks (סעיפים 6 ו-7), ומבודדים תלות כדי למנוע התנגשויות עם תוכנות אחרות. הם מפעילים את הסביבה, מגדירים אותה להתקנה והפעלה של פונקציות ספציפיות WP_preprocessing או WonderPeaks. הם מתקינים את תלות התוכנה והכלים הנדרשים לעיבוד מקדים של הנתונים. הם משביתים את הסביבה כאשר אינם בשימוש כדי למנוע שינוי מקרי ולשחרר משאבי מערכת.
  4. הורד מחברות ותבניות Jupyter ממאגר WonderPeaks GitHub. העלה את ההורדות של WonderPeaks למערכת ההפעלה המכילה את הנתונים הגולמיים (הספרייה תיווצר בסעיף 2).
    הערה: מחברות Jupyter מכילות סקריפטים ותבניות כתובות מראש הנחוצות להפעלת תהליכי עבודה של עיבוד מקדים, WonderPeaks ו-PeakStream. העלאתם לאותה מערכת כמו הנתונים הגולמיים מבטיחה שהנתיבים והספריות מיושרים כהלכה.

2. צור ספריית נתונים

הערה: זרימות עבודה של WonderPeaks ו-PeakStream דורשות שכל הנתונים (גולמיים ומעובדים) יאוחסנו באותה ספרייה. שלב זה מסביר כיצד ליצור ספרייה חדשה זו ({data_directory} = /path/to/your/data) וכיצד להעביר נתונים גולמיים ניסיוניים (קריאות רצף לא מעובדות) לתיקיה בתוך ספרייה זו הנקראת raw_data.

  1. יצירת ספריית נתונים.
    1. בטרמינל, מפעילים את mkdir {data_directory} (למשל mkdir /path/to/your/data)
  2. צור ספריית משנה של נתונים גולמיים עבור קריאות רצף לא מעובדות.
    1. בטרמינל, מפעילים את mkdir {data_directory}/raw_data (למשל mkdir /path/to/your/data /raw_data)
  3. העבר את קריאות הרצף הלא מעובדות לספריית הנתונים הגולמיים.
    1. בטרמינל, הפעל mv {current_path_to_raw_data}/*fastq* {data_directory}/raw_data (למשל mv current/data/path/*fastq* /path/to/your/data /raw_data

3. צור את קובץ קלט המשתמש (NGS_user_input.csv)

הערה: קובץ הקלט מציין את התצורות שנוצרו על-ידי המשתמש להפעלת עיבוד מקדים ו-WonderPeaks.

  1. הורד את NGS_user_inputs.csv התבניות ממאגר WonderPeaks GitHub.
  2. עדכן שדות ב NGS_user_inputs.csv. עדכן את השדות באופן הבא:
    ספריית נתונים: /path/to/your/data
    ספריית הגנום: /path/to/your/genome
    גנום מהיר: genome.fasta
    ביאור גנום: genome_annotation.gtf (ספק את שם הקובץ של ביאור הגנום בפורמט GTF)
  3. שמור NGS_user_inputs.csv מעודכן בספריית הנתונים שנוצרה בסעיף 2.
    התראה: אל תשנה את שם הקובץ; WonderPeaks יזהה את הקובץ הזה רק אם הוא נקרא NGS_user_input.csv.

4. צור קובץ מטא נתונים (NGS_user_metadata.csv)

הערה: קובץ המטא נתונים משמש לאחסון כל מידע רלוונטי לניסוי. ניתן להוסיף עמודות נוספות לתיאור תנאי הניסוי, אך אלה לא ישפיעו על השלבים הבאים.

  1. הורד את NGS_user_metadata.csv התבניות ממאגר WonderPeaks GitHub.
  2. עדכון שדות ב NGS_user_metadata.csv השדות הם כדלקמן:
    1. קובץ: ודא ששם הקובץ אינו כולל רווחים, כולל את נקודת האחיזה של הקובץ (לדוגמה, fastq , fastq.gz) ואינו כולל את הנתיב המוחלט.
    2. bedgraph: ציין אם יש לכלול את הקובץ ב- PeakStream על-ידי הגדרת שדה זה ל- TRUE או ל- FALSE.
      1. הגדר את שדה ה-bedgraph ל-FALSE כאשר ניתן לא לכלול את הקובץ באופן סביר בניתוח PeakStream. לדוגמה, בניסוי RNAsec, הגדר את פרמטר ה-bedgraph bedgraph=FALSE עבור מוטציות או מקרים אחרים שבהם לא צפויים הבדלי UTR בין דגימות. עם זאת, הקפד להגדיר את שדה ה-bedgraph ל-TRUE עבור כל קבצי הבקרה בניסוי RNAseq ועבור כל הקבצים בניסוי ChIPsec.
    3. גורם עיצוב
      1. designfactor1: ציין גורם עיצוב רלוונטי לתכנון הניסוי (למשל, טיפול או sample_type).
      2. designfactor2: ציין גורם עיצוב שני הרלוונטי לתכנון הניסוי (למשל, מתח או אפיטופ). עבור ניסוי RNAseq, כלול טיפול ומתח כגורמי עיצוב אופייניים. עמודת הטיפול מפרטת את הטיפולים המיושמים (למשל, בקרה, תרופה 1), ועמודת הזן מפרטת מידע על הזן (למשל, סוג בר, מוטציה). עבור ניסוי ChIPsec, כלול sample_type ואפיטופ כגורמי עיצוב אופייניים. העמודה sample_type מפרטת אם החלבון תויג או לא מתויג, ועמודת האפיטופ מפרטת את שם האפיטופ בו נעשה שימוש.
        הערה: גורמי עיצוב הם תכונות ספציפיות לתכנון הניסוי.
        WonderPeaks תואם לפקדים לא מתויגים או לפקדי קלט כקו הבסיס.
      3. ודא שעמודות גורם העיצוב אינן כוללות מספר שכפול ייחודי (לדוגמה, sample_type: [tagged, tagged, untagged_control, untagged_control] ולא sample_type: [tagged_1, tagged_2, untagged_control _1, untagged_control _2]. מתן מספרי שכפול ייחודיים יגרום לשגיאה במהלך הריצה.
      4. הקפד להשתמש בקו תחתון (_) במקום ברווחים בשמות של גורמי עיצוב.
      5. עבור יישום ChIPsek, ודא שהעמודה sample_type (או שם מותאם אישית) בקובץ המטה-נתונים כוללת מונחים המכילים מילים תג ופקד.
        הערה: לדוגמה, ערכים חוקיים יכולים לכלול תיוג ו-untagged_control. מתן עמודת sample_type ללא תנאים אלה יגרום לשגיאה במהלך ההפעלה.
        התראה: עבור יישום ChIP, על המשתמש לציין שני גורמי עיצוב.
      6. הוסף גורמי עיצוב לשורת NGS_user_inputs.csv הרלוונטית. ודא ששמות העמודות המשמשים לגורמי עיצוב רשומים כמחרוזת מופרדת באמצעות נקודה-פסיק (למשל, טיפול; מתח או sample_type; אפיטופ).
        התראה: גורמי העיצוב ב-NGS_user_inputs.csv חייבים להתאים בדיוק לעמודות של NGS_user_metadata.csv. כל ריצה לא תואמת תגרום לשגיאה במהלך הריצה (איור 2, טבלה משלימה S1 וטבלה משלימה S2).

figure-protocol-1
איור 2: דוגמה NGS_user_input.csv ו-NGS_user_metadata.csv. דוגמאות ל- NGS_user_input.csv (החלונית העליונה) ו- NGS_user_metadata.csv (החלונית התחתונה), המדגישות את ההתאמה בין העמודות DesignFactor ו- DesignFactor עם טקסט וחצים ורודים או כחולים. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

5. עיבוד מקדים של נתוני NGS

הערה: דלג לסעיף 5 או לסעיף 6 אם אתה משתמש בעיבוד מקדים מותאם אישית.

  1. פתח את מחברת Jupyter לעיבוד מקדים של NGS (NGS_Preprocessing.ipynb).
  2. הפעל WP_preprocessing הסביבה (שנוצרה בשלב 1.2) בפינה הימנית העליונה של ממשק המחברת.
  3. הפעל את התא הראשון על-ידי החזקת מקש Shift לחוץ ולאחר מכן הקשה על Enter (Shift+Enter).
  4. בתא השני של מחברת Jupyter, עדכן את נתיב הספרייה על ידי הגדרת הספרייה = "path/to/your/data", כאשר path/to/your/data/ היא הספרייה שנוצרה בסעיף 2.
  5. צור קבצי יישור. פונקציות העיבוד המקדים יבצעו חיתוך באמצעות FastP18; בקרת איכות באמצעות FastQC19 ו-MultiQC20; יישור באמצעות STAR21. קבצי יישור הפלט נשמרים בספריית משנה בשם startout בתוך ספריית הנתונים (למשל, path/to/your/data/starout); סינון (optional) באמצעות תצוגת samtools 22, סנן את קובץ היישור כדי לשמור רק על קריאות מעל סף שצוין ב-NGS_user_inputs.csv.
    הערה: פונקציות אלה יעבדו רק קריאות בודדות (למשל, R1) של מערך הנתונים בכל פעם. משתמשים יכולים לציין אפשרויות הפעלה עבור FastP ו-STAR NGS_user_inputs.csv (למשל, FastP: adapter_sequence (אופציונלי); STAR: genomeDir, genomeFastaFiles, sjdbGTFfil).
  6. בצע פונקציות עיבוד מקדים בתא השני באמצעות Shift + Enter.
    הערה: השלמת משימות בתא השני עשויה להימשך מספר שעות. אם הריצה מופסקת, חזור על שלבים 5.3-5.6 כדי להפעיל מחדש את הריצה. התקדמות מהשלבים הקודמים לא תוחלף, והתהליך ימשיך מהמקום שבו הפסיק.
  7. צור עקבות files של כיסוי היישור באמצעות BamCoverage23 (ראה שלבים 5.7.1 ו-5.7.2).
    הערה: עבור ChIPseq, WonderPeaks דורש קבצי גרף יחיד המכילים כיסוי לקריאה קדימה ואחורה. עבור RNAseq עם תחול Poly(A), PeakStream דורש שני קבצי bedgraph, אחד לקריאה קדימה (_fwd.bedgraph) ואחד לקריאה הפוכה (_rev.bedgraph). קריאות קדימה ואחורה נוצרות באמצעות הפרמטר filterRNAstrand בתוך BamCoverage23.
    1. ChIPseq באמצעות הפרמטרים הבאים: outfilfeformat="bedgraph", strand=None, binsize=20, smoothLength=60, minMappingQuality=255, normalizeUsing="CPM".
      הערה: פלט: מייצר גרף מיטה יחיד files המכילים כיסוי לקריאה קדימה ואחורה. הפלט מאוחסן ב-/path/to/your/data/bedgraphout (איור 3).
      1. בצע את הפונקציה BamCoverage בתא השלישי באמצעות Shift + Enter.
    2. RNAseq באמצעות הפרמטרים הבאים: outfilfeformat="bedgraph", strand="forward" או "reverse", binsize=20, smoothLength=60, minMappingQuality=255, normalizeUsing="CPM".
      זהירות: הקפד לבצע את הפונקציה פעמיים כאשר הגדיל מוגדר קדימה או אחורה כדי ליצור קבצים לקריאה בשני הכיוונים.
      הערה: פלט: מייצר שני קבצי bedgraph: אחד לקריאה קדימה (_fwd.bedgraph) ואחד לקריאה הפוכה (_rev.bedgraph). הפלט מאוחסן ב-/path/to/your/data/ bedgraphout (איור 3).
      1. בצע את הפונקציה BamCoverage בתא השלישי באמצעות Shift + Enter.

figure-protocol-2
איור 3: ארגון קבצים עבור WonderPeaks. צילום מסך של תיקיית הנתונים עם קבצי ה-bedgraph בספרייה bedgrapghout/normalizeUsingCPM. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

6. WonderPeaks עבור ChIPseq

  1. בדיקה מוקדמת
    1. ודא שכל קבצי ה-bedgraph עם filehandle .bedgraph נמצאים בתת-ספרייה בתוך ספריית הנתונים הנקראת bedgraphout (איור 3).
    2. ודא שגורמי עיצוב בקובץ user_inputs (NGS_user_inputs.csv) (איור 2) תואמים לעמודות בקובץ המטה-נתונים (NGS_user_metadata.csv) ושהשורות של עמודות designfactor אינן ייחודיות (ראה זהירות בשלב 4.2.4).
  2. פתח את מחברת Jupyter לעיבוד מקדים של NGS (WP4ChIP.ipynb).
  3. הפעל את WonderPeaks (סביבה שנוצרה בשלב 1.3) בפינה הימנית העליונה של ממשק המחשב הנייד.
  4. בצע את התאים באמצעות Shift+Enter עד לנקודת העצירה כדי להפעיל שיחות שיא. לאחר סיום, תיעוד של הנתונים המעובדים יישמר ויאוחסן בספריית משנה בתוך ספריית הנתונים הנקראת WonderPeaks
    1. חפש WOnder_init.csv: שרשור של כל הכיסוי הגולמי והתוצאות מחישוב הנגזרת הראשונה.
    2. הערה WOnder_unfiltered_peaks.csv: שרשור של כל הפסגות הלא מסוננות הנקראות על סמך הנגזרת הראשונה.
    3. שימו לב bedgraph_summary.csv: סיכום של סטטיסטיקת הציונים לאחר קיבוץ כל קובץ וכרומוזום.
  5. הגדר פרמטרי הפעלה:
    1. הפעלאת התא הראשון מתחת לנקודת השבירה של הסימון.
      הערה: תופיע תרשים המציג את הנתונים הגולמיים המופרדים לפי גורמי העיצוב שצוינו וטבלה המציגה את גורמי העיצוב; השתמש בטבלה ובתרשים כדי לקבוע ערכים בשלבים הבאים (איור 4).
    2. בתא הבא, ציין את הערכים עבור score_cut, fold_change ו-designfactor (איור 4).
      1. score_cut הוא ערך הסף המשמש כדי לקבוע אם יש לקחת בחשבון שיא בפלט. כדי לקבוע את score_cut, התבונן בתרשים ובחר ערך קרוב לחציון של הנתונים המתויגים (ראה קו מגובב, איור 4). הזן ערך זה באופן הבא: score_cut= ערך.
      2. fold_change הוא ערך הסף של ציוני היחס של taged:untagged המשמש לקביעה אם שיא נחשב לאמיתי. כדי לקבוע את fold_change, התבונן בתרשים ובחר ערך מעל היחס בין החציונים של הנתונים הלא מתויגים והמתויגים. הזן ערך זה באופן הבא: fold_change= ערך.
      3. designfactor_value מוגדרת כחלק מתכנון הניסוי. גורמי עיצוב אפשריים מפורטים באדום בטבלה המודפסת. לקביעת גורם העיצוב, בחר אחד מהערכים המפורטים באדום. הזן ערך זה בין מרכאות באופן הבא: designfactor_value ="{ value}".
  6. בצע את התאים הבאים באמצעות Shift + Enter כדי להפעיל סינון ומיפוי שיא. הנתונים ועלילות הסיכום יאוחסנו בתת-ספרייה בתוך ספריית הנתונים הנקראת WonderPeaks.
    1. שים לב {designfactor_value}_taggedVuntagged.csv: טבלת ציר של כל הפסגות החופפות עם עמודה עבור כל אחת מהדגימות המתויגות והלא מתויגות.
    2. הערה {designfactor_value}_all_tagged_peaks.csv: טבלת סיכום של כל הפסגות האמיתיות, המבוססת על פרמטרים של המשתמש (שלב 6.5).
    3. שימו לב {designfactor_value}_peaks2gtf.csv: מיפוי של הפסגות האמיתיות, בהתבסס על פרמטרים של המשתמש (שלב 6.5), לגנים בקובץ ההערות שצוין על ידי המשתמש.
  7. אופציונלי: החלף את הפרמטרים בשלב 6.5 על-ידי ביצוע מחדש של שלבים 6.5-6.6. אם אתה משתמש באותה designfactor_value, הקבצים שנוצרו, כמתואר בשלב 6.6, יוחלפו.

figure-protocol-3
איור 4: צילום מסך המדגיש את designfactor_value והספים שצוינו על ידי המשתמש ב-WonderPeaks עבור ChIP-seq. צילום מסך של מחברת Jupyter של WonderPeaks, המדגיש את אפשרויות designfactor_value האפשריות מהטבלה המוצגת וכיצד ליישם את designfactor_value בתא הבא. החץ השחור העליון מצביע על טבלה המציגה ערכי designfactor_value אפשריים; ערך ההפעלה מוקף בעיגול ומוצג כקלט המשתמש שנבחר עבור designfactor_value בתא האפשרויות (חץ שחור תחתון). בגרף, קווים מלאים ומקווקווים מציינים את ציוני השיא החציוניים המשוערים עבור דגימות מתויגות ולא מתויגות, בהתאמה, בניסויי התאים האטומים. חציונים אלה משמשים להגדרת הפרמטרים score_cut (חציון מתויג) ו-fold_change (היחס בין חציון מתויג ללא מתויג). אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

7. PeakStream עבור 3'RNAseq

  1. בדיקה מוקדמת:
    1. ודא שכל קבצי ה-bedgraph נמצאים בתת-ספרייה בתוך ספריית הנתונים הנקראת bedgraphout (איור 2).
    2. פתיחת מחברת Jupyter לעיבוד מקדים של NGS (PeakStream.ipynb)
    3. הפעל את WonderPeaks (סביבה שנוצרה בשלב 1.3) בפינה הימנית העליונה של ממשק המחשב הנייד.
  2. בצע את התאים באמצעות Shift+Enter עד לנקודת העצירה כדי להפעיל שיחות שיא ומיפוי שיא. לאחר שתסיים, קובץ הערות חדש עם קבצי ספירת קריאה חזויים של 3' ו-FeatureCounts24 יישמר ויאוחסן בספריית משנה בתוך ספריית הנתונים שלך הנקראת PeakStream (איור 5).
    הערה: כברירת מחדל, קובץ הפלט יכלול רק הערות עבור ביוטיפים המקודדים לחלבון, אך ניתן להחליף זאת באמצעות אפשרות הביוטיפ.

figure-protocol-4
איור 5: ארגון קבצים עבור PeakStream. צילום מסך של תיקיית הנתונים עם קבצי ה-bedgraph בספרייה bedgrapghout. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

וונדר פיקס
לאחר ביצוע ניסוי ChIP-seq, חוקרים משתמשים בדרך כלל במתקשרים שיא, כגון MACS3, כדי לזהות אזורים גנומיים המועשרים על ידי חלבון קושר DNA מתויג אפיטופ. פיתחנו את WonderPeaks כמתקשר שיא ידידותי למשתמש שנועד לזהות שיאים בשיטה שתוארה לעיל.

WonderPeaks מזהה פסגות על ידי חישוב תחילה של הנגזרת הראשונה של הכיסוי ומשתמשת בערך זה (שיפוע השיא) כדי להגדיר פסגות פוטנציאליות. לאחר מכן הוא מחפש מקרים שבהם הנגזרת הראשונה מציגה מקסימום מקומי מעל סף שיפוע שסופק...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

טכניקות ריצוף מהדור הבא (NGS) מספקות תובנה שאין שני לה לגבי ויסות וביטוי גנים בפתוגנים פטרייתיים. ככזה, כלים חישוביים חייבים להיות גם מקיפים - לכידת כל הנתונים שנוצרו בניסוי - וגם נגישים למשתמשים כלליים, במיוחד מדעני ספסל. בדוח זה, הצגנו שני כלים, WonderPeaks ו-PeakStream, העונים על צרכים אלה עבור חוקרי פתוגנים פטרייתיים בתהליכי עבודה של ChIP-seq ו-RNA-seq.

WonderPeaks הוא זרימת עבודה ידידותית למשתמש לשיחות שיא בניסויי ChIP-seq. בהשוואה ל-MACS הנפוץ, WonderPea...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

למחברים אין ניגודי אינטרסים להצהיר עליהם.

תודות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

עבודה זו נתמכה על ידי מענקי המכונים הלאומיים לבריאות (NIH) RO1AI175080 ו-R01GM037049 (לאלכסנדר ד. ג'ונסון) ופרס מענק הדרכה של NIH T32 T32 AI 60537-20 (ל-H.G). אנו מודים לאלכסנדר ג'ונסון, מתיו לוסה, ג'ני ז'אנג ובריאן וואנג על דיונים ועצות מועילות. אנו מודים גם לחברי המעבדה של קרול גרוס על המשוב. אנו מודים לאננדה מנדוזה על התמיכה הטכנית. הריצוף בוצע ב-UCSF CAT, בתמיכת מענקי UCSF PBBR, RRP IMIA ו-NIH 1S10OD028511-01. אנו מכירים בשימוש ב-ChatGPT של OpenAI לסיוע בפתרון בעיות בקוד ומתן הצעות לעריכת כתב היד.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
ערכת RNA-seq V1 של CORALL Lexogen095חומר מעבדה רטוב 
חוטים-פטריות riboPOOLsiTOOLSsdp-P096-6חומר מעבדה רטוב 
רגישות גבוהה RNA ScreenTapeAgilent5067-5579חומר מעבדה רטוב 
רגישות גבוהה RNA ScreenTape סולםזריז<חזק>5067-5581חומר מעבדה רטוב 
רגישות גבוהה RNA ScreenTape מאגר דגימהזריז<חזק>5067-5580חומר מעבדה רטוב 
רשימת התלות עבור WonderPeaks
https://github.com/mgarber21/WonderPeaks_preprocessing/blob/main/environment.ymlרשימת התלות עבור WonderPeaks_preprocessing
Monarch Spin RNA Cleanup KiNEBT2040Lחומר מעבדה רטובה 
pygenometracks (3.9)
QuantSeq 3′ ערכת הכנה לספריית mRNA-Seq FWD V1Lexogen015חומר מעבדה רטוב 
ערכת בדיקת Qubit RNA בעלת רגישות גבוהה (HS)InvitrogenQ32852חומר מעבדה רטוב 
RNA נקי & רכז-5Zymo ResearchR1016חומר מעבדה רטוב 
ערכת TURBO ללא DNAThermoFisherAM1907חומר מעבדה רטוב 
WonderPeaks(0.1.14)
WonderPeaks_preprocessing(0.2.3)
https://github.com/mgarber21/WonderPeaks/blob/main/environment.yml

מקורות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. fungal priority pathogens list to guide research, development and public health action. , WHO. https://www.who.int/publications/i/item/9789240060241 (2022).
  2. Fisher, M. C., Denning, D. W. The WHO fungal priority pathogens list as a game-changer. Nat Rev Microbiol. 21 (4), 211-212 (2023).
  3. Gaspar, J. M. Improved peak-calling with MACS2. bioRxiv. 496521, (2018).
  4. Muñoz, J. F., et al. Coordinated host-pathogen transcriptional dynamics revealed using sorted subpopulations and single macrophages infected with Candida albicans. Nat Commun. 10 (1), 1607(2019).
  5. Miramón, P., Pountain, A. W., Lorenz, M. C. Candida auris-macrophage cellular interactions and transcriptional response. Infect Immun. 91 (11), e0027423(2023).
  6. Lindemann-Perez, E., Rodríguez, D. L., Pérez, J. C. An approach to analyze spatiotemporal patterns of gene expression at single-cell resolution in Candida albicans-infected mouse tongues. mSphere. 9 (9), e0028224(2024).
  7. Mo, X., et al. In vivo RNA sequencing reveals a crucial role of Fus3-Kss1 MAPK pathway in Candida glabrata pathogenicity. mSphere. 9 (11), e0071524(2024).
  8. Haas, B. J., Chin, M., Nusbaum, C., Birren, B. W., Livny, J. How deep is deep enough for RNA-Seq profiling of bacterial transcriptomes. BMC Genomics. 13, 734(2012).
  9. Zaheer, R., et al. Impact of sequencing depth on the characterization of the microbiome and resistome. Sci Rep. 8 (1), 5890(2018).
  10. Xiong, Y., et al. A comparison of mRNA sequencing with random primed and 3′-directed libraries. Sci Rep. 7 (1), 14626(2017).
  11. Ma, F., et al. A comparison between whole transcript and 3' RNA sequencing methods using Kapa and Lexogen library preparation methods. BMC Genomics. 20, 9(2019).
  12. Fansler, M. M., Mitschka, S., Mayr, C. Quantifying 3′UTR length from scRNA-seq data reveals changes independent of gene expression. Nat Commun. 15 (1), 4050(2024).
  13. Tuch, B. B., et al. The transcriptomes of two heritable cell types illuminate the circuit governing their differentiation. PLoS Genet. 6, e1001070(2010).
  14. Shenker, S., Miura, P., Sanfilippo, P., Lai, E. C. IsoSCM: improved and alternative 3′ UTR annotation using multiple change-point inference. RNA. 21 (1), 14-27 (2015).
  15. Haese-Hill, W., Crouch, K., Otto, T. D. peaks2utr: a robust Python tool for the annotation of 3′ UTRs. Bioinformatics. 39 (3), btad112(2023).
  16. Anaconda - Getting started. , https://docs.anaconda.com/anaconda/getting-started/ (2025).
  17. Pryke, B. Jupyter Notebook tutorial. , https://www.dataquest.io/blog/jupyter-notebook-tutorial/ (2025).
  18. Chen, S., Zhou, Y., Chen, Y., Gu, J. fastp: an ultra-fast all-in-one FASTQ preprocessor. Bioinformatics. 34 (17), i884-i890 (2018).
  19. Andrews, S. FastQC: a quality control tool for high throughput sequence data. , https://www.bioinformatics.babraham.ac.uk/projects/fastqc/ (2010).
  20. Ewels, P., Magnusson, M., Lundin, S., Käller, M. MultiQC: summarize analysis results for multiple tools and samples in a single report. Bioinformatics. 32 (19), 3047-3048 (2016).
  21. Dobin, A., et al. STAR: ultrafast universal RNA-seq aligner. Bioinformatics. 29 (1), 15-21 (2013).
  22. Danecek, P., et al. Twelve years of SAMtools and BCFtools. Gigascience. 10 (2), giab008(2021).
  23. Ramírez, F., et al. deepTools2: a next generation web server for deep-sequencing data analysis. Nucleic Acids Res. 44 (W1), W160-W165 (2016).
  24. Liao, Y., Smyth, G. K., Shi, W. featureCounts: an efficient general purpose program for assigning sequence reads to genomic features. Bioinformatics. 30 (7), 923-930 (2014).
  25. Lohse, M. B., Johnson, A. D. Identification and characterization of Wor4, a new transcriptional regulator of white-opaque switching. G3 (Bethesda). 6 (3), 721-729 (2016).
  26. Nagalakshmi, U., et al. The transcriptional landscape of the yeast genome defined by RNA sequencing. Science. 320 (5881), 1344-1349 (2008).
  27. Diaz, A., Park, K., Lim, D. A., Song, J. S. Normalization, bias correction, and peak calling for ChIP-seq. Stat Appl Genet Mol Biol. 11 (3), Article 9(2012).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תגיות

ChIP SeqWonderPeaksPeakStream3 UTRCandida albicans
הסרטון יגיע בקרוב

מאמרים קשורים