מאמר שיטה

זיהוי מדויק של אתרי עריכת RNA באמצעות סורק עריכת RNA דיפרנציאלי מכויל

DOI:

10.3791/71148

23 ביוני 2026

במאמר זה

סיכום

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

פרוטוקול זה מתאר את השימוש בסורק עריכת RNA דיפרנציאלי מכוייל (CADRES), תהליך חישובי המשלב קריאת וריאנטים משותפים בין DNA–RNA, כיול מחדש מותאם לאותות, ומודלים סטטיסטיים מודעים לשכפול לזיהוי אתרי עריכת RNA דיפרנציאלית בדיוק גבוה.

תקציר

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

הגדרה מדויקת של עריכת RNA נותרה מאתגרת טכנית משום שיש להבחין בין שינויים אמיתיים לאחר שעתוק לבין וריאנטים גנומיים וארטיפקטים של ריצוף. קושי זה בולט במיוחד בעריכת ציטידין לאורידין שמופעלת על ידי אנזימי APOBEC, שם שינויים מעורבים ב-DNA וב-RNA מסתירים את אות העריכה האמיתי. סורק עריכת RNA דיפרנציאלי מכוון (CADRES) מספק מסגרת חישובית מובנית לטיפול במגבלות אלו באמצעות חקירת גרסאות DNA–RNA משולבת ושימור ממוקד של חתימות עריכה אותנטיות. פרוטוקול זה מציג את תהליך העבודה של CADRES, הכולל הכנת נתונים, קריאה משותפת של וריאנט RNA, כיול מחדש באיכות בסיסית לשימור אותות, סינון ארטיפקטים והערכה דיפרנציאלית של עריכת RNA בין תנאי ניסוי. CADRES תומך בריצוף RNA-seq משולב וגנום מלא או אקסום שלם, עם שכפול ביולוגי.  אסטרטגיית סינון רב-שלבית, הכוללת הסרת הומופולימר וסינון פרלוג מבוסס PBLAT, מפחיתה באופן שיטתי חיוביים שגויים תוך שמירה על אירועי עריכה בתדר נמוך. על ידי שילוב כיול עם מודלים מודעים לשכפול, CADRES מגביר את הדיוק והשחזוריות של ניתוח עריכת RNA, ומאפשר חקירת דינמיקות עריכה בהקשרים ביולוגיים מגוונים. בהשוואה לשיטות מבוססות, CADRES נועד לשפר את הדיוק בזיהוי עריכת RNA, במיוחד באירועי C-to-U בתיווך APOBEC.

מבוא

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

עריכת RNA מהווה שכבה דינמית של ויסות פוסט-שעתוק המאפשרת החלפות נוקלאוטידים ספציפיות לאתר בתוך תמלולי RNA מבלי לשנות את רצף ה-DNA הבסיסי. במטאזואנים, דה-אמינציה של אדנוזין-לאינוזין (A>I) המתווכת על ידי אנזימי ADAR היא הצורה הדומיננטית ותורמת לגיוון בתמלול, יציבות mRNA, ויסות חיסוני מולד ותפקוד נוירוני 1,2. ציטידין-לאורידין (C>U) (להלן "C>U" בהקשר ביולוגי; "C>T" בהקשר ריצוף) דה-אמינציה, שמופעלת על ידי חברי משפחת APOBEC, פועלת לצד מסלולים אלו ומעורבת במטבוליזם של שומן, הגבלת וירוסים, מוטגנזה ותפקידים רגולטוריים מתפתחים בביולוגיה חיסונית וסרטנית 3,4,5,6,7. מחקרים עדכניים הראו כי מספר אנזימי APOBEC, כולל APOBEC1, APOBEC3A ו-APOBEC3B (A3B), מזרזים עריכת RNA בהקשרים פיזיולוגיים ופתולוגיים 3,4,7,8,9,10. APOBEC3 אנזימים גם גורמים לעריכת DNA, ויוצרים חתימות מוטציות חופפות שמסבכות את ההבחנה בין עריכת RNA לשונות גנומית 8,10,11,12.

ריצוף מהדור הבא אפשר זיהוי רחב היקף של אתרי עריכת RNA פוטנציאליים, אך עדיין קשה להבחין בין עריכות אמיתיות לבין SNV גנומי או רעש טכני. אירועי A>I ו-C>U מופיעים כהחלפות A>G ו-C>T בספריות cDNA ויכולים להתבלבל על ידי טעויות פריימינג, שגיאות פולימראז, ארטיפקטים במיפוי ושינויים בביטוי הספציפי להקשר. משאבים ציבוריים כמו REDIportal13 מתארים מיליוני אתרי A>I, בעוד שההערות ב-C>U נשארות דלות, ומשקפות הן מגבלות ביולוגיות והן אנליטיות. זיהוי אמין של עריכת C>U — במיוחד שינויים בתנאים שונים — נותר לכן צורך אנליטי שלא נענה.

המטרה הכוללת של השיטה המוצגת כאן, סורק עריכת RNA דיפרנציאלי מכויל (CADRES), היא זיהוי מדויק של וריאנטים דיפרנציאליים על RNA (DVRs): אתרי עריכה שעוברים שינויים מובהקים סטטיסטית בעומק העריכה בין שני תנאים מוגדרים או יותר14. בפיתוח פרוטוקול זה, ניסינו להתמודד עם שני מכשולים מתמשכים. ראשית, יש להבחין בין עריכות RNA אמיתיות לווריאנטים המקודדים ב-DNA. שנית, יש לכמת את הבדלי העריכה באופן סטטיסטי עמיד בין מערכי נתונים של RNA-seq ששוכפלו ביולוגית. החידוש המרכזי של CADRES טמון בשילוב קריאות משולבות של וריאנטים DNA/RNA עם טיפול מכויל של וריאנטים של RNA במהלך כיול מחדש של ניקוד באיכות בסיסית (BQSR). אסטרטגיית "כיול הגברה" זו משמרת אתרי עריכת RNA חדשים שהתגלו במהלך BQSR, ובכך מונעת ירידה שיטתית באיכות שבדרך כלל מפחיתה את הרגישות בעריכות בתדר נמוך 15,16,17. גישה זו מפחיתה שליליות שגויה ומשפרת את הספציפיות בהשוואה לצינורות התלויים אך ורק על מסדי נתונים לעריכת RNA לא שלמים.

CADRES ממוקמת בתוך נוף של שיטות שכל אחת מהן מתמקדת בהיבטים שונים של ניתוח עריכת RNA. SNPiR18 ו-RVboost19 ארטיפקטים של פילטרים מקבוצות RNA בלבד; VaDiR20 משלב השוואות בין DNA–RNA אך אינו מדמה את המבנה; rMATS-DVR21 מבצע בדיקות דיפרנציאליות מבוססות GLMM אך מסתמך אך ורק על RNA-seq; ו-JACUSA/JACUSA2 22,23 תומכים בזיהוי מודע לשכפול אך אינם כוללים אסטרטגיות חקירה או כיול מחדש משותף של DNA–RNA. CADRES מאחד מודלים סטטיסטיים מודעים לשכפול, קריאות משולבות של וריאנטים DNA/RNA, וכיול מחדש מועשר לאתרי עריכה דה נובו, ומספק זרימת עבודה אחת המותאמת לזיהוי עריכת RNA תלויי מצב—כולל אירועי C>U הקשורים לפעילות APOBEC 10,11,12.

בהקשר זה, המשתמשים עשויים לראות ב-CADRES מתאים כאשר מערכת הניסוי שלהם עומדת בקריטריונים הבאים. ראשית, זמינות ריצוף RNA-seq זוגי וגנום מלא או אקסום שלם מאותן דגימות, המאפשרת חלוקה קפדנית של אירועים שמקורם ב-RNA מווריאנטים מקודדי DNA. שנית, השאלה הביולוגית עוסקת בשינויים בעריכת RNA בתנאים שונים—כגון השראה של אנזימים, לחץ סביבתי, שלבי התפתחות או מצבי מחלה—שבהם מודלים סטטיסטיים של עומק אללים ספציפי בין שכפולים הוא חיוני. שלישית, החוקר מחפש ספציפיות מוגברת בזיהוי עריכת C>U, שבה הבחנה בין אירועי RNA לבין מוטגנזה מונעת על ידי APOBEC היא חיונית. CADRES חשובה במיוחד במערכות שבהן פעילות APOBEC גורמת לעריכות RNA ו-DNA, כפי שמודגם במודלים A3B אינדוקטיביים 10,11,12 ובהן שיטות RNA בלבד מציגות שיעורי חיוביים שגויים מנופחים עקב SNVs מבלבלים או ארטיפקטים של רצפים חזרתיים.

ל-CADRES יש מספר יתרונות מעשיים. קריאת הווריאנט המשותפת של DNA/RNA מפחיתה את החיוביים השגויים המונעים על ידי SNV. Boost recalibration שומר על אותות עריכה אמיתיים, כולל אירועים חדשים שאינם קיימים במאגרי ייחוס. ה-GLMM שמקורו ב-rMATS מספק מסגרת עקרונית סטטיסטית לניתוח עריכה דיפרנציאלית בין שכפולים. יחד, תכונות אלו מספקות פלטפורמה מכויילת ומדויקת לחקר עריכת RNA דינמית בסביבות ניסוי ומחלה. במחקר הקודםשלנו 14, CADRES הושוו בקפדנות מול שיטות זיהוי עריכת RNA מוכרות, תוך שימוש הן במערכי נתונים מדומים בסיליקו והן במודלים אמיתיים של תאים A3B המושרים. בהערכת הסילקו, CADRES השיגה בעקביות ציוני דיוק של 0.85–0.95 וציוני דיוק של 0.92–0.98 במספרים שכפולים. תהליך העבודה הכולל של CADRES מוצג באיור 1.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

פרוטוקול זה מתאר זרימת עבודה ביואינפורמטיקה חישובית טהורה לזיהוי אירועי עריכת RNA ב-C>U באמצעות מסגרת CADRES. כל השלבים מתבצעים בסביבת לינוקס באמצעות שורת הפקודה. רק מאגרי נתוני ריצוף זמינים לציבור משמשים ואינם מעורבים נבדקים אנושיים או בעלי חוליות.

1. הגדרת סביבה והתקנת תוכנה

הערה: דרישות החישוב המינימליות לזרימת העבודה של CADRES הן כדלקמן: מעבד ≥ 8 ליבות (מומלץ 16 ליבות), זיכרון RAM ≥ 32 GB (מומלץ 64 GB למערכי נתונים של הגנום המלא), ושטח דיסק ≥ 100 GB.

  1. אשר שמערכת הפעלה לינוקס זמינה. פתח חלון טרמינל וודא שיש הרשאה להתקנה בסביבת המשתמש הנוכחית.
  2. התקן מנהל חבילות של קונדה אם הוא לא קיים כבר במערכת. הורד מתקין להפצה מינימלית של קונדה מהאתר הרשמי שלה. בצע את סקריפט ההתקנה לפי ההוראות שעל המסך.
  3. אמת ש-Conda פעילה על ידי הזנת הפקודה הבאה וודא שהפקודה מדפיסה מספר גרסה תקין.
    $ קונדה --גרסה
  4. צור תיקיית עבודה עבור זרימת העבודה של CADRES. נכנסו לתיקייה זו באמצעות:
    $ CD /path/to/working_directory
  5. הורד את קוד המקור של CADRES על ידי הרצה:
    $ git clone -- branch v1.0.0 https://github.com/junsun-hash/CADRES
  6. הזן את התיקייה המשובטת על ידי הרצה:
    $ cd CADRES
  7. צור סביבה ייעודית לקונדה באמצעות קובץ environment.yml שמסופק במאגר CADRES. בצע את הפקודה הבאה ואפשר לתהליך ההתקנה להשלים ללא הפרעה.
    $ conda env create -f environment.yml
  8. הפעל את הסביבה החדשה על ידי הזנת הפקודה הבאה. ודאו שהסביבה הופעלה על ידי בדיקת שהפקודה של הטרמינל מציגה כעת את שמה.
    $ קונדה הפעל CADRES
  9. ודא שכלי שורת הפקודה הנדרשים הותקנו כראוי. בצע כל פקודה למטה וודא שהיא מחזירה מספר גרסה במקום הודעת שגיאה:
    $ python --version
    $ samtools --גרסה
    $ gatk -- עזרה
    $ כלי מיטה --גרסה
    $ pblat

    הערה: מערך הכלים המדויק הכלול בסביבת CADRES עשוי להשתנות מעט בהתאם לעדכונים לקובץ environment.yml. אם חסר כלי, ליצור מחדש את הסביבה או לעדכן את רשימת התלות לפי הצורך.
  10. ודא שיש מספיק מקום בדיסק. אשר שקיים לפחות 100 GB של שטח פנוי לגנומים ייחוסיים, אינדקסי יישור וקבצי BAM ביניים על ידי הזנת:
    $ df -h
  11. אשר שהרשאות כתיבה זמינות בכל תיקיות העבודה, הפלט והזמניות על ידי יצירת קובץ בדיקה:
    $ לגעת test_file.txt
  12. מחק את הקובץ לאחר מכן על ידי הזנת:
    $ RM test_file.txt

2. הכנת נתונים

הערה: מאגר הנתונים המייצג בפרוטוקול זה כולל: HEK293T תאים עם A3B–GFP המושרה על ידי דוקסיציקלין; WGS ב-33×; RNA בקצה זוג ספציפי לחוט (2×150 bp, ≥60 M קריאות/דגימה); n = 3 שכפולים ביולוגיים לכל מצב (DMSO לעומת דוקסיציקלין 72 שעון). נתונים מלאים: SRA PRJNA1211186. תת-קבוצה להדגמה של chr22 מסופקת במאגר CADRES.

CADRES דורשים: (i) WGS (≥33×) או WES (≥33×); (ii) מעקב RNA ספציפי לגדיל (≥60 מיליון קריאות לדגימה); (iii) שני תנאים ניסיוניים עם ≥2 שכפולים ביולוגיים כל אחד.

  1. הכין את הגנום וההערה של הייחוס.
    1. הורידו את קובץ הגנום הייחוס (FASTA) וקובץ ההערות GTF מ-Ensembl או מאתר דומה. הגנום המומלץ הוא Ensembl GRCh38 assembly primary assembly: https://ftp.ensembl.org/pub/release-111/fasta/homo_sapiens/dna/ וההערה המומלצת ל-GTF היא GENCODE גרסה 45:
      https://ftp.ebi.ac.uk/pub/databases/gencode/Gencode_human/release_45/.
    2. אנדקס את ה-FASTA:
      $ samtools faidx FASTA_FILE.fa
      ודא שקונבנציות שמות הכרומוזומים (למשל, "chr1" לעומת "1") עקביות בכל חומרי העזר.
  2. קבל את נתוני הרצף.
    1. השגת קבצי FASTQ (WGS או WES) ב-DNA-seq עם עומק ≥33×.
    2. השגת קבצי FASTQ ספציפיים לחוט עם קצה RNA-seq עם ≥60 מיליון קריאות לכל דגימה, בשני תנאים ביולוגיים ולפחות שני שכפולים ביולוגיים בכל קבוצה.
  3. יישר את קריאות ריצוף ה-DNA באמצעות BWA-MEM.
    1. בנה אינדקס BWA:
      מדד BWA $ Homo_sapiens. GRCh38.dna.primary_assembly.fa -p bwaindex -a bwtsw
    2. יישור והמר ל-BAM:
      $ bwa mem -R '@RG\tID:ID\tPL:platform\tLB:library\tSM:sample_name' bwaindex wgs_R1.fq.gz wgs_R2.fq.gz | SamTools View -b > WGS.BAM
  4. יישר את קריאות רצף ה-RNA באמצעות STAR.
    1. יצירת אינדקס הגנום של STAR:
      $ STAR --runMode genomeGenerate \
      --genomeFastaFiles Homo_sapiens. GRCh38.dna.primary_assembly.fa \
      --גנום מנהל STAR_index \
      --sjdbGTFקובץ Homo_sapiens. GRCh38.gtf
    2. קריאות RNA יישור
      $ STAR \
      --גנום מנהל STAR_index \
      --readFilesCommand zcat \
      --readFilesIn rna_sample1.fq.gz rna_sample2.fq.gz \
      --sjdbGTFקובץ Homo_sapiens. GRCh38.gtf \
      --outSAMtype BAM לא ממוינת \
      --outSAMmapqUnique 60 \
      --outFileNamePrefix pass1_

      הערה: זה יוצר קובץ חיבור (pass1_SJ.out.tab) המכיל גם חיבור עם הערות וגם חיבורים חדשים.
    3. שחזר את מדד הגנום STAR הכולל צמתים חדשים:
      $ cat pass1_SJ.out.tab > SJ_all.tab
      $ STAR --runMode genomeGenerate \
      --genomeFastaFiles Homo_sapiens. GRCh38.dna.primary_assembly.fa \
      --גנום מנהל STAR_index_2pass \
      --sjdbGTFקובץ Homo_sapiens. GRCh38.gtf \
      --sjdbFileChrStartEnd SJ_all.tab
    4. בצע את יישור המעבר השני באמצעות האינדקס המעודכן:
      $ STAR \
      --גנום מנהל STAR_index_2pass \
      --readFilesCommand zcat \
      --readFilesIn rna_sample1.fq.gz rna_sample2.fq.gz \
      --sjdbGTFקובץ Homo_sapiens. GRCh38.gtf \
      --outSAMtype BAM ממוין לפי קואורדינטה \
      --outSAMmapqUnique 60 \
      --outFileNamePrefix output_name
  5. הכינו משאבי עזר עזר.
    1. (מומלץ) השגת dbSNP VCF
      הורד את ה-GRCh38 dbSNP VCF האנושי (לדוגמה, dbSNP build 150) משרת ה-FTP של NCBI:
      https://ftp.ncbi.nih.gov/snp/latest_release/VCF/ למקם את הקובץ שהורד (למשל, dbsnp_150.vcf.gz) בתיקיית העבודה.
      הערה: רשומות שמקורן ב-RNA (molType="cDNA") ב-dbSNP עשויות להסתיר אתרי עריכת RNA אמיתיים. החריגו אותם שמשתמשים:
      $ bcftools view -i 'INFO/molType!="cDNA"' dbsnp.vcf.gz -Oz -o dbsnp_no_cDNA.vcf.gz
    2. (מומלץ) למיין את ה-dbSNP VCF
      מיין את ה-VCF כך שיתאים לגנום הייחוס ול-GATK:
      $ gatk SortVcf \
      -אני dbsnp_150.vcf.gz \
      -או dbsnp_150.sorted.vcf.gz \

      --מילון רצף Homo_sapiens. GRCh38.dict
    3. (מומלץ) אנדקס של ה-dbSNP VCF הממוין
      צור אינדקס עבור dbSNP VCF הממוין:
      $ gatk IndexFeatureFile -I dbsnp_150.sorted.vcf.gz
      הערה: נדרש מילון ייחוס תואם. אם התיק Homo_sapiens. GRCh38.dict חסר, צור אותו כך:
      $ gatk CreateSequenceDictionary \
      -ר Homo_sapiens. GRCh38.dna.primary_assembly.fa \
      -או Homo_sapiens. GRCh38.dna.primary_assembly.dict
    4. (מומלץ) השגת קו הנבט של gnomAD VCF
      הורד את אתרי וריאנט הנבט GRCh38 gnomAD VCF מ: https://gnomad.broadinstitute.org/downloads השתמש בגנום VCF המתאים לצינור (לדוגמה, gnomad.genomes.vX.X.sites.vcf.gz).
    5. (מומלץ) מיין את ה-gnomAD VCF
      מיין את ה-VCF של gnomAD באמצעות אותו מילון הפניות כדי להבטיח תאימות:
      $ gatk SortVcf \
      -אני gnomad.vcf.gz \
      -או gnomad.sorted.vcf.gz \
      --מילון רצף Homo_sapiens. GRCh38.dict
    6. (מומלץ) אנדקס של gnomAD VCF הממוין
      צור אינדקס עבור gnomAD VCF הממוין:
      $ gatk IndexFeatureFile -I gnomad.sorted.vcf.gz
      הערה: ודא ששמות כרומוזומים (למשל, "chr1" לעומת "1") תואם את ה-FASTA לפני הרצת SortVcf.
  6. קבל הפניה ידועה לעריכת RNA.
    הערה: קובץ הפניה תואם REDIportal (rediportal.txt) המתאים ל-CADRES מאוצר במאגר CADRES וניתן להוריד אותו ישירות מ:
    https://github.com/junsun-hash/CADRES/releases/tag/v1.0.0. קובץ זה משמש לסימון אירועי עריכה ידועים בשלב 3.
  7. הכינו הערות גנים בפורמט RefGene. הורד את ההערה של RefGene (למשל, refGene.txt.gz מ-UCSC). יש לשחרר את הלחץ במידת הצורך ולוודא ששמות הכרומוזומים תואמים לאלו שבגנום הייחוס.
    הערה: דוגמה המתאימה ל-CADRES מאוצרת במאגר CADRES וניתן להוריד אותה ישירות מ:
    https://github.com/junsun-hash/CADRES/releases/tag/v1.0.0

3. ביצוע תהליך העבודה האנליטי של CADRES

הערה: סעיף 3 מבוצע בטרמינל לינוקס עם סביבת CADRES Conda מופעלת.

  1. כיול וכיול בוסט מחדש
    הערה: שלב 1 מתקן קבצי BAM ומבצע כיול מחדש של Boost — BQSR משופר הכולל dbSNP, gnomAD וסט ראשוני של מועמדים לעריכת RNA לשימור אותות עריכה אמיתיים. רשום את כל קבצי ה-RNA BAM המופרדים לפי רווחים. פלט: אתרי BAM מכוילים מחדש (סיומת: _recalibration.bam) ואתרי מועמדים ל-Boost.
    1. לביצוע שלב 3.1:
      $ פייתון pipeline_step1_calibration.py \
      --rna_bams /path/to/rna_sample1.bam /path/to/rna_sample2.bam ... \
      --dna_bam /path/to/wgs_normal.bam \
      --גנום /path/to/hg38.fa \
      --known_snv /path/to/dbsnp.sorted.vcf.gz \
      --output_dir ./output/step1_calibration \
      --קידומת project_demo

      הערה: מועמדי הבוסט נבנים מקריאת Mutect2 משותפת ראשונית של DNA-RNA (--max-events-in-region 4, מסנן PASS בלבד; ללא ספי AF/איכות נוספים). הומופולימר וסינון חוזר מטופלים בשלב 3.2.
  2. קריאת וריאנטים, הערכת זיהום וסינון
    הערה: שלב 3.2 מבצע קריאה משותפת של וריאנט DNA-RNA עם הערכת זיהום (באמצעות gnomAD), ואז מסנן מועמדים לפי הקשר הומופולימר ויישור מחדש של PBLAT. פלט: {prefix}.final.vcf.
    1. לביצוע שלב 3.2:
      $ פייתון pipeline_step2_variant_calling.py \
      --rna_bams ./output/step1_calibration/rna_sample1_split_recalibration.בם ... \
      --dna_bam ./output/step1_calibration/DNA_processed_recalibration.bam \
      --גנום /path/to/hg38.fa \
      --gnomad /path/to/gnomad.sorted.vcf.gz \
      --output_dir ./output/step2_variant_calling \
      --קידומת project_demo

      הערה: שלב זה מייצר את מערך הקריאות הסופי, המסונן בקפדנות (project_demo.final.vcf), המייצג הבדלים ב-RNA-DNA ברמת ביטחון גבוהה בכל הדגימות. פרמטרים מרכזיים: Mutect2 ---מינימום-ממוצע-בסיס-איכות 12, --מקסימום-אירועים-ב-رايون 4; PBLAT minbasequal 5; כולם מוגדרים מראש בסקריפט הצינור.
  3. בדיקות סטטיסטיות והערות פונקציונליות
    הערה: שלב 3.3 מכמת עריכת RNA דיפרנציאלית באמצעות GLMM המותאם מ-rMATS (תיקון FDR בנג'מיני-הוכברג), ומסמן כל אתר עם אזור גן, סמל גן ומצב עריכה ידוע. פלט: {קידומת}_Result.txt (DVRs עם ערכי P ו-FDR).
    מסנן היישור מחדש של PBLAT מסיר מועמדים המיפוי ללוקוסי גנומי מרובים, ובכך משפר את הספציפיות באזורים החוזרים על עצמם. THREAD_COUNT הפנימי שלו נשלט על ידי דגל --threads ב-pipeline_step2_variant_calling.py.
    1. לביצוע שלב 3.3:
      $ פייתון pipeline_step3_statistical_test.py \
      --group1_rna_bams ./output/step1_calibration/control_rep1.bam ... \
      --group2_rna_bams ./output/step1_calibration/treated_rep1.bam ... \
      --final_vcf ./output/step2_variant_calling/project_demo.final.vcf \
      --גנום /path/to/hg38.fa \
      --known_snv /path/to/dbsnp.sorted.vcf.gz \
      --known_editing /path/to/rediportal.txt \
      --gene_anno /path/to/refGene.txt \
      --output_dir ./output/step3_statistical_test \
      --תוויות בטיפול מבוקר

      הערה: פרמטרים מרכזיים: samtools mpileup -q 30 (מינימום איכות מיפוי), -Q 17 (מינימום איכות בסיס); מבחן יחס סבירות rMATS-GLMM עם חיתוך Δψ = 0.0001, קישור לוגיט בינומי עם עונש נורמלי רב-משתני מודע לשכפול (rho = 0.9); בנג'מיני-הוכברג תיקון רוזוולט; כולם מוגדרים מראש בסקריפט הצינור
      כל שלושת שלבי הצינור תומכים בביצוע רב-תהליכי דרך דגל --threads (ברירת מחדל: 4 לכל שלב). שלב 2 מקבל גם --contamination_threads (ברירת מחדל: 2).

4. בדיקת תוצאות והדמיה

  1. לאחר סיום תהליך העבודה של CADRES, עבור לתיקיית הפלט. קובץ התוצאות הראשי, {קידומת}_Result.txt, מפרט את כל הווריאנטים השונים שזוהו על RNA (DVRs), כולל קואורדינטות גנומטיות, אללים, ספירות אללים ברמת שכפול, שברי עריכה, הבדלים בין קבוצות ומדדים סטטיסטיים נלווים (ערך P ו-FDR). נכללים גם הערות ברמת הגן (סמל גן, אזור, חוט, סוג וריאנט, SNP/מצב עריכה ידוע). קובץ הסיכום המצורף, {prefix}_Result_summary.txt, מספק ספירות של כל סוג החלפה וסיווג שלהם ל-DVR של SNP, DVRים ידועים לעריכת RNA, ו-DVR חדשניים.
  2. (אופציונלי) יצר ויזואליזציות סטנדרטיות על ידי הרצת סקריפט הפוסט-אנליזה. פתח מפגש R והזן:
    קונסולת R:
    מקור ("Post-analysis.R")
    התסריט Post-analysis.R כלול ב-https://github.com/junsun-hash/CADRES/.
  3. יופיע דו-שיח לבחירת קובץ; בחר {קידומת}_Result.txt. התסריט מייצר שישה דמויות של פפואה גינאה החדשה.
    הערה: דו-שיח בחירת הקובץ דורש סשן R בשולחן העבודה. בשרתים ללא ראש, ערוך את המשתנה input_file ישירות (שורה 10 של Post-analysis.R) והפעיל את Rscript Post-analysis.R.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

כדי להעריך את CADRES בתנאים ניסיוניים ריאליסטיים, השתמשנו במערכת APOBEC3B השראה (A3B) בתאי 293T. מבנה לנטיויראלי מגיב לדוקסיציקלין המבטא A3B-GFP הוכנס לתאי 293T, ונבחרו אינטגרנטים יציבים עם פורומיצין. השראה עם דוקסיציקלין במשך 72 שעות יצרה ביטוי חזק של A3B-GFP, שאושר על ידי פלואורסצנציה של GFP ועלייה ברמות ה-mRNA של A3B. דגימות מושרות ולא מושרות הותאמו לאחר מכן עברו חילוץ אחיד של DNA ו-RNA, הכנת ספרייה וריצוף, כדי להבטיח שההבדלים שנצפו בין RNA ל-DNA משקפים עריכה אמיתית התלויה ב-A3B ולא ר...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

תהליך העבודה של CADRES המוצג כאן מספק אסטרטגיה מכויילת ועקבית פנימית לזיהוי אירועי עריכת RNA דיפרנציאליים עם ספציפיות גבוהה, במיוחד דה-אמינציה של C>U המופעלת על ידי אנזימי APOBEC. מספר שלבים בתוך הפרוטוקול הם קריטיים לדיוקו. ריצוף גנומי ותראנסקריפטומי תואם חיוני להבחנה בין עריכות RNA אמיתיות לפולימורפיזמים בסיסיים של DNA, בעוד שהליך ה-Boost Recalibration מגן על וריאנטים אמיתיים של RNA מפני עונש שגוי במהלך כיול מחדש של ציון הבסיס. חשובים לא פחות הם מסנני הרכבת הרצף והמיפוי, שמפחיתים קריאו...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

J.S., Z.D. ו-C.Z. הם עובדים במכון שנחאי למוצרים ביולוגיים, גוף העוסק כיום בפיתוח מסחרי של ביולוגים טיפוליים.

תודות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר זה מומן על ידי ועדת המדע והטכנולוגיה של שנגחאי (23S11901100).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
BCFtoolsפרויקט SamtoolsN/Aגרסה 1.21. קריאת וריאנטים ומניפולציה של VCF. URL: https://github.com/samtools/bcftools
Bedtoolsמעבדת QuinlanN/Aגרסה 2.31.1. פעולות חשבון גנום. URL: https://github.com/arq5x/bedtools2
Biopythonפרויקט BiopythonN/Aגרסה 1.85. כלי Python לביולוגיה מולקולרית. URL: https://www.biopython.org
BWA-MEMGitHub (lh3/bwa)N/Aגרסה 0.7.18. יישור DNA-seq. URL: https://github.com/lh3/bwa
קוד מקור CADRESGitHub (junsun-hash/CADRES)N/Aגרסה 1.0.0. סקריפטים של צינור CADRES. URL: https://github.com/junsun-hash/CADRES
Conda או MinicondaAnaconda Inc.N/Aגרסה 23.1. מנהל חבילות וסביבה. URL: https://docs.conda.io/en/latest/miniconda.html
dbSNP GRCh38 VCFNCBIN/Aגרסה 155. מסד נתונים של וריאנטים גרמיים נפוצים. URL: https://ftp.ncbi.nih.gov/snp/
GATK4מכון BroadN/Aגרסה 4.3.0.0. ערכת ניתוח גנום. URL: https://github.com/broadinstitute/gatk
Gitהקרן לחופש התוכנהN/Aגרסה 2.39. מערכת בקרת גרסאות. URL: https://git-scm.com
gnomAD GRCh38 VCFמכון BroadN/Aגרסה 3.1. תדירויות אללים של אוכלוסייה. URL: https://gnomad.broadinstitute.org
קובץ אנוטציה GTFEnsemblN/Aגרסה 109. אנוטציה של גנים עבור GRCh38. URL: https://www.ensembl.org
גנום הפניה האנושי GRCh38Ensembl/UCSCN/Aגרסה 109. הרכבת גנום הפניה. URL: https://www.ensembl.org או https://hgdownload.soe.ucsc.edu
תחנת עבודה או שרת LinuxשוניםN/AUbuntu 20.04. נדרשת ארכיטקטורת x86_64. URL: https://ubuntu.com
pblatדפדפן הגנום של UCSCN/Aגרסה 2.5.1. יישור מחדש של BLAT מקבילי. URL: https://github.com/ucscGenomeBrowser/kent
Picardמכון BroadN/Aגרסה 2.20.8. מניפולציה של נתוני NGS. URL: https://github.com/broadinstitute/picard
Pythonקרן התוכנה של PythonN/Aגרסה 3.9.19. שפת תכנות. URL: https://www.python.org
Rקרן RN/Aגרסה 4.5.2. חישוב סטטיסטי. URL: https://www.r-project.org
חבילת R: forcatsCRANN/Aגרסה 1.0.0. מניפולציה של גורמים. URL: https://cran.r-project.org/package=forcats
חבילת R: ggplot2CRANN/Aגרסה 4.0.1. הדמיית נתונים. URL: https://cran.r-project.org/package=ggplot2
חבילת R: ggrepelCRANN/Aגרסה 0.9.5. דחייה של תוויות טקסט. URL: https://cran.r-project.org/package=ggrepel
חבילת R: lme4CRANN/Aגרסה 1.1.35. מודלים ליניאריים של אפקטים מעורבים. URL: https://cran.r-project.org/package=lme4
חבילת R: readrCRANN/Aגרסה 2.1.5. קריאת קבצים מהירה. URL: https://cran.r-project.org/package=readr
חבילת R: stringrCRANN/Aגרסה 1.6.0. מניפולציה של מחרוזות. URL: https://cran.r-project.org/package=stringr
הפניה ל-REDIportalאוניברסיטת בולוניהN/Aגרסה 2.0. מסד נתונים של אתרי עריכת RNA A-to-I. URL: http://srv00.recas.ba.infn.it/atlas/
אנוטציה של RefGeneדפדפן הטבלאות של UCSCN/Aגרסה 109. אנוטציה של מבנה הגנים. URL: https://genome.ucsc.edu/cgi-bin/hgTables
Samtoolsפרויקט SamtoolsN/Aגרסה 1.21. מניפולציה של קובץ BAM. URL: https://github.com/samtools/samtools
מישר STARGitHub (alexdobin/STAR)N/Aגרסה 2.7.11b. יישור RNA-seq. URL: https://github.com/alexdobin/STAR

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תגיות

RNAAPOBECC To URNARNA Seq

מאמרים קשורים