Yöntem makalesi

Kalibreli Diferansiyel RNA Düzenleme Tarayıcısı kullanılarak RNA Düzenleme Alanlarının Yüksek Hassasiyetli Tespiti

DOI:

10.3791/71148

23 Haziran 2026

Bu makalede

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu protokol, DNA–RNA ortak varyant çağrısı, sinyal optimize edilmiş yeniden kalibrasyon ve çoğaltma farkında istatistiksel modellemeyi entegre ederek yüksek hassasiyetle ayırt edilen RNA düzenleme alanlarını entegre eden hesaplamalı bir iş akışı olan Kalibreli Diferansiyel RNA Düzenleme Tarayıcısının (CADRES) kullanımını tanımlar.

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

RNA düzenlemesinin doğru tanımlanması teknik olarak zordur çünkü gerçek transkripsiyon sonrası değişiklikler genomik varyantlar ve dizileme artefaktlarından ayırt edilmelidir. Bu zorluk, özellikle APOBEC enzimleri tarafından katalize edilen sitidinden uridine düzenleme için belirgindir; burada DNA ve RNA değişiklikleri gerçek düzenleme sinyalini gizler. Kalibreli Diferansiyel RNA Düzenleme Tarayıcısı (CADRES), entegre DNA–RNA varyant sorgulaması ve otantik düzenleme imzalarının hedefli korunması yoluyla bu sınırlamaları ele almak için yapılandırılmış bir hesaplama çerçevesi sağlar. Bu protokol, veri hazırlama, ortak RNA varyantı çağrısı, sinyal koruyan temel kalite yeniden kalibrasyonu, artefakt filtreleme ve deneysel koşullar arasında RNA düzenlemesinin diferansiyel değerlendirmesini içeren CADRES iş akışını sunar. CADRES, çiftleştirilmiş RNA-dizisini ve tam genom veya tam ekzom dizilemesini biyolojik çoğaltma ile destekler.  Homopolimer çıkarımı ve PBLAT tabanlı paralog taramasını içeren çok aşamalı bir filtreleme stratejisi, düşük frekanslı düzenleme olaylarını korurken yanlış pozitifleri sistematik olarak azaltır. Kalibrasyonu çoğaltma farkında modelleme ile birleştirerek, CADRES RNA düzenleme analizinin hassasiyetini ve tekrarlanabilirliğini artırır ve çeşitli biyolojik bağlamlarda düzenleme dinamiklerinin sorgulanmasını mümkün kılar. Yerleşik yöntemlerle karşılaştırıldığında, CADRES, özellikle APOBEC aracılı C-to-U olayları için RNA düzenleme algılamasında hassasiyeti artırmak için tasarlanmıştır.

Giriş

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

RNA düzenlemesi, altta yatan DNA dizisini değiştirmeden RNA transkriptlerinde siteye özgü nükleotit ikamelerini mümkün kılan dinamik bir transkripsiyon sonrası düzenleme katmanı oluşturur. Metazoanlarda, ADAR enzimleri aracılığıyla adenozin-inosin (A>I) deaminasyonu baskın biçimdir ve transkript çeşitlenmesine, mRNA stabiliteline, doğuştan bağışıklık modülasyonuna ve nöronfonksiyonuna katkı sağlar 1,2. Sitidinden uridine (C>U) (biyolojik bağlamda bundan sonra "C>U"; "C>T" dizileme bağlamında) deaminasyon, APOBEC ailesinin üyeleri tarafından katalizlenir ve bu yollarla birlikte çalışır ve lipid metabolizması, viral kısıtlama, mutajenez ve bağışıklık ile kanser biyolojîsinde ortaya çıkan düzenleyici rollerderol oynar 3,4,5,6,7. Son çalışmalar, APOBEC1, APOBEC3A ve APOBEC3B (A3B) dahil olmak üzere birkaç APOBEC enziminin, fizyolojik ve patolojik bağlamlarda RNA düzenlemesinikatalize ettiğini göstermiştir 3,4,7,8,9,10. APOBEC3 enzimler ayrıca DNA düzenlemesini indükleyerek RNA düzenleme ile genomik varyasyon arasındaki ayrımı karmaşıklaştıran örtüşen mutasyonalimzalar üretir 8,10,11,12.

Yeni nesil dizileme, potansiyel RNA düzenleme noktalarının transkriptom genelinde tanımlanmasını mümkün kılmıştır, ancak gerçek düzenlemeleri genomik SNV'ler veya teknik gürültüden ayırt etmek hâlâ zordur. A>I ve C>U olayları, cDNA kütüphanelerinde A>G ve C>T ikameleri olarak görülür ve yanlış priming, polimeraz hataları, haritalama artefaktları ve bağlama özgü ifade değişiklikleriyle karıştırılabilir. REDIportal13 gibi kamu kaynakları milyonlarca A>I sitesini kataloglarken, C>U açıklamaları hem biyolojik hem de analitik kısıtlamaları yansıtan seyrek kalır. C>U düzenlemesinin güvenilir şekilde tanımlanması—özellikle koşullar arasındaki değişiklikler—bu nedenle henüz değerlendirilmemiş bir analitik ihtiyaç olarak kalmaktadır.

Burada sunulan yöntemin genel amacı, Kalibreli Diferansiyel RNA Düzenleme Tarayıcısı (CADRES), RNA'daki Diferansiyel Varyantların (DVR) kesin olarak tanımlanmasıdır: iki veya daha fazla tanımlanmış koşul arasında düzenleme derinliğinde istatistiksel olarak anlamlı değişiklikler yaşayan düzenlemealanları 14. Bu protokolü geliştirirken, iki kalıcı engeli ele almaya çalıştık. Öncelikle, gerçek RNA düzenlemeleri DNA ile kodlanmış varyantlardan ayırt edilmelidir. İkinci olarak, düzenleme farklılıkları, biyolojik olarak çoğaltılan RNA-seq veri setleri arasında istatistiksel olarak sağlam bir şekilde nicelendirilmelidir. CADRES'in temel yeniliği, ortak DNA/RNA varyant çağrısının temel kalite skor yeniden kalibrasyonu (BQSR) sırasında RNA varyantlarının kalibre edilmiş bir tedavisiyle entegre edilmesidir. Bu "yeniden kalibrasyonu artır" stratejisi, BQSR sırasında yeni keşfedilen RNA düzenleme alanlarını korur ve böylece düşük frekanslı düzenlemelerde hassasiyeti genellikle aşındıran sistematik kalite düşüşünüönler 15,16,17. Bu yaklaşım, yalnızca eksik RNA düzenleme veritabanlarına dayanan boru hatlarına kıyasla yanlış negatifleri azaltır ve özgüllüğü artırır.

CKADR, her biri RNA düzenleme analizinin farklı yönlerini ele alan bir yöntem dünyasında yer alır. SNPiR18 ve RVboost19 filtre artefaktları, sadece RNA varyant setlerinden alınan; VaDiR20, DNA–RNA karşılaştırmalarını içerir ancak çoğaltma yapısını modellemez; rMATS-DVR21, GLMM tabanlı diferansiyel testler yapar ancak yalnızca RNA-dizimine dayanır; ve JACUSA/JACUSA222,23 kopyalanma farkında tespiti destekler ancak ortak DNA–RNA sorgulama veya yeniden kalibrasyon stratejilerini içermezler. CADRES, çoğaltma farkında istatistiksel modelleme, ortak DNA/RNA varyant çağrısı ve de novo düzenleme alanları için zenginleştirilmiş yeniden kalibrasyonu birleştirerek, APOBECaktivitesi 10,11,12 ile bağlantılı C>U olayları dahil olmak üzere kohale bağlı RNA düzenlemesini tespit etmek için optimize edilmiş tek bir iş akışı sağlar.

Bu bağlamda, kullanıcılar deneysel sistemleri aşağıdaki kriterleri karşıladığında CADRES'i uygun görebilirler. İlk olarak, aynı örneklerden eşleştirilmiş RNA-dizisi ve tüm genom veya tüm ekzom dizileme mevcuttur; bu da DNA kodlanmış varyantlardan RNA kaynaklı olayların titiz bölünmesini sağlar. İkinci olarak, biyolojik soru, enzim indüksiyonu, çevresel stres, gelişim evreleri veya hastalık durumları gibi koşullar arasında RNA düzenlemesindeki değişiklikleri içerir; burada kopyalar arasında alel-spesifik derinliğin istatistiksel modellemesi gereklidir. Üçüncü olarak, araştırmacı, RNA olaylarını APOBEC kaynaklı DNA mutajezisinden ayırmanın vazgeçilmez olduğu C>U düzenleme tespitinde artırılmış özgüllük arar. CADRES, APOBEC aktivitesinin hem RNA hem de DNA düzenlemelerini tetiklediği sistemlerde özellikle değerlidir; bu, indüklenebilir A3Bmodelleri 10,11,12'de gösterilmiştir ve geleneksel RNA tabanlı yöntemlerin, karıştırıcı SNV'ler veya tekrarlayan dizi artefaktları nedeniyle şişirilmiş yanlış pozitif oranlar sergilediği sistemlerde geçerlidir.

CKADR birkaç pratik avantaj sunar. Ortak DNA/RNA varyant çağrısı, SNV kaynaklı yanlış pozitifleri azaltır. Boost yeniden kalibrasyonu, referans veritabanlarında olmayan yeni olaylar da dahil olmak üzere gerçek düzenleme sinyallerini korur. rMATS'tan türetilen GLMM, tekrarlar arasında diferansiyel düzenleme analizi için istatistiksel olarak ilkeli bir çerçeve sağlar. Bu özellikler birlikte, deneysel ve hastalık ortamlarında dinamik RNA düzenlemesini incelemek için kalibre edilmiş ve yüksek hassasiyetli bir platform sağlar. Öncekiçalışmamız 14'te, CADRES hem in silico simülasyonu veri setleri hem de gerçek dünyada indüklenebilir A3B hücre modelleri kullanılarak yerleşik RNA düzenleme tespit yöntemleriyle titizlikle karşılaştırılmıştı. In silico değerlendirmede, CADRES tekrarlanan sayılar arasında tutarlı olarak 0.85–0.95 hassasiyet puanları ve 0.92–0.98 doğruluk puanları elde etti. Genel CADRES iş akışı Şekil 1'de gösterilmiştir.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Protokol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu protokol, CADRES çerçevesi kullanılarak C>U RNA düzenleme olaylarını tanımlamak için tamamen hesaplamalı bir biyoinformatik iş akışını tanımlar. Tüm adımlar bir Linux ortamında komut satırı kullanılarak gerçekleştirilir. Yalnızca kamuya açık dizileme veri setleri kullanılır ve insan veya omurgalı denek dahil değildir.

1. Ortam kurulumu ve yazılım kurulumu

NOT: CADRES iş akışı için minimum hesaplama gereksinimleri şunlardır: CPU ≥ 8 çekirdek (16 çekirdek önerilir), RAM ≥ 32 GB (tam genom veri setleri için 64 GB önerilir) ve disk alanı ≥ 100 GB.

  1. Linux işletim sisteminin mevcut olduğunu doğrulayın. Bir terminal penceresi açın ve mevcut kullanıcı ortamında kurulum izninin mevcut olduğundan emin olun.
  2. Sistemde zaten mevcut olmayan bir Conda paket yöneticisi kurun. Resmi web sitesinden minimal bir Conda dağıtımı için bir kurulum programı indirin. Kurulum betekini ekrandaki talimatlara uygun şekilde çalıştırın.
  3. Conda'nın aktif olduğunu aşağıdaki komutu girerek doğrulayın ve komutun geçerli bir sürüm numarası yazdığından emin olun.
    $ conda --versiyon
  4. CADRES iş akışı için bir çalışma dizini oluşturun. Bu dizine şu adresle gidin:
    $ cd /path/to/working_directory
  5. CADRES kaynak kodunu şu şekilde indirin:
    $ git clone --branch v1.0.0 https://github.com/junsun-hash/CADRES
  6. Klonlanmış dizine şu şekilde girin:
    $ cd CKADR
  7. CADRES deposunda sağlanan environment.yml dosyasını kullanarak özel bir Conda ortamı oluşturun. Aşağıdaki komutu çalıştırın ve kurulum sürecinin kesintisiz tamamlanmasına izin verin.
    $ conda env create -f environment.yml
  8. Yeni oluşturulan ortamı aşağıdaki komutu girerek etkinleştirin. Ortamın etkinleştirildiğini doğrulamak için terminal komutunun artık adını gösterdiğini kontrol edin.
    $ conda aktif CKADR
  9. Gerekli komut satırı araçlarının doğru kurulduğunu doğrulayın. Aşağıdaki komutları çalıştırın ve hata mesajı yerine sürüm numarası döndürdüğünü doğrulayın:
    $ python --sürüm
    $ samtools --versiyon
    $ gatk --yardım et
    $ yatak takımı --versiyonu
    $ pblat

    NOT: CADRES ortamında yer alan araçların tam seti, environment.yml dosyasına yapılan güncellemelere bağlı olarak biraz farklılık gösterebilir. Bir araç eksikse, ortamı yeniden oluşturun veya bağımlılık listesini gerektiğinde güncelleyin.
  10. Yeterli disk alanının olduğundan emin olun. Referans genomları, hizalama indeksleri ve ara BAM dosyaları için en az 100 GB boş alan olduğunu şu şekilde girerek doğrulayın:
    $ df -h
  11. Tüm çalışma, çıktı ve geçici dizinlerde yazma izinlerinin mevcut olduğunu bir test dosyası oluşturarak doğrulayın:
    $ dokun test_file.txt
  12. Dosyayı sonrasında şu şekilde girerek silin:
    $ rm test_file.txt

2. Veri hazırlığı

NOT: Bu protokolte kullanılan temsilci veri seti şunlardan oluşur: HEK293T doksisiklin indüklenebilir A3B–GFP hücresi; WGS 33×; zincire özgü çift uçlu RNA dizisi (2×150 bp, ≥60 M okuma/örnek); n = her koşul başına 3 biyolojik çoğaltma (DMSO vs. doksisiklin 72 saat). Tam veri: SRA PRJNA1211186. CADRES deposunda bir chr22 gösterim alt kümesi sağlanmıştır.

CKADR şunları gerektirir: (i) WGS (≥33×) veya WES (≥33×); (ii) zincire özgü, çift uçlu RNA dizisi (örnek başına ≥60 milyon okuma); (iii) her biri ≥2 biyolojik çoğaltının olduğu iki deneysel koşul.

  1. Referans genomunu ve notasyonunu hazırlayın.
    1. Ensembl veya benzer bir depodan referans genom (FASTA) ve GTF annotasyon dosyasını indirin. Önerilen referans genom Ensembl GRCh38 birincil montaj: https://ftp.ensembl.org/pub/release-111/fasta/homo_sapiens/dna/ ve önerilen GTF açıklaması GENCODE sürüm 45'tir:
      https://ftp.ebi.ac.uk/pub/databases/gencode/Gencode_human/release_45/.
    2. Referans FASTA'yı indeksleyin:
      $ samtools faidx FASTA_FILE.fa
      Kromozom isimlendirme kurallarının (örneğin "chr1" ile "1") tüm referans materyallerinde tutarlı olduğundan emin olun.
  2. Dizileme verilerini edinin.
    1. DNA-seq FASTQ dosyalarını (WGS veya WES) ≥33× derinlikte edinin.
    2. İki biyolojik koşulda ve en az iki biyolojik kopya içinde ipliğe özel, eşleştirilmiş uçlu RNA-seq FASTQ dosyalarını edinin; örnek başına ≥60 milyon okuma yapılabilir.
  3. DNA dizileme okumalarını BWA-MEM ile hizalayın.
    1. Bir BWA endeksi oluşturun:
      $ BWA Index Homo_sapiens. GRCh38.dna.primary_assembly.fa -p bwaindex -a bwtsw
    2. Hizalama ve BAM'a dönüştürün:
      $ bwa mem -R '@RG\tID:ID\tPL:platform\tLB:library\tSM:sample_name' bwaindex wgs_R1.fq.gz wgs_R2.fq.gz | samtools view -b > wgs.bam
  4. RNA dizileme okumalarını STAR ile hizalayın.
    1. STAR genom indeksi oluşturun:
      $ STAR --runMode genomeGenerate \
      --genomFastaFiles Homo_sapiens. GRCh38.dna.primary_assembly.fa \
      --genomDir STAR_index \
      --sjdbGTFfile Homo_sapiens. GRCh38.gtf
    2. RNA okumalarını hizala.
      $ STAR \
      --genomDir STAR_index \
      --readFilesCommand zcat \
      --readFilesIn rna_sample1.fq.gz rna_sample2.fq.gz \
      --sjdbGTFfile Homo_sapiens. GRCh38.gtf \
      --outSAMtype BAM Sıralanmamış \
      --outSAMmapqUnique 60 \
      --outFileNamePrefix pass1_

      NOT: Bu, hem notlu hem de yeni birleşimleri içeren bir splice-junction dosyası (pass1_SJ.out.tab) oluşturur.
    3. Yeni birleşimleri içeren STAR genom indeksini yeniden üretin:
      $ cat pass1_SJ.out.tab > SJ_all.tab
      $ STAR --runMode genomeGenerate \
      --genomFastaFiles Homo_sapiens. GRCh38.dna.primary_assembly.fa \
      --genomDir STAR_index_2pass \
      --sjdbGTFfile Homo_sapiens. GRCh38.gtf \
      --sjdbFileChrStartEnd SJ_all.tab
    4. Güncellenmiş indeks kullanılarak ikinci geçiş hizalamasını gerçekleştirin:
      $ STAR \
      --genomDir STAR_index_2pass \
      --readFilesCommand zcat \
      --readFilesIn rna_sample1.fq.gz rna_sample2.fq.gz \
      --sjdbGTFfile Homo_sapiens. GRCh38.gtf \
      --outSAMtype BAM SortedByCoordinate \
      --outSAMmapqUnique 60 \
      --outFileNamePrefix output_name
  5. Yardımcı referans kaynakları hazırla.
    1. (Tavsiye edilir) dbSNP VCF alın
      İnsan GRCh38 dbSNP VCF'sini (örneğin, dbSNP build 150) NCBI FTP sunucusundan indirin:
      https://ftp.ncbi.nih.gov/snp/latest_release/VCF/ İndirilmiş dosyayı (örneğin dbsnp_150.vcf.gz) çalışma dizinine yerleştirin.
      NOT: dbSNP'deki RNA kaynaklı girişler (molType="cDNA") gerçek RNA düzenleme noktalarını gizleyebilir. Bunları kullanarak hariç tutun:
      $ bcftools view -i 'INFO/molType!="cDNA"' dbsnp.vcf.gz -oz -o dbsnp_no_cDNA.vcf.gz
    2. (Tavsiye edilir) dbSNP VCF'yi sıralayın
      VCF'yi referans genom ve GATK ile uyumlu olacak şekilde sıralayın:
      $ gatk SortVcf \
      -Ben dbsnp_150.vcf.gz \
      -O dbsnp_150.sorted.vcf.gz \

      --dizi-sözlük Homo_sapiens. GRCh38.dict
    3. (Tavsiye edilir) Sıralanmış dbSNP VCF'yi indeksle
      Sıralanmış dbSNP VCF için bir indeks oluşturun:
      $ gatk IndexFeatureFile -I dbsnp_150.sorted.vcf.gz
      NOT: Eşleşen bir referans sözlüğü gereklidir. Dosya Homo_sapiens. GRCh38.dict eksik, aşağıdaki gibi oluşturun:
      $ gatk CreateSequenceDictionary \
      -R Homo_sapiens. GRCh38.dna.primary_assembly.fa \
      -Ah Homo_sapiens. GRCh38.dna.primary_assembly.dict
    4. (Tavsiye edilir) GnomAD germline VCF alın
      GRCh38 gnomAD germ hattı varyant siteleri VCF'yi şu adresten indirin: https://gnomad.broadinstitute.org/downloads Boru hattı için uygun genom VCF'yi kullanın (örneğin, gnomad.genomes.vX.X.sites.vcf.gz).
    5. (Tavsiye edilir) gnomAD VCF'yi sıralayın
      Uyumluluğu sağlamak için gnomAD VCF'yi aynı referans sözlüğüyle sıralayın:
      $ gatk SortVcf \
      -Ben gnomad.vcf.gz \
      -O gnomad.sorted.vcf.gz \
      --dizi-sözlük Homo_sapiens. GRCh38.dict
    6. (Tavsiye edilir) Sıralanmış gnomAD VCF'yi indeksle
      Sıralanmış gnomAD VCF için bir indeks oluşturun:
      $ gatk IndexFeatureFile -I gnomad.sorted.vcf.gz
      NOT: SortVcf çalıştırmadan önce kromozom isimlendirmesinin (örneğin "chr1" vs "1") referans FASTA ile eşleştiğinden emin olun.
  6. Bilinen bir RNA düzenleme referansı edinin.
    NOT: CADRES için uygun uyumlu bir REDIportal referans dosyası (rediportal.txt) CADRES deposu içinde derlenir ve doğrudan şu adresten indirilebilir:
    https://github.com/junsun-hash/CADRES/releases/tag/v1.0.0. Bu dosya, Step 3'te bilinen düzenleme olaylarının açıklaması için kullanılır.
  7. Gen açıklamalarını RefGene formatında hazırlayın. RefGene açıklamasını indirin (örneğin, UCSC'den refGene.txt.gz). Gerekirse dekompresyon yapın ve kromozom isimlerinin referans genomdakilerle örtüştüğünden emin olun.
    NOT: CADRES için uygun bir örnek CADRES deposu içinde derlenmiştir ve doğrudan şu adresten indirilebilir:
    https://github.com/junsun-hash/CADRES/releases/tag/v1.0.0

3. CADRES Analitik İş Akışının Yürütülmesi

NOT: Bölüm 3, Linux terminalinde CADRES Conda ortamı aktif iken yürütülür.

  1. Kalibrasyon ve Boost Yeniden Kalibrasyonu
    NOT: Adım 1, BAM dosyalarını standartlaştırır ve Boost yeniden kalibrasyonu gerçekleştirir—dbSNP, gnomAD ve orijinal düzenleme sinyallerini korumak için ön RNA düzenleme adayları setini içeren geliştirilmiş bir BQSR. Tüm RNA BAM dosyalarını boşluklarla ayrılmış olarak listeleyin. Çıktı: yeniden kalibre edilmiş BAM'ler (ek: _recalibration.bam) ve Boost aday siteler.
    1. 3.1. Adım çalıştırmak için:
      $ python pipeline_step1_calibration.py \
      --rna_bams /yol/to/rna_sample1.bam /path/to/rna_sample2.bam ... \
      --dna_bam /yol/wgs_normal.bam \
      --genom /path/to/hg38.fa \
      --known_snv /yol/to/dbsnp.sorted.vcf.gz \
      --output_dir ./output/step1_calibration \
      --ön ek project_demo

      NOT: Boost adayları, ön ortak DNA-RNA Mutect2 çağrısından oluşturulur (--max-events-in-region 4, sadece PASS filtresi; ek AF/kalite eşiği yok). Homopolimer ve tekrar filtreleme ise Adım 3.2'de ele alınır.
  2. Varyant çağrısı, kirlenme tahmini ve filtreleme
    NOT: Adım 3.2, ortak DNA-RNA varyant çağrısı ile kontaminasyon tahmini (gnomAD aracılığıyla) gerçekleştirir, ardından adayları homopolimer bağlamına ve PBLAT yeniden hizalamasına göre filtreler. Çıktı: {prefix}.final.vcf.
    1. 3.2. Adımı uygulamak için:
      $ python pipeline_step2_variant_calling.py \
      --rna_bams ./output/step1_calibration/rna_sample1_split_recalibration.bam ... \
      --dna_bam ./output/step1_calibration/DNA_processed_recalibration.bam \
      --genom /path/to/hg38.fa \
      --gnomad /path/to/gnomad.sorted.vcf.gz \
      --output_dir ./output/step2_variant_calling \
      --ön ek project_demo

      NOT: Bu adım, tüm örneklerde yüksek güvenliğe sahip RNA-DNA farklarını temsil eden son, sıkı şekilde filtrelenmiş varyant çağrı setini (project_demo.final.vcf) üretir. Ana parametreler: Mutect2 --minimum-median-base-quality 12, --max-events-in-region 4; PBLAT minbasequal 5; hepsi pipeline script'te önceden yapılandırılmıştır.
  3. İstatistiksel test ve fonksiyonel açıklama
    NOT: Adım 3.3, rMATS'tan (Benjamini-Hochberg FDR düzeltmesi) uyarlanmış bir GLMM kullanarak diferansiyel RNA düzenlemesini nicelikle sınırlandırır ve her siteyi gen bölgesi, gen sembolü ve bilinen düzenleme durumuyla notlar. Çıktı: {prefix}_Result.txt (P-değerleri ve FDR ile DVR'lar).
    PBLAT yeniden hizalama filtresi, birden fazla genomik lokusa aday eşlemelerini kaldırır ve tekrarlayan bölgelerde özgüllüğü artırır. Dahili THREAD_COUNT pipeline_step2_variant_calling.py'daki --threads bayrağı tarafından kontrol edilir.
    1. 3.3. Adım çalıştırmak için:
      $ python pipeline_step3_statistical_test.py \
      --group1_rna_bams ./output/step1_calibration/control_rep1.bam ... \
      --group2_rna_bams ./output/step1_calibration/treated_rep1.bam ... \
      --final_vcf ./output/step2_variant_calling/project_demo.final.vcf \
      --genom /path/to/hg38.fa \
      --known_snv /yol/to/dbsnp.sorted.vcf.gz \
      --known_editing /yol/rediportal.txt \
      --gene_anno /yol/to/refGene.txt \
      --output_dir ./output/step3_statistical_test \
      --etiketler Kontrol Tedavi Edildi

      NOT: Ana parametreler: samtools ampileup -q 30 (minimum eşleme kalitesi), -Q 17 (minimum baz kalitesi); Δψ kesme = 0.0001 ile rMATS-GLMM olasılık oranı testi, kopyalanma farkında çok değişkenli normal ceza (rho = 0.9) ile binomial logit bağlantısı; Benjamini-Hochberg FDR düzeltmesi; Hepsi pipeline script'te önceden yapılandırılmıştır
      Üç pipeline adımı da --threads bayrağı üzerinden çok iş parçacıklı yürütmeyi destekler (varsayılan: adım başına 4). Adım 2 ayrıca --contamination_threads (varsayılan: 2) kabul eder.

4. Sonuçların incelenmesi ve görselleştirmesi

  1. CADRES iş akışı tamamlandıktan sonra çıktı dizinine gidin. Ana sonuç dosyası {preek}_Result.txt, genomik koordinatlar, alleller, replika düzeyindeki allel sayıları, düzenleme kesirleri, gruplar arası farklar ve ilgili istatistiksel metrikler (P değeri ve FDR) dahil olmak üzere RNA üzerinde tespit edilen tüm Diferansiyel Varyantları (DVR) listeler. Gen düzeyinde açıklamalar (gen sembolü, bölge, zincir, varyant tipi, bilinen SNP/düzenleme durumu) da dahil edilmiştir. Eşlik eden özet dosya, {preek}_Result_summary.txt, her bir ikame türünün sayılarını ve bunların SNP DVR'ları, bilinen RNA düzenleme DVR'ları ve yeni DVR'lar olarak sınıflandırılmasını sağlar.
  2. (İsteğe bağlı) Post-analiz betiklerini çalıştırarak standart görselleştirmeler oluşturun. Bir R oturumu açın ve girin:
    R konsolu:
    kaynak("Post-analysis.R")
    Post-analysis.R yazısı https://github.com/junsun-hash/CADRES/'a dahildir.
  3. Bir dosya seçimi diyalogu görünecektir; {prefix}_Result.txt seçin. Senaryo altı PNG figürü üretir.
    NOT: Dosya seçimi diyalogu masaüstü R oturumu gerektirir. Başsız sunucularda, input_file değişkeni doğrudan (Post-analysis.R'nin 10. satırı) düzenleyin ve Rscript Post-analysis.R'yi çalıştırın.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Sonuçlar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

CADRES'i gerçekçi deneysel koşullarda değerlendirmek için 293T hücrelerinde indüklenebilir APOBEC3B (A3B) sistemi kullandık. 293T hücrelerine A3B-GFP ifade eden doksisiklin duyarlı lentiviral bir yapı getirildi ve puromisin ile stabil integrantlar seçildi. 72 saat boyunca doksisiklin ile indüksiyon, GFP floresansı ve artan A3B mRNA seviyeleriyle doğrulanan sağlam A3B-GFP ekspresyonu sağladı. Eşleştirilmiş indüklenmiş ve indüklenmemiş örnekler, gözlemlenen RNA-DNA farklılıklarının teknik ...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Tartışma

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Burada sunulan CADRES iş akışı, özellikle APOBEC enzimleri tarafından katalize edilen C>U deaminasyonu olmak üzere, yüksek spesifikliğe sahip diferansiyel RNA düzenleme olaylarını tespit etmek için kalibre edilmiş ve içsel tutarlı bir strateji sunar. Protokol içindeki birkaç adım, doğruluğu için çok önemlidir. Eşleştirilmiş genomik ve transkriptomik dizileme, gerçek RNA düzenlemelerini altta yatan DNA polimorfizmlerinden ayırmak için gereklidir; boost yeniden kalibrasyon prosedürü, temel...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Açıklamalar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

J.S., Z.D. ve C.Z., şu anda terapötik biyolojik ilaçların ticari geliştirilmesiyle meşgul olan Şanghay Biyolojik Ürünler Enstitüsü'nün çalışanlarıdır.

Teşekkürler

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma, Şanghay Bilim ve Teknoloji Komisyonu (23S11901100) tarafından finanse edilmiştir.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
BCFtoolsSamtools projesiN/ASürüm 1.21. Varyant çağrısı ve VCF manipülasyonu. URL: https://github.com/samtools/bcftools
BedtoolsQuinlan LabN/ASürüm 2.31.1. Genom aritmetik işlemleri. URL: https://github.com/arq5x/bedtools2
BiopythonBiopython projesiN/ASürüm 1.85. Moleküler biyoloji için Python araçları. URL: https://www.biopython.org
BWA-MEMGitHub (lh3/bwa)N/ASürüm 0.7.18. DNA-seq hizalama. URL: https://github.com/lh3/bwa
CADRES kaynak koduGitHub (junsun-hash/CADRES)N/ASürüm 1.0.0. CADRES boru hattı komut dosyaları. URL: https://github.com/junsun-hash/CADRES
Conda veya MinicondaAnaconda Inc.N/ASürüm 23.1. Paket ve ortam yöneticisi. URL: https://docs.conda.io/en/latest/miniconda.html
dbSNP GRCh38 VCFNCBIN/ASürüm 155. Yaygın germline varyantları veritabanı. URL: https://ftp.ncbi.nih.gov/snp/
GATK4Broad InstituteN/ASürüm 4.3.0.0. Genom Analiz Araç Takımı. URL: https://github.com/broadinstitute/gatk
GitSoftware Freedom ConservancyN/ASürüm 2.39. Sürüm kontrol sistemi. URL: https://git-scm.com
gnomAD GRCh38 VCFBroad InstituteN/ASürüm 3.1. Populasyon alel frekansları. URL: https://gnomad.broadinstitute.org
GTF açıklama dosyasıEnsemblN/ASürüm 109. GRCh38 için gen açıklaması. URL: https://www.ensembl.org
İnsan referans genomu GRCh38Ensembl/UCSCN/ASürüm 109. Referans genom montajı. URL: https://www.ensembl.org veya https://hgdownload.soe.ucsc.edu
Linux iş istasyonu veya sunucusuÇeşitliN/AUbuntu 20.04. x86_64 mimarisine ihtiyaç duyulur. URL: https://ubuntu.com
pblatUCSC Genom TarayıcısıN/ASürüm 2.5.1. Paralel BLAT yeniden hizalama. URL: https://github.com/ucscGenomeBrowser/kent
PicardBroad InstituteN/ASürüm 2.20.8. NGS veri manipülasyonu. URL: https://github.com/broadinstitute/picard
PythonPython Yazılım VakfıN/ASürüm 3.9.19. Programlama dili. URL: https://www.python.org
RR VakfıN/ASürüm 4.5.2. İstatistiksel hesaplama. URL: https://www.r-project.org
R paketi: forcatsCRANN/ASürüm 1.0.0. Faktör manipülasyonu. URL: https://cran.r-project.org/package=forcats
R paketi: ggplot2CRANN/ASürüm 4.0.1. Veri görselleştirme. URL: https://cran.r-project.org/package=ggplot2
R paketi: ggrepelCRANN/ASürüm 0.9.5. Metin etiketi itme. URL: https://cran.r-project.org/package=ggrepel
R paketi: lme4CRANN/ASürüm 1.1.35. Doğrusal karışık etkiler modelleri. URL: https://cran.r-project.org/package=lme4
R paketi: readrCRANN/ASürüm 2.1.5. Hızlı dosya okuma. URL: https://cran.r-project.org/package=readr
R paketi: stringrCRANN/ASürüm 1.6.0. Dize manipülasyonu. URL: https://cran.r-project.org/package=stringr
REDIportal referansıBologna ÜniversitesiN/ASürüm 2.0. A-to-I RNA düzenleme siteleri veritabanı. URL: http://srv00.recas.ba.infn.it/atlas/
RefGene açıklamasıUCSC Tablo TarayıcısıN/ASürüm 109. Gen yapısı açıklaması. URL: https://genome.ucsc.edu/cgi-bin/hgTables
SamtoolsSamtools projesiN/ASürüm 1.21. BAM dosyası manipülasyonu. URL: https://github.com/samtools/samtools
STAR hizalayıcıGitHub (alexdobin/STAR)N/ASürüm 2.7.11b. RNA-seq hizalama. URL: https://github.com/alexdobin/STAR

Yeniden basım ve izinler

Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste

İzin iste

Etiketler

RNA Editing DetectionAPOBEC EnzymesC To U EditingRNA Variant CallingBase Quality RecalibrationArtifact FilteringRNA Seq AnalysisWhole Genome Sequencing

İlgili makaleler