Articolo metodologico

Rilevamento ad alta precisione dei siti di editing dell'RNA utilizzando uno scanner calibrato differenziale di montaggio dell'RNA

DOI:

10.3791/71148

23 giugno 2026

In questo articolo

Sommario

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo protocollo descrive l'uso del Calibrated Differential RNA Editing Scanner (CADRES), un flusso di lavoro computazionale che integra chiamate varianti congiunti DNA–RNA, ricalibrazione ottimizzata per il segnale e modellazione statistica consapevole di repliche per identificare con grande precisione i siti di editing differenziale dell'RNA.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La delineazione accurata dell'editing dell'RNA rimane tecnicamente difficile perché le vere alterazioni post-trascrizionali devono essere distinte dalle varianti genomiche e dagli artefatti di sequenziamento. Questa difficoltà è particolarmente evidente per l'editing citidina-uridina catalizzato dagli enzimi APOBEC, dove variazioni miste di DNA e RNA oscurano il vero segnale di editing. Il Calibrated Differential RNA Editing Scanner (CADRES) fornisce un quadro computazionale strutturato per affrontare queste limitazioni attraverso l'interrogazione integrata delle varianti DNA–RNA e la conservazione mirata delle firme di editing autentiche. Questo protocollo presenta il flusso di lavoro CADRES, inclusa la preparazione dei dati, la chiamata congiunta di varianti dell'RNA, la ricalibrazione della qualità della base che preserva il segnale, il filtraggio degli artefatti e la valutazione differenziale del montaggio dell'RNA tra condizioni sperimentali. CADRES supporta il sequenziamento accoppiato di RNA-seq e del genoma completo o dell'esoma completo con replicazione biologica.  Una strategia di filtraggio a più stadi, che include la rimozione degli omopolimeri e lo screening paralogico basato su PBLAT, riduce sistematicamente i falsi positivi preservando gli eventi di montaggio a bassa frequenza. Combinando la calibrazione con la modellazione consapevole delle repliche, CADRI aumenta la precisione e la riproducibilità dell'analisi dell'editing dell'RNA, permettendo di interrogare le dinamiche di editing in contesti biologici diversi. Rispetto ai metodi consolidati, CADRI è progettato per migliorare la precisione nella rilevazione dell'editing dell'RNA, in particolare per gli eventi C-to-U mediati da APOBEC.

Introduzione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L'editing dell'RNA costituisce uno strato dinamico di regolazione post-trascrizionale che consente sostituzioni nucleotidiche specifiche all'interno dei trascritti di RNA senza alterare la sequenza di DNA sottostante. Nei metazoi, la deaminazione da adenosina-inosina (A>I) mediata dagli enzimi ADAR è la forma predominante e contribuisce alla diversificazione dei trascrizioni, alla stabilità dell'mRNA, alla modulazione immunitaria innata e alla funzioneneuronale 1,2. Citidina-a-uridina (C>U) (d'ora in poi "C>U" in contesto biologico; La deaminazione "C>T" nel contesto del sequenziamento), catalizzata dai membri della famiglia APOBEC, opera parallelamente a queste vie ed è implicata nel metabolismo lipidico, nella restrizione virale, nella mutagenesi e nei ruoli regolatori emergenti nella biologia immunitaria e oncologica 3,4,5,6,7. Lavori recenti hanno dimostrato che diversi enzimi APOBEC, tra cui APOBEC1, APOBEC3A e APOBEC3B (A3B), catalizzano l'editing dell'RNA in contesti fisiologici epatologici 3,4,7,8,9,10. APOBEC3 enzimi inducono anche l'editing del DNA, producendo firme mutazionali sovrapposte che complicano la discriminazione tra editing dell'RNA e variazionegenomica 8,10,11,12.

Il sequenziamento di nuova generazione ha permesso l'identificazione a livello di trascrittoma dei potenziali siti di editing dell'RNA, tuttavia distinguere vere modifiche da SNV genomici o rumore tecnico rimane difficile. Gli eventi A>I e C>U appaiono come sostituzioni A>G e C>T nelle librerie di cDNA e possono essere confusi da errori di priming, errori di polimerasi, artefatti di mappatura e cambiamenti di espressione specifici per il contesto. Risorse pubbliche come REDIportal13 catalogano milioni di siti A>I, mentre le annotazioni C>U rimangono scarse, riflettendo sia vincoli biologici che analitici. L'identificazione affidabile del montaggio C>U—soprattutto i cambiamenti tra le condizioni—rimane quindi un bisogno analitico insoddisfatto.

L'obiettivo principale del metodo qui presentato, il Calibrated Differential RNA Editing Scanner (CADRES), è l'identificazione precisa delle Varianti Differenziali sull'RNA (DVR): siti di editing che subiscono variazioni statisticamente significative nella profondità di montaggio tra due o più condizionidefinite 14. Nello sviluppo di questo protocollo, abbiamo cercato di affrontare due ostacoli persistenti. Innanzitutto, le vere modifiche dell'RNA devono essere distinte dalle varianti codificate nel DNA. In secondo luogo, le differenze di editing devono essere quantificate in modo statisticamente robusto tra i dataset di RNA-seq replicati biologicamente. L'innovazione centrale di CADRES risiede nell'integrazione della chiamata congiunta di varianti DNA/RNA con un trattamento calibrato delle varianti RNA durante la ricalibrazione del punteggio di qualità di base (BQSR). Questa strategia di "ricalibrazione del boost" preserva i nuovi siti di editing RNA scoperti durante la BQSR, prevenendo così un declassamento sistematico della qualità che comunemente erode la sensibilità per le modifiche a bassafrequenza 15,16,17. Questo approccio riduce i falsi negativi e migliora la specificità rispetto alle pipeline che si basano esclusivamente su database di editing RNA incompleti.

CADRES si inserisce in un panorama di metodi che affrontano diversi aspetti dell'analisi dell'editing dell'RNA. Artefatti di filtroSNPiR 18 e RVboost19 da set varianti solo a RNA; VaDiR 20 incorpora confronti DNA–RNA ma non modella la struttura replicata; rMATS-DVR21 esegue test differenziali basati su GLMM ma si basa esclusivamente su RNA-seq; e JACUSA/JACUSA222,23 supportano la rilevazione consapevole delle repliche ma non incorporano strategie di interrogazione o ricalibrazione congiunta DNA–RNA. CADRIS unifica la modellazione statistica consapevole delle repliche, la chiamata di varianti congiunti DNA/RNA e la ricalibrazione arricchita per i siti di editing de novo, fornendo un unico flusso di lavoro ottimizzato per rilevare l'editing RNA dipendente dalla condizione—inclusi gli eventi C>U collegati all'attivitàAPOBEC 10,11,12.

In questo contesto, gli utenti possono considerare CADRES appropriato quando il loro sistema sperimentale soddisfa i seguenti criteri. Innanzitutto, è disponibile il sequenziamento di RNA-seq accoppiato e del genoma intero o dell'esoma intero dagli stessi campioni, consentendo una rigorosa partizione degli eventi derivati da RNA da varianti codificate nel DNA. In secondo luogo, la questione biologica riguarda i cambiamenti nell'editing dell'RNA tra le condizioni — come l'induzione enzimatica, lo stress ambientale, le fasi dello sviluppo o gli stati patologici — dove la modellazione statistica della profondità allelica specifica tra repliche è essenziale. In terzo luogo, il ricercatore cerca una maggiore specificità nella rilevazione dell'editing C>U, dove distinguere gli eventi di RNA dalla mutagenesi del DNA guidata da APOBEC è indispensabile. CADRI è particolarmente prezioso in sistemi in cui l'attività APOBEC induce sia modifiche di RNA che di DNA, come dimostrato nei modelli A3Binduttibili 10, 11,12 e dove i metodi convenzionali basati solo sull'RNA mostrano tassi gonfiati di falsi positivi dovuti a SNV confondenti o artefatti a sequenza ripetitiva.

I CACTORES offrono diversi vantaggi pratici. La chiamata della variante congiunta DNA/RNA riduce i falsi positivi causati dal SNV. La ricalibrazione del boost preserva i veri segnali di modifica, inclusi eventi nuovi assenti nei database di riferimento. Il GLMM derivato da rMATS fornisce un quadro statisticamente di principio per l'analisi di editing differenziale tra repliche. Insieme, queste caratteristiche forniscono una piattaforma calibrata e ad alta precisione per studiare l'editing dinamico dell'RNA in contesti sperimentali e patologici. Nel nostro precedentestudio 14, CADRES è stato rigorosamente confrontato con metodi consolidati di rilevamento dell'editing dell'RNA, utilizzando sia dataset simulati in silico sia modelli reali di cellule A3B inducibili. Nella valutazione in silico, i CADRES hanno costantemente ottenuto punteggi di precisione di 0,85–0,95 e punteggi di precisione di 0,92–0,98 su tutti i numeri replicati. Il flusso di lavoro complessivo di CADRES è illustrato nella Figura 1.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo protocollo descrive un flusso di lavoro puramente computazionale di bioinformatica per identificare gli eventi di editing dell'RNA C>U utilizzando il framework CADRES. Tutti i passaggi vengono eseguiti all'interno di un ambiente Linux tramite la riga di comando. Vengono utilizzati solo dataset di sequenziamento pubblicamente disponibili e non sono coinvolti soggetti umani o vertebrati.

1. Impostazione dell'ambiente e installazione software

NOTA: I requisiti computazionali minimi per il flusso di lavoro CADRES sono i seguenti: CPU ≥ 8 core (consigliati 16 core), RAM ≥ 32 GB (64 GB consigliati per dataset a genoma completo) e spazio su disco ≥ 100 GB.

  1. Conferma che sia disponibile un sistema operativo Linux. Apri una finestra terminale e assicurati che siano disponibili i permessi per installare nell'ambiente utente attuale.
  2. Installa un gestore di pacchetti Conda se non è già presente nel sistema. Scarica un installatore per una distribuzione minima di Conda dal suo sito ufficiale. Esegui lo script di installazione seguendo le istruzioni a schermo.
  3. Verifica che Conda sia attivo inserendo il seguente comando e assicurati che il comando visualizzi un numero di versione valido.
    $ conda --versione
  4. Crea una directory funzionante per il flusso di lavoro CADRES. Naviga in questa directory utilizzando:
    $ cd /path/to/working_directory
  5. Scarica il codice sorgente di CADRES eseguendo:
    $ git clone --branch v1.0.0 https://github.com/junsun-hash/CADRES
  6. Inserisci la directory clonata eseguendo:
    $ cd CADER
  7. Crea un ambiente Conda dedicato utilizzando il file environment.yml fornito all'interno del repository CADRES. Esegui il seguente comando e lascia che il processo di installazione si completi senza interruzioni.
    $ conda env create -f environment.yml
  8. Attiva l'ambiente appena creato inserendo il seguente comando. Conferma che l'ambiente sia stato attivato controllando che il prompt del terminale ora mostri il suo nome.
    $ conda attiva CADRES
  9. Verifica che gli strumenti da riga di comando necessari siano stati installati correttamente. Esegui ogni comando qui sotto e conferma che restituisca un numero di versione invece di un messaggio di errore:
    $ python --versione
    $ samtools --versione
    $ gatk --aiuto
    $ Bedtools --versione
    $ pblat

    NOTA: L'insieme esatto di strumenti inclusi nell'ambiente CADRES può variare leggermente a seconda degli aggiornamenti del file environment.yml. Se manca uno strumento, ricrea l'ambiente o aggiorna la lista delle dipendenze secondo necessità.
  10. Assicurarsi che sia disponibile spazio su disco sufficiente. Conferma che esistono almeno 100 GB di spazio libero per genomi di riferimento, indici di allineamento e file BAM intermedi inserendo:
    $ df -h
  11. Conferma che i permessi di scrittura siano disponibili in tutte le directory di lavoro, output e temporanee creando un file di test:
    $ tocca test_file.txt
  12. Elimina il file successivamente inserendo:
    $ rm test_file.txt

2. Preparazione dei dati

NOTA: Il dataset rappresentativo utilizzato in questo protocollo è composto da: HEK293T cellule con A3B–GFP indotta dalla doxiciclina; WGS alle 33×; RNA-seq a estremità coppia specifica per filamento (2×150 bp, ≥60 letture/campione di 60 M); n = 3 repliche biologiche per condizione (DMSO vs. doxiciclina 72 h). Dati completi: SRA PRJNA1211186. Un sottoinsieme dimostrativo chr22 è fornito nel repository CADRES.

I CADER richiedono: (i) WGS (≥33×) o WES (≥33×); (ii) RNA-seq specifico per filamento, a estremità accoppiata (≥60 milioni di letture per campione); (iii) due condizioni sperimentali con ≥2 repliche biologiche ciascuna.

  1. Prepara il genoma di riferimento e l'annotazione.
    1. Scarica il file di genoma di riferimento (FASTA) e l'annotazione GTF da Ensembl o da un repository comparabile. Il genoma di riferimento raccomandato è l'assemblaggio primario Ensembl GRCh38: https://ftp.ensembl.org/pub/release-111/fasta/homo_sapiens/dna/ e l'annotazione GTF raccomandata è GENCODE release 45:
      https://ftp.ebi.ac.uk/pub/databases/gencode/Gencode_human/release_45/.
    2. Indicizza il riferimento FASTA:
      $ samtools faidx FASTA_FILE.fa
      Assicurati che le convenzioni di denominazione dei cromosomi (ad esempio, "chr1" contro "1") siano coerenti in tutti i materiali di riferimento.
  2. Ottieni i dati di sequenziamento.
    1. Ottieni file DNA-seq FASTQ (WGS o WES) con profondità ≥33×.
    2. Ottenere file FASTQ RNA-seq a estremità accoppiata specifici per il filamento con ≥60 milioni di letture per campione, in due condizioni biologiche e almeno due repliche biologiche per gruppo.
  3. Allinea le letture del sequenziamento del DNA usando BWA-MEM.
    1. Costruisci un indice BWA:
      Indice $ bwa Homo_sapiens. GRCh38.dna.primary_assembly.fa -p bwaindex -a bwtsw
    2. Allinea e converti in BAM:
      $ bwa mem -R '@RG\tID:ID\tPL:platform\tLB:library\tSM:sample_name' bwaindex wgs_R1.fq.gz wgs_R2.fq.gz | Vista samtools -b > wgs.bam
  4. Allinea le letture di sequenziamento dell'RNA usando STAR.
    1. Genera l'indice genomico STAR:
      $ STAR --runMode genomeGenerate \
      --genomeFastaFiles Homo_sapiens. GRCh38.dna.primary_assembly.fa \
      --genomeDir STAR_index \
      --sjdbGTFfile Homo_sapiens. GRCh38.gtf
    2. Align RNA reads
      $ STAR \
      --genomeDir STAR_index \
      --readFilesCommand zcat \
      --readFilesIn rna_sample1.fq.gz rna_sample2.fq.gz \
      --sjdbGTFfile Homo_sapiens. GRCh38.gtf \
      --outSAMtype BAM Non smistado \
      --outSAMmapqUnique 60 \
      --outFileNamePrefisso pass1_

      NOTA: Questo produce un file splice-junction (pass1_SJ.out.tab) contenente sia giunzioni annotate che nuove.
    3. Rigenerare l'indice genomico STAR incorporando giunzioni nuove:
      $ cat pass1_SJ.out.tab > SJ_all.tab
      $ STAR --runMode genomeGenerate \
      --genomeFastaFiles Homo_sapiens. GRCh38.dna.primary_assembly.fa \
      --genomeDir STAR_index_2pass \
      --sjdbGTFfile Homo_sapiens. GRCh38.gtf \
      --sjdbFileChrStartEnd SJ_all.tab
    4. Esegui l'allineamento del secondo passaggio usando l'indice aggiornato:
      $ STAR \
      --genomeDir STAR_index_2pass \
      --readFilesCommand zcat \
      --readFilesIn rna_sample1.fq.gz rna_sample2.fq.gz \
      --sjdbGTFfile Homo_sapiens. GRCh38.gtf \
      --outSAMtype BAM SortedByCoordinate \
      --outSAMmapqUnique 60 \
      --outFileNamePrefisso output_name
  5. Prepara risorse ausiliarie di riferimento.
    1. (Consigliato) Ottenere dbSNP VCF
      Scarica il VCF dbSNP umano GRCh38 (ad esempio, dbSNP build 150) dal server FTP NCBI:
      https://ftp.ncbi.nih.gov/snp/latest_release/VCF/ inserire il file scaricato (ad esempio, dbsnp_150.vcf.gz) nella cartella di lavoro.
      NOTA: Le voci derivate da RNA (molType="cDNA") in dbSNP possono mascherare i veri siti di editing dell'RNA. Escluderli utilizzando:
      $ bcftools view -i 'INFO/molType!="cDNA"' dbsnp.vcf.gz -Oz -o dbsnp_no_cDNA.vcf.gz
    2. (Consigliato) Ordina il VCF dbSNP
      Ordina il VCF in modo che sia compatibile con il genoma di riferimento e il GATK:
      $ gatk SortVcf \
      -Io dbsnp_150.vcf.gz \
      -O dbsnp_150.sorted.vcf.gz \

      --dizionario di sequenza Homo_sapiens. GRCh38.dict
    3. (Consigliato) Indicizza il dbSNP VCF ordinato
      Crea un indice per il VCF ordinato dbSNP:
      $ gatk IndexFeatureFile -I dbsnp_150.sorted.vcf.gz
      NOTA: È necessario un dizionario di riferimento corrispondente. Se il fascicolo Homo_sapiens. GRCh38.dict manca, generatelo come segue:
      $ gatk CreateSequenceDictionary \
      -R Homo_sapiens. GRCh38.dna.primary_assembly.fa \
      -O Homo_sapiens. GRCh38.dna.primary_assembly.detta
    4. (Consigliato) Ottenere VCF della linea germinale gnomAD
      Scarica il VCF dei siti varianti della linea germinale gnomAD di GRCh38 da: https://gnomad.broadinstitute.org/downloads Usa il genoma VCF appropriato per la pipeline (ad esempio, gnomad.genomes.vX.X.sites.vcf.gz).
    5. (Consigliato) Ordina il VCF gnomAD
      Ordina il VCF gnomAD usando lo stesso dizionario di riferimento per garantirne la compatibilità:
      $ gatk SortVcf \
      -Io gnomad.vcf.gz \
      -O gnomad.sorted.vcf.gz \
      --dizionario di sequenza Homo_sapiens. GRCh38.dict
    6. (Consigliato) Indicizza il VCF ordinato gnomAD
      Crea un indice per il VCF gnomAD ordinato:
      $ gatk IndexFeatureFile -I gnomad.sorted.vcf.gz
      NOTA: Assicurati che la denominazione dei cromosomi (ad esempio, "chr1" vs "1") corrisponda al riferimento FASTA prima di eseguire SortVcf.
  6. Ottieni un riferimento noto per l'editing dell'RNA.
    NOTA: Un file di riferimento REDIportal compatibile (rediportal.txt) adatto a CADRES è curato all'interno del repository CADRES e può essere scaricato direttamente da:
    https://github.com/junsun-hash/CADRES/releases/tag/v1.0.0. Questo file viene utilizzato per l'annotazione degli eventi di editing noti nel Passo 3.
  7. Prepara annotazioni geniche in formato RefGene. Scarica l'annotazione RefGene (ad esempio, refGene.txt.gz da UCSC). Scomprimi se necessario e assicurati che i nomi dei cromosomi corrispondano a quelli del genoma di riferimento.
    NOTA: Un esempio adatto a CADRES è curato all'interno del repository CCORES e può essere scaricato direttamente da:
    https://github.com/junsun-hash/CADRES/releases/tag/v1.0.0

3. Esecuzione del flusso di lavoro analitico CADRES

NOTA: La Sezione 3 viene eseguita nel terminale Linux con l'ambiente CADRES Conda attivato.

  1. Calibrazione e ricalibrazione della pressione
    NOTA: Il Passaggio 1 standardizza i file BAM ed esegue la ricalibrazione Boost—un BQSR migliorato che incorpora dbSNP, gnomAD e un set preliminare di candidati ad RNA per preservare segnali di editing autentici. Elenca tutti i file RNA BAM separati da spazi. Output: BAM ricalibrati (suffisso: _recalibration.bam) e siti candidati Boost.
    1. Per eseguire il Passo 3.1:
      $ Python pipeline_step1_calibration.py \
      --rna_bams /cammino/a/rna_sample1.bam /cammino/rna_sample2.bam ... \
      --dna_bam /cammino/a/wgs_normal.bam \
      --genoma /path/to/hg38.fa \
      --known_snv /percorso/di/dbsnp.sorted.vcf.gz \
      --output_dir ./output/step1_calibration \
      --prefisso project_demo

      NOTA: I candidati boost sono costruiti da un richiamo preliminare congiunto DNA-RNA Mutect2 (--max-events-in-region 4, solo filtro PASS; nessuna soglia AF/qualità aggiuntiva). L'omopolimero e il filtraggio ripetuto sono gestiti nello Step 3.2.
  2. Chiamata delle varianti, stima della contaminazione e filtraggio
    NOTA: Il Passaggio 3.2 esegue la chiamata congiunta di varianti DNA-RNA con stima della contaminazione (tramite gnomAD), quindi filtra i candidati per contesto omopolimerico e riallineamento PBLAT. Output: {prefisso}.final.vcf.
    1. Per eseguire il Passaggio 3.2:
      $ Python pipeline_step2_variant_calling.py \
      --rna_bams ./output/step1_calibration/rna_sample1_split_recalibration.bam ... \
      --dna_bam ./output/step1_calibration/DNA_processed_recalibration.bam \
      --genoma /path/to/hg38.fa \
      --gnomad /percorso/di/gnomad.sorted.vcf.gz \
      --output_dir ./output/step2_variant_calling \
      --prefisso project_demo

      NOTA: Questo passaggio produce il set finale di chiamate varianti rigorosamente filtrato (project_demo.final.vcf), che rappresenta differenze RNA-DNA ad alta fiducia su tutti i campioni. Parametri chiave: Mutect2 --minima-mediana-qualità-base-12, --max-eventi-in-regione-4; PBLAT minbasequal 5; Tutti sono preconfigurati nello script della pipeline.
  3. Test statistici e annotazione funzionale
    NOTA: Il Passo 3.3 quantifica l'editing differenziale dell'RNA utilizzando un GLMM adattato da rMATS (correzione Benjamini-Hochberg FDR) e annota ogni sito con la regione genica, il simbolo genico e lo stato di editing noto. Output: {prefisso}_Result.txt (DVR con valori P e FDR).
    Il filtro di riallineamento PBLAT rimuove candidati che mappano su più loci genomici, aumentando la specificità in regioni ripetitive. Il suo THREAD_COUNT interno è controllato dal flag --threads in pipeline_step2_variant_calling.py.
    1. Per eseguire il Passaggio 3.3:
      $ Python pipeline_step3_statistical_test.py \
      --group1_rna_bams ./output/step1_calibration/control_rep1.bam ... \
      --group2_rna_bams ./output/step1_calibration/treated_rep1.bam ... \
      --final_vcf ./output/step2_variant_calling/project_demo.final.vcf \
      --genoma /path/to/hg38.fa \
      --known_snv /percorso/di/dbsnp.sorted.vcf.gz \
      --known_editing /percorso/rediportal.txt \
      --gene_anno /sentiero/di/refGene.txt \
      --output_dir ./output/step3_statistical_test \
      --etichette Controllate

      NOTA: Parametri chiave: samtools mpileup -q 30 (qualità minima di mappatura), -Q 17 (qualità minima di base); test del rapporto di verosimiglianza rMATS-GLMM con cutoff Δψ = 0,0001, collegamento logit binomiale con penalità normale multivariata consapevole delle repliche (rho = 0,9); Correzione Benjamini-Hochberg FDR; Tutti sono preconfigurati nello script della pipeline
      Tutti e tre i passaggi della pipeline supportano l'esecuzione multithread tramite il flag --threads (predefinito: 4 per passo). Il Passaggio 2 accetta inoltre --contamination_threads (predefinito: 2).

4. Ispezione e visualizzazione dei risultati

  1. Dopo che il flusso di lavoro CADRES è terminato, naviga fino alla cartella di output. Il file principale dei risultati, {prefix}_Result.txt, elenca tutte le varianti differenziali sull'RNA (DVR) rilevate, inclusi coordinate genomiche, alleli, conteggi degli alleli a livello di replica, frazioni di modifica, differenze tra gruppi e metriche statistiche associate (valore P e FDR). Sono incluse anche annotazioni a livello genico (simbolo genico, regione, filamento, tipo di variante, SNP/stato di editing noto). Il file di riassunto allegato, {prefisso}_Result_summary.txt, fornisce conteggi di ogni tipo di sostituzione e la loro classificazione in SNP DVR, DVR noti per l'editing RNA e DVR innovativi.
  2. (Opzionale) Genera visualizzazioni standard eseguendo il post analysis script. Apri una sessione R e inserisci:
    R console:
    source("Post-analysis.R")
    Lo script Post-analysis.R è incluso in https://github.com/junsun-hash/CADRES/.
  3. Apparirà una finestra di dialogo per la selezione dei file; scegli {prefisso}_Result.txt. La sceneggiatura produce sei figure PNG.
    NOTA: La finestra di dialogo di selezione file richiede una sessione R sul desktop. Sui server headless, modifica direttamente la variabile input_file (riga 10 di Post-analysis.R) ed esegui Rscript Post-analysis.R.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Per valutare CADRES in condizioni sperimentali realistiche, abbiamo utilizzato un sistema di APOBEC3B inducibile (A3B) in 293 cellule T. Un costrutto lentivirale responsivo alla doxiciclina che esprime A3B-GFP è stato introdotto nelle cellule 293T, e sono stati selezionati integranti stabili con puromicina. L'induzione con doxiciclina per 72 ore ha prodotto un'espressione robusta di A3B-GFP, confermata dalla fluorescenza della GFP e dall'aumento dei livelli di mRNA di A3B. I campioni ind...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il flusso di lavoro CADRES presentato qui fornisce una strategia calibrata e internamente coerente per rilevare eventi differenziali di editing dell'RNA con alta specificità, in particolare la deaminazione C>U catalizzata dagli enzimi APOBEC. Diversi passaggi all'interno del protocollo sono fondamentali per la sua accuratezza. Il sequenziamento genomico e trasscrittomico abbinato è essenziale per distinguere le vere modifiche di RNA dai polimorfismi del DNA sottostante, mentre la procedu...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

J.S., Z.D. e C.Z. sono dipendenti dell'Istituto di Prodotti Biologici di Shanghai, un'entità attualmente impegnata nello sviluppo commerciale di biologici terapeutici.

Ringraziamenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo studio è stato finanziato dalla Commissione per la Scienza e la Tecnologia di Shanghai (23S11901100).

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
BCFtoolsSamtools projectN/AVersione 1.21. Chiamate di varianti e manipolazione VCF. URL: https://github.com/samtools/bcftools
BedtoolsQuinlan LabN/AVersione 2.31.1. Operazioni aritmetiche sul genoma. URL: https://github.com/arq5x/bedtools2
BiopythonBiopython projectN/AVersione 1.85. Strumenti Python per la biologia molecolare. URL: https://www.biopython.org
BWA-MEMGitHub (lh3/bwa)N/AVersione 0.7.18. Allineamento DNA-seq. URL: https://github.com/lh3/bwa
Codice sorgente CADRESGitHub (junsun-hash/CADRES)N/AVersione 1.0.0. Script del pipeline CADRES. URL: https://github.com/junsun-hash/CADRES
Conda o MinicondaAnaconda Inc.N/AVersione 23.1. Gestore di pacchetti e ambienti. URL: https://docs.conda.io/en/latest/miniconda.html
dbSNP GRCh38 VCFNCBIN/ABuild 155. Database di varianti germinali comuni. URL: https://ftp.ncbi.nih.gov/snp/
GATK4Broad InstituteN/AVersione 4.3.0.0. Toolkit per l'analisi del genoma. URL: https://github.com/broadinstitute/gatk
GitSoftware Freedom ConservancyN/AVersione 2.39. Sistema di controllo versione. URL: https://git-scm.com
gnomAD GRCh38 VCFBroad InstituteN/AVersione 3.1. Frequenze alleliche di popolazione. URL: https://gnomad.broadinstitute.org
File di annotazione GTFEnsemblN/ARilascio 109. Annotazzione dei geni per GRCh38. URL: https://www.ensembl.org
Genoma di riferimento umano GRCh38Ensembl/UCSCN/ARilascio 109. Assemblaggio del genoma di riferimento. URL: https://www.ensembl.org o https://hgdownload.soe.ucsc.edu
Workstation o server LinuxVariN/AUbuntu 20.04. Architettura x86_64 richiesta. URL: https://ubuntu.com
pblatUCSC Genome BrowserN/AVersione 2.5.1. Riallineamento BLAT parallelo. URL: https://github.com/ucscGenomeBrowser/kent
PicardBroad InstituteN/AVersione 2.20.8. Manipolazione dati NGS. URL: https://github.com/broadinstitute/picard
PythonPython Software FoundationN/AVersione 3.9.19. Linguaggio di programmazione. URL: https://www.python.org
RR FoundationN/AVersione 4.5.2. Computazione statistica. URL: https://www.r-project.org
Pacchetto R: forcatsCRANN/AVersione 1.0.0. Manipolazione dei fattori. URL: https://cran.r-project.org/package=forcats
Pacchetto R: ggplot2CRANN/AVersione 4.0.1. Visualizzazione dei dati. URL: https://cran.r-project.org/package=ggplot2
Pacchetto R: ggrepelCRANN/AVersione 0.9.5. Ripulsione delle etichette di testo. URL: https://cran.r-project.org/package=ggrepel
Pacchetto R: lme4CRANN/AVersione 1.1.35. Modelli a effetti misti lineari. URL: https://cran.r-project.org/package=lme4
Pacchetto R: readrCRANN/AVersione 2.1.5. Lettura rapida di file. URL: https://cran.r-project.org/package=readr
Pacchetto R: stringrCRANN/AVersione 1.6.0. Manipolazione delle stringhe. URL: https://cran.r-project.org/package=stringr
Riferimento REDIportalUniversità di BolognaN/AVersione 2.0. Database di siti di editing dell'RNA A-to-I. URL: http://srv00.recas.ba.infn.it/atlas/
Annotazione RefGeneUCSC Table BrowserN/ARilascio 109. Annotazzione della struttura del gene. URL: https://genome.ucsc.edu/cgi-bin/hgTables
SamtoolsSamtools projectN/AVersione 1.21. Manipolazione file BAM. URL: https://github.com/samtools/samtools
Allineatore STARGitHub (alexdobin/STAR)N/AVersione 2.7.11b. Allineamento RNA-seq. URL: https://github.com/alexdobin/STAR

Ristampe e permessi

Richiedi il permesso di riutilizzare il testo o le figure di questo articolo JoVE

Richiedi permesso

Tag

RNA Editing DetectionAPOBEC EnzymesC To U EditingRNA Variant CallingBase Quality RecalibrationArtifact FilteringRNA Seq AnalysisWhole Genome Sequencing

Articoli correlati