Methodenartikel

Hoogprecisiedetectie van RNA-bewerkingsplaatsen met behulp van gekalibreerde differentiële RNA-bewerkingsscanner

DOI:

10.3791/71148

23 juni 2026

In dit artikel

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dit protocol beschrijft het gebruik van de Calibrated Differential RNA Editing Scanner (CADRES), een computationele workflow die DNA–RNA joint variant calling, signaalgeoptimaliseerde herkalibratie en replicate-bewuste statistische modellering integreert om differentiële RNA-bewerkingsplaatsen met hoge precisie te identificeren.

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Nauwkeurige afbakening van RNA-bewerking blijft technisch uitdagend, omdat echte post-transcriptionele veranderingen moeten worden onderscheiden van genomische varianten en sequencing-artefacten. Deze moeilijkheid is vooral groot bij cytidine-naar-uridine bewerking die wordt gekatalyseerd door APOBEC-enzymen, waarbij vermengde DNA- en RNA-veranderingen het werkelijke bewerkingssignaal verhullen. De Calibrated Differential RNA Editing Scanner (CADRES) biedt een gestructureerd computationeel kader om deze beperkingen aan te pakken door geïntegreerde DNA–RNA-variant onderzoeken en gerichte bewaring van authentieke bewerkingshandtekeningen. Dit protocol presenteert de CADRES-workflow, inclusief datavoorbereiding, gezamenlijke RNA-variant calling, signaalbehoudende basiskwaliteit herkalibratie, artefactfiltering en differentiële beoordeling van RNA-bewerking tussen experimentele condities. CADRES ondersteunt gepaarde RNA-seq en whole-genome of whole-exome sequencing met biologische replicatie.  Een meerstapsfilterstrategie, waaronder homopolymeerverwijdering en PBLAT-gebaseerde paraloogscreening, vermindert systematisch vals-positieven terwijl laagfrequente bewerkingsgebeurtenissen behouden blijven. Door kalibratie te combineren met replicate-bewuste modellering verhoogt CADRES de precisie en reproduceerbaarheid van RNA-editing analyse, waardoor bewerkingsdynamiek in diverse biologische contexten kan worden onderzocht. In vergelijking met gevestigde methoden is CADRES ontworpen om de precisie in RNA-bewerkingsdetectie te verbeteren, met name voor APOBEC-gemedieerde C-naar-U-gebeurtenissen.

Inleiding

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

RNA-editing vormt een dynamische laag van post-transcriptionele regulatie die plaats-specifieke nucleotidesubstituties binnen RNA-transcripten mogelijk maakt zonder de onderliggende DNA-sequentie te veranderen. Bij metazoën is adenosine-naar-inosine (A>I) deaminering, gemedieerd door ADAR-enzymen, de overheersende vorm en draagt het bij aan transcriptdiversificatie, mRNA-stabiliteit, aangeboren immuunmodulatie en neuronale functie 1,2. Cytidine-naar-uridine (C>U) (hierna "C>U" in biologische context; "C>T" in sequencingcontext) deaminering, gekatalyseerd door leden van de APOBEREC-familie, werkt naast deze routes en is betrokken bij lipidmetabolisme, virale restrictie, mutagenese en opkomende regulerende rollen in immuun- en kankerbiologie 3,4,5,6,7. Recent onderzoek heeft aangetoond dat verschillende APOBEREC-enzymen, waaronder APOBEC1, APOBEC3A en APOBEC3B (A3B), RNA-bewerking katalyseren in fysiologische en pathologische contexten 3,4,7,8,9,10. APOBEC3 enzymen induceren ook DNA-bewerking, waarbij overlappende mutatiesignaturen ontstaan die het onderscheiden van RNA-editing en genomische variatie bemoeilijken 8,10,11,12.

Next-generation sequencing heeft transcriptome-wijde identificatie van potentiële RNA-bewerkingsplaatsen mogelijk gemaakt, maar het onderscheid maken van echte bewerkingen van genomische SNV's of technische ruis blijft moeilijk. A>I- en C>U-gebeurtenissen verschijnen als A>G- en C>T-substituties in cDNA-bibliotheken en kunnen worden verstoord door mispriming, polymerasefouten, mapping artifacten en contextspecifieke expressieveranderingen. Publieke bronnen zoals REDIportal13 catalogiseren miljoenen A>I-sites, terwijl C>U-annotaties schaars blijven en zowel biologische als analytische beperkingen weerspiegelen. Betrouwbare identificatie van C>U-bewerking—vooral veranderingen tussen omstandigheden—blijft daarom een onvervulde analytische behoefte.

Het overkoepelende doel van de hier gepresenteerde methode, de Calibrated Differential RNA Editing Scanner (CADRES), is de precieze identificatie van Differentiële Varianten op RNA (DVR's): bewerkingsplaatsen die statistisch significante veranderingen in bewerkingsdiepte ondergaan tussen twee of meer gedefinieerde condities14. Bij het ontwikkelen van dit protocol probeerden we twee hardnekkige obstakels aan te pakken. Ten eerste moeten bona fide RNA-bewerkingen worden onderscheiden van DNA-gecodeerde varianten. Ten tweede moeten bewerkingsverschillen statistisch robuust worden gekwantificeerd over biologisch gerepliceerde RNA-seq datasets. De centrale innovatie van CADRES ligt in de integratie van gezamenlijke DNA/RNA-variant calling met een gekalibreerde behandeling van RNA-varianten tijdens base-quality score recalibratie (BQSR). Deze "boost recalibration"-strategie behoudt nieuw ontdekte RNA-bewerkingsplaatsen tijdens BQSR, waardoor systematische kwaliteitsdowngrading voorkomt die vaak de gevoeligheid voor laagfrequente bewerkingenaantast 15,16,17. Deze aanpak vermindert vals-negatieven en verbetert de specificiteit in vergelijking met pijplijnen die uitsluitend vertrouwen op onvolledige RNA-bewerkingsdatabases.

CADRES bevindt zich binnen een landschap van methoden die elk verschillende aspecten van RNA-bewerkingsanalyse behandelen. SNPiR18 en RVboost19 filterartefacten uit RNA-only variantsets; VaDiR20 bevat DNA–RNA-vergelijkingen, maar modelleert geen replicatstructuur; rMATS-DVR21 voert GLMM-gebaseerde differentiële tests uit, maar vertrouwt uitsluitend op RNA-seq; en JACUSA/JACUSA222,23 ondersteunen replicate-bewuste detectie, maar bevatten geen gezamenlijke DNA–RNA-interrogatie- of herkalibratiestrategieën. CADRES verenigt replicate-bewuste statistische modellering, gezamenlijke DNA/RNA-variant calling en rekalibratie verrijkt voor de novo bewerkingsplaatsen, en biedt zo één workflow geoptimaliseerd voor het detecteren van conditie-afhankelijke RNA-bewerking—inclusief C>U-gebeurtenissen gekoppeld aan APOBEC-activiteit 10,11,12.

In deze context kunnen gebruikers CADRES geschikt achten wanneer hun experimentele systeem aan de volgende criteria voldoet. Ten eerste is gepaarde RNA-seq en whole-genome of whole-exome sequencing beschikbaar uit dezelfde monsters, waardoor een rigoureuze verdeling van RNA-afgeleide gebeurtenissen uit DNA-gecodeerde varianten mogelijk is. Ten tweede betreft de biologische vraag veranderingen in RNA-bewerking over aandoeningen heen—zoals enzyminductie, omgevingsstress, ontwikkelingsstadia of ziektetoestanden—waarbij statistische modellering van allelspecifieke diepte tussen replicaten essentieel is. Ten derde streeft de onderzoeker naar een verhoogde specificiteit in C>U-editatiedetectie, waarbij het onderscheiden van RNA-gebeurtenissen van APOBEC-gedreven DNA-mutagenese onmisbaar is. CADRES is vooral waardevol in systemen waar APOBEC-activiteit zowel RNA- als DNA-bewerkingen induceert, zoals aangetoond in induceerbare A3B-modellen 10,11,12 en waar conventionele RNA-only methoden opgeblazen vals-positieve percentages vertonen door verwarrende SNV's of repetitieve sequentie-artefacten.

CADRES biedt verschillende praktische voordelen. Het gezamenlijk DNA/RNA-variant calling vermindert door SNV veroorzaakte vals-positieven. Boost-herkalibratie behoudt echte bewerkingssignalen, inclusief nieuwe gebeurtenissen die ontbreken in referentiedatabases. De door rMATS afgeleide GLMM biedt een statistisch principieel kader voor differentiële bewerkingsanalyse over replicaten heen. Samen vormen deze kenmerken een gekalibreerd, hoogprecisieplatform voor het bestuderen van dynamische RNA-bewerking in experimentele en ziekteomgevingen. In onze vorige studie14 werd CADRES rigoureus vergeleken met gevestigde RNA-bewerkingsdetectiemethoden, waarbij zowel in silico gesimuleerde datasets als realistische induceerbare A3B-celmodellen werden gebruikt. In de in silico-evaluatie behaalde CADRES consequent precisiescores van 0,85–0,95 en nauwkeurigheidsscores van 0,92–0,98 over replicatieve getallen. De algemene CADRES-workflow wordt geïllustreerd in Figuur 1.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dit protocol beschrijft een puur computationele bioinformatica-workflow voor het identificeren van C>U RNA-bewerkingsgebeurtenissen met behulp van het CADRES-framework. Alle stappen worden uitgevoerd binnen een Linux-omgeving met behulp van de opdrachtregel. Er worden alleen openbaar beschikbare sequencingdatasets gebruikt, en er zijn geen menselijke of gewervelde proefpersonen betrokken.

1. Omgevingsinstallatie en software-installatie

OPMERKING: De minimale rekenvereisten voor de CADRES-workflow zijn als volgt: CPU ≥ 8 cores (aanbevolen 16 cores), RAM ≥ 32 GB (64 GB aanbevolen voor datasets voor het hele genoom), en schijfruimte ≥ 100 GB.

  1. Bevestig dat er een Linux-besturingssysteem beschikbaar is. Open een terminalvenster en zorg dat er toestemming is om te installeren in de huidige gebruikersomgeving.
  2. Installeer een Conda-pakketbeheerder als deze nog niet op het systeem aanwezig is. Download een installer voor een minimale Conda-distributie van de officiële website. Voer het installatiescript uit volgens de instructies op het scherm.
  3. Controleer of Conda actief is door het volgende commando in te voeren en zorg dat het commando een geldig versienummer afdrukt.
    $ conda --versie
  4. Maak een werkmap aan voor de CADRES-workflow. Navigeer in deze directory met:
    $ cd /pad/naar/working_directory
  5. Download de broncode van CADRES door het volgende uit te voeren:
    $ git-kloon --tak v1.0.0 https://github.com/junsun-hash/CADRES
  6. Voer de gekloonde map in door het volgende uit te voeren:
    $ cd KADERS
  7. Maak een speciale Conda-omgeving aan met het environment.yml-bestand dat in de CADRES-repository wordt geleverd. Voer het volgende commando uit en laat het installatieproces zonder onderbreking worden voltooid.
    $ conda env create -f environment.yml
  8. Activeer de nieuw aangemaakte omgeving door het volgende commando in te voeren. Bevestig dat de omgeving is geactiveerd door te controleren of de terminalprompt nu zijn naam toont.
    $ conda activate CADRES
  9. Controleer of de benodigde commandoregeltools correct zijn geïnstalleerd. Voer elk commando hieronder uit en bevestig dat ze een versienummer teruggeven in plaats van een foutmelding:
    $ python --versie
    $ samtools --versie
    $ gatk --help
    $ bedtools --versie
    $ pblat

    OPMERKING: De exacte set tools die in de CADRES-omgeving zijn opgenomen, kan enigszins verschillen afhankelijk van updates van het environment.yml-bestand. Als een tool ontbreekt, maak dan de omgeving opnieuw aan of werk de afhankelijkheidslijst bij indien nodig.
  10. Zorg ervoor dat er voldoende schijfruimte beschikbaar is. Bevestig dat er ten minste 100 GB vrije ruimte bestaat voor referentiegenomen, alignment-indices en tussenliggende BAM-bestanden door in te voeren:
    $ df -h
  11. Bevestig dat schrijfrechten beschikbaar zijn in alle werk-, uitvoer- en tijdelijke mappen door een testbestand aan te maken:
    $ raak test_file.txt
  12. Verwijder het bestand daarna door in te voeren:
    $ rm test_file.txt

2. Datavoorbereiding

OPMERKING: De representatieve dataset die in dit protocol wordt gebruikt bestaat uit: HEK293T cellen met doxycycline-induceerbare A3B–GFP; WGS op 33×; streng-specifiek gepaard RNA-seq (2×150 bp, ≥60 M lees/monster); n = 3 biologische replicaten per aandoening (DMSO versus doxycycline 72 uur). Volledige gegevens: SRA PRJNA1211186. Een chr22-demonstratiesubset wordt geleverd in de CADRES-repository.

CADRES vereist: (i) WGS (≥33×) of WES (≥33×); (ii) strengspecifiek, gepaard RNA-seq (≥60 miljoen lezingen per monster); (iii) twee experimentele condities met elk ≥2 biologische replicaten.

  1. Bereid het referentiegenoom en de annotatie voor.
    1. Download het referentiegenoom (FASTA) en het GTF-annotatiebestand van Ensembl of een vergelijkbare repository. Het aanbevolen referentiegenoom is Ensembl GRCh38 primaire assemblage: https://ftp.ensembl.org/pub/release-111/fasta/homo_sapiens/dna/ en de aanbevolen GTF-annotatie is GENCODE release 45:
      https://ftp.ebi.ac.uk/pub/databases/gencode/Gencode_human/release_45/.
    2. Indexeer de referentie FASTA:
      $ samtools faidx FASTA_FILE.fa
      Zorg ervoor dat chromosoomnaamconventies (bijvoorbeeld "chr1" versus "1") consistent zijn over alle referentiematerialen.
  2. Verkrijg de sequencinggegevens.
    1. Verkrijg DNA-seq FASTQ-bestanden (WGS of WES) met ≥33× diepte.
    2. Verkrijg strengspecifieke, gepaarde RNA-seq FASTQ-bestanden met ≥60 miljoen lezingen per monster, over twee biologische condities en ten minste twee biologische replicaties per groep.
  3. Lijn de DNA-sequencing-reads uit met BWA-MEM.
    1. Bouw een BWA-index:
      $ BWA index Homo_sapiens. GRCh38.dna.primary_assembly.fa -p bwaindex -a bwtsw
    2. Aligneren en converteren naar BAM:
      $ bwa mem -R '@RG\tID:ID\tPL:platform\tLB:library\tSM:sample_name' bwaindex wgs_R1.fq.gz wgs_R2.fq.gz | SamTools View -b > wgs.bam
  4. Lijn de RNA-sequencing-reads uit met STAR.
    1. Genereer de STAR-genoomindex:
      $ STAR --runMode genomeGenerate \
      --genomeFastaFiles Homo_sapiens. GRCh38.dna.primary_assembly.fa \
      --genomeDir STAR_index \
      --sjdbGTFfile Homo_sapiens. GRCh38.gtf
    2. Align RNA-lezingen
      $ STAR \
      --genomeDir STAR_index \
      --readFilesCommand zcat \
      --readFilesIn rna_sample1.fq.gz rna_sample2.fq.gz \
      --sjdbGTFfile Homo_sapiens. GRCh38.gtf \
      --outSAMtype BAM Ongesorteerd \
      --outSAMmapqUnique 60 \
      --outFileNamePrefix pass1_

      OPMERKING: Dit levert een splice-junction file (pass1_SJ.out.tab) op dat zowel geannoteerde als nieuwe junctions bevat.
    3. Regenereer de STAR-genoomindex met nieuwe verbindingen:
      $ kat pass1_SJ.out.tab > SJ_all.tab
      $ STAR --runMode genomeGenerate \
      --genomeFastaFiles Homo_sapiens. GRCh38.dna.primary_assembly.fa \
      --genomeDir STAR_index_2pass \
      --sjdbGTFfile Homo_sapiens. GRCh38.gtf \
      --sjdbFileChrStartEnd SJ_all.tab
    4. Voer de tweede doorgang uitlijning uit met behulp van de bijgewerkte index:
      $ STAR \
      --genomeDir STAR_index_2pass \
      --readFilesCommand zcat \
      --readFilesIn rna_sample1.fq.gz rna_sample2.fq.gz \
      --sjdbGTFfile Homo_sapiens. GRCh38.gtf \
      --outSAMtype BAM GesortedByCoördinaat \
      --outSAMmapqUnique 60 \
      --outFileNamePrefix output_name
  5. Bereid aanvullende referentiebronnen voor.
    1. (Aanbevolen) Verkrijg dbSNP VCF
      Download de menselijke GRCh38 dbSNP VCF (bijvoorbeeld dbSNP build 150) van de NCBI FTP-server:
      https://ftp.ncbi.nih.gov/snp/latest_release/VCF/ Plaats het gedownloade bestand (bijvoorbeeld dbsnp_150.vcf.gz) in de werkmap.
      OPMERKING: RNA-afgeleide vermeldingen (molType="cDNA") in dbSNP kunnen echte RNA-bewerkingsplaatsen maskeren. Sluit ze uit met:
      $ bcftools view -i 'INFO/molType!="cDNA"' dbsnp.vcf.gz -Oz -o dbsnp_no_cDNA.vcf.gz
    2. (Aanbevolen) Sorteer de dbSNP VCF
      Sorteer de VCF zodat deze compatibel is met het referentiegenoom en GATK:
      $ gatk SortVcf \
      -Ik dbsnp_150.vcf.gz \
      -O dbsnp_150.sorted.vcf.gz \

      --sequentie-woordenboek Homo_sapiens. GRCh38.dict
    3. (Aanbevolen) Indexeer de gesorteerde dbSNP VCF
      Maak een index aan voor de gesorteerde dbSNP VCF:
      $ gatk IndexFeatureFile -I dbsnp_150.sorted.vcf.gz
      OPMERKING: Een bijpassend referentiewoordenboek is vereist. Als het bestand Homo_sapiens. GRCh38.dict ontbreekt, genereer deze als volgt:
      $ gatk CreateSequenceDictionary \
      -R Homo_sapiens. GRCh38.dna.primary_assembly.fa \
      -O Homo_sapiens. GRCh38.dna.primary_assembly.dict
    4. (Aanbevolen) Verkrijg gnomAD kiembaal-VCF
      Download de GRCh38 gnomAD kiemlijnvariantsites VCF van: https://gnomad.broadinstitute.org/downloads Gebruik het genoom-VCF dat geschikt is voor de pijplijn (bijvoorbeeld gnomad.genomes.vX.X.sites.vcf.gz).
    5. (Aanbevolen) Sorteer de gnomAD VCF
      Sorteer de gnomAD VCF met hetzelfde referentiewoordenboek om compatibiliteit te waarborgen:
      $ gatk SortVcf \
      -Ik gnomad.vcf.gz \
      -O gnomad.sorted.vcf.gz \
      --sequentie-woordenboek Homo_sapiens. GRCh38.dict
    6. (Aanbevolen) Indexeer de gesorteerde gnomAD VCF
      Maak een index voor de gesorteerde gnomAD VCF:
      $ gatk IndexFeatureFile -I gnomad.sorted.vcf.gz
      OPMERKING: Zorg ervoor dat chromosoomnaamgeving (bijvoorbeeld "chr1" versus "1") overeenkomt met de referentie-FASTA voordat je SortVcf uitvoert.
  6. Verkrijg een bekende RNA-bewerkingsreferentie.
    OPMERKING: Een compatibel REDIportal-referentiebestand (rediportal.txt) geschikt voor CADRES wordt binnen de CADRES-repository samengesteld en kan direct worden gedownload van:
    https://github.com/junsun-hash/CADRES/releases/tag/v1.0.0. Dit bestand wordt gebruikt voor het annoteren van bekende bewerkingsgebeurtenissen in Stap 3.
  7. Bereid genannotaties voor in RefGene-formaat. Download de RefGene-annotatie (bijvoorbeeld refGene.txt.gz van UCSC). Decomprimeer indien nodig en zorg ervoor dat chromosoomnamen overeenkomen met die in het referentiegenoom.
    OPMERKING: Een voorbeeld dat geschikt is voor CADRES is samengesteld binnen de CADRES-repository en kan direct worden gedownload van:
    https://github.com/junsun-hash/CADRES/releases/tag/v1.0.0

3. Uitvoering van de CADRES Analytische Workflow

OPMERKING: Sectie 3 wordt uitgevoerd in de Linux-terminal met de CADRES Conda-omgeving geactiveerd.

  1. Kalibratie en boost-herkalibratie
    OPMERKING: Stap 1 standaardiseert BAM-bestanden en voert Boost-herkalibratie uit—een verbeterde BQSR die dbSNP, gnomAD en een voorlopige set RNA-bewerkingskandidaten integreert om echte bewerkingssignalen te behouden. Vermeld alle RNA BAM-bestanden gescheiden op spaties. Output: herkalibreerde BAM's (achtervoegsel: _recalibration.bam) en Boost-kandidaatsites.
    1. Om stap 3.1 uit te voeren:
      $ python pipeline_step1_calibration.py \
      --rna_bams /pad/naar/rna_sample1.bam /pad/naar/rna_sample2.bam ... \
      --dna_bam /path/to/wgs_normal.bam \
      --genoom /path/to/hg38.fa \
      --known_snv /pad/naar/dbsnp.sorted.vcf.gz \
      --output_dir ./output/step1_calibration \
      --voorvoegsel project_demo

      OPMERKING: Boostkandidaten worden opgebouwd uit een voorlopige gezamenlijke DNA-RNA Mutect2-roep (--max-events-in-region 4, alleen PASS-filter; geen extra AF/kwaliteitsdrempels). Homopolymeer- en herhaalfiltering worden behandeld in Stap 3.2.
  2. Variant calling, contaminatie-schatting en filtering
    OPMERKING: Stap 3.2 voert gezamenlijke DNA-RNA variant calling uit met contaminatie-schatting (via gnomAD), waarna kandidaten worden gefilterd op homopolymeercontext en PBLAT-heruitlijning. Uitvoer: {voorvoegsel}.final.vcf.
    1. Om Stap 3.2 uit te voeren:
      $ python pipeline_step2_variant_calling.py \
      --rna_bams ./output/step1_calibration/rna_sample1_split_recalibration.bam ... \
      --dna_bam ./output/step1_calibration/DNA_processed_recalibration.bam \
      --genoom /path/to/hg38.fa \
      --gnomad /pad/naar/gnomad.sorted.vcf.gz \
      --output_dir ./output/step2_variant_calling \
      --voorvoegsel project_demo

      OPMERKING: Deze stap levert de uiteindelijke, streng gefilterde variantroepset (project_demo.final.vcf) op, die de verschillen tussen RNA-DNA met hoge betrouwbaarheid over alle monsters vertegenwoordigt. Belangrijke parameters: Mutect2 --min-mediaan-basiskwaliteit 12, --max-gebeurtenissen-in-regio 4; PBLAT minbasequal 5; Allemaal zijn ze vooraf geconfigureerd in het pipeline-script.
  3. Statistisch testen en functionele annotatie
    OPMERKING: Stap 3.3 kwantificeert differentiële RNA-bewerking met een GLMM aangepast van rMATS (Benjamini-Hochberg FDR-correctie), en annoteert elke locatie met genregio, gensymbool en bekende bewerkingsstatus. Uitvoer: {voorvoegsel}_Result.txt (DVR's met P-waarden en FDR).
    Het PBLAT-re-aligneringsfilter verwijdert kandidaten die naar meerdere genomische loci worden gekoppeld, wat de specificiteit in repetitieve regio's verbetert. De interne THREAD_COUNT wordt aangestuurd door de --threads-vlag in pipeline_step2_variant_calling.py.
    1. Om stap 3.3 uit te voeren:
      $ python pipeline_step3_statistical_test.py \
      --group1_rna_bams ./output/step1_calibration/control_rep1.bam ... \
      --group2_rna_bams ./output/step1_calibration/treated_rep1.bam ... \
      --final_vcf ./output/step2_variant_calling/project_demo.final.vcf \
      --genoom /path/to/hg38.fa \
      --known_snv /pad/naar/dbsnp.sorted.vcf.gz \
      --known_editing /pad/naar/rediportal.txt \
      --gene_anno /pad/naar/refGene.txt \
      --output_dir ./output/step3_statistical_test \
      --labelt Gecontroleerd

      OPMERKING: Belangrijke parameters: samtools mpileup -q 30 (min kaartkwaliteit), -Q 17 (minimale basiskwaliteit); rMATS-GLMM likelihood-ratio test met Δψ cutoff = 0,0001, binomiale logitlink met replicate-aware multivariate normale straf (rho = 0,9); Benjamini-Hochberg FDR-correctie; alle zijn vooraf geconfigureerd in het pipeline-script
      Alle drie de pipeline-stappen ondersteunen multithreaded uitvoering via de --threads-vlag (standaard: 4 per stap). Stap 2 accepteert bovendien --contamination_threads (standaard: 2).

4. Resultateninspectie en visualisatie

  1. Nadat de CADRES-workflow is voltooid, navigeer je naar de uitvoermap. Het hoofdresultaatbestand, {prefix}_Result.txt, vermeldt alle gedetecteerde Differentiële Varianten op RNA (DVR's), inclusief genomische coördinaten, allelen, replicate-niveau alleltellingen, bewerkingsfracties, verschillen tussen groepen en bijbehorende statistische metrieken (P-waarde en FDR). Gene-niveau annotaties (gensymbool, regio, streng, varianttype, bekende SNP/bewerkingsstatus) zijn ook opgenomen. Het bijbehorende samenvattende bestand, {prefix}_Result_summary.txt, geeft tellingen van elk substitutietype en hun classificatie in SNP-DVR's, bekende RNA-bewerkende DVR's en nieuwe DVR's.
  2. (Optioneel) Genereer standaard visualisaties door het postanalyse-script uit te voeren. Open een R-sessie en voer in:
    R-console:
    bron("Post-analysis.R")
    Het script Post-analysis.R is opgenomen in https://github.com/junsun-hash/CADRES/.
  3. Er verschijnt een bestandsselectie-dialoog; Kies {prefix}_Result.txt. Het script levert zes PNG-figuren op.
    OPMERKING: De bestandsselectiedialoog vereist een desktop R-sessie. Op headless servers bewerk je de input_file variabele direct (regel 10 van Post-analysis.R) en voer je Rscript Post-analysis.R uit.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Om CADRES onder realistische experimentele omstandigheden te evalueren, gebruikten we een induceerbaar APOBEC3B (A3B)-systeem in 293T-cellen. Een doxycycline-responsief lentiviraal construct dat A3B-GFP expressie geeft, werd geïntroduceerd in 293T-cellen, en stabiele integranten werden geselecteerd met puromycine. Inductie met doxycycline gedurende 72 uur leverde robuuste A3B-GFP-expressie op, bevestigd door GFP-fluorescentie en verhoogde A3B mRNA-niveaus. Gematchte geïnduceerde en niet-...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De hier gepresenteerde CADRES-workflow biedt een gekalibreerde, intern consistente strategie voor het detecteren van differentiële RNA-bewerkingsgebeurtenissen met hoge specificiteit, met name C>U-deaminering gekatalyseerd door APOBEREC-enzymen. Verschillende stappen binnen het protocol zijn cruciaal voor de nauwkeurigheid ervan. Matched genomic en transcriptomic sequencing is essentieel om echte RNA-bewerkingen te onderscheiden van onderliggende DNA-polymorfismen, terwijl de boost-rekal...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

J.S., Z.D. en C.Z. zijn medewerkers van het Shanghai Institute of Biological Products, een entiteit die momenteel actief is in de commerciële ontwikkeling van therapeutische biologische middelen.

Dankbetuigingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deze studie werd gefinancierd door de Science and Technology Commission van Shanghai (23S11901100).

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Materialen

```html

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
BCFtoolsSamtools projectN/AVersie 1.21. Variant calling en VCF-manipulatie. URL: https://github.com/samtools/bcftools
BedtoolsQuinlan LabN/AVersie 2.31.1. Genome rekenkundige bewerkingen. URL: https://github.com/arq5x/bedtools2
BiopythonBiopython projectN/AVersie 1.85. Python tools voor moleculaire biologie. URL: https://www.biopython.org
BWA-MEMGitHub (lh3/bwa)N/AVersie 0.7.18. DNA-seq-uitlijning. URL: https://github.com/lh3/bwa
CADRES-broncodeGitHub (junsun-hash/CADRES)N/AVersie 1.0.0. CADRES-pijplijnscripts. URL: https://github.com/junsun-hash/CADRES
Conda of MinicondaAnaconda Inc.N/AVersie 23.1. Pakket- en omgevingsbeheerder. URL: https://docs.conda.io/en/latest/miniconda.html
dbSNP GRCh38 VCFNCBIN/ABuild 155. Gemeenschappelijke variantendatabase voor de kiembaan. URL: https://ftp.ncbi.nih.gov/snp/
GATK4Broad InstituteN/AVersie 4.3.0.0. Genome Analysis Toolkit. URL: https://github.com/broadinstitute/gatk
GitSoftware Freedom ConservancyN/AVersie 2.39. Versiebeheersysteem. URL: https://git-scm.com
gnomAD GRCh38 VCFBroad InstituteN/AVersie 3.1. Populatie-allelfrequenties. URL: https://gnomad.broadinstitute.org
GTF-annotatiebestandEnsemblN/ARelease 109. Genenannotatie voor GRCh38. URL: https://www.ensembl.org
Humaan referentiegenoom GRCh38Ensembl/UCSCN/ARelease 109. Referentiegenoomsamenstelling. URL: https://www.ensembl.org of https://hgdownload.soe.ucsc.edu
Linux-werkstation of serverVerschillendN/AUbuntu 20.04. x86_64-architectuur vereist. URL: https://ubuntu.com
pblatUCSC Genome BrowserN/AVersie 2.5.1. Parallelle BLAT-heruitlijning. URL: https://github.com/ucscGenomeBrowser/kent
PicardBroad InstituteN/AVersie 2.20.8. Manipulatie van NGS-gegevens. URL: https://github.com/broadinstitute/picard
PythonPython Software FoundationN/AVersie 3.9.19. Programmeertaal. URL: https://www.python.org
RR FoundationN/AVersie 4.5.2. Statistisch computing. URL: https://www.r-project.org
R-pakket: forcatsCRANN/AVersie 1.0.0. Factormanipulatie. URL: https://cran.r-project.org/package=forcats
R-pakket: ggplot2CRANN/AVersie 4.0.1. Gegevensvisualisatie. URL: https://cran.r-project.org/package=ggplot2
R-pakket: ggrepelCRANN/AVersie 0.9.5. Tekstlabelrepel. URL: https://cran.r-project.org/package=ggrepel
R-pakket: lme4CRANN/AVersie 1.1.35. Lineaire gemengde-effectmodellen. URL: https://cran.r-project.org/package=lme4
R-pakket: readrCRANN/AVersie 2.1.5. Snel lezen van bestanden. URL: https://cran.r-project.org/package=readr
R-pakket: stringrCRANN/AVersie 1.6.0. Stringmanipulatie. URL: https://cran.r-project.org/package=stringr
REDIportal-referentieUniversiteit van BolognaN/AVersie 2.0. A-naar-I RNA-bewerkingsplaatsendatabase. URL: http://srv00.recas.ba.infn.it/atlas/
RefGene-annotatieUCSC Table BrowserN/ARelease 109. Genenstructuurannotatie. URL: https://genome.ucsc.edu/cgi-bin/hgTables
SamtoolsSamtools projectN/AVersie 1.21. BAM-bestandmanipulatie. URL: https://github.com/samtools/samtools
STAR-alignerGitHub (alexdobin/STAR)N/AVersie 2.7.11b. RNA-seq-uitlijning. URL: https://github.com/alexdobin/STAR
```

Herprints en machtigingen

Toestemming aanvragen om de tekst of afbeeldingen van dit JoVE-artikel te hergebruiken

Toestemming aanvragen

Trefwoorden

Detectie van RNA editingAPOBEC enzymenC naar U editingRNA variant callingbase kwaliteitsrecalibratieartefact filteringRNA seq analysewhole genome sequencing

Gerelateerde artikelen