Artykuł metodologiczny

Wykrywanie miejsc edycji RNA o wysokiej precyzji z użyciem skanera edycji RNA o różnicowym kalibrze

DOI:

10.3791/71148

23 czerwca 2026

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ten protokół opisuje zastosowanie Kalibrowanego Skanera Edycji RNA (CADRES), komputerowego przepływu danych, który integruje wspólne wykrywanie wariantów DNA–RNA, przekalibrowywanie sygnałowo-optymalizacyjne oraz statystyczne modelowanie uwzględniające repliki w celu zidentyfikowania różnicowych miejsc edycji RNA z wysoką precyzją.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dokładne określenie edycji RNA pozostaje technicznie wymagające, ponieważ rzeczywiste post‑transkrypcyjne zmiany muszą być odróżniane od wariantów genomowych i artefaktów sekwencjonowania. Ta trudność jest szczególnie zaznaczona w przypadku edycji cytydyny‑do‑urydyny katalizowanej przez enzymy APOBEC, gdzie mieszane zmiany DNA i RNA zacierają prawdziwy sygnał edycji. Kalibrowany skaner różnicowej edycji RNA (CADRES) zapewnia zstrukturyzowaną ramę obliczeniową do radzenia sobie z tymi ograniczeniami poprzez zintegrowane badanie wariantów DNA–RNA oraz ukierunkowane zachowanie autentycznych sygnałów edycji. Ten protokół przedstawia przepływ CADRES, łącznie z przygotowaniem danych, wspólnym wykrywaniem wariantów RNA, rektyfikacją jakości bazy zachowującą sygnał, filtrowaniem artefaktów oraz różnicową oceną edycji RNA między warunkami eksperymentalnymi. CADRES obsługuje sparowany sekwencjonowanie RNA‑seq oraz sekwencjonowanie całego genomu lub całego eksomu z replikacją biologiczną.  Wieloetapowa strategia filtrowania, w tym usuwanie homopolimerów i przesiewanie paralogów oparte na PBLAT, systematycznie zmniejsza fałszywe dodatnie wyniki, zachowując zdarzenia edycji o niskiej częstotliwości. Łącząc kalibrację z modelowaniem uwzględniającym replikaty, CADRES zwiększa precyzję i powtarzalność analizy edycji RNA, umożliwiając badanie dynamiki edycji w różnorodnych kontekstach biologicznych. W porównaniu z uznanymi metodami, CADRES jest zaprojektowany w celu poprawy precyzji wykrywania edycji RNA, szczególnie dla zdarzeń C-do-U pośredniczynych przez APOBEC.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Edycja RNA stanowi dynamiczną warstwę post‑transkrypcyjnej regulacji, która umożliwia selektywne w miejscu zastępowanie nukleotydów w transkryptach RNA bez zmiany sekwencji DNA. W metazoa, deaminacja adenozyny‑do‑inozyny (A>I) katalizowana przez enzymy ADAR jest dominującą formą i przyczynia się do zróżnicowania transkryptów, stabilności mRNA, modulacja odporności wrodzonej i funkcji neuronów1,2. Deaminacja cytydyny‑do‑urydyny (C>U) (dalej „C>U” w kontekście biologicznym; „C>T” w kontekście sekwencjonowania), katalizowana przez członków rodziny APOBEC, działa wspólnie z tymi szlakami i jest zaangażowana w metabolizm lipidów, ograniczanie wirusowe, mutageneza i nowe role regulacyjne w biologii odpornościowej i onkologii3,4,5,6,7. Ostatnie badania wykazały, że kilka enzymów APOBEC, w tym APOBEC1, APOBEC3A i APOBEC3B (A3B), katalizują edycję RNA w różnych kontekstach fizjologicznych i patologicznych3,4,7,8,9,10. Enzymy APOBEC3 indukują również edycję DNA, produkując nakładające się signature mutacyjne, które utrudniają rozróżnienie między edycją RNA a wariantami genomowymi8,10,11,12.

Sekwencjonowanie nowej generacji umożliwiło identyfikację potencjalnych miejsc edycji RNA na skalę transkryptomu, jednak wyróżnienie prawdziwych edycji z wariantami SNV w genomie lub szumu technicznym nadal jest trudne. Zdarzenia A>I i C>U pojawiają się jako zastępstwa A>G i C>T w bibliotekach cDNA i mogą być mylące z powodu niewłaściwego primerowania, błędów polimerazy, artefaktów mapowania i zmian ekspresji zależnych od kontekstu. Publiczne zasoby takie jak REDIportal13, katalogują miliony miejsc A>I, podczas gdy adnotacje C>U pozostają rzadkie, odzwierciedlając zarówno ograniczenia biologiczne, jak i analityczne. Wiarygodne identyfikowanie edycji C>U—zwłaszcza zmian w różnych warunkach—dlatego nadal pozostaje niezaspokojoną potrzebą analityczną.

Nadrzecznym celem metody przedstawionej tutaj, Kalibrowanego Dyferencyjnego Skanera Edycji RNA (CADRES), jest precyzyjne zidentyfikowanie Dyferencyjnych Wariantów na RNA (DVRs): miejsc edycji, które przechodzą statystycznie istotne zmiany w głębokości edycji między dwoma lub więcej określonymi warunkami14. Opracowując ten protokół, staraliśmy się rozwiązać dwa uporczywe problemy. Po pierwsze, bona fide edycje RNA muszą być odróżniane od wariantów kodowanych w DNA. Po drugie, różnice w edycji muszą być ilościowo określone w sposób statystycznie mocny w danych RNA‑seq z replikowanych biologicznie zestawach danych. Centralna innowacja CADRES polega na integracji wspólnego wykrywania wariantów DNA/RNA z kalibrowanym traktowaniem wariantów RNA podczas rekalibracji punktów bazowych (BQSR). Ta strategia „wzmocnionej rekalibracji” zachowuje nowo odkryte miejsca edycji RNA podczas BQSR, zapobiegając tym samym systematycznemu obniżaniu jakości, które powszechnie osłabia wrażliwość na edycje o niskiej częstotliwości15,16,17. To podejście zmniejsza fałszywie negatywne wyniki i poprawia specyficzność w porównaniu z potokami, które polegają wyłącznie na niekompletnych bazach danych dotyczących edycji RNA.

CADRES znajduje się wśród metod, które każda z nich zajmuje się różnymi aspektami analizy edycji RNA. SNPiR18 i RVboost19 filtrują artefakty z zestawów wariantów tylko RNA; VaDiR20 uwzględnia porównania DNA-RNA, ale nie modeluje struktury repliki; rMATS‑DVR21 przeprowadza różnicowe testowanie oparte na GLMM, ale opiera się wyłącznie na RNA‑seq; a JACUSA/JACUSA222,23 obsługuje wykrywanie świadome replik, ale nie uwzględnia wspólnego przeszukiwania DNA-RNA ani strategii rekalibracji. CADRES ujednolica statystyczne modelowanie świadome replik, wspólne wykrywanie wariantów DNA/RNA oraz rekalibrację wzbogaconą o nowo odkryte miejsca edycji, zapewniając pojedynczy przepływ pracy zoptymalizowany pod kątem wykrywania edycji RNA zależnej od warunków—w tym zdarzenia C>U związane z aktywnością APOBEC10,11,12.

W

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

This protocol describes a purely computational bioinformatics workflow for identifying C>U RNA editing events using the CADRES framework. All steps are performed within a Linux environment using the command line. Only publicly available sequencing datasets are used, and no human or vertebrate subjects are involved.

1. Environment setup and software installation

NOTE: Minimum computational requirements for the CADRES workflow are as follows: CPU ≥ 8 cores (16 cores recommended), RAM ≥ 32 GB (64 GB recommended for whole-genome datasets), and disk space ≥ 100 GB.

  1. Confirm that a Linux operating system is available. Open a terminal window and ensure permission is available to install in the current user environment.
  2. Install a Conda package manager if it is not already present on the system. Download an installer for a minimal Conda distribution from its official website. Execute the installation script following the on‑screen instructions.
  3. Verify that Conda is active by entering the following command and ensure that the command prints a valid version number.
    $ conda --version
  4. Create a working directory for the CADRES workflow. Navigate into this directory using:
    $ cd /path/to/working_directory
  5. Download the CADRES source code by executing:
    $ git clone --branch v1.0.0 https://github.com/junsun-hash/CADRES
  6. Enter the cloned directory by running:
    $ cd CADRES
  7. Create a dedicated Conda environment using the environment.yml file provided within the CADRES repository. Execute the following command and allow the installation process to complete without interruption.
    $ conda env create -f environment.yml
  8. Activate the newly created environment by entering the following command. Confirm that the environment has been activated by checking that the terminal prompt now displays its name.
    $ conda activate CADRES
  9. Verify that the required command‑line tools have been installed correctly. Execute each command below and confirm that they return a version number rather than an error message:
    $ python --version
    $ samtools --version
    $ gatk --help
    $ bedtools --version
    $ pblat

    NOTE: The exact set of tools included in the CADRES environment may differ slightly depending on updates to the environment.yml file. If a tool is missing, recreate the environment or update the dependency list as required.
  10. Ensure that sufficient disk space is available. Confirm that at least 100 GB of free space exists for reference genomes, alignment indices, and intermediate BAM files by entering:
    $ df -h
  11. Confirm that write permissions are available in all working, output, and temporary directories by creating a test file:
    $ touch test_file.txt
  12. Delete the file afterwards by entering:
    $ rm test_file.txt

2. Data preparation

NOTE: The representative dataset used in this protocol consists of: HEK293T cells with doxycycline-inducible A3B–GFP; WGS at 33×; strand-specific paired-end RNA-seq (2×150 bp, ≥60 M reads/sample); n = 3 biological replicates per condition (DMSO vs. doxycycline 72 h). Full data: SRA PRJNA1211186. A chr22 demonstration subset is provided in the CADRES repository.

CADRES requires: (i) WGS (≥33×) or WES (≥33×); (ii) strand-specific, paired-end RNA-seq (≥60 million reads per sample); (iii) two experimental conditions with ≥2 biological replicates each.

  1. Prepare the reference genome and annotation.
    1. Download the reference genome (FASTA) and GTF annotation file from Ensembl or a comparable repository. The recommended reference genome is Ensembl GRCh38 primary assembly: https://ftp.ensembl.org/pub/release-111/fasta/homo_sapiens/dna/ and the recommended GTF annotation is GENCODE release 45:
      https://ftp.ebi.ac.uk/pub/databases/gencode/Gencode_human/release_45/.
    2. Index the reference FASTA:
      $ samtools faidx FASTA_FILE.fa
      Ensure that chromosome naming conventions (for example, “chr1” versus “1”) are consistent across all reference materials.
  2. Obtain the sequencing data.
    1. Obtain DNA‑seq FASTQ files (WGS or WES) with ≥33× depth.
    2. Obtain strand‑specific, paired‑end RNA‑seq FASTQ files with ≥60 million reads per sample, across two biological conditions and at least two biological replicates per group.
  3. Align the DNA sequencing reads using BWA‑MEM.
    1. Build a BWA index:
      $ bwa index Homo_sapiens.GRCh38.dna.primary_assembly.fa -p bwaindex -a bwtsw
    2. Align and convert to BAM:
      $ bwa mem -R '@RG\tID:ID\tPL:platform\tLB:library\tSM:sample_name' bwaindex wgs_R1.fq.gz wgs_R2.fq.gz | samtools view -b > wgs.bam
  4. Align the RNA sequencing reads using STAR.
    1. Generate STAR genome index:
      $ STAR --runMode genomeGenerate \
      --genomeFastaFiles Homo_sapiens.GRCh38.dna.primary_assembly.fa \
      --genomeDir STAR_index \
      --sjdbGTFfile Homo_sapiens.GRCh38.gtf
    2. Align RNA reads
      $ STAR \
      --genomeDir STAR_index \
      --readFilesCommand zcat \
      --readFilesIn rna_sample1.fq.gz rna_sample2.fq.gz \
      --sjdbGTFfile Homo_sapiens.GRCh38.gtf \
      --outSAMtype BAM Unsorted \
      --outSAMmapqUnique 60 \
      --outFileNamePrefix pass1_

      NOTE: This produces a splice-junction file (pass1_SJ.out.tab) containing both annotated and novel junctions.
    3. Re-generate the STAR genome index incorporating novel junctions:
      $ cat pass1_SJ.out.tab > SJ_all.tab
      $ STAR --runMode genomeGenerate

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aby ocenić CADRES w realistycznych warunkach eksperymentalnych, zastosowaliśmy indukcyjny system APOBEC3B (A3B) w komórkach 293T. Lentiwirusowy konstrukt odpowiadający na doksycyklinę, ekspresujący A3B-GFP, został wprowadzony do komórek 293T, a stabilne integranty zostały wyselekcjonowane za pomocą puromycyny. Indukcja doksycykliną przez 72 h prowadziła do intensywnej ekspresji A3B-GFP, potwierdzonej przez fluorescencyjną emisję GFP i zwiększone poziomy mRNA A3B. Uzgodnione próbki indukowane i nieindukowane zostały nastę...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Przedstawiony tutaj przepływ pracy CADRES zapewnia skalibrowaną, wewnętrznie spójną strategię wykrywania zróżnicowanych zdarzeń edycji RNA z wysoką specyficznością, szczególnie deaminacji C>U katalizowanej przez enzymy APOBEC. Kilka kroków w protokole jest kluczowych dla jego dokładności. Dopasowane sekwencjonowanie genomowe i transkryptomowe jest niezbędne do odróżnienia rzeczywistych edycji RNA od podstawowych polimorfizmów DNA, podczas gdy procedura ponownego kalibracju boost chroni autentyczne warianty RNA przed błęd...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

J.S., Z.D. i C.Z. są pracownikami Shanghai Institute of Biological Products, podmiotu obecnie zaangażowanego w komercyjny rozwój produktów biologicznych terapeutycznych.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

To badanie zostało sfinansowane przez Komisję Nauki i Technologii Szanghaju (23S11901100).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
BCFtoolsSamtools projectN/AVersion 1.21. Variant calling and VCF manipulation. URL: https://github.com/samtools/bcftools
BedtoolsQuinlan LabN/AVersion 2.31.1. Genome arithmetic operations. URL: https://github.com/arq5x/bedtools2
BiopythonBiopython projectN/AVersion 1.85. Python tools for molecular biology. URL: https://www.biopython.org
BWA-MEMGitHub (lh3/bwa)N/AVersion 0.7.18. DNA-seq alignment. URL: https://github.com/lh3/bwa
CADRES source codeGitHub (junsun-hash/CADRES)N/AVersion 1.0.0. CADRES pipeline scripts. URL: https://github.com/junsun-hash/CADRES
Conda or MinicondaAnaconda Inc.N/AVersion 23.1. Package and environment manager. URL: https://docs.conda.io/en/latest/miniconda.html
dbSNP GRCh38 VCFNCBIN/ABuild 155. Common germline variants database. URL: https://ftp.ncbi.nih.gov/snp/
GATK4Broad InstituteN/AVersion 4.3.0.0. Genome Analysis Toolkit. URL: https://github.com/broadinstitute/gatk
GitSoftware Freedom ConservancyN/AVersion 2.39. Version control system. URL: https://git-scm.com
gnomAD GRCh38 VCFBroad InstituteN/AVersion 3.1. Population allele frequencies. URL: https://gnomad.broadinstitute.org
GTF annotation fileEnsemblN/ARelease 109. Gene annotation for GRCh38. URL: https://www.ensembl.org
Human reference genome GRCh38Ensembl/UCSCN/ARelease 109. Reference genome assembly. URL: https://www.ensembl.org or https://hgdownload.soe.ucsc.edu
Linux workstation or serverVariousN/AUbuntu 20.04. x86_64 architecture required. URL: https://ubuntu.com
pblatUCSC Genome BrowserN/AVersion 2.5.1. Parallel BLAT realignment. URL: https://github.com/ucscGenomeBrowser/kent
PicardBroad InstituteN/AVersion 2.20.8. NGS data manipulation. URL: https://github.com/broadinstitute/picard
PythonPython Software FoundationN/AVersion 3.9.19. Programming language. URL: https://www.python.org
RR FoundationN/AVersion 4.5.2. Statistical computing. URL: https://www.r-project.org
R package: forcatsCRANN/AVersion 1.0.0. Factor manipulation. URL: https://cran.r-project.org/package=forcats
R package: ggplot2CRANN/AVersion 4.0.1. Data visualization. URL: https://cran.r-project.org/package=ggplot2
R package: ggrepelCRANN/AVersion 0.9.5. Text label repulsion. URL: https://cran.r-project.org/package=ggrepel
R package: lme4CRANN/AVersion 1.1.35. Linear mixed-effects models. URL: https://cran.r-project.org/package=lme4
R package: readrCRANN/AVersion 2.1.5. Fast file reading. URL: https://cran.r-project.org/package=readr
R package: stringrCRANN/AVersion 1.6.0. String manipulation. URL: https://cran.r-project.org/package=stringr
REDIportal referenceUniversity of BolognaN/AVersion 2.0. A-to-I RNA editing sites database. URL: http://srv00.recas.ba.infn.it/atlas/
RefGene annotationUCSC Table BrowserN/ARelease 109. Gene structure annotation. URL: https://genome.ucsc.edu/cgi-bin/hgTables
SamtoolsSamtools projectN/AVersion 1.21. BAM file manipulation. URL: https://github.com/samtools/samtools
STAR alignerGitHub (alexdobin/STAR)N/AVersion 2.7.11b. RNA-seq alignment. URL: https://github.com/alexdobin/STAR

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

RNA Editing DetectionAPOBEC EnzymesC To U EditingRNA Variant CallingBase Quality RecalibrationArtifact FilteringRNA Seq AnalysisWhole Genome Sequencing

Powiązane artykuły