Article de méthode

Détection haute précision des sites d’édition d’ARN à l’aide d’un scanner d’édition différentiel d’ARN calibré

DOI :

10.3791/71148

23 juin 2026

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ce protocole décrit l’utilisation du Calibrated Differential RNA Editing Scanner (CADRES), un flux de travail computationnel qui intègre l’appel de variantes articulées ADN–ARN, un recalibrage optimisé pour le signal et une modélisation statistique consciente de la réplication pour identifier avec une grande précision les sites d’édition différentiels d’ARN.

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La délimitation précise de l’édition de l’ARN reste techniquement complexe car les véritables altérations post-transcriptionnelles doivent être distinguées des variantes génomiques et des artefacts de séquençage. Cette difficulté est particulièrement marquée pour l’édition cytidine-uridine catalysée par les enzymes APOBEC, où les changements mélangés d’ADN et d’ARN obscurcissent le véritable signal d’édition. Le Calibrated Differential RNA Editing Scanner (CADRES) fournit un cadre informatique structuré pour répondre à ces limitations grâce à une interrogation intégrée des variantes ADN–ARN et à la préservation ciblée des signatures d’édition authentiques. Ce protocole présente le flux de travail CADRES, incluant la préparation des données, l’appel conjoint des variants ARN, le recalibrage de la qualité de base préservant le signal, le filtrage des artefacts et l’évaluation différentielle de l’édition ARN entre conditions expérimentales. CADRES soutient le séquençage par paires d’ARN-seq et de génome entier ou d’exome entier avec réplication biologique.  Une stratégie de filtrage à plusieurs étapes, incluant la suppression des homopolymères et le criblage paralogue basé sur PBLAT, réduit systématiquement les faux positifs tout en préservant les événements de montage à basse fréquence. En combinant l’étalonnage avec la modélisation consciente des réplications, CADRIs augmente la précision et la reproductibilité de l’analyse d’édition ARN, permettant d’interroger la dynamique d’édition à travers divers contextes biologiques. Comparé aux méthodes établies, CADRIES est conçu pour améliorer la précision dans la détection de l’édition de l’ARN, en particulier pour les événements C-to-U médiés par APOBEC.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L’édition de l’ARN constitue une couche dynamique de régulation post-transcriptionnelle qui permet des substitutions de nucléotidiques spécifiques au site au sein des transcrits d’ARN sans modifier la séquence d’ADN sous-jacente. Chez les métazoaires, la désamination adénosine à inosine (A>I) médiée par des enzymes ADAR est la forme prédominante et contribue à la diversification des transcripts, à la stabilité de l’ARNm, à la modulation immunitaire innée et à la fonctionneuronale 1,2. Cytidine à uridine (C>U) (ci-après « C>U » dans le contexte biologique ; La « C>T » dans le contexte du séquençage), catalysée par les membres de la famille APOBEC, opère parallèlement à ces voies et est impliquée dans le métabolisme lipidique, la restriction virale, la mutagenèse et les rôles régulateurs émergents en biologie immunitaireet du cancer 3,4,5,6,7. Des travaux récents ont démontré que plusieurs enzymes APOBEC, dont APOBEC1, APOBEC3A et APOBEC3B (A3B), catalysent l’édition de l’ARN dans des contextes physiologiqueset pathologiques 3,4,7,8,9,10. APOBEC3 enzymes induisent également l’édition de l’ADN, produisant des signatures mutationnelles qui se chevauchent et compliquent la discrimination entre l’édition de l’ARN et la variationgénomique 8,10,11,12.

Le séquençage de nouvelle génération a permis l’identification à l’échelle du transcriptome des sites potentiels d’édition d’ARN, mais distinguer les véritables modifications des SNV génomiques ou du bruit technique reste difficile. Les événements A>I et C>U apparaissent comme des substitutions A>G et C>T dans les bibliothèques d’ADNc et peuvent être confondus par des désamorçages, des erreurs de polymérase, des artefacts de cartographie et des changements d’expression contextuels. Des ressources publiques telles que REDIportal13 cataloguent des millions de sites A>I, tandis que les annotations C>U restent rares, reflétant à la fois des contraintes biologiques et analytiques. L’identification fiable de l’édition C>U — en particulier les changements selon les conditions — reste donc un besoin analytique non satisfait.

L’objectif principal de la méthode présentée ici, le Calibrated Differential RNA Editing Scanner (CADRES), est l’identification précise des variantes différentielles sur ARN (DVR) : des sites d’édition subissant des variations statistiquement significatives de profondeur d’édition entre deux conditions définies ouplus 14. En développant ce protocole, nous avons cherché à résoudre deux obstacles persistants. Premièrement, il faut distinguer les modifications d’ARN véritables des variantes codées dans l’ADN. Deuxièmement, les différences d’édition doivent être quantifiées de manière statistiquement robuste à travers les ensembles de données RNA-seq biologiquement répliqués. L’innovation centrale de CADRES réside dans l’intégration de l’appel conjoint des variantes ADN/ARN avec un traitement calibré des variantes d’ARN lors du recalibrage des scores de qualité de base (BQSR). Cette stratégie de « recalibration par boost » préserve les sites d’édition ARN nouvellement découverts pendant la BQSR, empêchant ainsi une rétrogradation systématique de la qualité qui érode couramment la sensibilité pour les montages à bassefréquence 15, 16, 17. Cette approche réduit les faux négatifs et améliore la spécificité par rapport aux pipelines qui reposent uniquement sur des bases de données d’édition d’ARN incomplètes.

CADRES s’inscrit dans un paysage de méthodes qui abordent chacune différents aspects de l’analyse de l’édition ARN. les artefacts de filtrageSNPiR 18 et RVboost19 provenant de variantes uniquement à ARN ; VaDiR 20 intègre des comparaisons ADN–ARN mais ne modélise pas la structure réplicative ; rMATS-DVR 21 réalise des tests différentiels basés sur GLMM mais s’appuie exclusivement sur RNA-seq ; et JACUSA/JACUSA222,23 soutiennent la détection consciente des réplications mais n’intègrent pas de stratégies d’interrogation ou de recalibrage conjointes ADN–ARN. CADRIS unifie la modélisation statistique consciente des réplications, l’appel des variantes conjointes ADN/ARN, et la recalibration enrichie pour les sites d’édition de novo, fournissant un flux de travail unique optimisé pour détecter l’édition d’ARN dépendante de la condition — y compris les événements C>U liés à l’activitéAPOBEC 10,11,12.

Dans ce contexte, les utilisateurs peuvent considérer CADRES comme approprié lorsque leur système expérimental remplit les critères suivants. Premièrement, un séquençage par paires ARN-seq et génome entier ou exome entier à partir des mêmes échantillons est disponible, permettant un partitionnement rigoureux des événements dérivés de l’ARN à partir de variantes codées par l’ADN. Deuxièmement, la question biologique concerne les changements dans l’édition de l’ARN selon les conditions — telles que l’induction enzymatique, le stress environnemental, les stades de développement ou les états pathologiques — où la modélisation statistique de la profondeur spécifique des allèles à travers les réplications est essentielle. Troisièmement, l’investigateur cherche à renforcer la spécificité dans la détection de l’édition C>U, où distinguer les événements d’ARN de la mutagenèse de l’ADN alimentée par APOBEC est indispensable. CADRES est particulièrement précieux dans les systèmes où l’activité APOBEC induit à la fois des modifications d’ARN et d’ADN, comme le démontrent les modèles A3Binductibles 10, 11,12, et où les méthodes conventionnelles uniquement à ARN présentent des taux de faux positifs gonflés dus à des SNV confondants ou à des artefacts de séquence répétitive.

CADRES offre plusieurs avantages pratiques. Son appel conjoint variant ADN/ARN réduit les faux positifs causés par le SNV. Le recalibrage boost préserve les véritables signaux d’édition, y compris les événements nouveaux absents des bases de données de référence. Le GLMM dérivé de rMATS fournit un cadre statistiquement principié pour l’analyse différentielle de l’édition entre réplications. Ensemble, ces fonctionnalités fournissent une plateforme calibrée et de haute précision pour étudier l’édition dynamique de l’ARN dans des contextes expérimentaux et de maladies. Dans notre étudeprécédente 14, CADRES a été rigoureusement évalué par rapport à des méthodes établies de détection d’édition d’ARN, utilisant à la fois des ensembles de données simulés in silico et des modèles réels de cellules A3B inductibles. Dans l’évaluation in silico, CADRI a constamment obtenu des scores de précision de 0,85 à 0,95 et des scores de précision de 0,92 à 0,98 sur les nombres de répliques. Le flux de travail global de CADRES est illustré à la Figure 1.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ce protocole décrit un flux de travail purement informatique computationnel permettant d’identifier les événements d’édition ARN C>U en utilisant le cadre CADRES. Toutes les étapes sont effectuées dans un environnement Linux en ligne de commande. Seuls des ensembles de données de séquençage accessibles au public sont utilisés, et aucun sujet humain ou vertébré n’est impliqué.

1. Configuration de l’environnement et installation logicielle

REMARQUE : Les exigences minimales de calcul pour le flux de travail CADRES sont les suivantes : CPU ≥ 8 cœurs (16 cœurs recommandés), RAM ≥ 32 Go (64 Go recommandés pour les ensembles de données du génome complet), et espace disque ≥ 100 Go.

  1. Confirmez qu’un système d’exploitation Linux est disponible. Ouvrez une fenêtre de terminal et assurez-vous que l’autorisation d’installation est disponible dans l’environnement utilisateur actuel.
  2. Installez un gestionnaire de paquets Conda s’il n’est pas déjà présent sur le système. Téléchargez un installateur pour une distribution minimale de Conda depuis son site officiel. Exécutez le script d’installation en suivant les instructions à l’écran.
  3. Vérifiez que Conda est actif en entrant la commande suivante et assurez-vous que la commande imprime un numéro de version valide.
    $ conda --version
  4. Créez un annuaire fonctionnel pour le flux de travail CADRES. Naviguez dans ce répertoire en utilisant :
    $ CD /chemin/vers/working_directory
  5. Téléchargez le code source de CADRES en exécutant :
    $ git clone --branch v1.0.0 https://github.com/junsun-hash/CADRES
  6. Entrez dans le répertoire cloné en exécutant :
    $ CD CADRES
  7. Créez un environnement Conda dédié à l’aide du fichier environment.yml fourni dans le dépôt CADRES. Exécutez la commande suivante et laissez le processus d’installation se terminer sans interruption.
    $ conda env create -f environment.yml
  8. Activez l’environnement nouvellement créé en entrant la commande suivante. Confirmez que l’environnement a été activé en vérifiant que l’invite du terminal affiche désormais son nom.
    $ conda active les CADRES
  9. Vérifiez que les outils de ligne de commande requis ont été correctement installés. Exécutez chaque commande ci-dessous et confirmez qu’elle renvoie un numéro de version plutôt qu’un message d’erreur :
    $ python --version
    $ samtools --version
    $ gatk --à l’aide
    $ Bedtools --version
    $ pblat

    REMARQUE : L’ensemble exact d’outils inclus dans l’environnement CADRES peut différer légèrement selon les mises à jour du fichier environment.yml. Si un outil manque, recréez l’environnement ou mettez à jour la liste des dépendances selon les besoins.
  10. Assurez-vous que suffisamment d’espace disque est disponible. Confirmez qu’il existe au moins 100 Go d’espace libre pour les génomes de référence, les indices d’alignement et les fichiers BAM intermédiaires en entrant :
    $ df -h
  11. Confirmez que les permissions d’écriture sont disponibles dans tous les répertoires de travail, de sortie et temporaires en créant un fichier test :
    $ touche test_file.txt
  12. Supprimez ensuite le fichier en entrant :
    $ rm test_file.txt

2. Préparation des données

REMARQUE : L’ensemble de données représentatif utilisé dans ce protocole se compose de : HEK293T cellules présentant A3B–GFP inducible par doxycycline ; WGS à 33× ; ARN-seq à extrémités paires spécifique aux brins (2×150 pb, ≥60 lectures M/échantillon) ; n = 3 réplications biologiques par condition (DMSO vs. doxycycline 72 h). Données complètes : SRA PRJNA1211186. Un sous-ensemble de démonstration chr22 est fourni dans le dépôt CADRES.

CADRES nécessite : (i) WGS (≥33×) ou WES (≥33×) ; (ii) séquence ARN spécifique aux brins, à extrémités appariées (≥60 millions de lectures par échantillon) ; (iii) deux conditions expérimentales avec ≥2 réplications biologiques chacune.

  1. Préparez le génome de référence et l’annotation.
    1. Téléchargez le génome de référence (FASTA) et le fichier d’annotation GTF depuis Ensembl ou un dépôt comparable. Le génome de référence recommandé est l’assemblage primaire Ensembl GRCh38 : https://ftp.ensembl.org/pub/release-111/fasta/homo_sapiens/dna/ et l’annotation GTF recommandée est la version 45 de GENCODE :
      https://ftp.ebi.ac.uk/pub/databases/gencode/Gencode_human/release_45/.
    2. Indexez la référence FASTA :
      $ samtools faidx FASTA_FILE.fa
      Assurez-vous que les conventions de nommage des chromosomes (par exemple, « chr1 » versus « 1 ») soient cohérentes dans tous les documents de référence.
  2. Obtenez les données de séquençage.
    1. Obtenir des fichiers DNA-seq FASTQ (WGS ou WES) avec une profondeur de ≥33×.
    2. Obtenir des fichiers FASTQ ARN-seq à extrémité pairée spécifiques au brin avec ≥60 millions de lectures par échantillon, sur deux conditions biologiques et au moins deux réplications biologiques par groupe.
  3. Alignez les lectures de séquençage de l’ADN à l’aide de BWA-MEM.
    1. Construire un indice BWA :
      $ bwa index Homo_sapiens. GRCh38.dna.primary_assembly.fa -p bwaindex -a bwtsw
    2. Alignez-vous et convertissez en BAM :
      $ bwa mem -R '@RG\tID :ID\tPL :platform\tLB :library\tSM :sample_name' bwaindex wgs_R1.fq.gz wgs_R2.fq.gz | Vue Samtools -B > wgs.bam
  4. Alignez les lectures de séquençage ARN à l’aide de STAR.
    1. Générez l’indice du génome STAR :
      $ STAR --runMode génomeGénérer \
      --genomeFastaFiles Homo_sapiens. GRCh38.dna.primary_assembly.fa \
      --genomeDir STAR_index \
      --sjdbGTFfile Homo_sapiens. GRCh38.gtf
    2. Aligner les lectures d’ARN
      $ STAR \
      --genomeDir STAR_index \
      --readFilesCommand zcat \
      --lireFichiersEn rna_sample1.fq.gz rna_sample2.fq.gz \
      --sjdbGTFfile Homo_sapiens. GRCh38.gtf \
      --outSAMtype BAM Non trié \
      --outSAMmapqUnique 60 \
      --outFileNamePrefixe pass1_

      REMARQUE : Cela produit un fichier splice-junction (pass1_SJ.out.tab) contenant à la fois des jonctions annotées et des nouvelles jonctions.
    3. Régénérer l’indice du génome STAR en intégrant de nouvelles jonctions :
      $ chat pass1_SJ.out.tab > SJ_all.tab
      $ STAR --runMode génomeGénérer \
      --genomeFastaFiles Homo_sapiens. GRCh38.dna.primary_assembly.fa \
      --genomeDir STAR_index_2pass \
      --sjdbGTFfile Homo_sapiens. GRCh38.gtf \
      --sjdbFileChrStartEnd SJ_all.tab
    4. Effectuez l’alignement du second passage en utilisant l’index mis à jour :
      $ STAR \
      --genomeDir STAR_index_2pass \
      --readFilesCommand zcat \
      --lireFichiersEn rna_sample1.fq.gz rna_sample2.fq.gz \
      --sjdbGTFfile Homo_sapiens. GRCh38.gtf \
      --outSAMtype BAM TriéByCoordonnée \
      --outSAMmapqUnique 60 \
      --outFileNamePrefixe output_name
  5. Préparez des ressources de référence auxiliaires.
    1. (Recommandé) Obtenir dbSNP VCF
      Téléchargez le VCF dbSNP GRCh38 humain (par exemple, la version dbSNP 150) depuis le serveur FTP NCBI :
      https://ftp.ncbi.nih.gov/snp/latest_release/VCF/ Placez le fichier téléchargé (par exemple, dbsnp_150.vcf.gz) dans le répertoire de travail.
      REMARQUE : Les entrées dérivées de l’ARN (molType="cDNA ») dans dbSNP peuvent masquer de véritables sites d’édition d’ARN. Excluez-les en utilisant :
      $ bcftools view -i 'INFO/molType !="cDNA"' dbsnp.vcf.gz -Oz -o dbsnp_no_cDNA.vcf.gz
    2. (Recommandé) Trier le VCF dbSNP
      Triez le VCF pour qu’il soit compatible avec le génome de référence et le GACK :
      $ gatk SortVcf \
      -Je dbsnp_150.vcf.gz \
      -O dbsnp_150.sorted.vcf.gz \

      --dictionnaire de séquences Homo_sapiens. GRCh38.dict
    3. (Recommandé) Indexez le dbSNP VCF trié
      Créez un index pour le VCF trié dbSNP :
      $ gatk IndexFeatureFile -I dbsnp_150.sorted.vcf.gz
      REMARQUE : Un dictionnaire de référence correspondant est nécessaire. Si le dossier Homo_sapiens. GRCh38.dict manque, générez-le comme suit :
      $ gatk CreateSequenceDictionary \
      -R Homo_sapiens. GRCh38.dna.primary_assembly.fa \
      -O Homo_sapiens. GRCh38.dna.primary_assembly.dict
    4. (Recommandé) Obtenir le VCF de la lignée germinale de GnomAD
      Téléchargez le VCF des sites variants germinaux de gnomAD de GRCh38 depuis : https://gnomad.broadinstitute.org/downloads Utilisez le VCF du génome approprié au pipeline (par exemple, gnomad.genomes.vX.X.sites.vcf.gz).
    5. (Recommandé) Trier le VCF de gnomAD
      Triez le VCF gnomAD à l’aide du même dictionnaire de référence pour garantir la compatibilité :
      $ gatk SortVcf \
      -Je gnomad.vcf.gz \
      -O gnomad.sorted.vcf.gz \
      --dictionnaire de séquences Homo_sapiens. GRCh38.dict
    6. (Recommandé) Indexez le VCF trié de gnomAD
      Créez un index pour le VCF trié de gnomAD :
      $ gatk IndexFeatureFile -I gnomad.sorted.vcf.gz
      REMARQUE : Assurez-vous que la dénomination des chromosomes (par exemple, « chr1 » vs « 1 ») correspond à la référence FASTA avant d’exécuter SortVcf.
  6. Obtenez une référence connue pour l’édition de l’ARN.
    RENOTE : Un fichier de référence REDIportal compatible (rediportal.txt) adapté aux CADRES est conservé dans le dépôt CADRES et peut être téléchargé directement depuis :
    https://github.com/junsun-hash/CADRES/releases/tag/v1.0.0. Ce fichier est utilisé pour l’annotation des événements d’édition connus à l’étape 3.
  7. Préparez les annotations génétiques au format RefGene. Téléchargez l’annotation RefGene (par exemple, refGene.txt.gz de l’UCSC). Décompressez si nécessaire et assurez-vous que les noms des chromosomes correspondent à ceux du génome de référence.
    REMARQUE : Un exemple adapté à CADRES est sélectionné dans le dépôt CADRES et peut être téléchargé directement depuis :
    https://github.com/junsun-hash/CADRES/releases/tag/v1.0.0

3. Exécution du flux de travail analytique CADRES

REMARQUE : La section 3 est exécutée dans le terminal Linux avec l’environnement CADRES Conda activé.

  1. Calibration et recalibrage de la suralimentation
    REMARQUE : L’étape 1 standardise les fichiers BAM et effectue un recalibrage Boost — un BQSR amélioré qui intègre dbSNP, gnomAD et un ensemble préliminaire de candidats à l’édition ARN pour préserver les signaux d’édition authentiques. Listez tous les fichiers ARN BAM séparés par des espaces. Sortie : BAM recalibrés (suffixe : _recalibration.bam) et sites candidats Boost.
    1. Pour exécuter l’étape 3.1 :
      $ Python pipeline_step1_calibration.py \
      --rna_bams /chemin/vers/rna_sample1.bam /chemin/vers/rna_sample2.bam ... \
      --dna_bam /chemin/vers/wgs_normal.bam \
      --génome /path/to/hg38.fa \
      --known_snv /chemin/vers/dbsnp.sorted.vcf.gz \
      --output_dir ./output/step1_calibration \
      --préfixe project_demo

      REMARQUE : Les candidats booster sont construits à partir d’un appel Mutect2 conjoint ADN-ARN préliminaire (--max-events-in-region 4, filtre PASS uniquement ; pas de seuils AF/qualité supplémentaires). L’homopolymère et le filtrage répété sont gérés à l’étape 3.2.
  2. Appel de variantes, estimation de la contamination et filtrage
    REMARQUE : L’étape 3.2 effectue l’appel conjoint des variantes ADN-ARN avec estimation de la contamination (via gnomAD), puis filtre les candidats par contexte homopolymère et réalignement PBLAT. Sortie : {préfixe}.final.vcf.
    1. Pour exécuter l’étape 3.2 :
      $ Python pipeline_step2_variant_calling.py \
      --rna_bams ./output/step1_calibration/rna_sample1_split_recalibration.bam ... \
      --dna_bam ./output/step1_calibration/DNA_processed_recalibration.bam \
      --génome /path/to/hg38.fa \
      --gnomad /chemin/vers/gnomad.sorted.vcf.gz \
      --output_dir ./output/step2_variant_calling \
      --préfixe project_demo

      REMARQUE : Cette étape produit l’ensemble final d’appels variants rigoureusement filtré (project_demo.final.vcf), représentant les différences ARN-ADN à haute confiance sur tous les échantillons. Paramètres clés : Mutect2 --min-median-base-quality 12, --max-events-in-region-4 ; PBLAT minbasequal 5 ; tous sont préconfigurés dans le script du pipeline.
  3. Tests statistiques et annotation fonctionnelle
    REMARQUE : L’étape 3.3 quantifie l’édition différentielle de l’ARN à l’aide d’un GLMM adapté à partir de rMATS (correction de Benjamini-Hochberg FDR), et annote chaque site avec la région du gène, le symbole du gène et l’état d’édition connu. Sortie : {préfixe}_Result.txt (DVR avec valeurs P et FDR).
    Le filtre de réalignement PBLAT élimine les candidats qui correspondent à plusieurs loci génomiques, renforçant la spécificité dans les régions répétitives. Son THREAD_COUNT interne est contrôlé par le drapeau --threads dans pipeline_step2_variant_calling.py.
    1. Pour exécuter l’étape 3.3 :
      $ Python pipeline_step3_statistical_test.py \
      --group1_rna_bams ./output/step1_calibration/control_rep1.bam ... \
      --group2_rna_bams ./output/step1_calibration/treated_rep1.bam ... \
      --final_vcf ./output/step2_variant_calling/project_demo.final.vcf \
      --génome /path/to/hg38.fa \
      --known_snv /chemin/vers/dbsnp.sorted.vcf.gz \
      --known_editing /chemin/vers/rediportal.txt \
      --gene_anno /chemin/vers/refGene.txt \
      --output_dir ./output/step3_statistical_test \
      --étiquettes Contrôlé Traité

      REMARQUE : Paramètres clés : samtools mpileup -q 30 (qualité minimale de mappage), -Q 17 (qualité minimale de base) ; test du rapport de vraisemblance rMATS-GLMM avec coupure Δψ = 0,0001, liaison logit binomiale avec pénalité normale multivariée consciente des réplications (rho = 0,9) ; correction Benjamini-Hochberg FDR ; Tous sont préconfigurés dans le script du pipeline
      Les trois étapes du pipeline supportent l’exécution multithread via le drapeau --threads (par défaut : 4 par étape). L’étape 2 accepte également --contamination_threads (par défaut : 2).

4. Inspection et visualisation des résultats

  1. Une fois le flux de travail CADRES terminé, naviguez jusqu’au répertoire de sortie. Le fichier principal de résultats, {prefix}_Result.txt, liste tous les variants différentiels d’ARN détectés (DVR), y compris les coordonnées génomiques, les allèles, le nombre d’allèles au niveau des réplicats, les fractions d’édition, les différences entre groupes et les métriques statistiques associées (valeur P et FDR). Des annotations au niveau du gène (symbole du gène, région, brinement, type de variante, SNP/statut d’édition connu) sont également incluses. Le fichier résumé associé, {prefix}_Result_summary.txt, fournit les comptages de chaque type de substitution et leur classification en DVR SNP, DVR connus pour l’édition d’ARN et DVR novateurs.
  2. (Optionnel) Générez des visualisations standards en exécutant le script d’analyse post-analyse. Ouvrez une session R et entrez :
    Console R :
    source(« Post-analysis.R »)
    Le script Post-analysis.R est inclus dans https://github.com/junsun-hash/CADRES/.
  3. Une boîte de dialogue de sélection de fichiers apparaîtra ; Choisissez {préfixe}_Result.txt. Le script produit six figures PNG.
    REMARQUE : La boîte de dialogue de sélection de fichiers nécessite une session R sur le bureau. Sur les serveurs headless, modifiez directement la variable input_file (ligne 10 de Post-analysis.R) et exécutez Rscript Post-analysis.R.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Pour évaluer CADRES dans des conditions expérimentales réalistes, nous avons utilisé un système de APOBEC3B inductible (A3B) dans 293 cellules T. Un construct lentiviral réactif à la doxycycline exprimant A3B-GFP a été introduit dans les cellules 293T, et des intégrants stables ont été sélectionnés avec de la puromycine. L’induction avec de la doxycycline pendant 72 heures a produit une expression robuste d’A3B-GFP, confirmée par la fluorescence de GFP et une augmentation des niveaux d’A...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le flux de travail CADRES présenté ici fournit une stratégie calibrée et cohérente en interne pour détecter les événements différentiels d’édition d’ARN avec une grande spécificité, en particulier la désamination C>U catalysée par les enzymes APOBEC. Plusieurs étapes du protocole sont déterminantes pour sa précision. Le séquençage génomique et transcriptomique apparié est essentiel pour distinguer les modifications réelles d’ARN des polymorphismes d’ADN sous-jacents, tandis que la procéd...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

J.S., Z.D. et C.Z. sont employés de l’Institut des produits biologiques de Shanghai, une entité actuellement engagée dans le développement commercial de biologiques thérapeutiques.

Remerciements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude a été financée par la Commission des sciences et technologies de Shanghai (23S11901100).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
BCFtoolsSamtools projectN/AVersion 1.21. Détection des variantes et manipulation de VCF. URL: https://github.com/samtools/bcftools
BedtoolsQuinlan LabN/AVersion 2.31.1. Opérations arithmétiques sur le génome. URL: https://github.com/arq5x/bedtools2
BiopythonBiopython projectN/AVersion 1.85. Outils Python pour la biologie moléculaire. URL: https://www.biopython.org
BWA-MEMGitHub (lh3/bwa)N/AVersion 0.7.18. Alignement de DNA-seq. URL: https://github.com/lh3/bwa
CADRES source codeGitHub (junsun-hash/CADRES)N/AVersion 1.0.0. Scripts du pipeline CADRES. URL: https://github.com/junsun-hash/CADRES
Conda ou MinicondaAnaconda Inc.N/AVersion 23.1. Gestionnaire de paquets et d'environnement. URL: https://docs.conda.io/en/latest/miniconda.html
dbSNP GRCh38 VCFNCBIN/ABuild 155. Base de données de variantes germinales communes. URL: https://ftp.ncbi.nih.gov/snp/
GATK4Broad InstituteN/AVersion 4.3.0.0. Toolkit d'analyse de génome. URL: https://github.com/broadinstitute/gatk
GitSoftware Freedom ConservancyN/AVersion 2.39. Système de contrôle de version. URL: https://git-scm.com
gnomAD GRCh38 VCFBroad InstituteN/AVersion 3.1. Fréquences alléliques de la population. URL: https://gnomad.broadinstitute.org
Fichier d'annotation GTFEnsemblN/ARelease 109. Annotation génique pour GRCh38. URL: https://www.ensembl.org
Génome de référence humain GRCh38Ensembl/UCSCN/ARelease 109. Assemblage de génome de référence. URL: https://www.ensembl.org ou https://hgdownload.soe.ucsc.edu
Station de travail ou serveur LinuxVariousN/AUbuntu 20.04. Architecture x86_64 requise. URL: https://ubuntu.com
pblatUCSC Genome BrowserN/AVersion 2.5.1. Réalignement BLAT parallèle. URL: https://github.com/ucscGenomeBrowser/kent
PicardBroad InstituteN/AVersion 2.20.8. Manipulation de données NGS. URL: https://github.com/broadinstitute/picard
PythonPython Software FoundationN/AVersion 3.9.19. Langage de programmation. URL: https://www.python.org
RR FoundationN/AVersion 4.5.2. Calcul statistique. URL: https://www.r-project.org
Package R: forcatsCRANN/AVersion 1.0.0. Manipulation de facteurs. URL: https://cran.r-project.org/package=forcats
Package R: ggplot2CRANN/AVersion 4.0.1. Visualisation de données. URL: https://cran.r-project.org/package=ggplot2
Package R: ggrepelCRANN/AVersion 0.9.5. Répulsion d'étiquettes textuelles. URL: https://cran.r-project.org/package=ggrepel
Package R: lme4CRANN/AVersion 1.1.35. Modèles à effets mixtes linéaires. URL: https://cran.r-project.org/package=lme4
Package R: readrCRANN/AVersion 2.1.5. Lecture rapide de fichiers. URL: https://cran.r-project.org/package=readr
Package R: stringrCRANN/AVersion 1.6.0. Manipulation de chaînes de caractères. URL: https://cran.r-project.org/package=stringr
Référence REDIportalUniversité de BologneN/AVersion 2.0. Base de données de sites d'édition RNA A-to-I. URL: http://srv00.recas.ba.infn.it/atlas/
Annotation RefGeneUCSC Table BrowserN/ARelease 109. Annotation de la structure des gènes. URL: https://genome.ucsc.edu/cgi-bin/hgTables
SamtoolsSamtools projectN/AVersion 1.21. Manipulation de fichiers BAM. URL: https://github.com/samtools/samtools
Aligneur STARGitHub (alexdobin/STAR)N/AVersion 2.7.11b. Alignement de RNA-seq. URL: https://github.com/alexdobin/STAR

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

D tection de l dition de l ARNenzymes APOBECdition C vers Uappel de variants d ARNrecalibrage de la qualit des basesfiltrage des art factsanalyse RNA Seqs quen age du g nome complet

Articles connexes