$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
L'editing dell'RNA costituisce uno strato dinamico di regolazione post-trascrizionale che consente sostituzioni nucleotidiche specifiche all'interno dei trascritti di RNA senza alterare la sequenza di DNA sottostante. Nei metazoi, la deaminazione da adenosina-inosina (A>I) mediata dagli enzimi ADAR è la forma predominante e contribuisce alla diversificazione dei trascrizioni, alla stabilità dell'mRNA, alla modulazione immunitaria innata e alla funzioneneuronale 1,2. Citidina-a-uridina (C>U) (d'ora in poi "C>U" in contesto biologico; La deaminazione "C>T" nel contesto del sequenziamento), catalizzata dai membri della famiglia APOBEC, opera parallelamente a queste vie ed è implicata nel metabolismo lipidico, nella restrizione virale, nella mutagenesi e nei ruoli regolatori emergenti nella biologia immunitaria e oncologica 3,4,5,6,7. Lavori recenti hanno dimostrato che diversi enzimi APOBEC, tra cui APOBEC1, APOBEC3A e APOBEC3B (A3B), catalizzano l'editing dell'RNA in contesti fisiologici epatologici 3,4,7,8,9,10. APOBEC3 enzimi inducono anche l'editing del DNA, producendo firme mutazionali sovrapposte che complicano la discriminazione tra editing dell'RNA e variazionegenomica 8,10,11,12.
Il sequenziamento di nuova generazione ha permesso l'identificazione a livello di trascrittoma dei potenziali siti di editing dell'RNA, tuttavia distinguere vere modifiche da SNV genomici o rumore tecnico rimane difficile. Gli eventi A>I e C>U appaiono come sostituzioni A>G e C>T nelle librerie di cDNA e possono essere confusi da errori di priming, errori di polimerasi, artefatti di mappatura e cambiamenti di espressione specifici per il contesto. Risorse pubbliche come REDIportal13 catalogano milioni di siti A>I, mentre le annotazioni C>U rimangono scarse, riflettendo sia vincoli biologici che analitici. L'identificazione affidabile del montaggio C>U—soprattutto i cambiamenti tra le condizioni—rimane quindi un bisogno analitico insoddisfatto.
L'obiettivo principale del metodo qui presentato, il Calibrated Differential RNA Editing Scanner (CADRES), è l'identificazione precisa delle Varianti Differenziali sull'RNA (DVR): siti di editing che subiscono variazioni statisticamente significative nella profondità di montaggio tra due o più condizionidefinite 14. Nello sviluppo di questo protocollo, abbiamo cercato di affrontare due ostacoli persistenti. Innanzitutto, le vere modifiche dell'RNA devono essere distinte dalle varianti codificate nel DNA. In secondo luogo, le differenze di editing devono essere quantificate in modo statisticamente robusto tra i dataset di RNA-seq replicati biologicamente. L'innovazione centrale di CADRES risiede nell'integrazione della chiamata congiunta di varianti DNA/RNA con un trattamento calibrato delle varianti RNA durante la ricalibrazione del punteggio di qualità di base (BQSR). Questa strategia di "ricalibrazione del boost" preserva i nuovi siti di editing RNA scoperti durante la BQSR, prevenendo così un declassamento sistematico della qualità che comunemente erode la sensibilità per le modifiche a bassafrequenza 15,16,17. Questo approccio riduce i falsi negativi e migliora la specificità rispetto alle pipeline che si basano esclusivamente su database di editing RNA incompleti.
CADRES si inserisce in un panorama di metodi che affrontano diversi aspetti dell'analisi dell'editing dell'RNA. Artefatti di filtroSNPiR 18 e RVboost19 da set varianti solo a RNA; VaDiR 20 incorpora confronti DNA–RNA ma non modella la struttura replicata; rMATS-DVR21 esegue test differenziali basati su GLMM ma si basa esclusivamente su RNA-seq; e JACUSA/JACUSA222,23 supportano la rilevazione consapevole delle repliche ma non incorporano strategie di interrogazione o ricalibrazione congiunta DNA–RNA. CADRIS unifica la modellazione statistica consapevole delle repliche, la chiamata di varianti congiunti DNA/RNA e la ricalibrazione arricchita per i siti di editing de novo, fornendo un unico flusso di lavoro ottimizzato per rilevare l'editing RNA dipendente dalla condizione—inclusi gli eventi C>U collegati all'attivitàAPOBEC 10,11,12.
In questo contesto, gli utenti possono considerare CADRES appropriato quando il loro sistema sperimentale soddisfa i seguenti criteri. Innanzitutto, è disponibile il sequenziamento di RNA-seq accoppiato e del genoma intero o dell'esoma intero dagli stessi campioni, consentendo una rigorosa partizione degli eventi derivati da RNA da varianti codificate nel DNA. In secondo luogo, la questione biologica riguarda i cambiamenti nell'editing dell'RNA tra le condizioni — come l'induzione enzimatica, lo stress ambientale, le fasi dello sviluppo o gli stati patologici — dove la modellazione statistica della profondità allelica specifica tra repliche è essenziale. In terzo luogo, il ricercatore cerca una maggiore specificità nella rilevazione dell'editing C>U, dove distinguere gli eventi di RNA dalla mutagenesi del DNA guidata da APOBEC è indispensabile. CADRI è particolarmente prezioso in sistemi in cui l'attività APOBEC induce sia modifiche di RNA che di DNA, come dimostrato nei modelli A3Binduttibili 10, 11,12 e dove i metodi convenzionali basati solo sull'RNA mostrano tassi gonfiati di falsi positivi dovuti a SNV confondenti o artefatti a sequenza ripetitiva.
I CACTORES offrono diversi vantaggi pratici. La chiamata della variante congiunta DNA/RNA riduce i falsi positivi causati dal SNV. La ricalibrazione del boost preserva i veri segnali di modifica, inclusi eventi nuovi assenti nei database di riferimento. Il GLMM derivato da rMATS fornisce un quadro statisticamente di principio per l'analisi di editing differenziale tra repliche. Insieme, queste caratteristiche forniscono una piattaforma calibrata e ad alta precisione per studiare l'editing dinamico dell'RNA in contesti sperimentali e patologici. Nel nostro precedentestudio 14, CADRES è stato rigorosamente confrontato con metodi consolidati di rilevamento dell'editing dell'RNA, utilizzando sia dataset simulati in silico sia modelli reali di cellule A3B inducibili. Nella valutazione in silico, i CADRES hanno costantemente ottenuto punteggi di precisione di 0,85–0,95 e punteggi di precisione di 0,92–0,98 su tutti i numeri replicati. Il flusso di lavoro complessivo di CADRES è illustrato nella Figura 1.