L'identificazione e la caratterizzazione dei plasmidi sono di grande interesse per la salute pubblica, la microbiologia clinica e l'ecologia microbica, poiché facilitano il mantenimento e la diffusione dei geni adattivi in contestiecologici 1,5 e fungono da piattaforme per un'evoluzioneaccelerata 4. L'introduzione delle tecnologie NGS ha permesso il sequenziamento ad alta velocità dei genomi di isolati microbici e di popolazioni, anche se l'identificazione post-assemblaggio di plasmidi completi o di conti derivati dai plasmidi generalmente richiede sequenze a lettura lunga perché i dati di sequenziamento a lettura breve non riescono a risolvere regioni ripetute maggiori della dimensione delle letture. ONT è diventato un approccio molto popolare per il sequenziamento a lunga lettura, con applicazioni che vanno oltre il sequenziamento dell'intero genoma e la metagenomica, che includono la verifica delle sequenze plasmidi, la rilevazione e caratterizzazione di modifiche epigenetiche, il sequenziamento dell'RNA e la valutazione dell'instabilità intrinseca degli array genici tandem (revisionati in12,49).
Qui, i ricercatori presentano un flusso di lavoro per il sequenziamento ONT dei plasmidi progettato per situazioni in cui la sequenza cromosomica è già nota o non ha alcun interesse. La ragione è che l'estrazione dei plasmidi è laboriosa, costosa e richiede tempo (poiché la popolazione ospite deve essere coltivata in coltura e processata), e il sequenziamento dell'intero genoma utilizzando la tecnologia nanopore è spesso sufficiente per ottenere assemblaggi completi dei plasmidi fornendo il loro contesto genomico. Esempi in cui il protocollo è utile includono la verifica di una sequenza plasmidica nel contesto dell'ingegneria geneticadei plasmidi 50,51, il miglioramento dell'accuratezza delle sequenze plasmidiche già ottenute dalWGS 24, o la caratterizzazione dei plasmidi catturati da campioni clinici o ambientali tramite coniugazione.
L'estrazione del DNA da campioni clinici e ambientali potrebbe richiedere una certa personalizzazione. Qui, gli autori riportano che alcuni dei ceppi clinici utilizzati hanno prodotto una matrice di biofilm che ostruiva i filtri, richiedendo molteplici fasi di pelleting e talvolta richiedendo l'aggiunta di due filtri. Inoltre, per sequenziare plasmidi coniugativi, è necessario un volume di coltura maggiore rispetto al sequenziamento dei plasmidi multicopia, poiché i plasmidi di medie e grandi dimensioni naturali tendono ad avere un numero di copiadi plasmide basso 2.
Il protocollo ha permesso il sequenziamento di plasmidi tra 4 kb e 173 kb di dimensione. Questa gamma rientra esattamente nelle specifiche del produttore (tra 2 e 200 kb). Recentemente, uno studio ha esaminato 23.000 sequenze di plasmidi depositate nel NCBI e ha riscontrato differenze significative di dimensione a seconda della fonte, con plasmidi di origine umana che presentano la dimensione mediana più piccola (76 kb), e plasmidi di suolo e piante i maggiori (215 e 427 kb, rispettivamente); I plasmidi provenienti da tutte le altre fonti avevano una dimensione mediana compresa tra 79 e 147 kB, quindi questo protocollo dovrebbe coprire la maggior parte dei plasmidi, con la possibile eccezione dei megaplasmidi52 e dei plasmidi di origine del suolo odelle piante 3.
Gli autori includono un passaggio di arricchimento del DNA plasmidico per migliorare l'accuratezza degli assemblaggi del DNA plasmidico. La presenza di grandi quantità di DNA cromosomico allaga i pori cellulari sulla cellula di flusso sequenziante con letture non bersaglio, riducendo sostanzialmente la profondità del DNA plasmidicale. Era già stato implementato un passaggio di arricchimento del DNA plasmidico per tentare l'assemblaggio completo del DNA plasmidico in campioni clinici per la rilevazione degli ARG24. Questo ha mostrato miglioramenti sostanziali nell'efficacia del completamento dell'assemblaggio dei plasmidi con sequenze solo a nanopori (78% degli assemblaggi completi rispetto al benchmark). Altri esempiseguirono 50, 53, 54.
Per migliorare la precisione delle letture, due di questi studi hanno utilizzato una tecnica sviluppata da nanopore chiamata "chiamata a base accoppiata su letture pseudopare"50,53. Questo approccio prevede l'allineamento dei segnali elettrici grezzi provenienti dai filamenti sensoriali e antisensi della stessa molecola di DNA, con conseguente miglioramento della precisione di circa un ordine di grandezza. Il peercalling a base su letture pseudo-pareate è compatibile con il multiplexing, purché la strategia consenta l'identificazione dei filamenti diretti e inversi della stessa molecola. Pertanto, non può essere utilizzato in plasmidi purificati da campioni di complemento plasmidico sconosciuto o contenenti una miscela di plasmidi. Si noti che il numero di plasmidi in un genoma varia tipicamente tra 0 e 7 plasmidi (in particolare negli isolati clinici)2,55.
I ricercatori hanno notato un alto livello di contaminazione cromosomica nei campioni (Tabella 10). Il livello di contaminazione di 10 campioni analizzati variava tra il 28 e il 72% secondo la mappatura delle leture. Tuttavia, quando i ricercatori hanno normalizzato questa sequenza alla dimensione del cromosoma rispetto a quella del plasmide o dei plasmidi presenti, si è scoperto che le sequenze plasmidiche erano in media 144 volte più abbondanti di quelle cromosomiche. Tradurre questo numero al livello di arricchimento del DNA plasmidico richiederebbe di conoscere il numero di copie plasmidiche in ciascun campione.
Le celle di flusso MinION producono tipicamente un'uscita di sequenziamento di ~30 GB, consentendo teoricamente il sequenziamento di oltre 96 plasmidi per run. In pratica, il multiplexing è anche vincolato dal limite di 96 codici a barre, rendendo 96 plasmidi il limite superiore pratico per cella di flusso. Tuttavia, la contaminazione da DNA cromosomico e lo squilibrio naturale dei codici a barre riducono la profondità effettiva di lettura per campione. Per garantire una profondità di lettura sufficiente per ogni campione, un approccio più conservativo consiste nel multiplexare circa 24 plasmidi per cella di flusso. La profondità raccomandata per l'assemblaggio accurato della sequenza plasmidiale è compresa tra 50 e70x32,56. Negli esempi illustrativi presentati in questo articolo, gli autori hanno analizzato 21 campioni multiplexati in una cella di flusso e ottenuto una profondità media (109x), che si allinea bene con l'ottimale del campione raccomandato per cella di flusso.
Si noti che, con una profondità di lettura eccessa, le partizioni di lettura pass/fail sono meno informative per valutare la qualità complessiva della lettura. Invece, le metriche derivate dalla distribuzione della lunghezza forniscono una rappresentazione più chiara della qualità del dataset. Una di queste metriche è l'N50, definita come la lunghezza di lettura a cui le letture di quella lunghezza o più rappresentano il 50% del totale delle basi. Questo valore è altamente sensibile ai passaggi di controllo qualità. Ad esempio, filtrare letture di bassa qualità o brevi con strumenti come Filtlong rimuove una frazione sostanziale della coda più corta della distribuzione, gonfiando così l'N50. Questo effetto è evidente nella Tabella 9.
Gli autori hanno utilizzato il kit Rapid Barcode di ONT, che utilizza un trasosoma per frammentare il DNA plasmide, e quindi non richiede una conoscenza preventiva del modello di restrizione del plasmide. Uno studio precedente ha rilevato che per plasmidi piccoli (<20 kb), la frammentazione enzimatica è necessaria perché i plasmidi piccoli rimangono circolarizzati durante la maggior parte delle estrazioni di DNA e quindi non contengono estremità libere per la ligaturadell'adattatore 54. Quello studio non ha utilizzato codici a barre, che generano ulteriori estremità libere tramite amplificazione PCR, quindi in questo caso è probabilmente irrilevante. OnRamp, una delle procedure avanzate per la validazione di plasmidi di routine, evita l'uso di codici a barre sfruttando letture di plasmidi a lunghezza intera per l'assemblaggio, semplificando la preparazione delcampione 54. In questo caso, gli autori preferivano i codici a barre per tre motivi. La prima è costruire un assemblaggio indipendentemente dalla lunghezza del plasmide. La seconda è tollerare la contaminazione da DNA cromosomico. Il terzo è che questo apre la possibilità di multiplexare diversi campioni, come detto sopra.
Uno studio precedente ha osservato che l'aggregazione di diversi assemblatori ha migliorato il risultato finale annullando i bias integrati nelle singole piattaformedi assemblaggio 24. Questa meta-analisi è una funzionalità che è stata incorporata nel programma di assemblaggio utilizzato dagli autori, Autocycler34. Rispetto alla sua versione precedente, chiamata Trycycler57, Autocycler è un po' più automatizzato; Utilizza diversi sottoinsiemi delle letture e (come già detto) esegue assemblaggi con più assemblatori per creare un assemblaggio consenso più accurato. Tuttavia, la maggior parte degli assemblatori, anche i migliori, come Flye28, Canu29 e Raven30, ha difficoltà con la presenza di plasmidi con un'ampia omologia di sequenza, unendo erroneamente sequenze plasmidiche o generando più copie di un singolo plasmide, e sono soggetti a mancare piccoliplasmidi 58,59 (vedi anche Figura 4C). Quando ciò accade, eliminare letture di qualità inferiore e rimuovere letture brevi può portare alla risoluzione dei contigi chimerici.
Per stabilire l'accuratezza complessiva dei protocolli di sequenziamento, gli autori hanno confrontato gli assembly solo ONT con assembly rifiniti combinando letture lunghe e brevi, che (a meno dei dati PacBio) è lo standard d'oro attuale. Gli autori avevano anche dati in gel che mostravano il numero di plasmidi presenti e le loro dimensioni stimate (Tabella 8, terza colonna). I ricercatori hanno assemblato con successo tutti i 13 plasmidi presenti nei 10 campioni e hanno ottenuto dimensioni coerenti con le sequenze assemblate. Questo è un notevole successo, poiché gli assemblatori di sequenze LR spesso non riescono ad assemblare plasmidi con sequenze strutturalmente complesse. A un livello più granulare, i confronti a coppie tra i due insiemi di sequenze indicavano un livello variabile di accuratezza (Tabella 8). Cinque degli assemblaggi plasmidiali avevano aree senza copertura negli assemblaggi ONT, presumibilmente il risultato di sequenze aggiunte artificialmente durante l'assemblaggio della sequenza solo ONT. Degli altri sette, tre hanno mostrato polimorfismi a singolo nucleotide, con differenze a coppie che variano tra lo 0,0023 e lo 0,05%, e quattro hanno mostrato concordanza perfetta. Il livello di accuratezza non sembra corrispondere al livello di arricchimento del DNA plasmidico o alla profondità di sequenziamento, ma la presenza di più di un plasmide in un dato campione sì, probabilmente perché avere più di un plasmide tende ad amplificare il livello di complessità della sequenza (Tabella 8). In sintesi, il flusso di lavoro è progettato per ottimizzare la resa e l'accuratezza delle sequenze plasmidiali. Sebbene sia in grado di assemblare sequenze plasmidi, produce un livello variabile di accuratezza a livello nucleotidico. Il protocollo può essere utilizzato per sequenziare plasmidi di un'ampia gamma di dimensioni, tollera almeno il 72% di contaminazione da DNA cromosomico e può ospitare (a seconda della dimensione del plasmide e dello stato della cella di flusso) almeno 24 plasmidi in una singola cella di flusso.