L’identification et la caractérisation des plasmides suscitent un grand intérêt pour la santé publique, la microbiologie clinique et l’écologie microbienne, car ils facilitent le maintien et la diffusion des gènes adaptatifs dans des contextes écologiques 1,5 et servent de plateformes pour une évolutionaccélérée 4. L’introduction des technologies NGS a permis le séquençage à haut débit des génomes d’isolats microbiens et de populations, bien que l’identification post-assemblage de plasmides complets ou de contigs dérivés des plasmides nécessite généralement des séquences à longue lecture, car les données de séquençage en lecture courte ne permettent pas de résoudre des régions répétées supérieures à la taille des lectures. L’ONT est devenue une approche très populaire de séquençage à longue lecture, avec des applications allant au-delà du séquençage du génome complet et de la métagénomique, incluant la vérification des séquences plasmidiques, la détection et la caractérisation des modifications épigénétiques, le séquençage de l’ARN, ainsi que l’évaluation de l’instabilité intrinsèque des réseaux de gènes en tandem (révisé dans12,49).
Ici, les chercheurs présentent un flux de travail pour le séquençage ONT des plasmides conçu pour des situations où la séquence chromosomique est déjà connue ou sans intérêt. La raison en est que l’extraction des plasmides est laborieuse et coûteuse en temps (car la population hôte doit être cultivée en culture et traitée), et le séquençage de l’ensemble du génome à l’aide de la technologie nanopore suffit souvent à obtenir des assemblages complets de plasmides tout en fournissant leur contexte génomique. Parmi les exemples où le protocole est utile, on trouve la vérification d’une séquence plasmidique dans le contexte de l’ingénierie génétiqueplasmidique 50,51, l’amélioration de la précision des séquences plasmidiques déjà obtenues par WGS24, ou la caractérisation de plasmides capturés à partir d’échantillons cliniques ou environnementaux par conjugaison.
L’extraction d’ADN à partir d’échantillons cliniques et environnementaux peut nécessiter une certaine adaptation. Ici, les auteurs rapportent que certaines souches cliniques qu’ils ont utilisées ont produit une matrice de biofilm qui obstruait les filtres, nécessitant plusieurs étapes de pelletage et parfois l’ajout de deux filtres. De plus, pour séquencer les plasmides conjugatifs, un volume de culture plus important est nécessaire par rapport au séquençage des plasmides multi-copies, car les plasmides de taille moyenne et grande naturellement présents ont tendance à avoir un faible nombre de copiesplasmidiques 2.
Le protocole a permis le séquençage de plasmides de taille comprise entre 4 kb et 173 kb. Cette plage correspond parfaitement aux spécifications du constructeur (entre 2 et 200 kb). Récemment, une étude a examiné 23 000 séquences plasmidiques déposées dans le NCBI et a trouvé des différences de taille significatives selon la source, les plasmides d’origine humaine ayant la plus petite taille médiane (76 kb), et les plasmides du sol et des plantes les plus importants (215 et 427 kb, respectivement) ; Les plasmides provenant de toutes les autres sources avaient une taille médiane comprise entre 79 et 147 kB, donc ce protocole devrait couvrir la plupart des plasmides, à l’exception possible des mégaplasmides52 et des plasmides d’origine solienneou végétale 3.
Les auteurs incluent une étape d’enrichissement de l’ADN plasmidique pour améliorer la précision des assemblages d’ADN plasmidique. La présence de grandes quantités d’ADN chromosomique inonde les pores cellulaires de la cellule de flux séquençant avec des lectures non ciblées, réduisant considérablement la profondeur de l’ADN plasmidique. Une étape d’enrichissement de l’ADN plasmidique a déjà été mise en œuvre pour tenter l’assemblage complet de l’ADN plasmidique dans des échantillons cliniques pour la détection des ARG24. Cela a montré des améliorations substantielles dans l’efficacité de l’assemblage des plasmides avec une séquence nanopore uniquement (78 % d’assemblages complets par rapport à la référence). D’autres exemples ont suivi50, 53, 54.
Pour améliorer la précision des lectures, deux de ces études ont utilisé une technique développée par nanopore appelée « appel de base par paires sur des lectures pseudo-appariées »50,53. Cette approche consiste à aligner les signaux électriques bruts provenant des brins sensibles et antisens d’une même molécule d’ADN, ce qui améliore la précision d’environ un ordre de grandeur. Le « pairing basecalling » sur des lectures pseudoappariées est compatible avec le multiplexage, tant que la stratégie permet d’identifier les brins avant et arrière d’une même molécule. Ainsi, il ne peut pas être utilisé dans des plasmides purifiés à partir d’échantillons de complément plasmidique inconnu ou contenant un mélange de plasmides. Notez que le nombre de plasmides dans un génome varie généralement entre 0 et 7 plasmides (notamment dans les isolats cliniques)2,55.
Les chercheurs ont constaté un niveau élevé de contamination chromosomique dans les échantillons (Tableau 10). Le niveau de contamination de 10 échantillons analysés variait entre 28 et 72 % selon la cartographie de lecture. Cependant, lorsque les chercheurs ont normalisé cette séquence à la taille du chromosome par rapport à celle du ou des plasmides présents, il a été constaté que les séquences plasmidiques étaient en moyenne 144 fois plus abondantes que les séquences chromosomiques. Traduire ce nombre au niveau d’enrichissement de l’ADN plasmidique nécessiterait de connaître le nombre de copies plasmidiques des plasmides dans chaque échantillon.
Les cellules de flux MinION produisent généralement une sortie de séquençage de ~30 Go, permettant théoriquement le séquençage de bien plus de 96 plasmides par exécution. En pratique, le multiplexage est également contraint par la limite de 96 codes-barres, ce qui fait de 96 plasmides la limite supérieure pratique par cellule de flux. Cependant, la contamination de l’ADN chromosomique et le déséquilibre naturel des codes-barres réduisent la profondeur de lecture effective par échantillon. Pour garantir une profondeur de lecture suffisante pour chaque échantillon, une approche plus conservatrice consiste à multiplexer environ 24 plasmides par cellule de flux. La profondeur recommandée pour l’assemblage précis de la séquence plasmidique est comprise entre 50 et70x32,56. Dans les exemples illustratifs présentés dans cet article, les auteurs ont analysé 21 échantillons multiplexés dans une cellule de flux et obtenu une profondeur moyenne (109x), ce qui correspond bien à l’optimum recommandé pour chaque cellule de flux.
Notez qu’avec une profondeur de lecture excédentaire, les partitions de lecture réussi/échec sont moins informatives pour évaluer la qualité globale de lecture. Au contraire, les métriques dérivées de la distribution de longueur offrent une représentation plus claire de la qualité des ensembles de données. Un de ces indicateurs est le N50, défini comme la longueur de lecture à laquelle les lectures de cette longueur ou plus représentent 50 % du total des bases. Cette valeur est très sensible aux étapes de contrôle qualité. Par exemple, filtrer les lectures de faible qualité ou courtes avec des outils comme Filtlong enlève une fraction substantielle de la queue plus courte de la distribution, gonflant ainsi le N50. Cet effet est évident dans le tableau 9.
Les auteurs ont utilisé le kit Rapid Barcode d’ONT, qui utilise un transposome pour fragmenter l’ADN plasmidique, et ne nécessite donc pas de connaissance préalable du schéma de restriction du plasmide. Une étude antérieure a montré que pour les petits plasmides (<20 kb), la fragmentation enzymatique est nécessaire car les petits plasmides restent circularisés lors de la plupart des extractions d’ADN, et ne contiennent donc pas d’extrémités libres pour la ligationadaptateur 54. Cette étude n’a pas utilisé de codes-barres, qui génèrent des extrémités libres supplémentaires par amplification PCR, donc dans ce cas, cela est probablement sans objet. OnRamp, l’une des procédures avancées pour la validation de plasmides de routine, évite l’utilisation de codes-barres en utilisant des lectures de plasmides pleine longueur pour l’assemblage, simplifiant ainsi la préparationde l’échantillon 54. Dans ce cas, les auteurs ont préféré les codes-barres pour trois raisons. La première consiste à construire un assemblage quelle que soit la longueur du plasmide. La seconde consiste à tolérer la contamination par l’ADN chromosomique. Le troisième est que cela ouvre la possibilité de multiplexer plusieurs échantillons, comme indiqué ci-dessus.
Une étude antérieure a noté que l’agrégation de différents assembleurs améliorait le résultat final en annulant les biais intégrés aux plateformesd’assemblage individuelles 24. Cette méta-analyse est une fonctionnalité qui a été intégrée dans le programme d’assemblage utilisé par les auteurs, Autocycler34. Par rapport à sa version précédente, nommée Trycycler57, Autocycler est un peu plus automatisé ; Il utilise plusieurs sous-ensembles des lectures et (comme mentionné précédemment) il effectue des assemblages avec plusieurs assembleurs pour créer un assemblage consensus plus précis. Cependant, la plupart des assembleurs, même les meilleurs, comme Flye28, Canu29 et Raven30, ont du mal à gérer la présence de plasmides présentant une homologie de séquence étendue, à fusionner par erreur des séquences plasmidiques ou à générer plusieurs copies d’un même plasmide, et sont sujets à manquer de petits plasmides58,59 (voir aussi Figure 4C). Lorsque cela se produit, supprimer les lectures de moindre qualité et supprimer les lectures courtes peut conduire à résoudre des contenus chimériques.
Pour établir la précision globale des protocoles de séquençage, les auteurs ont comparé les assemblages uniquement ONT avec des assemblages polis en combinant des lectures longues et courtes, ce qui (en dehors des données PacBio) est la référence actuelle. Les auteurs disposaient également de données sur gel montrant le nombre de plasmides présents et leur taille estimée (Tableau 8, troisième colonne). Les chercheurs ont réussi à assembler les 13 plasmides trouvés dans les 10 échantillons et à obtenir des tailles compatibles avec les séquences assemblées. C’est un certain succès, car les assembleurs de séquences LR échouent souvent à assembler des plasmides avec des séquences structurellement complexes. À un niveau plus précis, les comparaisons par paires entre les deux ensembles de séquences indiquaient un niveau de précision variable (Tableau 8). Cinq des assemblages plasmidiques avaient des zones sans couverture dans les assemblages ONT, vraisemblablement le résultat d’une séquence ajoutée artificiellement lors de l’assemblage de séquence uniquement ONT. Parmi les sept autres, trois présentaient des polymorphismes mononucléotidiques, avec des différences par paires allant de 0,0023 à 0,05 %, et quatre montraient une concordance parfaite. Le niveau de précision ne semble pas correspondre au niveau d’enrichissement ou de profondeur de séquençage de l’ADN plasmidique, mais la présence de plus d’un plasmide dans un échantillon donné, oui, possiblement parce que la présence de plus d’un plasmide tend à amplifier le niveau de complexité de séquence (Tableau 8). En résumé, le flux de travail est conçu pour optimiser le rendement et la précision des séquences plasmidiques. Bien qu’il soit capable d’assembler des séquences plasmidiques, il produit un niveau de précision variable au niveau des nucléotides. Le protocole peut être utilisé pour séquencer des plasmides de différentes tailles, tolère au moins 72 % de contamination par l’ADN chromosomique, et peut accueillir (selon la taille du plasmide et l’état de la cellule de flux) au moins 24 plasmides dans une seule cellule de flux.