Die Identifikation und Charakterisierung von Plasmiden ist von großem Interesse für die öffentliche Gesundheit, die klinische Mikrobiologie und die mikrobielle Ökologie, da sie die Erhaltung und Verbreitung adaptiver Gene in ökologischen Umgebungen ermöglichen 1,5 und als Plattformen für beschleunigte Evolution dienen4. Die Einführung von NGS-Technologien ermöglichte die Hochdurchsatzsequenzierung von Genomen mikrobieller Isolate und von Populationen, obwohl die postassemblierte Identifikation vollständiger Plasmide oder von Plasmid-abgeleiteten Kontigs in der Regel Long-Read-Sequenzen erfordert, da Short-Read-Sequenzierungsdaten keine Wiederholungsregionen auflösen können, die größer sind als die Reads. ONT ist zu einem sehr beliebten Long-Read-Sequenzierungsansatz geworden, mit Anwendungen, die über die Ganzgenomsequenzierung und Metagenomik hinausgehen und die Plasmidsequenzverifikation, Nachweis und Charakterisierung epigenetischer Modifikationen, RNA-Sequenzierung sowie die Bewertung der intrinsischen Instabilität von Tandem-Genarrays umfassen (Review in12,49).
Hier präsentieren die Forscher einen Workflow für die ONT-Sequenzierung von Plasmiden, die für Situationen entwickelt wurden, in denen die chromosomale Sequenz bereits bekannt oder nicht von Interesse ist. Der Grund dafür ist, dass die Plasmidextraktion arbeitsintensiv, kostspielig und zeitaufwendig ist (da die Wirtspopulation in Kultur gezüchtet und verarbeitet werden muss), und die Sequenzierung des gesamten Genoms mittels Nanoporentechnologie oft ausreicht, um vollständige Plasmidassemblierungen zu erhalten und gleichzeitig den genomischen Kontext zu liefern. Beispiele, bei denen das Protokoll hilfreich ist, sind die Verifikation einer Plasmidsequenz im Kontext der Plasmid-Gentechnik50,51, die Verbesserung der Genauigkeit bereits durch WGS24 gewonnener Plasmidsequenzen oder die Charakterisierung von Plasmiden, die aus klinischen oder Umweltproben durch Konjugation erfasst wurden.
DNA-Extraktion aus klinischen und Umweltproben muss möglicherweise individuell angepasst werden. Hier berichten die Autoren, dass einige der von ihnen verwendeten klinischen Stämme eine Biofilmmatrix erzeugten, die die Filter verstopfte, mehrere Pelletierungsschritte erforderte und manchmal das Hinzufügen von zwei Filtern erforderlich machte. Außerdem ist für die Sequenzierung konjugativer Plasmide ein größeres Kulturvolumen im Vergleich zur Sequenzierung von Multikopieplasmiden erforderlich, da natürlich vorkommende mittelgroße und große Plasmide tendenziell eine niedrige Plasmid-Kopienzahl2 aufweisen.
Das Protokoll hat die Sequenzierung von Plasmiden zwischen 4 kb und 173 kb ermöglicht. Dieser Bereich liegt eindeutig in die Herstellerspezifikationen (zwischen 2 und 200 kb). Kürzlich untersuchte eine Studie 23.000 Plasmidsequenzen, die in NCBI abgelagert wurden, und fand signifikante Größenunterschiede je nach Quelle, wobei Plasmide menschlichen Ursprungs die kleinste Mediangröße (76 kb) und Boden- und Pflanzenplasmide die größten (215 bzw. 427 kb); Plasmide aus allen anderen Quellen hatten eine mediane Größe zwischen 79 und 147 kB, daher sollte dieses Protokoll die meisten Plasmide abdecken, mit Ausnahme der Megaplasmide52 und Plasmide von Boden- oder Pflanzenherkunft3.
Die Autoren fügen einen Plasmid-DNA-Anreicherungsschritt hinzu, um die Genauigkeit von Plasmid-DNA-Assemblies zu verbessern. Das Vorhandensein großer Mengen chromosomaler DNA flutet die Zellporen der sequenzierenden Flow-Zelle mit nicht-Ziel-Reads und reduziert die Plasmid-DNA-Tiefe erheblich. Ein Plasmid-DNA-Anreicherungsschritt wurde bereits durchgeführt, um die vollständige Zusammensetzung von Plasmid-DNA in klinischen Proben zur Detektion von ARGs24 zu versuchen. Dies zeigte erhebliche Verbesserungen in der Effektivität der Abschluss der Plasmidassemblierung mit einer Nanoporen-reinen Sequenz (78 % vollständige Assemblierungen im Vergleich zum Benchmark). Weitere Beispiele folgten50, 53, 54.
Um die Lesegenauigkeit zu verbessern, verwendeten zwei dieser Studien eine von Nanopore entwickelte Technik namens "paired basecalling on pseudopaired reads"50,53. Dieser Ansatz beinhaltet die Ausrichtung der rohen elektrischen Signale von Sense- und Antisense-Strängen desselben DNA-Moleküls, was zu einer Genauigkeitssteigerung von etwa einer Größenordnung führt. Gepaarte Basecalling bei pseudogepaarten Reads ist mit Multiplexing kompatibel, solange die Strategie die Identifikation der Vorwärts- und Rückwärtsstränge desselben Moleküls ermöglicht. Daher kann es nicht in Plasmiden verwendet werden, die aus Proben unbekannten Plasmidkomplements gereinigt wurden oder eine Mischung von Plasmiden enthalten. Beachten Sie, dass die Anzahl der Plasmide in einem Genom typischerweise zwischen 0 und 7 Plasmiden liegt (insbesondere in klinischen Isolaten)2,55.
Die Forscher stellten ein hohes Maß an chromosomaler Kontamination in den Proben fest (Tabelle 10). Der Kontaminationsgrad der 10 analysierten Proben lag laut Lesekartierung zwischen 28 und 72 %. Als die Forscher diese Sequenz jedoch auf die Größe des Chromosoms relativ zur Größe des vorhandenen Plasmids normalisierten, stellte sich heraus, dass Plasmidsequenzen im Durchschnitt 144-mal häufiger waren als chromosomale. Um diese Zahl auf das Niveau der Plasmid-DNA-Anreicherung zu übertragen, müsste man die Plasmidkopienzahl der Plasmide in jeder Probe kennen.
MinION-Flusszellen erzeugen typischerweise eine Sequenzierungsausgabe von ~30 GB, was theoretisch die Sequenzierung von weit über 96 Plasmiden pro Durchlauf ermöglicht. In der Praxis ist Multiplexing auch durch das 96-Barcode-Limit eingeschränkt, wodurch 96 Plasmide die praktische obere Grenze pro Durchflusszelle darstellen. Chromosomale DNA-Kontamination und natürliches Barcode-Ungleichgewicht verringern jedoch die effektive Lesetiefe pro Probe. Um eine ausreichende Lesetiefe für jede Probe zu gewährleisten, ist ein konservativerer Ansatz, etwa 24 Plasmide pro Durchflusszelle zu multiplexen. Die empfohlene Tiefe für die genaue Montage der Plasmidsequenz liegt zwischen 50 und 70x32,56. In den in diesem Artikel vorgestellten illustrativen Beispielen haben die Autoren 21 multiplexierte Proben in einer Durchflusszelle durchgeführt und eine mittlere Tiefe (109x) erhalten, die gut mit dem empfohlenen Probenoptimum pro Durchflusszelle übereinstimmt.
Beachten Sie, dass bei übermäßiger Lesetiefe Bestanden/Nicht-bestanden-Lesepartitionen weniger informativ sind, um die Gesamtlesequalität zu beurteilen. Stattdessen liefern aus der Längenverteilung abgeleitete Kennzahlen eine klarere Darstellung der Datensatzqualität. Eine solche Metrik ist die N50, definiert als die Leselänge, bei der Lesungen dieser oder längeren Länge 50 % der Gesamtbasen ausmachen. Dieser Wert ist sehr empfindlich gegenüber Qualitätskontrollschritten. Zum Beispiel entfernt das Filtern von minderwertigen oder kurzen Lesungen mit Werkzeugen wie Filtlong einen erheblichen Teil des kürzeren Verteilungs, wodurch das N50 aufgebläht wird. Dieser Effekt ist in Tabelle 9 erkennbar.
Die Autoren verwendeten das Rapid Barcode Kit von ONT, das ein Transposom verwendet, um Plasmid-DNA zu fragmentieren, und daher keine Vorkenntnisse über das Restriktionsmuster des Plasmids erfordern. Eine frühere Studie ergab, dass für kleine Plasmide (<20 kb) eine enzymatische Fragmentierung notwendig ist, da kleine Plasmide bei den meisten DNA-Extraktionen zirkularisiert bleiben und daher keine freien Enden für die Adapterligation54 enthalten. Diese Studie verwendete keine Barcodes, die durch PCR-Amplifikation zusätzliche freie Enden erzeugen, daher ist das in diesem Fall wahrscheinlich ein Punkt von Bedeutung. OnRamp, eines der fortschrittlichsten Verfahren zur routinemäßigen Plasmidvalidierung, vermeidet die Verwendung von Barcodes, indem es vollständige Plasmidlesungen für die Assemblierung nutzt, was die Probenvorbereitung54 vereinfacht. In diesem Fall bevorzugten die Autoren aus drei Gründen Barcodes. Die erste ist, unabhängig von der Plasmidlänge eine Baugruppe zu bauen. Die zweite besteht darin, chromosomale DNA-Kontaminationen zu tolerieren. Der dritte ist, dass dies die Möglichkeit eröffnet, mehrere Samples zu multiplexen, wie oben erwähnt.
Eine frühere Studie stellte fest, dass die Aggregation verschiedener Assembler das Endergebnis verbesserte, indem sie die in einzelnenAssemblerplattformen eingebauten Verzerrungen aufhebt. Diese Metaanalyse ist eine Funktion, die in das von den Autoren verwendete Assemblerprogramm Autocycler34 integriert wurde. Im Vergleich zu seiner früheren Version namens Trycycler57 ist Autocycler etwas automatisierter; Es verwendet mehrere Teilmengen der Reads und (wie bereits erwähnt) führt es Assemblies mit mehreren Assemblern aus, um eine genauere Konsensassemblierung zu erzeugen. Allerdings haben die meisten Assembler, selbst die besten wie Flye28, Canu29 und Raven30, Schwierigkeiten mit dem Vorhandensein von Plasmiden mit umfangreicher Sequenzhomologie, fälschlichem Zusammenführen von Plasmidsequenzen oder der Erzeugung mehrerer Kopien eines einzelnen Plasmids und neigen dazu, kleine Plasmide58,59 zu übersehen (siehe auch Abbildung 4C). Wenn dies geschieht, kann das Ausschneiden von weniger hochwertigen Lesungen und das Entfernen kurzer Lesungen dazu führen, dass chimäre Kontigs gelöst werden.
Um die Gesamtgenauigkeit der Sequenzierungsprotokolle zu belegen, verglichen die Autoren die ONT-only Assemblies mit Assemblies, die durch die Kombination von Long-Read und Short-Read verfeinert wurden, was (abgesehen von PacBio-Daten) der aktuelle Goldstandard ist. Die Autoren hatten außerdem Geldaten, die die Anzahl der vorhandenen Plasmide und deren geschätzte Größe zeigen (Tabelle 8, dritte Spalte). Die Forscher konnten erfolgreich alle 13 Plasmide in den 10 Proben zusammenfügen und erhielten Größen, die mit den zusammengesetzten Sequenzen übereinstimmten. Dies ist ein echter Erfolg, da LR-Sequenz-Assembler oft nicht in der Lage sind, Plasmide mit strukturell komplexen Sequenzen zusammenzusetzen. Auf einer detaillierteren Ebene zeigten paarweise Vergleiche zwischen den beiden Sequenzsätzen eine variable Genauigkeit (Tabelle 8). Fünf der Plasmid-Assemblies hatten Bereiche ohne Abdeckung in den ONT-Assemblies, vermutlich das Ergebnis von Sequenzartefakten, die während der ONT-only Sequenz-Assembly hinzugefügt wurden. Von den anderen sieben zeigten drei Einzelnukleotid-Polymorphismen mit paarweisen Unterschieden zwischen 0,0023 und 0,05 %, und vier zeigten perfekte Konkordanz. Das Maß an Genauigkeit scheint nicht mit der DNA-Anreicherung oder Sequenzierungstiefe des Plasmids korreliert zu sein, aber das Vorhandensein von mehr als einem Plasmid in einer gegebenen Probe tut es, möglicherweise weil mehr als ein Plasmid dazu neigt, die Sequenzkomplexität zu verstärken (Tabelle 8). Zusammenfassend ist der Workflow darauf ausgelegt, die Ausbeute und Genauigkeit der Plasmidsequenz zu optimieren. Obwohl es in der Lage ist, Plasmidsequenzen zusammenzustellen, liefert es auf Nukleotidebene ein variables Maß an Genauigkeit. Das Protokoll kann verwendet werden, um Plasmide einer Vielzahl von Größen zu sequenzieren, toleriert mindestens 72 % chromosomale DNA-Kontamination und kann (je nach Plasmidgröße und Flowzellzustand) mindestens 24 Plasmide in einer einzelnen Durchflusszelle aufnehmen.