Plazmidy są samoreplikującymi się fragmentami DNA, powszechnie występującymi u bakterii. Ich wielkość jest bardzo zmienna, waha się od <800 bp do 2,5 Mbp, a zazwyczaj mają rozkład dwuizbowy, z mniejszym szczytem odpowiadającym wielokopianym, niekoniugacyjnym plazmidom i większym szczytem odpowiadającym plazmidom o niskiej kopii, często koniugacyjnych1,2. Plazmidy odgrywają kluczowa rolę w ekologii mikrobiologicznej, przenosząc geny, które pomagają ich gospodarzom przystosować się do wyzwań środowiskowych lub uzyskać dostęp do nowych nisz ekologicznych. Plazmidy służą również jako platformy dla przyspieszonej ewolucji, zapewniając zwiększoną plastyczność genetyczną i pośrednicząc w poziomym przenoszeniu genów między szczepami, gatunkami, rodzajami, a nawet rodzinami3,4. Analizy sieciowe i porównawcze genomów potwierdziły rolę środowiskowego rezystomatu jako trwałego rezerwuaru klinicznie istotnych genów odporności na antybiotyki (ARG), ułatwiając w ten sposób ich utrzymanie i rozprzestrzenianie się w różnych środowiskach ekologicznych5. Śledzenie plazmidów i ich zawartości, czyli genów odporności na antybiotyki i genów wirulencji, pomaga w identyfikacji ścieżek transmisji6. Dlatego identyfikacja i charakterystyka plazmidów jest bardzo istotna dla wielu zastosowań w zdrowiu publicznym, mikrobiologii klinicznej i biotechnologii.
Wprowadzenie technologii sekwencjonowania nowej generacji (NGS), które umożliwiają wysokowydajne sekwencjonowanie nieznanych szablonów DNA, otworzyło drogę do genomowej charakterystyki izolowanych mikrobów. Sekwencjonowanie całego genomu (WGS) umożliwia śledzenie pojawiania się, rozprzestrzeniania się i przenoszenia nowych patogenów, szczepów odpornych na leki i wariantów unikających szczepionek. Jest również coraz częściej wykorzystywane do pomocy w identyfikacji ścieżek transmisji podczas klinicznych wybuchów epidemii, potencjalnie informując o interwencjach w celu zapobiegania przyszłym wybuchom7. Wreszcie, WGS pozwala na profilowanie genów ARG, które mogą informować o decyzjach terapeutycznych8, chociaż łączenie ARG z jakościowymi i ilościowymi fenotypami odporności na antybiotyki jest nadal w trakcie realizacji9.
Jednak krótkie dane sekwencjonowania (SR), które są zazwyczaj produkowane przez WGS w skali, są ogólnie w zakresie 400–500 bp. Ta wielkość jest krótsza niż wielkość większości Mobilnych Elementów Genetycznych (MGEs) i dlatego nie może ich rozdzielić10. In silico identyfikacja sekwencji plazmidów w danych WGS jest dalsza skomplikowana przez niekompletne pokrycie i ze względu na wspólne sekwencje między plazmidami a także między bakteriami chromosomami i innymi plazmidami10. W konsekwencji, skomplikowane złożenia są często rozbite i niekompletne, co sprawia, że ich subgenomowa lokalizacja (chromosomalna lub plazmidowe) jest niemożliwa do przypisania10.
Technologia sekwencjonowania długich odczytów (LR) generuje bardzo ciągłe złożenia, które rozciągają się na większą liczbę powtórzeń, co znacznie ułatwia produkcję kompletnych złożeń plazmidowych. Są zasadniczo dwa rodzaje długich, jednocząsteczkowych technologii sekwencjonowania11,12. Jedna z tych metod, sekwencjonowanie nanoporowe, staje się popularna w mikrobiologii ze względu na niski koszt, szybkie czasy realizacji i przydatność dla środowisk o ograniczonych zasobach13,14.
Urządzenia sekwencjonowania nanoporowego używają komórek przepływowych zawierających tablice tysięcy nanoporów. DNA jest wczytywane do komórki przepływowej, otwierane przez białko motoryczne z aktywnością helikazy i przepływa przez nanopory napędzane różnicą prądu. Gdy nukleotydy w danym pojedynczym łańcuchu przechodzą przez pojedyncze nanopory, prąd jest zakłócany, co wytwarza charakterystyczny sygnał, który jest mierzony przez elektroniczny czujnik podłączony do każdego poru. Ten sygnał jest dekodowany za pomocą algorytmów basecallingu, a wynikowe dane są zbierane i analizowane dalej przy użyciu różnych narzędzi bioinformatycznych.
W porównaniu z podejściami SR-sekwencjonowania, sekwencjonowanie nanoporowe ma tendencję do produkowania niższej jakości odczytów (niższe wyniki Q) i generowania wstawień/delecji w sekwencjach homopolimerów podczas analizy danych elektrycznych (basecallingu)15. Zauważono również, że pobliska metylacja w natywnym DNA może powodować systematyczne błędy w basecallingu16. Powszechnie stosowanym rozwiązaniem jest dołączenie danych SR do korekcji błędów po montażu. Jednak ten proces (znany jako “polerowanie”) zwiększa koszt i kompleksowość17. Zwiększenie pokrycia sekwencjonowania może również poprawić dokładność, ale nie zawsze jest to technicznie osiągalne.