7 grudnia 2021
Ta analityczna platforma obliczeniowa dostarcza praktycznych wskazówek dla mikrobiologów, ekologów i epidemiologów zainteresowanych genomiką populacji bakteryjnej. W szczególności zaprezentowane tutaj prace pokazały, w jaki sposób można przeprowadzić: i) mapowanie hierarchicznych genotypów pod kierunkiem filogenezy; ii) analiza genotypów oparta na częstotliwości; iii) analizy pokrewieństwa i klonalności; iv) Identyfikacja loci akcesoryjnych różnicujących rodowód.
Ten protokół analityczny pozwala na badanie patogennych populacji bakterii na dużą skalę. Jest to bardzo ważne, ponieważ usprawnia prowadzenie badań ekologicznych i epidemiologicznych. Ale aby tak się stało, potrzebujemy zautomatyzowanego i skalowalnego narzędzia lub platformy obliczeniowej, która pozwoli na analizę wielu tysięcy sekwencji genomu jednocześnie.
ProkEvo wpisuje się w tę niszę i pozwala na przeprowadzenie praktycznej analizy populacji bakterii na dużą skalę, przy jednoczesnym mapowaniu treści pangenomicznej, która dokonuje przeglądu genotypów i unikalnych cech tych genotypów w celu przeprowadzenia badań ekologicznych i epidemiologicznych. Główną zaletą tego protokołu jest wykorzystanie potężnych, zautomatyzowanych i skalowalnych platform obliczeniowych, takich jak ProkEvo, do heurystycznego wydobywania hierarchicznych genotypów w populacjach bakterii. Prezentowany dziś protokół analityczny ma kilka praktycznych implikacji.
Jednym z nich jest ułatwienie diagnostyki w tym sensie, że pozwoliłoby na mapowanie i śledzenie genotypów bakteryjnych w czasie rzeczywistym, w sposób skalowalny, co pozwala na rozpoznanie i zdefiniowanie patogennych linii patogenów w celu śledzenia i mapowania tych patogenów w różnych warunkach. Innym zastosowaniem jest usprawnienie rutynowego nadzoru nad laboratoriami zdrowia publicznego i agencjami regulacyjnymi, co ma na celu ułatwienie śledzenia patogenów w różnych warunkach komercyjnych. Przedstawiony tutaj protokół zawiera praktyczne wskazówki dla mikrobiologów, ekologów, epidemiologów i wszystkich zainteresowanych genomiką populacji bakterii.
ProkEvo to platforma typu open source i publicznie dostępna, a jej strona GitHub zawiera szczegółowe instrukcje użytkowania. Opisany tutaj protokół można również znaleźć na GitHubie. Dzięki dostarczonym instrukcjom chcemy, aby ProkEvo i ten protokół były łatwe w użyciu i mogły być używane przez początkujących i zaawansowanych badaczy.
Rozpocznij przeprowadzanie analiz za pomocą drzewa Gigi, aby wykreślić drzewo filogenetyczne wraz z informacjami genotypowymi. Aby to zrobić, zoptymalizuj rozmiar figury drzewa Gigi, w tym średnicę i szerokość słojów, zmieniając wartości liczbowe na mapie cieplnej x-lim i G. Podczas wykreślania wielu warstw danych za pomocą drzewa filogenetycznego należy zagregować wszystkie metadane w najmniejszą możliwą liczbę kategorii, aby ułatwić wybór panelu do kolorowania.
Przeprowadź agregację danych w oparciu o pytanie o zainteresowania i wiedzę domenową. Po zakończeniu użyj wykresu słupkowego, aby ocenić względne częstości, agregując dane dla typu sekwencji lub linii ST oraz typowania sekwencji wielolocus w rdzeniu genomu lub wariantów cgMLST, aby ułatwić wizualizacje. Wybierz empiryczny lub statystyczny próg używany do agregacji danych.
Przykładowy kod może być użyty do sprawdzenia rozkładu częstotliwości linii ST i określenia punktu odcięcia. Przykładowy kod pokazuje, jak agregowane są pomocnicze lub podrzędne jednostki ST o niskiej częstotliwości. Jednostki ST, które nie są ponumerowane, można grupować jako inne ST.
Użyj podobnego kodu dla wariantów cgMLST. Użyj podejścia zagnieżdżonego, aby obliczyć proporcję każdej linii ST w każdej podgrupie BAPS1, aby zidentyfikować ST należące do tej samej podgrupy BAPS1. Kod ilustruje, w jaki sposób można obliczyć proporcję opartą na ST w podgrupach BAPS1.
Aby wykreślić rozkład oporności na środki przeciwdrobnoustrojowe lub loci oporności na środki przeciwdrobnoustrojowe w liniach ST, należy użyć progu empirycznego lub statystycznego w celu odfiltrowania najważniejszych loci oporności na środki przeciwdrobnoustrojowe w celu ułatwienia wizualizacji. Zapewnij surowy. plik csv zawierający obliczone proporcje wszystkich loci AMR we wszystkich liniach ST.
Następnie oblicz proporcję AMR dla każdego ST za pomocą kodu. Po wykonaniu obliczeń dla wszystkich ST należy połączyć zestawy danych w jedną ramkę danych za pomocą kodu, a następnie wyeksportować plik csv zawierający obliczone proporcje z kodem. Przed wykreśleniem rozkładu opartego na robotach AMR w liniach ST przefiltruj dane na podstawie progu, aby ułatwić wizualizacje.
Następnie wykreśl filogenezę rdzenia genomu wraz z hierarchicznymi klasyfikacjami genotypowymi w danych AMR na jednym wykresie przy użyciu drzewa Gigi. Następnie zoptymalizuj rozmiar figury wewnątrz drzewa Gigi, korzystając z parametrów wymienionych wcześniej. Zoptymalizuj wizualizacje, agregując zmienne lub używając klasyfikacji binarnej, takiej jak obecność lub brak genów.
Zbadano hierarchiczną strukturę populacji pierwszej linii Salmonella enterica w kontekście filogenezy genomu podstawowego. Względne częstości wszystkich genotypów hierarchicznych wykorzystano następnie do oceny ogólnego rozkładu i najczęściej obserwowanych klasyfikacji. Rzadziej występujące linie ST zostały zagregowane jako inne ST, aby ułatwić wizualizację danych.
Podobnie, rzadsze warianty cgMLST zostały zagregowane jako inne cgMLST. Relacje rodowe między ST zbadano przy użyciu podejścia zagnieżdżonego, oceniając względną częstość linii ST przez podgrupy lub haplotypy BAPS1. Oceniono względną częstość różnicowania loci oporności na oporność na środki przeciwdrobnoustrojowe w linii ST w celu zidentyfikowania unikalnych dodatkowych sygnatur genomowych związanych ze strukturą populacji serowara Newport.
W wynikach stwierdzono, że MDFA i loci AAC6IAA zostały nabyte przez przodków w populacji serowarów Newport, podczas gdy przewiduje się, że ST45 jest oporny na wiele leków. W porównaniu z ST45, inne główne linie ST, takie jak ST5 i ST118, są bardziej podatne na wiele leków. Dodatkowo wykorzystano wizualizację zakotwiczoną w filogenezie w celu systematycznej integracji danych dotyczących hierarchicznej struktury populacji.
Ten protokół analityczny stanowi podstawę do eksploracji danych populacji bakterii na dużą skalę. Pozwala to na mapowanie i śledzenie genotypów na dużą skalę za pomocą ProkEvo, ale może być również rozszerzony, aby odpowiedzieć na inne pytania, takie jak badanie rozkładu szlaków metabolicznych i czynników wirulencji związanych z informacjami genotypowymi. Oznacza to, że możemy przewidzieć fenotypy, które są związane z określonymi genotypami będącymi przedmiotem zainteresowania.
Opisany tutaj protokół zdecydowanie toruje drogę naukowcom do zbadania nowych pytań w dziedzinie genomiki populacyjnej i wnioskowania o wzorcach ewolucyjnych i ekologicznych dla patogennych i niepatogennych gatunków bakterii.
Wyświetl pełny transkrypt i uzyskaj dostęp do tysięcy filmów naukowych
Niniejszy artykuł przedstawia praktyczny, skalowalny protokół genomicznej analizy populacji bakteryjnych z wykorzystaniem platformy obliczeniowej ProkEvo. Dzięki zastosowaniu danych z sekwencjonowania całego genomu (WGS) oraz hierarchicznego mapowania genotypowego, protokół ten umożliwia badaczom analizę tysięcy genomów bakteryjnych, co ułatwia prowadzenie badań ekologicznych i epidemiologicznych. Podejście to zostało zademonstrowane na przykładzie Salmonella Newport, integrując dane filogenetyczne, genotypowe oraz dane dotyczące genomu akcesoryjnego w celu ujawnienia struktury populacji i wzorców oporności na środki przeciwdrobnoustrojowe.
Niniejszy protokół umożliwia skalowalną, zautomatyzowaną analizę genomiki populacyjnej bakterii z wykorzystaniem danych z sekwencjonowania całego genomu, wspierając nadzór epidemiologiczny oraz wnioskowanie ekologiczne w obszarze zdrowia publicznego i regulacji prawnych. Poprzez integrację hierarchicznego mapowania genotypów z analizą akcesoryjnego genomu, dostarcza on ram do minimalizacji ryzyka w walidacji celów w badaniach nad opornością na środki przeciwdrobnoustrojowe oraz czynnikami wirulencji. Podejście to zwiększa pewność predykcyjną w odniesieniu do specyficznych dla linii sygnatur genomicznych, dostarczając informacji niezbędnych do podejmowania decyzji typu go/no-go w wczesnych etapach poszukiwania nowych interwencji przeciwbakteryjnych.
Metoda ta integruje się z kontinuum odkryć — od wczesnej fazy odkrywania (Early Discovery), przez identyfikację związku wiodącego (Lead Identification), aż po prace przedkliniczne — zapewniając skalowalne mapowanie genotypowe oraz analizę genomu akcesoryjnego, co wspiera testowanie hipotez, wyjaśnianie szlaków metabolicznych i redukcję ryzyka biologicznego.