$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Na ścieżce od ekstrakcji próbki DNA do identyfikacji wariantów, które mogą być interesujące przy rozważaniu diagnozy pacjenta, progresji choroby i możliwych opcji leczenia, ważne jest, aby rozpoznać różnorodny charakter metodologii wymaganej zarówno do sekwencjonowania, jak i prawidłowego przetwarzania danych. Opisany w niniejszym dokumencie protokół jest przykładem wykorzystania ukierunkowanego NGS i późniejszej analizy bioinformatycznej niezbędnej do identyfikacji rzadkich wariantów o potencjalnym znaczeniu klinicznym. W szczególności przedstawiamy podejście przyjęte przez podgrupę ONDRI genomics podczas korzystania z niestandardowego panelu NGS zaprojektowanego przez ONDRISeq.
Uznaje się, że metody te zostały opracowane w oparciu o konkretną platformę NGS i że istnieją inne platformy sekwencjonowania i zestawy do wzbogacania celów, które można zastosować. Jednak platforma NGS i instrument stacjonarny (Tabela materiałów) zostały wybrane na podstawie ich wczesnej aprobaty amerykańskiej Agencji ds. Żywności i Leków (FDA)46. Autoryzacja ta odzwierciedla wysokiej jakości sekwencjonowanie, które można wykonać za pomocą wybranych protokołów NGS, oraz niezawodność, jaką można przypisać odczytom sekwencjonowania.
Chociaż uzyskanie dokładnych odczytów sekwencjonowania z głębokością pokrycia jest bardzo ważne, przetwarzanie bioinformatyczne wymagane do końcowej analizy rzadkich wariantów jest niezbędne i może być intensywne obliczeniowo. Ze względu na wiele źródeł błędów, które mogą wystąpić w procesie sekwencjonowania, solidny potok bioinformatyczny musi korygować różne niedokładności, które można wprowadzić. Mogą one wynikać z niewspółosiowości w procesie mapowania, stronniczości amplifikacji wprowadzonej przez amplifikację PCR w przygotowaniu biblioteki oraz technologii wytwarzającej artefakty sekwencjonowania47. Bez względu na oprogramowanie używane do mapowania odczytu i wywoływania wariantów, istnieją typowe sposoby redukcji tych błędów, w tym lokalne wyrównanie, usunięcie zduplikowanych zmapowanych odczytów i ustawienie odpowiednich parametrów kontroli jakości podczas wywoływania wariantów. Ponadto parametry wybrane podczas wywoływania wariantów mogą się różnić w zależności od tego, co jest najbardziej odpowiednie dla danego badania11. Minimalne pokrycie i wynik jakości wariantu i otaczających nukleotydów, które zostały w nim zastosowane, zostały wybrane tak, aby stworzyć równowagę między odpowiednią swoistością a czułością. Parametry te zostały zweryfikowane dla panelu ONDRISeq w oparciu o zgodność wywoływania wariantów z trzema oddzielnymi technikami genetycznymi, jak opisano wcześniej, w tym: 1) genotypowaniem opartym na chipach; 2) test dyskryminacji allelicznej; oraz 3) Sekwencjonowanie Sangera9.
Po dokładnym wywołaniu wariantów, w celu określenia tych o potencjalnym znaczeniu klinicznym, niezbędne są adnotacje i kuracja. Ze względu na otwartą dostęp, ANNOVAR jest doskonałym narzędziem zarówno do adnotacji, jak i wstępnej selekcji lub eliminacji wariantów. Oprócz tego, że ANNOVAR jest łatwo dostępny, może być stosowany do dowolnego pliku VCF, bez względu na używaną platformę sekwencjonowania, i można go dostosować do potrzeb badania26.
Po adnotacji warianty muszą być interpretowane w celu określenia, czy należy je uznać za mające znaczenie kliniczne. Proces ten staje się nie tylko złożony, ale często jest podatny na subiektywizm i błędy ludzkie. Z tego powodu ACMG ustaliło wytyczne dotyczące oceny dowodów na patogenność dowolnego wariantu. Stosujemy niesynonimiczne, rzadkie podejście do ręcznego sprawdzania oparte na wariantach, które jest konstruowane na podstawie tych wytycznych i zabezpieczane przez indywidualną ocenę każdego wariantu, który jest w stanie przejść przez potok, za pomocą niestandardowo zaprojektowanego skryptu języka Python, który klasyfikuje warianty na podstawie wytycznych. W ten sposób każdemu wariantowi przypisuje się ranking patogenny, prawdopodobnie chorobotwórczy, o niepewnym znaczeniu, prawdopodobnym łagodnym lub łagodnym, a my jesteśmy w stanie dodać standaryzację i przejrzystość do procesu selekcji wariantów. Ważne jest, aby zdać sobie sprawę, że specyfika kuracji wariantów, wykraczająca poza proces bioinformatyczny, zostanie zindywidualizowana w oparciu o potrzeby badań, a zatem wykraczała poza zakres prezentowanych metodologii.
Chociaż przedstawione tutaj metody są specyficzne dla ONDRI, opisane kroki można przełożyć na dużą liczbę chorób konstytucyjnych będących przedmiotem zainteresowania. Wraz ze wzrostem liczby asocjacji genów dla wielu fenotypów, ukierunkowany NGS pozwala na podejście oparte na hipotezach, które może wykorzystać wcześniejsze badania przeprowadzone w tej dziedzinie. Istnieją jednak ograniczenia dotyczące ukierunkowanego NGS i przedstawionej metodologii. Skupiając się tylko na określonych regionach genomu, obszary odkryć są ograniczone do nowych alleli będących przedmiotem zainteresowania. W związku z tym nie zostaną zidentyfikowane nowe geny lub inne loci genomowe poza tymi, które są objęte celami sekwencjonowania, które mogłyby zostać ujawnione za pomocą metod WGS lub WES. Istnieją również regiony w genomie, które mogą być trudne do dokładnego sekwencjonowania za pomocą podejść NGS, w tym te o wysokim stopniu powtarzania sekwencji48 lub te, które są bogate w zawartość GC49. Na szczęście, w przypadku korzystania z ukierunkowanego NGS, istnieje a priori wysoki stopień zaznajomienia się z sekwencjonowanymi regionami genomu i tym, czy mogą one stanowić wyzwanie techniczne. Wreszcie, wykrywanie wariantów numerów kopii na podstawie danych NGS nie jest obecnie ustandaryzowane50. Jednak bioinformatyczne rozwiązania tych problemów mogą pojawić się na horyzoncie; Nowe narzędzia obliczeniowe mogą pomóc w analizie tych dodatkowych form zmienności u pacjentów z ONDRI.
Pomimo swoich ograniczeń, ukierunkowany NGS jest w stanie uzyskać wysokiej jakości dane w ramach podejścia opartego na hipotezach, pozostając jednocześnie tańszym niż jego odpowiedniki WGS i WES. Metodologia ta jest nie tylko odpowiednia dla efektywnych i ukierunkowanych badań, ale także wykładniczo rośnie kliniczne wdrożenie celowanego NGS. Technologia ta jest wykorzystywana do udzielania odpowiedzi na wiele różnych pytań dotyczących szlaków molekularnych różnych chorób. Jest również rozwijany w celu uzyskania dokładnego narzędzia diagnostycznego przy stosunkowo niskich kosztach w przeciwieństwie do WES i WGS. Nawet w porównaniu ze złotym standardem sekwencjonowania Sangera, ukierunkowany NGS może konkurować pod względem efektywności czasowej i kosztowej. Z tych powodów ważne jest, aby naukowiec lub klinicysta, który otrzymuje i wykorzystuje dane NGS, na przykład dostarczone jako tekst w raporcie laboratoryjnym lub klinicznym, rozumiał złożoną "czarną skrzynkę", która leży u podstaw wyników. Przedstawione tu metody powinny pomóc użytkownikom zrozumieć proces leżący u podstaw generowania i interpretacji danych NGS.