Artykuł metodologiczny

Ukierunkowane sekwencjonowanie nowej generacji i bioinformatyka w celu oceny genetycznych uwarunkowań chorób konstytucjonalistycznych

DOI:

10.3791/57266

4 kwietnia 2018

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ukierunkowane sekwencjonowanie nowej generacji to efektywne czasowo i kosztowo podejście, które staje się coraz bardziej popularne zarówno w badaniach nad chorobami, jak i w diagnostyce klinicznej. Opisany tutaj protokół przedstawia złożony przepływ pracy wymagany do sekwencjonowania i procesu bioinformatycznego wykorzystywanego do identyfikacji wariantów genetycznych, które przyczyniają się do choroby.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Sekwencjonowanie nowej generacji (NGS) szybko rewolucjonizuje sposób prowadzenia badań nad genetycznymi determinantami chorób konstytucyjnych. Technika ta jest bardzo wydajna, ponieważ miliony odczytów sekwencjonowania są generowane w krótkim czasie i przy stosunkowo niskich kosztach. W szczególności ukierunkowany NGS jest w stanie skoncentrować badania na regionach genomu o szczególnym znaczeniu w oparciu o badaną chorobę. Nie tylko jeszcze bardziej obniża to koszty i zwiększa szybkość procesu, ale także zmniejsza obciążenie obliczeniowe, które często towarzyszy NGS. Chociaż celowany NGS jest ograniczony do pewnych regionów genomu, co uniemożliwia identyfikację potencjalnych nowych loci będących przedmiotem zainteresowania, może być doskonałą techniką w obliczu fenotypowo i genetycznie heterogennej choroby, dla której istnieją wcześniej znane powiązania genetyczne. Ze względu na złożony charakter techniki sekwencjonowania ważne jest ścisłe przestrzeganie protokołów i metodologii w celu uzyskania odczytów sekwencjonowania o wysokim zasięgu i jakości. Ponadto, po uzyskaniu odczytów sekwencjonowania, zaawansowany przepływ pracy bioinformatycznej jest wykorzystywany do dokładnego mapowania odczytów do genomu referencyjnego, wywoływania wariantów i zapewnienia, że warianty przechodzą metryki jakości. Warianty muszą być również opatrzone adnotacjami i wyselekcjonowane w oparciu o ich znaczenie kliniczne, które można ustandaryzować, stosując wytyczne American College of Medical Genetics and Genomics dotyczące patogeniczności. Metody przedstawione w niniejszym dokumencie przedstawią etapy związane z generowaniem i analizą danych NGS z ukierunkowanego panelu sekwencjonowania, przy użyciu panelu chorób neurodegeneracyjnych ONDRISeq jako modelu, w celu identyfikacji wariantów, które mogą mieć znaczenie kliniczne.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ponieważ definiowanie genetycznych determinantów różnych schorzeń nabiera wyższego priorytetu w badaniach i w klinice, sekwencjonowanie nowej generacji (NGS) okazuje się być wysokowydajnym i opłacalnym narzędziem do osiągnięcia tych celów1,2,3. Przez prawie 40 lat sekwencjonowanie Sangera było złotym standardem w identyfikacji wariantów genetycznych4; Jednak w przypadku chorób o niejednorodności genetycznej lub nieznanej etiologii genetycznej należy ocenić wiele możliwych genów kandydujących, często jednocześnie. W tym kontekście sekwencjonowanie Sangera staje się kosztowne i czasochłonne. Jednak NGS obejmuje masowe równoległe sekwencjonowanie milionów fragmentów DNA, co pozwala na zastosowanie efektywnej kosztowo i czasowo techniki jednoczesnego wykrywania szerokiego zakresu zmienności genetycznej w różnych regionach genomu.

Istnieją trzy rodzaje NGS do sekwencjonowania DNA: 1) sekwencjonowanie całego genomu (WGS), 2) sekwencjonowanie całego eksomu (WES) i 3) sekwencjonowanie ukierunkowane5. WGS ocenia całą zawartość genomu danej osoby, podczas gdy WES obejmuje sekwencjonowanie tylko regionów kodujących białka genome6. Z kolei sekwencjonowanie celowane koncentruje się na określonych regionach genomu w oparciu o stosunkowo niewiele specyficznych genów połączonych wspólnymi mechanizmami patologicznymi lub znanym fenotypem klinicznym. Za pomocą tego podejścia można określić zarówno eksony, jak i introny, lub dowolne międzygenowe regiony genu lub określonej grupy genów. Dlatego sekwencjonowanie celowane może być doskonałym podejściem, gdy istnieje już podstawa genów kandydujących, o których wiadomo, że są związane z chorobą będącą przedmiotem zainteresowania. Ukierunkowanie na określone regiony genomu pozwala na eliminację zbędnej i nieistotnej zmienności genetycznej, która może zaciemniać lub odwracać uwagę od interpretacji klinicznej. Chociaż zarówno WGS, jak i WES generują dużą ilość danych wysokiej jakości, ilość danych może być przytłaczająca. Tak duża ilość danych nie tylko wymaga intensywnej obliczeniowo analizy bioinformatycznej, ale przechowywanie danych może często stwarzać problemy7. To wyzwanie związane z przechowywaniem danych wiąże się również z dodatkowymi kosztami zarówno dla WGS, jak i WES, co często nie jest początkowo brane pod uwagę przy obliczaniu kosztów sekwencjonowania. Ponadto, mimo że maleje, koszt WGS i WES pozostaje stosunkowo wysoki. Sekwencjonowanie celowane może być bardziej opłacalną opcją, szczególnie gdy wymagane jest sekwencjonowanie dużej liczby osób.

Inicjatywa Badawcza Chorób Neurodegeneracyjnych w Ontario (ONDRI) to wieloplatformowe, obejmujące całą prowincję, obserwacyjne badanie kohortowe charakteryzujące pięć chorób neurodegeneracyjnych, w tym: 1) chorobę Alzheimera i łagodne upośledzenie funkcji poznawczych, 2) stwardnienie zanikowe boczne, 3) demencję czołowo-skroniową, 4) chorobę Parkinsona i 5) naczyniowe upośledzenie funkcji poznawczych8. Podgrupa genomiczna ONDRI ma na celu wyjaśnienie, w ramach podstawowej charakterystyki tej kohorty, często pomijanego, ale niezwykle ważnego krajobrazu genetycznego tych fenotypowo i genetycznie heterogenicznych chorób. Choroby neurodegeneracyjne są zatem odpowiednimi kandydatami do metodologii NGS, a w szczególności do sekwencjonowania celowanego.

Specjalnie zaprojektowaliśmy ukierunkowany panel NGS, ONDRISeq, do sekwencjonowania 528 uczestników zaangażowanych w ONDRI dla regionów kodujących białka 80 genów, które wcześniej były powiązane z pięcioma interesującymi chorobami. Dzięki tej metodologii jesteśmy w stanie wykorzystać wysokiej jakości dane NGS w ukierunkowany i wydajny sposób. Konstrukcja i walidacja panelu ONDRISeq z wieloma badaniami zgodności zostały już wcześniej opisane, dla których panel ONDRISeq był w stanie zidentyfikować nowe, rzadkie warianty o możliwym znaczeniu klinicznym w 72,2% z 216 przypadków wykorzystanych do walidacji panelu9. Chociaż technologia NGS rozwinęła się szybko i niezwykle w ostatnich latach, wielu badaczy staje przed wyzwaniem podczas przetwarzania surowych danych w listę użytecznych, opatrzonych adnotacjami wariantów10. Co więcej, interpretacja wariantów może być złożona, zwłaszcza w obliczu wielu rzadkich lub nowatorskich11.

Tutaj opisujemy krok po kroku metodologię docelowego NGS i związany z nim przepływ pracy bioinformatycznej wymagany do resekwencjonowania, wywoływania wariantów i adnotacji wariantów, na przykładzie badania ONDRISeq. Po wygenerowaniu danych NGS surowe pliki sekwencjonowania muszą zostać dostosowane do ludzkiego genomu referencyjnego, aby można było dokładnie wywołać warianty. Warianty muszą być następnie opatrzone adnotacjami, aby przeprowadzić kolejne sprawdzanie wariantów. Wyjaśnimy również, jak wdrażamy standardy i wytyczne American College of Medical Genetics w celu dokładnej klasyfikacji patogenności wariantów.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dla celów ONDRI, protokoły etyczne i świadoma zgoda zostały uzyskane na podstawie Komisji Etyki Badawczej w Baycrest Centre for Geriatric Care (Toronto, Ontario, Kanada); Centrum ds. Uzależnień i Zdrowia Psychicznego (Toronto, Ontario, Kanada); Szpital Elizabeth Bruyère (Ottawa, Ontario, Kanada); Hamilton General Hospital (Hamilton, Ontario, Kanada); Londyńskie Centrum Nauk o Zdrowiu (Londyn, Ontario, Kanada); McMaster (Hamilton, Ontario, Kanada); Szpital w Ottawie (Ottawa, Ontario, Kanada); Parkwood Hospital (Londyn, Ontario, Kanada); St Michael's Hospital (Toronto, Ontario, Kanada); Centrum Nauk o Zdrowiu Sunnybrook (Toronto, Ontario, Kanada); oraz University Health Network-Toronto Western Hospital (Toronto, Ontario, Kanada).

1. Izolacja DNA z próbek krwi ludzkiej

  1. Pobieraj próbki od uczestników sekwencjonowania zgodnie z odpowiednimi protokołami etycznymi i świadomą zgodą.
    1. Aby uzyskać DNA wysokiej jakości, należy pobrać próbki krwi do celów ekstrakcji.
      UWAGA: DNA można również ekstrahować ze śliny lub komórek policzkowych, zapewniając użycie odpowiedniego zestawu do ekstrakcji DNA.
    2. W przypadku ekstrakcji z krwi, aby uzyskać wysoką wydajność DNA, należy zebrać próbkę w trzech probówkach EDTA K2 o pojemności 4 ml, dostarczając próbkę o całkowitej objętości ~12 ml.
    3. Wirować próbki krwi przez 20 minut przy 750 x g do frakcji na górną fazę osocza, cienką, środkową fazę leukocytów i dolną fazę erytrocytów.
  2. Usunąć osocze z próbki krwi, pipetując ją z górnej części próbki za pomocą jednorazowej pipety do przenoszenia. Odpowiednio wyrzucić osocze lub dozować do wielu podwielokrotności 500 μl w celu przechowywania w temperaturze -80 °C do przyszłych analiz biochemicznych. Upewnij się, że do każdej próbki używana jest nowa, sterylna pipeta.
  3. Ekstrakcja DNA z próbki krwi za pomocą zestawu do ekstrakcji krwi12 (Tabela materiałów) zgodnie z instrukcjami producenta.
    UWAGA: Jeśli uzyska się próbkę o objętości opisanej powyżej, otrzyma się ~3 ml leukocytów do wykorzystania w ekstrakcji DNA.
  4. Zmierz początkowe stężenie DNA w ng/μL za pomocą spektrofotometru o pełnym spektrum13 (Tabela materiałów), zgodnie z instrukcjami producenta.
  5. Przejdź bezpośrednio do kroku 2. Alternatywnie należy przechowywać DNA w temperaturze 4 °C.

2. Przygotowanie biblioteki sekwencjonowania

  1. Przeprowadzać seryjne rozcieńczenia próbek DNA w ciągu trzech dni, aby uzyskać końcowe stężenie 5,0 ± 1,0 ng/μl.
    1. Rozcieńczyć 1 M bufor Tris o pH 8,5 do 10 μM wodą dejonizowaną.
      UWAGA: Objętość rozcieńczonego będzie zależeć od liczby próbek DNA, które będą musiały zostać rozcieńczone w kolejnych krokach.
    2. Jeśli rozcieńczanie DNA wykonuje się bezpośrednio po kroku 1.4, przejdź do następnego kroku. Jeśli nie tego samego dnia, zmierz stężenie DNA, tak jak to zostało zrobione w kroku 1.4.
    3. Na podstawie zmierzonego stężenia rozcieńczyć 40 μl DNA do ~10 ng/μL za pomocą 10 μM buforu Tris o pH 8,5 i pozostawić próbkę na noc w temperaturze 4 °C.
    4. Zmierz stężenie DNA za pomocą fluorometru14 odpowiedniego do oznaczania ilościowego DNA (Tabela materiałów), zgodnie z instrukcjami producenta.
      UWAGA: Stężenie próbki powinno wynosić >10 ng/μL ze względu na niższą czułość używanego wcześniej spektrofotometru.
    5. Na podstawie zmierzonego stężenia rozcieńczyć 20 μl DNA do 10 ng/μl przy użyciu 10 μM buforu Tris o pH 8,5 i pozostawić próbkę na noc w temperaturze 4 °C.
    6. Zmierz stężenie DNA za pomocą fluorometru14, zgodnie z instrukcjami producenta.
    7. Na podstawie zmierzonego stężenia rozcieńczyć 10 μl DNA do 5 ng/μl przy użyciu 10 μM Tris-HCl o pH 8,5 i pozostawić próbkę na noc w temperaturze 4 °C.
  2. Przygotuj bibliotekę sekwencjonowania zgodnie z instrukcjami producenta z odpowiednim zestawem do wzbogacania docelowego panelu NGS15 (Tabela materiałów). Upewnij się, że zestaw wzbogacający jest odpowiedni dla używanej platformy NGS.
    1. Postępuj zgodnie z instrukcjami producenta16 dotyczącymi pleksji i pulowania bibliotek.
      UWAGA: W przypadku ONDRISeq biblioteki składają się z 12 próbek DNA, połączonych w zestawy po dwie i uruchamianych na instrumencie NGS (Table of Materials). Liczba próbek, które można uruchomić w jednej reakcji, będzie zależeć od zastosowanego zestawu do sekwencjonowania i platformy.
    2. Aby uzyskać wyższą jakość danych sekwencjonowania, należy wykonać opcjonalny krok w celu sprawdzenia jakości biblioteki DNA po znakowaniu, opisany w instrukcji producenta zestawu do wzbogacania celu15.
      1. Przeanalizuj każdą bibliotekę w trzech egzemplarzach, aby upewnić się, że biblioteka jest w stanie uzyskać odpowiednią jakość.
    3. W przypadku łączenia bibliotek zmierz stężenie DNA za pomocą fluorometru14, zgodnie z instrukcjami producenta. Użyj tego stężenia, aby określić objętość każdej biblioteki DNA do puli w celu uzyskania proporcji równomolowych zalecanych przez używany docelowy zestaw do wzbogacania.

3. Sekwencjonowanie nowej generacji

  1. Uporządkuj bibliotekę zgodnie z instrukcjami producenta zestawu odczynników do instrumentu NGS Desktop Instrument17,18 (Tabela materiałów).
    1. Przygotuj przykładowy arkusz zgodnie z instrukcjami producenta18 za pomocą odpowiedniego oprogramowania technologii NGS (Tabela materiałów), które zostanie zaimportowane do przepływu pracy instrumentu NGS na pulpicie.
      UWAGA: Na potrzeby ONDRISeq wybrana opcja aplikacji to "inne", z żądanymi tylko plikami FASTQ (Rysunek 1). Kolejne kroki będą przetwarzać te pliki FASTQ, aby umożliwić pełne dostosowanie parametrów wyrównania i jakości. Jeśli jednak zostanie wybrane sekwencjonowanie celowane, niektóre instrumenty NGS są w stanie samodzielnie przetworzyć dane sekwencjonowania na pliki VCF. Z instrukcjami producenta18 można zapoznać się z pełnym wyborem opcji.
    2. Jeśli korzystasz ze środowiska obliczeniowego opartego na chmurze19 (Tabela materiałów), zaloguj się podczas konfigurowania przebiegu sekwencjonowania. Zrób to po kliknięciu "Sekwencjonowanie" na stronie głównej instrumentu NGS na komputer.
    3. Zgodnie z instrukcjami producenta<, zmierz stężenie biblioteki biblioteki za pomocą fluorometru18 zgodnie z instrukcjami producenta, zmierz stężenie biblioteki DNA za pomocą fluorometrusup class="xref">14.
    4. Sprawdź poprawność jakości biblioteki DNA za pomocą odpowiedniego zautomatyzowanego systemu elektroforezy i zestawu do analizy jakości DNA20 (Tabela materiałów), zgodnie z instrukcjami producenta.
    5. Aby przeliczyć stężenie DNA z ng/μL na nM, użyj następującego wzoru16
      figure-protocol-1
      UWAGA: Średni rozmiar biblioteki będzie specyficzny dla używanego zestawu do wzbogacania celu i można go uzyskać ze śladu elektroforezy zaobserwowanego w kroku 3.1.4.
    6. Rozcieńczyć bibliotekę sekwencjonowania do końcowego stężenia 6–20 pM, w zależności od przypadku, i objętości 600 μl, zgodnie z instrukcjami producenta21.
      UWAGA: Dokładne wymagane stężenie zależy od użytego zestawu do sekwencjonowania. Skonsultuj się z producentem zestawu wzbogacającego, aby określić prawidłowe stężenie obciążenia.
    7. Rozcieńczyć, denaturować i dołączyć bibliotekę sekwencjonowania kontroli pozytywnej21, zgodnie z instrukcjami producenta.
    8. Prowadź dziennik każdego przebiegu sekwencjonowania, który obejmuje stężenie załadowanej biblioteki DNA (pM), procent dodanej kontroli dodatniej, kod kreskowy wkładu z odczynnikiem, aplikację wybraną w kroku 3.1.1, liczbę odczytów indeksu, użyty zestaw do wzbogacania, długość odczytu oraz nazwę arkusza próbki.
      UWAGA: Czas pracy instrumentu NGS na pulpicie będzie zależał od wybranego instrumentu, zestawu wzbogacającego i długości odczytu (4–56 godzin dla sekwencera użytego w tym eksperymencie22).
  2. Po zakończeniu sekwencjonowania uzyskaj dostęp do "Folderu uruchamiania", który zawiera wszystkie wyjścia, przechodząc do strony głównej instrumentu NGS i klikając "Zarządzaj plikami". Przenieś pliki na dysk lokalny, aby uzyskać do nich późniejszy dostęp. Aby uzyskać osobną opcję, na komputerze znajdź pliki w środowisku obliczeniowym opartym na chmurze19, wybierając opcję "Uruchamianie" w panelu nawigacyjnym. Wybierz odpowiedni przebieg sekwencjonowania, aby przejść do strony Podsumowanie przebiegu. Wybierz "Pobierz", aby uzyskać dane z chmury. W wyświetlonym oknie dialogowym wybierz pliki FASTQ jako typ pliku do pobrania i kliknij "Pobierz".
  3. Na stronie Podsumowanie przebiegu środowiska obliczeniowego opartego na chmurze19,23 przejdź do sekcji "Wykresy", aby przeanalizować jakość przebiegu sekwencjonowania z różnymi danymi wygenerowanymi przez środowisko obliczeniowe. Zapoznaj się z instrukcjami producenta23, aby uzyskać szczegółowe informacje na temat każdej wyprodukowanej figurki.
    1. Na stronie Run Charts (Wykresy uruchamiania) znajdź rysunek "Data by Cycle" (Dane według cyklu). Pod wykresem wybierz "Intensywność", a pod kanałem wybierz "Wszystkie kanały". Upewnij się, że ten wykres intensywności sygnału jest podobny do wykresu wytworzonego przez sekwencjonowanie wykonane w przeszłości przy użyciu tego samego zestawu wzbogacającego i instrumentu stacjonarnego NGS.
      UWAGA: Odzwierciedla to procent intensywności pokazany przez każdą bazę we wszystkich 150 cyklach. Liczba ta może się znacznie różnić w zależności od użytego zestawu wzbogacającego, dlatego należy ją porównać z wcześniejszymi sekwencjonowaniem tego samego panelu.
    2. Wybierz kartę "Indeksowanie kontroli jakości" w panelu nawigacyjnym uruchamiania, aby znaleźć histogram kontroli jakości indeksowania (QC), który znajduje się po prawej stronie strony. Upewnij się, że we wszystkich próbkach zaobserwowano względnie równomierny rozkład % zidentyfikowanych odczytów (PF).
      UWAGA: Jeśli jakiekolwiek próbki mają znacznie niższy % zidentyfikowanych odczytów (PF) niż pozostałe próbki, należy pamiętać, że może to mieć wpływ na jakość danych sekwencjonowania.
  4. Na stronie Podsumowanie przebiegu środowiska obliczeniowego opartego na chmurze przejdź do metryk jakości, klikając pozycję "Metryki" w panelu nawigacyjnym uruchamiania.
    UWAGA: Wartości graniczne metryk będą zależeć od używanej platformy sekwencjonowania i zestawu wzbogacającego. Istnieje wiele wskaźników, które można wykorzystać w oparciu o instrukcje producenta23, przy czym poniższe kroki wyróżniają trzy, które są wysoce zalecane do kontroli jakości.
    1. W sekcji "GĘSTOŚĆ (K/MM2)" upewnij się, że gęstość klastra mieści się w zakresie zalecanym przez używany zestaw do wzbogacania (w tym przypadku 1,200–1,400 K/mm2).
    2. Pod całkowitą wartością "%≥Q30" upewnij się, że wartość wynosi ≥85%, co odzwierciedla jakość sekwencjonowania odczytuje.
      UWAGA: Jeśli wartość jest niższa niż ten próg 85%, należy pamiętać, że jakość sekwencjonowania może być zagrożona.
    3. W polu "ALIGNED (%)" upewnij się, że wartość jest podobna do % kontroli dodatniej, która została uwzględniona w przebiegu sekwencjonowania.
      UWAGA: Działa to jako miara kontroli pozytywnej, tak że tylko ten procent wszystkich odczytów okazał się zgodny z genomem kontroli pozytywnej. Jeśli zastosowano 1% kontroli pozytywnej, można by się spodziewać, że wyrównany (%) wyniesie ~1–5%.

figure-protocol-2
Rysunek 1: Zrzut ekranu przedstawiający opcje kreatora przykładowych arkuszy oprogramowania NGS (Table of Materials). Na potrzeby ONDRISeq używana jest tylko aplikacja FASTQ. Jeśli jednak użytkownik chciałby, aby utworzono inne pliki, takie jak pliki VCF, zaleca się użycie aplikacji z kategorii docelowej resekwencjonowania. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

4. Sekwencjonowanie i wywoływanie wariantów

  1. Do wstępnego przetwarzania danych należy wybrać odpowiednie oprogramowanie, aby dopasować surowe pliki FASTQ do ludzkiego genomu referencyjnego i wywołać warianty (Tabela materiałów).
  2. Importuj odczyty sekwencjonowania FASTQ do oprogramowania do wstępnego przetwarzania danych.
    UWAGA: Na potrzeby ONDRISeq 48 plików FASTQ utworzonych z jednej serii sekwencjonowania 24 próbek jest importowanych i przetwarzanych za pomocą oprogramowania. Liczba próbek przetwarzanych jednocześnie może się różnić w zależności od potrzeb badacza i wielkości panelu NGS.
    1. W "Obszarze nawigacji" kliknij prawym przyciskiem myszy i wybierz "Nowy folder". Nazwij folder w taki sposób, aby była jasna co do przebiegu sekwencjonowania, który został wykonany.
    2. Z paska narzędzi u góry wybierz "Importuj". Z wyświetlonej listy rozwijanej platform sekwencjonowania wybierz platformę, na której przeprowadzono sekwencjonowanie.
      UWAGA: Na potrzeby ONDRISeq wybiera się "Illumina". Jeśli jednak korzystasz z innej platformy sekwencjonowania, zapoznaj się z instrukcjami producenta, aby uzyskać informacje na temat pozostałych kroków importowania FASTQ24.
    3. W oknie dialogowym przejdź do plików FASTQ i wybierz je z przebiegu sekwencjonowania, który jest przetwarzany. Upewnij się, że importowane pliki są przechowywane i importowane z dysku lokalnego, jeśli używasz komputera z wieloma serwerami.
    4. W "Opcjach ogólnych" w oknie dialogowym kliknij pole obok "Odczyty sparowane", jeśli sekwencjonowanie używało sparowanych końców chemicznych.
      UWAGA: W takim przypadku dla każdej próbki powinny być również zaimportowane dwie próbki FASTQ - jedna do przodu i jedna do tyłu.
    5. Z informacji o odczycie sparowanym w oknie dialogowym wybierz opcję "Sparowany koniec (przód-tył)", jeśli plik FASTQ odczytany do przodu pojawia się przed odczytem wstecznym na liście plików. Jeśli pliki pojawiają się w odwrotnej kolejności, wybierz "Para wiązań (do tyłu-do przodu)". Ustaw minimalną odległość odczytu dla par na 1 i maksymalną odległość dla 1000, aby umożliwić wykrywanie zmian strukturalnych na małą skalę w sekwencjach próbek.
    6. Z "Opcji Illumina" w oknie dialogowym wybierz "Usuń nieudane odczyty", aby usunąć odczyty, które nie powiodły się sekwencjonowania. Jeśli instrument biurkowy NGS zdemultipleksował dane przed eksportem plików FASTQ, nie zaznaczaj pola "De-multipleksowanie MiSeq".
    7. Z listy rozwijanej "Wynik jakości" wybierz potok NGS, który został użyty do sekwencjonowania. Wybierz "Dalej" u dołu okna dialogowego.
      UWAGA: Użyty potok będzie miał wpływ na format wyników jakości pliku FASTQ. Aby uzyskać więcej informacji na temat wybranego rurociągu, zapoznaj się z instrukcjami producenta24.
    8. W nowym oknie dialogowym wybierz "Zapisz" i "Utwórz podfoldery dla każdej jednostki kąpielowej, aby umieścić pliki FASTQ każdej próbki w osobnym folderze. Wybierz "Dalej" u dołu okna dialogowego.
    9. W nowym oknie dialogowym wybierz folder, który został utworzony w kroku 4.2.1. W tym miejscu zostaną zaimportowane pliki FASTQ. Wybierz "Zakończ" u dołu okna dialogowego i poczekaj, aż pliki FASTQ zostaną zaimportowane. Kliknij zakładkę "Procesy", aby zobaczyć stan importu pliku.
  3. Zaprojektuj przepływ pracy w oprogramowaniu, aby wykonać ponowne sekwencjonowanie i wywoływanie wariantów, zgodnie z instrukcjami producenta.
    UWAGA: Ten przepływ pracy może się różnić w zależności od potrzeb badacza, ale poniższe kroki obejmują to, co jest zawarte na potrzeby ONDRISeq (Rysunek 2). Kroki w tym przepływie pracy można zastosować do innych programów do sekwencjonowania NGS i wywoływania wariantów, jeśli jest to odpowiednie. Całe przetwarzanie bioinformatyczne do celów ONDRI odbywa się w odniesieniu do ludzkiego genomu referencyjnego GRCH37/hg19, w celu zapewnienia spójności przetwarzania i analizy danych.
    1. Mapuj odczyty sekwencjonowania do genomu referencyjnego.
      1. Podczas konfiguracji należy wybrać genom referencyjny zgodnie z potrzebami, upewniając się, że jest to ten sam genom referencyjny, który jest używany na wszystkich etapach bioinformatycznych.
      2. Z listy rozwijanej trybu maskowania wybierz opcję "Bez maskowania", aby żadne obszary sekwencji odniesienia nie były maskowane.
      3. Użyj domyślnych opcji mapowania przypisanych przez oprogramowanie. Zapoznaj się z instrukcjami producenta24, aby sprawdzić, czy jest to dopuszczalne w oparciu o cele badania.
    2. Uwzględnij w przepływie pracy lokalne wyrównanie do ludzkiego genomu referencyjnego, aby rozwiązać wszelkie błędy mapowania odczytu, szczególnie w odniesieniu do wariantów insercji-delecji.
      1. Użyj domyślnych opcji lokalnego wyrównania przypisanych przez oprogramowanie. Zapoznaj się z instrukcjami producenta24, aby sprawdzić, czy jest to dopuszczalne w oparciu o cele badania.
    3. Usuń zduplikowane zmapowane odczyty generowane przez PCR w protokole NGS, aby zmniejszyć efekt stronniczości amplifikacji PCR, która może powodować wyniki fałszywie dodatnie25.
      1. Ustaw "Maksymalną reprezentację sekwencji mniejszości (%)" w oparciu o potrzeby badania.
        UWAGA: Łagodne ustawienie, używane na potrzeby ONDRISeq, wynosi 5%; Jednak domyślne ustawienie oprogramowania jest bardziej rygorystyczne 20%. Gdy dwa odczyty są bardzo podobne, to ustawienie określa, czy sekwencja z mniejszą liczbą odczytów powinna być traktowana jako błąd sekwencjonowania wynikający z błędu amplifikacji PCR. W związku z tym, ustawiając wartość 5%, liczba odczytów mniejszościowych musi wynosić ≤ 5% liczby odczytów większości, aby została skorygowana tak, aby była identyczna z liczbą odczytów większościowych.
    4. Eksportuj statystyki dla regionów docelowych w postaci pliku tekstowego podsumowania pokrycia z odczytanych ścieżek wygenerowanych w kroku 4.3.3. Ignoruj nieokreślone dopasowania i zepsute pary w ustawieniach. Wybierz miejsce docelowe na dysku lokalnym dla tych plików.
    5. Wyeksportuj plik binarnej mapy wyrównania sekwencji (BAM) dla każdej próbki z odczytanych ścieżek wygenerowanych w kroku 4.3.3. Zawiera on dane dotyczące wyrównania sekwencji, jeśli będą potrzebne w przyszłych analizach. Wybierz miejsce docelowe na dysku lokalnym dla tych plików.
    6. Wybierz metodę wykrywania wariantów, aby wywołać warianty w sekwencji.
      UWAGA: W przypadku gdy można przyjąć założenia dotyczące ploidalności próbek, zaleca się stosowanie algorytmu wykrywania stałego wariantu ploidalności, tak jak jest to używane do celów ONDRISeq. Jeśli nie można przyjąć takiego założenia, zapoznaj się z instrukcjami producenta24, aby określić najlepszy algorytm do celów badania.
      1. Podczas konfiguracji, z opcji stałych parametrów wariantu ploidalności, należy ustawić ploidalność jako odpowiednią dla organizmu próbki. Ustaw "wymagane prawdopodobieństwo wariantu", czyli prawdopodobieństwo, że wariant został poprawnie wywołany, aby został zachowany, na 90,0%.
      2. Użyj następujących zalecanych ustawień dla filtrów ogólnych: "Minimalne pokrycie" 10x, "Minimalna liczba" 2, "Minimalna częstotliwość odczytu" 20%, "Ignoruj uszkodzone pary", ignoruj nieokreślone dopasowania na podstawie "Odczytów" i "Minimalna długość odczytu" 20,
        UWAGA: Te parametry są oparte na celach ONDRISeq. Zapoznaj się z instrukcjami producenta24, aby upewnić się, że są one odpowiednie dla przeprowadzanych badań.
      3. Użyj następujących zalecanych ustawień dla filtrów szumów: "Filtry o jakości podstawowej" z wynikiem jakości odwzorowania "Promień sąsiedztwa" równy 5, wynik odwzorowania "Minimalna jakość centralna" wynoszący 20 i wynik odwzorowania "Minimalna jakość sąsiedztwa" wynoszący 15; "Filtr kierunku odczytu" wynoszący 5,0% oraz "Filtr względnego kierunku odczytu" o istotności 1,0%.
        UWAGA: Te parametry są oparte na celach ONDRISeq. Zapoznaj się z instrukcjami producenta24, aby upewnić się, że są one odpowiednie dla przeprowadzanych badań.
    7. Filtruj warianty, które zostały wywołane, na podstawie ich nakładania się z regionami docelowymi panelu docelowego, jak określono w pliku Browser Extensible Data (BED), zezwalając na zachowanie tylko wariantów występujących w regionach genomu wybranych dla docelowego panelu NGS.
      UWAGA: Plik BED będzie unikalny dla docelowego panelu NGS, który jest używany, w oparciu o regiony genomu, które panel jest w stanie pokryć.
    8. Wyeksportuj raport wariantów w formacie VCF (Variant Calling Format) ze ścieżki wariantu utworzonej w kroku 4.3.7. Wybierz miejsce docelowe na dysku lokalnym dla tych plików.
    9. Zapisz i zainstaluj obieg pracy zgodnie z instrukcjami producenta24, aby udostępnić go w "Toolboxie" oprogramowania. Upewnij się, że obieg pracy jest nazwany w taki sposób, aby w przyszłości było jasne, dla którego panelu NGS jest odpowiedni.
      1. W oknie dialogowym z opcjami "Eksportowanie danych referencyjnych" podczas instalacji ustaw wszystkie opcje na "Pakiet".
      2. W oknie dialogowym z opcjami "Lokalizacja instalacji" podczas instalacji kliknij "Zainstaluj przepływ pracy na komputerze lokalnym".
  4. Uruchom zaimportowane pliki odczytu sekwencjonowania FASTQ przez dostosowany przepływ pracy bioinformatyki zaprojektowany w kroku 4.3, zgodnie z instrukcjami producenta24.
    1. Zidentyfikuj przepływ pracy zaprojektowany w kroku 4.3 w "Przyborniku" oprogramowania i kliknij go dwukrotnie.
    2. W wyświetlonym oknie dialogowym zlokalizuj foldery z plikami FASTQ, które zostały zaimportowane w kroku 4.2 w "Obszarze nawigacji". Zaznacz wszystkie foldery, wybierając je w "Obszarze nawigacji", a następnie kliknij pole obok "Partia". Użyj strzałki skierowanej w prawo, aby przenieść pliki do "Wybranych elementów". Kliknij "Dalej" u dołu okna dialogowego.
    3. W oknie dialogowym przejrzyj "Przegląd wsadowy", aby upewnić się, że wybrano właściwe pliki FASTQ, a następnie kliknij "Dalej".
    4. Zapoznaj się z poniższymi krokami przepływu pracy w oknie dialogowym, aby upewnić się, że podczas projektowania przepływu pracy w kroku 4.3 wybrano właściwe pliki i lokalizacje eksportu: "Mapuj odczyty do odniesienia"; Usuń zduplikowane zmapowane odczyty"; "Tworzenie statystyk dla regionów docelowych"; "Eksport BAM"; "Eksportuj tekst rozdzielany tabulatorem"; "Filtr oparty na nakładaniu się"; oraz "Eksport VCF"
    5. W ostatnim kroku w oknie dialogowym -"Obsługa wyników" - wybierz opcję "Zapisz w folderze wejściowym". Kliknij "Zakończ" u dołu okna dialogowego.
      UWAGA: Oznacza to, że pliki utworzone dla każdej próbki zostaną umieszczone w tym samym folderze, w którym przechowywany jest plik FASTQ w oprogramowaniu do wstępnego przetwarzania danych.

figure-protocol-3
Rysunek 2: Przepływ pracy do ponownego sekwencjonowania i wywoływania wariantów plików FASTQ w oprogramowaniu do wstępnego przetwarzania danych (Tabela materiałów) dostosowanego do potrzeb ONDRISeq. Kroki w przepływie pracy można zastosować do innego oprogramowania do sekwencjonowania NGS i wywoływania wariantów w zależności od potrzeb badacza. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

5. Adnotacja wariantu

  1. Pobierz i dostosuj skrypt Annotate Variation (ANNOVAR)26, aby wykonać adnotację wariantu w pliku VCF każdej próbki.
    1. Pobierz następujące bazy danych z ANNOVAR do dołączenia jako adnotacje: 1) RefSeq27 (aktualizacja z sierpnia 2015 r.); 2) dbSNP13828 (aktualizacja z września 2014); 3) Exome Aggregation Consortium29 (ExAC, wersja 0.3, aktualizacja z listopada 2015 r.); 4) Europejski Projekt Sekwencjonowania Egzomu Narodowego Instytutu Serca, Płuc i Krwi (National Heart, Lung, and Blood Institute Exome Sequencing Project) European Cohort30 (ESP, aktualizacja z marca 2015 r.); 5) The 1000 Genomes Project European Cohort31 (1KGP, aktualizacja z sierpnia 2015 r.); 6) ClinVar32 (aktualizacja z marca 2016 r.); oraz 7) Combined Annotation Dependent Depletion33 (CADD), Sorting Intolerant from Tolerant34 (SIFT) i PolyPhen-235.
      UWAGA: Współrzędne genomu i wszystkie bazy danych, do których odwołuje się ANNOVAR, odnoszą się do budowy ludzkiego genomu GRCh37/hg19. Ponadto wymienione wersje baz danych są używane na potrzeby ONDRISeq, podczas pobierania baz danych należy używać najbardziej aktualnych dostępnych wersji.
    2. W razie potrzeby dostosuj ANNOVAR tak, aby wyświetlał pełną listę wariantów z adnotacjami, jak również zmniejszoną kompilację wariantów z adnotacjami za pomocą --filter operation26.
      UWAGA: Zredukowaną listę można dostosować do potrzeb badacza. Do celów ONDRISeq ograniczona lista wariantów z adnotacjami nie obejmuje wariantów, które występują dalej niż 15 zasad od najbliższego eksonu ani żadnych wariantów o częstości występowania alleli mniejszych (MAF) >3% w żadnej z trzech baz danych: 1) ExAC; 2) ESP; oraz 3) 1KGP. Ten krok jest wysoce zalecany.
    3. W razie potrzeby dostosuj ANNOVAR tak, aby wyodrębniał określone wywołania alleli w oparciu o potrzeby badacza26.
      UWAGA: Na potrzeby ONDRISeq ANNOVAR ocenia wywołania sekwencjonowania wykonane dla alleli ryzyka APOE rs429358(C>T):p.C130R i rs7412(C>T):p.R176C w celu uzyskania ogólnego genotypu APOE, którego istnieje sześć możliwych kombinacji, w tym: 1) E2/E2; 2) E3/E2; 3) E4/E2; 4) E3/E3; 5) E4/E3; 6) E4/E4. Spośród tych sześciu możliwych genotypów APOE, E4/E4 jest najczęściej akceptowanym genetycznym czynnikiem ryzyka rozwoju choroby Alzheimera o późnym początku36.
  2. Przeszukaj bazy danych mutacji chorób (tabela materiałów), aby określić, czy warianty były wcześniej powiązane z chorobą, z uzasadnionymi dowodami. Weź pod uwagę wszystkie warianty, które nie zostały wcześniej zgłoszone jako nowy wariant.
    1. Oceń adnotacje ANNOVAR z ClinVar w taki sposób, aby warianty związane z chorobą obejmowały wszystkie sklasyfikowane jako prawdopodobnie chorobotwórcze lub chorobotwórcze.
  3. Przetwarzaj warianty splicingu za pomocą narzędzi do przewidywania in silico Analiza wariantów oparta na splotach37 (SPANR) i Human Splicing Finder38 (HSF, wersja 3.0).
  4. W przypadku przetwarzania dużej liczby próbek porównaj wywołania wariantów w każdej próbce, aby określić, które warianty są wspólne dla różnych próbek. Zrób to ręcznie lub za pomocą specjalnie zaprojektowanego skryptu, który pozwala na wykrycie możliwych artefaktów sekwencjonowania i zdarzeń skażenia.
    UWAGA: Na potrzeby ONDRI używany jest niestandardowy skrypt do opisywania plików wyjściowych ANNOVAR poprzez porównywanie ich ze sobą. Skrypt zawiera adnotację, dla każdego wariantu, z identyfikatorem podmiotu wszelkich innych próbek zawierających ten sam wariant, inaczej nazywany historią wariantu w kohorcie badania.
  5. Klasyfikuj warianty na podstawie wytycznych American College of Medical Genetics (ACMG) dotyczących patogenności39, przypisując każdemu wariantowi klasyfikację jako jedną z następujących: 1) patogenny; 2) prawdopodobnie chorobotwórczy; 3) wariant o niepewnym znaczeniu; 4) prawdopodobnie łagodne; lub 5) łagodny.
    UWAGA: Na potrzeby ONDRI do półautomatycznego przeprowadzania klasyfikacji ACMG używany jest zaprojektowany przez nas skrypt w języku Python. Chociaż nie jest używany w tym badaniu, InterVar40 jest podobnie zaprojektowanym narzędziem, które może być wykorzystane w analogiczny sposób.
  6. Sekwencjonuj wszystkie warianty z pokryciem sekwencjonowania <30x i/lub warianty, które zostały zidentyfikowane w > 10% kohorty badania, aby sprawdzić, czy nie są artefaktami sekwencjonowania41.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Opisane tutaj metodologie zostały zastosowane do 528 próbek DNA uczestników od osób, które zostały zapisane do ONDRI. Próbki zostały uruchomione na panelu ONDRISeq w 22 seriach po 24 próbki na serię. Ogólnie rzecz biorąc, dane sekwencjonowania określono jako wysokiej jakości, ze średnim pokryciem próby wynoszącym 78 ± 13x, a wszystkie indywidualne serie wyrażały średnie pokrycie próbki >30x. Co więcej, średnio 94 % wszystkich regionów docelowych zostało objętych co najmniej 20-krotnym badaniem (tabela 1).

Średnio 95,6% odczytów zostało zmapowanych do sekwencji referencyjnej, a wszystkie przebiegi ONDRISeq miały zmapowane >90% odczytów (>Tabela 1). Spośród zmapowanych odczytów 92,0% miało wynik Phred ≥Q30, przy czym tylko jeden przebieg miał <80% zmapowanych odczytów spełniających tę metrykę jakości. Jednak ten bieg nadal wykazywał średnie pokrycie 79x, a 93% regionów docelowych było pokrytych co najmniej 20x.

SZT. pkt. pkt. pkt. pkt. pkt. pkt. Rozdział
parametrŚrednia (±sd)Najlepsza wydajnośćNajsłabsza wydajność
Gęstość klastra (x103/mm2)1424 (±269)1347Rok 1835
Całkowita liczba odczytów (106)43,1 (±6,0)48,747,4
Zmapowane odczyty (106)40,1 (±6,0)47,1Nr 25,7
Zamapowane odczyty (%)95,6 (±1,3)96,892,6
Wynik Jakości Phred ≥Q30 (%)92,0 (±6,0)Rozdział 9268,3
Pokrycie próbki (x)78 (±13)9951 Rozdział 51

Tabela 1: Metryki jakości sekwencjonowania dla 22 przebiegów na ONDRISeq.

Studium przypadku: Identyfikacja rzadkich wariantów u pacjenta z chorobą Parkinsona.

Aby zademonstrować użyteczność naszego ukierunkowanego przepływu pracy NGS, przedstawiamy przykład 68-letniego mężczyzny z chorobą Parkinsona. Próbka DNA została przeprowadzona na instrumencie NGS (Table of Materials) przy użyciu panelu ONDRISeq wraz z 23 innymi próbkami ONDRI. Przebieg wykazał gęstość klastra 1,555 x 103/mm2. Konkretna próbka pacjenta wykazała średnie pokrycie 76x, przy czym 93,9% docelowych regionów pokryło co najmniej 20x.

Po wykonaniu wywołania wariantów i adnotacji za pomocą niestandardowego przepływu pracy bioinformatycznej, okazało się, że pacjent ma 1351 wariantów w eksonach i otaczających 250 pz z 80 genów zawartych w panelu ONDRISeq. Jednak w ramach projektu ANNOVAR udało się zmniejszyć liczbę wariantów, biorąc pod uwagę ontologię sekwencji wariantów i MAF, jak opisano powyżej. W ten sposób powstała lista siedmiu wariantów, które zostały poddane ręcznej selekcji (Rysunek 3). Spośród tych siedmiu wariantów dwa zostały zidentyfikowane jako mające potencjalne znaczenie kliniczne. Proces ten jest specyficzny dla potrzeb ONDRI i został przeprowadzony poprzez identyfikację tych, które są stosunkowo rzadkie w populacji ogólnej i nie są synonimiczne w ontologii, powodując w ten sposób zmianę białka. Niezależnie od tego, czy wariant był wcześniej związany z chorobą, w tym procesie wykorzystano również przewidywania in silico dotyczące szkodliwości białka i klasyfikację patogeniczności wariantów ACMG.

Pierwszym zidentyfikowanym z obniżonej listy był wariant heterozygotyczny, a mianowicie LRRK2:c.T3939A, co dało w wyniku wariant nonsensowny p.C1313*. LRRK2 koduje białko Rich Leucine-Repeat Kinase 2, które posiada zarówno aktywność GTPazy, jak i kinazy42. Co więcej, wiadomo, że mutacje w obrębie tego genu są jedną z głównych przyczyn rodzinnej choroby Parkinsona43. Ten wariant wprowadza przedwczesny kodon stop w LRRK2, tracąc w ten sposób reszty aminokwasowe 1,314–2,527. Zapobiega to translacji Ras białka białek złożonych (Roc), C-końca Roc (COR) i domen kinazy białkowej, które są zaangażowane w funkcjonowanie odpowiednio jako atypowa GTPaza Rho, białko wiążące GTP i kinaza białkowa, i przewidywano, że są szkodliwe przez analizę in silico wygenerowaną przez CADD (CADD Phred = 36). Ten wariant jest również rzadki z MAF wynoszącym odpowiednio 0,004% i 0,01% w ExAC i ESP i nie ma go w bazie danych 1000G. Ponadto jest to jedyny pacjent spośród wszystkich 528 zsekwencjonowanych, który jest nosicielem tego wariantu, który jest nowy, ponieważ nie został wcześniej opisany w bazach danych mutacji choroby (tabela materiałów). Pewność wywołania wariantu zostało potwierdzone przez jego głębokie pokrycie 109x. Ostatecznie wariant został oceniony zgodnie ze standardami i wytycznymi AMCG dotyczącymi patogenności i został sklasyfikowany jako patogenny.

Pacjent był również nosicielem drugiego heterozygotycznego wariantu, NR4A2:c.C755A, co spowodowało zmianę błędnego sensu p.P252Q. Białko kodowane przez NR4A2, Podrodzinę Receptora Jądrowego 4 Grupa A Członek 2, jest czynnikiem transkrypcyjnym biorącym udział w generowaniu neuronów dopaminergicznych44, a mutacje w obrębie tego genu były wcześniej związane z chorobą Parkinsona45. Przewidywano, że substytucja niepolarnej proliny do polarnej glutaminy będzie szkodliwa na podstawie analizy predykcyjnej in silico wygenerowanej przez CADD (CADD Phred = 21,1), ale nie na podstawie analizy wygenerowanej przez SIFT lub PolyPhen-2. Wariant jest rzadki, z MAF 0,004% w ExAC i brakiem zarówno ESP, jak i 1000G. Wariant został również zidentyfikowany u uczestnika ONDRI ze zdiagnozowanym naczyniowym upośledzeniem poznawczym, ale nie został wcześniej opisany w bazach danych mutacji choroby. Ten wariant miał pokrycie tylko 18x, jednak sekwencjonowanie Sangera zostanie przeprowadzone w celu zapewnienia jego ważności w sekwencji. Ostatecznie stwierdzono, że wariant ma niepewne znaczenie podczas oceny za pomocą norm i wytycznych ACMG dotyczących patogenności.

Panel ONDRISeq i potok bioinformatyczny są również w stanie określić genotyp APOE każdej próbki. U tego pacjenta stwierdzono genotyp APOE E3/E3.

figure-results-1
Rysunek 3: Przykład zmniejszonego wyniku z ANNOVAR wyświetlającego ręcznie wyselekcjonowane warianty z adnotacjami. Zmniejszona wydajność ANNOVAR ze studium przypadku 68-letniego mężczyzny z chorobą Parkinsona. Warianty z adnotacjami są selekcjonowane w celu zidentyfikowania tych, które z największym prawdopodobieństwem będą miały znaczenie kliniczne, zgodnie z czerwonymi polami. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Na ścieżce od ekstrakcji próbki DNA do identyfikacji wariantów, które mogą być interesujące przy rozważaniu diagnozy pacjenta, progresji choroby i możliwych opcji leczenia, ważne jest, aby rozpoznać różnorodny charakter metodologii wymaganej zarówno do sekwencjonowania, jak i prawidłowego przetwarzania danych. Opisany w niniejszym dokumencie protokół jest przykładem wykorzystania ukierunkowanego NGS i późniejszej analizy bioinformatycznej niezbędnej do identyfikacji rzadkich wariantów o potencjalnym znaczeniu klinicznym. W szczególności przedstawiamy podejście przyjęte przez podgrupę ONDRI genomics podczas korzystania z niestandardowego panelu NGS zaprojektowanego przez ONDRISeq.

Uznaje się, że metody te zostały opracowane w oparciu o konkretną platformę NGS i że istnieją inne platformy sekwencjonowania i zestawy do wzbogacania celów, które można zastosować. Jednak platforma NGS i instrument stacjonarny (Tabela materiałów) zostały wybrane na podstawie ich wczesnej aprobaty amerykańskiej Agencji ds. Żywności i Leków (FDA)46. Autoryzacja ta odzwierciedla wysokiej jakości sekwencjonowanie, które można wykonać za pomocą wybranych protokołów NGS, oraz niezawodność, jaką można przypisać odczytom sekwencjonowania.

Chociaż uzyskanie dokładnych odczytów sekwencjonowania z głębokością pokrycia jest bardzo ważne, przetwarzanie bioinformatyczne wymagane do końcowej analizy rzadkich wariantów jest niezbędne i może być intensywne obliczeniowo. Ze względu na wiele źródeł błędów, które mogą wystąpić w procesie sekwencjonowania, solidny potok bioinformatyczny musi korygować różne niedokładności, które można wprowadzić. Mogą one wynikać z niewspółosiowości w procesie mapowania, stronniczości amplifikacji wprowadzonej przez amplifikację PCR w przygotowaniu biblioteki oraz technologii wytwarzającej artefakty sekwencjonowania47. Bez względu na oprogramowanie używane do mapowania odczytu i wywoływania wariantów, istnieją typowe sposoby redukcji tych błędów, w tym lokalne wyrównanie, usunięcie zduplikowanych zmapowanych odczytów i ustawienie odpowiednich parametrów kontroli jakości podczas wywoływania wariantów. Ponadto parametry wybrane podczas wywoływania wariantów mogą się różnić w zależności od tego, co jest najbardziej odpowiednie dla danego badania11. Minimalne pokrycie i wynik jakości wariantu i otaczających nukleotydów, które zostały w nim zastosowane, zostały wybrane tak, aby stworzyć równowagę między odpowiednią swoistością a czułością. Parametry te zostały zweryfikowane dla panelu ONDRISeq w oparciu o zgodność wywoływania wariantów z trzema oddzielnymi technikami genetycznymi, jak opisano wcześniej, w tym: 1) genotypowaniem opartym na chipach; 2) test dyskryminacji allelicznej; oraz 3) Sekwencjonowanie Sangera9.

Po dokładnym wywołaniu wariantów, w celu określenia tych o potencjalnym znaczeniu klinicznym, niezbędne są adnotacje i kuracja. Ze względu na otwartą dostęp, ANNOVAR jest doskonałym narzędziem zarówno do adnotacji, jak i wstępnej selekcji lub eliminacji wariantów. Oprócz tego, że ANNOVAR jest łatwo dostępny, może być stosowany do dowolnego pliku VCF, bez względu na używaną platformę sekwencjonowania, i można go dostosować do potrzeb badania26.

Po adnotacji warianty muszą być interpretowane w celu określenia, czy należy je uznać za mające znaczenie kliniczne. Proces ten staje się nie tylko złożony, ale często jest podatny na subiektywizm i błędy ludzkie. Z tego powodu ACMG ustaliło wytyczne dotyczące oceny dowodów na patogenność dowolnego wariantu. Stosujemy niesynonimiczne, rzadkie podejście do ręcznego sprawdzania oparte na wariantach, które jest konstruowane na podstawie tych wytycznych i zabezpieczane przez indywidualną ocenę każdego wariantu, który jest w stanie przejść przez potok, za pomocą niestandardowo zaprojektowanego skryptu języka Python, który klasyfikuje warianty na podstawie wytycznych. W ten sposób każdemu wariantowi przypisuje się ranking patogenny, prawdopodobnie chorobotwórczy, o niepewnym znaczeniu, prawdopodobnym łagodnym lub łagodnym, a my jesteśmy w stanie dodać standaryzację i przejrzystość do procesu selekcji wariantów. Ważne jest, aby zdać sobie sprawę, że specyfika kuracji wariantów, wykraczająca poza proces bioinformatyczny, zostanie zindywidualizowana w oparciu o potrzeby badań, a zatem wykraczała poza zakres prezentowanych metodologii.

Chociaż przedstawione tutaj metody są specyficzne dla ONDRI, opisane kroki można przełożyć na dużą liczbę chorób konstytucyjnych będących przedmiotem zainteresowania. Wraz ze wzrostem liczby asocjacji genów dla wielu fenotypów, ukierunkowany NGS pozwala na podejście oparte na hipotezach, które może wykorzystać wcześniejsze badania przeprowadzone w tej dziedzinie. Istnieją jednak ograniczenia dotyczące ukierunkowanego NGS i przedstawionej metodologii. Skupiając się tylko na określonych regionach genomu, obszary odkryć są ograniczone do nowych alleli będących przedmiotem zainteresowania. W związku z tym nie zostaną zidentyfikowane nowe geny lub inne loci genomowe poza tymi, które są objęte celami sekwencjonowania, które mogłyby zostać ujawnione za pomocą metod WGS lub WES. Istnieją również regiony w genomie, które mogą być trudne do dokładnego sekwencjonowania za pomocą podejść NGS, w tym te o wysokim stopniu powtarzania sekwencji48 lub te, które są bogate w zawartość GC49. Na szczęście, w przypadku korzystania z ukierunkowanego NGS, istnieje a priori wysoki stopień zaznajomienia się z sekwencjonowanymi regionami genomu i tym, czy mogą one stanowić wyzwanie techniczne. Wreszcie, wykrywanie wariantów numerów kopii na podstawie danych NGS nie jest obecnie ustandaryzowane50. Jednak bioinformatyczne rozwiązania tych problemów mogą pojawić się na horyzoncie; Nowe narzędzia obliczeniowe mogą pomóc w analizie tych dodatkowych form zmienności u pacjentów z ONDRI.

Pomimo swoich ograniczeń, ukierunkowany NGS jest w stanie uzyskać wysokiej jakości dane w ramach podejścia opartego na hipotezach, pozostając jednocześnie tańszym niż jego odpowiedniki WGS i WES. Metodologia ta jest nie tylko odpowiednia dla efektywnych i ukierunkowanych badań, ale także wykładniczo rośnie kliniczne wdrożenie celowanego NGS. Technologia ta jest wykorzystywana do udzielania odpowiedzi na wiele różnych pytań dotyczących szlaków molekularnych różnych chorób. Jest również rozwijany w celu uzyskania dokładnego narzędzia diagnostycznego przy stosunkowo niskich kosztach w przeciwieństwie do WES i WGS. Nawet w porównaniu ze złotym standardem sekwencjonowania Sangera, ukierunkowany NGS może konkurować pod względem efektywności czasowej i kosztowej. Z tych powodów ważne jest, aby naukowiec lub klinicysta, który otrzymuje i wykorzystuje dane NGS, na przykład dostarczone jako tekst w raporcie laboratoryjnym lub klinicznym, rozumiał złożoną "czarną skrzynkę", która leży u podstaw wyników. Przedstawione tu metody powinny pomóc użytkownikom zrozumieć proces leżący u podstaw generowania i interpretacji danych NGS.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie mają nic do ujawnienia.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Chcielibyśmy podziękować wszystkim uczestnikom ONDRI za zgodę i współpracę z naszym badaniem. Dziękujemy badaczom ONDRI (www.ONDRI.ca/people), w tym naszemu głównemu badaczowi (MJS) oraz komitetom zarządzającym ONDRI: komitetowi wykonawczemu, komitetowi sterującemu, komitetowi publikacji, komitetowi rekrutacyjnemu, platformom oceny i zespołowi zarządzania projektem. Dziękujemy również Regionalnemu Centrum Genomiki w Londynie za ich wiedzę techniczną. AAD jest wspierane przez Alzheimer Society of London i stypendium Middlesex Masters Graduate Research Scholarship. SMKF jest wspierany przez ALS Canada Tim E. Noël Postdoctoral Fellowship.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
4 ml probówki EDTA K2Fisher Scientific02-689-4
1 M Tris BufferBio Basic Canada Inc.SD8141
Gentra Puregene Zestawdo krwi Qiagen1583891,000 ml. Jest to zestaw do ekstrakcji krwi, o którym mowa w kroku 1.3.
Spektrofotometr NanoDrop-1000Thermo Fisher ScientificND-2000zastąpiony przez spektrofotometr NanoDrop-2000. Jest to spektrofotometr o pełnym spektrum, o którym mowa w krokach 1.4 i 2.1.2.
Fluorometr Qubit 2.0InvitrogenQ32866Jest to fluorometr odpowiedni do oznaczania ilościowego DNA, o którym mowa w krokach 2.1.4, 2.1.6, 2.2.3 i 3.1.3.
Nextera Rapid Custom Zestaw wzbogacający do przechwytywaniaIllumina, Inc.FC-140-1009Specjalnie zaprojektowany dla panelu ONDRISeq, sekwencjonujący eksony 80 genów, w wyniku czego uzyskuje się 971 388 par zasad sekwencji w odczytach sparowanych końców o długości 150 zasad; 288 próbek w zestawie. Jest to zestaw do wzbogacania celów, o którym mowa w krokach 2.2, 2.2.2, 2.2.3, 3.1.5, 3.1.6, 3.4.1 i w dyskusji.
2100 BioAnalyzerAgilent TechnologiesG2939BAJest to zautomatyzowany system elektroforezy, o którym mowa w kroku 3.1.4.
Zestaw odczynników DNA o wysokiej czułościAgilent Technologies5067-4626110 próbek w zestawie; Jest to zestaw do analizy jakości DNA, o którym mowa w kroku 3.1.4.
Zestaw odczynników MiSeq v3Illumina, Inc.MS-102-3003Zestaw na 600 cykli; Jest to zestaw odczynników do instrumentów biurkowych NGS, o którym mowa w kroku 3.1.
Osobisty sekwenator genomu MiSeqIllumina, Inc.SY-410-1003Jest to instrument biurkowy NGS, o którym mowa w krokach 2.2.1, 3.1, 3.1.1, 3.1.2, 3.1.8, 3.2, 4.2.6, Reprezentatywne wyniki i Dyskusja.
Kierownik eksperymentówIllumina, Inc.Jest to oprogramowanie w technologii NGS, o którym mowa w kroku 3.1.1 i Rysunek 1. https://support.illumina.com/sequencing/sequencing_software/experiment_manager/downloads.html
BaseSpaceIllumina, Inc.SW-410-1000Jest to środowisko obliczeniowe oparte na chmurze, o którym mowa w krokach 3.1.2, 3.2, 3.3, 3.3.1, 3.3.2, 3.4, 3.4.1, 3.4.2 i 3.4.3. https://basespace.illumina.com/
CLC Genomics Workbench 10.1.1Qiagen832000Dostępne są również opcje open source do wstępnego przetwarzania danych, które mogą modelować przepływ pracy używany w tym protokole. Jest to oprogramowanie używane do wstępnego przetwarzania danych, o którym mowa w kroku 4 i w Rysunek 2
adnotacjihttp://annovar.openbioinformatics.org/en/latest/user-guide/download/
RefSeqNarodowe Centrum Informacjihttps://www.ncbi.nlm.nih.gov/refseq/
dbSNP138Narodowe Centrum Informacjihttps://www.ncbi.nlm.nih.gov/projects/SNP/snp_summary.cgi?view+summary=view+summary&build_id=138
Exome Aggregation Consortium BroadInstitutehttp://exac.broadinstitute.org/
National Heart, Lung, and Blood Institute Projekt sekwencjonowania egzomu European CohortUniversity of Washington oraz Broad Institutehttp://evs.gs.washington.edu/EVS/
ClinVar National Center for Biotechnology Informationhttps://www.ncbi.nlm.nih.gov/clinvar/
Połączone zubożenie zależne od adnotacjiUniwersytet Waszyngtoński i Hudson-Alpha Institute for Biotechnologyhttp://cadd.gs.washington.edu/
Sorting Intolerant from TolerantJ. Craig Venter Instutitehttp://sift.jcvi.org/
PolyPhen-2Brigham and Women's Hospital, Harvard Medical Schoolhttp://genetics.bwh.harvard.edu/pph2/
Ludzki gen Baza danych mutacjiQiagen834050Jest to baza danych mutacji chorobowych, o której mowa w kroku 5.2 i reprezentatywnych wynikach. https://portal.biobase-international.com/cgi-bin/portal/login.cgi?redirect_url=/hgmd/pro/start.php
Analiza wariantów oparta na splicinguLaboratorium Freya, Uniwersytet w Torontohttp://tools.genes.toronto.edu/
Human Splicing FinderAix Marseille Universitéhttp://www.umd.be/HSF3/HSF.shtml
Inne materiały
Wirówka
Jednorazowe pipety transferowe
Zmienność Biotechnologicznej Biotechnologicznej

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Metzker, M. L. Sequencing technologies - the next generation. Nat Rev Genet. 11 (1), 31-46 (2010).
  2. Mardis, E. R. Next-generation DNA sequencing methods. Annu Rev Genomics Hum Genet. 9, 387-402 (2008).
  3. Shendure, J., Ji, H. Next-generation DNA sequencing. Nat Biotechnol. 26 (10), 1135-1145 (2008).
  4. Sanger, F., Nicklen, S., Coulson, A. R. DNA sequencing with chain-terminating inhibitors. Proc Natl Acad Sci U S A. 74 (12), 5463-5467 (1977).
  5. Farhan, S. M. K., Hegele, R. A. Exome Sequencing: New Insights into Lipoprotein Disorders. Current Cardiology Reports. 16 (7), (2014).
  6. Choi, M., et al. Genetic diagnosis by whole exome capture and massively parallel DNA sequencing. Proc Natl Acad Sci U S A. 106 (45), 19096-19101 (2009).
  7. Mardis, E. R. DNA sequencing technologies: 2006-2016. Nat Protoc. 12 (2), 213-218 (2017).
  8. Farhan, S. M., et al. The Ontario Neurodegenerative Disease Research Initiative (ONDRI). Can J Neurol Sci. 44 (2), 196-202 (2017).
  9. Farhan, S. M. K., et al. The ONDRISeq panel: custom-designed next-generation sequencing of genes related to neurodegeneration. NPJ Genom Med. (16032), 1-11 (2016).
  10. El-Metwally, S., Hamza, T., Zakaria, M., Helmy, M. Next-generation sequence assembly: four stages of data processing and computational challenges. PLoS Comput Biol. 9 (12), e1003345(2013).
  11. Yohe, S., Thyagarajan, B. Review of Clinical Next-Generation Sequencing. Arch Pathol Lab Med. , (2017).
  12. Qiagen. Gentra Puregene Handbook. , 4th edn, (2014).
  13. NanoDrop Technologies, Inc. Spectrophotometer V3.5 User's Manual. , (2007).
  14. Invitrogen by Life Technologies. Qubit 2.0 Fluorometer User Manual. Vol. Q32866. , (2010).
  15. Illumina, Inc. Nextera Rapid Capture Enrichment Guide. , Vol. 15037436 v01 (2016).
  16. Illumina, Inc. Nextera Rapid Capture Enrichment Reference Guide. , Vol. 15037436 v01 (2016).
  17. Rev. B. Illumina, Inc. MiSeq Reagent Kit v3 Reagent Preparation Guide. , Vol. 15044932 Rev. B (2013).
  18. Illumina, Inc. MiSeq System Guide. , Vol. 15027617 v01 (2015).
  19. BaseSpace Sequence Hub. , https://basespace.illumina.com/dashboard (2017).
  20. Rev. B. Agilent Technologies. Agilent High Sensitivity DNA Kit Guide. , Vol. G2938-90321 (2013).
  21. Illumina, Inc. MiSeq System Denature and Dilute Libraries Guide. , Vol. 15039740 v01 (2016).
  22. Illumina, Inc. System Specification Sheet: MiSeq System. , (2016).
  23. BaseSpace Sequence Hub Help Center. , Available from: https://help.basespace.illumina.com/ (2017).
  24. Qiagen. Genomics Workbench 10.1.1 User Manual. , (2017).
  25. Ebbert, M. T., et al. Evaluating the necessity of PCR duplicate removal from next-generation sequencing data and a comparison of approaches. BMC Bioinformatics. 17, Suppl 7. 239(2016).
  26. Wang, K., Li, M., Hakonarson, H. ANNOVAR: functional annotation of genetic variants from high-throughput sequencing data. Nucleic Acids Res. 38 (16), e164(2010).
  27. Leary, N. A., et al. Reference sequence (RefSeq) database at NCBI: current status, taxonomic expansion, and functional annotation. Nucleic Acids Res. 44 (D1), D733-D745 (2016).
  28. Kitts, A., Phan, L., Ward, M., Bradley Holmes, J. The Database of Short Genetic Variation (dbSNP). , National Center for Biotechnology Information. Bethesda, MD. (2013).
  29. Lek, M., et al. Analysis of protein-coding genetic variation in 60,706 humans. Nature. 536 (7616), 285-291 (2016).
  30. Exome Variant Server, NHLBI GO Exome Sequencing Project (ESP). , http://evs.gs.washington.edu/EVS/ (2017).
  31. Auton, A., et al. A global reference for human genetic variation. Nature. 526 (7571), 68-74 (2015).
  32. Landrum, M. J., et al. ClinVar: public archive of interpretations of clinically relevant variants. Nucleic Acids Res. 44 (D1), D862-D868 (2016).
  33. Kircher, M., et al. A general framework for estimating the relative pathogenicity of human genetic variants. Nat Genet. 46 (3), 310-315 (2014).
  34. Kumar, P., Henikoff, S., Ng, P. C. Predicting the effects of coding non-synonymous variants on protein function using the SIFT algorithm. Nat Protoc. 4 (7), 1073-1081 (2009).
  35. Adzhubei, I. A., et al. A method and server for predicting damaging missense mutations. Nat Methods. 7 (4), 248-249 (2010).
  36. Bertram, L., McQueen, M. B., Mullin, K., Blacker, D., Tanzi, R. E. Systematic meta-analyses of Alzheimer disease genetic association studies: the AlzGene database. Nat Genet. 39 (1), 17-23 (2007).
  37. Xiong, H. Y., et al. The human splicing code reveals new insights into the genetic determinants of disease. Science. 347 (6218), (2015).
  38. Desmet, F. O., et al. Human Splicing Finder: an online bioinformatics tool to predict splicing signals. Nucleic Acids Res. 37 (9), e67(2009).
  39. Richards, S., et al. Standards and guidelines for the interpretation of sequence variants: a joint consensus recommendation of the American College of Medical Genetics and Genomics and the Association for Molecular Pathology. Genet Med. 17 (5), 405-424 (2015).
  40. Li, Q., Wang, K. InterVar: Clinical Interpretation of Genetic Variants by the 2015 ACMG-AMP Guidelines. Am J Hum Genet. 100 (2), 267-280 (2017).
  41. Yang, Z. L., Sun, G. L. High-frequency, low-coverage "false positives" mutations may be true in GS Junior sequencing studies. Scientific Reports. 7, (2017).
  42. Gandhi, P. N., Wang, X., Zhu, X., Chen, S. G., Wilson-Delfosse, A. L. The Roc domain of leucine-rich repeat kinase 2 is sufficient for interaction with microtubules. J Neurosci Res. 86 (8), 1711-1720 (2008).
  43. Goldwurm, S., et al. The G6055A (G2019S) mutation in LRRK2 is frequent in both early and late onset Parkinson's disease and originates from a common ancestor. J Med Genet. 42 (11), e65(2005).
  44. Caiazzo, M., et al. Direct generation of functional dopaminergic neurons from mouse and human fibroblasts. Nature. 476 (7359), 224-227 (2011).
  45. Grimes, D. A., et al. Translated mutation in the Nurr1 gene as a cause for Parkinson's disease. Mov Disord. 21 (7), 906-909 (2006).
  46. Collins, F. S., Hamburg, M. A. First FDA authorization for next-generation sequencer. N Engl J Med. 369 (25), 2369-2371 (2013).
  47. Van der Auwera, G. A., et al. From FastQ data to high confidence variant calls: the Genome Analysis Toolkit best practices pipeline. Curr Protoc Bioinformatics. 43, 11-33 (2013).
  48. Treangen, T. J., Salzberg, S. L. Repetitive DNA and next-generation sequencing: computational challenges and solutions. Nat Rev Genet. 13 (1), 36-46 (2011).
  49. Shin, S., Park, J. Characterization of sequence-specific errors in various next-generation sequencing systems. Mol Biosyst. 12 (3), 914-922 (2016).
  50. Povysil, G., et al. panelcn.MOPS: Copy-number detection in targeted NGS panel data for clinical diagnostics. Hum Mutat. 38 (7), 889-897 (2017).

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Panel ONDRISeqwywo ywanie wariant wpliki FASTQmapowanie do genomu referencyjnegowska niki jako ciznaczenie kliniczne

Powiązane artykuły