Badania oparte na sekwencjonowaniu i genotypowaniu, w tym badania asocjacyjne całego genomu (GWAS), badania locus kandydującego oraz badania głębokiego sekwencjonowania, zidentyfikowały wiele wariantów genetycznych statystycznie powiązanych z chorobą, cechą lub fenotypem. Wbrew wczesnym przewidywaniom, większość tych wariantów (85-93%) znajduje się w regionach niekodujących i nie zmienia sekwencji aminokwasowej białek1,2. Interpretacja funkcji tych wariantów niekodujących oraz określenie mechanizmów biologicznych łączących je z powiązaną chorobą, cechą lub fenotypem okazały się trudnym zadaniem3-6. Opracowaliśmy ogólną strategię identyfikacji mechanizmów molekularnych, które łączą warianty z istotnym fenotypem pośrednim – ekspresją genów. Ten schemat postępowania został zaprojektowany specjalnie w celu identyfikacji modulacji wiązania czynników transkrypcyjnych (TF) przez warianty genetyczne. Strategia ta łączy podejścia obliczeniowe i techniki biologii molekularnej mające na celu przewidzenie biologicznych efektów wariantów kandydujących in silico oraz empiryczną weryfikację tych przewidywań (Rysunek 1).

Rysunek 1: Strategiczne podejście do analizy niekodujących wariantów genetycznych. Kroki, które nie zostały uwzględnione w szczegółowym protokole towarzyszącym niniejszemu manuskryptowi, są zaznaczone kolorem szarym. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.
W wielu przypadkach istotne jest, aby zacząć od rozszerzenia listy wariantów o wszystkie te, które wykazują wysoką nierównowagę sprzężeń (LD) z każdym wariantem powiązanym statystycznie. LD jest miarą nielosowego powiązania alleli w dwóch różnych pozycjach chromosomowych, którą można zmierzyć za pomocą statystyki r2 7. r2 jest miarą nierównowagi sprzężeń między dwoma wariantami, gdzie r2 = 1 oznacza doskonałe sprzężenie między wariantami. Stwierdzono, że allele w wysokim LD współsegregują na chromosomie w populacjach przodków. Obecne macierze do genotypowania nie obejmują wszystkich znanych wariantów w ludzkim genomie. Zamiast tego wykorzystują one LD w ludzkim genomie i zawierają podzbiór znanych wariantów, które pełnią rolę reprezentantów (proxy) dla innych wariantów w obrębie konkretnego regionu LD8. Zatem wariant bez żadnych konsekwencji biologicznych może być powiązany z konkretną chorobą, ponieważ znajduje się w LD z wariantem przyczynowym – wariantem o istotnym efekcie biologicznym. Proceduralnie zaleca się konwersję plików wywołań wariantów (vcf) z najnowszej wersji projektu 1,000 genomes project9 na pliki binarne kompatybilne z PLINK10,11, narzędziem open-source do analizy asocjacji całego genomu. Następnie wszystkie pozostałe warianty genetyczne z LD r2 >0,8 w stosunku do każdego wejściowego wariantu genetycznego mogą zostać zidentyfikowane jako kandydaci. Ważne jest, aby na tym etapie zastosować odpowiednią populację referencyjną – np. jeśli wariant zidentyfikowano u osób pochodzenia europejskiego, do rozszerzenia LD należy użyć danych od osób o podobnym pochodzeniu.
Ekspansja LD często skutkuje powstaniem dziesiątek wariantów kandydujących i jest prawdopodobne, że tylko niewielka ich część przyczynia się do mechanizmu choroby. Często nie jest możliwe eksperymentalne zbadanie każdego z tych wariantów z osobna. Przydatne jest zatem wykorzystanie tysięcy publicznie dostępnych zbiorów danych genomiki funkcjonalnej w celu przefiltrowania i priorytetyzacji wariantów. Na przykład konsorcjum ENCODE12 przeprowadziło tysiące eksperymentów ChIP-seq opisujących wiązanie TF i kofaktorów oraz modyfikacje histonów w szerokim zakresie kontekstów, wraz z danymi o dostępności chromatyny uzyskanymi za pomocą technologii takich jak DNase-seq13, ATAC-seq14 i FAIRE-seq15. Bazy danych i serwery internetowe, takie jak UCSC Genome Browser16, Roadmap Epigenomics17, Blueprint Epigenome18, Cistrome19 i ReMap20, zapewniają bezpłatny dostęp do danych uzyskanych za pomocą tych i innych technik eksperymentalnych w szerokim zakresie typów komórek i warunków. Gdy wariantów do zbadania eksperymentalnie jest zbyt wiele, dane te mogą posłużyć do priorytetyzacji tych zlokalizowanych w prawdopodobnych regionach regulatorowych w odpowiednich typach komórek i tkanek. Ponadto w przypadkach, gdy wariant znajduje się w obrębie piku ChIP-seq dla konkretnego białka, dane te mogą dostarczyć potencjalnych wskazówek co do konkretnych TF lub kofaktorów, których wiązanie może być zaburzone.
Następnie uzyskane priorytetowe warianty są przesiewane eksperymentalnie w celu walidacji przewidywanego, zależnego od genotypu wiązania białek przy użyciu metody EMSA21,22. Metoda EMSA mierzy zmianę migracji oligonukleotydu w nieredukującym żelu TBE. Fluorescencyjnie znakowany oligonukleotyd inkubuje się z lizatem jądrowym; wiązanie czynników jądrowych spowalnia ruch oligonukleotydu w żelu. W ten sposób oligonukleotyd, który związał więcej czynników jądrowych, będzie widoczny jako silniejszy sygnał fluorescencyjny podczas skanowania. Co istotne, EMSA nie wymaga przewidywań dotyczących konkretnych białek, których wiązanie ulegnie zmianie.
Po zidentyfikowaniu wariantów zlokalizowanych w przewidywanych regionach regulacyjnych, które są zdolne do różnicowego wiązania czynników jądrowych, stosuje się metody obliczeniowe w celu przewidzenia konkretnych czynników transkrypcyjnych (TF), których wiązanie mogą one wpływać. Preferujemy korzystanie z CIS-BP23,24, RegulomeDB25, UniProbe26 oraz JASPAR27. Po zidentyfikowaniu potencjalnych TF, przewidywania te można zweryfikować za pomocą przeciwciał przeciwko tym TF (supershifty EMSA i Westerny DAPA). Supershift EMSA polega na dodaniu przeciwciała specyficznego dla TF do lizatu jądrowego i oligonukleotydu. Pozytywny wynik w supershifcie EMSA objawia się jako dalsze przesunięcie prążka EMSA lub zanik prążka (omówiono w referencji28). W uzupełniającej metodzie DAPA, biotynilowany na końcu 5' dupleks oligonukleotydowy zawierający wariant oraz flankujące go nukleotydy o długości 20 par zasad inkubuje się z lizatem jądrowym z odpowiednich typów komórek, aby wychwycić czynniki jądrowe specyficznie wiążące oligonukleotydy. Kompleks dupleksu oligonukleotydowego z czynnikiem jądrowym jest unieruchamiany przez mikrokulki streptawidyny w kolumnie magnetycznej. Związane czynniki jądrowe są zbierane bezpośrednio poprzez elucję29,48. Przewidywania dotyczące wiązania można następnie ocenić za pomocą Western blotu z wykorzystaniem przeciwciał specyficznych dla białka. W przypadkach, gdy brak jest oczywistych przewidywań lub jest ich zbyt wiele, eluaty z wyciągów wariantów w eksperymentach DAPA można przekazać do jednostki proteomiki w celu identyfikacji potencjalnych TF za pomocą spektrometrii mas, co może być następnie zwalidowane przy użyciu wcześniej opisanych metod.
W dalszej części artykułu przedstawiono szczegółowy protokół analizy wariantów genetycznych metodami EMSA oraz DAPA.