Przedstawiamy protokół do identyfikacji funkcjonalnych implikacji wariantów niekodujących zidentyfikowanych przez badania asocjacyjne całego genomu (GWAS) przy użyciu trójwymiarowych interakcji chromatyny.
Artykuł metodologiczny
* These authors contributed equally
Przedstawiamy protokół do identyfikacji funkcjonalnych implikacji wariantów niekodujących zidentyfikowanych przez badania asocjacyjne całego genomu (GWAS) przy użyciu trójwymiarowych interakcji chromatyny.
Badania asocjacyjne całego genomu (GWAS) z powodzeniem zidentyfikowały setki genomowych loci, które są związane z ludzkimi cechami i chorobami. Ponieważ jednak większość loci istotnych dla całego genomu (GWS) przypada na genom niekodujący, funkcjonalny wpływ wielu z nich pozostaje nieznany. Trójwymiarowe interakcje chromatyny zidentyfikowane przez Hi-C lub jego pochodne mogą dostarczyć użytecznych narzędzi do opisywania tych loci poprzez łączenie niekodujących wariantów z ich genami, które można wykorzystać. W tym miejscu przedstawiamy protokół mapowania niekodujących wariantów GWAS na ich domniemane geny przy użyciu zestawów danych GWAS i Hi-C choroby Alzheimera (AD) z ludzkiej dorosłej tkanki mózgowej. Przypuszczalne przyczynowe polimorfizmy pojedynczego nukleotydu (SNP) są identyfikowane przez zastosowanie algorytmów precyzyjnego mapowania. SNP są następnie mapowane do ich przypuszczalnych genów docelowych za pomocą interakcji wzmacniacz-promotor opartych na Hi-C. Otrzymany w ten sposób zestaw genów reprezentuje geny ryzyka choroby Alzheimera, ponieważ są one potencjalnie regulowane przez warianty ryzyka choroby Alzheimera. Aby uzyskać dalsze biologiczne informacje na temat mechanizmów molekularnych leżących u podstaw choroby Alzheimera, scharakteryzowaliśmy geny ryzyka choroby Alzheimera za pomocą danych dotyczących rozwojowej ekspresji mózgu i profili ekspresji pojedynczej komórki mózgu. Protokół ten można rozszerzyć na dowolne zestawy danych GWAS i Hi-C w celu zidentyfikowania przypuszczalnych genów docelowych i mechanizmów molekularnych leżących u podstaw różnych cech i chorób człowieka.
Badania asocjacyjne całego genomu (GWAS) odegrały kluczową rolę w odkryciu genetycznych podstaw szeregu ludzkich cech i chorób. To zakrojone na szeroką skalę genotypowanie ujawniło tysiące wariantów genomu związanych z fenotypami, od wzrostu po ryzyko schizofrenii. Jednak pomimo ogromnego sukcesu GWAS w identyfikacji loci związanych z chorobą i cechą, mechanistyczne zrozumienie, w jaki sposób te warianty przyczyniają się do fenotypu, było wyzwaniem, ponieważ większość wariantów związanych z fenotypem znajduje się w niekodującej frakcji ludzkiego genomu. Ponieważ warianty te często pokrywają się z przewidywanymi elementami regulatorowymi, prawdopodobnie zmienią kontrolę transkrypcji pobliskiego genu. Jednak niekodujące loci mogą wpływać na transkrypcję genów w odległościach liniowych przekraczających jedną megazasadę, co utrudnia identyfikację genów dotkniętych każdym wariantem. Trójwymiarowa (3D) struktura chromatyny odgrywa ważną rolę w pośredniczeniu w połączeniach między odległymi loci regulatorowymi a promotorami genów i może być wykorzystana do identyfikacji genów dotkniętych polimorfizmami pojedynczych nukleotydów związanych z fenotypem (SNP).
Regulacja genów odbywa się za pośrednictwem złożonego procesu, który obejmuje aktywację wzmacniacza i tworzenie pętli chromatyny, które fizycznie łączą wzmacniacze z promotorami genów, do których można skierować maszynerię transkrypcyjną1,2,3. Ponieważ pętle chromatyny często obejmują kilkaset kilozasad (kb), do rozszyfrowania mechanizmów regulacji genów potrzebne są szczegółowe mapy architektury chromatyny 3D. Wynaleziono wiele technologii wychwytywania konformacji chromatyny w celu identyfikacji architektury chromatyny 3D4. Spośród tych technologii Hi-C zapewnia najbardziej wszechstronną architekturę, ponieważ rejestruje profile interakcji chromatyny 3D w całym genomie. Zestawy danych Hi-C zostały szybko przystosowane do interpretacji niekodujących loci-istotnych dla całego genomu (GWS) loci5,6,7,8,9,10,11,12,13, ponieważ może łączyć warianty niekodujące z ich przypuszczalnymi genami docelowymi w oparciu o profile interakcji chromatyny.
W tym artykule przedstawiamy protokół do obliczeniowego przewidywania przypuszczalnych docelowych genów wariantów ryzyka GWAS przy użyciu profili interakcji chromatyny. Stosujemy ten protokół do mapowania loci14 do ich docelowych genów przy użyciu zestawów danych Hi-C w mózgu dorosłego człowieka9. Powstałe w ten sposób geny ryzyka choroby Alzheimera są scharakteryzowane przez inne funkcjonalne zestawy danych genomowych, które obejmują profile transkryptomiczne i ekspresji rozwojowej pojedynczej komórki.
1. Konfiguracja stacji roboczej
2. Generowanie obiektu GRanges dla wiarygodnych SNP
3. Mapowanie pozycyjne
UWAGA: Dla każdego kroku wpisz odpowiedni kod w oknie konsoli w RStudio.
4. Trajektorie ekspresji rozwojowej
UWAGA: Dla każdego kroku wpisz odpowiedni kod w oknie konsoli w RStudio.
5. Profile wyrażeń typu komórkowego
UWAGA: Dla każdego kroku wpisz odpowiedni kod w oknie konsoli w RStudio.
6. Analiza wzbogacania adnotacji genów w genach ryzyka choroby Alzheimera
Opisany tutaj proces zastosowano do zestawu 800 wiarygodnych SNP, które zostały zdefiniowane w oryginalnym badaniu14. Mapowanie pozycyjne wykazało, że 103 SNP pokrywały się z promotorami (43 unikalne geny), a 42 SNP pokrywały się z egzonami (27 unikalnych genów). Po mapowaniu pozycyjnym 84% (669) SNP pozostało nieadnotowanych. Wykorzystując zbiory danych Hi-C z dorosłego mózgu, zdołaliśmy powiązać dodatkowe 208 SNP z 64 genami na podstawie bliskości fizycznej. Łącznie zmapowano 284 wiarygodnych SNP związanych z AD do 112 genów ryzyka AD (Rycina 1A). Geny ryzyka AD były powiązane z białkami prekursorowymi amyloidu, tworzeniem amyloidu-beta oraz odpowiedzią immunologiczną, co odzwierciedla znaną biologię AD15,16,17,18 (Rycina 1B-D). Profile ekspresji rozwojowej genów ryzyka AD wykazały wyraźne wzbogacenie w okresie postnatalnym, co wskazuje na związany z wiekiem podwyższony poziom ryzyka AD (Rycina 2A). Wreszcie, geny ryzyka AD wykazywały wysoką ekspresję w mikrogleju, głównych komórkach odpornościowych w mózgu (Rycina 2B). Jest to zgodne z powtarzającymi się odkryciami, że AD ma silne podłoże immunologiczne, a mikroglej odgrywa centralną rolę w patogenezie AD14,19,20.

Rycina 1: Definiowanie domniemanych genów docelowych loci GWS w chorobie Alzheimera (AD). (A) Wiarygodne SNP pochodzące z 29 czołowych loci AD zostały podzielone na SNP promotorowe, SNP eksonowe oraz nieopisane SNP niekodujące. SNP promotorowe i eksonowe przypisano bezpośrednio do ich genów docelowych poprzez mapowanie pozycyjne, natomiast do mapowania SNP na podstawie oddziaływań fizycznych wykorzystano dodatkowo profile oddziaływań chromatyny w dorosłym mózgu. (B-D) Analizę wzbogacenia terminów GO (B), KEGG (C) i Reactome (D) w genach ryzyka AD przeprowadzono za pomocą programu HOMER, zgodnie z opisem w sekcji 6 protokołu. Oś x reprezentuje skorygowaną o współczynnik fałszywych odkryć (FDR) wartość -log10 (P-value). Wykreślono wzbogacone terminy z FDR < 0,1. Szare linie pionowe reprezentują FDR = 0,05. APP białko prekursor amyloidowy. Licznik: liczba genów ryzyka AD reprezentowanych w każdym terminie; mianownik: liczba genów w każdym terminie. Kliknij tutaj, aby wyświetlić większą wersję tej ryciny.

Rycina 2: Charakterystyka genów ryzyka AD. (A) Geny ryzyka AD wykazują wysoką ekspresję w korze postnatalnej w porównaniu do kory prenatalnej. (B) Wykresy skrzypcowe przedstawiające rozkłady wartości ekspresji genów (ekspresja znormalizowana) w różnych typach komórek kory. Wyniki te wskazują, że geny ryzyka AD wykazują wysoką ekspresję w mikrogleju, co jest zgodne z poprzednimi badaniami14. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.
Plik uzupełniający 1. Kliknij tutaj, aby wyświetlić ten plik (kliknij prawym przyciskiem myszy, aby pobrać).
Plik uzupełniający 2. Kliknij tutaj, aby wyświetlić ten plik (kliknij prawym przyciskiem myszy, aby pobrać).
Plik uzupełniający 3. Kliknij tutaj, aby wyświetlić ten plik (kliknij prawym przyciskiem myszy, aby pobrać).
W tym miejscu opisujemy ramy analityczne, które można wykorzystać do funkcjonalnego opisywania loci GWS w oparciu o mapowanie pozycyjne i interakcje chromatyny. Proces ten składa się z wielu etapów (więcej informacji można znaleźć w recenzji13). Po pierwsze, biorąc pod uwagę, że profile interakcji chromatyny są wysoce specyficzne dla typu komórki, należy wykorzystać dane Hi-C uzyskane z odpowiednich typów komórek/tkanek, które najlepiej oddają biologię leżącą u podstaw zaburzenia. Biorąc pod uwagę, że AD jest chorobą neurodegeneracyjną, wykorzystaliśmy dane Hi-C mózgu dorosłego9 do adnotacji loci GWS. Po drugie, każde locus GWS często ma do setek SNP, które są powiązane z cechą z powodu nierównowagi sprzężeń (LD), dlatego ważne jest, aby uzyskać domniemane przyczynowe ("wiarygodne") SNP poprzez obliczeniowe przewidywanie przyczynowości za pomocą algorytmów precyzyjnego mapowania21,22 lub eksperymentalne testowanie działań regulacyjnych przy użyciu podejść o wysokiej przepustowości, takich jak masowo równoległe testy reporterowe (MPRA)23 lub samotranskrypcję aktywnego sekwencjonowania regionu regulatorowego (STARR-seq)24. Do opisanej tu pracy wykorzystaliśmy wiarygodne SNP podane w Jansen et al.14. Po trzecie, SNP promotora i egzonu są anotowane na podstawie mapowania pozycyjnego. Zastosowaliśmy prostą strategię mapowania pozycyjnego, w której SNP zostały zmapowane do genów, gdy nakładały się na promotory (zdefiniowane jako 2 kb przed miejscem rozpoczęcia transkrypcji) lub eksonami. Jednak podejście to można dalej rozwijać, oceniając funkcjonalne konsekwencje egzonicznych SNP, takie jak to, czy SNP indukuje rozpad zapośredniczony przez nonsens, zmienność missense lub zmienność nonsensu. Po czwarte, profile interakcji chromatyny z odpowiedniego typu tkanki/komórki można wykorzystać do przypisania SNP do ich przypuszczalnych genów docelowych na podstawie fizycznej bliskości. Użyliśmy profili interakcji zakotwiczonych w promotorach, ale możemy jeszcze bardziej udoskonalić lub rozszerzyć profile interakcji, biorąc pod uwagę działania wzmacniające (kierowane przez acetylację histonu H3 K27 lub dostępność chromatyny) lub interakcje egzoniczne. Jedną z ważnych kwestii w tym procesie jest stosowanie spójnej budowy ludzkiego genomu. Na przykład, jeśli pozycje genomowe w statystykach podsumowujących nie są oparte na hg19 (tj. hg18 lub hg38), należy uzyskać odpowiednią wersję genomu referencyjnego lub statystyki podsumowujące muszą zostać przekonwertowane na hg19 za pomocą liftover25.
Zastosowaliśmy te ramy do identyfikacji przypuszczalnych genów docelowych dla AD GWAS, przypisując 284 SNP do 112 genów ryzyka AD. Korzystając z rozwojowych profili ekspresji26 i profili ekspresji specyficznych dla typu komórki9, wykazaliśmy, że ten zestaw genów był zgodny z tym, co wiadomo o patologii AD, ujawniając typy komórek (mikroglej), funkcje biologiczne (odpowiedź immunologiczna i beta amyloid) oraz podwyższone ryzyko wraz z wiekiem.
Chociaż przedstawiliśmy ramy, które nakreślają potencjalne geny docelowe AD i leżącą u jego podstaw biologię, warto zauważyć, że adnotacja oparta na Hi-C może być rozszerzona o adnotację dowolnej niekodującej odmiany. W miarę jak dostępnych będzie coraz więcej danych z sekwencjonowania całego genomu, a nasza wiedza na temat rzadkiej zmienności niekodującej rośnie, Hi-C będzie stanowić kluczowe źródło interpretacji wariantów genetycznych związanych z chorobą. Kompendium zasobów Hi-C uzyskanych z wielu typów tkanek i komórek będzie zatem miało kluczowe znaczenie dla ułatwienia szerokiego zastosowania tej struktury w celu uzyskania biologicznego wglądu w różne cechy ludzkie i choroby.
Autorzy nie mają nic do ujawnienia.
Ta praca była wspierana przez granty NIH R00MH113823 (dla H.W.) i R35GM128645 (dla D.H.P.), NARSAD Young Investigator Award (dla H.W.) oraz grant SPARK od Simons Foundation Autism Research Initiative (SFARI, dla N.M. i H.W.).
| Nazwa | Firma | Numer katalogowy | Komentarze |
|---|---|---|---|
| Rozdzielczość 10 kb Profile interakcji Hi-C w dorosłym mózgu z psychencode | http://adult.psychencode.org/ | ||
| Zestawy danych ekspresji rozwojowej | http://www.brainspan.org/ | ||
| Precyzyjnie zmapowane wiarygodne SNP dla AD (Tabela uzupełniająca 8 od Jansen et al.14) | https://static-content.springer.com/ | ||
| HOMER | a target="_blank" href="http://homer.ucsd.edu/homer/configureHomer.pl">http://homer.ucsd.edu/ | ||
| R (wersja 3.5.0) | https://www.r-project.org/ | ||
| RStudio Desktop | https://www.rstudio.com/ | ||
| Zestawy danych wyrażeń | http://adult.psychencode.org/ |