$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Wykorzystanie technologii sekwencjonowania nowej generacji rozszerza się zarówno w laboratoriach badawczych, jak i klinicznych laboratoriów genetycznych1. Analizy sekwencjonowania całego eksomu (WES) i całego genomu (WGS) ujawniają liczne rzadkie warianty o nieznanym znaczeniu (VUS) w znanych genach powodujących chorobę, a także warianty w genach, które nie są jeszcze powiązane z chorobą Mendla (GUS: geny o niepewnym znaczeniu). Po otrzymaniu listy genów i wariantów w raporcie sekwencji klinicznej, genetycy medyczni muszą ręcznie odwiedzić wiele zasobów internetowych, aby uzyskać więcej informacji i ocenić, który wariant może być odpowiedzialny za określony fenotyp obserwowany u interesującego pacjenta. Proces ten jest czasochłonny, a jego skuteczność w dużym stopniu zależy od wiedzy specjalistycznej danej osoby. Chociaż opublikowano kilka wytycznych2,3, interpretacja WES i WGS wymaga ręcznego nadzoru, ponieważ nie ma jeszcze ustandaryzowanej metodologii analizy wariantów. Dla interpretacji VUS cenna staje się wiedza na temat wcześniej zgłoszonej zależności genotyp-fenotyp, sposobu dziedziczenia i częstości alleli w populacji ogólnej. Ponadto wiedza na temat tego, czy wariant wpływa na krytyczną domenę białkową, czy na ewolucyjnie zachowaną pozostałość, może zwiększyć lub zmniejszyć prawdopodobieństwo patogenności. Aby zebrać wszystkie te informacje, zazwyczaj trzeba poruszać się po 10-20 bazach danych organizmów ludzkich i modelowych, ponieważ informacje są rozproszone w sieci WWW.
Podobnie, naukowcy zajmujący się modelowymi organizmami, którzy pracują nad konkretnymi genami i szlakami, są często zainteresowani powiązaniem swoich odkryć z mechanizmami chorób ludzkich i chcą skorzystać z wiedzy, która jest generowana w dziedzinie genomiki człowieka. Jednak ze względu na szybką ekspansję i ewolucję zestawów danych dotyczących ludzkiego genomu, trudno było zidentyfikować bazy danych, które dostarczają przydatnych informacji. Ponadto, ponieważ większość baz danych organizmów modelowych jest przeznaczona dla badaczy, którzy na co dzień pracują z konkretnym organizmem, na przykład badaczowi myszy bardzo trudno jest wyszukać określone informacje w bazie danych Drosophila i odwrotnie. Podobnie jak w przypadku poszukiwań interpretacji wariantów przeprowadzanych przez genetyków medycznych, identyfikacja użytecznych informacji o ludziach i innych organizmach modelowych jest czasochłonna i w dużym stopniu zależy od doświadczenia badacza organizmu modelowego. MARRVEL (Model organism Aggregated Resources for Rare Variant ExpLoration)4 to narzędzie przeznaczone dla obu grup użytkowników w celu usprawnienia ich przepływu pracy.
MARRVEL (http://marrvel.org) został zaprojektowany jako scentralizowana wyszukiwarka, która systematycznie zbiera dane dla klinicystów i badaczy w efektywny i spójny sposób. Dzięki informacjom z 20 lub więcej publicznie dostępnych baz danych, program ten pozwala użytkownikom szybko zbierać informacje i uzyskiwać dostęp do dużej liczby baz danych organizmów ludzkich i modelowych bez konieczności wielokrotnego wyszukiwania. Strony wyników wyszukiwania zawierają również hiperłącza do oryginalnych źródeł informacji, umożliwiając osobom fizycznym dostęp do surowych danych i gromadzenie dodatkowych informacji dostarczonych przez źródła.
W przeciwieństwie do wielu wariantów narzędzi do priorytetyzacji, które wymagają wprowadzania dużych danych sekwencjonowania w postaci plików VCF lub BAM i instalacji często zastrzeżonego/komercyjnego oprogramowania, MARRVEL działa na dowolnej przeglądarce internetowej. Można z niego korzystać bezpłatnie i jest kompatybilny z urządzeniami przenośnymi (np. smartfonami, tabletami), o ile są one podłączone do Internetu. Wybraliśmy ten format, ponieważ wielu klinicystów i badaczy zazwyczaj musi przeszukiwać jeden lub kilka genów i wariantów na raz. Należy pamiętać, że rozwijamy funkcje pobierania wsadowego i API (interfejsu programowania aplikacji) dla MARRVEL, aby ostatecznie umożliwić użytkownikom zarządzanie setkami genów i wariantów jednocześnie za pomocą niestandardowych narzędzi do zapytań, jeśli to konieczne.
Ze względu na szeroki zakres zastosowań, w tym protokole, opiszemy szeroko zakrojone podejście do nawigacji po różnych zestawach danych, które wyświetla MARRVEL. Bardziej ukierunkowane przykłady, które są dostosowane do konkretnych potrzeb użytkowników, zostaną opisane w sekcji Reprezentatywne wyniki. Należy zauważyć, że wyniki projektu MARRVEL nadal wymagają pewnego poziomu wiedzy podstawowej z zakresu genetyki człowieka lub organizmów modelowych w celu uzyskania cennych informacji. Odsyłamy czytelników do tabeli zawierającej listę podstawowych artykułów, które opisują funkcję każdej z oryginalnych baz danych, które są kuratorowane przez MARRVEL (Tabela 1). Poniższy protokół jest podzielony na trzy sekcje: (1) Jak rozpocząć poszukiwania, (2) jak interpretować wyniki badań genetycznych człowieka w ramach projektu MARRVEL oraz (3) jak wykorzystać dane dotyczące organizmów modelowych w badaniu MARRVEL. W sekcji "Reprezentatywne wyniki" opisano bardziej ukierunkowane i szczegółowe podejścia. MARRVEL jest aktywnie aktualizowany, dlatego prosimy o zapoznanie się z aktualną stroną FAQ na stronie internetowej, aby uzyskać szczegółowe informacje na temat źródeł danych. Zdecydowanie zalecamy użytkownikom MARRVEL zarejestrowanie się w celu otrzymywania powiadomień o aktualizacjach za pośrednictwem formularza zgłoszeniowego e-mail znajdującego się na dole strony głównej MARRVEL.