Tutaj prezentujemy podejście bioinformatyczne i analizy mające na celu zidentyfikowanie ekspresji LINE-1 na poziomie specyficznym dla locus.
Artykuł metodologiczny
Tutaj prezentujemy podejście bioinformatyczne i analizy mające na celu zidentyfikowanie ekspresji LINE-1 na poziomie specyficznym dla locus.
Długie Elementy-1 (LINEs/L1s) to powtarzające się elementy, które mogą kopiować i losowo wstawiać do genomu, powodując niestabilność genomu i mutagenezę. Zrozumienie wzorców ekspresji loci L1 na poziomie indywidualnym przyczyni się do zrozumienia biologii tego pierwiastka mutagennego. Ten autonomiczny element stanowi znaczną część ludzkiego genomu z ponad 500 000 kopii, choć 99% z nich jest okrojonych i wadliwych. Jednak ich obfitość i dominująca liczba wadliwych kopii utrudniają identyfikację autentycznie wyrażonych L1 na podstawie sekwencji związanych z L1 wyrażanych jako część innych genów. Trudno jest również określić, który konkretny locus L1 jest wyrażany ze względu na powtarzalny charakter elementów. Pokonując te wyzwania, przedstawiamy bioinformatyczne podejście RNA-Seq do identyfikacji ekspresji L1 na poziomie specyficznym dla locus. Podsumowując, zbieramy cytoplazmatyczne RNA, wybieramy poliadenylowane transkrypty i wykorzystujemy analizy RNA-Seq specyficzne dla nici, aby jednoznacznie zmapować odczyty do loci L1 w ludzkim genomie referencyjnym. Wizualnie dobieramy każdy locus L1 z unikalnie zmapowanymi odczytami, aby potwierdzić transkrypcję z własnego promotora i dostosować zmapowane odczyty transkryptu, aby uwzględnić mapowalność każdego pojedynczego locus L1. Podejście to zastosowano do linii komórkowej guza gruczołu krokowego, DU145, aby zademonstrować zdolność tego protokołu do wykrywania ekspresji z niewielkiej liczby pełnowymiarowych elementów L1.
Retrotranspozony to powtarzalne elementy DNA, które mogą "przeskakiwać" w genomie w mechanizmie kopiowania i wklejania za pośrednictwem produktów pośrednich RNA. Jeden podzbiór retrotranspozonów jest znany jako Long INterspersed Elements-1 (LINEs/L1s) i stanowi jedną szóstą ludzkiego genomu z ponad 500 0000 kopii1. Pomimo ich obfitości, większość z tych kopii jest wadliwa i okrojona, a tylko około 80-120 elementów L1 uważa się za aktywne2. Pełnowymiarowy L1 ma około 6 kb długości z nietranslowanymi obszarami 5' i 3', wewnętrznym promotorem i powiązanym promotorem antysensownym, dwiema nienakładającymi się ramkami otwartego odczytu (ORF) oraz sygnałem i wielobiegunowym ogonem 3,4,5. U ludzi L1 składają się z podrodzin wyróżnionych wiekiem ewolucyjnym, przy czym starsze rodziny z czasem zgromadziły więcej unikalnych mutacji sekwencji w porównaniu z najmłodszą podrodziną, L1HS6,7. L1 są jedynymi autonomicznymi, ludzkimi retrotranspozonami, a ich ORF kodują odwrotną transkryptazę, endonukleazę i RNP z aktywnościami wiążącymi RNA i opiekuńczymi wymaganymi do retrotranspozycji i wstawienia do genomu w procesie zwanym odwrotną transkrypcją zapoczątkowaną przez cel8,9,10,11,12.
Retrotranspozycja L1s została zgłoszona jako powodująca choroby ludzkiej linii zarodkowej poprzez różne mechanizmy, w tym mutagenezę insercyjną, delecje w miejscu docelowym i rearanżacje13,14,15,16. Ostatnio wysunięto hipotezę, że L1 mogą odgrywać rolę w onkogenezie i / lub progresji nowotworu, ponieważ zaobserwowano zwiększoną ekspresję i insercję tego mutagennego pierwiastka w różnych nowotworach nabłonka17,18. Szacuje się, że na każde 200 urodzeń przypada jedno nowe wstawienie L119. Dlatego konieczne jest lepsze zrozumienie biologii aktywnie wyrażających się L1. Powtarzalność i obfitość wadliwych kopii znalezionych w transkryptach innych genów sprawiły, że ten poziom analizy jest wyzwaniem.
Na szczęście, wraz z pojawieniem się technologii sekwencjonowania o wysokiej przepustowości, poczyniono postępy w celu przeanalizowania i zidentyfikowania autentycznie wyrażających L1 na poziomie specyficznym dla locus. Istnieją różne filozofie dotyczące tego, jak najlepiej zidentyfikować ekspresję L1 za pomocą sekwencjonowania RNA nowej generacji. Zaproponowano tylko dwa rozsądne podejścia do mapowania transkryptów L1 na poziomie specyficznym dla locus. Skupia się tylko na potencjalnej transkrypcji, która odczytuje sygnał poliadenylacji L1 do sekwencji flankujących20. Nasze podejście wykorzystuje niewielkie różnice w sekwencji między elementami L1 i mapuje tylko te odczyty RNA-Seq, które jednoznacznie mapują na jeden locus21. Obie te metody mają ograniczenia w zakresie ilościowego oznaczania poziomów transkryptów. Kwantyfikacja może być potencjalnie ulepszona, dodając poprawkę na "unikalną mapowalność" każdego locus21, lub używając bardziej złożonych algorytmów, które redystrybuują odczyty z wieloma mapami, których nie można było jednoznacznie zmapować do określonego locus22. W tym miejscu szczegółowo omówimy krok po kroku ekstrakcję RNA oraz protokół sekwencjonowania i bioinformatyki nowej generacji w celu identyfikacji wyrażonych elementów L1 na poziomie specyficznym dla locus. Nasze podejście maksymalnie wykorzystuje naszą wiedzę z zakresu biologii funkcjonalnych elementów L1. Obejmuje to wiedzę, że funkcjonalne elementy L1 muszą być generowane z promotora L1, inicjowane na początku elementu L1, muszą być translowane w cytoplazmie i że ich transkrypty powinny być współliniowe z genomem. Krótko mówiąc, zbieramy świeże, cytoplazmatyczne RNA, wybieramy poliadenylowane transkrypty i wykorzystujemy analizy RNA-Seq specyficzne dla nici, aby jednoznacznie mapować odczyty do loci L1 w ludzkim genomie referencyjnym. Te wyrównane odczyty nadal wymagają obszernej ręcznej selekcji w celu określenia, czy odczyty transkrypcji pochodzą z promotora L1 przed wyznaczeniem locus jako autentycznie wyrażonego L1. Stosujemy to podejście na próbce linii komórkowej guza prostaty DU145, aby pokazać, w jaki sposób identyfikuje ona stosunkowo niewiele aktywnie transkrybowanych członków L1 z masy nieaktywnych kopii.
1. Ekstrakcja cytoplazmatycznego RNA
2. Sekwencjonowanie nowej generacji
3. Tworzenie adnotacji (opcjonalnie, jeśli ktoś ma istniejącą adnotację)
4. Odczyt potoku wyrównania w celu zidentyfikowania wyrażonych L1
szt.| opcja | opis |
| –p | Zawiera szczegółowe informacje o liczbie wątków, których komputer powinien użyć podczas wyrównywania. Większa pamięć komputera pozwoli na więcej wątków i powinna być empirycznie d. |
| –m 1 | To mówi programowi, aby akceptował tylko odczyty, które mają jedno dopasowanie w genomie, które jest lepsze niż jakiekolwiek inne dopasowanie genomu. |
| – y | Jest to przełącznik tryhard, który sprawia, że mapowanie wyszukuje wszystkie możliwe dopasowania i nie pozwala na zamknięcie po osiągnięciu określonej liczby dopasowań. |
| –V 3 | Dzięki temu program może wykorzystywać pamięć tylko do zmapowanych odczytów z 3 lub mniej niezgodnościami z genomem. |
| –X 600 | Zezwala to tylko na sparowane odczyty, które są mapowane w odległości 600 baz od siebie. Dzięki temu pary odczytu są współliniowe w genomie i dokonują selekcji względem s obejmujących przetworzone cząsteczki RNA. |
| –Porcja MBS 8184 | To polecenie przydziela dodatkową pamięć do obsługi dużej liczby wyrównań możliwych dla każdego odczytu związanego z L1. |
Tabela 1: Opcje wiersza poleceń dla muszki.
5. Ręczna selekcja
6. Przeczytaj strategię dopasowania, aby ocenić mapowalność w genomie referencyjnym (opcjonalnie, jeśli posiada się istniejący zestaw danych o dopasowanym genomowym DNA)
Kroki opisane powyżej oraz przedstawione graficznie na Ryc. 1 zastosowano do ludzkiej linii komórkowej raka prostaty DU145. Próbkę RNA przygotowano z frakcji cytoplazmatycznej, a następnie poddano sekwencjonowaniu nowej generacji (NGS) zgodnie z protokołem selekcji poly-A, specyficznym dla nici i z odczytami parowanymi (paired-end). Przy użyciu programu Bowtie pliki sekwencjonowania parowanego dopasowano do genomu, dopuszczając jedynie unikalne dopasowania, w których odczyt parowany lepiej pasował do jednej lokalizacji genomowej niż do jakiejkolwiek innej. Pliki sekwencyjne DU145 dopasowano do ludzkiego genomu referencyjnego, tworząc plik bam, który jest dostępny na żądanie autorów. Za pomocą narzędzia bedtools z plików bam DU145 z rozdzieleniem nici wyodrębniono dane dotyczące liczby odczytów zmapowanych do pełnowymiarowych L1s. Odczyty te posortowano w arkuszu kalkulacyjnym od największego do najmniejszego i poddano ręcznej kurateli poprzez analizę otoczenia genomowego każdego locus L1 w programie IGV w celu potwierdzenia jego autentyczności (Tabela uzupełniająca 1). Jeśli próbka została uznana za autentycznie eksprymowaną, oznaczono ją kolorem zielonym wraz z wyjaśnieniem przyczyny akceptacji w ostatniej kolumnie po prawej stronie. Przykłady loci L1 uznanych za autentycznie eksprymowane zgodnie z wytycznymi opisanymi w sekcji metod przedstawiono na Ryc. 2a-b. Jeśli próbka nie została uznana za autentycznie eksprymowaną, oznaczono ją kolorem czerwonym wraz z powodem odrzucenia w ostatniej kolumnie po prawej stronie. Przykłady loci L1 odrzuconych ze względu na ekspresję z promotora innego niż ich własny, zgodnie z wytycznymi opisanymi w sekcji metod, szczegółowo przedstawiono na Ryc. 2c-e.
W niniejszym badaniu analizowano wyłącznie pełnowymiarowe elementy L1 z nienaruszoną regionem promotora. Brak takiego rozróżnienia wprowadziłby znaczne źródło szumu transkrypcyjnego pochodzącego z uciętych elementów L1. Przykłady uciętych elementów L1 w linii DU145 przedstawiono na Rysunku 3a-b, gdzie zostały one zidentyfikowane na podstawie unikalnie zmapowanych odczytów RNA-Seq. Jednak w programie IGV widać wyraźnie, że transkrypty te nie zostały zainicjowane z uciętego elementu L1, lecz wynikają z włączenia sekwencji L1 do genu lub znajdują się poniżej eksprymowanego genu.
Ogólnie w DU145 odsetek pełnowymiarowych loci L1 oraz odczytów, które po ręcznej kurateli zostają odrzucone jako autentycznie wyrażone L1, wynosi około 50% (Supplemental Table 2), co wykazuje wysoki poziom zmapowanych odczytów transkryptów L1, które bez ręcznej kurateli zostałyby zarejestrowane jako wyniki fałszywie dodatnie. Konkretnie w DU145 stwierdzono łącznie 114 pełnowymiarowych loci L1 z unikalnie zmapowanymi odczytami w kierunku sensownym, co dało łącznie 3 152 odczyty, jednak po ręcznej kurateli zidentyfikowano jedynie 60 loci wyrażanych z własnych promotorów z 1 879 odczytami (Supplemental Table 1). Ma to miejsce nawet w przypadku podjęcia kroków w celu ograniczenia ekspresji nieistotnej dla biologii L1 poprzez selekcję cytoplazmatycznego mRNA. Należy zauważyć, że locus z najwyższym poziomem zmapowanych transkryptów w DU145 zostało odrzucone, ponieważ nie było autentycznie wyrażonym L1 (Figure 4). Ogólnie liczba zmapowanych transkryptów w konkretnych loci L1 mieści się w podobnym zakresie zarówno dla loci L1 zaakceptowanych, jak i odrzuconych jako autentycznie wyrażone po ręcznej kurateli (Figure 4).
Po ręcznej kuracji liczba odczytów wykazujących unikalne mapowanie do autentycznie eksponowanych specyficznych loci L1 w linii DU145 mieści się w przedziale od 175 odczytów do arbitralnie przyjętego minimalnego progu odcięcia wynoszącego 10 odczytów (Rysunek 5). To podejście, polegające na identyfikacji odczytów transkryptów jednoznacznie zmapowanych do L1, ogranicza możliwość dokładnego ilościowego określenia ekspresji. Aby to uwzględnić, opracowano czynnik korekcyjny dla każdego locus na podstawie jego mapowalności. W celu stworzenia tego czynnika korekcyjnego, najpierw wykorzystano program bedtools do wyodrębnienia liczby jednoznacznie zmapowanych odczytów z genomowego pliku bam komórek HeLa, które wyrównały się do wszystkich pełnowymiarowych loci L1, a następnie przedstawiono te loci na wykresie w kolejności malejącej liczby zmapowanych odczytów transkryptów (dodatkowe Rycina 1). Przyjęto umownie, że elementy L1 posiadające 400 odczytów charakteryzują się pełną mapowalnością pokrycia. Liczbę odczytów możliwych do zmapowania do locus L1 w próbce sekwencjonowania genomu HeLa przeskalowano względem 400 odczytów, a następnie uzyskaną wartość przemnożono przez liczbę odczytów zmapowanych do każdego autentycznie eksprymowanego locus L1 w linii DU145 (Tabela uzupełniająca 2). Zgodnie z oczekiwaniami, elementy L1, które miały wyższe wartości korekcji mapowalności, pochodziły z młodszych podrodzin, takich jak L1PA2 (Tabela uzupełniająca 2). Po skorygowaniu odczytów o wskaźniki mapowalności (mappability scores) dla każdego locus, ilościowe oznaczenie ekspresji dla większości loci wzrosło (Rysunek 6). Liczba odczytów, które zmapowano jednoznacznie do autentycznie eksprimowanych specyficznych locus L1 z korektami mapowalności w komórkach DU145, wynosiła od 612 do 4 odczytów, przy czym nastąpiła zmiana kolejności locus od najwyższej do najniższej ekspresji (Rysunek 6).

Rycina 1: Schemat przepływu pracy.
Przedstawiono graficznie kroki służące do identyfikacji ekspresyjnych L1 w próbce ludzkiej. Należy zauważyć, że kroki 1 i 2 nie muszą być powtarzane, jeśli odpowiednie pliki są już dostępne. Pliki te można pobrać z Pliku uzupełniającego 1a-b oraz Pliku uzupełniającego 2. Pola zaznaczone na czerwono wskazują kroki, w których program bedtools coverage jest wykorzystywany do zliczania liczby odczytów mapujących się do L1 w kierunku sensownym. Loci z odczytami mapującymi się w orientacji sensownej to te L1, które powinny zostać poddane ręcznej kuracji. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rycina 2: Przykłady wyselekcjonowanych loci L1 w DU145.
Do programu IGV wczytano genom referencyjny, plik adnotacji gff dla pełnowymiarowych L1 zgodny z wersją genomu referencyjnego (Plik uzupełniający 1), plik bam dla DU145, a na koniec genomowy plik bam dla HeLa w celu oceny mapowalności; wszystkie są one dostępne na prośbę autora. Dodano strzałki, aby ułatwić wizualizację kierunku adnotowanego L1. Strzałki i odczyty w kolorze czerwonym są zorientowane w sekwencji od prawej do lewej. Strzałki i odczyty w kolorze niebieskim są zorientowane w sekwencji od lewej do prawej. a) W IGV to locus L1 wydaje się być wyrażane z własnego promotora, ponieważ w orientacji sens w obszarze powyżej 5 kb powyżej L1 nie występują żadne odczyty. Ten L1 charakteryzuje się niską mapowalnością, nie znajduje się w genie i istnieją dowody na oczekiwaną aktywność promotora antysensownego26. b) W IGV to locus L1 wydaje się być wyrażane z własnego promotora, ponieważ w orientacji sens w obszarze powyżej 5 kb powyżej L1 nie występują żadne odczyty. Ten L1 charakteryzuje się niską mapowalnością i znajduje się w obrębie genu o przeciwnym kierunku. c) W IGV to locus L1 zostało odrzucone jako wyrażane L1, ponieważ w obrębie 5 kb powyżej występują odczyty w tej samej orientacji. Ten L1 znajduje się w obrębie genu o tym samym kierunku, zatem odczyty transkryptów najprawdopodobniej pochodzą z promotora wyrażanego genu. d) W IGV to locus L1 zostało odrzucone jako wyrażane L1, ponieważ w obrębie 5 kb powyżej występują odczyty w tej samej orientacji. Ten L1 znajduje się za silnie wyrażanym genem o tym samym kierunku, zatem odczyty transkryptów najprawdopodobniej pochodzą z promotora tego wyrażanego genu i rozciągają się poza normalny terminator genu. e) W IGV to locus L1 zostało odrzucone jako wyrażane L1, ponieważ w obrębie 5 kb powyżej występują odczyty w tej samej orientacji. Ten L1 nie znajduje się w obrębie ani w pobliżu adnotowanego genu w genomie referencyjnym, zatem pochodzenie tych transkryptów wewnątrz i powyżej elementu L1 sugeruje nieadnotowany promotor. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rycina 3: Szum tła pochodzi również z przyciętych elementów L1.
Nasza adnotacja L1 nie obejmuje przyciętych elementów L1, ponieważ stanowią one główne źródło szumu tła. Dodano strzałki, aby ułatwić wizualizację kierunku adnotowanego L1. Strzałki i odczyty w kolorze niebieskim są zorientowane w sekwencji od lewej do prawej. a) Przedstawiono przykład przyciętego L1 z podrodziny L1MB5 o długości 2706 bps. W programie IGV widać, że odczyty pochodzą z przedłużenia w kierunku downstream wyrażonego genu. b) Pokazano inny przykład przyciętego L1. Ten L1 to L1PA11 o długości 4767 bps. W programie IGV widać, że odczyty mapujące się unikalnie do L1 pochodzą z wyrażonego eksonu, w którym znajduje się L1. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rycina 4: Odczyty transkryptów mapujące się unikalnie do wszystkich pełnowymiarowych, nienaruszonych L1 w ludzkim genomie, wykazujących ekspresję w linii komórkowej raka prostaty DU145.
Kolorem czarnym zaznaczono specyficzne loci zidentyfikowane jako autentycznie eksponowane po manualnej kurateli, a kolorem czerwonym specyficzne loci odrzucone jako autentyczne odczyty po manualnej kurateli. Kolorem szarym zaznaczono loci, do których mapuje się mniej niż dziesięć odczytów. Ponieważ loci te stanowią niewielką frakcję odczytów transkryptów, nie poddano ich manualnej kurateli. Znaczniki na osi x oznaczają co 100 pełnowymiarowych, nienaruszonych L1. Około 4 500 loci nie zostało przedstawionych na wykresie, ponieważ miały zero zmapowanych odczytów. Kliknij tutaj, aby zobaczyć powiększoną wersję tej ryciny.

Rycina 5: Odczyty transkrypcji mapujące się jednoznacznie do autentycznie eksponowanych, pełnowymiarowych i nienaruszonych elementów L1 w linii komórkowej raka prostaty DU145.
Przedstawiono liczbę odczytów transkrypcji mapujących się do specyficznych loci w komórkach DU145 po ręcznej kurateli. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rycina 6: Odczyty mapujące się do autentycznie ekspresyjnych L1 po korekcie o mapowalność.
Przedstawiono liczbę odczytów transkryptów skorygowaną o wyniki mapowalności specyficzne dla locus, które mapują się do ręcznie wyselekcjonowanych loci L1 w komórkach DU145. Kliknij tutaj, aby wyświetlić większą wersję tej ryciny.
Plik uzupełniający 1: Adnotacje dla pełnowymiarowych, nienaruszonych ludzkich L1s w zależności od orientacji. a) FL-L1-BLAST_RM_minus.gff. b) FL-L1-BLAST_RM_plus.gff. Kliknij tutaj, aby pobrać ten plik.
Plik uzupełniający 2: Skrypty superkomputerowe wykorzystane do automatyzacji potoku bioinformatycznego szczegółowo opisanego w sekcji 4. Aby pobrać ten plik, kliknij tutaj.
Rysunek dodatkowy 1: Próbka genomowego DNA użyta do określenia możliwości mapowania L1.
Przedstawiono liczbę odczytów transkryptów genomowych z próbki linii komórkowej HeLa, które mapują się jednoznacznie do wszystkich 5 000 pełnowymiarowych loci L1 w genomie. Przyjęto, że L1 posiada pełną możliwość mapowania pokrycia, gdy do L1 mapuje się 400 odczytów. Kliknij tutaj, aby pobrać ten rysunek.
Tabela uzupełniająca 1: Ręczna kuratela L1 w DU145. Kliknij tutaj, aby pobrać tę tabelę.
Tabela uzupełniająca 2: Wyselekcjonowane L1 w DU145 z korektą mapowalności. Kliknij tutaj, aby pobrać tę tabelę.
Wykazano, że aktywność L1 powoduje uszkodzenia genetyczne i niestabilność, przyczyniając się do choroby 27,28,29. Z około 5000 pełnometrażowych kopii L1 tylko kilkadziesiąt ewolucyjnie młodych L1 odpowiada za większość aktywności retrotranspozycyjnej2. Istnieją jednak dowody na to, że nawet niektóre starsze, niezdolne do retrotranspozycji L1 są nadal zdolne do wytwarzania białek uszkadzających DNA30. Aby w pełni docenić rolę L1 w niestabilności genomu i chorobach, należy zrozumieć ekspresję L1 na poziomie specyficznym dla locus. Jednak wysokie tło sekwencji związanych z L1 włączonych do innych RNA niezwiązanych z retrotranspozycją L1 stanowi poważne wyzwanie w interpretacji autentycznej ekspresji L1. Kolejnym wyzwaniem w identyfikacji, a tym samym zrozumieniu wzorców ekspresji poszczególnych loci L1 jest ich powtarzalny charakter, który nie pozwala na odwzorowanie wielu krótkich sekwencji odczytu na jeden unikalny locus. Aby sprostać tym wyzwaniom, opracowaliśmy opisane powyżej podejście do identyfikacji ekspresji poszczególnych loci L1 za pomocą danych RNA-Seq.
Nasze podejście filtruje wysoki poziom (ponad 99%) szumu transkrypcyjnego generowanego przez sekwencje L1, które nie są związane z retrotranspozycją L1, wykonując szereg kroków. Pierwszym krokiem jest przygotowanie cytoplazmatycznego RNA. Wybierając cytoplazmatyczne RNA, odczyty związane z L1 znajdujące się w wyrażonym intronowym mRNA w jądrze są znacznie zubożone. Kolejnym krokiem podjętym w celu zmniejszenia szumu transkrypcyjnego niezwiązanego z L1 jest wybór transkryptów poliadenylowanych. Usuwa to szum transkryptu związany z L1 występujący w gatunkach innych niż mRNA. Kolejnym krokiem jest sekwencjonowanie specyficzne dla nici w celu zidentyfikowania i wyeliminowania antysensownych transkryptów związanych z L1. Zastosowanie adnotacji dla pełnej długości L1 z funkcjonalnymi regionami promotorowymi podczas identyfikacji liczby transkryptów RNA-Seq, które mapują się na L1, eliminuje również szum tła, który w przeciwnym razie pochodzi z obciętych L1. Wreszcie, ostatnim krytycznym krokiem w eliminacji szumu transkrypcyjnego sekwencji L1 niezwiązanych z retrotranspozycją L1 jest ręczna selekcja pełnej długości L1, które zidentyfikowano jako mapowane transkrypty RNA-Seq. Ręczna selekcja polega na wizualizacji każdego bioinformatycznie zidentyfikowanego locus L1 do ekspresji w kontekście otaczającego go środowiska genomowego w celu potwierdzenia, że ekspresja pochodzi od promotora L1. Podejście to zastosowano do DU145, linii komórkowej guza prostaty. Nawet przy wszystkich krokach związanych z przygotowaniem podjętych w celu zmniejszenia szumu tła, około 50% loci L1 zidentyfikowanych bioinformacyjnie w DU145 zostało odrzuconych jako szum tła L1 pochodzący z innych źródeł transkrypcji (Figura 4), podkreślając rygor wymagany do uzyskania wiarygodnych wyników. To podejście wykorzystujące ręczną selekcję jest pracochłonne, ale niezbędne w rozwoju tego potoku w celu oceny i zrozumienia środowiska genomowego otaczającego L1 o pełnej długości. Kolejne kroki obejmują zmniejszenie ilości niezbędnej ręcznej kuracji poprzez automatyzację niektórych reguł selekcji, chociaż ze względu na wciąż nie do końca znaną naturę ekspresji genomowej, nieoznaczone źródła ekspresji w genomie referencyjnym, regiony o niskiej podatności na mapowanie, a nawet czynniki komplikujące związane z budową genomu referencyjnego, nie jest obecnie możliwe pełne zautomatyzowanie kuracji L1.
Drugie wyzwanie związane z identyfikacją ekspresji poszczególnych loci L1 za pomocą sekwencjonowania dotyczy mapowania powtarzających się transkryptów L1. W tej strategii dopasowania wymagane jest, aby transkrypt był jednoznacznie i współliniowo wyrównany z genomem referencyjnym, aby mógł zostać zmapowany. Wybierając sekwencje sparowanych końców, które mapują się zgodnie, zwiększa się liczba transkryptów, które jednoznacznie dopasowują się do loci L1 znalezionych w genomie referencyjnym. Ta unikatowa strategia mapowania zapewnia pewność wywoływania odczytów mapujących specyficznie do pojedynczego locus L1, chociaż potencjalnie zaniża ilość wyrażeń każdego zidentyfikowanego jako autentycznie wyrażonego, powtarzalnego L1. Aby w przybliżeniu skorygować to niedoszacowanie, opracowano wynik "mapowalności" dla każdego locus L1 na podstawie jego mapowalności i zastosowano go do liczby unikalnie zmapowanych odczytów transkryptu (Rysunek 6). Należy zauważyć, że idealnie byłoby, gdyby mapowalność była oceniana do odczytów pełnego pokrycia na całej długości L1 zgodnie z dopasowaną próbką WGS. Tutaj używamy WGS komórek HeLa do określenia wyników mapowalności każdego loci L1 w celu nadmuchania lub opróżnienia odczytów mapowania na loci L1 w liniach komórkowych guza prostaty DU145. To obliczenie maplakowalności jest surowym wynikiem korekcyjnym, ale wybrana "pełna mapowalność pokrycia" wynosząca 400 odczytów została określona z myślą o dynamicznej naturze linii komórek nowotworowych. Na rysunku uzupełniającym 1 można zaobserwować, że istnieje kilka loci L1 z HeLa WGS o wyjątkowo dużej liczbie zmapowanych odczytów. Prawdopodobnie pochodzą one ze zduplikowanych sekwencji chromosomów w obrębie HeLa, które nie znajdują się w genomie referencyjnym, dlatego te loci nie zostały wybrane jako reprezentatywne dla pełnego pokrycia mapowalności. Zamiast tego ustalono, że średnie pokrycie 100% odczytu występuje około 400 odczytów, zgodnie z rysunkiem uzupełniającym 1 , a następnie założono, że średnia ta dotyczy również linii komórkowej guza prostaty DU145.
Ta strategia dopasowania z odczytami 100-200 pz z technologii RNA-Seq preferencyjnie selekcjonuje również ewolucyjnie starsze L1 w genomie referencyjnym, ponieważ starsze L1 zgromadziły z czasem unikalne mutacje, które sprawiają, że są bardziej podatne na mapowanie. Podejście to ma zatem ograniczoną czułość, jeśli chodzi o identyfikację najmłodszych L1, a także niereferencyjnych, polimorficznych L1. Aby zidentyfikować najmłodszego z L1, sugerujemy użycie 5' RACE selekcji transkryptów L1 i technologii sekwencjonowania, takiej jak PacBio, która wykorzystuje dłuższe odczyty21. Pozwala to na bardziej unikalne mapowanie, a tym samym pewną identyfikację ekspresji, młodych L1. Połączenie RNA-Seq i PacBio może prowadzić do bardziej wyczerpującej listy autentycznie wyrażonych L1. Aby zidentyfikować autentycznie wyrażone polimorficzne L1, pierwsze kolejne kroki obejmują budowę i wstawienie sekwencji polimorficznych do genomu referencyjnego.
Biologiczne i techniczne wyzwania związane z badaniem powtarzających się sekwencji są ogromne, chociaż dzięki powyższej rygorystycznej procedurze usuwania szumu transkrypcyjnego sekwencji L1 niezwiązanych z retrotranspozycją przy użyciu technologii sekwencjonowania RNA, zaczynamy przesiewać duże poziomy transkrypcyjnego szumu tła i pewnie i rygorystycznie identyfikować wzorce ekspresji L1 i ilość na poziomie poszczególnych locus.
Autorzy nie mają nic do ujawnienia.
Chcielibyśmy podziękować doktorowi Yan Dongowi za komórki nowotworowe prostaty DU145. Chcielibyśmy podziękować dr Nathanowi Ungerleiderowi za jego wskazówki i rady w tworzeniu skryptów superkomputerowych. Niektóre z tych prac zostały sfinansowane z grantów NIH R01 GM121812 dla PD, R01 AG057597 dla VPB i 5TL1TR001418 dla TK. Chcielibyśmy również podziękować za wsparcie ze strony Cancer Crusaders i Tulane Cancer Center Bioinformatics Core.
| Nazwa | Firma | Numer katalogowy | Komentarze |
|---|---|---|---|
| 1 M HEPES | Affymetrix | AAJ16924AE | |
| 5 M Bioanalizator NaCl | Invitrogen | AM9760G | |
| Agilent 2100 | Agilent technologies | ||
| Zestaw Agilent RNA 6000 Nano | Agilent technologies | 5067-1511 | |
| bedtools.26.0 | https://bedtools.readthedocs.io/en/latest/content/installation.html | ||
| muszka-0.12.8 | Skrobak do https://sourceforge.net/projects/bowtie-bio/files/bowtie/0.12.8/ | ||
| komórek | Olympus plastics | 25-270 | |
| Chloroform | Fisher | C298-500 | |
| Digitonin | Research Products International Corp | 50-488-644 | |
| Etanol | Fisher | A4094 | |
| Gibco (sól fizjologiczna buforowana fosforanami) | Invitrogen | 10-010-049 | |
| Homogenizator | Thomas Scientific | BBI-8541906 | |
| IGV 2.4 | https://software.broadinstitute.org/software/igv/download | ||
| Isopropanol | Fisher | A416-500 | |
| mac2unix | https://sourceforge.net/projects/cs-cmdtools/files/mac2unix/ | ||
| Q-tips | Fisher | 23-400-122 | |
| Roztwór do usuwania RNAzyz później | Invitrogen | AM7022 | |
| RNaseZap RNase Dekontaminacja Roztwór | Invitrogen | AM9780 | |
| samtools-1.3 | https://sourceforge.net/projects/samtools/files/ | ||
| sratoolkit.2.9.2 | https://github.com/ncbi/-tools/wiki/Downloads | ||
| SUPERaza· W inhibitorze RNazy | Invitrogen | AM2694 | |
| Trizol | Invitrogen | 15-596-018 | |
| Woda (bez DNASE, RNAZY) | Fisher | BP2484100 |