Artykuł metodologiczny

Sekwencjonowanie RNA nowej generacji i proces bioinformatyczny w celu identyfikacji ekspresji LINE-1 na poziomie specyficznym dla locus

11.4K wyświetleń

DOI:

10.3791/59771

19 maja 2019

W tym artykule

Podsumowanie

Tutaj prezentujemy podejście bioinformatyczne i analizy mające na celu zidentyfikowanie ekspresji LINE-1 na poziomie specyficznym dla locus.

Streszczenie

Długie Elementy-1 (LINEs/L1s) to powtarzające się elementy, które mogą kopiować i losowo wstawiać do genomu, powodując niestabilność genomu i mutagenezę. Zrozumienie wzorców ekspresji loci L1 na poziomie indywidualnym przyczyni się do zrozumienia biologii tego pierwiastka mutagennego. Ten autonomiczny element stanowi znaczną część ludzkiego genomu z ponad 500 000 kopii, choć 99% z nich jest okrojonych i wadliwych. Jednak ich obfitość i dominująca liczba wadliwych kopii utrudniają identyfikację autentycznie wyrażonych L1 na podstawie sekwencji związanych z L1 wyrażanych jako część innych genów. Trudno jest również określić, który konkretny locus L1 jest wyrażany ze względu na powtarzalny charakter elementów. Pokonując te wyzwania, przedstawiamy bioinformatyczne podejście RNA-Seq do identyfikacji ekspresji L1 na poziomie specyficznym dla locus. Podsumowując, zbieramy cytoplazmatyczne RNA, wybieramy poliadenylowane transkrypty i wykorzystujemy analizy RNA-Seq specyficzne dla nici, aby jednoznacznie zmapować odczyty do loci L1 w ludzkim genomie referencyjnym. Wizualnie dobieramy każdy locus L1 z unikalnie zmapowanymi odczytami, aby potwierdzić transkrypcję z własnego promotora i dostosować zmapowane odczyty transkryptu, aby uwzględnić mapowalność każdego pojedynczego locus L1. Podejście to zastosowano do linii komórkowej guza gruczołu krokowego, DU145, aby zademonstrować zdolność tego protokołu do wykrywania ekspresji z niewielkiej liczby pełnowymiarowych elementów L1.

Wprowadzenie

Retrotranspozony to powtarzalne elementy DNA, które mogą "przeskakiwać" w genomie w mechanizmie kopiowania i wklejania za pośrednictwem produktów pośrednich RNA. Jeden podzbiór retrotranspozonów jest znany jako Long INterspersed Elements-1 (LINEs/L1s) i stanowi jedną szóstą ludzkiego genomu z ponad 500 0000 kopii1. Pomimo ich obfitości, większość z tych kopii jest wadliwa i okrojona, a tylko około 80-120 elementów L1 uważa się za aktywne2. Pełnowymiarowy L1 ma około 6 kb długości z nietranslowanymi obszarami 5' i 3', wewnętrznym promotorem i powiązanym promotorem antysensownym, dwiema nienakładającymi się ramkami otwartego odczytu (ORF) oraz sygnałem i wielobiegunowym ogonem 3,4,5. U ludzi L1 składają się z podrodzin wyróżnionych wiekiem ewolucyjnym, przy czym starsze rodziny z czasem zgromadziły więcej unikalnych mutacji sekwencji w porównaniu z najmłodszą podrodziną, L1HS6,7. L1 są jedynymi autonomicznymi, ludzkimi retrotranspozonami, a ich ORF kodują odwrotną transkryptazę, endonukleazę i RNP z aktywnościami wiążącymi RNA i opiekuńczymi wymaganymi do retrotranspozycji i wstawienia do genomu w procesie zwanym odwrotną transkrypcją zapoczątkowaną przez cel8,9,10,11,12.

Retrotranspozycja L1s została zgłoszona jako powodująca choroby ludzkiej linii zarodkowej poprzez różne mechanizmy, w tym mutagenezę insercyjną, delecje w miejscu docelowym i rearanżacje13,14,15,16. Ostatnio wysunięto hipotezę, że L1 mogą odgrywać rolę w onkogenezie i / lub progresji nowotworu, ponieważ zaobserwowano zwiększoną ekspresję i insercję tego mutagennego pierwiastka w różnych nowotworach nabłonka17,18. Szacuje się, że na każde 200 urodzeń przypada jedno nowe wstawienie L119. Dlatego konieczne jest lepsze zrozumienie biologii aktywnie wyrażających się L1. Powtarzalność i obfitość wadliwych kopii znalezionych w transkryptach innych genów sprawiły, że ten poziom analizy jest wyzwaniem.

Na szczęście, wraz z pojawieniem się technologii sekwencjonowania o wysokiej przepustowości, poczyniono postępy w celu przeanalizowania i zidentyfikowania autentycznie wyrażających L1 na poziomie specyficznym dla locus. Istnieją różne filozofie dotyczące tego, jak najlepiej zidentyfikować ekspresję L1 za pomocą sekwencjonowania RNA nowej generacji. Zaproponowano tylko dwa rozsądne podejścia do mapowania transkryptów L1 na poziomie specyficznym dla locus. Skupia się tylko na potencjalnej transkrypcji, która odczytuje sygnał poliadenylacji L1 do sekwencji flankujących20. Nasze podejście wykorzystuje niewielkie różnice w sekwencji między elementami L1 i mapuje tylko te odczyty RNA-Seq, które jednoznacznie mapują na jeden locus21. Obie te metody mają ograniczenia w zakresie ilościowego oznaczania poziomów transkryptów. Kwantyfikacja może być potencjalnie ulepszona, dodając poprawkę na "unikalną mapowalność" każdego locus21, lub używając bardziej złożonych algorytmów, które redystrybuują odczyty z wieloma mapami, których nie można było jednoznacznie zmapować do określonego locus22. W tym miejscu szczegółowo omówimy krok po kroku ekstrakcję RNA oraz protokół sekwencjonowania i bioinformatyki nowej generacji w celu identyfikacji wyrażonych elementów L1 na poziomie specyficznym dla locus. Nasze podejście maksymalnie wykorzystuje naszą wiedzę z zakresu biologii funkcjonalnych elementów L1. Obejmuje to wiedzę, że funkcjonalne elementy L1 muszą być generowane z promotora L1, inicjowane na początku elementu L1, muszą być translowane w cytoplazmie i że ich transkrypty powinny być współliniowe z genomem. Krótko mówiąc, zbieramy świeże, cytoplazmatyczne RNA, wybieramy poliadenylowane transkrypty i wykorzystujemy analizy RNA-Seq specyficzne dla nici, aby jednoznacznie mapować odczyty do loci L1 w ludzkim genomie referencyjnym. Te wyrównane odczyty nadal wymagają obszernej ręcznej selekcji w celu określenia, czy odczyty transkrypcji pochodzą z promotora L1 przed wyznaczeniem locus jako autentycznie wyrażonego L1. Stosujemy to podejście na próbce linii komórkowej guza prostaty DU145, aby pokazać, w jaki sposób identyfikuje ona stosunkowo niewiele aktywnie transkrybowanych członków L1 z masy nieaktywnych kopii.

Protokół

1. Ekstrakcja cytoplazmatycznego RNA

  1. Uzyskaj komórki za pomocą następujących metod.
    1. Zbierz żywe komórki z kolb T-75 o splocie 2,75%–100% zlewających się.
      1. Przemyć kolbę 2 razy w 5 ml zimnego PBS, a w ostatnim płukaniu zeskrobać komórki i przenieść do stożkowej probówki o pojemności 15 ml. Wirować przez 2 minuty w temperaturze 1 000 x g i temperaturze 4 °C, a następnie ostrożnie usunąć i wyrzucić supernatant (tabela materiałów).
    2. Zbierz komórki z próbek tkanek.
      1. Przygotuj tkankę do ekstrakcji cytoplazmatycznego RNA w ciągu godziny od wycięcia i zawsze trzymaj na lodzie. Do długotrwałego przechowywania należy używać roztworów inhibitorów RNA do przechowywania tkanki do 72 godzin po sekcji zgodnie z protokołem producenta (tabela materiałów).
      2. Próbkę o objętości 10μm3 należy pokroić w kostkę i homogenizować świeżą próbkę z 5 ml zimnego PBS w sterylnym homogenizatorze z dounce, przenieść do stożkowej probówki o pojemności 15 ml, wirować przez 2 minuty przy 1 000 x g w temperaturze 4 °C, a następnie ostrożnie usunąć i wyrzucić supernatant (tabela materiałów).
  2. Dodaj 2 ml buforu do lizy do osadu komórkowego - wymieszaj i inkubuj na lodzie przez 5 minut.
    1. Przygotuj świeży bufor do lizy ze 150 mM NaCl, 50 mM HEPES (pH 7,4) i 25 μg/ml digitoniny (tabela materiałów).
    2. Ponieważ minimalne stężenie digitoniny w buforze do lizy wymagane do przeniknięcia przez błonę plazmatyczną może się różnić w zależności od typu komórki, mikroskopijnie potwierdź, że komórki potraktowane buforem do lizy tracą błonę plazmatyczną i zachowują nienaruszoną błonę jądrową.
    3. Tuż przed użyciem dodaj 1,000 U/ml inhibitora RNazy (tabela materiałów).
  3. Wirować przez 1 minutę przy 1 000 x g i temperaturze 4 °C i zebrać supernatant.
  4. Dodać supernatant do wstępnie schłodzonych 7,5 ml Trizolu i 1,5 ml chloroformu. Wszystkie czynności, które wymagają chloroformu, muszą być wykonane w czystym okapie chemicznym (Tabela materiałów).
  5. Wirować przez 35 minut przy 3,220 x g i 4 °C.
  6. Przenieś wodną część (górną warstwę) do świeżej, wstępnie schłodzonej probówki o pojemności 15 ml.
  7. Dodać 4,5 ml chloroformu i odwirować.
  8. Wirować przez 10 minut w temperaturze 3 220 x g i temperaturze 4 °C.
  9. Przenieś wodną część do świeżej, wstępnie schłodzonej probówki.
  10. Dodać 4,5 ml izopropanolu, dobrze wstrząsnąć i inkubować w temperaturze -80 °C przez noc (tabela materiałów).
  11. Wirować przy 3,220 x g i temperaturze 4 °C przez 45 minut.
  12. Usuń izopropanol, dodaj 15 ml 100% etanolu (tabela materiałów).
  13. Wirować przy 3 220 g przez 10 min.
  14. Usuń etanol, odcedź i susz przez około 1 godzinę.
    1. Użyj sterylnego bawełnianego wacika, aby usunąć pozostały etanol (Tabela materiałów).
  15. Ponownie zawiesić próbkę w 100 do 200 μl wody wolnej od RNaz w zależności od wielkości granulek (Tabela materiałów).
  16. Frakcjonowanie próbek przy użyciu technologii elektroforezy w celu określenia jakości i stężenia próbek zgodnie z instrukcjami producenta23 (Tabela materiałów).
    1. Próbki kwalifikują się do analizy RNA-Seq, jeśli RIN > 824.

2. Sekwencjonowanie nowej generacji

  1. Prześlij próbki cytoplazmatycznego RNA do sekwencjonowania przy użyciu platformy sekwencjonowania nowej generacji, której celem jest wygenerowanie co najmniej 50 milionów odczytów sparowanych końców 100 pz.
  2. Wybierz poli-adenylowane RNA i sekwencjonowanie specyficzne dla nici.

3. Tworzenie adnotacji (opcjonalnie, jeśli ktoś ma istniejącą adnotację)

  1. Utwórz pełną adnotację L1 lub pobierz pełną adnotację L1 (plik uzupełniający 1a-b).
    1. Pobierz adnotacje Repeat Masker dla elementów LINE-1 z przeglądarki genomu UCSC za pomocą narzędzia przeglądarki tabel (https://genome.ucsc.edu/cgi-bin/hgTables). Określ klad ssaków, genom człowieka, zestaw hg19 (lub hg38 dla bardziej zaktualizowanego genomu) i przefiltruj pod kątem "LINE1" w polu Nazwa klasy. Pobierz jako plik .gtf i oznacz jako FL-L1-BLAST.gtf.
    2. Przeprowadź lokalne wyszukiwanie BLAST pierwszych 300 pz pełnoziarnistego elementu L1 L1.3 obejmującego region promotora w ludzkim genomie i dodaj 6 000 pz w dół, aby utworzyć koniec współrzędnych L1 do pliku adnotacji. Zapisz w pliku gtf i oznacz jako FL-L1-RM.gtf.
    3. Przetnij adnotację RepeatMasker i adnotację L1 opartą na promotorze za pomocą bedtools i oznacz jako FL-L1-BLAST_RM.txt (pakiety oprogramowania).
      1. Użyj tego polecenia w terminalu Linux: bedtools intersect -a FL-L1-BLAST.gtf -b FL-L1-RM.gtf > FL-L1-BLAST_RM.txt.
    4. Oddziel przeciętą adnotację FL-L1 górnym i dolnym pasmem.
      1. Skopiuj FL-L1-BLAST_RM.txt do arkusza kalkulacyjnego i posortuj według nici "minus" i "plus", a następnie posortuj według lokalizacji chromosomu.
      2. Utwórz dwa nowe dokumenty arkusza kalkulacyjnego, jeden z przeciętymi współrzędnymi dla pełnej długości L1 na nitce ujemnej, a drugi na dolnym pasmie, a następnie zapisz jako FL-L1-BLAST_RM_minus.xls i FL-L1-BLAST_RM_plus.xls.
      3. Zapisz dwa nowe dokumenty jako pliki .txt.
    5. Użyj programu mac2unix, aby przekonwertować .txt pliki na poprawne pliki adnotacji (pakiety oprogramowania).
      1. Użyj tego polecenia w terminalu: mac2unix.sh FL-L1-BLAST_RM_minus.gff.
      2. Użyj tego polecenia w terminalu: mac2unix.sh FL-L1-BLAST_RM_plus.gff.
      3. Zapisz nowe pliki z rozszerzeniem .gff.
    6. Alternatywnie użyj AWK, aby filtrować wiersze skojarzone z pasmem + i –.
      1. Użyj następującego polecenia, aby uzyskać pasmo +: awk '/+/' FL-L1_BLAST_RM.gtf > FL-L1_BLAST_RM_plus.gtf.
      2. Użyj następującego wiersza poleceń, aby pobrać pasmo -: awk '/-/' FL-L1_BLAST_RM.gtf > FL-L1_BLAST_RM_minus.gtf.

4. Odczyt potoku wyrównania w celu zidentyfikowania wyrażonych L1

szt.
opcjaopis
–pZawiera szczegółowe informacje o liczbie wątków, których komputer powinien użyć podczas wyrównywania. Większa pamięć komputera pozwoli na więcej wątków i powinna być empirycznie d.
–m 1To mówi programowi, aby akceptował tylko odczyty, które mają jedno dopasowanie w genomie, które jest lepsze niż jakiekolwiek inne dopasowanie genomu.
– yJest to przełącznik tryhard, który sprawia, że mapowanie wyszukuje wszystkie możliwe dopasowania i nie pozwala na zamknięcie po osiągnięciu określonej liczby dopasowań.
–V 3Dzięki temu program może wykorzystywać pamięć tylko do zmapowanych odczytów z 3 lub mniej niezgodnościami z genomem.
–X 600Zezwala to tylko na sparowane odczyty, które są mapowane w odległości 600 baz od siebie. Dzięki temu pary odczytu są współliniowe w genomie i dokonują selekcji względem s obejmujących przetworzone cząsteczki RNA.
–Porcja MBS 8184To polecenie przydziela dodatkową pamięć do obsługi dużej liczby wyrównań możliwych dla każdego odczytu związanego z L1.

Tabela 1: Opcje wiersza poleceń dla muszki.

  1. Uruchom sekwencjonowanie sparowanych końców fastq z próbką RNA-Seq za pomocą Bowtie.
    UWAGA: Muszka1 musi być używana, a nie Muszka2, ponieważ parametry wymagane do unikalnego wyrównania można znaleźć tylko w tej wersji muszki (pakiety oprogramowania). Muszka jest używana na nakładkach uwzględniających spawy, takich jak STAR, w celu oceny zgodnych, ciągłych odczytów bardziej istotnych dla biologii i ekspresji L1.
    1. Użyj tego wiersza poleceń w terminalu Linux: bowtie -p 10 -m 1 -S -y -v 3 -X 600 --chunkmbs 8184 hg_X_Y_M_index -1 hg_sample_1.fq -2 hg_sample_2.fq | samtools view -hbuS - | samtools sort – hg_sample_sorted.bam. Zobacz Tabelę 1, aby zapoznać się z opisem opcji wiersza poleceń dla Bowtie.
  2. Pasmo oddziel wyjściowy plik bam za pomocą samtools (Software Packages) i następujących poleceń Linux. Należy pamiętać, że rzeczywiste wartości flag mogą się różnić, jeśli nie korzysta się ze standardowych protokołów sekwencjonowania nowej generacji.
    1. Użyj tego wiersza poleceń, aby wybrać dla górnej nici: samtools view -h hg_sample_sorted.bam | awk 'substr($0,1,1) == "@" || $2 == 83 || $2 == 163 {print}' | samtools view -bS - > hg_sample_sorted_topstrand.bam.
    2. Użyj tego wiersza poleceń, aby wybrać dolną nić: samtools view -h hg_sample_sorted.bam | awk 'substr($0,1,1) == "@" || $2 == 99 || $2 == 147 {print}' | samtools view -bS - > hg_sample_sorted_bottomstrand.bam.
  3. Generuj liczniki odczytów względem adnotacji dla loci L1 za pomocą bedtools (Software Packages).
    1. Użyj tego wiersza poleceń, aby wygenerować liczniki odczytów dla L1 w kierunku wyczuwania na górnym pasmie: bedtools coverage -abam FL-L1-BLAST_RM_plus.gff -b hg_sample_sorted_topstrand.bam > hg_sample_sorted_bowtie_tryhard_plus_top.txt.
    2. Użyj tego wiersza poleceń, aby wygenerować liczniki odczytów dla L1 w kierunku sensu na dolnym pasmie: bedtools coverage -abam FL-L1-BLAST_RM_minus.gff -b hg_sample_sorted_bottomstrand.bam > hg_sample_sorted_bowtie_tryhard_minus_bottom.txt.
  4. Zindeksuj plik bam z kroku 5.1.1, aby był widoczny w przeglądarce Integrative Genomics Viewer (IGV)25 (Software Packages).
    1. Użyj tego wiersza poleceń: samtools index hg_sample_sorted.bam
  5. Aby użyć trybu wsadowego w celu zwiększenia liczby próbek RNA-Seq przesyłanych jednocześnie przez instalację, należy użyć skryptu superkomputera do wykonania kroku 4.1 o nazwie human_bowtie.sh, skryptu do wykonania kroków 4.2-4.3 o nazwie human_L1_pipeline.sh, a następnie skryptu do wykonania kroku 4.4 o nazwie bam_index.sh. Skrypty te można znaleźć w pliku uzupełniającym 2 wraz z powiązanymi poleceniami superkomputera do uruchamiania skryptów.

5. Ręczna selekcja

  1. Utwórz arkusz kalkulacyjny dla odczytów zmapowanych do każdego miejsca L1 z adnotacjami.
    1. Skopiuj hg_sample_sorted_bowtie_tryhard_minus_bottom.txt utworzone w kroku 4.3.2 i oznacz stronę etykietą jako "minus-bottom".
      1. Posortuj wszystkie kolumny na podstawie od największej do najmniejszej liczby odczytów znalezionych w kolumnie J.
    2. Skopiuj ponad hg_sample_sorted_bowtie_tryhard_plus_top.txt utworzone w kroku 4.3.1 i oznaczone jako "top-plus" w innym arkuszu kalkulacyjnym.
      1. Posortuj wszystkie kolumny na podstawie od największej do najmniejszej liczby odczytów znalezionych w kolumnie J.
    3. Utwórz trzecią stronę oznaczoną jako "połączona" i dodaj wszystkie loci z dziesięcioma lub więcej odczytami ze stron "minus-dół" i "plus-góra".
      1. Posortuj wszystkie kolumny na podstawie od największej do najmniejszej liczby odczytów znalezionych w kolumnie J.
    4. Załaduj następujące pliki do IGV25 (pakiety oprogramowania): 1) genom referencyjny do wizualizacji genów z adnotacjami, 2) FL-L1-BLAST_RM.gff do wizualizacji adnotacji L1, 3) hg_sample_sorted.bam do wizualizacji zmapowanych transkryptów z próbki będącej przedmiotem zainteresowania oraz 4) hg_genomicDNA_sorted.bam do oceny możliwości mapowania regionów genomu.
    5. Usuń wiersze pokrycia i skrzyżowania skojarzone z każdym plikiem bam.
    6. Skompresuj hg_sample_sorted.bam i hg_genomicDNA_sorted.bam, aby wszystkie ścieżki IGV zmieściły się na jednym ekranie.
  2. Ręczne selekcjonowanie.
    1. Korzystając ze współrzędnych z loci wymienionych na stronie "połączonej" arkusza kalkulacyjnego, wyświetl nazwę loci w IGV25 (Software Packages).
    2. Selekcjonuj locus tak, aby był autentycznie wyrażony samodzielnie, jeśli nie ma żadnych odczytów w kierunku L1 do 5 kb.
      1. Oznacz wiersz kolorem zielonym i zwróć uwagę, dlaczego jest to autentycznie wyrażony L1.
        UWAGA: Wyjątek od tej reguły istnieje, jeśli region przed L1 nie jest mapowalny. W takim przypadku należy oznaczyć wiersz kolorem czerwonym i zwrócić uwagę, że nie można ocenić wyrażenia regionu przed promotorem L1, a zatem nie można z całą pewnością określić wyrażenia L1.
    3. Zadbaj o to, aby locus nie był autentycznie wyrażony przez własny promotor, jeśli istnieją odczyty do 5 kb.
      1. Oznacz wiersz kolorem czerwonym i zanotuj, dlaczego nie jest to autentycznie wyrażony L1.
      2. Określ locus jako fałszywy, jeśli jest wyrażony w intronie wyrażonego genu w tym samym kierunku z odczytami przed L1, jeśli znajduje się za wyrażonym genem w tym samym kierunku z odczytami przed L1 lub dla nieanotowanych wzorców ekspresji z odczytami przed L1.
        UWAGA: Wyjątek od tej reguły ma zastosowanie, gdy minimalne odczyty bezpośrednio nachodzą na miejsce startowe promotora L1, ale nieznacznie powyżej miejsca startowego L1. Jeśli nie ma innych odczytów przed przypadkiem L1, takim jak ten, należy uznać, że ten L1 jest autentycznie wyrażony. Oznacz wiersz kolorem zielonym i zanotuj, dlaczego jest to autentycznie wyrażony L1.
    4. Określ, czy locus L1 może być fałszywy, jeśli wzorzec zmapowanych odczytów do locus nie jest skorelowany z określonymi regionami mapowalności L1.
      UWAGA: Na przykład, jeśli L1 jest wysoce mapowalny, ale ma tylko stos odczytów w skondensowanym regionie w L1, jest mniej prawdopodobne, że jest związany z ekspresją L1 poza własnym promotorem, a bardziej prawdopodobne, że pochodzi ze źródeł bez adnotacji, takich jak eksony lub LTR. W takich przypadkach należy nadać loci kolor pomarańczowy i zanotować, dlaczego locus jest podejrzany. Zweryfikuj źródła podejrzanych nagromadzeń, sprawdzając lokalizację L1 w przeglądarce genomu UCSC.
    5. Zadbaj o to, aby locus nie był autentycznie wyrażany, jeśli znajduje się w środowisku genomowym sporadycznie wyrażanych regionów bez adnotacji
      UWAGA: Na przykład odczyty mogą być wyrażone 10 kb przed L1, ale mniej więcej co 10 kb są mapowane odczyty, a niektóre z tych odczytów są wyrównane z L1. Te L1 są mniej prawdopodobne, że zostaną wyrażone przez własny promotor, a bardziej prawdopodobne jest, że mają zmapowane odczyty z powodu nieopisanych wzorców ekspresji genomu. W takich przypadkach należy nadać loci kolor pomarańczowy i zanotować, dlaczego locus jest podejrzany.

6. Przeczytaj strategię dopasowania, aby ocenić mapowalność w genomie referencyjnym (opcjonalnie, jeśli posiada się istniejący zestaw danych o dopasowanym genomowym DNA)

  1. Pobierz pliki sekwencji DNA całego genomu i przekonwertuj je na pliki .fq
    1. Wejdź na stronę NCBI znajdującą się tutaj: https://www.ncbi.nlm.nih.gov/
    2. Wpisz WGS HeLa sparowany koniec.
    3. Wybierz dla Homo sapiens w obszarze Wyniki według taksonu.
    4. Wybierz próbkę, która jest sparowana na końcu i ma odczyty z 100 lub więcej pz, jak w poniższym przykładzie: https://www.ncbi.nlm.nih.gov//ERX457838[accn]
    5. Potwierdź długość odczytu, wybierając pozycję Uruchom, a następnie Metadane, jak pokazano poniżej: https://trace.ncbi.nlm.nih.gov/Traces//?run=ERR492384
    6. Aby pobrać dane sekwencji DNA całego genomu, wprowadź to polecenie w terminalu Linux: sratoolkit.2.9.2-mac64/bin/prefetch -X 100G ERR492384
      UWAGA: Funkcja pobierania z wyprzedzeniem zestawu narzędzi pobiera numer dostępu "ERR492384" znajdujący się na stronie NCBI (Pakiety oprogramowania). "100G" ogranicza ilość pobieranych danych do 100 gigabajtów.
    7. Wprowadź to polecenie w terminalu Linux: fastq-dump --split-files ERR492384
      UWAGA: Spowoduje to podzielenie pobranego zestawu danych genomowego DNA na dwa pliki fastq.
  2. Uruchom wyrównanie za pomocą muszki.
    1. Użyj tego polecenia w Linuksie do wyrównania: bowtie -p 10 -m 1 -S -y -v 3 -X 600 --chunkmbs 8184 hg_X_Y_M_index -1 hg_genomicDNA_1.fq -2 hg_genomicDNA_2.fq | samtools view -hbuS - | samtools sort – hg_genomicDNA_sorted.bam.
      1. Zapoznaj się z krokiem 4.1, aby zrozumieć parametry używane w wyrównaniu muszki (pakiety oprogramowania).
      2. Pobierz genomicznie dopasowany plik bam, aby ocenić mapowalność dostępną na żądanie autora.
  3. Zindeksuj plik bam z kroku 4.2.1 za pomocą samtools, aby był widoczny w IGV25 (Software Packages), aby dodatkowo informować o ręcznym sprawdzaniu.
    1. Użyj tego wiersza poleceń w systemie Linux: samtools index hg_genomicDNA_sorted.bam
  4. Ocena mapowalności każdego loci L1
    1. Określ liczbę unikalnie zmapowanych odczytów do loci L1 za pomocą programu bedtools, adnotacji FL-L1 i dopasowanych danych sekwencji genomowych (pakiety oprogramowania).
      1. Użyj tego wiersza poleceń w systemie Linux: bedtools coverage -abam FL-L1-BLAST_RM.gtf –b hg_genomicDNA_sorted.bam > L1_Mappability_hg_genomicDNA.txt.
    2. Oznacz locus L1 tak, aby miał pełną mapowalność pokrycia, gdy 400 unikalnych odczytów jest do niego wyrównanych.
    3. Określ czynnik wymagany do skalowania w górę lub w dół odczytów wyrównanych genomowego DNA do 400 dla każdego indywidualnego L1.
    4. Aby uzyskać skalowaną miarę ekspresji zgodnie z indywidualną mapowalnością locus L1, pomnóż czynnik określony w kroku 6.4.3 przez liczbę odczytów transkryptu RNA, które są zgodne z autentycznie wyrażonymi L1 określonymi w sekcjach 4–5.

Wyniki

Kroki opisane powyżej i opisane graficznie w Rysunek 1 został zastosowany do ludzkiej linii komórkowej guza prostaty DU145. Próbka RNA została przygotowana cytoplazmatycznie i została zsekwencjonowana nowej generacji w wybranym przez poli-A, specyficznym dla nici, sparowanym protokole. Korzystając z Bowtie, pliki sekwencjonowania sparowanych końców zostały wyrównane, umożliwiając tylko unikalne dopasowania, w których odczyt sparowanego końca lepiej pasował do jednej lokalizacji genomowej w porównaniu z jakąkolwiek inną lokalizacją genomową. Pliki sekwencji DU145 zostały dostosowane do ludzkiego genomu referencyjnego, tworząc plik bam, który jest dostępny na żądanie autora. Korzystając z narzędzi bedtools, wyodrębniono dane z plików bam rozdzielonych pasmami DU145 na temat liczby odczytów, które zostały zmapowane na pełną długość L1. Odczyty te zostały posortowane w arkuszu kalkulacyjnym od największego do najmniejszego i ręcznie wyselekcjonowane, badając środowisko genomowe wokół każdego locus L1 w IGV w celu potwierdzenia jego autentyczności (Tabela uzupełniająca 1). Jeśli próbka została wyselekcjonowana tak, aby była autentycznie wyrażona, była oznaczona kolorem zielonym z wyjaśnieniem jej akceptacji w prawej kolumnie. Przykłady loci L1 akceptowanych jako autentycznie wyrażone zgodnie z wytycznymi opisanymi w sekcji metod są pokazane w Rysunek 2a-b. Jeśli próbka została odrzucona w celu autentycznego wyrażenia, była oznaczona kolorem czerwonym z przyczyną odrzucenia w skrajnej prawej kolumnie. Przykłady loci L1 odrzuconych z powodu ekspresji przez promotor inny niż ich własny, zgodnie z wytycznymi opisanymi w sekcji metod są szczegółowo opisane w Rysunek 2c-e.

Tutaj badano tylko pełnowymiarowe L1 z nienaruszonym regionem promotora. Jeśli to rozróżnienie nie zostanie dokonane, wprowadza się duże źródło szumu transkrypcyjnego pochodzącego z obciętych L1. Przykłady obciętych L1 w DU145 są pokazane w Rysunek 3a-b, gdzie zidentyfikowano je jako mające unikalnie zmapowane odczyty RNA-Seq. W przypadku IGV wydaje się jednak, że transkrypty te nie zostały zainicjowane przez skrócony L1, ale przez włączenie sekwencji L1 do genu lub poniżej genu eksprymowanego.

Ogólnie w DU145, procent pełnowymiarowych loci L1 i odczytów, które są odrzucane jako autentycznie wyrażone L1 po ręcznym kuratorstwie, wynosi około 50% (Tabela uzupełniająca 2), co pokazuje wysoki poziom odczytów transkryptów mapowanych L1, które w przeciwnym razie zostałyby zarejestrowane jako fałszywie pozytywne bez ręcznej selekcji. W szczególności w DU145 było 114 całkowitych loci L1 o pełnej długości, które miały unikalnie zmapowane odczyty w kierunku sensu z łączną liczbą 3,152 odczytów, ale tylko 60 loci zidentyfikowano do ekspresji z własnego promotora po ręcznej selekcji z 1,879 odczytami (tabela uzupełniająca 1). Dzieje się tak nawet wtedy, gdy podjęto kroki w celu zmniejszenia ekspresji nieistotnej dla biologii L1 poprzez selekcję cytoplazmatycznego mRNA. Należy zauważyć, że locus z najwyższym poziomem zmapowanych transkryptów w DU145 został odrzucony, ponieważ nie był autentycznie wyrażonym L1 (Rysunek 4). Ogólnie rzecz biorąc, liczba zmapowanych transkryptów do określonych loci L1 waha się podobnie między zaakceptowanymi i odrzuconymi loci L1, jak autentycznie wyrażone po ręcznej selekcji (Rysunek 4).

Po ręcznym sprawdzeniu, liczba odczytów, które jednoznacznie odwzorowują na autentycznie wyrażone określone loci L1 w DU145, wynosi od 175 odczytów do arbitralnie wybranego minimum 10 odczytów (Rysunek 5). To podejście polegające na identyfikowaniu jednoznacznie zmapowanych odczytów transkrypcji na L1 ogranicza możliwość dokładnego ilościowego określenia ekspresji. Aby to uwzględnić, stworzono współczynnik korygujący dla każdego locus na podstawie jego mapowalności. Aby stworzyć ten współczynnik korekcyjny, najpierw użyto narzędzi bedtools do wyodrębnienia liczby unikalnie zmapowanych odczytów z pliku HeLa genomic bam, które były wyrównane do wszystkich pełnowymiarowych loci L1 i umieszczono je na wykresie od najwyższych do najniższych zmapowanych odczytów transkryptu (Uzupełniające Rysunek 1). Arbitralnie wyznaczono, że L1 z 400 odczytami mają pełną mapowalność pokrycia. Liczba odczytów, które można zmapować do locus L1 w próbce sekwencjonowania genomu HeLa, została przeskalowana względem 400 odczytów, a następnie ta skalowana liczba została pomnożona przez liczbę odczytów, które zostały zmapowane do każdego autentycznie wyrażonego loci L1 w DU145 (Tabela uzupełniająca 2). Zgodnie z oczekiwaniami, elementy L1, które miały większe wyniki korekcji dla mapowalności, pochodziły z młodszych podrodzin, takich jak L1PA2 (Tabela uzupełniająca 2). Po skorygowaniu odczytów o wyniki mapowalności w każdym locus, kwantyfikacja dla ekspresji dla większości loci wzrosła (Rysunek 6). Liczba odczytów, które zostały odwzorowane w sposób unikalny na autentycznie wyrażone określone loci L1 z poprawkami mapowalności w DU145, wahała się od 612 do 4 odczytów i nastąpiła zmiana kolejności najwyższych do najniższych loci ekspresji (Rysunek 6).

figure-results-1
Rysunek 1: Schemat przepływu pracy.
Graficznie opisano kroki do identyfikacji wyrażonych L1 w próbce ludzkiej. Należy pamiętać, że kroki 1 i 2 nie muszą być powtarzane, jeśli odpowiednie pliki są już dostępne. Te odpowiednie pliki można pobrać z pliku suplementu 1a-b i pliku suplementu 2. Pola w kolorze czerwonym wskazują kroki, w których używany jest program pokrycia narzędzi do zliczania liczby odczytów mapujących na L1 w tym samym kierunku zmysłów. Te loci z odczytami mapowania zorientowanego na wyczuwanie to L1, które powinny być ręcznie selekcjonowane. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

figure-results-2
Rysunek 2: Przykłady wyselekcjonowanych loci L1 w DU145.
Do IGV ładowany jest genom referencyjny, pełnowymiarowy plik adnotacji L1 gff pasujący do referencyjnej wersji genomu (plik suplementu 1), plik DU145 bam i wreszcie genomowy plik HeLa bam do oceny mapowalności, które są dostępne na żądanie autora. Strzałki zostały dodane, aby pomóc w wizualizacji kierunku adnotacji L1. Strzałki i znaki w kolorze czerwonym są zorientowane w kolejności od prawej do lewej. Strzałki i odczyty w kolorze niebieskim są zorientowane w kolejności od lewej do prawej. a) W IGV ten locus L1 wydaje się być wyrażony przez swój własny promotor, ponieważ nie ma odczytów przed L1 w orientacji sensownej przez ponad 5 kb. Ten L1 ma niską zdolność do mapowania, nie występuje w genie i ma dowody na oczekiwaną aktywność promotora antysensownego26. b) W IGV ten locus L1 wydaje się być wyrażony przez własny promotor, ponieważ nie ma odczytów przed L1 w orientacji sensownej przez ponad 5 kb. Ten L1 ma niską mapowalność i znajduje się w genie o przeciwnym kierunku. c) W IGV ten locus L1 został odrzucony jako wyrażony L1, ponieważ w ciągu 5 kb występują odczyty upstream w tej samej orientacji. Ten L1 znajduje się w genie o tym samym kierunku, więc odczyty transkryptu najprawdopodobniej pochodzą od promotora ekspresji genu. d) W IGV ten locus L1 został odrzucony jako wyrażony L1, ponieważ w ciągu 5 kb występują odczyty upstream w tej samej orientacji. Ten L1 znajduje się za genem o wysokiej ekspresji w tym samym kierunku, więc odczyty transkryptu najprawdopodobniej pochodzą od promotora tego wyrażonego genu i wykraczają poza normalny terminator genu. e) W IGV ten locus L1 został odrzucony jako wyrażony L1, ponieważ w ciągu 5 kb występują odczyty upstream w tej samej orientacji. Ten L1 nie znajduje się w obrębie ani w pobliżu anotowanego genu w genie referencyjnym, więc pochodzenie tych transkryptów w obrębie i przed elementem L1 sugeruje promotor bez adnotacji. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

figure-results-3
Ilustracja 3: szum tła również pochodzi z obciętych L1.
Nasza adnotacja L1 nie obejmuje obciętych L1, ponieważ są one głównym źródłem szumów tła. Strzałki zostały dodane, aby pomóc w wizualizacji kierunku adnotacji L1. Strzałki i odczyty w kolorze niebieskim są zorientowane w kolejności od lewej do prawej. a) Pokazano przykład obciętego L1 w rodzinie L1MB5, który wynosi 2706 bps. W przypadku IGV oczywiste jest, że odczyty pochodzą z dalszego rozszerzenia wyrażonego genu. b) Pokazany jest kolejny przykład obciętego L1. Ten L1 to L1PA11 o długości 4767 punktów bazowych. W IGV oczywiste jest, że odczyty odwzorowujące jednoznacznie do L1 pochodzą z wyrażonego eksonu, w którym znajduje się L1. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

figure-results-4
Rycina 4: Transkrypcja odczytuje tę mapę jednoznacznie do wszystkich nienaruszonych L1 o pełnej długości w ludzkim genomie ulegających ekspresji w linii komórkowej guza prostaty DU145.
W kolorze czarnym zaznaczono konkretne loci, które mają zostać zidentyfikowane jako autentycznie wyrażone po ręcznym kuratorium, a w kolorze czerwonym zaznaczono konkretne loci, które należy odrzucić jako autentycznie wyrażone odczyty po ręcznym kuratorium. W kolorze szarym znajdują się loci z mniej niż dziesięcioma odczytami odwzorowanymi na każdy. Ponieważ te loci reprezentują niewielki ułamek odczytów transkrypcji, nie były one ręcznie selekcjonowane. Znaczniki osi x oznaczają co 100 pełnowymiarowych, nienaruszonych L1. Około 4500 loci nie jest pokazanych graficznie, ponieważ nie miały one żadnych zmapowanych odczytów. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

figure-results-5
Rycina 5: Transkrypcja odczytuje, że mapa jest jednoznacznie odwzorowana na autentycznie wyrażone nienaruszone L1 o pełnej długości w linii komórkowej guza prostaty DU145.
Pokazano liczbę odczytów transkrypcji, które są mapowane na określone loci w komórkach DU145 po ręcznym kuratorowaniu. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

figure-results-6
Rysunek 6: odczytuje mapowanie do autentycznie wyrażonego L1 po dostosowaniu za pomocą mapowalności.
Pokazano liczbę odczytów transkrypcji skorygowanych przez wyniki maplikowalności specyficzne dla loci, które są mapowane na ręcznie wyselekcjonowane loci L1 w komórkach DU145. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

Plik uzupełniający 1: Adnotacje dla pełnowymiarowych, nienaruszonych ludzkich L1 zgodnie z orientacją. a) FL-L1-BLAST_RM_minus.gff. b) FL-L1-BLAST_RM_plus.gff. Kliknij tutaj, aby pobrać ten plik.

Plik uzupełniający 2: Skrypty superkomputerowe używane do automatyzacji procesu bioinformatycznego szczegółowo opisane w sekcji 4. Kliknij tutaj, aby pobrać ten plik.

Rysunek uzupełniający 1: Próbka genomowego DNA użyta do określenia możliwości mapowania L1.
Pokazano liczbę odczytanych transkryptów genomowych z próbki linii komórkowej HeLa, które odwzorowują unikalnie wszystkie 5000 pełnowymiarowych loci L1 w genomie. Wyznaczono, że L1 ma pełną mapowalność zasięgu, gdy 400 odczytuje mapę do L1. Kliknij tutaj, aby pobrać ten rysunek.

Tabela uzupełniająca 1: Ręczna selekcja L1 w DU145. Kliknij tutaj, aby pobrać tę tabelę.

Tabela uzupełniająca 2: Wyselekcjonowane L1 w DU145 z dostosowaniem mapowalności. Kliknij tutaj, aby pobrać tę tabelę.

Dyskusja

Wykazano, że aktywność L1 powoduje uszkodzenia genetyczne i niestabilność, przyczyniając się do choroby 27,28,29. Z około 5000 pełnometrażowych kopii L1 tylko kilkadziesiąt ewolucyjnie młodych L1 odpowiada za większość aktywności retrotranspozycyjnej2. Istnieją jednak dowody na to, że nawet niektóre starsze, niezdolne do retrotranspozycji L1 są nadal zdolne do wytwarzania białek uszkadzających DNA30. Aby w pełni docenić rolę L1 w niestabilności genomu i chorobach, należy zrozumieć ekspresję L1 na poziomie specyficznym dla locus. Jednak wysokie tło sekwencji związanych z L1 włączonych do innych RNA niezwiązanych z retrotranspozycją L1 stanowi poważne wyzwanie w interpretacji autentycznej ekspresji L1. Kolejnym wyzwaniem w identyfikacji, a tym samym zrozumieniu wzorców ekspresji poszczególnych loci L1 jest ich powtarzalny charakter, który nie pozwala na odwzorowanie wielu krótkich sekwencji odczytu na jeden unikalny locus. Aby sprostać tym wyzwaniom, opracowaliśmy opisane powyżej podejście do identyfikacji ekspresji poszczególnych loci L1 za pomocą danych RNA-Seq.

Nasze podejście filtruje wysoki poziom (ponad 99%) szumu transkrypcyjnego generowanego przez sekwencje L1, które nie są związane z retrotranspozycją L1, wykonując szereg kroków. Pierwszym krokiem jest przygotowanie cytoplazmatycznego RNA. Wybierając cytoplazmatyczne RNA, odczyty związane z L1 znajdujące się w wyrażonym intronowym mRNA w jądrze są znacznie zubożone. Kolejnym krokiem podjętym w celu zmniejszenia szumu transkrypcyjnego niezwiązanego z L1 jest wybór transkryptów poliadenylowanych. Usuwa to szum transkryptu związany z L1 występujący w gatunkach innych niż mRNA. Kolejnym krokiem jest sekwencjonowanie specyficzne dla nici w celu zidentyfikowania i wyeliminowania antysensownych transkryptów związanych z L1. Zastosowanie adnotacji dla pełnej długości L1 z funkcjonalnymi regionami promotorowymi podczas identyfikacji liczby transkryptów RNA-Seq, które mapują się na L1, eliminuje również szum tła, który w przeciwnym razie pochodzi z obciętych L1. Wreszcie, ostatnim krytycznym krokiem w eliminacji szumu transkrypcyjnego sekwencji L1 niezwiązanych z retrotranspozycją L1 jest ręczna selekcja pełnej długości L1, które zidentyfikowano jako mapowane transkrypty RNA-Seq. Ręczna selekcja polega na wizualizacji każdego bioinformatycznie zidentyfikowanego locus L1 do ekspresji w kontekście otaczającego go środowiska genomowego w celu potwierdzenia, że ekspresja pochodzi od promotora L1. Podejście to zastosowano do DU145, linii komórkowej guza prostaty. Nawet przy wszystkich krokach związanych z przygotowaniem podjętych w celu zmniejszenia szumu tła, około 50% loci L1 zidentyfikowanych bioinformacyjnie w DU145 zostało odrzuconych jako szum tła L1 pochodzący z innych źródeł transkrypcji (Figura 4), podkreślając rygor wymagany do uzyskania wiarygodnych wyników. To podejście wykorzystujące ręczną selekcję jest pracochłonne, ale niezbędne w rozwoju tego potoku w celu oceny i zrozumienia środowiska genomowego otaczającego L1 o pełnej długości. Kolejne kroki obejmują zmniejszenie ilości niezbędnej ręcznej kuracji poprzez automatyzację niektórych reguł selekcji, chociaż ze względu na wciąż nie do końca znaną naturę ekspresji genomowej, nieoznaczone źródła ekspresji w genomie referencyjnym, regiony o niskiej podatności na mapowanie, a nawet czynniki komplikujące związane z budową genomu referencyjnego, nie jest obecnie możliwe pełne zautomatyzowanie kuracji L1.

Drugie wyzwanie związane z identyfikacją ekspresji poszczególnych loci L1 za pomocą sekwencjonowania dotyczy mapowania powtarzających się transkryptów L1. W tej strategii dopasowania wymagane jest, aby transkrypt był jednoznacznie i współliniowo wyrównany z genomem referencyjnym, aby mógł zostać zmapowany. Wybierając sekwencje sparowanych końców, które mapują się zgodnie, zwiększa się liczba transkryptów, które jednoznacznie dopasowują się do loci L1 znalezionych w genomie referencyjnym. Ta unikatowa strategia mapowania zapewnia pewność wywoływania odczytów mapujących specyficznie do pojedynczego locus L1, chociaż potencjalnie zaniża ilość wyrażeń każdego zidentyfikowanego jako autentycznie wyrażonego, powtarzalnego L1. Aby w przybliżeniu skorygować to niedoszacowanie, opracowano wynik "mapowalności" dla każdego locus L1 na podstawie jego mapowalności i zastosowano go do liczby unikalnie zmapowanych odczytów transkryptu (Rysunek 6). Należy zauważyć, że idealnie byłoby, gdyby mapowalność była oceniana do odczytów pełnego pokrycia na całej długości L1 zgodnie z dopasowaną próbką WGS. Tutaj używamy WGS komórek HeLa do określenia wyników mapowalności każdego loci L1 w celu nadmuchania lub opróżnienia odczytów mapowania na loci L1 w liniach komórkowych guza prostaty DU145. To obliczenie maplakowalności jest surowym wynikiem korekcyjnym, ale wybrana "pełna mapowalność pokrycia" wynosząca 400 odczytów została określona z myślą o dynamicznej naturze linii komórek nowotworowych. Na rysunku uzupełniającym 1 można zaobserwować, że istnieje kilka loci L1 z HeLa WGS o wyjątkowo dużej liczbie zmapowanych odczytów. Prawdopodobnie pochodzą one ze zduplikowanych sekwencji chromosomów w obrębie HeLa, które nie znajdują się w genomie referencyjnym, dlatego te loci nie zostały wybrane jako reprezentatywne dla pełnego pokrycia mapowalności. Zamiast tego ustalono, że średnie pokrycie 100% odczytu występuje około 400 odczytów, zgodnie z rysunkiem uzupełniającym 1 , a następnie założono, że średnia ta dotyczy również linii komórkowej guza prostaty DU145.

Ta strategia dopasowania z odczytami 100-200 pz z technologii RNA-Seq preferencyjnie selekcjonuje również ewolucyjnie starsze L1 w genomie referencyjnym, ponieważ starsze L1 zgromadziły z czasem unikalne mutacje, które sprawiają, że są bardziej podatne na mapowanie. Podejście to ma zatem ograniczoną czułość, jeśli chodzi o identyfikację najmłodszych L1, a także niereferencyjnych, polimorficznych L1. Aby zidentyfikować najmłodszego z L1, sugerujemy użycie 5' RACE selekcji transkryptów L1 i technologii sekwencjonowania, takiej jak PacBio, która wykorzystuje dłuższe odczyty21. Pozwala to na bardziej unikalne mapowanie, a tym samym pewną identyfikację ekspresji, młodych L1. Połączenie RNA-Seq i PacBio może prowadzić do bardziej wyczerpującej listy autentycznie wyrażonych L1. Aby zidentyfikować autentycznie wyrażone polimorficzne L1, pierwsze kolejne kroki obejmują budowę i wstawienie sekwencji polimorficznych do genomu referencyjnego.

Biologiczne i techniczne wyzwania związane z badaniem powtarzających się sekwencji są ogromne, chociaż dzięki powyższej rygorystycznej procedurze usuwania szumu transkrypcyjnego sekwencji L1 niezwiązanych z retrotranspozycją przy użyciu technologii sekwencjonowania RNA, zaczynamy przesiewać duże poziomy transkrypcyjnego szumu tła i pewnie i rygorystycznie identyfikować wzorce ekspresji L1 i ilość na poziomie poszczególnych locus.

Oświadczenia

Autorzy nie mają nic do ujawnienia.

Podziękowania

Chcielibyśmy podziękować doktorowi Yan Dongowi za komórki nowotworowe prostaty DU145. Chcielibyśmy podziękować dr Nathanowi Ungerleiderowi za jego wskazówki i rady w tworzeniu skryptów superkomputerowych. Niektóre z tych prac zostały sfinansowane z grantów NIH R01 GM121812 dla PD, R01 AG057597 dla VPB i 5TL1TR001418 dla TK. Chcielibyśmy również podziękować za wsparcie ze strony Cancer Crusaders i Tulane Cancer Center Bioinformatics Core.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
1 M HEPESAffymetrixAAJ16924AE
5 M Bioanalizator NaClInvitrogenAM9760G
Agilent 2100Agilent technologies
Zestaw Agilent RNA 6000 NanoAgilent technologies5067-1511
bedtools.26.0https://bedtools.readthedocs.io/en/latest/content/installation.html
muszka-0.12.8Skrobak do https://sourceforge.net/projects/bowtie-bio/files/bowtie/0.12.8/
komórekOlympus plastics25-270
ChloroformFisherC298-500
DigitoninResearch Products International Corp50-488-644
EtanolFisherA4094
Gibco (sól fizjologiczna buforowana fosforanami)Invitrogen10-010-049
HomogenizatorThomas ScientificBBI-8541906
IGV 2.4https://software.broadinstitute.org/software/igv/download
IsopropanolFisherA416-500
mac2unixhttps://sourceforge.net/projects/cs-cmdtools/files/mac2unix/
Q-tipsFisher23-400-122
Roztwór do usuwania RNAzyz późniejInvitrogenAM7022
RNaseZap RNase Dekontaminacja RoztwórInvitrogenAM9780
samtools-1.3https://sourceforge.net/projects/samtools/files/
sratoolkit.2.9.2https://github.com/ncbi/-tools/wiki/Downloads
SUPERaza· W inhibitorze RNazyInvitrogenAM2694
TrizolInvitrogen15-596-018
Woda (bez DNASE, RNAZY)FisherBP2484100

Bibliografia

  1. International Human Genome Sequencing. Initial sequencing and analysis of the human genome. Nature. 409, 860(2001).
  2. Brouha, B., et al. Hot L1s account for the bulk of retrotransposition in the human population. Proceedings of the National Academy of Sciences of the United States of America. 100 (9), 5280-5285 (2003).
  3. Dombroski, B. A., Mathias, S. L., Nanthakumar, E., Scott, A. F., Kazazian, H. H. Isolation of an active human transposable element. Science. 254 (5039), 1805(1991).
  4. Swergold, G. D. Identification, characterization, and cell specificity of a human LINE-1 promoter. Molecular and Cellular Biology. 10 (12), 6718-6729 (1990).
  5. Speek, M. Antisense promoter of human L1 retrotransposon drives transcription of adjacent cellular genes. Molecular and Cellular Biology. 21 (6), 1973-1985 (2001).
  6. Deininger, L., Batzer, M. A., Hutchison, C. A., Edgell, M. H. Master genes in mammalian repetitive DNA amplification. Trends in Genetics. 8 (9), 307-311 (1992).
  7. Boissinot, S., Chevret, P., Furano, A. L1 (LINE-1) Retrotransposon Evolution and Amplification in Recent Human History. Molecular Biology and Evolution. 17 (6), 915-918 (2000).
  8. Khazina, E., Weichenrieder, O. Non-LTR retrotransposons encode noncanonical RRM domains in their first open reading frame. Proceedings of the National Academy of Sciences of the United States of America. 106 (3), 731-736 (2009).
  9. Martin, S. L., Bushman, F. D. Nucleic acid chaperone activity of the ORF1 protein from the mouse LINE-1 retrotransposon. Molecular and Cellular Biology. 21 (2), 467-475 (2001).
  10. Feng, Q., Moran, M. H., Kazazian, H. H., Boeke, J. D. Human L1 Retrotransposon Encodes a Conserved Endonuclease Required for Retrotransposition. Cell. 87 (5), 905-916 (1996).
  11. Mathias, S. L., Scott, A. F., Kazazian, H. H., Boeke, J. D., Gabriel, A. Reverse transcriptase encoded by a human transposable element. Science. 254 (5039), 1808(1991).
  12. Luan, D. D., Korman, M. H., Jakubczak, J. L., Eickbush, T. H. Reverse transcription of R2Bm RNA is primed by a nick at the chromosomal target site: A mechanism for non-LTR retrotransposition. Cell. 72 (4), 595-605 (1993).
  13. van den Hurk, J. A. J. M., et al. Novel types of mutation in the choroideremia (CHM) gene: a full-length L1 insertion and an intronic mutation activating a cryptic exon. Human Genetics. 113 (3), 268-275 (2003).
  14. Miné, M., et al. A large genomic deletion in the PDHX gene caused by the retrotranspositional insertion of a full-length LINE-1 element. Human Mutation. 28 (2), 137-142 (2007).
  15. Solyom, S., et al. Pathogenic orphan transduction created by a nonreference LINE-1 retrotransposon. Human Mutation. 33 (2), 369-371 (2012).
  16. Hancks, D. C., Kazazian, H. H. Roles for retrotransposon insertions in human disease. Mobile DNA. Mobile DNA. 7, 9-9 (2016).
  17. Tubio, J. M. C., et al. Mobile DNA in cancer. Extensive transduction of nonrepetitive DNA mediated by L1 retrotransposition in cancer genomes. Science. 345 (6196), 1251343-1251343 (2014).
  18. Ewing, A. D., et al. Widespread somatic L1 retrotransposition occurs early during gastrointestinal cancer evolution. Genome Research. 25 (10), 1536-1545 (2015).
  19. Beck, C. R., Garcia-Perez, J. L., Badge, R. M., Moran, J. V. LINE-1 elements in structural variation and disease. Annual Review of Genomics and Human Genetics. 12, 187-215 (2011).
  20. Philippe, C., et al. Activation of individual L1 retrotransposon instances is restricted to cell-type dependent permissive loci. eLife. 5, e13926(2016).
  21. Deininger, P., et al. A comprehensive approach to expression of L1 loci. Nucleic Acids Research. 45 (5), e31-e31 (2017).
  22. Jin, Y., Tam, O. H., Paniagua, E., Hammell, M. TEtranscripts: a package for including transposable elements in differential expression analysis of RNA-seq datasets. Bioinformatics. 31 (22), 3593-3599 (2015).
  23. Agilent RNA 6000 Nano Kit Guide. , Agilent. (2017).
  24. Mueller, O. L., Schroeder, A. RNA Integrity Number (RIN) –Standardization of RNA Quality Control. , Agilent Technologies. (2016).
  25. Robinson, J. T., et al. Integrative genomics viewer. Nature Biotechnology. 29, 24(2011).
  26. Speek, M. Antisense promoter of human L1 retrotransposon drives transcription of adjacent cellular genes. Molecular Cellular Biology. 21 (6), 1973-1985 (2001).
  27. Belancio, V. P., Deininger, L., Roy-Engel, A. M. LINE dancing in the human genome: transposable elements and disease. Genome Medicine. 1 (10), 97-97 (2009).
  28. Iskow, R. C., et al. Natural Mutagenesis of Human Genomes by Endogenous Retrotransposons. Cell. 141 (7), 1253-1261 (2010).
  29. Scott, E. C., et al. A hot L1 retrotransposon evades somatic repression and initiates human colorectal cancer. Genome Research. 26 (6), 745-755 (2016).
  30. Kines, K. J., Sokolowski, M., deHaro, D. L., Christian, C. M., Belancio, V. P. Potential for genomic instability associated with retrotranspositionally-incompetent L1 loci. Nucleic Acids Research. 42 (16), 10488-10502 (2014).

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Ekspresja LINE 1sekwencjonowanie RNAanaliza specyficzna dla locuselementy mobilneselekcja transkrypt w poliadenylowanychspecyficzne dla nici RNA Seqmapowanie unikalnych odczyt wmanualna kuratela locusmapowalno genomowa

Powiązane artykuły