Prezentujemy publiczną stronę internetową do analizy sekwencji genomowych. Wykrywa wzorce sekwencji DNA z różnymi nielosowymi składami nukleotydów. Ten zasób generuje również losowe sekwencje o różnych poziomach złożoności.
Method Article
Prezentujemy publiczną stronę internetową do analizy sekwencji genomowych. Wykrywa wzorce sekwencji DNA z różnymi nielosowymi składami nukleotydów. Ten zasób generuje również losowe sekwencje o różnych poziomach złożoności.
Niekodujące regiony genomowe u złożonych eukariontów, w tym obszary międzygenowe, introny i nietranslowane segmenty eksonów, są głęboko nielosowe w swoim składzie nukleotydowym i składają się ze złożonej mozaiki wzorców sekwencji. Wzorce te obejmują tak zwane regiony niejednorodności średniego zakresu (MRI) - sekwencje o długości 30-10000 nukleotydów, które są wzbogacone o określoną zasadę lub kombinację zasad (np. bogatych w (G + T), bogatych w puryny itp.). Regiony MRI są związane z nietypowymi (innymi niż B) strukturami DNA, które często biorą udział w regulacji ekspresji genów, rekombinacji i innych procesów genetycznych (Fedorova i Fedorov 2010). Istnienie silnego odchylenia fiksacji w regionach MRI wobec mutacji, które mają tendencję do zmniejszania niejednorodności sekwencji, dodatkowo potwierdza funkcjonalność i znaczenie tych sekwencji genomowych (Prakash i in. 2009).
Tutaj prezentujemy swobodnie dostępny zasób internetowy -- pakiet programu Genomic MRI -- przeznaczony do analizy obliczeniowej sekwencji genomowych w celu znalezienia i scharakteryzowania różnych wzorców MRI w ich obrębie (Bechtel et al. 2008). Pakiet ten umożliwia również generowanie randomizowanych sekwencji o różnych właściwościach i poziomie zgodności z naturalnymi wejściowymi sekwencjami DNA. Głównym celem tego zasobu jest ułatwienie badania rozległych regionów niekodującego DNA, które wciąż są słabo zbadane i czekają na dokładne zbadanie i rozpoznanie.
Wszystkie użyte programy w artykule zostały napisane przy użyciu perla, a wszystkie strony internetowe zostały stworzone przy użyciu PHP.
1. Punkt wyjścia:
Otwórz stronę domową internetowego pakietu Genomic MRI pod adresem http://mco321125.meduohio.edu/~jbechtel/gmri/ . Zasób internetowy zawiera również instrukcje/wyjaśnienia dotyczące programów w linku "Help (How-to/README)", podczas gdy wszystkie opublikowane materiały na temat genomicznego rezonansu magnetycznego i podobnych algorytmów są wymienione w linku "Linki do odpowiednich zasobów".
2. Przygotowanie i przesyłanie sekwencji wejściowych.
Utwórz plik z sekwencjami w formacie FASTA, aby rozpocząć sesję analizy GMRI. Każda sekwencja nukleotydowa w tym formacie powinna być poprzedzona pojedynczym wierszem rozpoczynającym się od znaku ">" reprezentującego identyfikator, po którym w tym samym wierszu następuje krótki opis tej sekwencji. Sekwencje nukleotydowe do analizy GMRI dopuszczają również znaki takie jak R, Y, N, X itp. Niezależnie od tego, znaki inne niż A, T, C, G nie będą przetwarzane przez program i zostaną pominięte. Sekwencje, w których powtarzające się elementy zostały "zamaskowane" (zastąpione przez "N") mogą być używane jako dane wejściowe. Należy pamiętać, że w znakach sekwencji nie jest rozróżniana wielkość liter.
UWAGA: Odtąd sekwencje wejściowe są określane jako "plik użytkownika".
3. Uzyskaj rozkład częstotliwości oligonukleotydów sekwencji wejściowych (opcjonalnie).
Kliknij na zakładkę "Analizator SRI" (górny wiersz), aby uzyskać rozkład częstości oligonukleotydów dla całego zestawu sekwencji wejściowych. Akronim SRI oznacza niejednorodność krótkiego zasięgu. W tym momencie użytkownik może określić największą długość oligonukleotydów (od 2 do 9 nukleotydów, domyślnie 6 nt), dla których będą obliczane częstotliwości. Wyboru tego dokonuje się poprzez kliknięcie żądanej opcji w polu listy "Maksymalny rozmiar oligomeru". Następnie naciśnij przycisk "Analizuj plik", aby rozpocząć obliczenia. Przybliżona reprezentacja kompozycji sekwencji wejściowej natychmiast pojawi się w postaci krótkiej tabeli w środku tej strony internetowej i będzie do pobrania jako "userfile.comp.tbl". Ta tabela przedstawia tylko najwięcej i najmniej obfitych oligonukleotydów w sekwencjach wejściowych.
Cała tabela częstości dla wszystkich możliwych oligonukleotydów jest generowana jako plik o nazwie "userfile.comp", który można uzyskać za pomocą linku "Pobierz plik kompozycji".
UWAGA: Analizator SRI zlicza cały zestaw wszystkich nakładających się oligonukleotydów.
4. Generuj losowe sekwencje o takim samym składzie oligonukleotydów jak w sekwencjach wejściowych (opcjonalnie).
(Do tego zadania wymagane jest wykonanie kroku 3 protokołu).
5. Analiza niejednorodności średniego zakresu (MRI) sekwencji wejściowych i losowych.
6. Dodatkowe programy w pakiecie Genomic MRI (opcjonalnie).
Zasób Genomic MRI posiada również dwie zaawansowane opcje generowania bardzo specyficznych sekwencji losowych. Są one dostępne w zakładkach "Generator MRI" i "Generator CDS" w górnym rzędzie.
7. Reprezentatywne wyniki
Ten protokół pozwala użytkownikowi badać niejednorodność składu sekwencji nukleotydowych. Co ważne, wspiera również generowanie różnorodnych randomizowanych sekwencji o składzie oligonukleotydowym zbliżonym do sekwencji wejściowych. Zwykle sekwencje genomowe złożonych eukariontów nie są jednorodne pod względem składu, ale raczej reprezentują złożoną mozaikę segmentów sekwencji wzbogaconych o określone nukleotydy (na przykład bogate w puryny, bogate w (G + T), (A + T) itp.). Te wzorce w średniej skali zakresu (30-1000 pz) są wizualizowane przez graficzne dane wyjściowe analizatora MRI, które pokazują wybrane segmenty bogate w treść jako górne niebieskie kolce, a segmenty o niskiej zawartości jako dolne czerwone skoki (patrz rysunki 1 i 2). Zazwyczaj liczba dowolnych regionów bogatych i ubogich w treść w naturalnej sekwencji (ryc. 1) jest o rząd razy wyższa niż liczba tych samych typów regionów w odpowiednich randomizowanych sekwencjach (ryc. 2) o tym samym składzie oligonukleotydowym. Te segmenty sekwencji ze średnią niejednorodnością składu nukleotydów mogą być interesujące dla użytkownika. Są one dostępne w plikach wyjściowych Genomic MRI do dalszych badań.

Rysunek 1. Przykład graficznego wyjścia analizatora MRI z kroku 5.7. Wyniki uzyskano na próbie 44 ludzkich intronów. Niebieskie słupki reprezentują pozycje regionów bogatych w GC wzdłuż tych intronów. Czerwone słupki reprezentują regiony MRI ubogie w GC (lub bogate w AT). Oś y zawiera górny i dolny próg dla danego typu zawartości.

Rysunek 2.Wyjście analizatora MRI dla sekwencji losowej "userfile.rand1_4".
Graficzna reprezentacja MRI w sekwencji wygenerowanej losowo za pomocą programu generatora SRI.

Rysunek 3.Przykład początku tekstowego pliku wyjściowego z analizatora MRI.
Wszystkie sekwencje bogate i ubogie w treść wykryte przez program są przedstawione w ostatniej (czwartej) kolumnie. Ich względne położenie, mierzone liczbą okien, przedstawiono w pierwszej kolumnie. Druga i trzecia kolumna to wskaźniki odpowiednio dla regionów bogatych i ubogich w treść.
Regiony o niejednorodnym składzie nukleotydów w średnich skalach (30-1000 nukleotydów) są nadmierne w genomach złożonych eukariontów i można je znaleźć wszędzie (regiony międzygenowe, introny, nieulegające translacji regiony eksonów, powtarzające się elementy). Regiony te są często związane z nietypowymi konformacjami DNA. Na przykład sekwencje bogate w puryny/pirymidyny mają tendencję do tworzenia tripleksów DNA (H-DNA); sekwencje z naprzemiennymi zasadami purynowymi / pirymidynowymi są związane z konformacjami Z-DNA; Regiony bogate w (G + C) wykazują nieprawidłowości strukturalne w B-DNA i mogą być podatne na rozszczepienie kręgosłupa; Regiony bogate w (A+T) mogą tworzyć niezwykłą strukturę - element rozwijający DNA; itd. (zrecenzowane przez Fedorov & Fedorova 2010). Niektóre z tych wzorców średniego zakresu (np. regiony bogate w (G+T)) są prawie niezbadane i nadal czekają na dokładne zbadanie i rozpoznanie. Głównym celem naszego zasobu internetowego Genomic MRI jest pomoc użytkownikom w identyfikacji tych regionów MRI w celu ich dalszej analizy eksperymentalnej i zbadania ich możliwych funkcji. Wiedza na temat regionów MRI może zostać włączona do nowej generacji programów predykcyjnych genów i udoskonalić je (Shepard 2010) oraz pogłębić naszą wiedzę na temat funkcji i właściwości genomu.
Nie stwierdzono konfliktu interesów.
Jesteśmy wdzięczni Samuelowi Shepardowi, Peterowi Bazeleyowi i Johnowi Davidowi Bellowi za administrowanie stronami internetowymi Genomic MRI. Praca ta została wsparta nagrodą National Science Foundation Career Award "Badanie ról komórek intronowych" [numer grantu MCB-0643542].
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| Komputer z plikami internetowymi | |||
| z sekwencjami nukleotydowymi do badania |
Request permission to reuse the text or figures of this JoVE article
Request Permission