É necessária uma assinatura do JoVE para visualizar este conteúdo. Faça login ou inicie seu teste gratuito.

Artigo de método

Uma abordagem integrada para identificação de microproteínas e análise de sequências

3.4K visualizações

DOI:

10.3791/63841

12 de julho de 2022

* These authors contributed equally

Neste artigo

Resumo

O protocolo descrito aqui fornece instruções detalhadas sobre como analisar regiões genômicas de interesse para potencial de codificação de microproteínas usando PhyloCSF no Navegador de Genoma UCSC fácil de usar. Além disso, várias ferramentas e recursos são recomendados para investigar mais as características sequenciais das microproteínas identificadas para obter informações sobre suas funções putativas.

Resumo

O sequenciamento de última geração (NGS) impulsionou o campo da genômica para a frente e produziu sequências de genomas inteiros para inúmeras espécies animais e organismos modelo. No entanto, apesar dessa riqueza de informações sequenciais, esforços abrangentes de anotação genética têm se mostrado desafiadores, especialmente para pequenas proteínas. Notavelmente, os métodos convencionais de anotação de proteínas foram projetados para excluir intencionalmente proteínas putativas codificadas por quadros de leitura aberto curtos (sORFs) com menos de 300 nucleotídeos de comprimento para filtrar o número exponencialmente maior de sORFs não codificadores espúrios em todo o genoma. Como resultado, centenas de pequenas proteínas funcionais chamadas microproteínas (<100 aminoácidos em comprimento) foram incorretamente classificadas como RNAs não codificantes ou negligenciadas inteiramente.

Aqui fornecemos um protocolo detalhado para aproveitar ferramentas bioinformáticas gratuitas e disponíveis publicamente para consultar regiões genômicas para potencial de codificação de microproteínas com base na conservação evolutiva. Especificamente, fornecemos instruções passo a passo sobre como examinar o potencial de conservação e codificação de sequências usando as Frequências de Substituição de Codon Filogenéticas (PhyloCSF) no navegador de genoma da Universidade da Califórnia Santa Cruz (UCSC). Além disso, detalhamos etapas para gerar eficientemente alinhamentos de várias espécies de sequências de microproteínas identificadas para visualizar a conservação da sequência de aminoácidos e recomendar recursos para analisar características de microproteínas, incluindo estruturas de domínio previstas. Essas ferramentas poderosas podem ser usadas para ajudar a identificar sequências putativas de codificação de microproteínas em regiões genômicas não anônicas ou para excluir a presença de uma sequência de codificação conservada com potencial translacional em uma transcrição de interesse não codificada.

Introdução

A identificação do conjunto completo de elementos de codificação no genoma tem sido um objetivo importante desde o início do Projeto Genoma Humano, e continua sendo um objetivo central para a compreensão dos sistemas biológicos e da etiologia das doenças de base genética 1,2,3,4. Os avanços nas técnicas de NGS levaram à produção de sequências de genomas inteiras para um grande número de organismos, incluindo vertebrados, invertebrados, leveduras e plantas5. Além disso, métodos de sequenciamento transcricional de alto ....

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

O protocolo descrito abaixo detalha as etapas para carregar e navegar nas faixas do navegador PhyloCSF no Navegador genoma UCSC (gerado por Mudge et al.49). Para dúvidas gerais sobre o Navegador de Genoma da UCSC, um extenso Guia do Usuário do Navegador genoma pode ser encontrado aqui: https://genome.ucsc.edu/goldenPath/help/hgTracksHelp.html.

1. Carregando o PhyloCSF Track Hub para o navegador de genoma UCSC

  1. Abra uma janela do navegador de internet e navegue até o Navegador de Genoma do UCSC (

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Aqui usaremos a mitoregulina de microproteína validada (Mtln) como exemplo para demonstrar como um sORF conservado irá gerar uma pontuação PhyloCSF positiva que pode ser facilmente visualizada e analisada no Navegador de Genoma da UCSC. Mitoregulina foi anteriormente anotada como um RNA não codificado (anteriormente iD gene humano LINC00116 e gene do rato ID 150001K16Rik). Os métodos comparativos de genômica e análise de conservação de sequências desempenharam um papel crítico em sua descoberta inicial .......

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

O protocolo aqui apresentado fornece instruções detalhadas sobre como interrogar regiões genômicas de interesse para potencial de codificação de microproteínas usando PhyloCSF no Navegador de Genoma UCSCfácil de usar 48,49,50,51. Como detalhado acima, PhyloCSF é um poderoso algoritmo de genômica comparativa que integra modelos filogenéticos e frequências de substituição de codon para identifica.......

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Os autores declaram que não têm interesses financeiros concorrentes.

Agradecimentos

Este trabalho foi apoiado por subsídios dos Institutos Nacionais de Saúde (HL-141630 e HL-160569) e da Cincinnati Children's Research Foundation (Trustee Award).

....

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
WebsiteWebsite AddressRequirements
Clustal Omega Multiple Sequence Alignment Toolhttps://www.ebi.ac.uk/Tools/msa/clustalo/Web browserPrograma de alinhamento de múltiplas sequências para o alinhamento eficiente de sequências FASTA (ou seja, para comparação entre espécies de microproteínas identificadas)
COXPRESSdbhttps://coxpresdb.jpNavegador da WebFornece relações gênicas co-reguladas para estimar as funções gênicas
Perguntas frequentes sobre ferramentas de bioinformática EMBL-EBIhttps://www.ebi.ac.uk/seqdb/confluence/display/JDSAT/Bioinformatics+Tools+FAQPerguntasfrequentes (FAQs) do navegador da Web para ferramentas EMBL-EBI. Inclui a chave de codificação de cores para alinhamentos de sequências de proteínas
Instituto Europeu de Bioinformática (EMBL-EBI),
Ferramentas e Recursos de Dados
https://www.ebi.ac.uk/services/allNavegador da WebLista abrangente de sites, ferramentas e recursos de dados disponíveis gratuitamente
Expasy - PortalSuíço de Recursos de Bioinformáticahttps://www.expasy.orgNavegadorda Web Conjunto de ferramentas e recursos de bioinformática para análise de sequência de proteínas que é mantido pelo Instituto Suíço de Bioinformática (SIB)
National Center for Biotechnology Information (NCBI)
Pesquisa
de Domínio Conservadohttps://www.ncbi.nlm.nih.gov/Structure/cdd/wrpsb.cgiNavegador da WebFerramenta de pesquisa para identificar domínios conservados dentro de sequências de nucleotídeos de proteínas ou codificantes
Pfam 35http://pfam.xfam.orgNavegador da WebBanco de dados da família de proteínas (Pfam), fornece alinhamentos e classificação de famílias e domínios de proteínas
Descrição do PhyloCSF Track Hub https://genome.ucsc.edu/cgi-bin/hgTrackUi?hgsid=1267045267_TEc99h2oW5Q
edaCd4ir8aZ65ryaD&db=mm10
&c=chr2&g=hub_109801_
PhyloCSF_smooth
Descriçãodetalhada das trilhas do PhyloCSF suavizado e do PhyloCSF Track Hub
   
   
   
   
   
SignalP 6.0https://services.healthtech.dtu.dk/service.php? SignalP-6.0Navegador da WebPrevê a presença de peptídeos de sinal e a localização de seus locais de clivagem
TMHMM - 2.0https://services.healthtech.dtu.dk/service.php? TMHMM-2.0Navegador da WebPrevisão de hélices transmembranares em proteínas
UCSC Genome Browser BLAT Searchhttps://genome.ucsc.edu/cgi-bin/hgBlatWeb browserFerramenta usada para encontrar regiões genômicas usando informações de DNA ou sequência de proteínas
UCSC Genome Browser Gatewayhttps://genome.ucsc.edu/cgi-bin/hgGatewayNavegador da WebLink direto para o UCSC Genome Browser Gateway
UCSC Genome Browser Homehttps://genome.ucsc.edu/Web browserSite inicial do UCSC Genome
Browser UCSC Genome Browser Track Data Hubshttps://genome.ucsc.edu/cgi-bin/hgHubConnect#publicHubsNavegador da WebLink direto para o banco de dados Track Data Hubs/Public Hubs para pesquisar e carregar o
genoma PhyloCSF TracksUCSChttps://genome.ucsc.edu/goldenPath/help/hgTracksHelp.htmlNavegador da WebGuia do usuário abrangente detalhando como navegar no UCSC Genome Browser
WoLF PSORTa href="https://wolfpsort.hgc.jp">https://wolfpsort.hgc.jpWeb browserFerramenta de previsão de localização subcelular de proteínas
Guia do usuário do navegador de<

Referências

  1. Collins, F. S., Morgan, M., Patrinos, A. The human genome project: lessons from large-scale biology. Science. 300 (5617), 286-290 (2003).
  2. Lander, E. S., et al. Initial sequencing and analysis of the human genome. Nature. 409 (6822), 860-921 (2001).
  3. Sachidanandam, R., <....

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Reimpressões e permissões

Etiquetas

ORF CurtasAn lise PhyloCSFNavegador de Genoma UCSCAlinhamento de M ltiplas Sequ nciasConserva o de Amino cidosAnota o de RNA N o CodificantePredi o de Estrutura de Dom niosGen mica Comparativa