Un abonnement JoVE est requis pour visualiser ce contenu. Connectez-vous ou commencez votre période d'essai gratuite.

Article de méthode

Une approche intégrée pour l’identification des microprotéines et l’analyse des séquences

3.4K vues

⸱

DOI :

10.3791/63841

⸱

12 juillet 2022

* These authors contributed equally

Dans cet article

Résumé

Le protocole décrit ici fournit des instructions détaillées sur la façon d’analyser les régions génomiques d’intérêt pour le potentiel de codage des microprotéines à l’aide de PhyloCSF sur le navigateur de génome convivial UCSC. En outre, plusieurs outils et ressources sont recommandés pour étudier plus avant les caractéristiques de séquence des microprotéines identifiées afin de mieux comprendre leurs fonctions putatives.

Résumé

Le séquençage de nouvelle génération (NGS) a propulsé le domaine de la génomique vers l’avant et produit des séquences de génome entier pour de nombreuses espèces animales et organismes modèles. Cependant, malgré cette richesse d’informations sur les séquences, les efforts complets d’annotation des gènes se sont avérés difficiles, en particulier pour les petites protéines. Notamment, les méthodes conventionnelles d’annotation des protéines ont été conçues pour exclure intentionnellement les protéines putatives codées par de courts cadres de lecture ouverts (sORF) de moins de 300 nucléotides de longueur afin de filtrer le nombre exponentiellement plus élevé de faux sORF non codants dans tout le génome. En conséquence, des centaines de petites protéines fonctionnelles appelées microprotéines (<100 acides aminés de longueur) ont été classées à tort comme des ARN non codants ou complètement négligées.

Ici, nous fournissons un protocole détaillé pour tirer parti d’outils bioinformatiques gratuits et accessibles au public pour interroger les régions génomiques sur le potentiel de codage des microprotéines basé sur la conservation évolutive. Plus précisément, nous fournissons des instructions étape par étape sur la façon d’examiner la conservation des séquences et le potentiel de codage à l’aide des fréquences de substitution phylogénétique du codon (PhyloCSF) sur le navigateur de génome convivial de l’Université de Californie à Santa Cruz (UCSC). De plus, nous détaillons les étapes pour générer efficacement plusieurs alignements d’espèces de séquences de microprotéines identifiées afin de visualiser la conservation des séquences d’acides aminés et recommandons des ressources pour analyser les caractéristiques des microprotéines, y compris les structures de domaine prédites. Ces outils puissants peuvent être utilisés pour aider à identifier des séquences de codage de microprotéines putatives dans des régions génomiques non canoniques ou pour exclure la présence d’une séquence codante conservée avec un potentiel translationnel dans une transcription d’intérêt non codante.

Introduction

L’identification de l’ensemble complet des éléments codants dans le génome est un objectif majeur depuis le lancement du projet du génome humain et demeure un objectif central pour la compréhension des systèmes biologiques et l’étiologie des maladies génétiques 1,2,3,4. Les progrès des techniques NGS ont conduit à la production de séquences du génome entier pour un grand nombre d’organismes, y compris les vertébrés, les invertébrés, les levures et les plantes5. De plus, les méthodes de séquençage transcriptionnel à h....

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Le protocole décrit ci-dessous détaille les étapes à suivre pour charger et naviguer dans les pistes du navigateur PhyloCSF sur le navigateur du génome UCSC (généré par Mudge et al.49). Pour des questions générales concernant le navigateur de génome UCSC, un guide complet de l’utilisateur de Genome Browser peut être trouvé ici: https://genome.ucsc.edu/goldenPath/help/hgTracksHelp.html.

1. Chargement du PhyloCSF Track Hub dans le navigateur de génome UCSC

  1. Ouvrez une fenêtre de navigateur Internet et accédez au navigateur....

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Ici, nous utiliserons la microprotéine mitoréguline validée (Mtln) comme exemple pour démontrer comment un sORF conservé générera un score PhyloCSF positif qui peut être facilement visualisé et analysé sur le navigateur de génome UCSC. La mitoréguline était auparavant annotée en tant qu’ARN non codant (anciennement ID du gène humain LINC00116 et ID du gène de la souris 1500011K16Rik). La génomique comparative et les méthodes d’analyse de conservation des séquences ont joué un rôle essentiel dans sa

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Le protocole présenté ici fournit des instructions détaillées sur la façon d’interroger les régions génomiques d’intérêt pour le potentiel de codage des microprotéines à l’aide de PhyloCSF sur le navigateur de génome convivial UCSC 48,49,50,51. Comme détaillé ci-dessus, PhyloCSF est un puissant algorithme de génomique comparative qui intègre des modèles phylogénétiques et des fréquences de subs.......

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Les auteurs déclarent qu’ils n’ont pas d’intérêts financiers concurrents.

Remerciements

Ce travail a été soutenu par des subventions des National Institutes of Health (HL-141630 et HL-160569) et de la Cincinnati Children’s Research Foundation (Trustee Award).

....

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
WebsiteWebsite AddressRequirements
Clustal Omega Multiple Sequence Alignment Toolhttps://www.ebi.ac.uk/Tools/msa/clustalo/NavigateurWebProgramme d’alignement de séquences multiples pour l’alignement efficace des séquences FASTA (c’est-à-dire pour la comparaison inter-espèces de microprotéines identifiées)
COXPRESSdbhttps://coxpresdb.jpNavigateur WebFournit des relations géniques co-régulées pour estimer les fonctions des gènes
Outils bioinformatiques EMBL-EBIFAQhttps://www.ebi.ac.uk/seqdb/confluence/display/JDSAT/Bioinformatics+Tools+FAQFoire aux questions (FAQ) sur le navigateur Web pour les outils EMBL-EBI. Comprend la clé de codage couleur pour l’alignement des séquences protéiques
Institut européen de bioinformatique (EMBL-EBI),
Outils et ressources de données
https://www.ebi.ac.uk/services/allNavigateur WebListe complète de sites Web, d’outils et de ressources de données disponibles gratuitement
Expasy - Portailsuisse de ressources bioinformatiqueshttps://www.expasy.orgWeb browserSuite d’outils et de ressources bioinformatiques pour l’analyse des séquences de protéines gérée par l’Institut suisse de bioinformatique (SIB
)National Center for Biotechnology Information (NCBI)
https://www.ncbi.nlm.nih.gov/Structure/cdd/wrpsb.cgiNavigateur WebOutil de recherche pour identifier les domaines conservés au sein de séquences de protéines ou de nucléotides codants
Pfam 35http://pfam.xfam.orgBasede données de la famille de protéines (Pfam), fournit des alignements et une classification des familles et domaines de protéines
PhyloCSF Track Hub Description https://genome.ucsc.edu/cgi-bin/hgTrackUi?hgsid=1267045267_TEc99h2oW5Q
edaCd4ir8aZ65ryaD&db=mm10
&c=chr2&g=hub_109801_
PhyloCSF_smooth
Navigateur WebDescription détaillée des traces PhyloCSF lissées et du PhyloCSF Track Hub
  ;   ;
  ;   ;
  ;   ;
  ;   ;
  ;   ;
SignalP 6.0https://services.healthtech.dtu.dk/service.php ? SignalP-6.0Webnavigateur Prédit la présence de peptides de signal et l’emplacement de leurs sites de clivage
TMHMM - 2.0https://services.healthtech.dtu.dk/service.php ? TMHMM-2.0Navigateur WebPrédiction des hélices transmembranaires dans les protéines
UCSC Genome Browser BLAT Searchhttps://genome.ucsc.edu/cgi-bin/hgBlatWeb Outilutilisé pour trouver des régions génomiques à l’aide d’informations sur les séquences d’ADN ou de protéines
UCSC Genome Browser Gatewayhttps://genome.ucsc.edu/cgi-bin/hgGatewayNavigateur WebLien direct vers l’UCSC Genome Browser Gateway
UCSC Genome Browser Accueilhttps://genome.ucsc.edu/Web browserSite web pour l’UCSC Genome
Browser UCSC Genome Browser Track Data Hubshttps://genome.ucsc.edu/cgi-bin/hgHubConnect#publicHubsNavigateur WebLien direct vers la base de données Track Data Hubs/Public Hubs pour rechercher et charger le Guide de l’utilisateur du navigateur de
génome PhyloCSF Tracks UCSChttps://genome.ucsc.edu/goldenPath/help/hgTracksHelp.htmlNavigateur WebGuide d’utilisation complet détaillant comment naviguer dans l’UCSC Genome Browser
WoLF PSORTa href="https://wolfpsort.hgc.jp">https://wolfpsort.hgc.jpWebOutil de prédiction de la localisation subcellulaire des protéines
<

Références

  1. Collins, F. S., Morgan, M., Patrinos, A. The human genome project: lessons from large-scale biology. Science. 300 (5617), 286-290 (2003).
  2. Lander, E. S., et al. Initial sequencing and analysis of the human genome. Nature. 409 (6822), 860-921 (2001).
  3. Sachidanandam, R., <....

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Étiquettes

Cadres de lecture ouverts courtsanalyse PhyloCSFnavigateur de génome UCSCalignement de séquences multiplesconservation des acides aminésannotation des ARN non codantsprédiction de la structure des domainesgénomique comparative