5 februari 2014
Hier beschrijven we een stap-voor-stap pijpleiding genereren betrouwbare fylogenie van nucleotide-of aminozuursequentie datasets. Deze gids is bedoeld om onderzoekers of studenten nieuwe fylogenetische analyse dienen.
Het algemene doel van dit artikel is om een betrouwbare fylogenetische boom te reconstrueren uit DNA- of eiwitsequenties. Dit wordt bereikt door eerst vergelijkbare sequenties te identificeren met behulp van blast-programma's bij NCBI. De tweede stap is het uitlijnen van vergelijkbare sequenties.
Vervolgens wordt het beste pasmodel van evolutie bepaald uit de uitlijning. De laatste stap is het afleiden van de fylogenetische relatie uit de uitgelijnde sequenties. Uiteindelijke is de stapsgewijze pijplijn bedoeld om te laten zien hoe gebruikers van sequentiegegevens tot betrouwbare fylogenieën kunnen komen.
Deze methode kan helpen bij het beantwoorden van belangrijke vragen in diverse vakgebieden door identiteit en functie van nieuwe sequenties af te leiden. Om de online versie van de basic local alignment search tool of blast te gebruiken, navigeer naar het National Center for Biotechnology Information of NNC B'S Blast Web Server. Klik op het juiste blast-programma.
Voer een FASTA-geformatteerde tekstsequentie zoals hier getoond in het zoekvak in. Klik op het juiste blast-programma voor gebruik in de zoekopdracht en klik vervolgens op blast. De uitvoer is standaard in HTML-formaat en toont de meest vergelijkbare sequenties met de invoer tekstsequentie.
De volgende sectie behandelt het gebruik van een lokaal blast-uitvoerbaar bestand op Windows Mac. Gebruikers kunnen naar de volgende sectie springen genaamd Blast Local executables voor Macs x. Om het blast-opdrachtregelprogramma op een Windows-machine uit te voeren, downloadt u het juiste Windows-uitvoerbare bestand van de NCBI blast-website.
Na het installeren van het Blast-programma, configureert u de pc-omgevingsvariabele als volgt, klik op de startknop van de pc en klik met de rechtermuisknop op computer. Klik vervolgens op eigenschappen. Selecteer in het nieuwe venster geavanceerde systeeminstellingen en klik in het geavanceerde tabblad van het nieuwe pop-upvenster op de knop omgevingsvariabelen.
Klik vervolgens onder de gebruikersvariabelen voor gebruikerssectie op de nieuwe knop. Voeg in het nieuwe pop-upvenster de variabelenaam pad en de variabele waarde toe zoals hier getoond. Download vervolgens een vooraf geformatteerd blast-database, die dagelijks wordt bijgewerkt vanaf de NCBI-website of een genoom voor een specifiek organisme.
Open vervolgens een MS DOS-prompt door op start te klikken en CMD in de zoekbalk te typen en verander naar de NCBI blast-map. Maak de database met behulp van de Make blast DB-opdracht die hier wordt weergegeven. Maak een query-eiwitsequentie genaamd test door een FASTA-geformatteerde eiwittekstsequentie in de DB-map in te voegen.
Vervolgens om de meest vergelijkbare sequenties voor de test-eiwit te identificeren, vraagt u de database af via een blast P query-opdracht. De volgende sectie herhaalt deze informatie voor Mac-gebruikers. Windows-gebruikers kunnen naar sectie vijf springen waarin meerdere sequentie-uitlijningen worden gegenereerd.
Om het blast-opdrachtregelprogramma op een Mac uit te voeren, downloadt u het juiste MAC-uitvoerbare bestand door op afstand toegang te krijgen tot de N-C-B-I-F-T-P-site. Om dit te doen, opent u de zoekmachine en zoekt u naar terminal in het terminalvenster, typt u het FTP-adres voor de N-C-B-I-F-T-P-site. Typ anoniem voor naam en wachtwoord en typ vervolgens CD blast slash executables slash latest.
Lijst de uitvoerbare bestanden op door LS te typen en download de nieuwste versie die voldoet aan uw systeemvereisten door het volgende te typen. Ontcomprimeer nu de gedownloade bestanden. Voeg nu de locatie van de binaries voor het blast-uitvoerbare bestand toe aan uw pad zodat de shell door deze map kan zoeken.
Wanneer u op zoek bent naar opdrachten, downloadt u een vooraf geformatteerde blast-database of een genoom vanaf de NCBI-website. Zoek in de genomes-map door CD genomes te typen. Download vervolgens het genoom of de gewenste sequentie zoals hieronder aangegeven en typ vervolgens quit om de FTP-site te verlaten.
Maak vervolgens de database door de Make Blast DB-instructie te typen. Voer een FASTA-geformatteerde querysequentie in de bin-map in en vraag de database af met de blast P query-opdracht om de meest vergelijkbare sequentie te vinden voor de testsequentiegegevens onder de meest gebruikte meerdere sequentie-uitlijningen of MSA-programma's is tea coffee. Nadat u fasta-geformatteerde sequentiegegevens in de zoekbalk op de tea coffee-site hebt ingevoerd, geeft de uitvoer vergelijkbare residuen aan door middel van kleurcodering.
Een ander veelgebruikt MSA-programma is de clusteral MSA, die kan worden gedownload als een opdrachtregelversie, CLUSTERAL W, of een grafische versie CLUSTERAL X voor verschillende besturingssystemen. Laad vervolgens de gegevens in het clusteral-programma als fast a-geformatteerde sequentietekst door het bestands tab te selecteren. Klik vervolgens op de knop sequenties laden.
Schakel nu over naar het uitlijnen tab en klik op de knop volledige uitlijning doen om de sequenties uit te lijnen voor een passend evolutiemodel. Download het protest-programma. Zodra protest is gedownload, dubbelklikt u op protest.
Zodra protest is gestart, klikt u op selecteer bestand in het uitlijningsvak om de sequentiegegevens te laden. Klik vervolgens op starten om het programma te starten. Nadat de uitvoering is voltooid, geeft het programma het beste model aan op basis van de criteria voor het afleiden van sequenties.
Nadat u Phi ML hebt gedownload en gestart, laadt u de invoersequentie als een bestand lip-geformatteerde sequentie door de bestandsnaam en PY te typen. Start vervolgens het programma door y te typen. Nadat u een Bayesiaanse afleidingenprogramma hebt gedownload van de Mr Bays-website, start u het programma door op het uitvoerbare bestand te klikken. Lees vervolgens Nexus-geformatteerde sequentiegegevens in het programma door execute bestandsnaam dot NEX te typen.
Stel vervolgens het evolutionaire model in en selecteer het aantal generaties om te draaien. Nadat u de analyse met de mc mc-opdracht hebt uitgevoerd, vat u de bomen samen met de sum T-opdracht om een fylogenetische boom te bekijken. Download het tree view-programma.
Als laatste opmerking, er zijn constant nieuwe softwarereleases gericht op het bieden van
Bekijk het volledige transcript en krijg toegang tot duizenden wetenschappelijke video's
Dit artikel presenteert een stapsgewijze pipeline voor het reconstrueren van betrouwbare fylogenetische bomen uit DNA- of eiwitsequenties. Het is ontworpen voor onderzoekers en studenten die nieuw zijn in fylogenetische analyse.
Phylogenetic analysis enables target validation and mechanistic de-risking in early discovery by inferring functional identity and evolutionary relationships of novel sequences. This pipeline supports predictive confidence in lead identification by clarifying biological context and reducing ambiguity in target hypothesis testing. It provides a translational bridge from sequence data to functional annotation, informing portfolio triage and risk-adjusted advancement decisions.
The method integrates into the discovery continuum from target identification through lead optimization, enabling hypothesis testing, biological de-risking, and predictive modeling based on evolutionary relationships.