5 februari 2014
Hier beschrijven we een stap-voor-stap pijpleiding genereren betrouwbare fylogenie van nucleotide-of aminozuursequentie datasets. Deze gids is bedoeld om onderzoekers of studenten nieuwe fylogenetische analyse dienen.
Het algemene doel van dit artikel is het reconstrueren van een betrouwbare fylogenetische stamboom op basis van DNA- of eiwitsequenties. Dit wordt bereikt door eerst vergelijkbare sequenties te identificeren met behulp van blast-programma's bij het NCBI. De tweede stap bestaat uit het aligneren van deze vergelijkbare sequenties.
Vervolgens wordt het best passende evolutiemodel bepaald op basis van de alignment. De laatste stap is het afleiden van de fylogenetische relatie uit de gealigneerde sequenties. Uiteindelijk wordt de stapsgewijze pipeline gebruikt om te laten zien hoe gebruikers van sequentiedata naar betrouwbare fylogenieën kunnen gaan.
Deze methode kan helpen bij het beantwoorden van kernvragen in diverse vakgebieden door de identiteit en functie van nieuwe sequenties af te leiden. Om de online versie van de basic local alignment search tool of blast te gebruiken, gaat u naar het National Center for Biotechnology Information of de NNC B'S Blast Web Server. Klik op het betreffende blast-programma.
Voer een tekstsequentie in FASTA-formaat, zoals hier getoond, in het queryveld in. Klik op het gewenste BLAST-programma voor het gebruik in de zoekopdracht en klik vervolgens op blast. De output is standaard in HTML-formaat en toont de sequenties die het meest overeenkomen met de ingevoerde tekstsequentie.
De volgende sectie behandelt het gebruik van een lokaal blast-uitvoerbaar bestand op Windows Mac. Gebruikers kunnen overspringen naar de volgende sectie met de titel Blast Local executables for Macs x. Om het blast-opdrachtregelprogramma op een Windows-machine uit te voeren, downloadt u het juiste Windows-uitvoerbare bestand van de NCBI blast-website.
Configureer na de installatie van het Blast-programma de omgevingsvariabele van de pc als volgt: klik op de startknop van de pc en klik met de rechtermuisknop op 'Deze pc'. Klik vervolgens op eigenschappen. Selecteer in het nieuwe venster geavanceerde systeeminstellingen en klik in het tabblad geavanceerd van het nieuwe pop-upvenster op de knop omgevingsvariabelen.
Klik vervolgens onder de gebruikersvariabelen voor de gebruikerssectie op de knop 'nieuw'. Voeg in het nieuwe pop-upvenster de variabelenaam path toe en de hier getoonde variabelenwaarde. Download daarna een vooraf geformatteerde blast-database, die dagelijks worden bijgewerkt vanaf de NCBI-website, of een genoom voor een specifiek organisme.
Open vervolgens een MS DOS-opdrachtprompt door op start te klikken, CMD in de zoekbalk te typen en naar de NCBI blast-map te gaan. Maak de database aan met het hier getoonde Make blast DB-commando. Maak een query-eiwitsequentie genaamd test door een eiwittekstsequentie in FASTA-formaat in de DB-map te plaatsen.
Om vervolgens de meest gelijkaardige sequenties van het testeiwit te identificeren, doorzoekt u de database via een blast P query-commando. De volgende sectie herhaalt deze informatie voor Mac-gebruikers. Windows-gebruikers kunnen direct overgaan naar sectie vijf: het genereren van meervoudige sequentie-alignments.
Om het blast command line-programma op een Mac uit te voeren, downloadt u het juiste MAC-uitvoerbare bestand door op afstand toegang te krijgen tot de N-C-B-I-F-T-P-site. Open hiervoor Finder en zoek naar Terminal; typ in het terminalvenster het FTP-adres van de N-C-B-I-F-T-P-site. Typ anonymous voor zowel de naam als het wachtwoord, en typ vervolgens CD blast slash executables slash latest.
の間 lijst de uitvoerbare bestanden op door LS te typen en download de nieuwste versie die overeenkomt met uw systeemvereisten door het volgende te typen. Decomprimeer nu de gedownloade bestanden. Voeg nu de locatie van de binaries voor het blast-uitvoerbare bestand toe aan uw pad, zodat de shell in deze directory kan zoeken.
Voor het zoeken naar commando's downloadt u een vooraf geformatteerde blast-database of een genoom van de NCBI-website. Zoek in de directory met genomen door CD genomes te typen. Download vervolgens het genoom of de sequentie van belang als volgt, en typ daarna quit om de FTP-site te verlaten.
Maak vervolgens de database door de Make Blast DB-instructie te typen. Plaats een query-sequentie in FASTA-formaat in de bin-map en raadpleeg de database met het blast P query-commando om de meest vergelijkbare sequentie bij de testsequentiegegevens te vinden; een van de veelgebruikte programma's voor multiple sequence alignment of MSA is tea coffee. Nadat de sequentiegegevens in FASTA-formaat in het query-veld op de tea coffee-site zijn ingevoerd, geeft de output vergelijkbare residuen aan via kleurcodering.
Een ander veelgebruikt MSA-programma is Clustal MSA, dat kan worden gedownload als een opdrachtregelversie, CLUSTAL W, of een grafische versie, CLUSTAL X, voor verschillende besturingssystemen. Laad vervolgens de gegevens in het Clustal-programma als een FASTA-geformatteerde sequentietekst door het tabblad 'bestand' te selecteren. Klik daarna op de knop 'sequenties laden'.
Schakel nu over naar het tabblad align en klik op de knop do complete alignment om de sequenties uit te lijnen voor een best fit-evolutiemodel. Download het programma ProtTest. Zodra ProtTest is gedownload, dubbeltikt u op ProtTest.
Zodra Protest is gestart, klikt u op 'select file' in het uitlijningsvenster om de sequentiegegevens te laden. Klik vervolgens op 'start' om het programma uit te voeren. Na voltooiing van de run geeft het programma het beste model aan op basis van de criteria voor het afleiden van sequenties.
Na het downloaden en opstarten van Phi ML, laadt u de inputsequentie als een bestand met een lip-geformatteerde sequentie door de bestandsnaam en PY in te typen. Start vervolgens het programma door y te typen. Na het downloaden van een Bayesiaans inferentieprogramma van de Mr Bays-website, start u het programma door op het uitvoerbare bestand te klikken. Lees vervolgens Nexus-geformatteerde sequentiegegevens in het programma door execute bestandsnaam punt NEX te typen.
Stel vervolgens het evolutionaire model in en selecteer het aantal generaties dat moet worden uitgevoerd. Nadat de analyse is uitgevoerd met het mc mc-commando, vat u de bomen samen met het sum T-commando om een fylogenetische stamboom te bekijken. Download het programma voor het weergeven van de stamboom.
Als laatste opmerking: er worden voortdurend nieuwe softwarepakketten uitgebracht die gericht zijn op het leveren van betere alignments, similariteitspredicties of fylogenetische bomen. Hoewel het overzicht in deze video populaire programma's behandelde, wordt de kijker aangemoedigd om aanvullende opties te verkennen. Het blast-algoritme voert lokale alignments uit, waarbij wordt gezocht naar korte sequenties van similariteit.
Nadat het algoritme alle mogelijke fragmenten uit de querysequentie heeft opgezocht en deze sequenties maximaal heeft uitgebreid, stelt het alignments samen. Voor elk paar querysequenties geeft de e-waarde een indicatie van de statistische significantie van een match. Hoe lager de E-waarde, hoe significanter de hit.
Een sequentie-alignment met een E-waarde van 0,05 betekent bijvoorbeeld dat de kans dat deze match louter op toeval berust vijf op 100 is. De BIT-score maakt gebruik van een specifieke scorematrix om aan te geven hoe goed de alignment is. Hoe hoger de BIT-score, hoe beter de alignment.
Een meervoudige sequentie-uitlijning of MSA is een sequentie-uitlijning van drie of meer primaire sequenties bestaande uit aminozuren, DNA of RNA. De output van de hier getoonde MSA tea coffee maakt gebruik van kleurcodes voor vergelijkbare residuen. Een voorbeeld van een uitlijning van zes eiwitsequenties, uitgelijnd met behulp van cluster X, wordt hier getoond voor aminozuurutlijningen.
Het programma protest wordt gebruikt om de selectie van de best passende modellen voor aminozuurvervangingen te bepalen. Binnen de gegevens vermeldt het programma de modellen terwijl ze worden geanalyseerd en toont het de beste passing na voltooiing van het programma. Phi ML schat maximum likelihood fylogenieën op basis van alignments van nucleotiden- of aminozuursequenties. Het bevat een groot aantal substitutiemodellen gekoppeld aan diverse opties om de boomtopologieruimte te doorzoeken.
Mr.Bayes maakt gebruik van Bayesiaanse CMC-inferentie over een reeks evolutionaire modellen om fylogenetische relaties te reconstrueren. Zodra het programma is gestart, kan de voortgang in specifieke intervallen worden bekeken, zoals hier wordt getoond. Wanneer er een fylogenetische boom is gegenereerd, moet de topologie worden gevisualiseerd.
In deze figuur toont het boomweergstvenster een voorbeeldboom van eiwitten uit fly.Base. De boomweerg bevat een boomeditor waarmee de gebruiker takken kan verplaatsen en bomen opnieuw kan routeren. Tijdens het uitvoeren van deze procedure is het belangrijk om de gebruikershandleidingen voor elk programma grondig door te lezen.
Dit protocol biedt een praktisch startpunt om de lezer te introduceren in de werking van deze programma's. Ik moedig de lezer echter aan om te experimenteren met en vertrouwd te raken met de vele instellingen die bij elk programma horen.
Bekijk het volledige transcript en krijg toegang tot duizenden wetenschappelijke video's
Dit artikel presenteert een stapsgewijze pipeline voor het reconstrueren van betrouwbare fylogenetische bomen op basis van DNA- of eiwitsequenties. Het is ontworpen voor onderzoekers en studenten die nieuw zijn in de fylogenetische analyse.
Fylogenetische analyse maakt targetvalidatie en mechanische risicoreductie mogelijk in de vroege ontdekkingsfase door de functionele identiteit en evolutionaire relaties van nieuwe sequenties af te leiden. Deze pipeline ondersteunt het voorspellend vertrouwen bij de identificatie van leads door de biologische context te verduidelijken en ambiguïteit bij het testen van target-hypothesen te verminderen. Het biedt een translationele brug van sequentiegegevens naar functionele annotatie, wat input levert voor portfolletriage en risico-gecorrigeerde beslissingen over verdere ontwikkeling.
De methode is geïntegreerd in het ontdekkingscontinuüm, van targetidentificatie tot lead-optimalisatie, waardoor hypothesetoetsing, biologische risicoreductie en voorspellende modellering op basis van evolutionaire relaties mogelijk worden gemaakt.