February 5th, 2014
Hier beschreiben wir eine Schritt-für-Schritt-Pipeline zum Erzeugen von zuverlässigen Phylogenien von Nukleotid-oder Aminosäuresequenz Datensätze. Dieser Leitfaden soll den Forschern oder Studenten neue phylogenetische Analyse dienen.
Das übergeordnete Ziel dieses Artikels ist es, einen zuverlässigen phylogenetischen Baum aus DNA- oder Proteinsequenzen zu rekonstruieren. Dies wird erreicht, indem zunächst ähnliche Sequenzen mit Hilfe von Sprengprogrammen am NCBI identifiziert werden. Der zweite Schritt besteht darin, ähnliche Sequenzen auszurichten.
Als nächstes wird das am besten geeignete Modell der Evolution aus der Ausrichtung bestimmt. Der letzte Schritt besteht darin, die phylogenetische Beziehung aus den ausgerichteten Sequenzen abzuleiten. Letztendlich wird anhand der Schritt-für-Schritt-Pipeline gezeigt, wie Benutzer von Sequenzdaten zu zuverlässigen Phylogenien gelangen können.
Diese Methode kann helfen, Schlüsselfragen in verschiedenen Bereichen zu beantworten, indem sie Identität und Funktion auf neuartige Sequenzen ableitet. Um die Online-Version des grundlegenden lokalen Ausrichtungs-, Suchwerkzeugs oder Blast zu verwenden, navigieren Sie zum National Center for Biotechnology Information oder zum Blast-Webserver von NNC B. Klicken Sie auf das entsprechende Strahlprogramm.
Geben Sie eine FASTA-formatierte Textsequenz wie die hier gezeigte in das Abfragefeld ein. Klicken Sie auf das entsprechende Blast-Programm, das in der Suche verwendet werden soll, und klicken Sie dann auf blast. Die Ausgabe ist standardmäßig im HTML-Format und zeigt die Sequenzen an, die der Eingabetextsequenz am ähnlichsten sind.
Der nächste Abschnitt befasst sich mit der Verwendung einer lokalen ausführbaren Blast-Datei unter Windows Mac. Benutzer können zum folgenden Abschnitt springen, der als ausführbare Blast-Dateien für Macs x bezeichnet wird. Um das Blast-Befehlszeilenprogramm auf einem Windows-Rechner auszuführen, laden Sie die entsprechende ausführbare Windows-Datei von der NCBI-Blast-Website herunter.
Konfigurieren Sie nach der Installation des Blast-Programms die PC-Umgebungsvariable wie folgt, klicken Sie auf die Schaltfläche PC-Start und klicken Sie mit der rechten Maustaste auf Computer. Klicken Sie dann auf Eigenschaften. Wählen Sie im neuen Fenster die Option Erweiterte Systemeinstellungen aus und klicken Sie auf der Registerkarte Erweitert des neuen Popup-Fensters auf die Schaltfläche Umgebungsvariablen.
Klicken Sie dann im Abschnitt Benutzervariablen für Benutzer auf die Schaltfläche Neu. Fügen Sie im neuen Popup-Fenster den Variablennamen, den Pfad und den hier gezeigten Variablenwert hinzu. Laden Sie als Nächstes eine vorformatierte Blast-Datenbank herunter, die täglich von der NCBI-Website aktualisiert wird, oder ein Genom für einen bestimmten Organismus.
Öffnen Sie dann eine MS DOS-Eingabeaufforderung, indem Sie auf Start klicken, CMD in die Suchleiste eingeben und in den NCBI-Blast-Ordner wechseln. Erstellen Sie die Datenbank mit dem hier gezeigten Befehl Make blast DB. Erstellen Sie eine Abfrageproteinsequenz mit dem Namen test, indem Sie eine FASTA-formatierte Proteintextsequenz in den DB-Ordner einfügen.
Um dann die ähnlichsten Sequenzen wie das Testprotein zu identifizieren, fragen Sie die Datenbank über einen blast P-Abfragebefehl ab. Im folgenden Abschnitt werden diese Informationen für Mac-Benutzer wiederholt. Windows-Benutzer können mit Abschnitt fünf fortfahren, in dem mehrere Sequenzausrichtungen generiert werden.
Um das Blast-Befehlszeilenprogramm auf einem Mac auszuführen, laden Sie die entsprechende ausführbare MAC-Datei herunter, indem Sie aus der Ferne auf die N-C-B-I-F-T-P-Site zugreifen. Öffnen Sie dazu den Finder und suchen Sie im Terminalfenster nach Terminal, geben Sie die FTP-Adresse für die N-C-B-I-F-T-P-Site ein. Geben Sie anonymous als Name und Kennwort ein, und geben Sie dann CD blast slash executables slash latest ein.
Listen Sie die ausführbaren Dateien auf, indem Sie LS eingeben, und laden Sie die neueste Version herunter, die Ihren Systemanforderungen entspricht, indem Sie Folgendes eingeben. Dekomprimieren Sie nun die heruntergeladenen Dateien. Fügen Sie nun den Speicherort der Binärdateien für die ausführbare Blast-Datei zu Ihrem Pfad hinzu, damit die Shell dieses Verzeichnis durchsuchen kann.
Wenn Sie nach Befehlen suchen, laden Sie eine vorformatierte Blast-Datenbank oder ein Genom von der NCBI-Website herunter. Durchsuchen Sie das Genomverzeichnis, indem Sie CD-Genome eingeben. Laden Sie dann das Genom oder die Sequenz von Interesse wie folgt herunter, und geben Sie dann quit ein, um die FTP-Site zu verlassen.
Erstellen Sie als Nächstes die Datenbank, indem Sie die Make Blast DB-Anweisung eingeben. Fügen Sie eine FASTA-formatierte Abfragesequenz in den bin-Ordner ein, und fragen Sie die Datenbank mit dem Abfragebefehl blast P ab, um die Sequenz zu finden, die den Testsequenzdaten unter den häufig verwendeten Mehrfachsequenzausrichtungs- oder MSA-Programmen am ähnlichsten ist. Nach der Eingabe von fasta formatierten Sequenzdaten in das Abfragefeld an der Tee-Kaffee-Stelle zeigt die Ausgabe durch die Farbcodierung ähnliche Rückstände an.
Ein weiteres häufig verwendetes MSA-Programm ist das clusterale MSA, das als Kommandozeilenversion, CLUSTERAL W, oder als grafische Version CLUSTERAL X für verschiedene Betriebssysteme heruntergeladen werden kann. Laden Sie anschließend die Daten so schnell wie einen formatierten Sequenztext in das Cluster-Programm, indem Sie die Registerkarte Datei auswählen. Klicken Sie dann auf die Schaltfläche Ladesequenzen.
Wechseln Sie nun zur Registerkarte Ausrichten und klicken Sie auf die Schaltfläche Vollständige Ausrichtung durchführen, um die Sequenzen für ein am besten passendes Evolutionsmodell auszurichten. Laden Sie das Protestprogramm herunter. Sobald der Protest heruntergeladen wurde, doppelklicken Sie auf Protest.
Sobald der Protest gestartet ist, klicken Sie im Ausrichtungsfeld auf Datei auswählen, um die Sequenzdaten zu laden. Klicken Sie dann auf Start, um das Programm auszuführen. Nach Abschluss des Laufs gibt das Programm das beste Modell auf der Grundlage der Kriterien für die Ableitung von Sequenzen an.
Laden Sie nach dem Herunterladen und Starten von Phi ML die Eingabesequenz als Sequenz im Dateilippenformat, indem Sie den Dateinamen und PY eingeben. Starten Sie dann das Programm, indem Sie y eingeben. Nachdem Sie ein Bayes'sches Inferenzprogramm von der Mr Bays-Website heruntergeladen haben, starten Sie das Programm, indem Sie auf die ausführbare Datei klicken. Lesen Sie dann die Nexus-formatierten Sequenzdaten in das Programm ein, indem Sie den Ausführungsdateinamen dot NEX eingeben.
Legen Sie als Nächstes das Evolutionsmodell fest und wählen Sie die Anzahl der auszuführenden Generationen aus. Nachdem Sie die Analyse mit dem Befehl mc mc ausgeführt haben, fassen Sie die Bäume mit dem Befehl sum T zusammen, um einen phylogenetischen Baum anzuzeigen. Laden Sie das Programm zur Baumansicht herunter.
Abschließend möchte ich darauf hinweisen, dass ständig neue Software veröffentlicht wird, die darauf abzielt, bessere Ausrichtungen, Ähnlichkeitsvorhersagen oder phylogenetische Bäume zu ermöglichen. Während der Überblick in diesem Video beliebte Programme abdeckte, wird der Zuschauer ermutigt, zusätzliche Optionen zu erkunden. Der Blast-Algorithmus führt lokale Alignments durch, d. h. sucht nach kurzen Abschnitten mit Sequenzähnlichkeit.
Nachdem der Algorithmus alle möglichen Strecken aus der Abfragesequenz nachgeschlagen und diese Sequenzen maximal erweitert hat, setzt er Alignments zusammen. Für jedes Abfragesequenzpaar gibt der e-Wert einen Hinweis auf die statistische Signifikanz für eine Übereinstimmung. Je niedriger der E-Wert, desto signifikanter der Treffer.
Eine Sequenzausrichtung mit einem E-Wert von 0,05 bedeutet beispielsweise, dass die Wahrscheinlichkeit, dass diese Übereinstimmung allein zufällig auftritt, fünf zu 100 beträgt. Die BIT-Punktzahl verwendet eine bestimmte Bewertungsmatrix, um einen Hinweis darauf zu geben, wie gut die Ausrichtung ist. Je höher die BIT-Punktzahl, desto besser die Ausrichtung.
Ein Multiple Sequence Alignment (MSA) ist ein Sequenzalignment von drei oder mehr primären Sequenzen, die aus Aminosäuren, DNA oder RNA bestehen. Die Ausgabe des MSA-Teekaffees, die hier zu sehen ist, kodiert ähnliche Rückstände farblich. Hier ist ein Probenalignment von sechs Proteinsequenzen, die mit Cluster X ausgerichtet wurden, für Aminosäure-Alignments dargestellt.
Das Programm Protest wird verwendet, um die Auswahl der am besten geeigneten Modelle für Aminosäureersatz zu bestimmen. Innerhalb der Daten listet das Programm die Modelle auf, während sie analysiert werden, und zeigt die beste Anpassung nach Abschluss des Programms an, Phi ML schätzt Maximum-Likelihood-Phylogenien aus Alignments von Nukleotid- oder Aminosäuresequenzen. Es enthält eine große Anzahl von Substitutionsmodellen, die mit verschiedenen Optionen zum Durchsuchen des Baumtopologieraums gekoppelt sind.
Herr Bayes nutzt die Bayes'sche CMC-Inferenz in einer Reihe von Evolutionsmodellen, um phylogenetische Beziehungen zu rekonstruieren. Sobald das Programm ausgeführt wird, kann der Fortschritt in bestimmten Intervallen angezeigt werden, wie hier gezeigt. Sobald ein phylogenetischer Baum generiert ist, muss die Topologie visualisiert werden.
In dieser Abbildung zeigt das Baumansichtsfenster einen Beispielbaum von Proteinen aus der Fliege an. Basis. Die Baumansicht enthält einen Baumeditor, der es dem Benutzer ermöglicht, Äste zu verschieben und Bäume umzuleiten. Wenn Sie dieses Verfahren versuchen, ist es wichtig, daran zu denken, die Benutzerhandbücher für jedes Programm gründlich zu lesen.
Dieses Protokoll bietet einen praktischen Ausgangspunkt, um den Leser in die Funktionsweise dieser Programme einzuführen. Ich ermutige den Leser jedoch, mit den vielen Einstellungen, die mit jedem Programm verbunden sind, herumzuspielen und sich mit ihnen vertraut zu machen.
View the full transcript and gain access to thousands of scientific videos
Dieser Artikel präsentiert eine Schritt-für-Schritt-Pipeline zur Rekonstruktion zuverlässiger phylogenetischer Bäume aus DNA- oder Proteinsequenzen. Er ist für Forscher und Studierende konzipiert, die neu in der phylogenetischen Analyse sind.
Phylogenetic analysis enables target validation and mechanistic de-risking in early discovery by inferring functional identity and evolutionary relationships of novel sequences. This pipeline supports predictive confidence in lead identification by clarifying biological context and reducing ambiguity in target hypothesis testing. It provides a translational bridge from sequence data to functional annotation, informing portfolio triage and risk-adjusted advancement decisions.
The method integrates into the discovery continuum from target identification through lead optimization, enabling hypothesis testing, biological de-risking, and predictive modeling based on evolutionary relationships.