2014年2月5日
ここでは、ヌクレオチドまたはアミノ酸配列データセットから信頼性の高い系統発生を生成するためのステップバイステップのパイプラインを説明します。このガイドでは、研究者や系統解析に新たな学生にサービスを提供することを目指しています。
この記事の全体的な目標は、DNAまたはタンパク質配列から信頼性の高い系統樹を再構築することです。これは、まずNCBIのブラストプログラムを使用して類似の配列を同定することによって達成されます。2 番目のステップは、類似したシーケンスを整列させることです。
次に、アラインメントから進化の最適なモデルが決定されます。最後のステップは、整列した配列から系統関係を推測することです。最終的に、ステップバイステップのパイプラインを使用して、ユーザーが配列データから信頼性の高い系統発生に移行する方法を示します。
この手法は、新しい配列の同一性と機能を推測することにより、さまざまな分野の重要な質問に答えるのに役立ちます。基本的なローカルアライメント検索ツールまたはブラストのオンラインバージョンを使用するには、National Center for Biotechnology InformationまたはNNC B'S Blast Web Serverに移動します。適切なブラストプログラムをクリックします。
ここに示すような FASTA 形式のテキスト シーケンスをクエリ ボックスに入力します。検索に使用する適切なブラストプログラムをクリックし、[ブラスト]をクリックします。出力はデフォルトでHTML形式であり、入力テキストシーケンスに最も類似したシーケンスが表示されます。
次のセクションでは、Windows Mac での Local Blast 実行可能ファイルの使用について説明します。ユーザーは、次のセクション「Blast Local executables for Macs x」にスキップできます。Windows マシンで blast コマンドラインプログラムを実行するには、NCBI blast Web サイトから適切な Windows 実行可能ファイルをダウンロードします。
Blastプログラムをインストールした後、PC環境変数を次のように構成し、PCのスタートボタンをクリックしてコンピューターを右クリックします。次に、[プロパティ] をクリックします。新しいウィンドウで、システムの詳細設定を選択し、新しいポップアップの詳細設定タブで、環境変数ボタンをクリックします。
次に、[user のユーザー変数] セクションで、[新規] ボタンをクリックします。新しいポップアップで、変数名のパスと、ここに示す変数値を追加します。次に、NCBIのウェブサイトまたは特定の生物のゲノムから毎日更新される、事前にフォーマットされたblastデータベースをダウンロードします。
次に、[スタート]をクリックしてMS DOSプロンプトを開き、検索バーに「CMD」と入力して、NCBIブラストフォルダに変更します。次に示す Make blast DB コマンドを使用してデータベースを作成します。DBフォルダにFASTA形式のタンパク質テキスト配列を挿入して、testというクエリタンパク質配列を作成します。
次に、試験タンパク質に最も類似した配列を同定するために、blast Pクエリコマンドでデータベースを調査します。次のセクションでは、Macユーザー向けにこの情報を繰り返します。Windows ユーザーは、セクション 5 にスキップして複数のシーケンス アラインメントを生成できます。
Mac で blast コマンドラインプログラムを実行するには、N-C-B-I-F-T-P サイトにリモートアクセスして、適切な MAC 実行可能ファイルをダウンロードします。これを行うには、ファインダーを開き、ターミナルウィンドウでターミナルを検索し、N-C-B-I-F-T-PサイトのFTPアドレスを入力します。名前とパスワードに「anonymous」と入力し、「CD blast slash executables slash latest」と入力します。
LSと入力して実行可能ファイルを一覧表示し、次のように入力してシステム要件に一致する最新バージョンをダウンロードします。次に、ダウンロードしたファイルを解凍します。次に、blast実行可能ファイルのバイナリの場所をパスに追加して、シェルがこのディレクトリを検索できるようにします。
コマンドを探すときは、NCBIのWebサイトから事前にフォーマットされたblastデータベースまたはゲノムをダウンロードしてください。「CD genomes」と入力して、ゲノムディレクトリを検索します。次に、次のように目的のゲノムまたは配列をダウンロードし、「quit」と入力してFTPサイトを終了します。
次に、Make Blast DB 命令を入力してデータベースを作成します。FASTA形式のクエリシーケンスをbinフォルダに挿入し、blast Pクエリコマンドを使用してデータベースに問い合わせ、一般的に使用されるマルチプルシーケンスアラインメントまたはMSAプログラムの中で最もテストシーケンスデータに類似したシーケンスを見つけます。fasta 形式の配列データを tea coffee サイトのクエリ ボックスに入力すると、色分けによって同様の残渣が出力されます。
もう 1 つの一般的に使用される MSA プログラムは、コマンド ライン バージョンの CLUSTERAL W、またはさまざまなオペレーティング システム用のグラフィカル バージョンの CLUSTERAL X としてダウンロードできる clusteral MSA です。次に、[ファイル] タブを選択して、書式設定されたシーケンス テキストと同じ速さでデータをクラスター プログラムに読み込みます。次に、ロードシーケンスボタンをクリックします。
次に、アラインメントタブに切り替えて、完全なアラインメントを行うボタンをクリックして、進化の最適なモデルのためにシーケンスをアラインメントします。抗議プログラムをダウンロードします。抗議がダウンロードされたら、抗議をダブルクリックします。
抗議が開始されたら、アライメントボックスのselect fileをクリックして配列データをロードします。次に、[開始]をクリックしてプログラムを実行します。実行が完了すると、プログラムはシーケンスを推論するための基準に基づいて最適なモデルを示します。
Phi MLをダウンロードして起動した後、ファイル名とPYを入力して、入力シーケンスをファイルリップ形式のシーケンスとして読み込みます。次に、「y」と入力してプログラムを起動します。Mr Bays の Web サイトからベイズ推論プログラムをダウンロードした後、実行可能ファイルをクリックしてプログラムを起動します。次に、Nexus形式のシーケンスデータを、ファイル名dot NEXを入力してプログラムに読み込みます。
次に、進化モデルを設定し、実行する世代数を選択します。mc mc コマンドで解析を実行した後、sum T コマンドを使用してツリーを要約し、系統樹を表示します。ツリービュープログラムをダウンロードします。
最後に、より優れたアラインメント、類似性予測、または系統樹を提供することを目的とした新しいソフトウェアが絶えずリリースされています。このビデオの概要では人気のあるプログラムについて説明していますが、視聴者は追加のオプションを検討することをお勧めします。blast アルゴリズムは、短い配列の類似性を検索するローカルアラインメントを実行します。
アルゴリズムは、クエリ シーケンスから可能なすべてのストレッチを検索し、これらのシーケンスを最大限に拡張した後、アラインメントをアセンブルします。各クエリ シーケンス ペアについて、e 値は一致の統計的有意性を示します。E 値が小さいほど、ヒットの有意性が高くなります。
たとえば、E 値が 0.05 のシーケンス アラインメントは、この一致が偶然に発生する可能性が 100 分の 5 であることを意味します。BITスコアは、特定のスコアリングマトリックスを使用して、アライメントがどの程度優れているかを示します。BITスコアが高いほど、アライメントが良好です。
マルチプルシーケンシングアラインメント(MSA)は、アミノ酸、DNA、またはRNAで構成される3つ以上の一次配列のシーケンシングです。ここで見られるMSAティーコーヒーからの出力は、同様の残留物を色分けしています。ここでは、クラスターXを使用してアラインメントされた6つのタンパク質配列のサンプルアラインメントを、アミノ酸のアラインメントについて示しています。
このプログラムの抗議は、アミノ酸代替品の最適なモデルの選択を決定するために使用されます。データ内で、プログラムは分析中のモデルをリストアップし、プログラムの完了後に最適なモデルを表示し、Phi MLはヌクレオチドまたはアミノ酸配列のアラインメントから最尤系統を推定します。これは、ツリートポロジ空間を検索するためのさまざまなオプションに結合された多数の置換モデルを組み込んでいます。
ベイズ氏は、多くの進化モデルにわたるベイズCMC推論を利用して、系統発生的関係を再構築します。プログラムが実行されると、ここに示すように、進行状況を特定の間隔で表示することができます。系統樹が生成されたら、トポロジを視覚化する必要があります。
この図では、ツリービューウィンドウにハエのタンパク質のサンプルツリーが表示されています。基。ツリービューには、ユーザーがブランチを移動したり、ツリーを再ルーティングしたりできるツリーエディタが含まれています。この手順を試行するときは、各プログラムのユーザーガイドをよく読むことを忘れないでください。
このプロトコルは、これらのプログラムがどのように機能するかについて読者に紹介するための実用的な出発点を提供します。ただし、読者には、各プログラムに関連する多くの設定を試して、詳しく知ることをお勧めします。
完全なトランスクリプトを表示し、数千本の科学動画にアクセス
この記事では、DNAまたはタンパク質配列から信頼性の高い系統樹を再構築するための段階的なパイプラインを紹介します。系統解析に初めて取り組む研究者や学生向けに設計されています。
Phylogenetic analysis enables target validation and mechanistic de-risking in early discovery by inferring functional identity and evolutionary relationships of novel sequences. This pipeline supports predictive confidence in lead identification by clarifying biological context and reducing ambiguity in target hypothesis testing. It provides a translational bridge from sequence data to functional annotation, informing portfolio triage and risk-adjusted advancement decisions.
The method integrates into the discovery continuum from target identification through lead optimization, enabling hypothesis testing, biological de-risking, and predictive modeling based on evolutionary relationships.