このコンテンツを表示するには、JoVEへの購読が必要です。 または、無料トライアルをお申し込みください。

方法論記事

バッチ酵母 2 ハイブリッド スクリーンからシーケンス データの情報解析

6.8K 閲覧数

DOI:

10.3791/57802

2018年6月28日

この記事について

サマリー

肯定的な酵母 2 ハイブリッド相互作用の可能性があります選択酵母集団のディープ シーケンスには、パートナーの相互作用の蛋白質についての情報の富が得られます。ここでは、特定のバイオインフォマティクス ツールとこのような画面からシーケンス データを分析するカスタマイズされた更新されたソフトウェアの操作について述べる。

要約

我々 は、同時に高スループット短鎖 DNA シーケンスを利用した単一の画面内で一過性と静的な蛋白質の相互作用の多数を明らかにする酵母 2 ハイブリッド試金を適応しています。結果のシーケンスのデータセットだけでなく、肯定的な酵母 2 ハイブリッド相互作用のための選択中に濃縮されている人口はどのような遺伝子を追跡も蛋白質の相互作用のために十分の関連するサブドメインに関する詳細情報を与えます。ここでは、我々 は非専門家すべての生物情報学および処理し、バッチ酵母 2 ハイブリッド試金から DNA シーケンス fastq ファイルを分析する統計手順を実行することができるスタンドアロンのソフトウェア プログラムの完全なスイートをについて説明します。これらのソフトウェアによって覆われている処理手順が含まれます: 酵母 2 ハイブリッド獲物ライブラリ内でエンコードされた各候補タンパク質に対応する 1) マッピングとカウントのシーケンス リード2) 濃縮プロファイルを評価する統計解析プログラム・ 3) 並進フレームと興味の相互作用の蛋白質を符号化する各の豊かなプラスミッドのコーディング領域内の位置を調べるためのツール。

概要

蛋白質の相互作用を検出する方法の 1 つは、どの攻撃設計興味の蛋白質の相互作用のパートナー1フラグメントにバインドされたときだけ拡張酵母、酵母 2 ハイブリッド (Y2H) アッセイです。大規模な並列高スループット シーケンスの助けを借りて複数 Y2H 相互作用の検出を行うことが今できます。いくつかのフォーマットがされている個体群が生成するプラスミドを含む酵母の選択条件下でバッチで栽培されたものを開発した 1 つを含む2,3,45の説明、正 Y2H 相互作用6。我々 は、開発 deepn 深さ (評価のタンパク質ネットワークの動的な濃縮) と呼ばれる、1 つの蛋白質 (またはドメイン) のと相互作用するタンパク質を識別するために同じ獲物ライブラリから差分 interactomes を識別するワークフロー。別の蛋白質またはコンホメーションの突然変異体のドメイン。このワークフローの主な手順は、適正処理や DNA シーケンス データの解析があります。RNA シーケンス実験に似ていますファッション Y2H 相互作用の選択の前後に各遺伝子のための読み取りの数をカウントするだけでいくつかの情報を拾うことができます。しかしより多くの詳細な情報は、Y2H 相互作用を作り出すことができるある特定の蛋白質のサブドメイン情報を含むこれらのデータセットから抽出できます。さらに、DEEPN アプローチが重要であるに対し多くのサンプルの複製を分析することができます面倒で高価です。複製の数が限られている6DEEPN データセットのために特別に開発された統計モデルを使用して、この問題を軽減します。生物情報学の知識がなくても捜査官の DNA シーケンスのデータセットの処理および分析信頼できる、完全な堅牢で、アクセスを作る、分析のすべてのステップをカバーするソフトウェア プログラムのスイートを開発しました。

デスクトップ コンピューター上で実行されるスタンドアロンのソフトウェア プログラムのこのスイートには、MAPster、deepn 深さと Stat_Maker が含まれます。MAPster は、生産して下流のアプリケーションで使用する標準 .sam ファイル HISAT2 のプログラム7を使用してゲノムへのマッピングにより、各 fastq ファイル キューに登録グラフィック ユーザー インターフェイスです。Deepn 深さは、いくつかのモジュールです。それは割り当て、特定遺伝子モジュール '遺伝子' カウントを使用して RNA シーケンス型数量化と同様に対応する読み取りをカウントします。また、Gal4 転写ドメインと獲物のシーケンス間の接合に対応するシーケンスを抽出し、比較表やグラフ ('Junction_Make' モジュールを使用) の点検を許可するようにこれらの接合位置の照合順序'Blast_Query' モジュールには、簡単な検査、定量、ジャンクション Gal4 結合配列の比較ができます。Stat_Maker は、可能性が高い Y2H ヒットの優先順位付けの方法として統計的に遺伝子濃縮データあたりの読み取り数を評価します。ここでは、これらのソフトウェア プログラムを使用して完全に DEEPN Y2H からデータ実験 dna 塩基配列を解析する方法について述べる.PC、Mac、および Linux システム上で実行する deepn 深さのバージョンがあります。MAPster マッピング プログラムなどの他のプログラムと deepn 深さ統計モジュール Stat_Maker Unix で実行、Mac および linux システム上でのみ利用可能なサブルーチンに頼る。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

プロトコル

1. マッピング Fastq ファイル

注: DEEPN ソフトウェアとして多くの生物情報学プログラムは、参照 DNA の位置を読む各シーケンスがマップされて前記 DNA シーケンス データを使用します。HISTAT2 プログラムを使用して、以降の手順で使用される .sam ファイルを生成ここに MAPster インターフェイスを含んでこれのためさまざまなマッピング プログラムを使用できます。

  1. ゲノムの正しいバージョンにシーケンス データをマップします。マウス由来の Y2H ライブラリ、UCSC mm10 ゲノム; を使用します。これらのヒトの遺伝子を使用して、出芽酵母遺伝子の UCSC hg38 参照ゲノムを使用、UCSC SacCer3 参照ゲノムを使用します。
  2. MAPster をインストールします。
    1. MAPster ソフトウェアをダウンロードしてインストールします。ソフトウェアは、次のように web ブラウザーを使用して見つけることができます: https://github.com/emptyewer/MAPster/releases。HISAT2 は、Apple Macintosh などの Unix ベースのシステムで実行されます。このため、MAPster プログラムは、Apple Macintosh、linux など互換性のあるシステムでのみ実行されます。
      注: Apple Mac のシステム要件は、: 10.10 + OSX > 4 Gb の RAM、> 500 Gb のディスク容量、および参照ゲノムをダウンロードするためインターネット接続。ユーザーは、それを相談する、機関の人、企業管理者の権限およびアクセス許可を制限するセキュリティ プロトコルを持っている場合必要があります。
  3. 必要なファイルと「メイン」タブ (図 1) を使用してパラメーターを入力します。ペアまたは既定のファイル形式として FASTQ と対になっていないとどちらかのファイルを入力する適切な「Pairwise」ボタンを選択します。
    1. Deepn 深さ分析のため単一の読み取り形式で実行する「オフ」に「Pairwise」オプションをオンにします。
    2. MAPster に適切なウィンドウにドラッグ アンド ドロップするだけでファイルを読み込みます。
    3. Y2H 獲物ライブラリ挿入のソースに対応する DNA ・ ゲノム ソースの参照を選択します。いくつかのモデル生物からインデックス付きゲノム「ゲノム」ボックスに表示されます、計算生物学、ジョンズホプキンス大学センターから自動的にダウンロードすることができます。参照ゲノムは、後で使用できるローカルで格納されます。
    4. HISAT2、マルチ スレッド サポートから「スレッド」ボックスの下マッピング プログラムに専念するコンピューターのプロセスの数を示します。MAPster はコンピューターを検索し、既定値として利用可能なプロセッサの最大数を示唆しています。
    5. 出力ファイル名を指定します。このファイル名は、スペースや特殊文字なしの短いまだわかりやすい名前をお勧めしますので DEEPN プロセス全体で使用されます。「出力ディレクトリを開く」ボタンを使用してマップされたファイルを出力するフォルダーを指定します。
    6. 適切なファイルとパラメーターを選択すると、マッピング ジョブは「キューに追加」ボタンを使用してジョブ キューに追加します。メイン ウィンドウでファイル名を削除され、新しいサンプルに対応するファイルに置き換えられますことができます、彼らが対応する出力ファイル名を指定後、キューに追加できます。
    7. すべてのジョブがジョブ キューに入力される「キューの実行」ボタンをクリックしてします。
      注: マッピング ジョブは、キューに配置されている、一度「ジョブ パラメーター」ウィンドウと「ジョブ コマンド」ウィンドウに表示されるすべての引数とコマンド ライン ステートメントに表示されるパラメーター設定を、そのジョブを選択します。出力オプションは合わせて失敗してください読み取りするかどうかを演出など各 read に対して許可主な線形の数を指定します。MAPster から既定の出力ファイルは、サムの形式 (例えば'.sam' ファイル) です。Fastq ファイルを読み書きするシーケンス (マップ) したものを含むサンプル指定し、なかったすべてが含まれます (マップ) 指定されたツタに正常にマップします。

2. バイオ情報処理を用いた DEEPN ソフトウェア

注意: DEEPN ソフトウェアはマウス cDNA 配列、ヒト cDNA シーケンス、または出芽酵母ゲノムの DNA 配列を含む獲物ライブラリとコンパイル用現在。Deepn 深さは標準 .sam ファイル形式を受け取り、マップおよびマップされた読み取りのそれぞれのマップおよびマップされていない読み取りまたは別のファイルを含むサム (.sam) ファイルを受け入れることができます。

  1. DEEPN ソフトウェアをダウンロードしてインストールします。ソフトウェアは、次のように web ブラウザーを使用して見つけることができます: https://github.com/emptyewer/DEEPN/releases。コンピューティングのプラットフォームとダウンロード バージョンに一致するを選択します。インストールするには、ダウンロードしたインストール パッケージを開きます。
    注: deepn 深さのバージョン、PC、Mac、および Linux の改良システムのことがあります。Mac と PC のシステム必要があります > 500 Gb のハード ディスク容量と > 4 Gb の RAM。
  2. DEEPN ソフトウェアを開きます。メイン ウィンドウ (図 2) からトップの選択] ボックスから対応する獲物のライブラリ情報を選択します。処理されたファイルがフォルダー/ディレクトリに「作業フォルダー」ボタンをクリックして移動して行くことができますフォルダーを選択します。必要な場合、1 つは新しいフォルダー/ディレクトリを作成できます。「作業フォルダー」を選択すると、一度 deepn 深さは unmapped_sam_files、mapped_sam_files と sam_files と題して 3 つのサブフォルダーを作成します。
    1. MAPster プログラムの既定の設定で製作しております .sam ファイルなど、マップとマップされていない読み取りを含むを使用して 'sam_files' フォルダーに配置します。それ以外の場合、unmapped_sam_files と mapped_sam_files にそれに応じて .sam ファイルを配置します。
  3. 「遺伝子数 + 接合する」ボタンをクリックして処理を開始します。
    注: 各遺伝子に対応する回数をカウントするマッピング位置を使用する遺伝子数モジュールで処理が始まります。接合には、接合シーケンスを抽出 (シーケンスを直接融合 Gal4 活性化ドメインから下流) 読み取りから Blast アルゴリズムを使用してそれらを識別し、。これは図 3に示すフォルダーの完全なセットが作成されます。処理時間は、サイズとシーケンス データ ファイルの数、および使用するコンピューターの処理速度によって異なります。2 億 5000 万の実験データセットの 12-30 h から典型的な時間範囲を読み取ります。遺伝子数のプロシージャおよび Junction_Make プロシージャは、「遺伝子計算」ボタンまたは「接合する」ボタンをクリックして個別に開始できます。
  4. ダウンロードし、Stat_Maker (https://github.com/emptyewer/DEEPN/releases) をインストールします。これ DEEPN データセット現在 Unix Mac システム上でのみ動作するために設計された統計解析パッケージです。
    1. Stat_Maker を開き、ボタン「インストールの確認」(図 4) をクリックしますします。最初に実行する場合 Stat_Maker が自動的にこれらのリソースをインターネットから引いて、R、ぎざぎざおよび Bioconductor をインストールします。R、ぎざぎざおよび Bioconductor が検出されると、Stat_Maker がアクティブになるし、さらにユーザーの入力を許可します。
    2. DEEPN 処理作業フォルダーに移動する「フォルダーの選択」ボタンをクリックしてします。Stat_Maker は、自動的に検索、ウィンドウの統計分析ファイルを一覧表示します。
    3. ドラッグ アンド ベクトルと餌のデータセットごとに、それぞれの成長条件の下ファイル windows 上のファイル一覧ウィンドウから適切なファイルをドロップ: 非選択 (彼 + メディア)、(彼のメディア) を選択します。重要なは、Stat_Maker には、空の重複データセット ベクトルだけでは、選択されていない集団の 2 つのサンプルとの 2 つのサンプルの選択が必要です。これは実験内の可変性の見積もりを与えます。
    4. 「実行」ボタンををクリックしてします。コンピューターの速度、に応じて 5 〜 15 分間計算になります。
  5. 「Stat_Maker 結果」というラベルの付いたメインの作業フォルダー内の新しいサブフォルダーに配置されている Stat_Maker の出力から結果を確認します。
    注: スプレッドシート プログラム共通の開くことができる CSV (コンマ区切り値) ファイルに結果があります。Stat_Maker には、空の pTEF GBD (図 5) で関心の餌を選択するときに特異的濃縮する可能性のある遺伝子のヒットがランク付けされます。また集計は各データセットの読み取りの比率が遺伝子挿入はで発見した上流、下流、または開いたリーディング ・ フレームと遺伝子はまた正しい並進リーディング ・ フレーム内で見つかったかどうか。多くの場合、deepn 深さは、対応する蛋白質の適切な読書フレームの外、または対応するオープンリーディング フレームの下流は cDNA の部分には指定された cDNA の部分と餌の堅牢な Y2H の相互作用をキャプチャします。これらの無関係なヒットの検出と除去を合理化 Stat_Maker からの結合された出力をスキャンします。
  6. 各潜在的な候補者に関するデータを確認、DEEPN ソフトウェアを開いて、獲物に対応するライブラリ情報をクリックし、「作業フォルダー」を使用して、正しい作業フォルダーを選択します。
    1. 「ブラスト クエリ」ボタンをクリックします。これは、新しいウィンドウ (図 6) を読み込みます。上部のテキスト ボックスに遺伝子名または興味の遺伝子の候補を選択する GenBank NM 番号を入力します。これらの遺伝子の名前は、StatMaker 出力ファイルに記載されている名前に対応します。型を入力または戻るには、興味の遺伝子の検索が開始されます。
    2. 「データセットの選択」メニューを使用して分析のため使用するデータセットを選択。通常、これらはベクターのみを含めるし、非選択的条件下で栽培したサンプルおよび選択条件下で栽培した餌サンプルを餌します。当初は、データセットが読み込みに時間がかかる、しかし、異なる遺伝子を持つ同じデータセットの後続のクエリは急速に。Blast_Query の関心とどのように豊かなそれぞれの融点は順序に沿う融合のポイントが表示されます。これは、両方「結果」タブを使用して表形式または「印刷」タブを使用してグラフィック形式で表示できます。これらの結果は、右上の「保存する .csv」ボタンをクリックしてして .csv ファイルにエクスポートできます。

3. deepn 深さによって識別される候補者の検証

注: deepn 深さと Stat_Maker の目的は、肯定的な Y2H 相互作用を与える候補者の遺伝子を識別するためにです。Y2H のような相互作用を確認することができます関心の餌プラスミドを使用して伝統的なバイナリ Y2H 形式を使用して行わ空 Gal4 活性化ドメイン '餌' プラスミドとペア同様する興味の遺伝子/cDNA 断片を運んで獲物プラスミドとペアになっています。Y2H 選択を受ける人口は酵母から分離した DNA の混合物内の実際のプラスミドを分離することはありません。ただし、計算、遺伝子/cDNA 断片は Y2H 相互作用を生成する、再構築、5' と 3' 端そのフラグメントのためのプライマーを設計し、人口は酵母から分離した DNA のフラグメントを増幅するなど 1 つできます。候補獲物断片の 5' と 3' 端を見つける方法について説明します。

  1. DEEPN ソフトウェアを開き、「選択パラメーター」と作業フォルダー「作業フォルダー選択」プロジェクトに対応するパラメーターを選択します。Blast_Query モジュールを起動するには、「ブラスト クエリ」ボタンをクリックします。
  2. 興味や、GenBank"NM"の遺伝子の名前を入力上のテキスト ボックスの番号。'結果'] タブ下の接合位置のテーブルを取得する興味の餌の選択した酵母の人口に対応するデータセットをプルダウン メニューから選択します。既定では、Blast_Query、データセットは、データベース内で見つかった接合数 ppm で定量化豊富によると別の位置を順序します。
    1. 最も豊富な位置を見つける"Orf」と「フレームで"。位置の値は、上部のテキスト ボックスは、NCBI 参照シーケンス ('NM' 番号) を持つ遺伝子の塩基位置に対応します。このシーケンスは、GenBank (https://www.ncbi.nlm.nih.gov/nuccore/) から取得または Blast_Query ウィンドウ下のテキスト ボックスからコピーできます。
      注:図 6、中央のパネルの例を見つけることが。センター データセットで '結果' は、最も豊富なジャンクションとして表示: '位置': 867;'#Junctions': 20033.821;'クエリの開始'、1;CD: ORF; で'フレーム': フレームで。GenBank NCBI 参照シーケンス NM_019648 のヌクレオチド 867 獲物フラグメントの開始であります。
  3. クエリの開始が 1 の場合、位置番号に対応する塩基配列を含むようにプライマーの 5' 末端を設計し、その位置 (図 7) から 25 ヌクレオチド下流を拡張します。クエリの開始が 1 以上の場合は、Gal4 活性化ドメインと興味の獲物シーケンスの間の余分なヌクレオチドがあることと、プライマーを開始するさらに下流のクエリを開始値によるとを示します。
  4. DEEPN ウィンドウから「データの分析」下の「読みの深さ」ボタンをクリックしてします。読み取り深度ウィンドウが開いたら、上部のテキスト ボックスに NCBI 参照 (NM) のシーケンス番号や遺伝子名を入力します。興味の豊かな遺伝子を含む関連するデータセットを選択するのにプルダウン ・ メニューを使用します。左の表を使用し、グラフィック表示回数が興味 (図 7B) の遺伝子に対応するデータで発見されたを決定する権利。
  5. 読み取り深度によって計算される遺伝子フラグメントのシーケンスをキャプチャ 3' 端プライマーを設計します。ORF を超えた豊富な読み取りの場合終止コドン、終止コドンと終止コドンのすぐ上流の領域を含むようにプライマーを設計します。遺伝子のシーケンスが停止コドン過去に及ばない、結果表を検出することができますし、遠い 3' としてこの位置を使用して、最も遠い 3' 領域を検索する使用してプライマーを配置します。
    注: 読み取り深度プログラムは興味の特定の遺伝子/cDNA に一致するシーケンスを検索する間隔でスキャンします。これは最も豊富な獲物の断片の 5' と 3' 端がサンプルでその遺伝子が予測できます。シーケンスの長さに沿って読み取り深度の変動は、通常、図 7で見ることができます。読み取りの深さが明らかに過去の終止コドンの場合獲物フラグメントが終止コドンを超えたとして、こうして 3' プライマーは単に停止コドン周辺地域を対応できることを示します。
  6. 遺伝子あたり 50 μ L の PCR 反応を行います。各反応を含むライブラリ獲物プラスミドに一致する各前方および逆のプライマーの 25 pmol (材料の表を参照してください)。反応は、忠実度の高い 2 x PCR マスター ミックスの 25 μ L、5 μ g の DNA サンプルと 50 μ L までの水にも含まれています。
    1. 3 72 ° C の熱処理温度 55 ° C、30 分の延長時間 25 サイクルの反応を増幅する s、および 10 98 ° C で変化 s の 98 ° C で 30 s 変性によってサイクリング先頭と次の 72 ° C で 5 分インキュベーション

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

結果

Fastq データをマッピングする: 最初の手順
Deepn 深さが初期の出力は、ゲノムに配置してマップする必要があります短い一連の読み取りのファイルを含む事実上すべての NGS アプリケーション、トランスクリプトーム、または他は DNA8を参照します。最近では、HISAT2 の配置プログラムは、最新のインデックス作成アルゴリズムを使用してマッピング速度7,9を劇的に増加するを開発されました。HISAT2 デスクトップ コンピューターで効率よく実行して、通常サイズのマップは数分でファイルを読むことができます。これにより、コマンドライン言語 (図 1) で通常動作するリモートの高性能コンピューター クラスター上の依存を避けることができます fastq ファイルをローカルにマップすることができます MAPster ...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

ディスカッション

ここで説明するソフトウェア スイート完全に DEEPN 実験からハイスループット DNA シーケンス データを分析処理しことができます。使用する最初のプログラムは、MAPster、DNA シーケンスの読み取りは、標準 fastq ファイルと参照 DNA 情報学プログラム DEEPN ソフトウェアを含む全体のホストによる下流の処理のために彼らの位置をマップです。出力ファイル、プログラム7制御のさまざまなツールを使用して簡単なマッピングを提供します、基になる HISAT2 の速度と相まって買い物名を MAPster インタ フェースと入力ファイルを結合、複数のジョブをキューにその能力の有用性deepn 深さ以外のアプリケーション。MAPster は、deepn 深さ以外にもデータ分析の他のタイプに適している HISAT2 プログラムのいくつかのパラメーターにアクセスできます。これらの機能のいくつかは RNA シーケンスと全ゲノム マッピング実験の事前設定済みパラメーターが含まれます、簡単に調整可能な HISAT2 パラメーターの専門家のユーザーとカスタマイズされたアプリケーションのための完全な...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

開示事項

著者がある何も開示するには

謝辞

この仕事は健康の国民の協会によって支えられた: NIH R21 EB021870 01A1、NSF 研究プロジェクト助成: 1517110。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

材料

この記事で使用された材料の一覧
名前会社カタログ番号コメント
Mapsterhttps://github.com/emptyewer/MAPster/releases
DEEPNソフトウェア
https://github.com/emptyewer/DEEPN/releases Statmakerhttps://github.com/emptyewer/DEEPN/releases
最小コンピュータシステムAppleMac Intel Core i5以上
-4 Gb RAM500
Gb ディスク spce 以上
、 - OS 10.10 以上 Dell Intel i5-7400 以上 - 4 Gb RAM 以上 - 500 Gb ディスク spce 以上 - Windows 7 以上

参考文献

  1. Fields, S., Song, O. A novel genetic system to detect protein-protein interactions. Nature. 340 (6230), 245-246 (1989).
  2. Rajagopala, S. V. Mapping the Protein-Protein Interactome Networks Using Yeast Two-Hybrid Screens. Advances in Experimental Medicine and Biology. 883, 187-214 (2015).
  3. Weimann, M., et al. A Y2H-seq approach defines the human protein methyltransferase interactome. Nature Methods. 10 (4), 339-342 (2013).
  4. Yachie, N., et al. Pooled-matrix protein interaction screens using Barcode Fusion Genetics. Molecular Systems Biology. 12 (4), 863(2016).
  5. Trigg, S. A., et al. CrY2H-seq: a massively multiplexed assay for deep-coverage interactome mapping. Nature Methods. , (2017).
  6. Pashkova, N., et al. DEEPN as an Approach for Batch Processing of Yeast 2-Hybrid Interactions. Cell Reports. 17 (1), 303-315 (2016).
  7. Kim, D., Langmead, B., Salzberg, S. L. HISAT: a fast spliced aligner with low memory requirements. Nature Methods. 12 (4), 357-360 (2015).
  8. Reinert, K., Langmead, B., Weese, D., Evers, D. J. Alignment of Next-Generation Sequencing Reads. Annual Review of Genomics and Human Genetics. 16, 133-151 (2015).
  9. Pertea, M., Kim, D., Pertea, G. M., Leek, J. T., Salzberg, S. L. Transcript-level expression analysis of RNA-seq experiments with HISAT, StringTie and Ballgown. Nature Protocols. 11 (9), 1650-1667 (2016).
  10. Conesa, A., et al. A survey of best practices for RNA-seq data analysis. Genome Biology. 17, 13(2016).

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

再版と許可

タグ

MAPster DEEPN Stat Maker