June 23rd, 2012
プールされたDNAシーケンシングは、大規模コホートで複雑な表現型に関連付けられている稀な亜種を検出するための迅速かつ費用対効果の高い戦略である。ここでは、スプリンターソフトウェアパッケージを使用して、32のがん関連遺伝子のプールされた、次世代シーケンシングの計算分析を記述します。このメソッドは、スケーラブルで、目的の任意の表現型にも適用可能である。
この手順の全体的な目標は、まれな機能的変異が優勢である個体の集団内の遺伝子を特定することです。これは、最初にDNAサンプルの集団をプールすることによって達成されます。2番目のステップは、次世代のシーケンシングライブラリを作成してシーケンシングすることです。
これに続いて、参照シーケンスに対する読み取りのアラインメントとエラーモデルの作成が行われます。最後のステップは、スプリンターアルゴリズムを使用した計算解析です。最終的に、プールされた次世代シーケンシングのスプリンター解析を使用して、まれな機能的分散が優勢な集団内の遺伝子を示します。
今日は、私のメンターであり共同研究者であるRob Mitraの研究室の大学院生であるFrancesco Vilaniaさんに、私の研究室の大学院生であるEnrique Ramosさんをお迎えします。この手法は、単一の個々の遺伝子型などの既存の方法と比較した場合の主な利点は、事前の情報を必要とせずに、DNA分子の混合集団における非常に正確に希少な配列変異を検出できることです。この方法は、大規模なコホート研究で希少な変異を引き起こす新規疾患の頻度をどのように決定するかなど、遺伝学およびゲノミクス分野の重要な質問に答えるのに役立ちます。
すべてのスプリンター実験では、最適な精度を得るためにネガティブコントロールとポジティブコントロールの存在が必要であり、PFU超高忠実度を使用してPCR反応ミックスを調製します。DNAポリメラーゼ。ネガティブコントロールは、クローニングされたベクターバックボーンなど、遺伝的変異がないことが知られている任意のDNA配列からのPCR産物です。
ここでは、M 13 MP 18ベクターからの1,934塩基対アンプリコンが使用される。ポジティブコントロールは、全集団に存在する以前に検証された配列バリアントの任意のセットであり得る。このデータが利用できない場合、このラボでは、この表にリストされているように、PGMT Easy Vectorにクローニングされた操作済み配列のブレンドから、PCR 産物あたり 331 塩基からなる人工陽性コントロールを設計しました。
これらの配列は、患者プール内の真の変異体のさまざまなマイナー対立遺伝子頻度を模倣するために組み合わされます。このビデオに添付されているプロトコルで説明したサンプルのPCR増幅後、狂言カヤッククイックカラム精製、または真空マニホールド付きの96ウェルフィルタープレートを使用して、各PCR産物の余分なプライマーを洗浄し、大規模なクリーンアップを行います。精製したら、標準的な手法を使用して各PCR産物を定量します。
すべてのPCR産物とコントロールを分子番号で正規化されたプールに組み合わせる準備をします。濃度によるプーリングでは、大きな製品よりも小さなアンプリコンが過剰に表現されます。代わりに、アンプリコンあたりの正規化された分子数をプールします。
ピペッティング中に精度を維持するのに十分な大きさの任意の数値を選択してください。PCR産物とコントロールを引っ張ります。PCR産物のライゲーションが必要であるのは、小さなPCR申請者の断片化により、表現が彼らの目的に偏る可能性が高いためです。
このため、プルPCR産物を断片化する前に大きなコンにライゲーションします。プロトコルに記載されているように、T four Ligase、T four PNK、および PEG を使用して、平滑終結繍用の混合物を調製します。反応を摂氏22度で17時間インキュベートします。
その後、摂氏65度で20分間インキュベートし、その後摂氏4度で保持します。ライゲーションを確認するには、50ナノグラムのサンプルをローズゲルにロードします。ライゲーションが成功すると、レーンに高分子量のバンドが存在します。
Qiagen PB Bufferでサンプルを10対1に希釈して粘性を低下させることにより、ランダム超音波処理戦略を通じてDNA断片化を準備します。次に、24サンプルのダイアゴンノードバイオラプチャーを使用してPCR産物の大きな円錐を断片化し、毎分40秒オンと20秒オフで25分間にわたって高出力で超音波処理します。アグロゲル上でDNA断片化の結果を確認し、本文に記載されているように照明シーケンシングを進めます。
シーケンシングを開始するには、アラインメントを読み取ります。生のシーケンシングを変換するか、ファイルをスカーフ形式に読み込むか、圧縮します。圧縮はオプションです。
これにより、関連情報を失うことなく、後続の分析ステップの時間とスペースを節約できます。付属のアライメントツールを使用して、生のリードを注釈付きの高速参照シーケンスにアライメントします。標的領域に特異的なのは、PCR反応、ならびにポジティブコントロールおよびネガティブコントロールを含む。
入力形式は、スカーフ形式または圧縮形式である必要があります。次に、本文で説明されているようにファイルのタグ付けを実行します。各実行では、シーケンスエラーの一意のプロファイルが生成され、各実行のモデルエラーに対する正確なバリアント呼び出しのために特性評価されます。
配列変異の展開されることが知られている内部コントロールは、アライメントされたタグ付きファイルから各プールサンプルライブラリに含まれています。付属のツールを使用して、ネガティブコントロール参照シーケンスを使用してエラーモデルファイルを生成し、すべてのネガティブコントロールシーケンスを使用するか、5つのプライムエンドと3つのプライムエンドで指定されたサブセットのみを使用できます。一意の読み取りと疑似カウントは常に適用する必要があります。
このツールは、出力ファイル名パラメーターとして名前が付けられた 3 つのファイルを生成し、末尾が 0、1、または 2 です。これらのファイルは、splinter を使用したバリアント呼び出しの 1 次誤差モデルと 2 次誤差モデルにそれぞれ対応しています。2 次誤差モデルは、実行誤差率プロファイルの視覚化に常に使用する必要があります。
エラーモデルグラフのプロットに使用されるPearlスクリプトを使用して、ゼロ次エラーモデルファイルにPDFエラープロットを生成できます。プロット ファイルにより、実行の特定のエラー傾向が明らかになり、分析の読み取りベースの最大数を推測するために利用できます。次のセクションでは、エラーモデルを使用してアラインメントされたファイルに対してsplinterを実行し、まれなシーケンスバリアントを検出する方法を示します。
解析の最初のステップは、参照シーケンスとエラーモデルを使用して、アライメントされたファイルに対してスプリンターを実行することです。シングルリードベースは、不良品であることが判明した場合、分析から除外できます。P 値のカットオフは、バリアント呼び出し分析の厳密さを決定します。
マイナス1.301の最小カットオフは良いスタートです。プール サイズ オプションは、実際のプール内の 1 つの対立遺伝子の周波数よりも小さいマイナー対立遺伝子周波数の潜在的な分散を排除することにより、アルゴリズムの信号対雑音識別を最適化します。プール サイズ オプションは、実験で分析された実際の対立遺伝子の数より大きい最も近い値に設定する必要があります。
低い周波数で呼び出された分散は、ノイズとして無視されます。すべてのパラメータとファイル名を入力したら、splinterを実行します。このファイルは、サンプル全体で統計的に有意なすべてのヒットを、バリアントの種類のバリアントの位置の説明と共に返します。
DNA鎖あたりのP値、バリアントの頻度、およびDNA鎖あたりの総カバレッジ。リストバイアルは、サンプル全体のカバレッジを正規化するためにスプリンターによって使用されます。最初のフィールドは目的のアンプリコンを示し、2番目のフィールドは突然変異が存在する位置を示します。
N は、配列の残りの部分に変異が含まれていないことを示します。正規化、つまりポジティブコントロールの分析は、特定の分析に対する感度と特異性を最大化するための鍵です。マイナス 1.301 の初期カットオフでは、すべての誤検知を排除するには不十分である可能性が高いため、これは重要です。
すべてのスプリンター分析では、呼び出された各バリアントの実際の P 値が表示されますが、これは優先度を予測できませんでした。ただし、既知の真陽性ベース位置の初期出力に表示される最も厳密でないP値を使用して、解析全体を繰り返すことができます。これにより、すべての真陽性を保持しながら、すべてではないにしてもほとんどの偽陽性を除外し、通常、真陽性と比較して有意な P 値がはるかに少なくなります。
このプロセスを自動化するために、カットオフテスタースクリプトを使用できます。カットオフ テスター スクリプトには、スプリンター出力ファイルと、正規化に使用されるものとしてタブ区切りファイルの形式でのポジティブ コントロール ヒットの一覧が必要です。結果として得られる出力は、最適なカットオフに徐々に到達するカットオフのリストになります。
最後の行は、実行の最適なカットオフを表しているため、データ分析に使用できます。最適な結果は、1つの感度と特異性を達成することです。ただし、到達しない場合は、組み込まれた読み取り塩基の数を変更することでスプリンター分析を最適化できます。
最終的なカットオフは、カットオフ カット スクリプトを使用してデータに適用でき、最適なカットオフを下回るヒットからスプリンター出力ファイルをフィルター処理します。この手順では、サンプルに存在するスニップとインデルを含む最終的なスプリンター出力ファイルが生成されます。挿入の出力は、置換や削除の出力とは少し異なることに注意してください。
プールされたサンプル内の単一の対立遺伝子のカバレッジの関数としての精度は、このタイプのプロットで視覚化されます。精度は、曲線の下の領域がレシーバー オペレーター曲線の UC を省略したものとして推定され、ランダム精度 0.5 から完全な精度 1.0 までの範囲です。この例では、UCは、200 501, 000対立遺伝子のプール内の単一変異体対立遺伝子を検出するための対立遺伝子あたりのカバレッジの関数としてプロットされます。
ここでは、UC は、挿入、削除、および置換の合計の関数としてプロットされます。この誤差プロットは、特定の位置に誤ったベースを組み込む確率を示しています。エラープロファイルは、シーケンシングリードの3つのプライムエンドに向かって増加する傾向にある低いエラー率を示しています。
特に、参照ヌクレオチドが異なれば、エラー確率も異なります。このプロットは、対立遺伝子ごとに 25 倍を超えるカバレッジを持つ位置の対立遺伝子頻度を推定する際のスプリンターの精度を示しています。スプリンターによって推定されたプールされたDNA対立遺伝子頻度と、ゲノムワイド関連研究またはGWASの結果によって測定された対立遺伝子数との比較。
非常に高い相関関係で、974人の集団が引っ張られ、シーケンシングのために20キロベース以上をターゲットにしました。スプリンターは、まれな変異株の検出に適用されました。標準プロトコルに従って、各個体は、タグ付けされた変異体と新規変異体のジェノタイピングとの間のgwas一致によって以前に実施されたジェノタイピングを受けていました。
プールされたサンプルで呼び出されたものは素晴らしかったです。3つの変異体(そのうち2つは集団ではまれ)は、シーケンシング結果からデノボと呼ばれ、個々のパイロシーケンシングによって検証され、マイナーな対立遺伝子頻度またはパイロシーケンシングとプルシーケンシングの間の数学的な一致は優れていました。プールされたサンプルでまれな分散を見つけ終えると、多くの人々は、特定された分散の機能的な結果が何であるかを知りたがります。
したがって、分散の注釈は、開発後のプロセスの次のステップになります。この技術は、DNAシーケンシングの分野の研究者が、大規模集団研究で希少な変異を特徴付けるための迅速かつ費用対効果の高い方法で希少な変異を研究する道を開きました。このビデオを見れば、スプリンターを使用してプール内の希少配列バリアント、DNAサンプルを検出する方法について十分に理解できるはずです。
プールDNAシーケンシングは、大規模な集団における複雑な形質に関連する希少な遺伝子変異を同定するための効率的な方法です。この記事では、32の癌関連遺伝子からのプールシーケンシングデータの計算機分析をSPLINTERソフトウェアパッケージを用いて詳細に説明します。
Detecting rare genomic variants in large populations is critical for target validation in complex disease research, where common variants fail to explain phenotypic variability. The SPLINTER-enabled pooled sequencing approach provides a cost-effective, scalable method to interrogate therapeutic hypotheses by identifying low-frequency functional variants without prior variant knowledge. This supports early discovery de-risking by enabling allele frequency estimation and variant confirmation in disease-relevant cohorts, directly informing portfolio prioritization and mechanistic follow-up.
The method fits within the discovery continuum from hypothesis generation to lead identification, providing variant detection outputs that inform target selection and assay readiness.