May 9th, 2011
我々は、ゲノム配列の解析のために公共の計算のウェブサイトを提示する。それは様々な非ランダムな塩基組成とDNA配列のパターンを検出します。このリソースは、また複雑さの多様なレベルでランダム化されたシーケンスを生成します。
この手順の全体的な目標は、ユーザー指定のゲノム配列の均質性とも呼ばれる、ミッドレンジの非ランダム性を探索することです。これは、最初にインプット配列のオリゴヌクレオチド組成を調べ、配列を構成するオリゴヌクレオチドの周波数表を生成することによって達成されます。この目標は、SRI Analyzer プログラムを呼び出すことによって達成されます。
2番目のステップは、入力配列とまったく同じオリゴヌクレオチド組成を持つランダムな配列を生成することです。これは、SRI ジェネレータ プログラムを呼び出すことによって実現されます。手順の3番目のステップは、特定のヌクレオチドまたはヌクレオチドの組み合わせ(GCやagなど)によって大幅に濃縮されたインプット配列およびランダム化配列内のセグメントを見つけることです。
この目標は、MRIアナライザープログラムによって達成されます。手順の最後のステップは、プログラムによって検出されたすべてのMRI領域のシーケンスを含むファイルをダウンロードすることです。最終的には、多細胞アリアのゲノム領域の大部分が、4つのヌクレオチドのそれぞれまたはそれらの組み合わせのいずれかで検出された極端な塩基組成を含むセグメントによって有意に濃縮されていることを示す結果を得ることができます。
均質な領域におけるこれらは、異常なDNA確認および/または特定のDNA特性に関連しています。この方法は、遺伝子間領域や入口を含む非コード配列の広大な領域内で潜在的に機能的なDNA要素を見つけるなど、ゲノミクス分野の重要な質問に答えるのに役立ちます。この方法は哺乳類のゲノムに関する洞察を提供しますが、無脊椎動物、植物、菌類、バクテリアなどの他の生物にも適用できます。
www.bioinfo.utoledo. edu/gri/the web resourceで、オンラインゲノムミッドレンジの均質性またはG GM Iパッケージのホームページを開きます。また、ヘルプの Readme リンクにあるプログラムに関する詳細情報も提供します。
ゲノムMRIおよび同様のアルゴリズムに関するすべての公開資料は関連リソースへのリンクに記載されていますが、リンクは、A-G-M-R-I解析セッションを開始するためのより高速なフォーマットシーケンスでファイルを作成します。より高速に書式設定されたシーケンスは、ニンジンまたは大なり記号で始まり、その後に一意の識別子または名前と、次の行のシーケンスが続きます。TGヌクレオチドとCヌクレオチドのみがゲノムMRIで処理されますが、他の文字入力も許可されています。
PKD one遺伝子の配列ファイルを使用します。セッションのデモを行うには、スタートボタンを押します。これにより、新しい Web ページが開き、入力シーケンスを指定されたウィンドウにコピー アンド ペーストするオプション、またはファイルが大きい場合にオプションが提供されます。
アップロードするには、ファイルの選択ボタンをクリックしてファイルをアップロードします。目的のファイルを参照します。次に、[このファイルでこのセッションを開始する]ボタンをクリックすると、ファイルが正常にアップロードされたことの確認がページの上部に表示されます。以下に。
このメッセージは、現在のセッション (この場合は C eight EP oh six) の識別子です。入力シーケンスの近距離を均質性で解析するには、[短距離を均一性で解析]ボタンをクリックします。このプログラムは、SRI Analyzer プログラムの実行専用に設計された新しいページを開きます。
ここでは、調べるオリゴヌクレオチドの最大長を選択する必要があります。中規模の約50, 000ヌクレオチドの入力配列であるため、周波数が計算されるオリゴヌクレオチドの最大長としてフォーマーを選択します。最後に、すぐにファイルの分析ボタンを押す必要があります。
このプログラムは、入力シーケンス内の選択した長さとそれより短い長さのすべてのオリゴヌクレオチドの周波数を計算します。すべてのオリゴヌクレオチドの周波数を確認するには、リンクダウンロード組成ファイルをクリックしてください。このファイルは user file という名前です。
com は 3 つの列を持つテーブルを表します。最初の列はオリゴヌクレオチドを指定します。2 番目は相対周波数を表し、3 番目は入力シーケンス内のオリゴヌクレオチドの発生数を表します。
入力ファイルと同じオリゴヌクレオチド組成のランダム化配列を生成するには、SRIジェネレータータブをクリックします。新しいページで、生成するランダムシーケンスのサンプル数を選択します。これらの各サンプルには、ユーザー ファイルの入力シーケンスと同じ数と長さのランダムなシーケンスが含まれます。
この例では、ユーザーファイルはPKD 1遺伝子の配列です。次に、ランダム化された配列で周波数が近似されるオリゴヌクレオチドの最長長を選択するには、フォーマーのラジオボタン(4つの塩基オリゴヌクレオチドを表す)を選択します。次に、生成するランダム化されたシーケンスのサンプル数として 2 を選択します。
最後に、数十万のヌクレオチドの入力シーケンスのファイル生成ボタンをクリックしてプログラムを起動します。ランダムなシーケンスを生成するには数分かかる場合があります。したがって、このページの下部に青いダウンロードリンクが表示されるまでお待ちください。
入力配列とランダム化配列の均質性におけるミッドレンジを解析するには、MRI analyzerタブをクリックします。新しいページで、解析するファイルリストボックスから解析するシーケンスを選択します。次に、7 つのコンテンツタイプのリストから GC コンテンツを選択します。
GCコンテンツは、GプラスCコンポジションの略です。ウィンドウサイズフィールドでは、コンテンツの豊富なシーケンスと不十分なシーケンスを調べるウィンドウの長さを選択できます。デフォルトのウィンドウサイズである 50 ヌクレオチドのままにします。
最後に、コンテンツが豊富な地域とコンテンツの少ない地域の上限と下限のしきい値をそれぞれ選択します。これらの閾値は、現在のウィンドウ内の特定のヌクレオチドの数、またはウィンドウ内のこれらのヌクレオチドの割合によって定義できます。この場合、最初に上限しきい値に60%、下限しきい値に30%のランダム値を選択します。
次に、ファイルの分析ボタンを押しますこれに続いて、出力ファイルへのリンクが表示され、結果のグラフィカル表現が表示されます。入力シーケンスに沿ったすべてのコンテンツが豊富な領域は青色の上向きのスパイクとしてマークされ、コンテンツの低品質の領域は赤色の下向きのスパイクとしてマークされます。グラフは、GC が豊富な領域を示す青いスパイクが多すぎ、GC が不十分な領域を示す赤いスパイクがはるかに少ないことを示しています。
これは、選択したパラメータが最適ではないことを意味します。次の反復では、75%の上限しきい値と32%の下限しきい値を使用します。再度、ファイルの分析ボタンをクリックしてMRIアナライザーを開始します。
新しいグラフは、新しいはるかに厳しいパラメータに対しても、何百もの青いスパイクがあることを示しています。したがって、上限しきい値を80%に増やし、計算を繰り返します。新しいグラフは、62のGCリッチ領域のGC含量が80%以上であり、GC含量が32%未満の28のGC不良領域を示しています次に、入力ファイルの結果と、PKD 1遺伝子と同じオリゴヌクレオチド組成を持つ2つのランダム化配列と比較します。
これを行うには、GCリッチ領域とGCプルーフ領域について同じパラメータを維持しながら、ファイル解析リストボックスを使用して、配列をPKD1遺伝子からランダム遺伝子に変更します。ランダム化されたシーケンス番号 1 に対して新たに生成されたグラフィカル表示は、このランダム シーケンスには 1 つの GC 不良領域と 31 の GC リッチ領域しかないことを示しています。別のランダム化されたシーケンスでは、コンテンツが豊富な地域とコンテンツの少ない地域の数に多少の変動が見られる場合がありますが、傾向は同じであるべきです。
PKDの1つの遺伝子のランダム化配列は、数倍少ないです。GCが豊富な地域は、GCが不十分な地域の10倍以上です。次のデモンストレーションでは、別のタイプの MRI コンテンツを使用します。
同じパッケージ中に、この遺伝子の1つのヒト遺伝子イントロンには、DN aex構造に関連するいくつかのプリン体に富む領域が含まれています。MRI分析装置のWebページで、DNA含有量をプリン体を表すagヌクレオチドに切り替えます。ウィンドウサイズを50ベースに保ち、上限しきい値を80%に、下限しきい値を10%に変更し、ファイルの分析ボタンを押してプログラムを呼び出します。
表示されたグラフは、この遺伝子が青色の垂直スパイクで示される6つのagリッチ領域と、赤色のスパイクで示される14個のag不良領域を持つことを示しています。次に、PKD 1遺伝子について得られたこれらの結果を、アンダースタディの遺伝子と同じオリゴヌクレオチド組成を持つランダム化配列からのデータと、最初にランダム化配列(たとえば2番)に切り替え、前のテストと同じパラメータを維持します。このランダム シーケンスのグラフは、AG が豊富な領域が 1 つだけ含まれ、AG が不十分な領域が含まれていないことを示しています。
セッション中に生成されたすべてのデータは、各Webページの右上隅にあるダウンロードファイルタブからアクセスできる特別なファイルに保存されます。このリンクを開いた後、入力シーケンスと生成されたすべてのランダム化されたシーケンスをダウンロードします。このファイルリストの下には、SRIアナライザープログラムによって生成されたオリゴヌクレオチド周波数テーブルへのリンクがあります。
次に、セッション中にMRIアナライザープログラムによって生成されたすべての結果へのリンクがあります。例えば、ファイルuser aファイルRAND one four AGCO 50 32 14をクリックすると、ランダム化された配列について得られた結果を表す。次のパラメータを持つナンバーワン、ag含有量50ヌクレオチドロングウィンドウ、上限閾値、32ヌクレオチド、下限閾値14ヌクレオチド。
このファイルでは、コンテンツの豊富な基準または低い基準に一致するすべてのヌクレオチド配列セグメントとその座標が、入力配列に沿った連続した位置に応じたリストとして利用できます。このビデオを見れば、計算リソースであるゲノムMRIをどのようにナビゲートするかを十分に理解できるはずです。
この記事では、ゲノム配列の解析を目的とした計算機ウェブレソースについて説明します。焦点は、非ランダムなヌクレオチド組成の検出にあります。このツールは、類似したオリゴヌクレオチド組成を持つランダム化された配列を生成し、ゲノムの不均一性の探索を容易にします。
Genomic MRI provides a computational approach to detect non-random nucleotide patterns in non-coding DNA, supporting target validation by identifying regulatory elements with potential functional significance. This enables mechanistic de-risking in early discovery by linking sequence inhomogeneity to biological processes such as gene expression and recombination. The resource enhances predictive confidence in lead identification by prioritizing genomic regions with extreme base composition for downstream assay development.
The method integrates into the discovery continuum from target validation through lead identification to preclinical work by providing quantitative outputs on sequence enrichment that inform biological de-risking decisions.