方法論記事

薬用植物における3次元ドメイン交換タンパク質の機械学習予測

DOI:

10.3791/68519

2025年8月15日

この記事について

サマリー

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

この研究では、さまざまな薬用植物ゲノムからの3Dドメインスワッピングに関与する、または関与すると予測されるタンパク質を調べます。機械学習モデルを採用して、3D ドメイン交換タンパク質を正確に予測し、その機能と二次代謝産物産生との関連性を予測します。

要約

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

3Dドメインスワッピングは、2つ以上のタンパク質サブユニットが同一の構造サブユニットを交換してオリゴマーを形成するタンパク質構造現象です。3Dドメインスワッピングを示すタンパク質は、二次代謝産物の生合成などのさまざまな生物学的機能や、薬用植物におけるいくつかの生物的および非生物的ストレスへの対処において重要な役割を果たします。本研究では、ランダムフォレストモデルとK最近傍分類器モデルを用いて、薬用植物のゲノム間の3次元ドメインスワッピングパターンを予測する能力を調査し、それぞれ91.6%と88.7%の精度を実証しました。合計420(31%)の配列が、3Dドメインスワッピングに関与していると推定されると予測されました。また、遺伝子オントロジー(GO)用語、京都遺伝子ゲノム大百科事典(KEGG)経路解析、および二次代謝産物生合成経路におけるドメイン分布に基づく機能アノテーションのために、さまざまな薬用植物から予測された3Dドメインスワップタンパク質配列について濃縮調査を実施しました。予測された配列の機能的注釈は、3Dドメインスワップ配列が、光合成活性の環状電子輸送経路内の電子伝達、酸化的リン酸化、二次代謝産物(テルペノイド、 アルカロイド、およびポリアミン)。これらの発見は、3D ドメイン交換現象におけるタンパク質の関与、それぞれの機能、および創薬や生物工学の取り組みを促進するタンパク質の可能性を予測する機械学習の能力を強調しています。

概要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

計算手法は、タンパク質の構造、機能、相互作用に関する詳細な分析と予測を可能にすることで、タンパク質研究に革命をもたらしました。タンパク質の機能の正確な同定と注釈は、生命の分子メカニズムを解明するために不可欠であり、医学と医薬品開発の進歩にとって非常に重要です。ただし、実験方法には固有の複雑さと費用がかかるため、大規模なシーケンス データに対応するためのスケーラビリティが制限されます。その結果、タンパク質機能予測のための計算手法の開発は、計算生物学および分子生物学における極めて重要な分野として浮上し、革新的な大規模アプローチを通じてこのギャップに対処しています1

3Dドメインスワッピング2 は、共有構造のセグメントが個々の鎖間で交換されるタンパク質の構造現象です。1994年、3Dドメインスワッピングのメカニズムに関する入門文書がジフテリア毒素二量体3で発見されました。ただし、3D ドメイン スワッピングの基本原則は 40 年前にさかのぼることができます。ウシ膵臓リボヌクレアーゼA(RNase A)は、高度な化学修飾実験を通じて、酢酸中での凍結乾燥中に二量体を形成することが観察されています4。タンパク質オリゴマー化では、2つ以上のタンパク質鎖が柔軟なヒンジ領域を介して同一の構造要素を交換します。単量体サブユニット間で交換されるタンパク質の部分はスワップドメインと呼ばれ、特定のタンパク質の球状ドメイン全体、ループ、または二次構造要素で構成される場合があります。逆に、モノマー内の元の位置に変化しない領域は、非スワップドメイン5と呼ばれます。非スワップドメイン間の結合は、 図 1 に示す非スワップドメイン・インターフェース (NSDI) として定義されます。3Dドメインスワッピングでは、あるタンパク質サブユニットのスワップされていないドメインと別のサブユニットのすでにスワップされたドメインとの関係を、スワップドメインインターフェース(SDI)と呼びます。この現象のもう 1 つの重要な側面は、スワップされていないドメインとスワップされたドメインを接続する柔軟なリンカー セグメントであるヒンジ領域です。このヒンジ領域は、3Dドメインスワッピングの動きを助ける上で重要な機能を果たし、コンフォメーションスイッチとして機能し、ドメインスワッピングに必要な構造再構成を可能にします。3Dドメインスワッピングは、タンパク質の集合や機能調節など、さまざまな生物学的プロセスに関与しています5。また、異常なスワッピングが凝集体やアミロイド原線維の形成につながる可能性がある特定のタンパク質ミスフォールディング疾患にも関連しています。

figure-introduction-1
図1:3Dドメインスワッピングの構造表現。 この表現は、柔軟なヒンジ領域を介して2つのタンパク質モノマー間の同一の構造要素の交換を示し、その結果、ドメインスワップされた二量体またはオリゴマーアセンブリが形成されます。 この図の拡大版を表示するには、ここをクリックしてください。

異なるタイプの3Dドメインスワッピングは、スワップされたドメインの性質と結果として生じるオリゴマー構造6に基づいて同定されている。2002年、アイゼンバーグと彼らの同僚は、3Dドメインスワッピングの3つのタイプを特定しました:正真正銘のドメインスワッピング(BDS)、準ドメインスワッピング(QDS)、および3Dドメインスワッピング(CDS)の候補7。最も一般的なタンパク質クラスは、正真正銘のドメインスワッピングです。これは、二量体分子とモノマー分子の両方が安定した形で存在する状態を指し、二量体はドメインスワップ配置を採用し、モノマーは閉じた配置を採用することになっています。準ドメインスワッピングでは、タンパク質はオリゴマー状態で存在することが知られていますが、その相同構造はモノマー状態で存在することが知られています。CDSでは、ドメインスワップカテゴリのタンパク質分類のみを確認するのに対し、関与するモノマーまたはそれらのモノマー相同体の構造情報は存在しません8。この手順では、モノマーまたはそれらのモノマー相同体は存在しません。むしろ、異種のタンパク質分子が存在します。 表1は 、これら3つのカテゴリ9の例を示しています。

表1:例による3Dドメインスワッピングの種類。この表をダウンロードするには、ここをクリックしてください。

その後の研究により、多数のドメインスワップ構造が明らかになり、3D ドメインスワッピングの概念を理解する道が開かれました。この現象を裏付ける最も初期の構造的証拠は、バクテリオファージλ由来のCroリプレッサータンパク質の分子で観察され、C末端鎖の交換を通じて二量体構造を形成します。1996年、研究者は単量体Cro分子が3Dドメインスワッピングに関与していることを発見しました10。βB2-クリスタリン12、ヒトCksHs213、牛肝カタラーゼ14、組換えヒトインターロイキン-515などの他の構造11も、3Dドメインスワップ構造の可能性として報告されました。タンパク質分子内のスワップドメイン位置に基づいて、3Dドメインスワッピングは、C末端ドメインスワッピング、N末端ドメインスワッピング、および比較的まれな中心ドメインスワッピングの3つのタイプに分類されます。著者らは、完全なヒトゲノムを使用して、ドメインスワップ症例を予測します。ランダム フォレストとサポート ベクター マシンをバイナリ分類器として使用し、精度はそれぞれ 81.7% と 73.9% です。タンパク質配列のほぼ44%が、ヒトゲノム6で3Dドメインスワップとして予測されました。遺伝子オントロジー(GO)に基づいて、予測された症例のドメイン分布、疾患分布、機能アノテーションについて濃縮分析を実施しました。別のアプローチでは、ランダムフォレストアプローチを使用してOcimum tenuiforumの完全なゲノムワイド解析を調査し、Ocimum tenuiforumのタンパク質配列のほぼ25%が3Dドメインスワッピングに関与していると予測されていることがわかりました。研究者らはまた、GO項の関連とそのタンパク質ドメインファミリーの関連を使用して機能注釈を実行し、非生物的ストレスに関与しているのは1158の配列のみであることを発見しました16。

植物はさまざまな特徴的なタンパク質ファミリーを示しており、特定のタンパク質は3Dドメインスワッピングなどの構造再構成を受ける能力を持っていることが認識されています。3Dドメインスワッピングは、いくつかの薬理学的用途を持つ二次代謝産物またはその他の生物学的に関連する経路の生成により、生物的および非生物的ストレス状態に影響を与える可能性があります。したがって、それらはこの調査の重要な焦点となります。Wal1の結晶構造は、非対称単位内に2つの二量体とシスタチンCに見られる構造再構成を特徴とするドメイン交換二量体配置を示しました。フィトシスタチンは非生物的ストレスにおいて重要な役割を果たし、作物の抵抗性も改善します。合計20,121の3Dドメインスワップ予測タンパク質が、入手可能な文献およびさまざまな関連リポジトリから同定されており、そのうち17,552は植物由来で、2569は非植物由来です17,18

文献では、機械学習アプローチを使用したさまざまな植物の3Dドメインスワッピング予測の他のさまざまな例が報告されています。シロイヌナズナは33.7%(12,033のレビューされた配列のうち4058)、Medicago truncatulaは20.9%(186のレビューされた配列のうち39)、Solanum tuberosumは36.5%(400のレビューされた配列のうち146)、Solanum lycopersicumは25.5%(423のレビューされた配列のうち108)、およびOcimum tenuiforumは15.5%(36841のレビューされた配列のうち5706)6.計算手法は、3D ドメイン交換タンパク質の構造的および機能的側面を探索する上で非常に貴重になっています。これらのアプローチは、可能な限り最良の特徴19、注釈、および濃縮分析に基づいて配列の予測を容易にし、基本的な分子メカニズムへの洞察を提供します。さまざまなタンパク質配列における3Dドメインスワッピングの予測は、サポートベクターマシン(SVM)ベースの分類器を使用して達成されました。このアプローチは、配列と構造的特徴を統合することによって開発され、トレーニングデータセットで76.33%、テストデータセットで73.81%の予測精度が得られ、タンパク質のドメインスワッピング傾向を特定する可能性を示しています20。SVM ではなく KNN を選択する主な理由は、KNN のトレーニング プロセスがはるかに単純であることです。設定するには、1つのメインパラメータであるK(予測を行うときに考慮される最近傍の数)のみが必要ですが、SVMでは、カーネルタイプ、C、ガンマなどのいくつかのパラメータを慎重に調整する必要があります。さらに、KNN はマルチクラス分類をより簡単に処理しますが、SVM は通常、1 対 1 の戦略などのより複雑な戦略を必要とします。

タンパク質構造予測のための機械学習
タンパク質構造の予測には、FASTA配列からタンパク質の3次元形状を推論することが含まれます。この分野の最近の進歩は、進化データへのさまざまな機械学習技術の適用によって大きく推進されています21,22。共進化データから情報を抽出するための初期のアプローチは、機械学習手法に依存していました。しかし、より最近の戦略、特に深い残差ネットワークを利用する戦略は、潜在的なターゲット23の予測において優れた性能を実証しています。Alphafold はディープラーニングベースのデータベースですが、Rosetta は物理ベースのエネルギー関数ツールです。これらのツールは、実験構造に近似できる完全な3D原子構造を予測するために使用されます。これらのツールは原子分解能の構造座標のみを提供しますが、これらのツールは 3D ドメイン イベントを指定しません。対照的に、提案されたアプローチは完全な3D構造予測因子ではなく、タンパク質が3Dドメインスワッピングを受ける可能性が高いかどうかを予測するだけです24,25

薬用植物は、その生理活性化合物により、さまざまな病気の予防と治療のための天然資源として何世紀にもわたって利用されてきました。これらは伝統医学に不可欠であり、現代の医薬品の開発に貢献しています。しかし、創薬のための薬用植物のタンパク質ドメインスワッピングの分野では、重要な研究は行われていません。機械学習とそのアンサンブル モデルを含むアルゴリズムは、シーケンス データのパターンと関係を認識して、3D ドメイン スワッピングを予測します。この研究で薬用植物を選択した理由は、3Dドメインスワッピングに関与する植物のタンパク質の機能的多様性を検出できるため、ストレス応答、病原体防御、代謝生合成の理解が得られるためです。NMRまたは結晶学技術を利用して、タンパク質の3Dドメインスワッピングを大量に決定し、複雑で高度なオリゴマーコンフォメーションを決定することに関連する技術的課題は、高度な計算アプローチを開発する必要性を浮き彫りにしています。

提案された研究作業の全体的な目標は、ランダムフォレスト(RF)26 およびK最近傍(KNN)27 アルゴリズムを使用して、タンパク質配列構造予測タスクに計算方法論を採用し、さまざまな薬用植物配列で交換された症例のゲノムワイド解析を完了することです。ランダムフォレスト(RF)はバイナリ分類器です。これは、タンパク質配列解析で広く使用されている堅牢で多用途な機械学習アルゴリズムです。これは、デシジョンツリー(DT)のアンサンブルを構築することによって動作し、トレーニングデータセットとテストデータセットの両方で非常に高い精度を達成します。タンパク質配列タスクの場合、RF は、物理化学的特性、配列組成、二次構造、配列アライメントまたはプロファイルから得られる進化情報など、さまざまな特徴を分析できます。大規模でノイズの多いデータセットの処理に優れており、特徴の重要度メトリック28 を提供します。K-Nearest Neighbors (KNN) 分類器は、タンパク質配列解析に広く適用されているシンプルかつ効果的な機械学習アルゴリズムです。これは、特徴空間内の k 個の最も近い隣人の多数派クラスに基づいて入力シーケンスを分類することによって機能します。タンパク質配列解析では、KNNを使用して機能カテゴリ、構造特性、および細胞内局在を予測できます。KNN分類の特徴には、多くの場合、アミノ酸組成、配列モチーフ、進化プロファイル、または物理化学的属性が含まれます。KNNは、そのシンプルさからタンパク質分析によく選ばれています。解釈可能性と有効性により、タンパク質配列解析のための貴重なツールになります29。これらのアルゴリズムを組み合わせることで補完的な強みが得られ、さまざまな薬用植物配列における 3D ドメイン スワッピングを研究するための包括的な計算フレームワークが可能になります。これら 2 つのモデルは、ドメイン スワッピングを受ける可能性のあるケースのみを予測します。完全な3D構造座標や、このスワッピングプロセスに特に関与している部品や残渣は予測されません。3次元ドメインevents.3Dスワッピングのメカニズムや機能面を明らかにするために、スワッピングに関与する特定の領域や残基を特定することは、閉ループ構成、オープンエンドスワップ、および異なるヒンジ領域やドメインアーキテクチャを含むその他の違いなど、構造的に異なるさまざまな現象で構成されているため、これはさらなる研究の問題です。これを踏まえて、提案されたアプローチは、あらゆる種類の3Dドメインスワッピングイベントを統一された分類の下でのみ分類します。この選択は当初、特定のクラスの3Dドメインスワッピングを指定できる注釈付きデータの可用性が限られていることによって推進されました。これは、さまざまな薬用植物ベースのデータセットに対する最初の種類の試みであり、異なるスワッピングメカニズムを区別することで、モデルの予測精度を高めることができると感じています。

薬用植物の濃縮分析は、生理活性化合物の合成とストレス反応に関与する主要な遺伝子、タンパク質、経路を特定するのに役立ちます。分子メカニズムについての洞察を提供します。薬用植物におけるこれらの分析では、生理活性化学物質の合成、ストレス回復力、耐病性に関連する必須遺伝子、タンパク質、生物学的プロセスを調査します。遺伝子オントロジー(GO)やKEGG経路解析など、選択されたタンパク質の機能アノテーションにより、二次代謝産物産生と環境ストレス応答の根底にある分子メカニズムが明らかになります。このアプローチは、創薬に実質的に役立つ、作物の回復力を向上させ、持続可能な農業と医薬品の進歩のための植物代謝経路を解明します。

研究の新たな貢献
この研究は、生物学的データセットのタンパク質構造パターンを予測するためのより正確で効率的なモデルを促進する機械学習の能力を強調しています。

この研究では、新しい機能を機械学習アルゴリズムに統合し、タンパク質機能をより明確に予測する能力を向上させます。このような特徴により、タンパク質の構造と機能の関係の理解が深まり、タンパク質工学におけるより正確なタンパク質設計と最適化に役立ちます。

予測されたタンパク質の濃縮分析は、主要な生物学的経路、細胞プロセス、および分子機能を見つけるのに役立ち、バイオマーカーの発見、医薬品設計、および疾患メカニズムの理解に貴重な標的を提供します。この分析により、経路ベースの介入と治療標的の特定の精度が向上します。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

プロトコル

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

注:このセグメントは、(a)データ収集、(b)特徴選択、(c)データの前処理、(d)データの後処理(e)モデル開発、(f)提案されたモデルの結果評価、および(g)正の予測シーケンスの異なるレベルでのエンリッチメント分析の6つの主要なステップを含む、提案された方法論の包括的な概要を提供します。Core i5-10500 は、この研究で使用された第 10 世代プロセッサです。6 コアと 12 スレッドを備え、基本周波数は 3.10 GHz、最大ターボ速度は 4.50 GHz です。12 MB の Intel Smart Cache が搭載され、DDR4-2666 メモリをサポートし、統合ビジュアル用の UHD Graphics 630 が含まれています。効率的なマルチタスクと生産性を実現するように構築されており、LGA 1200 ソケットと互換性があり、65W TDP で動作します。

1. データ収集

  1. Use3d3dswap-pred (https://caps.ncbs.res.in/3dswap-pred/3dswap-pred.html) および 3DSwap+ (https://caps.ncbs.res.in/3Dswapplus/index.html)3030 補足表 1、補足表 2、補足ファイル 1、補足ファイル 2)。主に薬用植物由来の3Dドメインスワップ分子の合計573の手動でキュレーションされたPDBエントリを使用します。
  2. Best Representative Profile(BRP)法を採用して、各Pfam31 タンパク質ファミリー(http://pfam.xfam.org/)にBest Representative Sequence(BRS)を割り当てることにより、ネガティブデータセットを構築します。HMMER32 (https://www.ebi.ac.uk/Tools/hmmer/)を使用して、すべてのPfam BRPに対して合計10,112の構造配列を検索し、E値しきい値は0.001です。DIAL を使用して結果のシーケンスを処理し、構造ドメイン (https://bioinformaticshome.com/db/tool/DIAL) を識別します。575 個の PDB エントリをネガティブ データセットとして含めます (トレーニング)。
  3. BRP法によって導出された314のタンパク質配列と、3DSwap+によってネガティブデータセットとして識別された261の手動でキュレーションされた非3Dドメインスワップ配列を含めます。
  4. UniProt33 (https://www.uniprot.org/)から、さまざまな薬用植物から合計1,355のレビューされたタンパク質配列エントリを取得します。この研究には 13 種類の薬用植物が含まれます (テスト/予測データセット): Citrus sinensis (RS-102)、Vitis vinifera (RS-226)、Mentha (RS-28)、Cannabis sativa (RS-21)、Acorus clamus (RS-511)、Coffea arabica (RS-104)、Papaver somniferum (RS-58)、Hibiscus (RS-88)、Jasmine (RS-89)、Thyme (RS-30)、Thymus (RS-14)、Illicium oligandrum (RS-72)、および Citrus limon (RS-12)。系統樹は 補足図1に示されています。

2. モデル作成のための機能の使用

  1. 薬用植物のタンパク質配列を予測するための 453 の特徴からなる包括的な特徴セットを利用します。徹底的な文献レビューに基づいて慎重に選択された 439 の確立された機能と 16 の新しい機能が含まれています。
  2. AAindexデータベース34(https://www.genome.jp/aaindex/)を使用して、アミノ酸の物理化学的特性を決定します。特徴量選択に WEKA35 機械学習プラットフォーム (https://www.waikato.ac.nz/int/research/institutes-centres-entities/institutes/artificial-intelligence-institute/research/software/) を適用します。新しく組み込まれた機能については、表 2 を参照してください。

表 2: 新しく追加された機能とその説明のリスト。 この表は、3Dドメインスワッピングの予測におけるモデルのパフォーマンスを向上させるために、特徴抽出フェーズで設計された新しい特徴をまとめたものです。各特徴は、ドメインスワッピングの傾向に影響を与えると仮定されているタンパク質の特定の配列ベース、物理化学的、または構造的特性を捉えます。各特徴の生物学的関連性と計算上の導出を明確にするために、詳細な説明が提供されます。 この表をダウンロードするには、ここをクリックしてください。

3. データの前処理と後処理

注:データの前処理。データの前処理は、分析用の生データの準備を含む機械学習の重要なステップです。これには、データのクリーニング (重複の削除、欠損値の処理など) が含まれます。

  1. Supplementary Coding File 1 を使用して、カテゴリ変数を数値形式にエンコードし、これには 4 つの主要なステップが含まれます: (1) スコア辞書の定義、(2) シーケンス I0 によるファスタ シーケンスの処理。解析、(3)データフレームの作成、(4)3Dドメインスワップ特徴の数値解析。
  2. データの後処理を通じてモデルの出力を改良し、解釈します。予測を再調整し、結果を集計し、分類のしきい値を適用します。以前の研究36,37,38でサポートされているように、しきい値β = 0.5(範囲0-1)を使用してバイモーダル3Dドメインスワッピングデータセットを分類します。
  3. データセットを 70:30 のトレーニングとテストの分割で分割し、モデルのトレーニングに 70%、独立した評価に 30% を割り当てます。
  4. 標準スケーラー法を使用してトレーニング データを標準化し、特徴値を平均 0 と標準偏差 1 に調整し、機械学習推定器との互換性を高めます。特徴量の選択を実行して、最も影響力のある変数を特定します。
    注: データセットの標準化は、最適なパフォーマンスを確保するために多くの機械学習アルゴリズムで広く使用されている前提条件です。正規分布からかけ離れたデータは、機械学習モデルのパフォーマンスに悪影響を与える可能性があります39
  5. 検証を行います。堅牢で偏りのないモデル評価を保証するために、K-fold 交差検証も実装されました 補足表 3
  6. データセットを K 個のサブセットに分割します。K=5 のサブセットでモデルを反復的にトレーニングおよび評価し、残りのサブセットを独立したテストに使用します。

4. モデルの作成と実装

  1. ランダムフォレスト(RF)およびK最近傍(KNN)アルゴリズムを実装および微調整して、予測パフォーマンスを最適化します。トレーニングには573および575のタンパク質配列、テストには1,355のタンパク質配列を使用して、モデルをトレーニング、検証、およびテストします。
  2. Pythonスクリプト (Supplementary Coding File 1) を使用して、選択したタンパク質配列に基づいて数値特徴値を抽出します。両方のデータセットのこれらの数値を CSV ファイルに保存し、二項分類モデルを生成するために RF および KNN 分類器に送信します。
  3. これらのモデルを使用して、3Dドメインスワップタンパク質と非3Dドメインスワップタンパク質を区別します。3Dドメインスワッピングを予測するための一般化されたフレームワークについては、 図2図3 を参照してください。
  4. RFモデルには、n_estimators=20、max_depth=4、random_state=42などのハイパーパラメータを適用します。
  5. KNN 分類器モデルにハイパー パラメーター neighbors=5 を適用します。
    注:これらのパラメータ設定は、手動でキュレーションされた薬用植物データセットでのモデルのパフォーマンスを向上させるために微調整されました。

figure-protocol-1
図2:図示的な概略図。 この表現は、ランダムフォレストとK最近傍(KNN)機械学習モデルを示しており、二項分類タスクのコンテキストにおけるアルゴリズム構造と機能ワークフローを示しています。 この図の拡大版を表示するには、ここをクリックしてください。

figure-protocol-2
図 3: 機械学習ベースのワークフロー。 この図は、薬用植物タンパク質の3Dドメインスワッピングを予測するための機械学習ベースのワークフローを示しています。このプロセスは、ベンチマーク データセットとメタ データセットを組み合わせたデータセットの取得から始まります。特徴抽出には、タンパク質配列から既存の特徴と新しい特徴の両方を導き出すことが含まれます。データセットの前処理では、FASTAシーケンスはシーケンス解析と辞書マッピングを使用して数値に変換され、特定の3Dドメインスワップ機能を含む構造化データフレームが作成されます。後処理には、しきい値 (β = 0.5) を使用したドメイン スワップ ステータスの割り当て、トレーニング セットとテスト セットへのデータの分割 (70-30 の比率)、特徴の標準化、および k 倍の検証による特徴選択の実行が含まれます。ランダムフォレスト(RF)とK-Nearest Neighbors(KNN)の2つの機械学習モデルを学習させ、AUROCとAUPRCとともにモデル指標を用いてその性能を評価し、予測精度と堅牢性を評価します 。この図の拡大版を表示するには、ここをクリックしてください。

5. ML分類器の静的評価とモデル評価

  1. ランダムフォレスト(RF)およびK最近傍(KNN)アルゴリズムを実装および微調整して、予測パフォーマンスを最適化します。トレーニングには573および575のタンパク質配列、テストには1,355のタンパク質配列を使用して、モデルをトレーニング、検証、およびテストします。
    figure-protocol-3(1)
    figure-protocol-4(2)
    figure-protocol-5(3)
    figure-protocol-6(4)
    figure-protocol-7(5)
    figure-protocol-8(6)
    注:TP(真陽性)は、モデルによってドメインスワップとして正しく予測された配列の割合として定義します。TN(真陰性)は、ドメインスワップされていないと正しく予測された配列の割合として定義します。偽陽性(FP)は、ドメインスワップされていないタンパク質がドメインスワップとして誤って予測されるケースとして定義します。偽陰性(FN)は、ドメインスワップされたタンパク質がドメインスワップされていないものとして誤って予測されるケースとして定義します。
  2. Xsen を正確に識別された真陽性の比率として計算し、Xspe をモデルによって正しく識別された真陰性の比率として計算します。
    注: MCC を使用して、混同行列から真陽性、真陰性、偽陽性、および偽陰性を分析することにより、二項分類の品質を評価します。
  3. 精度の計算 (ACC) は、予測全体に占める正しい予測の割合を測定します。
    注:精度は、予測されたすべての陽性のうち正しく識別された陽性の割合を評価しますが、F1スコアは精度と感度の調和平均であり、偽陽性と偽陰性を平衡化します。
  4. AUC を使用して、二項分類タスクにおける分類モデルのパフォーマンスを評価します。正および負に分類されたタンパク質に基づいて、Scikit-learn Pythonライブラリ40を使用してAUC(Area Under the Curve)を計算します。
  5. テストデータを使用して、これらのパラメータを評価します。

6. 各種薬用植物種における3次元ドメインスワッピング予測モデルの実装

  1. Citrus sinensis、Mentha、Vitis vinifera、Thyme、Thymus vulgaris、Jasmine、Hibiscus、Papaver somniferum、Illicium oligandrum、Citrus limon、Acorus calamus、Cannabis sativa、Coffea arabicaなど、13種類の薬用植物からの合計1,355のレビューされたシーケンス(予測データセット)にRFとKNNを適用します。
    注:これらのタンパク質は、シトラスシネンシス、メンサ、タイムなどのさまざまな機能に関連しており、消化不良を助けます。Vitis vinifera、ジャスミン、ハイビスカスは 抗酸化物質の非常に豊富な供給源であり、皮膚の健康も改善します。イリシウム・オリガンドラム は、抗真菌性、抗菌性などで知られています。

7. 薬用植物由来の正予測3Dドメインスワップタンパク質の濃縮研究

  1. UniProtのデータを使用して、これらのタンパク質配列のアクセッションコードを二次代謝物カテゴリにマッピングします。
  2. 予測された配列から遺伝子IDを抽出します。
  3. KEGGオンラインWebサーバー41 (https://www.genome.jp/kegg/)を開き、個々の遺伝子IDまたはタンパク質名を貼り付けてそれぞれの経路を確認することで、KEGG経路濃縮解析を行います。
  4. 予測された3Dドメインスワッピングタンパク質を予測データセットと対比して比較分析を実行し、特定の遺伝子オントロジー(GO)用語と生物学的経路の統計的に有意な過剰表現を検出します。予測された配列の遺伝子IDをShinyGO v0.742 (https://bioinformatics.sdstate.edu/go74/)に貼り付け、目的の機能または経路カテゴリ(生物学的機能、細胞成分、分子機能、KEGGなど)を選択します。
    注:これらのアノテーションは、ユーザがPythonコードを記述および実行することを可能にするオンラインクラウドベースのプラットフォーム43 を使用して視覚化する。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

結果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

3Dドメインスワッピングを示すタンパク質は、さまざまな生物学的機能に関連していることがよくあります。しかし、3Dドメインスワッピングに関与したタンパク質配列の体系的なゲノムワイド分析は、ほとんど未調査のままです。本研究では、13種類の薬用植物から推定される3Dドメインスワップタンパク質を、二次代謝産物ドメイン、KEGG経路、遺伝子オントロジー(GO)用語との関連性に着目して、推定予測する初期調査を実施しました。アクセシブルな文献の包括的な分析と応用機械学習モデルの性能評価により、提案されたモデルであるランダムフォレスト(RF)は、K最近傍(KNN)と比較して、3Dドメインスワップカテゴリの予測において優れた結果を示していることが示されています。 図4Aでは、AUCが高いことはAUROC分析の優れた性能を表しています。RF(AUC=-0.914)モデルは、3D-DSクラスと3D-NDSクラスを区別する強力な能力を示しています。KNN モデルの AUC 値 (AUC=-0.883) は RF よりわずかに低いですが、それでも 3D ドメインスワップと 3D 非ドメインスワップを分類...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

ディスカッション

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

完全なゲノムにわたるタンパク質の 3D ドメイン スワッピングの理解は、さまざまな分野で非常に重要です。機械学習アプローチ、特にランダムフォレストとK最近傍26,27は、ゲノムレベルでタンパク質配列データから直接3Dドメインスワッピングを予測するために採用されています。これら 2 つの ML モデルには、データセットの収集、特徴の選択、データの前/後処理、カスタマイズされたモデル スクリプトの実装、モデル評価などのさまざまなステップが含まれます。RF モデルと KNN モデルは、それぞれ 91.6% と 88.7% の精度を示しています。これらの予測モデルは、その後、13種の薬用植物種のさまざまな完全なゲノムに適用されました。

私たちの知る限り、これは、ML技術を利用して薬用植物のゲノムスケールで3Dドメインスワッピング症例を調査する最初の包括的な取り組みです。SVMよりもKNNが選ばれたのは、SV...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

開示事項

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者らは、この論文で報告された研究に影響を与えると思われる競合する経済的利益や個人的な関係が知られていないことを宣言します。

謝辞

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

この研究には資金は提供されませんでした。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

材料

この記事で使用された材料の一覧
名前会社カタログ番号コメント
3DSwap+https://caps.ncbs.res.in/3Dswapplus/index.html 
PfamEMBL-EBIhttp://pfam.xfam.org/: 
HMMEREMBL-EBI;
Aaindexhttps://www.genome.jp/aaindex/:
ダイヤルBioinformaticshome.comhttps://bioinformaticshome.com/db/tool/DIAL: 
WEKAウェカトhttps://www.waikato.ac.nz/int/research/institutes-centres-entities/institutes/artificial-intelligence-institute/research/software/
 KEGGhttps://www.genome.jp/kegg/ :
ShinyGOhttps://bioinformatics.sdstate.edu/go/ :
uniprotUniprothttps://www.uniprot.org/ :
https://www.ebi.ac.uk/Tools/hmmer/:  大学

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Radivojac, P., et al. A large-scale evaluation of computational protein function prediction. Nat Methods. 10 (3), 221-227 (2013).
  2. Bennett, M. J., et al. 3D domain swapping: a mechanism for oligomer assembly. Protein Sci. 4, 2455-2468 (1995).
  3. Bennett, M. J., et al. Domain swapping: entangling alliances between proteins. Proc Natl Acad Sci U S A. 91, 3127-3131 (1994).
  4. Liu, Y., et al. The crystal structure of a 3D domain-swapped dimer of RNase A at a 2.1-Å resolution. Proc Natl Acad Sci U S A. 95 (7), 3437-3442 (1998).
  5. Straub, J. E., et al. Principles governing oligomer formation in amyloidogenic peptides. Curr Opin Struct Biol. 20, 187-195 (2010).
  6. Upadhyay, A. K., et al. Genome-wide prediction and analysis of 3D domain-swapped proteins in the human genome from sequence information. PLoS One. 11 (7), e0159627(2016).
  7. Liu, Y., et al. 3D domain swapping: as domains continue to swap. Protein Sci. 11, 1285-1299 (2002).
  8. Schlunegger, M. P., et al. Oligomer formation by 3D domain swapping: a model for protein assembly and misassembly. Adv Protein Chem. 50, 61-122 (1997).
  9. Rousseau, F., et al. Implications of 3D domain swapping for protein folding, misfolding and function. Adv Exp Med Biol. 747, 137-152 (2012).
  10. Anderson, W. F., et al. Structure of the Cro repressor from bacteriophage λ and its interaction with DNA. Nature. 290 (5809), 754-758 (1981).
  11. Albright, R. A., et al. High-resolution structure of an engineered Cro monomer shows changes in conformation relative to the native dimer. Biochemistry. 35, 735-742 (1996).
  12. Bax, B., et al. X-ray analysis of beta B2-crystallin and evolution of oligomeric lens proteins. Nature. 347, 776-780 (1990).
  13. Parge, H. E., et al. Human CksHs2 atomic structure: A role for its hexameric assembly in cell cycle control. Science. 262, 387-395 (1993).
  14. Fita, I., et al. The NADPH binding site on beef liver catalase. Proc Natl Acad Sci U S A. 82 (6), 1604-1608 (1985).
  15. Milburn, M. V., et al. A novel dimer configuration revealed by the crystal structure at 2.4 Å resolution of human interleukin-5. J Biol Chem. 268, 2117-2120 (1993).
  16. Upadhyay, A. K., et al. Genome-wide analysis of domain-swap predicted products in the genome of anti-stress medicinal plant: Ocimum tenuiflorum. Bioinformat Biol Insights. 13, 1177932218821362(2019).
  17. Simpson, G. A., et al. Crystal structure and interconversion of monomers and domain-swapped dimers of the walnut tree phytocystatin. Biochim Biophys Acta Prot Proteom. 1872 (2), 140975(2024).
  18. Tran, L. H., et al. 3D domain swapping dimerization of the receiver domain of cytokinin receptor CRE1 from Arabidopsis thaliana and Medicago truncatula. Front Plant Sci. 24 (12), 756341(2021).
  19. Shameer, K., et al. Insights into protein sequence and structure-derived features mediating 3D domain swapping mechanism using support vector machine-based approach. J Bioinform Comput Biol. 4, 33-42 (2010).
  20. Shameer, K., et al. 3dswap-pred: prediction of 3D domain swapping from protein sequence using Random Forest approach. Protein Pept Lett. 19, 1010-1020 (2012).
  21. Tasnim, F. Protein sequence classification through deep learning and encoding strategies. Proc Comp Sci. 238, 876-881 (2024).
  22. Xu, Y., et al. Deep dive into machine learning models for protein engineering. J Chem Info Modeling. 60 (6), 2773-2790 (2020).
  23. Lilhore, U. K., et al. Optimizing protein sequence classification: integrating deep learning models with Bayesian optimization for enhanced biological analysis. BMC Med Inform Decis Mak. 24, 236(2024).
  24. Jumper, J., et al. Highly accurate protein structure prediction with AlphaFold. Nature. 596 (7873), 583-589 (2021).
  25. Du, Z., et al. The trRosetta server for fast and accurate protein structure prediction. Nat Protoc. 16 (12), 5634-5651 (2021).
  26. Genuer, R., et al. Random forests: Some methodological insights. arXiv. , (2008).
  27. Guo, G., et al. KNN model-based approach in classification. Lect Notes Comput Sci. 2888, 986-996 (2003).
  28. Kathuria, C., et al. Predicting the protein structure using random forest approach. Procedia Comput Sci. 132, 1654-1662 (2018).
  29. Gui, Y., et al. Application of K-nearest neighbors in protein-protein interaction prediction. Highlights Sci Eng Technol. 2, 125-131 (2022).
  30. Joseph, A. P., Shingate, P., Upadhyay, A. K., Sowdhamini, R. 3PFDB+: improved search protocol and update for the identification of representatives of protein sequence domain families. Database. 2014, bau026(2014).
  31. Finn, R. D., et al. The Pfam protein families database. Nucl Acids Res. 41, D211-D222 (2013).
  32. Mistry, J., et al. Challenges in homology search: HMMER3 and convergent evolution of coiled-coil regions. Nucl Acid Res. 41, e121(2013).
  33. Apweiler, A. UniProt: The universal protein knowledgebase. Nucl Acids Res. 46 (5), 2699-2699 (2018).
  34. Kawashima, S., et al. AAindex: amino acid index database, progress report 2008. Nucl Acids Res. 36, D202-D205 (2008).
  35. Frank, E., et al. Data mining in bioinformatics using WEKA. Bioinformatics. 20, 2479-2481 (2004).
  36. Pedregosa, F., et al. Scikit-learn: Machine Learning in Python. J Mach Learn Res. 12, 2825-2830 (2011).
  37. Wu, C., et al. Prediction of DNA methylation site status based on fusion deep learning algorithm. IEEE AEMCSE Proc. 5, 180-183 (2022).
  38. Wilhelm, T., et al. Phenotype prediction based on genome-wide DNA methylation data. BMC Bioinform. 15, 1-15 (2014).
  39. Uddin, S., et al. Dataset meta-level and statistical features affect machine learning performance. Sci Rep. 14 (1), 1F670(2024).
  40. Pedregosa, F., et al. Scikit-learn: Machine Learning in Python. J Mach Learn Res. 12, 2825-2830 (2011).
  41. Kanehisa, M., et al. Kyoto encyclopedia of genes and genomes. Nucl Acid Res. 28 (1), 27-30 (2000).
  42. Ge, S. X., et al. ShinyGO: a graphical gene-set enrichment tool for animals and plants. Bioinformatics. 36 (8), 2628-2629 (2020).
  43. Bisong, E. Google Colaboratory. Building Machine Learning and Deep Learning Models on Google Cloud Platform. , Apress. Berkeley, CA. (2019).
  44. Kirby, G. W. Biosynthesis of the morphine alkaloids. Science. 155 (3759), 170-173 (1967).
  45. Toffolatti, S. L., et al. Role of terpenes in plant defence to biotic stress. Biocont Agents Sec Metabol. , 401-417 (2021).
  46. Boncan, D. A. T., et al. Terpenes and terpenoids in plants: interactions with environment and insects. Int J Mol Sci. 21 (19), 7382(2020).
  47. Mansouri, H., et al. The response of terpenoids to exogenous gibberellic acid in Cannabis sativa L. at vegetative stage. Acta Physiol. Plant.33, 1085-1091 (2011).
  48. Pál, M., et al. Speculation: Polyamines are important in abiotic stress signalling. Plant Sci. 237, 16-23 (2015).
  49. Mattoo, A. K., et al. Higher polyamines restore and enhance metabolic memory in ripening fruit. Plant Sci. 174 (4), 386-393 (2008).

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

再版と許可

このJoVE記事のテキストまたは図の再利用許可をリクエスト

許可をリクエスト

タグ

3D K KEGG
動画は近日公開

関連記事