この研究では、さまざまな薬用植物ゲノムからの3Dドメインスワッピングに関与する、または関与すると予測されるタンパク質を調べます。機械学習モデルを採用して、3D ドメイン交換タンパク質を正確に予測し、その機能と二次代謝産物産生との関連性を予測します。
方法論記事
この研究では、さまざまな薬用植物ゲノムからの3Dドメインスワッピングに関与する、または関与すると予測されるタンパク質を調べます。機械学習モデルを採用して、3D ドメイン交換タンパク質を正確に予測し、その機能と二次代謝産物産生との関連性を予測します。
3Dドメインスワッピングは、2つ以上のタンパク質サブユニットが同一の構造サブユニットを交換してオリゴマーを形成するタンパク質構造現象です。3Dドメインスワッピングを示すタンパク質は、二次代謝産物の生合成などのさまざまな生物学的機能や、薬用植物におけるいくつかの生物的および非生物的ストレスへの対処において重要な役割を果たします。本研究では、ランダムフォレストモデルとK最近傍分類器モデルを用いて、薬用植物のゲノム間の3次元ドメインスワッピングパターンを予測する能力を調査し、それぞれ91.6%と88.7%の精度を実証しました。合計420(31%)の配列が、3Dドメインスワッピングに関与していると推定されると予測されました。また、遺伝子オントロジー(GO)用語、京都遺伝子ゲノム大百科事典(KEGG)経路解析、および二次代謝産物生合成経路におけるドメイン分布に基づく機能アノテーションのために、さまざまな薬用植物から予測された3Dドメインスワップタンパク質配列について濃縮調査を実施しました。予測された配列の機能的注釈は、3Dドメインスワップ配列が、光合成活性の環状電子輸送経路内の電子伝達、酸化的リン酸化、二次代謝産物(テルペノイド、 アルカロイド、およびポリアミン)。これらの発見は、3D ドメイン交換現象におけるタンパク質の関与、それぞれの機能、および創薬や生物工学の取り組みを促進するタンパク質の可能性を予測する機械学習の能力を強調しています。
計算手法は、タンパク質の構造、機能、相互作用に関する詳細な分析と予測を可能にすることで、タンパク質研究に革命をもたらしました。タンパク質の機能の正確な同定と注釈は、生命の分子メカニズムを解明するために不可欠であり、医学と医薬品開発の進歩にとって非常に重要です。ただし、実験方法には固有の複雑さと費用がかかるため、大規模なシーケンス データに対応するためのスケーラビリティが制限されます。その結果、タンパク質機能予測のための計算手法の開発は、計算生物学および分子生物学における極めて重要な分野として浮上し、革新的な大規模アプローチを通じてこのギャップに対処しています1。
3Dドメインスワッピング2 は、共有構造のセグメントが個々の鎖間で交換されるタンパク質の構造現象です。1994年、3Dドメインスワッピングのメカニズムに関する入門文書がジフテリア毒素二量体3で発見されました。ただし、3D ドメイン スワッピングの基本原則は 40 年前にさかのぼることができます。ウシ膵臓リボヌクレアーゼA(RNase A)は、高度な化学修飾実験を通じて、酢酸中での凍結乾燥中に二量体を形成することが観察されています4。タンパク質オリゴマー化では、2つ以上のタンパク質鎖が柔軟なヒンジ領域を介して同一の構造要素を交換します。単量体サブユニット間で交換されるタンパク質の部分はスワップドメインと呼ばれ、特定のタンパク質の球状ドメイン全体、ループ、または二次構造要素で構成される場合があります。逆に、モノマー内の元の位置に変化しない領域は、非スワップドメイン5と呼ばれます。非スワップドメイン間の結合は、 図 1 に示す非スワップドメイン・インターフェース (NSDI) として定義されます。3Dドメインスワッピングでは、あるタンパク質サブユニットのスワップされていないドメインと別のサブユニットのすでにスワップされたドメインとの関係を、スワップドメインインターフェース(SDI)と呼びます。この現象のもう 1 つの重要な側面は、スワップされていないドメインとスワップされたドメインを接続する柔軟なリンカー セグメントであるヒンジ領域です。このヒンジ領域は、3Dドメインスワッピングの動きを助ける上で重要な機能を果たし、コンフォメーションスイッチとして機能し、ドメインスワッピングに必要な構造再構成を可能にします。3Dドメインスワッピングは、タンパク質の集合や機能調節など、さまざまな生物学的プロセスに関与しています5。また、異常なスワッピングが凝集体やアミロイド原線維の形成につながる可能性がある特定のタンパク質ミスフォールディング疾患にも関連しています。

図1:3Dドメインスワッピングの構造表現。 この表現は、柔軟なヒンジ領域を介して2つのタンパク質モノマー間の同一の構造要素の交換を示し、その結果、ドメインスワップされた二量体またはオリゴマーアセンブリが形成されます。 この図の拡大版を表示するには、ここをクリックしてください。
異なるタイプの3Dドメインスワッピングは、スワップされたドメインの性質と結果として生じるオリゴマー構造6に基づいて同定されている。2002年、アイゼンバーグと彼らの同僚は、3Dドメインスワッピングの3つのタイプを特定しました:正真正銘のドメインスワッピング(BDS)、準ドメインスワッピング(QDS)、および3Dドメインスワッピング(CDS)の候補7。最も一般的なタンパク質クラスは、正真正銘のドメインスワッピングです。これは、二量体分子とモノマー分子の両方が安定した形で存在する状態を指し、二量体はドメインスワップ配置を採用し、モノマーは閉じた配置を採用することになっています。準ドメインスワッピングでは、タンパク質はオリゴマー状態で存在することが知られていますが、その相同構造はモノマー状態で存在することが知られています。CDSでは、ドメインスワップカテゴリのタンパク質分類のみを確認するのに対し、関与するモノマーまたはそれらのモノマー相同体の構造情報は存在しません8。この手順では、モノマーまたはそれらのモノマー相同体は存在しません。むしろ、異種のタンパク質分子が存在します。 表1は 、これら3つのカテゴリ9の例を示しています。
表1:例による3Dドメインスワッピングの種類。この表をダウンロードするには、ここをクリックしてください。
その後の研究により、多数のドメインスワップ構造が明らかになり、3D ドメインスワッピングの概念を理解する道が開かれました。この現象を裏付ける最も初期の構造的証拠は、バクテリオファージλ由来のCroリプレッサータンパク質の分子で観察され、C末端鎖の交換を通じて二量体構造を形成します。1996年、研究者は単量体Cro分子が3Dドメインスワッピングに関与していることを発見しました10。βB2-クリスタリン12、ヒトCksHs213、牛肝カタラーゼ14、組換えヒトインターロイキン-515などの他の構造11も、3Dドメインスワップ構造の可能性として報告されました。タンパク質分子内のスワップドメイン位置に基づいて、3Dドメインスワッピングは、C末端ドメインスワッピング、N末端ドメインスワッピング、および比較的まれな中心ドメインスワッピングの3つのタイプに分類されます。著者らは、完全なヒトゲノムを使用して、ドメインスワップ症例を予測します。ランダム フォレストとサポート ベクター マシンをバイナリ分類器として使用し、精度はそれぞれ 81.7% と 73.9% です。タンパク質配列のほぼ44%が、ヒトゲノム6で3Dドメインスワップとして予測されました。遺伝子オントロジー(GO)に基づいて、予測された症例のドメイン分布、疾患分布、機能アノテーションについて濃縮分析を実施しました。別のアプローチでは、ランダムフォレストアプローチを使用してOcimum tenuiforumの完全なゲノムワイド解析を調査し、Ocimum tenuiforumのタンパク質配列のほぼ25%が3Dドメインスワッピングに関与していると予測されていることがわかりました。研究者らはまた、GO項の関連とそのタンパク質ドメインファミリーの関連を使用して機能注釈を実行し、非生物的ストレスに関与しているのは1158の配列のみであることを発見しました16。
植物はさまざまな特徴的なタンパク質ファミリーを示しており、特定のタンパク質は3Dドメインスワッピングなどの構造再構成を受ける能力を持っていることが認識されています。3Dドメインスワッピングは、いくつかの薬理学的用途を持つ二次代謝産物またはその他の生物学的に関連する経路の生成により、生物的および非生物的ストレス状態に影響を与える可能性があります。したがって、それらはこの調査の重要な焦点となります。Wal1の結晶構造は、非対称単位内に2つの二量体とシスタチンCに見られる構造再構成を特徴とするドメイン交換二量体配置を示しました。フィトシスタチンは非生物的ストレスにおいて重要な役割を果たし、作物の抵抗性も改善します。合計20,121の3Dドメインスワップ予測タンパク質が、入手可能な文献およびさまざまな関連リポジトリから同定されており、そのうち17,552は植物由来で、2569は非植物由来です17,18。
文献では、機械学習アプローチを使用したさまざまな植物の3Dドメインスワッピング予測の他のさまざまな例が報告されています。シロイヌナズナは33.7%(12,033のレビューされた配列のうち4058)、Medicago truncatulaは20.9%(186のレビューされた配列のうち39)、Solanum tuberosumは36.5%(400のレビューされた配列のうち146)、Solanum lycopersicumは25.5%(423のレビューされた配列のうち108)、およびOcimum tenuiforumは15.5%(36841のレビューされた配列のうち5706)6.計算手法は、3D ドメイン交換タンパク質の構造的および機能的側面を探索する上で非常に貴重になっています。これらのアプローチは、可能な限り最良の特徴19、注釈、および濃縮分析に基づいて配列の予測を容易にし、基本的な分子メカニズムへの洞察を提供します。さまざまなタンパク質配列における3Dドメインスワッピングの予測は、サポートベクターマシン(SVM)ベースの分類器を使用して達成されました。このアプローチは、配列と構造的特徴を統合することによって開発され、トレーニングデータセットで76.33%、テストデータセットで73.81%の予測精度が得られ、タンパク質のドメインスワッピング傾向を特定する可能性を示しています20。SVM ではなく KNN を選択する主な理由は、KNN のトレーニング プロセスがはるかに単純であることです。設定するには、1つのメインパラメータであるK(予測を行うときに考慮される最近傍の数)のみが必要ですが、SVMでは、カーネルタイプ、C、ガンマなどのいくつかのパラメータを慎重に調整する必要があります。さらに、KNN はマルチクラス分類をより簡単に処理しますが、SVM は通常、1 対 1 の戦略などのより複雑な戦略を必要とします。
タンパク質構造予測のための機械学習
タンパク質構造の予測には、FASTA配列からタンパク質の3次元形状を推論することが含まれます。この分野の最近の進歩は、進化データへのさまざまな機械学習技術の適用によって大きく推進されています21,22。共進化データから情報を抽出するための初期のアプローチは、機械学習手法に依存していました。しかし、より最近の戦略、特に深い残差ネットワークを利用する戦略は、潜在的なターゲット23の予測において優れた性能を実証しています。Alphafold はディープラーニングベースのデータベースですが、Rosetta は物理ベースのエネルギー関数ツールです。これらのツールは、実験構造に近似できる完全な3D原子構造を予測するために使用されます。これらのツールは原子分解能の構造座標のみを提供しますが、これらのツールは 3D ドメイン イベントを指定しません。対照的に、提案されたアプローチは完全な3D構造予測因子ではなく、タンパク質が3Dドメインスワッピングを受ける可能性が高いかどうかを予測するだけです24,25。
薬用植物は、その生理活性化合物により、さまざまな病気の予防と治療のための天然資源として何世紀にもわたって利用されてきました。これらは伝統医学に不可欠であり、現代の医薬品の開発に貢献しています。しかし、創薬のための薬用植物のタンパク質ドメインスワッピングの分野では、重要な研究は行われていません。機械学習とそのアンサンブル モデルを含むアルゴリズムは、シーケンス データのパターンと関係を認識して、3D ドメイン スワッピングを予測します。この研究で薬用植物を選択した理由は、3Dドメインスワッピングに関与する植物のタンパク質の機能的多様性を検出できるため、ストレス応答、病原体防御、代謝生合成の理解が得られるためです。NMRまたは結晶学技術を利用して、タンパク質の3Dドメインスワッピングを大量に決定し、複雑で高度なオリゴマーコンフォメーションを決定することに関連する技術的課題は、高度な計算アプローチを開発する必要性を浮き彫りにしています。
提案された研究作業の全体的な目標は、ランダムフォレスト(RF)26 およびK最近傍(KNN)27 アルゴリズムを使用して、タンパク質配列構造予測タスクに計算方法論を採用し、さまざまな薬用植物配列で交換された症例のゲノムワイド解析を完了することです。ランダムフォレスト(RF)はバイナリ分類器です。これは、タンパク質配列解析で広く使用されている堅牢で多用途な機械学習アルゴリズムです。これは、デシジョンツリー(DT)のアンサンブルを構築することによって動作し、トレーニングデータセットとテストデータセットの両方で非常に高い精度を達成します。タンパク質配列タスクの場合、RF は、物理化学的特性、配列組成、二次構造、配列アライメントまたはプロファイルから得られる進化情報など、さまざまな特徴を分析できます。大規模でノイズの多いデータセットの処理に優れており、特徴の重要度メトリック28 を提供します。K-Nearest Neighbors (KNN) 分類器は、タンパク質配列解析に広く適用されているシンプルかつ効果的な機械学習アルゴリズムです。これは、特徴空間内の k 個の最も近い隣人の多数派クラスに基づいて入力シーケンスを分類することによって機能します。タンパク質配列解析では、KNNを使用して機能カテゴリ、構造特性、および細胞内局在を予測できます。KNN分類の特徴には、多くの場合、アミノ酸組成、配列モチーフ、進化プロファイル、または物理化学的属性が含まれます。KNNは、そのシンプルさからタンパク質分析によく選ばれています。解釈可能性と有効性により、タンパク質配列解析のための貴重なツールになります29。これらのアルゴリズムを組み合わせることで補完的な強みが得られ、さまざまな薬用植物配列における 3D ドメイン スワッピングを研究するための包括的な計算フレームワークが可能になります。これら 2 つのモデルは、ドメイン スワッピングを受ける可能性のあるケースのみを予測します。完全な3D構造座標や、このスワッピングプロセスに特に関与している部品や残渣は予測されません。3次元ドメインevents.3Dスワッピングのメカニズムや機能面を明らかにするために、スワッピングに関与する特定の領域や残基を特定することは、閉ループ構成、オープンエンドスワップ、および異なるヒンジ領域やドメインアーキテクチャを含むその他の違いなど、構造的に異なるさまざまな現象で構成されているため、これはさらなる研究の問題です。これを踏まえて、提案されたアプローチは、あらゆる種類の3Dドメインスワッピングイベントを統一された分類の下でのみ分類します。この選択は当初、特定のクラスの3Dドメインスワッピングを指定できる注釈付きデータの可用性が限られていることによって推進されました。これは、さまざまな薬用植物ベースのデータセットに対する最初の種類の試みであり、異なるスワッピングメカニズムを区別することで、モデルの予測精度を高めることができると感じています。
薬用植物の濃縮分析は、生理活性化合物の合成とストレス反応に関与する主要な遺伝子、タンパク質、経路を特定するのに役立ちます。分子メカニズムについての洞察を提供します。薬用植物におけるこれらの分析では、生理活性化学物質の合成、ストレス回復力、耐病性に関連する必須遺伝子、タンパク質、生物学的プロセスを調査します。遺伝子オントロジー(GO)やKEGG経路解析など、選択されたタンパク質の機能アノテーションにより、二次代謝産物産生と環境ストレス応答の根底にある分子メカニズムが明らかになります。このアプローチは、創薬に実質的に役立つ、作物の回復力を向上させ、持続可能な農業と医薬品の進歩のための植物代謝経路を解明します。
研究の新たな貢献
この研究は、生物学的データセットのタンパク質構造パターンを予測するためのより正確で効率的なモデルを促進する機械学習の能力を強調しています。
この研究では、新しい機能を機械学習アルゴリズムに統合し、タンパク質機能をより明確に予測する能力を向上させます。このような特徴により、タンパク質の構造と機能の関係の理解が深まり、タンパク質工学におけるより正確なタンパク質設計と最適化に役立ちます。
予測されたタンパク質の濃縮分析は、主要な生物学的経路、細胞プロセス、および分子機能を見つけるのに役立ち、バイオマーカーの発見、医薬品設計、および疾患メカニズムの理解に貴重な標的を提供します。この分析により、経路ベースの介入と治療標的の特定の精度が向上します。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
注:このセグメントは、(a)データ収集、(b)特徴選択、(c)データの前処理、(d)データの後処理(e)モデル開発、(f)提案されたモデルの結果評価、および(g)正の予測シーケンスの異なるレベルでのエンリッチメント分析の6つの主要なステップを含む、提案された方法論の包括的な概要を提供します。Core i5-10500 は、この研究で使用された第 10 世代プロセッサです。6 コアと 12 スレッドを備え、基本周波数は 3.10 GHz、最大ターボ速度は 4.50 GHz です。12 MB の Intel Smart Cache が搭載され、DDR4-2666 メモリをサポートし、統合ビジュアル用の UHD Graphics 630 が含まれています。効率的なマルチタスクと生産性を実現するように構築されており、LGA 1200 ソケットと互換性があり、65W TDP で動作します。
1. データ収集
2. モデル作成のための機能の使用
表 2: 新しく追加された機能とその説明のリスト。 この表は、3Dドメインスワッピングの予測におけるモデルのパフォーマンスを向上させるために、特徴抽出フェーズで設計された新しい特徴をまとめたものです。各特徴は、ドメインスワッピングの傾向に影響を与えると仮定されているタンパク質の特定の配列ベース、物理化学的、または構造的特性を捉えます。各特徴の生物学的関連性と計算上の導出を明確にするために、詳細な説明が提供されます。 この表をダウンロードするには、ここをクリックしてください。
3. データの前処理と後処理
注:データの前処理。データの前処理は、分析用の生データの準備を含む機械学習の重要なステップです。これには、データのクリーニング (重複の削除、欠損値の処理など) が含まれます。
4. モデルの作成と実装

図2:図示的な概略図。 この表現は、ランダムフォレストとK最近傍(KNN)機械学習モデルを示しており、二項分類タスクのコンテキストにおけるアルゴリズム構造と機能ワークフローを示しています。 この図の拡大版を表示するには、ここをクリックしてください。

図 3: 機械学習ベースのワークフロー。 この図は、薬用植物タンパク質の3Dドメインスワッピングを予測するための機械学習ベースのワークフローを示しています。このプロセスは、ベンチマーク データセットとメタ データセットを組み合わせたデータセットの取得から始まります。特徴抽出には、タンパク質配列から既存の特徴と新しい特徴の両方を導き出すことが含まれます。データセットの前処理では、FASTAシーケンスはシーケンス解析と辞書マッピングを使用して数値に変換され、特定の3Dドメインスワップ機能を含む構造化データフレームが作成されます。後処理には、しきい値 (β = 0.5) を使用したドメイン スワップ ステータスの割り当て、トレーニング セットとテスト セットへのデータの分割 (70-30 の比率)、特徴の標準化、および k 倍の検証による特徴選択の実行が含まれます。ランダムフォレスト(RF)とK-Nearest Neighbors(KNN)の2つの機械学習モデルを学習させ、AUROCとAUPRCとともにモデル指標を用いてその性能を評価し、予測精度と堅牢性を評価します 。この図の拡大版を表示するには、ここをクリックしてください。
5. ML分類器の静的評価とモデル評価
(1)
(2)
(3)
(4)
(5)
(6)6. 各種薬用植物種における3次元ドメインスワッピング予測モデルの実装
7. 薬用植物由来の正予測3Dドメインスワップタンパク質の濃縮研究
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
3Dドメインスワッピングを示すタンパク質は、さまざまな生物学的機能に関連していることがよくあります。しかし、3Dドメインスワッピングに関与したタンパク質配列の体系的なゲノムワイド分析は、ほとんど未調査のままです。本研究では、13種類の薬用植物から推定される3Dドメインスワップタンパク質を、二次代謝産物ドメイン、KEGG経路、遺伝子オントロジー(GO)用語との関連性に着目して、推定予測する初期調査を実施しました。アクセシブルな文献の包括的な分析と応用機械学習モデルの性能評価により、提案されたモデルであるランダムフォレスト(RF)は、K最近傍(KNN)と比較して、3Dドメインスワップカテゴリの予測において優れた結果を示していることが示されています。 図4Aでは、AUCが高いことはAUROC分析の優れた性能を表しています。RF(AUC=-0.914)モデルは、3D-DSクラスと3D-NDSクラスを区別する強力な能力を示しています。KNN モデルの AUC 値 (AUC=-0.883) は RF よりわずかに低いですが、それでも 3D ドメインスワップと 3D 非ドメインスワップを分類...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
完全なゲノムにわたるタンパク質の 3D ドメイン スワッピングの理解は、さまざまな分野で非常に重要です。機械学習アプローチ、特にランダムフォレストとK最近傍26,27は、ゲノムレベルでタンパク質配列データから直接3Dドメインスワッピングを予測するために採用されています。これら 2 つの ML モデルには、データセットの収集、特徴の選択、データの前/後処理、カスタマイズされたモデル スクリプトの実装、モデル評価などのさまざまなステップが含まれます。RF モデルと KNN モデルは、それぞれ 91.6% と 88.7% の精度を示しています。これらの予測モデルは、その後、13種の薬用植物種のさまざまな完全なゲノムに適用されました。
私たちの知る限り、これは、ML技術を利用して薬用植物のゲノムスケールで3Dドメインスワッピング症例を調査する最初の包括的な取り組みです。SVMよりもKNNが選ばれたのは、SV...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
著者らは、この論文で報告された研究に影響を与えると思われる競合する経済的利益や個人的な関係が知られていないことを宣言します。
この研究には資金は提供されませんでした。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| 3DSwap+ | https://caps.ncbs.res.in/3Dswapplus/index.html | ||
| Pfam | EMBL-EBI | http://pfam.xfam.org/: | |
| HMMER | EMBL-EBI | ; | |
| Aaindex | https://www.genome.jp/aaindex/: | ||
| ダイヤル | Bioinformaticshome.com | https://bioinformaticshome.com/db/tool/DIAL: | |
| WEKA | ウェカト | https://www.waikato.ac.nz/int/research/institutes-centres-entities/institutes/artificial-intelligence-institute/research/software/ | |
| KEGG | https://www.genome.jp/kegg/ : | ||
| ShinyGO | https://bioinformatics.sdstate.edu/go/ : | ||
| uniprot | Uniprot | https://www.uniprot.org/ : |
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト