2025年8月19日
質量分析ベースのプロテオミクスデータは、オープンデータベースで利用でき、無料のツールを使用してアクセスできます。データベースの検索と説明が複雑であることを考えると、多くの生物学者はこれらのデータセットを利用するための知識を欠いています。ここでは、基本的なプロテオミクスデータ検索に無料のツールを使用するためのガイドを提供します。
私たちの研究は、生物学者が無料のツールを使用して複雑なプロテオミクスデータを分析するためのガイドを提供します。私たちは、彼らが調査結果を検証し、公開データセットを探索できるようにすることを目指しています。多くの生物学者は、明確なガイドがないため、公開プロテオームデータを使用できません。
私たちの研究はこれを橋渡しし、新しい野生生物実験なしで検証を可能にします。私たちの仕事は、ベンダーにとらわれない無料の最先端のソフトウェアを利用しています。これらのツールは、多くの従来のツールよりも高速で感度が高く、より正確なプロテオーム発見を提供します。
まず、UniProtデータベースからリファレンスプロテオームFASTAファイルをダウンロードします。FASTAの追加ボタンをクリックして、リファレンスプロテオームファイルをDIA-NNソフトウェアにロードします。「前駆体イオン生成」セクションで、ライブラリーフリー検索ライブラリ生成用のFASTAダイジェストと、ディープラーニングベースのスペクトル、RT、およびIM予測の2つのオプションを選択します。
次に、実行ボタンをクリックして、予測スペクトルライブラリを生成します。[プリカーサーイオン生成]セクションの2つのオプションの選択を解除します。入力セクションのファイル形式に対応するタイプボタンをクリックして、DIAデータを読み込みます。
次に、アルゴリズムセクションで質量精度とMS1精度の両方を0ppmに設定します。実験セットアップに従って、前駆体イオン生成セクションの前駆体とフラグメントの質量範囲の設定を調整します。その他のソフトウェア設定は変更しないでください。
次に、実行ボタンをクリックします。操作インターフェイスに「完了まで待機」と表示され、分析が完了したことを示します。インストール後、binフォルダにあるフラグパイプアイコンをクリックします。
[構成] タブに移動して、依存するすべての設定を表示します。MSFragger、IonQuant、diaTracer、DIA-NN、および Python モジュールがシステムで使用可能かどうかを確認します。不足しているモジュールがある場合は、[ダウンロードアップデート]または[ダウンロード]をクリックして取得します。
次に、ワークフロータブに切り替えます。ワークフロードロップダウンからデフォルトを選択し、[ワークフローの読み込み]をクリックします。次に、「ファイルの追加」をクリックしてファイルパスを入力します。
[ファイルの割り当て]で実験名と生物学的複製番号を割り当てるか、空白のままにします。次に、データベースタブをクリックして切り替えます。ディスクからFASTAファイルをロードするか、サンプル種に対応するファイルをダウンロードします。
ダウンロード中に、オプションを選択し、シーケンスのみを確認し、おとりを追加し、簡単な実行のために一般的な汚染物質を追加します。[MSFragger] タブをクリックして、ビューを変更します。閉じた検索のデフォルト設定を選択し、ロードをクリックします。
ピークマッチング設定で、すべてのデフォルト値を保持します。キャリブレーションと最適化の両方で、処理時間を短縮するために [なし] を選択します。タンパク質消化の場合は、実験の要件に基づいてパラメータを調整し、残りのデフォルト設定を維持します。
次に、[検証] タブに切り替えます。[predict RT]と[predict spectra]は、データに依存しない取り込みワークフローを対象としているため、オフにしてください。quant MS1タブをクリックします。
[MS1 quant の実行] を選択し、[load quant defaults] をクリックします。イオン量を選択し、他のすべての設定はデフォルト値のままにします。最後に、[実行] タブをクリックして続行します。
目的の出力ディレクトリを選択し、[実行] をクリックしてデータの分析を開始します。膵管腺癌(PDAC)の患者では、SERPINA5とHPSEは正常な人と比較して血清中の発現の増加を示しましたが、FGBは血清中の発現の増加を示しました。肝細胞癌腫瘍サンプルでは、ENO3、PLS3、MTAP、SERPINB9、およびITPR2は、対のある組織と比較して発現の低下を示しましたが、ME1、CYP27A1、RPS16、およびATP5PFは有意に増加しました。
ヒートマップの視覚化により、正常な人と比較して、PDAC患者の血清中のタンパク質発現が一貫して上昇していることが明らかになりました。PDAC 血清の遺伝子オントロジー濃縮分析により、凝固と止血に関連するプロセスの有意なアップレギュレーションが明らかになりました。肝細胞癌腫瘍のGO分析により、ヌクレオチドおよびプリンヌクレオチド代謝やNAD代謝経路などの代謝プロセスの濃縮が特定されました。
PDAC血清のKEGG経路濃縮分析により、グリコサミノグリカン分解とともに、補体および凝固カスケード経路の有意な活性化が明らかになりました。肝細胞癌腫瘍サンプルの KEG 分析により、PPAR シグナル伝達、炭素代謝、および神経変性疾患経路の濃縮が特定されましたが、統計的有意性は低かった。アップレギュレーションされたPDAC血清タンパク質のタンパク質間相互作用ネットワークは、凝固因子11、フィブリノーゲンベータ鎖、血漿セリンプロテアーゼ阻害剤、およびHPSE、CD5抗原様、CRISP3を含むいくつかの単離タンパク質を含む中心クラスターを明らかにしました。
完全なトランスクリプトを表示し、数千本の科学動画にアクセス
この研究は、生物学者が無料の最先端ツールを使用して複雑なプロテオミクスデータを分析するための包括的なガイドを提供します。
Mass spectrometry-based proteomics is increasingly central to early discovery and translational research, yet data complexity and lack of accessible workflows limit its broader adoption in biopharma R&D. This article demonstrates how free, vendor-agnostic computational tools enable robust interrogation and validation of public proteomic datasets, supporting hypothesis-driven research without new experimental burden. Streamlined data analysis workflows enhance predictive confidence and facilitate cross-study comparisons, directly impacting target validation and biomarker discovery pipelines.
This workflow positions mass spectrometry data analysis from early discovery through lead identification and translational research, leveraging public repositories and free computational tools.