方法論記事

TCGAデータおよび単一セルデータに基づく分析( 例としてTRPM4 を用いる)

DOI:

10.3791/69304

2025年12月5日

* These authors contributed equally

この記事について

サマリー

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ここでは、トランスクリプトーム解析と単細胞解析、さらに101の機械学習アルゴリズムを活用し、101の機械学習アルゴリズムを用いて、前述の単一遺伝子の予後モデルを構築するために、膀胱がんにおける単一遺伝子の役割を徹底的に分析するプロトコルを提示します。

要約

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本稿では、公開されたトランスクリプトミクスデータセットおよび単細胞データセットに基づく解析手法を導入し、腫瘍免疫微小環境の形成、腫瘍分子サブタイプの形成、腫瘍患者の予後予測など、腫瘍における単一遺伝子の役割を包括的に記述することができる。同時に、単一遺伝子データの導入は、単一のトランスクリプトーム解析によるランダム性や異質性を回避するだけでなく、遺伝子がどの特定の細胞クラスターで発現しているかをより深く探求し、遺伝子が経路内で果たす役割のさらなる研究を可能にします。多くの研究者が単一細胞解析に精通していない可能性があるため、この方法記事ではTISCH2(http://tisch.compbio.cn/)と呼ばれるオンラインウェブサイトが紹介されており、単一細胞解析の完了を助けます。さらに、101の機械学習手法の応用は、最も正確な予後モデルを構築する上で不可欠な役割を果たしてきました。結論として、バイオインフォマティクス解析、機械学習、単細胞解析を組み合わせたこの統合単一遺伝子解析手法は、腫瘍進行における単一遺伝子の機能研究や、経路における個々の遺伝子の機能研究において不可欠かつ重要な役割を果たすと考えられています。

概要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ご存知の通り、膀胱がん(BLCA)は世界で最も攻撃的で転移性の悪性腫瘍の一つであり、現在の膀胱がんのバイオマーカーには不正確さなど問題が依然として存在します。BLCA患者の予後を特定し、転後を予測するためには、膀胱がんのバイオマーカーの探索と予後モデルの確立が非常に重要です。バイオマーカーの研究方法がいくつか開発されていますが、これらの多くは現在トランスクリプトミクスに限定されており、その結果サンプル2に異質性が生じます。さらに、トランスクリプトミクスデータだけでは、異なる細胞サブポピュレーションの役割や、単細胞レベルで異なる経路における遺伝子の機能を調査できていないことが多いため、過去の研究は正確さや効果を損なっています。単一細胞解析が初心者にとって難しいことを考慮し、スキルを素早く習得できるようオンラインプラットフォームが導入されました。最後に、たとえ単一の遺伝子がトランスクリプトーム解析や単細胞解析で適切なバイオマーカーであることが判明しても、そのバイオマーカーがすべてのコホートに適用できる保証はないため、結論をより普遍的に適用できるものにするために、バイオマーカーに関連する予後モデルを構築する必要があります。.101機械学習アルゴリズムとは、10種類の異なる機械学習アルゴリズムを組み合わせて101の予後モデルを構築することであり、最適な予後モデルを特定することを目的としています。複雑なデータを扱い、より高い安定性を示すランダムフォレスト、XGBoost、SVMなどのアルゴリズムの導入により、この統合アルゴリズムは驚くべき安定性を示しています。この予後モデルをより正確かつバイオマーカーに関連性のあるものにするために、まずすべての遺伝子とバイオマーカー間の相関分析が行われ、要件に基づいて約20〜30個の遺伝子を選び、その後101機械学習アルゴリズムを用いて予後モデルを構築し、一連の解析を経て結果を最終決定します。

過去6年間の単純なトランスクリプトミクス解析で予測されたバイオマーカーと比較すると、単細胞およびトランスクリプトミクス解析のバイオマーカーは、組織やサンプルを基本的な細胞構成要素に偏りなく分解することを可能にします。これにより、異なる細胞タイプの明確な分化(T細胞、B細胞、マクロファージなど)や新しいサブポピュレーション(消耗したT細胞や調節性T細胞など)の発見、さらには連続的な動的プロセス(細胞分化軌跡など)の捕捉が可能となります4。これは果物と牛乳を別々に並べるようなもので、各成分とその量を明確にイメージできます。単一コホートのCoxモデル7と比較して、101機械学習を用いて構築された予後モデルは、データから変数間の複雑で非線形な相互作用を自動的に学習できるため、より正確かつ科学的に妥当です。例えば、特定の遺伝子変異の影響は特定の年齢や腫瘍の大きさの患者にのみ有意になることがあります。ランダムフォレストやニューラルネットワークなどの機械学習モデルは、手動仕様8を必要とせずにこれらの高次相互作用を自動的に捕捉できます。解析に使用されるデータセットには大多数の遺伝子が含まれ、遺伝子の数が少なすぎず、予後モデル構築に用いられる遺伝子の数が過剰でなく、一般的に20〜30左右に維持されるのが最適です。単一細胞セットの品質管理標準は1000以上、細胞あたりのUMI数は1000以上、細胞あたりの遺伝子数は500以上であるべきです。

ここでは、公開トランスクリプトミクスデータセットおよび単一細胞データセットから新規バイオマーカーを特定するための段階的なアプローチを提供し、その例としてBLCAにおける TRPM4 の役割を例に挙げます。複数の研究手法と多様なデータセットが用いられており、がんゲノムアトラス・膀胱がん(TCGA-BLCA)データセット、単細胞データセットGSE145281、BLCAデータセットGSE32894およびGSE31684などが用いられており、複数の視点から腫瘍学におけるバイオマーカーの精度と適用可能性を高め、 BRCAにおけるTRPM4 の研究を前進させています。TCGA-BLCAデータセットはカリフォルニア大学サンタクルーズ校Xena校(UCSC Xena)のウェブサイトから取得されました。GSE32894および GSE31684 は遺伝子発現オムニバス(GEO)からダウンロードされ、単細胞データGSE145281は Tumor Immune Single-Cell Hub 2(TISCH2)から取得されました。さらに、BLCA分子サブタイプおよび処理反応に関するデータは、関連論文の補足スプレッドシートファイルから抽出されました。その後、バイオインフォマティクス解析、単一細胞解析、機械学習が行われ、統合された単一遺伝子研究手法を確立します。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

プロトコル

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

注意:この記事で使用されているすべてのコードはウェブサイト https://github.com/YaoGeng-nmu/Analysis-of-TRPM4-based-on-TCGA-data-and-single-cell-data-in-BLCA/blob/main/code で確認できます。

1. トランスクリプトミクスデータの準備

  1. TCGA-BLCAデータセットの準備
    1. すべてのTCGAデータセットは、UCSC Xena (https://xenabrowser.net/datapages/)10のウェブサイトからダウンロードできます。ダウンロードされたデータセットは事前処理されており、遺伝子注釈11などの追加作業は不要です。
    2. TCGAデータセットを選択し、TCGA-BLCAデータtをクリックします。その後、TCGA-BLCAデータセットのページにアクセスし、「Gene Expression RNA-seq」をクリックし、TCGA-BLCAデータセットから臨床データおよび遺伝子発現プロファイルをダウンロードしてください。このデータセットには、400人のBLCA患者のmRNA発現データが含まれていることを確認してください。
    3. 腫瘍サンプルと隣接する正常組織サンプルを区別するために、末端01と11のサンプルを分離してください。01のサンプルは腫瘍サンプルを示し、11のサンプルはがん隣接組織(正常なサンプル)を示します。
  2. GSE32894とGSE31684の準備
    1. GEOウェブサイト(https://www.ncbi.nlm.nih.gov)をクリックして、BLCAデータセットGSE32894とGSE316841213をダウンロードしてください。
    2. 右上の 「それぞれのエントリ ー」をクリックした後、GSE32894およびGSE31684のデータセットページに移動します。
    3. 次に、GSE32894のためにそれぞれのmRNAデータ、臨床データ、生存データをダウンロードしてください。GSE32894データセットの http ボタンをクリックしてください。また、プラットフォームボタンを使ってGPL6947プラットフォームデータをダウンロードしてください。シリーズ マトリックスファイル ボタンをクリックし、mRNAデータ、臨床データ、生存データをダウンロードGSE32894時に GSE32894_series_matrix.txt.gz ボタンをクリックした後、GSE32894をダウンロードしてください。
    4. GSE31684のために、それぞれのmRNAデータ、臨床データ、生存データをダウンロードしてください。GSE31684データセットの http ボタンをクリックしてください。また、プラットフォームボタンを使ってGPL570プラットフォームデータをダウンロードしてください。 シリーズマトリックスファイル ボタンをクリックし、mRNAデータ、臨床データ、GSE31684生存データのダウンロード時に GSE31684_series_matrix.txt.gz ボタンをクリックした後、GSE31684をダウンロードしてください。
    5. フィルタリング段階では、発現レベルがゼロまたはゼロに近い意味のない遺伝子を除去します。バッチ補正にはSVAパッケージ14に基づくComBatメソッドを用いてください。

2. 単細胞分析の準備

  1. 準備GSE145281
    1. 単一細胞レベルでの研究を行うには、転写組データだけではどの細胞クラスターが TRPM4 を最も有意に発現するかを判断するには不十分であると考え、BLCA単一細胞データセットを探してください。
    2. こちらから、TISCH2(http://tisch.compbio.cn/)という腫瘍の単一細胞解析を行うオンラインウェブサイトにアクセスしてください。
    3. 実験的なニーズに応じて、必要な がんタイプ を選択し、この場合はBLCAを例に挙げます。
    4. BLCAボタンをクリックし、GSE145281というデータセットを選択してください。

3. BLCAの分子サブタイプおよび治療選択データへの応答の準備

  1. ここで参照された記事からBLCAの分子サブタイプおよび治療選択に対する応答データをダウンロードしてください。
  2. PubMedのウェブサイトを開く(https://pubmed.ncbi.nlm.nih.gov/)。記事を検索し、「補足表」をクリックしてください。この圧縮ファイルパッケージには合計18個のファイルが含まれています。

4. TRPM4のBLCA免疫微小環境解析

  1. 異なる TRPM4 群における133種類の免疫調節因子の発現のヒートマッププロット
    1. TRPM4の式に従い、すべてのBLCAサンプルを高TRPM4群と低TRPM4群に分けます。
    2. すべてのサンプル名とTRPM4発現データを個別にコピーし、TRPM4発現の降順に並べ替え、サンプルの前半分をグループ列の低TRPM4グループに分類します。 すべてのTCGA-BLCA患者のIDは補足表1に記載されています。
    3. トランスクリプトミックデータ解析に必要なRパッケージをインストールしてください。提供されたコードにファイル配置を変更するなど、わずかな修正を加えてからコードを実行します。遺伝子IDと免疫調節因子のIDが正しく一致しているかを注意深く確認し、遺伝子IDの後に隙間や目立たない要因がないか確認してください。これらがヒートマップ生成失敗の主な原因です。
  2. ESTIMATE Rパッケージを用いた腫瘍サンプルの間質および免疫学的解析
    1. トランスクリプトミックデータ解析に必要なすべてのRパッケージがインストールされていることを確認してください。コード要件に従い、必要なデータに対応する名前を付けてから 「実行 」ボタンをクリックしてください。
      注意:このウェブサイトはオンライン分析機能も提供していることを忘れないでください。ウェブサイト(https://bioinformatics.mdanderson.org/estimate/rpackage.html)を訪れることで望ましい結果を得ることは可能ですが、この方法は自己収集したデータの解析には適していません。
    2. 「疾患」ボタンをクリックし、「膀胱尿路上皮癌」オプションを選択してください。次に、RNA-seq-V2プラットフォームボタンを選択します。すべてのサンプルの間質スコア、免疫スコア、推定スコアをダウンロードしてください。
  3. 異なる TRPM4 グループ間の表現のバイオリンプロット
    1. トランスクリプトミックデータ解析に必要なすべてのRパッケージをインストールしてください。必要なすべてのRパッケージは 補足表2に記載されています。コード要件に従い、必要なデータに対応する名前を付けてから「実行」ボタンをクリックしてください。
    2. 遺伝子IDが正しく入力されているかを慎重に確認し、遺伝子IDの末尾に空白やその他の目立たない要素がないか確認してください。これらはバイオリンプロット作成の失敗の主な原因です。
  4. 異なる TRPM4 グループ間の三角形ヒートマッププロット
    1. トランスクリプトミックデータ解析に必要なすべてのRパッケージをインストールしてください。 TIGIT CD80など、複数の免疫チェックポイント遺伝子の発現データを必ず準備してください。TCGA-BLCAトランスクリプトームデータを開いて、免疫チェックポイント遺伝子の数が多くないことを前提に、各エントリーを個別に検索してください。
    2. コード要件に従い、必要なデータに対応する名前を付けてから 「実行 」ボタンをクリックしてください。
  5. 異なる遺伝子とTRPM4の相関プロット
    1. トランスクリプトミックデータ解析に必要なすべてのRパッケージをインストールしてください。最初の遺伝子に TRPM4 を埋め、研究中の遺伝子を2番目の遺伝子、つまり CD3E に追加します。
    2. 「実行」ボタンをクリックした後、CTLA4など解析が必要な他の遺伝子にCD3Eを変更してください。

5. GSE145281データセットにおける TRPM4 の単一セル解析

  1. 単一セル解析を用いたBLCA GSE145281データセット解析
    1. ウェブサイトにアクセスし、 BLCAをクリックしてください。単一細胞解析により、トランスクリプトミクス解析と比較してどの細胞クラスターがTRPM4の発現が高いかをより深く探ることができます。単一細胞解析データはGSE130001から収集されているか確認し、品質管理基準と比較して、データセットあたりの細胞数が1000を超え、細胞あたりのUMI数が1000を超え、細胞あたりの遺伝子数が500を超えていることを確認しましょう。各クラスターの他の細胞と比べて差異発現遺伝子は、対数変換フォールド変化(|logFC| >= 0.25)に基づいて同定され、クラスタリング分解能は0.5であるべきです。
  2. 異なるセルクラスターのセル注釈
    1. すべてのセルクラスターに注釈が付けられていることを確認してください。例えば、B細胞はCD19、MS4A1、CD27、IGHD、IGHM、TCL1A、FCRL5で注釈を付けることができます。細胞注釈に用いられるすべての遺伝子は 補足表3に記載されています。
    2. 次にGSE145281を選び、 TRPM4のすべての結果をダウンロードします。Overallボタンをクリックして、異なるクラスターやセルタイプのUMAPプロットGSE145281をダウンロードしてください。
    3. 遺伝子ボタンをクリックし、解析する単一の遺伝子を選択します。GSEAボタンをクリックして、KEGG経路やHallmark経路1617など様々な経路でこの単一遺伝子の機能を観察してください。
    4. CCIボタンをクリックすると、単一の遺伝子を高度に発現させるクラスターの細胞チャットプロットおよび細胞チャットバブルプロットを見つけられます。
    5. TFエンリッチメントボタンをクリックすると、各クラスターのリッチされた転写因子が表示されます。

6. 101 TRPM4に関連する予後モデルを構築するための機械学習

  1. トランスクリプトミックデータ解析に必要なすべてのRパッケージをインストールしてください。単一の機械学習手法が予後予測に最適な方法とは限らないことを考慮し、予後モデルは101の機械学習手法を用いて構築可能です。TCGA-BLCAコホートおよびGSE32894およびGSE31684コホートおよび TRPM4のすべての遺伝子間の相関解析を実施します。
  2. TRPM4に強く関連している遺伝子の数に基づき、TRPM4と相関が0.6以上、または-0.6以下または-0.6以下の遺伝子をすべて選択します。すべてのコホートでTRPM4に強く関連しているすべての遺伝子を選択します。
  3. GSE32894コホートとGSE31684コホートのすべてのデータを組み合わせて検証セットを作成し、TCGA-BLCAをトレーニングセットとして使用します。
  4. コード要件に従い、必要なデータに対応する名前を付けてから 「実行 」ボタンをクリックしてください。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

結果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

トランスクリプトミクスを用いて個々の遺伝子の免疫微小環境を解析する主な利点は、個々の遺伝子と遺伝子発現レベルでの免疫細胞や分子との動的な相互作用と直接的な相関を可能にし、免疫特性を直接観察し、個々の遺伝子や変化の高発現・低発現を持つグループ間で免疫細胞の浸透割合の違いを特定できることはよく知られています免疫チェックポイント分子の発現において18。バイオインフォマティクス解析の代表的な結果は、バイオリンプロットなどの免疫マイクロ環境や免疫分子の解析に関連するものです。単細胞解析の代表的な結果は、各細胞クラスターのターゲット遺伝子発現レベルと各細胞クラスターの経路ヒートマップ解析です。101の機械学習モデルの代表的な結果は、予後モデルを構築するために用いられるアルゴリズムのヒートマップです。

まず、ヒートマッププロットでは、133の免疫調節剤が低TRPM4群でより多く発現していることが示されています(図1A

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

ディスカッション

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

過去の研究では、単一遺伝子のバイオインフォマティクス解析では、表面的、不正確、適用範囲の限界といった問題がしばしば直面していました。さらに、これまでの単一遺伝子に関する研究は、通常トランスクリプトームデータに限定されてきました。さらに、トランスクリプトームデータのみに焦点を当てると、サンプルの異質性やランダム性などの問題が生じ、普遍的なパターンの特定が困難になることがある。したがって、前述の問題に対処するために、個々の遺伝子が経路レベルで重要な役割をよく理解するために、単一細胞データを導入しました。この記事の重要なステップは、単一細胞解析のためのオンラインウェブサイト「TISCH2(http://tisch.compbio.cn/)」を導入したことです。品質管理の基準として、データセットごとの細胞数は1000を超え、細胞あたりのUMI数は1000を超え、細胞あたりの遺伝子数は500を超えています。さらに、101機械学習はすべての...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

開示事項

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者たちは利益相反がないと宣言しています。

謝辞

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

インテリジェント分析フレームワークの開発に感謝します(http://www.sxdyc.com/ で利用可能)。彼らの革新的な計算インフラは、精密分析や自動データ解釈モジュールを通じて研究ワークフローを大幅に加速させました。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

材料

この記事で使用された材料の一覧
名前会社カタログ番号コメント
R 4.3.3なしなしなし

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhang, C., et al. Identification of multicohort-based predictive signature for NMIBC recurrence reveals SDCBP as a novel oncogene in bladder cancer. Ann Med. 57 (1), 2458211(2025).
  2. Han, M. H., et al. Plasma GFAP and Amyloid Pathology Predict Cognitive Response to Multidomain Interventions in MCI. Aging Dis. , (2025).
  3. Xie, S., et al. Towards Precision Aging Biology: Single-Cell Multi-Omics and Advanced AI-Driven Strategies. Aging Dis. , (2025).
  4. Han, Y., et al. TISCH2: expanded datasets and new tools for single-cell transcriptome analyses of the tumor microenvironment. Nucleic Acids Res. 51 (D1), D1425-D1431 (2023).
  5. Yao, Y., et al. Advances in prognostic models for osteosarcoma risk. Heliyon. 10 (7), e28493(2024).
  6. Ding, X., et al. Glutamine metabolism reprogramming promotes bladder cancer progression via PYCR1: a multi-omics and functional validation study. J Transl Med. 23 (1), 1277(2025).
  7. Zhu, T., et al. Methylparaben and propylparaben promote bladder cancer invasion via MMP2 and PPARG modulation. Ecotoxicol Environ Saf. 306, 119383(2025).
  8. Xie, J. H., et al. Deciphering cutaneous melanoma prognosis through LDL metabolism: Single-cell transcriptomics analysis via 101 machine learning algorithms. Exp Dermatol. 33 (4), e15070(2024).
  9. Sun, D., et al. TISCH: a comprehensive web resource enabling interactive single-cell transcriptome visualization of tumor microenvironment. Nucleic Acids Res. 49 (D1), D1420-D1430 (2021).
  10. Cao, X., et al. D-Mannose Upregulates Testin via the NF-κB Pathway to Inhibit Breast Cancer Proliferation. J Biochem Mol Toxicol. 39 (8), e70398(2025).
  11. Goldman, M. J., et al. Visualizing and interpreting cancer genomics data via the Xena platform. Nat Biotechnol. 38 (6), 675-678 (2020).
  12. Yu, Q., et al. GREM1 may be a biological indicator and potential target of bladder cancer. Sci Rep. 14 (1), 23280(2024).
  13. Wu, Q., et al. Membrane palmitoylated protein MPP1 inhibits immune escape by regulating the USP12/ CCL5 axis in urothelial carcinoma. Int Immunopharmacol. 146, 113802(2025).
  14. Johnson, W. E., Li, C., Rabinovic, A. Adjusting batch effects in microarray expression data using empirical Bayes methods. Biostatistics. 8 (1), 118-127 (2007).
  15. Hu, J., et al. Siglec15 shapes a non-inflamed tumor microenvironment and predicts the molecular subtype in bladder cancer. Theranostics. 11 (7), 3089-3108 (2021).
  16. Kanehisa, M., Sato, Y., Morishima, K. BlastKOALA and GhostKOALA: KEGG Tools for Functional Characterization of Genome and Metagenome Sequences. J Mol Biol. 428 (4), 726-731 (2016).
  17. Munkley, J., et al. Hallmarks of glycosylation in cancer. Oncotarget. 7 (23), 35478-35489 (2016).
  18. Da, Y., et al. A high stroma-tumor ratio is associated with an immunosuppressive tumor microenvironment and a poor prognosis in bladder cancer. Front Oncol. 15, 1604609(2025).
  19. Chen, C., et al. Bioinformatics Methods for Mass Spectrometry-Based Proteomics Data Analysis. Int J Mol Sci. 21 (8), 2873(2020).
  20. Jonauskaite, D., et al. Universal Patterns in Color-Emotion Associations Are Further Shaped by Linguistic and Geographic Proximity. Psychol Sci. 31 (10), 1245-1260 (2020).
  21. Zhu, W., et al. Integrated machine learning identifies epithelial cell marker genes for improving outcomes and immunotherapy in prostate cancer. J Transl Med. 21 (1), 782(2023).
  22. Zhao, J., et al. Bioinformatics prediction and experimental verification of key biomarkers for diabetic kidney disease based on transcriptome sequencing in mice. PeerJ. 10, e13932(2022).

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

再版と許可

このJoVE記事のテキストまたは図の再利用許可をリクエスト

許可をリクエスト

タグ

TCGA DataSingle Cell DataTRPM4 GeneTumor Immune MicroenvironmentTumor Molecular SubtypesPrognostic ModelMachine LearningBioinformatics AnalysisSingle Gene AnalysisTISCH2 Website

関連記事