ここでは、トランスクリプトーム解析と単細胞解析、さらに101の機械学習アルゴリズムを活用し、101の機械学習アルゴリズムを用いて、前述の単一遺伝子の予後モデルを構築するために、膀胱がんにおける単一遺伝子の役割を徹底的に分析するプロトコルを提示します。
方法論記事
* These authors contributed equally
ここでは、トランスクリプトーム解析と単細胞解析、さらに101の機械学習アルゴリズムを活用し、101の機械学習アルゴリズムを用いて、前述の単一遺伝子の予後モデルを構築するために、膀胱がんにおける単一遺伝子の役割を徹底的に分析するプロトコルを提示します。
本稿では、公開されたトランスクリプトミクスデータセットおよび単細胞データセットに基づく解析手法を導入し、腫瘍免疫微小環境の形成、腫瘍分子サブタイプの形成、腫瘍患者の予後予測など、腫瘍における単一遺伝子の役割を包括的に記述することができる。同時に、単一遺伝子データの導入は、単一のトランスクリプトーム解析によるランダム性や異質性を回避するだけでなく、遺伝子がどの特定の細胞クラスターで発現しているかをより深く探求し、遺伝子が経路内で果たす役割のさらなる研究を可能にします。多くの研究者が単一細胞解析に精通していない可能性があるため、この方法記事ではTISCH2(http://tisch.compbio.cn/)と呼ばれるオンラインウェブサイトが紹介されており、単一細胞解析の完了を助けます。さらに、101の機械学習手法の応用は、最も正確な予後モデルを構築する上で不可欠な役割を果たしてきました。結論として、バイオインフォマティクス解析、機械学習、単細胞解析を組み合わせたこの統合単一遺伝子解析手法は、腫瘍進行における単一遺伝子の機能研究や、経路における個々の遺伝子の機能研究において不可欠かつ重要な役割を果たすと考えられています。
ご存知の通り、膀胱がん(BLCA)は世界で最も攻撃的で転移性の悪性腫瘍の一つであり、現在の膀胱がんのバイオマーカーには不正確さなど問題が依然として存在します。BLCA患者の予後を特定し、転後を予測するためには、膀胱がんのバイオマーカーの探索と予後モデルの確立が非常に重要です。バイオマーカーの研究方法がいくつか開発されていますが、これらの多くは現在トランスクリプトミクスに限定されており、その結果サンプル2に異質性が生じます。さらに、トランスクリプトミクスデータだけでは、異なる細胞サブポピュレーションの役割や、単細胞レベルで異なる経路における遺伝子の機能を調査できていないことが多いため、過去の研究は正確さや効果を損なっています。単一細胞解析が初心者にとって難しいことを考慮し、スキルを素早く習得できるようオンラインプラットフォームが導入されました。最後に、たとえ単一の遺伝子がトランスクリプトーム解析や単細胞解析で適切なバイオマーカーであることが判明しても、そのバイオマーカーがすべてのコホートに適用できる保証はないため、結論をより普遍的に適用できるものにするために、バイオマーカーに関連する予後モデルを構築する必要があります。.101機械学習アルゴリズムとは、10種類の異なる機械学習アルゴリズムを組み合わせて101の予後モデルを構築することであり、最適な予後モデルを特定することを目的としています。複雑なデータを扱い、より高い安定性を示すランダムフォレスト、XGBoost、SVMなどのアルゴリズムの導入により、この統合アルゴリズムは驚くべき安定性を示しています。この予後モデルをより正確かつバイオマーカーに関連性のあるものにするために、まずすべての遺伝子とバイオマーカー間の相関分析が行われ、要件に基づいて約20〜30個の遺伝子を選び、その後101機械学習アルゴリズムを用いて予後モデルを構築し、一連の解析を経て結果を最終決定します。
過去6年間の単純なトランスクリプトミクス解析で予測されたバイオマーカーと比較すると、単細胞およびトランスクリプトミクス解析のバイオマーカーは、組織やサンプルを基本的な細胞構成要素に偏りなく分解することを可能にします。これにより、異なる細胞タイプの明確な分化(T細胞、B細胞、マクロファージなど)や新しいサブポピュレーション(消耗したT細胞や調節性T細胞など)の発見、さらには連続的な動的プロセス(細胞分化軌跡など)の捕捉が可能となります4。これは果物と牛乳を別々に並べるようなもので、各成分とその量を明確にイメージできます。単一コホートのCoxモデル7と比較して、101機械学習を用いて構築された予後モデルは、データから変数間の複雑で非線形な相互作用を自動的に学習できるため、より正確かつ科学的に妥当です。例えば、特定の遺伝子変異の影響は特定の年齢や腫瘍の大きさの患者にのみ有意になることがあります。ランダムフォレストやニューラルネットワークなどの機械学習モデルは、手動仕様8を必要とせずにこれらの高次相互作用を自動的に捕捉できます。解析に使用されるデータセットには大多数の遺伝子が含まれ、遺伝子の数が少なすぎず、予後モデル構築に用いられる遺伝子の数が過剰でなく、一般的に20〜30左右に維持されるのが最適です。単一細胞セットの品質管理標準は1000以上、細胞あたりのUMI数は1000以上、細胞あたりの遺伝子数は500以上であるべきです。
ここでは、公開トランスクリプトミクスデータセットおよび単一細胞データセットから新規バイオマーカーを特定するための段階的なアプローチを提供し、その例としてBLCAにおける TRPM4 の役割を例に挙げます。複数の研究手法と多様なデータセットが用いられており、がんゲノムアトラス・膀胱がん(TCGA-BLCA)データセット、単細胞データセットGSE145281、BLCAデータセットGSE32894およびGSE31684などが用いられており、複数の視点から腫瘍学におけるバイオマーカーの精度と適用可能性を高め、 BRCAにおけるTRPM4 の研究を前進させています。TCGA-BLCAデータセットはカリフォルニア大学サンタクルーズ校Xena校(UCSC Xena)のウェブサイトから取得されました。GSE32894および GSE31684 は遺伝子発現オムニバス(GEO)からダウンロードされ、単細胞データGSE145281は Tumor Immune Single-Cell Hub 2(TISCH2)から取得されました。さらに、BLCA分子サブタイプおよび処理反応に関するデータは、関連論文の補足スプレッドシートファイルから抽出されました。その後、バイオインフォマティクス解析、単一細胞解析、機械学習が行われ、統合された単一遺伝子研究手法を確立します。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
注意:この記事で使用されているすべてのコードはウェブサイト https://github.com/YaoGeng-nmu/Analysis-of-TRPM4-based-on-TCGA-data-and-single-cell-data-in-BLCA/blob/main/code で確認できます。
1. トランスクリプトミクスデータの準備
2. 単細胞分析の準備
3. BLCAの分子サブタイプおよび治療選択データへの応答の準備
4. TRPM4のBLCA免疫微小環境解析
5. GSE145281データセットにおける TRPM4 の単一セル解析
6. 101 TRPM4に関連する予後モデルを構築するための機械学習
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
トランスクリプトミクスを用いて個々の遺伝子の免疫微小環境を解析する主な利点は、個々の遺伝子と遺伝子発現レベルでの免疫細胞や分子との動的な相互作用と直接的な相関を可能にし、免疫特性を直接観察し、個々の遺伝子や変化の高発現・低発現を持つグループ間で免疫細胞の浸透割合の違いを特定できることはよく知られています免疫チェックポイント分子の発現において18。バイオインフォマティクス解析の代表的な結果は、バイオリンプロットなどの免疫マイクロ環境や免疫分子の解析に関連するものです。単細胞解析の代表的な結果は、各細胞クラスターのターゲット遺伝子発現レベルと各細胞クラスターの経路ヒートマップ解析です。101の機械学習モデルの代表的な結果は、予後モデルを構築するために用いられるアルゴリズムのヒートマップです。
まず、ヒートマッププロットでは、133の免疫調節剤が低TRPM4群でより多く発現していることが示されています(図1A
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
過去の研究では、単一遺伝子のバイオインフォマティクス解析では、表面的、不正確、適用範囲の限界といった問題がしばしば直面していました。さらに、これまでの単一遺伝子に関する研究は、通常トランスクリプトームデータに限定されてきました。さらに、トランスクリプトームデータのみに焦点を当てると、サンプルの異質性やランダム性などの問題が生じ、普遍的なパターンの特定が困難になることがある。したがって、前述の問題に対処するために、個々の遺伝子が経路レベルで重要な役割をよく理解するために、単一細胞データを導入しました。この記事の重要なステップは、単一細胞解析のためのオンラインウェブサイト「TISCH2(http://tisch.compbio.cn/)」を導入したことです。品質管理の基準として、データセットごとの細胞数は1000を超え、細胞あたりのUMI数は1000を超え、細胞あたりの遺伝子数は500を超えています。さらに、101機械学習はすべての...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
著者たちは利益相反がないと宣言しています。
インテリジェント分析フレームワークの開発に感謝します(http://www.sxdyc.com/ で利用可能)。彼らの革新的な計算インフラは、精密分析や自動データ解釈モジュールを通じて研究ワークフローを大幅に加速させました。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| R 4.3.3 | なし | なし | なし |
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト