$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
この研究はヘルシンキ宣言に従って実施され、プロトコルは2024年11月に河北医科大学第三病院倫理委員会(W2025-065-1)によって承認されました。研究に関与したすべての被験者からインフォームド・コンセントが得られました。
データソースと前処理
HFに関連するRNA-seqデータが得られ、Gene Expression Omnibus(https://www.ncbi.nlm.nih.gov/geo/)からの2つのマイクロアレイデータセットも含まれます。2つの末梢血液マイクロアレイデータセットが選ばれました。GSE59867(HFサンプル34件と対照群30件)をトレーニングデータセットとして使用しました。検証データセットとしてGSE57338(HFサンプル177件と対照群136件)が使用されました。年齢、性別、疾患状態などのGSE57338の臨床情報はGEOから取得され、 補足表1にまとめられています。さらに、dbPTMデータベースから合計3,893件のSUMOylation関連遺伝子(SRG)が取得されました(https://awi.cuhk.edu.cn/dbPTM/index.php)(補足表2)、また過去の研究に基づく 2,030件のミトコンドリア関連遺伝子(MRG)が収集されました(補足表3)。次に、RパッケージGEOquery(v 2.72.0)25 を用いてGEOデータベースからデータセットをダウンロードし、表現行列を抽出し、サンプル表現型情報を取得しました。注釈は注釈ファイルをマッピングし、遺伝子IDを照合することで行われました。無効な遺伝子IDは除去され、最も発現率の高いプローブが保持されました。
機械学習による主要遺伝子選択
HF、SUMOylation、ミトコンドリアに関連する遺伝子を選択するために多段階アプローチが用いられました。まず、訓練データセット、SRGs、MRG間の共通遺伝子を交差解析を用いて特定しました。共通遺伝子の潜在的機能は、遺伝子オントロジー(GO)および京都遺伝子・ゲノム百科事典(KEGG)によるRパッケージClusterProfiler(v 4.12.6)26を用いた濃縮解析によって特定されました。その後、LASSO回帰、XGBoost、ランダムフォレスト(RF)という3つの機械学習手法が用いられ、遺伝子のさらなるフィルタリングが行われました。LASSO回帰では、最適な正則化パラメータλが交差検証によって選択され、最も予測価値の高い遺伝的特徴を特定しました。非ゼロ係数遺伝子が選定され、その後の解析が行われました。その後、XGBoostおよびRFアルゴリズムを用いて特徴重要度スコアを計算し、上位20遺伝子をスクリーニングしました。
診断モデルの構築と評価
GSE59867データセットに基づくロジスティック回帰を用いて診断モデルを構築しました。その後、このモデルを適用して疾患の状況を予測し、確率スコアを算出しました。モデルの検証のために、同じ主要な遺伝子をGSE57338データセットから抽出し、トレーニングデータセットに合わせて正規化し、外部予測に使用しました。モデルの性能は、受信機動作特性(ROC)曲線、混乱行列、キャリブレーション曲線、意思決定曲線解析(DCA)を用いて評価されました。
遺伝子セット豊富解析(GSEA)と細胞内局在化
スピアマン相関解析を用いて、各主要遺伝子の相関遺伝子を特定しました。GSEA解析は、RパッケージのClusterProfiler(v 4.12.6)を用いて主要な遺伝子の関連遺伝子に対して実施されました。一方、細胞内の主要な遺伝子の正確な細胞内局在を特定するために、GeneCardsデータベース(https://www.genecards.org/)を用いて細胞内局在を特定しました。
遺伝子疾患関連および薬剤予測
特定された主要遺伝子の臨床的関連性を評価するため、系統的な疾患関連解析および薬物相互作用解析が行われました。疾患と遺伝子の関連性は比較毒性ゲノミクスデータベース(CTD; https://ctdbase.org/)を用いて調査され、結果は推論スコアと参照数(報告された上位10の関連)の両方でランク付けされました。主要遺伝子の遺伝子-薬物相互作用データは薬物-遺伝子相互作用データベース(DGIdb)から取得され、相互作用スコア0.5に基づいて薬物は除外<。その後、PDBデータベース(https://www.rcsb.org/)から主要遺伝子に対応するタンパク質の3D構造、PubChem(https://pubchem.ncbi.nlm.nih.gov/)から潜在的薬剤の分子構造をダウンロードしました。次に、CB-Dock227 (https://cadd.labshare.cn/cb-dock2/php/index.php)を用いて分子ドッキング解析を行い、潜在的な薬物とタンパク質間の結合スコアを算出しました。結合自由エネルギーが低いほど相互作用が安定していることを示し、化合物がより高い標的化能力を持つ可能性を示唆しています。
免疫浸潤解析
免疫細胞浸透は、3つの補完的な方法で評価されました。すなわち、微小環境細胞集団計数(MCP-counter)28、RNA転写本の相対サブセット推定による細胞型同定(CIBERSORT)29 、および単一サンプル濃縮解析(ssGSEA)30。MCPカウンタおよびCIBERSORT解析はRパッケージIOBR(v 0.99.0)31を使用して実施されました。MCPカウンターは免疫細胞および間質細胞の存在比を推定するために用いられ、CIBERSORTは22種類の免疫細胞の相対的な割合を定量化するために用いられました。ssGSEAはGSVAパッケージ(v1.52.3)32 を用いて免疫細胞サブタイプのサンプルレベルの濃縮を評価するために実施されました。
競合する内因性RNA(ceRNA)調節ネットワークの構築
既に特定された主要遺伝子に関連するmiRNA–lncRNA調節の役割の可能性を調査するために、ceRNA調節ネットワークを構築しました。RパッケージのmultiMiR(v 1.26.0)33 は、PITA(https://omictools.com/pita-tool/)とmiRDBデータベース(https://mirdb.org/)のデータを統合し、主要遺伝子の潜在的なmicroRNA(miRNA)–mRNA相互作用を予測するために用いられました。高い信頼度と一貫性を持つmiRNA–mRNAペアが選択されました。その後、lncRNA–miRNAの相互作用をStarBaseデータベース(https://rnasysu.com/encori/)から取得し、10件のCLIP-seq実験で支持された相互作用をフィルタリング≥、lincRNAとして分類しました。cRNAネットワークはlncRNA-miRNA-mRNA相互作用を統合して構築されました。
qPCR検証
主要遺伝子の発現を検証するため、HF患者および健康対照群の血液サンプルを、承認済みのプロトコルおよびインフォームドコンセントのもと、河北医科大学第三病院の臨床コホート(n=6件)から採取しました(W2025-065-1)。TRIzol試薬とクロロホルムおよびイソプロパノールを組み合わせて総RNAを単離しました。抽出後、RNAはDEPC処理水に溶解され、その濃度と純度はナノドロップ分光光度計で評価されました。転写解析のために、RT用Fast First-Sand cDNA合成ミックス(dsDNase使用)を用いてRNAを逆転写してcDNAに転写しました。その後、Fast Taq qPCR SYBR Green Mixを用いて定量PCRが実施されました。具体的なプライマー配列は 材料表に詳述されています。相対的な遺伝子発現レベルは、適切な正規化を用いて2-ΔΔCT 法を用いて計算されました。
統計解析
すべての統計解析はRソフトウェアとGraphPad Prismを用いて実施されました。2つの独立したグループ間の統計比較は、データ分布に応じてStudentのt検定またはMann-Whitney U検定のいずれかを用いて行われました。p値が0.05未満であれば、統計的有意性を示すと考えられました。