$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
データ検索と前処理
本研究は公開されているトランスクリプトムおよび遺伝データを用いて実施されました。人間や動物の被験者は直接関与していません。HER2+乳がん治療耐性に関連するトランスクリプトミックデータセットは、NCBI遺伝子発現オムニバス(GEO)データベースから取得されました(https://www.ncbi.nlm.nih.gov/geo/)11。GSE231524およびGSE231525の2つのRNA-seqデータセットが、HER2+乳がん細胞株(BT474およびMDA-MB-453)におけるHER3駆動耐性およびDUSP6阻害に特に焦点を当てていることから選ばれました。これらのデータセットには、ラパチニブ(1μM)曝露およびDUSP6ノックダウンに由来する親表、薬剤耐性、薬剤耐性表現型が含まれていました。生カウント行列および対応するメタデータファイルは、RStudio(v4.3.2)のGEOquery(v2.70.0)およびBiobase(v2.62.0)パッケージを使ってアクセスされました12。メタデータは各データセットごとに2つの主要な対照を定義するために厳選されました。GSE231524は対照群(BT474親代、0日目)と薬剤耐性および薬剤耐性サンプル(9日目〜9か月目)を比較しGSE231525、対照群(スクランブルドsiRNA)とDUSP6ノックダウン(DUSP6-KD)を比較しました。品質管理とデータ正規化はDESeq2(v1.42.0)フレームワークを用いて行われ、分散安定化変換(VST)を用いて異様分散性を低減し、サンプル間の比較可能性を確保しました。データ分布およびクラスタリングパターンは、ggplot2(v3.5.0)およびpheatmap(v1.0.12)を用いて視覚的に評価し、データの均一性を確認し、差異表現解析の前に潜在的な外れ値を特定しました13,14。
本研究では、細胞株トランスクリプトミクスデータセットから得られた結果と患者由来の臨床データセットから得られた結果との間に明確な区別が維持されました。細胞株データは主に探索的解析に用いられ、差異発現遺伝子の同定や、制御された実験モデルにおける予備的な機構的知見の生成に用いられました。対照的に、患者由来データセットは遺伝子発現パターンの外部検証や臨床的関連性評価、予後評価に用いられました。したがって、細胞株モデルおよび臨床コホートの結果は、過度な一般化を避け、すべての結果に適切な翻訳的文脈を確保するために別々に解釈されます。
差異遺伝子発現解析
対照条件と治療条件間で有意に変容された遺伝子を特定するために差異発現解析が行われました。正規化されたカウントは、DESeq2に統合された調整回帰モデル(ARM)を用いて処理され、log₂フォールド変化と統計的有意性を正確に推定しました。設計式は~条件として定義され、対照群と処理群を表しました。調整p値(FDR)が0.05<、絶対log₂フォールド変化≥1の遺伝子は有意に発現に差があると考えられました。効果サイズ推定の堅牢性を高めるために、apeglm法を用いてLog₂フォールド変化縮小を実施しました。分析結果はEnhancedVolcano (v1.22.0)15 およびggplot216を用いて可視化され、発現規模と統計的信頼度の関係を示す火山プロットおよびMAプロットが生成されました。分散推定もDESeq2内で評価され、生物学的複製の正確な分散モデリングと一貫した正規化を確保しました17。
ミトコンドリア酸化ストレス関連差異発現遺伝子(MOS-DEGs)の検索および同定
エネルギー代謝、酸化ストレス、薬剤耐性の関連を調査するため、Human MitoCarta3.018 (https://personal.broadinstitute.org/scalvo/MitoCarta3.0/human.mitocarta3.0.html)、Gene Ontology(GO:0006979、酸化ストレスへの応答)(http://geneontology.org/)、京都遺伝子・ゲノム百科事典(KEGG)酸化リン酸化経路など複数のデータベースからミトコンドリアおよび酸化ストレス関連遺伝子の包括的なリストが作成されました(https://www.genome.jp/kegg/ 年)、およびヒト酸化ストレス遺伝子データベース(HOSGDB)(http://hosgdb.com/ 年)。回収されたすべての遺伝子は、orgを用いてHGNC承認の遺伝子シンボルに標準化されました。Hs.eg.db(v3.18.0)およびAnnotationDbi(v1.64.0)は、重複したエントリー、擬遺伝子、非コードRNAは注釈の正確性を確保するために削除されました。その結果生まれた厳選されたミトコンドリア酸化ストレス遺伝子パネル(MOS遺伝子)は、両トランスクリプトミックデータセットから同定された差異発現遺伝子との統合の参考セットとして用いられました。
キュレーションされたMOS遺伝子リストと、GSE231524およびGSE231525から得られたDEGの交差は、rでdplyr(v1.1.3)19 およびベースのRのintersect()関数を用いて実行されました。この統合的アプローチにより、ミトコンドリア代謝、酸化還元調節、酸化ストレス適応に機能的に関連した遺伝子を表すMOS-DEGsの同定が可能となりました。データセット間の重複は、実験モデル間で共有および一意遺伝子を示すためにRのVennDiagram(v1.7.3)パッケージを用いて可視化されました。洗練されたMOS-DEGのリストは下流解析に用いられ、HER2標的治療耐性の転写および代謝再プログラミングのメカニズムに関する洞察を提供しました。
MOS-DEGの発現プロファイリングと可視化
同定されたMOS-DEGsの発現プロファイリングは、RStudioのComplexHeatmap(v2.18.0)21 およびpheatmap(v1.0.12)パッケージを用いて行われ、親、薬剤耐性、耐性疾患における全体的な発現パターンを可視化しました。正規化されたカウントデータはzスコアスケーリングを用いて変換され、サンプル間で遺伝子発現マトリックスを標準化しました。クラスタリングはユークリッド距離法および完全連鎖法を用いて共発現パターンの検出と条件特異的な転写プロファイルの識別を行いました。状態間の明確な視覚的差異を確保するために、ggplot2を用いてヒートマップとクラスタリングプロットを作成しました。この可視化アプローチにより、ミトコンドリア活性、酸化ストレス調節、薬剤耐性状態下での代謝再プログラミングに関連する遺伝子群の同定が可能となりました。
機能的豊富化と経路注釈
同定されたMOS-DEGの生物学的意義および調節機構を探るため、遺伝子オントロジー(GO)および京都遺伝子・ゲノム百科事典(KEGG)の濃縮解析がR Studio(バージョン4.3.1)を用いて実施されました。解析は、複数のBioconductorパッケージを用いて再現可能な計算と可視化を行うtidyverse環境で実施されました。遺伝子注釈と識別子マッピングは組織を用いて行われました。Hs.eg.db ホ モ・サピエンスの リファレンスゲノム(GRCh38)に基づくデータベース(https://bioconductor.org/packages/org.Hs.eg.db/)。GO濃縮解析はclusterProfilerパッケージ(バージョン4.8.1、https://bioconductor.org/packages/clusterProfiler/)を用いて行われ、遺伝子を生物学的プロセス(BP)、細胞成分(CC)、分子機能(MF)の3つの主要なオントロジーに分類しています。enrichGO22 関数は、パラメータをp 値 <0.05に設定し、 p値を調整した 状態で使用されました。(FDR)<0.05で、ベンジャミニ–ホッホバーグ補正法を適用しました。バープロット、ドットプロット、コード図などの可視化は、enrichplot(https://bioconductor.org/packages/enrichplot/)、ggplot213 (https://cran.r-project.org/web/packages/ggplot2/)、GOplot(https://cran.r-project.org/web/packages/GOplot/)を用いて生成されました。これらのツールは、強化されたGO用語とその遺伝子関連を構造化した視点を提供しました。
KEGG経路の濃縮はclusterProfilerパッケージ内のenrichKEGG()関数を用いて行われ、人間のKEGGデータベース(https://www.genome.jp/kegg/)を参照しています。KEGGRESTパッケージ(https://bioconductor.org/packages/KEGGREST/)は経路データの検索と注釈に使用されました。調整済み p値 (q値)<0.05の経路は有意とみなされました。可視化と経路マッピングはpathview(https://bioconductor.org/packages/pathview/)、ggplot2、enrichplotを用いて行われ、ネットワーク表現にはigraphとggraphが用いられました。すべての濃縮解析および可視化はR Studio(v4.3.1)で再現可能なコードと標準化されたバイオコンダクターワークフローを用いて実装され、MOS-DEGに関連する濃縮機能カテゴリーおよび生物学的経路の信頼性の高い同定が保証されました。
乳がんにおける予測バイオマーカーのROCベースの検証
MOS-DEGsの臨床的予測力を検証するため、ROCplotterオンラインツール(https://www.rocplot.org/)を用いて受信者の動作特性(ROC)曲線解析を実施しました24。ROCplotterは、化学療法、ホルモン療法、抗HER2薬を含む3,104人の乳がん患者の遺伝子発現データと臨床注釈付き治療反応データセットを統合した統合ウェブベースのプラットフォームです。
分析は「病理的完全反応」をアウトカム変数、「任意の化学療法(いかなる化学療法)」を治療カテゴリーとして用いて行われました。Affymetrixマイクロアレイデータセットから得られた遺伝子発現値は、プラットフォーム内の臨床注釈に基づき、自動的にレスポンダーグループと非レスポンダーグループに階層化されました。
受講者操作特性(ROC)曲線(AUC)、マン・ホイットニーU検定、フォールド変化検定、カイ二乗検定を用いて、各遺伝子が応答者と非応答者を区別する能力を評価しました。判別性能を評価する主要な指標として、曲線下面積(AUC)が用いられました。AUC値が0.55を超え、ROCのp値が0.05<有意とみなされ、トランスクリプトミックバイオマーカーに典型的な中程度の予測性能を示し、分析的厳密性を維持するために偽発見率(FDR)補正を適用しました。
選ばれたすべてのMOS-DEGは対応するAffymetrixプローブIDで照会されました。各遺伝子の識別力は臨床乳がんコホート全体で評価され、発現データは反応者グループと非反応者グループに階層化されました。ROC曲線、ボックスプロット、および関連する統計出力はROCplotterプラットフォームによって直接生成され、下流の可視化および比較のためにエクスポートされました。この解析は、ミトコンドリア酸化ストレスに関与する酸化還元および代謝調節因子の予測価値を定量化しました。臨床サンプル間で一貫した予測有意性を示す遺伝子は、最終的な予測パネルに含めるために保持されました。
腫瘍、正常、転移組織における差異発現解析(TNMplot解析)
主要なMOS-DEGsの発現パターンは、TNMplotウェブツールv2 (https://tnmplot.com/analysis/)25を用いて正常、腫瘍、転移性乳腺組織にわたって解析されました。RNA-Seq(TCGA + GTEx + MET500)および遺伝子チップデータセットの両方を検証し、クロスプラットフォーム検証を確実にしました。「多重遺伝子解析」モジュールは乳浸潤性がんで選択された組織タイプ26として使用されました。発現値はlog₂形質転換され、腫瘍群と正常群(TvsN)、転移性対腫瘍群(MvsT)、転移性群と正常群(MvsN)で比較されました。TNMplotはMann–Whitney U検定を用いて、統計的有意性を評価するためにフォールド変化(FC)とp値を自動で計算しました。発現分布はTNMplotインターフェースから直接生成されたボックスプロットと密度プロットとして可視化され、緑、赤、灰色はそれぞれ正常組織、腫瘍組織、転移組織を表しました。すべての図は高解像度でエクスポートされ、結果セクションに統合されました。この二重プラットフォーム解析により、乳がん進行に関連する主要なミトコンドリア酸化還元代謝調節因子の強健な同定と検証が可能となりました。
カプラン・マイヤープロッターを用いた生存および予後解析
乳がんにおけるMOS-DEGの予後的関連性を評価するため、Kaplan–Meier Plotterオンラインツール(https://kmplot.com/analysis/)28を用いて生存分析が実施されました。このデータベースは、複数のGEO、EGA、TCGAデータセットから得られた4,900人以上の乳がん患者の遺伝子発現および生存データを統合しています。解析は、優先遺伝子に対応する個々のAffymetrixプローブIDを用いて再発なし生存率(RFS)を用い、225609_at(GSR)、201761_at(MTHFD2)、201619_at(PRDX3/AOP1)、201128_s_at(ACLY)を用いて実施されました。患者は中央値発現カットオフに基づいて高発現群と低発現群に分けられ、生存確率はKaplan–Meier法を用いて推定されました。ログランク検定は生存曲線間の統計的有意性を評価するために用いられ、95%信頼区間(CI)を含むハザード比(HR)がツールによって自動的に算出されました。すべての解析はRFSエンドポイントを用いて行われ、ホルモン受容体やHER2の状態(ER、PR、HER2=すべて)に基づく制限はありませんでした。冗長なサンプルは除去され、統計的堅牢性を確保するために比例的なハザード仮定が検証されました。品質管理フィルターではバイアスされたマイクロアレイは除外されました。KMプロッターのデフォルト設定に従い、複数回のテストに対して手動プローブ選択やp値補正は適用されませんでした。統計的有意な差はp.<0.05と定義されました。生存プロットを可視化し、高解像度でダウンロードし、各候補MOS遺伝子29,30の高発現体と低発現体の結果を比較しました。
本解析は、HER2+ 乳がんサンプルのみを用いて、差異発現遺伝子(DEG)およびハブ遺伝子の同定を目的としたものである。その後、HER2の状態(ER、PR、HER2=すべて)に制限なく生存分析を行い、同定された遺伝子のより広範な予後関連性と一般化可能性を評価しました。このアプローチは、研究の焦点を再定義するのではなく、二次的な検証ステップとして用いられました。したがって、同定されたハブ遺伝子の予後的影響は慎重に解釈され、主要な結論はHER2+ 乳がんに特有のままです。
MTHFD2-201(ENST00000394053.7)およびPRDX3-201(ENST00000298510.4)の標準転写配列は、Ensembl Genome Browser (https://www.ensembl.org)31,32から取得されました。変異株の注釈と分類はEnsembl Variant Effect Predictor(https://www.ensembl.org/vep)を用いて行われ、各特定変異体に対して詳細なゲノム文脈、コドン変化、アミノ酸置換を提供しました。下流解析のために選ばれたのはミスセンス変異(非同義SNP)のみでした。
病原性予測と変異の優先順位付け
各nsSNPの機能的影響は、計算予測ツールを組み合わせて評価されました。SIFT(https://sift.bii.a-star.edu.sg)を用いてアミノ酸保存の評価を行い、スコア0.05の変異株を有害な33≤分類しました。PolyPhen-2(http://genetics.bwh.harvard.edu/pph2)は置換の構造的および進化的影響を推定し、スコア≥0.85は被害の可能性を示しました。34。CADD(https://cadd.gs.washington.edu)は複数の注釈を統合した複合有害性スコアを提供し、≥20は高い病原性ポテンシャル35を示しました。MetaLR36、Mutation Assessor、REVELからの補完的な指標がVEPインターフェースから統合され、予測信頼性の向上が図られました37。MetaLR ≥ 0.70、Mutation Assessor ≥ 3.5、REVEL ≥ 0.75 の閾値を満たす変異株が、病原性の可能性が高いと優先されました。
構造的および機構的影響予測
アミノ酸置換が構造の完全性や生化学的機能にどのように影響するかを評価するため、上位のnsSNPはMutPred2(http://mutpred.mutdb.org)38 およびDynaMut(http://biosig.unimelb.edu.au/dynamut)39を用いてさらに解析されました。MutPred2は、触媒活性の変化、金属結合残基の増減、溶媒アクセスの変化、アロステリック調節を含む機能障害の確率を推定し、0.80≥高度に病原性が高いと分類されました。DynaMutは野生型タンパク質と変異タンパク質間のギブス自由エネルギー変化(ΔΔG)を計算し、安定性変化の方向と大きさを評価し、原子変位や水素結合の再配置の可視化を生成しました。
二次構造および3D構造モデリングおよび溶媒アクセス性プロファイリング
MTHFD2およびPRDX3の実験的に分離された結晶構造は、タンパク質データバンク(PDB)から取得され、PyMOL V:3.1 (https://pymol.org)40 で処理され、有害残基の空間的分布を可視化しました。変異体モデルは、対応するアミノ酸置換を導入し、その後構造の精緻化とエネルギー最小化を行って作成されました。比較3次元検査では、二次元素の変化、原子間接触の変化、nsSNPが触媒および共因子結合ドメインに空間的に近接していることが明らかになり、酸化還元および代謝機能の潜在的な障害が明らかになりました。
二次構造および溶媒曝露解析はPSIPRED V: 3.2 (http://bioinf.cs.ucl.ac.uk/psipred)41,42およびNetSurfP 3.0 (https://services.healthtech.dtu.dk/service.php?NetSurfP-2.0)43を用いて実施されました。これらのツールは、αヘリックス、β鎖、コイル、無秩序領域、そして相対溶媒アクセス性(RSA)スコアを予測しました。中程度から高いRSA値と構造順序を示す残基をマッピングし、溶媒曝露および機能的に重要な位置を特定しました。影響を受けた部位は2Dトポロジー図で可視化され、有害な変異が剛性触媒コアで起こるのか柔軟なループ領域で起こるのかを判定し、タンパク質の折りたたみ動態や酵素効率に対する影響を予測しました。
データベースの相互検証、関数統合、安定性検証
優先順位付けされた各nsSNPは、dbSNP、1000ゲノム、ExAC、gnomADなどの集団レベルのゲノムデータベースと照合し、変異頻度、全体的な対立遺伝子分布、過去に報告された臨床関連を確認しました。進化保存、構造モデリング、機械学習に基づく機能予測の統合により、MTHFD2およびPRDX3における高信頼度の有害変異の同定が可能となりました。これらの高影響変異はその後、機能ドメインにマッピングされ、ミトコンドリア酸化ストレスの不均衡、代謝シグナル伝達の変化、乳がんにおける治療抵抗性における潜在的な役割を明らかにしました。各有害置換の熱力学的影響をさらに確認するために、iMutant 3.0 (https://folding.biofold.org/i-mutant/i-mutant3.0.html)44 を用いて、配列および構造データを用いて変異がタンパク質安定性に与える影響を予測しました。解析では野生型タンパク質と変異型タンパク質間の自由エネルギー変化を表すΔΔG(kcal/mol)値を算出しました。ΔΔG値が陰性である変異は不安定化変異として分類され、タンパク質の安定性低下と展開確率の増加を示しました。iMutant予測とDynaMutおよびMutPred2の結果の統合により、酸化還元機能、触媒完全性、タンパク質全体の立体構造安定性に影響を与える可能性のある構造的に重要な残基の同定のクロスバリデーションが可能となりました。
統合的機能的解釈と治療的関連性
特定されたすべての有害なnsSNPは、dbSNP、gnomAD、ExACの母集団データベースとのクロスリファレンスにより検証され、マイナーアレル頻度およびがん表現型との既に報告された関連性を検証しました。進化的保存、構造モデリング、安定性データの統合的解釈により、高影響の変異rs1471336772(MTHFD2)およびrs747786383(PRDX3)がタンパク質の立体構造および触媒効率に最も強い悪影響を及ぼすことが示されました。計算結果は、MTHFD2の変異がNADPH依存性のレドックス代謝を不安定化させる一方で、PRDX3の変異がペルオキシダーゼ介在の酸化ストレス防御を損ない、ミトコンドリア機能障害や腫瘍攻撃性に寄与していることを示唆しています。このnsSNPベースの構造および機能解析は、将来の治療スクリーニングおよび変異検証のための計算的基盤を提供し、MTHFD2およびPRDX3が酸化還元標的乳がん治療の精密バイオマーカーであることを強調しています。分析戦略の明確さを高め、包括的概要を提供するために、研究の主要なステップをまとめた概略的なワークフローを 図2に示しています。このワークフローは、差分遺伝子発現解析、ミトコンドリア遺伝子フィルタリング、タンパク質間相互作用ネットワーク構築、ROC解析を用いた臨床検証、nsSNPに基づく構造特性評価を統合しています。この段階的な枠組みは、トランスクリプトミックデータ処理からバイオマーカー同定および機能的解釈への論理的な進展を強調しています。

図2。HER2+ 乳がんにおけるミトコンドリア酸化ストレス関連バイオマーカーの同定および検証のための統合的多段階ワークフロー。この概 説は、研究で用いられた分析パイプラインをまとめたものです。まず、RNA-seqデータセット(GSE231524およびGSE231525)に対して差異遺伝子発現(DEG)解析を行い、有意に変異した遺伝子を特定しました。これらのDEGは、精選されたミトコンドリア酸化ストレス関連遺伝子と交差させ、MOS-DEGを得ました。次に、STRINGとCytoscapeを用いてタンパク質間相互作用(PPI)ネットワーク解析を行い、ハブ遺伝子と機能モジュールを特定しました。その後、ROCプロッタープラットフォームを用いて、臨床コホートにおける選択遺伝子の予測性能を評価するために、受講者動作特性(ROC)曲線解析を適用しました。最後に、非同義SNP(nsSNP)解析と構造モデリングを行い、優先遺伝子(MTHFD2およびPRDX3)における主要変異の機能的および構造的影響を評価しました。この統合的ワークフローは、トランスクリプトミクス、ネットワーク解析、臨床解析、構造解析を結びつけ、潜在的なバイオマーカーや治療標的を特定します。 この図の拡大版はこちらをクリックしてご覧ください。