Research Article

Identification des gènes hub, des polymorphismes mononucléotides et des cibles potentielles de médicaments dans le cancer du sein à l’aide d’une analyse transcriptomique

DOI:

10.3791/70964

June 9th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude a étudié les gènes liés au stress oxydatif mitochondrial associés à la résistance thérapeutique chez le cancer du sein HER2-positif. En utilisant des ensembles de données transcriptomiques, une bioinformatique intégrée et des données cliniques (n = 4 929), les auteurs ont identifié MTHFD2 et PRDX3 comme des gènes clés exprimés différemment avec une valeur pronostique potentielle. In silico. Les analyses suggèrent des effets fonctionnels des variantes génétiques.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le cancer du sein HER2-positif (HER2+) développe souvent une résistance à des thérapies comme le Lapatinib, pouvant impliquer le métabolisme mitochondrial et la reprogrammation redox. Cette étude visait à identifier les gènes liés au stress oxydatif mitochondrial (MOS-DEG) comme biomarqueurs de résistance et à caractériser leurs NSSP fonctionnels et leurs impacts structurels. Des ensembles de données RNA-seq (GSE231524, GSE231525) ont été analysés à l’aide de DESeq2 pour identifier les DEG, qui ont été croisés avec des gènes de stress oxydatif mitochondrial pour obtenir des MOS-DEG. Un enrichissement fonctionnel, une analyse IPP, une analyse ROC, un profilage d’expression et une analyse de survie ont été réalisés. Les nsSNP ont été évalués à l’aide de multiples outils prédictifs, et les impacts structurels ont été évalués par modélisation secondaire et 3D. Une analyse transcriptomique et clinique intégrée a identifié MTHFD2 et PRDX3 comme des MOS-DEG centraux présentant des rôles régulateurs opposés dans le métabolisme redox mitochondrial. MTHFD2 était fortement surélevée et associée à un pronostic mauvais (HR = 1,53, p = 1,1 × 10⁻16), tandis que PRDX3 présentait des schémas d’expression protecteurs (HR = 0,73, p = 7,7×10⁻10). L’analyse ROC suggérait leur potentiel en tant que prédicteurs de la réponse thérapeutique. L’analyse nsSNP a révélé cinq variants délétères dans MTHFD2 et quatre variants délétères dans PRDX3, rs1471336772 (MTHFD2) et rs747786383 (PRDX3.) identifiés comme les plus pathogènes. Ces variantes étaient prédites comme dommageables en se basant sur plusieurs systèmes de notation computationnelle, notamment SIFT ≤ 0,05, PolyPhen-2 ≥ 0,85, des scores CADD délétères et des scores REVEL élevés, et étaient situées dans des domaines catalytiques ou redox actifs. La modélisation structurelle a suggéré que ces substitutions peuvent déstabiliser la conformation, perturber les sites de liaison des métaux et cofacteurs, et affecter la régénération de la NADPH ou l’activité de la peroxydase dépendante de la thioredoxine. Les prédictions de dynamique moléculaire ont indiqué une perte potentielle de stabilité structurelle et une flexibilité altérée, suggérant une possible altération fonctionnelle du contrôle redox mitochondrial. Cette étude identifie MTHFD2 et PRDX3 comme régulateurs du stress oxydatif mitochondrial dans le cancer du sein HER2+ . Les NSSNP délétères dans ces gènes peuvent contribuer à un équilibre redox altéré, pouvant influencer l’adaptation métabolique (MTHFD2) et la défense antioxydante (PRDX3).

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le cancer du sein est le cancer le plus fréquemment diagnostiqué chez les femmes dans le monde et constitue une cause majeure de décès liés au cancer, malgré des progrès substantiels dans la détection précoce et les traitements ciblés 1,2,3. L’hétérogénéité moléculaire au sein des tumeurs mammaires sous-tend la diversité des résultats cliniques et des réponses au traitement, posant des défis persistants pour l’oncologiede précision 4,5. Parmi les sous-types moléculaires reconnus, le cancer du sein positif au récepteur du facteur de croissance épidermique 2 (HER2) humain représente environ 15 à 20 % de tous les cancers du sein et se caractérise par une amplification du gène HER2 et une surexpression de la tyrosine kinase du récepteur HER2 6,7. Bien que les thérapies ciblant HER2, telles que le trastuzumab et le lapatinib, aient nettement amélioré le pronostic chez les patients, une résistance primaire et acquise à ces agents apparaît fréquemment, conduisant à une rechute tumorale et à la progressionde la maladie 8,9. Comprendre les mécanismes moléculaires à l’origine de la résistance à la thérapie HER2 reste donc un besoin majeur non satisfait en oncologie clinique.

Les preuves émergentes suggèrent que la dysfonction mitochondriale et le stress oxydatif jouent un rôle crucial dans la médiation de la résistance aux médicaments dans le cancer du sein. Les mitochondries, au-delà de leur rôle canonique dans la production d’ATP, sont des régulatrices clés de l’apoptose, de la signalisation redox et de la plasticité métabolique — autant de processus que les cellules cancéreuses exploitent pour survivre à la pression thérapeutique. En particulier, les cellules cancéreuses HER2+ résistantes présentent un déplacement métabolique vers la phosphorylation oxydative (OXPHOS), un tampon accru des espèces réactives de l’oxygène (ROS) et une biogenèse mitochondriale modifiée. Ces adaptations permettent aux cellules de maintenir la signalisation de survie et d’échapper à l’apoptose malgré une inhibition soutenue des voies de signalisation HER2. Les gènes codant pour les sous-unités du complexe mitochondrial et les enzymes régulant le redox sont donc des biomarqueurs potentiels et des cibles thérapeutiques pour surmonter la résistance.

Parallèlement, les polymorphismes à nucléotide unique (NSSPs) non synonymes dans les gènes mitochondriaux ou liés au stress oxydatif peuvent modifier la structure et la fonction des protéines, influençant l’activité enzymatique, la réponse aux médicaments et la susceptibilité auxmaladies 10. Prédiction computationnelle des effets délétères des nsSNP utilisant in silico.des outils tels que SIFT, PolyPhen-2 et CADD offrent un moyen rapide d’identifier les variants fonctionnels pouvant contribuer à l’hétérogénéité du cancer et à la résistance thérapeutique. L’intégration des données transcriptomiques et mutationnelles offre ainsi une vision multidimensionnelle de la dysrégulation génétique et de l’altération structurelle tant au niveau transcriptionnel que génomique.

Les avancées récentes en bioinformatique et en biologie des systèmes ont permis l’identification à haut débit des gènes moteurs potentiels grâce à un profilage d’expression à grande échelle et une analyse basée sur les réseaux. Des dépôts publics tels que le Gene Expression Omnibus (GEO) fournissent des ensembles de données précieux de séquençage d’ARN qui capturent les changements moléculaires entre modèles expérimentaux et cohortes de patients. Associées à des outils analytiques tels que DESeq2, clusterProfiler et l’analyse du réseau STRING–Cytoscape, ces ressources permettent une caractérisation complète des gènes différenciellement exprimés (DEG), l’enrichissement des voies et la découverte de gènes hub. Il est important de noter que l’intégration des signatures géniques du stress oxydatif mitochondrial avec les DEG peut mettre en lumière de nouveaux mécanismes moléculaires sous-jacents à la résistance à la thérapie ciblée par HER2 et identifier des biomarqueurs candidats pour une intervention thérapeutique.

L’axe de résistance piloté par HER3 a récemment attiré l’attention en tant que voie compensatoire majeure après l’inhibition de HER2. L’activation de HER3 restaure la signalisation en aval de PI3K/AKT, favorisant la survie cellulaire et la tolérance aux médicaments (Figure 1). La DUSP6 (Phosphatase à double spécificité 6), un régulateur négatif de la signalisation ERK, a été impliquée dans la modulation de cette réponse adaptative. L’inhibition de DUSP6 réactive la signalisation ERK et peut contrer la résistance médiée par HER3, mais son interaction avec le stress oxydatif mitochondrial et l’adaptation métabolique reste insuffisamment comprise. Ainsi, des analyses transcriptomiques comparatives de lignées cellulaires HER2+ (BT474 et MDA-MB-453) sous inhibition de DUSP6 et exposition chronique au Lapatinib offrent un modèle idéal pour disséquer les déterminants moléculaires de la résistance aux médicaments.

Figure 1
Figure 1. Représentation schématique du paysage moléculaire reliant dysfonctionnement mitochondrial, stress oxydatif et progression du cancer du sein. Ces mécanismes moléculaires intégrés sous-jacents au stress oxydatif mitochondrial ont provoqué l’oncogenèse dans le cancer du sein. Des complexes de chaînes de transport d’électrons mitochondriaux dérégulés, en particulier impliquant DUFS3, UQCRC1, COX4I1, SDHA et ATP5PO, conduisent à une production excessive d’espèces réactives de l’oxygène (ROS), entraînant des dommages oxydatifs à l’ADN, une peroxydation lipidique et un potentiel de membrane mitochondriale altéré. Ces perturbations oxydatives activent des voies de signalisation oncogéniques telles que PI3K/AKT, MACK et NF-κB, tout en supprimant les régulateurs apoptotiques tels que p53 et BAX, favorisant ainsi la survie des cellules tumorales, la prolifération et l’évasion immunitaire. Le schéma met également en lumière le double impact du stress oxydatif mitochondrial sur le métabolisme du cancer et le microenvironnement tumoral, soulignant sa contribution à la résistance au traitement et à la modulation immunitaire dans les conditions de cancer du sein HER2+. Ce modèle intégratif constitue la base mécanistique des analyses transcriptomiques et basées sur SNP ultérieures, visant à identifier les gènes conducteurs mitochondriaux et les cibles thérapeutiques potentielles. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

La présente étude a été conçue pour identifier systématiquement les gènes centrals, les nsSNP fonctionnels et les cibles médicamenteuses potentielles associées au stress oxydatif mitochondrial dans le cancer du sein HER2+ . En intégrant des données transcriptomiques issues de GSE231524 et GSE231525 avec des ensembles de gènes mitochondriaux et liés au stress oxydatif sélectionnés, l’étude actuelle visait à définir les gènes différentiels liés au stress oxydatif mitochondrial (MOS-DEG) qui contribuent à la résistance à la thérapie. Les analyses en aval comprenaient l’enrichissement de l’ontologie génique (GO) et des voies KEGG, la construction de réseaux d’interaction protéine-protéine (PPI), la priorisation des gènes centraux et l’analyse de corrélation de survie utilisant la base de données Kaplan–Meier Immunotherapy. De plus, des gènes clés ont été étudiés davantage pour la variation des nsSNP et son impact structurel potentiel afin de délimiter les conséquences fonctionnelles dues aux mutations.

En combinant le profilage transcriptomique, la biologie des réseaux et l’analyse mutationnelle in silico , cette étude fournit un cadre intégré pour découvrir des biomarqueurs mitochondriaux potentiels et des cibles thérapeutiques dans le cancer du sein HER2+ . L’identification des gènes centrals liés à la phosphorylation oxydative et de leurs SNP fonctionnels pourrait ouvrir la voie au développement de stratégies thérapeutiques de précision pour surmonter la résistance aux médicaments ciblés par HER2 et améliorer les résultats pour les patients.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Récupération des données et prétraitement

Cette étude a été menée à partir de données transcriptomiques et génétiques accessibles au public ; aucun sujet humain ou animal n’était directement impliqué. Les ensembles de données transcriptomiques pertinents pour la résistance au traitement du cancer du sein HER2+ ont été extraits de la base de données NCBI Gene Expression Omnibus (GEO) (https://www.ncbi.nlm.nih.gov/geo/)11. Deux ensembles de données RNA-seq, GSE231524 et GSE231525, ont été sélectionnés en raison de leur focus spécifique sur la résistance alimentée par HER3 et l’inhibition de DUSP6 dans les lignées cellulaires de cancer du sein HER2+ (BT474 et MDA-MB-453). Ces ensembles de données comprenaient des phénotypes parentaux, tolérants et résistants aux médicaments dérivés de l’exposition au Lapatinib (1 μM) et du knockdown au DUSP6. Les matrices de comptage brut et les fichiers de métadonnées correspondants étaient consultés via les paquets GEOquery (v2.70.0) et Biobase (v2.62.0) dans RStudio (v4.3.2)12. Les métadonnées ont été sélectionnées pour définir deux contrastes principaux pour chaque ensemble de données : GSE231524 comparé le témoin (BT474 parental, jour 0) avec des échantillons tolérants et résistants aux médicaments (jour 9–mois 9), tandis que GSE231525 comparé le témoin (ARNN brouillé) avec le knockdown DUSP6 (DUSP6-KD). Le contrôle qualité et la normalisation des données ont été réalisés à l’aide du cadre DESeq2 (v1.42.0), qui applique une transformation stabilisatrice de variance (VST) pour réduire l’hétéroscédasticité et garantir la comparabilité entre les échantillons. La répartition des données et les schémas de regroupement ont été évalués visuellement à l’aide de ggplot2 (v3.5.0) et pheatmap (v1.0.12) afin de confirmer l’uniformité des données et d’identifier les valeurs aberrantes potentielles avant l’analyse différentielled’expression 13,14.

Dans cette étude, une distinction claire a été maintenue entre les résultats issus de jeux de données transcriptomiques de lignées cellulaires et ceux obtenus à partir de jeux de données cliniques dérivés des patients. Les données de lignées cellulaires ont principalement été utilisées pour des analyses exploratoires, incluant l’identification de gènes exprimés différemment et la génération d’intuitions mécanistiques préliminaires dans des modèles expérimentaux contrôlés. En revanche, des ensembles de données dérivés des patients ont été utilisés pour la validation externe des schémas d’expression génique et l’évaluation de leur pertinence clinique, y compris l’évaluation pronostique. En conséquence, les résultats des modèles de lignées cellulaires et des cohortes cliniques sont interprétés séparément afin d’éviter la généralisation excessive et d’assurer un contexte translationnel approprié pour toutes les conclusions.

Analyse différentielle de l’expression génique

Une analyse d’expression différentielle a été réalisée pour identifier les gènes qui étaient significativement modulés entre les conditions témoins et traitement. Les comptages normalisés ont été traités à l’aide du modèle de régression ajusté (ARM) intégré à DESeq2 afin d’estimer avec précision les variations de pliage log₂ et la signification statistique. La formule de conception était définie comme ~condition, représentant les groupes témoins versus groupes traités. Les gènes avec une valeur p ajustée (FDR) < 0,05 et un changement absolu log₂ ≥ 1 ont été considérés comme exprimés de manière significativement différentielle. Le retrait du changement de pli log₂ a été réalisé à l’aide de la méthode apeglm pour améliorer la robustesse de l’estimation de la taille de l’effet. Les résultats de l’analyse ont été visualisés à l’aide d’EnhancedVolcano (v1.22.0)15 et ggplot216, qui ont généré des graphiques volcaniques et des graphiques MA montrant la relation entre la magnitude de l’expression et la confiance statistique. Des estimations de dispersion ont également été évaluées dans le cadre de DESeq2 afin d’assurer une modélisation précise de la variance et une normalisation cohérente entre les répliquesbiologiques 17.

Récupération et identification des gènes différentiels-exprimés différemment liés au stress oxydatif mitochondrial (MOS-DEG)

Pour étudier le lien entre le métabolisme énergétique, le stress oxydatif et la résistance aux médicaments, une liste complète des gènes associés au stress mitochondrial et oxydatif a été compilée à partir de plusieurs bases de données, dont Human MitoCarta3.018 (https://personal.broadinstitute.org/scalvo/MitoCarta3.0/human.mitocarta3.0.html), Gene Ontology (GO :0006979, response to oxidative stress) (http://geneontology.org/), la Kyoto Encyclopedia of Genes and Genomes (KEGG) via de phosphorylation oxydative (https://www.genome.jp/kegg/), et la base de données des gènes du stress oxydatif humain (HOSGDB) (http://hosgdb.com/). Tous les gènes récupérés ont été standardisés selon des symboles génétiques approuvés par HGNC en utilisant org. Hs.eg.db (v3.18.0) et AnnotationDbi (v1.64.0), tandis que les entrées en double, les pseudogènes et les ARN non codants ont été supprimés pour garantir la précision des annotations. Le panel de gènes de stress oxydatif mitochondrial (gènes MOS) ainsi sélectionné a ensuite été utilisé comme ensemble de référence pour l’intégration avec les gènes différenciellement exprimés identifiés à partir des deux ensembles de données transcriptomiques.

L’intersection de la liste de gènes MOS sélectionnée avec les DEG obtenus de GSE231524 et GSE231525 a été réalisée en R à l’aide de fonctions dplyr (v1.1.3)19 et de base R intersect(). Cette approche intégrative a permis d’identifier les MOS-DEG, représentant des gènes fonctionnellement liés au métabolisme mitochondrial, à la régulation redox et à l’adaptation au stress oxydatif. Le chevauchement entre les ensembles de données a été visualisé à l’aide du package VennDiagram (v1.7.3) dans R pour illustrer les gènes partagés et uniques entre les modèlesexpérimentaux 20. La liste affinée des MOS-DEG a été utilisée pour des analyses en aval, fournissant une compréhension mécaniste de la reprogrammation transcriptionnelle et métabolique sous-jacente à la résistance à la thérapie ciblée par HER2.

Profilage d’expression et visualisation des MOS-DEG

Le profilage d’expression des MOS-DEG identifiés a été réalisé à l’aide des packages ComplexHeatmap (v2.18.0)21 et pheatmap (v1.0.12) dans RStudio afin de visualiser les schémas d’expression globaux à travers les conditions parentales, tolérantes aux médicaments et résistantes. Les données de comptage normalisées ont été transformées à l’aide d’une échelle z-score pour standardiser la matrice d’expression génique à travers les échantillons. Le regroupement a été réalisé à l’aide de méthodes de distance euclidienne et de liaison complète pour détecter les schémas de co-expression et distinguer les profils transcriptionnels spécifiques à chaque condition. Des cartes thermiques et des graphiques de regroupement ont été générés à l’aide de ggplot2 afin d’assurer une différenciation visuelle claire entre les conditions. Cette approche de visualisation a facilité l’identification de groupes géniques associés à l’activité mitochondriale, à la modulation du stress oxydatif et à la reprogrammation métabolique sous des états résistants aux médicaments.

Enrichissement fonctionnel et annotation des voies

Pour explorer la signification biologique et les mécanismes régulateurs des MOS-DEG identifiés, des analyses d’enrichissement de la Gene Ontology (GO) et de la Kyoto Encyclopedia of Genes and Genomes (KEGG) ont été réalisées à l’aide de R Studio (version 4.3.1). Les analyses ont été réalisées dans l’environnement tidyverse en utilisant plusieurs packages Bioconductor pour le calcul et la visualisation reproductibles. L’annotation des gènes et le mappage des identifiants étaient effectués via l’organisation. Hs.eg.db base de données (https://bioconductor.org/packages/org.Hs.eg.db/) basée sur le génome de référence Homo sapiens (GRCh38). L’analyse d’enrichissement GO a été réalisée à l’aide du package clusterProfiler (version 4.8.1 ; https://bioconductor.org/packages/clusterProfiler/), qui classe les gènes en trois ontologies majeures : Processus biologique (BP), Composante cellulaire (CC) et Fonction moléculaire (MF). La fonctionenrichGO 22 était utilisée avec des paramètres fixés à la valeur p < 0,05 et la valeur p ajustée. (FDR) < 0,05, en appliquant la méthode de correction de Benjamini–Hochberg. Les visualisations, incluant les diagrammes en barres, les diagrammes de points et les diagrammes de cordes, ont été générées à l’aide d’enrichplot (https://bioconductor.org/packages/enrichplot/), ggplot213 (https://cran.r-project.org/web/packages/ggplot2/) et GOplot (https://cran.r-project.org/web/packages/GOplot/). Ces outils ont fourni une vue structurée des termes enrichis des GO et de leurs associations génétiques.

L’enrichissement des voies KEGG était réalisé à l’aide de la fonction enrichKEGG() dans le package clusterProfiler, en référence à la base de données humaine KEGG (https://www.genome.jp/kegg/). Le package KEGGREST (https://bioconductor.org/packages/KEGGREST/) était utilisé pour la récupération et l’annotation des données de voies. Les voies avec une valeur p ajustée. (valeur q) < 0,05 étaient considérées comme significatives. La visualisation et la cartographie des chemins ont été réalisées en utilisant pathview (https://bioconductor.org/packages/pathview/), ggplot2 et enrichplot, tandis qu’igraph et ggraph ont été utilisés pour la représentation du réseau23. Toutes les analyses et visualisations d’enrichissement ont été réalisées dans R Studio (v4.3.1) en utilisant du code reproductible et des flux de travail Bioconductor standardisés, garantissant une identification fiable des catégories fonctionnelles enrichies et des voies biologiques associées aux MOS-DEG.

Validation par ROC des biomarqueurs prédictifs dans le cancer du sein

Pour valider la puissance prédictive clinique des MOS-DEG, une analyse de la courbe de caractéristique de fonctionnement du récepteur (ROC) a été réalisée à l’aide de l’outil en ligne ROCplotter (https://www.rocplot.org/)24. ROCplotter est une plateforme web intégrée qui combine des données d’expression génique avec des ensembles de données cliniquement annotés sur la réponse au traitement de 3 104 patientes atteintes de cancer du sein, y compris celles traitées par chimiothérapie, hormonothérapie ou agents anti-HER2.

L’analyse a été réalisée en utilisant les paramètres « réponse complète pathologique » comme variable de résultat et « toute chimiothérapie » comme catégorie de traitement. Les valeurs d’expression génique dérivées des ensembles de données microarrays Affymetrix ont été automatiquement stratifiées en groupes répondants et non-répondants selon les annotations cliniques présentes sur la plateforme.

La courbe de caractéristique de fonctionnement du récepteur (ROC) (AUC), le test U de Mann–Whitney, le changement de pli et le test du chi-carré ont été appliqués pour évaluer la capacité de chaque gène à distinguer les répondants des non-répondants. La surface sous la courbe (AUC) a été utilisée comme principale mesure pour évaluer la performance discriminatoire. Les valeurs d’AUC supérieures à 0,55 avec des valeurs p ROC < 0,05 ont été considérées comme significatives, représentant une performance prédictive modérée typique des biomarqueurs transcriptomiques, tandis que la correction du taux de fausse découverte (FDR) a été appliquée pour maintenir la rigueur analytique.

Tous les MOS-DEG sélectionnés ont été interrogés à l’aide de leurs identifiants de sonde Affymetrix correspondants. Le potentiel discriminatoire de chaque gène a été évalué entre cohortes cliniques de cancer du sein, où les données d’expression ont été stratifiées en groupes répondant et non-répondant. Les courbes ROC, les boxplots et les résultats statistiques associés étaient générés directement par la plateforme ROCplotter et exportés pour une visualisation et une comparaison en aval. L’analyse a quantifié la valeur prédictive des régulateurs redox et métaboliques impliqués dans le stress oxydatif mitochondrial. Les gènes présentant une signification prédictive constante à travers les échantillons cliniques ont été conservés pour inclusion dans le panel prédictif final.

Analyse de l’expression différentielle dans les tissus tumeurs, normaux et métastatiques (analyse TNMplot)

Les schémas d’expression des MOS-DEG supérieurs ont été analysés sur les tissus mammaires normaux, tumoraux et métastatiques à l’aide de l’outil web TNMplot v2 (https://tnmplot.com/analysis/)25. Les ensembles de données RNA-Seq (TCGA + GTEx + MET500) et les jeux de données sur puces génétiques ont été examinés afin d’assurer une validation multiplateforme. Le module « Multiple Gene Analysis » a été utilisé avec le carcinome invasif du sein comme type de tissusélectionné 26. Les valeurs d’expression ont été transformées en log₂ et comparées entre les groupes Tumeur vs. Normal (TvsN), Métastatique vs. Tumeur (MvsT) et Métastasique vs. Normal (MvsN). Le TNMplot a automatiquement calculé le changement de pli (FC) et les valeurs p en utilisant le test U de Mann–Whitney pour évaluer la signification statistique. Les distributions d’expression ont été visualisées sous forme de boxplots et de diagrammes de densité directement générés à partir de l’interface TNMplot, avec le vert, le rouge et le gris représentant respectivement les tissus normaux, tumoraux et métastatiques. Toutes les figures ont été exportées en haute résolution pour être intégrées dans la section résultats. Cette analyse biplateforme a permis une identification robuste et une validation des principaux régulateurs métaboliques mitochondriaux associés à la progression du cancerdu sein 27.

Survie et analyse pronostique à l’aide du traceur de Kaplan–Meier

Pour évaluer la pertinence pronostique des MOS-DEG dans le cancer du sein, une analyse de survie a été réalisée à l’aide de l’outil en ligne Kaplan–Meier Plotter (https://kmplot.com/analysis/)28. Cette base de données intègre des données d’expression et de survie génique provenant de plus de 4 900 patientes atteintes de cancer du sein, dérivées de plusieurs ensembles de données GEO, EGA et TCGA. L’analyse a été réalisée pour la survie sans récidive (RFS) en utilisant des identifiants individuels de sonde Affymetrix correspondant aux gènes prioritaires : 225609_at (GSR), 201761_at (MTHFD2), 201619_at (PRDX3/AOP1) et 201128_s_at (ACLY). Les patients ont été divisés en groupes à haute et faible expression selon le seuil médian d’expression, et les probabilités de survie ont été estimées à l’aide de la méthode Kaplan–Meier. Le test log-rank a été utilisé pour évaluer la signification statistique entre les courbes de survie, et les rapports de risque (HR) avec des intervalles de confiance (IC) de 95 % ont été calculés automatiquement par l’outil. Toutes les analyses ont été réalisées en utilisant le critère RFS, sans restriction basée sur le récepteur hormonal ou le statut HER2 (ER, PR, HER2 = tous). Les échantillons redondants ont été retirés et les hypothèses de risques proportionnels ont été vérifiées pour garantir la robustesse statistique. Les filtres de contrôle qualité excluaient les micro-réseaux biaisés. Aucune sélection manuelle de la sonde ni correction de la valeur p pour plusieurs tests n’a été appliquée, conformément aux paramètres par défaut du KM Plotter. La signification statistique a été définie comme p. < 0,05. Les graphiques de survie ont été visualisés et téléchargés en haute résolution pour une interprétation plus approfondie, comparant les résultats entre les hauts et faibles exprimeurs de chaque gèneMOS candidat 29,30.

La présente analyse a été initiée à partir de jeux de données comprenant exclusivement des échantillons de cancer du sein HER2+ pour l’identification des gènes différenciellement exprimés (DEG) et des gènes hub. Par la suite, une analyse de survie a été réalisée sans restriction au statut HER2 (ER, PR, HER2 = tous) afin d’évaluer la pertinence pronostique plus large et la généralisabilité des gènes identifiés. Cette approche a été employée comme une étape secondaire de validation plutôt que pour redéfinir le focus de l’étude. Ainsi, les implications pronostiques des gènes hubs identifiés sont interprétées avec prudence, les conclusions principales restant spécifiques au cancer du sein HER2+ .

Les séquences de transcription canoniques de MTHFD2-201 (ENST00000394053.7) et PRDX3-201 (ENST00000298510.4) ont été récupérées depuis le navigateur génomique Ensembl (https://www.ensembl.org)31,32. L’annotation et la classification des variantes ont été réalisées à l’aide du prédicteur d’effet variant Ensembl (VEP) (https://www.ensembl.org/vep), qui fournissait un contexte génomique détaillé, des altérations de codons et des substitutions d’acides aminés pour chaque variant identifié. Seules les variantes de missense (SNP non synonymes) ont été sélectionnées pour l’analyse en aval.

Prédiction de la pathogénicité et priorisation des variants

Les conséquences fonctionnelles de chaque nsSNP ont été évaluées à l’aide d’une combinaison d’outils de prédiction computationnelle. SIFT (https://sift.bii.a-star.edu.sg) a été appliqué pour évaluer la conservation des acides aminés, classant les variants avec un score ≤ 0,05 commedélétères 33. PolyPhen-2 (http://genetics.bwh.harvard.edu/pph2) a estimé l’impact structurel et évolutif des substitutions, où des scores ≥ 0,85 indiquaient des dommagesprobables 34. Le CADD (https://cadd.gs.washington.edu) a fourni un score composite de délétérité intégrant plusieurs annotations, avec des valeurs ≥ 20 indiquant un potentiel pathogène élevé35. Des métriques complémentaires de MetaLR36, Mutation Assessor et REVEL ont été intégrées depuis l’interface VEP pour améliorer la fiabilitéde la prédiction 37. Les variants atteignant les seuils MetaLR ≥ 0,70, Mutation Assessor ≥ 3,5 et REVEL ≥ 0,75 ont été priorisés comme probablement pathogènes.

Prédiction de l’impact structurel et mécaniste

Pour évaluer comment les substitutions d’acides aminés influencent l’intégrité structurelle et la fonction biochimique, chaque nsSNP classé en tête a été analysé en plus en détail à l’aide de MutPred2 (http://mutpred.mutdb.org)38 et DynaMut (http://biosig.unimelb.edu.au/dynamut)39. MutPred2 a estimé la probabilité de perturbation fonctionnelle, incluant une activité catalytique modifiée, le gain ou la perte de résidus de liaison métallique, des changements dans l’accessibilité des solvants et la modulation allostérique, avec des scores ≥ 0,80 classés comme hautement pathogènes. DynaMut a calculé le changement d’énergie libre de Gibbs (ΔΔG) entre les protéines de type sauvage et les protéines mutantes, évaluant la direction et l’ampleur de l’altération de la stabilité, et généré des visualisations des déplacements atomiques et des réarrangements des liaisons hydrogène.

Modélisation structurelle secondaire et 3D ainsi que profilage d’accessibilité des solvants

Les structures cristallines résolues expérimentalement de MTHFD2 et PRDX3 ont été obtenues à partir de la Protein Data Bank (PDB) et traitées à l’aide de PyMOL V :3.1 (https://pymol.org)40 pour visualiser la distribution spatiale des résidus délétères. Les modèles mutants ont été créés en introduisant les substitutions d’acides aminés correspondantes, suivies d’un raffinement structurel et d’une minimisation de l’énergie. L’inspection comparative 3D a mis en lumière des changements d’éléments secondaires, des contacts interatomiques modifiés et la proximité spatiale des nsSNP avec les domaines catalytiques et de liaison cofacteur, révélant des perturbations potentielles des fonctions rédox et métaboliques.

Des analyses secondaires de structure et d’exposition au solvant ont été réalisées à l’aide de PSIPRED V : 3.2 (http://bioinf.cs.ucl.ac.uk/psipred)41,42 et NetSurfP 3.0 (https://services.healthtech.dtu.dk/service.php?NetSurfP-2.0)43. Ces outils prédisaient les hélices α, les β-brins, les bobines et les régions désordonnées, ainsi que les scores d’accessibilité relative aux solvants (RSA). Les résidus présentant des valeurs RSA modérées à élevées et un ordre structurel ont été cartographiés pour identifier les positions exposées au solvant et fonctionnellement critiques. Les sites concernés ont été visualisés dans des schémas topologiques 2D afin de déterminer si des mutations délétères survenaient dans des noyaux catalytiques rigides ou des régions de boucles flexibles, prédisant ainsi leurs effets probables sur la dynamique du repliement des protéines et l’efficacité enzymatique.

Validation croisée de bases de données, intégration fonctionnelle et validation de stabilité

Chaque nsSNP priorisé a été croisé avec des bases de données génomiques au niveau de la population, incluant dbSNP, 1000 Genomes, ExAC et gnomAD afin de confirmer la fréquence des variants, la distribution allélique mondiale et les associations cliniques précédemment rapportées. L’intégration de la conservation évolutive, de la modélisation structurelle et de la prédiction fonctionnelle basée sur l’apprentissage automatique a permis d’identifier des variants délétères à haute confiance dans MTHFD2 et PRDX3. Ces mutations à fort impact ont ensuite été cartographiées dans des domaines fonctionnels afin d’élucider leur rôle potentiel dans le déséquilibre du stress oxydatif mitochondrial, la signalisation métabolique altérée et la résistance thérapeutique dans le cancer du sein. Pour confirmer davantage les conséquences thermodynamiques de chaque substitution délétère, iMutant 3.0 (https://folding.biofold.org/i-mutant/i-mutant3.0.html)44 a été utilisé pour prédire les effets des mutations sur la stabilité des protéines à l’aide de données de séquences et de structures. L’analyse a calculé des valeurs de ΔΔG (kcal/mol) représentant le changement d’énergie libre entre les protéines de type sauvage et mutantes. Les variants présentant des valeurs négatives de ΔΔΔG ont été classés comme des mutations déstabilisatrices, indiquant une stabilité réduite des protéines et une probabilité accrue de dépliement. L’intégration des prédictions iMutant avec les résultats de DynaMut et MutPred2 a permis une validation croisée pour identifier les résidus structurellement critiques susceptibles d’affecter la fonction redox, l’intégrité catalytique et la stabilité conformationnelle globale des protéines.

Interprétation fonctionnelle intégrée et pertinence thérapeutique

Tous les NSSNP délétères identifiés ont été validés par recoupement avec les bases de données dbSNP, gnomAD et ExAC afin de vérifier les fréquences allèles mineures et les associations précédemment rapportées avec les phénotypes cancéreux. L’interprétation intégrative des données de conservation évolutive, de modélisation structurelle et de stabilité a indiqué que les mutations à fort impact rs1471336772 (MTHFD2) et rs747786383 (PRDX3) exercent les effets les plus forts sur la conformation des protéines et l’efficacité catalytique. Les résultats computationnels suggèrent collectivement que les mutations de MTHFD2 déstabilisent le métabolisme redox dépendant de NADPH, tandis que les mutations de PRDX3 altèrent la défense contre le stress oxydatif médiée par la peroxydase, contribuant à la dysfonction mitochondriale et à l’agressivité tumorale. Cette analyse structurelle et fonctionnelle basée sur nsSNP fournit une base computationnelle pour le dépistage thérapeutique futur et la validation mutationnelle, mettant en avant MTHFD2 et PRDX3 comme biomarqueurs de précision pour la thérapie du cancer du sein ciblant le redox. Pour améliorer la clarté et fournir un aperçu complet de la stratégie analytique, un flux de travail schématique résumant les principales étapes de l’étude est présenté à la Figure 2. Le flux de travail intègre l’analyse différentielle de l’expression génique, le filtrage des gènes mitochondriaux, la construction de réseaux d’interactions protéine-protéine, la validation clinique par analyse ROC, et la caractérisation structurale basée sur des nsSNP. Ce cadre étape par étapes met en avant la progression logique du traitement des données transcriptomiques à l’identification des biomarqueurs et à l’interprétation fonctionnelle.

Figure 2
Figure 2. Flux de travail intégratif en plusieurs étapes pour l’identification et la validation des biomarqueurs liés au stress oxydatif mitochondrial dans le cancer du sein HER2+ . Ce schéma résume le pipeline analytique utilisé dans l’étude. Premièrement, une analyse différentielle de l’expression génique (DEG) a été réalisée sur des ensembles de données RNA-seq (GSE231524 et GSE231525) afin d’identifier des gènes significativement modifiés. Ces DEG ont été croisés avec des gènes mitochondriaux liés au stress oxydatif curé pour obtenir des MOS-DEG. Ensuite, une analyse du réseau d’interaction protéine-protéine (PPI) a été réalisée à l’aide de STRING et Cytoscape pour identifier les gènes hub et les modules fonctionnels. Par la suite, l’analyse de la courbe des caractéristiques de fonctionnement du récepteur (ROC) a été appliquée à l’aide de la plateforme ROCplotter pour évaluer la performance prédictive de certains gènes dans des cohortes cliniques. Enfin, une analyse des SNP non synonymes (nsSNP) et une modélisation structurelle ont été réalisées pour évaluer l’impact fonctionnel et structurel potentiel des variants clés dans les gènes priorisés (MTHFD2 et PRDX3). Ce flux de travail intégratif relie des analyses transcriptomiques, de réseau, cliniques et structurelles pour identifier les biomarqueurs potentiels et les cibles thérapeutiques. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Analyse différentielle de l’expression génique

Un profilage différentiel de l’expression a été réalisé pour étudier les altérations transcriptionnelles associées à la progression du cancer du sein HER2+ et à la résistance au traitement en utilisant deux ensembles de données RNA-seq indépendants, GSE231524 et GSE231525. Dans le premier ensemble de données (GSE231524), un total de 19 727 gènes ont été initialement quantifiés. Après la normalisation, le filtrage et l’a...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le stress oxydatif mitochondrial est une caractéristique déterminante de l’adaptation tumorale, régissant la survie cellulaire, la plasticité métabolique et la résistance au traitement. La présente étude a exploré de manière systématique les gènes différentiels liés au stress oxydatif mitochondrial (MOS-DEG) dans le cancer du sein HER2+ en intégrant des données transcriptomiques, un enrichissement fonctionnel, une validation clinique, et des analyses mutationnelles et stru...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs n’ont aucun conflit d’intérêts à déclarer. Des outils d’intelligence artificielle, dont ChatGPT (GPT-5) d’OpenAI, ont été utilisés pour améliorer la grammaire, la clarté et la formulation scientifique du manuscrit. Toutes les analyses, interprétations et conclusions ont été conçues et vérifiées par les auteurs.

Contributions des auteurs :

Xiaobo Jia a conceptualisé et supervisé l’étude, contribué à la conception de l’étude, à l’interprétation des données, à la rédaction du manuscrit et assuré la direction globale du projet. Hui Su a contribué à l’acquisition de données, à l’analyse bioinformatique et à l’interprétation des résultats transcriptomiques. Jiaxin Zhang a assisté au traitement des données, à l’analyse des nsSNP, à la modélisation structurelle et à la préparation de figures. Zhao Liu a contribué à l’analyse statistique, à la validation des résultats et à la révision de manuscrits. Tous les auteurs ont examiné et approuvé la version finale du manuscrit.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
AnnotationDbiBioconductorv1.64.0Package d'annotation R utilisé pour la normalisation et l'annotation des symboles de gènes HGNC.
apeglmBioconductorméthode dans DESeq2Méthode utilisée pour le rétrécissement du changement de log2 dans l'analyse d'expression différentielle.
BiobaseBioconductorv2.62.0Package R utilisé pour accéder et gérer les objets d'expression et de métadonnées dérivés de GEO.
CADDUniversity of Washington / Kircher Laboutil webScore de Combined Annotation Dependent Depletion utilisé pour la prédiction de la pathogénicité des nsSNP.
clusterProfilerBioconductorv4.8.1Package R utilisé pour l'analyse d'enrichissement GO et KEGG.
ComplexHeatmapBioconductorv2.18.0Package R utilisé pour la génération de heatmap et le clustering d'expression.
CytoscapeCytoscape ConsortiumlogicielPlateforme de visualisation de réseau utilisée avec les réseaux PPI dérivés de STRING et la priorisation de CytoHubba.
dbSNPNCBIbase de donnéesBase de données de variantes de population utilisée pour la validation croisée des nsSNP prioritaires.
DESeq2Bioconductorv1.42.0Package R utilisé pour la normalisation, la modélisation de la variance et l'analyse d'expression différentielle.
dplyrCRAN / tidyversev1.1.3Package R utilisé pour la manipulation de données et l'intersection d'ensembles de gènes.
DynaMutUniversity of Melbourne / BioSigserveur webOutil utilisé pour estimer les changements de stabilité et de flexibilité associés aux mutations dans les protéines.
EnhancedVolcanoBioconductorv1.22.0Package R utilisé pour visualiser les résultats d'expression différentielle sous forme de plots volcaniques.
Ensembl Genome BrowserEMBL-EBI / Ensemblbase de donnéesSource de séquences de transcripts canoniques pour MTHFD2 et PRDX3.
Ensembl Variant Effect Predictor (VEP)EMBL-EBI / Ensembloutil webOutil utilisé pour annoter les variants missense et intégrer des scores prédictifs.
ExACBroad Institutebase de donnéesBase de données exomique au niveau de la population utilisée pour la validation croisée des nsSNP.
Gene Expression Omnibus (GEO)NCBIbase de donnéesRéférentiel utilisé pour récupérer les ensembles de données transcriptomiques pour l'analyse du cancer du sein HER2 positif.
Gene OntologyGene Ontology ConsortiumGO:0006979Ressource d'ontologie utilisée pour récupérer les gènes liés au stress oxydatif et pour l'analyse d'enrichissement.
GEOqueryBioconductorv2.70.0Package R utilisé pour accéder aux matrices de comptage GEO et aux métadonnées.
ggplot2CRAN / tidyversev3.5.0Package R utilisé pour la visualisation des données, les plots de clustering et les sorties graphiques.
ggraphCRANPackage RPackage R utilisé pour la visualisation des graphes et des réseaux lors de la représentation d'enrichissement et des voies.
gnomADBroad Institutebase de donnéesBase de données de variantes de population utilisée pour vérifier la fréquence et la distribution des nsSNP prioritaires.
GOplotCRANPackage RPackage R utilisé pour la visualisation de l'enrichissement GO, y compris les plots chord et de synthèse.
GSE231524NCBI GEOaccèsEnsemble de données RNA-seq utilisé pour l'analyse des phénotypes parentaux, de tolérance aux médicaments et de résistance BT474.
GSE231525NCBI GEOaccèsEnsemble de données RNA-seq utilisé pour l'analyse de l'inhibition de DUSP6 dans les cellules de cancer du sein HER2 positives.
Human MitoCarta3.0Broad Institutebase de donnéesRessource génétique mitochondriale organisée utilisée pour définir les ensembles de gènes mitochondriaux.
Human Oxidative Stress Gene Database (HOSGDB)HOSGDBbase de donnéesBase de données utilisée pour récupérer les gènes liés au stress oxydatif.
igraphCRANPackage RPackage R utilisé pour la représentation des réseaux et la visualisation des voies.
iMutant 3.0University of Bologna / Biofoldserveur webOutil utilisé pour prédire les effets des mutations sur la stabilité des protéines.
Kaplan–Meier PlotterKMplotoutil webPlateforme en ligne utilisée pour l'analyse de survie sans récidive dans les cohortes de cancer du sein.
KEGGKyoto Universitybase de donnéesBase de données de voies utilisée pour l'analyse d'enrichissement de la phosphorylation oxydative et des voies.
KEGGRESTBioconductorPackage RPackage utilisé pour récupérer et annoter les informations sur les voies KEGG.
LapatinibNon spécifié dans le manuscritCondition de traitement à 1 µMInhibiteur ciblant HER2 utilisé dans les ensembles de données expérimentaux sources pour dériver les phénotypes de tolérance/résistance aux médicaments.
MetaLRIntégré via Ensembl VEPscoreMétrique de pathogénicité computationnelle utilisée pour la priorisation des variantes.
MutPred2MutPredserveur webOutil utilisé pour prédire les conséquences fonctionnelles des substitutions d'acides aminés.
NetSurfP 3.0Technical University of Denmarkserveur webOutil utilisé pour la prédiction de la structure secondaire et de l'accessibilité au solvant.
org.Hs.eg.dbBioconductorv3.18.0Package d'annotation du génome humain utilisé pour le mappage des identifiants de gènes.
pathviewBioconductorPackage RPackage utilisé pour cartographier les gènes enrichis sur les voies KEGG.
pheatmapCRANv1.0.12Package R utilisé pour le plot de heatmap et la visualisation du clustering.
PolyPhen-2Harvard / Brigham and Women's Hospitaloutil webPrédicteur computationnel utilisé pour estimer l'impact structurel/fonctionnel des substitutions d'acides aminés.
Protein Data Bank (PDB)RCSB PDBbase de donnéesSource de structures protéiques résolues expérimentalement pour MTHFD2 et PRDX3.
PSIPREDUniversity College Londonv3.2Serveur de prédiction de structure secondaire des protéines utilisé pour l'analyse de topologie 2D.
PyMOLSchrödinger / PyMOLv3.1Logiciel de graphique moléculaire utilisé pour visualiser les structures protéiques et les sites de mutation.
REVELIntégré via Ensembl VEPscoreScore de pathogénicité d'ensemble utilisé pour la priorisation des variantes missense.
ROCplotterROCplot.orgoutil webPlateforme en ligne utilisée pour la validation basée sur ROC de l'expression génique dans les

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Breast CancerHER2 PositiveMitochondrial Oxidative StressTranscriptomic AnalysisHub GenesSingle Nucleotide PolymorphismsDrug TargetsMTHFD2PRDX3RNA Sequencing

Related Articles