Acquisition à partir de la base de données TCGA
Les données de séquençage de l'ARN et les informations cliniques concernant la cohorte de carcinome mammaire invasif du projet TCGA (TCGA-BRCA) ont été obtenues à partir du portail Genomic Data Commons14. Les données d'ARN-séquençage du flux de travail STAR au format de transcrits par million (TPM) ont été extraites conjointement avec les annotations cliniques appariées. Les échantillons d'ARN-séq pour lesquels aucune information clinique correspondante n'était disponible ont été exclus. Pour les analyses basées sur l'expression, les valeurs de TPM ont été transformées selon log2(TPM + 1). L'expression de MPO a été extraite à l'aide du symbole génique MPO et de l'identifiant génique Ensembl ENSG00000005381.8. Pour les analyses nécessitant un regroupement en MPO-élevé et MPO-faible, seuls les échantillons tumoraux de la cohorte TCGA-BRCA ont été inclus, tandis que les échantillons normaux adjacents ont été exclus de l'attribution des groupes. Les échantillons tumoraux ont été divisés selon la valeur médiane de l'expression de MPO, transformée en log2(TPM + 1), parmi les échantillons tumoraux TCGA-BRCA. Les échantillons dont l'expression de MPO était supérieure ou égale à la médiane ont été classés dans le groupe MPO-élevé, tandis que ceux dont l'expression était inférieure à la médiane ont été classés dans le groupe MPO-faible. Cette stratégie de regroupement fondée sur la médiane a été utilisée pour l'analyse de survie, l'analyse d'expression différentielle, l'analyse d'enrichissement, le regroupement par méthylation et les comparaisons d'enrichissement en cellules immunitaires, sauf indication contraire. Les caractéristiques clinico-pathologiques, incluant le sexe, l'âge, l'ethnicité, le stade pathologique T, le grade histologique, le sous-type PAM50, le stade pathologique, le statut tumoral, ainsi que les critères de jugement relatifs à la survie, notamment la survie globale (OS), l'intervalle sans progression (PFI) et la survie spécifique à la maladie (DSS), ont été analysées à l'aide de la version 4.2.1 du logiciel R.
Récupération d'images publiques d'immunohistochimie
Des images représentatives d'immunohistochimie (IHC) de la protéine MPO provenant de tissus mammaires normaux adjacents et de tissus cancéreux du sein ont été utilisées comme références qualitatives au niveau protéique. Ces images n'ont pas été incluses dans les analyses morphométriques quantitatives ou les analyses statistiques. Les zones encadrées indiquent les régions montrées à un grossissement plus élevé. Les barres d'échelle indiquent 100 µm sur les images à 20× et 50 µm sur les images à 40×.
Analyse de corrélation d'expression
Le jeu de données TCGA-BRCA a été utilisé pour examiner les gènes co-varyant avec l'expression de MPO dans le cancer du sein. Des coefficients de corrélation de Pearson au niveau du génome ont été calculés entre MPO et les gènes codant pour des protéines, et les 30 gènes les plus fortement corrélés positivement et les 30 gènes les plus fortement corrélés négativement ont été sélectionnés pour la visualisation. Pour les analyses de corrélation impliquant plusieurs gènes testés, les p-values nominales ont été ajustées selon la méthode de taux de fausses découvertes de Benjamini-Hochberg. Le réseau d'interactions protéine-protéine (PPI) associé à MPO a été construit à l'aide de la base de données Search Tool for the Retrieval of Interacting Genes/Proteins (STRING), les paires de protéines présentant un score d'interaction supérieur à 0,40 étant conservées pour la visualisation15.
Analyse d'enrichissement fonctionnel
Les gènes différentiellement exprimés (DEG) ont été identifiés en comparant les groupes de tumeurs TCGA-BRCA à forte et faible expression de MPO à l'aide de seuils de |log2FC| > 1 et d'une valeur de p ajustée selon Benjamini-Hochberg < 0,05. Une analyse d'enrichissement fonctionnel des DEG a été réalisée à l'aide du package R clusterProfiler version 4.4.4, incluant des analyses des processus biologiques, des composants cellulaires et des fonctions moléculaires de l'ontologie génique (GO), ainsi que des analyses de voies de la Kyoto Encyclopedia of Genes and Genomes (KEGG)16,17,18,19,20. Les termes GO et KEGG enrichis ont été considérés comme significatifs lorsque la valeur de p ajustée était < 0,05.
Une analyse d'enrichissement de gènes (GSEA) a été réalisée à l'aide d'une liste de gènes préclassés basée sur des statistiques d'expression différentielle entre les groupes à forte expression de MPO (MPO-high) et à faible expression de MPO (MPO-low). La collection MSigDB C2 Canonical Pathways c2.cp.all.v2022.1.Hs.symbols.gmt, correspondant à MSigDB v2022.1.Hs et contenant 3 050 jeux de gènes, a été utilisée21,22. Les termes enrichis ont été considérés comme significatifs selon une valeur-p ajustée par la méthode de Benjamini–Hochberg < 0,05, une valeur-q FDR < 0,25 et une valeur |score d'enrichissement normalisé| > 1. Lorsque cela était applicable, les Z-scores des termes significativement enrichis ont été calculés à l'aide du package GOplot pour la visualisation.
Analyse de l'enrichissement des cellules immunitaires dans les tumeurs
Les composants immunitaires et stromaux dans la cohorte TCGA-BRCA ont été évalués à l'aide de l'algorithme ESTIMATE implémenté dans le package R estimate version 1.0.13. Les données d'expression transformées selon log2(TPM + 1) ont été utilisées comme entrée, et les scores immunitaire, stromal et ESTIMATE ont été calculés pour chaque échantillon tumoral. TIMER/TIMER2.0 a été utilisé pour évaluer les associations entre l'expression de MPO et les niveaux d'infiltration estimés des principales populations de cellules immunitaires dans la cohorte TCGA-BRCA, notamment les cellules B, les cellules T CD8+, les cellules T CD4+, les macrophages, les neutrophiles et les cellules dendritiques23,24,25. Les résultats basés sur TIMER ont été interprétés comme des estimations de l'infiltration immunitaire dérivées de la ressource en ligne correspondante. Pour l'analyse d'enrichissement des cellules immunitaires parmi 24 types de cellules immunitaires, une analyse d'enrichissement de l'ensemble de gènes par échantillon unique (ssGSEA) a été mise en œuvre à l'aide du package R GSVA version 1.46.026. La matrice de signatures immunitaires LM22 utilisée pour la désconvolution basée sur CIBERSORT de 22 types de cellules immunitaires est fournie dans le Tableau supplémentaire 1. Les corrélations entre l'expression de MPO et les scores d'enrichissement des cellules immunitaires ont été évaluées à l'aide du coefficient de corrélation de rang de Spearman. Les différences de scores d'enrichissement des cellules immunitaires entre les groupes tumoraux définis comme MPO-élevé et MPO-faible selon la médiane ont été comparées à l'aide du test de Wilcoxon à somme de rangs. Pour les analyses impliquant plusieurs types de cellules immunitaires, les valeurs de p ont été ajustées selon la méthode de taux de fausses découvertes de Benjamini–Hochberg.
Méthylation de l'ADN du gène MPO
Les profils de méthylation de l'ADN au niveau du locus MPO ont été évalués à l'aide de MethSurv. Les valeurs bêta de méthylation des sites CpG et les associations avec la survie pour TCGA-BRCA ont été obtenues à partir de la plateforme MethSurv. Les sites CpG associés au gène MPO sélectionnés ont été visualisés, et leurs associations avec les résultats de survie ont été évaluées à partir des sorties d'analyse de survie fournies par MethSurv27. Pour les analyses impliquant plusieurs sites CpG, les valeurs de p ont été ajustées sur l'ensemble des sites CpG liés à MPO testés à l'aide de la méthode de taux de fausses découvertes de Benjamini-Hochberg. Ces analyses de méthylation ont été interprétées comme des annotations épigénétiques exploratoires.
Construction du réseau PPI et analyse de corrélation des gènes liés aux neutrophiles
Afin d'examiner l'association entre la MPO et la biologie liée aux neutrophiles, une analyse systématique en réseau a été réalisée. Un ensemble de gènes comprenant des médiateurs établis de l'activation des neutrophiles et des processus inflammatoires associés a été recensé à partir de la littérature actuelle. La liste complète des gènes liés aux neutrophiles est fournie dans le Tableau supplémentaire 2. Les symboles des gènes ont été harmonisés selon les symboles officiels, les doublons ont été supprimés, puis les gènes disponibles ont été croisés avec la matrice d'expression TCGA-BRCA avant l'analyse STRING/RIP, la priorisation des gènes centraux et l'analyse de corrélation entre la MPO et les gènes centraux. Le réseau RIP parmi ces gènes a été construit à l'aide de la base de données STRING (version 11.5), en utilisant un seuil de confiance moyenne pour le score d'interaction (>0,40). Les gènes centraux de ce réseau ont été priorisés algorithmiquement selon la centralité de degré, qui quantifie le nombre d'interactions directes par nœud. Les 20 gènes présentant les scores de degré les plus élevés ont été sélectionnés pour l'analyse de corrélation ultérieure.
Par la suite, les profils d'expression de ces gènes centraux et de la MPO ont été extraits du jeu de données transcriptomiques TCGA-BRCA. L'association entre la MPO et chacun des gènes centraux a été évaluée statistiquement à l'aide du coefficient de corrélation de Spearman. Afin de caractériser les profils de corrélation entre les gènes centraux eux-mêmes, une matrice de corrélation de Spearman par paires a été calculée pour tous les échantillons tumoraux. Ces analyses de corrélation ont fourni la base quantitative pour les visualisations ultérieures, notamment le graphique en bâtonnets des corrélations entre la MPO et les gènes centraux, ainsi que le diagramme en cordes et la carte thermique illustrant les profils de corrélation entre les gènes centraux.
Prédiction des facteurs de transcription en amont et des ARNmi ciblant MPO
La base de données KnockTF (https://bio.liclab.net/KnockTF/index.php)28,29, la base de données ChIP (http://chip-atlas.org/)30,31 et la base de données GTRD32,33 (https://gtrd.biouml.org/#!) ont été utilisées pour prédire les facteurs de transcription ciblés par MPO. De plus, la base de données TargetScan (https://www.targetscan.org/vert_80/) a été utilisée pour prédire les sites de liaison potentiels des miARN ciblant MPO. Les diagrammes de Venn ont été générés à l’aide du site MicroBioinformatics (https://www.bioinformatics.com.cn/static/others/jvenn/example.html)34.
Analyse unicellulaire de la MPO
Le jeu de données spécifique GSE161529 provient de la base Gene Expression Omnibus (GEO). Le prétraitement des données a d'abord consisté en un filtrage au niveau cellulaire afin d'exclure les cellules de faible qualité — celles répondant à l'un des critères suivants : expression des gènes mitochondriaux dépassant 25 %, nombre total d'identifiants moléculaires uniques (UMI) inférieur à 5000, ou moins de 2500 gènes détectés. Ensuite, la contamination par l'ARN ambiant et les effets techniques liés aux lots ont été corrigés35. Une analyse en composantes principales (ACP) a été réalisée afin de réduire la dimensionnalité et évaluer la similarité cellulaire, suivie d'une analyse UMAP pour le regroupement et la visualisation des cellules. Puis, selon les gènes marqueurs typiques des cellules, les différents groupes ont été annotés en types cellulaires11. L'ensemble de gènes associés à la MPO utilisé pour le calcul de signature unicellulaire est fourni dans le fichier supplémentaire 1. Avant le calcul des scores, les symboles des gènes ont été harmonisés avec les symboles officiels, les doublons ont été supprimés, et les gènes disponibles ont été croisés avec la matrice d'expression de GSE161529. Les méthodes AUCell, Seurat AddModuleScore et ssGSEA ont été utilisées pour calculer les scores associés à la MPO pour chaque cellule. Les scores obtenus par les trois méthodes ont été normalisés par Z-score, ajustés à une plage comparable, puis intégrés afin de produire un score composite associé à la MPO pour les analyses descriptives ultérieures. Les réseaux d'interactions entre cellules ont été analysés afin de comparer les profils de communication ligand–récepteur impliquant les cellules tumorales épithéliales stratifiées selon le signal associé à la MPO et divers types cellulaires partenaires. Ces résultats ont été interprétés comme des profils descriptifs de communication, et non comme une preuve que les cellules exprimant la MPO médiatisent directement la communication intercellulaire.
Abaissement virtuel au niveau de la cellule unique de MPO et analyse d'enrichissement des voies à l'aide de scTenifoldKnk
Un abaissement virtuel au niveau de la cellule unique de MPO a été réalisé en intégrant Seurat et scTenifoldKnk. Après un contrôle de qualité standard (200 à 6 000 gènes par cellule ; fraction mitochondriale < 10 %), les données ont été normalisées par logarithme, et 2 000 gènes hautement variables ont été sélectionnés pour la réduction de dimensionnalité et le regroupement en clusters. Afin d'enrichir les contextes pertinents pour MPO, seules les cellules présentant un score dans les 50 % supérieurs pour un module génique myéloïde/neutrophile ont été conservées. À partir de ces cellules, un sous-ensemble voisin de MPO a été défini en étendant à partir de cellules initiatrices positives pour MPO en utilisant k = 40 voisins les plus proches dans l'espace PCA. Ce sous-ensemble élargi n'a pas été considéré comme une population purement positive pour MPO, et aucune conclusion sur les proportions de types cellulaires n'a été tirée de cette étape d'expansion KNN. Ce sous-ensemble a été soumis à une analyse d'abaissement virtuel via scTenifoldKnk, en utilisant l'union des gènes hautement variables et de MPO (exprimé dans ≥25 cellules) comme ensemble génique. Les gènes significativement perturbés ont été identifiés (FDR < 0,05, ajusté par BH). Les gènes obtenus ont ensuite été analysés pour leur enrichissement fonctionnel dans les processus biologiques GO et les voies KEGG (q < 0,05).
Recherche exploratoire de médicaments et de gènes et annotation ADMET
DGIdb a été interrogé afin d'obtenir des enregistrements préliminaires d'interactions médicament–gène ou chimique–gène associées à l'MPO. Étant donné que les listes d'interactions issues de bases de données peuvent inclure des entrées étayées par des types de preuves hétérogènes et ne peuvent pas correspondre directement à des agents thérapeutiques cliniquement applicables, les composés récupérés ont été considérés comme des annotations exploratoires plutôt que comme des candidats thérapeutiques prioritaires. SwissADME et ADMETlab ont ensuite été utilisés pour résumer les propriétés physicochimiques, pharmacocinétiques et toxicologiques prédites. Ces annotations in silico ont servi à fournir un contexte préliminaire pour l'interprétation au niveau des composés et à souligner la nécessité d'une curation pharmacologique, toxicologique et clinique supplémentaire avant que toute pertinence thérapeutique puisse être envisagée36.