Cette étude a été approuvée par le comité d'évaluation institutionnel de l'hôpital populaire de la province du Shaanxi (numéro d'approbation : 2024-R055) et a été menée conformément aux principes de la Déclaration d'Helsinki. Un consentement éclairé écrit a été obtenu de chaque participant avant tout prélèvement sanguin. Tous les échantillons sanguins humains et sériques ont été collectés, manipulés et stockés conformément aux directives institutionnelles du service de médecine de laboratoire.
Tous les prélèvements sanguins veineux et sériques ont été traités comme des matériaux biologiques potentiellement infectieux. Le traitement des échantillons a été effectué dans un laboratoire de niveau de sécurité biologique 2 par du personnel formé portant des équipements de protection individuelle adaptés. Les articles en plastique jetables, les embouts de pipette et les microplaques utilisées ayant été en contact avec des matériaux biologiques ont été stérilisés en autoclave ou collectés comme déchets biologiques dangereux et éliminés via le circuit médical autorisé de l'établissement, conformément à la réglementation locale.
Aperçu de la conception de l'étude :
Le flux opératoire de cette étude est résumé dans un schéma de conception expérimentale (Figure Supplémentaire S1) et se divise en deux volets complémentaires. Dans le volet in silico, des jeux de données transcriptomiques publics, de cellules uniques, protéiques, de modifications post-traductionnelles, immunitaires et de sensibilité aux médicaments ont été analysés afin de caractériser le contexte biologique de la protéine hWAPL et de formuler des hypothèses mécanistiques. Dans le volet expérimental, les concentrations sériques de hWAPL et de SCC-Ag ont été mesurées chez une cohorte indépendante monocentrique, et leurs performances diagnostiques, prises séparément ou combinées, ont été évaluées par analyse de la courbe ROC (caractéristique de fonctionnement du récepteur) et par régression logistique. Les deux volets n'ont été intégrés qu'au niveau de l'interprétation, le volet sérique fournissant la seule validation expérimentale.
Profilage de l'expression génique pancancéreux et du carcinome épidermoïde du col de l'utérus
Les données de séquençage de l'ARN provenant du Cancer Genome Atlas (TCGA) ont été obtenues via le navigateur UCSC Xena. Toutes les bases de données publiques et outils web utilisés dans cette étude ont été consultés entre septembre et octobre 2025, et les versions spécifiques ainsi que les dates d'accès sont indiquées dans le Tableau des matériaux. Les niveaux d'expression de WAPL, quantifiés en fragments par kilobase de transcrit par million de lectures cartographiées (FPKM), ont fait l'objet d'une transformation log₂ à laquelle un pseudocompte de 1 a été ajouté. Ces valeurs transformées ont ensuite été utilisées pour effectuer des analyses comparatives entre les tissus malins et les échantillons normaux adjacents appariés, pour plusieurs types de cancer. Pour l'analyse ciblée des tumeurs du col de l'utérus, les données d'expression de WAPL spécifiques au carcinome épidermoïde du col de l'utérus et à l'adénocarcinome endocervical (CESC) ont été isolées. Le profil d'expression dans ces échantillons tumoraux a ensuite été visualisé et comparé aux niveaux d'expression observés dans des tissus contrôles épithéliaux normaux du col de l'utérus.
Analyse des isoformes du transcrit WAPL
Les profils d'expression des isoformes du transcrit WAPL ont été examinés à l'aide de la base de données GEPIA2. Les isoformes spécifiques ont été définies par leurs identifiants de transcrit Ensembl correspondants (ENST). Les niveaux d'expression ont été calculés comme le logarithme en base 2 des transcrits par million plus un [log₂(TPM+1)] et sont présentés graphiquement sous forme de plots en violon.
Analyse de séquençage de l'ARN au niveau de la cellule unique
Le jeu de données de séquençage de l'ARN au niveau de la cellule unique (scRNA-seq) GSE168652 a été obtenu à partir du référentiel Gene Expression Omnibus (GEO). La préparation des données, l'évaluation de la qualité, la normalisation et le regroupement en clusters ont été effectuées à l'aide de la plateforme scCancerExplorer. Les cellules exprimant moins de 200 gènes et les gènes détectés dans moins de trois cellules ont été éliminés. La normalisation a été réalisée selon la méthode Log-Normalize avec un facteur d'échelle de 10 000.
Les 2 000 gènes les plus variables ont été identifiés à l'aide d'une transformation stabilisant la variance, puis utilisés pour une analyse en composantes principales (ACP). L'approximation uniforme de variété et la projection (UMAP) pour la réduction de dimensionnalité ont été appliquées en se basant sur les 30 premières composantes principales. Le regroupement fondé sur un graphe a été mis en œuvre au moyen de l'algorithme de Louvain avec une résolution de 0,8. Les groupes cellulaires ont été annotés selon des gènes marqueurs établis. Les niveaux d'expression de WAPL ont été mesurés dans différentes populations cellulaires, et les stades du cycle cellulaire ont été déterminés à l'aide de la méthode CellCycleScoring.
Expression protéique et analyse des modifications post-traductionnelles
L'expression et la distribution sous-cellulaire de WAPL dans le CSCC ont été évaluées à l'aide de la base de données Human Protein Atlas. Les sites de modification post-traductionnelle (PTM) ont été identifiés à l'aide de PhosphoSitePlus. En outre, d'éventuelles associations entre les niveaux d'expression de WAPL et les gènes impliqués dans les processus de modification des protéines, notamment AKT1, AKT2, KAT2B, EP300, USP7 et KAT5, dans le CSCC ont été étudiées à l'aide de l'outil Xiantao Academic13,14,15,16,17.
Réseau de co-expression et analyse d'enrichissement fonctionnel
Les données de séquençage ARN pour le CSCC-TCGA, traitées à l'aide de l'aligneur STAR et normalisées en transcrits par million (TPM), ont été obtenues à partir du portail Genomic Data Commons (GDC). Afin d'identifier les gènes co-exprimés avec WAPL, un seuil de sélection a été appliqué en se basant sur un coefficient de corrélation de Pearson absolu supérieur à 0,6 et un seuil de significativité statistique de P < 0,05.
Afin d'étudier les fonctions biologiques associées à WAPL, une analyse d'expression différentielle a d'abord été réalisée après répartition des patients en groupes d'expression élevée et faible de WAPL, la valeur médiane d'expression servant de seuil de démarcation. Les gènes différentiellement exprimés ont été identifiés à l'aide de la plateforme Xiantao Academic, puis soumis à une analyse d'enrichissement en Ontologie génique, incluant les catégories processus biologique, composant cellulaire et fonction moléculaire, ainsi qu'à une analyse des voies de la Kyoto Encyclopedia of Genes and Genomes. Indépendamment, les interactions protéiques impliquant WAPL ont été explorées à l'aide de STRING, et le réseau d'interactions obtenu a été reconstruit et analysé dans Cytoscape.
Une analyse d'enrichissement des ensembles de gènes (GSEA) a été réalisée à l'aide des bases de données Reactome, WikiPathways et KEGG, avec des critères de sélection définis par un score d'enrichissement normalisé absolu (|NES|) > 1 et un taux de fausses découvertes (FDR) < 0,25.
Analyse de l'infiltration immunitaire
Les outils computationnels TIMER 2.0 et xCell ont été utilisés pour analyser les données transcriptomiques du cohort TCGA-CESC, permettant l'évaluation quantitative de l'état d'infiltration de 24 populations cellulaires immunitaires distinctes.
Prédiction de la sensibilité aux médicaments
Les prédictions de sensibilité aux médicaments ont été obtenues à partir de la base de données GDSC2 à l'aide du package R oncoPredict. La concentration inhibitrice demi-maximale (IC50) a été calculée pour un ensemble de 86 composés chimiothérapeutiques.
Analyses de survie et diagnostiques
Les courbes de survie globale (OS) et d'intervalle sans progression (PFI) ont été établies à l'aide de la plateforme analytique Xiantao, les cohortes de patients étant divisées en deux groupes selon le niveau médian d'expression de WAPL. La signification pronostique des variables a été évaluée à l'aide de modèles de régression de Cox univariés et multivariés à risques proportionnels. Afin d'évaluer la capacité diagnostique de WAPL et de SCC (SERPINB3) à distinguer le CSCC du tissu normal adjacent, une analyse des courbes caractéristiques de fonctionnement du récepteur (ROC) a été appliquée aux données transcriptomiques, exprimées en transcrits par million (TPM), obtenues à partir de The Cancer Genome Atlas.
Prélèvement des échantillons sériques et ELISA
Cette étude a reçu l'approbation du comité d'éthique de l'hôpital provincial de Shaanxi (numéro d'approbation : 2024-R055) et a été réalisée conformément à la Déclaration d'Helsinki. Un total de 89 échantillons sériques a été obtenu auprès de patientes atteintes de CSCC confirmé histopathologiquement, ainsi que 89 témoins sains appariés par âge. L'âge médian était de 54 ans, étendu de 31 à 77 ans, dans le groupe CSCC, et de 41 ans, étendu de 30 à 52 ans, dans le groupe témoin. Tous les cas de cancer du col de l'utérus étaient nouvellement diagnostiqués et n'avaient reçu aucun traitement au moment du prélèvement sanguin ; les échantillons ont été recueillis avant toute intervention chirurgicale, chimiothérapie ou radiothérapie. Nous notons que, bien que les deux groupes proviennent d'un contexte clinique comparable, l'âge médian diffère de 13 ans. Cette différence est examinée directement dans la section Résultats et dans une analyse de sensibilité spécifique ajustée sur l'âge, et elle est reconnue comme une limite dans la section Discussion.
Du sang veineux a été prélevé dans des tubes sans anticoagulant, laissé en coagulation à température ambiante pendant 10 à 20 minutes, puis centrifugé à 2 000–3 000 × g pendant 20 minutes. Le sérum a été séparé dans l'heure suivant le prélèvement, aliquoté immédiatement et stocké à −20 °C ; l'intervalle entre la ponction veineuse et la congélation n'a dépassé 2 heures pour aucun échantillon. Les aliquots ont subi un seul cycle de congélation-décongélation avant analyse, et toutes les mesures ont été réalisées dans les trois mois suivant le stockage. Le sérum obtenu a été divisé en aliquots et conservé à −20 °C. Tout échantillon hémolysé ou lipémique a été exclu de l'analyse.
La quantification des niveaux sériques de la protéine hWAPL a été réalisée à l'aide d'un kit de dosage immunoenzymatique (ELISA) disponible commercialement, fondé sur le principe du sandwich à double anticorps. En bref, les étalons de calibration et les échantillons à tester ont été distribués en double dans des puits de microplaque prérecouverts avec un anticorps de capture spécifique de hWAPL, puis incubés 30 min à 37 °C. Après une série de lavages destinés à éliminer les composants non liés, un anticorps de détection marqué à la peroxydase de raifort (HRP) et dirigé contre hWAPL a été ajouté et incubé dans des conditions identiques.
Après d'autres lavages, 50 µL de chacune des solutions chromogènes A et B ont été ajoutés aux puits et incubés à l'obscurité à 37 °C pendant 10 min. Une solution d'arrêt (50 µL) a été ajoutée pour terminer la réaction enzymatique. La densité optique a été mesurée à une longueur d'onde principale de 450 nm, avec une lecture de référence à 630 nm, dans les 15 min suivant l'arrêt de la réaction. Une courbe standard a été établie à l'aide d'étalons dilués en série couvrant une gamme de concentration de 10 à 450 pg/mL. La concentration en hWAPL de chaque échantillon inconnu a été déterminée par interpolation à partir de cette courbe standard et corrigée en fonction de toute dilution préanalytique. Le dosage a été réalisé strictement conformément aux instructions du fabricant. Selon les spécifications du fabricant, la plage de détection fonctionnelle du kit est de 10 à 450 pg/mL. Les échantillons ont été dosés à une dilution finale de 5 fois, et les spécimens dont la densité optique dépassait celle du calibrateur le plus élevé ont été davantage dilués et redosés, en appliquant le facteur de dilution total lors du calcul inverse. La performance analytique a été vérifiée dans la matrice sérique avant l'analyse des échantillons d'étude : un pool sérique à concentration élevée dilué en série a montré une linéarité acceptable sur toute la gamme d'étalonnage, et le taux de récupération après ajout de l'étalon recombinant dans trois pools sériques était compris dans une fourchette acceptable, conforme à la conception du kit en sandwich à double anticorps. La limite inférieure de quantification correspondait au calibrateur le plus faible (10 pg/mL). Nous soulignons que ce kit est indiqué par le fabricant pour un usage exclusivement de recherche et ne constitue pas un dispositif de diagnostic in vitro validé cliniquement ; les concentrations absolues et le seuil déduit doivent donc être interprétés comme spécifiques à la plateforme et provisoires, comme discuté ci-dessous.
Parallèlement, les taux sériques d'Ag-SCC ont été quantifiés à l'aide de la plateforme Abbott Alinity i par un dosage immunoenzymatique chimiluminescent sur microparticules (CMIA), avec une limite supérieure de référence de 1,5 ng/mL. Toutes les procédures analytiques ont été réalisées en double par du personnel de laboratoire aveugle quant au statut de la maladie ainsi qu'à toutes les variables cliniques, y compris le stade clinique, le grade histologique et le statut HPV. Les coefficients de variation inter-essais et intra-essais des méthodologies utilisées ont tous deux été maintenus inférieurs à 10 %.
Analyse statistique
Les concentrations sériques de hWAPL n'ayant pas satisfait à l'hypothèse de normalité selon le test de Shapiro–Wilk (tous les P < 0,05), les analyses ultérieures ont été réalisées à l'aide de méthodes non paramétriques. Les variables continues sont donc présentées sous forme de médianes avec les écarts interquartiles (EI). Les différences entre deux groupes indépendants ont été évaluées à l'aide du test U de Mann–Whitney, tandis que les comparaisons entre trois groupes ou plus ont été effectuées avec le test H de Kruskal–Wallis. Les corrélations entre variables ont été évaluées par une analyse de corrélation des rangs de Spearman pour les données continues ou ordinales, et par le coefficient de corrélation bisériale ponctuel pour les variables binaires, telles que le statut d'infection par le VPH. Les résultats relatifs à la survie ont été comparés à l'aide du test du log-rang, et les rapports de risques instantanés avec intervalles de confiance à 95 % ont été estimés à partir de modèles de régression de Cox pour les risques proportionnels.
Les performances diagnostiques ont été évaluées par analyse de la courbe ROC, le seuil optimal pour chaque biomarqueur étant déterminé en maximisant l'indice de Youden. Les différences d'aire sous la courbe (AUC) ont été testées à l'aide de la méthode de DeLong. Afin d'étudier l'utilité diagnostique combinée, un modèle de régression logistique binaire a été construit, le statut de la maladie (CSCC = 1 ; témoin = 0) étant la variable dépendante, et les concentrations sériques de hWAPL et de l'antigène SCC servant de prédicteurs indépendants. Les probabilités prédites obtenues ont été enregistrées sous forme de score composite pour une analyse ROC ultérieure.
La sensibilité différentielle aux médicaments entre les groupes à forte expression de WAPL (WAPL-high) et à faible expression de WAPL (WAPL-low) a été évaluée à l'aide du package limma, en appliquant des seuils de P ajusté < 0,05 et de |log₂ du rapport d'expression| > 0,3. La significativité statistique a été définie par une valeur P bilatérale < 0,05. Toutes les analyses ont été réalisées à l'aide de SPSS, de R ou d'outils en ligne spécifiés. Les packages R utilisés comprenaient survival, survminer, pROC, ggplot2, oncoPredict et limma. Pour toutes les analyses à haute dimension impliquant des tests simultanés de nombreuses hypothèses, notamment les comparaisons pan-cancéreuses, l'analyse de co-expression, les analyses différentielles d'expression et d'enrichissement fonctionnel, ainsi que l'analyse de sensibilité aux médicaments, les valeurs P ont été ajustées pour les comparaisons multiples à l'aide du taux de fausses découvertes de Benjamini–Hochberg, et les valeurs P ajustées sont indiquées le cas échéant ; les corrélations par paires entre hWAPL et des gènes individuels ou des fractions de cellules immunitaires sont rapportées avec des valeurs P nominales, et ces résultats de corrélation sont considérés comme générant des hypothèses plutôt que confirmatoires. Étant donné qu'un petit nombre de champs clinicopathologiques dans la cohorte publique étaient partiellement renseignés, les cas comportant des données manquantes ont été exclus de l'analyse correspondante selon une méthode par paire, plutôt que d'être imputés, et le nombre de cas évaluables est indiqué pour chaque variable dans Tableau 1. Afin de tenir compte de la différence d'âge entre les cohortes sériques, une analyse de sensibilité utilisant une régression logistique binaire ajustée sur l'âge a été effectuée, et la corrélation de Spearman entre hWAPL sérique et l'âge a été calculée au sein de chaque groupe.