L'étude a été approuvée par le comité d'éthique de l'Université médicale de Hainan (numéro d'approbation HMC1984.24) et était conforme à la Déclaration d'Helsinki (telle que révisée en 2013).
Sujets de l'étude
Une étude menée auprès de 50 patients atteints d'un cancer du poumon diagnostiqués entre 2017 et 2024 au Sanya Central Hospital dans la province de Hainan a été réalisée selon les recommandations cliniques de l'Association médicale chinoise pour le diagnostic et le traitement du cancer du poumon (édition 2024). Le stade selon la CSCO (2024) a été aligné sur la 8e édition du système AJCC afin d'assurer la comparabilité entre les études, comme cela a été validé dans des cohortes chinoises.12, avec deux revues indépendantes par des oncologues afin d'assurer la cohérence. Le processus de sélection des patients, la disponibilité des tissus, l'évaluation de la qualité de l'ARN et l'inclusion finale des échantillons pour l'analyse par RT-qPCR sont résumés dans Figure 1.
Données de l'étude
Cette étude a utilisé la bio-informatique pour analyser les niveaux d'expression de YTHDC2 dans le CBNPC et leur relation avec les caractéristiques clinicopathologiques, offrant des aperçus sur les mécanismes potentiels. Les analyses bio-informatiques ont été réalisées exclusivement à l'aide de données publiques de séquençage ARN provenant de The Cancer Genome Atlas (TCGA), incluant des échantillons de carcinome adénocarcinomateux du poumon (LUAD), de carcinome épidermoïde du poumon (LUSC) et de tissus pulmonaires normaux correspondants téléchargés via le GDC Data Portal (https://portal.gdc.cancer.gov/). Le jeu de données téléchargé comprenait les données d'expression issues du séquençage ARN ainsi que les variables cliniques disponibles (identifiant du patient, identifiant de l'échantillon, âge, sexe, stade pathologique, statut de survie et durée de survie globale) pour les cas éligibles de TCGA-LUAD et TCGA-LUSC. Les échantillons manquant de données d'expression génique ou d'informations sur la survie ont été exclus des analyses de survie et de ROC ultérieures. Le jeu de données utilisé dans cette étude est fourni en tant que fichier supplémentaire 1. Aucun prélèvement clinique collecté à l'hôpital central de Sanya n'a été utilisé pour les analyses bio-informatiques. Les procédures détaillées des analyses GEPIA, Kaplan–Meier Plotter et survivalROC sont fournies dans la section Analyse bio-informatique ci-dessous. L'ensemble du flux de travail bio-informatique, incluant l'acquisition des données, le prétraitement, l'analyse de l'expression génique, l'analyse de survie et l'analyse ROC, est résumé dans Figure 2.
Critères d'inclusion et d'exclusion
Les critères d'inclusion et d'exclusion des patients sont présentés dans le Tableau 1. Une analyse de puissance réalisée à l'aide d'un logiciel d'analyse statistique a déterminé qu'au moins 26 cas par groupe permettraient d'atteindre une puissance de 80 % pour détecter une taille d'effet modérée (d = 0,8, α = 0,05, bilatéral). Bien que l'inscription initiale visait 50 paires dans le groupe cancer du poumon, l'analyse finale par qRT-PCR a inclus 30 échantillons tumoraux et 19 échantillons de tissus adjacents normaux, après exclusion pour qualité insuffisante du tissu ou de l'ARN. Cette réduction de la taille de l'échantillon reflète les contraintes cliniques du monde réel et souligne l'importance de l'intégrité de l'ARN et de la disponibilité des tissus dans les études translationnelles. Pour des comparaisons avec n = 19, la taille d'effet minimale détectable est d = 1,0 (puissance 80 %, α = 0,05). Ainsi, l'expérience disposait d'une puissance suffisante pour détecter des différences importantes, mais pas faibles à modérées, dans l'expression de YTHDC2.
Échantillons de tissus et PCR quantitative en temps réel (qRT-PCR)
Les diagnostics pathologiques ont été établis de manière doublement aveugle par deux pathologistes différents. La pureté tumorale a été estimée par les pathologistes (>70 % de cellules malignes) et confirmée à l’aide du logiciel ESTIMATE (TCGA). Les tissus normaux adjacents ont été macrodissectés afin de minimiser la contamination par le stroma. Les types histologiques de cancer du poumon comprenaient l’adénocarcinome pulmonaire et le carcinome épidermoïde, avec 26 cas d’adénocarcinome pulmonaire et 4 cas de carcinome épidermoïde. Le stade clinique des 50 patients atteints de cancer du poumon a été déterminé selon les critères de stadification décrits dans les « Recommandations cliniques de l’Association médicale chinoise pour le cancer du poumon (édition 2024) ». Les échantillons de carcinome non à petites cellules (NSCLC) confirmés histologiquement (n = 50) représentaient des distributions cliniques typiques (voir Tableau 2). Parmi les 50 patients initialement inclus, 30 échantillons de tissu tumoral et 19 échantillons appariés de tissu normal adjacent ont satisfait aux critères de qualité de l’ARN. Étant donné que l’analyse statistique appariée exige des échantillons appariés provenant du même patient, la comparaison de l’expression entre tumeur et tissu normal adjacent a été effectuée à l’aide des 19 paires appariées disponibles. Ces spécimens cliniques ont été utilisés exclusivement pour la validation expérimentale par qRT-PCR et ont été analysés indépendamment des jeux de données publiques TCGA utilisés pour l’analyse bioinformatique. Ces échantillons sélectionnés ont été traités immédiatement après confirmation pathologique et manipulés dans des conditions sans RNase avant l’extraction de l’ARN. Ce sous-groupe correspond aux cas où une quantité adéquate de tissu et un ARN total de haute qualité (nombre d’intégrité de l’ARN, RIN >7,0) ont pu être obtenus. La concentration et la pureté totales de l’ARN ont été mesurées avant la transcription inverse, et seuls les échantillons présentant une qualité d’ARN adéquate (RIN >7,0) ont été inclus dans les analyses en aval. Des quantités équivalentes d’ARN total ont été transcrits en sens inverse en ADN complémentaire (ADNc) selon le protocole du fabricant avant la PCR quantitative. Ce processus a permis de garantir la validité des données d’expression génique analysées. Les expériences de qRT-PCR ont été réalisées sur un thermocycleur PCR en temps réel, en utilisant un test de PCR quantitative basé sur des sondes. Toutes les réactions ont été effectuées en triple, accompagnées de témoins sans matrice afin d’assurer la reproductibilité analytique. L’amplification par PCR a été réalisée selon les conditions cyclantes suivantes : une étape initiale d’activation enzymatique/dénaturation à 95 °C pendant 10 min, suivie de 40 cycles de dénaturation à 95 °C pendant 15 s et d’hybridation/extension à 60 °C pendant 60 s. Les signaux de fluorescence ont été acquis à la fin de chaque cycle d’amplification. Tous les réactifs et consommables ont été obtenus auprès de fournisseurs commerciaux (voir Tableau des matériaux). Les séquences d’amorces et de sondes utilisées en qRT-PCR sont indiquées dans le Tableau 3.
Analyse bioinformatique
Analyse de l'expression du gène YTHDC2 à l'aide de la base de données GEPIA
La base de données GEPIA a été utilisée pour analyser l'expression de YTHDC2 dans le CBNP. Le serveur web GEPIA (http://gepia.cancer-pku.cn/) a été consulté via un navigateur web. Le module Expression DIY a été sélectionné, le symbole du gène "YTHDC2" a été saisi, les jeux de données LUAD et LUSC ont été choisis, les paramètres de normalisation par défaut ont été conservés, et des boîtes à moustaches d'expression différentielle ont été générées directement à l'aide de l'interface GEPIA. La signification statistique a été définie comme p < 0,05.
Base de données Kaplan-Meier pour l'analyse de survie des patients atteints de cancer du poumon
L'étude a analysée la relation entre l'expression de YTHDC2 et le pronostic chez des patients atteints de cancer du poumon à l'aide de la base de données Kaplan-Meier Plotter. Le jeu de données sur le cancer du poumon a été sélectionné, le symbole du gène "YTHDC2" a été saisi, l'option de seuil optimal automatiquement sélectionnée a été appliquée, et les courbes de Kaplan-Meier pour la survie globale et la survie après progression ont été générées en utilisant les paramètres d'analyse par défaut. Les patients ont été automatiquement répartis en groupes à expression élevée et faible à l'aide du seuil optimal déterminé par la plateforme Kaplan-Meier Plotter, et les rapports de risques avec leurs intervalles de confiance à 95 % correspondants ont été calculés selon les paramètres par défaut de la plateforme.
Exécution de packages R dans le logiciel R pour la création de courbes ROC
Les données d'expression issues du séquençage de l'ARN et les métadonnées cliniques correspondantes pour les cas éligibles de TCGA-LUAD et TCGA-LUSC ont été téléchargées à partir du portail de données GDC. Les jeux de données téléchargés ont été fusionnés par identifiant patient et importés dans R pour des analyses ultérieures. Le package survivalROC a été utilisé pour générer des courbes ROC dépendantes du temps aux points de prédiction de 1, 3 et 5 ans, et les valeurs correspondantes de la surface sous la courbe (AUC) ont été calculées afin d'évaluer la performance pronostique de l'expression de YTHDC2. Seuls les patients atteints de TCGA-LUAD ou TCGA-LUSC disposant d'informations sur l'expression en ARN-séquençage et la survie ont été inclus dans l'analyse ROC de survie. La cohorte clinique locale n'a pas été utilisée pour la prédiction de la survie car des données de suivi à long terme n'étaient pas disponibles.
Expression tissulaire de YTHDC2 par qRT-PCR
Pour analyser les niveaux d'expression génique, une PCR quantitative en temps réel (qRT-PCR) a été réalisée. Des volumes équivalents d'ADNc ont été ajoutés à chaque réaction selon les conditions recommandées par le fabricant. L'amplification a été effectuée à l'aide d'un test de PCR quantitative basé sur une sonde, et les données de fluorescence ont été collectées automatiquement à la fin de chaque cycle d'amplification. Brièvement, le processus d'extraction de l'ARN comprenait plusieurs étapes, notamment la préparation de l'échantillon, la déparaffinisation, l'élimination du liquide résiduel, la digestion par la protéinase K, une incubation, une centrifugation, un traitement à la DNase, l'ajout de DNase I et une précipitation à l'éthanol. L'échantillon a ensuite été lié à une colonne de purification d'ARN à base de silice et centrifugé à 8 000 × g pendant 30 s. La colonne a ensuite été lavée avec le tampon de lavage 1, le tampon de lavage 2 et le tampon de lavage 2 dilué avec de l'éthanol, puis séchée à 13 000 × g pendant 2 min. L'ARN a ensuite été élué en ajoutant 70 µL d'eau sans RNase au centre de la membrane de la colonne, suivie d'une centrifugation à 13 000 × g pendant 1 min. Chaque paire d'amorces a produit un unique produit d'amplification, confirmé par analyse de la courbe de fusion avant le calcul de l'expression génique relative. L'efficacité des amorces (90–110 %) a été validée à l'aide de courbes standards avant l'analyse des échantillons. Les analyses de courbe de fusion ont confirmé la présence d'amplicons uniques et l'absence de dimères d'amorces. L'expression relative de YTHDC2 a été calculée selon la méthode 2-ΔCt, dans laquelle les valeurs de Ct ont été normalisées par rapport au gène de référence endogène GAPDH. Étant donné que les valeurs d'expression étaient présentées sous forme de niveaux d'expression normalisés plutôt que sous forme de variations d'expression par rapport à un échantillon témoin, les résultats sont rapportés comme des valeurs 2−ΔCt. Le gène GAPDH a été choisi comme gène de référence car son expression présentait une variabilité minimale (CV < 5 %) par rapport aux alternatives testées (ACTB, CV = 12 % ; ARNr 18S, CV = 18 %), ce qui est conforme aux critères de sélection des gènes de référence dans les études sur la m6A.
Analyse statistique
Des analyses statistiques ont été réalisées à l'aide de logiciels statistiques, y compris la création de graphiques et de diagrammes. Pour analyser les données quantitatives et catégorielles relatives à l'expression du gène YTHDC2 chez des patients atteints de CBNPC, le logiciel R a été utilisé pour les analyses bioinformatiques et la génération de courbes ROC. Les courbes ROC et les AUC ont été utilisées pour évaluer la performance diagnostique de l'expression de YTHDC2 dans la prédiction de la survie. Pour les analyses fondées sur des régressions, les estimations d'effet (rapports de cotes) accompagnées des intervalles de confiance à 95 % correspondants ont été indiquées le cas échéant. Le test de Wilcoxon pour échantillons appariés a été utilisé afin de comparer l'expression de YTHDC2 entre des échantillons appariés de tissu tumoral et de tissu normal adjacent, tandis qu'une analyse de corrélation de Pearson a été employée pour évaluer l'association entre l'expression de YTHDC2 et les caractéristiques clinicopathologiques. Les coefficients de corrélation (r) ainsi que les valeurs-p correspondantes ont été rapportés. Étant donné que les données de qRT-PCR comprenaient des échantillons appariés de tissu tumoral et de tissu normal adjacent provenant des mêmes patients, et que les données d'expression génique n'étaient pas distribuées normalement, le test de Wilcoxon pour échantillons appariés a été utilisé pour comparer les niveaux d'expression de YTHDC2 entre les tissus appariés. Ce test ne suppose pas la normalité des données et est couramment utilisé pour des données biologiques asymétriques. Tous les tests statistiques étaient bilatéraux, et une valeur de p <0,05 a été considérée comme statistiquement significative. La normalité des variables continues a été vérifiée avant l'analyse. Les variables continues sont présentées sous forme de moyenne ± écart-type ou de médiane (intervalle interquartile), selon le cas.