Lo studio è stato approvato dal Comitato Etico dell'Università di Medicina di Hainan (numero di approvazione HMC1984.24) ed è stato condotto in conformità con la Dichiarazione di Helsinki (come rivista nel 2013).
Soggetti dello studio
È stato condotto uno studio su 50 pazienti con cancro del polmone diagnosticati tra il 2017 e il 2024 presso l'Ospedale Centrale di Sanya nella provincia di Hainan, utilizzando le Linee Guida Cliniche dell'Associazione Medica Cinese per la Diagnosi e il Trattamento del Cancro del Polmone (Edizione 2024). La stadiazione CSCO (2024) è stata allineata all'edizione ottava del sistema AJCC per garantire confrontabilità tra studi, come precedentemente validato in coorti cinesi12, con revisione indipendente da parte di due oncologi al fine di assicurare coerenza. Il processo di selezione dei pazienti, la disponibilità dei tessuti, la valutazione della qualità dell'RNA e l'inclusione finale dei campioni per l'analisi di qRT-PCR sono riassunti in Figura 1.
Dati dello studio
Questo studio ha utilizzato la bioinformatica per analizzare i livelli di espressione di YTHDC2 nel carcinoma polmonare non a piccole cellule (NSCLC) e la loro relazione con le caratteristiche clinicopatologiche, fornendo informazioni sui possibili meccanismi coinvolti. Le analisi bioinformatiche sono state eseguite esclusivamente utilizzando dati pubblici di sequenziamento dell'RNA provenienti da The Cancer Genome Atlas (TCGA), inclusi campioni di adenocarcinoma polmonare (LUAD), carcinoma polmonare a cellule squamose (LUSC) e tessuti polmonari normali corrispondenti, scaricati tramite il GDC Data Portal (https://portal.gdc.cancer.gov/). Il set di dati scaricato includeva informazioni sull'espressione genica ottenute tramite sequenziamento dell'RNA, insieme alle variabili cliniche disponibili (identificativo del paziente, identificativo del campione, età, sesso, stadio patologico, stato di sopravvivenza e tempo di sopravvivenza globale) per i casi idonei di TCGA-LUAD e TCGA-LUSC. I campioni privi di informazioni sull'espressione genica o sullo stato di sopravvivenza sono stati esclusi dalle analisi successive di sopravvivenza e ROC. Il set di dati utilizzato in questo studio è fornito come File Supplementare 1. Nessun campione clinico raccolto presso il Sanya Central Hospital è stato utilizzato per le analisi bioinformatiche. Le procedure dettagliate relative alle analisi GEPIA, Kaplan–Meier Plotter e survivalROC sono riportate nella sezione Analisi bioinformatica riportata di seguito. L'intero flusso di lavoro bioinformatico, comprensivo di acquisizione dei dati, pre-elaborazione, analisi dell'espressione genica, analisi della sopravvivenza e analisi ROC, è riassunto nella Figura 2.
Criteri di inclusione ed esclusione
I criteri di inclusione ed esclusione dei pazienti sono riportati nella Tabella 1. Un’analisi della potenza statistica effettuata mediante software specializzato ha determinato che almeno 26 casi per gruppo avrebbero garantito una potenza dell’80% nel rilevare un effetto di entità moderata (d = 0,8, α = 0,05, test a due code). Sebbene l’arruolamento iniziale mirasse a includere 50 coppie nel gruppo di cancro polmonare, l’analisi finale di qRT-PCR ha incluso 30 campioni tumorali e 19 campioni di tessuto normale adiacente, dopo aver escluso quelli con qualità inadeguata del tessuto o dell’RNA. Questa riduzione della numerosità campionaria riflette i vincoli clinici reali e sottolinea l’importanza dell’integrità dell’RNA e della disponibilità del tessuto negli studi traslazionali. Con n = 19 per i confronti, l’entità minima dell’effetto rilevabile è d = 1,0 (potenza dell’80%, α = 0,05). Pertanto, l’esperimento aveva potenza sufficiente per rilevare differenze elevate, ma non piccole o moderate, nell’espressione di YTHDC2.
Campioni di tessuto e PCR quantitativa in tempo reale (qRT-PCR)
Le diagnosi patologiche sono state determinate in modo doppio cieco da due diversi patologi. La purezza tumorale è stata stimata dai patologi (>70% di cellule maligne) e confermata tramite ESTIMATE (TCGA). I tessuti normali adiacenti sono stati macrodissecati per minimizzare la contaminazione stromale. I tipi istologici di cancro del polmone includevano adenocarcinoma polmonare e carcinoma a cellule squamose, con 26 casi di adenocarcinoma polmonare e 4 casi di carcinoma a cellule squamose. Lo stadio clinico dei 50 pazienti con cancro del polmone è stato stabilito secondo i criteri di stadiazione riportati nelle “Linee guida cliniche dell'Associazione Medica Cinese per il cancro del polmone (Edizione 2024)”. I campioni di NSCLC confermati istopatologicamente (n = 50) rappresentavano distribuzioni cliniche tipiche (vedi Tabella 2). Dei 50 pazienti inizialmente arruolati, 30 campioni di tessuto tumorale e 19 campioni abbinati di tessuto normale adiacente hanno soddisfatto i criteri di qualità dell'RNA. Poiché l'analisi statistica accoppiata richiede campioni abbinati dello stesso paziente, il confronto tra l'espressione nel tumore e nel tessuto normale adiacente è stato effettuato utilizzando le 19 coppie disponibili. Questi campioni clinici sono stati utilizzati esclusivamente per la validazione sperimentale mediante qRT-PCR e sono stati analizzati indipendentemente dai dataset pubblici TCGA utilizzati per l'analisi bioinformatica. I campioni selezionati sono stati processati immediatamente dopo la conferma istopatologica e manipolati in condizioni prive di RNasi prima dell'estrazione dell'RNA. Questo sottogruppo rappresenta i casi in cui è stato possibile ottenere sia una quantità adeguata di tessuto sia un RNA totale di alta qualità (numero di integrità dell'RNA, RIN >7,0). La concentrazione e la purezza dell'RNA totale sono state misurate prima della trascrizione inversa, e solo i campioni con qualità dell'RNA adeguata (RIN >7,0) sono stati inclusi per le analisi successive. Quantità uguali di RNA totale sono state retrotrascritte in DNA complementare (cDNA) seguendo il protocollo del produttore prima della PCR quantitativa. Questo processo ha garantito la validità dei dati sull'espressione genica analizzati. Gli esperimenti di qRT-PCR sono stati eseguiti su un termociclatore per PCR in tempo reale, utilizzando un saggio di PCR quantitativa basato su sonde. Tutte le reazioni sono state eseguite in triplice replicazione, insieme a controlli senza stampo per garantire la riproducibilità analitica. L'amplificazione PCR è stata effettuata nelle seguenti condizioni di ciclaggio: un passaggio iniziale di attivazione/denaturazione enzimatica a 95°C per 10 minuti, seguito da 40 cicli di denaturazione a 95°C per 15 secondi e di annealing/estensione a 60°C per 60 secondi. I segnali di fluorescenza sono stati acquisiti al termine di ogni ciclo di amplificazione. Tutti i reagenti e i materiali monouso sono stati ottenuti da fornitori commerciali (vedi Tabella dei Materiali). Le sequenze dei primer e delle sonde utilizzate nella qRT-PCR sono riportate nella Tabella 3.
Analisi bioinformatica
Analisi del database GEPIA dell'espressione del gene YTHDC2
Il database GEPIA è stato utilizzato per analizzare l'espressione di YTHDC2 nel NSCLC. Il server web GEPIA (http://gepia.cancer-pku.cn/) è stato accessibile tramite un browser web. È stato selezionato il modulo Expression DIY, è stato inserito il simbolo genico "YTHDC2", sono stati selezionati i set di dati LUAD e LUSC, sono stati mantenuti i parametri di normalizzazione predefiniti e sono stati generati direttamente tramite l'interfaccia GEPIA i box plot dell'espressione differenziale. La significatività statistica è stata definita come p < 0,05.
Database del grafico di Kaplan-Meier per l'analisi della sopravvivenza nei pazienti con cancro del polmone
Lo studio ha analizzato la relazione tra l'espressione di YTHDC2 e la prognosi nei pazienti con cancro del polmone utilizzando il database Kaplan-Meier Plotter. È stato selezionato il dataset relativo al cancro del polmone, è stato inserito il simbolo genico "YTHDC2", è stata applicata l'opzione di cutoff migliore selezionata automaticamente e sono state generate le curve di Kaplan-Meier per la sopravvivenza complessiva e la sopravvivenza dopo la progressione, utilizzando le impostazioni di analisi predefinite. I pazienti sono stati automaticamente suddivisi in gruppi ad alta e bassa espressione mediante il cutoff ottimale determinato dalla piattaforma Kaplan-Meier Plotter, e i rapporti di rischio con i corrispondenti intervalli di confidenza al 95% sono stati calcolati utilizzando le impostazioni predefinite della piattaforma.
Eseguire pacchetti R nel software R per la creazione di grafici di curve ROC
I dati di espressione da sequenziamento dell'RNA e i corrispondenti metadati clinici per i casi idonei di TCGA-LUAD e TCGA-LUSC sono stati scaricati dal GDC Data Portal. I set di dati scaricati sono stati uniti in base all'identificatore del paziente e importati in R per le analisi successive. Il pacchetto survivalROC è stato utilizzato per generare curve ROC dipendenti dal tempo ai punti di previsione a 1, 3 e 5 anni, e i corrispondenti valori dell'area sotto la curva (AUC) sono stati calcolati per valutare le prestazioni prognostiche dell'espressione di YTHDC2. Solo i pazienti con dati disponibili di espressione da RNA-seq e informazioni sulla sopravvivenza di TCGA-LUAD e TCGA-LUSC sono stati inclusi nell'analisi survival ROC. La coorte clinica locale non è stata utilizzata per la previsione della sopravvivenza poiché non erano disponibili dati di follow-up a lungo termine.
Espressione tissutale di YTHDC2 mediante qRT-PCR
Per analizzare i livelli di espressione genica, è stata eseguita una qRT-PCR. Volumi uguali di cDNA sono stati aggiunti a ciascuna reazione secondo le condizioni raccomandate dal produttore. L'amplificazione è stata effettuata mediante un saggio di PCR quantitativa basato su sonde, e i dati di fluorescenza sono stati raccolti automaticamente al termine di ogni ciclo di amplificazione. In breve, il processo di estrazione dell'RNA ha comportato diverse fasi, tra cui la preparazione del campione, la deparaffinizzazione, la rimozione del liquido residuo, la digestione con proteinasi K, l'incubazione, la centrifugazione, il trattamento con DNasi, l'aggiunta di DNasi I e la precipitazione con etanolo. Il campione è stato quindi legato a una colonna di purificazione dell'RNA a base di silice e centrifugato a 8.000 × g per 30 s. La colonna è stata quindi lavata con wash buffer 1, wash buffer 2 e wash buffer 2 diluito con etanolo, e asciugata a 13.000 × g per 2 min. L'RNA è stato quindi eluito aggiungendo 70 µL di acqua priva di RNasi al centro della membrana della colonna, seguito da centrifugazione a 13.000 × g per 1 min. Ogni coppia di primer ha mostrato un singolo prodotto di amplificazione, confermato dall'analisi della curva di denaturazione prima del calcolo dell'espressione genica relativa. L'efficienza dei primer (90–110%) è stata validata mediante curve standard prima dell'analisi dei campioni. Le analisi delle curve di denaturazione hanno confermato la presenza di un singolo amplicone e l'assenza di dimeri di primer. L'espressione relativa di YTHDC2 è stata calcolata utilizzando il metodo 2-ΔCt, in cui i valori di Ct sono stati normalizzati rispetto al gene di riferimento endogeno GAPDH. Poiché i valori di espressione sono stati presentati come livelli di espressione normalizzati anziché come variazioni di fold rispetto a un campione calibratore, i risultati sono riportati come valori di 2−ΔCt. Il gene GAPDH è stato scelto come gene di controllo perché la sua espressione ha mostrato una variabilità minima (CV < 5%) rispetto alle alternative testate (ACTB, CV = 12%; 18S rRNA, CV = 18%), in accordo con i criteri di selezione dei geni di riferimento negli studi sull'm6A.
Analisi statistica
Le analisi statistiche sono state eseguite utilizzando software statistici, inclusa la creazione di grafici e diagrammi. Per analizzare i dati quantitativi e categorici sull'espressione del gene YTHDC2 in pazienti con NSCLC, è stato utilizzato il software R per le analisi bioinformatiche e la generazione delle curve ROC. Le curve ROC e l'AUC sono state utilizzate per valutare le prestazioni diagnostiche dell'espressione di YTHDC2 nella previsione della sopravvivenza. Per le analisi basate su regressione, sono stati riportati, ove applicabile, le stime dell'effetto (odds ratio) con i corrispondenti intervalli di confidenza al 95%. Il test di Wilcoxon per campioni appaiati è stato utilizzato per confrontare l'espressione di YTHDC2 tra campioni tumorali e tessuti normali adiacenti appaiati, mentre l'analisi di correlazione di Pearson è stata impiegata per valutare l'associazione tra l'espressione di YTHDC2 e le caratteristiche clinicopatologiche. Sono stati riportati i coefficienti di correlazione (r) e i corrispondenti valori p. Poiché i dati di qRT-PCR comprendevano campioni appaiati di tessuto tumorale e tessuto normale adiacente provenienti dagli stessi pazienti e i dati sull'espressione genica non presentavano distribuzione normale, è stato utilizzato il test di Wilcoxon per campioni appaiati per confrontare i livelli di espressione di YTHDC2 tra i tessuti appaiati. Questo test non presuppone la normalità dei dati ed è comunemente usato per dati biologici asimmetrici. Tutti i test statistici erano a due code e un valore di p <0,05 è stato considerato statisticamente significativo. Le variabili continue sono state valutate per la normalità prima dell'analisi. Le variabili continue sono presentate come media ± deviazione standard o mediana (intervallo interquartile), a seconda dei casi.