O estudo foi aprovado pelo Comitê de Ética da Universidade de Medicina de Hainan (número de aprovação HMC1984.24) e esteve em conformidade com a Declaração de Helsinque (revisada em 2013).
Assuntos do estudo
Foi conduzido um estudo com 50 pacientes com câncer de pulmão diagnosticados entre 2017 e 2024 no Hospital Central de Sanya, na província de Hainan, utilizando as Diretrizes Clínicas da Associação Médica da China para o Diagnóstico e Tratamento do Câncer de Pulmão (Edição 2024). A estadia CSCO (2024) foi alinhada com a 8ª Edição do AJCC para permitir comparabilidade entre estudos, conforme validado em coortes chineses12, com revisão por dois oncologistas independentes para garantir consistência. O processo de seleção dos pacientes, disponibilidade de tecidos, avaliação da qualidade do RNA e inclusão final das amostras para análise de qRT-PCR são resumidos na Figura 1.
Dados do estudo
Este estudo utilizou bioinformática para analisar os níveis de expressão de YTHDC2 no CCRP e sua relação com características clínico-patológicas, oferecendo insights sobre mecanismos potenciais. As análises bioinformáticas foram realizadas exclusivamente com dados públicos de sequenciamento de RNA do The Cancer Genome Atlas (TCGA), incluindo amostras de adenocarcinoma pulmonar (LUAD), carcinoma de células escamosas do pulmão (LUSC) e tecidos pulmonares normais correspondentes, obtidos por meio do GDC Data Portal (https://portal.gdc.cancer.gov/). O conjunto de dados baixado incluiu dados de expressão de sequenciamento de RNA juntamente com variáveis clínicas disponíveis (identificador do paciente, identificador da amostra, idade, sexo, estágio patológico, status de sobrevida e tempo de sobrevida global) para os casos elegíveis de TCGA-LUAD e TCGA-LUSC. Amostras sem informações de expressão gênica ou de sobrevida foram excluídas das análises downstream de sobrevida e ROC. O conjunto de dados utilizado neste estudo está disponível como Arquivo Suplementar 1. Nenhum espécime clínico coletado no Hospital Central de Sanya foi utilizado nas análises bioinformáticas. Os procedimentos detalhados para as análises GEPIA, Kaplan–Meier Plotter e survivalROC são fornecidos na seção Análise bioinformática abaixo. O fluxo de trabalho completo de bioinformática, incluindo aquisição de dados, pré-processamento, análise de expressão gênica, análise de sobrevida e análise ROC, está resumido na Figura 2.
Critérios de inclusão e exclusão
Os critérios de inclusão e exclusão dos pacientes estão apresentados na Tabela 1. Uma análise de poder realizada com software de análise estatística de poder determinou que pelo menos 26 casos por grupo forneceriam poder de 80% para detectar um efeito de tamanho moderado (d = 0,8, α = 0,05, bicaudal). Embora o recrutamento inicial tivesse como meta 50 pares no grupo de câncer de pulmão, a análise final de qRT-PCR incluiu 30 amostras tumorais e 19 amostras de tecido adjacente normal após exclusões por qualidade do tecido ou do RNA. Essa redução no tamanho da amostra reflete as limitações clínicas do mundo real e destaca a importância da integridade do RNA e da disponibilidade do tecido em estudos translacionais. Com n = 19 nas comparações, o tamanho mínimo do efeito detectável é d = 1,0 (poder de 80%, α = 0,05). Assim, o experimento teve poder suficiente para detectar diferenças grandes, mas não pequenas a moderadas, na expressão de YTHDC2.
Amostras de tecido e PCR quantitativa em tempo real (qRT-PCR)
Os diagnósticos patológicos foram determinados de forma duplamente cega por dois patologistas diferentes. A pureza tumoral foi estimada pelos patologistas (>70% de células malignas) e confirmada por meio do método ESTIMATE (TCGA). Tecidos normais adjacentes foram macrodissecados para minimizar a contaminação estromal. Os tipos histológicos de câncer de pulmão incluíram adenocarcinoma de pulmão e carcinoma de células escamosas, com 26 casos de adenocarcinoma de pulmão e 4 casos de carcinoma de células escamosas. A estadia clínica dos 50 pacientes com câncer de pulmão foi realizada de acordo com os critérios de estadiamento descritos nas “Diretrizes Clínicas da Associação Médica Chinesa para Câncer de Pulmão (Edição 2024)”. Espécimes de CPTNP confirmados patologicamente (n = 50) representaram distribuições clínicas típicas (ver Tabela 2). Dos 50 pacientes inicialmente incluídos, 30 amostras de tecido tumoral e 19 amostras pareadas de tecido normal adjacente atenderam aos critérios de qualidade do RNA. Como a análise estatística pareada exige espécimes pareados do mesmo paciente, a comparação da expressão entre tecido tumoral e tecido normal adjacente foi realizada utilizando os 19 pares disponíveis. Esses espécimes clínicos foram usados exclusivamente para validação experimental por qRT-PCR e analisados independentemente dos conjuntos de dados públicos do TCGA utilizados na análise bioinformática. Esses espécimes selecionados foram processados imediatamente após a confirmação patológica e manipulados em condições livres de RNase antes da extração de RNA. Este subconjunto reflete os casos em que foi possível obter tanto quantidade adequada de tecido quanto RNA total de alta qualidade (número de integridade do RNA, RIN >7,0). A concentração e pureza do RNA total foram medidas antes da transcrição reversa, e somente amostras com qualidade adequada de RNA (RIN >7,0) foram incluídas para análises posteriores. Quantidades iguais de RNA total foram transcritas reversamente em DNA complementar (cDNA) de acordo com o protocolo do fabricante antes da PCR quantitativa. Esse processo garantiu a validade dos dados de expressão gênica analisados. Os experimentos de qRT-PCR foram realizados em um termociclador de PCR em tempo real, utilizando um ensaio de PCR quantitativo baseado em sonda. Todas as reações foram realizadas em triplicata, juntamente com controles sem molde para assegurar a reprodutibilidade analítica. A amplificação por PCR foi realizada nas seguintes condições de ciclagem: uma etapa inicial de ativação/enzimática desnaturação a 95 °C por 10 min, seguida por 40 ciclos de desnaturação a 95 °C por 15 s e pareamento/elongação a 60 °C por 60 s. Os sinais de fluorescência foram adquiridos ao final de cada ciclo de amplificação. Todos os reagentes e materiais descartáveis foram obtidos de fornecedores comerciais (ver Tabela de Materiais). As sequências dos iniciadores e sondas utilizadas na qRT-PCR estão indicadas na Tabela 3.
Análise bioinformática
Análise da expressão gênica de YTHDC2 no banco de dados GEPIA
O banco de dados GEPIA foi utilizado para analisar a expressão de YTHDC2 no CCRP. O servidor web do GEPIA (http://gepia.cancer-pku.cn/) foi acessado por meio de um navegador da internet. O módulo Expression DIY foi selecionado, o símbolo do gene "YTHDC2" foi inserido, os conjuntos de dados LUAD e LUSC foram selecionados, os parâmetros padrão de normalização foram mantidos e os gráficos de caixa de expressão diferencial foram gerados diretamente pela interface do GEPIA. A significância estatística foi definida como p < 0,05.
Banco de dados Kaplan-Meier plotter para análise de sobrevida de pacientes com câncer de pulmão
O estudo analisou a relação entre a expressão de YTHDC2 e o prognóstico em pacientes com câncer de pulmão utilizando o banco de dados Kaplan-Meier Plotter. Foi selecionado o conjunto de dados de câncer de pulmão, o símbolo do gene "YTHDC2" foi inserido, foi aplicada a opção de corte ideal pré-selecionada automaticamente e foram geradas curvas de Kaplan-Meier para sobrevida global e sobrevida pós-progressão utilizando as configurações padrão de análise. Os pacientes foram automaticamente estratificados em grupos de alta e baixa expressão utilizando o ponto de corte ótimo determinado pela plataforma Kaplan-Meier Plotter, e as razões de risco com os respectivos intervalos de confiança de 95% foram geradas usando as configurações padrão da plataforma.
Execução de pacotes R no software R para a plotagem de curvas ROC
Os dados de expressão de sequenciamento de RNA e as metainformações clínicas correspondentes para os casos elegíveis de TCGA-LUAD e TCGA-LUSC foram baixados do GDC Data Portal. Os conjuntos de dados baixados foram combinados por identificador do paciente e importados para o R para análises posteriores. O pacote survivalROC foi utilizado para gerar curvas ROC dependentes do tempo nos pontos de previsão de 1, 3 e 5 anos, e os valores correspondentes da área sob a curva (AUC) foram calculados para avaliar o desempenho prognóstico da expressão de YTHDC2. Apenas pacientes com dados disponíveis de expressão por RNA-seq e informações de sobrevida de TCGA-LUAD e TCGA-LUSC foram incluídos na análise de ROC de sobrevida. A coorte clínica local não foi utilizada para predição de sobrevida porque dados de acompanhamento de longo prazo não estavam disponíveis.
Expressão tecidual de YTHDC2 por qRT-PCR
Para analisar os níveis de expressão gênica, foi realizada qRT-PCR. Volumes iguais de cDNA foram adicionados a cada reação de acordo com as condições recomendadas pelo fabricante. A amplificação foi realizada utilizando um ensaio de PCR quantitativo baseado em sonda, e os dados de fluorescência foram coletados automaticamente ao final de cada ciclo de amplificação. Resumidamente, o processo de extração de RNA envolveu várias etapas, incluindo preparação da amostra, desparafinização, remoção do líquido residual, digestão com proteinase K, incubação, centrifugação, tratamento com DNase, adição de DNase I e precipitação com etanol. Em seguida, a amostra foi ligada a uma coluna de purificação de RNA baseada em sílica e centrifugada a 8.000 × g por 30 s. A coluna foi então lavada com tampão de lavagem 1, tampão de lavagem 2 e tampão de lavagem 2 diluído com etanol, e seca a 13.000 × g por 2 min. O RNA foi então eluído pela adição de 70 µL de Água Livre de RNase ao centro da membrana da coluna, seguido de centrifugação a 13.000 × g por 1 min. Cada par de primers demonstrou um único produto de amplificação, o qual foi confirmado por análise da curva de dissociação antes do cálculo da expressão gênica relativa. A eficiência dos primers (90–110%) foi validada utilizando curvas-padrão antes da análise das amostras. As análises de curva de dissociação confirmaram a presença de amplicons únicos e a ausência de dímeros de primer. A expressão relativa de YTHDC2 foi calculada pelo método 2-ΔCt, no qual os valores de Ct foram normalizados ao gene de referência endógeno GAPDH. Como os valores de expressão foram apresentados como níveis de expressão normalizados em vez de variações em relação a uma amostra calibradora, os resultados são relatados como valores de 2−ΔCt. O gene GAPDH foi selecionado como gene de referência porque sua expressão apresentou variabilidade mínima (CV < 5%) em comparação com as alternativas testadas (ACTB, CV = 12%; 18S rRNA, CV = 18%), o que está de acordo com os critérios de seleção de genes de referência em estudos de m6A.
Análise estatística
As análises estatísticas foram realizadas utilizando software estatístico, incluindo a criação de gráficos e tabelas. Para analisar os dados quantitativos e categóricos sobre a expressão do gene YTHDC2 em pacientes com CCRP, o software R foi utilizado para análises bioinformáticas e geração de curvas ROC. As curvas ROC e a AUC foram usadas para avaliar o desempenho diagnóstico da expressão de YTHDC2 na predição de sobrevida. Para análises baseadas em regressão, as estimativas de efeito (razões de chances) com os respectivos intervalos de confiança de 95% foram relatadas quando aplicáveis. O teste de Wilcoxon para amostras pareadas foi utilizado para comparar a expressão de YTHDC2 entre amostras pareadas de tecido tumoral e tecido normal adjacente, enquanto a análise de correlação de Pearson foi usada para avaliar a associação entre a expressão de YTHDC2 e as características clínico-patológicas. Os coeficientes de correlação (r) e os valores de p correspondentes foram relatados. Como os dados de qRT-PCR consistiam em amostras pareadas de tecido tumoral e tecido normal adjacente provenientes dos mesmos pacientes e os dados de expressão gênica não apresentavam distribuição normal, o teste de Wilcoxon para amostras pareadas foi utilizado para comparar os níveis de expressão de YTHDC2 entre os tecidos pareados. Este teste não assume normalidade dos dados e é comumente usado para dados biológicos assimétricos. Todos os testes estatísticos foram bicaudais, e p <0,05 foi considerado estatisticamente significativo. As variáveis contínuas foram avaliadas quanto à normalidade antes da análise. As variáveis contínuas são apresentadas como média ± desvio padrão ou mediana (intervalo interquartil), conforme apropriado.