$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
O câncer de pulmão continua sendo um dos principais tipos de câncer, levando a sérios problemas de saúde, frequentemente levando à morte1. A radiômica permite a caracterização quantitativa de imagens médicas extraindo grandes conjuntos de características que descrevem a forma, textura e padrões de intensidade do tumor 2,3. Essas características, também chamadas de características artesanais, servem como potenciais biomarcadores para diagnóstico, prognóstico e resposta ao tratamento do câncer de pulmão. No entanto, os conjuntos de dados de radiômica são tipicamente de alta dimensão e limitados por amostra, levando a características redundantes e ruidosas que degradam o desempenho domodelo 4,5,6,7. Portanto, a seleção eficiente e explicável de características é crucial para desenvolver modelos preditivos robustos baseados em radiômica.
Abordagens tradicionais de seleção de características, como métodos de filtro (por exemplo, análise de correlação, análise de variância [ANOVA], informação mútua) e métodos de envolvimento (por exemplo, Seleção Sequencial de Características, Eliminação Recursiva de Características) são amplamente utilizadas para modelos de detecção de câncer baseados emradiômica 4,8,9. No entanto, frequentemente falham em capturar interações não lineares de características e dependências contextuais profundas inerentes aos dados deradiômica 9,10,11. Técnicas de aprendizado de características em conjunto foram exploradas para classificação de imagens médicas, mas alcançaram precisão moderada, que poderia ser aindamelhorada 12.
Métodos de aprendizado profundo, especialmente redes neurais profundas (DNNs), demonstraram capacidade superior de modelar relações não lineares e hierárquicas entre características e resultados, tornando-os ideais para orientar a seleção de características e fornecer modelos precisos de detecção de câncer13,14. Nesse contexto, o potencial do uso de uma rede neural convolucional, técnicas de IA multimodal e VCG-16, um modelo pré-treinado para diagnóstico de câncer, éexplorado 1,15,16. Um modelo híbrido de aprendizado profundo17, incluindo o modelo VGG-19 pré-treinado e redes de memória de curto prazo (LSTMs), foi proposto, treinado e testado em um grande número de imagens, alcançando mais de 99% de precisão.
Além da detecção do câncer, também foram realizadas pesquisas sobre estadiamento do câncer. Hugo et al.18 projetaram um modelo de rede neural feed-forward no banco de dados NSCLC de 300 pacientes para classificar o câncer estágios I, II e III com uma precisão de 74,52% nos testes modelos. Um método de inversãobayesiana baseado em radiômica, o 3, foi apresentado para a detecção de estádios do câncer de pulmão usando o conjunto de dados NLST com um tamanho de amostra de 200. O método proposto alcançou uma precisão de 86%. A revisão da literatura revelou que a maioria dos estudos sobre detecção do câncer focou exclusivamente na classificação de tumores benignos e malignos, e apenas alguns abordaram a classificação dos estágios do câncer, com precisões inferiores a 90% que podem ser aprimoradas. Este artigo de pesquisa aborda a lacuna mencionada e propõe uma estrutura robusta de classificação baseada em características radiômicas para a detecção precisa do estágio do câncer de pulmão.
Uma estrutura de eliminação de características recursivas baseada em perda de gradiente (GL-RFE) foi introduzida neste estudo, integrando a retropropagação de gradiente de redes neurais ao processo RFE. Diferentemente dos métodos convencionais de RFE, que dependem de métricas estáticas de importância de características, o GL-RFE aproveita os gradientes da função de perda em relação a cada característica de entrada para medir o quão fortemente cada característica influencia as previsões do modelo. Ao remover iterativamente características com contribuições mínimas de gradiente, o modelo apresentado realiza a seleção de características das 15 principais características diagnósticas otimizadas para a detecção de estágios do câncer de pulmão em 2 classes (estágios I e II combinados e estágios IIIa e IIIb combinados). O diagrama do fluxo de trabalho realizado é apresentado na Figura 1. O conjunto de dados de câncer de pulmão escolhido para o modelo apresentado é o NSCLC Radiomics19, com 411 volumes de formato denominados imagem digital e comunicações em medicina (DICOM), com informações clínicas do estádio do câncer. Um total de 106 recursos de radiômica 3D de cada volume DICOM para câncer de pulmão são extraídos usando o PyRadiomics20, uma extensão de um software de código aberto, o 3D Slicer21. Essas características pertencem a sete classesde características: 22, incluindo forma, método de diferença de nível cinza (GLDM), matriz de coocorrência de nível cinza (GLCM), primeira ordem, matriz de comprimento de traço de nível cinza (GLRLM), matriz de zona de tamanho de nível cinza (GLSZM), matriz de diferença de tons de cinza de vizinhança (NGTDM). Os dados de radiômica da classe minoritária (estágio I e estágio II) foram superamostrados usando a técnica sintética de sobreamostragem de minorias (SMOTE)23.
A novidade do framework GL-RFE proposto está em integrar a análise de sensibilidade baseada em gradiente derivada do treinamento de redes neurais no processo de eliminação de características recursivas. Diferentemente das abordagens convencionais de RFE que dependem de medidas estáticas de importância, a GL-RFE avalia dinamicamente a relevância das características por meio de gradientes retropropagados da função de perda. Isso permite a identificação de características que influenciam diretamente as previsões do modelo para o estágio do câncer, mantendo a interpretabilidade e a viabilidade computacional para conjuntos de dados médicos relativamente pequenos.
O conjunto de dados utilizado para o treinamento e teste do framework proposto é um conjunto de dados de imagens de TC de 422 pacientes com câncer de pulmão, conhecido como NSCLC Radiomics17. Para cada paciente, o conjunto de dados inclui um volume de tomografia computarizada, um conjunto de estruturas de radioterapia DICOM (RTSTRUCT) e um arquivo de segmentação DICOM (SEG). Esses arquivos contêm delimitações manuais realizadas por um oncologista radioterapeuta do volume tridimensional do volume tumoral primário grosso (GTV-1), bem como da imagem pulmonar. O conjunto de dados é um conjunto pré-processado, e as dimensões das imagens são 512 x 512 pixels.
Devido à natureza não linear das características radiômicas feitas à mão, essas características não podem ser usadas diretamente com modelos de aprendizado profundo para diagnóstico de câncer, e seus padrões de dados inerentes devem ser capturados usando técnicas de IA. O GL-RFE classifica características com base na magnitude do gradiente da perda do modelo L em relação a cada característica de entrada xi.
Para cada característica de entrada xi, o gradiente absoluto médio é calculado da seguinte forma:
(1)
Aqui, N é o número total de amostras. Lj é a perda para ja amostra. xIJ é a i-ésima característica da jésima amostra.
representa a sensibilidade da perda em relação à característica de entrada.
As características com magnitudes de gradiente baixo têm impacto mínimo nas atualizações do modelo e são eliminadas recursivamente. O fluxo de trabalho proposto para eliminar as características radiômicas de baixo gradiente usando um perceptrôn multicamadas (MLP) e treinar uma rede neural de aprendizado profundo (DNN) nas 15 principais características está mostrado na Figura 1. O desempenho do método GL-RFE para seleção de características é então avaliado.
O modelo de aprendizado profundo mencionado com o método GL–RFE é implementado em um notebook Jupyter no Google Colab, que permite escrever e executar código Python em um ambiente online. Diferentes pacotes, incluídos nos passos do protocolo e nos materiais, precisam ser baixados para compilar o código. Usando o método descrito na seção de Protocolo, as 15 principais características radiômicas para a detecção do câncer de pulmão são identificadas e usadas para alcançar a detecção precisa do câncer em conjuntos de dados de teste.