Triagem de biomarcadores diagnósticos candidatos para queloides usando um algoritmo de aprendizado de máquina
Um total de 283 genes relacionados ao metabolismo do heme foi incluído neste estudo. A análise de expressão diferencial do conjunto de dados GSE44270, comparando tecidos de queloides e pele normal, identificou 25 genes diferencialmente expressos de forma significativa (Figura 1A e Tabela Suplementar S3). Para triagem adicional de biomarcadores associados à doença, a regressão LASSO identificou nove genes candidatos (Figura 1B,C e Tabela Suplementar S3), enquanto o algoritmo de floresta aleatória (RF) selecionou 11 genes com alta importância preditiva (Figura 1D e Tabela Suplementar S3). A intersecção entre os resultados do LASSO e do RF foi visualizada por meio de um diagrama de Venn, resultando em seis biomarcadores centrais, a saber, FLVCR1, TMCC2, EIF2AK1, XK, HPX e KEL (Figura 1E e Tabela Suplementar S3). A análise da curva característica de operação do receptor (ROC) na coorte GSE44270 demonstrou bom desempenho diagnóstico para os seis biomarcadores, com valores de AUC de 0,8016 para FLVCR1, 0,7063 para TMCC2, 0,7817 para EIF2AK1, 0,7460 para XK, 0,7500 para HPX e 0,7857 para KEL (Figura 1F). Com base nesses seis biomarcadores, um nomograma diagnóstico para queloides foi posteriormente construído utilizando o pacote rms no R (Figura 1G).

Figura 1: Identificação de genes candidatos relacionados ao metabolismo de heme associados ao quelóide utilizando algoritmos de aprendizado de máquina. (A) Gráfico de caixa ilustrando a expressão diferencial de genes relacionados ao metabolismo de heme entre tecidos queloides e normais. (B,C) Análise de regressão logística LASSO para triagem de marcadores diagnósticos candidatos. (D) Biomarcadores candidatos selecionados pelo algoritmo RF. (E) Diagrama de Venn mostrando os genes sobrepostos identificados pelos dois algoritmos de aprendizado de máquina. (F) Análise da curva ROC avaliando o desempenho diagnóstico dos biomarcadores candidatos. (G) Nômograma para predição de quelóide com base na assinatura de seis genes. Abreviaturas: LASSO, operador de redução e seleção absoluta mínima; RF, floresta aleatória; ROC, característica de operação do receptor. Significância estatística: ns, P > 0,05; *, P < 0,05; **, P < 0,01; ***, P < 0,001; e ****, P < 0,0001. Clique aqui para visualizar uma versão ampliada desta figura.
O desempenho preditivo do nomograma diagnóstico foi avaliado tanto na coorte de treinamento (GSE44270) quanto na coorte de validação (GSE7890). O modelo demonstrou excelente precisão diagnóstica, alcançando valores de AUC de 0,984 (IC 95%: 0,950–1,000) e 0,922 (IC 95%: 0,806–1,000), respectivamente (Figura 2A,D). Para avaliar mais a fundo a robustez e o possível superajuste da assinatura diagnóstica de seis genes, foram realizadas análises adicionais de validação interna na coorte de descoberta (GSE44270). A validação cruzada com cinco dobras demonstrou desempenho discriminativo consistente entre os subconjuntos, com uma AUC média de 0,925, indicando que o modelo manteve desempenho estável de classificação apesar das variações nas amostras de treinamento. Além disso, a validação por bootstrap com 1.000 iterações de reamostragem resultou em uma AUC média de 0,930 (IC 95%: 0,794–1,000). Após ajuste para o otimismo potencial causado pelo tamanho limitado da amostra, a AUC corrigida para otimismo permaneceu em 0,930, sugerindo que o desempenho diagnóstico da assinatura de seis genes foi relativamente estável após a validação interna. Além disso, a análise de curva de decisão (DCA) indicou que o nomograma apresentou um benefício líquido potencial mais alto do que estratégias diagnósticas alternativas em uma variedade de probabilidades limiares, embora esses achados devam ser interpretados com cautela devido ao tamanho limitado da amostra (Figura 2B,E). Adicionalmente, amostras de queloides apresentaram escores de risco significativamente mais altos do que os controles saudáveis nas coortes de treinamento e validação (Figura 2C,F), demonstrando ainda mais a estabilidade e confiabilidade do modelo diagnóstico.

Figura 2: Validação do nomograma para predição de queloides. (A) Curva ROC avaliando o desempenho preditivo do nomograma no conjunto de dados GSE44270. (B) ACD avaliando a utilidade clínica do nomograma no GSE44270. (C) Distribuição do escore de risco comparando amostras de queloides e saudáveis no GSE44270. (D) Curva ROC avaliando o desempenho preditivo do nomograma no conjunto de dados independente GSE7890. (E) ACD avaliando a utilidade clínica do nomograma no GSE7890. (F) Distribuição do escore de risco comparando amostras de queloides e saudáveis no GSE7890. Abreviações: ROC = característica operacional do receptor; ACD = análise da curva de decisão. Clique aqui para visualizar uma versão maior desta figura.
Os biomarcadores diagnósticos estão associados às características imunológicas do quelóide
Para explorar a relação entre os seis biomarcadores diagnósticos e o microambiente imune, foi realizada uma análise de correlação para avaliar as associações entre a expressão dos biomarcadores e a infiltração de células imunes. Os resultados revelaram que os seis biomarcadores estavam significativamente associados a múltiplas populações de células imunes infiltrantes (Figura 3A). Especificamente, a expressão de FLVCR1 apresentou associação negativa com células T auxiliares foliculares (Figura 3B). TMCC2 mostrou correlações positivas com células natural killer e células dendríticas ativadas, enquanto apresentou correlação negativa com células dendríticas imaturas e células B imaturas (Figura 3C–F). Além disso, a expressão de EIF2AK1 apresentou associação negativa com células natural killer CD56dim (Figura 3G), enquanto XK apresentou associação negativa com eosinófilos (Figura 3H).

Figura 3Correlação entre genes candidatos relacionados ao metabolismo de heme e infiltração de células imunes. (AMapa de calor mostrando as correlações entre genes candidatos e populações de células imunes. O vermelho indica correlações positivas, enquanto o azul indica correlações negativas.B). Correlação entre FLVCR1 expressão e células T helper foliculares. (C-F) Correlações entre TMCC2 expressão e células assassinas naturais, células dendríticas ativadas, células dendríticas imaturas e células B imaturas, respectivamente. (G) Correlação entre EIF2AK1 expressão e células natural killer CD56dim.H). Correlação entre XK expressão e eosinófilos. Abreviações: FLVCR1 = receptor do vírus da leucemia felina do subgrupo C 1; TMCC2 = transmembrana e domínios em alfa-hélice 2; EIF2AK1 = quinase alfa do fator de iniciação da tradução em eucariotos 2; CD56dimensão = dimensão do cluster de diferenciação 56 Clique aqui para visualizar uma versão maior desta figura.
Análise de dados de transcriptoma de célula única
Para caracterizar os padrões de expressão dos biomarcadores diagnósticos identificados no microambiente do quelóide, analisamos o conjunto de dados de sequenciamento de RNA de célula única GSE163973. Após controle de qualidade e integração dos dados, 21.488 células de alta qualidade foram mantidas para análises posteriores. Excluímos células com menos de 200 ou mais de 6.000 contagens totais de identificadores moleculares únicos (UMI) e identificamos e removemos potenciais dupletos utilizando o pacote DoubletDetection. Selecionamos os 2.000 genes que exibiram maior variabilidade de expressão, seguido de redução de dimensionalidade e visualização com a projeção de aproximação uniforme de variedades (UMAP). Um total de 10 grandes populações celulares foi identificado, incluindo células endoteliais, fibroblastos, fibras musculares, queratinócitos, células imunes, células endoteliais linfáticas, células glandulares, células neurais, melanócitos e uma população celular não classificada (Figura 4A,B). O perfil de expressão revelou padrões distintos de distribuição específicos a cada tipo celular dos biomarcadores diagnósticos. FLVCR1 foi predominantemente expresso em células endoteliais e melanócitos, enquanto EIF2AK1 mostrou expressão relativamente alta em células neurais, células glandulares e fibroblastos. HPX foi principalmente enriquecido em melanócitos, enquanto KEL exibiu expressão predominante em células glandulares (Figura 4C,D).

Figura 4: Distribuição de biomarcadores diagnósticos relacionados ao metabolismo do heme no transcriptoma de célula única de queloides. (A) Gráfico UMAP mostrando 21 agrupamentos celulares compostos por 21.488 células de amostras de queloides. (B) Anotações de tipos celulares com base nas anotações relatadas no estudo original. (C) Gráficos de características mostrando a expressão de biomarcadores diagnósticos relacionados ao metabolismo do heme em diferentes tipos celulares. (D) Gráfico de bolhas mostrando os níveis médios de expressão e as porcentagens de células que expressam os biomarcadores diagnósticos relacionados ao metabolismo do heme em diferentes tipos celulares. Abreviação: UMAP = aproximação e projeção de variedade uniforme. Clique aqui para visualizar uma versão maior desta figura.
Identificação e análise da rede de interação de biomarcadores diagnósticos candidatos
Para explorar os mecanismos regulatórios subjacentes aos biomarcadores diagnósticos candidatos, foi construída uma rede regulatória de miRNA–mRNA. Para melhorar a confiabilidade das interações previstas, foram identificados miRNAs sobrepostos que direcionam os biomarcadores candidatos. Um total de 282 miRNAs interagindo com os seis biomarcadores diagnósticos foi obtido, e a rede regulatória resultante é mostrada na Figura 5. Notavelmente, previu-se que hsa-miR-34a-5p, hsa-let-7a-5p, hsa-let-7d-5p, hsa-let-7e-5p e hsa-miR-26b-5p regulassem simultaneamente os seis biomarcadores candidatos.

Figura 5: Rede reguladora de miRNA dos biomarcadores diagnósticos relacionados ao metabolismo do heme. A rede ilustra as relações regulatórias entre os seis genes biomarcadores diagnósticos (FLVCR1, HPX, TMCC2, KEL, XK e EIF2AK1) e seus miRNAs associados. Os nós gênicos representam os biomarcadores diagnósticos, enquanto os nós circundantes representam os miRNAs. As arestas indicam interações miRNA–mRNA com suporte experimental. Abreviações: FLVCR1 = receptor do vírus da leucemia felina do subgrupo C 1; HPX = hemopexina; TMCC2 = domínios transmembrana e com estrutura em alça 2; KEL = metaloendopeptidase Kell; XK = grupo sanguíneo X-linked Kx; EIF2AK1 = quinase 1 do fator de iniciação da tradução eucariótica 2 alfa; miRNA = microRNA; mRNA = RNA mensageiro. Clique aqui para visualizar uma versão maior desta figura.
Validação experimental da expressão de FLVCR1 e análise de docking molecular de compostos terapêuticos potenciais
Para validar as descobertas bioinformáticas e confirmar a relevância funcional do gene central identificado, avaliamos experimentalmente a expressão de FLVCR1 em PKF e NHDF. As análises de qRT-PCR e western blot demonstraram consistentemente que FLVCR1 estava significativamente superexpresso em fibroblastos de queloides em comparação com os controles normais (Figura 6A–C, Figura Suplementar S1 e Tabela Suplementar S4). Essa expressão celular elevada apoia o envolvimento potencial da desregulação metabólica do heme associada ao FLVCR1 na patogênese da queloides.
Dado o envolvimento potencial da FLVCR1 em alterações imunes associadas ao metabolismo do heme, em seguida buscamos identificar compostos terapêuticos potenciais que pudessem direcionar diretamente a FLVCR1 para interromper esse eixo patogênico. Foi realizada uma triagem virtual em alto rendimento utilizando uma biblioteca de compostos de medicina tradicional chinesa (MTC) e a estrutura proteica preparada. Os 20 compostos com os escores de encaixe mais favoráveis foram selecionados para avaliação adicional (Tabela Suplementar S5). De modo geral, uma energia de ligação mais baixa indica uma afinidade de ligação mais forte, e energias de encaixe abaixo de −5 kcal/mol são consideradas indicativas de interações estáveis entre ligante e proteína. Dentre os compostos triados, (+)-Galocatequina, (−)-Epicatequina, (−)-Galocatequina e Cianidina (cloreto) exibiram afinidades de ligação favoráveis à FLVCR1. Notavelmente, a (+)-Galocatequina mostrou a interação mais forte com FLVCR1, formando quatro ligações de hidrogênio com GLU214, ASN245, GLN246 e GLN471, sugerindo um modo de ligação estável entre ligante e proteína (Figura 6D–G). Esses achados destacam a (+)-galocatequina como um candidato promissor para intervenção terapêutica baseada em mecanismos que direcionam FLVCR1.

Figura 6: Validação experimental da expressão de FLVCR1 e encaixe molecular de compostos potenciais direcionados à FLVCR1. (A) Imagens representativas de western blot mostrando a expressão da proteína FLVCR1 em CON e queloides. GAPDH serviu como controle de carga. (B) Quantificação dos níveis proteicos de FLVCR1 normalizados em relação a GAPDH. (C) Os níveis relativos de expressão de mRNA de FLVCR1 em fibroblastos de CON e queloides foram determinados por qRT-PCR. GAPDH foi utilizado como referência interna. (D–G) Representações tridimensionais dos modos de ligação previstos entre FLVCR1 e compostos de pequenas moléculas selecionados: (D) (+)-Galocatequina. (E) (-)-Epicatequina. (F) (-)-Galocatequina. (G) Cianidina (Cloreto). Abreviações: FLVCR1 = receptor do vírus da leucemia felina do subgrupo C 1; CON, controle; GAPDH, desidrogenase gliceraldeído-3-fosfato; qRT-PCR, reação em cadeia da polimerase com transcrição reversa quantitativa; SD, desvio padrão. Os dados são apresentados como média ± SD. Significância estatística: ns, P > 0,05; *, P < 0,05; **, P < 0,01; ***, P < 0,001; e ****, P < 0,0001. Clique aqui para visualizar uma versão ampliada desta figura.
Confirmação da estabilidade do complexo FLVCR1–(+)-Galocatequina por meio de simulação de dinâmica molecular
Para examinar a confiabilidade do modo previsto de ligação entre ligante e proteína, foi realizada uma simulação de dinâmica molecular (MD) para o complexo FLVCR1–(+)-gallocatequina. A análise concentrou-se em determinar se o complexo permaneceu estruturalmente estável ao longo do tempo e se a ligação do ligante alterou o comportamento conformacional da proteína, utilizando RMSD, RMSF, raio de giração (Rg), SASA, análise de ligação de hidrogênio e cálculos MM/GBSA. A análise de RMSD (Figura 7A) mostrou que tanto a proteína apó quanto o complexo ligado ao ligante apresentaram flutuações iniciais nos primeiros 20 ns, seguidas por estabilização gradual, indicando que os sistemas atingiram o equilíbrio durante a simulação. Após o equilíbrio, o valor de RMSD do complexo FLVCR1–(+)-gallocatequina permaneceu abaixo de 0,2 nm, sugerindo que a ligação do ligante contribuiu para manter a estabilidade estrutural do FLVCR1. A análise de RMSF (Figura 7B) demonstrou que a maioria dos resíduos exibiu flutuações limitadas ao longo da simulação, indicando a preservação da integridade geral da proteína, enquanto algumas regiões flexíveis podem representar regiões em alça envolvidas na acomodação do ligante. Além disso, perfis estáveis de Rg e SASA (Figura 7C,D) indicaram que o complexo manteve uma conformação compacta, sem expansão estrutural evidente ou mudanças na exposição ao solvente. A análise de ligação de hidrogênio (Figura 7E) revelou que o complexo FLVCR1–(+)-gallocatequina manteve interações intermoleculares persistentes, com aproximadamente 3–4 ligações de hidrogênio formadas durante a simulação, o que apoia a estabilidade da associação entre ligante e proteína. A análise MM/GBSA mostrou ainda que o complexo FLVCR1–(+)-gallocatequina exibiu uma energia livre de ligação favorável (ΔGtotal = −34,87 ± 4,13 kcal/mol) (Tabela Suplementar S6). A análise de decomposição de energia indicou que as interações de van der Waals (ΔVDWAALS = −46,34 ± 2,16 kcal/mol) e as interações eletrostáticas (ΔEelec = −14,09 ± 3,45 kcal/mol) foram as principais contribuições favoráveis para a ligação, apesar da contribuição desfavorável da energia de solvatação polar (ΔGsolvation = 25,55 ± 0,74 kcal/mol) (Tabela Suplementar S6). Em conjunto, esses resultados de simulação de MD demonstraram que a (+)-gallocatequina formou um complexo estável com FLVCR1 e reforçaram a confiabilidade do modo de ligação previsto por docking.

Figura 7: Análise por simulação de dinâmica molecular do complexo FLVCR1–(+)-Galocatequina. (A) Perfis de RMSD de FLVCR1 na forma apó e do complexo FLVCR1–(+)-Galocatequina durante a simulação de dinâmica molecular de 100 ns. (B) Perfil de RMSF mostrando flutuações ao nível dos resíduos de FLVCR1 durante a simulação. (C) Perfil de SASA mostrando alterações na área da superfície acessível ao solvente do complexo FLVCR1–(+)-Galocatequina. (D) Perfil de Rg avaliando a compactação do complexo FLVCR1–(+)-Galocatequina durante a simulação. (E) Análise de ligações de hidrogênio mostrando interações intermoleculares dinâmicas entre FLVCR1 e (+)-Galocatequina ao longo da simulação. Abreviações: FLVCR1 = receptor de leucemia felina do subgrupo C 1; RMSD = desvio quadrático médio; RMSF = flutuação quadrática média; SASA = área da superfície acessível ao solvente; Rg = raio de giração. Clique aqui para visualizar uma versão maior desta figura.
Disponibilidade de Dados:
Os conjuntos de dados transcriptômicos disponíveis publicamente analisados neste estudo podem ser acessados por meio do Gene Expression Omnibus (GEO) sob os números de acesso GSE44270, GSE7890 e GSE163973. Os dados brutos gerados neste estudo e que sustentam a validação experimental, incluindo medições de qRT-PCR, imagens originais de western blot e dados de quantificação de western blot, são fornecidos como Figura Suplementar S1, Tabela Suplementar S1, Tabela Suplementar S2, Tabela Suplementar S3 e Tabela Suplementar S4. Os resultados de docking molecular e os dados de energia livre de ligação MM/GBSA também são fornecidos nas Tabela Suplementar S5 e Tabela Suplementar S6.
Figura suplementar S1: Dados originais do western blot.Clique aqui para baixar este arquivo.
Tabela Suplementar S1: Genes relacionados ao metabolismo de heme.Clique aqui para baixar este arquivo.
Tabela Suplementar S2: Sequências de primers de genes selecionados. Clique aqui para baixar este arquivo.
Tabela Suplementar S3: Abordagens de aprendizado de máquina para identificar biomarcadores diagnósticos potenciais no quelóide. Clique aqui para baixar este arquivo.
Tabela Suplementar S4: Dados brutos que apoiam a validação experimental da expressão de FLVCR1. Clique aqui para baixar este arquivo.
Tabela Suplementar S5: Os 20 principais compostos candidatos identificados por docking molecular com FLVCR1.Clique aqui para baixar este arquivo.
Tabela Suplementar S6: Análise da energia livre de ligação MM/GBSA do complexo FLVCR1–(+)-Galocatequina.Clique aqui para baixar este arquivo.