Identifizierung von potenziellen diagnostischen Biomarkern für Keloid unter Verwendung eines maschinellen Lernalgorithmus
Insgesamt wurden 283 Gene im Zusammenhang mit dem Hämstoffwechsel in diese Studie einbezogen. Die differentielle Expressionsanalyse des GSE44270-Datensatzes, die keloide mit normalem Hautgewebe verglich, identifizierte 25 signifikant anders exprimierte Gene (Abbildung 1A und Ergänzende Tabelle S3). Zur weiteren Selektion krankheitsassoziierter Biomarker identifizierte die LASSO-Regression neun Kandidatengene (Abbildung 1B,C und Ergänzende Tabelle S3), während der Random-Forest-Algorithmus (RF) 11 Gene mit hoher Vorhersagebedeutung auswählte (Abbildung 1D und Ergänzende Tabelle S3). Der Überlapp zwischen den Ergebnissen von LASSO und RF wurde mittels eines Venndiagramms dargestellt und ergab sechs zentrale Biomarker, nämlich FLVCR1, TMCC2, EIF2AK1, XK, HPX und KEL (Abbildung 1E und Ergänzende Tabelle S3). Die Analyse der Receiver-Operating-Characteristic (ROC) in der GSE44270-Kohorte zeigte eine günstige diagnostische Leistung für alle sechs Biomarker, mit AUC-Werten von 0,8016 für FLVCR1, 0,7063 für TMCC2, 0,7817 für EIF2AK1, 0,7460 für XK, 0,7500 für HPX und 0,7857 für KEL (Abbildung 1F). Basierend auf diesen sechs Biomarkern wurde anschließend ein diagnostisches Nomogramm für Keloide unter Verwendung des rms-Pakets in R erstellt (Abbildung 1G).

Abbildung 1: Identifizierung von kandidaten Häm-Stoffwechsel-assoziierten Genen, die mit Keloiden mittels maschineller Lernalgorithmen verknüpft sind. (A) Boxplot, der die differentielle Expression von Häm-Stoffwechsel-assoziierten Genen zwischen Keloid- und Normalgewebe veranschaulicht. (B,C) LASSO-logistische Regressionsanalyse zur Auswahl kandidater diagnostischer Marker. (D) Durch den RF-Algorithmus ausgewählte kandidaten Biomarker. (E) Venn-Diagramm, das die überlappenden Gene zeigt, die durch die beiden maschinellen Lernalgorithmen identifiziert wurden. (F) ROC-Kurvenanalyse zur Bewertung der diagnostischen Leistung der kandidaten Biomarker. (G) Nomogramm zur Vorhersage von Keloide basierend auf der Sechs-Gen-Signatur. Abkürzungen: LASSO, Least Absolute Shrinkage and Selection Operator; RF, Random Forest; ROC, Receiver Operating Characteristic. Statistische Signifikanz: ns, P > 0,05; *, P < 0,05; **, P < 0,01; ***, P < 0,001; und ****, P < 0,0001. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.
Die Vorhersageleistung des diagnostischen Nomogramms wurde sowohl in der Trainingskohorte (GSE44270) als auch in der Validierungskohorte (GSE7890) bewertet. Das Modell zeigte eine ausgezeichnete diagnostische Genauigkeit mit AUC-Werten von 0,984 (95 % KI: 0,950–1,000) bzw. 0,922 (95 % KI: 0,806–1,000) (Abbildung 2A,D). Um die Robustheit und das potenzielle Überanpassungsrisiko der sechsgenigen diagnostischen Signatur weiter zu bewerten, wurden zusätzliche interne Validierungsanalysen in der Entdeckungskohorte (GSE44270) durchgeführt. Die fünffache Kreuzvalidierung zeigte eine konsistente Unterscheidungsleistung über alle Teilmengen hinweg mit einer mittleren AUC von 0,925, was darauf hindeutet, dass das Modell eine stabile Klassifizierungsleistung trotz Variationen in den Trainingsproben beibehielt. Außerdem ergab die Bootstrap-Validierung mit 1.000 Resampling-Durchgängen eine mittlere AUC von 0,930 (95 % KI: 0,794–1,000). Nach Korrektur für mögliche Überoptimismus aufgrund der begrenzten Stichprobengröße blieb die optimistischkeitskorrigierte AUC bei 0,930, was darauf hindeutet, dass die diagnostische Leistung der sechsgenigen Signatur nach interner Validierung relativ stabil war. Darüber hinaus zeigte die Entscheidungskurvenanalyse (DCA), dass das Nomogramm über einen Bereich von Schwellenwahrscheinlichkeiten hinweg einen höheren potenziellen Nettovorteil aufwies als alternative diagnostische Strategien, obwohl diese Ergebnisse angesichts der begrenzten Stichprobengröße mit Vorsicht zu interpretieren sind (Abbildung 2B,E). Zusätzlich wiesen Keloid-Proben in beiden Kohorten, der Trainings- und der Validierungskohorte, signifikant höhere Risikoscores als gesunde Kontrollen auf (Abbildung 2C,F), was die Stabilität und Zuverlässigkeit des diagnostischen Modells weiter unterstreicht.

Abbildung 2: Validierung des Nomogramms zur Vorhersage von Keloide. (A) ROC-Kurve zur Bewertung der Vorhersageleistung des Nomogramms im GSE44270-Datensatz. (B) DCA zur Bewertung der klinischen Nützlichkeit des Nomogramms im GSE44270. (C) Verteilung der Risikoscores im Vergleich von Keloide- und gesunden Proben im GSE44270. (D) ROC-Kurve zur Bewertung der Vorhersageleistung des Nomogramms im unabhängigen GSE7890-Datensatz. (E) DCA zur Bewertung der klinischen Nützlichkeit des Nomogramms im GSE7890. (F) Verteilung der Risikoscores im Vergleich von Keloide- und gesunden Proben im GSE7890. Abkürzungen: ROC = receiver operating characteristic; DCA = decision curve analysis. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.
Diagnostische Biomarker sind mit den immunologischen Merkmalen von Keloiden assoziiert
Um die Beziehung zwischen den sechs diagnostischen Biomarkern und der immunologischen Mikroumgebung zu untersuchen, wurde eine Korrelationsanalyse durchgeführt, um die Zusammenhänge zwischen der Expression der Biomarker und der Infiltration von Immunzellen zu bewerten. Die Ergebnisse zeigten, dass alle sechs Biomarker signifikant mit mehreren infiltrierenden Immunzellpopulationen assoziiert waren (Abbildung 3A). Insbesondere war die Expression von FLVCR1 negativ mit T-follikulären Helferzellen assoziiert (Abbildung 3B). TMCC2 wies positive Korrelationen mit natürlichen Killerzellen und aktivierten dendritischen Zellen auf, während eine negative Korrelation mit unreifen dendritischen Zellen und unreifen B-Zellen bestand (Abbildung 3C–F). Außerdem war die Expression von EIF2AK1 negativ mit CD56dim natürlichen Killerzellen assoziiert (Abbildung 3G), während XK negativ mit Eosinophilen assoziiert war (Abbildung 3H).

Abbildung 3: Korrelation zwischen kandidaten Hämstoffwechsel-assoziierten Genen und der Infiltration von Immunzellen. (AHeatmap mit den Korrelationen zwischen Kandidatengenen und Immunzellpopulationen. Rot zeigt positive Korrelationen an, während Blau negative Korrelationen anzeigt.B). Korrelation zwischen FLVCR1 Expression und T-follikuläre Helferzellen.C-F) Korrelationen zwischen TMCC2 Expression und natürliche Killerzellen, aktivierte dendritische Zellen, immature dendritische Zellen und immature B-Zellen, jeweils.GKorrelation zwischen EIF2AK1 Expression und CD56dim natürliche Killerzellen.H). Korrelation zwischen XK Expression und Eosinophile. Abkürzungen: FLVCR1 = feline Leukämie-Virus-Subgruppe-C-Rezeptor 1; TMCC2 = Transmembran- und Coiled-Coil-Domänen 2; EIF2AK1 = eukaryotischer Translationsinitiationsfaktor-2-alpha-Kinase 1; CD56gedimmt = Cluster der Differenzierung 56 schwach Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.
Analyse von Einzelzell-Transkriptomdaten
Um die Expressionsmuster der identifizierten diagnostischen Biomarker im Keloide-Mikromilieu zu charakterisieren, analysierten wir den Single-Cell-RNA-Sequenzierungsdatensatz GSE163973. Nach Qualitätskontrolle und Datenintegration wurden 21.488 hochwertige Zellen für nachfolgende Analysen beibehalten. Zellen mit weniger als 200 oder mehr als 6.000 insgesamt eindeutigen molekularen Identifikatoren (UMI) wurden ausgeschlossen, und potenzielle Doubletts wurden mithilfe des DoubletDetection-Pakets identifiziert und entfernt. Die 2.000 Gene mit der größten Expressionsvariabilität wurden ausgewählt, gefolgt von einer Dimensionsreduktion und Visualisierung mittels Uniformer Manifold-Approximation und -Projection (UMAP). Insgesamt wurden 10 größere Zellpopulationen identifiziert, darunter Endothelzellen, Fibroblasten, Muskelzellen, Keratinozyten, Immunzellen, lymphatische Endothelzellen, Drüsenzellen, Nervenzellen, Melanozyten und eine nicht klassifizierte Zellpopulation (Abbildung 4A,B). Die Expressionsprofilierung zeigte unterschiedliche, zelltypspezifische Verteilungsmuster der diagnostischen Biomarker. FLVCR1 wurde vorwiegend in Endothelzellen und Melanozyten exprimiert, während EIF2AK1 eine relativ hohe Expression in Nervenzellen, Drüsenzellen und Fibroblasten aufwies. HPX war hauptsächlich in Melanozyten angereichert, während KEL eine vorherrschende Expression in Drüsenzellen zeigte (Abbildung 4C,D).

Abbildung 4: Verteilung von hämstoffwechselbezogenen diagnostischen Biomarkern im Einzelzell-Transkriptom des Keloids. (A) UMAP-Diagramm, das 21 Zellcluster mit insgesamt 21.488 Zellen aus Keloidproben zeigt. (B) Zelltyp-Annotationen basierend auf den im Originalartikel berichteten Annotationen. (C) Merkmalsdarstellungen (Feature plots), die die Expression von hämstoffwechselbezogenen diagnostischen Biomarkern in verschiedenen Zelltypen zeigen. (D) Blasendiagramm, das die durchschnittlichen Expressionsniveaus und den Anteil exprimierender Zellen für hämstoffwechselbezogene diagnostische Biomarker in verschiedenen Zelltypen darstellt. Abkürzung: UMAP = uniform manifold approximation and projection. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.
Identifizierung und Interaktionsnetzwerkanalyse von potenziellen diagnostischen Biomarkern
Um die regulatorischen Mechanismen der in Betracht gezogenen diagnostischen Biomarker zu untersuchen, wurde ein miRNA–mRNA-Regulationsnetzwerk konstruiert. Um die Zuverlässigkeit der vorhergesagten Interaktionen zu erhöhen, wurden überlappende miRNAs identifiziert, die die in Betracht gezogenen Biomarker gezielt ansteuern. Insgesamt wurden 282 miRNAs ermittelt, die mit den sechs diagnostischen Biomarkern interagieren, und das resultierende Regulierungsnetzwerk ist in Abbildung 5 dargestellt. Bemerkenswerterweise wurde vorhergesagt, dass hsa-miR-34a-5p, hsa-let-7a-5p, hsa-let-7d-5p, hsa-let-7e-5p und hsa-miR-26b-5p alle sechs in Betracht gezogenen Biomarker gleichzeitig regulieren.

Abbildung 5: miRNA-Regulationsnetzwerk von heme-Stoffwechsel-bezogenen diagnostischen Biomarkern. Das Netzwerk veranschaulicht die regulatorischen Beziehungen zwischen den sechs diagnostischen Biomarker-Genen (FLVCR1, HPX, TMCC2, KEL, XK und EIF2AK1) und ihren assoziierten miRNAs. Genknoten repräsentieren die diagnostischen Biomarker, während die umgebenden Knoten miRNAs darstellen. Kanten zeigen experimentell bestätigte miRNA–mRNA-Interaktionen an. Abkürzungen: FLVCR1 = feline Leukämievirus-Subgruppe-C-Rezeptor 1; HPX = Hemopexin; TMCC2 = Transmembran- und Coiled-Coil-Domänen 2; KEL = Kell-Metallo-Endopeptidase; XK = X-chromosomale Kx-Blutgruppe; EIF2AK1 = eukaryotischer Initiationsfaktor 2 alpha-Kinase 1; miRNA = microRNA; mRNA = messenger RNA. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.
Experimentelle Validierung der FLVCR1-Expression und molekulare Docking-Analyse potenzieller therapeutischer Verbindungen
Um die bioinformatischen Ergebnisse zu validieren und die funktionelle Relevanz des identifizierten Hub-Gens zu bestätigen, untersuchten wir experimentell die Expression von FLVCR1 in PKF und NHDF. Sowohl qRT-PCR- als auch Western-Blot-Analysen zeigten durchgängig, dass FLVCR1 in keloide Fibroblasten im Vergleich zu normalen Kontrollen signifikant hochreguliert war (Abbildung 6A–C, Ergänzende Abbildung S1 und Ergänzende Tabelle S4). Diese erhöhte zelluläre Expression stützt die mögliche Beteiligung einer FLVCR1-assoziierten Dysregulation des Häm-Stoffwechsels an der Pathogenese von Keloide.
Angesichts der möglichen Beteiligung von FLVCR1 an hemo-metabolischen Immunveränderungen suchten wir als Nächstes nach potenziellen therapeutischen Verbindungen, die FLVCR1 direkt gezielt beeinflussen könnten, um diese pathogene Achse zu unterbrechen. Mithilfe einer Bibliothek mit Verbindungen aus der traditionellen chinesischen Medizin (TCM) und der vorbereiteten Proteinstruktur wurde ein Hochdurchsatz-Virtual-Screening durchgeführt. Die 20 Verbindungen mit den günstigsten Docking-Scores wurden für eine weitere Bewertung ausgewählt (ergänzende Tabelle S5). Im Allgemeinen deutet eine niedrigere Bindungsenergie auf eine stärkere Bindungsaffinität hin, und Docking-Energien unter −5 kcal/mol gelten als Hinweis auf stabile Ligand-Protein-Wechselwirkungen. Unter den untersuchten Verbindungen wiesen (+)-Gallocatechin, (−)-Epicatechin, (−)-Gallocatechin und Cyanidin (Chlorid) günstige Bindungsaffinitäten gegenüber FLVCR1 auf. Bemerkenswerterweise zeigte (+)-Gallocatechin die stärkste Wechselwirkung mit FLVCR1, indem es vier Wasserstoffbrücken mit GLU214, ASN245, GLN246 und GLN471 bildete, was auf einen stabilen Bindungsmodus zwischen Ligand und Protein hindeutet (Abbildung 6D–G). Diese Ergebnisse unterstreichen (+)-Gallocatechin als vielversprechenden Kandidaten für eine mechanismenbasierte therapeutische Intervention, die auf FLVCR1 abzielt.

Abbildung 6: Experimentelle Validierung der FLVCR1-Expression und molekulares Docking potenzieller Verbindungen, die FLVCR1 gezielt ansprechen. (A) Repräsentative Western-Blot-Bilder, die die FLVCR1-Proteinexpression in CON und Keloid zeigen. GAPDH diente als Ladekontrolle. (B) Quantifizierung der auf GAPDH normalisierten FLVCR1-Proteinmengen. (C) Relative mRNA-Expressionsmengen von FLVCR1 in CON- und Keloid-Fibroblasten wurden mittels qRT-PCR bestimmt. GAPDH wurde als interne Referenz verwendet. (D–G) Dreidimensionale Darstellungen der vorhergesagten Bindungsmodi zwischen FLVCR1 und ausgewählten niedermolekularen Verbindungen: (D) (+)-Gallocatechin. (E) (-)-Epicatechin. (F) (-)-Gallocatechin. (G) Cyanidin (Chlorid). Abkürzungen: FLVCR1 = feline leukemia virus subgroup C receptor 1; CON, Kontrolle; GAPDH, Glyceraldehyd-3-phosphat-Dehydrogenase; qRT-PCR, quantitative reverse Transkriptase-Polymerase-Kettenreaktion; SD, Standardabweichung. Die Daten werden als Mittelwert ± SD angegeben. Statistische Signifikanz: ns, P > 0,05; *, P < 0,05; **, P < 0,01; ***, P < 0,001; und ****, P < 0,0001. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.
Bestätigung der Stabilität des FLVCR1–(+)-Gallocatechin-Komplexes mittels Molekulardynamik-Simulation
Um die Zuverlässigkeit der vorhergesagten Ligand–Protein-Bindungsweise zu überprüfen, wurde eine Molekulardynamik-(MD-)Simulation für den FLVCR1–(+)-Gallocatechin-Komplex durchgeführt. Die Analyse konzentrierte sich darauf, ob der Komplex über die Zeit strukturell stabil blieb und ob die Ligandenbindung das konformationelle Verhalten des Proteins mittels RMSD-, RMSF-, Trägheitsradius-(Rg-), SASA-, Wasserstoffbrückenanalyse sowie MM/GBSA-Berechnungen veränderte. Die RMSD-Analyse (Abbildung 7A) zeigte, dass sowohl das Apo-Protein als auch der ligandengebundene Komplex anfängliche Schwankungen innerhalb der ersten 20 ns aufwiesen, gefolgt von einer schrittweisen Stabilisierung, was darauf hindeutet, dass die Systeme während der Simulation ein Gleichgewicht erreichten. Nach der Equilibrierung blieb der RMSD-Wert des FLVCR1–(+)-Gallocatechin-Komplexes unterhalb von 0,2 nm, was darauf hindeutet, dass die Ligandenbindung zur Aufrechterhaltung der strukturellen Stabilität von FLVCR1 beitrug. Die RMSF-Analyse (Abbildung 7B) zeigte, dass die meisten Reste während der gesamten Simulation nur geringe Schwankungen aufwiesen, was auf die Erhaltung der Gesamtintegrität des Proteins hinweist, während mehrere flexible Regionen Schleifenbereiche darstellen könnten, die an der Ligandenaufnahme beteiligt sind. Zudem deuten stabile Rg- und SASA-Profile (Abbildung 7C,D) darauf hin, dass der Komplex eine kompakte Konformation beibehielt, ohne offensichtliche strukturelle Expansion oder Änderungen in der Lösungsmittelzugänglichkeit. Die Wasserstoffbrückenanalyse (Abbildung 7E) ergab, dass der FLVCR1–(+)-Gallocatechin-Komplex persistente intermolekulare Wechselwirkungen aufrechterhielt, wobei während der Simulation etwa 3–4 Wasserstoffbrücken gebildet wurden, was die Stabilität der Ligand–Protein-Assoziation unterstützt. Die MM/GBSA-Analyse zeigte weiterhin, dass der FLVCR1–(+)-Gallocatechin-Komplex eine günstige Bindungsenergie aufwies (ΔGtotal = −34,87 ± 4,13 kcal/mol) (Ergänzende Tabelle S6). Die Energiezerlegungsanalyse ergab, dass van-der-Waals-Wechselwirkungen (ΔVDWAALS = −46,34 ± 2,16 kcal/mol) und elektrostatische Wechselwirkungen (ΔEelec = −14,09 ± 3,45 kcal/mol) die wesentlichen günstigen Beiträge zur Bindung darstellten, trotz des ungünstigen Beitrags der polaren Solvatisierungsenergie (ΔGsolvation = 25,55 ± 0,74 kcal/mol) (Ergänzende Tabelle S6). Insgesamt zeigten diese MD-Simulationsresultate, dass (+)-Gallocatechin einen stabilen Komplex mit FLVCR1 bildete und weiterhin die Zuverlässigkeit der dockingvorhergesagten Bindungsweise untermauerten.

Abbildung 7: Analyse der Molekulardynamik-Simulation des FLVCR1–(+)-Gallocatechin-Komplexes. (A) RMSD-Profile von apo-FLVCR1 und dem FLVCR1–(+)-Gallocatechin-Komplex während der 100 ns langen Molekulardynamik-Simulation. (B) RMSF-Profil, das schwankungen auf Ebene der Aminosäurereste von FLVCR1 während der Simulation zeigt. (C) SASA-Profil, das Änderungen der lösungsmittelzugänglichen Oberfläche des FLVCR1–(+)-Gallocatechin-Komplexes darstellt. (D) Rg-Profil zur Bewertung der Kompressibilität des FLVCR1–(+)-Gallocatechin-Komplexes während der Simulation. (E) Wasserstoffbrückenanalyse, die dynamische intermolekulare Wechselwirkungen zwischen FLVCR1 und (+)-Gallocatechin über den gesamten Simulationszeitraum hinweg zeigt. Abkürzungen: FLVCR1 = feline Leukämievirus-Subgruppe-C-Rezeptor 1; RMSD = Root-Mean-Square-Abweichung; RMSF = Root-Mean-Square-Fluktuation; SASA = lösungsmittelzugängliche Oberfläche; Rg = Trägheitsradius. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.
Datenverfügbarkeit:
Die in dieser Studie analysierten öffentlich zugänglichen transkriptomischen Datensätze können über die Gene Expression Omnibus (GEO) unter den Zugangsnummern GSE44270, GSE7890 und GSE163973 abgerufen werden. Die in dieser Studie generierten Rohdaten sowie die den experimentellen Validierungen zugrundeliegenden Daten, einschließlich qRT-PCR-Messungen, Original-Western-Blot-Bilder und Western-Blot-Quantifizierungsdaten, sind als ergänzende Abbildung S1, ergänzende Tabelle S1, ergänzende Tabelle S2, ergänzende Tabelle S3 und ergänzende Tabelle S4 bereitgestellt. Die Ergebnisse der molekularen Docking-Analysen sowie die MM/GBSA-Bindungsenergiedaten sind ebenfalls in ergänzender Tabelle S5 und ergänzender Tabelle S6 enthalten.
Ergänzende Abbildung S1: Ursprüngliche Daten der Westernblot-Analyse.Bitte klicken Sie hier, um diese Datei herunterzuladen.
Ergänzende Tabelle S1: Gene im Zusammenhang mit dem Hämstoffwechsel.Bitte klicken Sie hier, um diese Datei herunterzuladen.
Ergänzende Tabelle S2: Primersequenzen ausgewählter Gene. Bitte klicken Sie hier, um diese Datei herunterzuladen.
Ergänzende Tabelle S3: Maschinelle Lernverfahren zur Identifizierung potenzieller diagnostischer Biomarker bei Keloid. Bitte klicken Sie hier, um diese Datei herunterzuladen.
Ergänzungstabelle S4: Rohdaten zur Unterstützung der experimentellen Validierung von FLVCR1 Expression Bitte klicken Sie hier, um diese Datei herunterzuladen.
Ergänzungstabelle S5: Die 20 besten Kandidatenverbindungen, identifiziert durch molekulares Docking mit FLVCR1.Bitte klicken Sie hier, um diese Datei herunterzuladen.
Ergänzungstabelle S6: MM/GBSA-Bindungsenergieanalyse des FLVCR1–(+)-Gallocatechin-Komplexes.Bitte klicken Sie hier, um diese Datei herunterzuladen.