Screening naar kandidaat diagnostische biomarkers voor keloïd met behulp van een machine learning-algoritme
In totaal werden 283 genen die gerelateerd zijn aan het heemmetabolisme in deze studie opgenomen. Differentieel expressieanalyse van de GSE44270-dataset, waarbij keloïd- en normale huidweefsels werden vergeleken, identificeerde 25 significant differentieel tot expressie gebrachte genen (Figuur 1A en Aanvullende Tabel S3). Om verder te screenen op ziekte-geassocieerde biomarkers, identificeerde LASSO-regressie 9 kandidaatgenen (Figuur 1B,C en Aanvullende Tabel S3), terwijl het random forest (RF)-algoritme 11 genen selecteerde met een hoge voorspellende waarde (Figuur 1D en Aanvullende Tabel S3). De overlap tussen de LASSO- en RF-resultaten werd gevisualiseerd met een Venn-diagram, wat resulteerde in zes kernbiomarkers, namelijk FLVCR1, TMCC2, EIF2AK1, XK, HPX en KEL (Figuur 1E en Aanvullende Tabel S3). Receiver operating characteristic (ROC)-analyse in de GSE44270-cohort toonde een gunstige diagnostische prestatie aan voor alle zes biomarkers, met AUC-waarden van 0,8016 voor FLVCR1, 0,7063 voor TMCC2, 0,7817 voor EIF2AK1, 0,7460 voor XK, 0,7500 voor HPX en 0,7857 voor KEL (Figuur 1F). Op basis van deze zes biomarkers werd vervolgens een diagnostisch nomogram voor keloïd geconstrueerd met behulp van het rms-pakket in R (Figuur 1G).

Figuur 1: Identificatie van kandidaatgenen gerelateerd aan het heemmetabolisme die geassocieerd zijn met keloïden met behulp van machine-learning-algoritmen. (A) Boxplot die de differentiële expressie van genen gerelateerd aan het heemmetabolisme illustreert tussen keloïd- en normaal weefsel. (B,C) LASSO logistieke regressieanalyse voor het screenen van kandidaatdiagnostische markers. (D) Kandidaatbiomarkers geselecteerd door het RF-algoritme. (E) Venn-diagram dat de overlappende genen toont die door de twee machine-learning-algoritmen zijn geïdentificeerd. (F) ROC-curve-analyse ter evaluatie van de diagnostische prestaties van de kandidaatbiomarkers. (G) Nomogram voor de voorspelling van keloïden op basis van de zes-genen-signatuur. Afkortingen: LASSO, least absolute shrinkage and selection operator; RF, random forest; ROC, receiver operating characteristic. Statistische significantie: ns, P > 0,05; *, P < 0,05; **, P < 0,01; ***, P < 0,001; en ****, P < 0,0001. Klik hier om een grotere versie van deze figuur te bekijken.
De predictieve prestatie van het diagnostische nomogram werd beoordeeld in zowel de trainingscohort (GSE44270) als de validatiecohort (GSE7890). Het model vertoonde een uitstekende diagnostische nauwkeurigheid, met respectievelijk AUC-waarden van 0,984 (95% CI: 0,950–1,000) en 0,922 (95% CI: 0,806–1,000) (Figuur 2A,D). Om de robuustheid en potentiële overfitting van de diagnostische handtekening van zes genen verder te evalueren, werden aanvullende interne validatieanalyses uitgevoerd in de discovery-cohort (GSE44270). Een vijfvoudige kruisvalidatie toonde een consistente discriminatieve prestatie over de subsets aan, met een gemiddelde AUC van 0,925, wat aangeeft dat het model een stabiele classificatieprestatie behield ondanks variaties in de trainingsmonsters. Bovendien leverde bootstrap-validatie met 1.000 resampled iteraties een gemiddelde AUC op van 0,930 (95% CI: 0,794–1,000). Na correctie voor potentieel optimisme veroorzaakt door de beperkte steekproefomvang bleef de optimisme-gecorrigeerde AUC 0,930, wat suggereert dat de diagnostische prestatie van de handtekening van zes genen relatief stabiel was na interne validatie. Daarnaast suggereerde een decision curve analysis (DCA) dat het nomogram een hoger potentieel netto voordeel vertoonde dan alternatieve diagnostische strategieën over een reeks drempelwaarschijnlijkheden, hoewel deze bevindingen met voorzichtigheid moeten worden geïnterpreteerd gezien de beperkte steekproefomvang (Figuur 2B,E). Daarnaast vertoonden keloidmonsters significant hogere risicoscores dan gezonde controles in zowel de trainings- als de validatiecohort (Figuur 2C,F), wat de stabiliteit en betrouwbaarheid van het diagnostische model verder aantoont.

Figuur 2: Validatie van het nomogram voor de voorspelling van keloïden. (A) ROC-curve die de voorspellende prestatie van het nomogram in de GSE44270-dataset evalueert. (B) DCA die het klinische nut van het nomogram in GSE44270 evalueert. (C) Risicoscoreverdeling waarbij keloïd- en gezonde monsters in GSE44270 worden vergeleken. (D) ROC-curve die de voorspellende prestatie van het nomogram in de onafhankelijke GSE7890-dataset evalueert. (E) DCA die het klinische nut van het nomogram in GSE7890 evalueert. (F) Risicoscoreverdeling waarbij keloïd- en gezonde monsters in GSE7890 worden vergeleken. Afkortingen: ROC = receiver operating characteristic; DCA = decision curve analysis. Klik hier om een grotere versie van deze figuur te bekijken.
Diagnostische biomarkers zijn geassocieerd met de immuunkenmerken van keloïd
Om de relatie tussen de zes diagnostische biomarkers en de immuunmicro-omgeving te onderzoeken, werd een correlatieanalyse uitgevoerd om de associaties tussen biomarker-expressie en immuuncelinfiltratie te beoordelen. De resultaten onthulden dat alle zes biomarkers significant geassocieerd waren met meerdere infiltrerende immuuncelpopulaties (Figuur 3A). Specifiek was de expressie van FLVCR1 negatief geassocieerd met T-folliculaire helpercellen (Figuur 3B). TMCC2 vertoonde positieve correlaties met natural killer-cellen en geactiveerde dendritische cellen, terwijl het negatief correleerde met onrijpe dendritische cellen en onrijpe B-cellen (Figuur 3C–F). Daarnaast was de expressie van EIF2AK1 negatief geassocieerd met CD56dim natural killer-cellen (Figuur 3G), terwijl XK negatief geassocieerd was met eosinofielen (Figuur 3H).

Figuur 3: Correlatie tussen kandidaatgenen gerelateerd aan het heemmetabolisme en immuuncelinfiltratie. (A) Heatmap die de correlaties tussen kandidaatgenen en immuuncelpopulaties weergeeft. Rood geeft positieve correlaties aan, terwijl blauw negatieve correlaties aangeeft. (B). Correlatie tussen FLVCR1-expressie en T-folliculaire helpercellen. (C-F) Correlaties tussen TMCC2-expressie en respectievelijk natural killer-cellen, geactiveerde dendritische cellen, onrijpe dendritische cellen en onrijpe B-cellen. (G) Correlatie tussen EIF2AK1-expressie en CD56dim natural killer-cellen. (H). Correlatie tussen XK-expressie en eosinofielen. Afkortingen: FLVCR1 = feline leukemia virus subgroup C receptor 1; TMCC2 = transmembrane and coiled-coil domains 2; EIF2AK1 = eukaryotic translation initiation factor 2 alpha kinase 1; CD56dim = cluster of differentiation 56 dim. Klik hier om een grotere versie van deze figuur te bekijken.
Analyse van transcriptoomgegevens van enkelcellen
Om de expressiepatronen van de geïdentificeerde diagnostische biomarkers binnen de keloid-micro-omgeving te karakteriseren, hebben we de single-cell RNA-sequencing dataset GSE163973 geanalyseerd. Na kwaliteitscontrole en data-integratie bleven er 21.488 hoogwaardige cellen over voor verdere analyses. Cellen met minder dan 200 of meer dan 6.000 totale unieke moleculaire identificatie (UMI)-counts werden uitgesloten, en potentiële doubletten werden geïdentificeerd en verwijderd met behulp van het DoubletDetection-pakket. De 2.000 genen met de grootste expressievariabiliteit werden geselecteerd, gevolgd door dimensionaliteitsreductie en visualisatie met Uniform Manifold Approximation and Projection (UMAP). Er werden in totaal 10 belangrijke celpopulaties geïdentificeerd, waaronder endotheelcellen, fibroblasten, spiervezels, keratinocyten, immuuncellen, lymfatische endotheelcellen, kliercellen, neurale cellen, melanocyten en een niet-geclassificeerde celpopulatie (Figuur 4A,B). Expressieprofilering onthulde duidelijke celtype-specifieke distributiepatronen van de diagnostische biomarkers. FLVCR1 werd voornamelijk tot expressie gebracht in endotheelcellen en melanocyten, terwijl EIF2AK1 een relatief hoge expressie vertoonde in neurale cellen, kliercellen en fibroblasten. HPX was primair verrijkt in melanocyten, terwijl KEL een predominante expressie vertoonde in kliercellen (Figuur 4C,D).

Figuur 4: Distributie van diagnostische biomarkers gerelateerd aan het heemmetabolisme in het single-cell transcriptoom van keloïden. (A) UMAP-plot die 21 celclusters toont bestaande uit 21.488 cellen uit keloïdmonsters. (B) Annotaties van celtypen gebaseerd op de annotaties gerapporteerd in de oorspronkelijke studie. (C) Feature-plots die de expressie van diagnostische biomarkers gerelateerd aan het heemmetabolisme over verschillende celtypen tonen. (D) Bubble-plot die de gemiddelde expressieniveaus en percentages cellen tonen die de diagnostische biomarkers gerelateerd aan het heemmetabolisme over verschillende celtypen tot expressie brengen. Afkorting: UMAP = uniform manifold approximation and projection. Klik hier om een grotere versie van deze figuur te bekijken.
Identificatie en interactienetwerkanalyse van kandidaat diagnostische biomarkers
Om de regulatiemechanismen ten grondslag aan de kandidaat-diagnostische biomarkers te onderzoeken, is een miRNA–mRNA-regulatienetwerk geconstrueerd. Om de betrouwbaarheid van de voorspelde interacties te verbeteren, werden overlappende miRNA's geïdentificeerd die zich richten op de kandidaat-biomarkers. In totaal werden 282 miRNA's verkregen die interageren met de zes diagnostische biomarkers, en het resulterende regulatienetwerk wordt getoond in Figuur 5. Opvallend is dat hsa-miR-34a-5p, hsa-let-7a-5p, hsa-let-7d-5p, hsa-let-7e-5p en hsa-miR-26b-5p voorspeld werden om gelijktijdig alle zes kandidaat-biomarkers te reguleren.

Figuur 5: miRNA-regulerend netwerk van diagnostische biomarkers gerelateerd aan het heemmetabolisme.Het netwerk illustreert de regulerende relaties tussen de zes diagnostische biomarkergenen (FLVCR1, HPX, TMCC2, KEL, XK en EIF2AK1) en hun geassocieerde miRNA's. Geenknooppunten vertegenwoordigen de diagnostische biomarkers, terwijl de omringende knooppunten miRNA's vertegenwoordigen. Randen geven experimenteel ondersteunde miRNA-mRNA-interacties aan. Afkortingen: FLVCR1 = feline leukemia virus subgroup C receptor 1; HPX = hemopexine; TMCC2 = transmembrane and coiled-coil domains 2; KEL = Kell metallo-endopeptidase; XK = X-linked Kx blood group; EIF2AK1 = eukaryotic translation initiation factor 2 alpha kinase 1; miRNA = microRNA; mRNA = messenger RNA. Klik hier om een grotere versie van deze figuur te bekijken.
Experimentele validatie van FLVCR1-expressie en moleculaire docking-analyse van potentiële therapeutische verbindingen
Om de bioinformatische bevindingen te valideren en de functionele relevantie van het geïdentificeerde hubgen te bevestigen, hebben we de expressie van FLVCR1 in PKF en NHDF experimenteel beoordeeld. Zowel qRT-PCR- als western blot-analyses toonden consistent aan dat FLVCR1 significant was upgereguleerd in keloidfibroblasten vergeleken met normale controles (Figuur 6A–C, Aanvullende figuur S1 en aanvullende tabel S4). Deze verhoogde cellulaire expressie ondersteunt de potentiële betrokkenheid van FLVCR1-geassocieerde verstoringen in het heemmetabolisme bij de pathogenese van keloïden.
Gezien de mogelijke betrokkenheid van FLVCR1 bij immuunveranderingen geassocieerd met het heemmetabolisme, hebben we vervolgens gezocht naar potentiële therapeutische verbindingen die FLVCR1 direct konden targeten om deze pathogene as te onderbreken. Er werd high-throughput virtuele screening uitgevoerd met behulp van een bibliotheek met verbindingen uit de traditionele Chinese geneeskunde (TCM) en de voorbereide proteïnestructuur. De 20 verbindingen met de meest gunstige docking-scores werden geselecteerd voor verdere evaluatie (Supplemetaire Tabel S5). In het algemeen duidt een lagere bindingsenergie op een sterkere bindingsaffiniteit, en docking-energieën onder −5 kcal/mol worden beschouwd als indicatief voor stabiele ligand-proteïne-interacties. Onder de gescreende verbindingen vertoonden (+)-Gallocatechin, (−)-Epicatechin, (−)-Gallocatechin en Cyanidine (chloride) gunstige bindingsaffiniteiten voor FLVCR1. Opvallend was dat (+)-Gallocatechin de sterkste interactie met FLVCR1 vertoonde door vier waterstofbruggen te vormen met GLU214, ASN245, GLN246 en GLN471, wat wijst op een stabiele ligand-proteïne-bindingsmodus (Figuur 6D–G). Deze bevindingen markeren (+)-gallocatechin als een veelbelovende kandidaat voor mechanisme-gebaseerde therapeutische interventie gericht op FLVCR1.

Figuur 6: Experimentele validatie van FLVCR1-expressie en moleculaire docking van potentiële verbindingen gericht op FLVCR1. (A) Representatieve western blot-afbeeldingen die de expressie van het FLVCR1-eiwit in CON en keloïd tonen. GAPDH diende als ladingscontrole. (B) Kwantificatie van FLVCR1-eiwitniveaus genormaliseerd naar GAPDH. (C) Relatieve mRNA-expressieniveaus van FLVCR1 in CON- en keloïd-fibroblasten werden bepaald via qRT-PCR. GAPDH werd gebruikt als interne referentie. (D–G) Driedimensionale weergaven van de voorspelde bindingsmodi tussen FLVCR1 en geselecteerde kleine molecuulverbindingen: (D) (+)-Gallocatechine. (E) (-)-Epicatechine. (F) (-)-Gallocatechine. (G) Cyanidine (chloride). Afkortingen: FLVCR1 = feline leukemia virus subgroup C receptor 1; CON, controle; GAPDH, glyceraldehyde-3-fosfaatdehydrogenase; qRT-PCR, kwantitatieve reverse transcriptie polymerasekettingreactie; SD, standaarddeviatie. Gegevens worden weergegeven als het gemiddelde ± SD. Statistische significantie: ns, P > 0,05; *, P < 0,05; **, P < 0,01; ***, P < 0,001; en ****, P < 0,0001. Klik hier om een grotere versie van deze figuur te bekijken.
Bevestiging van de stabiliteit van het FLVCR1–(+)-Gallocatechin-complex met moleculaire dynamicasimulatie
Om de betrouwbaarheid van de voorspelde bindingsmodus van ligand–eiwit te onderzoeken, werd een moleculaire dynamicasimulatie (MD) uitgevoerd voor het FLVCR1–(+)-gallocatechin-complex. De analyse richtte zich op de vraag of het complex structureel stabiel bleef over de tijd en of ligandbinding het conformationele gedrag van het eiwit veranderde, gebruikmakend van RMSD, RMSF, gyratie-straal (Rg), SASA, waterstofbruganalyse en MM/GBSA-berekeningen. RMSD-analyse (Figuur 7A) liet zien dat zowel het apo-eiwit als het ligand-gebonden complex initiële fluctuaties vertoonden gedurende de eerste 20 ns, gevolgd door geleidelijke stabilisatie, wat aantoont dat de systemen tijdens de simulatie een evenwicht bereikten. Na equilibratie bleef de RMSD-waarde van het FLVCR1–(+)-gallocatechin-complex onder de 0.2 nm, wat suggereert dat ligandbinding bijdroeg aan het behoud van de structurele stabiliteit van FLVCR1. RMSF-analyse (Figuur 7B) toonde aan dat de meeste residuen beperkte fluctuaties vertoonden gedurende de gehele simulatie, wat wijst op het behoud van de algemene eiwitintegriteit, terwijl verschillende flexibele regio's mogelijk loop-regio's vertegenwoordigen die betrokken zijn bij de accommodatie van het ligand. Bovendien gaven stabiele Rg- en SASA-profielen (Figuur 7C,D) aan dat het complex een compacte conformatie behield, zonder evidente structurele expansie of veranderingen in de blootstelling aan het oplosmiddel. Waterstofbruganalyse (Figuur 7E) onthulde dat het FLVCR1–(+)-gallocatechin-complex persistente intermoleculaire interacties behield, waarbij ongeveer 3–4 waterstofbruggen werden gevormd tijdens de simulatie, wat de stabiliteit van de ligand–eiwitassociatie ondersteunt. MM/GBSA-analyse toonde verder aan dat het FLVCR1–(+)-gallocatechin-complex een gunstige vrije bindingsenergie vertoonde (ΔGtotal = −34.87 ± 4.13 kcal/mol) (Suppletaire Tabel S6). Energie-decompositieanalyse wees uit dat van der Waals-interacties (ΔVDWAALS = −46.34 ± 2.16 kcal/mol) en elektrostatische interacties (ΔEelec = −14.09 ± 3.45 kcal/mol) de belangrijkste gunstige bijdragers waren aan de binding, ondanks de ongunstige bijdrage van de polaire solvatatie-energie (ΔGsolvation = 25.55 ± 0.74 kcal/mol) (Suppletaire Tabel S6). Gezamenlijk demonstreerden deze MD-simulatieresultaten dat (+)-gallocatechin een stabiel complex vormde met FLVCR1 en ondersteunden ze verder de betrouwbaarheid van de via docking voorspelde bindingsmodus.

Figuur 7: Moleculaire dynamicasimulatie-analyse van het FLVCR1–(+)-Gallocatechin-complex. (A) RMSD-profielen van apo FLVCR1 en het FLVCR1–(+)-Gallocatechin-complex tijdens de 100 ns moleculaire dynamicasimulatie. (B) RMSF-profiel dat de fluctuaties op residuniveau van FLVCR1 tijdens de simulatie laat zien. (C) SASA-profiel dat veranderingen in het oplosmiddel-toegankelijke oppervlak van het FLVCR1–(+)-Gallocatechin-complex laat zien. (D) Rg-profiel dat de compactheid van het FLVCR1–(+)-Gallocatechin-complex tijdens de simulatie evalueert. (E) Waterstofbrug-analyse die de dynamische intermoleculaire interacties tussen FLVCR1 en (+)-Gallocatechin gedurende de simulatie laat zien. Afkortingen: FLVCR1 = feline leukemia virus subgroup C receptor 1; RMSD = root mean square deviation; RMSF = root mean square fluctuation; SASA = solvent-accessible surface area; Rg = straal van gyratie. Klik hier om een grotere versie van deze figuur te bekijken.
Beschikbaarheid van gegevens:
De publiek toegankelijke transcriptomische datasets die in deze studie zijn geanalyseerd, kunnen worden geraadpleegd via de Gene Expression Omnibus (GEO) onder de accession-nummers GSE44270, GSE7890 en GSE163973. De brondata die in deze studie zijn gegenereerd en ten grondslag liggen aan de experimentele validatie, waaronder qRT-PCR-metingen, originele western blot-afbeeldingen en kwantificeringsgegevens van de western blots, worden verstrekt als Aanvullende Figuur S1, Aanvullende Tabel S1, Aanvullende Tabel S2, Aanvullende Tabel S3 en Aanvullende Tabel S4. De resultaten van de moleculaire docking en de MM/GBSA-gegevens over de vrije bindingsenergie zijn eveneens opgenomen in Aanvullende Tabel S5 en Aanvullende Tabel S6.
Aanvullende Figuur S1: Originele gegevens van western blotting.Klik hier om dit bestand te downloaden.
Aanvullende tabel S1: Genen gerelateerd aan het heemmetabolisme.Klik hier om dit bestand te downloaden.
Aanvullende tabel S2: Primersequenties van geselecteerde genen. Klik hier om dit bestand te downloaden.
Aanvullende tabel S3: Machine-learningbenaderingen voor het identificeren van potentiële diagnostische biomarkers bij keloïden.Klik hier om dit bestand te downloaden.
Aanvullende tabel S4: Ruwe gegevens ter ondersteuning van de experimentele validatie van FLVCR1-expressie. Klik hier om dit bestand te downloaden.
Aanvullende tabel S5: Top 20 kandidaatverbindingen geïdentificeerd door moleculaire docking met FLVCR1.Klik hier om dit bestand te downloaden.
Aanvullende Tabel S6: MM/GBSA binding vrije-energie analyse van het FLVCR1–(+)-Gallocatechine complex.Klik hier om dit bestand te downloaden.