In overeenstemming met de Maatregelen voor Ethische Beoordeling van Levenswetenschappelijk en Medisch Onderzoek met Menselijke Proefpersonen, die op 18 februari 2023 in China zijn uitgevaardigd, kan onderzoek met publiek beschikbare gegevens voldoen aan de criteria voor vrijstelling van ethische beoordeling. Deze studie gebruikte uitsluitend openbaar toegankelijke, gedeïdentificeerde secundaire transcriptomische gegevens en betrof geen nieuwe menselijke participatie, menselijke monsterverzameling of dierproeven. Daarom was aanvullende institutionele ethische goedkeuring niet vereist. In deze studie werden geen dierproeven uitgevoerd. Daarom was goedkeuring van de institutionele commissie voor dierenverzorging en -gebruik niet van toepassing.
Gegevensbronnen voor endoplasmatisch reticulum-stressgerelateerde genen bij atriumfibrilleren
In deze studie werden openbaar beschikbare AF-gerelateerde transcriptomische datasets opgehaald uit de GEO-database, waaronder GSE41177, GSE79768, GSE115574, GSE14975 en GSE165838. Gedetailleerde informatie over de GSE-datasets is te vinden in Aanvullend Bestand 1—Aanvullende Tabel S1. GSE41177 en GSE79768 werden gebruikt om de geïntegreerde bulk transcriptomic trainingscohort samen te stellen, terwijl GSE115574 en GSE14975 als twee onafhankelijke externe validatiecohorten werden gebruikt. GSE165838 werd gebruikt voor single-cell transcriptomische analyse. Omdat deze datasets op verschillende platforms zijn gegenereerd en kunnen verschillen in weefselbron, klinische achtergrond en monstersamenstelling, werd elke dataset afzonderlijk voorbewerkt op basis van de platformkenmerken vóór integratie of validatie. Batch-effectcorrectie werd vervolgens uitgevoerd met het sva R-pakket voor de samengevoegde trainingscohort. De stressgerelateerde genset van het endoplasmatisch reticulum werd uit de GeneCards-database gehaald met een relevantiescore ≥ 3 en vormde na deduplicatie de doelgenenlijst die in deze studie werd gebruikt.
Analyse van differentieel tot expressie gebrachte genen
Na datastandaardisatie en normalisatie werd het R-pakket limma gebruikt om differentieel tot expressie gedrukte genen (DEGs) in de geïntegreerde trainingsset te identificeren. DEG's werden gedefinieerd met de volgende significantiecriteria: valse ontdekkingsfrequentie-aangepaste P-waarde (adj. P.Val) < 0.05 en |log2FC| > 0,58510. Om de expressiepatronen van LEG's te visualiseren, werden vulkaangrafieken en heatmaps gegenereerd met respectievelijk de ggplot2- en pheatmap-pakketten.
WGCNA-analyse
Om potentiële mechanismen van gecoördineerde genregulatie te verduidelijken, de associatiepatronen tussen co-expressiemodules en klinische eigenschappenvariabelen te definiëren, en kernbiomarkers of therapeutische doelen met translationeel potentieel te identificeren, werd WGCNA toegepast11.
Er werd een gewogen co-expressienetwerk opgebouwd met behulp van het WGCNA-pakket in R. De zachte drempelkracht (β) werd geselecteerd volgens het criterium van de schaalvrije topologie; de overeenkomstige β waarde werd gekozen voor latere analyses wanneer de schaalvrije topologie-fitindex (R2) 0,8512 bereikte en boven bleef staan. Tijdens module-identificatie werden parameters gerelateerd aan dynamisch boomkappen en moduledetectiegevoeligheid geoptimaliseerd om modulegrensresolutie en stabiliteit te verbeteren. Ten slotte werden modules die significant geassocieerd zijn met het doeltrait geëxtraheerd en werden intramodulaire hubgenen geïdentificeerd als kandidaatgensets voor downstream-analyses.
Verrijkingsanalyse van AF-gerelateerde DEG's
Om hubgenen precies te identificeren, werden de DEG's eerst gekruist met genen uit de belangrijkste WGCNA-modules om een set genen te definiëren die betrokken zijn bij AF-pathogenese. Vervolgens werd deze AF-genset verder gekruist met ERS-gerelateerde genen, en de resulterende overlappende genen werden behouden voor latere analyses.
De functionele verrijking van de gescreende genen werd geëvalueerd met behulp van Gene Ontology (GO) en Kyoto Encyclopedia of Genes and Genomes (KEGG) analyses. GO-termen werden geanalyseerd met het R-pakket clusterProfiler om verrijking samen te vatten over biologische processen (BP), cellulaire componenten (CC) en moleculaire functie (MF) categorieën13. KEGG-analyse werd vervolgens gebruikt om verrijkte routes te identificeren die geassocieerd zijn met de doelgenen14. Verrijkingsresultaten met een aangepaste P-waarde < 0,05 werden als statistisch significant beschouwd. De leidende GO-termen en KEGG-paden werden weergegeven als staafdiagrammen en bubbelplots met behulp van ggplot2.
Eiwit-eiwitinteractie (PPI) analyse
PPI-analyse werd uitgevoerd door de gekruiste genset te uploaden naar de STRING-database, waarbij het organisme beperkt bleef tot Homo sapiens. Losgekoppelde knooppunten werden verwijderd en interacties werden teruggevonden met een middelmatige betrouwbaarheidsscore drempel (gecombineerde score ≥ 0,4). Het resulterende PPI-netwerk werd vervolgens geïmporteerd in een netwerkvisualisatie- en analysetool voor topologische analyse om belangrijke knooppunten te identificeren.
Constructie van een kandidaat AF-ERS classificatiemodel gebaseerd op 12 machine learning-algoritmen
In deze studie werd een ensemble-classificatiekader ontwikkeld op basis van twaalf conventionele machine learning-algoritmen om ERS-gerelateerde kandidaat-signaturgenen geassocieerd met AF te screenen en de classificatieprestaties te optimaliseren. Voor datapartitionering werden na standaardisatie en normalisatie GSE41177 en GSE79768 samengevoegd om de trainingscohortexpressiematrix te genereren. GSE115574 werd gebruikt als een onafhankelijke externe validatiecohort om de generaliseerbaarheid van modellen te evalueren. Specifiek werden DEG's voor het eerst geïdentificeerd in de trainingscohort (|log2FC| >0,585, aangepast p < 0,05). Deze DEG's werden vervolgens gekruist met genen van de belangrijkste WGCNA-modules en ERS-gerelateerde genen, en de resulterende genset werd gebruikt als invoer voor modelconstructie.
Om ERS-gerelateerde genen te koppelen aan het AF-fenotype, werd een kandidaatclassificatiemodel ontwikkeld met 12 machine learning-benaderingen: Lasso, Ridge, stapsgewijs gegeneraliseerd lineair model (Stepglm), extreme gradient boosting (XGBoost), random forest (RF), elastisch net (Enet), gedeeltelijke least squares regressie voor gegeneraliseerde lineaire modellen (plsRglm), gegeneraliseerde boosted regressiemodellering (GBM), naïeve Bayes, lineaire discriminantenanalyse (LDA), glmBoost, en ondersteuningsvectormachine (SVM). Een systematische combinatorische modelleringsstrategie werd toegepast door een tweede algoritme toe te voegen aan het eerste en deze te integreren via de afstemmingsparameter α, wat resulteerde in 113 combinaties van featureselectie en modelfitting die uitgebreid werden geëvalueerd. Modeldiscriminatie werd beoordeeld door het oppervlak onder de receiver operating characteristic curve (AUC) te berekenen. Volgens eerder gerapporteerde modelselectiecriteria werd het uiteindelijke kandidaatraamwerk gedefinieerd als het model met de beste algehele prestaties, beoordeeld door het gemiddelde AUC over de trainings- en validatiecohorten.
Deze combinatorische modelleringsstrategie is gebaseerd op eerdere studies in biomedisch machine learning 15,16,17. Gezamenlijk geven deze studies aan dat geen enkel algoritme consequent beter presteert dan anderen op het gebied van datasets en analytische taken. Op basis van dit uitgangspunt kan het toepassen van een ensemble-leer- en combinatorisch modelleringskader de kans vergroten om een hoogpresterende kandidaatmodel met stabielere generaliseerbaarheid te verkrijgen en de robuustheid van modelselectie te verbeteren.
Vervolgens werden SHapley Additive exPlanations (SHAP) waarden toegepast om het machine learning-model te interpreteren door de belangrijkste kenmerken die AF-classificatie aansturen te visualiseren, waardoor de bijdrage van elk kenmerk aan het voorspelde resultaat wordt gekwantificeerd en wordt geïllustreerd hoe individuele signatuurgenen de uiteindelijke modeloutput18 beïnvloeden.
Evaluatie van modelprestaties en externe validatie van het optimale model
De prestaties van het optimale model werden geëvalueerd in de trainingscohort en in de onafhankelijke externe validatiecohort (GSE115574). Op modelniveau werd een verwarringsmatrix geconstrueerd op basis van de voorspelde klassenlabels, en werden de bijbehorende classificatiemetrics gerapporteerd. Receiver operating characteristic (ROC) curves werden gegenereerd met behulp van het R-pakket pROC, en de AUC werd berekend om discriminatieprestaties te kwantificeren.
Op biomarkerniveau werden enkel-gen ROC-curves uitgezet voor elk sleutelgen in het optimale model, en werden de bijbehorende AUC's berekend om hun individuele discriminatievermogen te beoordelen. Daarnaast werd differentiële expressie van de sleutelgenen samengevat met behulp van een vulkaangrafiek, en werden boxplots gebruikt om hun expressieverdeling in ziekte- versus gezonde steekproeven weer te geven. Om de generaliseerbaarheid van de eerder gedefinieerde optimale, modelafgeleide gensignatur verder te evalueren, werd een aanvullende onafhankelijke externe validatie uitgevoerd met behulp van GSE14975. GSE14975 bevat transcriptomische gegevens van monsters van het linker atrium, waaronder vijf atriumfibrilleringsmonsters en vijf sinusritme-/controlemonsters. Alle genen die in de vergrendelde handtekening waren opgenomen, waren beschikbaar in deze dataset. Om consistentie te behouden met de oorspronkelijke cross-cohort analytische workflow, werden de ontwikkelingscohort en GSE14975 geharmoniseerd met ComBat en de datasetbron als batchvariabele. Deze harmonisatie werd op ongecontroleerde wijze uitgevoerd. Belangrijk is dat ziekte-/controlelabels van GSE14975 niet werden gebruikt voor featureselectie, coëfficiëntenschatting, drempelbepaling of hyperparameterafstemming.
Het optimale, op model gebaseerde scoremodel werd alleen met de ontwikkelingscohort aangepast en vervolgens toegepast op GSE14975 voor externe validatie. De modelprestaties in GSE14975 werden beoordeeld met behulp van een analyse van de ontvanger-bedrijfskenmerken, oppervlakte onder de curve, 95% betrouwbaarheidsinterval (BI), gevoeligheid, specificiteit, nauwkeurigheid, positieve en negatieve voorspellende waarden en Brier-score. Daarnaast werden enkel-gen ROC-curves gegenereerd voor alle optimale modelafgeleide genen in GSE14975 om hun individuele discriminatievermogen te illustreren. Om mogelijke overfitting in de ontwikkelingscohort verder te beoordelen, werden herhaalde 10-voudige kruisvalidatie en bootstrap-optimismecorrectie uitgevoerd met behulp van de gensignatur afgeleid van het vergrendelde optimale model. Voor herhaalde kruisvalidatie werd de ontwikkelingscohort herhaaldelijk opgedeeld in 10 vouwen, en werd modeldiscriminatie samengevat over alle iteraties. Voor bootstrap-validatie werden 1.000 bootstrap-resamples gegenereerd om het optimisme van de schijnbare development-set-prestaties te schatten en om de optimisme-gecorrigeerde AUC te berekenen. Omdat de uiteindelijke signatuur afkomstig was van het optimale model, werd de bijdrage van elk gen voornamelijk geïnterpreteerd op basis van de absolute grootte en richting van de modelcoëfficiënten. Daarnaast werden in GSE14975 enkel-gen ROC-analyses uitgevoerd om het individuele discriminatievermogen van elk componentgen te illustreren. Voor visualisatiedoeleinden waren enkel-gen ROC-curves zo georiënteerd dat ze discriminerende vaardigheid weerspiegelden, ongeacht of hogere of lagere expressie geassocieerd was met AF.
Analyse van genensetverrijking (GSEA)
Om de functionele implicaties van de sleutelgenen te onderzoeken, werd GSEA uitgevoerd met behulp van monsters uit ziektegroep19. Voor elk sleutelgen werden de steekproeven gestratificeerd in subgroepen met hoge en lage expressie, waarbij de mediane expressiewaarde in de ziektegroep de grens vormde. Het gemiddelde expressieverschil tussen de twee subgroepen voor elk gen werd berekend, en er werd een gerangschikte genenlijst in aflopende volgorde gegenereerd als input voor verrijkingsanalyse. GSEA werd uitgevoerd met behulp van het R-pakket clusterProfiler, met gensets verkregen uit de MSigDB-collectie c2.cp.kegg.Hs.symbols.gmt. Statistische significantie werd gedefinieerd als p < 0,05. De richting van verrijking werd bepaald door het teken van de genormaliseerde verrijkingsscore (NES), en verrijkingsplots werden gegenereerd voor representatieve paden.
Beoordeling van subtype-subtyp-abundantie van immuuncellen en differentiële expressie
Het CIBERSORT-deconvolutie-algoritme werd toegepast om de relatieve abundantie van infiltrerende immuuncel-subsets en hun onderlinge relaties tussen monsters te schatten. Op basis van de LM22-leukocytenhandtekeningmatrix werd de samenstelling van immuuncellen kwantitatief afgeleid uit genexpressieprofielen met behulp van het R-pakket CIBERSORT20. Een drempel van p < 0,05 werd gebruikt om de resultaten te filteren, en alleen monsters die aan dit criterium voldeden, werden behouden voor latere analyses. Er werden boxplots gegenereerd om de geschatte relatieve fracties van immuuncel-subsets tussen de AF- en controlegroepen te vergelijken. Daarnaast werd Spearmans correlatieanalyse uitgevoerd om associaties te beoordelen tussen infiltratieniveaus van immuuncellen en hubgenexpressie.
Enkelcelanalyse
Single-cell transcriptomische analyse werd uitgevoerd met behulp van de GEO-dataset GSE165838. Ruwe genceltellingmatrices werden geïmporteerd in R en verwerkt met Seurat v4.4.0. Voor elk monster werd een Seurat-object gegenereerd met CreateSeuratObject met min.cells = 5 en min.features = 300. Kwaliteitscontrole-metrics, waaronder het aantal gedetecteerde genen, het totale aantal unieke moleculaire identificaties (UMI), het percentage mitochondriale genen, het percentage ribosomale genen en het percentage hemoglobinegenen, werden voor elke cel berekend. Cellen werden behouden als ze meer dan 500 gedetecteerde genen hadden, minder dan 5.000 UMI-tellingen, het mitochondriale genpercentage < 25%, het ribosomale genpercentage > 3% en het hemoglobinegenpercentage < 1%. Genen die in minder dan drie cellen werden aangetroffen, werden verwijderd. MALAT1 en mitochondriale genen werden ook uitgesloten vóór downstream analyse. DoubletFinder werd gebruikt om potentiële doublets te detecteren en uit te sluiten. Kort gezegd werden cellen gesplitst op monsteridentiteit, en werd de dubbeldetektion afzonderlijk uitgevoerd voor elk monster met behulp van hoofdcomponenten 1–30.
De pN-parameter werd ingesteld op 0,25, en de optimale pK-waarde werd geselecteerd volgens de maximale BC-metriek verkregen uit parametersweeping. Het verwachte dubbelingspercentage werd geschat op basis van het aantal teruggevonden cellen in elk monster, met percentages van respectievelijk 2,5%, 5% en 6,5% voor monsters met relatief lage, intermediaire en hoge celaantallen. Alleen cellen die als singlets werden geclassificeerd, werden behouden. De verontreiniging van omgevings-RNA werd verder geschat met DecontX, en cellen met een contaminatiescore ≥ 0,2 werden uitgesloten. Na kwaliteitscontrole, dubbelverwijdering en omgevings-RNA-filtering werden 40.886 cellen en 23.947 genen behouden voor downstream analyse. De gefilterde single-cell dataset werd genormaliseerd met de LogNormalize-methode met een schaalfactor van 10.000, gevolgd door identificatie van zeer variabele genen. De gegevens werden vervolgens opgeschaald voordat de hoofdcomponentanalyse plaatsvond.
Om sample-specifieke batcheffecten te verminderen, werd Harmony toegepast met orig.ident als batchvariabele. Uniform Manifold Approximation and Projection (UMAP) visualisatie en het bouwen van dichtstbijzijnde buurgrafen werden uitgevoerd met behulp van de eerste 15 door Harmony gecorrigeerde dimensies21. Clustering werd uitgevoerd met het Louvain-algoritme en meerdere clusteringresoluties werden geëvalueerd. De laatste grote celtype-annotatie was gebaseerd op het clusteringsresultaat bij resolutie 0,05. Celclusters werden handmatig geannoteerd volgens canonieke marker-genexpressie. Deze marker-gebaseerde annotatiestrategie is consistent met eerdere enkelcel-immunoprofielstudies22. T-cellen werden geïdentificeerd door CD3D, CD3E en TRAC; natuurlijke doder (NK) cellen door NKG7, GNLY, NCAM1 en KLRG1; monocyt-macrofagen cellen door LYZ, CD14, FCGR3A, CD68, CD163, FCN1, TYROBP, S100A8 en S100A9; B-cellen door MS4A1 en CD79A; plasmacellen door MZB1 en XBP1; endotheelcellen door PECAM1, VWF en CDH5; vaatvormige gladde spiercellen door ACTA2, TAGLN, MYH11 en MYL9; fibroblasten door DCN, LUM, COL1A1, COL1A2 en PDGFRA; neutrofielachtige cellen door FCGR3B, CXCR2, S100A8 en MPO; mastcellen door TPSB2; en dendritische cellen door LILRA4, CD1C en XCR1. Marker-genexpressie over clusters werd visualiseerd met dot plots, en de expressieverdeling van de uiteindelijke ERS-gerelateerde hubgenen werd weergegeven op UMAP embeddings.
Om ERS-gerelateerde transcriptieactiviteit op enkelcelniveau te kwantificeren, werd de uiteindelijke hub-genset gebruikt om celgewijze signaturescores te berekenen met behulp van AUCell, single-sample genset-verrijkingsanalyse en Seurat AddModuleScore. Voor AUCell werden celranglijsten opgesteld uit de genormaliseerde RNA-expressiematrix, en AUC-scores werden berekend met behulp van de hub-genset waarbij de top 10% van de gerangschikte genen de maximale rangschikkingsdrempel was. Voor ssGSEA werden verrijkingsscores berekend met behulp van het GSVA-pakket. De drie score-uitkomsten werden gecentreerd en geschaald, vervolgens min-max genormaliseerd, en uiteindelijk opgeteld om een geïntegreerde ERS-gerelateerde samengestelde score voor elke cel te genereren. De verdeling van de samengestelde score werd vergeleken over geannoteerde celpopulaties om de celtype-heterogeniteit van het ERS-gerelateerde programma te evalueren. Omdat de monoocyt-macrofagen lijn een prominente ERS-gerelateerde signatuurverrijking vertoonde en nauw geassocieerd was met immuun-inflammatoire remodeling, werd deze geselecteerd voor latere analyses binnen de lijn. Monocyt-macrofagen cellen werden verdeeld in groepen met hoge en lage scores volgens de mediane ERS-gerelateerde samengestelde score. Vervolgens werd een pseudotijdtrajectanalyse uitgevoerd op monocyt-macrofagen cellen met behulp van een monocle.
Voor pseudotime-analyse werd een CellDataSet-object gemaakt uit de ruwe telmatrix met behulp van een negatief binomiaal expressiemodel. Groottefactoren en spreidingen werden vervolgens geschat. Ordeninggenen werden geselecteerd met een gemiddelde expressiedrempel van ≥ 0,1 en empirische dispersie groter dan de gepasseerde dispersie. De dimensionaliteit werd verminderd met het DDRTree-algoritme en de cellen werden geordend langs de afgeleide traject. De dynamische expressiepatronen van ERS-gerelateerde hubgenen langs pseudotime werden gevisualiseerd. Een cel-cel communicatieanalyse werd uitgevoerd met CellChat om potentiële ligand-receptorinteracties te onderzoeken waarbij monocyt-macrofagen met verschillende ERS-gerelateerde scores betrokken zijn. Voor deze analyse werden monocyt-macrofagen gelabeld als high-score of low-score volgens de mediane composietscore, terwijl andere cellen hun oorspronkelijke celtypelabels behielden. De genormaliseerde RNA-expressiematrix en de bijbehorende celgroepannotaties werden gebruikt om het CellChat-object te creëren. Voor cel-cel communicatieanalyse werd de menselijke CellChatDB-database geselecteerd en werden alleen secreted signaling interactions geëvalueerd. Overexpressieve genen en ligand-receptorparen werden gedetecteerd voordat de communicatiekansen werden berekend. Celgroepen met minder dan 10 cellen werden uitgesloten van de interactie-analyse. Communicatiekansen op padniveau werden vervolgens geschat en samengevoegd om het aantal en de sterkte van interacties tussen celpopulaties te vergelijken. Om reproduceerbaarheid te vergemakkelijken, wordt hieronder een checkpointtabel gegeven die elke protocolstap koppelt aan de bijbehorende verwachte outputfiguur of tabel (Aanvullend Bestand 1—Aanvullende Tabel S2).