Ein Abonnement von JoVE ist erforderlich, um diesen Inhalt anzuzeigen. Melden Sie sich an oder beginnen Sie noch heute mit einer kostenlosen Testphase.

Forschungsartikel

Endoplasmatische Retikulum-stressbezogene Immunsignatur bei Vorhofflimmern: Maschinelles Lernen und Einzelzelltranskriptomik

123 Aufrufe

DOI:

10.3791/71532

7. August 2026

* These authors contributed equally

In diesem Artikel

Zusammenfassung

Hier präsentieren wir ein Protokoll zur Identifizierung von stressbedingten Immunsignaturen des endoplasmatischen Retikulums bei Vorhofflimmern, indem wir öffentliche Bulk-Transkriptomik, maschinelles Lernen, Immuninfiltrationsanalyse und Einzelzelltranskriptomik für reproduzierbare Biomarkerpriorisierung und Zelltyplokalisierung integrieren.

Zusammenfassung

Diese Studie beschreibt einen reproduzierbaren computergestützten Workflow zur Identifizierung von Gensignaturen endoplasmatischer Retikulumstress (ERS) bei Vorhofflimmern (AF) durch Integration von Bulk-Transkriptomik, maschinellem Lernen, Immuninfiltrationsanalyse und Einzelzelltranskriptomik. Öffentliche Bulk-Transkriptom-Datensätze wurden aus dem Gene Expression Omnibus (GEO) abgerufen, gefolgt von Phänotyp-Harmonisierung, Normalisierung, Batch-Effekt-Korrektur und differentieller Expressionsanalyse. Die gewichtete Gen-Koexpressionsnetzwerkanalyse (WGCNA) wurde mit ERS-bezogenen Gensätzen kombiniert, um potenzielle ERS-assoziierte Gene zu identifizieren. Ein Multialgorithmus-Maschinelles Lern-Framework wurde dann verwendet, um Strategien zur Auswahl von Merkmalen und Modellanpassung zu vergleichen. Das ausgewählte Modell wurde in einer unabhängigen externen Validierungskohorte (GSE115574) bewertet und in einer weiteren Kohorte (GSE14975) weiter bewertet, wobei die diskriminierende Leistung durch die Analyse des Empfängerbetriebscharakteris (ROC) und die Fläche unter der Kurve (AUC) quantifiziert wurde. Mit diesem Workflow wurden 22 ERS-bezogene Kerngene identifiziert, und ein 18-Gen-Elastic Net (Enet)-Modell zeigte die höchste insgesamt diskriminierende Leistung in den Trainings- und Validierungskohorten. Die SHapley Additive ExPlanations (SHAP)-Analyse hob den wesentlichen Beitrag von Genen wie RPS11, NCF2 und S100A4 zur Modellvorhersage hervor. Immundekonvolution und Einzelzell-Transkriptomanalyse kartierten die ERS-bezogene Signatur überwiegend auf die Monozyten-Makrophagenlinie, was auf eine mögliche Beteiligung an AF-assoziierter Immunremodellierung hindeutet. Dieser Workflow bietet eine reproduzierbare Strategie, um krankheitsassoziierte transkriptomische Signaturen mit spezifischen Immunzellpopulationen zu verknüpfen und kann mit geeigneten Bulk- und Einzelzelldatensätzen an andere Krankheitskontexte angepasst werden.

Einleitung

Vorhofflimmern (AF) ist die häufigste anhaltende Arrhythmie in der klinischen Praxis, gekennzeichnet durch gestörte elektrische Aktivität in den Vorhöfen und Verlust mechanischer Funktionen. Es erhöht erheblich das Risiko von Schlaganfall, Herzinsuffizienz und sterblicher Sterblichkeit durch alle Ursachen und wird zu einer großen globalen Belastung für die öffentlicheGesundheit. Die aktuelle klinische Behandlung von AF steht vor erheblichen Herausforderungen: Traditionelle Antiarrhythmika haben eine begrenzte langfristige Wirksamkeit bei der Aufrechterhaltung des Sinusrhythmus, und ihre Nebenwirkungen wie Arrhythmien und Kardiotoxizität begrenzen ihre kontinuierliche Anwendung 2,3. Die Katheterablation bleibt ebenfalls eine Herausforderung bei der Aufrechterhaltung eines langfristigen Sinusrhythmus bei anhaltendem AF4. Neue Behandlungsstrategien sind derzeit durch das Fehlen eines systematischen Verständnisses der molekularen Landschaft der vorgelagerten Mechanismen von AF, was die Identifizierung und Übersetzung präziser Ziele erschwert. Forschungen haben gezeigt, dass das pathologische Fortschreiten der AF-Erkrankung komplexe Wechselwirkungen über mehrere Dimensionen hinweg umfasst, einschließlich der Umgestaltung des elektrischen, strukturellen und autonomen Nervensystems. Dazu gehört die atriale strukturelle Remodellierung, die sich auf Myokardialfibrose konzentriert, und ist ein zentraler Mechanismus für die Aufrechterhaltung von AF 5,6,7.

Daher ist die Aufklärung der vorgelagerten Stresswege, die Fibrose antreiben, einer der Schlüssel zur Überwindung des therapeutischen Engpasses bei persistierender AF. Jüngste Studien legen nahe, dass der Stress des endoplasmatischen Retikulums (ERS), ein zentrales regulatorisches Zentrum, das es Zellen ermöglicht, mit intra- und extrazellulären Störungen umzugehen, eine hoch konservierte adaptive Reaktion ist, die ausgelöst wird, wenn die ER-Homöostase gestört wird und zu einer übermäßigen Ansammlung ungefalteter oder fehlgefalteter Proteine im ER-Lumen führt. ERS kann an der Vorhofremodellierung teilnehmen, indem Proteostase, Kalziumkreislauf, entzündliche Reaktionen und Apoptose 8,9 reguliert werden. Die upstream-Trigger, Schlüsseleffektormoleküle und downstream-Signalwege von ERS bei AF sind jedoch noch nicht systematisch charakterisiert, was es erschwert, die kritischen Knoten und umsetzbaren Interventionspunkte im Vorhoffe-Remodellierung zu definieren.

Im Vergleich zu traditionellen Bulk-Transkriptomstudien kann Multi-Omics-Integration robustere populationsbezogene, krankheitsassoziierte Signale liefern. Darüber hinaus ermöglicht die Einbindung einzelzelliger Transkriptomik die Zerlegung der zellulären Heterogenität und die Identifikation der zellulären Quellen dieser Signale, wodurch die Assoziationsergebnisse auf bestimmte Zelltypen und deren potenzielle Wechselwirkungswege abgebildet werden. Dies bildet eine Grundlage für spätere mechanistische Untersuchungen und Zielpriorisierung. In der vorliegenden Studie wurden AF-bezogene, massenbezogene transkriptomische und einzelzellige transkriptomische Datensätze aus der Gene Expression Omnibus (GEO)-Datenbank abgerufen. ERS-bezogene Kernmodule wurden durch differentielle Expressionsanalyse und gewichtete Gen-Koexpressionsnetzwerkanalyse (WGCNA) identifiziert. Durch die Integration von Einzelzellanalysen wurden Schlüsselmoleküle weiter auf spezifische Zelltypen und deren Interaktionsnetzwerke lokalisiert. Gemeinsam zielt diese Studie darauf ab, ERS-bezogene Schlüsselnetzwerke in der AF und deren Zusammenhänge mit struktureller Umgestaltung zu definieren und so eine Begründung für Zielfindung und mechanismengesteuerte, geschichtete therapeutische Strategien zu liefern.

Im Vergleich zur Analyse der differenziellen Expression eines einzelnen Datensatzes oder dem Biomarker-Screening mit einem einzelnen Algorithmus verbessert dieser Workflow die Robustheit und Interpretierbarkeit, indem er Cross-Cohort-Validierung, biologisch eingeschränkte Merkmalsauswahl, Multialgorithmus-Modellvergleich, Immundekonfaltion und Einzelzelltranskriptomik integriert. Diese Schritte helfen, reproduzierbare ERS-bezogene Signaturen zu priorisieren und bulk-abgeleitete Signale an spezifische Immunzellpopulationen und Interaktionsnetzwerke zu lokalisieren. Dieser Workflow eignet sich für Studien, die öffentliche oder interne transkriptomische Datensätze mit gut definierten Krankheits- und Kontrollgruppen, vergleichbaren Gewebequellen, ausreichender Stichprobengröße und verfügbaren Phänotyp-Annotationen verwenden. Sie ist besonders nützlich für die Hypothesengenerierung, die Priorisierung von Biomarkern und die Zelltyplokalisierung krankheitsassoziierter molekularer Programme. Seine Leistung hängt jedoch von der Qualität des Datensatzes, der Phänotypkonsistenz und der effektiven Korrektur des Batch-Effekts ab; Daher benötigen Kandidatensignaturen, die durch diesen Workflow identifiziert werden, eine Validierung in unabhängigen Kohorten und experimentellen Modellen vor der klinischen Übersetzung. Der gesamte Studienablauf ist in Abbildung 1 dargestellt.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Protokoll

Gemäß den am 18. Februar 2023 in China erlassenen Maßnahmen zur ethischen Überprüfung von Lebenswissenschaften und medizinischer Forschung mit menschlichen Probanden kann Forschung mit öffentlich zugänglichen Daten die Kriterien für eine Ausnahme von der ethischen Überprüfung erfüllen. Diese Studie verwendete ausschließlich öffentlich zugängliche, deidentifizierte sekundäre transkriptomische Daten und beinhaltete keine neue menschliche Teilnehmerrekrutierung, menschliche Probenentnahme oder Tierversuche. Daher war keine zusätzliche institutionelle ethische Genehmigung erforderlich. In dieser Studie wurden keine Tierversuche durchgeführt. Daher war die Genehmigung durch das institutionelle Komitee für Tierpflege und -nutzung nicht anwendbar.

Datenquellen für stressbedingte Gene des endoplasmatischen Retikulums bei Vorhofflimmern
In dieser Studie wurden öffentlich verfügbare, AF-bezogene transkriptomische Datensätze aus der GEO-Datenbank abgerufen, darunter GSE41177, GSE79768, GSE115574, GSE14975 und GSE165838. Detaillierte Informationen zu den GSE-Datensätzen finden Sie in Supplementary File 1—Supplementary Table S1. GSE41177 und GSE79768 wurden verwendet, um die integrierte Bulk-Transkriptomik-Trainingskohorte zu konstruieren, während GSE115574 und GSE14975 als zwei unabhängige externe Validierungskohorten verwendet wurden. GSE165838 wurde für einzellige transkriptomische Analysen verwendet. Da diese Datensätze auf verschiedenen Plattformen generiert wurden und sich in Gewebeherkunft, klinischem Hintergrund und Probenzusammensetzung unterscheiden können, wurde jeder Datensatz vor der Integration oder Validierung separat entsprechend seinen Plattformeigenschaften vorbearbeitet. Die Batch-Effektkorrektur wurde anschließend mit dem SVA R-Paket für die zusammengeführte Trainingskohorte durchgeführt. Das stressbezogene Genset des endoplasmatischen Retikulums wurde aus der GeneCards-Datenbank mit einem Relevanzwert von ≥ 3 abgerufen und bildete nach der Deduplikation die Zielgenliste, die in dieser Studie verwendet wurde.

Analyse differenziell exprimierter Gene
Nach der Datenstandardisierung und -normalisierung wurde das R-Paket-Limma verwendet, um differenziell exprimierte Gene (DEGs) im integrierten Trainingssatz zu identifizieren. DEGs wurden anhand folgender Signifikanzkriterien definiert: Falschentdeckungsrate-angepasster P-Wert (adj. P.Val) < 0.05 und |log2FC| > 0,58510. Um die Ausdrucksmuster von DEGs zu visualisieren, wurden Vulkandiagramme und Heatmaps mit den Paketen ggplot2 bzw. pheatmap erstellt.

WGCNA-Analyse
Um potenzielle Mechanismen koordinierter Genregulation zu erläutern, die Assoziationsmuster zwischen Koexpressionsmodulen und klinischen Merkmalsvariablen zu definieren und Kernbiomarker oder therapeutische Ziele mit translationalem Potenzial zu identifizieren, wurde WGCNA11 angewandt.

Ein gewichtetes Koexpressionsnetzwerk wurde mit dem WGCNA-Paket in R konstruiert. Die weiche Schwellenwert (β) wurde nach dem Kriterium der skalenfreien Topologie ausgewählt; der entsprechende Wert β wurde für spätere Analysen gewählt, als der skalenfreie Topologie-Fit-Index (R2) 0,8512 erreichte und darüber blieb. Während der Modulidentifikation wurden Parameter im Zusammenhang mit dynamischem Baumfällen und Modulerkennungsempfindlichkeit optimiert, um die Auflösung und Stabilität der Modulgrenzen zu verbessern. Schließlich wurden Module, die signifikant mit dem Zielmerkmal assoziiert sind, extrahiert und intramodulare Hub-Gene als Kandidatengensets für nachgelagerte Analysen identifiziert.

Anreicherungsanalyse von AF-bezogenen DEGs
Um Hub-Gene präzise zu identifizieren, wurden die DEGs zunächst mit Genen aus den wichtigsten WGCNA-Modulen gekreuzt, um eine Reihe von Genen zu definieren, die an der AF-Pathogenese beteiligt sind. Anschließend wurde dieser AF-Gensatz weiter mit ERS-bezogenen Genen gekreuzt, und die daraus resultierenden überlappenden Gene wurden für spätere Analysen beibehalten.

Die funktionelle Anreicherung der untersuchten Gene wurde mithilfe von Gene Ontology (GO) und der Kyoto Encyclopedia of Genes and Genomes (KEGG) Analysen bewertet. GO-Begriffe wurden mit dem R-Paket clusterProfiler analysiert, um die Anreicherung über die Kategorienbiologische Prozesse (BP), zelluläre Komponenten (CC) und molekulare Funktionen (MF) zusammenzufassen. Die KEGG-Analyse wurde dann verwendet, um angereicherte Signalwege zu identifizieren, die mit den Zielgenen14 assoziiert sind. Anreicherungsergebnisse mit einem bereinigten P-Wert < 0,05 wurden als statistisch signifikant angesehen. Die führenden GO-Begriffe und KEGG-Pfade wurden als Balkendiagramme und Blasendiagramme mit ggplot2 dargestellt.

Protein-Protein-Interaktionsanalyse (PPI)
Die PPI-Analyse wurde durchgeführt, indem der geschnittene Gensatz in die STRING-Datenbank hochgeladen wurde, wobei der Organismus auf Homo sapiens beschränkt war. Getrennte Knoten wurden entfernt, und Interaktionen wurden mit einem mittleren Konfidenzwert (kombinierter Wert ≥ 0,4) abgerufen. Das resultierende PPI-Netzwerk wurde anschließend in ein Netzwerkvisualisierungs- und Analysetool für topologische Analysen importiert, um Schlüsselknoten zu identifizieren.

Entwicklung eines Kandidaten-AF-ERS-Klassifikationsmodells basierend auf 12 maschinellen Lernalgorithmen
In dieser Studie wurde ein Ensemble-Klassifikationsrahmen auf Basis von zwölf konventionellen Machine-Learning-Algorithmen entwickelt, um ERS-bezogene Kandidatensignaturgene zu screenen und die Klassifikationsleistung zu optimieren. Für die Datenpartitionierung wurden nach Standardisierung und Normalisierung GSE41177 und GSE79768 zusammengeführt, um die Trainingskohorten-Expressionsmatrix zu erzeugen. GSE115574 wurde als unabhängige externe Validierungskohorte zur Bewertung der Modellgeneralisierbarkeit verwendet. Konkret wurden DEGs erstmals in der Ausbildungskohorte identifiziert (|log2FC| >0,585, angepasst p < 0,05). Diese DEGs wurden dann mit Genen aus den wichtigsten WGCNA-Modulen und ERS-bezogenen Genen gekreuzt, und der resultierende Gensatz wurde als Eingabefunktion für den Modellbau verwendet.

Um ERS-bezogene Gene mit dem AF-Phänotyp zu verknüpfen, wurde ein Kandidatenklassifikationsmodell entwickelt, das 12 maschinelle Lernmethoden verwendet: Lasso, Ridge, schrittweise generalisiertes lineares Modell (Stepglm), extremes Gradientenboosting (XGBoost), Zufallswald (RF), elastisches Netz (Enet), partielle kleinste Quadrat-Regression für generalisierte lineare Modelle (plsRglm), generalisierte boosted regression (GBM), naive Bayes, lineare Diskriminantenanalyse (LDA), glmBoost, und Support Vector Machine (SVM). Eine systematische kombinatorische Modellierungsstrategie wurde angewandt, indem ein zweiter Algorithmus zum ersten hinzugefügt und über den Tuningparameter α integriert wurde, wodurch 113 Kombinationen von Merkmalsauswahl und Modellanpassung ergaben, die umfassend bewertet wurden. Die Modelldiskriminierung wurde durch Berechnung der Fläche unter der Empfänger-Betriebscharakteristiekkurve (AUC) bewertet. Nach zuvor berichteten Modellauswahlkriterien wurde der endgültige Kandidatenrahmen als Modell mit der besten Gesamtleistung definiert, bewertet anhand des durchschnittlichen AUC über die Ausbildungs- und Validierungskohorten.

Diese kombinatorische Modellierungsstrategie basierte auf früheren Studien im biomedizinischen maschinellen Lernen 15,16,17. Zusammen zeigen diese Studien, dass kein einzelner Algorithmus andere in Datensätzen und analytischen Aufgaben konsistent übertrifft. Auf dieser Grundlage kann die Verwendung eines Ensemble-Learning- und kombinatorischen Modellierungsrahmens die Wahrscheinlichkeit erhöhen, ein leistungsstarkes Kandidatenmodell mit stabilerer Generalisierbarkeit zu erhalten, und die Robustheit der Modellauswahl verbessern.

Anschließend wurden SHapley Additive ExPlanations (SHAP) Werte angewandt, um das maschinelle Lernmodell zu interpretieren, indem die Schlüsselmerkmale visualisiert werden, die die AF-Klassifikation antreiben, wodurch der Beitrag jedes Merkmals zum vorhergesagten Ergebnis quantifiziert und gezeigt wurde, wie einzelne Signaturgene das endgültige Modellergebnis18 beeinflussen.

Bewertung der Modellleistung und externe Validierung des optimalen Modells
Die Leistung des optimalen Modells wurde sowohl in der Trainingskohorte als auch in der unabhängigen externen Validierungskohorte (GSE115574) bewertet. Auf Modellebene wurde eine Verwirrungsmatrix auf Basis der vorhergesagten Klassenlabels erstellt, und die entsprechenden Klassifikationsmetriken wurden gemeldet. Empfänger-Betriebscharakteristik (ROC)-Kurven wurden mit dem R-Paket pROC erzeugt, und die AUC wurde berechnet, um die diskriminative Leistung zu quantifizieren.

Auf Biomarker-Ebene wurden für jedes Schlüsselgen im optimalen Modell Einzelgen-ROC-Kurven dargestellt, und die entsprechenden AUCs wurden berechnet, um deren individuelle Diskriminierungsfähigkeit zu bewerten. Zusätzlich wurde die differentielle Expression der Schlüsselgene mittels eines Vulkandiagramms zusammengefasst, und Boxplots wurden verwendet, um deren Expressionsverteilungen in Krankheits- versus gesunden Stichproben darzustellen. Um die Generalisierbarkeit der zuvor definierten optimalen modellabgeleiteten Gensignatur weiter zu bewerten, wurde eine zusätzliche unabhängige externe Validierung mit GSE14975 durchgeführt. GSE14975 enthält transkriptomische Daten aus Proben des linken Vorhofanhängsels, darunter fünf Vorhofflimmerproben und fünf Proben des Sinusrhythmus-/Kontrollsystems. Alle in der gesperrten Signatur enthaltenen Gene waren in diesem Datensatz verfügbar. Um die Konsistenz mit dem ursprünglichen Cross-Cohort-Analyse-Workflow zu gewährleisten, wurden die Entwicklungskohorte und GSE14975 mit ComBat harmonisiert, wobei die Datensatzquelle als Batch-Variable fungierte. Diese Harmonisierung erfolgte unbeaufsichtigt. Wichtig ist, dass Krankheits-/Kontrolllabels aus GSE14975 nicht für Merkmalsauswahl, Koeffizientenschätzung, Schwellenwertbestimmung oder Hyperparameter-Abstimmung verwendet wurden.

Das optimale, modellabgeleitete Bewertungsmodell wurde ausschließlich mit der Entwicklungskohorte angepasst und anschließend zur externen Validierung auf GSE14975 angewendet. Die Modellleistung in GSE14975 wurde mittels Analyse der Empfänger-Betriebscharakteristikakurve, Fläche unter der Kurve, 95%-Konfidenzintervall (KI), Sensitivität, Spezifität, Genauigkeit, positiver und negativer Prädiktionswerte sowie Brier-Wert bewertet. Zusätzlich wurden Einzelgen-ROC-Kurven für alle optimalen modellabgeleiteten Gene in GSE14975 generiert, um ihre individuelle Diskriminierungsfähigkeit zu veranschaulichen. Um das mögliche Überfitting in der Entwicklungskohorte weiter zu bewerten, wurden wiederholte zehnfache Cross-Validation und Bootstrap-Optimismus-Korrekturen unter Verwendung der Gensignatur aus dem Locked-Optimal-Modell durchgeführt. Für wiederholte Kreuzvalidierung wurde die Entwicklungskohorte wiederholt in 10-fache unterteilt, und die Modelldiskriminierung wurde über alle Iterationen hinweg zusammengefasst. Für die Bootstrap-Validierung wurden 1.000 Bootstrap-Resamples generiert, um den Optimismus der scheinbaren Entwicklungsset-Leistung zu schätzen und die optimismuskorrigierte AUC zu berechnen. Da die endgültige Signatur aus dem optimalen Modell abgeleitet wurde, wurde der Beitrag jedes Gens hauptsächlich entsprechend der absoluten Größe und Richtung der Modellkoeffizienten interpretiert. Zusätzlich wurden in GSE14975 Einzelgen-ROC-Analysen durchgeführt, um die individuelle Diskriminierungsfähigkeit jedes einzelnen Teilgens zu veranschaulichen. Für Visualisierungszwecke wurden Einzelgen-ROC-Kurven so ausgerichtet, dass sie die diskriminierende Fähigkeit widerspiegeln, unabhängig davon, ob eine höhere oder niedrigere Expression mit AF assoziiert war.

Genmengenanreicherungsanalyse (GSEA)
Um die funktionellen Auswirkungen der Schlüsselgene zu untersuchen, wurde GSEA mit Proben aus der Krankheitsgruppe19 durchgeführt. Für jedes Schlüsselgen wurden die Proben in Untergruppen mit hoher und niedriger Expression unterteilt, wobei der mediane Expressionswert der Krankheitsgruppe als Grenzwert diente. Der mittlere Expressionsunterschied zwischen den beiden Untergruppen für jedes Gen wurde berechnet, und eine rangfolgende Genliste wurde in absteigender Reihenfolge als Eingabe für die Anreicherungsanalyse erstellt. GSEA wurde mit dem R-Paket clusterProfiler durchgeführt, wobei Gensets aus der MSigDB-Sammlung c2.cp.kegg.Hs.symbols.gmt. stammten. Die statistische Signifikanz wurde als p < 0,05 definiert. Die Anreicherungsrichtung wurde durch das Vorzeichen des normalisierten Anreicherungswerts (NES) bestimmt, und es wurden Anreicherungsdiagramme für repräsentative Wege erstellt.

Bewertung der Häufigkeit des Immunzell-Subtyps und der differenziellen Expression
Der CIBERSORT-Dekonvolutionsalgorithmus wurde angewandt, um die relative Häufigkeit der infiltrierenden Immunzell-Subsets und deren Wechselbeziehungen über Proben hinweg zu schätzen. Basierend auf der LM22-Leukozytensignaturmatrix wurde die Zusammensetzung der Immunzellen quantitativ aus Genexpressionsprofilen mit dem R-Paket CIBERSORT20 abgeleitet. Ein Schwellenwert von p < 0,05 wurde verwendet, um Ergebnisse zu filtern, und nur Proben, die dieses Kriterium erfüllten, wurden für spätere Analysen beibehalten. Es wurden Boxplots erstellt, um die geschätzten relativen Anteile der Immunzell-Subsets zwischen AF- und Kontrollgruppen zu vergleichen. Zusätzlich wurde Spearmans Korrelationsanalyse durchgeführt, um Assoziationen zwischen Immunzellinfiltrationsniveaus und Hub-Genexpression zu bewerten.

Einzelzellanalyse
Eine einzelzellige transkriptomische Analyse wurde mit dem GEO-Datensatz GSE165838 durchgeführt. Rohe Gen-Zell-Matrizen wurden in R importiert und mit Seurat v4.4.0 verarbeitet. Für jede Probe wurde ein Seurat-Objekt mit CreateSeuratObject mit min.cells = 5 und min.features = 300 generiert. Qualitätskontrollkennzahlen, darunter die Anzahl der nachgewiesenen Gene, die Gesamtzahl einzigartiger molekularer Identifikatoren (UMI), den Anteil des mitochondrialen Gens, den Prozentsatz des Ribosomgens und den Hämoglobin-Genprozentsatz, wurden für jede Zelle berechnet. Zellen wurden erhalten, wenn sie mehr als 500 nachgewiesene Gene aufwiesen, weniger als 5.000 UMI-Zählungen, der Mitochondrien-Genanteil < 25 %, der ribosomale Genanteil > 3 % und der Hämoglobin-Genanteil < 1 %. Gene, die in weniger als drei Zellen nachgewiesen wurden, wurden entfernt. MALAT1- und mitochondriale Gene wurden ebenfalls vor der nachgelagerten Analyse ausgeschlossen. DoubletFinder wurde verwendet, um potenzielle Doublets zu erkennen und auszuschließen. Kurz gesagt wurden die Zellen nach Stichprobenidentität aufgeteilt, und die Dublett-Detektion erfolgte separat für jede Probe unter Verwendung der Hauptkomponenten 1–30.

Der pN-Parameter wurde auf 0,25 gesetzt, und der optimale pK-Wert wurde entsprechend der maximalen BC-Metrik ausgewählt, die durch das Parameter-Sweeping erhalten wurde. Die erwartete Doublet-Rate wurde anhand der Anzahl der gefundenen Zellen in jeder Probe geschätzt, wobei Raten von 2,5 %, 5 % und 6,5 % für Proben mit relativ niedrigen, mittleren bzw. hohen Zellzahlen verwendet wurden. Es wurden nur als Singlets klassifizierte Zellen erhalten. Die Kontamination von Umgebungs-RNA wurde mit DecontX weiter geschätzt, und Zellen mit einem Kontaminationswert ≥ 0,2 wurden ausgeschlossen. Nach Qualitätskontrolle, Doublet-Entfernung und Umgebungs-RNA-Filterung wurden 40.886 Zellen und 23.947 Gene für die nachgelagerte Analyse erhalten. Der gefilterte Einzelzell-Datensatz wurde mit der LogNormalize-Methode unter Verwendung eines Skalierungsfaktors von 10.000 normalisiert, gefolgt von der Identifikation hochvariabler Gene. Die Daten wurden dann vor der Analyse der Hauptkomponenten skaliert.

Um sample-spezifische Batch-Effekte zu reduzieren, wurde Harmony unter Verwendung von orig.ident als Batch-Variable angewendet. Die Visualisierung der Uniform Manifold Approximation and Projection (UMAP) sowie die Konstruktion von Graphen mit dem nächstgelegenen Nachbarn wurden unter Verwendung der ersten 15 Harmony-korrigierten Dimensionen21 durchgeführt. Das Clustering wurde mit dem Louvain-Algorithmus durchgeführt, und mehrere Clustering-Auflösungen wurden ausgewertet. Die letzte große Zelltyp-Annotation basierte auf dem Clusterergebnis bei Auflösung 0,05. Zellcluster wurden manuell entsprechend der kanonischen Marker-Genexpression annotiert. Diese markerbasierte Annotationsstrategie ist mit früheren Einzelzell-Immunprofilierungsstudien konsistent22. T-Zellen wurden durch CD3D, CD3E und TRAC identifiziert; natürliche Killerzellen (NK) von NKG7, GNLY, NCAM1 und KLRG1; Monozyten-Makrophagenzellen durch LYZ, CD14, FCGR3A, CD68, CD163, FCN1, TYROBP, S100A8 und S100A9; B-Zellen von MS4A1 und CD79A; Plasmazellen von MZB1 und XBP1; Endothelzellen durch PECAM1, VWF und CDH5; gefäßglatte Muskelzellen durch ACTA2, TAGLN, MYH11 und MYL9; Fibroblasten von DCN, LUM, COL1A1, COL1A2 und PDGFRA; neutrophilähnliche Zellen von FCGR3B, CXCR2, S100A8 und MPO; Mastzellen durch TPSB2; und dendritische Zellen durch LILRA4, CD1C und XCR1. Die Marker-Gen-Expression über Cluster hinweg wurde mit Punktdiagrammen visualisiert, und die Expressionsverteilung der finalen ERS-bezogenen Hub-Gene wurde auf UMAP-Einbettungen visualisiert.

Zur Quantifizierung der ERS-bezogenen Transkriptionsaktivität auf Einzelzellebene wurde der endgültige Hub-Gen-Satz verwendet, um zellweise Signaturwerte mittels AUCell, einer Genanreicherungsanalyse für einzelne Proben und Seurat AddModuleScore zu berechnen. Für AUCell wurden Zellrankings aus der normalisierten RNA-Expressionsmatrix konstruiert, und AUC-Scores wurden mit dem Hub-Gen-Set berechnet, wobei die besten 10 % der eingestuften Gene die maximale Ranking-Schwelle bildeten. Für ssGSEA wurden die Anreicherungswerte mit dem GSVA-Paket berechnet. Die drei Wertungsergebnisse wurden zentriert und skaliert, dann min-max-normalisiert und schließlich summiert, um für jede Zelle einen integrierten, ERS-bezogenen zusammengesetzten Score zu erzeugen. Die Verteilung des zusammengesetzten Scores wurde über annotierte Zellpopulationen hinweg verglichen, um die Zelltypheterogenität des ERS-bezogenen Programms zu bewerten. Da die Monozyten-Makrophagenlinie eine ausgeprägte ERS-bezogene Signaturanreicherung aufwies und eng mit immuninflammatorischer Remodellierung verbunden war, wurde sie für spätere Analysen innerhalb der Linie ausgewählt. Monozyten-Makrophagenzellen wurden entsprechend dem medianen, ERS-bezogenen Zusammengesetzten Wert in Gruppen mit hohem und niedrigem Wert unterteilt. Anschließend wurde eine Pseudozeit-Trajektorienanalyse an Monocyten-Makrophagen-Zellen mit Monokel durchgeführt.

Für die Pseudozeitanalyse wurde ein CellDataSet-Objekt aus der rohen Zählmatrix mit einem negativen binomialen Expressionsmodell erstellt. Größenfaktoren und Verteilungen wurden dann geschätzt. Ordnungsgene wurden unter Verwendung eines mittleren Expressionsschwellenwerts von ≥ 0,1 und einer empirischen Dispersion größer als der angepassten Dispersion ausgewählt. Die Dimensionalität wurde mit dem DDRTree-Algorithmus reduziert, und die Zellen wurden entlang der abgeleiteten Trajektorie geordnet. Die dynamischen Expressionsmuster von ERS-bezogenen Hub-Genen entlang der Pseudozeit wurden visualisiert. Die Analyse der Zell-Zell-Kommunikation wurde mit CellChat durchgeführt, um potenzielle Liganden-Rezeptor-Interaktionen mit Monocyt-Makrophagen-Zellen mit unterschiedlichen ERS-bezogenen Werten zu untersuchen. Für diese Analyse wurden Monozyten-Makrophagenzellen entsprechend dem Median-Composite-Wert als High-Score oder Low-Score eingestuft, während andere Zellen ihre ursprünglichen Zelltyp-Labels beibehielten. Die normierte RNA-Expressionsmatrix und die entsprechenden Zellgruppenannotationen wurden verwendet, um das CellChat-Objekt zu erstellen. Für die Analyse der Zell-zu-Zell-Kommunikation wurde die menschliche CellChatDB-Datenbank ausgewählt, und es wurden nur ausgeschiedene Signalwechselwirkungen ausgewertet. Überexprimierte Gene und Ligandenrezeptorpaare wurden erkannt, bevor die Kommunikationswahrscheinlichkeiten berechnet wurden. Zellgruppen mit weniger als 10 Zellen wurden aus der Interaktionsanalyse ausgeschlossen. Die Kommunikationswahrscheinlichkeiten auf Pfadebene wurden anschließend geschätzt und aggregiert, um die Anzahl und Stärke der Interaktionen zwischen Zellpopulationen zu vergleichen. Um die Reproduzierbarkeit zu erleichtern, wird unten eine Checkpoint-Tabelle bereitgestellt, die jeden Protokollschritt mit der entsprechenden erwarteten Ausgabefigur oder -tabelle verknüpft (Supplementary File 1—Supplementary Table S2).

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Ergebnisse

Identifikation unterschiedlich exprimierter Gene bei AF
Um die Vergleichbarkeit zwischen den Kohorten zu verbessern, wurden zwei AF-bezogene transkriptomische Datensätze (GSE41177 und GSE79768) integriert und Batch-Effekte auf der fusionierten Expressionsmatrix korrigiert. Abbildung 2A,B zeigt Boxplots globaler Expressionsverteilungen vor und nach der Batch-Effect-Korrektur, die verwendet wurden, um zu bewerten, ob die Ex...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Diskussion

Diese Studie integrierte Bulk- und Einzelzell-Transkriptome, um die Rolle von ERS bei AF zu untersuchen. Eine ERS-bezogene Gensignatur mit günstiger Cross-Cohort-Diskriminierung wurde abgeleitet, und diese Signale wurden überwiegend der Monozyten-Makrophagen-Linie zugeordnet und mit umfangreicher interzellulärer Kommunikation verbunden. Zusammen deuten die Ergebnisse darauf hin, dass ERS-assoziierte Programme mit einer immunzellzentrierten Remodellierung bei AF verbunden sind. Im Verglei...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Offenlegungen

Die Autoren berichten von keinem Interessenkonflikt in dieser Arbeit. Während der Überarbeitung dieses Manuskripts wurde ChatGPT von OpenAI ausschließlich zur Unterstützung der englischsprachigen Verfeinerung verwendet. Die Autoren haben alle KI-unterstützten Texte geprüft, überprüft und bearbeitet und übernehmen die volle Verantwortung für die Genauigkeit und Integrität des endgültigen Manuskripts. Es wurden keine KI-unterstützten Werkzeuge verwendet, um Forschungsideen zu generieren, Datenanalysen durchzuführen, Ergebnisse zu interpretieren, Abbildungen oder Tabellen zu erstellen oder wissenschaftliche Schlussfolgerungen zu ziehen. Die im Artikel berichtete Arbeit wurde von den Autoren selbst durchgeführt. F.T., PR. W: Schreiben eines Originalentwurfs, Software, Methodik, Visualisierung, Validierung und Datenkuratierung. SY. T: Untersuchung und Methodik. FF. B: Aufsicht. QR. L: Supervision, Methodik, Datenkuratierung. XY. J, YX. X: Literaturabruf und Dateninterpretation.

Materialien

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
AddModuleScoreSeurat functionversion 4.4.0Nicht verfügbar
AUCellBioconductorversion 1.32.0RRID:SCR_021327
caretCRANversion 7.0.1RRID:SCR_022524
celda / decontXBioconductorversion 1.24.0Nicht verfügbar
CellChatGitHub / CellChatversion 2.2.0RRID:SCR_021946
CIBERSORT / LM22 signature matrixCIBERSORTLM22Nicht verfügbar
clusterProfilerBioconductorversion 4.12.6RRID:SCR_016884
CytoscapeCytoscape Consortiumversion 3.10RRID:SCR_003032
DoubletFinderGitHub / McGinnis Labversion 2.0.4Nicht verfügbar
e1071CRANversion 1.7.16Nicht verfügbar
gbmCRANversion 2.2.2Nicht verfügbar
Gene Expression Omnibus (GEO) databaseNational Center for Biotechnology Information (NCBI)GSE41177Nicht verfügbar
Gene Expression Omnibus (GEO) databaseNCBIGSE79768Nicht verfügbar
Gene Expression Omnibus (GEO) databaseNCBIGSE115574Nicht verfügbar
Gene Expression Omnibus (GEO) databaseNCBIGSE14975Nicht verfügbar
Gene Expression Omnibus (GEO) databaseNCBIGSE165838Nicht verfügbar
glmnetCRANversion 4.1.8Nicht verfügbar
HarmonyCRANversion 1.2.4Nicht verfügbar
limmaBioconductorversion 3.60.6RRID:SCR_010943
MASSCRANversion 7.3.61Nicht verfügbar
mboostCRANversion 2.9.11Nicht verfügbar
MonocleBioconductorversion 2.38.0RRID:SCR_016339
org.Hs.eg.dbBioconductorversion 3.19.1Nicht verfügbar
plsRglmCRANversion 1.5.1Nicht verfügbar
pROCCRANversion 1.18.5RRID:SCR_024286
R statistical softwareR Foundation for Statistical Computingversion 4.4.2RRID:SCR_001905
randomForestCRANversion 4.7.1.2RRID:SCR_015718
RStudioPosit Software, PBCversion 2024.4.1.748RRID:SCR_000432
SeuratCRAN / Satija Labversion 4.4.0RRID:SCR_016341
shapvizCRANversion 0.10.2Nicht verfügbar
svaBioconductorversion 3.52.0Nicht verfügbar
WGCNACRANversion 1.73RRID:SCR_003302
xgboostCRANversion 1.7.8.1Nicht verfügbar

Referenzen

  1. Saleh K, Haldar S. Atrial fibrillation: a contemporary update. Clin Med (Lond). 2023;23(5):437-41.
  2. Lemme M, et al. Atrial-like engineered heart tissue: an in vitro model of the human atrium. Stem Cell Reports. 2018;11(6):1378-90.
  3. van Gorp PRR, Trines SA, Pijnappels DA, de Vries AAF. Multicellular in vitro models of cardiac arrhythmias: focus on atrial fibrillation. Front Cardiovasc Med. 2020;7:43.
  4. Scherr D, et al. Five-year outcome of catheter ablation of persistent atrial fibrillation using termination of atrial fibrillation as a procedural endpoint. Circ Arrhythm Electrophysiol. 2015;8(1):18-24.
  5. Staerk L, et al. Atrial fibrillation: epidemiology, pathophysiology, and clinical outcomes. Circ Res. 2017;120(9):1501-17.
  6. Schotten U, Verheule S, Kirchhof P, Goette A. Pathophysiological mechanisms of atrial fibrillation: a translational appraisal. Physiol Rev. 2011;91(1):265-325.
  7. Van Wagoner DR, Chung MK. Inflammation, inflammasome activation, and atrial fibrillation. Circulation. 2018;138(20):2243-6.
  8. Yuan M, et al. IP3R1/GRP75/VDAC1 complex mediates endoplasmic reticulum stress-mitochondrial oxidative stress in diabetic atrial remodeling. Redox Biol. 2022;52:102289.
  9. Wang M, Kaufman RJ. Protein misfolding in the endoplasmic reticulum as a conduit to human disease. Nature. 2016;529(7586):326-35.
  10. Ritchie ME, et al. limma powers differential expression analyses for RNA-sequencing and microarray studies. Nucleic Acids Res. 2015;43(7):e47.
  11. Langfelder P, Horvath S. WGCNA: an R package for weighted correlation network analysis. BMC Bioinformatics. 2008;9:559.
  12. Hu H, et al. Dissection of metabolome and transcriptome: insights into capsaicin and flavonoid accumulation in two typical Yunnan Xiaomila fruits. Int J Mol Sci. 2024;25(14):7761.
  13. Chen GY, et al. Integrating network pharmacology and experimental validation to explore the key mechanism of Gubitong Recipe in the treatment of osteoarthritis. Comput Math Methods Med. 2022;2022:7858925.
  14. Chen GY, et al. Prediction of Rhizoma Drynariae targets in the treatment of osteoarthritis based on network pharmacology and experimental verification. Evid Based Complement Alternat Med. 2021;2021:5233462.
  15. Díaz-Uriarte R, Alvarez de Andrés S. Gene selection and classification of microarray data using random forest. BMC Bioinformatics. 2006;7:3.
  16. Saeys Y, Inza I, Larrañaga P. A review of feature selection techniques in bioinformatics. Bioinformatics. 2007;23(19):2507-17.
  17. Statnikov A, Wang L, Aliferis CF. A comprehensive comparison of random forests and support vector machines for microarray-based cancer classification. BMC Bioinformatics. 2008;9:319.
  18. Liu H, et al. Unraveling diethyl phthalate-induced prostate carcinogenesis: core targets revealed by integrated network toxicology, machine learning, and structural validation. Hum Genomics. 2025;19(1):149.
  19. Subramanian A, et al. Gene set enrichment analysis: a knowledge-based approach for interpreting genome-wide expression profiles. Proc Natl Acad Sci U S A. 2005;102(43):15545-50.
  20. Newman AM, et al. Robust enumeration of cell subsets from tissue expression profiles. Nat Methods. 2015;12(5):453-7.
  21. Xu H, et al. Single-cell transcriptomics reveals CCL3+ classical monocyte subset linked to autoimmune pathogenesis. J Inflamm Res. 2025;18:16273-91.
  22. Wang Y, et al. Immunological profiling of rheumatoid factor-positive primary Sjögren’s syndrome by single-cell RNA sequencing. Front Immunol. 2026;17:1822615.
  23. Wiersma M, et al. Endoplasmic reticulum stress is associated with autophagy and cardiomyocyte remodeling in experimental and human atrial fibrillation. J Am Heart Assoc. 2017;6(10):e006458.
  24. Hu HJ, et al. Hydrogen sulfide ameliorates angiotensin II-induced atrial fibrosis progression to atrial fibrillation through inhibition of the Warburg effect and endoplasmic reticulum stress. Front Pharmacol. 2021;12:690371.
  25. Liu Y, et al. Integrative transcriptomic, proteomic, and machine learning approach to identifying feature genes of atrial fibrillation using atrial samples from patients with valvular heart disease. BMC Cardiovasc Disord. 2021;21(1):52.
  26. Fu S, et al. Using integrative bioinformatics approaches and machine-learning strategies to identify potential signatures for atrial fibrillation. Int J Cardiol Heart Vasc. 2025;56:101592.
  27. Wu S, et al. Multiplex proteomics identifies inflammation-related plasma biomarkers for aging and cardio-metabolic disorders. Clin Proteomics. 2024;21(1):30.
  28. Xie Z, et al. Identification and verification of biomarkers and immune infiltration in obesity-related atrial fibrillation. Biology (Basel). 2023;12(1):121.
  29. Huo TM, Wang ZW. Comprehensive analysis to identify key genes involved in advanced atherosclerosis. Dis Markers. 2021;2021:4026604.
  30. Chen M, et al. Weighted gene co-expression network analysis identifies crucial genes mediating progression of carotid plaque. Front Physiol. 2021;12:601952.
  31. Wang S, et al. S100A8/A9 in inflammation. Front Immunol. 2018;9:1298.
  32. Wang Q, et al. Myeloid-specific S100A8/A9 deficiency attenuates atrial fibrillation through prevention of TLR4/NF-κB-mediated immune cell recruitment and inflammation. Front Immunol. 2025;16:1623486.
  33. Wu CL, Yin R, Wang SN, Ying R. A review of CXCL1 in cardiac fibrosis. Front Cardiovasc Med. 2021;8:674498.
  34. Zhang YF, et al. CXCR4 and TYROBP mediate the development of atrial fibrillation via inflammation. J Cell Mol Med. 2022;26(12):3557-67.
  35. Hulsmans M, et al. Recruited macrophages elicit atrial fibrillation. Science. 2023;381(6654):231-9.
  36. van der Net JB, et al. Arachidonate 5-lipoxygenase-activating protein gene and coronary heart disease risk in familial hypercholesterolemia. Atherosclerosis. 2009;203(2):472-8.
  37. Ye X, et al. ALOX5AP predicts poor prognosis by enhancing M2 macrophage polarization and immunosuppression in serous ovarian cancer microenvironment. Front Oncol. 2021;11:675104.
  38. Song P, Deng H, Liu Y, Zhang M. Integrated bioinformatics analysis and experimental validation reveal the relationship between ALOX5AP and the prognosis and immune microenvironment in glioma. BMC Med Genomics. 2024;17(1):218.
  39. Chen S, Tang L, Guillot A, Liu H. Bariatric surgery associates with nonalcoholic steatohepatitis/hepatocellular carcinoma amelioration via SPP1 suppression. Metabolites. 2023;13(1):11.
  40. Ji H, et al. Integrated genomic, transcriptomic, and epigenetic analyses identify a leukotriene synthesis-related M2 macrophage gene signature that predicts prognosis and treatment vulnerability in gliomas. Front Immunol. 2022;13:970702.
  41. Sirish P, et al. The critical roles of proteostasis and endoplasmic reticulum stress in atrial fibrillation. Front Physiol. 2021;12:793171.
  42. Sun Z, et al. Cross-talk between macrophages and atrial myocytes in atrial fibrillation. Basic Res Cardiol. 2016;111(6):63.
  43. Schall TJ, Proudfoot AEI. Overcoming hurdles in developing successful drugs targeting chemokine receptors. Nat Rev Immunol. 2011;11(5):355-63.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Nachdrucke und Genehmigungen

Tags

MedizinAusgabe 234Ausgabe 234Leerer WertAusgabeEinzelzellanalyseSHAP-Analyse