$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Deze studie betrok de Medical Information Mart for Intensive Care IV (Mimic-IV) Database11 (Versie 1.0, PhysioNet: https://physionet.org/content/mimiciv/1.0/) en Telehealth Intensive Care Unit (eICU) Database12 (Versie 2.0, PhysioNet: https://physionet.org/content/eicu-crd/2.0/) na het afronden van het Protecting Human Research Participants-examen (Record ID: 44151052). Deze studie werd uitgevoerd in overeenstemming met de principes van de Verklaring van Helsinki (2013), en patiënten hadden toestemming gegeven om hun gegevens in de twee databases vast te leggen. Ethische goedkeuring werd voor deze studie opgegeven omdat de gegevens in de eICU- en MIMIC-IV-databases volledig geanonimiseerd waren (geen persoonlijke identificaties behouden).
Materialen en gereedschappen
Gegevensbronnen: MIMIC-IV Database: Versie 1.0, open-access register met 76.540 IC-opnames (2008-2019), toegankelijk via PhysioNet. eICU-database: Versie 2.0, multicenter-database met >200.000 elektronische medische dossiers van 335 afdelingen in 208 Amerikaanse ziekenhuizen (2014-2015), toegankelijk via PhysioNet. Software & Uitvoeringsomgeving: RapidMiner Studio: Versie 9.10.001 (uitvoeringsomgeving: Windows 10 Pro 64-bit), gebruikt voor modelbouw (classificatie/clustering) en functieselectie; IBM SPSS Statistics: Versie 23.0 (uitvoeringsomgeving: Windows 10 Pro 64-bits), gebruikt voor statistische analyse en imputatie van ontbrekende waardes; Java Development Kit (JDK): Versie Java SE 8u381 (uitvoeringsomgeving: Windows 10 Pro 64-bit), gebruikt voor webapplicatieontwikkeling; ondersteunende IDE: Eclipse IDE 2023-09; Apache Tomcat: Versie 9.0.85, gebruikt voor het uitrollen van de webgebaseerde applicatie.
Studieontwerp en -omgeving
Het concept van deze studie wordt geïllustreerd in Aanvullende Figuur 1. Deze studie analyseerde gegevens uit twee grote bronnen, de Medical Information Mart for Intensive Care IV (mimic-iv) en de Telehealth Intensive Care Unit (eICU) databases, om een voorspellend model te construeren van pneumonie-geassocieerde ARDS en getroffen patiënten te classificeren op basis van klinische fenotypes. Deze studie volgde de richtlijnen van het Transparent Reporting of a Multivariable Prediction Model for Individual Prognosis or Diagnosis (TRIPOD).
Studievoorbeelden
De trainings- en testgegevens van deze studie zijn verkregen van MIMIC-IV. De bron van externe verificatie was de multicenter eICU-database. Deze studie gebruikte de International Classification of Diseases (Negende en Tiende Revisie) om gegevens te verzamelen over patiënten met longontsteking en longontstekingsgeassocieerde ARDS. Patiënten die minder dan 24 uur waren opgenomen, werden uitgesloten.
Voorspellers
Na evaluatie van de beschikbaarheid van gegevens en het aantal ontbrekende klinische variabelen in de MIMIC-IV- en eICU-datasets, werden 52 variabelen voor longontstekingsgeassocieerde ARDS geselecteerd als kandidaat-trainingsvariabelen voor gebruik in machine learning, inclusief demografische kenmerken van patiënten, laboratoriumbevindingen en scores van de ernst van de ziekte. Deze studie gebruikte een gewicht-door-correlatie-algoritme (gebaseerd op het correlatiegewicht tussen variabelen en uitkomsten) om te screenen op belangrijke voorspellers (variabelen die uiteindelijk in de modellen worden opgenomen) van de 52 kandidaatvariabelen en selecteerde vervolgens subgroepclusteringsfactoren uit de belangrijkste voorspellers.
Om dit te doen, open je RapidMiner Studio, maak je een nieuw proces aan en voeg je de operator Gewicht per Correlatie toe door te klikken op Proces > Operators > Feature Selection > Weight by Correlation. Stel de parameter in: Correlatiedrempel = 0,04 (behoud variabelen met gewicht > 0,04). Om het model te dwingen rekening te houden met vroege stadia van de ziekte en tijdigheid, werden binnen 24 uur na opname de maximale en minimale waarden van laboratoriumindicatoren verkregen. Omdat de Acute Physiology Score III (APSIII) niet was opgenomen in de eICU-database, werden in plaats daarvan scores op de Acute Physiology and Chronic Health Evaluation IV (APACHE IV) gebruikt. Deze studie zuiverde de gegevens en interpoleerde de ontbrekende waarden met behulp van de meervoudige imputatiemethode en standaardiseerde de invoervariabelen bij het ontwikkelen van voorspellings- en subfenotyperingsmodellen.
Statistische analyse
Open SPSS 23.0, importeer de vooraf bewerkte dataset en selecteer Analyseren > Beschrijvende Statistieken > Verkennen. Controleer normaliteitsgrafieken met tests om de Kolmogorov-Smirnov-test voor continue variabelen uit te voeren. Scheve verspreide variabelen worden gerapporteerd als mediaan (interkwartielbereik, IQR); categorische variabelen worden gerapporteerd als aantal (percentage, %). Om continue variabelen tussen groepen te vergelijken, werd de Mann-Whitney U-test of de Kruskal-Wallis-test gebruikt, afhankelijk van toepassing. Om categorische variabelen tussen groepen te vergelijken, werd de chi-kwadraattoets van Pearson of de exacte test van Fisher gebruikt, afhankelijk van toepassing.
Modelontwikkeling en webpresentatie
Voor modelontwikkeling verdeelde deze studie de MIMIC-IV afleidingscohort in een trainingsset (90% van de volledige steekproef willekeurig gekozen voor modelontwikkeling en hyperparameterafstemming) en een testset (10% van de volledige steekproef willekeurig gekozen voor intern testen); deze studie voerde externe verificatie uit op de eICU. Deze studie implementeerde machine learning met vijf methoden: beslissingsboom, logistische regressie, naïeve bayes, stapeling (basisleraren waren de logistische regressie, naïeve bayes en random forest-methoden; de stacking learner was de decision tree-methode), en random forest. Beslissingsboom: klik op Proces > Operatoren > Modellering > Classificatie > Beslissingsboom met Algoritme = C4.5, Minimale bladgrootte = 5. Voor logistische regressie: klik op Proces > Operators > Modellering > Classificatie > Logistische Regressie met Regularisatiesterkte = 0,1, Maximale iteraties = 100. Voor Naïeve Bayes: klik op Proces > Operatoren > Modellering > Classificatie > Naïve Bayes met Kerneltype = Gaussiaans. Voor Willekeurig bos: klik op Proces > Operatoren > Modellering > Classificatie > Willekeurig Bos met Aantal bomen = 100, Maximale diepte = 20. Voor stapeling: klik op Proces > operatoren > modellering > ensemble > stapelen met basisleraars = logistische regressie + naïeve bayes + willekeurig bos; Stacking learner = Decision Tree. Deze studie mat de voorspellingsprestaties van het ontwikkelde model door het oppervlak onder de receiver operating characteristic curve (AUC), nauwkeurigheid, precisie en recall te berekenen.
Bij het opstellen van de classificatie van pneumonie-geassocieerde ARDS-klinische subgroepen gebruikte deze studie k-means clustering met belangrijke voorspellers. Om het optimale aantal cluster k te bepalen, werd de waarde van de Gap-statistieken in de Gap-statistiekgrafiek onderzocht, wat het optimale aantal clusters suggereerde. Deze studie analyseerde de klinische kenmerken en uitkomsten van verschillende fenotypen, en we vergeleken de verschillen in sterftecijfers in het ziekenhuis tussen patiënten met verschillende clusters die wel of niet vroege lage tot middelhoge dosis corticosteroïden ontvingen.
Selecteer in RapidMiner Studio Bestand > Exportmodel en sla de diagnosevoorspellings- en subgroepclassificatiemodellen op als .model-bestanden. Gebruik JDK Java SE 8u381 en Eclipse IDE 2023-09 om webpagina's in de Java-taal te schrijven; Importeer de .model-bestanden in het project. Deze studie gebruikte de Java-taal om een webpagina te ontwikkelen waarop het diagnostisch model en het klinische subgroepclusteringsmodel werden ingebed, en we hebben het model online geüpload.