Onderzoeksartikel

Multimodel interpreteerbare machine learning voor osteoporosevoorspelling bij diabetes met behulp van een grote intensive care elektronische patiëntendossierdatabase

DOI:

10.3791/71386

30 juni 2026

In dit artikel

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dit protocol beschrijft de ontwikkeling en evaluatie van een interpreteerbaar ensembleboomgebaseerd machine learning-model met behulp van routinematig verzamelde klinische gegevens om het osteoporoserisico bij patiënten met diabetes te voorspellen.

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Diabetes mellitus wordt geassocieerd met een verhoogde skeletfragiliteit en een verhoogd breukrisico; echter, vroege identificatie van osteoporose (OP) bij diabetische populaties blijft een uitdaging. Deze studie had als doel meerdere machine learning (ML) modellen te ontwikkelen en te vergelijken voor het voorspellen van OP bij patiënten met diabetes, terwijl hun klinische bruikbaarheid werd geëvalueerd en de transparantie van het model werd verbeterd met behulp van SHapley Additive exPlanations (SHAP). Met behulp van routinematig verzamelde demografische en laboratoriumgegevens uit de MIMIC-IV-database werden meerdere ML-algoritmen, waaronder boomensembles, gradient boosting en lineaire baselines, getraind en gevalideerd. De modelprestaties werden uitgebreid geëvalueerd met behulp van discriminatiemetrics, waaronder het oppervlak onder de receiver operating characteristic curve (AUC) en precisie–recall-analyse, evenals kanskalibratiecurves en beslissingscurveanalyse (DCA) om het netto klinisch voordeel te beoordelen. Het best presterende model werd verder geïnterpreteerd met behulp van SHAP om featurebijdragen te kwantificeren en te visualiseren op zowel globaal als individueel niveau. Van alle geëvalueerde modellen toonden op basis van ensemble-boommethoden verbeterde prestaties. De ExtraTrees-classifier behaalde de hoogste validatieprestaties (AUC = 0,862; gemiddelde precisie = 0,866). Bovendien vertoonde het geselecteerde model uitstekende kanskalibratie (Brier-score = 0,154) en toonde het aanzienlijk netto klinisch voordeel over een breed scala aan risicodrempels in de DCA. SHAP-analyse identificeerde geslacht en leeftijd als de meest invloedrijke voorspellers, gevolgd door routinematige hematologische en metabole laboratoriumindicatoren. Lokale verklaringen boden klinisch interpreteerbare inzichten in individuele voorspellingen. Een interpreteerbaar ensembleboomgebaseerd model voorspelt effectief het OP-risico bij patiënten met diabetes met behulp van routinematig beschikbare klinische variabelen. De integratie van SHAP verbetert de klinische transparantie, en sterke kalibratie in combinatie met positief netto klinisch voordeel ondersteunt de potentiële implementatie ervan als een betrouwbaar hulpmiddel voor de vroege risicostratificatie van de OP-risico's bij diabetische populaties.

Inleiding

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Diabetes mellitus en osteoporose (OP) zijn zeer voorkomende chronische aandoeningen die steeds vaker naast elkaar bestaan, wat een aanzienlijke last veroorzaakt door fragiliteitsfracturen, invaliditeit en zorgkosten. Bij patiënten met type 2 diabetes (T2D) is het breukrisico paradoxaal genoeg verhoogd, zelfs wanneer de oppervlaktelijke botmineraaldichtheid (BMD), gemeten met dual-energy X-ray absorptiometrie (DXA), behouden blijft of hoger is dan verwacht, wat benadrukt dat botkwaliteit en systemische metabole factoren belangrijk bijdragen aan skeletfragiliteit 1,2. Hoewel DXA de klinische standaard is voor het diagnosticeren van OP, blijven de toegankelijkheid en het gebruik ervan in veel situaties beperkt, en kan DXA-gebaseerde beoordeling het diabetesgerelateerde skeletrisico onderschrijden. Op populatieniveau suggereert meta-analytisch bewijs dat OP vaak voorkomt bij mensen met diabetes, hoewel prevalentieschattingen variëren tussen cohorten en klinische contexten3. Daarom is er een cruciale klinische behoefte en sterke motivatie om pragmatische, schaalbare risicovoorspellingsinstrumenten te ontwikkelen die gebruikmaken van routinematig verzamelde klinische gegevens om risicovolle patiënten eerder te identificeren, en zo gerichte screening en individuele preventiestrategieën sturen.

In de afgelopen jaren zijn machine learning (ML)-methoden steeds vaker gebruikt om complexe, niet-lineaire relaties in klinische data te modelleren en om OP risicovoorspellers te bouwen voor patiënten met diabetes. Eerdere studies hebben veelbelovende discriminatie aangetoond met behulp van algoritmen zoals gradient boosting, support vector machines, neurale netwerken en nomogram-achtige tools. Specifiek hebben recente ontwikkelingen innovatieve modelleringsstrategieën onderzocht, zoals de fusie van ML met fuzzy logica, om OP en diabetesgerelateerde risico's te voorspellen op basis van aanpasbare factoren 4,5,6. Er blijft echter een aanzienlijke onderzoekskloof bestaan: veel bestaande modellen zijn ontwikkeld in beperkte subgroepen (bijvoorbeeld uitsluitend postmenopauzale vrouwen of oudere T2D-patiënten) en geëvalueerd binnen een beperkte set kandidaatalgoritmen, waardoor onzekerheid blijft over welke modelleerkeuzes optimaal zijn voor bredere diabetische populaties en heterogene elektronische patiëntendossiergegevens (EPD). Bovendien is een cruciale belemmering voor de klinische adoptie van deze hoogpresterende ML-modellen hun "black box"-karakter, die het vertrouwen van clinici beperkt en de vertaling naar uitvoerbare besluitvorming belemmert. SHapley Additive exPlanations (SHAP) biedt een oplossing door case-niveau verklaringen te bieden, waarbij elke voorspelling wordt toegeschreven aan individuele kenmerken met behulp van Shapley-waarden, zodat clinici kunnen verifiëren of de redenering van het model overeenkomt met klinische plausibiliteit.

Om deze hiaten te dichten, hebben we een OP risicovoorspellingsraamwerk ontwikkeld en gevalideerd voor patiënten met diabetes met behulp van de Medical Information Mart for Intensive Care IV (MIMIC-IV) critical care EPD-database7. De nieuwheid van deze studie ligt in de uitgebreide benchmarking over meerdere ML-modelfamilies, gecombineerd met transparante, SHAP-gebaseerde interpreteerbaarheid binnen een grote, klinisch complexe diabetische cohort. In tegenstelling tot studies die zich op één algoritme concentreren, selecteert onze end-to-end aanpak systematisch het best presterende model op basis van rigoureuze validatie en biedt het transparante, patiëntniveau verklaringen. Dit kader is bedoeld om zowel robuuste voorspellende prestaties als klinisch bruikbare inzichten te leveren, ter ondersteuning van een vroegere risicostratificatie voor OP bij patiënten met diabetes.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gegevensbron- en ethische verklaring
Deze retrospectieve studie gebruikte gegevens van de MIMIC-IV (versie 3.1), een publiek toegankelijke, gedeïdentificeerde intensive care EPD-database die op PhysioNet wordt gehost. De database bevat demografische informatie, vitale functies, laboratoriumtesten, diagnoses, procedures en medicatie.

Toegang tot MIMIC-IV vereist geaccrediteerde autorisatie en naleving van de PhysioNet-gegevensgebruiksovereenkomst en trainingsvereisten. De onderzoekers voltooiden de vereiste training en kregen toegang (certificaatnummer: 68351548). Omdat de database is gedeidentificeerd, analyseerde deze studie geanonimiseerde gegevens en hield geen direct contact met patiënten; Daarom was geïnformeerde toestemming niet vereist. De volledige, stapsgewijze uitvoerbare modelleringsworkflow wordt geïllustreerd in Figuur 1.

figure-protocol-1
Figuur 1. Algemene modelleringsworkflow voor osteoporose (OP) risicovoorspelling bij patiënten met diabetes. Schematische weergave van de studiepijplijn, inclusief cohortidentificatie, data-extractie, feature engineering, multi-model benchmarking, modelselectie op basis van validatieprestaties en SHAP-gebaseerde interpreteerbaarheid van het uiteindelijke model. Klik hier om een grotere versie van deze figuur te bekijken.

Populatie en gegevensextractie bestuderen
Gegevens werden geëxtraheerd uit de Medical Information Mart for Intensive Care IV (MIMIC-IV) database met behulp van een databasebeheertool. Om reproduceerbaarheid te waarborgen, worden de exacte SQL-queries, inclusief tabelnamen en filterlogica die worden gebruikt voor cohortopvraging, opgenomen in Aanvullend Bestand 1. Volwassen patiënten (≥18 jaar) die de diagnose diabetes mellitus kregen werden geïdentificeerd met ICD-9-codes (249, 250) en ICD-10-codes (E08–E13). De primaire uitkomst, OP, werd gedefinieerd met ICD-9 codes (733.x) en ICD-10 codes (M80, M81, M82). Binnen de initiële in aanmerking komende diabetische cohort (n = 46.226) werden 3.672 positieve gebeurtenissen (patiënten met OP) en 42.554 negatieve gebeurtenissen (patiënten zonder OP) geïdentificeerd. Een gedetailleerd stroomschema voor patiëntselectie en uitval is te zien in Figuur 2.

figure-protocol-2
Figuur 2. Stroomdiagram van patiëntselectie en cohortconstructie. Het stroomdiagram illustreert de stapsgewijze cohortafleiding uit de MIMIC-IV (v3.1) database. Volwassen patiënten met diabetes mellitus werden geïdentificeerd met ICD-codes, gevolgd door uitsluiting van patiënten met leeftijd & LT; 18 jaar, ontbrekende kritieke data & gt; 30%, of ongeldige gegevens. De laatste cohort was verdeeld in OP (positieve gebeurtenissen) en niet-OP (negatieve gebeurtenissen). Klasse-onevenwicht werd aangepakt met willekeurige ondersteekproeven en SMOTE toegepast op de trainingsgegevens vóór het splitsen van gestratificeerde datasets. Klik hier om een grotere versie van deze figuur te bekijken.

Feature-engineering
Om eerlijke benchmarking te waarborgen over meerdere ML-algoritmen en nauwkeurige reproduceerbaarheid, werd een identieke reeks preprocessing-stappen toegepast: featureselectie, ontbrekende waarde imputatie, continue feature scaling, class balancing en dataset-splitsing. De volledige lijst van invoerfuncties, inclusief variabelennamen, eenheden en databronnen, wordt beschreven in Tabel 1.

KenmerkenTotaal
(n = 14.688)
Trainingsset
(n = 9.546)
Validatieset
(n = 2.204)
Testset
(n = 2.938)
P-waarde
Geslacht0.345
Mannelijk6222 (42.36%)4045 (42.37%)935 (42.42%)1242 (42.27%)
Vrouwelijk8466 (57.64%)5501 (57.63%)1269 (57.58%)1696 (57.73%)
Leeftijd0,28 (−0,40, 0,94)0,28 (−0,43, 0,94)0,23 (−0,46, 0,89)0,28 (−0,39, 0,95)0.1655
Rode bloedcellen−0,14 (−0,79, 0,49)−0,13 (−0,79, 0,49)−0,17 (−0,83, 0,48)−0,14 (−0,76, 0,49)0.3641
Hematocriet−0,14 (−0,81, 0,52)−0,13 (−0,80, 0,52)−0,14 (−0,87, 0,51)−0,16 (−0,81, 0,52)0.3709
Hemoglobine−0,12 (−0,79, 0,52)−0,12 (−0,79, 0,51)−0,15 (−0,86, 0,53)−0,13 (−0,78, 0,52)0.3616
RDW−0,16 (−0,59, 0,45)−0,17 (−0,59, 0,46)−0,14 (−0,59, 0,45)−0,17 (−0,60, 0,42)0.5803
Fosfaat−0,14 (−0,60, 0,38)−0,15 (−0,61, 0,38)−0,11 (−0,57, 0,38)−0,13 (−0,56, 0,34)0.415
MCV0,05 (−0,50, 0,63)0,06 (−0,50, 0,65)0,03 (−0,49, 0,65)0,02 (−0,50, 0,59)0.5408
Magnesium−0,10 (−0,52, 0,37)−0,10 (−0,52, 0,37)−0,10 (−0,52, 0,37)−0,09 (−0,50, 0,37)0.7797
Witte bloedcellen−0,16 (−0,47, 0,21)−0,16 (−0,47, 0,20)−0,15 (−0,48, 0,25)−0,16 (−0,46, 0,20)0.6856
Anionkloof−0,12 (−0,64, 0,45)−0,13 (−0,64, 0,45)−0,07 (−0,61, 0,48)−0,13 (−0,64, 0,45)0.1217
Creatinine−0,30 (−0,48, 0,01)−0,30 (−0,48, 0,01)−0,30 (−0,46, 0,01)−0,30 (−0,48, −0,00)0.3323
MCH0,11 (−0,48, 0,62)0,12 (−0,48, 0,62)0,11 (−0,47, 0,62)0,09 (−0,48, 0,61)0.5195
Bloedplaatjesaantal−0,09 (−0,61, 0,49)−0,09 (−0,61, 0,49)−0,08 (−0,62, 0,47)−0,10 (−0,62, 0,48)0.9709
MCHC−0,00 (−0,59, 0,59)−0,00 (−0,60, 0,59)−0,00 (−0,57, 0,58)0,00 (−0,57, 0,60)0.9263
Chloride0,05 (−0,54, 0,64)0,05 (−0,52, 0,65)0,03 (−0,59, 0,62)0,07 (−0,52, 0,62)0.4675
Kalium−0,07 (−0,67, 0,53)−0,09 (−0,67, 0,53)−0,07 (−0,67, 0,53)−0,07 (−0,62, 0,53)0.3071
Natrium0,05 (−0,56, 0,60)0,05 (−0,55, 0,60)−0,00 (−0,60, 0,60)0,07 (−0,57, 0,61)0.3492
Ureumstikstof−0,28 (−0,60, 0,29)−0,28 (−0,60, 0,29)−0,26 (−0,59, 0,31)−0,28 (−0,59, 0,25)0.6826
Totaal calcium0,02 (−0,61, 0,59)0,02 (−0,61, 0,59)−0,01 (−0,59, 0,56)0,01 (−0,61, 0,60)0.8203

Tabel 1. Basiskenmerken en geengineerde kenmerken van de studiecohort. Categorische variabelen worden gepresenteerd als n (%). Continue variabelen worden gepresenteerd als mediaan (interkwartielbereik) van gestandaardiseerde waarden. P-waarden werden berekend om de verdelingen over de trainings-, validatie- en testsets te vergelijken met behulp van passende statistische tests.

Continue variabelen met herhaalde metingen werden geaggregeerd met behulp van het rekenkundige gemiddelde binnen het volledige observatievenster van het ICU-verblijf om één kenmerk per patiënt te verkrijgen. Variabelen met een ontbrekingspercentage van meer dan 30% werden uitgesloten. Voor de overige numerieke variabelen werden ontbrekende waarden berekend met het K-Nearest Neighbors (KNN) algoritme (n_neighbors = 5, gewichten = 'uniform'). Categorische variabelen werden geïimputeerd met de meest voorkomende categorie en vervolgens getransformeerd met binaire mapping, waarbij onzichtbare categorieën een vector van nullen kregen toegewezen.

Continue variabelen werden gestandaardiseerd met behulp van de z-score schaalformule (). Kenmerken met nul variantie werden expliciet verwijderd vóór de schaalverdeling. Alle preprocessingparameters (μ en σ.) werden strikt op de trainingsset gescat en consequent toegepast op de validatie- en testsets.

Gezien de ernstige klassenongelijkheid (3.672 versus 42.554) werd een hybride balanceringsstrategie uitsluitend toegepast op de trainingsdata om te voorkomen dat prestatieschattingen te hoog gaan. Eerst werd willekeurige onderbemonstering gebruikt om de meerderheid negatieve klasse te verminderen tot een 1:2 (positief:negatief) verhouding (wat 7.344 negatieve steekproeven opleverde). Vervolgens werd de Synthetic Minority Over-sampling Technique (SMOTE) toegepast op de positieve klasse om een uiteindelijke 1:1 gebalanceerde verhouding te bereiken (7.344 vs. 7.344)8.

Ten slotte werd de cohort op patiëntniveau opgesplitst in training (65%), validatie (15%) en testsets (20%) met behulp van gestratificeerde steekproeven. Om alle willekeurige processen over imputatie, balans en splitsing strikt te controleren, werd een globale willekeurige seed (random_state = 42) gehandhaafd.

Modelarchitectuur
Om het meest geschikte voorspellende model voor het OP-risico bij patiënten met diabetes te identificeren, werd een grootschalig benchmarkingkader gebruikt om 70 ML-algoritmevarianten te vergelijken onder een identiek datarepresentatie- en evaluatieprotocol. Kandidaatmodelfamilies omvatten geregulariseerde lineaire classifiers, support vector machines (SVM's), kNN, boomensembles, gradient boosting-architecturen en meerlagige perceptrons 9,10,11,12,13,14,15,16,17.

In plaats van een traditionele rasterzoekopdracht werd hyperparameteroptimalisatie uitgevoerd door vooraf gedefinieerde, robuuste configuraties te evalueren over deze 70 modelvarianten op de trainingssplit. De selectie was strikt gebaseerd op het maximaliseren van het oppervlak onder de receiver operating characteristic (ROC) curve (AUC) op de validatieset. Het uiteindelijke best presterende model was geconfigureerd met n_estimators = 200, waarbij andere parameters op de standaardinstellingen van het softwarepakket in de Table of Materials bleven. Evaluatiemetrics, waaronder AUC, nauwkeurigheid, F1-score, precisie en recall, werden berekend met een standaard 0,5 kansdrempel van 0,5.

Om klinische transparantie te ondersteunen, werd SHAP toegepast op het geselecteerde model met behulp van de TreeExplainer-methode. Gezien de boom-gebaseerde aard van het uiteindelijke model, werden exacte boompad-afhankelijke verwachte waarden gebruikt als achtergrondconfiguratie.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Modelprestatievergelijking
Om de optimale voorspellende benadering voor OP bij patiënten met diabetes te identificeren, werden meerdere ML-modellen systematisch vergeleken. Een geregulariseerde lineaire classifier (logistische regressie) werd opgenomen als basisregelmodel. De algehele prestatievergelijking is samengevat in Figuren 3–6. Over alle geëvalueerde modellen presteerden op basis van ensembleboomen beter dan de lineaire basislijn qua discrimin...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

In deze studie werden meerdere ML-algoritmen systematisch vergeleken om een optimaal voorspellend model voor OP te identificeren bij patiënten met diabetes. Op basis van de ensemble tree-methoden, met name het ExtraTrees-model, toonden verbeterde discriminatie, betrouwbare kanskalibratie en een groter netto klinisch voordeel vergeleken met lineaire baselines en andere algoritmefamilies. Deze bevindingen geven aan dat niet-lineaire interacties en complexe kenmerkrelaties belangrijk zijn o...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs stellen dat het onderzoek is uitgevoerd zonder commerciële of financiële relaties die als een potentieel belangenconflict kunnen worden opgevat.

Dankbetuigingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs erkennen dankbaar de financiële steun van het Nantong Municipal Science and Technology Project (subsidienr. JC2023039) en het Social Development Guidance Program van het Nantong Science and Technology Bureau (subsidienummer MSZ2023054).

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Materialen

```html

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
CatBoostYandexv1.2 (of van toepassing)Gradient boosting algoritme geoptimaliseerd voor categorische kenmerken
imbalanced-learn (SMOTE)Scikit-learn Contribv0.11 (of van toepassing)Bibliotheek gebruikt om Synthetic Minority Over-sampling Technique uit te voeren voor klasse-balancering
LightGBMMicrosoft Corporationv4.0 (of van toepassing)Gradient boosting framework gebaseerd op beslisbomen
MatplotlibMatplotlib Development Teamv3.7 (of van toepassing)Visualisatiebibliotheek gebruikt voor het plotten van figuren en prestatiecurven
MIMIC-IV Clinical DatabasePhysioNetv3.1Publiek beschikbare elektronische gezondheidsrecord dataset uit de intensive care gebruikt als gegevensbron
Navicat PremiumPremiumSoft CyberTech Ltd.v17.0Databasebeheertool gebruikt voor SQL-gebaseerde gegevensextractie
NumPyNumPy Developersv1.24 (of van toepassing)Numerieke rekenbibliotheek gebruikt voor arraybewerkingen en gegevensverwerking
OpenPyXLEric Gazoni, Charlie Clarkv3.1 (of van toepassing)Bibliotheek gebruikt voor het lezen en schrijven van Excel-bestanden
PandasPandas Development Teamv2.0 (of van toepassing)Bibliotheek voor gegevensmanipulatie en -analyse voor gestructureerde datasets
PostgreSQLPostgreSQL Global Development Groupv14 (of van toepassing)Relationeel databasesysteem gebruikt om MIMIC-IV gegevens te queryen en te beheren
PythonPython Software Foundationv3.8+ (of van toepassing)Programmeertaal gebruikt voor gegevensverwerking, modellering en analyse
Scikit-learnScikit-learn Developersv1.3 (of van toepassing)Machine learning bibliotheek gebruikt voor modelontwikkeling, voorverwerking en evaluatie
SciPySciPy Developersv1.10 (of van toepassing)Wetenschappelijke rekenbibliotheek gebruikt voor statistische analyse
SeabornMichael Waskomv0.12 (of van toepassing)Statistische gegevensvisualisatiebibliotheek voor verbeterde grafische uitvoer
SHAP (SHapley Additive exPlanations)Scott Lundbergv0.42 (of van toepassing)Framework gebruikt om modelvoorspellingen te interpreteren met behulp van kenmerkattributiewaarden
XGBoostDMLC (Distributed Machine Learning Community)v2.0 (of van toepassing)Gradient boosting algoritme veel gebruikt voor gestructureerde gegevensmodellering
```

Herprints en machtigingen

Toestemming aanvragen om de tekst of afbeeldingen van dit JoVE-artikel te hergebruiken

Toestemming aanvragen

Trefwoorden

MedicineAlldiabetes mellitusosteoporosisMachine learningExtraTreesExplainable Artificial IntelligenceRisk predictionBone fragility

Gerelateerde artikelen