De studie werd goedgekeurd door de Institutionele Ethiekcommissie van het Yulin First Hospital, provincie Shaanxi, China. Omdat het ging om een retrospectieve analyse van routinematig verzamelde ziekenhuisgegevens, en omdat alle gegevens vóór de analyse waren geanonimiseerd, is de vereiste voor schriftelijke geïnformeerde toestemming kwijtgescholden. De studie werd uitgevoerd in overeenstemming met de institutionele vereisten voor gegevensbescherming en de principes van de Verklaring van Helsinki.
Data en methoden
Studiepopulatie en ontwerp
Dit was een retrospectieve cohortstudie in één centrum, uitgevoerd in het Yulin First Hospital in de provincie Shaanxi, China. De ziekenhuisgegevens van patiënten die tussen juli 2022 en december 2024 werden opgenomen met aSAH werden gescreend. In aanmerking komende patiënten waren volwassenen van 18 jaar of ouder met een diagnose van aSAH, bevestigd door craniale en intracraniale vasculaire beeldvorming. Van patiënten werd vereist dat zij binnen 72 h na het begin van de symptomen waren opgenomen en dat zij tijdens de indexopname een aneurysmabehandeling hadden ondergaan.
Patiënten werden uitgesloten indien zij een traumatische subarachnoïdale bloeding, een niet-aneurismatische subarachnoïdale bloeding, een ernstige reeds bestaande hematologische aandoening, een andere grote intracraniële aandoening die de beoordeling van de uitkomst beïnvloedde, onvoldoende dossiers voor DCI-evaluatie, of een overlijden in het ziekenhuis vóór een adequate DCI-beoordelingsperiode hadden. Het uitsluiten van vroege sterfgevallen in het ziekenhuis kan leiden tot survivorship bias, omdat de meest ernstige gevallen mogelijk uit de analyse worden verwijderd. Daarom moeten de bevindingen worden geïnterpreteerd als voornamelijk van toepassing op patiënten die lang genoeg overleefden voor een DCI-evaluatie.
Gegevensverzameling
Klinische, laboratorium-, beeldvormings- en behandelingsgerelateerde variabelen werden uit het elektronisch medisch dossier geëxtraheerd met behulp van een vooraf gedefinieerd data-extractieformulier. De geëxtraheerde variabelen omvatten demografische factoren, medische voorgeschiedenis, kenmerken van het aneurysma, de vroege neurologische graad, vroege beeldvormingsbevindingen, laboratoriumresultaten, de behandelingsaanpak en ziekenhuiscomplicaties. Het beoogde voorspellingsmoment was na voltooiing van de initiële opname en perioperatieve beoordeling, maar vóór het belangrijkste risikovenster voor DCI.
Leeftijd, geslacht, bodymassindex, rookstatus, alcoholgebruik, hypertensie, diabetes, aneurysmagrootte, locatie van het aneurysma, gemodificeerde Fisher-graad, Hunt-Hess-graad, World Federation of Neurological Surgeons-graad, intraventriculaire bloeding en herbloeding werden genoteerd op basis van opnamegegevens en initiële beeldvorming. Laboratoriumvariabelen, waaronder hemoglobine, serumalbumine en serumnatrium, werden verkregen uit de vroegst beschikbare bloedtest vóór het voorspellingsmoment. Cerebraal oedeem werd beoordeeld aan de hand van baseline-beeldvorming of onmiddellijke post-behandelingsbeeldvorming die beschikbaar was vóór de DCI-diagnose. Variabelen die pas na het begin van DCI werden geregistreerd, zijn niet gebruikt voor de modelontwikkeling om informatielekkage te beperken.
Anemie werd gedefinieerd als hemoglobine <110 g/L bij vrouwelijke patiënten en <120 g/L bij mannelijke patiënten. Hypoalbuminemie werd gedefinieerd als serumalbumine <35 g/L. Hyponatriëmie werd gedefinieerd als serumnatrium <130 mmol/L.
Patiënten werden behandeld volgens het institutionele zorgpad voor aSAH. De standaardbehandeling omvatte vroege clipping of coiling van het aneurysma, neurologische observatie, bloeddrukcontrole, vocht- en elektrolytenmanagement en surveillance op complicaties, waaronder hydrocefalie, rebleeding, insulten, infecties, vasospasmen en DCI. Nimodipine werd gebruikt, tenzij er sprake was van contra-indicaties. De monitoring van vasospasmen werd uitgevoerd middels neurologisch onderzoek, vasculaire beeldvorming en transcraniële Doppler-echografie wanneer dit klinisch geïndiceerd was. Hydrocefalie werd, indien nodig, behandeld door afvoer van het hersenvocht. Hemodynamische optimalisatie en rescue-therapie werden toegepast op basis van de beoordeling van het behandelteam. Omdat de intensiteit van de behandeling en de details van de rescue-therapie niet volledig waren vastgelegd in de retrospectieve dataset, konden deze factoren niet volledig in het model worden gecorrigeerd en werden zij als een beperking beschouwd.
Diagnose van DCI
DCI werd gedefinieerd als een nieuw focaal neurologisch defect, een afname van het bewustzijnsniveau of een nieuw cerebraal infarct op follow-up computertomografie of magnetische resonantie-imaging, optredend tijdens het verwachte risicovlak voor DCI en niet verklaarbaar door een andere oorzaak. Het risicovlak voor DCI werd gedefinieerd als dag 3–14 na de hemorragische ictus. Alternatieve verklaringen, waaronder herbloeding, hydrocefalie, insulten, infectie, metabole stoornissen, sedatieve effecten en procedure-gerelateerde infarcten, werden beoordeeld voordat een gebeurtenis als DCI werd geclassificeerd.
De beoordeling van de uitkomsten werd uitgevoerd door twee clinici met ervaring in de behandeling van aSAH, waaronder één neurochirurg en één neuroloog/arts neuro-intensive care. De beoordelaars bekeken de klinische verslagen, neurologische onderzoeken, beeldvormingsrapporten en follow-up beeldvorming. Tijdens de beoordeling van de uitkomsten waren zij geblindeerd voor de uiteindelijke modeluitvoer. Meningsverschillen werden opgelost via consensusdiscussies, waarbij de relevante beeldvorming en de klinische tijdlijn werden bekeken. De formele inter-beoordelaarsbetrouwbaarheid werd niet gemeten; deze beperking is toegevoegd omdat de classificatie van DCI een klinisch oordeel kan vereisen.
Berekening van de steekproefomvang
De steekproefomvang werd geschat op basis van de vuistregel van 10 gebeurtenissen per variabele (EPV)11. Met 20 kandidaat-predictoren en een verwachte incidentie van DCI van ongeveer 35%, was een minimale steekproefomvang van 20 × 10 / 0,35 ≈ 572 patiënten vereist. Onze uiteindelijke cohort van 680 patiënten overtrof deze vereiste. Hoewel de events-per-variable (EPV) regel als algemene richtlijn is toegepast, kan moderne predictieve modellering, in het bijzonder machine learning-algoritmen, flexibelere overwegingen met betrekking tot de steekproefomvang vereisen. De uiteindelijke cohortomvang werd als adequaat beschouwd om modelstabiliteit te waarborgen, het risico op overfitting te minimaliseren en een betrouwbare schatting van de modelperformantie-metrieken mogelijk te maken.
Modelontwikkeling en validatie
Patiënten werden toegewezen aan een trainingscohort van 544 patiënten en een intern validatiecohort van 136 patiënten met behulp van een uitkomstgestratificeerde 8:2 splitsing. Uitkomststratificatie werd gebruikt om een vergelijkbare proportie DCI-gebeurtenissen in de twee cohorten te behouden. DCI trad op bij 175 van de 544 patiënten in het trainingscohort en bij 42 van de 136 patiënten in het interne validatiecohort. Het 8:2 hold-out ontwerp is behouden omdat dit de vooraf gespecificeerde strategie voor modelontwikkeling was en een apart cohort bood voor een voorlopige interne prestatiebeoordeling.
De selectie van predictoren werd uitsluitend uitgevoerd in de trainingscohort met behulp van least absolute shrinkage and selection operator-regressie met 10-voudige kruisvalidatie. De geselecteerde strafparameter was λ = 0.031. Zes predictoren werden behouden: leeftijd, hersenoedeem, hypoalbuminemie, gemodificeerde Fisher-graad, Hunt-Hess-graad en World Federation of Neurological Surgeons-graad.
Modellen voor logistische regressie, extreme gradient boosting, light gradient boosting machine, support vector machine en k-dichtstbijzijnde buren werden ontwikkeld met behulp van dezelfde set geselecteerde predictoren. Alle procedures voor voorbewerking, selectie van predictoren en modelontwikkeling waren beperkt tot de trainingscohort. De interne validatiecohort werd niet gebruikt tijdens de selectie van predictoren of de modeloptimalisatie en werd pas geëvalueerd na de modelontwikkeling.
De numerieke random seed die werd gebruikt voor de oorspronkelijke cohorttoewijzing is niet bewaard gebleven in de gearchiveerde analyseregisters en kon retrospectief niet worden geverifieerd. Bootstrap-optimismecorrectie en herhaalde k-fold interne validatie waren evenmin beschikbaar. Daarom wordt de huidige analyse beschreven als een enkele hold-out interne validatie in plaats van een optimismecorrectie of een herhaald cross-gevalideerde prestatiebeoordeling.
Reproduceerbaarheid van machine learning
Voor de selectie van LASSO-predictoren werd 10-voudige kruisvalidatie toegepast binnen de trainingscohort. Continue predictoren werden gestandaardiseerd wanneer dit vereist was door het modelleringsalgoritme, en categorische predictoren werden weergegeven met behulp van vooraf gedefinieerde binaire klinische categorieën. De validatiecohort werd niet gebruikt voor afstemming of modelselectie.
De gearchiveerde analysematerialen bevatten niet de definitieve tuning-grids, geselecteerde hyperparameters, volledige pakketversies, de oorspronkelijke random seed of een bevestigde procedure voor klasse-onbalans voor XGBoost, LightGBM, SVM en KNN. Deze instellingen zijn daarom niet gereconstrueerd of geschat. De vergelijkingen tussen de machine-learning-modellen moeten bijgevolg worden geïnterpreteerd als verkennende vergelijkingen van algoritmen in plaats van volledig reproduceerbare experimenten voor modelontwikkeling. Informatie over de reproduceerbaarheid, zowel beschikbaar als niet beschikbaar, dient te worden samengevat in Aanvullende Tabel 1.
Biascontrole & sensitiviteitsanalyse
Opeenvolgende geschikte patiënten werden geïncludeerd om selectiebias te verminderen. Gestandaardiseerde variabeledefinities en een gestructureerd data-extractieformulier werden gebruikt om informatiebias te verminderen. Predictoren werden beperkt tot informatie die beschikbaar was vóór het beoogde tijdstip van de DCI-voorspelling om informatielekkage te verminderen. Predictorselectie, preprocessing en modelontwikkeling werden uitsluitend uitgevoerd in de trainingscohort.
De aangepaste Fisher-graad, de Hunt-Hess-graad en de WFNS-graad vertegenwoordigen gerelateerde aspecten van de bloedingslast en de neurologische ernst. Hoewel alle drie de variabelen behouden bleven na LASSO-selectie, zijn de numerieke waarden van de variantie-inflatiefactor en de resultaten van een sensitiviteitsmodel waarin overlappende ernstschalen waren uitgesloten, niet opgenomen in de gearchiveerde analyse-output. Deze analyses konden niet worden gereconstrueerd uit de geaggregeerde tabellen, omdat correlaties op patiëntniveau en de output van de gefitte modellen vereist zijn. Daarom werden de individuele coëfficiënten van deze ernstmaten niet geïnterpreteerd als onafhankelijke of causale effecten. Ze werden uitsluitend behouden als componenten van het voorspellingsmodel dat in de trainingscohort was geselecteerd.
Interpreteerbaarheid van het model
Men geloofde dat klinische toepasbaarheid modelinterpreteerbaarheid als een cruciaal element vereiste. In het meest effectieve model werden de effecten van predictoren overwogen om de klinische plausibiliteit en de overeenstemming met bestaande pathofysiologische kennis over vertraagde cerebrale ischemie te beoordelen. Deze methode maakte een duidelijke beoordeling van het modelgedrag mogelijk en verbeterde het potentieel voor klinische vertaling.
Ontbrekende gegevens
Ontbrekende gegevens op variabelenniveau werden geëvalueerd tijdens de datapreparatie. De oorspronkelijke aantallen en percentages ontbrekende gegevens per kandidaatvariabele vóór imputatie zijn echter niet bewaard gebleven in de gearchiveerde analyseresultaten en konden niet nauwkeurig worden gereconstrueerd uit de geaggregeerde tabellen. Bijgevolg is er geen aanname van volledige data gedaan en zijn er geen niet-geverifieerde percentages van ontbrekende gegevens gerapporteerd.
Een geverifieerde aanvullende tabel met ontbrekende gegevens moet rechtstreeks worden gegenereerd uit de oorspronkelijke gedeïdentificeerde dataset op patiëntniveau. Aanvullende Tabel 2 moet voor elke kandidaatvariabele het aantal en het percentage ontbrekende waarnemingen vóór de gegevensverwerking rapporteren, de methode die is gebruikt om de ontbrekende gegevens aan te pakken, en het aantal waarnemingen dat is opgenomen in de uiteindelijke analyse. Het onvermogen om het oorspronkelijke, variabele-specifieke patroon van ontbrekende gegevens te herstellen, werd beschouwd als een beperking van het huidige rapport.
Statistische Analyse
De selectie van predictoren werd uitgevoerd in de trainingscohort met behulp van LASSO-regressie met 10-voudige kruisvalidatie. De discriminatie werd beoordeeld aan de hand van het oppervlak onder de receiver operating characteristic-curve met 95% betrouwbaarheidsintervallen. De kalibratie werd beschreven met behulp van kalibratieplots en puntschattingen van de kalibratieshelling, het kalibratie-intercept en de Brier-score. Bootstrap-betrouwbaarheidsintervallen voor de kalibratiematen waren niet beschikbaar.
Drempelwaarde-afhankelijke classificatiematen werden berekend op basis van de beschikbare verwarringsmatrices voor interne validatie. De exacte numerieke kansdrempel die is gebruikt om de gearchiveerde verwarringsmatrices te genereren, is niet bewaard gebleven en kon niet worden geverifieerd. Daarom werden deze maten beschrijvend geïnterpreteerd en werden ze niet gebruikt als de primaire basis voor modelselectie. De decision-curve analyse werd eveneens als verkennend beschouwd, omdat het exact vooraf gespecificeerde drempelwaardebereik en de netto-voordeeluitvoer op patiëntniveau niet bewaard zijn gebleven. Een tweezijdige P waarde onder 0,05 werd beschouwd als statistisch significant.