Fuente de datos
Este estudio fue un análisis retrospectivo basado en la base de datos Medical Information Mart for Intensive Care IV (MIMIC-IV, versión 3.1), una base de datos pública de cuidados críticos alojada en PhysioNet (https://physionet.org/content/mimiciv/3.1/). La base de datos fue desarrollada mediante una colaboración entre el Laboratorio de Fisiología Computacional del Instituto Tecnológico de Massachusetts, el Beth Israel Deaconess Medical Center y Philips, y contiene datos clínicos completos y desidentificados, incluyendo información demográfica, signos vitales, mediciones de laboratorio e informes de medicación.
Todos los datos de pacientes en MIMIC-IV están completamente desidentificados conforme a la Ley de Portabilidad y Responsabilidad de Seguros de Salud (HIPAA), por lo que este estudio no requirió la aprobación de la junta de revisión institucional (IRB). El uso de la base de datos está regulado por un acuerdo de uso de datos (DUA), y el acceso solo se concede a usuarios autorizados que hayan completado la formación y certificación requeridas. Los autores completaron la formación necesaria y obtuvieron las credenciales de acceso (usuario acreditado por PhysioNet) y realizaron este estudio en cumplimiento de todas las normativas relevantes sobre el uso de datos.
Estudio de población y extracción de datos
Los pacientes adultos (≥18 años) que se sometieron a procedimientos neuroquirúrgicos de columna fueron identificados a partir de la base de datos MIMIC-IV utilizando códigos CIE relacionados con procedimientos. Los procedimientos neuroquirúrgicos espinales se definieron como códigos CIE-9 que comenzan por 03 (operaciones en la médula espinal y el canal espinal) y códigos CIE-10 que comenzan con 00B, 00H, 00J, 00N, 00P, 00Q, 00R, 00S, 00T o 00U (procedimientos relacionados con la médula espinal). Para los pacientes con múltiples ingresos hospitalarios, solo se mantuvo la primera admisión que contenía un procedimiento que calificaba para evitar mediciones repetidas por parte del mismo individuo.
La variable de resultado, osteoporosis, se definió en base a los códigos CIE-9 que comenzaban con 733 y los códigos CIE-10 que comenzaban con M80, M81 o M82 registrados durante la admisión del índice. Dado que tanto los predictores como el resultado se derivaron de la misma hospitalización, la tarea analítica en este estudio se enmarcó como una clasificación hospitalaria en lugar de una predicción prospectiva de riesgo.
Un total de 10.803 pacientes cumplieron los criterios de inclusión. Tras la división estratificada, el conjunto de datos se dividió en un conjunto de entrenamiento (n = 7.561), un conjunto de validación (n = 1.621) y un conjunto de prueba (n = 1.621). La distribución de clases era muy desequilibrada en todas las particiones. En el conjunto de entrenamiento, 499 pacientes (6,60%) fueron positivos para osteoporosis y 7.062 (93,40%) para osteoporosis negativa. En el conjunto de validación, 107 pacientes (6,60%) fueron positivos y 1.514 (93,40%) negativos. El conjunto de pruebas mostró la misma distribución, con 107 casos positivos (6,60%) y 1.514 negativos (93,40%).
Los datos clínicos se extrajeron utilizando software de gestión de bases de datos relacional de MIMIC-IV. Las variables extraídas incluyeron características demográficas (por ejemplo, edad y sexo), mediciones de laboratorio, signos vitales y registros de medicación. Para cada paciente, se utilizaron datos del ingreso índice para la construcción posterior de características.
Para asegurar una evaluación válida del modelo, el conjunto de datos se dividió primero en conjuntos de entrenamiento, validación y prueba utilizando muestreo estratificado (70%, 15% y 15%)3,7. Todos los pasos posteriores de preprocesamiento que pudieran introducir sesgo, incluyendo la selección de características y el remuestreo, se realizaron exclusivamente dentro del conjunto de entrenamiento. El desequilibrio de clases en el conjunto de entrenamiento se abordó mediante una combinación de reducción de muestreo de la clase mayoritaria y la Técnica de Sobremuestreo de Minorías Sintéticas (SMOTE), mientras que los conjuntos de validación y prueba mantuvieron la distribución original de clases para reflejar la prevalencia real.
Ingeniería de características
Se implementó una cadena de ingeniería de características en varias etapas para mejorar el rendimiento del modelo manteniendo la interpretabilidad. Para cada paciente, los registros de medicación, laboratorio y signos vitales del ingreso índice se agregaron en características a nivel resumen (por ejemplo, valores medios para mediciones repetidas y exposición media para medicamentos).
Para reducir la escasez de características, se excluyeron grupos candidatos con valores faltantes de más del 30%. Para evitar fugas de datos, este paso de filtrado se realizó exclusivamente usando el conjunto de entrenamiento, y el mismo conjunto de características se aplicó a los conjuntos de validación y prueba.
Posteriormente, se realizó un cribado de características univariadas a nivel de grupo de características utilizando la prueba U de Mann–Whitney para comparar las distribuciones entre pacientes positivos y negativos para osteoporosis. Los grupos de características se clasificaron según la significación estadística, y los grupos top-k (k = 20) se mantuvieron para la modelización posterior. Este procedimiento de selección también se realizó exclusivamente dentro del conjunto de entrenamiento para evitar fugas de información.
Dado el grado relativamente alto de ausencia entre los grupos de características candidatas, el papel principal de este paso de selección top-k era filtrar características con señales estadísticas débiles en lugar de optimizar estrictamente la dimensionalidad de las características. En la práctica, el rendimiento del modelo no fue muy sensible al valor exacto de k dentro de un rango razonable, lo que sugiere que este paso sirvió principalmente como un procedimiento de cribado orientado a la robustez para excluir características poco informativas y preservar señales clínicamente relevantes.
Se mantuvieron características demográficas básicas en todos los modelos. Los valores ausentes en estas variables demográficas se imputaron utilizando el valor medio calculado a partir del conjunto de entrenamiento. La imputación de medias fue elegida por su simplicidad y estabilidad en este gran conjunto de datos, aunque puede reducir la varianza e introducir sesgo; Se reconoce esta limitación.
Para características seleccionadas de medicamentos, laboratorio y signos vitales, la ausencia de una medición o exposición registrada se codificaba como cero para permitir una entrada numérica consistente para el entrenamiento del modelo. Reconocemos que este enfoque puede confundir valores verdaderos de cero con ausencia o no exposición, especialmente para variables donde cero no tiene significado fisiológico. Sin embargo, esta estrategia de codificación se aplicó de forma consistente en todas las muestras y fue seguida por la estandarización Z-score, que mitiga la distorsión relacionada con la escala. El posible impacto de esta suposición se discute como una limitación.
Todas las características numéricas se estandarizaron mediante la normalización de puntuaciones Z basada en la media y desviación estándar estimadas del conjunto de entrenamiento:
z = (x — μ)/σ
Donde x representa el valor bruto de la característica, y μ y σ denotan la media y la desviación estándar calculadas respecto al conjunto de entrenamiento. Las variables categóricas se codificaban numéricamente para cumplir con los requisitos de entrada de los modelos de aprendizaje profundo.
Esta estrategia de ingeniería de características permitió una reducción sistemática de la dimensionalidad mientras se preservaban dominios clínicamente relevantes, incluyendo demografía, función renal, índices hematológicos, marcadores inflamatorios y parámetros metabólicos. Las características de referencia detalladas de la población del estudio en los conjuntos de entrenamiento, validación y prueba se presentan en la Tabla 1.
| Características | Total | Conjunto de entrenamiento | Conjunto de validación | Conjunto de pruebas | Valor P |
| (n=5238) | (n=1996) | (n=1621) | (n=1621) |
| Género | | <0,001 |
| Masculino | 2477 (47.29%) | 834 (41.78%) | 797 (49.17%) | 846 (52.19%) | |
| Femenino | 2761 (52.71%) | 1162 (58.22%) | 824 (50.83%) | 775 (47.81%) | |
| Edad | 60.69 (48.29, 70.61) | 63.45 (52.00, 72.41) | 58.00 (46.00, 69.00) | 60.00 (46.00, 70.00) | <0,001 |
| Altura | 165.23 (160.79, 171.21) | 164.25(161.41, 172.23) | 166.32 (161.85, 171.22) | 165.22 (161.31, 169.89) | <0,001 |
| Peso | 72.01 (56.77, 82.46) | 75.45 (63.22, 81.45) | 70.55 (60.22, 79.33) | 73.62 (65.22, 81.88) | <0,001 |
| Senna | 1.00 (-0.73, 8.60) | 1.00 (-0.30, 8.60) | 1.00 (-1.00, 8.60) | 1.00 (-1.00, 8.60) | <0,001 |
| Docusato Sódico | 100.00 (100.00, 100.00) | 100.00 (100.00, 100.00) | 100.00 (100.00, 100.00) | 100.00 (100.00, 100.00) | 0.001 |
| Heparina | 5000.00 (1655.28, 5000.00) | 5000.00 (-1.00, 5000.00) | 5000.00 (1600.00, 5000.00) | 5000.00 (3750.00, 5000.00) | 0.292 |
| Lavado con cloruro de sodio al 0,9% | 3.00 (1.76, 3.00) | 3.00 (3.00, 3.00) | 3.00 (-1.00, 3.00) | 3.00 (3.00, 3.00) | <0,001 |
| Glóbulos rojos | 3.96 (3.51, 4.35) | 3.90 (3.49, 4.28) | 4.02 (3.53, 4.40) | 3.97 (3.50, 4.38) | <0,001 |
| Hemoglobina | 11.81 (10.51, 13.02) | 11.66 (10.47, 12.82) | 11.91 (10.58, 13.14) | 11.90 (10.49, 13.15) | <0,001 |
| RDW | 13.98 (13.22, 15.15) | 14.12 (13.35, 15.24) | 13.90 (13.10, 15.06) | 13.90 (13.18, 15.13) | <0,001 |
| Hematócrito | 35.67 (31.95, 39.00) | 35.32 (31.63, 38.50) | 36.00 (32.28, 39.37) | 35.77 (32.01, 39.25) | <0,001 |
| Gravedad específica | 1.01 (1.01, 1.02) | 1.01 (1.01, 1.02) | 1.01 (1.01, 1.02) | 1.01 (1.01, 1.02) | <0,001 |
| Bicarbonato | 25.72 (24.04, 27.15) | 25.86 (24.17, 27.27) | 25.65 (23.92, 27.03) | 25.62 (24.00, 27.12) | <0,001 |
| Neutrófilos | 68.67 (60.52, 76.23) | 69.41 (61.90, 76.52) | 68.10 (59.60, 75.88) | 68.34 (59.75, 76.23) | <0,001 |
| Creatinina | 0.82 (0.68, 1.02) | 0.81 (0.68, 1.00) | 0.83 (0.69, 1.02) | 0.83 (0.68, 1.03) | <0,001 |
| Fosfato | 3.29 (2.92, 3.64) | 3.27 (2.93, 3.57) | 3.30 (2.93, 3.69) | 3.30 (2.90, 3.65) | 0.002 |
| Nitrógeno ureico | 15.43 (12.08, 20.18) | 15.74 (12.50, 20.20) | 15.00 (11.64, 19.89) | 15.48 (12.00, 20.43) | <0,001 |
| Linfocitos | 19.12 (12.22, 26.15) | 18.81 (12.49, 25.30) | 19.36 (12.40, 27.07) | 19.24 (11.72, 26.27) | 0.001 |
| Alanina Aminotransferasa (ALT) | 20.49 (10.84, 32.82) | 20.47 (11.67, 32.06) | 20.00 (10.00, 32.93) | 21.00 (10.67, 33.67) | 0.3283 |
| MCV | 90.90 (87.50, 94.32) | 91.03 (87.64, 94.51) | 90.64 (87.43, 94.00) | 91.00 (87.40, 94.40) | <0,001 |
| MCHC | 33.14 (32.37, 33.92) | 33.11 (32.37, 33.88) | 33.16 (32.38, 33.97) | 33.16 (32.35, 33.93) | <0,001 |
| Basófilos | 0.42 (0.27, 0.61) | 0.41 (0.27, 0.59) | 0.45 (0.29, 0.63) | 0.41 (0.26, 0.60) | 0.037 |
Tabla 1. Características de referencia de la población del estudio estratificadas por conjuntos de entrenamiento, validación y prueba.
Arquitectura del modelo
Para modelar relaciones complejas entre características clínicas tabulares heterogéneas, empleamos una arquitectura basada en TabTransformer implementada usando el frameworkPyTorch 6. El modelo fue diseñado para procesar tanto variables categóricas como numéricas y para capturar interacciones contextuales entre características mediante un mecanismo de autoatención.
Representación de entrada
Las variables categóricas se transformaron primero en incrustaciones densas. Cada rasgo categórico se mapeaba a un vector de incrustación de dimensión d(embedding_dim = 256). Las características numéricas se estandarizaron mediante la normalización Z-score y luego se proyectaron en el mismo espacio de incrustación mediante una capa de transformación lineal, permitiendo el procesamiento conjunto con características categóricas.
Los vectores de características incrustados se concatenaron para formar una secuencia de tokens:
X = [x 1,x 2,... xn]
donde cada xi ∈ Rd representa una característica incrustada.
Codificador de transformador
Las incrustaciones de características concatenadas pasaban a través de una pila de capas de codificadores Transformer (num_layers = 3). Cada capa consistía en una autoatención multi-cabeza seguida de una red de avance de alimentación por posición.
El mecanismo de autoatención multicabeza se define como:
—> Atención(Q,K,V) = softmax
V
Donde Q, K y V denotan matrices de consulta, clave y valor. Se utilizaron múltiples cabezas de atención (num_heads = 8) para capturar diversas interacciones de características.
Cada bloque de transformador incluía autoatención multicabezal, conexión residual y normalización de capas, red de avance de alimentación, caída (tasa = 0,243).
Agregación y clasificación de características
La salida de la capa final del Transformer se aplanaba y pasaba por un perceptrón multicapa (MLP) para su clasificación. La MLP consistía en una o más capas completamente conectadas con funciones de activación no lineales.
La capa final de salida utilizó una función de activación sigmoide para producir la probabilidad predicha de osteoporosis:
—>
= σ(z)
Donde z es la salida logit.
Función de pérdida y estrategia de entrenamiento
El modelo se entrenó utilizando la pérdida binaria de entropía cruzada:
—> L = −(1/N) Σ [ yi log(ŷi) + (1 −y i) log(1 − ŷi) ]
Donde yi denota la etiqueta verdadera y
i la probabilidad predicha.
El modelo se optimizó usando el optimizador Adam (tasa de aprendizaje = 1,9e-4, tamaño de lote = 64) para 100 épocas. Se aplicó una parada temprana basada en el rendimiento de validación (paciencia = 15) para evitar el sobreajuste. Para apoyar la reproducibilidad, todos los procedimientos experimentales se realizaron utilizando una semilla aleatoria constante (semilla = 42).
Interpretabilidad del modelo
Para mejorar la interpretabilidad, se aplicaron SHapley Additives ExPlanations (SHAP) al modelo entrenado. Los valores de SHAP se calcularon en el conjunto de pruebas para cuantificar la contribución de cada característica al resultado predicho, permitiendo tanto la interpretación global como individual del comportamiento del modelo.
Como se ilustra en la Figura 1, el flujo de trabajo resume el proceso desde el preprocesamiento de datos MIMIC-IV hasta la construcción y clasificación del modelo. La arquitectura TabTransformer captura interacciones entre características tabulares heterogéneas mediante la autoatención, mientras que la visualización basada en SHAP proporciona información interpretable sobre las contribuciones de las características. Este marco permite un análisis internamente validado de los patrones relacionados con la osteoporosis en una cohorte neuroquirúrgica espinal heterogénea.

Figura 1. Estudia el flujo de trabajo y la arquitectura de modelos. Esta figura ilustra el diseño general del estudio, incluyendo la selección de cohortes, el preprocesamiento de datos, la ingeniería de características, la división de conjuntos de datos y el desarrollo de modelos. También resume la arquitectura TabTransformer utilizada para la clasificación, incluyendo incrustación de características, capas de codificadores Transformer y salida final de clasificación. Solo se incluyó la primera admisión que cumpliera los requisitos por paciente. Por favor, haz clic aquí para ver una versión ampliada de esta figura.