Este estudio fue revisado y aprobado por el Comité de Ética del Hospital de Cáncer de Taizhou. Se obtuvo el consentimiento informado por escrito de todos los participantes antes de la recolección de datos, de acuerdo con las normas éticas institucionales y nacionales. Los reactivos y el software utilizado se enumeran en la Tabla de materiales.
1. Descripción general del flujo de trabajo
El flujo de trabajo de extremo a extremo para procesar datos clínicos estructurados con XGBoost se muestra en la Figura 1 e incluye la ingesta de características, la construcción de árboles, las actualizaciones residuales, la regularización y la evaluación. El flujo de trabajo de preprocesamiento y modelado de secuencias para datos de monitoreo remoto con LSTM se muestra en la Figura 2, que abarca el remuestreo de 10 minutos, el manejo de brechas, las ventanas no superpuestas de 7 días, la arquitectura de red y la inferencia.
2. Reclutamiento de pacientes y datos demográficos
Los pacientes fueron reclutados consecutivamente de clínicas ambulatorias y salas de hospitalización en el Hospital Oncológico de Taizhou entre marzo de 2023 y enero de 2024. Los criterios de inclusión fueron un diagnóstico confirmado de EPOC según los criterios GOLD (FEV1/FVC < 70%), una condición estable en el momento de la inscripción y una edad entre 40 y 80 años. Los criterios de exclusión incluyeron comorbilidades graves como cáncer de pulmón, enfermedad cardiovascular no controlada o deterioro cognitivo que impida el consentimiento informado. Se inscribieron 214 pacientes (edad media 63,7 ± 8,9 años; 68% hombres; 54% fumadores actuales o ex fumadores).
3. Recopilación de datos
Los datos clínicos estructurados incluyeron la función pulmonar (FEV1, FVC), la saturación de oxígeno en sangre (SpO2), la duración de la estancia hospitalaria y la duración de la enfermedad. La función pulmonar y la SpO2 se registraron como porcentajes, la estancia hospitalaria en días y la duración de la enfermedad en años. Los datos de monitoreo remoto se recopilaron utilizando oxímetros portátiles certificados y rastreadores de actividad validados según los estándares de oro del hospital: los oxímetros de pulso se verificaron con monitores Masimo Rad-97 (error absoluto medio del 1,8% en el rango de SpO2 del 90-100%), los sensores de frecuencia cardíaca se validaron con electrocardiografía (error medio de 2,3 lpm) y los contadores de pasos se calibraron en un protocolo de cinta de correr. Los datos sin procesar se exportaron como archivos CSV con marca de tiempo en un intervalo de muestreo de 10 minutos.
4. Justificación del tamaño de la muestra
Los umbrales de 300 muestras de entrenamiento para XGBoost y aproximadamente 1000 secuencias de 7 días no superpuestas para LSTM fueron respaldados por experimentos y análisis de potencia / simulación. Un análisis de potencia post hoc utilizando G*Power (versión 3.1) indicó que 300 muestras proporcionaron un >80% de potencia para detectar un tamaño de efecto medio (f2 de Cohen = 0,15) a α = 0,05 en regresión logística. Las simulaciones mostraron que se necesitaban alrededor de 1000 secuencias para la convergencia estable del LSTM en series temporales fisiológicas multivariantes. La evidencia empírica se resume en la Tabla 1 y se visualiza en la Figura 3 y la Figura 4.
5. Preprocesamiento de datos
Las entradas faltantes, identificadas como espacios en blanco, valores centinela o NaN, se imputaron utilizando la media del conjunto de entrenamiento para cada característica para evitar la fuga de destino:
(1)
donde mj es el número de valores observados para la característica j. Lo mismo
se aplicó a los conjuntos de validación y prueba. Para eliminar el sesgo relacionado con la escala, las características se estandarizaron con la normalización de la puntuación z utilizando parámetros de solo entrenamiento:
(2)
donde μj y σj son la media y la desviación típica de la característica j estimada a partir de los datos de entrenamiento. Para las señales de series temporales (SpO2, frecuencia cardíaca, pasos), los flujos se alinearon con una cadencia de 10 minutos; Las brechas cortas de hasta 30 minutos se llenaron hacia adelante y las brechas más largas se suavizaron con un promedio móvil de tres puntos. Luego se aplicó una ventana deslizante de 7 días con 1008 pasos de tiempo para formar secuencias no superpuestas para evitar fugas (ver Figura 2).
6. Entrenamiento del modelo
Para los datos clínicos estructurados, XGBoost se ajustó a través de la búsqueda en cuadrícula sobre la tasa de aprendizaje (0,01-0,3), la profundidad máxima (3-10) y el número de estimadores (100-500) bajo un objetivo logístico binario (flujo de trabajo en la Figura 1). Para los datos de monitoreo remoto, el LSTM comprendía dos capas LSTM ocultas con 128 unidades cada una, inicialización de Xavier, una tasa de abandono de 0.5 y una capa de salida sigmoide; optimización utilizó Adam con una tasa de aprendizaje de 0.001 implementada en TensorFlow (canalización en la Figura 2). El sobreajuste se mitigó con el abandono y la interrupción temprana (paciencia = 10), y el desequilibrio de clase se abordó con SMOTE.
7. Estrategia de evaluación
Los datos estructurados se evaluaron con validación cruzada estratificada de 10 veces. Los datos de las series temporales se evaluaron con validación de avance para preservar el orden temporal. Las métricas incluyeron exactitud, precisión, recuerdo, medida F, área bajo la curva ROC (AUC) y error cuadrático medio (MSE). Las diferencias entre modelos se evaluaron mediante la prueba de rango con signo de Wilcoxon (bilateral). Las cifras incluyen bandas de confianza del 95% o barras de error para cuantificar la incertidumbre. Estas opciones abordan directamente los riesgos de fuga de series temporales y la necesidad de significación estadística solicitada por los revisores.
8. Relevancia clínica y pruebas piloto
El modelo híbrido predijo la disminución de la SpO2 6-12 h antes de la manifestación clínica en el 78% de los pacientes monitoreados y redujo la MSE en un 42,5% en relación con las líneas de base. En un piloto de cuatro semanas con 20 pacientes con EPOC, las puntuaciones de riesgo del modelo semanal coincidieron con las evaluaciones de los médicos en el 85% de las revisiones, lo que respalda el potencial de integración clínica.
9. Software y entorno
Los análisis se realizaron en Python 3.10.6 con scikit-learn 1.2.2, XGBoost 1.7.5, TensorFlow 2.13 y PyTorch 1.13 en Ubuntu 20.04 LTS con una GPU NVIDIA RTX 3080, CUDA 11.6 y cuDNN 8.2. El control de versiones completo y los proveedores se enumeran en la tabla de materiales sin numerar.