$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Consideraciones éticas y población de estudio
Este estudio retrospectivo fue aprobado por el comité de ética institucional. Se renunció al consentimiento informado, ya que toda la información sanitaria protegida fue anonimizada. La población del estudio consistió en pacientes obtenidos de la base de datos de imagen del First People's Hospital de Nantong, que se sometieron a una resonancia magnética lumbar debido a dolor lumbar entre enero de 2022 y diciembre de 2023. También se recogieron las características clínicas de los pacientes (Tabla 1).
Criterios de inclusión y exclusión
El estándar diagnóstico actual para la DLBP sigue el método de discografía de la Asociación Internacional para el Estudio del Dolor de 1995, que provoca dolor mediante un aumento de presión pero no es ampliamente aceptado debido a su altainvasividad 8. Por ello, este estudio adoptó una prueba restrictiva intraoperatoria de provocación del dolor discal como método diagnóstico para la DLBP, coherente con los principios discográficos y minimizando daños y complicaciones discalesadicionales 31. El procedimiento implicó a los pacientes en posición prona bajo anestesia espinal, con el disco lumbar objetivo localizado mediante guiado por rayos X de C-arm. Se insertó una aguja de 18 G (<22 G) mediante un enfoque posterolateral en el núcleo pulposo central, evitando las raíces nerviosas y el saco dural. Tras confirmar la colocación de la aguja, se inyectó solución salina o contraste no iónico (por ejemplo, iohexol) a una tasa no superior a 0,5 mL/min, con presión inferior a 50 psi y un volumen total de inyección inferior a 3 mL, para simular el aumento de la presión intradiscal y provocar síntomas familiares de dolor lumbar, con una puntuación de escala visual analógica (VAS) ≥ 7.
Criterios de inclusión en grupos DLBP: Los pacientes incluidos aquí se sometieron a una resonancia magnética, presentan dolor lumbar recurrente durante más de 3 meses, con tratamiento conservador fallido, con o sin entumecimiento o dolor irradiado en la extremidad inferior, y son positivos para la prueba intraoperatoria de provocación del dolor discológico.
Criterios de inclusión en grupos no DLBP: Los pacientes incluidos aquí se sometieron a una resonancia magnética; no tienen antecedentes de dolor lumbar en los últimos 3 meses o las personas sanas están siendo sometidas a un examen físico; no presentan anomalías en la resonancia magnética; y realizar una evaluación estandarizada con el Índice de Discapacidad (ODI) de Oswestry <10 y VAS ≤2.
Criterios de exclusión: Excluir a los pacientes que presenten otras causas de dolor lumbar, como herniación discal significativa que comprime nervios, fracturas, infecciones de columna, espondilolistesis, tumores, osteoporosis o enfermedades metabólicas óseas; antecedentes de cirugía antes del examen; imágenes poco claras o de mala calidad; incapacidad para identificar la región de interés (ROI).
En total, se incluyeron 243 pacientes, que comprenden 81 pacientes con DLBP y 162 controles.
Parámetros de la resonancia magnética
Todos los pacientes incluidos en este estudio se sometieron a resonancias magnéticas de 3,0 T, utilizando secuencias que incluyeron imágenes ponderadas sagital y axial T1 (T1WI) y T2 ponderadas (T2WI). En el estudio se utilizaron tres máquinas de resonancia magnética diferentes: Siemens Verio, Siemens Prisma y Philips Ingenia CX. Los parámetros de barrido se establecieron de la siguiente manera: para T2WI sagital, TR osciló entre 2000 y 4597 ms, TE de 90 a 120 ms, grosor de corte de 4,0 a 4,8 mm, con 15 cortes incluidos, ancho de banda de 250 Hz a 340 Hz, tamaño de matriz de 384 × 384 o 512 × 512, porcentaje de campo de visión de fase del 100%, y un campo de visión de lectura de 300 mm.
Medición de características y estadísticas de imagen de HIZ
Este estudio utilizó el software 3D Slicer (versión 5.6.1, https://download.slicer.org/?version=5.6.1) para analizar manualmente imágenes ponderadas en T2 de resonancia magnética lumbar de 243 pacientes y controles. El flujo de trabajo de procesamiento de datos fue el siguiente: las imágenes se importaban usando la función Añadir Datos DICOM en 3D Slicer. Las mediciones se realizaron utilizando la función Markups por dos estudiantes de posgrado en investigación de columna bajo la supervisión de radiólogos y cirujanos de columna con más de 10 años de experiencia clínica. Las discrepancias en las mediciones se resolvieron mediante consulta con ambos médicos. Todos los valores de medición fueron promediados por dos estadísticos para garantizar la precisión. En imágenes sagitales se midieron los dos diámetros máximos mutuamente perpendiculares de la zona de alta intensidad (HIZ), definidos como Hizh (dirección casi vertical) y Hizw (dirección casi horizontal). La función de segmentación se utilizó para delimitar la región HIZ, y se calculó el área del HIZ más prominente en el plano sagital, denotada como Hizarea. En imágenes axiales, se medía la longitud máxima del HIZ, denominada Hizl. Además, se definieron tres variables binarias: Hiz (presencia de HIZ), Otra (presencia de HIZ multisegmental) y Posición (si el HIZ cruza la línea media posterior) (Tabla 2).
La radiómica presenta la extracción y estandarización
Para integrar la operación específica de Remuestreo del Volumen Escalar en el contexto del procesamiento de imágenes ponderadas en T2 de resonancia magnética lumbar de 243 pacientes y controles usando 3D Slicer, se siguieron los siguientes pasos detallados: El proceso comenzó con la importación de imágenes ponderadas en T2 para resonancia magnética lumbar en 3D Slicer. Para asegurar la consistencia y reducir el sesgo de heterogeneidad, todas las imágenes se remuestrearon a un tamaño de vóxel de 0,6 × 0,6 × 0,6 mm utilizando el módulo de Remuestreo de Volumen Escalar . Los pasos específicos eran: Navegar a la sección de Módulos y seleccionar Remuestrear Volumen Escalar. En Conjunto de parámetros, asegúrate de que esté seleccionado Remuestrear Volumen Escalar . En la sección de Parámetros de Remuestreo , establece el Espaciado en 0,6, 0,6, 0,6 para definir las dimensiones del vóxeles objetivo. Selecciona un método de interpolación apropiado entre opciones como lineal, vecino más cercano, bspline, hamming, coseno, welch, lanczos o blackman, con lineal como predeterminado. Para Volumen de Salida, selecciona o crea un nuevo volumen para almacenar los datos remuestreados. Tras verificar la configuración, haz clic en Aplicar para ejecutar el proceso de remuestreo.
Tras el remuestreo, dos estudiantes de posgrado en investigación de columna, guiados por radiólogos y cirujanos de columna con más de 10 años de experiencia, realizaron la delimitación semiautomática de la región de interés (ROI). Las discrepancias se resolvieron mediante consulta. Los pasos específicos eran: seleccionar la capa (remuestrear el nuevo volumen), crear una nueva capa de segmentación y usar la función Dibujar para la delimitación capa por capa. Usa la función de relleno entre rebanadas para el relleno entre capas. Suaviza el ROI formado usando el método de suavizado mediano con un tamaño de núcleo de 3,0 mm, 5 x 5 píxeles. Utilizando la biblioteca PyRadiomics, se extrajeron 107 características radiómicas de las imágenes remuestreadas, incluyendo características de forma, características estadísticas de primer orden, matriz de co-ocurrencia de nivel gris (GLCM), matriz de longitud de paso a nivel gris (GLRLM), matriz de zonas de tamaño a nivel gris (GLSZM), matriz de diferencia de tonos de gris vecina (NGTDM) y características de la matriz de dependencia de niveles de gris (GLDM) (Tabla suplementaria 1). Finalmente, los datos extraídos de características se estandarizaron utilizando el método Z-score para transformar su rango natural en un rango estandarizado.
Agrupación basada en características
Los grupos se asignaron de la siguiente manera:
d0 (Grupo base): Características clínicas incluidas, n(d0) = 5.
d1 (Grupo base de ajuste fino): Características clínicas incluidas y características de imagen HIZ, n(d1) = 12.
d2 (Grupo de modelos): Características clínicas incluidas y radiómicas, n(d2) = 112.
D (Grupo de ajuste de modelos finos): Características clínicas incluidas, características de imagen HIZ y características de radiómica, n(D) = 119.
Lectura y preprocesamiento de datos
Los datos de los respectivos grupos se leían usando la función read_excel en el software R (versión 4.3.1, https://www.r-project.org/, plataforma: x86_64-w64-mingw32/x64 [64 bits]) con codificación UTF-8 (por defecto del sistema), que soporta la mayoría de los lenguajes escritos a nivel global. La función select se utilizaba para separar la variable objetivo de las variables de características.
Selección de características
Para garantizar la reproducibilidad de la división de datos, los cuatro conjuntos de datos (D, d2, d1, d0) siguieron el mismo flujo de trabajo de procesamiento, con una semilla aleatoria fija de 80. Se añadió una columna de etiquetas al marco de datos, se convirtió a un tipo de factor, y se generaron etiquetas aleatorias (1 y 0) usando una distribución binomial para dividir los datos en conjuntos de entrenamiento y prueba en una proporción de 8:2 (80% de probabilidad para el conjunto de entrenamiento). Debido al número limitado de características, los grupos d0 y d1 no requerían selección de características, mientras que los grupos d2 y D pasaban por selección de características:
Primero, se aplicó la prueba Mann-Whitney U al conjunto de entrenamiento para seleccionar características con valores p <0,05. Después, se realizó regresión Lasso con validación cruzada de 10 veces y regularización L1 para determinar el coeficiente de penalización óptimo y seleccionar características de una única iteración. Se estableció una semilla aleatoria del 1 al 100, y los pasos anteriores (división de datos, prueba Mann-Whitney U y regresión Lazo) se repetían en un bucle. Se seleccionaron características que aparecieron más de 50 veces en 100 iteraciones para modelado posterior para garantizar la fiabilidad en la construcción y predicción diagnóstica. Las características de modelado para cada grupo se enumeran en la Tabla 3.
Búsqueda en cuadrícula y ajuste de modelos
Para optimizar los modelos, se aplicó la búsqueda en cuadrícula para explorar y evaluar sistemáticamente diferentes combinaciones de hiperparámetros. Mediante ajustes iterativos y evaluación del rendimiento, este estudio identificó el conjunto de hiperparámetros que proporcionaban los mejores valores de AUC ROC para los conjuntos de tren y prueba, optimizando así el rendimiento del modelo.
Desarrollo y evaluación del modelo
Todo el desarrollo de modelos y análisis de datos se realizó en R (versión 4.3.1). Este estudio aplicó varios algoritmos de aprendizaje automático, incluyendo Random Forest (RF), Support Vector Machine (SVM), Decision Tree (TREE), K-Nearest Neighbors (KNN) y Logistic Regression (LOG), para desarrollar 20 modelos en los cuatro grupos (d0, d1, d2 y D) para predecir el diagnóstico de DLBP. El rendimiento del modelo se evaluó utilizando las siguientes métricas: ROC AUC, PR AUC, precisión, sensibilidad, especificidad, valor predictivo positivo (PPV), valor predictivo negativo (NPV) y puntuación F1.
Los valores ROC AUC y PR AUC se generaron directamente a partir de las curvas ROC y PR, mientras que las métricas restantes (precisión, sensibilidad, especificidad, PPV, NPV y puntuación F1) se calcularon y analizaron estadísticamente usando funciones correspondientes en R. Entre los 20 modelos desarrollados, este estudio seleccionó 8 modelos representativos para evaluación basados en las métricas de rendimiento mencionadas.
Las fórmulas para cada métrica son las siguientes:




Q

TP: Positivo verdadero; TN: Negativo verdadero; FP: Falso positivo; FN: Falso negativo.
Análisis de interpretabilidad SHAP
El modelo de Bosque Aleatorio del grupo D demostró el mejor rendimiento en la evaluación del modelo. Para interpretar aún más las predicciones del modelo, este estudio reconstruyó el modelo en Python (versión 3.7.9) y realizó un análisis de interpretabilidad SHAP. Para mantener la coherencia, los hiperparámetros de tren del modelo Random Forest en Python eran idénticos a los usados en R, y el flujo de trabajo de procesamiento de datos también era consistente. Específicamente, utilizamos el intérprete de modelos de árbol para analizar la contribución de cada característica a las predicciones diagnósticas del modelo en los conjuntos de tren y prueba. Para una mejor visualización, generamos gráficos de distribución de valores SHAP, gráficos de importancia de características y gráficos de fuerza SHAP para predicciones individuales.
Análisis estadístico
Todos los análisis de datos se realizaron usando R (versión 4.3.1, https://www.r-project.org/, plataforma: x86_64-w64-mingw32/x64 (64 bits)) y Python (versión 3.7.9, https://www.python.org/downloads/release/python-379/). Las variables continuas se describieron como media ± desviación estándar, mientras que las variables categóricas se expresaron como frecuencia y porcentaje. La comparación entre DLBP y no DLBP se analizó utilizando la prueba U, considerando un valor P inferior a 0,05 estadísticamente significativo.