Diseño del estudio y población de pacientes
Este estudio retrospectivo analizó exámenes de ultrasonido tiroideo obtenidos entre el 13 de junio de 2024 y el 13 de enero de 2025. El protocolo del estudio fue aprobado por el Comité de Ética del Hospital de Amistad de Beijing, Universidad Médica Capital (número de aprobación BFHHZS20240300) y se llevó a cabo de acuerdo con los principios éticos descritos en la Declaración de Helsinki, y se dispensó el consentimiento informado debido al diseño retrospectivo. El conjunto de datos comprendía 68 nódulos tiroideos de 63 pacientes (30 benignos y 38 malignos), y el nódulo fue la unidad analítica. Los diagnósticos de referencia se basaron en la citología por aspiración con aguja fina guiada por ultrasonido (CAF). El grupo maligno incluyó 38 nódulos reportados como carcinoma tiroideo papilar en la CAF.
Criterios de inclusión
Los pacientes elegibles debían cumplir todos los siguientes criterios: (1) haberse sometido a ecografía en escala de grises convencional y Doppler, seguida de ecografía con contraste (CEUS) con calidad de imagen satisfactoria que permitiera el análisis posterior de la imagen de flujo microvascular; (2) tener un diagnóstico citopatológico de CPT confirmado mediante biopsia con aguja fina, con o sin prueba concurrente positiva para la mutación BRAFV600E; o tener un resultado citológico de Categoría III de Bethesda (atipia de significado indeterminado), pero con prueba concurrente positiva para la mutación BRAFV600E; (3) tener un diagnóstico citopatológico de nódulos benignos proliferativos, nódulos adenomatosos o nódulos foliculares benignos en la Categoría II de Bethesda sin prueba concurrente positiva para la mutación BRAFV600E.
Criterios de exclusión
Se excluyeron a los pacientes del estudio si se presentaba alguna de las siguientes condiciones: (1) imágenes de CEUS de baja calidad o señal insuficiente de microburbujas que impidiera la evaluación confiable del flujo microvascular; (2) ausencia de resultados citológicos o patológicos; (3) diagnóstico histopatológico de un subtipo raro o especial de carcinoma tiroideo (por ejemplo, variantes anaplásicas); o (4) hallazgos citológicos sugestivos de neoplasia folicular (Categoría IV de Bethesda) o cualquier lesión de origen folicular indeterminado, independientemente del estado mutacional; (5) tiroiditis de Hashimoto
Adquisición de ultrasonido, CEUS y SRUS
Todos los exámenes se realizaron con el sistema de ultrasonido referenciado y un transductor de matriz lineal. Los pacientes se colocaron en posición supina con el cuello extendido. Se localizó y midió el nódulo objetivo mediante ultrasonido en modo B; se registraron microcalcificaciones, y se utilizó el mismo plano de imagen centrado en la lesión para evaluar la vascularización intranodular con Doppler color.
Después de establecer el acceso intravenoso, el sistema se cambió a un modo CEUS/URM de bajo índice mecánico (URM significa imágenes de microscopía de ultraresolución). Se realizó CEUS mediante una inyección intravenosa en bolo de SonoVue de 1,2 mL, seguida inmediatamente por una inyección de 5 ml de solución salina; el temporizador en pantalla y la adquisición continua de cine se iniciaron con la administración del bolo. La sonda se mantuvo en un plano fijo con presión mínima, y se pidió al paciente que evitara tragar durante la fase de entrada y salida del contraste.
Para la CEUS cuantitativa, se utilizó una región de interés restringida a la lesión para obtener los parámetros de intensidad-tiempo. Para la SRUS, el flujo de trabajo de URM localizó y rastreó las señales de microburbujas tras el control de movimiento y generó mediciones de relación vascular, complejidad, densidad microvascular, índice de perfusión y velocidad de flujo. Las exportaciones de imágenes representativas mostraron ajustes de VSP 4, RES 2, CTR 3, SM 2, VEN 3 y CPT 10 s; los ajustes correspondientes no estuvieron disponibles para los exámenes restantes.
Las 25 variables de entrada del modelo se enumeran en la Tabla 1 y se agrupan por modalidad de adquisición: edad y sexo; microcalcificaciones en modo B; vascularidad intranodular en Doppler color; CEUS cualitativo; CEUS cuantitativo; y 11 mediciones microvasculares de SRUS.
Selección de características
Se conservaron las 25 características cuantitativas en los modelos de aprendizaje automático. Solo se utilizaron características numéricas; se excluyeron los nombres de los pacientes, los números de registro y los campos de tamaño de lesión. No se realizó ninguna selección de características basada en datos, y los mismos predictores preespecificados se introdujeron en cada clasificador.
Normalización de características
No se aplicó ninguna transformación, imputación ni escalado global antes de la validación cruzada. La estandarización se aplicó únicamente al SVM con función de base radial mediante una canalización StandardScaler. El escalador se ajustó a los nódulos de entrenamiento de cada partición y luego se aplicó a los nódulos de validación de esa partición. Los clasificadores basados en árboles recibieron las escalas numéricas originales:

donde x es el valor original de la característica, µ es la media del conjunto de entrenamiento y σ es la desviación estándar del conjunto de entrenamiento. El preprocesamiento por pliegues evitó que las observaciones de validación contribuyeran a los parámetros de escalado del SVM.
Particionamiento de datos
La evaluación principal del rendimiento utilizó una validación cruzada estratificada por grupos en cinco partes (five-fold StratifiedGroupKFold) con shuffle = True y random_state = 42. Un identificador de paciente definió 63 grupos, y todos los nódulos del mismo paciente se asignaron al mismo grupo. Ningún paciente aportó nódulos tanto al subconjunto de entrenamiento como al de validación de un mismo grupo.
Entrenamiento y validación del modelo
Protocolo de entrenamiento
Se evaluaron cinco clasificadores: bosque aleatorio (100 árboles; random_state = 42), SVM con función de base radial (C = 1,0; gamma = scale; probability = True; tubería StandardScaler; random_state = 42), árbol de decisión (criterio de Gini; profundidad ilimitada; random_state = 42), XGBoost (100 estimadores; learning_rate = 0,3; max_depth = 6; subsample = 1,0; colsample_bytree = 1,0; random_state = 42) y aumento de gradiente (100 estimadores; learning_rate = 0,1; max_depth = 3; random_state = 42). No se realizó búsqueda en cuadrícula, optimización bayesiana, ajuste de umbrales ni selección anidada de modelos.
Validación cruzada
Dentro de cada uno de los cinco grupos de pacientes divididos, los modelos se entrenaron con los grupos restantes de pacientes y se evaluaron con los grupos excluidos. Se calcularon la precisión, sensibilidad, especificidad, valor predictivo positivo, puntuación F1 y el área bajo la curva ROC para cada división, y se resumieron como media ± DE. Las predicciones fuera de la muestra (OOF) se agruparon de los 68 nódulos para generar una curva ROC validada cruzadamente y una matriz de confusión para cada modelo.
Evaluación del rendimiento
Métricas de evaluación
El rendimiento del modelo se evaluó dentro de cada grupo de validación agrupado por paciente y a partir de las predicciones agrupadas fuera del conjunto (OOF) utilizando las siguientes métricas:
Precisión: Proporción general de predicciones correctas

Sensibilidad (Recuperación): Proporción de nódulos malignos reales identificados correctamente

Especificidad: Proporción de nódulos benignos reales identificados correctamente

Precisión (Valor Predictivo Positivo): Proporción de casos predichos como malignos que realmente eran malignos

Puntuación F1: Media armónica de la precisión y la recuperación

Área bajo la curva de característica operativa del receptor (ROC-AUC): Medida de la capacidad del modelo para discriminar entre nódulos benignos y malignos en todos los umbrales de clasificación
donde TP = verdaderos positivos (nódulos malignos identificados correctamente), TN = verdaderos negativos (nódulos benignos identificados correctamente), FP = falsos positivos (nódulos benignos clasificados incorrectamente como malignos) y FN = falsos negativos (nódulos malignos clasificados incorrectamente como benignos).
Análisis de la matriz de confusión
Las matrices de confusión OOF se generaron agrupando las predicciones realizadas para cada nódulo únicamente en el grupo en el que se excluyó a ese paciente. Así, cada nódulo recibió una predicción de un modelo entrenado con nódulos de otros pacientes.
Análisis de la importancia de las características
Para el modelo de bosque aleatorio, se calcularon las puntuaciones de importancia de las características en función de la disminución media de la impureza de Gini en todos los árboles de decisión. Se identificaron y clasificaron las 15 características más importantes para determinar qué parámetros microvasculares contribuyeron de manera más significativa al rendimiento de la clasificación.
Análisis exploratorio con SHAP
Se realizó un análisis SHAP OOF enfocado utilizando un explicador basado en permutaciones para la SVM. Para cada nódulo excluido, solo se utilizaron las observaciones correspondientes del conjunto de entrenamiento como distribución de referencia (128 permutaciones antitéticas; semilla aleatoria = 20260716). Los valores SHAP absolutos medios resumieron la magnitud de las contribuciones, y los valores con signo indicaron la dirección. El análisis fue exploratorio y no se utilizó para inferir causalidad, identificar biomarcadores independientes ni definir umbrales clínicos.
Análisis estadístico
Análisis comparativo
El rendimiento del modelo se resumió de forma descriptiva en las cinco particiones de validación agrupadas por paciente y en las predicciones agrupadas fuera del ajuste (OOF). No se realizó ninguna prueba de hipótesis formal entre modelos ni clasificación basada en valores P, porque las particiones están relacionadas y la cohorte es pequeña.
Para comparaciones basales entre grupos, la normalidad de las variables continuas se evaluó dentro de cada grupo de resultados mediante la prueba de Shapiro-Wilk. De Welch t se utilizó la prueba t cuando ambos grupos cumplían con la normalidad; de lo contrario, una prueba de Mann-Whitney bilateral U se utilizó la prueba t. Las variables categóricas se evaluaron mediante la prueba de chi-cuadrado de Pearson, con la prueba exacta de Fisher para tablas 2 x 2 con escasos datos. Los valores p fueron bilaterales, exploratorios y sin ajustar (alfa = 0,05).
Reproducibilidad
La reproducibilidad se apoyó en una definición específica del grupo de pacientes, una semilla aleatoria fija (42), configuraciones fijas del clasificador y un preprocesamiento por pliegues. Los identificadores se utilizaron únicamente para agrupar y no se introdujeron como predictores ni se exportaron con las salidas del modelo.