La osteoartritis de rodilla (KOA) es una enfermedad articular progresiva y de larga duración que es una de las principales razones por las que las personas mayores en todo el mundo se vuelvendiscapacitadas. La detección temprana de alteraciones estructurales sutiles es crucial para una intervención eficaz; sin embargo, los instrumentos diagnósticos tradicionales, como el sistema de clasificación Kellgren-Lawrence (KL) e índices clínicos como WOMAC, están limitados por la subjetividad y la variabilidad entreobservadores 1.
Con la creciente disponibilidad de repositorios de imagen de rodilla a gran escala como OAI y MOST, los enfoques computacionales para la evaluación objetiva de KOA han cobradoprotagonismo 2. Los primeros métodos de análisis radiográfico basados en descriptores artesanales y clasificación estadística mostraron una robustez limitada para datos de imagen de altadimensión 2. Los marcos de modelado basado en imágenes más recientes mejoraron la sensibilidad a la KOA en fase temprana, pero siguen enfrentando desafíos en la interpretabilidad clínica y la transparencia de la decisión.
El análisis impulsado por IA puede detectar la osteoartritis de rodilla de forma temprana y sin cirugía, lo que reduce la necesidad de radiografías repetidas y el impacto ambiental de la imagen a gran escala y el diagnóstico enpapel 3. Hasta la fecha, modelos de aprendizaje automático, como los Árboles de Decisión y los Bosques Aleatorios, han podido predecir el riesgo de precisión en WOMAC y nivel KL (Figura 1); sin embargo, han tenido dificultades con datos de imagen que tienen altadimensionalidad 4. Las arquitecturas de aprendizaje profundo, especialmente CNN y redes ResNet, automatizaban la extracción de características y obtenían mejor precisión, pero eran difíciles de entender. Los Transformadores de Visión (ViTs) aportaron una comprensión contextual global a través de la autoatención.
El marco DeciViT-F apoya prácticas clínicas sostenibles creando soluciones sanitarias precisas, comprensibles y asequibles. Esto ayuda a las personas con discapacidades crónicas y mejora su calidad de vida, especialmente en las personas mayores. Es explicable que la lógica bayesiana difusa promueve el uso ético de la IA, garantizando confianza, inclusión y transparencia en la toma de decisiones clínicas. Al final, este enfoque conducirá a un futuro mejor, más justo y más respetuoso con el medio ambiente para todos nosotros.
El marco DeciViT-Knee 2025 queda establecido como una cadena híbrida e interpretable para abordar estos problemas. Utiliza ViT-B/16 para la representación profunda de imágenes 2,4, árboles de decisión bayesianos para clasificación clara y probabilística, y una Capa de InferenciaDifusa 5 que convierte la incertidumbre en lenguaje que las personas pueden entender. Esta fusión de tres capas proporciona alta precisión diagnóstica, una calibración sólida y una interpretabilidad a nivel clínico.
Revisión bibliográfica
Ninguna investigación previa ha combinado completamente la extracción de características basada en ViT-B/16 con árboles de decisión bayesianos para razonamiento probabilístico sobre datos multimodales de KOA. Estudios recientes sobre la interpretabilidad han demostrado cómo la lógica difusa puede ayudar a conectar números precisos con el razonamiento basado en el lenguaje. Los sistemas difusos permiten representaciones de verdad parcial (por ejemplo, pérdida leve de cartílago o presencia de osteófitos en el límite), que corresponden con la incertidumbre frecuentemente articulada en evaluaciones radiológicas. Se ha demostrado que las capas de inferencia difusa disminuyen la variabilidad entre observadores y mejoran la interpretabilidad clínica cuando se incorporan a redesprofundas 5,6,7,8,9,10. Poner una capa fuzzy-bayesiana sobre incrustaciones ViT crea límites de decisión que sean tanto probabilísticos como lingüísticamente significativos. Esto convierte activaciones abstractas en conjuntos de reglas que la gente puede entender, como: SI el adelgazamiento del cartílago es moderado Y la variación de intensidad ósea es alta, ENTONCES KL probablemente ≥ 2.
DeciViT-Knee 2025 tiene como objetivo proporcionar una detección temprana, clara y repetible de KOA mediante un marco ViT-Fuzzy-Bayesiano optimizado para su uso en entornos clínicos. Esto cerrará eficazmente la brecha entre precisión, interpretabilidad y transparencia lingüística.
El siguiente enfoque ofrece una descripción clara y repetible de cada paso, desde la configuración del entorno y la preparación del conjunto de datos hasta el entrenamiento, la prueba y la visualización del modelo. Esto ayudará a investigadores y clínicos a repetir y a ampliar este trabajo para un diagnóstico preciso de trastornos musculoesqueléticos
Elección y establecimiento de un modelo
Elegimos el Transformador de Visión (ViT-B/16) como el principal extractor de características de imagen porque puede utilizar la autoatención multicabeza para modelar relaciones contextuales globales en imágenesradiográficas 2,4,11. La estructura ViT permite el análisis simultáneo tanto de variaciones finas de textura como de dependencias espaciales a largo plazo, importantes para distinguir cambios osteoartríticos sutiles entre los grados KL0-4, 2, 4, 12. Esto difiere de las arquitecturas basadas en CNN, que utilizan campos receptivoslocalizados 11.
Se añadió una Capa de Inferencia Difusa (FIL) entre la salida de la incrustación del transformador y el clasificador probabilístico para lidiar con la incertidumbre que conlleva la gradación radiográfica, especialmente para KOA límite y en fase temprana (Figura 2)13,14. El suegro convierte activaciones de incrustación continua en conjuntos difusos que tienen sentido en términos de lenguaje (por ejemplo, pérdida leve, moderada o severa de cartílago) y crea grados de pertenencia que muestran cuán incierto es eldiagnóstico 7,8. Este diseño facilita la comprensión al emparejar las predicciones numéricas con los patrones de razonamiento cualitativo que utilizanlos radiólogos 15.
Se utilizó un conjunto de Árboles de Decisión Bayesianos (BDTE) para convertir las incrustaciones de características mejoradas por difusez en resultados de clasificación probabilística, de modo que las predicciones fueran precisas y fáciles deentender 16,17,18,19. Cada árbol del conjunto calcula probabilidades posteriores e intervalos de confianza, lo que ayuda a establecer límites de decisiónbien calibrados 13. Este método combina la precisión estadística de la inferencia bayesiana con la claridad basada en reglas de los árboles de decisión, otorgando a cada resultado diagnóstico tanto certeza cuantitativa como una razón comprensible para su19.
Comparación mediante comparación
Utilizamos las mismas divisiones de entrenamiento y validación para comparar sistemáticamente la pipeline híbrida ViT + FIL + BDTE con las líneas base CNN y ResNet-50. Utilizamos la precisión de la clasificación, el AUC, la puntuación Brier y la interpretabilidad evaluada por el clínico en una escala de cinco puntos como métricas de comparación. El uso de varias líneas base permitió probar de forma justa la generalización del modelo, la consistencia de calibración y la explicabilidad entre arquitecturas.