$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Se ha recomendado la evaluación cinemática de la tarea de consumo de alcohol para su uso en la investigación de rehabilitación delictus 6. Sin embargo, se han citado preocupaciones prácticas como barreras para la adopción de la cinemática en la investigación de rehabilitación, y estas preocupaciones incluyen el coste y los requisitos técnicos de las tecnologías de captura de movimiento convencionalmente utilizadas para medir la biomecánicahumana 15. Estas preocupaciones dificultan posteriormente la adopción clínica y la traducción de la evaluación cinemática a la práctica clínica. Alternativamente, un enfoque más práctico para extraer cinemática mediante visión por ordenador puede realizarse usando una sola cámara estereoscópica, un ordenador personal y objetos comúnmente encontrados en un entornoambulatorio 16. Presentamos un protocolo diseñado para clínicos que emplea una guía web para grabar imágenes y vídeos compatibles con un flujo de trabajo de visión por ordenador para extraer métricas cinemáticas de la tarea de beber. El objetivo a largo plazo es aumentar el acceso a estas métricas, que ya se habían desarrollado y recomendado previamente para su uso en la investigación de rehabilitación del ictus 5,6,12,13,14.
La sincronización de vídeo es importante para enfoques de doble cámara en visión por ordenador. Los sistemas de doble cámara imitan los ojos humanos, que perciben simultáneamente una escena en el mundo real desde puntos de vista ligeramente diferentes para permitir la percepción de profundidad. En el caso de la visión por ordenador, la sincronización adecuada es fundamental para la precisión de la información tridimensional (por ejemplo, la posición de la muñeca humana en un sistema de coordenadas cartesianas) determinada a partir de dos fuentes bidimensionales (por ejemplo, la ubicación de píxeles de la muñeca humana en una foto). En nuestra experiencia, las cámaras duales pueden ofrecer resultados razonables cuando se sincronizan con un rango de 1 ms16. Varios factores pueden reducir la sincronización, incluyendo tasas de fotogramas poco fiables de la cámara, velocidades limitadas de transmisión de datos en cables, ineficiencias de software y especificaciones de hardware limitadas (por ejemplo, baja RAM o procesadores de bajo nivel). Para evitar problemas de sincronización, este protocolo utiliza una cámara estéreo estándar, que se beneficia de una huella física más pequeña y está diseñada como un dispositivo plug-and-play (por ejemplo, conexión USB única a un ordenador personal estándar) para capturar automáticamente imágenes sincronizadas de dos sensores de imagen integrados.
Las características de la cámara requieren una consideración cuidadosa para cualquier aplicación de visión por ordenador. En teoría, imágenes de mayor resolución y grabaciones de mayor tasa de fotogramas del movimiento humano ofrecen más datos para detectar puntos clave anatómicos con mayor precisión espaciotemporal. Sin embargo, es inevitable que se equilibre la cantidad de datos y los recursos informáticos disponibles para procesarlos. El protocolo descrito se basa en una cámara estéreo que graba vídeo con resolución de 1280 x 720 píxeles a una tasa de fotogramas de 60 Hz, comparable a estudios previos que aplicaban visión por ordenador para la cinemática de tareasde consumo 16,18. Para grabar estos vídeos, hemos observado un éxito fiable usando un ordenador de gama superior de consumo (por ejemplo, CPU de 3,2 GHz con 128 GB de RAM) y un éxito mixto usando un ordenador portátil (por ejemplo, una CPU de 2,6 GHz con 16 GB de RAM). Al aplicar ordenadores de gama inferior, un problema típico es la ausencia de fotogramas de vídeo, que a menudo se presenta como un vídeo de salida con una duración menor que la grabación prevista de 20 s. Cabe destacar que, aunque la computación de datos es un culpable común de la ausencia de fotogramas de vídeo, la transmisión de datos también es importante. En el ámbito sanitario, por ejemplo, los ajustes de seguridad asociados a los puertos de acceso a los ordenadores (por ejemplo, unidades USB) pueden provocar retrasos en la transmisión de datos que interfieren con una grabación de vídeo fiable.
La interferencia en línea de visión desafiará pasos clave en un flujo de trabajo de visión por ordenador, incluyendo la calibración y la estimación de la postura humana. La calibración se basa en imágenes digitales de un patrón de tablero de ajedrez de tamaño estándar, lo que permite la visión por ordenador mapear píxeles de imagen a las dimensiones físicas del mundo real. Una visualización clara del patrón de tablero de ajedrez mejora la tasa de éxito de este mapeo. La interferencia visual puede deberse a varias razones, incluyendo, pero no limitándose a: (i) problemas de iluminación (por ejemplo, resplandor intenso de una ventana cercana o sombras oscuras); (ii) movimientos excesivamente rápidos del tablero de ajedrez (por ejemplo, desenfoque de la imagen debido a un tiempo de exposición prolongado de la cámara); o (iii) propiedades intrínsecas inapropiadas de la cámara (por ejemplo, distancia focal incorrecta o distorsión severa del objetivo). La estimación de postura humana aprovecha la inteligencia artificial para anotar automáticamente los puntos de referencia anatómicos a partir de imágenes de una sola persona (estimación de una sola pose) o de varias personas (estimación de varias poses). La visualización clara del ser humano es entonces fundamental para la tasa de éxito de la estimación de la pose. Cierta interferencia visual puede tolerarse dependiendo de los parámetros de visión por ordenador (por ejemplo, arquitectura de IA, umbrales de predicción). Sin embargo, para evaluar la idoneidad de un vídeo para la estimación de poses humanas, los riesgos comunes a los que hay que estar alerta incluyen los siguientes: (i) espectadores a la vista en caso de estimación de una sola pose; (ii) segmentos del cuerpo de forma intermitente fuera del campo de visión de la cámara; y (iii) autooclusiones debidas a la superposición de los segmentos corporales.
Desacoplar la recogida de datos del propio flujo de trabajo de visión por ordenador ofrece tanto ventajas como desventajas. Un inconveniente notable es el retraso en la información clínicamente relevante disponible para los clínicos y los pacientes para informar la toma de decisiones. Una ventaja potencial es la reducción de la interferencia en la interacción entre el clínico y el paciente. Por ejemplo, suponiendo que la calibración se realice antes de la cita del paciente, grabar en vídeo 10 repeticiones de la tarea de beber tal y como se describe en la literaturaprevia 12 requeriría idealmente menos de 4 minutos de grabación en vídeo más cualquier tiempo necesario para orientar a los pacientes que son ingenuos respecto al protocolo. Además, este desacoplamiento puede aumentar la aceptación por parte de los clínicos al dividir la responsabilidad de la información. Dentro de esta separación de funciones, el clínico asume la responsabilidad de cuándo y por qué se realizan las evaluaciones por vídeo, y los científicos/ingenieros de datos se encargan de refinar el flujo de trabajo de visión por ordenador responsable de métricas clínicas precisas y fiables (por ejemplo, la cinemática de tareas de bebida). De hecho, esto puede compararse con la realidad actual de muchas pruebas basadas en sangre (por ejemplo, paneles metabólicos completos) e basadas en imágenes (por ejemplo, estudios de resonancia magnética) que los clínicos solicitan rutinariamente. Por último, este desacoplamiento puede ser ventajoso a medida que el campo de la IA continúe avanzando. Los datos de vídeo adquiridos hoy podrían ser analizados repetidamente por soluciones de visión por ordenador más avanzadas del futuro, que podrían extraer más métricas cinemáticas con mayor velocidad, precisión y fiabilidad.
Nuestro objetivo es avanzar aún más en el acceso a la cinemática de las extremidades superiores entre la comunidad de rehabilitación, que incluye a profesionales ambulatorios y, previsiblemente, a personas en el ámbito domiciliario (por ejemplo, telerehabilitación). Este protocolo y la aplicación web deben considerarse una etapa temprana de desarrollo, que hasta ahora se ha visto como una actividad muy enfocada (es decir, la tarea de beber) y un grupo relativamente enfocado de partes interesadas (es decir, usuarios clínicos y sujetos que pueden realizar fácilmente la tarea de beber). Serán necesarias versiones futuras para acomodar un grupo de usuarios más diverso, actividades más diversas y poblaciones de sujetos más diversas (por ejemplo, individuos con déficits graves que requieren adaptación en actividades). Además, el desarrollo futuro incluirá puntos de control importantes antes de su implementación generalizada, como la integración en los historiales médicos electrónicos y el mantenimiento de la privacidad y confidencialidad del paciente. Estas futuras versiones probablemente también incorporarán nueva tecnología y perfeccionarán la tecnología disponible actualmente. Por ejemplo, el protocolo actual asume un flujo de trabajo de visión por ordenador basado en la visión binocular (por ejemplo, cámaras estereoscópicas). Un desarrollo lógico siguiente es un protocolo que incluya visión monocular (por ejemplo, cámaras más básicas), que podría ser posible utilizando IA entrenada con conjuntos de datos binoculares. Cabe destacar que el protocolo actual proporciona datos de imagen y vídeo compatibles con las soluciones de visión por ordenador de última generación, que ya están siendo superadas en rendimiento por las solucionesmás recientes 18. El protocolo web descrito aquí podría permitir a los clínicos implementar en su práctica una base para la visión por ordenador, que probablemente avancerá notablemente a medida que la tecnología de IA permee la industria sanitaria.