Redes LSTM
Una Red Neuronal Recurrente (RNN) era un tipo de red neuronal que podía predecir el valor en el siguiente paso temporal basándose en las observaciones previas de una serie temporal. Las RNN procesaban una observación de una serie temporal a la vez y almacenaban información histórica de dicha serie ajustando continuamente un "vector de estado" en la capa oculta. Aunque el objetivo de las RNN era obtener información histórica en series temporales, las RNN no eran adecuadas para procesar series temporales más largas debido al problema de anulación del gradiente que se encontraba al usar el algoritmo de retropropagación. La red de Memoria a Corto Plazo Largo (LSTM) es una variante de RNN que aborda el problema de anulación del gradiente que se encuentra durante el entrenamiento, lo que le permite manejar series temporales más largas. En comparación con las RNN estándar, las LSTM tienen tres unidades adicionales de control de puerta: la puerta de entrada, la puerta de olvido y la puerta de salida. La Figura 1 delimita la estructura fundamental de la LSTM y su marco arquitectónico central, que comprende cinco componentes esenciales: tres funciones de activación sigmoides y dos funciones de activación tangente hiperbólica (tanh). Cabe destacar que la función sigmoide situada a la izquierda asume un papel fundamental en la regulación de la transmisión de información del paso de tiempo anterior, realizando las funciones de filtrado y refinamiento de la información para apoyar este proceso regulador, como se elucida en la ecuación posterior:
(1)

Figura 1. Estructura fundamental de la red LSTM. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
donde la puerta de olvido actuaba como "f t", las secuencias de entrada como "xt" y "ht-1" es la información oculta antes de la salida de la unidad. La puerta de olvido era responsable de determinar qué información debía descartarse o conservarse, la puerta de entrada podía actualizar el estado de la unidad de memoria y la puerta de salida podía determinar el valor del estado oculto posterior. Estas tres puertas se denotan como ft, it y ot.
(2)
(3)
(4)
(5)
(6)
La ecuación (3) define el estado candidato de celda C't creado por la función tanh, que propone añadir nuevos valores al estado de la celda. Específicamente, la entrada del modelo se formuló integrando las salidas de dos funciones sigmoides con las de la función tanh inicial, como se muestra en la Ecuación (5).
La ecuación (4) caracteriza la función sigmoide derecha que sirve como valor inicial de salida del modelo, que posteriormente se mapeó al intervalo [−1, 1] mediante la función tangente hiperbólica (tanh). A continuación, tanto el valor resultante de la función tanh como la salida de la función sigmoide se convierten en sus respectivos valores reales de salida, como se ejemplifica en la Ecuación (6).
En LSTM, la función sigmoide regulaba la información actual, mientras que la función tangente hiperbólica (tanh) podía ser responsable de procesar la información histórica. La integración de estas dos funciones otorga a los LSTM su capacidad predictiva. En comparación con las RNN convencionales, la ventaja de las LSTM reside en su sofisticada arquitectura, capaz de capturar toda la memoria de datos de entrada hasta el paso de tiempo t+1. La integridad de esta memoria se preserva mediante el mecanismo de acceso facilitado por la función sigmoide, asegurando así que la información crítica se conserve durante periodos prolongados.
Filtro HP
El filtro de Hodrick-Prescott (filtro HP), propuesto por Hodrick y Prescott en 1980, se ha utilizado ampliamente en análisis económico y análisis relacionados con series temporales. El filtro HP asume que el conjunto de datos a analizar fue una combinación de cambios a largo plazo y fluctuaciones a corto plazo, descomponiendo la serie temporal Y={y1, y2, ⋯, yT} en dos subseries: la serie de tendencias a largo plazo G={g1, g2, ⋯, gT} y la serie de fluctuaciones a corto plazo S={s1, s2, ⋯, sT}. La serie de tendencias a largo plazo gT, donde t=1,2,⋯,T, se deriva minimizando la siguiente expresión:
(7)
Donde T representa el número de muestras en la serie temporal yt, y λ es mayor que 0, conocido como el parámetro de suavizado, que indica los pesos de los términos
y
. Cuando λ=0, la serie de tendencias a largo plazo G que satisface el problema de minimización es igual a la serie original Y. A medida que aumenta el valor de λ, el número total de cambios en la serie de tendencias a largo plazo disminuye en relación con los de la serie original, lo que significa que un λ mayor resulta en una serie de tendencias a largo plazo más suave. Cuando λ tiende al infinito, la serie de tendencias a largo plazo se asemejará a una función lineal. La serie de fluctuaciones a corto plazo puede obtenerse restando la serie de tendencias a largo plazo de la serie temporal original, es decir, S=Y-G.
Antes de aplicar el filtro HP, era imprescindible seleccionar un parámetro de suavizado adecuado λ, ya que diferentes parámetros de suavizado dictan tendencias y fluctuaciones a corto plazo distintas. De acuerdo con investigaciones relacionadas previas, el valor de λ se fija en 100 en este estudio.
Preparación de los participantes y aprobación ética
Se había obtenido la aprobación ética del Comité de Revisión Ética de la Universidad Médica de Mongolia Interior (Nº YKD202001041) antes de cualquier recogida de datos. Se reclutó a un investigador a tiempo completo del Colegio de Medicina Mongola de la Universidad Médica de Mongolia Interior, experto en el método de laminación de la Osteopatía Tradicional Mongola China (CTMO). Se obtuvo el consentimiento informado por escrito del participante. Todos los procedimientos se ajustaban a los principios de la Declaración de Helsinki.
Configuración y calibración del equipo
Se utilizó un sistema de prueba de resistencia de agarre multicanal equipado con 24 sensores mecánicos para recopilar parámetros mecánicos del método de rodado CTMO (véase la Figura 2 y la Figura 3 para la disposición del sistema y la posición de los sensores). Los 24 sensores de fuerza estaban calibrados según las instrucciones del fabricante. El software de adquisición de datos estaba configurado para registrar datos a una frecuencia de muestreo de 100 Hz y para mostrar lecturas de fuerza en tiempo real en Newtons (N). La duración de la grabación se estableció en 60 segundos por prueba.

Figura 2. Sistema de prueba de resistencia de agarre multicanal. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 3. Interfaz de adquisición de manipulación de masaje basada en el sistema de prueba de fuerza de agarre multicanal. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Adquisición de datos
Se indicó al participante que se pusiera el guante instrumentado y adoptara la postura estándar de salida. El modelo del antebrazo humano artificial se colocó sobre una superficie estable y horizontal frente al participante. Al iniciar el software de registro de datos, el participante realizó la manipulación de rodado CTMO de forma continua en el área designada del modelo del antebrazo durante 1 minuto. El archivo de datos en bruto se guardaba en un formato estructurado (por ejemplo, .csv o .txt) que contenía marcas de tiempo y lecturas de fuerza de los 24 sensores. Este procedimiento se repitió hasta completar un total de 150 ensayos independientes. El participante descansó al menos 30 segundos entre ensayos para minimizar la variabilidad inducida por fatiga. R (versión 4.2) se utilizó posteriormente para calcular reglas de movimiento y ángulos de rango de movimiento articular, y para resumir las características operativas de la técnica.
Selección de sensores mediante visualización de características
Los datos de fuerza en bruto de los 24 sensores de todas las pruebas se cargaron en R. La magnitud y varianza media de la fuerza para cada sensor se calcularon en todo el conjunto de datos. Se construyó un diagrama de relleno de burbujas utilizando el paquete ggplot2 en R para mostrar la contribución relativa de cada falange/metacarpo de dedos al esfuerzo total de fuerza. Según este diagrama (Figura 4), los sensores 8 (falange proximal del dedo meñique), 13 (falange distal del dedo medio) y 2 (falange distal del índice) mostraron las mayores magnitudes de fuerza y variabilidad, por lo que fueron seleccionados como las características principales de entrada para modelados posteriores.

Figura 4. Diagrama de relleno de burbujas de los nudillos en el método de rodar. (1) falange proximal del dedo índice; (2) falange distal del dedo índice; (3) metacarpo del dedo índice; (4) falange media del dedo índice; (5) falange proximal del dedo anular; (6) falange distal del dedo anular; (7) falange metacarpiana del dedo anular; (8) falange proximal del dedo meñique; (9) falange distal del dedo meñique; (10) metacarpo del meñique; (11) falange media del dedo meñique; (12) falange proximal del dedo medio; (13) falange distal del dedo corazón; (14) metacarpo del dedo corazón; (15) falange del dedo medio del dedo medio. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Preprocesamiento de datos para modelado de series temporales
Los datos de fuerzas en serie temporal F8(t), F13(t) y F2(t) para los sensores seleccionados se extrajeron del conjunto de datos en bruto. Se creó una variable de tiempo normalizada T escalando las marcas de tiempo de grabación al intervalo [0'1]. Se utilizó la siguiente fórmula:

Donde t era la marca de tiempo original en segundos. Para cada ensayo, los datos de fuerza y el tiempo normalizado se concatenaron en un conjunto de datos de series temporales multivariantes de dimensiones N × 4, donde N era el número de pasos de tiempo (6.000 pasos para un ensayo de 60 s a 100 Hz) y las columnas correspondían a [T'F8'F 13'F 2].
Filtrado de Hodrick–Prescott (HP)
El filtro Hodrick–Prescott se aplicó de forma independiente a cada una de las tres señales de fuerza F8, F13 y F2. El parámetro de suavizado se estableció en λ = 100. Este valor se había elegido en función de la naturaleza anual/cíclica aproximada de la tendencia de la fuerza a largo plazo observada en los primeros 2.000 puntos de datos (como se demuestra en la Figura 5) y se consideró adecuado para preservar las características de la fuerza biomecánica.

Figura 5. Comparación de los efectos del filtro HP con λ = 100 y λ = 10.000 en los primeros 2.000 puntos de datos del Sensor 8. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Nota de implementación: La función hpfilter del paquete mFilter en R se utilizó con el argumento frecuencia = 100.
Se obtuvieron dos componentes para cada señal del sensor: el componente de tendencia G(t) y el componente cíclico C(t), donde
. La matriz final de características de entrada se construyó concatenando el tiempo normalizado con los componentes de tendencia y cíclicos filtrados por HP de los tres sensores seleccionados. Esto dio lugar a un conjunto de datos de N × 7 dimensiones:
. El conjunto de datos se dividió cronológicamente en subconjuntos de entrenamiento (70%), validación (15%) y test (15%). Crítica: Se evitó el baratón aleatorio de las series temporales para evitar fugas temporales. El set de prueba contenía el 15% final de la secuencia temporal registrada.
Construcción del modelo LSTM de dos capas con filtrado HP
El entorno computacional se configuró usando TensorFlow (versión 2.10) con la API Keras en R. La arquitectura de la red neuronal se definió de la siguiente manera:
Capa de entrada: Forma = (longitud de secuencia'7), donde sequence_length era el número de pasos de tiempo por muestra de entrada (se usaron 100 pasos).
Primera capa LSTM: Unidades = 50, return_sequences = VERDADERO. La función de activación del tanh se utilizaba para el paso recurrente, y el sigmoide para las activaciones de la puerta.
Segunda capa LSTM: Unidades = 50, return_sequences = FALSO.
Capa totalmente conectada (densa): Unidades = 1 (para la predicción de fuerzas univariantes). El flujo de trabajo completo del modelo LSTM de doble capa con filtrado HP, desde el preprocesamiento de datos hasta la predicción final, se ilustra en la Figura 6. El objetivo de salida era el valor de fuerza en el Sensor 8 en el siguiente paso temporal (predicción de un paso por delante).

Figura 6. Gráfico de flujo de trabajo de aplicaciones LSTM de doble capa. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
El modelo se compiló usando el algoritmo de optimización de Adam con los siguientes hiperparámetros: Tasa de aprendizaje: 0,001; Tasa de decaimiento: 0,001; Función de pérdida: Error cuadrático medio (MSE). El modelo se entrenó durante 20 épocas con un lote de 32. El Early Stopping se implementó con una paciencia de 5 épocas monitorizando la pérdida de validación para evitar sobreajustes. Se aplicó una tasa de abandono de 0,2 entre las capas LSTM para la regularización. Los datos de entrenamiento se barajaban solo a nivel de lote dentro de cada época—no en el orden secuencial—para mantener la coherencia temporal mientras se introducía la estocasticidad para el descenso por gradiente.
Configuración de datos de pruebas
Para evaluar el rendimiento predictivo de los modelos propuestos, el conjunto de datos preprocesado se particionó cronológicamente en tres subconjuntos: entrenamiento (70%), validación (15%) y test (15%). La división cronológica aseguró que no se filtrara información futura en el proceso de entrenamiento. El conjunto de pruebas comprendía los últimos 2.000 pasos de tiempo × 3 sensores = 6.000 puntos de datos de la secuencia grabada, lo que corresponde a aproximadamente 20 s de datos de esfuerzo de fuerza continua a la frecuencia de muestreo original de 100 Hz. Para la evaluación de capacidades de predicción de mayor duración, se construyó una secuencia de pruebas extendida de 1.200 s (120.000 pasos de tiempo) concatenando cronológicamente 20 ensayos consecutivos de 60-s preservando el orden temporal. Se verificó la continuidad de la fuerza entre ensayos concatenados para garantizar que no hubieran transiciones abruptas.
Métricas de rendimiento
Se calcularon tres métricas estándar de regresión para cuantificar la precisión de las predicciones:
Coeficiente de determinación (R2): Definido como
, donde yi denotan
los valores de fuerza real y predicho, respectivamente, y
es la media de los valores reales. R2 mide la proporción de varianza en los datos de fuerza explicados por el modelo.
Error absoluto medio (MAE): Definido como
. El MAE proporciona la magnitud media de los errores de predicción en unidades de Newtons (N).
Error cuadrático medio de raíz (RMSE): definido como
. La RMSE es sensible a grandes desviaciones de error y se expresa en Newtons (N).
Todas las métricas se calcularon en el conjunto de pruebas no visto tras revertir cualquier transformación de normalización o escalado aplicada durante el preprocesamiento.
Modelos comparativos de referencia
Para comparar el LSTM propuesto de dos capas con filtrado Hodrick–Prescott (HP), se implementaron y evaluaron los siguientes modelos alternativos bajo idénticas divisiones de entrenamiento, validación y prueba. Los hiperparámetros para todos los modelos de redes neuronales se ajustaron usando el conjunto de validación para garantizar una comparación justa.
LSTM de una sola capa sin filtrado HP
Arquitectura: Una única capa LSTM con 50 unidades ocultas, seguida de una capa densa totalmente conectada con una sola neurona de salida.
Características de entrada: datos de fuerza en bruto de los Sensores 8, 13 y 2, más tiempo normalizado (entrada en 4 dimensiones).
Entrenamiento: optimizador Adam con tasa de aprendizaje = 0,001, decaimiento = 0,001, tamaño del lote = 32, entrenado durante 20 épocas con parada temprana (paciencia = 5) monitorizando la pérdida de validación.
LSTM de doble capa sin filtrado HP
Arquitectura: Dos capas LSTM apiladas, cada una con 50 unidades ocultas. La primera capa LSTM devolvía secuencias completas, y la segunda capa LSTM solo devolvía el estado oculto final. A continuación, se desarrolló una capa de salida densa con una neurona.
Características de entrada: Iguales que las anteriores (entradas de fuerza bruta de 4 dimensiones).
Parámetros de entrenamiento: Idénticos a la configuración de LSTM de una sola capa.
LSTM de una sola capa con filtrado HP
Arquitectura: Una única capa LSTM con 50 unidades ocultas seguida de una capa de salida densa.
Características de entrada: Componentes de tendencia y cíclicos descompuestos por HP para los Sensores 8, 13 y 2, además de tiempo normalizado T (entrada de 7 dimensiones, según se describe en el Protocolo).
Parámetros de entrenamiento: Iguales que antes.
PCA-LSTM
Reducción de dimensionalidad: Se aplicó el Análisis de Componentes Principales (PCA) a la matriz de características filtrada por HP de 7 dimensiones para extraer tres componentes principales, que en conjunto explicaban el >95% de la varianza en el conjunto de características.
Arquitectura: Una única capa LSTM con 50 unidades ocultas, que recibe como entrada las tres series temporales principales de componentes.
Parámetros de entrenamiento: Iguales que antes.
Red neuronal de retropropagación (BP)
Arquitectura: Una red neuronal feedforward con una capa oculta que contiene 64 neuronas y activación de ReLU. La capa de salida contenía una sola neurona lineal.
Representación de entrada: Los datos de series temporales se aplanaron en vectores de características de longitud fija (100 pasos de tiempo × 7 características = 700 dimensiones de entrada).
Entrenamiento: optimizador Adam con tasa de aprendizaje = 0,001, pérdida por error cuadrático medio, entrenado para 100 épocas con un tamaño de lote de 64. Parar temprano con paciencia = se aplicó 10.
Regresor de Bosque Aleatorio
Algoritmo: Conjunto de 100 árboles de decisión con una profundidad máxima de 10 y un conjunto mínimo de muestras por división a 5.
Representación de entrada: Mismos vectores de características aplanadas que se usan para la red neuronal BP (entrada de 700 dimensiones).
Implementación: El RandomForestRegressor de la biblioteca scikit-learn (versión 1.2) se empleaba con hiperparámetros predeterminados excepto donde se especificara arriba.
Consideraciones estadísticas
Para evaluar la robustez del rendimiento predictivo, cada configuración del modelo fue entrenada y evaluada cinco veces con diferentes inicializaciones aleatorias (cuando correspondía). Las métricas reportadas representan los valores medios a lo largo de las cinco pruebas, acompañadas de la desviación estándar para cuantificar la variabilidad. No se aplicó validación cruzada a la serie temporal para preservar el orden temporal; en su lugar, se utilizó el conjunto fijo de validación cronológica para la sintonización de hiperparámetros.