$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudio no incluyó participantes humanos ni sujetos animales. Por lo tanto, no se requería la aprobación ética ni el consentimiento informado. El marco propuesto de clasificación tejida tejida de extremo a extremo (Figura 1) consta de cuatro etapas secuenciales: adquisición de imágenes, preprocesamiento y aumento, entrenamiento del modelo y evaluación. La salida de cada etapa sirve como entrada para la siguiente.
Etapa 1: Adquisición de imágenes: Se obtuvieron imágenes tejidas del conjunto de datos y se capturaron utilizando una cámara digital bajo un sistema de iluminación controlada. Las imágenes se adquirían a 300 dpi usando una distancia focal fija de 50 mm.
Etapa 2: Preprocesamiento y aumento: Las imágenes se redimensionaron y prepararon para el entrenamiento. Para mejorar la generalización, se aplicaron aumentos geométricos y fotométricos utilizando un marco de aprendizaje profundo que incluyó volteos horizontales y verticales (p = 0,1), traslación afín (±0,1), escalado (0,8–1,2) y rotación (±45°). Los ajustes fotométricos incluyeron variaciones en brillo, contraste y saturación (±40%) y variación de matiz (±10%).
La eliminación de ruido basada en UNet se aplicó antes de la formación. El modelo de UNet se implementó en la biblioteca de software de aprendizaje profundo (marco de aprendizaje profundo Keras) y se entrenó durante 30 épocas usando el optimizador Adam (tasa de aprendizaje = 0,001, tamaño de lote = 16).
Etapa 3: Entrenamiento con modelo: Se utilizó un GAN para generar imágenes sintéticas de tejidos con el fin de realzar características. El discriminador constaba de cinco capas convolucionales con activación LeakyReLU, mientras que el generador incluía cuatro capas convolucionales y cuatro capas de deconvolución. El GAN se entrenó para 100 épocas usando pérdida binaria de entropía cruzada (tasa de aprendizaje = 0,0002, β₁ = 0,5). El clasificador CNN (backbone ResNet-50) fue entonces entrenado conjuntamente en un marco iterativo GAN–CNN con un tamaño de lote de 32, dropout de 0,2, tasa de aprendizaje de 0,001 y el optimizador Adam.
Etapa 4: Evaluación del modelo: El rendimiento del modelo se evaluó utilizando precisión, exactitud, recuerdo, puntuación F1 y precisión balanceada.
1. Descripción del conjunto de datos
Se obtuvieron un total de 3.540 imágenes tejidas de 880 muestras de tela de un conjunto de datos público bajo condiciones de iluminacióncontrolada 12. De estas, se utilizaron 2.832 imágenes para pruebas, mientras que las 708 imágenes restantes se ampliaron para generar 11.328 muestras de entrenamiento. El conjunto de datos está anonimizado y, por tanto, no requiere aprobación ética. Las muestras representativas se muestran en la Figura 2.
El conjunto de datos comprende tres clases de tejido: liso, satinado y sarga. Los tejidos se producían utilizando hilos texturizados de poliéster (densidades lineales de filamento 110 dtex; 1,14 y 3,05 dtex) y hilos texturizados con microfilamento de poliéster (110 dtex; 0,33, 0,57 y 0,76 dtex) como trama, y hilos de poliéster 83 dtex (1,14 dtex) como urdimbre. Se construyeron tres tipos de tejido —1/1 liso, 3/2 sarga y 4/1 satén—.
Los datos utilizados en este estudio se obtuvieron de un conjunto de datos público que incluye imágenes en bruto y preprocesadas, metadatos de aumento y muestras generadaspor GAN 12. Se aplicaron aumentos adicionales y síntesis basadas en GAN para aumentar aún más la diversidad de formación. del conjunto de datos. El conjunto de datos final contenía 11.328 imágenes de entrenamiento y 2832 de prueba; El 80% de los datos de entrenamiento se utilizaron para entrenamiento de modelos y el 20% para validación. Los parámetros estructurales variaban de la siguiente manera: densidad lineal del hilo (Ne: 6–40), número de hilo (25–58 extremos/cm) y densidad de área textil (125–485 gsm). La formación y las pruebas se realizaban en una unidad de procesamiento gráfico utilizando un marco y software de aprendizaje profundo.
2. Preprocesamiento Eficiente Propuesto con aumento
Para abordar la limitación de datos de entrenamiento y mejorar la generalización, se aplicó aumento de datos. La ampliación amplía el conjunto de datos sin modificar la arquitectura del modelo, reduce el sobreajuste y mejora la robustez. Se emplearon dos tipos de aumento:
Aumento geométrico:
Las transformaciones incluían volteretas horizontales y verticales (p = 0,1), transformación afín (trasladar = 0,1, escala = 0,8–1,2) y rotación en ángulo fijo (45°). Estas operaciones simulan variaciones en la orientación urdimbre-trama y en las condiciones de imagen (Figura 3).
Aumento fotométrico:
Para aumentar la robustez a la iluminación y la variabilidad del sensor, el brillo, el contraste y la saturación se ajustaron en un ±40% y el matiz en un ±10%. Estas modificaciones preservan la estructura geométrica mientras varían las características de iluminación (Figura 4).
3. Eliminación de ruido usando UNet
UNet es una arquitectura convolucional codificador–decodificador utilizada para reducir el ruido de texturas estructuradas de tejido tejido. Debido a que los patrones de tela son sensibles al ruido de sensores e iluminación, se realiza la eliminación de ruido antes de la clasificación para preservar los detalles estructurales; la red utiliza una función de activación sigmoide en la capa de salida y la arquitectura de reducción de ruido basada en UNet (Figura 5). Las imágenes con desruido sirvieron como entradas refinadas para la cadena GAN–CNN para la generación y clasificación sintética. La formulación matemática del proceso de eliminación de ruido de UNet y la estrategia de optimización GAN (Ecuaciones 1–10) se proporcionan en el Archivo Suplementario 1. La interacción entre los módulos de UNet, GAN y CNN dentro del marco de extremo a extremo se ilustra en la Figura 6.
4. Generación y entrenamiento de modelos de extremo a extremo propuestos usando GAN-CNN
Se empleó el marco híbrido GAN–CNN para el reconocimiento de patrones de tejidos tejidos. Como se muestra en la Figura 6, se utilizó una red generativa adversarial (GAN), compuesta por un generador (G) y un discriminador (D), para sintetizar imágenes tejidas realistas bajo condiciones variables de iluminación, ruido y textura para aumentar la diversidad de conjuntos de datos, mientras que la CNN aprendió características discriminativas tanto de muestras reales como generadas para mejorar la precisión de la clasificación.
5. Clasificación basada en CNN
Tras la síntesis de imágenes basada en GAN, se utilizaron tanto imágenes reales como generadas de tela para entrenar una CNN para la extracción y clasificación de características de texturas. Se adoptó una arquitectura ResNet-50 preentrenada para clasificar tres tipos de tejido. Se eliminó la capa original totalmente conectada, mientras que las primeras capas convolucionales se mantuvieron como columna vertebral. Sobre esta columna vertebral, se añadieron una capa de pooling promedio global, dos capas de normalización por lotes, dos capas totalmente conectadas (512 y 256 neuronas), activaciones de ReLU y dropout. Una capa Softmax realizaba la clasificación final de tres clases. La arquitectura modificada se muestra en la Figura 7.
El modelo fue entrenado usando el optimizador Adam con pérdida categórica de entropía cruzada durante 50 épocas (tamaño del lote = 32, tasa de aprendizaje = 0,001, abandono = 0,2). El ajuste de hiperparámetros se realiza mediante búsqueda en cuadrícula (tasa de aprendizaje: 0,001–0,0001; tamaño del lote: 16–64; abandono: 0,1–0,3). Se aplicó una parada temprana basada en la pérdida de validación para evitar el sobreajuste, logrando la convergencia en aproximadamente 2,3 horas por entrenamiento.
Se empleó una estrategia coordinada de entrenamiento de extremo a extremo para garantizar la coherencia en las etapas de reducción de ruido, síntesis de datos y clasificación. La UNet fue preentrenada por primera vez para 30 épocas usando pares de imágenes ruidosas-limpias (Adam, tasa de aprendizaje = 0,001, tamaño del lote = 16, pérdida MSE). El módulo GAN, compuesto por un generador con cuatro capas convolucionales y cuatro capas de deconvolución y un discriminador con cinco capas convolucionales usando activaciones LeakyReLU, fue entrenado adversarialmente durante 100 épocas (pérdida binaria de entropía cruzada, β₁ = 0,5, tasa de aprendizaje = 0,0002). Posteriormente, el GAN y el CNN se entrenaron conjuntamente en un bucle iterativo durante 50 épocas (tamaño de lote = 32), utilizando muestras generadas para actualizar el clasificador. La optimización CNN utilizó el optimizador Adam (tasa de aprendizaje = 0,001, dropout = 0,2), promoviendo una convergencia estable y una generalización mejorada entre tipos de entrelazado.