$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudo não envolveu participantes humanos nem animais envolvidos. Portanto, aprovação ética e consentimento informado não eram necessários. A estrutura proposta de classificação de tecido tecido de ponta a ponta (Figura 1) consiste em quatro etapas sequenciais: aquisição de imagem, pré-processamento e aumento, treinamento de modelos e avaliação. A saída de cada estágio serve como entrada para o próximo.
Etapa 1: Aquisição da imagem: Imagens de tecido tecido foram obtidas a partir do conjunto de dados e capturadas usando uma câmera digital sob um sistema de iluminação controlada. As imagens eram adquiridas a 300 dpi usando uma distância focal fixa de 50 mm.
Etapa 2: Pré-processamento e aumento: As imagens foram redimensionadas e preparadas para o treinamento. Para potencializar a generalização, aumentos geométricos e fotométricos foram aplicados usando uma estrutura de aprendizado profundo que incluía flips horizontais e verticais (p = 0,1), translação afim (±0,1), escala (0,8–1,2) e rotação (±45°). Os ajustes fotométricos incluíram variações de brilho, contraste e saturação (±40%) e variação de matiz (±10%).
A redução de ruído baseada na UNet foi aplicada antes do treinamento. O modelo UNet foi implementado na biblioteca de software de aprendizado profundo (framework de aprendizado profundo Keras) e treinado por 30 épocas usando o otimizador Adam (taxa de aprendizado = 0,001, tamanho do lote = 16).
Etapa 3: Treinamento de modelo: Um GAN foi usado para gerar imagens sintéticas de tecido tecido para realçar características. O discriminador compreendia cinco camadas convolucionais com ativação LeakyReLU, enquanto o gerador incluía quatro camadas convolucionais e quatro camadas de deconvolução. O GAN foi treinado para 100 épocas usando perda binária de entropia cruzada (taxa de aprendizado = 0,0002, β₁ = 0,5). O classificador CNN (backbone ResNet-50) foi então treinado conjuntamente em uma estrutura iterativa GAN–CNN com tamanho de lote de 32, dropout de 0,2, taxa de aprendizado de 0,001 e o otimizador Adam.
Etapa 4: Avaliação do Modelo: O desempenho do modelo foi avaliado usando precisão, exatidão, recordação, pontuação F1 e precisão balanceada.
1. Descrição do conjunto de dados
Um total de 3.540 imagens de tecidos tecidos de 880 amostras de tecido foram obtidas de um conjunto de dados público sob condições de iluminaçãocontrolada 12. Dessas, 2.832 imagens foram usadas para testes, enquanto as 708 imagens restantes foram ampliadas para gerar 11.328 amostras de treinamento. O conjunto de dados é anonimizado e, portanto, não requer aprovação ética. Amostras representativas são mostradas na Figura 2.
O conjunto de dados compreende três classes de telagem: simples, cetim e sarja. Os tecidos eram produzidos usando fios texturizados de poliéster (densidades lineares de filamento 110 dtex; 1,14 e 3,05 dtex) e fios texturizados com microfilamento de poliéster (110 dtex; 0,33, 0,57 e 0,76 dtex) como trama, e fios de poliéster 83 dtex (1,14 dtex) como urdidura. Três tipos de tecelagem — 1/1 simples, 3/2 sarja e 4/1 cetim — foram construídos.
Os dados utilizados neste estudo foram obtidos a partir de um conjunto de dados público disponível que inclui imagens brutas e pré-processadas, metadados de aumento e amostras geradas porGAN 12. Aumentos adicionais e síntese baseada em GAN foram aplicados para aumentar ainda mais a diversidade de treinamento. do conjunto de dados. O conjunto final de dados continha 11.328 imagens de treinamento e 2832 de testes; 80% dos dados de treinamento foram usados para treinamento de modelos e 20% para validação. Os parâmetros estruturais variaram da seguinte forma: densidade linear do fio (Ne: 6–40), contagem de fios (25–58 extremidades/cm) e densidade de área do tecido (125–485 gsm). O treinamento e os testes eram realizados em uma unidade de processamento gráfico usando uma estrutura e software de deep learning.
2. Pré-processamento Eficiente Proposto com Aumento
Para abordar dados limitados de treinamento e melhorar a generalização, foi aplicada a ampliação de dados. A ampliação expande o conjunto de dados sem modificar a arquitetura do modelo, reduz o sobreajuste e aumenta a robustez. Dois tipos de aumento foram empregados:
Aumento geométrico:
As transformações incluíam flips horizontais e verticais (p = 0,1), transformação afim (translate = 0,1, escala = 0,8–1,2) e rotação em ângulo fixo (45°). Essas operações simulam variações na orientação urdidura-trama e nas condições de imagem (Figura 3).
Aumento fotométrico:
Para aumentar a robustez à iluminação e variabilidade dos sensores, brilho, contraste e saturação foram ajustados em ±40% e matiz em ±10%. Essas modificações preservam a estrutura geométrica enquanto variam as características de iluminação (Figura 4).
3. Redução de ruído usando UNet
UNet é uma arquitetura convolucional codificador–decodificador usada para reduzir ruído em texturas estruturadas de tecido tecido. Como os padrões de tecido são sensíveis ao ruído de sensores e iluminação, a redução de ruído é realizada antes da classificação para preservar detalhes estruturais; a rede utiliza uma função de ativação sigmoide na camada de saída e a arquitetura de denoising baseada na UNet (Figura 5). As imagens desruidadas serviram como entradas refinadas para a pipeline GAN–CNN para geração e classificação sintética. A formulação matemática do processo de redução de ruído da UNet e da estratégia de otimização GAN (Equações 1–10) são fornecidas no Arquivo Suplementar 1. A interação entre os módulos UNet, GAN e CNN dentro do framework de ponta a ponta é ilustrada na Figura 6.
4. Geração e treinamento propostos de modelos de ponta a ponta usando GAN-CNN
A estrutura híbrida GAN–CNN foi empregada para reconhecimento de padrões de tecidos tecidos. Como mostrado na Figura 6, uma rede generativa adversarial (GAN), composta por um gerador (G) e um discriminador (D), foi usada para sintetizar imagens realistas de tecido tecido sob condições variadas de iluminação, ruído e textura, aumentando a diversidade do conjunto de dados, enquanto a CNN aprendeu características discriminativas tanto de amostras reais quanto geradas para melhorar a precisão da classificação.
5. Classificação baseada na CNN
Após a síntese de imagens baseada em GAN, tanto imagens reais quanto geradas de tecido tecido foram usadas para treinar uma CNN para extração e classificação de características de textura. Uma arquitetura pré-treinada ResNet-50 foi adotada para classificar três tipos de telagem. A camada original totalmente conectada foi removida, enquanto as primeiras camadas convolucionais foram mantidas como espinha dorsal. Sobre essa espinha dorsal, foram adicionadas uma camada global de pooling médio, duas camadas de normalização em lote, duas camadas totalmente conectadas (512 e 256 neurônios), ativações de ReLU e dropout. Uma camada Softmax realizou a classificação final de três classes. A arquitetura modificada é mostrada na Figura 7.
O modelo foi treinado usando o otimizador Adam com perda categórica de entropia cruzada por 50 épocas (tamanho do lote = 32, taxa de aprendizado = 0,001, abandono = 0,2). A sintonia por hiperparâmetros é realizada via busca em grade (taxa de aprendizado: 0,001–0,0001; tamanho do lote: 16–64; dropout: 0,1–0,3). Paradas precoces baseadas na perda de validação foram aplicadas para evitar sobreajuste, com convergência alcançada em aproximadamente 2,3 horas por treinamento.
Foi empregada uma estratégia coordenada de treinamento de ponta a ponta para garantir consistência entre as etapas de redução de ruído, síntese de dados e classificação. O UNet foi pré-treinado inicialmente para 30 épocas usando pares de imagens ruidosas e limpas (Adam, taxa de aprendizado = 0,001, tamanho do lote = 16, perda MSE). O módulo GAN, composto por um gerador com quatro camadas convolucionais e quatro camadas de deconvolução e um discriminador com cinco camadas convolucionais usando ativações LeakyReLU, foi treinado adversarialmente por 100 épocas (perda binária de entropia cruzada, β₁ = 0,5, taxa de aprendizado = 0,0002). Posteriormente, o GAN e a CNN foram treinados conjuntamente em um ciclo iterativo por 50 épocas (tamanho do lote = 32), com amostras geradas sendo usadas para atualizar o classificador. A otimização CNN utilizou o otimizador Adam (taxa de aprendizado = 0,001, dropout = 0,2), promovendo convergência estável e melhorando a generalização entre os tipos de teagem.