O sistema de colaboração ciberfísica integrado com inteligência artificial explicável apresentado foi testado experimentalmente em aproximadamente 12.000 gravações de áudio do Conjunto de Dados MIMII, que contém condições normais e anormais de máquinas. O conjunto de dados de treinamento consistiu em cerca de 9.600 registros, enquanto o conjunto de dados de teste incluiu aproximadamente 2.400 amostras de áudio. Com base nos resultados, o modelo proposto de CNN-transformer alcançou uma precisão de classificação de 98,5% no conjunto de dados de teste, entre 0,97 e 0,98. Isso se relaciona aos resultados na Tabela 3, à matriz de confusão e à análise de estabilidade estatística. A integração do codificador transformador aprimora as capacidades de modelagem temporal da arquitetura, enquanto a CNN extrai características espaciais discriminativas do espectrograma de entrada.
Além do desempenho de classificação, outras características relacionadas ao sistema foram avaliadas. Em primeiro lugar, a latência de inferência para uma implementação baseada em edge não excedeu 20 ms, permitindo a detecção em tempo real de anomalias. Em segundo lugar, o sistema apresentado ajudou a melhorar a eficiência energética ao reduzir os requisitos de comunicação. Por fim, o framework proposto de Inteligência Artificial Explicável fornece interpretabilidade SHAP, tornando o modelo mais fácil de analisar sob a perspectiva de um especialista na área. Os dados MIMII foram convertidos em espectrogramas por meio da Transformada de Fourier de Curta Duração (STFT), utilizando um tamanho de janela de 1024, um tamanho de salto de 512 e um tamanho de Transformada Rápida de Fourier (FFT) de 1024. Os espectrogramas Mel log resultantes foram redimensionados para 224 × 224 pixels e, em seguida, normalizados pelo escore z. Métodos de aumento de dados, incluindo máscara de tempo, máscara de frequência e adição de ruído gaussiano, foram utilizados para aumentar a robustez do modelo treinado. A arquitetura da CNN consistiu em quatro camadas convolucionais com 32, 64, 128 e 256 filtros, respectivamente, e incluiu normalização por lote, ReLU e camadas de agrupamento máximo. Os mapas de características extraídos foram transformados em sequências e usados como entradas para o codificador transformer, que consistiu em quatro camadas codificadoras, oito cabeças de atenção, um embedding de 256 dimensões e uma dimensão de alimentação direta de 1024. Uma probabilidade de dropout de 0,3 foi aplicada para minimizar o sobreajuste. O otimizador Adam com uma taxa de aprendizado de 0,0001 e uma redução de peso de 1 x 10⁻5 foi utilizado para o treinamento. O número de épocas e o tamanho do lote no treinamento foram 100 e 32, respectivamente. A semente aleatória foi definida como 42 para manter a reprodutibilidade do experimento. Os seguintes métodos foram utilizados para verificar a validade estatística dos resultados: todos os experimentos foram executados independentemente 10 vezes com diferentes sementes aleatórias e embaralhamentos de dados. Os valores médios e os desvios padrão de Acurácia, Precisão, Revocação, Pontuação F1, área sob a curva característica de operação do receptor (ROC-AUC) e área sob a curva precisão-revocação (PR-AUC) foram calculados. Além disso, intervalos de confiança de 95% foram calculados para estimar a incerteza de desempenho. Por fim, um teste t pareado foi realizado comparando os resultados da nossa abordagem CNN-transformer com o modelo de referência de melhor desempenho. O método de parada antecipada foi aplicado utilizando 10 épocas como parâmetro de paciência. Tabela 4 apresenta a Configuração Ambiental e a Configuração de Hiperparâmetros, e Tabela 5 fornece os detalhes do Ambiente de Simulação.
O experimento de avaliação no presente trabalho foi conduzido utilizando o conjunto de dados MIMII, que inclui diversas condições operacionais de máquinas e cenários acústicos de falhas. Embora os resultados do framework proposto validem o modelo, é necessária uma validação adicional em diversos conjuntos de dados industriais e ambientes de manufatura.
A estrutura proposta foi implementada em uma plataforma de computação de borda equipada com um processador multicore, 16 GB de memória do sistema e um acelerador de borda com unidade de processamento gráfico (GPU) para suportar inferência em tempo real e explicabilidade. Sensores acústicos industriais transmitiram fluxos de áudio para o gateway de borda por meio da camada de comunicação IIoT. Os nós de borda foram utilizados para executar tarefas como criação de espectrogramas, inferência de anomalias e geração de explicações SHAP, enquanto o servidor em nuvem foi usado para armazenar dados de longo prazo e atualizar o modelo. Essa configuração não apenas reduz a quantidade de comunicação necessária, mas também permite a interação em tempo real entre dispositivos sensores, módulos de IA e operadores humanos em sistemas ciberfísicos.
A abordagem CNN-transformer apresentada acima é comparada a diversos métodos existentes, incluindo modelos convencionais de aprendizado de máquina (ML), como máquina de vetores de suporte (SVM) e floresta aleatória, modelos CNN sem o transformador e métodos baseados em memória de longo prazo curto (LSTM). Embora modelos tradicionais de ML não alcancem resultados satisfatórios devido à incapacidade de processar correlações espaciais e temporais nos dados, os modelos CNN podem lidar eficientemente com características espaciais, enquanto os modelos LSTM conseguem tratar os aspectos temporais de sinais acústicos. No entanto, os primeiros são inferiores aos últimos em termos de custo computacional e capacidade de processamento paralelo.
Para garantir uma comparação justa entre o modelo proposto CNN-transformer e os modelos de referência, o primeiro foi treinado e avaliado utilizando a mesma divisão do conjunto de dados MIMII (80% para treinamento e 20% para testes), etapas de pré-processamento, processo de criação de espectrogramas e medidas de avaliação. No método SVM, foi utilizado o kernel de função de base radial (RBF), com C = 10 e γ = 0,01. O método de floresta aleatória incluiu 200 árvores, com profundidade máxima de árvore de 20. Quanto à CNN, ela possuía quatro camadas de convolução (32, 64, 128 e 256 filtros), seguidas por camadas totalmente conectadas, sem um módulo Transformer. Por fim, para o método LSTM, foram utilizadas duas camadas LSTM empilhadas com 128 unidades ocultas e uma taxa de dropout de 0,3.
Por outro lado, o uso do framework CNN-transformer permite obter os melhores resultados aproveitando eficientemente as capacidades espaciais e temporais dos sinais acústicos. Além disso, o uso da computação de borda permite reduzir os custos computacionais, melhorar a latência e economizar energia. Adicionalmente, a explicabilidade das previsões implementada usando SHAP pode ser considerada outra vantagem que diferencia o método proposto das técnicas existentes.
Apesar dos avanços recentes no desenvolvimento de novos modelos para detecção de anomalias acústicas, como o Vision Transformer (ViT), Audio Spectrogram Transformer (AST), Conformer e modelos baseados em aprendizado auto-supervisionado, uma comparação experimental dessas arquiteturas não foi realizada no presente estudo. No futuro, esses modelos estão planejados para serem utilizados como referência na avaliação do framework proposto.
Métricas, incluindo acurácia, precisão, revocação e pontuação F1, são utilizadas para avaliar o desempenho do modelo proposto. Enquanto a precisão mede a razão entre verdadeiros positivos e o número total de verdadeiros positivos e falsos positivos, a acurácia avalia a correção geral das previsões. A revocação fornece uma estimativa da capacidade do modelo de prever anomalias em um determinado sistema. Isso é crucial porque a falha em prever um defeito pode levar a falhas no sistema. A seguir está como essas métricas são calculadas matematicamente:
(25)
(26)
(27)
(28)
Além dessas, métricas adicionais relacionadas ao desempenho do sistema, como latência, utilização de energia e escalabilidade, são consideradas ao avaliar o desempenho no mundo real do modelo CPS proposto com base na computação de borda.
Além das técnicas padrão de medição de desempenho, existem muitas outras medidas que podem ajudar a avaliar a solução proposta de uma perspectiva mais abrangente, especialmente considerando sua aplicabilidade a estudos de caso com dados desbalanceados e em fluxo no mundo real. Por exemplo, a capacidade do algoritmo de distinguir entre os dois grupos com base em diferentes limiares é medida pela área sob a curva da característica operacional do receptor (ROC-AUC). Dada sua robustez e separabilidade, o valor de ROC-AUC deve ser alto. Além disso, a métrica área sob a curva precisão-revocação (PR-AUC) é importante para o estudo de caso de detecção de anomalias, uma vez que as classes anormais são raras.
Uma medida importante a ser considerada é o Coeficiente de Correlação de Matthews (MCC). Ele leva em conta os quatro elementos da matriz de confusão e fornece uma avaliação precisa, mesmo na presença de desequilíbrio entre classes. Esta medida é calculada da seguinte forma:
(29)
Os valores do MCC variam de -1 a +1, sendo +1 a indicação de uma previsão perfeita. A outra métrica que poderia ser aplicada é a Especificidade (Taxa de Verdadeiros Negativos), que seria útil em uma aplicação industrial para avaliar se existem previsões falsas positivas:
(30)
Para garantir que não houvesse inconsistência entre a matriz de confusão e as métricas de desempenho, todos os critérios de avaliação foram calculados com base no conjunto de dados de teste final. As notações de verdadeiro positivo (TP), verdadeiro negativo (TN), falso positivo (FP) e falso negativo (FN) são utilizadas ao longo das equações a seguir. Exatidão, Precisão, Revocação, Especificidade, pontuação F1 e MCC foram calculados com base nas Eqs. (25)–(30). Além disso, ROC-AUC e PR-AUC foram calculados a partir das saídas de probabilidade do modelo CNN-transformer por meio de avaliação de limiar independente.
As métricas principais a serem consideradas no nível do sistema incluem latência, taxa de transferência e custo computacional. Latência é o tempo necessário para fazer uma previsão. Taxa de transferência é a quantidade de amostras de dados processadas por segundo. O custo computacional, que representa a eficiência energética, é importante para garantir a eficiência computacional. Além disso, métricas de explicabilidade, como consistência SHAP e estabilidade da importância das características, também podem ser consideradas ao avaliar o modelo.
É evidente pelos resultados da Tabela 3 para o conjunto de dados MIMII que o modelo proposto CNN-transformer supera todos os demais métodos de aprendizado de máquina e aprendizado profundo. O desempenho dos modelos SVM e floresta aleatória é aceitável, embora limitado, com precisões de 88,6% e 91,2%, respectivamente. Isso pode ser explicado pela incapacidade desses modelos de extrair características temporais e espaciais complexas de sinais acústicos. No entanto, o LSTM supera o SVM e a floresta aleatória, alcançando precisão de 94,5% ao modelar dados de séries temporais. Contudo, a abordagem CNN-transformer sugerida demonstra o melhor desempenho, com precisão aprimorada (98,5%), revocação (99,02%), pontuação F1 (98,54%) e exatidão (98,06%). Assim, o algoritmo sugerido pode classificar com precisão condições normais e anormais de máquinas. A especificidade aprimorada (97,96%) demonstra a eficácia da abordagem na redução de falsos positivos, o que é crucial para a indústria. Deve-se notar que o desempenho do CNN-transformer pode ser explicado pela combinação de CNN e Transformer, em que o primeiro extrai características discriminativas e o segundo captura relações temporais em sequências longas.
A curva ROC na Figura 6 mostra o desempenho comparativo dos métodos SVM, floresta aleatória, LSTM e o modelo proposto CNN-transformer em relação às suas capacidades de classificação com base no conjunto de dados MIMII. Conforme mostrado na Figura 6, a maior Área Sob a Curva (AUC) foi observada para o modelo CNN-transformer proposto, que alcançou 0,994. É evidente que o método proposto oferece melhor desempenho discriminativo para distinguir entre categorias normais e anormais. Por outro lado, o LSTM apresenta resultados ligeiramente inferiores ao do modelo CNN-transformer sugerido; portanto, seu valor de AUC é cerca de 0,97. Tanto a floresta aleatória quanto o SVM apresentam AUCs relativamente baixos, cerca de 0,958 e 0,913, respectivamente. Isso se deve à incapacidade de ambos os métodos de aprender padrões acústicos complexos a partir dos dados fornecidos.
Na detecção de anomalias, onde as amostras anômalas são escassas, a curva precisão-revocação (PR) oferece uma análise mais adequada. Na curva PR, o modelo CNN-transformer alcança a maior Precisão Média (AP), cerca de 0,97–0,98, indicando capacidade superior para detectar instâncias anômalas com menos alarmes falsos, conforme mostrado na Figura 7. Por outro lado, o classificador LSTM ocupa o segundo lugar, com um AP variando entre 0,92 e 0,94. Já os classificadores floresta aleatória e SVM ocupam o terceiro e o quarto lugares, respectivamente, com APs de 0,88 e 0,84. O classificador híbrido proposto alcança maior precisão em todos os níveis de revocação, o que é importante para aplicações industriais práticas, pois estas exigem alta precisão e baixos índices de falsos alarmes.
O modelo CNN-transformer foi comparado com modelos existentes no conjunto de dados MIMII utilizando métricas avançadas de desempenho apresentadas na Tabela 6. O valor ROC-AUC indica a capacidade discriminatória do modelo entre as duas classes em vários limiares. Os classificadores SVM e floresta aleatória alcançam valores de ROC-AUC de 0,913 e 0,958, respectivamente, enquanto o modelo LSTM atinge um ROC-AUC de 0,970 e a CNN obtém 0,98. A estrutura proposta CNN-transformer alcança o maior ROC-AUC de 0,994, demonstrando discriminação superior entre condições normais e anormais da máquina. Da mesma forma, os valores PR-AUC indicam que o modelo proposto pode lidar eficazmente com o desequilíbrio de classes, um fator essencial na detecção de anomalias. O modelo CNN-transformer proposto alcança o maior PR-AUC (Precisão Média) de 0,982, seguido pela CNN (0,950), LSTM (0,912), floresta aleatória (0,891) e SVM (0,765), indicando desempenho superior em precisão e revocação para detecção de anomalias acústicas industriais. Além disso, o Coeficiente de Correlação de Matthews (MCC), que mede o equilíbrio do desempenho do modelo, apresenta um valor relativamente alto de 0,97 para o modelo proposto. No entanto, métodos anteriores, como SVM (0,73) e floresta aleatória (0,78), apresentaram precisão preditiva inferior.
Para testar a estabilidade da abordagem apresentada, o mesmo experimento foi realizado 10 vezes com diferentes sementes de inicialização e esquemas de embaralhamento de dados. Os resultados na Tabela 7 para a arquitetura CNN-transformer foram os seguintes: acurácia = 98,50% ± 0,19%, precisão = 98,06% ± 0,23%, revocação = 99,02% ± 0,22% e pontuação F1 = 98,54% ± 0,24%. O desvio padrão relativamente pequeno indica a estabilidade do modelo. Os intervalos de confiança de 95% foram calculados para todas as medidas de avaliação. Determinou-se que o intervalo de confiança para a métrica de acurácia foi [98,1%, 98,9%], indicando que o modelo apresenta desempenho consistentemente bom. Intervalos de confiança estreitos também foram determinados para ROC-AUC, PR-AUC e MCC. O teste t pareado comparando o modelo proposto CNN-transformer e o modelo de referência com melhor desempenho (LSTM) resultou em um valor de p < 0,05, indicando que o ganho de desempenho observado é significativo e não decorrente do acaso.
Para testar a robustez da arquitetura proposta de CNN-transformer, os experimentos foram repetidos 10 vezes com diferentes sementes de inicialização aleatória e configurações de embaralhamento, conforme mostrado na Figura 8. A acurácia média, precisão, revocação e pontuação F1 obtidas pelo modelo foram de 98,50% ± 0,19%, 98,06% ± 0,23%, 99,02% ± 0,22% e 98,54% ± 0,24%, respectivamente. A partir da análise do gráfico de caixa, observa-se variações mínimas nas métricas de desempenho do modelo, indicando sua estabilidade e robustez. Assim, a abordagem proposta exibe alta estabilidade em múltiplos experimentos, sem variações significativas, indicando, portanto, boas capacidades de generalização do modelo.
Além disso, um teste estatístico foi realizado com base nos resultados de múltiplas execuções do experimento. Os pequenos desvios-padrão em todas as medidas de avaliação indicam pouca suscetibilidade a variações na aleatoriedade ou no treinamento. Isso confirma que o modelo proposto de CNN-transformer pode oferecer desempenho estável e consistente em sistemas ciberfísicos de manufatura do mundo real.
O mapa de calor SHAP fornece uma indicação da importância das regiões de tempo-frequência no espectrograma para prever se a condição da máquina é normal ou anormal. Os valores SHAP indicam a contribuição de cada preditor para a previsão final.
No mapa de calor dos valores SHAP mostrado na Figura 9A, valores SHAP positivos (por exemplo, entre +0,6 e +1,2) representam contribuição para a anormalidade, enquanto valores SHAP negativos (ou seja, entre −0,3 e −0,8) representam contribuição para a categoria normal. A pontuação SHAP mais intensa foi encontrada na faixa de frequência média (40–80 intervalos de frequência) nos quadros de tempo de 50 a 100. Essas regiões são áreas-chave onde sinais críticos de falha são detectados em medições acústicas. Além disso, a banda de baixa frequência (menos de 20 intervalos) apresenta pontuações SHAP quase nulas (−0,1 a +0,1), indicando um impacto desprezível na tomada de decisão do modelo. Isso indica que o modelo ignora o ruído de fundo irrelevante para a previsão de falhas. A consistência temporal de pontuações SHAP elevadas dentro de faixas de tempo específicas também destaca a capacidade do módulo Transformer de capturar dependências de longo alcance em sinais acústicos. Em resumo, o mapa de calor SHAP mostra claramente que o modelo CNN-Transformer se concentra em bandas tempo-frequência únicas com alto poder discriminativo. Isso aumenta a interpretabilidade do modelo e ajuda o operador humano a detectar falhas visualmente.
Mostra-se que o método SHAP é usado exclusivamente como uma técnica de interpretabilidade e não faz parte do processo de treinamento do modelo CNN-transformer. A precisão da classificação é determinada unicamente pelos parâmetros aprendidos pelos componentes CNN e Transformer. O SHAP é utilizado após a etapa de inferência do modelo para interpretar as previsões, identificando as janelas tempo-frequência mais influentes que direcionam as previsões para categorias normais ou anormais. Assim, o SHAP melhora a transparência e a compreensão humanas sem afetar a precisão da classificação. Os valores SHAP fornecidos pela estrutura proposta permitem uma visualização clara que ajudará os operadores de manutenção a verificar as previsões do modelo comparando as regiões detectadas com o comportamento real da máquina e os registros de manutenção. Dessa forma, será mais fácil para as pessoas colaborarem com máquinas durante atividades de manutenção preditiva.
Para avaliar o nível de explicabilidade, foi realizada uma análise global de SHAP sobre a importância das características, conforme ilustrado na Figura 9B. Os resultados mostram que alguns componentes de frequência média desempenham um papel significativo na detecção de anomalias. Além disso, um estudo de caso ilustrado na Figura 9C demonstra que o SHAP identifica corretamente as regiões relevantes para falhas em espectrogramas anormais de máquinas. O estudo envolveu um estudo de caso qualitativo utilizando amostras de dados anormais de bombas e válvulas do conjunto de dados MIMII. No caso de bombas com falha, o SHAP identificou faixas de frequência de 2–4 kHz associadas à cavitação e ao desgaste. No caso de válvulas com falha, a ativação do SHAP foi predominante em áreas com sinais harmônicos repetidos, indicativos de vazamento. Em amostras de teste representativas, as visualizações do SHAP identificaram com confiabilidade zonas tempo-frequência discriminativas associadas a condições anômalas da máquina. Ao destacar as regiões espectrais que contribuem mais significativamente para cada previsão, essas explicações esclarecem como o modelo toma decisões. A análise SHAP é oferecida como uma ferramenta de interpretabilidade para compreensão do comportamento do modelo, e não como verificação de falhas validada por especialistas, pois a validação formal por profissionais de manutenção estava fora do escopo deste estudo.
A matriz de confusão destaca o quão bem o modelo proposto CNN-transformer realiza a classificação no conjunto de dados MIMII mostrado na Figura 10. No geral, 960 amostras normais foram corretamente identificadas como normais (Verdadeiros Negativos), enquanto 20 amostras normais foram incorretamente identificadas como anormais (Falsos Positivos). Além disso, dentre todas as amostras, 1010 amostras anormais foram detectadas como tais (Verdadeiros Positivos), enquanto 10 amostras anormais foram identificadas como normais (Falsos Negativos).
Assim, foi alcançado um alto desempenho de detecção, especialmente para amostras anômalas, que são cruciais na manutenção preditiva. Conforme mostrado na Figura 10, um erro Falso Negativo é observado muito raramente (10 amostras) – isso é vital para qualquer indústria garantir sua segurança e confiabilidade. Por outro lado, o erro Falso Positivo (20 amostras) ocorre ligeiramente com mais frequência, mas permanece em um nível relativamente baixo. A matriz de confusão apresentada na Figura 10 foi gerada usando um subconjunto balanceado de 2.000 gravações de teste (números iguais de amostras normais e anômalas) para fornecer uma visualização clara do desempenho do classificador. Todas as métricas de avaliação relatadas, incluindo acurácia, precisão, revocação, especificidade e pontuação F1, foram calculadas utilizando o conjunto completo de testes (aproximadamente 2.400 gravações).
Levando em consideração a matriz de confusão representada na Figura 10 e na Tabela 8 (VN = 960, FP = 20, VP = 1010, FN = 10), podem ser realizados os seguintes cálculos: Acurácia = (VP + VN) / (VP + VN + FP + FN) = 98,50%, Precisão = VP/(VP + FP) = 98,06%, Revocação = VP/(VP + FN) = 99,02%, Especificidade = VN / (VN + FP) = 97,96%, F1-score = 98,54% e MCC = 0,97. Além disso, os valores de ROC-AUC e PR-AUC foram 0,994 e 0,982, respectivamente. A matriz de confusão apresentada na Figura 10 foi gerada utilizando um subconjunto balanceado e representativo de 2.000 gravações dos dados de teste, apenas para fins de visualização. Todas as métricas quantitativas de desempenho relatadas neste estudo foram calculadas utilizando o conjunto completo de testes (aproximadamente 2.400 gravações). De modo geral, os resultados demonstram que a arquitetura proposta de CNN-transformer alcança uma acurácia de classificação de 98,5%, em consonância com os resultados apresentados na Tabela 8 e na análise de ablação.
Para verificar a eficácia da implementação baseada em borda, foram realizadas medições adicionais. A latência média de inferência do modelo proposto é de 18,7 ms/amostra, e ele pode processar aproximadamente 53 amostras por segundo, conforme mostrado na Tabela 9. O consumo de energia durante a inferência foi de 8,9 W, resultando em um consumo energético estimado de 0,167 J/predição. Para avaliar o impacto sustentável da abordagem proposta na Tabela 10, foram considerados a sobrecarga de comunicação, o consumo de energia e o uso de recursos. Como o processo de inferência ocorre localmente em nós de borda, apenas dados diagnósticos resumidos são transmitidos para o ambiente em nuvem. Os resultados experimentais indicaram uma redução de 73% na comunicação em comparação com sistemas CPS baseados em nuvem tradicionais. Além disso, a inferência local reduziu o consumo de energia em 32%, enquanto o tempo de comunicação diminuiu de 75 ms para 20 ms.
Estudo de ablação
O conjunto de dados MIMII é submetido a uma pesquisa de ablação para avaliar o impacto de cada componente da arquitetura CPHS baseada em IA explicável. Este estudo de ablação investiga os efeitos do uso de uma CNN para aprender características espaciais, um codificador de transformador para aprender características temporais e do próprio algoritmo de explicabilidade SHAP. Várias modificações do modelo proposto são consideradas, a saber: (i) uma versão somente com CNN, (ii) uma versão somente com Transformador, (iii) o modelo com CNN e Transformador combinados, mas sem o algoritmo SHAP, e (iv) o modelo completo proposto com CNN e Transformador combinados ao SHAP. Para avaliação, métricas comuns como acurácia, precisão, revocação e pontuação F1 são empregadas.
Esses resultados do estudo de ablação demonstram a importância de cada elemento na estrutura descrita na Tabela 11. O modelo somente com CNN atinge uma acurácia de 93,8%, indicando que a extração de características espaciais de espectrogramas é eficaz, mas não consegue capturar dependências temporais em sinais acústicos. O mesmo se aplica ao modelo somente com Transformer, que atinge uma acurácia ligeiramente menor (92,6%), pois extrai características temporais, mas negligencia informações espaciais. Por fim, o modelo proposto CNN-Transformer obteve uma acurácia de 98,5%, precisão de 98,06%, revocação (recall) de 99,02% e pontuação F1 de 98,54%, em conformidade com os resultados do experimento principal. Como o SHAP é usado apenas para interpretação pós-hoc e não para o treinamento do modelo, a acurácia de classificação é a mesma daquele do modelo CNN-Transformer treinado. O SHAP é então utilizado para gerar explicações baseadas na atribuição de características. A melhoria no recall (99,02%) indica que o modelo é eficaz na detecção de condições anormais nas máquinas, garantindo que nenhuma peça com defeito seja ignorada, o que é essencial para a implementação de um sistema de manutenção preditiva.
DISPONIBILIDADE DE DADOS:
O conjunto de dados Malfunctioning Industrial Machine Investigation and Inspection (MIMII) utilizado neste estudo está disponível publicamente no repositório oficial Zenodo. Os experimentos foram conduzidos utilizando gravações de áudio e anotações de acesso público fornecidas pelos autores do conjunto de dados. O conjunto de dados pode ser acessado em https://zenodo.org/records/3384388. O código de implementação que acompanha este estudo está disponível publicamente por meio do repositório Zenodo em https://zenodo.org/records/21405292. O repositório inclui o código de implementação para o framework proposto, incluindo o pipeline de pré-processamento dos dados, arquitetura do modelo, fluxo de trabalho de treinamento, scripts de avaliação, arquivos de configuração e utilitários auxiliares para facilitar a compreensão e a reprodução independente da metodologia proposta. O conjunto de dados MIMII não é redistribuído junto com o código de implementação e deve ser obtido separadamente a partir de seu repositório oficial.

Figura 1: Arquitetura do trabalho proposto. Projeto arquitetônico de um sistema ciberfísico humano orientado por IA explicável, combinando pré-processamento, aprendizado espacial baseado em CNN, modelagem temporal baseada em transformadores, explicabilidade SHAP e computação de borda para manufatura sustentável. Clique aqui para visualizar uma versão maior desta figura.

Figura 2: Pipeline de pré-processamento. Pipeline de pré-processamento de sinal acústico composto pela remoção de ruído, normalização, segmentação, transformação STFT e extração do espectrograma. Clique aqui para visualizar uma versão maior desta figura.

Figura 3: Extração de características espaciais usando CNN. Arquitetura para extração de características espaciais por meio de CNNs utilizando espectrogramas através do processo de convolução, ativação e agrupamento. Clique aqui para visualizar uma versão maior desta figura.

Figura 4: Modelagem temporal utilizando um codificador transformer. Arquitetura de codificador transformer para capturar dependências temporais e dependências de longo alcance por meio da representação de sequência de espectrograma. Clique aqui para visualizar uma versão maior desta figura.

Figura 5: Camada de classificação. Uma camada classificadora que mapeia as características temporais codificadas em valores de probabilidade para prever a condição da máquina. Clique aqui para visualizar uma versão maior desta figura.

Figura 6: Resultado da curva ROC. Comparação das curvas ROC para os algoritmos SVM, floresta aleatória, LSTM, CNN e CNN-transformer proposto no conjunto de dados MIMII. Clique aqui para visualizar uma versão maior desta figura.

Figura 7: Resultado da curva precisão-revocação. Comparação da curva precisão-revocação representando a eficiência na detecção de anomalias de diversos métodos de aprendizado de máquina e aprendizado profundo. Clique aqui para visualizar uma versão maior desta figura.

Figura 8: Análise de estabilidade de desempenho em múltiplas execuções. Gráfico de caixa mostrando a estabilidade no desempenho dos resultados de Acurácia, Precisão, Revocação e pontuação F1 obtidos em dez experimentos independentes realizados com a arquitetura proposta de CNN-transformer. As pequenas variações indicam estabilidade e robustez do modelo. Clique aqui para visualizar uma versão maior desta figura.

Figura 9: Análise de explicabilidade baseada em SHAP do framework proposto para detecção de anomalias. (A) Análise de explicabilidade baseada em SHAP. Mapa de calor utilizando o método SHAP para mostrar as zonas tempo-frequência mais relevantes que levam à identificação de comportamento anômalo. (B) Análise de importância de características utilizando a abordagem global SHAP para identificação das características mais influentes. (C) Visualização da explicabilidade SHAP para uma máquina anormal. Clique aqui para visualizar uma versão maior desta figura.

Figura 10: Matriz de confusão para o conjunto de dados MIMII. A matriz de confusão representa o desempenho de classificação do algoritmo proposto CNN-transformer. Clique aqui para visualizar uma versão maior desta figura.
| Parâmetro | Descrição |
| Nome do Conjunto de Dados | Conjunto de Dados MIMII (Malfunctioning Industrial Machine Investigation and Inspection) |
| Tipos de Máquinas | Válvulas, Bombas, Ventiladores, Trilhos Deslizantes |
| Total de Amostras Utilizadas | Aproximadamente 12.000 gravações de áudio |
| Classes | Normal, Anormal |
| Taxa de Amostragem | 16 kHz |
| Duração por Amostra | 10 segundos |
| Formato de Áudio | WAV |
| Representação de Características | Imagens de Espectrograma Baseadas em STFT |
| Etapa de Pré-processamento | Filtragem de Ruído, Normalização, Segmentação, Transformação STFT |
| Atribuição de Rótulos | Gravações normais rotuladas como Classe 0; gravações anormais rotuladas como Classe 1 de acordo com as anotações do MIMII |
| Divisão Treino-Teste | 80% para Treinamento (≈9.600 amostras), 20% para Teste (≈2.400 amostras) |
| Estratégia de Particionamento dos Dados | Divisão no nível de arquivos de áudio realizada antes da segmentação para evitar vazamento de dados |
| Condições de Ruído Industrial | Ambientes acústicos industriais realistas incluídos nas gravações do MIMII |
| Domínio de Aplicação | Manutenção Preditiva e Detecção de Anomalias em Máquinas |
| Objetivo Alvo da Indústria 5.0 | Detecção de Falhas Explicável, Centrada no Humano e Sustentável |
Tabela 1: Descrição do conjunto de dados. Descrição do conjunto de dados MIMII com relação ao tipo de máquina, distribuição de amostragem, características do sinal, representação de características e aspectos de aplicação.
| Tipo de Máquina | IDs da Máquina | Gravações Normais | Gravações Anômalas | Condições de SNR (dB) | Divisão Experimental |
| Fan | ID00–ID06 | 8.400 | 1.600 | −12 a −9 | 80% Treinamento / 20% Teste |
| Gearbox | ID00–ID06 | 7.124 | 1.147 | −17 a −15 | 80% Treinamento / 20% Teste |
| Pump | ID00–ID06 | 7.200 | 1.800 | −18 a −9 | 80% Treinamento / 20% Teste |
| Slide Rail | ID00–ID05 | 7.000 | 1.800 | −14 a −12 | 80% Treinamento / 20% Teste |
| Valve | ID00–ID05 | 7.000 | 1.800 | −12 a −9 | 80% Treinamento / 20% Teste |
Tabela 2: Descrição do conjunto de dados MIMII utilizado neste estudo. Tipos de máquinas industriais, identificações das máquinas, quantidades de gravações normais e anômalas, condições de SNR e a divisão treino/teste utilizada para classificação binária supervisionada.
| Modelo | Precisão (%) | Exatidão (%) | Recuperação (%) | Pontuação F1 (%) | Especificidade (%) |
| SVM | 88.6 | 86.9 | 85.4 | 86.1 | 90.2 |
| Floresta Aleatória (RF) | 91.2 | 89.8 | 88.5 | 89.1 | 92.6 |
| LSTM | 94.5 | 93.2 | 92.8 | 93 | 95.1 |
| CNN | 96.3 | 95.4 | 94.9 | 95.1 | 96.8 |
| CNN–Transformador (Proposto) | 98.5 | 98,06 | 99,02 | 98,54 | 97,96 |
Tabela 3: Resultado da classificação para o conjunto de dados MIMII. Comparação do desempenho de classificadores de aprendizado de máquina e aprendizado profundo utilizando acurácia, precisão, revocação, pontuação F1 e especificidade.
| Parâmetro | Valor |
| Conjunto de Dados | MIMII Dataset |
| Total de Amostras | ~12.000 |
| Divisão Treino-Teste | 80% / 20% |
| Tipo de Entrada | Imagens de Espectrograma |
| Camadas CNN | 3–5 Camadas de Convolução |
| Camadas Transformer | 2–4 Camadas Codificadoras |
| Tamanho do Lote | 32 |
| Taxa de Aprendizado | 0,001 |
| Otimizador | Adam |
| Épocas | 100 |
| Hardware | Dispositivo de Borda + GPU (para treinamento) |
| Comprimento da Janela STFT | 1024 |
| Tamanho do Salto | 512 |
| Tamanho da FFT | 1024 |
| Resolução do Espectrograma | 224 × 224 |
| Normalização | Z-score |
| Aumento de Dados | Máscara Temporal, Máscara de Frequência, Ruído Gaussiano |
| Camadas CNN | 4 |
| Filtros CNN | 32, 64, 128, 256 |
| Camadas Transformer | 4 |
| Cabeças de Atenção | 8 |
| Dimensão de Embedding | 256 |
| Dimensão da Rede Alimentada Diretamente | 1024 |
| Dropout | 0,3 |
| Semente Aleatória | 42 |
| Tolerância para Parada Antecipada | 10 |
Tabela 4: Configuração ambiental e configuração de hiperparâmetros. Parâmetros de treinamento e experimentos utilizados para implementar a arquitetura proposta de CNN-transformer.
| Componente | Especificação |
| Linguagem de Programação | Python |
| Framework | TensorFlow / PyTorch |
| Processador | Intel i7 / Ryzen 7 |
| GPU | NVIDIA GTX 1660 / Série RTX |
| Dispositivo de Borda | Raspberry Pi / NVIDIA Jetson |
| Visualização | Matplotlib, SHAP |
| Dispositivo de Borda | NVIDIA Jetson Xavier NX |
| CPU | 6 núcleos ARM v8.2 |
| RAM | 16 GB |
| Sistema Operacional | Ubuntu 20.04 |
| Framework de Aprendizado Profundo | TensorFlow/PyTorch |
| Tamanho do Conjunto de Dados | 12.000 amostras MIMII |
| Conectividade | Ethernet/Wi-Fi |
| Parâmetros do Modelo | 8,4 milhões |
| Tamanho do Modelo | 32,7 MB |
| Framework | PyTorch + TensorRT |
| Tamanho do Lote | 1 |
| Quantização | FP16 |
| Poda | Não |
| Latência Média | 17,8 ms |
| Latência Mediana | 17,2 ms |
| Latência no 95º Percentil | 19,6 ms |
| Taxa de Transferência | 56 amostras/s |
| Uso de Memória | 1,4 GB |
| Consumo de Energia | 11,3 W |
Tabela 5: Ambiente de simulação. Hardware e software foram utilizados para treinar, implantar e avaliar o modelo proposto.
| Modelo | ROC-AUC | PR-AUC | MCC |
| SVM | 0.913 | 0.765 | 0.73 |
| Floresta Aleatória (RF) | 0.958 | 0.891 | 0.78 |
| LSTM | 0.97 | 0.912 | 0.86 |
| CNN | 0.98 | 0.95 | 0.9 |
| CNN–Transformer (Proposto) | 0.994 | 0.982 | 0.97 |
Tabela 6: Comparação dos resultados experimentais para ROC-AUC, PR-AUC e MCC. Comparação entre vários modelos com base nas medidas de ROC-AUC, PR-AUC e coeficiente de correlação de Matthews.
| Métrica | Média (%) + DesvPad (%) | Confiança de 95% |
| Exatidão | 98.50 ± 0.19 | [98.1, 98.9] |
| Precisão | 98.06 ± 0.23 | [98.0, 98.2] |
| Revocação | 99.22 ± 0.22 | [98.8, 99.4] |
| Pontuação F1 | 98.54 ± 0.24 | [98.1, 98.9] |
| ROC-AUC | 0.984 | 0.004 |
| PR-AUC | 0.982 | 0.005 |
| MCC | 0.97 | 0.007 |
Tabela 7: Resultado da análise estatística de múltiplas execuções. Estatísticas de robustez para a arquitetura proposta de CNN-transformer ao longo de 10 experimentos, incluindo média, desvio padrão, intervalo de confiança de 95% e significância para diversas medidas de desempenho.
| Métrica | Valor |
| Exatidão | 98,50% |
| Precisão | 98,06% |
| Sensibilidade | 99,02% |
| Especificidade | 97,96% |
| Pontuação F1 | 98,54% |
| MCC | 0,97 |
| ROC-AUC | 0,994 |
| PR-AUC | 0,982 |
Tabela 8: Conjunto final de teste da matriz de confusão. A matriz de confusão do conjunto de teste para a arquitetura proposta, mostrando a classificação dos estados normais e anormais das máquinas a partir dos quais foram derivadas as métricas de avaliação.
| Métrica | Implantação em Nuvem | Implantação na Borda |
| Latência de Inferência (ms) | 85,6 | 18,7 |
| Taxa de Transferência (amostras/s) | 22 | 53 |
| Uso de Rede (MB/min) | 120 | 18 |
| Energia por Previsão (J) | 0,52 | 0,17 |
| Capacidade em Tempo Real | Moderada | Alta |
Tabela 9: Resultado da latência de inferência. O desempenho de latência da implantação em borda do framework CPHS habilitado para IA Explicável, incluindo tempo de processamento, taxa de transferência, consumo de memória e outras características em tempo real.
| Métrica | CPS baseado em nuvem | CPHS proposto com suporte a edge | Melhoria |
| Transmissão de dados por hora | 100% | 35% | Redução de 65% |
| Latência de comunicação | 75 ms | 20 ms | Redução de 73,3% |
| Consumo de energia | 100% | 68% | Redução de 32% |
| Estimativa de emissão de carbono | 100% | 70% | Redução de 30% |
Tabela 10: Avaliação da sustentabilidade do CPHS habilitado para borda. Medições de sobrecarga de comunicação, consumo de energia, utilização de recursos e latência são utilizadas para avaliar a sustentabilidade do CPHS habilitado para borda.
| Variante do modelo | Precisão (%) | Exatidão (%) | Revocação (%) | Pontuação F1 (%) |
| Apenas CNN | 93.8 | 92.5 | 94.2 | 93.3 |
| Apenas Transformer | 92.6 | 91.2 | 93.5 | 92.3 |
| CNN + Transformer | 98.5 | 98.06 | 99.02 | 98.54 |
Tabela 11: Resultado do estudo de ablação. Resultado do estudo de ablação destacando o efeito dos módulos CNN, Transformer e SHAP no desempenho do modelo proposto.