Se requiere una suscripción a JoVE para ver este contenido. Inicie sesión o comience su prueba gratuita.

Artículo de método

Fusión de atención cruzada de características acústicas tiempo-frecuencia para el reconocimiento de fallos en el aislamiento en equipos eléctricos utilizando un sistema de matriz de micrófonos

32 vistas

DOI:

10.3791/71752

21 de julio de 2026

En este artículo

Resumen

Este protocolo describe un método sin contacto para reconocer fallos de aislamiento en equipos eléctricos mediante la extracción y fusión de características acústicas en el dominio del tiempo y la frecuencia para la clasificación automatizada de fallos.

Resumen

El objetivo de este protocolo es proporcionar un método sin contacto para reconocer fallos de aislamiento en equipos eléctricos extrayendo y fusionando características acústicas en el dominio del tiempo y la frecuencia para la clasificación automatizada de fallos. Las huellas acústicas generadas por fallos de aislamiento presentan características no lineales y no gaussianas, lo que puede limitar la eficacia de los enfoques convencionales de extracción de características de dominio único. Para abordar este desafío, este protocolo presenta un marco de extracción de características y fusión tiempo-frecuencia basado en un mecanismo de atención cruzada (CA) para la identificación de cuatro tipos de fallos de aislamiento. Las características en el dominio del tiempo se extraen primero utilizando una red convolucional temporal acoplada a un autocodificador para capturar variaciones dinámicas en señales acústicas secuenciales. Paralelamente, se extraen características en el dominio de la frecuencia de espectrogramas Mel utilizando un módulo de atención por bloque convolucional para mejorar la representación de características espectrales. A continuación, se emplea un mecanismo de CA para fusionar adaptativamente características temporales y espectrales, fortaleciendo las relaciones entre ambos dominios de características. La representación de características fusionadas se introduce posteriormente en una red neuronal convolucional unidimensional optimizada utilizando el algoritmo Cuckoo Search para la clasificación de fallos. Los resultados representativos demuestran que este marco caracteriza eficazmente huellas acústicas complejas y logra un alto rendimiento de clasificación en comparación con los enfoques convencionales de extracción de características. El protocolo proporciona una estrategia robusta de no contacto para el diagnóstico de fallos en el aislamiento y el monitoreo del estado de los equipos eléctricos.

Introducción

La identificación temprana de fallos de aislamiento en equipos eléctricos es fundamental para garantizar la seguridad y estabilidad de la redeléctrica 1,2,3,4. Las estadísticas indican que aproximadamente el 60% de las fallas en equipos eléctricos están directamente asociadas con la degradación delaislamiento 5. Sin embargo, los métodos convencionales de monitorización eléctrica suelen sufrir respuesta retardada, pobres capacidades anti-interferencias y la necesidad de instalaciones invasivas basadas en contacto5. Recientemente, el reconocimiento de huellas dactilares acústicas ha surgido como un enfoque diagnóstico sin contacto prometedor debido a su rápida respuesta y facilidad de implementación 6,7. No obstante, las señales de fallo de aislamiento son inherentemente no lineales y nogaussianas 8. Sus características acústicas suelen estar enmascaradas por el ruido ambiental y las vibraciones estructurales, lo que dificulta que los métodos tradicionales de extracción de dominio único (en el tiempo o en el dominio de la frecuencia) capturen las características esenciales de la falla.

La investigación actual en la extracción de características acústicas se enfrenta a dos desafíos principales. Primero, el análisis en el dominio del tiempo, como las tasas de energía en tiempo corto o de cruce de cero, refleja las fluctuaciones de la señal pero a menudo pierde detalles espectrales finos. En segundo lugar, los métodos en el dominio de la frecuencia, como la Transformada Rápida de Fourier (FFT) y las transformadas wavelet, pueden extraer características espectrales pero tienen dificultades para captar la evolución temporal dinámica de la señal. Estudios previos han intentado salvar esta brecha. Por ejemplo, Dai et al.9 utilizaron la transformada de Fourier de corto tiempo (STFT) para generar mapas de tiempo-frecuencia bidimensionales. Sin embargo, debido al principio de incertidumbre, la resolución de STFT está limitada por el ancho de la ventana, lo que obliga a un compromiso entre localización temporal y resolución en frecuencia. Otros enfoques, como los coeficientes cepstrales de frecuencia Mel (MFCCs) y los coeficientes cepstrales de frecuencia gamma (GFCC)10, a menudo resultan en representaciones de características demasiado simples para mantener la robustez bajo condiciones de alta interferencia. Aunque las distribuciones avanzadas y las características basadas en entropía11 han alcanzado alta precisión en conjuntos de datos específicos, a menudo carecen de generalizabilidad debido a tamaños limitados de muestra. Además, la simple concatenación de características en el dominio del tiempo y la frecuencia no logra establecer un mecanismo de correlación intrínseco, lo que a menudo conduce a una alta redundancia y discriminabilidad insuficiente. Los modelos tradicionales de aprendizaje automático también tienden a sobreajustarse cuando se trata de las características de muestra pequeña y alto ruido típicas de los conjuntos de datos de fallosde aislamiento 12. Los desarrollos recientes han evolucionado desde descriptores convencionales hechos a mano y representaciones tiempo-frecuencia hacia la extracción de características basadas en redes neuronales profundas y estrategias de fusión guiadas por atención. No obstante, muchos enfoques existentes aún procesan información temporal y espectral de forma independiente o la combinan mediante simple concatenación de características, limitando su capacidad para capturar relaciones entre dominios dentro de señales acústicas complejas.

Para abordar estas limitaciones, este protocolo presenta una metodología sinérgica de extracción y fusión de características tiempo-frecuencia centrada en un mecanismo de atención cruzada (CA). El objetivo principal de este método es establecer un modelo de correlación intermodal que asigne pesos de forma adaptativa a características críticas, reduciendo así la dilución de la información comúnmente asociada a las estrategias tradicionales de concatenación. El protocolo emplea una red temporal convolucional acoplada (TCN) y una arquitectura de autoencoder (AE) para construir una vía de procesamiento en el dominio del tiempo, utilizando convoluciones causales dilatadas para capturar dependencias a largo alcance dentro de secuencias acústicas. Simultáneamente, se diseña una arquitectura paralela de espectrograma Mel y módulo de atención convolucional por bloque (CBAM) para mejorar las características espectrales locales y la atención por canal. En este enfoque es central la introducción de un mecanismo de CA, que emplea interacciones consulta–clave–valor para modelar las interdependencias entre los dominios del tiempo y la frecuencia. Conceptos similares de fusión basados en la atención se han reportado en maquinaria ruidosa y tareas acústico-diagnósticas, donde los pesos de atención enfatizan regiones temporales o espectrales discriminativas bajo interferencia; sin embargo, la mayoría de los clasificadores de descarga parcial existentes aún dependen de representaciones de dominio único o fusión tardía, lo que motiva el diseño actual de CA. Finalmente, se emplea una red neuronal convolucional unidimensional (1D-CNN), optimizada mediante el algoritmo Cuckoo Search (CS), para una clasificación robusta de fallos.

Este método ofrece ventajas significativas sobre los enfoques diagnósticos convencionales al proporcionar una solución de alto rendimiento y sin contacto que sigue siendo eficaz en entornos electromagnéticos complejos. Las métricas de rendimiento se reportan por separado para el estudio de ablación y el modelo final de clasificación. El estudio de ablación alcanzó un 98,2% de precisión para la configuración CA, mientras que el modelo final de clasificación alcanzó una precisión global del 99,05% (3962/4000), con tasas de reconocimiento por clase que oscilaron entre el 98,6% y el 99,4%. Es especialmente adecuado para investigadores e ingenieros que buscan implementar monitorización automatizada de equipos de conmutación de 10 kV o equipos similares de distribución de energía donde la detección basada en contacto sea poco práctica. Siguiendo este protocolo, los usuarios pueden caracterizar eficazmente huellas acústicas complejas y lograr una identificación fiable de fallos bajo condiciones elevadas de ruido de fondo. Los modelos acústicos basados en transformadores, incluidas las arquitecturas de transformadores de espectrograma de audio (AST), son prometedores para el modelado espectrotemporal de contexto a largo alcance; Sin embargo, no fueron seleccionados para el protocolo actual porque el conjunto de datos disponible es relativamente pequeño y el marco propuesto prioriza un entrenamiento estable, menor coste computacional y ramas interpretables de procesamiento en el dominio del tiempo y la frecuencia. La evaluación de arquitecturas basadas en transformadores representa una dirección importante para estudios futuros.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Este estudio no incluyó participantes humanos, animales vertebrados ni especímenes biológicos. Por lo tanto, no se requería la aprobación ética institucional, la aprobación para el uso de animales y la aprobación de sujetos humanos.

La Figura 1 ilustra la estructura de convolución causal dilatada utilizada dentro de la arquitectura TCN. La Figura 2 ilustra la estructura de conexión residual utilizada durante la extracción temporal de características. La Figura 3 ilustra la arquitectura AE utilizada para la reducción de dimensiones de características. La Figura 4 ilustra la arquitectura CBAM utilizada para la extracción de características espectrales. La Figura 5 ilustra el mecanismo de CA utilizado para la fusión de características tiempo-frecuencia.

figure-protocol-1
Figura 1: Estructura de convolución causal dilatada. Ilustración esquemática de la arquitectura de la red temporal convolucional (TCN) empleando convoluciones causales y dilatadas. El factor de dilatación aumenta con la profundidad de la red para expandir el campo receptivo y capturar dependencias temporales a largo alcance en señales acústicas. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-protocol-2
Figura 2: Estructura de conexión residual. Diagrama del bloque residual utilizado dentro de la arquitectura TCN. El bloque incorpora convoluciones causales, normalización de peso, funciones de activación de ReLU, capas de dropout y una conexión residual para facilitar un entrenamiento estable en redes profundas y mitigar la degradación del gradiente. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-protocol-3
Figura 3: Arquitectura del Autocodificador (AE). Representación esquemática del AE utilizado para la reducción de dimensiones de características. El codificador comprime las características acústicas de entrada en una representación latente, y el decodificador reconstruye el espacio de características original a partir de la representación comprimida. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-protocol-4
Figura 4: Arquitectura del Módulo de Atención de Bloques Convolucionales (CBAM). Flujo de trabajo del CBAM utilizado para la mejora de características en el dominio de la frecuencia. El módulo aplica secuencialmente mecanismos de atención de canal y atención espacial para refinar representaciones de características extraídas de espectrogramas Mel. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-protocol-5
Figura 5: Mecanismo de fusión de características de atención cruzada (CA). Representación esquemática del módulo CA utilizado para fusionar características temporales y del dominio de la frecuencia. Las matrices de consulta, clave y valor se generan a partir de las dos modalidades de características para modelar dependencias cruzadas y producir representaciones de características fusionadas. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

1. Configuración de la plataforma de huellas acústicas de fallos de aislamiento y adquisición de datos

  1. Construir una plataforma de detección de matriz de micrófonos sin contacto dentro del laboratorio. Montar el sistema utilizando un circuito de prueba de alta tensión, un armario de pruebas que contiene modelos de defectos, un sistema de prueba de Tensión Terrestre Transitoria (TEV) y el sistema de matriz de micrófonos. El sistema TEV funcionaba como canal de referencia eléctrico para la verificación de descargas.
    NOTA: Asegúrese de que el circuito de alta tensión incluya un autotransformador (T1), un transformador de prueba (T2), una resistencia protectora (R) de 200 kΩ y un condensador de acoplamiento (Cx) de 1 nF. Consulte la Figura 6 para el diseño esquemático.
    PRECAUCIÓN: Las pruebas de alta tensión presentan un riesgo de descarga eléctrica. Sigue los procedimientos de seguridad eléctrica institucional y asegúrate de que todos los componentes de alta tensión estén correctamente aislados y conectados a tierra antes de la operación.
  2. Configura cuatro modelos distintos de fallos de aislamiento dentro del armario de pruebas para simular defectos operativos comunes: descarga superficial, descarga suspendida, descarga interna y descarga puntual (Figura 7).
  3. Prepara los modelos de fallo de aislamiento para las pruebas.
    1. Fabricar todos los modelos en placas aislantes de resina epoxi de 100 mm × 100 mm × 5 mm utilizando electrodos pulidos.
    2. Preparar el modelo de descarga superficial fijando dos electrodos de tira de cobre de 20 mm × 10 mm × 1 mm en la superficie superior con una separación de fluencia de 15 mm. Deja la superficie epoxi intermedia expuesta.
    3. Prepara el modelo de descarga suspendida montando un electrodo de varilla de cobre de 2 mm de diámetro 5 mm por encima de una placa de cobre conectada a tierra (40 mm × 40 mm × 1 mm) mediante un soporte epoxi. Mantén el electrodo de la varilla eléctricamente aislado de la placa.
    4. Prepara el modelo de descarga interna fundiendo un bloque epoxi que contiene un vacío de aire artificial cilíndrico (10 mm de diámetro × 2 mm de altura) centrado entre dos placas de cobre (40 mm × 40 mm × 1 mm). Coloca el centro de vacío aproximadamente 2,5 mm por debajo de la superficie superior.
    5. Prepara el modelo de descarga puntual colocando un electrodo de aguja de acero inoxidable con un radio de punta aproximado de 0,5 mm frente a una placa de cobre conectada a tierra a través de un espacio de aire de 10 mm.
    6. Limpia todos los electrodos con etanol y sécalos completamente antes de montarlos.
    7. Montar la geometría electrodo-defecto en el armario de pruebas y verificar todos los espaciados entre electrodos usando un calibrador antes de cada prueba de voltaje.
  4. Despliega el sensor de matriz de micrófonos empleando una estructura espiral anular modificada compuesta por 112 canales. Consulte la Figura 8 para la distribución de coordenadas.
  5. Ajusta la frecuencia de muestreo a 200 kHz y configura la longitud de muestra a 8192 puntos por fotograma. Consulte la Tabla 1 para los parámetros del sensor.
  6. Configura el hardware de la matriz de micrófonos.
    1. Montar los 112 micrófonos al ras del marco espiral anular modificado en las posiciones de coordenadas mostradas en la Figura 8. Mantener el espaciado entre elementos definido por el archivo de coordenadas del array, que va de 10 mm a 25 mm.
    2. Coloca un calibrador acústico portátil y una fuente de referencia ultrasónica de 40 kHz a 300 mm del centro del conjunto de micrófonos.
    3. Calibrar todos los canales activos del micrófono antes de cada sesión de adquisición utilizando un SPL de 94 dB, una señal de referencia acústica de 1 kHz y una señal de referencia ultrasónica de 40 kHz.
    4. Graba 5 s de señales de calibración de cada canal de micrófono.
    5. Calcula la sensibilidad RMS y la respuesta de fase de cada canal en relación con el canal central de la matriz.
    6. Conservar solo canales con desviación de sensibilidad dentro de ±2 dB a 1 kHz, dentro de ±3 dB a 40 kHz, y sin clipping ni elevación anormal del fondo de ruido.
    7. Excluye los canales que no cumplan los criterios de aceptación de análisis posteriores.
    8. Repite el procedimiento de calibración después de cualquier reemplazo de micrófono o movimiento de la matriz de micrófonos.
  7. Configura el sistema de adquisición de datos multicanal para realizar muestreos simultáneos en todos los canales activos del micrófono.
    1. Configura el sistema DAQ para la adquisición simultánea de los 112 canales de micrófono usando un reloj de muestreo compartido de 200 kHz.
    2. Establecer la resolución de adquisición a 16 bits, configurar el acoplamiento AC y adquirir 8192 puntos por fotograma.
    3. Distribuir un disparador de arranque por hardware a todos los módulos de adquisición a través de un bus de disparo TTL de borde positivo común.
    4. Almacena todos los canales de micrófono dentro del mismo registro de fotograma y conserva la marca de tiempo del disparo y el índice de canal para cada adquisición.
    5. Inspecciona los primeros 100 fotogramas adquiridos para detectar muestras caídas, saturación del canal y deriva de reloj antes de comenzar la recogida formal de datos.
  8. Justifica la configuración del conjunto de micrófonos. El conjunto de 112 canales fue seleccionado para mejorar la densidad de muestreo espacial para la formación de haz y la estimación del retardo GCC-PHAT, aumentando así la supresión del ruido ambiental fuera del eje en relación con un arreglo escaso de bajo número de canales. Aunque aproximadamente cuatro canales pueden ser suficientes para la localización geométrica 3D, el protocolo actual utiliza muestreo espacial denso para mejorar la señal y la estabilidad de características, en lugar de localizar solo a los demás. Las versiones de canal reducido deben validarse por separado antes de su despliegue en campo, sensible al coste.
  9. Aplicar alta tensión al circuito de prueba para inducir fenómenos de descarga parcial a través de los modelos.
  10. Mantener el entorno experimental durante las pruebas.
    1. Mantener el laboratorio a 22°C ± 2°C, humedad relativa del 45%–55% y 101 ± 2 kPa de presión atmosférica durante la adquisición de datos.
    2. Mide el ruido acústico de fondo antes de activar el sistema de alta tensión.
    3. Proceder con la adquisición de datos solo cuando el nivel de ruido de fondo ponderado A sea ≤40 dB(A).
    4. Verifique que el fondo de ruido ultrasónico de cada canal activo de micrófono esté al menos 20 dB por debajo del nivel de descarga-impulso observado durante las pruebas piloto.
    5. Mantén puertas y ventanas cerradas y apaga los equipos rotativos no esenciales durante la recogida de datos.
    6. Toma a tierra el chasis de alta tensión y el chasis DAQ antes de la adquisición.
    7. Evitar el movimiento del personal cerca de la matriz de micrófonos durante la grabación.
  11. Monitoriza la actividad de descarga de forma continua utilizando el sensor TEV conectado a un terminal PC.
    1. Establece el umbral de monitorización TEV a 6 dB por encima del nivel de ruido de fondo previo a la prueba y no inferior a un nivel de entrada equivalente de 10 mV.
    2. Configura el canal de referencia TEV con un ancho de banda analógico de 3–100 MHz y una ganancia de 40 dB.
    3. Registra la actividad de pulsos TEV usando envolvente y registro de pulsos en el terminal del PC.
    4. Configura el sistema TEV para que use disparo hardware de borde positivo.
    5. Utiliza el mismo valor umbral tanto para la monitorización TEV como para la generación de disparos.
    6. Aceptar una trama acústica solo cuando ocurra actividad de pulsos TEV dentro de la ventana de adquisición correspondiente y se repita a través de tramas consecutivas al voltaje seleccionado.
  12. Ajusta progresivamente el voltaje entre 4 y 12 kV.
  13. Registrar las señales acústicas una vez que se observe un fenómeno de fallo de aislamiento distinto y estable para un modelo específico. Defina un fenómeno de fallo distinto y estable como un estado de descarga en el que la actividad del TEV y los patrones de impulsos acústicos se observan repetidamente en el voltaje objetivo sin extinción intermitente evidente, saturación del canal acústico, ruido mecánico no relacionado ni ruido de impacto externo. Mantener el voltaje hasta que el patrón de descarga se mantenga estable durante al menos 60 segundos antes de grabar fotogramas acústicos.
  14. Recopila 1000 conjuntos de datos válidos para cada uno de los cuatro tipos de fallo. Clasificar un fotograma de muestra como válido solo cuando la referencia TEV indica actividad de descarga, el canal acústico no está saturado, el bastidor no contiene impacto externo evidente ni ruido de manipulación, y la etiqueta de muestra coincide con el modelo de defecto activo. Excluir tramas con saturación del canal acústico, ausencia de confirmación TEV, etiquetado de fallos inconsistente, extinción intermitente de descarga, impacto mecánico externo o ruido de fondo inestable.
  15. Sincroniza el sistema TEV y el sistema de adquisición acústica durante la recogida de datos.
    1. Conecta la salida del disparador TEV a la entrada acústica del DAQ a través del bus compartido TTL.
    2. Utiliza la salida de pulsos TEV como disparador hardware para la adquisición de datos acústicos.
    3. Registra el marcador de disparo como un canal de temporización digital en el archivo de datos acústicos.
    4. Realizar la alineación inicial de las secuencias TEV y de adquisición acústica usando la marca de tiempo del disparo.
    5. Estima los retardos residuales entre micrófonos usando GCC-PHAT antes de la formación de haz.
    6. Verifica que la precisión de sincronización TEV-acústica esté dentro de ±1 muestra acústica, correspondiente a ≤5 μs a una frecuencia de muestreo de 200 kHz.

figure-protocol-6
Figura 6: Plataforma de detección de fallos de aislamiento con matriz de micrófonos. Montaje experimental utilizado para la detección de fallos en aislamiento acústico. La plataforma consta de un circuito de prueba de alta tensión, un armario de pruebas de fallos de aislamiento, un sistema de matriz de micrófonos, un sensor TEV y un sistema informático de monitorización para la adquisición y verificación de datos. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-protocol-7
Figura 7: Modelos de fallos de aislamiento construidos en laboratorio. Modelos representativos de fallo de aislamiento utilizados para la adquisición de datos. (A) Modelo de descarga superficial. (B) Modelo de descarga suspendida. (C) Modelo de descarga interna. (D) Modelo de descarga puntual. Los modelos se construyeron para simular cuatro condiciones comunes de fallo de aislamiento bajo condiciones controladas de laboratorio. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-protocol-8
Figura 8: Distribución de la matriz de micrófonos. Disposición espacial de la matriz de micrófonos de 112 canales empleando una configuración espiral anular modificada. La distribución de coordenadas ilustra la colocación de los sensores utilizada para la adquisición de señales acústicas y el posterior análisis de formación de haz. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Tipo de parámetroValor de parámetro
Estructura del arrayEspiral anular modificada
Número de canales112
Frecuencia de muestreo200 kHz
Puntos de muestra por fotograma8192

Tabla 1: Parámetros de la matriz de micrófonos. Especificaciones técnicas del sistema de matriz de micrófonos utilizado para la adquisición de señales acústicas durante experimentos de fallo de aislamiento. La tabla resume la geometría del array, el número de canales, la tasa de muestreo y el número de puntos de muestreo adquiridos por fotograma. Por favor, haz clic aquí para descargar esta tabla.

2. Extracción de características en el dominio temporal mediante TCN-AE

  1. Introdujo los datos acústicos preprocesados de series temporales en el TCN para capturar variaciones temporalesdinámicas 13,14. Tras la fusión de señales, normaliza cada marco acústico de 8192 puntos usando el procedimiento de normalización aplicado durante el entrenamiento del modelo e introduce la secuencia 1D normalizada en el TCN.
  2. Configura la arquitectura TCN.
    1. Construye el TCN usando tres bloques residuales organizados secuencialmente para la extracción temporal de características.
    2. Asignar 64 filtros convolucionales a cada bloque residual y establecer el tamaño del núcleo de convolución en 3.
    3. Implementar convoluciones causales dilatadas y configurar los factores de dilatación como d = 1, 2 y 4 para expandir progresivamente el campo receptivo temporal.
    4. Aplica la función de activación de ReLU después de cada operación convolucional.
    5. Aplica una tasa de abandono de 0,20 después de cada bloque residual para reducir el sobreajuste durante el entrenamiento.
    6. Realizar la normalización de peso como método de regularización dentro de cada bloque residual.
    7. Incorpora conexiones residuales a lo largo de la red y utiliza proyecciones convolucionales 1 × 1 siempre que sea necesario para igualar las dimensiones de las características entre las rutas residuales y transformadas.
  3. Aplicar convoluciones causales a la secuencia de entrada. Adapta el relleno cero previo a la secuencia en función del tamaño del núcleo para asegurar que la salida en un paso de tiempo dado dependa estrictamente de entradas actuales y previas.
  4. Ejecuta la convolución causal usando el peso del núcleo (wi) y el tamaño del núcleo (K) de la siguiente manera (Ecuación 1):
    figure-protocol-9(1)
  5. Implementa convoluciones dilatadas para expandir el campo receptivo de la red sin aumentar el número de parámetros. Aumenta el factor de dilatación d exponencialmente a medida que avanza la profundidad de la red para capturar dependencias temporales a largo alcance.
  6. Calcular la convolución dilatada usando el factor de dilatación (d) de la siguiente manera (Ecuación 2). Utiliza la progresión del factor de dilatación d = 1, 2 y 4 durante el entrenamiento de la CNT para expandir progresivamente el campo receptor temporal sin aumentar el número de puntos muestreados en cada marco acústico.
    figure-protocol-10(2)
  7. Integrar conexiones residuales para mitigar los gradientes nulos durante el entrenamiento profundo de red.
  8. Pasa la secuencia de entrada a través del bloque de convolución causal dilatado. Realiza regularización de peso y aplica una activación no lineal de ReLU seguida de una capa Dropout.
  9. Añadir la salida procesada directamente a la secuencia de entrada original (Figura 2). Aplica la normalización de peso dentro de cada bloque residual y utiliza una tasa de dropout de 0,20 antes de realizar la suma residual. Utiliza una proyección convolucional 1 × 1 cuando sea necesario para igualar las dimensiones de las características entre las rutas residuales y transformadas.
  10. Alimentar las características temporales de alta dimensión extraídas por el TCN en un AE para la reducción de dimensiones de características15.
  11. Configura la arquitectura de AE.
    1. Construye el codificador usando tres capas totalmente conectadas con dimensiones 512, 256 y 128 neuronas, respectivamente.
    2. Definamos la representación en espacio latente usando un vector de características de 128 dimensiones.
    3. Construye el decodificador usando tres capas completamente conectadas con dimensiones 128, 256 y 512 neuronas, respectivamente.
    4. Aplica la función de activación de ReLU después de cada capa completamente conectada tanto en el codificador como en el decodificador.
    5. Configura el AE para reconstruir la representación de características de entrada a partir del vector de espacio latente y optimiza la reconstrucción usando la función de pérdida de error cuadrático medio (MSE) descrita en el Paso 2.16.
  12. Comprime los datos de entrada en una representación de espacio latente de dimensión inferior mediante el codificador.
  13. Reconstruye los datos originales usando el decodificador (Figura 3).
  14. Ejecuta las transformaciones de codificación y decodificación usando la función de activación de ReLU (σ), matrices de pesos (W₁ y W₂) y términos de sesgo (b₁ y b₂) según las Ecuaciones 3 y 4.
    figure-protocol-11(3)
    figure-protocol-12(4)
  15. Entrena al AE para preservar información crítica minimizando el error de reconstrucción.
  16. Utiliza el error cuadrático medio (MSE) como función de pérdida y calcula el error de reconstrucción usando la Ecuación 5.
    1. Entrena al AE usando el optimizador Adam con una tasa de aprendizaje de 0,001.
    2. Establece el tamaño del lote en 50 y entrena la red para un máximo de 100 épocas.
    3. Controla la pérdida de validación durante el entrenamiento y aplica paradas tempranas con un valor de paciencia de 10 épocas.
    4. Utiliza la partición fija del conjunto de datos que consta de 2400 muestras de entrenamiento, 400 muestras de validación y 400 muestras de prueba.
    5. Realizar entrenamiento de modelos en el entorno de aprendizaje profundo basado en Python, resumido en la Tabla de Materiales.
    6. Calcula el error de reconstrucción usando la Ecuación 5.
      figure-protocol-13(5)

3. Extracción de características en dominio de frecuencia mediante espectrograma Mel y CBAM

  1. Aplica funciones de pre-énfasis, encuadre y ventanas a las señales acústicas de descarga parcial en bruto.
    1. Elimina el desplazamiento de CC de cada marco acústico de 8192 puntos.
    2. Aplica el preénfasis usando:
      figure-protocol-14
    3. Normaliza cada trama usando su amplitud absoluta máxima tras la eliminación del offset DC.
    4. Segmenta cada fotograma usando una ventana de Hamming de 1024 muestras.
    5. Utiliza una longitud de salto de 512 muestras, lo que corresponde a un 50% de solapamiento entre ventanas adyacentes.
    6. Calcular la transformada de Fourier de corto tiempo (STFT) usando una FFT de 1024 puntos.
    7. No aplique filtrado pasa banda adicional por software más allá de la limitación de ancho de banda del hardware frontal y los criterios de exclusión de calidad de trama descritos anteriormente.
  2. Realizar una transformada de Fourier sobre las señales procesadas.
  3. Convierte la frecuencia lineal original (f) a la escala de Mel. Este paso linealiza la percepción humana de frecuencias y reduce el peso de las bandas deinterferencia 16.
  4. Calcula la frecuencia a escala Mel (fmel) usando la frecuencia lineal original (f) (Ecuación 6).
    figure-protocol-15(6)
  5. Particionar las frecuencias en una secuencia de bancos de filtros triangulares.
  6. Calcula la suma ponderada de todas las amplitudes de señal dentro de cada ancho de banda de filtro. Aplica una función logarítmica a la salida para mejorar la consistencia perceptual respecto a las variaciones de amplitud.
  7. Calcula la salida del banco de filtros de mel usando la Ecuación 7. Aquí, S(m) es la salida del filtro m-ésima, k es el índice de frecuencia y Hm(k) define el filtro triangular.
    figure-protocol-16(7)
  8. Genera los espectrogramas Mel.
    1. Calcular la transformada de Fourier de corto tiempo usando un tamaño FFT de 1024.
    2. Aplica bancos de filtros de 256 Mel al espectro de frecuencias resultante.
    3. Genera espectrogramas de mel en el rango de frecuencias de 0 a 100 kHz.
    4. Redimensionar o representar los espectrogramas Mel resultantes como mapas de características de 256 × 256 píxeles para el procesamiento CBAM posterior.
    5. Convierte el espectrograma de potencia Mel a la escala de decibelios.
    6. Aplicar la normalización min-max por espectrograma usando el espectrograma Mel comprimido logarítmicamente (SdB):
      figure-protocol-17
    7. Realizar la normalización de forma independiente para cada imagen del espectrograma 256 × 256 Mel.
    8. Recortar los valores normalizados al rango [0,1] antes de introducir el espectrograma en la rama CBAM.
  9. Introduce los espectrogramas Mel resultantes en el CBAM para extraer las características espectralesprincipales 17.
  10. Procesar los datos mediante mecanismos secuenciales de atención por canal y atención espacial (Figura 4).
  11. Configura la arquitectura CBAM.
    1. Configura el módulo de atención al canal usando una relación de reducción de canal de 16.
    2. Mapas de características de entrada de procesos con dimensiones de 256 × 256 × 64.
    3. Aplica el agrupamiento global de promedio y el global de máximo agrupamiento para generar descriptores de canal.
    4. Pasa los descriptores agrupados por un perceptrón multicapa compartido y aplica una función de activación sigmoidea para generar pesos de atención al canal.
    5. Genera pesos de atención espacial usando un núcleo convolucional 3 × 3 aplicado a los descriptores espaciales concatenados con promedio y max-pool.
    6. Aplica una función de activación sigmoide para producir el mapa espacial final.
  12. Extrae los pesos de atención del canal.
  13. Aplica agrupación figure-protocol-18 global de promedio y global de máxima figure-protocol-19 agrupación a lo largo de las dimensiones del canal del mapa de características de entrada.
  14. Procesa los vectores descriptores globales generados a través de una capa totalmente conectada (FC) para obtener el peso de atención al canal (Mc).
  15. Calcula los pesos de atención en el canal usando la Ecuación 8. Aquí, Mc es el peso de atención del canal, FC denota la capa completamente conectada, y σ representa la función de activación sigmoide.
    figure-protocol-20(8)
  16. Extrae los pesos de atención espacial.
  17. Aplica pooling figure-protocol-21 global max y global promedio figure-protocol-22 pooling a lo largo del eje del canal.
  18. Concatena los mapas descriptores espaciales resultantes y los procesa a través de una capa convolucional para generar el peso de atención espacial (Ms).
  19. Calcula los pesos de atención espacial usando la Ecuación 9. Aquí, Ms es el peso de atención espacial, figure-protocol-23 es el descriptor espacial generado por la agrupación media global, y figure-protocol-24 es el descriptor espacial generado por la agrupación global máxima.
    figure-protocol-25(9)
    1. Concatena los descriptores espaciales promedio agrupado y max-pool a lo largo de la dimensión del canal.
    2. Aplica una convolución figure-protocol-26 3 × 3 con paso = 1 y el mismo relleno para generar el mapa de características de atención espacial.
    3. Aplicar una función de activación sigmoide a la salida de la convolución para obtener los pesos de atención espacial.
    4. Multiplica los pesos de atención espacial elemento por elemento con el mapa de características de entrada para generar la representación espacial refinada.

4. Fusión de características multimodales usando CA

  1. Implementar un mecanismo de CA para sintetizar las características temporales extraídas y las característicasespectrales 18. A diferencia de la autoatención, extraer información contextual de una modalidad para mejorar dinámicamente la representación de la otra (Figura 5).
  2. Configura la arquitectura de la CA.
    1. Establece la dimensión de incrustación en 128.
    2. Configura el módulo de CA con 4 cabezas de atención.
    3. Establece las dimensiones de proyección de consulta, clave y valor a 128 cada una.
    4. Aplica una tasa de abandono de 0,10 dentro del módulo de CA.
    5. No apliques capas de normalización post-atención ni capas de alimentación hacia adelante después del módulo de atención cruzada.
    6. Concatena las salidas de todos los cabezales de atención.
    7. Solicita abandonar la carrera con una tasa de 0,10.
    8. Aplana la representación de características resultante.
    9. Transfiere el vector de características aplanado directamente al clasificador 1D-CNN.
  3. Inicializa las matrices de Consulta (Q), Llave (K) y Valor (V) a partir de las dos secuencias de entrada distintas (características en el dominio del tiempo y en el dominio de la frecuencia).
  4. Calcula la matriz de consulta usando la Ecuación 10, donde X1 denota la matriz temporal de características producida por la vía TCN-AE, y WQ, y bQ indican la matriz de pesos aprendidos correspondiente y el término de sesgo, respectivamente.
    figure-protocol-27(10)
  5. Calcular la matriz clave usando la ecuación 11, donde X2 denota la matriz de características en el dominio de la frecuencia producida por la vía Mel-CBAM, y WK, y bK indican la matriz de pesos aprendidos correspondiente y el término de sesgo, respectivamente.
    figure-protocol-28(11)
  6. Calcula la matriz de valores usando la ecuación 12. donde WV y bV indican la matriz de pesos aprendida correspondiente y el término de sesgo, respectivamente.
    figure-protocol-29(12)
  7. Calcula la interacción con la CA basándose en la relación entre la Consulta y los elementos clave.
  8. Calcula la matriz de atención-peso usando la Ecuación 13. Aquí, αij especifica el peso de atención del i-ésimo elemento respecto al j-ésimo elemento, y dk es la dimensionalidad de los vectores clave.
    figure-protocol-30(13)
  9. Actualiza la representación final de las características calculando la suma ponderada de la matriz de valores según los pesos de atención calculados.
  10. Calcula la representación de las características fusionadas usando la Ecuación 14. Aquí, Oi es la salida de secuencia que representa la robusta huella acústica tiempo-frecuencia fusionada del fallo de aislamiento.
    figure-protocol-31(14)
    1. Genera la representación de características fusionadas con una dimensión de salida de 128.
    2. Combina las salidas de atención de tiempo cruzado y frecuencia cruzada.
    3. Aplanar la representación fusionada antes de la clasificación.
    4. Pasa la representación de características aplanadas al clasificador Softmax 1D-CNN y totalmente conectado que se muestra en la Figura 9.

figure-protocol-32
Figura 9: Marco general para la identificación de fallos de aislamiento. Flujo de trabajo del método propuesto de identificación de fallos en aislamiento. Las señales brutas de la matriz de micrófonos se fusionan y preprocesan, seguidas de la extracción de características en el dominio del tiempo usando una vía TCN–AE, la extracción de características en el dominio de la frecuencia usando espectrogramas Mel y CBAM, la fusión de características basada en CA, y la clasificación final de fallos mediante una red neuronal convolucional unidimensional. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

5. Alinear y fusionar señales de la matriz de micrófonos mediante GCC-PHAT

  1. Selecciona dos señales de micrófono para la estimación del retardo y conviértelas al dominio de la frecuencia usando la FFT.
    1. Utiliza el marco acústico completo de 8192 puntos adquirido a 200 kHz para el cálculo GCC-PHAT basado en FFT.
    2. Aplica la FFT a cada señal de micrófono seleccionada antes de calcular el espectro de potencia cruzada ponderado por PHAT.
    3. Estima el retardo temporal intercanal respecto al micrófono de referencia seleccionado utilizando el espectro de potencia cruzada ponderado por PHAT y el procedimiento IFFT mostrado en la Figura 10.
    4. Aplica GCC-PHAT en relación con el micrófono de referencia seleccionado antes de alinear los 112 canales activos del micrófono.
    5. Aplica una ventana de Hann al marco acústico completo de 8192 puntos antes del procesamiento FFT.
    6. No uses ventanas solapadas durante la estimación del retardo GCC-PHAT.
    7. Aplicar la plataforma cero de cada fotograma en ventana a 16.384 puntos antes de los cálculos FFT e IFFT.
    8. Utiliza la señal sin relleno para mejorar la resolución de pico de retardo durante la estimación de retardo.
  2. Obtén las representaciones figure-protocol-33 en el dominio de la frecuencia y figure-protocol-34 de las señales de micrófono seleccionadas.
  3. Calcula el espectro de potencias cruzadas para evaluar la similitud entre ambas señales.
  4. Introduce la función de ponderación de la transformada de fase (PHAT) para acentuar el pico de correlación cruzada y mitigar los efectos de reverberación.
  5. Calcula el espectro de potencia cruzada ponderado por PHAT usando la Ecuación 15. Aquí, figure-protocol-35 y figure-protocol-36 son las representaciones en el dominio de la frecuencia de las dos señales micrófonicas y figure-protocol-37 denota el conjugado complejo.
    figure-protocol-38(15)
  6. Aplicar la IFFT para calcular la función de correlación cruzada generalizada (GCC).
  7. Identifica la variable de retardo τ localizando el pico de la función GCC.
  8. Calcula la función GCC usando la Ecuación 16. Aquí, figure-protocol-39 es la función de correlación cruzada generalizada y representa el retardo temporal estimado.
    figure-protocol-40(16)
  9. Realizar compensación temporal para alinear las señales en función del retardo estimado.
  10. Sincroniza cada canal figure-protocol-41 respecto al micrófono de referencia usando la Ecuación 17. Aquí, figure-protocol-42 es la señal compensada por retardo y τi es el retardo estimado respecto al micrófono de referencia.
    1. Selecciona el micrófono situado más cerca del centro geométrico de la matriz como micrófono de referencia.
    2. Verifica que el micrófono seleccionado cumpla con los criterios de aceptación de calibración descritos en el Paso 1.6.
    3. Si el micrófono central no cumple los criterios de calibración, selecciona el micrófono calibrado más cercano al centro geométrico como micrófono de referencia.
    4. Estima el retardo τi para cada canal activo de micrófono en relación con el micrófono de referencia seleccionado.
    5. Alinea los 112 canales activos del micrófono con el micrófono de referencia seleccionado antes de la formación de haz.
      figure-protocol-43(17)
  11. Ejecuta la formación de haz por retardo y suma para fusionar la información espacial.
  12. Potenciar la señal originada en la dirección objetivo mientras suprime el ruido ambiental usando la Ecuación 18. Aquí, y(t) es la señal de salida en forma de haz, figure-protocol-44 es la señal compensada por retardo del i-ésimo micrófono, y N es el número total de canales de micrófono.
    1. Realizar formación de haz por retardo y suma tras la compensación de retardo GCC-PHAT.
    2. Usa un peso igual para todos los canales activos del micrófono.
    3. Conjunto N = 112 para los 112 canales activos de micrófono utilizados durante la adquisición.
    4. Define la dirección del objetivo usando la ubicación geométrica conocida del modelo activo de defecto en relación con el centro de la matriz de micrófonos.
    5. Dirije el formador de haz de retardo y suma hacia el centro del modelo de defecto activo durante la fusión de señales.
    6. Utiliza la geometría predefinida del gabinete de pruebas para determinar la dirección de dirección.
    7. No realices una estimación de la dirección de objetivos basada en datos durante el entrenamiento o las pruebas del modelo.
      figure-protocol-45(18)

figure-protocol-46
Figura 10: Procedimiento de alineación de señales GCC-PHAT. Flujo de trabajo del algoritmo de correlación cruzada generalizada con transformada de fase (GCC-PHAT). Las señales de micrófono en dominio de frecuencia se procesan para obtener el espectro de potencia cruzada y la función de ponderación, seguidas de la transformación inversa de Fourier para estimar el retardo temporal entre canales. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

6. Optimizar la red mediante el algoritmo CS

  1. Inicializa los parámetros del algoritmo CS para optimizar la 1D-CNN.
    1. Fija el tamaño de la población, correspondiente al número de nidos, en 20.
    2. Fija la probabilidad de descubrimiento (Pa) en 0,25.
    3. Establece el número máximo de iteraciones de optimización en 50.
    4. Configura la semilla aleatoria en 42 para apoyar la reproducibilidad.
    5. Establece el parámetro de escala del tamaño del paso α a 0,01.
    6. Defina los límites de búsqueda de hiperparámetros según los rangos resumidos en la Tabla 2.
    7. Terminar la optimización cuando se alcanza el número máximo de iteraciones o cuando se logra la convergencia validación-aptitud.
  2. Generar nuevas soluciones simulando el comportamiento de parasitismo de cría obligado de los cucos combinado con los vuelos de Lévy.
  3. Actualiza la solución actual (nido) figure-protocol-47 usando un tamaño de paso aleatorio derivado de la característica de vuelo de Lévy.
  4. Calcula la posición actualizada del nido usando la Ecuación 19. Aquí, α es el parámetro de escala del tamaño del paso y figure-protocol-48 denota multiplicación por entrada.
    1. Establece el parámetro de escala del tamaño del paso (α) en 0,01.
    2. Establece el parámetro de vuelo de Lévy (λ) en 1,5.
    3. Codifica cada nido candidato como un conjunto de hiperparámetros 1D-CNN, incluyendo configuración de capa convolucional, tamaño del núcleo, tasa de aprendizaje, tamaño del lote y configuración del optimizador.
    4. Genera nidos de candidatos usando actualizaciones de Lévy-flight y evalúa cada candidato usando el rendimiento del conjunto de validación.
    5. Retener soluciones candidatas que mejoren la validación de la aptitud.
      figure-protocol-49(19)
  5. Calcular las variables aleatorias para el vuelo de Lévy utilizando una distribución normal estándar escalada por el parámetro σ.
  6. Calcula σ usando la Ecuación 20. Aquí, figure-protocol-50 representa la función Gamma y β normalmente se establece en 1,5.
    figure-protocol-51(20)
  7. Entrenar la 1D-CNN usando cinco capas convolucionales, un tamaño de núcleo de 3, activación de ReLU, optimización de descenso de gradiente estocástico (SGD), una tasa de aprendizaje inicial de 0,001, un tamaño de lote de 50 y una función de pérdida cruzada de entropía.
  8. Evalúa el modelo optimizado en el conjunto de pruebas.
    1. Entrena el último 1D-CNN usando una parada temprana de pérdida de validación con un valor de paciencia de 10 épocas.
    2. Establece la semilla aleatoria en 42 para la partición de conjuntos de datos y el entrenamiento de modelos.
    3. Evalúa el modelo optimizado utilizando el conjunto fijo de pruebas resumido en la Tabla 2.
    4. Informa la evaluación completa de la matriz de confusión por separado del resultado de la ablación, con una precisión global del 99,05% (3962/4000) y tasas de reconocimiento por clase que oscilan entre el 98,6% y el 99,4%.
CategoríaParámetroValor / Ambientación
Conjunto de datos y entradaFotogramas acústicos totales4,000
Clases de falloDescarga superficial; baja suspendida; descarga interna; Descarga puntual
Frecuencia de muestreo200 kHz
Longitud del fotograma8.192 puntos por frame
Canales de matriz de micrófonos112
Entrada de modelosRepresentación de características acústicas de tiempo-frecuencia fusionadas con atención cruzada
División de conjuntos de datosTamaño del set de entrenamiento2.400 muestras
Tamaño del conjunto de validación400 muestras
Tamaño del conjunto de pruebas400 muestras
Tamaño completo de evaluación de la matriz de confusión4.000 muestras
Estrategia divididaDivisión simple fija
Semilla aleatoria42
Arquitectura TCNNúmero de bloques residuales3
Filtros por bloque residual64
Tamaño del núcleo de convolución3
Calendario de dilatación1, 2, 4
Tasa de abandono0.20
Arquitectura del autocodificadorDimensiones de la capa codificadora512 → 256 → 128
Dimensión del espacio lato128
Dimensiones de la capa decodificadora128 → 256 → 512
Entrenamiento con autocodificadorOptimizadorAdam
Tasa de aprendizaje0.001
Tamaño del lote50
Número de épocas de entrenamiento100 épocas
Criterio de parada tempranaMSE de validación; Paciencia = 20 épocas
Ajustes del espectrograma melTamaño de FFT1.024 puntos
Número de filtros Mel256
Rango de frecuencias0–100 kHz
Dimensiones del espectrograma256 × 256
Configuración CBAMRelación de reducción de canal16
Dimensiones del mapa de características256 × 256 × 64
Configuración de atención cruzadaDimensión de incrustación128
Número de cabezas de atención4
Dimensión de proyección de consulta128 en total; 32 por persona
Dimensión de proyección de claves128 en total; 32 por persona
Dimensión de proyección de valor128 en total; 32 por persona
Tasa de abandono0.10
Clasificador 1D-CNNNúmero de capas convolucionales5
Tamaño del núcleo de convolución3
Función de activaciónReLU
Capa de salidaSoftmax de 4 clases
Función de pérdidaPérdida de entropía cruzada
Entornos de entrenamientoOptimizadorDescenso Estocástico por Gradiente (SGD)
Tasa inicial de aprendizaje0.001
Tamaño del lote50
Iteraciones máximas de entrenamiento1,000
Paradas tempranasMonitorización de pérdidas de validación
Paciencia para parar temprano100 iteraciones
Derrota en el entrenamiento finalNo disponible en el manuscrito suministrado
Pérdida final de validaciónNo disponible en el manuscrito suministrado
Optimización en Cuckoo SearchObjetivo de optimizaciónHiperparámetros 1D-CNN
Tamaño de la población / número de nidos20
Probabilidad de descubrimiento (Pa)0.25
Parámetro de escalado por tamaño de paso (α)0.01
Parámetro de vuelo de lévy (β)1.5
Parámetro de vuelo de Lévy (λ)1.5
Iteraciones de optimización máxima50
Límites de búsqueda por hiperparámetrosFiltros conv {32, 64, 128, 256}; tamaño del núcleo {3, 5, 7}; tasa de aprendizaje 1×10⁻⁴–1×10⁻²; tamaño del lote {25, 50, 100}; abandono 0,10–0,50; Decaymiento de peso 1×10⁻⁵–1×10⁻³
Validación e informesFigura 13 Precisión de ablación de CA98.20%
Tabla 2 Precisión de la matriz de confusión99.05% (3,962/4,000)
Validación cruzada / ejecuciones repetidasNo interpretado

Tabla 2: Configuración del conjunto de datos, parámetros de entrenamiento del modelo y ajustes de optimización para la clasificación de fallos de aislamiento. La tabla resume la composición del conjunto de datos, la estrategia de partición de datos, la arquitectura 1D-CNN, la configuración de entrenamiento, la configuración de optimización de Cuckoo Search, las métricas de validación y las consideraciones de selección de parámetros utilizadas para desarrollar y evaluar el marco propuesto de diagnóstico de fallos. Los valores específicos de la implementación faltantes deben reportarse en los registros finales de entrenamiento y optimización para facilitar la reproducibilidad. Por favor, haz clic aquí para descargar esta tabla.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Marco de Extracción de Características en el Dominio del Tiempo y la Frecuencia

El método propuesto de identificación de fallos de aislamiento integra vías temporales y espectrales de extracción de características para caracterizar las complejas firmas acústicas generadas por defectos de aislamiento. La extracción de características en el dominio del tiempo se realizó utilizando un TCN que incorporaba convoluciones causales dilatadas para capt...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Este artículo de método delimita un protocolo estandarizado y sin contacto para identificar fallos complejos de aislamiento en equipos eléctricos mediante reconocimiento de huellas dactilares acústicas. Al integrar un TCN-AE junto con un espectrograma Mel procesado por un Mel-CBAM, la pipeline establecida aísla tanto fluctuaciones dinámicas de series temporales como características espectrales localizadas. La posterior fusión cruzada mediante un mecanismo de CA pretende reducir la diluci...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Los autores no tienen nada que revelar.

Agradecimientos

Los autores agradecen mucho a la Universidad Tecnológica de Shenyang por proporcionar las instalaciones de laboratorio de alta tensión y el apoyo técnico esenciales para la adquisición de datos acústicos y la validación experimental en este estudio. También expresamos nuestro agradecimiento a nuestros colegas por sus profundas conversaciones sobre la extracción de características y la optimización de redes neuronales. Esta investigación no recibió ninguna subvención específica de ninguna agencia financiadora en los sectores público, comercial o sin ánimo de lucro.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

```html
Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Autoencoder (AE)Modelo personalizadoArquitectura de codificador-decodificador para compresión de característicasReducción de dimensionalidad de características
Módulo de atención cruzadaModelo personalizadoMódulo de fusión de características tiempo-frecuenciaFusión de características multimodales
Algoritmo GCC-PHATAlgoritmo personalizadoImplementación basada en FFT/IFFTEstimación de retardo de tiempo y alineación de señal
Circuito de prueba de alto voltajePlataforma de laboratorio autoconstruidaAutotransformador T1, transformador de prueba T2, resistencia protectora de 200 kΩ, condensador de acoplamiento de 1 nF; voltaje de operación 4–12 kVGeneración de condiciones de fallo de aislamiento
Espectrograma Mel + CBAMModelo personalizadoExtracción espectral de frecuencia Mel con mejora de atenciónExtracción de características en el dominio de la frecuencia
Sistema de matriz de micrófonosPlataforma de laboratorio autoconstruidaMatriz espiral anular modificada de 112 canales; tasa de muestreo de 200 kHz; 8192 puntos por tramaAdquisición acústica
Sensores de micrófonoMódulos de micrófono ultrasónicos coincidentes autoconstruidos112 canales coincidentes; sensibilidad -38 +/- 3 dBV/Pa; respuesta de frecuencia 20 Hz-100 kHz; calibrado a 94 dB SPL/1 kHz y 40 kHz; límites de aceptación: +/-2 dB a 1 kHz y +/-3 dB a 40 kHzDetección acústica
Sistema DAQ multicanalPlataforma DAQ sincronizada autoconstruidaAdquisición simultánea de 112 canales; ADC de 16 bits; 200 kHz/canal; 8192 puntos/trama; reloj de muestreo compartido; disparo hardware TTL de flanco positivoAdquisición y sincronización de datos
CNN unidimensional + optimización CSModelo personalizadoCinco capas convolucionales; tamaño de núcleo 3; SGD; tasa de aprendizaje 0.001; tamaño de lote 50Clasificación de fallos
Entorno de entrenamiento de PythonPython / PyTorchPython 3.9; PyTorch 2.0; NumPy 1.24; scikit-learn 1.2; librosa 0.10; CUDA 11.8Entrenamiento y evaluación de modelos
Red Convolucional Temporal (TCN)Modelo personalizadoConvoluciones causales dilatadas con conexiones residualesExtracción de características en el dominio del tiempo
Gabinete de prueba con modelos defectuososPlataforma de laboratorio autoconstruidaModelos de descarga superficial, descarga suspendida, descarga interna y descarga puntualSimulación de fallos de aislamiento
Sistema de prueba de Voltaje Transitorio a Tierra (TEV)Módulo comercial de monitoreo TEVCanal de referencia TEV; ancho de banda analógico 3-100 MHz; ganancia de 40 dB; disparo TTL de flanco positivo; umbral de disparo establecido 6 dB por encima del nivel de ruido de fondo o >=10 mV equivalente en la entrada del sensorVerificación de actividad de descarga
```

Reimpresiones y permisos

Etiquetas

Ingenier aN mero 233N mero 233Valor vac oN merohuellas ac sticasmecanismo de atenci n cruzadafusi n de caracter sticasRed Convolucional Temporal