Este estudio no incluyó participantes humanos, animales vertebrados ni especímenes biológicos. Por lo tanto, no se requería la aprobación ética institucional, la aprobación para el uso de animales y la aprobación de sujetos humanos.
La Figura 1 ilustra la estructura de convolución causal dilatada utilizada dentro de la arquitectura TCN. La Figura 2 ilustra la estructura de conexión residual utilizada durante la extracción temporal de características. La Figura 3 ilustra la arquitectura AE utilizada para la reducción de dimensiones de características. La Figura 4 ilustra la arquitectura CBAM utilizada para la extracción de características espectrales. La Figura 5 ilustra el mecanismo de CA utilizado para la fusión de características tiempo-frecuencia.

Figura 1: Estructura de convolución causal dilatada. Ilustración esquemática de la arquitectura de la red temporal convolucional (TCN) empleando convoluciones causales y dilatadas. El factor de dilatación aumenta con la profundidad de la red para expandir el campo receptivo y capturar dependencias temporales a largo alcance en señales acústicas. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 2: Estructura de conexión residual. Diagrama del bloque residual utilizado dentro de la arquitectura TCN. El bloque incorpora convoluciones causales, normalización de peso, funciones de activación de ReLU, capas de dropout y una conexión residual para facilitar un entrenamiento estable en redes profundas y mitigar la degradación del gradiente. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 3: Arquitectura del Autocodificador (AE). Representación esquemática del AE utilizado para la reducción de dimensiones de características. El codificador comprime las características acústicas de entrada en una representación latente, y el decodificador reconstruye el espacio de características original a partir de la representación comprimida. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 4: Arquitectura del Módulo de Atención de Bloques Convolucionales (CBAM). Flujo de trabajo del CBAM utilizado para la mejora de características en el dominio de la frecuencia. El módulo aplica secuencialmente mecanismos de atención de canal y atención espacial para refinar representaciones de características extraídas de espectrogramas Mel. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 5: Mecanismo de fusión de características de atención cruzada (CA). Representación esquemática del módulo CA utilizado para fusionar características temporales y del dominio de la frecuencia. Las matrices de consulta, clave y valor se generan a partir de las dos modalidades de características para modelar dependencias cruzadas y producir representaciones de características fusionadas. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
1. Configuración de la plataforma de huellas acústicas de fallos de aislamiento y adquisición de datos
- Construir una plataforma de detección de matriz de micrófonos sin contacto dentro del laboratorio. Montar el sistema utilizando un circuito de prueba de alta tensión, un armario de pruebas que contiene modelos de defectos, un sistema de prueba de Tensión Terrestre Transitoria (TEV) y el sistema de matriz de micrófonos. El sistema TEV funcionaba como canal de referencia eléctrico para la verificación de descargas.
NOTA: Asegúrese de que el circuito de alta tensión incluya un autotransformador (T1), un transformador de prueba (T2), una resistencia protectora (R) de 200 kΩ y un condensador de acoplamiento (Cx) de 1 nF. Consulte la Figura 6 para el diseño esquemático.
PRECAUCIÓN: Las pruebas de alta tensión presentan un riesgo de descarga eléctrica. Sigue los procedimientos de seguridad eléctrica institucional y asegúrate de que todos los componentes de alta tensión estén correctamente aislados y conectados a tierra antes de la operación.
- Configura cuatro modelos distintos de fallos de aislamiento dentro del armario de pruebas para simular defectos operativos comunes: descarga superficial, descarga suspendida, descarga interna y descarga puntual (Figura 7).
- Prepara los modelos de fallo de aislamiento para las pruebas.
- Fabricar todos los modelos en placas aislantes de resina epoxi de 100 mm × 100 mm × 5 mm utilizando electrodos pulidos.
- Preparar el modelo de descarga superficial fijando dos electrodos de tira de cobre de 20 mm × 10 mm × 1 mm en la superficie superior con una separación de fluencia de 15 mm. Deja la superficie epoxi intermedia expuesta.
- Prepara el modelo de descarga suspendida montando un electrodo de varilla de cobre de 2 mm de diámetro 5 mm por encima de una placa de cobre conectada a tierra (40 mm × 40 mm × 1 mm) mediante un soporte epoxi. Mantén el electrodo de la varilla eléctricamente aislado de la placa.
- Prepara el modelo de descarga interna fundiendo un bloque epoxi que contiene un vacío de aire artificial cilíndrico (10 mm de diámetro × 2 mm de altura) centrado entre dos placas de cobre (40 mm × 40 mm × 1 mm). Coloca el centro de vacío aproximadamente 2,5 mm por debajo de la superficie superior.
- Prepara el modelo de descarga puntual colocando un electrodo de aguja de acero inoxidable con un radio de punta aproximado de 0,5 mm frente a una placa de cobre conectada a tierra a través de un espacio de aire de 10 mm.
- Limpia todos los electrodos con etanol y sécalos completamente antes de montarlos.
- Montar la geometría electrodo-defecto en el armario de pruebas y verificar todos los espaciados entre electrodos usando un calibrador antes de cada prueba de voltaje.
- Despliega el sensor de matriz de micrófonos empleando una estructura espiral anular modificada compuesta por 112 canales. Consulte la Figura 8 para la distribución de coordenadas.
- Ajusta la frecuencia de muestreo a 200 kHz y configura la longitud de muestra a 8192 puntos por fotograma. Consulte la Tabla 1 para los parámetros del sensor.
- Configura el hardware de la matriz de micrófonos.
- Montar los 112 micrófonos al ras del marco espiral anular modificado en las posiciones de coordenadas mostradas en la Figura 8. Mantener el espaciado entre elementos definido por el archivo de coordenadas del array, que va de 10 mm a 25 mm.
- Coloca un calibrador acústico portátil y una fuente de referencia ultrasónica de 40 kHz a 300 mm del centro del conjunto de micrófonos.
- Calibrar todos los canales activos del micrófono antes de cada sesión de adquisición utilizando un SPL de 94 dB, una señal de referencia acústica de 1 kHz y una señal de referencia ultrasónica de 40 kHz.
- Graba 5 s de señales de calibración de cada canal de micrófono.
- Calcula la sensibilidad RMS y la respuesta de fase de cada canal en relación con el canal central de la matriz.
- Conservar solo canales con desviación de sensibilidad dentro de ±2 dB a 1 kHz, dentro de ±3 dB a 40 kHz, y sin clipping ni elevación anormal del fondo de ruido.
- Excluye los canales que no cumplan los criterios de aceptación de análisis posteriores.
- Repite el procedimiento de calibración después de cualquier reemplazo de micrófono o movimiento de la matriz de micrófonos.
- Configura el sistema de adquisición de datos multicanal para realizar muestreos simultáneos en todos los canales activos del micrófono.
- Configura el sistema DAQ para la adquisición simultánea de los 112 canales de micrófono usando un reloj de muestreo compartido de 200 kHz.
- Establecer la resolución de adquisición a 16 bits, configurar el acoplamiento AC y adquirir 8192 puntos por fotograma.
- Distribuir un disparador de arranque por hardware a todos los módulos de adquisición a través de un bus de disparo TTL de borde positivo común.
- Almacena todos los canales de micrófono dentro del mismo registro de fotograma y conserva la marca de tiempo del disparo y el índice de canal para cada adquisición.
- Inspecciona los primeros 100 fotogramas adquiridos para detectar muestras caídas, saturación del canal y deriva de reloj antes de comenzar la recogida formal de datos.
- Justifica la configuración del conjunto de micrófonos. El conjunto de 112 canales fue seleccionado para mejorar la densidad de muestreo espacial para la formación de haz y la estimación del retardo GCC-PHAT, aumentando así la supresión del ruido ambiental fuera del eje en relación con un arreglo escaso de bajo número de canales. Aunque aproximadamente cuatro canales pueden ser suficientes para la localización geométrica 3D, el protocolo actual utiliza muestreo espacial denso para mejorar la señal y la estabilidad de características, en lugar de localizar solo a los demás. Las versiones de canal reducido deben validarse por separado antes de su despliegue en campo, sensible al coste.
- Aplicar alta tensión al circuito de prueba para inducir fenómenos de descarga parcial a través de los modelos.
- Mantener el entorno experimental durante las pruebas.
- Mantener el laboratorio a 22°C ± 2°C, humedad relativa del 45%–55% y 101 ± 2 kPa de presión atmosférica durante la adquisición de datos.
- Mide el ruido acústico de fondo antes de activar el sistema de alta tensión.
- Proceder con la adquisición de datos solo cuando el nivel de ruido de fondo ponderado A sea ≤40 dB(A).
- Verifique que el fondo de ruido ultrasónico de cada canal activo de micrófono esté al menos 20 dB por debajo del nivel de descarga-impulso observado durante las pruebas piloto.
- Mantén puertas y ventanas cerradas y apaga los equipos rotativos no esenciales durante la recogida de datos.
- Toma a tierra el chasis de alta tensión y el chasis DAQ antes de la adquisición.
- Evitar el movimiento del personal cerca de la matriz de micrófonos durante la grabación.
- Monitoriza la actividad de descarga de forma continua utilizando el sensor TEV conectado a un terminal PC.
- Establece el umbral de monitorización TEV a 6 dB por encima del nivel de ruido de fondo previo a la prueba y no inferior a un nivel de entrada equivalente de 10 mV.
- Configura el canal de referencia TEV con un ancho de banda analógico de 3–100 MHz y una ganancia de 40 dB.
- Registra la actividad de pulsos TEV usando envolvente y registro de pulsos en el terminal del PC.
- Configura el sistema TEV para que use disparo hardware de borde positivo.
- Utiliza el mismo valor umbral tanto para la monitorización TEV como para la generación de disparos.
- Aceptar una trama acústica solo cuando ocurra actividad de pulsos TEV dentro de la ventana de adquisición correspondiente y se repita a través de tramas consecutivas al voltaje seleccionado.
- Ajusta progresivamente el voltaje entre 4 y 12 kV.
- Registrar las señales acústicas una vez que se observe un fenómeno de fallo de aislamiento distinto y estable para un modelo específico. Defina un fenómeno de fallo distinto y estable como un estado de descarga en el que la actividad del TEV y los patrones de impulsos acústicos se observan repetidamente en el voltaje objetivo sin extinción intermitente evidente, saturación del canal acústico, ruido mecánico no relacionado ni ruido de impacto externo. Mantener el voltaje hasta que el patrón de descarga se mantenga estable durante al menos 60 segundos antes de grabar fotogramas acústicos.
- Recopila 1000 conjuntos de datos válidos para cada uno de los cuatro tipos de fallo. Clasificar un fotograma de muestra como válido solo cuando la referencia TEV indica actividad de descarga, el canal acústico no está saturado, el bastidor no contiene impacto externo evidente ni ruido de manipulación, y la etiqueta de muestra coincide con el modelo de defecto activo. Excluir tramas con saturación del canal acústico, ausencia de confirmación TEV, etiquetado de fallos inconsistente, extinción intermitente de descarga, impacto mecánico externo o ruido de fondo inestable.
- Sincroniza el sistema TEV y el sistema de adquisición acústica durante la recogida de datos.
- Conecta la salida del disparador TEV a la entrada acústica del DAQ a través del bus compartido TTL.
- Utiliza la salida de pulsos TEV como disparador hardware para la adquisición de datos acústicos.
- Registra el marcador de disparo como un canal de temporización digital en el archivo de datos acústicos.
- Realizar la alineación inicial de las secuencias TEV y de adquisición acústica usando la marca de tiempo del disparo.
- Estima los retardos residuales entre micrófonos usando GCC-PHAT antes de la formación de haz.
- Verifica que la precisión de sincronización TEV-acústica esté dentro de ±1 muestra acústica, correspondiente a ≤5 μs a una frecuencia de muestreo de 200 kHz.

Figura 6: Plataforma de detección de fallos de aislamiento con matriz de micrófonos. Montaje experimental utilizado para la detección de fallos en aislamiento acústico. La plataforma consta de un circuito de prueba de alta tensión, un armario de pruebas de fallos de aislamiento, un sistema de matriz de micrófonos, un sensor TEV y un sistema informático de monitorización para la adquisición y verificación de datos. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 7: Modelos de fallos de aislamiento construidos en laboratorio. Modelos representativos de fallo de aislamiento utilizados para la adquisición de datos. (A) Modelo de descarga superficial. (B) Modelo de descarga suspendida. (C) Modelo de descarga interna. (D) Modelo de descarga puntual. Los modelos se construyeron para simular cuatro condiciones comunes de fallo de aislamiento bajo condiciones controladas de laboratorio. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 8: Distribución de la matriz de micrófonos. Disposición espacial de la matriz de micrófonos de 112 canales empleando una configuración espiral anular modificada. La distribución de coordenadas ilustra la colocación de los sensores utilizada para la adquisición de señales acústicas y el posterior análisis de formación de haz. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
| Tipo de parámetro | Valor de parámetro |
| Estructura del array | Espiral anular modificada |
| Número de canales | 112 |
| Frecuencia de muestreo | 200 kHz |
| Puntos de muestra por fotograma | 8192 |
Tabla 1: Parámetros de la matriz de micrófonos. Especificaciones técnicas del sistema de matriz de micrófonos utilizado para la adquisición de señales acústicas durante experimentos de fallo de aislamiento. La tabla resume la geometría del array, el número de canales, la tasa de muestreo y el número de puntos de muestreo adquiridos por fotograma. Por favor, haz clic aquí para descargar esta tabla.
2. Extracción de características en el dominio temporal mediante TCN-AE
- Introdujo los datos acústicos preprocesados de series temporales en el TCN para capturar variaciones temporalesdinámicas 13,14. Tras la fusión de señales, normaliza cada marco acústico de 8192 puntos usando el procedimiento de normalización aplicado durante el entrenamiento del modelo e introduce la secuencia 1D normalizada en el TCN.
- Configura la arquitectura TCN.
- Construye el TCN usando tres bloques residuales organizados secuencialmente para la extracción temporal de características.
- Asignar 64 filtros convolucionales a cada bloque residual y establecer el tamaño del núcleo de convolución en 3.
- Implementar convoluciones causales dilatadas y configurar los factores de dilatación como d = 1, 2 y 4 para expandir progresivamente el campo receptivo temporal.
- Aplica la función de activación de ReLU después de cada operación convolucional.
- Aplica una tasa de abandono de 0,20 después de cada bloque residual para reducir el sobreajuste durante el entrenamiento.
- Realizar la normalización de peso como método de regularización dentro de cada bloque residual.
- Incorpora conexiones residuales a lo largo de la red y utiliza proyecciones convolucionales 1 × 1 siempre que sea necesario para igualar las dimensiones de las características entre las rutas residuales y transformadas.
- Aplicar convoluciones causales a la secuencia de entrada. Adapta el relleno cero previo a la secuencia en función del tamaño del núcleo para asegurar que la salida en un paso de tiempo dado dependa estrictamente de entradas actuales y previas.
- Ejecuta la convolución causal usando el peso del núcleo (wi) y el tamaño del núcleo (K) de la siguiente manera (Ecuación 1):
(1)
- Implementa convoluciones dilatadas para expandir el campo receptivo de la red sin aumentar el número de parámetros. Aumenta el factor de dilatación d exponencialmente a medida que avanza la profundidad de la red para capturar dependencias temporales a largo alcance.
- Calcular la convolución dilatada usando el factor de dilatación (d) de la siguiente manera (Ecuación 2). Utiliza la progresión del factor de dilatación d = 1, 2 y 4 durante el entrenamiento de la CNT para expandir progresivamente el campo receptor temporal sin aumentar el número de puntos muestreados en cada marco acústico.
(2)
- Integrar conexiones residuales para mitigar los gradientes nulos durante el entrenamiento profundo de red.
- Pasa la secuencia de entrada a través del bloque de convolución causal dilatado. Realiza regularización de peso y aplica una activación no lineal de ReLU seguida de una capa Dropout.
- Añadir la salida procesada directamente a la secuencia de entrada original (Figura 2). Aplica la normalización de peso dentro de cada bloque residual y utiliza una tasa de dropout de 0,20 antes de realizar la suma residual. Utiliza una proyección convolucional 1 × 1 cuando sea necesario para igualar las dimensiones de las características entre las rutas residuales y transformadas.
- Alimentar las características temporales de alta dimensión extraídas por el TCN en un AE para la reducción de dimensiones de características15.
- Configura la arquitectura de AE.
- Construye el codificador usando tres capas totalmente conectadas con dimensiones 512, 256 y 128 neuronas, respectivamente.
- Definamos la representación en espacio latente usando un vector de características de 128 dimensiones.
- Construye el decodificador usando tres capas completamente conectadas con dimensiones 128, 256 y 512 neuronas, respectivamente.
- Aplica la función de activación de ReLU después de cada capa completamente conectada tanto en el codificador como en el decodificador.
- Configura el AE para reconstruir la representación de características de entrada a partir del vector de espacio latente y optimiza la reconstrucción usando la función de pérdida de error cuadrático medio (MSE) descrita en el Paso 2.16.
- Comprime los datos de entrada en una representación de espacio latente de dimensión inferior mediante el codificador.
- Reconstruye los datos originales usando el decodificador (Figura 3).
- Ejecuta las transformaciones de codificación y decodificación usando la función de activación de ReLU (σ), matrices de pesos (W₁ y W₂) y términos de sesgo (b₁ y b₂) según las Ecuaciones 3 y 4.
(3)
(4)
- Entrena al AE para preservar información crítica minimizando el error de reconstrucción.
- Utiliza el error cuadrático medio (MSE) como función de pérdida y calcula el error de reconstrucción usando la Ecuación 5.
- Entrena al AE usando el optimizador Adam con una tasa de aprendizaje de 0,001.
- Establece el tamaño del lote en 50 y entrena la red para un máximo de 100 épocas.
- Controla la pérdida de validación durante el entrenamiento y aplica paradas tempranas con un valor de paciencia de 10 épocas.
- Utiliza la partición fija del conjunto de datos que consta de 2400 muestras de entrenamiento, 400 muestras de validación y 400 muestras de prueba.
- Realizar entrenamiento de modelos en el entorno de aprendizaje profundo basado en Python, resumido en la Tabla de Materiales.
- Calcula el error de reconstrucción usando la Ecuación 5.
(5)
3. Extracción de características en dominio de frecuencia mediante espectrograma Mel y CBAM
- Aplica funciones de pre-énfasis, encuadre y ventanas a las señales acústicas de descarga parcial en bruto.
- Elimina el desplazamiento de CC de cada marco acústico de 8192 puntos.
- Aplica el preénfasis usando:

- Normaliza cada trama usando su amplitud absoluta máxima tras la eliminación del offset DC.
- Segmenta cada fotograma usando una ventana de Hamming de 1024 muestras.
- Utiliza una longitud de salto de 512 muestras, lo que corresponde a un 50% de solapamiento entre ventanas adyacentes.
- Calcular la transformada de Fourier de corto tiempo (STFT) usando una FFT de 1024 puntos.
- No aplique filtrado pasa banda adicional por software más allá de la limitación de ancho de banda del hardware frontal y los criterios de exclusión de calidad de trama descritos anteriormente.
- Realizar una transformada de Fourier sobre las señales procesadas.
- Convierte la frecuencia lineal original (f) a la escala de Mel. Este paso linealiza la percepción humana de frecuencias y reduce el peso de las bandas deinterferencia 16.
- Calcula la frecuencia a escala Mel (fmel) usando la frecuencia lineal original (f) (Ecuación 6).
(6)
- Particionar las frecuencias en una secuencia de bancos de filtros triangulares.
- Calcula la suma ponderada de todas las amplitudes de señal dentro de cada ancho de banda de filtro. Aplica una función logarítmica a la salida para mejorar la consistencia perceptual respecto a las variaciones de amplitud.
- Calcula la salida del banco de filtros de mel usando la Ecuación 7. Aquí, S(m) es la salida del filtro m-ésima, k es el índice de frecuencia y Hm(k) define el filtro triangular.
(7)
- Genera los espectrogramas Mel.
- Calcular la transformada de Fourier de corto tiempo usando un tamaño FFT de 1024.
- Aplica bancos de filtros de 256 Mel al espectro de frecuencias resultante.
- Genera espectrogramas de mel en el rango de frecuencias de 0 a 100 kHz.
- Redimensionar o representar los espectrogramas Mel resultantes como mapas de características de 256 × 256 píxeles para el procesamiento CBAM posterior.
- Convierte el espectrograma de potencia Mel a la escala de decibelios.
- Aplicar la normalización min-max por espectrograma usando el espectrograma Mel comprimido logarítmicamente (SdB):

- Realizar la normalización de forma independiente para cada imagen del espectrograma 256 × 256 Mel.
- Recortar los valores normalizados al rango [0,1] antes de introducir el espectrograma en la rama CBAM.
- Introduce los espectrogramas Mel resultantes en el CBAM para extraer las características espectralesprincipales 17.
- Procesar los datos mediante mecanismos secuenciales de atención por canal y atención espacial (Figura 4).
- Configura la arquitectura CBAM.
- Configura el módulo de atención al canal usando una relación de reducción de canal de 16.
- Mapas de características de entrada de procesos con dimensiones de 256 × 256 × 64.
- Aplica el agrupamiento global de promedio y el global de máximo agrupamiento para generar descriptores de canal.
- Pasa los descriptores agrupados por un perceptrón multicapa compartido y aplica una función de activación sigmoidea para generar pesos de atención al canal.
- Genera pesos de atención espacial usando un núcleo convolucional 3 × 3 aplicado a los descriptores espaciales concatenados con promedio y max-pool.
- Aplica una función de activación sigmoide para producir el mapa espacial final.
- Extrae los pesos de atención del canal.
- Aplica agrupación
global de promedio y global de máxima
agrupación a lo largo de las dimensiones del canal del mapa de características de entrada.
- Procesa los vectores descriptores globales generados a través de una capa totalmente conectada (FC) para obtener el peso de atención al canal (Mc).
- Calcula los pesos de atención en el canal usando la Ecuación 8. Aquí, Mc es el peso de atención del canal, FC denota la capa completamente conectada, y σ representa la función de activación sigmoide.
(8)
- Extrae los pesos de atención espacial.
- Aplica pooling
global max y global promedio
pooling a lo largo del eje del canal.
- Concatena los mapas descriptores espaciales resultantes y los procesa a través de una capa convolucional para generar el peso de atención espacial (Ms).
- Calcula los pesos de atención espacial usando la Ecuación 9. Aquí, Ms es el peso de atención espacial,
es el descriptor espacial generado por la agrupación media global, y
es el descriptor espacial generado por la agrupación global máxima.
(9)
- Concatena los descriptores espaciales promedio agrupado y max-pool a lo largo de la dimensión del canal.
- Aplica una convolución
3 × 3 con paso = 1 y el mismo relleno para generar el mapa de características de atención espacial.
- Aplicar una función de activación sigmoide a la salida de la convolución para obtener los pesos de atención espacial.
- Multiplica los pesos de atención espacial elemento por elemento con el mapa de características de entrada para generar la representación espacial refinada.
4. Fusión de características multimodales usando CA
- Implementar un mecanismo de CA para sintetizar las características temporales extraídas y las característicasespectrales 18. A diferencia de la autoatención, extraer información contextual de una modalidad para mejorar dinámicamente la representación de la otra (Figura 5).
- Configura la arquitectura de la CA.
- Establece la dimensión de incrustación en 128.
- Configura el módulo de CA con 4 cabezas de atención.
- Establece las dimensiones de proyección de consulta, clave y valor a 128 cada una.
- Aplica una tasa de abandono de 0,10 dentro del módulo de CA.
- No apliques capas de normalización post-atención ni capas de alimentación hacia adelante después del módulo de atención cruzada.
- Concatena las salidas de todos los cabezales de atención.
- Solicita abandonar la carrera con una tasa de 0,10.
- Aplana la representación de características resultante.
- Transfiere el vector de características aplanado directamente al clasificador 1D-CNN.
- Inicializa las matrices de Consulta (Q), Llave (K) y Valor (V) a partir de las dos secuencias de entrada distintas (características en el dominio del tiempo y en el dominio de la frecuencia).
- Calcula la matriz de consulta usando la Ecuación 10, donde X1 denota la matriz temporal de características producida por la vía TCN-AE, y WQ, y bQ indican la matriz de pesos aprendidos correspondiente y el término de sesgo, respectivamente.
(10)
- Calcular la matriz clave usando la ecuación 11, donde X2 denota la matriz de características en el dominio de la frecuencia producida por la vía Mel-CBAM, y WK, y bK indican la matriz de pesos aprendidos correspondiente y el término de sesgo, respectivamente.
(11)
- Calcula la matriz de valores usando la ecuación 12. donde WV y bV indican la matriz de pesos aprendida correspondiente y el término de sesgo, respectivamente.
(12)
- Calcula la interacción con la CA basándose en la relación entre la Consulta y los elementos clave.
- Calcula la matriz de atención-peso usando la Ecuación 13. Aquí, αij especifica el peso de atención del i-ésimo elemento respecto al j-ésimo elemento, y dk es la dimensionalidad de los vectores clave.
(13)
- Actualiza la representación final de las características calculando la suma ponderada de la matriz de valores según los pesos de atención calculados.
- Calcula la representación de las características fusionadas usando la Ecuación 14. Aquí, Oi es la salida de secuencia que representa la robusta huella acústica tiempo-frecuencia fusionada del fallo de aislamiento.
(14)
- Genera la representación de características fusionadas con una dimensión de salida de 128.
- Combina las salidas de atención de tiempo cruzado y frecuencia cruzada.
- Aplanar la representación fusionada antes de la clasificación.
- Pasa la representación de características aplanadas al clasificador Softmax 1D-CNN y totalmente conectado que se muestra en la Figura 9.

Figura 9: Marco general para la identificación de fallos de aislamiento. Flujo de trabajo del método propuesto de identificación de fallos en aislamiento. Las señales brutas de la matriz de micrófonos se fusionan y preprocesan, seguidas de la extracción de características en el dominio del tiempo usando una vía TCN–AE, la extracción de características en el dominio de la frecuencia usando espectrogramas Mel y CBAM, la fusión de características basada en CA, y la clasificación final de fallos mediante una red neuronal convolucional unidimensional. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
5. Alinear y fusionar señales de la matriz de micrófonos mediante GCC-PHAT
- Selecciona dos señales de micrófono para la estimación del retardo y conviértelas al dominio de la frecuencia usando la FFT.
- Utiliza el marco acústico completo de 8192 puntos adquirido a 200 kHz para el cálculo GCC-PHAT basado en FFT.
- Aplica la FFT a cada señal de micrófono seleccionada antes de calcular el espectro de potencia cruzada ponderado por PHAT.
- Estima el retardo temporal intercanal respecto al micrófono de referencia seleccionado utilizando el espectro de potencia cruzada ponderado por PHAT y el procedimiento IFFT mostrado en la Figura 10.
- Aplica GCC-PHAT en relación con el micrófono de referencia seleccionado antes de alinear los 112 canales activos del micrófono.
- Aplica una ventana de Hann al marco acústico completo de 8192 puntos antes del procesamiento FFT.
- No uses ventanas solapadas durante la estimación del retardo GCC-PHAT.
- Aplicar la plataforma cero de cada fotograma en ventana a 16.384 puntos antes de los cálculos FFT e IFFT.
- Utiliza la señal sin relleno para mejorar la resolución de pico de retardo durante la estimación de retardo.
- Obtén las representaciones
en el dominio de la frecuencia y
de las señales de micrófono seleccionadas.
- Calcula el espectro de potencias cruzadas para evaluar la similitud entre ambas señales.
- Introduce la función de ponderación de la transformada de fase (PHAT) para acentuar el pico de correlación cruzada y mitigar los efectos de reverberación.
- Calcula el espectro de potencia cruzada ponderado por PHAT usando la Ecuación 15. Aquí,
y
son las representaciones en el dominio de la frecuencia de las dos señales micrófonicas y
denota el conjugado complejo.
(15)
- Aplicar la IFFT para calcular la función de correlación cruzada generalizada (GCC).
- Identifica la variable de retardo τ localizando el pico de la función GCC.
- Calcula la función GCC usando la Ecuación 16. Aquí,
es la función de correlación cruzada generalizada y representa el retardo temporal estimado.
(16)
- Realizar compensación temporal para alinear las señales en función del retardo estimado.
- Sincroniza cada canal
respecto al micrófono de referencia usando la Ecuación 17. Aquí,
es la señal compensada por retardo y τi es el retardo estimado respecto al micrófono de referencia.
- Selecciona el micrófono situado más cerca del centro geométrico de la matriz como micrófono de referencia.
- Verifica que el micrófono seleccionado cumpla con los criterios de aceptación de calibración descritos en el Paso 1.6.
- Si el micrófono central no cumple los criterios de calibración, selecciona el micrófono calibrado más cercano al centro geométrico como micrófono de referencia.
- Estima el retardo τi para cada canal activo de micrófono en relación con el micrófono de referencia seleccionado.
- Alinea los 112 canales activos del micrófono con el micrófono de referencia seleccionado antes de la formación de haz.
(17)
- Ejecuta la formación de haz por retardo y suma para fusionar la información espacial.
- Potenciar la señal originada en la dirección objetivo mientras suprime el ruido ambiental usando la Ecuación 18. Aquí, y(t) es la señal de salida en forma de haz,
es la señal compensada por retardo del i-ésimo micrófono, y N es el número total de canales de micrófono.
- Realizar formación de haz por retardo y suma tras la compensación de retardo GCC-PHAT.
- Usa un peso igual para todos los canales activos del micrófono.
- Conjunto N = 112 para los 112 canales activos de micrófono utilizados durante la adquisición.
- Define la dirección del objetivo usando la ubicación geométrica conocida del modelo activo de defecto en relación con el centro de la matriz de micrófonos.
- Dirije el formador de haz de retardo y suma hacia el centro del modelo de defecto activo durante la fusión de señales.
- Utiliza la geometría predefinida del gabinete de pruebas para determinar la dirección de dirección.
- No realices una estimación de la dirección de objetivos basada en datos durante el entrenamiento o las pruebas del modelo.
(18)

Figura 10: Procedimiento de alineación de señales GCC-PHAT. Flujo de trabajo del algoritmo de correlación cruzada generalizada con transformada de fase (GCC-PHAT). Las señales de micrófono en dominio de frecuencia se procesan para obtener el espectro de potencia cruzada y la función de ponderación, seguidas de la transformación inversa de Fourier para estimar el retardo temporal entre canales. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
6. Optimizar la red mediante el algoritmo CS
- Inicializa los parámetros del algoritmo CS para optimizar la 1D-CNN.
- Fija el tamaño de la población, correspondiente al número de nidos, en 20.
- Fija la probabilidad de descubrimiento (Pa) en 0,25.
- Establece el número máximo de iteraciones de optimización en 50.
- Configura la semilla aleatoria en 42 para apoyar la reproducibilidad.
- Establece el parámetro de escala del tamaño del paso α a 0,01.
- Defina los límites de búsqueda de hiperparámetros según los rangos resumidos en la Tabla 2.
- Terminar la optimización cuando se alcanza el número máximo de iteraciones o cuando se logra la convergencia validación-aptitud.
- Generar nuevas soluciones simulando el comportamiento de parasitismo de cría obligado de los cucos combinado con los vuelos de Lévy.
- Actualiza la solución actual (nido)
usando un tamaño de paso aleatorio derivado de la característica de vuelo de Lévy.
- Calcula la posición actualizada del nido usando la Ecuación 19. Aquí, α es el parámetro de escala del tamaño del paso y
denota multiplicación por entrada.
- Establece el parámetro de escala del tamaño del paso (α) en 0,01.
- Establece el parámetro de vuelo de Lévy (λ) en 1,5.
- Codifica cada nido candidato como un conjunto de hiperparámetros 1D-CNN, incluyendo configuración de capa convolucional, tamaño del núcleo, tasa de aprendizaje, tamaño del lote y configuración del optimizador.
- Genera nidos de candidatos usando actualizaciones de Lévy-flight y evalúa cada candidato usando el rendimiento del conjunto de validación.
- Retener soluciones candidatas que mejoren la validación de la aptitud.
(19)
- Calcular las variables aleatorias para el vuelo de Lévy utilizando una distribución normal estándar escalada por el parámetro σ.
- Calcula σ usando la Ecuación 20. Aquí,
representa la función Gamma y β normalmente se establece en 1,5.
(20)
- Entrenar la 1D-CNN usando cinco capas convolucionales, un tamaño de núcleo de 3, activación de ReLU, optimización de descenso de gradiente estocástico (SGD), una tasa de aprendizaje inicial de 0,001, un tamaño de lote de 50 y una función de pérdida cruzada de entropía.
- Evalúa el modelo optimizado en el conjunto de pruebas.
- Entrena el último 1D-CNN usando una parada temprana de pérdida de validación con un valor de paciencia de 10 épocas.
- Establece la semilla aleatoria en 42 para la partición de conjuntos de datos y el entrenamiento de modelos.
- Evalúa el modelo optimizado utilizando el conjunto fijo de pruebas resumido en la Tabla 2.
- Informa la evaluación completa de la matriz de confusión por separado del resultado de la ablación, con una precisión global del 99,05% (3962/4000) y tasas de reconocimiento por clase que oscilan entre el 98,6% y el 99,4%.
| Categoría | Parámetro | Valor / Ambientación |
| Conjunto de datos y entrada | Fotogramas acústicos totales | 4,000 |
| Clases de fallo | Descarga superficial; baja suspendida; descarga interna; Descarga puntual |
| Frecuencia de muestreo | 200 kHz |
| Longitud del fotograma | 8.192 puntos por frame |
| Canales de matriz de micrófonos | 112 |
| Entrada de modelos | Representación de características acústicas de tiempo-frecuencia fusionadas con atención cruzada |
| División de conjuntos de datos | Tamaño del set de entrenamiento | 2.400 muestras |
| Tamaño del conjunto de validación | 400 muestras |
| Tamaño del conjunto de pruebas | 400 muestras |
| Tamaño completo de evaluación de la matriz de confusión | 4.000 muestras |
| Estrategia dividida | División simple fija |
| Semilla aleatoria | 42 |
| Arquitectura TCN | Número de bloques residuales | 3 |
| Filtros por bloque residual | 64 |
| Tamaño del núcleo de convolución | 3 |
| Calendario de dilatación | 1, 2, 4 |
| Tasa de abandono | 0.20 |
| Arquitectura del autocodificador | Dimensiones de la capa codificadora | 512 → 256 → 128 |
| Dimensión del espacio lato | 128 |
| Dimensiones de la capa decodificadora | 128 → 256 → 512 |
| Entrenamiento con autocodificador | Optimizador | Adam |
| Tasa de aprendizaje | 0.001 |
| Tamaño del lote | 50 |
| Número de épocas de entrenamiento | 100 épocas |
| Criterio de parada temprana | MSE de validación; Paciencia = 20 épocas |
| Ajustes del espectrograma mel | Tamaño de FFT | 1.024 puntos |
| Número de filtros Mel | 256 |
| Rango de frecuencias | 0–100 kHz |
| Dimensiones del espectrograma | 256 × 256 |
| Configuración CBAM | Relación de reducción de canal | 16 |
| Dimensiones del mapa de características | 256 × 256 × 64 |
| Configuración de atención cruzada | Dimensión de incrustación | 128 |
| Número de cabezas de atención | 4 |
| Dimensión de proyección de consulta | 128 en total; 32 por persona |
| Dimensión de proyección de claves | 128 en total; 32 por persona |
| Dimensión de proyección de valor | 128 en total; 32 por persona |
| Tasa de abandono | 0.10 |
| Clasificador 1D-CNN | Número de capas convolucionales | 5 |
| Tamaño del núcleo de convolución | 3 |
| Función de activación | ReLU |
| Capa de salida | Softmax de 4 clases |
| Función de pérdida | Pérdida de entropía cruzada |
| Entornos de entrenamiento | Optimizador | Descenso Estocástico por Gradiente (SGD) |
| Tasa inicial de aprendizaje | 0.001 |
| Tamaño del lote | 50 |
| Iteraciones máximas de entrenamiento | 1,000 |
| Paradas tempranas | Monitorización de pérdidas de validación |
| Paciencia para parar temprano | 100 iteraciones |
| Derrota en el entrenamiento final | No disponible en el manuscrito suministrado |
| Pérdida final de validación | No disponible en el manuscrito suministrado |
| Optimización en Cuckoo Search | Objetivo de optimización | Hiperparámetros 1D-CNN |
| Tamaño de la población / número de nidos | 20 |
| Probabilidad de descubrimiento (Pa) | 0.25 |
| Parámetro de escalado por tamaño de paso (α) | 0.01 |
| Parámetro de vuelo de lévy (β) | 1.5 |
| Parámetro de vuelo de Lévy (λ) | 1.5 |
| Iteraciones de optimización máxima | 50 |
| Límites de búsqueda por hiperparámetros | Filtros conv {32, 64, 128, 256}; tamaño del núcleo {3, 5, 7}; tasa de aprendizaje 1×10⁻⁴–1×10⁻²; tamaño del lote {25, 50, 100}; abandono 0,10–0,50; Decaymiento de peso 1×10⁻⁵–1×10⁻³ |
| Validación e informes | Figura 13 Precisión de ablación de CA | 98.20% |
| Tabla 2 Precisión de la matriz de confusión | 99.05% (3,962/4,000) |
| Validación cruzada / ejecuciones repetidas | No interpretado |
Tabla 2: Configuración del conjunto de datos, parámetros de entrenamiento del modelo y ajustes de optimización para la clasificación de fallos de aislamiento. La tabla resume la composición del conjunto de datos, la estrategia de partición de datos, la arquitectura 1D-CNN, la configuración de entrenamiento, la configuración de optimización de Cuckoo Search, las métricas de validación y las consideraciones de selección de parámetros utilizadas para desarrollar y evaluar el marco propuesto de diagnóstico de fallos. Los valores específicos de la implementación faltantes deben reportarse en los registros finales de entrenamiento y optimización para facilitar la reproducibilidad. Por favor, haz clic aquí para descargar esta tabla.