$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Metodología
Se construyó un modelo supervisado de ventana deslizante para predecir el valor futuro de PM2.5 en el tiempo t + 1 a partir de observaciones horarias previas. Se evaluaron las ventanas de entrada candidatas de 12, 24 y 48 pasos horarios usando el rendimiento de validación, y la configuración final de CORTA-Net utilizó una secuencia de entrada de 24 horas. Se utilizó interpolación lineal para rellenar los valores que faltan; los valores atípicos se eliminaron usando el método IQR; y todas las variables se escalaron usando la normalización min-max antes de generar características PM2.5 con retraso. A continuación, se aplicó el procedimiento CorrXGBoost-Rank para la selección de características. Primero, el filtrado de correlación de Pearson retenía variables con |r| ≥ 0,30. Segundo, pares de características altamente redundantes con correlación por pares |corr(x i, xj)| ≥ 0,85 fueron filtrados para reducir la multicolinealidad. En tercer lugar, se entrenó un regresor XGBoost sobre las variables restantes, y se mantuvieron predictores con puntuaciones de importancia basadas en la ganancia de XGBoost ≥ 0,015 para la entrada final del modelo. La arquitectura final de CORTA-Net consistió en capas LSTM apiladas para codificación temporal, una capa de atención multicabeza para ponderación a nivel de características y pasos temporales, y capas de regresión densa para estimación PM2.5 . El modelo fue entrenado usando el optimizador Adam con pérdida por error cuadrático medio y parada temprana. La evaluación del modelo se realizó utilizando RMSE yR2 a través de particiones de entrenamiento, validación, pruebas y validación cruzada de 10 partidas. La Tabla 2 representa el resumen de preprocesamiento de datos e ingeniería de características.
| Escalón | Método utilizado | Parámetro / umbral | Propósito |
| Cálculo de valores faltantes | Porcentaje de observaciones ausentes | Informe porcentaje variable | Cuantifica la completitud de los datos |
| Imputación de gap corto | Interpolación lineal | Longitud de la brecha ≤ 6 h | Rellena intervalos cortos que faltan |
| Detección de valores atípicos | Método IQR | Q1 − 1,5 × IQR, Q3 + 1,5 × IQR | Elimina valores extremos inválidos |
| Normalización | Escalado Min-Max | Set de entrenamiento mínimo y máximo | Estandariza la gama de características |
| PM₂.₅ lags | Variables con retardo | Lag₁, Lag₂, Lag₃ | Captura la persistencia temporal |
| Estadísticas en movimiento | Promedias móviles | 3 h, 6 h, 12 h, 24 h | Captura la acumulación a corto plazo |
| Función de conteo de fuegos | CONTEO DE INCENDIOS DE MODIS | Recuento del mismo día / día anterior | Representa la influencia regional del fuego |
Tabla 2: Preprocesamiento de datos y resumen de la ingeniería de características. En la Tabla 2, el procesamiento de datos se realiza de dos maneras: primero, mediante la limpieza y transformación de los datos en bruto (preprocesamiento), y segundo, mediante ingeniería de características para crear/seleccionar/modificar características (características). Como unidad, estos dos procesos ayudan a eliminar o reducir el ruido; manejar valores faltantes; mejorar la coherencia de los datos; y crear modelos más predictivos.
Los parámetros de normalización se estimaron solo a partir del conjunto de entrenamiento y luego se aplicaron sin cambios a los conjuntos de pruebas y validación para evitar fugas de información.
Formulación matemática del rango CorrXGBoost
Sea X = {x 1, x2, ..., xn} el conjunto de variables de entrada candidatas, y y la concentración objetivo PM₂.₅. Para cada característica xi, el coeficiente de correlación de Pearson con la variable objetivo se calculó como:
(1)
donde cov(x, i, y) es la covarianza entre la característica xi y el objetivo y, y σxi y σy son sus desviaciones estándar. Características conservadas que satisfacen: |ri| ≥ τr donde τr = 0,30 en este estudio.
Se calcularon correlaciones por pares entre todas las features_xretenidas i, xj, y si |corr(x i,x j)| >= τrojo, donde τrojo = 0,85, la característica con la correlación absoluta más baja con el objetivo PM2,5 se elimina del conjunto de características. Este proceso reduce las variables del conjunto de características que tienen multicolinealidad. A continuación, se ajustó un modelo regresor XGBoost a las características restantes, y se calcularon puntuaciones de importancia de características para cada característica usando la importancia XGBoost, y las características que satisfacían i_i ≥ τxgb donde τxgb = 0,015 se mantenían en el conjunto final de características (S") definido comoS final = Scorr ∪ Sxgb, es decir, el conjunto definido filtrando características para redundancia respecto a la correlación y eliminando cualquier característica basada en la importancia de la variable XGBoost. El enfoque general adoptado en la selección de características es el siguiente: calcular la correlación Pearson objetivo de características por pares, descartar características con |r_i|< 0,30, descartar características con pares que tengan correlaciones por pares ≥ 0,85, ajustar XGBoost a las características restantes, mantener características con puntuación de importancia XGBoost ≥ 0,015, definir las características deseadas finales Sfinal=S corr ∪ Sxgb, donde Scorr son las características que se mantienen tras un filtrado redundante de correlaciones, y Sxgb son las características seleccionadas usando la puntuación de importancia de características de XGBoost. Por tanto, el flujo de trabajo CorrXGBoost-Rank es: calcular la correlación de Pearson entre características y objetivo, eliminar características con |r i| < 0,30, eliminar características altamente redundantes con correlación por pares ≥ 0,85, entrenar XGBoost en las variables restantes, conservar variables con puntuación de importancia XGBoost ≥ 0,015 y usar la unión de variables seleccionadas por correlación y seleccionadas por XGBoost como conjunto final de características. Los parámetros utilizados en este estudio son τr = 0,30, τrojo = 0,85 y τxgb = 0,015.
Fuentes de datos
Los autores integraron tres grandes conjuntos de datos para el estudio; estos son datos sobre contaminantes atmosféricos (PM2.5, PM10, NO2, CO y SO₂) que los autores obtuvieron a través del monitoreo de la calidad del aire por CPCB (Junta Central de Control de la Contaminación) / DPCC (Comité de Control de la Contaminación de Delhi), datos meteorológicos (temperatura, humedad, velocidad/dirección y presión del viento) del departamento meteorológico indio (IMD) e información satelital sobre incendios activos de la MODIS Active Fire Products de la NASA. Estos tres conjuntos de datos cubren el periodo de 12 años de enero de 2012 a diciembre de 2023 y, por tanto, representan diferentes tipos de emisiones. Los incendios contribuyen a la contaminación del aire, como se ilustra en la Figura Suplementaria 2, que muestra las tendencias de FIRECOUNT desde 2012 hasta 2024.
Tendencias a largo plazo de los contaminantes a lo largo del periodo del estudio
La Figura 1 muestra las tendencias a largo plazo de los contaminantes a lo largo de los años de estudio (2012–2024). Los recuentos anuales de incendios y las concentraciones medias de PM₂.₅ entre 2012 y 2024 tienen una relación positiva moderadamente fuerte (r = 0,688), lo que indica que una mayor actividad de incendios suele estar relacionada con concentraciones más altas de PM₂.₅. Tanto los datos medidos como los predichos de PM₂.₅ siguen una tendencia similar, apoyando la idea de que la quema de biomasa contribuye a la contaminación por partículas. Aunque existe una variabilidad interanual significativa, las emisiones relacionadas con incendios son un factor importante para determinar la variabilidad PM₂.₅, lo que subraya la necesidad de una gestión regional del fuego para mejorar la calidad del aire. La autocorrelación de PM2.5 predicha a treinta retrasos, mostrada en la Figura Suplementaria 3, presenta una autocorrelación positiva considerable en casi los treinta retrasos, confirmando que PM2.5 en Delhi tiene una fuerte dependencia temporal y persistencia de varios días.

Figura 1: Tendencias a largo plazo de PM₂.₅ y conteo de incendios desde 2012 hasta 2024. La Figura 1 compara la variación anual del recuento de incendios con las concentraciones observadas y previstas de PM₂.₅. PM₂.₅ se reporta en μg/m 3. FIRECOUNT representa la actividad de incendios derivados de satélites a partir de productos MODIS. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Descomposición STL (descomposición estacional y de tendencias usando Loess)
STL o descomposición estacional y de tendencias usando Loess es un algoritmo iterativo que permite desglosar los datos de series temporales en tres componentes aditivos, como se muestra en la Figura 2: tendencia (tendencia a largo plazo) (Figura 2A), (Figura 2D), (Figura 2G), (Figura 2J), estacional (periodos cíclicos) (Figura 2B), (Figura 2E), (Figura 2H), (Figura 2K) y resto (ruido/residual) (Figura 2C), (Figura 2F), (Figura 2I), (Figura 2L). STL ha demostrado ser eficaz para tratar las complejas características no lineales de los datos ambientales (como PM2.5), para las cuales muchas otras técnicas analíticas han fallado debido a amplitudes variables en la señal estacional y a la existencia de valores atípicos. El suavizado LOESS permite una separación precisa de estos componentes, produciendo una interpretación más clara de tendencias o patrones. A través del procesamiento STL, es posible separar las tendencias alcistas más amplias de PM2.5 de los ciclos diarios/estacionales más cortos y de los residuos erráticos dentro de esos ciclos. Esta separación permite identificar qué emisiones han influido en el PM2.5, en contraposición a los factores meteorológicos que han influido en el PM2.5. Los resultados de esta separación ayudan a una previsión precisa de las futuras emisiones de PM2.5 ; proporcionar datos para decisiones regulatorias; y cumplir con los estándares establecidos para la desagregación rigurosa de datos de series temporales para estudios de calidad del aire34. Las mediciones diarias medias de concentración de PM2,5 realizadas en estaciones de monitorización de Delhi entre 2012 y 2024 indican cambios mínimos en los niveles de PM2,5 (es decir, ningún cambio significativo entre 2022 y 2024) en general y un comportamiento extremadamente limitado y consistente (o consistencia en los niveles de PM2,5 entre los cuatro lugares de monitorización). Los niveles de PM2,5 en el Sector 8 de Dwarka y Mundka-DPCC muestran una tendencia persistente a la baja (es decir, continúa disminuyendo), mientras que Anand Vihar tiene una tendencia al alcista (es decir, un aumento significativo), y Sonia Vihar una ligera tendencia al alza (desde un aumento muy pequeño desde 2022). Además, los residuos de las concentraciones diarias de PM2,5 en cada una de las cuatro estaciones de monitorización indicaron que las concentraciones de PM2,5 estaban fuertemente influenciadas por cambios estacionales (meteorológicos), que producían grandes fluctuaciones en las concentraciones medias diarias de PM2,5 para las estaciones individuales. Las concentraciones diarias de PM2,5 para las cuatro estaciones de monitoreo en Delhi (2012–2024) se muestran en la Figura 2.

Figura 2: Descomposición STL (descomposición estacional y de tendencias usando Loess) de las concentraciones diarias de PM₂.₅ en cuatro estaciones de monitoreo de Delhi entre 2022 y 2024. La serie temporal de cada estación de monitorización se divide en tres componentes aditivos: tendencia a largo plazo, variación estacional y residuo (resto). (A) Componente de tendencia para el Sector 8 de Dwarka. (B) Componente estacional para el Sector 8 de Dwarka. (C) Componente residual para el Sector 8 de Dwarka. (D) Componente de tendencia para Anand Vihar. (E) Componente estacional para Anand Vihar. (F) Componente residual para Anand Vihar. (G) Componente de tendencia para Mundka-DPCC. (H) Componente estacional para Mundka-DPCC. (I) Componente residual para Mundka-DPCC. (J) Componente de tendencia para Sonia Vihar. (K) Componente estacional para Sonia Vihar. (L) Componente residual para Sonia Vihar. STL, descomposición estacional y de tendencias usando Loess. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
La Figura 2 presenta las descomposiciones temporales de concentraciones diarias de PM2.5 en cuatro ubicaciones urbanas de monitorización entre 2022 y 2024, revelando patrones de descensos a largo plazo, aumentos graduales y grandes cambios diurnos. Estas diferencias pueden atribuirse en gran medida a los efectos físicos del clima, es decir, cambios en la altura de la capa límite planetaria (PBL), como la expansión diurna que aumenta la dispersión vertical y reduce las concentraciones, y la contracción nocturna, dejando contaminantes cerca del suelo y creando un pico más alto por la noche. Otras influencias meteorológicas provienen de emisiones locales de actividad humana relacionadas con sus horas de mayor volumen (picos de mañana/tarde), industrias y sus interacciones con: factores específicos del sitio, como la topografía local, la velocidad del viento, la humedad relativa y la estación (es decir, mayor correlación en invierno) que generan los cambios específicos de la estación y los descensos generales a largo plazo pueden haber sido influenciados por controles regulatorios sobre las emisiones. lo que lleva a tendencias descendentes en general.
Correlación entre las características
La Figura 3 presenta la distribución de todas las características de entrada utilizadas en el modelo CORTA-Net. En paneles, las variables contaminantes (PM10 (Figura 3A), NO₂ (Figura 3B), CO (Figura 3C), SO₂ (Figura 3D)) muestran distribuciones sesgadas hacia la derecha típicas de los datos de calidad del aire urbano, mientras que O₃ (Figura 3E) y presión (Figura 3I) presentan patrones cercanosa la normalidad 35. La temperatura (Figura 3F) muestra una estructura estacional bimodal clara, la humedad (Figura 3G) sigue una amplia dispersión uniforme, y la velocidad del viento (Figura 3H) muestra una distribución de cola ligera. Estos patrones ponen de manifiesto el comportamiento estadístico heterogéneo de los predictores y justifican la necesidad de ingeniería de características y normalización antes del entrenamiento del modelo.

Figura 3: Distribución de las características de entrada utilizadas en el modelo CORTA-Net, incluyendo concentraciones de contaminantes atmosféricos y variables meteorológicas. Las distribuciones ilustran las características estadísticas de los predictores antes del preprocesamiento y el entrenamiento del modelo. (A) PM₁₀ concentración. (B) Concentración NO₂. (C) Concentración de CO. (D) Concentración SO₂. (E) O₃ concentración. (F) Temperatura del aire. (G) Humedad relativa. (H) Velocidad del viento. (I) Presión atmosférica. Las variables contaminantes, particularmente PM₁₀, NO₂, CO y SO₂, presentan distribuciones sesgadas hacia la derecha típicas de los datos de calidad del aire urbano, mientras que O₃ y la presión atmosférica muestran distribuciones aproximadamente normales. La temperatura muestra un patrón estacional bimodal, la humedad tiene una distribución amplia y la velocidad del viento se concentra en valores más bajos con una distribución de cola ligera. Estas distribuciones heterogéneas de características apoyan el uso de la ingeniería de características y la normalización antes del desarrollo del modelo. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
La Figura 4 presenta la clasificación de importancia de características basada en la ganancia de XGBoost tras el preprocesamiento CorrXGBoost-Rank para la previsión PM₂.₅. El gráfico actual de importancia de características muestra que PM₂.₅ del Día Anterior es el predictor mejor valorado con una puntuación de importancia de 0,280, seguido de PM10 = 0,180, FIRECOUNT = 0,150, NO₂ = 0,120, CO = 0,080, velocidad del viento = 0,070, temperatura = 0,040, humedad = 0,030 y día del año = 0,020. La línea vertical discontinua representa el umbral real de selección de características de XGBoost de 0,015. Se mantuvieron los predictores con puntuaciones de importancia mayores o iguales a 0,015 para el conjunto final de entrada CORTA-Net, mientras que los predictores por debajo de este umbral, incluyendo SO₂ = 0,010, O₃ = 0,010, presión = 0,005, precipitación = 0,005, fin de semana = 0,002 y festivo = 0,001, se excluyeron. Estos valores representan puntuaciones de importancia de características basadas en la ganancia de XGBoost y no deben interpretarse como coeficientes de correlación de Pearson ni efectos causales.
Por lo tanto, solo se incluyeron en el modelo las características que recibieron una contribución por encima de este umbral. Los modelos XGBoost utilizan un conjunto de árboles de decisión, que construyen iterativamente un árbol para minimizar una función de pérdida, conocida como gradient boosting. XGBoost calcula la importancia de las características usando una de tres métricas: ganancia (cuánto mejora la división de la característica el rendimiento del modelo), peso (cuántas veces se eligió la característica como división para un árbol) o cobertura (el número de observaciones afectadas por la división). El modelo XGBoost se basó en datos relacionados con la calidad del aire (contaminantes, variables meteorológicas) y se centra en PM2.5 con retraso para pronosticar automáticamente PM2.5, algo común en los modelos PM2.5 en Delhi, y ayuda a capturar la persistencia temporal de PM2.5. Delhi_PM2,5 es un factor importante debido a las altas características de autocorrelación de las partículas finas, que también apuntan a la presencia de una inercia de contaminación por las fuentes de emisión consistentes. La velocidad del viento es un contribuyente significativo porque proporciona el mecanismo para la dispersión de los contaminantes; mientras que los vientos bajos permiten que se acumulen contaminantes durante el invierno cuando hay inversiones. El NO2 está correlacionado con PM2.5 debido al tráfico y las emisiones, mientras que el día del año indica el ciclo anual de emisiones de contaminantes (es decir, emisiones más bajas el fin de semana). En Delhi, PM2.5 tiene una alta auto-persistencia debido a la meteorología invernal estancada y a las emisiones continuas de vehículos, industria ybiomasa 28. El viento ayuda a la dispersión de aerosoles, pero el viento débil < 2 m/s contribuyó a un aumento de la acumulación de PM2,5 debido a las inversiones. La relación entre NO2 y PM2.5 es resultado de su origen común (es decir, combustión) y está sujeta a influencias temporales (por ejemplo, diaria frente a semanal)36. Los cuatro factores principales responsables de explicar el 93% o más de la variación en el AQI son variaciones en las concentraciones de contaminantes derivadas de acumulación retardada de PM2,5 (93%+) y bajas velocidades de viento que atrapan las emisiones, las emisiones de NO2/PM de vehículos e industria, y las variaciones diarias en la cantidad de tráfico37. Además, la geografía de Delhi es un factor que contribuye a la persistencia de inversiones en la zona y, por tanto, también agrava las concentraciones de PM2.5 . El ajuste de hiperparámetros, la regularización y la adición de variables adicionales (como la temperatura) ayudarían a limitar las posibilidades de sobreajuste y mejorarían el rendimiento general del modelo. La implementación de estrategias operativas para reducir las emisiones de PM debería incluir la implantación de límites diarios a las emisiones de PM, el uso de dispositivos que permitan monitorización en tiempo real de la presencia de PM y el uso del viento para dispersar PM por los espacios verdes urbanos.

Figura 4: Clasificación de importancia de características basada en la ganancia de XGBoost tras el cribado de características de CorrXGBoost-Rank para la previsión PM₂.₅. Las barras predictoras están dispuestas en orden descendente de importancia. La línea vertical discontinua representa el umbral real de selección de características de XGBoost de 0,015. Se mantuvieron los predictores con puntuaciones ≥ 0,015 para el conjunto final de entrada CORTA-Net, mientras que los predictores por debajo de este umbral fueron excluidos. La clasificación se utiliza para el cribado de características e interpretación del comportamiento del modelo, y no debe interpretarse como atribución causal. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Arquitectura del modelo CORTA-net
La Figura 5 presenta un marco propuesto de predicción de PM2.5. Las figuras complementarias 4 y 5 ilustran la disposición interna de la unidad LSTM y una representación del diagrama de bloques de atención multicabezal. Todas las fuentes de datos (es decir, condiciones ambientales, observaciones meteorológicas, actividad de incendios y aspectos temporales y contextuales de los datos) pasaron por preprocesamiento para asegurar que coinciden temporalmente, que se les impute cualquier dato faltante (si es necesario) y que hayan sido sometidas tanto a la eliminación como a la normalización de valores atípicos antes de emplearlas en cualquiera de los procesos de construcción del modelo. La arquitectura del modelo, la ingeniería de características, la configuración de entrenamiento, la configuración de datos, el aprendizaje por transferencia, las métricas de evaluación, las predicciones futuras y los detalles de implementación se muestran en la Tabla Suplementaria 1. Utilizando el módulo CorrXGBoost-Rank, el conjunto óptimo de características se determina antes de que un subconjunto de ellas se introduzca en la arquitectura LSTM, lo cual ha sido mejorado mediante la incorporación de capas de atención multicabeza para tener en cuenta el comportamiento de series temporales durante la fase de modelado. Tanto la previsión de PM2.5 como la PM2.5 se proporcionaron como salidas la importancia de las características de entrada, así como los pesos de atención de múltiples cabezas como mapas de atención. La estructura interna de unidades LSTM y el diagrama de bloques de atención multicabeza se han incluido como Figuras Suplementarias 4 y 5, respectivamente, mientras que la Tabla Suplementaria 1 proporciona los parámetros de arquitectura para cada tipo de capa dentro de esta arquitectura.

Figura 5: Arquitectura general del modelo de previsión CORTA-Net PM₂.₅. Un proceso de pronóstico de entrada incluye datos de indicadores de calidad del aire, indicadores meteorológicos, indicadores de tiempo y indicadores de conteo de incendios MODIS (Espectrorradiómetro de Imagen de Resolución Moderada). Para cada uno de estos pasos, el algoritmo alineó las marcas de tiempo, manejó los valores faltantes, filtró los valores atípicos, normalizó datos e ingenió características. Los predictores finales se seleccionaron entonces mediante el proceso CorrXGBoost-Rank. Posteriormente, las características seleccionadas se colocaban en ventanas deslizantes de secuencia temporal y pasaban a través de un codificador LSTM (Long Short-Term Memory) mediante aprendizaje por transferencia. Para cada característica y paso temporal, el mecanismo de atención multicabeza aplica pesos antes de enviar la salida combinada a la capa final densa de regresión para producir la predicción PM₂.₅. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Formación y evaluación
Se utilizó un enfoque de ventana deslizante para formar secuencias de aprendizaje supervisadas. El entrenamiento utilizó optimizador Adam y pérdida por error cuadrático medio (Tabla Suplementaria 2). El rendimiento del modelo se evaluó utilizando RMSE yR2 en particiones de entrenamiento, validación, prueba y validación cruzada. La arquitectura del modelo, la ingeniería de características, la configuración de entrenamiento, la configuración de datos, el aprendizaje por transferencia, las métricas de evaluación, las predicciones futuras y los detalles de implementación se tabulan en la Tabla Suplementaria 1. La Figura 6 representa los diagnósticos de entrenamiento para el modelo de predicción CORTA-Net PM₂.₅. En los paneles, la Figura 6A representa curvas de pérdida de entrenamiento y validación, mostrando la reducción progresiva de errores, con una parada óptima en la época 106. La evolución de la brecha de generalización durante la evaluación de un análisis de sobreajuste se ilustra mediante la divergencia entre los datos de validación y de entrenamiento en la Figura 6B. En particular, muestra periodos en los que la divergencia supera los límites predefinidos; esta información aporta evidencia de que el comportamiento de la tasa de aprendizaje y los patrones de reducción de pérdida ilustran los beneficios de la decaimiento de la tasa de aprendizaje programada (LR) en épocas críticas como medio para mejorar la estabilidad de la convergencia, como se muestra en la Figura 6C. En conjunto, estas figuras ofrecen un resumen de la dinámica de aprendizaje, la capacidad de generalización y la configuración recomendada de entrenamiento del modelo.

Figura 6: Diagnósticos de entrenamiento para el modelo de predicción CORTA-Net PM₂.₅. (A) Curvas de pérdida de entrenamiento y validación que muestran una reducción progresiva del error durante el entrenamiento del modelo, con una parada temprana en la época 106 según el rendimiento de validación. (B) Brecha de generalización entre la pérdida de entrenamiento y validación a lo largo de las épocas, ilustrando la evolución de la generalización del modelo y los periodos de mayor divergencia indicativos de posible sobreajuste. (C) Calendario de tasa de aprendizaje que muestra el efecto de la disminución de la tasa de aprendizaje programada en la optimización durante el entrenamiento. (D) Resumen del comportamiento de convergencia del modelo, demostrando la optimización estable y la configuración final de entrenamiento seleccionada para el modelo CORTA-Net. En conjunto, estos diagnósticos ilustran la dinámica del modelo, las características de convergencia y el rendimiento de generalización durante el entrenamiento. Por favor, haz clic aquí para ver una versión ampliada de esta figura.