CORTA(상관최적화 순위 전달-주의)-Net은 델리에서 단기 PM₂.₅ 예측을 위한 하이브리드 딥러닝 프레임워크입니다. 이 모델은 CorrXGBoost-Rank 특징 선택, 장기 단기 기억 네트워크와 전이 학습, 시간 및 특징 수준 해석을 위한 다중 헤드 주의를 결합하며, 대기질, 기상학, 위성 기반 화재 계수 데이터를 활용해 PM2.5 예보를 개선합니다.
이 콘텐츠를 보려면 JoVE 구독이 필요합니다. 로그인하거나 오늘 무료 평가판을 시작하세요.
CORTA(상관최적화 순위 전달-주의)-Net은 델리에서 단기 PM₂.₅ 예측을 위한 하이브리드 딥러닝 프레임워크입니다. 이 모델은 CorrXGBoost-Rank 특징 선택, 장기 단기 기억 네트워크와 전이 학습, 시간 및 특징 수준 해석을 위한 다중 헤드 주의를 결합하며, 대기질, 기상학, 위성 기반 화재 계수 데이터를 활용해 PM2.5 예보를 개선합니다.
델리에서 단기 PM2.5 예측은 지역 배출, 기상 변동, 계절적 정체, 간헐적 화재 관련 오염에 영향을 받기 때문에 도전적입니다. 본 연구는 2012년부터 2024년까지 다중 출처 환경 데이터를 활용한 PM2.5 예측을 위한 하이브리드 딥러닝 프레임워크인 CORTA-Net을 소개합니다. 입력 데이터에는 CPCB(중앙오염통제위원회)/DPCC(델리 오염통제위원회) 모니터링소의 시간별 대기질 관측, 인도 기상청(IMD)의 기상 변수, 그리고 MODIS(중해상도 영상 분광계) 제품에서 얻은 위성 기반 화재 계수 정보가 포함됩니다. 제안된 프레임워크는 먼저 CorrXGBoost-Rank 특징 선택을 적용하여 중복 예측 변수를 줄이고 중요한 오염물질, 기상, 시간, 화재 관련 변수를 유지합니다. 선택된 특징들은 감독 슬라이딩 윈도우 시퀀스로 배열되고, 전이 학습 기반 LSTM 인코더와 다중 헤드 주의 계층을 통해 처리됩니다. 주의 메커니즘은 PM2.5 예보의 특징 및 시간-단계 수준의 해석을 제공합니다. CORTA-Net은 연대순 훈련, 테스트, 검증 분할과 교차 검증을 통해 평가되었습니다. 무작위 숲, XGBoost, LSTM, attention-LSTM 기준선과 비교하여, 제안된 프레임워크는 평가된 델리 모니터링 스테이션 환경에서 예측 오차를 줄였습니다. CORTA-Net의 새로움은 명시적인 CorrXGBoost-Rank 특징 스크리닝, 전이 학습 기반 시간 인코딩, MODIS 화재-활동 통합, 다중 헤드 주의 기반 모델-행동 분석을 단일 재현 가능한 PM2.5 예측 파이프라인에 결합했다는 점에 있습니다. 실질적으로, 이 프레임워크는 오염물질 기록, 기상 관측, 화재 활동 지표가 제공되는 데이터가 풍부한 모니터링 환경에서 단기 도시 대기질 예측을 지원할 수 있습니다.
공기 역학적 ≤직경 2.5 μm(PM2.5)인 미세입자는 델리에서 중요한 대기질 문제로, 지역 배출 1,2,3, 지역 교통 4, 계절 기상5, 그리고 간헐적 바이오매스 소각 사건6의 영향을 받습니다. 몬순 이후 및 겨울 기간 동안7, 저풍속8, 얕은 경계층 조건9, 온도 역전이 오염물질 확산을 줄이고 입자 축적을 증가시킬 수 있습니다. 단기 PM2.5의 예측은 시계열10의 본질적인 비선형적이고 계절적이며 갑작스러운 고오염 현상 때문에 어렵습니다. 이전 PM2.5 예측 연구들은 통계 모델, 머신러닝 모델, 반복 신경망 모델을 활용해 왔습니다. 통계적방법은 데이터의 추세와 계절성을 결정하는 데 유용할 수 있으나, 오염물질과 기상학 사이에 존재하는 비선형 상호작용을 완전히 설명하지 못할 수 있습니다. 랜덤 포레스트와 XGBoost와 같은 머신러닝 모델은 비선형 관계를 모델링하는 데 사용할 수 있습니다. 하지만 지연 기능이 설계되지 않는 한 일반적으로 시간적 의존성을 가지지 않습니다. 장단기(LSTM) 신경망은 시간적 의존성과 비선형 관계를 모두 모델링할 수 있습니다15.
장기 단기 기억 네트워크는 시간 패턴을 모델링할 수 있으나(16), 비고정 상태와 갑작스러운 오염 에피소드에 의해 그 수행 능력이 영향을 받을 수있습니다. 최근의 주의 기반 및 트랜스포머 기반 접근법은 시간 표현을 개선하지만, 많은 접근법이 모든 후보 변수를 직접 처리하며 시퀀스 모델링 전에 특징 중복에 대한 제한적 제어를 제공합니다.19,20. 트랜스포머 기반 및 하이브리드 딥러닝 모델들이 최근 PM2.5와 AQI 예측21을 개선했지만, 이들의 기여는 주로 시간 표현 학습22, 공간 그래프 구성23, 모델 융합24, 최적화에 집중되어 있습니다. 많은 모델들은 이용 가능한 다변량 입력 집합을 직접 사용하며, 주요 학습 부담을 시퀀스 모델25에 둡니다. 이로 인해 입력 중복이 증가하고 해석 가능성이 감소하며, 시간 모델링, 특징 스크리닝, 외부 환경 지표, 주의력 기반 가중치에서 개선이 발생하는지 식별하기 어려워집니다. 따라서 CORTA-Net은 새로운 독립형 신경망계층 26이 아니라 워크플로우 수준 예측 프레임워크로 자리매김합니다. 이 기술의 특징은 네 단계의 순서차별 통합에 있습니다: 시퀀스 모델링 전 CorrXGBoost-Rank 특징 스크리닝, 시간적 적응을 위한 전이 학습 LSTM 인코딩, 에피소다적 바이오매스 연소 영향에 대한 MODIS 유도 화재 카운트 포함, 그리고 특징 및 시간-단계 모델 행동 해석을 위한 다중 헤드 주의. 이 설계는 동일한 델리 모니터링 스테이션 설정27 내에서 예측 정확도와 선택된 오염물질, 기상학, 시간, 화재 활동 변수의 기여도를 모두 평가할 수 있게 합니다.
최근 대기질 예측의 발전은 하이브리드 딥러닝 모델, 주의 메커니즘, 그래프 기반 학습28, 트랜스포머 아키텍처를 활용하여 비선형 시간 및 공간적 의존성을 포착하는 데 점점 더 많이 사용되고있습니다. 이러한 접근법들은 장기 의존성을 학습하고 시간 단계 또는 입력 변수에 적응 가중치를 할당함으로써 예측 성능을 향상시켰습니다. 그러나 많은 최근 모델들은 여전히 대규모 입력 특징집합에 의존하거나, 시간 모델링 전에 중복 예측 변수를 명시적으로 줄이지 않거나, 발화적 바이오매스 연소 효과가 중요한 경우 외부 화재 활동 지표를 포함하지 않습니다. CORTA-Net은 특징 스크리닝, 전이 학습 LSTM 인코딩, MODIS 기반 화재 카운트 통합, 다중 헤드 주의를 단일 예측 워크플로우에 결합하여 이 격차를 메웁니다.
본 연구는 CORTA-Net을 새로운 신경망 계층이 아닌 재현 가능한 하이브리드 PM2.5 예측 파이프라인으로 제시합니다. 이 프레임워크는 CorrXGBoost-Rank 특징 선택, 전이 학습 기반 LSTM 시간 인코딩, MODIS 기반 화력 집계 통합, 다중 헤드 주의 기반 모델-행동 분석의 네 단계를 결합합니다. CorrXGBoost-Rank는 먼저 중복 오염물질 및 기상 변수를 줄인 후 서열 모델링을 진행합니다. 선택된 특징들은 슬라이딩 윈도우 시퀀스로 배열되어 전이 학습 LSTM 인코더로 처리됩니다. MODIS 화재 계수 변수는 지역 화재 활동의 외부 지표로 포함되며, 다중 헤드 주의 계층을 사용하여 최근 시간 단계와 입력 변수가 예보에 가장 크게 기여하는 것을 분석합니다. 이 프레임워크는 최소 한 개의 모니터링 스테이션에서 연속 PM2.5 관측이 가능하며, 가능하면 수년간의 시간별 데이터를 포함하는 환경에 적합합니다. 또한 지역적 바이오매스 연소 영향이 있을 때 기상 관측과 위성 산불 조사 정보의 혜택도 받습니다. 따라서 CORTA-Net은 데이터가 풍부한 도시 대기질 예보 환경에 적합하며, 모니터링 기록이 드문드문하거나 불규칙하거나 단기 모니터링이 있는 지역에는 적합하지 않을 수 있습니다.
델리는 몬순 이후 및 겨울철에 PM₂.₅ 수치가 반복적으로 높게 나타나기 때문에 연구 지역으로 선정되었습니다. 도시는 교통, 산업 활동, 주거 배출, 기상 정체, 지역 농업 소각의 영향을 받고 있습니다. 이 연구에는 네 개의 모니터링 관측소가 사용되었습니다: 드와르카 섹터 8, 아난드 비하르, 문드카-DPCC, 그리고 소니아 비하르. 각 역은 주거 지역, 교통 영향 지역, 산업 영향 지역 등 서로 다른 유형의 도시 마이크로환경을 나타냅니다. 2012년부터 2024년까지 각 관측소에서 수행된 관측 결과는 보충 그림 1에 제시되어 있습니다. 모델 학습은 2015년부터 2022년까지의 데이터를 기반으로 진행되었으며, 2023년 데이터로 모델 개발과 모델 검증 테스트가 이루어졌습니다.32 는 2024년에 수집된 데이터를 기반으로 했습니다. 입력 변수로는 PM2.5, PM10, NO,NO2, NOx, CO, 벤젠, 공기 온도, 풍속, 태양 복사, 기압 등이 포함되었으며,33번 사이트에서 이용 가능한 정보를 바탕으로 결정되었습니다. MODIS에서 파생된 화재 계수 데이터는 해당 지역의 화재 활동 수준을 나타내는 외부 변수로 사용되었습니다. 표 1은 네 개의 모니터링 스테이션 각각의 PM₂.₅ 농도 통계 요약을 담고 있습니다.
| 데이터셋 | 역 이름 | 심술궂은 | 성병 | 민 | 25% | 50% | 75% | 맥스 |
| 1 | 드와르카 8구역 | 98.24 | 79.12 | 7.52 | 38.65 | 70.83 | 133.47 | 588.15 |
| 2 | 아난드 비하르 | 115.87 | 89.42 | 8.91 | 49.28 | 84.36 | 152.89 | 574.92 |
| 3 | 문드카-DPCC | 113.62 | 91.05 | 4.21 | 43.58 | 86.74 | 158.42 | 682.31 |
| 4 | 소니아 비하르 | 101.35 | 80.25 | 5.80 | 42.15 | 75.60 | 138.75 | 565.40 |
표 1: 델리 4개 모니터링 지점의 PM₂.₅ 농도 요약 통계. 표 1은 델리의 네 개 모니터에서 측정된 평균 PM2.5(미세먼지) 농도를 제시합니다. PM2.5 는 2.5마이크론 미만의 공기 중 오염물질로 구성되어 있어 폐 깊숙이 쉽게 흡입할 수 있을 만큼 작아 다양한 잠재적 건강 위험을 초래합니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
방법론
감독 하에 슬라이딩 윈도우 모델이 구축되어 이전 시간별 관측에서 t + 1 시점의 미래 PM2.5 값을 예측하였습니다. 후보 입력 창 길이인 12, 24, 48시간 간격을 검증 성능을 사용해 평가했으며, 최종 CORTA-Net 구성은 24시간 입력 시퀀스를 사용했습니다. 선형 보간법이 누락된 값을 채우는 데 사용되었습니다; 이상치는 IQR 방법으로 제거되었으며; 모든 변수는 지연된 PM2.5 특징을 생성하기 전에 최소-최대 정규화를 사용해 스케일링되었습니다. 그 후 CorrXGBoost-Rank 절차가 특징 선택에 적용되었습니다. 첫째, 피어슨 상관관계 필터링은 |r| ≥ 0.30. 둘째, 쌍별 상관관계를 가진 매우 중복된 특징 쌍 |corr(xi, xj)| 0.85 ≥ 다중공선성을 줄이기 위해 필터링되었다. 셋째, 나머지 변수들에 대해 XGBoost 회귀분석을 학습시켰고, XGBoost 게이득 기반 중요도 점수 0.015≥ 예측 변수를 최종 모델 입력에 남겼습니다. 최종 CORTA-Net 아키텍처는 시간 인코딩을 위한 스택된 LSTM 계층, 특징 및 시간 단계 가중치를 위한 다중 헤드 주의 계층, PM2.5 추정을 위한 조밀한 회귀 계층으로 구성되었습니다. 이 모델은 평균 제곱 오차 손실과 조기 정지 기능을 갖춘 Adam 최적화 도구를 사용해 학습되었습니다. 모델 평가는 RMSE와 R2 를 사용하여 훈련, 검증, 테스트 및 10배 교차 검증 파티션을 통해 수행되었습니다. 표 2는 데이터 전처리 및 특징 공학 요약을 나타냅니다.
| 스텝 | 사용 방법 | 매개변수 / 임계값 | 목적 |
| 결손 계산 | 누락된 관측값의 비율 | 변수별 보고서 비율 | 데이터 완전성을 정량화함 |
| 단기 보충 | 선형 보간 | 간극 길이 ≤ 6시간 | 짧은 누락 구간을 채웁니다 |
| 이상치 검출 | IQR 방법 | Q1 − 1.5 × IQR, Q3 + 1.5 × IQR | 유효하지 않은 극단값을 제거합니다 |
| 정규화 | 최소-최대 척도 | 훈련 집합 최소 및 최대 | 기능 범위를 표준화함 |
| PM₂.₅ 지연 | 지연 변수 | lag₁, lag₂, lag₃ | 시간적 지속성을 포착합니다 |
| 롤링 통계 | 이동평균선 | 3시간, 6시간, 12시간, 24시간 | 단기 축적을 포착함 |
| 발사 카운트 기능 | 모디스 화염 카운트 | 당일 / 전날 카운트 | 지역 화재 영향력을 나타냅니다 |
표 2: 데이터 전처리 및 특징 공학 요약. 표 2에서 데이터 처리는 두 가지 방식으로 이루어집니다: 첫째는 원시 데이터의 정제 및 변환(전처리)이고, 둘째는 특징 공학을 통해 특성을 생성/선택/수정하는 것입니다(특징). 이 두 공정이 하나의 단위로 작용하여 노이즈를 제거하거나 줄이는 데 도움을 줍니다; 누락 값을 처리하고; 데이터 일관성 향상; 그리고 더 많은 예측 모델을 만드는 것.
정규화 매개변수는 훈련 세트에서만 추정한 후 정보 누출을 방지하기 위해 테스트 및 검증 세트에 변경 없이 적용했습니다.
CorrXGBoost 랭크의 수학적 공식화
X = {x1, x2, ..., xn}을 후보 입력 변수 집합으로, y를 목표 PM₂.₅ 농도로 나타깝다고 하자. 각 특징 xi에 대해, 목표 변수와의 피어슨 상관계수는 다음과 같이 계산되었습니다:
(1)
여기서 cov(xi, y)는 특징 XI 와 표적 Y 간의 공분산이며, σxI 와 σy는 이들의 표준편차이다. 만족스러운 유지된 특징: |ri| ≥ τr 여기서 τr = 0.30입니다.
모든 보유 features_xi, xj, 그리고 |corr(xi, xj)| >= τ빨간색, 여기서 τ빨간색 = 0.85, PM2.5 목표에 대한 절대 상관관계가 낮은 특징은 특징 집합에서 제외됩니다. 이 과정은 다중 공선성을 가진 특징 집합의 변수들을 줄입니다. 이후 나머지 특징에 XGBoost 회귀기 모델이 적합되었고, XGBoost 중요성을 사용해 각 특징에 대해 특징 중요도 점수를 계산했으며, τxgb = 0.015를 만족하는 특징i_i ≥은 최종 특징 집합(S)에 포함되었습니다. S는 Sfinal=S corr ∪S xgb로 정의되었습니다. 즉, 상관관계에 대한 중복성을 필터링하고 XGBoost 변수 중요도를 기반으로 한 특징을 제거하여 정의된 특징 집합입니다. 특징 선택의 전반적인 접근법은 다음과 같습니다: 쌍별 피어슨 상관관계를 계산하고, |r_i|< 0.30인 특징을 폐기하며, 쌍별 상관관계가 0.85인 쌍≥ 특징을 버리고, 나머지 특징에 XGBoost를 맞추며, XGBoost 중요도 점수 0.015≥ 특징을 유지하고, 최종 원하는 특징 Sfinal=Scorr ∪ Sxgb 정의합니다. 여기서 Scorr는 중복 상관 필터링 후 유지되는 특징이고, Sxgb는 XGBoost 특징 중요도 점수를 사용해 선택된 특징입니다. 따라서 CorrXGBoost-Rank 워크플로우는 다음과 같습니다: 특징-대상 피어슨 상관관계를 계산하고, |ri|를 가진 특징을 제거합니다. 0.30<, 쌍별 상관이 0.85≥ 매우 중복된 특징을 제거하고, 나머지 변수들에 대해 XGBoost를 훈련시키며, XGBoost 중요도 점수 0.015≥ 있는 변수를 유지하고, 상관관계 선택과 XGBoost가 선택한 변수의 합집합을 최종 특징 집합으로 사용합니다. 이 연구에서 사용된 매개변수는 τr = 0.30, τred = 0.85, τxgb = 0.015입니다.
데이터 출처
저자들은 연구를 위해 세 개의 대규모 데이터셋을 통합했습니다; 이 데이터는 CPCB(중앙오염통제위원회) / DPCC(델리 오염통제위원회)의 대기질 모니터링, 인도 기상청(IMD)의 기상 데이터(온도, 습도, 풍속/방향 및 기압), NASA의 MODIS 활성 화재 산물 위성 정보를 통해 얻은 PM2.5, PM10, NO2, CO, SO₂에 관한 데이터입니다. 이 세 데이터셋은 2012년 1월부터 2023년 12월까지의 12년을 포함하며, 따라서 서로 다른 유형의 배출량을 나타냅니다. 화재 사고는 대기 오염에 기여하며, 보충 그림 2는 2012년부터 2024년까지의 FIRECOUNT 추세를 보여줍니다.
연구 기간 동안 오염물질의 장기 추세
그림 1은 연구 기간(2012–2024) 동안 오염물질의 장기 추세를 보여줍니다. 2012년부터 2024년 사이의 연간 화재 수치와 평균 PM₂.₅ 농도는 중간 정도 강한 양의 상관관계를 보이며(r = 0.688), 화재 활동 증가가 일반적으로 PM₂.₅ 농도 증가와 관련이 있음을 나타냅니다. 측정된 데이터와 예측된 PM₂.₅ 데이터 모두 유사한 경향을 따르며, 바이오매스 연소가 미세먼지 오염에 기여한다는 생각을 뒷받침합니다. 연 간 변동성이 크지만, 화재 관련 배출은 PM₂.₅ 변동성을 결정하는 중요한 요소로, 대기질 개선을 위한 지역 화재 관리의 필요성을 강조합니다. 보충 그림 3에 나타난 30 시점에서 예측된 PM2.5의 자기상관관계는 거의 모든 30개 시점에서 상당한 양의 자기상관관계를 보이며, 델리의 PM2.5가 강한 시간적 의존성과 다일간 지속성을 보인다는 것을 확인시켜 줍니다.

그림 1: 2012년부터 2024년까지의 장기 PM₂.₅ 및 화재 집계 추세. 그림 1은 연간 화재 개체수 변동과 관측 및 예측된 PM₂.₅ 농도를 비교합니다. PM₂.₅는 μg/m3 단위로 보고됩니다. FIRECOUNT는 MODIS 제품에서 유래한 위성 산불 활동을 나타냅니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
STL(로에스를 이용한 계절 및 추세 분해) 분해
STL 또는 Loess를 이용한 계절 및 추세 분해는 시계열 데이터를 세 가지 가법 요소로 분해할 수 있는 반복 알고리즘으로, 그림 2에 나타난 대로 추세(장기 추세)(그림 2A), (그림 2D), (그림 2G), (그림 2J), 계절(주기 기간)(그림 2B), (그림 2E), (그림 2H), (그림 2K), 그리고 나머지 부분(잡음/잔여)(그림 2C)으로 나누어 나누어 있습니다. (그림 2F), (그림 2I), (그림 2L). STL은 계절 신호의 변동성 진폭과 이상치의 존재로 인해 많은 다른 분석 기법들이 실패한 환경 데이터의 복잡한 비선형 특성(예: PM2.5)을 성공적으로 다루는 데 성공했습니다. LOESS 평활화는 이러한 구성 요소를 정확히 분리하여 추세나 패턴을 보다 명확하게 해석할 수 있게 합니다. STL 처리를 통해 PM2.5의 광범위한 상승 추세를 짧은 일/계절 주기 및 그 주기 내의 불규칙한 잔여 흐름과 분리할 수 있습니다. 이 분리는 PM2.5에 영향을 준 배출 요인을 식별할 수 있게 하며, 기상 요인에 의해 영향을 받은 것은 무엇인지 구분할 수있습니다. 이 분리 결과는 미래 PM2.5 배출량의 정확한 예측에 도움을 줍니다; 규제 결정을 위한 데이터 제공; 대기질 연구를 위한 엄격한 시계열 데이터 세분화 기준을 준수해야 합니다. 2012년부터 2024년까지 델리 모니터링 스테이션에서 측정된 일일 평균 PM2.5 농도 측정은 전반적으로 PM2.5 수치 변화가 미미한(즉, 2022–24년 사이 유의미한 변화 없음)과 매우 제한적인 일관된 행동(또는 4개 모니터링 지점 간 PM2.5 수치의 일관성)을 나타냅니다. 드와르카 섹터 8과 문드카-DPCC의 PM2.5 수준은 지속적인 하락 추세(즉, 계속 하락)를 보이고 있으며, 아난드 비하르는 상승 추세(즉, 크게 상승)를 보이고 있으며, 소니아 비하르는 2022년 이후 아주 소폭 상승에서 소폭 상승 추세를 보이고 있습니다. 또한, 네 개 관측소 각각의 일일 PM2.5 농도의 잔여 효과는 계절(기상) 변화에 크게 영향을 받아 개별 관측소별 일일 PM2.5 농도에 큰 변동이 있음을 나타냈습니다. 델리의 네 개 모니터링 스테이션(2012–2024)의 일일 PM2.5 농도는 그림 2에 표시되어 있습니다.

그림 2: 2022년부터 2024년까지 델리 4개 모니터링 관측소에서 일일 PM₂₅ 농도의 STL(계절 및 추세 분해, Loess 이용) 분해. 각 모니터링 관측소의 시계열은 장기 추세, 계절 변동, 잔여(잔여)의 세 가지 덧셈 요소로 분해됩니다. (A) 드와르카 섹터 8의 추세 구성 요소. (B) 드와르카 섹터 8의 계절적 구성 요소. (C) 드와르카 섹터 8의 잔류 구성 요소. (D) 아난드 비하르의 트렌드 구성 요소. (E) 아난드 비하르의 계절별 구성 요소. (F) 아난드 비하르의 잔여 성분. (G) 문드카-DPCC의 추세 구성 요소. (H) 문드카-DPCC의 계절 구성 요소. (I) 문드카-DPCC의 잔류 성분. (J) 소니아 비하르의 트렌드 구성 요소. (K) 소니아 비하르의 계절성 구성 요소. (L) 소니아 비하르의 잔여 성분. 로에스를 이용한 STL, 계절 및 추세 분해. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
그림 2 는 2022-2024년 4개 도시 모니터링 지점에서 일일 PM2.5 농도의 시간적 분해를 보여주며, 장기 감소, 점진적 증가, 그리고 큰 일간 변화 패턴을 드러냅니다. 이러한 차이는 주로 날씨의 물리적 영향, 즉 행성 경계층(PBL)의 높이 변화, 예를 들어 낮 팽창으로 수직 분산이 증가하고 농도가 낮아지고, 야간 수축으로 인해 오염물질이 지면 가까이에 머물고 밤에 더 높은 피크가 형성되는 등의 영향에 기인할 수 있습니다. 기타 기상학적 영향은 가장 많은 양이 발생하는 시간대(아침/저녁 피크), 산업 및 지역 지형, 풍속, 상대 습도, 계절(예: 겨울 상관관계 증가)과 같은 지역별 요인과의 상호작용에서 비롯되며, 이는 배출 규제 통제에 의해 영향을 받았을 수 있습니다. 이로 인해 전반적으로 하락세가 이어졌습니다.
특징 간 상관관계
그림 3 은 CORTA-Net 모델에서 사용되는 모든 입력 특징의 분포를 보여줍니다. 패널에서는 오염물질 변수(PM10 (그림 3A), NO₂(그림 3B), CO(그림 3C), SO₂(그림 3D))는 도시 대기질 데이터에서 흔히 나타나는 우측 왜곡 분포를 보이는 반면, O₃(그림 3E)와 압력(그림 3I)은 거의 정상 패턴을 보입니다35. 온도(그림 3F)는 명확한 이중계절 구조를 보여주고, 습도(그림 3G)는 넓고 균일한 분포를 따르며, 풍속(그림 3H)은 연미 분포를 보여준다. 이러한 패턴은 예측 변수의 이질적인 통계적 행동을 강조하며, 모델 학습 전에 특징 공학과 정규화가 필요함을 정당화합니다.

그림 3: 대기 오염물질 농도와 기상 변수를 포함한 CORTA-Net 모델에 사용되는 입력 특징의 분포. 분포는 전처리와 모델 훈련 전 예측 변수의 통계적 특성을 보여줍니다. (A) PM₁₀ 농도. (B) NO₂ 농도. (C) 일산화탄소 농도. (D) SO₂ 농도. (E) O₃ 농도. (여성) 기온. (G) 상대습도. (H) 풍속. (I) 대기압. 오염물질 변수, 특히 PM₁₀, NO₂, CO, SO₂는 도시 대기질 데이터에서 흔히 볼 수 있는 우측 왜곡 분포를 보이는 반면, O₃과 대기압은 대략 정규 분포를 보입니다. 기온은 이중계절 패턴을 보이고, 습도는 넓게 분포하며, 바람 속도는 낮은 값에 집중되어 가벼운 꼬리 분포를 보입니다. 이러한 이기종 특징 분포는 모델 개발 전에 특징 공학과 정규화 사용을 지원합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
그림 4 는 PM₂.₅ 예측을 위한 CorrXGBoost-Rank 전처리 후 XGBoost 이득 기반 특징 중요도 순위를 제시합니다. 현재 특징 중요도 그래프에 따르면 전날 PM₂.₅이 가장 높은 순위의 예측 변수로 중요도 점수 0.280이며, 그 다음으로 PM10 = 0.180, FIRECOUNT = 0.150, NO₂ = 0.120, CO = 0.080, 풍속 = 0.070, 온도 = 0.040, 습도 = 0.030, 연중 요일 = 0.020이 뒤를 잇고 있습니다. 점선 세로선은 실제 XGBoost 기능 선택 임계값인 0.015를 나타냅니다. 중요도 점수가 0.015 이상인 예측 변수는 최종 CORTA-Net 입력 세트에 포함되었으나, SO₂ = 0.010, O₃ = 0.010, 압력 = 0.005, 강수량 = 0.005, 주말 = 0.002, 공휴일 = 0.001 등 이 임계값 이하의 예측 변수는 제외되었습니다. 이 값들은 XGBoost 이득 기반 특징 중요도 점수를 나타내며, 피어슨 상관계수나 인과 효과로 해석해서는 안 됩니다.
따라서 이 임계값보다 기여한 특징들만 모델에 포함되었습니다. XGBoost 모델은 결정 트리 앙상블을 사용하며, 손실 함수를 최소화하기 위해 트리를 반복적으로 구축합니다. 이를 그라디언트 부팅이라고 합니다. XGBoost는 특징의 중요성을 세 가지 지표 중 하나를 사용하여 계산합니다: 게인(특징 분할이 모델 성능을 얼마나 향상시키는지), 가중치(특징이 트리의 분할로 선택된 횟수), 또는 커버(분할로 영향을 받은 관측 횟수). XGBoost 모델은 대기질 관련 데이터(오염물질, 기상 변수)를 기반으로 구축되었으며, 델리 PM2.5 모델에서 흔히 볼 수 있는 PM2.5의 지연 예측부터 자동 회귀 예측까지 집중하여 PM2.5의 시간적 지속 상태를 포착하는 데 도움을 줍니다. Delhi_PM2.5는 미세입자의 높은 자기상관 특성 때문에 중요한 기여를 하며, 이는 일관된 배출원으로부터의 오염 관성의 존재를 시사합니다. 풍속은 오염물질 확산의 메커니즘을 제공하기 때문에 중요한 기여자입니다; 반면 바람이 약하면 겨울철 역전이 발생할 때 오염물질이 쌓일 수 있습니다. NO2는 교통량/배출량 때문에 PM2.5와 상관관계가 있으며, 요일은 오염물질의 연간 배출 주기(즉, 주말 배출량이 적음)를 나타냅니다. 델리에서는 PM2.5가 겨울 기상 정체와 차량, 산업,바이오매스 배출로 인한 지속적인 배출로 인해 높은 자기존속성을 보입니다. 바람은 에어로졸 확산에 도움을 주지만, 2 m/s< 약한 바람은 역전으로 인해 PM2.5의 축적을 증가시키는 데 기여했습니다. NO2와 PM2.5의 관계는 이들의 공통 기원(즉, 연소)에 의해 발생하며, 시간적 영향(예: 일일 vs. 주간)에 의해 영향을 받습니다36. AQI 변동의 93% 이상을 설명하는 네 가지 주요 요인은 PM2.5 축적(93%+)과 저풍속으로 인한 오염물질 농도 변화, 차량 및 산업에서 발생하는NO2/PM 배출, 그리고 일상별 교통량 변동입니다. 또한 델리의 지리적 특성은 이 지역에서 역전(inversion) 현상이 지속되는 데 기여하며, PM2.5 농도를 악화시킵니다. 하이퍼 파라미터 튜닝, 정규화, 그리고 온도 등 추가 변수 추가는 과적합 가능성을 줄이고 전체 모델 성능을 향상시킬 수 있습니다. PM 배출 감소를 위한 운영 전략 실행에는 PM 배출량의 일일 제한 설정, PM 존재 상태를 실시간으로 모니터링하는 장치 사용, 그리고 바람을 이용해 PM을 도시 녹지 공간에 분산시키는 것이 포함되어야 합니다.

그림 4: PM₂.₅ 예측을 위한 CorrXGBoost-Rank 특징 스크리닝 후 XGBoost 게인 기반 특징 중요도 순위. 예측 막대는 중요도 순서대로 배열되어 있습니다. 점선 세로선은 실제 XGBoost 기능 선택 임계값인 0.015를 나타냅니다. 점수 0.015≥ 예측 변수는 최종 CORTA-Net 입력 세트에 포함되었고, 이 임계값 이하의 예측 변수는 제외하였습니다. 순위는 특징 선별 및 모델-행동 해석에 사용되며 인과적 귀속으로 해석해서는 안 됩니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
CORTA-net 모델 아키텍처
그림 5 는 제안된 PM2.5 예측 프레임워크를 제시합니다. 보조 그림 4 와 5 는 LSTM 유닛의 내부 배치와 다중 헤드 어텐션 블록 다이어그램의 표현을 보여줍니다. 모든 데이터 소스(즉, 주변 조건, 기상 관측, 화재 활동, 그리고 시간적 및 맥락적 측면 모두)는 시간 기준이 일치하고, 누락된 데이터가 필요 시 귀속되며, 모델 구축 과정에서 이상치 제거와 정규화를 모두 거쳤는지 사전 처리를 거쳤습니다. 모델의 아키텍처, 특징 공학, 학습 구성, 데이터 구성, 전이 학습, 평가 지표, 미래 예측 및 구현 세부 사항은 보충 표 1에 나와 있습니다. CorrXGBoost-Rank 모듈을 활용하여, 최적의 특징 집합이 LSTM 아키텍처에 입력되기 전에 결정되며, 이 구조는 모델링 단계에서 시계열 행동을 고려하기 위해 다중 헤드 주의 계층을 도입하여 더욱 강화되었습니다. PM2.5 예측과 PM2.5 특징 중요도, 그리고 다중 헤드 주의 가중치가 주의 지도로서 출력으로 제공되었습니다. 내부 LSTM 유닛 구조와 다중 헤드 주의 블록 다이어그램은 각각 보조 그림 4와 5로 포함되었으며, 보조 표 1은 이 아키텍처 내 각 계층 유형에 대한 아키텍처 매개변수를 제공합니다.

그림 5: CORTA-Net PM₂.₅ 예측 모델의 전체 아키텍처. 입력 예보 과정에는 대기질 지표, 기상 지표, 시간 지표, MODIS(중해상도 영상 분광계) 화재 계수 지표의 입력이 포함됩니다. 각 단계마다 알고리즘은 타임스탬프를 정렬하고, 누락값을 처리하며, 이상치를 필터링하고, 데이터를 정규화하고, 특징을 설계했습니다. 최종 예측 변수는 CorrXGBoost-Rank 과정을 통해 선정되었습니다. 그 후 선택된 특징들은 시간 순서 슬라이딩 창에 배치되어 LSTM(장기 단기 기억) 인코더를 통해 전이 학습을 통해 전달되었습니다. 각 특징과 시간 단계별로 다중 헤드 주의 메커니즘은 결합된 출력을 최종 회귀 밀집층으로 보내기 전에 가중치를 적용하여 PM₂.₅ 예측을 산출합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
교육 및 평가
슬라이딩 윈도우 방식을 사용하여 감독 학습 시퀀스를 형성했습니다. 훈련은 Adam 최적화기와 평균제곱 오차 손실을 사용했습니다(보충표 2). 모델 성능은 RMSE와 R2 를 사용하여 훈련, 검증, 테스트, 교차 검증 파티션 전반에 걸쳐 평가되었습니다. 모델의 아키텍처, 특징 공학, 학습 구성, 데이터 구성, 전이 학습, 평가 지표, 미래 예측, 구현 세부 사항은 보충 표 1에 정리되어 있습니다. 그림 6 은 CORTA-Net PM₂.₅ 예측 모델의 훈련 진단을 나타냅니다. 패널에서 그림 6A 는 훈련 및 검증 손실 곡선을 나타내며, 점진적으로 오류 감소를 보여주며, 최적 종료는 106에서 이루어집니다. 과적합 분석 평가 중 일반화 격차의 진화는 그림 6B에서 검증과 훈련 데이터 간의 차이로 잘 드러납니다. 특히, 발산이 사전에 정의된 한계를 초과하는 기간을 보여준다; 이 정보는 학습률 행동과 손실 감소 패턴이 임계 시기에 계획된 학습률(LR) 감소가 수렴 안정성을 향상시키는 수단으로서 이점을 잘 보여준다는 증거를 제공합니다. 이 수치들은 모형의 학습 역학, 일반화 능력 및 권장 훈련 구성을 요약합니다.

그림 6: CORTA-Net PM₂.₅ 예측 모델의 학습 진단. (A) 모델 학습 중 오류가 점진적으로 감소하는 학습 및 검증 손실 곡선, 검증 성능에 기반한 에포크 106에서 조기 중단을 보여줍니다. (B) 시대별 훈련과 검증 손실 사이의 일반화 격차, 모델 일반화의 진화와 잠재적 과적합을 나타내는 발산 증가 시기를 보여준다. (C) 학습률 일정: 훈련 전반에 걸쳐 최적화에 미치는 학습률 감소의 영향을 보여줍니다. (D) 모델 수렴 동작 요약, 안정적인 최적화 및 CORTA-Net 모델에 선택된 최종 훈련 구성을 시연함. 이 진단들은 함께 모델의 동역학, 수렴 특성, 그리고 훈련 중 일반화 성능을 보여줍니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
특징 선택 및 예측 결과
CorrXGBoost-Rank 절차는 지연된 PM₂.₅, 풍속, 습도, 온도, 시간 지표, MODIS 산불 등 다양한 변수를 대기질 예측의 중요한 변수로 선정했습니다. 이 각 변수는 오염의 지속 여부, 기상 조건에 의한 확산, 계절별 오염 수준 차이, 산불로 인한 지역적 영향 등을 설명합니다. 불필요한 입력 차원을 줄이기 위해 중복 변수는 시퀀스 모델링 전에 제거되었습니다. CORTA-Net은 평균 절대 오차, 평균평균근 오차, 결정 계수를 사용하여 평가되었습니다. 델리 일일 데이터셋에서 모델은 RMSE = 3.19, R2 = 0.983을 달성했습니다. 데일리 델리 기후 훈련 분할에서 모델은 RMSE = 4.98, R2 = 0.845를 달성했습니다. 대상 테스트 세트 산란 분석에서 관찰 및 예측된 PM₂.₅ 값은 Pearson r = 0.942, R2...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
CORTA-Net은 세 가지 핵심 구성 요소를 연속적으로 결합하여 하이브리드 아키텍처를 형성합니다. CorrXGBoost-Rank: 시간 모델링38단계 이전에 중복 예측 변수를 제거하는 맞춤형 특징 선택 구성 요소입니다. LSTM 인코더: 선택한 24시간 입력 시퀀스39에서 단기 및 장기 시간 의존성을 캡처하기 위해 스택된 LSTM 계층을 사용합니다. 다중 헤드 주의 계층: CORTA-Net 하이브리드 시퀀스 모델의 마지막 단계의 일부로 LSTM 출력(관련 주의 가중치)에 적용됨; 최종 출력의 해석 가능성을 높이면서도 주 LSTM 백본40의 역할을 대체하지 않습니다. LSTM 인코더는 선택된 슬라이딩 윈도우 시퀀스로부터 시간적 의존성을 학습합니다. CORTA-Net은 CorrXGBoost-Rank가 중복 예측 변수를 가지치기하는 하이브리드 시...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자들은 이해 상충이 없습니다.
누라 빈트 압둘라흐만 대학교 연구원 지원 프로젝트 번호 (PNURSP2026R300), 사우디아라비아 리야드 누라 빈트 압둘라흐만 공주.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| Calibri 글꼴 | Microsoft Corporation | URL: https://learn.microsoft.com/en-us/typography/font-list/calibri | 수정된 그림 다이어그램 및 레이블에 대한 기본 활자체로 사용됨. |
| CORTA-Net 그림 생성 스크립트 | 이 CORTA-Net 프로젝트용 사용자 정의 스크립트 | URL: https://github.com/saravagnamahasiva/CORTA-Net | 수정된 레이블과 순서로 간행물 품질의 그림 PDF를 재생성하는 데 사용됨. |
| CORTA_Net_High_Resolution_Images.zip | 사용자 제공 프로젝트 이미지 아카이브 | 카탈로그 번호/RRID: 해당 없음; 로컬 소스 아카이브 | 출처/참조 이미지 세트로 사용되며 그림 식별에 사용됨. |
| GitHub | GitHub, Inc. | URL: https://github.com/ | 프로젝트 코드 및 그림 생성 파일의 의도된 저장소 호스트로 사용됨. |
| Matplotlib | Matplotlib 개발 팀 | RRID: SCR_008624; URL: https://matplotlib.org/ | 차트, 다이어그램, 레이블, 패널 마커 및 벡터 PDF 그림을 다시 그리는 데 사용됨. |
| NumPy | NumPy 개발자 | RRID: SCR_008633; URL: https://numpy.org/ | 재생성된 그림 패널에서 결정론적 배열 및 시뮬레이션된 값에 사용됨. |
| OpenAI Codex | OpenAI | URL: https://openai.com/codex | 코드 편집, 그림 재생성, PDF 패키징 및 검증을 보조하는 데 사용됨. |
| Pillow | Pillow 기여자 | URL: https://python-pillow.org/ | 래스터 이미지 출력을 검사, 크기 조정, 미리 보기 및 유효성 검사하는 데 사용됨. |
| Poppler | Poppler 개발자 / freedesktop.org | URL: https://poppler.freedesktop.org/ | 생성된 PDF를 PNG 미리 보기로 렌더링하여 시각적 품질 검사에 사용됨. |
| pypdf | pypdf 기여자 | URL: https://pypdf.readthedocs.io/ | 각 최종 그림 PDF에 하나의 유효한 페이지가 포함되어 있는지 확인하는 데 사용됨. |
| Python | Python 소프트웨어 재단 | RRID: SCR_008394; URL: https://www.python.org/ | 그림 생성 및 PDF 처리를 위한 프로그래밍 환경으로 사용됨. |
| ReportLab | ReportLab Inc. | URL: https://www.reportlab.com/ | PDF 아티팩트로 필수 자료/도구/소프트웨어 테이블을 작성하는 데 사용됨. |
| Windows PowerShell | Microsoft Corporation | URL: https://learn.microsoft.com/en-us/powershell/ | 파일 오케스트레이션, 아카이브 추출 및 최종 ZIP 패키징 명령에 사용됨. |
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.