제안된 YOLOv11 및 CNN 융합 모델의 생산 라인 안전 모니터링 효율성을 검증하기 위해 다양한 안전 위험 시나리오를 포함하는 데이터셋을 구축하였다. 이 데이터셋은 12,000장의 생산 라인 장면 이미지로 구성되었으며, 고정 랜덤 시드 42를 사용하여 훈련, 검증 및 테스트 세트로 7:1.5:1.5 비율로 나누었다. 데이터셋은 표준 조명, 저조도, 부분 가림, 심한 가림, 모션 블러 및 복잡한 배경을 포함한 다양한 작업 조건을 포괄한다. 추론을 위한 신뢰도 임계값은 0.5로, 비최대 억제(NMS) 임계값은 0.45로 설정하였다. 모든 실험은 3회 반복 수행하였으며, 결과는 평균 ± 표준 편차로 보고하였다. 어노테이션 카테고리는 작업자, 안전모, 로봇 팔, 위험 구역, 도구 및 차량으로 설정하였으며 PASCAL Visual Object Classes (VOC) 형식을 사용하였다. IoU(intersection-over-union) 임계값은 0.5로 설정하였고, 2인 교차 검증을 통해 어노테이션 일관성을 확인하였다. 입력 이미지는 640 × 640으로 균일하게 크기를 조정하였으며 Mosaic 데이터로 증강하였다. 훈련은 초기 학습률 0.01, 모멘텀 0.9, 가중치 감쇠 0.0005, 배치 크기 32의 SGD 옵티마이저를 사용하여 수행하였다. 훈련은 200 에포크(epochs) 동안 진행되었으며, 코사인 어닐링(cosine annealing)을 사용하여 학습률을 조정하였다.
모델의 효과를 철저히 평가하기 위해 다양한 평가 지표가 활용되었습니다: 평균 정밀도(mAP), 이미지 프레임 처리 속도를 측정하기 위한 초당 프레임 수(FPS), 양성 예측의 정확도를 평가하기 위한 정밀도(precision), 진양성을 검출하는 모델의 능력을 측정하기 위한 재현율(recall), 그리고 수신자 조작 특성(ROC) 곡선 아래 면적을 나타내어 모델의 전반적인 분류 능력을 반영하는 곡선 아래 면적(AUC)이 그것입니다. 계산 공식은 식 (4), (5), (6), (7), (8), (9), (10), (11)에 나타나 있습니다:
(4)
(5)
(6)
재현율
(7)
(8)
(9)
(10)
(11)
여기서 mAP@0.5는 IoU 임계값이 0.5일 때의 평균 정밀도 평균(mean average precision)을 나타내며, N은 카테고리의 수, APi는 i번째 카테고리의 평균 정밀도, mAP@[0.5:0.95]는 0.5에서 0.95까지의 IoU 임계값에 대해 계산된 mAP의 평균입니다. TP, FP, FN, TN은 각각 진양성, 위양성, 위음성, 진음성의 수를 나타냅니다. F는 처리된 총 프레임 수, T는 총 처리 시간, TPR은 진양성률, FPR은 위양성률입니다.
YOLOv11 검출 구성 요소의 손실 함수는 수식 (12)에 나와 있습니다:
(12)
여기서 Lcoord는 예측된 프레임과 실제 프레임 사이의 편차를 나타내고, Lconf는 예측된 프레임의 신뢰도 오차를 측정하며, Lclass는 카테고리 예측 오차를 측정합니다. λcoord, λconf 및 λclass는 해당 손실 값들의 균형을 맞추기 위해 사용되는 가중치 계수입니다.
표 1의 데이터를 분석한 결과, 제안된 방법은 mAP@0.5 0.91 및 mAP@0.5:0.95 0.82를 달성하였으며, 이는 YOLOv5와 비교하여 각각 0.04 및 0.04 개선된 수치입니다. F1-score는 0.935로, 이 또한 비교 모델들보다 높습니다. 검출 속도는 120 FPS로 Faster R-CNN보다 4배 빠르지만, YOLOv10 및 YOLOv11보다는 약간 낮습니다. 파라미터 수는 6.7M으로 YOLOv11보다 1.5M 더 많지만, mAP@0.5는 0.03 향상되었습니다. 유사한 계산 비용을 가진 EfficientDet과 비교했을 때, 정확도는 0.06 더 높고 파라미터 수는 56% 더 적습니다. 이러한 데이터는 도입된 다중 규모 융합(multi-scale fusion) 및 어텐션 메커니즘이 소형 타겟 검출 정확도를 효과적으로 향상시켜 속도와 정확도 사이의 적절한 균형을 달성했음을 입증합니다. 요약하자면, 제안된 방법은 검출 정확도와 속도 사이의 균형을 이루었습니다. mAP@0.5는 두 번째로 우수한 모델보다 0.02 더 높고, F1-score는 0.935에 달하며, 6.7M의 파라미터는 실제 배포에 충분한 수준입니다. 다중 규모 융합 및 어텐션 메커니즘은 복잡한 장면에서 소형 및 가려진 타겟의 인식 능력을 향상시킵니다. 이 모델은 정확도와 효율성의 균형을 맞추어 산업 안전 모니터링과 같은 실시간 시나리오에 적합합니다. 참고로, 모든 비교 모델은 공식 사전 학습된 가중치를 사용하였으며, 입력 해상도는 640 × 640, NMS 임계값은 0.45, 신뢰도 임계값은 0.5로 통일하였습니다.
| 방법 | mAP@0.5 | mAP@0.5:0.95 | F1-스코어 | 초당 프레임 수 | 매개변수 (M) |
| YOLOv5 | 0.87 | 0.78 | 0.89 | 130 | 7.1 |
| EfficientDet | 0.85 | 0.73 | 0.88 | 50 | 15.3 |
| RetinaNet | 0.82 | 0.68 | 0.85 | 45 | 37.6 |
| Faster R-CNN | 0.84 | 0.7 | 0.87 | 30 | 45.2 |
| YOLOv10 | 0.89 | 0.77 | 0.88 | 135 | 5.3 |
| YOLOv11 | 0.88 | 0.75 | 0.895 | 140 | 5.2 |
| 저희의 것 | 0.91 | 0.82 | 0.935 | 120 | 6.7 |
표 1: 모델 성능의 종합 비교표. 데이터 분석 결과, 제안된 방법은 mAP@0.5 0.91 및 mAP@0.5:0.95 0.82를 달성하여 YOLOv5 대비 각각 0.04 및 0.04의 향상을 보였습니다. F1-score는 0.935로, 이 또한 비교 모델들보다 높습니다. 검출 속도는 120 FPS로 Faster R-CNN보다 4배 빠르지만, YOLOv10 및 YOLOv11보다는 약간 낮습니다. 파라미터 수는 6.7M으로 YOLOv11보다 1.5M 더 많지만, mAP@0.5에서는 0.03의 향상이 있었습니다. 연산 비용이 유사한 EfficientDet과 비교했을 때, 정확도는 0.06 더 높고 파라미터 수는 56% 더 적습니다. 이러한 데이터는 도입된 다중 스케일 융합 및 어텐션 메커니즘이 소형 타겟 검출의 정확도를 효과적으로 높여, 속도와 정확도 사이의 우수한 균형을 달성했음을 입증합니다. 요약하자면, 본 연구에서 제안한 방법은 검출 정확도와 속도 사이의 균형을 달성했습니다. mAP@0.5는 두 번째로 우수한 모델보다 0.02 더 높고, F1-score는 0.935에 도달했으며, 6.7M의 파라미터는 실제 배포에 충분한 수준입니다. 다중 스케일 융합 및 어텐션 메커니즘은 복잡한 장면에서 소형 및 가려진 타겟의 인식을 향상시킵니다. 이 모델은 정확도와 효율성의 균형을 맞추어 산업 안전 모니터링과 같은 실시간 시나리오에 적합합니다. 참고로, 모든 비교 모델은 공식 사전 학습된 가중치를 사용하였으며, 입력 해상도는 640 × 640, NMS 임계값은 0.45, 신뢰도 임계값은 0.5로 통일하였습니다.
그림 2는 모델의 오탐지 유형에 대한 심층 분석을 제공합니다. YOLOv11 + CNN은 배경 오탐지율이 가장 낮았으며(10,000 프레임당 85회), 대부분의 오탐지는 유사한 객체(62회)와 부분적으로 가려진 장면(48회)에서 발생했습니다. ROC 곡선 분석 결과, FPR 0.1에서 모델의 TPR은 0.9(AUC = 0.98)에 도달했으며, 곡선 간의 간격이 가장 좁게 나타나 탐지 신뢰도가 매우 높음을 뒷받침합니다. 이러한 분석 결과는 모델의 성능을 입증할 뿐만 아니라, 특히 유사 객체 식별 능력을 강화함으로써 향후 오탐지 최적화를 위한 명확한 기술적 로드맵을 제시합니다.

그림 2. 오차 분석. 모델의 오탐지 유형 분석. YOLOv11 + CNN은 배경 오탐지율이 가장 낮았으며(10,000 프레임당 85회), 오탐지의 대부분은 유사한 객체(62회)와 부분적으로 가려진 장면(48회)에 집중되었다. ROC 곡선 분석 결과, FPR 0.1에서 모델의 TPR은 0.9(AUC = 0.98)에 도달했으며, 곡선 간의 간격이 가장 좁게 나타나 탐지 신뢰도의 타당성을 뒷받침한다. 이러한 분석 결과는 모델의 성능을 입증할 뿐만 아니라, 특히 유사 객체 구분 능력을 강화함으로써 향후 오탐지 최적화를 위한 명확한 기술적 로드맵을 제공한다. 여기를 클릭하여 이 그림의 더 큰 버전을 확인하십시오.
그림 3은 다양한 하드웨어 플랫폼에서의 모델 성능을 비교한 것입니다. YOLOv11 + CNN은 Edge tensor processing unit (TPU)에서 ±2 ms의 낮은 변동폭과 함께 18 ms의 초저지연 시간을 달성하였으며, 전력 소비는 15 W로 제어되었습니다. 처리량 테스트 결과, 본 모델은 Jetson Xavier 엣지 컴퓨팅 장치에서 70 FPS의 처리 속도를 달성하였으며, 99백분위수 지연 시간은 50 ms 이내로 제어되었습니다. 이러한 배포 성능 지표를 통해 산업 분야의 다양한 컴퓨팅 플랫폼 배포 요구 사항에 적응할 수 있습니다. 오차 분석 결과, 본 모델은 자원이 제한된 환경에서도 안정적인 성능을 유지할 수 있어 공학적 적용 가능성을 입증하였습니다.

그림 3. 배포 성능. 다양한 하드웨어 플랫폼에서의 모델 성능 비교. YOLOv11 + CNN은 Edge TPU에서 18 ms의 초저지연 시간(변동 폭 ±2 ms)을 달성하였으며, 전력 소비는 15 W로 제어되었습니다. 처리량 테스트 결과, 해당 모델은 Jetson Xavier 엣지 컴퓨팅 장치에서 70 FPS의 처리 속도를 달성하였으며, 99분위 지연 시간은 50 ms 이내로 제어되었습니다. 이러한 배포 성능 지표는 본 모델이 산업 현장의 다양한 컴퓨팅 플랫폼 배포 요구 사항에 적응할 수 있음을 나타냅니다. 오류 분석 결과, 모델이 자원 제한 환경에서도 안정적인 성능을 유지할 수 있음을 보여주어 공학적 적용 가능성을 입증하였습니다. 여기를 클릭하여 이 그림의 더 큰 버전을 확인하십시오.
그림 4는 6가지 대상 카테고리에 따른 각 모델의 검출 성능 차이를 비교합니다. YOLOv11 + CNN은 안전모 인식 작업에서 0.96의 정확도를 달성하여 벤치마크 모델보다 4%포인트 높은 성능을 보였습니다. 점 도표는 모델이 카테고리 간 성능 변동이 최소한(±0.05)임을 나타내며, 이는 모델의 일반화 능력을 반영합니다. 히트맵으로 표시된 혼동 행렬을 보면 위험 구역과 로봇 팔 사이에 15%의 상호 오검출이 발생함을 알 수 있습니다. 이러한 결과는 향후 모델 최적화를 위한 명확한 방향을 제시합니다.

그림 4. 카테고리 탐지 분석. 6개 대상 카테고리에 걸친 각 모델의 탐지 성능 차이 비교. YOLOv11 + CNN은 안전모 인식 작업에서 0.96의 정확도를 달성하여 벤치마크 모델보다 4%포인트 더 높은 성능을 보였다. 점 도표는 모델이 카테고리 간에 최소한의 성능 변동(±0.05)을 보임을 나타내며, 이는 모델의 일반화 능력을 반영한다. 히트맵으로 제시된 혼동 행렬은 위험 구역과 로봇 팔 사이에 15%의 상호 오탐지가 발생함을 보여준다. 이 결과는 향후 모델 최적화를 위한 명확한 방향성을 제공한다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
그림 5는 각 모델의 학습 과정에 대한 종합적인 기록을 제공합니다. YOLOv11 + CNN은 30 epoch 이내에 손실(loss)이 0.1까지 떨어지며 가장 빠른 수렴 속도를 보였으며, 검증 세트의 mAP 곡선과 학습 세트 간의 격차는 지속적으로 1% 미만을 유지했습니다. 오차 범위 플롯 분석 결과, 모델의 최종 검증 mAP@0.5는 0.94 ± 0.01로 안정적이었으며, 성능 변동 범위는 RetinaNet의 3분의 1 수준에 불과했습니다. 이러한 결과는 공동 학습 프로토콜의 효과를 뒷받침합니다. 해당 모델은 학습 초기 단계에서 성능 우위를 보였으며, 이는 모델의 구조적 설계가 신속한 특징 학습을 가능하게 함을 나타냅니다.

그림 5훈련 과정 분석. 각 모델의 학습 과정 기록입니다. YOLOv11 + CNN은 가장 빠른 수렴 속도를 보이며(30 에포크 이내에 손실 값이 0.1로 감소), 검증 세트의 mAP 곡선과 학습 세트 간의 간격이 항상 1% 미만으로 유지됩니다. 오차 범위 도표(error band plot) 분석 결과, 모델의 최종 검증 mAP@0.5는 0.94 ± 0.01로 안정적이며, 성능 변동 범위는 RetinaNet의 3분의 1 수준에 불과합니다. 이러한 결과는 공동 학습 프로토콜의 효과를 뒷받침합니다. 해당 모델은 학습 초기 단계에서 성능 우위를 보이며, 이는 모델의 구조적 설계 덕분에 특징을 빠르게 학습할 수 있음을 나타냅니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.
표 2는 복잡한 환경에서 다양한 검출 모델의 정량적 성능 결과를 보여줍니다. 표준 조명 조건 및 다양한 극한 시나리오에 걸친 테스트 데이터에 따르면, YOLOv11 + CNN이 모든 조건에서 최적의 성능을 유지하는 것으로 나타났습니다. 표준 조명 조건에서 이 모델의 mAP@0.5는 0.91에 달해, YOLOv5 (0.87) 및 Faster R-CNN (0.84)보다 유의미하게 우수했습니다. 환경 조건이 악화됨에 따라 각 모델의 성능이 다양한 정도로 감소하지만, YOLOv11 + CNN은 가장 강력한 환경 강건성을 보여줍니다. 저조도 조건 (< 50 lux)에서 성능 감소폭은 3% (0.88까지)에 불과하여, 비교 모델의 5% 감소보다 우수했습니다. 심한 폐색 시나리오 (> 50%)에서도 mAP를 0.78로 유지할 수 있었으며, 성능 저하율 (13%)은 YOLOv5 (15%) 및 Faster R-CNN (16%)보다 현저히 낮았습니다. 이러한 결과는 YOLOv11 + CNN이 개선된 특징 융합 및 어텐션 메커니즘을 통해 조명 변화 및 폐색과 같은 복잡한 요인에 대한 모델의 적응력을 향상시켰으며, 이를 통해 산업 현장에서의 실제 적용 가능성을 뒷받침한다는 것을 입증합니다.
| 시험 조건 | YOLOv11 + CNN | YOLOv5 | Faster R-CNN | 성능 변동 |
| 표준 조명 | 0.91 | 0.87 | 0.84 | 0.01 |
| 저조도 (< 50 럭스) | 0.88 (-3%) | 0.82 (-5%) | 0.79 (-5%) | 0.02 |
| 부분 폐쇄 (30%–50%) | 0.85 (-6%) | 0.80 (-7%) | 0.76 (-8%) | 0.03 |
| 심한 폐쇄 (> 50%) | 0.78 (-13%) | 0.72 (-15%) | 0.68 (-16%) | 0.04 |
| 모션 블러 | 0.83 (-8%) | 0.77 (-10%) | 0.73 (-11%) | 0.05 |
표 2: 환경 적응성에 대한 정량적 분석 표. 정량적 분석을 통해 복잡한 환경에서 각 검출 모델의 성능을 평가하였다. 표준 조명 조건부터 다양한 극한 시나리오까지의 테스트 데이터에 따르면, YOLOv11 + CNN이 모든 테스트 조건에서 가장 높은 성능을 유지하는 것으로 나타났다. 표준 조명 조건에서 이 모델의 mAP@0.5는 0.91에 달해, YOLOv5 (0.87) 및 Faster R-CNN (0.84)보다 유의미하게 우수한 성능을 보였다. 환경 조건이 악화됨에 따라 각 모델의 성능이 다양한 정도로 감소하였으나, YOLOv11 + CNN은 평가된 모델 중 가장 강력한 환경 강건성을 나타냈다. 저조도 조건 (< 50 lux)에서 성능 감소폭은 3% (0.88로 감소)에 불과하여, 비교 모델의 5% 감소보다 우수했다. 심한 폐쇄 시나리오 (> 50%)에서도 mAP를 0.78로 유지하였으며, 성능 저하율 (13%)은 YOLOv5 (15%) 및 Faster R-CNN (16%)보다 유의미하게 낮았다. 이러한 결과는 YOLOv11 + CNN이 개선된 특징 융합 메커니즘과 어텐션 설계를 통해 조명 변화 및 폐쇄 간섭과 같은 복잡한 요인에 대한 모델의 적응성을 향상시켰음을 입증하며, 산업 현장에서의 실질적인 적용 가능성을 뒷받침한다.
표 3은 본 실험에서 SGD 옵티마이저가 사용되었으며, 수렴을 가속화하고 진동을 억제하기 위해 0.9의 모멘텀이 적용되었음을 보여줍니다. 초기 학습률은 0.01로 설정하고 코사인 어닐링(cosine annealing)을 사용하여 훈련 과정 동안 점진적으로 감소시켜 최적화를 정교화했습니다. L2 정규화를 적용하고 과적합을 줄이기 위해 0.0005의 가중치 감쇠(weight decay)를 도입했습니다. 배치 크기는 32로 설정하여 계산 효율성과 그래디언트 추정 안정성 사이의 균형을 맞추었습니다. 200회의 훈련 에포크(epoch)를 통해 충분한 수렴을 보장했습니다. 이러한 파라미터들은 단일 단계 검출 작업에 맞게 조정되어 훈련 속도와 정확도의 균형을 이루었습니다.
| 매개변수 | 값 |
| 최적화 도구 | 확산 구배 분배(SGD) |
| 초기 학습률 | 0.01 |
| 운동량 | 0.9 |
| 가중치 감쇠 | 0.0005 |
| 배치 크기 | 32 |
| 훈련 에포크 | 200 |
| 학습률 스케줄링 | 코사인 어닐링 |
표 3: 학습 하이퍼파라미터 표. 본 실험에서는 수렴을 가속화하고 진동을 억제하기 위해 모멘텀 0.9의 SGD 옵티마이저를 사용하였다. 초기 학습률은 0.01로 설정하고 코사인 어닐링(cosine annealing)을 적용하여 학습 과정 동안 점진적으로 감소시켜 최적화를 정밀하게 수행하였다. L2 정규화를 적용하고 과적합을 줄이기 위해 0.0005의 가중치 감쇠(weight decay)를 도입하였다. 배치 크기는 32로 설정하여 계산 효율성과 그래디언트 추정 안정성 사이의 균형을 맞추었다. 200회의 학습 에포크(epoch)를 통해 충분한 수렴을 보장하였다. 파라미터들은 학습 속도와 정확도의 균형을 맞추어 단일 단계 검출 작업에 맞게 조정되었다.
표 4는 YOLOv11을 베이스라인으로 사용했을 때 mAP@0.5가 0.89임을 보여줍니다. 다중 스케일 융합(multi-scale fusion)만 도입했을 때는 정확도가 0.88로 감소합니다. 여기에 채널 어텐션(channel attention)과 공간 어텐션(spatial attention)을 순차적으로 추가로 적용하면 정확도가 각각 0.90과 0.89로 향상됩니다. 모든 모듈을 결합했을 때의 정확도는 0.91에 도달하며, 이는 베이스라인 대비 0.02 향상된 수치입니다. 해당 데이터는 채널 어텐션이 정확도를 직접적으로 향상시키며, 다중 스케일과 어텐션을 결합한 성능이 최적임을 보여줍니다.
| 구성 | mAP@0.5 |
| YOLOv11 (기준 모델) | 0.89 |
| + 다중 규모 융합 | 0.88 |
| + 다중 스케일 + 채널 어텐션 | 0.9 |
| + 다중 스케일 + 공간 주의 집중 | 0.89 |
| 전체 모듈 (YOLOv11 + CNN) | 0.91 |
표 4: 제거 실험 표. YOLOv11을 베이스라인으로 사용했을 때 mAP@0.5는 0.89입니다. 다중 스케일 융합(multi-scale fusion)만 도입하면 정확도가 0.88로 감소합니다. 다중 스케일 융합 후 채널 어텐션(channel attention) 또는 공간 어텐션(spatial attention)을 추가하면 정확도가 각각 0.90과 0.89로 향상됩니다. 모든 모듈을 결합한 정확도는 0.91에 도달하며, 이는 베이스라인 대비 0.02 향상된 수치입니다. 데이터에 따르면 본 설정에서는 채널 어텐션이 공간 어텐션보다 더 큰 이득을 제공하며, 다중 스케일 융합과 어텐션을 결합한 성능이 가장 최적임을 보여줍니다.
그림 6은 극한 환경에서 모델의 성능을 체계적으로 평가한 결과입니다. 저조도 조건에서 YOLOv11 + CNN의 mAP는 6%만 감소하여 0.88을 기록했으며, 심한 가림 현상이 있는 장면에서도 0.78의 mAP를 유지하여 벤치마크보다 8% 높은 성능을 보였습니다. 이러한 결과는 해당 모델이 환경 적응성을 갖추고 있으며, 산업 생산 현장에서 흔히 발생하는 조명 변화 및 국부적 가림 문제를 효과적으로 해결함으로써 검출 시스템의 안정적인 작동을 지원함을 입증합니다.

그림 6. 환경 적응성. 극한 환경에서의 모델 성능에 대한 체계적인 평가. 저조도 조건에서 YOLOv11 + CNN의 mAP는 단 6%만 하락하여 0.88을 기록했으며, 심한 폐색이 있는 장면에서도 0.78의 mAP(벤치마크 대비 8% 높음)를 유지했다. 이러한 결과는 본 모델이 환경 적응성을 갖추고 있어 산업 생산 현장에서 흔히 발생하는 조명 변화 및 국소적 폐색 문제를 효과적으로 해결하며, 이를 통해 검출 시스템의 안정적인 운용을 지원함을 입증한다. 여기를 클릭하여 이 그림의 더 큰 버전을 확인하십시오.
그림 7은 t-SNE 차원 축소를 통해 6가지 유형의 산업 대상물에 대한 YOLOv11과 YOLOv11 + CNN의 특성 분포 차이를 비교한 것입니다. 왼쪽 그림을 보면 기본 모델인 YOLOv11의 특성이 상당한 클래스 내 분산(클래스 내 거리 2.34 ± 0.15)을 보이며, 특히 "Danger Zone"(빨간색)과 "Vehicle"(보라색)에서 상당한 중첩이 나타나는데, 이는 실험군 3의 오탐지율 15%와 일치합니다. 오른쪽 그림은 개선된 YOLOv11 + CNN이 특성 강화 모듈을 통해 클래스 내 응집력을 유의미하게 향상시켜, 각 카테고리 내 클러스터 중심 간의 평균 거리를 1.8배 증가시켰음을 보여줍니다.

그림 7. t-SNE 특성 분포 비교. t-SNE 차원 축소를 통한 6가지 유형의 산업 대상물에 대한 YOLOv11과 YOLOv11 + CNN의 특성 분포 차이 비교. 왼쪽 그림은 기본 모델인 YOLOv11의 특성이 상당한 클래스 내 분산(클래스 내 거리 2.34 ± 0.15)을 보이며, 특히 "Danger Zone"(빨간색)과 "Vehicle"(보라색)에서 상당한 중첩이 나타남을 보여주며, 이는 실험군 3의 15% 오탐지율과 일치한다. 오른쪽 그림은 개선된 YOLOv11 + CNN이 특성 강화 모듈을 통해 클래스 내 응집도를 유의미하게 향상시켰으며, 각 카테고리별 클러스터 중심 간의 평균 거리가 1.8배 증가했음을 보여준다. 여기를 클릭하여 이 그림의 더 큰 버전을 확인하십시오.
그림 8은 체계적인 절제 실험(ablation experiments)을 통해 각 모듈의 기여도를 검증합니다. 절제 실험 결과, 다중 스케일 융합 후 채널 어텐션을 추가하면 mAP@0.5가 0.90으로 증가하며, 공간 어텐션을 추가하면 mAP@0.5가 0.89로 증가하는 것으로 나타났습니다. 전체 모듈을 적용했을 때 가장 높은 0.91의 mAP@0.5를 달성했습니다. 히트맵 시각화 결과, 복합 어텐션 메커니즘이 위험 구역의 중심(활성화 값: +0.15)과 가장자리의 작은 타겟(+0.08)에 대한 탐지 응답을 동시에 강화할 수 있음을 보여줍니다. 실험 데이터는 다중 스케일 특징 융합과 어텐션 메커니즘이 누적 효과를 가지며, 이를 통해 모델이 다양한 스케일에서의 타겟 탐지 요구 사항을 충족할 수 있음을 입증합니다.

그림 8모듈형 제거 실험. 체계적인 어블레이션 실험을 통해 각 모듈의 기여도를 검증하였다. 어블레이션 결과, 다중 스케일 융합 이후에 채널 어텐션을 추가하면 mAP@0.5가 0.90으로 증가하며, 공간 어텐션을 추가하면 mAP@0.5가 0.89로 증가하는 것으로 나타났다. 전체 모듈을 적용했을 때 가장 높은 mAP@0.5 수치인 0.91을 달성하였다. 히트맵 시각화 결과, 복합 어텐션 메커니즘이 위험 구역의 중심(활성화 값: +0.15)과 가장자리의 소형 타겟(+0.08)에 대한 검출 응답을 동시에 강화할 수 있음을 보여준다. 실험 데이터는 다중 스케일 특징 융합과 어텐션 메커니즘이 누적 효과를 가지며, 이를 통해 모델이 다양한 스케일에 걸쳐 타겟 검출 요구사항을 충족할 수 있음을 입증한다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.
데이터 가용성:
전체 원본 생산 라인 이미지 및 비디오 스트림은 산업 기밀 제한 대상이므로 공개적으로 배포되지 않습니다. 보충 데이터셋 설명(Supplemental File 1)에서 데이터셋 획득 세부 사항, 카테고리 및 시나리오 분포, 어노테이션 사양, 품질 관리 절차, 데이터 분할, 전처리 및 증강 절차를 제공합니다. 의사코드 및 재현성 프레임워크(Supplemental File 2)에서는 의사코드 수준의 워크플로우, 구성 설명 및 재현을 위한 가이드를 제공합니다. 비상업적 학술 연구를 위해 익명화된 하위 집합 및 추가 지원 자료를 교신 저자에게 요청할 수 있으며, 이는 기관 및 기밀 제한 사항을 따릅니다.
보충 파일 1. 보충 데이터셋 설명. 이 파일은 데이터셋 획득 프로토콜, 시나리오 범위, 클래스 분포, 어노테이션 사양, 품질 관리 절차, 훈련/검증/테스트 분할, 전처리 및 증강 절차를 설명합니다. 이 파일을 다운로드하려면 여기를 클릭하십시오.
보충 파일 2. 슈도코드 및 재현성 프레임워크. 이 파일은 전처리, 학습, 평가 및 배포를 위한 슈도코드 수준의 워크플로우와 구성 세부 사항을 제공하며, 원본 산업 영상에 대한 제한 사항 및 지원 자료에 대한 접근 방법을 설명합니다. 이 파일을 다운로드하려면 여기를 클릭하십시오.