방법 논문

딥러닝 기반 객체 검출 및 특징 향상을 이용한 실시간 생산 라인 안전 모니터링

36 조회수

DOI:

10.3791/70968

2026년 8월 21일

이 논문에서

요약

본 논문은 You Only Look Once 버전 11 (YOLOv11)과 합성곱 신경망(convolutional neural networks)을 통합한 생산 라인 안전 모니터링 방법을 제안합니다. 이 방법은 그래픽 처리 장치(graphics processing unit)에서 0.5 intersection-over-union 임계값에서의 평균 정밀도 평균(mAP@0.5) 0.91, mAP@0.5:0.95 0.82, 초당 120 프레임을 달성하여 평가된 베이스라인 모델들보다 우수한 성능을 보였습니다.

초록

Industry 4.0가 심화됨에 따라 생산 라인의 자동화 및 지능화 수준이 크게 향상되었으며, 이에 따라 모니터링의 실시간 성능, 정확도 및 안전성에 대한 요구사항이 높아졌습니다. 수동 점검이나 단순 임계값 기반 결정에 의존하는 기존 모니터링 시스템은 일반적으로 응답 시간이 느리고 오경보율이 높으며 지능 수준이 제한적이라는 단점이 있습니다. 따라서 본 논문에서는 You Only Look Once version 11 (YOLOv11)과 합성곱 신경망 (CNN)을 결합한 생산 라인 안전 모니터링 시스템을 제안합니다. 먼저, 획득한 이미지를 전처리하였습니다. 그 다음, YOLOv11을 사용하여 작업자, 장비 및 잠재적 위험 요소를 실시간으로 식별하였습니다. 이어서, 작고 가려진 대상에 대한 특징 추출 능력을 향상시키기 위해 다중 스케일 특징 융합 및 어텐션 메커니즘이 적용된 강화된 CNN 네트워크를 도입하였습니다. 마지막으로, 탐지 결과를 CNN 강화 특징과 융합하여 안전 상태를 평가하였습니다. 자체 구축한 생산 라인 안전 데이터셋을 사용하여 실험을 수행하였으며, 모멘텀 0.9인 확률적 경사 하강법 (SGD) 최적화 도구, 초기 학습률 0.01, 가중치 감쇠 0.0005, 코사인 어닐링 학습률 조정, 배치 크기 32 및 200 epoch 학습을 적용하였습니다. 평가 기준 알고리즘과의 비교를 위한 평가 지표로는 mAP@0.5 및 초당 프레임 수 (FPS)의 탐지 속도를 사용하였습니다. 결과적으로 제안된 시스템은 0.91의 mAP@0.5와 120 FPS의 탐지 속도를 달성하였습니다. 또한 음영 및 다양한 조명과 같은 복잡한 조건에서도 강건한 성능을 보여주어, 생산 라인 안전 모니터링에서의 효과와 실제 적용 가능성을 입증하였습니다.

서론

현대 산업 생산에서 안전은 생산 효율성과 인원 복지를 보장하는 초석입니다. 생산 라인 환경은 일반적으로 고속 기계 장비, 복잡한 기술 공정, 그리고 여러 과업이 포함된 협업 작업으로 구성됩니다. 아주 작은 잠재적 안전 위험 요소라도 심각한 생산 사고로 이어져 상당한 경제적 손실과 심지어 인명 피해를 초래할 수 있습니다. 따라서 산업 생산의 안전성을 향상시키기 위해 효율적이고 지능적인 실시간 안전 모니터링 시스템을 구축하는 것이 매우 중요합니다1,2.

전통적인 안전 모니터링 방법은 주로 수동 비디오 감시와 다양한 센서(적외선, 연기 및 진동 센서 등)3에 의존합니다. 수동 모니터링은 효율성이 떨어질 뿐만 아니라, 모니터링 인원의 피로로 인해 탐지 누락이 발생하기 쉽고, 지속적이고 포괄적인 커버리지를 제공할 수 없습니다. 센서는 일정 수준의 조기 경보 기능을 제공할 수 있지만, 탐지 범위가 제한적이고 환경적 간섭에 민감하여 오경보라는 두드러진 문제가 발생합니다4. 이에 따라 지능형 모니터링 시스템이 점점 더 연구의 중심이 되고 있습니다. 딥러닝 알고리즘을 사용하여 비디오 스트림을 실시간으로 분석하면 이상 이벤트, 불안전한 행동 및 잠재적 위험을 자동으로 식별할 수 있으며, 이를 통해 모니터링 시스템의 지능을 크게 향상시킬 수 있습니다4,5.

객체 탐지는 지능형 모니터링의 핵심 기술입니다. 1단계 객체 탐지기의 대표 주자인 You Only Look Once (YOLO) 시리즈 알고리즘은 상당한 강점을 보여줍니다. YOLOv1부터 YOLOv8에 이르기까지, 이 알고리즘 모음은 네트워크 아키텍처, 손실 함수 및 학습 방법론 등 여러 측면에서 지속적인 발전을 거듭해 왔습니다6,7. 특히 YOLOv11은 복잡한 배경과 밀집된 타겟에 직면했을 때도 높은 프레임 속도를 유지하면서 더 높은 탐지 정확도를 달성했습니다8.

하지만 일반적인 객체 검출 작업에서의 우수한 성능에도 불구하고, YOLOv11은 특정 생산 라인 안전 모니터링 시나리오에서 여전히 어려움에 직면해 있습니다9. 예를 들어, 작업자가 장비에 의해 부분적으로 가려지거나 안전 표지판이 작고 배경색과 매우 유사한 경우 YOLOv11의 검출 정확도가 감소할 수 있습니다. 이를 위해서는 모델이 더 강력한 특징 추출 및 의미론적 이해 능력을 갖추어야 합니다10.

합성곱 신경망(Convolutional neural networks, CNNs)은 이미지 특징 추출 분야에서 강력한 성능을 가지고 있습니다11. 더 깊고 복잡한 네트워크 구조를 설계함으로써, CNN은 더 풍부하고 추상적인 이미지 특징을 학습할 수 있습니다. CNN을 YOLOv11과 결합하면 YOLOv11의 빠른 탐지 능력과 CNN의 심층 특징 추출 기능을 활용할 수 있어, 더욱 견고하고 지능적인 안전 모니터링 시스템을 구축할 수 있습니다.

이를 바탕으로, 본 논문은 YOLOv11과 CNN을 이용한 생산 라인 안전 모니터링 시스템을 제안합니다. 본 연구의 혁신적인 측면은 다음과 같습니다: (1) YOLOv11과 개선된 CNN의 딥 퓨전 아키텍처를 제안함; (2) 주요 안전 특성의 인식 능력을 향상시키기 위해 다중 스케일 특징 퓨전 및 복합 어텐션 메커니즘을 도입함; (3) 자체 구축한 복잡한 장면 데이터셋을 통해 모델의 성능 우위를 검증함.

YOLO 시리즈 알고리즘의 발전
2015년 Redmon 등에 의해 처음 소개된 이후12, You Only Look Once (YOLO) 알고리즘은 상당한 관심을 끌었습니다. 영역 제안(region proposals)에 의존하는 2단계 검출기와 달리, YOLO는 객체 검출을 회귀 작업으로 처리합니다. 이미지 내 객체의 클래스와 위치를 직접 예측함으로써 YOLO는 검출 속도를 현저히 높였으며, 이를 통해 실시간 사용에 적합하게 되었습니다13.

이 시리즈의 선구적인 연구로서, YOLOv1은 최초로 엔드투엔드 대상 검출을 구현하였습니다.14YOLOv1은 입력 이미지를 그리드 구조로 분할하는 방식을 포함하며, 여기서 각 그리드 셀은 일반적으로 다음과 같이 배치됩니다. S × S 형식은 그 경계 내에 들어오는 객체를 검출하는 작업을 수행합니다.

구체적으로, YOLOv1의 출력은 텐서입니다. S × S × (B × 5 + C) 중에서, 각 바운딩 박스의 예측은 중심점 좌표(x,y), 너비 w, 높이 h, 그리고 신뢰도 c의 5개 요소로 구성됩니다. 계산 과정은 식 (1)에 나타나 있습니다:
객체 검출 분석을 위한 확률 및 IoU(Intersection over Union) 공식.   (1)

그중 Pr(Object)는 그리드 내에 타겟이 존재할 확률을 나타내며, IOU는 예측된 바운딩 박스와 실제 정답(ground-truth) 박스 사이의 교집합 영역을 합집합 영역으로 나눈 비율을 나타냅니다. 또한 각 그리드는 타겟이 존재할 때 해당 타겟이 i번째 클래스에 속할 확률을 나타내는 클래스 확률 세트 Pr 를 예측합니다. YOLOv1의 손실 함수는 좌표 예측 손실, 신뢰도 추정 손실, 카테고리 예측 손실의 세 가지 주요 구성 요소로 이루어져 있습니다15.

YOLOv2는 안정성과 정확도를 향상시키기 위해 Batch Normalization, 고해상도 분류기 및 다중 스케일 훈련 전략을 도입했습니다16. YOLOv3는 Darknet-53를 백본 네트워크로 사용하며, 타겟 검출을 강화하기 위해 Feature Pyramid Network (FPN) 개념에서 영감을 얻었습니다17.

YOLOv4는 YOLOv3를 기반으로 수많은 최적화를 수행하였으며, 모델 성능을 더욱 향상시키기 위해 Cross Stage Partial Network (CSPNet)18, Path Aggregation Network (PANet)19 및 Mosaic 데이터 증강과 같은 기술들을 도입하였습니다. YOLOv5는 더 사용하기 쉽고 효율적인 구현을 제공함으로써 공학적으로 상당한 기여를 하였습니다20.

최근 몇 년 동안 YOLO 시리즈는 YOLOv6, YOLOv7, YOLOv8와 같은 버전들이 잇따라 출시되며 계속해서 진화해 왔습니다. YOLOv7은 확장 효율적 레이어 집계 네트워크(Extended Efficient Layer Aggregation Network, E-ELAN) 구조와 모델 재매개변수화 기술을 도입함으로써 속도와 정확도 모두에서 새로운 돌파구를 마련했습니다. 이러한 향상은 특징 학습의 효율성을 높일 뿐만 아니라 네트워크의 추론 성능을 최적화하여, YOLOv7이 다양한 실시간 객체 탐지 작업에서 이전 버전들과 많은 주류 탐지기들을 능가할 수 있게 했습니다. YOLOv8은 네트워크 구조를 더욱 최적화하고, 앵커 프리(anchor-free) 설계를 채택하여 모델을 단순화하였으며, 일반화 능력을 향상시켰습니다21.

이 연구에 사용된 YOLOv11은 이전 버전들의 장점을 기반으로 복잡한 산업 현장에 최적화되었습니다. 주요 개선 사항으로는 특징 추출 네트워크, 더욱 효율적인 특징 융합 모듈 및 더 견고한 손실 함수 설계가 포함됩니다. 이러한 개선을 통해 YOLOv11은 생산 환경의 폐쇄물, 소형 타겟 및 복잡한 배경을 처리할 때 더 나은 성능을 발휘합니다. YOLOv11은 Ultralytics에서 출시한 YOLO 시리즈의 한 버전입니다. YOLOv8과 비교하여 C3K2 모듈과 특징 융합 경로를 개선하였으며, 적응형 앵커 박스 전략을 도입하여 산업 현장에서 더 강력한 검출 견고성을 제공합니다.

합성곱 신경망(CNN)의 기초 및 발전
합성곱 신경망(CNN)은 컴퓨터 비전 분야에서 딥러닝의 성공에 지대한 영향을 미친 핵심 모델입니다. CNN은 합성곱 연산을 통해 이미지의 지역적 특징을 추출하고, 이후 풀링 연산을 통해 특징의 차원을 축소함으로써 계층적인 이미지 추상화를 구현합니다22.

전형적인 CNN은 여러 개의 합성곱 층, 풀링 층 및 완전 연결 층으로 구성됩니다. 합성곱 층은 합성곱 커널을 사용하여 입력 이미지를 스캔하고, 국소 영역에 대해 내적을 계산하여 특징 맵을 생성합니다. 계산 과정은 식 (2)에 나타나 있습니다:

합성곱 연산 공식 다이어그램; 머신러닝 모델을 위한 수학적 표기법.   (2)

여기서 x는 입력 이미지, wkbk는 각각 컨볼루션 커널의 가중치와 편향이며, 알고리즘에 사용되는 행렬 또는 텐서 연산과 관련되었을 가능성이 있는 수학 식 y_ij^k은 위치 (i,j)에서의 출력 특성 맵 값입니다. 풀링 층은 일반적으로 Max Pooling 또는 Average Pooling을 사용합니다. 완전 연결 층은 특성을 추출하고 분류 확률을 예측하는 역할을 합니다.

이를 바탕으로, 본 논문에서는 YOLOv11을 위한 CNN 특징 강화 모듈을 설계하였으며, 이는 두 개의 병렬 브랜치로 구성됩니다. 하나는 3 × 3 및 5 × 5 컨볼루션 커널을 사용하여 다중 스케일 특징을 추출하는 다중 스케일 컨볼루션 브랜치이며, 다른 하나는 채널 주의 집중(Squeeze-and-Excitation) 및 공간 주의 집중 모듈을 순차적으로 연결하여 주요 타겟의 판별적 특징을 강화하는 주의 집중 브랜치입니다. 두 브랜치의 출력은 요소별 덧셈(element-wise addition)을 통해 융합되며, 이에 해당하는 특징 강화 손실 함수는 식 (3)에 나타나 있습니다.

 손실 함수 조정에 대한 수학적 공식 L=λcoordLcoord+λconfLconf+λclsLcls+λfeatLfeat (3)

Lcoord는 바운딩 박스 좌표 회귀 손실이며, Lconf는 타겟 신뢰도 손실이고, Lcls는 카테고리 분류 손실입니다. Lfeat는 특징 강화 손실로, CNN 강화 모듈에 의해 추출된 소형 타겟 및 가려진 타겟의 판별적 특징을 제한하는 데 사용됩니다. λcoord, λconf, λcls, λfeat는 해당 손실 항의 가중치 계수입니다. 본 작업에서는 λfeat = 0.05로 설정하였으며, 나머지 가중치는 검출 작업 요구 사항에 따라 균형을 맞추었습니다.

VGGNet23 및 ResNet24와 같은 고전적인 CNN 구조는 이미지 분류 작업에서 큰 성공을 거두었습니다. 이러한 아키텍처 중에서 ResNet은 심층 네트워크 학습 시 발생하는 기울기 소실 문제를 효과적으로 완화하여, 더 깊고 복잡한 네트워크 구조를 구축하는 것을 용이하게 합니다.

객체 검출 작업에서 CNN은 일반적으로 특징 추출기(백본)로 사용됩니다. 예를 들어, YOLO 시리즈 알고리즘의 Darknet, cross-stage partial Darknet (CSPDarknet) 등은 모두 CNN을 기반으로 구축되었습니다25. 특징 추출 능력을 향상시키기 위해 연구자들은 수많은 개선된 CNN 구조를 제안해 왔습니다. 예를 들어, Inception 모듈은 다중 스케일 컨볼루션 커널을 통해 병렬로 특징을 추출합니다. DenseNet은 조밀한 연결(dense connections)을 통해 특징 재사용성을 높입니다. Squeeze-and-Excitation Network는 어텐션 메커니즘을 통해 특징 채널의 중요도를 적응적으로 조정합니다26.

본 연구에서는 YOLOv11의 특징 추출 능력을 향상시키기 위해 개선된 CNN 모듈을 설계하였습니다. 이 모듈은 다중 스케일 특징 융합과 어텐션 메커니즘을 결합하여 생산 라인 시나리오의 핵심 안전 정보를 더욱 효과적으로 포착합니다.

산업 안전 모니터링에서의 딥러닝 적용 현황
딥러닝은 산업 안전 모니터링 분야에서 상당한 주목을 받고 있습니다. CNN 기반 알고리즘은 작업자의 안전모 착용 여부 판별, 위험 구역으로의 무단 침입 감지, 그리고 오작동 장비의 상태 모니터링 등에 활용되고 있습니다27.

행동 인식 측면에서는 3D CNN과 순환 신경망을 사용하여 작업자의 작업 행동을 분석하고 잠재적으로 위험한 행동을 식별합니다. 예를 들어, 작업자의 자세 시퀀스를 분석함으로써 안전 작업 절차를 위반하고 있는지 여부를 판단할 수 있습니다28.

YOLO와 Faster R-CNN은 실시간 감시 비디오에서 인원 및 장비 검출을 위해 널리 사용됩니다. 예를 들어, 문헌에서는 YOLOv5 기반의 실시간 헬멧 검출 시스템이 제안되었으며, 이는 건설 현장 안전 관리의 지능화를 효과적으로 향상시켰습니다29.

기존 연구에서 어느 정도 진전이 있었음에도 불구하고, 몇 가지 과제가 남아 있습니다. 첫째, 산업 현장은 일반적으로 복잡한 조명, 가려짐 및 배경 간섭이 특징이며, 이는 알고리즘의 강건성에 엄격한 요구 사항을 부과합니다. 둘째, 실시간 성능이 핵심 요구 사항이며, 알고리즘은 정확도를 유지하면서 고속 추론을 달성해야 합니다. 마지막으로, 기존 연구는 주로 단일 작업 탐지에 집중되어 있으며, 다중 소스 정보 융합 및 종합적 분석에 대한 탐구가 부족한 실정입니다30.

본 연구에서 제안하는 YOLOv11 및 CNN 융합 모델은 특성 추출 및 융합 능력을 강화함으로써 앞서 언급한 문제들을 해결하고, 생산 라인의 안전 위험에 대한 포괄적인 실시간 모니터링을 달성하는 것을 목표로 합니다.

프로토콜

YOLOv11 및 CNN 알고리즘

시스템 전체 아키텍처
본 논문에서 제안하는 생산 라인 안전 모니터링 시스템은 고정밀, 고속 실시간 안전 모니터링을 달성하기 위해 YOLOv11과 개선된 CNN을 결합한 하이브리드 아키텍처를 채택합니다. 그림 1에 나타난 바와 같이, 시스템은 주로 입력 전처리 모듈, YOLOv11 객체 검출 모듈, CNN 특징 강화 모듈 및 융합 결정 모듈로 구성됩니다. 입력 이미지는 먼저 전처리 모듈에 의해 정규화 및 증강되어 모델의 일반화 능력을 향상시킵니다. 이후 CSPDarknet 백본에 의해 특징이 추출되며, spatial pyramid pooling-fast (SPPF) 모듈을 통해 수용 영역(receptive field)이 확장됩니다. 업샘플링 후 다중 스케일 특징이 융합되며, 융합된 특징에 채널 어텐션과 공간 어텐션이 순차적으로 적용되어 주요 타겟의 판별적 표현력을 더욱 강화합니다. CNN 특징 강화 모듈은 YOLOv11 백본 네트워크의 C3, C4, C5 레이어 출력 뒤에 삽입되어 각각 80 × 80 × 256, 40 × 40 × 512, 20 × 20 × 1,024 크기의 다중 스케일 특징 맵을 전달받습니다. CNN 특징 강화 모듈은 작거나 가려진 타겟에 대한 특징 추출을 더욱 강화합니다. 마지막으로 융합 결정 모듈은 YOLOv11의 검출 결과와 CNN 강화 특징을 결합하고, 설계된 손실 함수를 통해 이를 공동 최적화하여 타겟의 정확한 위치, 카테고리 및 신뢰도 점수를 출력합니다.

YOLOv11 검출 프레임워크
YOLOv11은 YOLO 시리즈의 단일 단계 검출 프레임워크가 가진 강점을 활용하여 여러 가지 중요한 개선 사항을 도입했습니다. 해당 아키텍처는 백본 네트워크, 특징 융합 네트워크, 검출 헤드의 세 가지 주요 구성 요소로 나뉩니다. 백본 네트워크는 강화된 CSPDarknet 구조를 사용합니다. 특징 융합 네트워크는 특징 피라미드 네트워크와 경로 집계 네트워크에서 영감을 받아 다중 규모 특징을 효과적으로 병합하기 위해 교차 단계 로컬 연결과 깊이별 분리 컨볼루션을 통합하였습니다.

특징 강화 모듈
특징 강화 모듈은 주요 안전 특징에 대한 모델의 민감도를 향상시키는 것을 목표로 합니다. 이 모듈은 YOLOv11 백본 네트워크의 각 층에서 생성된 특징 맵을 처리하며, 업샘플링 및 다운샘플링 연산을 통해 서로 다른 스케일 간의 정보를 융합합니다. 구체적으로, 다중 스케일 분기는 공간적 스케일의 다양성을 포착하고, 어텐션 분기는 주요 채널과 위치 응답을 동적으로 강화합니다. 이 두 분기는 독립적으로 작동하지 않고 잔차 연결 및 특징 재보정을 통해 상호 보완적으로 융합됩니다. 각 스케일에서 강화 모듈에 의해 처리된 특징 맵은 1 × 1 컨볼루션을 통해 원래 특징 맵의 채널 수와 일치하도록 조정된 후, 요소별 덧셈을 통해 원래의 YOLOv11 특징 맵과 융합됩니다. 이렇게 융합된 특징 맵은 이후 다중 스케일 융합을 위해 특징 피라미드 네트워크(FPN)로 입력되어 계층적 안전 특징 표현을 형성합니다. 모듈 간의 원활한 통합을 보장하기 위해 엔드-투-엔드 공동 학습 전략이 채택되었으며, 손실 함수는 YOLOv11 검출 손실과 CNN 모듈 특징 강화 손실로 구성됩니다.

합성곱 신경망 다이어그램; 이미지 검출 프로세스를 위한 Conv, ELAN, SPPF 모듈 포함.
그림 1YOLOv11-CNN 알고리즘. 특징 강화 모듈은 주요 안전 특징에 대한 모델의 민감도를 증폭시키는 것을 목표로 합니다. 이 모듈은 YOLOv11 백본의 다양한 레이어에서 추출된 특징 맵을 처리하며, 업샘플링 및 다운샘플링 연산을 통해 서로 다른 스케일의 특징들을 융합합니다. 또한, 채널 및 공간 주의 집중 메커니즘을 통합합니다. YOLOv11과 CNN 모듈 간의 원활한 통합을 보장하기 위해 공동 학습 전략이 채택되었습니다. 학습 과정에서 두 모듈의 파라미터는 엔드투엔드로 최적화됩니다. 손실 함수는 YOLOv11의 검출 손실과 CNN 모듈의 특징 강화 손실을 결합하여 구성됩니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

결과

제안된 YOLOv11 및 CNN 융합 모델의 생산 라인 안전 모니터링 효율성을 검증하기 위해 다양한 안전 위험 시나리오를 포함하는 데이터셋을 구축하였다. 이 데이터셋은 12,000장의 생산 라인 장면 이미지로 구성되었으며, 고정 랜덤 시드 42를 사용하여 훈련, 검증 및 테스트 세트로 7:1.5:1.5 비율로 나누었다. 데이터셋은 표준 조명, 저조도, 부분 가림, 심한 가림, 모션 블러 및 복잡한 배경을 포함한 다양한 작업 조건을 포괄한다. 추론을 위한 신뢰도 임계값은 0.5로, 비최대 억제(NMS) 임계값은 0.45로 설정하였다. 모든 실험은 3회 반복 수행하였으며, 결과는 평균 ± 표준 편차로 보고하였다. 어노테이션 카테고리는 작업자, 안전모, 로봇 팔, 위험 구역, 도구 및 차량으로 설정하였으며 PASCAL Visual Object Classes (VOC) 형식을 사용하였다. IoU(intersection-over-union) 임계값은 0.5로 설정하였고, 2인 교차 검증을 통해 어노테이션 일관성을 확인하였다. 입력 이미지는 640 × 640으로 균일하게 크기를 조정하였으며 Mosaic 데이터로 증강하였다. 훈련은 초기 학습률 0.01, 모멘텀 0.9, 가중치 감쇠 0.0005, 배치 크기 32의 SGD 옵티마이저를 사용하여 수행하였다. 훈련은 200 에포크(epochs) 동안 진행되었으며, 코사인 어닐링(cosine annealing)을 사용하여 학습률을 조정하였다.

모델의 효과를 철저히 평가하기 위해 다양한 평가 지표가 활용되었습니다: 평균 정밀도(mAP), 이미지 프레임 처리 속도를 측정하기 위한 초당 프레임 수(FPS), 양성 예측의 정확도를 평가하기 위한 정밀도(precision), 진양성을 검출하는 모델의 능력을 측정하기 위한 재현율(recall), 그리고 수신자 조작 특성(ROC) 곡선 아래 면적을 나타내어 모델의 전반적인 분류 능력을 반영하는 곡선 아래 면적(AUC)이 그것입니다. 계산 공식은 식 (4), (5), (6), (7), (8), (9), (10), (11)에 나타나 있습니다:

mAP 계산 공식, mAP@0.5=1/NΣ(Ni=1)APi, 지표, 정밀도, 데이터 분석.  (4)
평균 정밀도(mAP) 계산 공식; 데이터 평가 분석을 위한 Σ 수식.  (5)
정밀도 공식, TP/(TP+FP), 머신러닝 결과 분석을 위한 수식, 간결한 지표.  (6)
재현율정밀도 공식, TP/(TP+FN), 수식, 통계 분석, 머신러닝 평가. (7)
물리학의 시간당 힘 계산을 보여주는 정적 평형 방정식 FPS=F/T.  (8)
진양성률 공식, TPR=TP/(TP+FN), 통계 분석 수식.  (9)
위양성률 공식, FPR=FP/(FP+TN), 통계 분석, 교육용.  (10)
AUC 공식 AUC=∫₀¹TPR(x)dx; 데이터 분석 해석을 위한 수학적 도표.  (11)

정밀도-재현율 지표; mAP@0.5, mAP@[0.5:0.95], TP, FP, FN, 정밀도, 재현율; 데이터 분석.  여기서 mAP@0.5는 IoU 임계값이 0.5일 때의 평균 정밀도 평균(mean average precision)을 나타내며, N은 카테고리의 수, APii번째 카테고리의 평균 정밀도, mAP@[0.5:0.95]는 0.5에서 0.95까지의 IoU 임계값에 대해 계산된 mAP의 평균입니다. TP, FP, FN, TN은 각각 진양성, 위양성, 위음성, 진음성의 수를 나타냅니다. F는 처리된 총 프레임 수, T는 총 처리 시간, TPR은 진양성률, FPR은 위양성률입니다.
YOLOv11 검출 구성 요소의 손실 함수는 수식 (12)에 나와 있습니다:

손실 함수 공식: \( \text{LOSS} = \lambda_{\text{coord}} \cdot L_{\text{coord}} + \lambda_{\text{conf}} \cdot L_{\text{conf}} + \lambda_{\text{class}} \cdot L_{\text{class}} \).     (12)

정적 평형 방정식 다이어그램: L_coord, L_conf, L_class; λ_coord, λ_conf, λ_class.  여기서 Lcoord는 예측된 프레임과 실제 프레임 사이의 편차를 나타내고, Lconf는 예측된 프레임의 신뢰도 오차를 측정하며, Lclass는 카테고리 예측 오차를 측정합니다. λcoord, λconf 및 λclass는 해당 손실 값들의 균형을 맞추기 위해 사용되는 가중치 계수입니다.

표 1의 데이터를 분석한 결과, 제안된 방법은 mAP@0.5 0.91 및 mAP@0.5:0.95 0.82를 달성하였으며, 이는 YOLOv5와 비교하여 각각 0.04 및 0.04 개선된 수치입니다. F1-score는 0.935로, 이 또한 비교 모델들보다 높습니다. 검출 속도는 120 FPS로 Faster R-CNN보다 4배 빠르지만, YOLOv10 및 YOLOv11보다는 약간 낮습니다. 파라미터 수는 6.7M으로 YOLOv11보다 1.5M 더 많지만, mAP@0.5는 0.03 향상되었습니다. 유사한 계산 비용을 가진 EfficientDet과 비교했을 때, 정확도는 0.06 더 높고 파라미터 수는 56% 더 적습니다. 이러한 데이터는 도입된 다중 규모 융합(multi-scale fusion) 및 어텐션 메커니즘이 소형 타겟 검출 정확도를 효과적으로 향상시켜 속도와 정확도 사이의 적절한 균형을 달성했음을 입증합니다. 요약하자면, 제안된 방법은 검출 정확도와 속도 사이의 균형을 이루었습니다. mAP@0.5는 두 번째로 우수한 모델보다 0.02 더 높고, F1-score는 0.935에 달하며, 6.7M의 파라미터는 실제 배포에 충분한 수준입니다. 다중 규모 융합 및 어텐션 메커니즘은 복잡한 장면에서 소형 및 가려진 타겟의 인식 능력을 향상시킵니다. 이 모델은 정확도와 효율성의 균형을 맞추어 산업 안전 모니터링과 같은 실시간 시나리오에 적합합니다. 참고로, 모든 비교 모델은 공식 사전 학습된 가중치를 사용하였으며, 입력 해상도는 640 × 640, NMS 임계값은 0.45, 신뢰도 임계값은 0.5로 통일하였습니다.

방법mAP@0.5mAP@0.5:0.95F1-스코어초당 프레임 수매개변수 (M)
YOLOv50.870.780.891307.1
EfficientDet0.850.730.885015.3
RetinaNet0.820.680.854537.6
Faster R-CNN0.840.70.873045.2
YOLOv100.890.770.881355.3
YOLOv110.880.750.8951405.2
저희의 것0.910.820.9351206.7

표 1: 모델 성능의 종합 비교표. 데이터 분석 결과, 제안된 방법은 mAP@0.5 0.91 및 mAP@0.5:0.95 0.82를 달성하여 YOLOv5 대비 각각 0.04 및 0.04의 향상을 보였습니다. F1-score는 0.935로, 이 또한 비교 모델들보다 높습니다. 검출 속도는 120 FPS로 Faster R-CNN보다 4배 빠르지만, YOLOv10 및 YOLOv11보다는 약간 낮습니다. 파라미터 수는 6.7M으로 YOLOv11보다 1.5M 더 많지만, mAP@0.5에서는 0.03의 향상이 있었습니다. 연산 비용이 유사한 EfficientDet과 비교했을 때, 정확도는 0.06 더 높고 파라미터 수는 56% 더 적습니다. 이러한 데이터는 도입된 다중 스케일 융합 및 어텐션 메커니즘이 소형 타겟 검출의 정확도를 효과적으로 높여, 속도와 정확도 사이의 우수한 균형을 달성했음을 입증합니다. 요약하자면, 본 연구에서 제안한 방법은 검출 정확도와 속도 사이의 균형을 달성했습니다. mAP@0.5는 두 번째로 우수한 모델보다 0.02 더 높고, F1-score는 0.935에 도달했으며, 6.7M의 파라미터는 실제 배포에 충분한 수준입니다. 다중 스케일 융합 및 어텐션 메커니즘은 복잡한 장면에서 소형 및 가려진 타겟의 인식을 향상시킵니다. 이 모델은 정확도와 효율성의 균형을 맞추어 산업 안전 모니터링과 같은 실시간 시나리오에 적합합니다. 참고로, 모든 비교 모델은 공식 사전 학습된 가중치를 사용하였으며, 입력 해상도는 640 × 640, NMS 임계값은 0.45, 신뢰도 임계값은 0.5로 통일하였습니다.

그림 2는 모델의 오탐지 유형에 대한 심층 분석을 제공합니다. YOLOv11 + CNN은 배경 오탐지율이 가장 낮았으며(10,000 프레임당 85회), 대부분의 오탐지는 유사한 객체(62회)와 부분적으로 가려진 장면(48회)에서 발생했습니다. ROC 곡선 분석 결과, FPR 0.1에서 모델의 TPR은 0.9(AUC = 0.98)에 도달했으며, 곡선 간의 간격이 가장 좁게 나타나 탐지 신뢰도가 매우 높음을 뒷받침합니다. 이러한 분석 결과는 모델의 성능을 입증할 뿐만 아니라, 특히 유사 객체 식별 능력을 강화함으로써 향후 오탐지 최적화를 위한 명확한 기술적 로드맵을 제시합니다.

객체 탐지 모델을 비교하는 ROC 곡선 및 막대 그래프: AUC, 유형별 오경보 분석.
그림 2. 오차 분석. 모델의 오탐지 유형 분석. YOLOv11 + CNN은 배경 오탐지율이 가장 낮았으며(10,000 프레임당 85회), 오탐지의 대부분은 유사한 객체(62회)와 부분적으로 가려진 장면(48회)에 집중되었다. ROC 곡선 분석 결과, FPR 0.1에서 모델의 TPR은 0.9(AUC = 0.98)에 도달했으며, 곡선 간의 간격이 가장 좁게 나타나 탐지 신뢰도의 타당성을 뒷받침한다. 이러한 분석 결과는 모델의 성능을 입증할 뿐만 아니라, 특히 유사 객체 구분 능력을 강화함으로써 향후 오탐지 최적화를 위한 명확한 기술적 로드맵을 제공한다. 여기를 클릭하여 이 그림의 더 큰 버전을 확인하십시오.

그림 3은 다양한 하드웨어 플랫폼에서의 모델 성능을 비교한 것입니다. YOLOv11 + CNN은 Edge tensor processing unit (TPU)에서 ±2 ms의 낮은 변동폭과 함께 18 ms의 초저지연 시간을 달성하였으며, 전력 소비는 15 W로 제어되었습니다. 처리량 테스트 결과, 본 모델은 Jetson Xavier 엣지 컴퓨팅 장치에서 70 FPS의 처리 속도를 달성하였으며, 99백분위수 지연 시간은 50 ms 이내로 제어되었습니다. 이러한 배포 성능 지표를 통해 산업 분야의 다양한 컴퓨팅 플랫폼 배포 요구 사항에 적응할 수 있습니다. 오차 분석 결과, 본 모델은 자원이 제한된 환경에서도 안정적인 성능을 유지할 수 있어 공학적 적용 가능성을 입증하였습니다.

장치별 YOLO 모델의 처리량 및 지연 시간 비교 차트; 장치 성능 분석.
그림 3. 배포 성능. 다양한 하드웨어 플랫폼에서의 모델 성능 비교. YOLOv11 + CNN은 Edge TPU에서 18 ms의 초저지연 시간(변동 폭 ±2 ms)을 달성하였으며, 전력 소비는 15 W로 제어되었습니다. 처리량 테스트 결과, 해당 모델은 Jetson Xavier 엣지 컴퓨팅 장치에서 70 FPS의 처리 속도를 달성하였으며, 99분위 지연 시간은 50 ms 이내로 제어되었습니다. 이러한 배포 성능 지표는 본 모델이 산업 현장의 다양한 컴퓨팅 플랫폼 배포 요구 사항에 적응할 수 있음을 나타냅니다. 오류 분석 결과, 모델이 자원 제한 환경에서도 안정적인 성능을 유지할 수 있음을 보여주어 공학적 적용 가능성을 입증하였습니다. 여기를 클릭하여 이 그림의 더 큰 버전을 확인하십시오.

그림 4는 6가지 대상 카테고리에 따른 각 모델의 검출 성능 차이를 비교합니다. YOLOv11 + CNN은 안전모 인식 작업에서 0.96의 정확도를 달성하여 벤치마크 모델보다 4%포인트 높은 성능을 보였습니다. 점 도표는 모델이 카테고리 간 성능 변동이 최소한(±0.05)임을 나타내며, 이는 모델의 일반화 능력을 반영합니다. 히트맵으로 표시된 혼동 행렬을 보면 위험 구역과 로봇 팔 사이에 15%의 상호 오검출이 발생함을 알 수 있습니다. 이러한 결과는 향후 모델 최적화를 위한 명확한 방향을 제시합니다.

혼동 행렬 및 카테고리 성능 그래프; 정밀도, 재현율, F1-스코어 분석, 안전 모델.
그림 4. 카테고리 탐지 분석. 6개 대상 카테고리에 걸친 각 모델의 탐지 성능 차이 비교. YOLOv11 + CNN은 안전모 인식 작업에서 0.96의 정확도를 달성하여 벤치마크 모델보다 4%포인트 더 높은 성능을 보였다. 점 도표는 모델이 카테고리 간에 최소한의 성능 변동(±0.05)을 보임을 나타내며, 이는 모델의 일반화 능력을 반영한다. 히트맵으로 제시된 혼동 행렬은 위험 구역과 로봇 팔 사이에 15%의 상호 오탐지가 발생함을 보여준다. 이 결과는 향후 모델 최적화를 위한 명확한 방향성을 제공한다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 5는 각 모델의 학습 과정에 대한 종합적인 기록을 제공합니다. YOLOv11 + CNN은 30 epoch 이내에 손실(loss)이 0.1까지 떨어지며 가장 빠른 수렴 속도를 보였으며, 검증 세트의 mAP 곡선과 학습 세트 간의 격차는 지속적으로 1% 미만을 유지했습니다. 오차 범위 플롯 분석 결과, 모델의 최종 검증 mAP@0.5는 0.94 ± 0.01로 안정적이었으며, 성능 변동 범위는 RetinaNet의 3분의 1 수준에 불과했습니다. 이러한 결과는 공동 학습 프로토콜의 효과를 뒷받침합니다. 해당 모델은 학습 초기 단계에서 성능 우위를 보였으며, 이는 모델의 구조적 설계가 신속한 특징 학습을 가능하게 함을 나타냅니다.

머신러닝 모델의 검증 mAP 및 훈련 손실을 비교하는 박스 플롯과 바이올린 플롯.
그림 5훈련 과정 분석. 각 모델의 학습 과정 기록입니다. YOLOv11 + CNN은 가장 빠른 수렴 속도를 보이며(30 에포크 이내에 손실 값이 0.1로 감소), 검증 세트의 mAP 곡선과 학습 세트 간의 간격이 항상 1% 미만으로 유지됩니다. 오차 범위 도표(error band plot) 분석 결과, 모델의 최종 검증 mAP@0.5는 0.94 ± 0.01로 안정적이며, 성능 변동 범위는 RetinaNet의 3분의 1 수준에 불과합니다. 이러한 결과는 공동 학습 프로토콜의 효과를 뒷받침합니다. 해당 모델은 학습 초기 단계에서 성능 우위를 보이며, 이는 모델의 구조적 설계 덕분에 특징을 빠르게 학습할 수 있음을 나타냅니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

표 2는 복잡한 환경에서 다양한 검출 모델의 정량적 성능 결과를 보여줍니다. 표준 조명 조건 및 다양한 극한 시나리오에 걸친 테스트 데이터에 따르면, YOLOv11 + CNN이 모든 조건에서 최적의 성능을 유지하는 것으로 나타났습니다. 표준 조명 조건에서 이 모델의 mAP@0.5는 0.91에 달해, YOLOv5 (0.87) 및 Faster R-CNN (0.84)보다 유의미하게 우수했습니다. 환경 조건이 악화됨에 따라 각 모델의 성능이 다양한 정도로 감소하지만, YOLOv11 + CNN은 가장 강력한 환경 강건성을 보여줍니다. 저조도 조건 (< 50 lux)에서 성능 감소폭은 3% (0.88까지)에 불과하여, 비교 모델의 5% 감소보다 우수했습니다. 심한 폐색 시나리오 (> 50%)에서도 mAP를 0.78로 유지할 수 있었으며, 성능 저하율 (13%)은 YOLOv5 (15%) 및 Faster R-CNN (16%)보다 현저히 낮았습니다. 이러한 결과는 YOLOv11 + CNN이 개선된 특징 융합 및 어텐션 메커니즘을 통해 조명 변화 및 폐색과 같은 복잡한 요인에 대한 모델의 적응력을 향상시켰으며, 이를 통해 산업 현장에서의 실제 적용 가능성을 뒷받침한다는 것을 입증합니다.

시험 조건YOLOv11 + CNNYOLOv5Faster R-CNN성능 변동
표준 조명0.910.870.840.01
저조도 (< 50 럭스)0.88 (-3%)0.82 (-5%)0.79 (-5%)0.02
부분 폐쇄 (30%–50%)0.85 (-6%)0.80 (-7%)0.76 (-8%)0.03
심한 폐쇄 (> 50%)0.78 (-13%)0.72 (-15%)0.68 (-16%)0.04
모션 블러0.83 (-8%)0.77 (-10%)0.73 (-11%)0.05

표 2: 환경 적응성에 대한 정량적 분석 표. 정량적 분석을 통해 복잡한 환경에서 각 검출 모델의 성능을 평가하였다. 표준 조명 조건부터 다양한 극한 시나리오까지의 테스트 데이터에 따르면, YOLOv11 + CNN이 모든 테스트 조건에서 가장 높은 성능을 유지하는 것으로 나타났다. 표준 조명 조건에서 이 모델의 mAP@0.5는 0.91에 달해, YOLOv5 (0.87) 및 Faster R-CNN (0.84)보다 유의미하게 우수한 성능을 보였다. 환경 조건이 악화됨에 따라 각 모델의 성능이 다양한 정도로 감소하였으나, YOLOv11 + CNN은 평가된 모델 중 가장 강력한 환경 강건성을 나타냈다. 저조도 조건 (< 50 lux)에서 성능 감소폭은 3% (0.88로 감소)에 불과하여, 비교 모델의 5% 감소보다 우수했다. 심한 폐쇄 시나리오 (> 50%)에서도 mAP를 0.78로 유지하였으며, 성능 저하율 (13%)은 YOLOv5 (15%) 및 Faster R-CNN (16%)보다 유의미하게 낮았다. 이러한 결과는 YOLOv11 + CNN이 개선된 특징 융합 메커니즘과 어텐션 설계를 통해 조명 변화 및 폐쇄 간섭과 같은 복잡한 요인에 대한 모델의 적응성을 향상시켰음을 입증하며, 산업 현장에서의 실질적인 적용 가능성을 뒷받침한다.

표 3은 본 실험에서 SGD 옵티마이저가 사용되었으며, 수렴을 가속화하고 진동을 억제하기 위해 0.9의 모멘텀이 적용되었음을 보여줍니다. 초기 학습률은 0.01로 설정하고 코사인 어닐링(cosine annealing)을 사용하여 훈련 과정 동안 점진적으로 감소시켜 최적화를 정교화했습니다. L2 정규화를 적용하고 과적합을 줄이기 위해 0.0005의 가중치 감쇠(weight decay)를 도입했습니다. 배치 크기는 32로 설정하여 계산 효율성과 그래디언트 추정 안정성 사이의 균형을 맞추었습니다. 200회의 훈련 에포크(epoch)를 통해 충분한 수렴을 보장했습니다. 이러한 파라미터들은 단일 단계 검출 작업에 맞게 조정되어 훈련 속도와 정확도의 균형을 이루었습니다.

매개변수
최적화 도구확산 구배 분배(SGD)
초기 학습률0.01
운동량0.9
가중치 감쇠0.0005
배치 크기32
훈련 에포크200
학습률 스케줄링코사인 어닐링

표 3: 학습 하이퍼파라미터 표. 본 실험에서는 수렴을 가속화하고 진동을 억제하기 위해 모멘텀 0.9의 SGD 옵티마이저를 사용하였다. 초기 학습률은 0.01로 설정하고 코사인 어닐링(cosine annealing)을 적용하여 학습 과정 동안 점진적으로 감소시켜 최적화를 정밀하게 수행하였다. L2 정규화를 적용하고 과적합을 줄이기 위해 0.0005의 가중치 감쇠(weight decay)를 도입하였다. 배치 크기는 32로 설정하여 계산 효율성과 그래디언트 추정 안정성 사이의 균형을 맞추었다. 200회의 학습 에포크(epoch)를 통해 충분한 수렴을 보장하였다. 파라미터들은 학습 속도와 정확도의 균형을 맞추어 단일 단계 검출 작업에 맞게 조정되었다.

표 4는 YOLOv11을 베이스라인으로 사용했을 때 mAP@0.5가 0.89임을 보여줍니다. 다중 스케일 융합(multi-scale fusion)만 도입했을 때는 정확도가 0.88로 감소합니다. 여기에 채널 어텐션(channel attention)과 공간 어텐션(spatial attention)을 순차적으로 추가로 적용하면 정확도가 각각 0.90과 0.89로 향상됩니다. 모든 모듈을 결합했을 때의 정확도는 0.91에 도달하며, 이는 베이스라인 대비 0.02 향상된 수치입니다. 해당 데이터는 채널 어텐션이 정확도를 직접적으로 향상시키며, 다중 스케일과 어텐션을 결합한 성능이 최적임을 보여줍니다.

구성mAP@0.5
YOLOv11 (기준 모델)0.89
+ 다중 규모 융합0.88
+ 다중 스케일 + 채널 어텐션0.9
+ 다중 스케일 + 공간 주의 집중0.89
전체 모듈 (YOLOv11 + CNN)0.91

표 4: 제거 실험 표. YOLOv11을 베이스라인으로 사용했을 때 mAP@0.5는 0.89입니다. 다중 스케일 융합(multi-scale fusion)만 도입하면 정확도가 0.88로 감소합니다. 다중 스케일 융합 후 채널 어텐션(channel attention) 또는 공간 어텐션(spatial attention)을 추가하면 정확도가 각각 0.90과 0.89로 향상됩니다. 모든 모듈을 결합한 정확도는 0.91에 도달하며, 이는 베이스라인 대비 0.02 향상된 수치입니다. 데이터에 따르면 본 설정에서는 채널 어텐션이 공간 어텐션보다 더 큰 이득을 제공하며, 다중 스케일 융합과 어텐션을 결합한 성능이 가장 최적임을 보여줍니다.

그림 6은 극한 환경에서 모델의 성능을 체계적으로 평가한 결과입니다. 저조도 조건에서 YOLOv11 + CNN의 mAP는 6%만 감소하여 0.88을 기록했으며, 심한 가림 현상이 있는 장면에서도 0.78의 mAP를 유지하여 벤치마크보다 8% 높은 성능을 보였습니다. 이러한 결과는 해당 모델이 환경 적응성을 갖추고 있으며, 산업 생산 현장에서 흔히 발생하는 조명 변화 및 국부적 가림 문제를 효과적으로 해결함으로써 검출 시스템의 안정적인 작동을 지원함을 입증합니다.

객체 검출 모델 성능 그래프; 조명 및 폐색 영향 분석; mAP@0.5 지표.
그림 6. 환경 적응성. 극한 환경에서의 모델 성능에 대한 체계적인 평가. 저조도 조건에서 YOLOv11 + CNN의 mAP는 단 6%만 하락하여 0.88을 기록했으며, 심한 폐색이 있는 장면에서도 0.78의 mAP(벤치마크 대비 8% 높음)를 유지했다. 이러한 결과는 본 모델이 환경 적응성을 갖추고 있어 산업 생산 현장에서 흔히 발생하는 조명 변화 및 국소적 폐색 문제를 효과적으로 해결하며, 이를 통해 검출 시스템의 안정적인 운용을 지원함을 입증한다. 여기를 클릭하여 이 그림의 더 큰 버전을 확인하십시오.

그림 7은 t-SNE 차원 축소를 통해 6가지 유형의 산업 대상물에 대한 YOLOv11과 YOLOv11 + CNN의 특성 분포 차이를 비교한 것입니다. 왼쪽 그림을 보면 기본 모델인 YOLOv11의 특성이 상당한 클래스 내 분산(클래스 내 거리 2.34 ± 0.15)을 보이며, 특히 "Danger Zone"(빨간색)과 "Vehicle"(보라색)에서 상당한 중첩이 나타나는데, 이는 실험군 3의 오탐지율 15%와 일치합니다. 오른쪽 그림은 개선된 YOLOv11 + CNN이 특성 강화 모듈을 통해 클래스 내 응집력을 유의미하게 향상시켜, 각 카테고리 내 클러스터 중심 간의 평균 거리를 1.8배 증가시켰음을 보여줍니다.

YOLOv11 및 YOLOv11+CNN 특성 클러스터링 차트, 클래스 내 거리 분석, 데이터 시각화.
그림 7. t-SNE 특성 분포 비교. t-SNE 차원 축소를 통한 6가지 유형의 산업 대상물에 대한 YOLOv11과 YOLOv11 + CNN의 특성 분포 차이 비교. 왼쪽 그림은 기본 모델인 YOLOv11의 특성이 상당한 클래스 내 분산(클래스 내 거리 2.34 ± 0.15)을 보이며, 특히 "Danger Zone"(빨간색)과 "Vehicle"(보라색)에서 상당한 중첩이 나타남을 보여주며, 이는 실험군 3의 15% 오탐지율과 일치한다. 오른쪽 그림은 개선된 YOLOv11 + CNN이 특성 강화 모듈을 통해 클래스 내 응집도를 유의미하게 향상시켰으며, 각 카테고리별 클러스터 중심 간의 평균 거리가 1.8배 증가했음을 보여준다. 여기를 클릭하여 이 그림의 더 큰 버전을 확인하십시오.

그림 8은 체계적인 절제 실험(ablation experiments)을 통해 각 모듈의 기여도를 검증합니다. 절제 실험 결과, 다중 스케일 융합 후 채널 어텐션을 추가하면 mAP@0.5가 0.90으로 증가하며, 공간 어텐션을 추가하면 mAP@0.5가 0.89로 증가하는 것으로 나타났습니다. 전체 모듈을 적용했을 때 가장 높은 0.91의 mAP@0.5를 달성했습니다. 히트맵 시각화 결과, 복합 어텐션 메커니즘이 위험 구역의 중심(활성화 값: +0.15)과 가장자리의 작은 타겟(+0.08)에 대한 탐지 응답을 동시에 강화할 수 있음을 보여줍니다. 실험 데이터는 다중 스케일 특징 융합과 어텐션 메커니즘이 누적 효과를 가지며, 이를 통해 모델이 다양한 스케일에서의 타겟 탐지 요구 사항을 충족할 수 있음을 입증합니다.

어텐션 맵을 이용한 YOLO 프레임워크의 특징 강화에 대한 어블레이션 연구 그래프; 성능 분석.
그림 8모듈형 제거 실험. 체계적인 어블레이션 실험을 통해 각 모듈의 기여도를 검증하였다. 어블레이션 결과, 다중 스케일 융합 이후에 채널 어텐션을 추가하면 mAP@0.5가 0.90으로 증가하며, 공간 어텐션을 추가하면 mAP@0.5가 0.89로 증가하는 것으로 나타났다. 전체 모듈을 적용했을 때 가장 높은 mAP@0.5 수치인 0.91을 달성하였다. 히트맵 시각화 결과, 복합 어텐션 메커니즘이 위험 구역의 중심(활성화 값: +0.15)과 가장자리의 소형 타겟(+0.08)에 대한 검출 응답을 동시에 강화할 수 있음을 보여준다. 실험 데이터는 다중 스케일 특징 융합과 어텐션 메커니즘이 누적 효과를 가지며, 이를 통해 모델이 다양한 스케일에 걸쳐 타겟 검출 요구사항을 충족할 수 있음을 입증한다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

데이터 가용성:
전체 원본 생산 라인 이미지 및 비디오 스트림은 산업 기밀 제한 대상이므로 공개적으로 배포되지 않습니다. 보충 데이터셋 설명(Supplemental File 1)에서 데이터셋 획득 세부 사항, 카테고리 및 시나리오 분포, 어노테이션 사양, 품질 관리 절차, 데이터 분할, 전처리 및 증강 절차를 제공합니다. 의사코드 및 재현성 프레임워크(Supplemental File 2)에서는 의사코드 수준의 워크플로우, 구성 설명 및 재현을 위한 가이드를 제공합니다. 비상업적 학술 연구를 위해 익명화된 하위 집합 및 추가 지원 자료를 교신 저자에게 요청할 수 있으며, 이는 기관 및 기밀 제한 사항을 따릅니다.

보충 파일 1. 보충 데이터셋 설명. 이 파일은 데이터셋 획득 프로토콜, 시나리오 범위, 클래스 분포, 어노테이션 사양, 품질 관리 절차, 훈련/검증/테스트 분할, 전처리 및 증강 절차를 설명합니다. 이 파일을 다운로드하려면 여기를 클릭하십시오.

보충 파일 2. 슈도코드 및 재현성 프레임워크. 이 파일은 전처리, 학습, 평가 및 배포를 위한 슈도코드 수준의 워크플로우와 구성 세부 사항을 제공하며, 원본 산업 영상에 대한 제한 사항 및 지원 자료에 대한 접근 방법을 설명합니다. 이 파일을 다운로드하려면 여기를 클릭하십시오.

토론

실험 결과, 제안된 YOLOv11–CNN 융합 모델이 생산 라인 안전 모니터링의 검출 정확도와 실시간 성능을 향상시키는 것으로 나타났습니다. YOLOv11의 효율적인 단일 단계 검출과 CNN 모듈의 특징 강화 기능을 활용하여, 시스템은 복잡한 조명 및 가려짐 조건에서도 작업자, 장비 및 위험 구역을 식별했습니다. 다중 스케일 특징 융합과 어텐션 메커니즘을 통해 핵심 안전 요소에 집중하는 능력이 강화되었으며, 이를 통해 조기 경보를 위한 해석 가능한 시각적 근거를 제공했습니다.

이 시스템은 실시간 모니터링을 통해 수동 검사에 대한 의존도를 낮추고 잠재적인 안전 위험에 대한 대응 시간을 단축할 수 있어, 자동차 제조 및 전자 제품 조립과 같은 환경의 생산 라인에서 실용적인 가치를 가집니다. 나사나 공구와 같은 작은 대상물, 그리고 로봇 팔이나 기타 장비에 의해 부분적으로 가려진 작업자 대상물의 경우, 다중 스케일 특징 융합 및 어텐션 메커니즘이 안전 관련 특징을 추출하고 강조하는 모델의 능력을 향상시킵니다. 이러한 개선 사항은 대상물의 크기와 가시성이 다양한 생산 환경에 유효합니다.

하지만 본 연구에는 여전히 명확한 한계점이 존재합니다. 심각한 폐색이나 매우 낮은 조도 환경에서는 대상의 특징 정보가 불완전해지고 기존의 컨볼루션 특징이 불충분할 수 있어 모델의 성능이 저하될 수 있습니다. 새로 추가된 CNN 특징 강화 모듈은 1.5M의 추가 파라미터를 도입하며, 이는 저가형 엣지 기기의 계산 부담을 증가시키고 자원이 제한된 환경에서의 배포를 제한할 수 있습니다. 본 연구는 가시광선 이미지 데이터만을 사용하며 적외선 열화상 또는 밀리미터파 레이더와 같은 다중 모달 센서 정보를 통합하지 않았습니다. 따라서 완전한 어둠이나 연기가 자욱한 극한의 산업 현장에서는 성능이 제한적일 수 있습니다.

향후 연구는 다음과 같은 방향에 집중할 예정입니다. 탐지 성능을 유지하면서 파라미터 부담을 줄이기 위해 구조적 가지치기(structured pruning)와 지식 증류(knowledge distillation)를 기반으로 한 모델 경량화를 진행하고, 극한의 조명 및 연기 환경에서의 탐지 능력을 향상시키기 위해 가시광선-적외선 다중모드 융합 탐지 프레임워크를 구축하며, 컨볼루션 층의 일부를 대체하고 장거리 문맥 특징 추출을 강화하기 위해 경량 Transformer 모듈을 도입하고, 표적 탐지부터 행동 조기 경보까지의 전체 워크플로우를 지원하는 엔드 투 엔드 이상 행동 인식 서브시스템을 개발할 것입니다.

결론적으로, 본 연구는 복잡한 산업 환경에서 잠재적인 안전 위험 요소를 실시간으로 탐지하고 조기 경보를 제공하기 위해 YOLOv11과 CNN 알고리즘을 융합한 생산 라인 안전 모니터링 시스템에 중점을 둡니다. 실험적 검증을 통해, 융합 모델은 객체 탐지 정확도와 추론 속도 면에서 성능상의 이점을 보여주었습니다. 효율적인 단일 단계 탐지 아키텍처와 최적화된 특징 추출을 통해, YOLOv11은 작업자, 장비 및 위험 구역을 신속하게 식별하는 데 뛰어난 성능을 보였으며, 생산 라인 시나리오 내의 핵심 안전 요소를 정확하게 포착했습니다. 동시에, 개선된 CNN 모듈의 도입으로 특징 포착 능력이 더욱 강화되었으며 가려진 대상에 대한 탐지 성능이 향상되었습니다. 생산 라인 안전 모니터링 시, 모델은 시각적 분석을 통해 이미지 내의 핵심 안전 구역에 자동으로 집중함으로써 안전 경보에 대한 해석 가능한 근거를 제공합니다. 융합 모델은 가공, 조립, 창고 보관을 포함한 다양한 생산 라인 시나리오에서 강력한 적응성과 안정성을 입증했습니다. 본 논문의 주요 연구 내용은 다음과 같습니다.

(1) 검출 속도와 정확도의 균형을 맞추기 위해 YOLOv11과 CNN의 딥 퓨전 아키텍처를 설계하였습니다.
(2) 복잡한 시나리오에서 핵심 안전 요소에 집중하는 능력을 향상시키기 위해 다중 스케일 특징 융합 및 어텐션 최적화 메커니즘을 구축하였습니다.
(3) 자체 구축한 생산 라인 안전 데이터셋을 이용한 실험 결과, 모델은 0.91의 mAP@0.5와 120 FPS의 검출 속도를 달성하였습니다. 교차 시나리오 테스트에서 모델은 안정적인 성능을 보였습니다.

대표적인 사례 연구 결과, 표준 조명 조건에서 40%만 노출된 안전모가 다중 스케일 퓨전 및 채널 어텐션에 의해 정확하게 검출된 반면(신뢰도 0.93), 베이스라인 모델은 이를 배경으로 오인하였습니다. 저조도 시나리오에서 작업자가 위험 구역에 진입했을 때, 공간 어텐션은 방향성 라인을 통해 타겟의 바운딩 박스를 성공적으로 생성하였으나, 비교 방법으로는 검출에 실패했습니다. 검출 실패 사례로는 심한 폐색 상황에서 배경과의 질감 유사성으로 인해 렌치가 도구로 오검출된 경우와, 저조도 환경의 원거리에서 낮은 신호 대 잡음비로 인해 안전모를 놓친 경우가 있었으며, 이는 극한 조건에서의 특징 표현 능력에 한계가 있음을 보여줍니다. 이러한 결과는 본 모델이 일반적이고 중간 정도의 복잡한 시나리오에서는 강건하지만, 극한 조건에서는 여전히 개선이 필요함을 나타냅니다.

공개 사항

저자들은 선언할 이해상충이 없습니다.

감사의 글

본 연구는 타이저우 대학교 고위 인재 과학 연구 재단의 "지능형 제조를 위한 정밀 검측 핵심 기술 연구"(TZXY2020QDJJ006)의 지원을 일부 받아 수행되었습니다.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
COCO API   해당 없음타겟 검출 정확도 평가 및 통계 분석에 사용된 평가 도구.
CUDA 11.4NVIDIA해당 없음PyTorch 1.12 프레임워크와 함께 사용된 병렬 컴퓨팅 플랫폼.
Edge TPU   해당 없음지연 시간 및 전력 소비 테스트에 사용된 배포 플랫폼; 보고된 지연 시간은 18 ms, 전력 소비는 15 W임.
Jetson Xavier 엣지 컴퓨팅 장치NVIDIA   처리량 테스트에 사용된 엣지 컴퓨팅 장치; 보고된 처리 속도는 70 FPS이며 99% 백분위수 지연 시간은 50 ms 이내임.
NVIDIA Tesla V100 GPUNVIDIA   학습/평가 서버에 사용된 GPU.
PyTorch 1.12   해당 없음모델 학습 및 평가에 사용된 딥러닝 프레임워크.
scikit-learn    해당 없음모델 평가에 사용된 평가/통계 분석 도구.
자체 구축 생산 라인 안전 데이터셋해당 없음해당 없음VOC 형식의 생산 라인 장면 이미지 12,000장으로 구성된 데이터셋으로, 표준 조명, 저조도, 부분 가려짐, 심한 가려짐, 모션 블러 및 복잡한 배경을 포함함; 어노테이션 카테고리는 작업자, 안전모, 로봇 팔, 위험 구역, 도구, 차량의 6가지임.
학습 서버       NVIDIA Tesla V100 GPU와 Ubuntu 20.04 운영체제가 탑재된 서버.
Ubuntu 20.04 운영체제     해당 없음학습/평가 서버에서 사용된 운영체제.
VOC 어노테이션 형식해당 없음해당 없음자체 구축 생산 라인 안전 데이터셋에 사용된 어노테이션 형식.
YOLOv11 객체 검출 모델Ultralytics해당 없음작업자, 장비 및 잠재적 위험 요소를 실시간으로 검출하는 데 사용된 객체 검출 모델.

참고문헌

  1. Ramadan MNA, Ali MAH, Jaber H, Alkhedher M. Blockchain-secured IoT-federated learning for industrial air pollution monitoring: a mechanistic approach to exposure prediction and environmental safety. Ecotoxicol Environ Saf. 2025;300:118442.
  2. Ahn J, et al. SafeFac: video-based smart safety monitoring for preventing industrial work accidents. Expert Syst Appl. 2023;215:119397.
  3. Natha S, et al. A scalable and generalized deep ensemble model for road anomaly detection in surveillance videos. Comput Mater Contin. 2024;81(3):3707-3729.
  4. Diallo AR, Homri L, Dantan JY. Reducing false alarms in fault detection: a comparative analysis between conformal prediction and classical methods applied to PCA and autoencoders. J Process Control. 2025;152:103495.
  5. Cheng X, Han Y, Zhang W. Development of intelligent monitoring system for soil erosion in pipeline engineering based on deep learning. Comput Electr Eng. 2025;126:110432.
  6. Yan H, et al. A global feature fusion and adaptive optimization method to enhance detection accuracy and computational efficiency based on YOLOv8. Alexandria Eng J. 2025;129:538-552.
  7. Samma H, Al-Azani S, El-Ferik S. UAV-based real-time face detection using YOLOv7. Transp Res Procedia. 2025;84:331-338.
  8. Gong X, Yu J, Zhang H, Dong X. AED-YOLO11: a small object detection model based on YOLO11. Digit Signal Process. 2025;166:105411.
  9. Li R, Xiao K, Lin S, Wu Z. Enhancing aquatic ecosystem monitoring through fish jumping behavior analysis and YOLOv5: applications in freshwater fish identification. J Environ Manage. 2025;391:126413.
  10. Zhang D, Gao Q, Chen Z, Lin Z. Semantic feature refinement of YOLO for human mask detection in dense crowded. J Vis Commun Image Represent. 2025;107:104399.
  11. Choi MJ, Ku DG, Lee SJ. Integrated YOLO and CNN algorithms for evaluating degree of walkway breakage. KSCE J Civ Eng. 2022;26(8):3570-3577.
  12. Li Y, et al. Underwater acoustic intelligent spectrum sensing with multimodal data fusion: an Mul-YOLO approach. Future Gener Comput Syst. 2025;173:107880.
  13. Jiang D, et al. Real-time tracker of chicken for poultry based on attention mechanism-enhanced YOLO-Chicken algorithm. Comput Electron Agric. 2025;237:110640.
  14. Yang X, et al. Automated concrete bridge damage detection using an efficient Vision Transformer-enhanced anchor-free YOLO. Engineering. 2025;51:311-326.
  15. Fuertes D, et al. People detection with omnidirectional cameras using a spatial grid of deep learning foveatic classifiers. Digit Signal Process. 2022;126:103473.
  16. Deepak GD, Bhat SK. Maximizing YOLOv2 efficiency: a study on multiclass detection of indoor objects. Results Eng. 2025;26:105405.
  17. Zhang C, et al. Personnel target detection in infrared environment based on YOLOv3-tinier network and its FPGA implementation. Infrared Phys Technol. 2025;150:106015.
  18. Zhou Y. A YOLO-NL object detector for real-time detection. Expert Syst Appl. 2024;238:122256.
  19. Asadollahpour E, Rahmannejad R, Asghari A, Abdollahipour A. Back analysis of closure parameters of Panet equation and Burger's model of Babolak water tunnel conveyance. Int J Rock Mech Min Sci. 2014;68:159-166.
  20. Anguchamy KK, Palanisamy V. Real-time object detection using improvised YOLOv4 and feature mapping technique for autonomous driving. Expert Syst Appl. 2025;280:127452.
  21. Khan AT, Jensen SM, Khan AR. Advancing precision agriculture: a comparative analysis of YOLOv8 for multi-class weed detection in cotton cultivation. Artif Intell Agric. 2025;15(2):182-191.
  22. Raushan R, Singhal V, Jha RK. Damage detection in concrete structures with multi-feature backgrounds using the YOLO network family. Autom Constr. 2025;170:105887.
  23. Zarboubi M, Bellout A, Chabaa S, Dliou A. CustomBottleneck-VGGNet: advanced tomato leaf disease identification for sustainable agriculture. Comput Electron Agric. 2025;232:110066.
  24. Xie F, et al. Wine variety traceability by data fusion of near-infrared spectroscopy and mid-infrared spectroscopy combined with GAF and ResNet. Chemom Intell Lab Syst. 2025;264:105468.
  25. Huang J, et al. Estimation of the orientation of potatoes and detection bud eye position using potato orientation detection you only look once with fast and accurate features for the movement strategy of intelligent cutting robots. Eng Appl Artif Intell. 2025;142:109923.
  26. Huang Y, et al. Human intrusion detection with distributed fiber optic data based on Squeeze-Excitation and hierarchical connection enhancement network. Opt Fiber Technol. 2025;94:104297.
  27. Qi R, et al. Mechanical fault diagnosis of on-load tap changers using time-frequency vibration analysis and a lightweight YOLO model. Measurement. 2025;256:118441.
  28. Yan J, Wang Z. YOLO V3+VGG16-based automatic operations monitoring and analysis in a manufacturing workshop under Industry 4.0. J Manuf Syst. 2022;63:134-142.
  29. Nazli NANM, et al. A real-time system for detecting personal protective equipment compliance using deep learning model YOLOv5. Procedia Comput Sci. 2024;245:647-656.
  30. Xiao Y, et al. The prediction of kiwi quality attributes based on multi-source data fusion comprehensive analysis model using HSI and FHSI. J Food Compos Anal. 2025;144:107645.

재인쇄 및 허가

태그

YOLOv11