현대 산업 생산에서 안전은 생산 효율성과 인원 복지를 보장하는 초석입니다. 생산 라인 환경은 일반적으로 고속 기계 장비, 복잡한 기술 공정, 그리고 여러 과업이 포함된 협업 작업으로 구성됩니다. 아주 작은 잠재적 안전 위험 요소라도 심각한 생산 사고로 이어져 상당한 경제적 손실과 심지어 인명 피해를 초래할 수 있습니다. 따라서 산업 생산의 안전성을 향상시키기 위해 효율적이고 지능적인 실시간 안전 모니터링 시스템을 구축하는 것이 매우 중요합니다1,2.
전통적인 안전 모니터링 방법은 주로 수동 비디오 감시와 다양한 센서(적외선, 연기 및 진동 센서 등)3에 의존합니다. 수동 모니터링은 효율성이 떨어질 뿐만 아니라, 모니터링 인원의 피로로 인해 탐지 누락이 발생하기 쉽고, 지속적이고 포괄적인 커버리지를 제공할 수 없습니다. 센서는 일정 수준의 조기 경보 기능을 제공할 수 있지만, 탐지 범위가 제한적이고 환경적 간섭에 민감하여 오경보라는 두드러진 문제가 발생합니다4. 이에 따라 지능형 모니터링 시스템이 점점 더 연구의 중심이 되고 있습니다. 딥러닝 알고리즘을 사용하여 비디오 스트림을 실시간으로 분석하면 이상 이벤트, 불안전한 행동 및 잠재적 위험을 자동으로 식별할 수 있으며, 이를 통해 모니터링 시스템의 지능을 크게 향상시킬 수 있습니다4,5.
객체 탐지는 지능형 모니터링의 핵심 기술입니다. 1단계 객체 탐지기의 대표 주자인 You Only Look Once (YOLO) 시리즈 알고리즘은 상당한 강점을 보여줍니다. YOLOv1부터 YOLOv8에 이르기까지, 이 알고리즘 모음은 네트워크 아키텍처, 손실 함수 및 학습 방법론 등 여러 측면에서 지속적인 발전을 거듭해 왔습니다6,7. 특히 YOLOv11은 복잡한 배경과 밀집된 타겟에 직면했을 때도 높은 프레임 속도를 유지하면서 더 높은 탐지 정확도를 달성했습니다8.
하지만 일반적인 객체 검출 작업에서의 우수한 성능에도 불구하고, YOLOv11은 특정 생산 라인 안전 모니터링 시나리오에서 여전히 어려움에 직면해 있습니다9. 예를 들어, 작업자가 장비에 의해 부분적으로 가려지거나 안전 표지판이 작고 배경색과 매우 유사한 경우 YOLOv11의 검출 정확도가 감소할 수 있습니다. 이를 위해서는 모델이 더 강력한 특징 추출 및 의미론적 이해 능력을 갖추어야 합니다10.
합성곱 신경망(Convolutional neural networks, CNNs)은 이미지 특징 추출 분야에서 강력한 성능을 가지고 있습니다11. 더 깊고 복잡한 네트워크 구조를 설계함으로써, CNN은 더 풍부하고 추상적인 이미지 특징을 학습할 수 있습니다. CNN을 YOLOv11과 결합하면 YOLOv11의 빠른 탐지 능력과 CNN의 심층 특징 추출 기능을 활용할 수 있어, 더욱 견고하고 지능적인 안전 모니터링 시스템을 구축할 수 있습니다.
이를 바탕으로, 본 논문은 YOLOv11과 CNN을 이용한 생산 라인 안전 모니터링 시스템을 제안합니다. 본 연구의 혁신적인 측면은 다음과 같습니다: (1) YOLOv11과 개선된 CNN의 딥 퓨전 아키텍처를 제안함; (2) 주요 안전 특성의 인식 능력을 향상시키기 위해 다중 스케일 특징 퓨전 및 복합 어텐션 메커니즘을 도입함; (3) 자체 구축한 복잡한 장면 데이터셋을 통해 모델의 성능 우위를 검증함.
YOLO 시리즈 알고리즘의 발전
2015년 Redmon 등에 의해 처음 소개된 이후12, You Only Look Once (YOLO) 알고리즘은 상당한 관심을 끌었습니다. 영역 제안(region proposals)에 의존하는 2단계 검출기와 달리, YOLO는 객체 검출을 회귀 작업으로 처리합니다. 이미지 내 객체의 클래스와 위치를 직접 예측함으로써 YOLO는 검출 속도를 현저히 높였으며, 이를 통해 실시간 사용에 적합하게 되었습니다13.
이 시리즈의 선구적인 연구로서, YOLOv1은 최초로 엔드투엔드 대상 검출을 구현하였습니다.14YOLOv1은 입력 이미지를 그리드 구조로 분할하는 방식을 포함하며, 여기서 각 그리드 셀은 일반적으로 다음과 같이 배치됩니다. S × S 형식은 그 경계 내에 들어오는 객체를 검출하는 작업을 수행합니다.
구체적으로, YOLOv1의 출력은 텐서입니다. S × S × (B × 5 + C) 중에서, 각 바운딩 박스의 예측은 중심점 좌표(x,y), 너비 w, 높이 h, 그리고 신뢰도 c의 5개 요소로 구성됩니다. 계산 과정은 식 (1)에 나타나 있습니다:
(1)
그중 Pr(Object)는 그리드 내에 타겟이 존재할 확률을 나타내며, IOU는 예측된 바운딩 박스와 실제 정답(ground-truth) 박스 사이의 교집합 영역을 합집합 영역으로 나눈 비율을 나타냅니다. 또한 각 그리드는 타겟이 존재할 때 해당 타겟이 i번째 클래스에 속할 확률을 나타내는 클래스 확률 세트 Pr 를 예측합니다. YOLOv1의 손실 함수는 좌표 예측 손실, 신뢰도 추정 손실, 카테고리 예측 손실의 세 가지 주요 구성 요소로 이루어져 있습니다15.
YOLOv2는 안정성과 정확도를 향상시키기 위해 Batch Normalization, 고해상도 분류기 및 다중 스케일 훈련 전략을 도입했습니다16. YOLOv3는 Darknet-53를 백본 네트워크로 사용하며, 타겟 검출을 강화하기 위해 Feature Pyramid Network (FPN) 개념에서 영감을 얻었습니다17.
YOLOv4는 YOLOv3를 기반으로 수많은 최적화를 수행하였으며, 모델 성능을 더욱 향상시키기 위해 Cross Stage Partial Network (CSPNet)18, Path Aggregation Network (PANet)19 및 Mosaic 데이터 증강과 같은 기술들을 도입하였습니다. YOLOv5는 더 사용하기 쉽고 효율적인 구현을 제공함으로써 공학적으로 상당한 기여를 하였습니다20.
최근 몇 년 동안 YOLO 시리즈는 YOLOv6, YOLOv7, YOLOv8와 같은 버전들이 잇따라 출시되며 계속해서 진화해 왔습니다. YOLOv7은 확장 효율적 레이어 집계 네트워크(Extended Efficient Layer Aggregation Network, E-ELAN) 구조와 모델 재매개변수화 기술을 도입함으로써 속도와 정확도 모두에서 새로운 돌파구를 마련했습니다. 이러한 향상은 특징 학습의 효율성을 높일 뿐만 아니라 네트워크의 추론 성능을 최적화하여, YOLOv7이 다양한 실시간 객체 탐지 작업에서 이전 버전들과 많은 주류 탐지기들을 능가할 수 있게 했습니다. YOLOv8은 네트워크 구조를 더욱 최적화하고, 앵커 프리(anchor-free) 설계를 채택하여 모델을 단순화하였으며, 일반화 능력을 향상시켰습니다21.
이 연구에 사용된 YOLOv11은 이전 버전들의 장점을 기반으로 복잡한 산업 현장에 최적화되었습니다. 주요 개선 사항으로는 특징 추출 네트워크, 더욱 효율적인 특징 융합 모듈 및 더 견고한 손실 함수 설계가 포함됩니다. 이러한 개선을 통해 YOLOv11은 생산 환경의 폐쇄물, 소형 타겟 및 복잡한 배경을 처리할 때 더 나은 성능을 발휘합니다. YOLOv11은 Ultralytics에서 출시한 YOLO 시리즈의 한 버전입니다. YOLOv8과 비교하여 C3K2 모듈과 특징 융합 경로를 개선하였으며, 적응형 앵커 박스 전략을 도입하여 산업 현장에서 더 강력한 검출 견고성을 제공합니다.
합성곱 신경망(CNN)의 기초 및 발전
합성곱 신경망(CNN)은 컴퓨터 비전 분야에서 딥러닝의 성공에 지대한 영향을 미친 핵심 모델입니다. CNN은 합성곱 연산을 통해 이미지의 지역적 특징을 추출하고, 이후 풀링 연산을 통해 특징의 차원을 축소함으로써 계층적인 이미지 추상화를 구현합니다22.
전형적인 CNN은 여러 개의 합성곱 층, 풀링 층 및 완전 연결 층으로 구성됩니다. 합성곱 층은 합성곱 커널을 사용하여 입력 이미지를 스캔하고, 국소 영역에 대해 내적을 계산하여 특징 맵을 생성합니다. 계산 과정은 식 (2)에 나타나 있습니다:
(2)
여기서 x는 입력 이미지, wk와 bk는 각각 컨볼루션 커널의 가중치와 편향이며,
은 위치 (i,j)에서의 출력 특성 맵 값입니다. 풀링 층은 일반적으로 Max Pooling 또는 Average Pooling을 사용합니다. 완전 연결 층은 특성을 추출하고 분류 확률을 예측하는 역할을 합니다.
이를 바탕으로, 본 논문에서는 YOLOv11을 위한 CNN 특징 강화 모듈을 설계하였으며, 이는 두 개의 병렬 브랜치로 구성됩니다. 하나는 3 × 3 및 5 × 5 컨볼루션 커널을 사용하여 다중 스케일 특징을 추출하는 다중 스케일 컨볼루션 브랜치이며, 다른 하나는 채널 주의 집중(Squeeze-and-Excitation) 및 공간 주의 집중 모듈을 순차적으로 연결하여 주요 타겟의 판별적 특징을 강화하는 주의 집중 브랜치입니다. 두 브랜치의 출력은 요소별 덧셈(element-wise addition)을 통해 융합되며, 이에 해당하는 특징 강화 손실 함수는 식 (3)에 나타나 있습니다.
(3)
Lcoord는 바운딩 박스 좌표 회귀 손실이며, Lconf는 타겟 신뢰도 손실이고, Lcls는 카테고리 분류 손실입니다. Lfeat는 특징 강화 손실로, CNN 강화 모듈에 의해 추출된 소형 타겟 및 가려진 타겟의 판별적 특징을 제한하는 데 사용됩니다. λcoord, λconf, λcls, λfeat는 해당 손실 항의 가중치 계수입니다. 본 작업에서는 λfeat = 0.05로 설정하였으며, 나머지 가중치는 검출 작업 요구 사항에 따라 균형을 맞추었습니다.
VGGNet23 및 ResNet24와 같은 고전적인 CNN 구조는 이미지 분류 작업에서 큰 성공을 거두었습니다. 이러한 아키텍처 중에서 ResNet은 심층 네트워크 학습 시 발생하는 기울기 소실 문제를 효과적으로 완화하여, 더 깊고 복잡한 네트워크 구조를 구축하는 것을 용이하게 합니다.
객체 검출 작업에서 CNN은 일반적으로 특징 추출기(백본)로 사용됩니다. 예를 들어, YOLO 시리즈 알고리즘의 Darknet, cross-stage partial Darknet (CSPDarknet) 등은 모두 CNN을 기반으로 구축되었습니다25. 특징 추출 능력을 향상시키기 위해 연구자들은 수많은 개선된 CNN 구조를 제안해 왔습니다. 예를 들어, Inception 모듈은 다중 스케일 컨볼루션 커널을 통해 병렬로 특징을 추출합니다. DenseNet은 조밀한 연결(dense connections)을 통해 특징 재사용성을 높입니다. Squeeze-and-Excitation Network는 어텐션 메커니즘을 통해 특징 채널의 중요도를 적응적으로 조정합니다26.
본 연구에서는 YOLOv11의 특징 추출 능력을 향상시키기 위해 개선된 CNN 모듈을 설계하였습니다. 이 모듈은 다중 스케일 특징 융합과 어텐션 메커니즘을 결합하여 생산 라인 시나리오의 핵심 안전 정보를 더욱 효과적으로 포착합니다.
산업 안전 모니터링에서의 딥러닝 적용 현황
딥러닝은 산업 안전 모니터링 분야에서 상당한 주목을 받고 있습니다. CNN 기반 알고리즘은 작업자의 안전모 착용 여부 판별, 위험 구역으로의 무단 침입 감지, 그리고 오작동 장비의 상태 모니터링 등에 활용되고 있습니다27.
행동 인식 측면에서는 3D CNN과 순환 신경망을 사용하여 작업자의 작업 행동을 분석하고 잠재적으로 위험한 행동을 식별합니다. 예를 들어, 작업자의 자세 시퀀스를 분석함으로써 안전 작업 절차를 위반하고 있는지 여부를 판단할 수 있습니다28.
YOLO와 Faster R-CNN은 실시간 감시 비디오에서 인원 및 장비 검출을 위해 널리 사용됩니다. 예를 들어, 문헌에서는 YOLOv5 기반의 실시간 헬멧 검출 시스템이 제안되었으며, 이는 건설 현장 안전 관리의 지능화를 효과적으로 향상시켰습니다29.
기존 연구에서 어느 정도 진전이 있었음에도 불구하고, 몇 가지 과제가 남아 있습니다. 첫째, 산업 현장은 일반적으로 복잡한 조명, 가려짐 및 배경 간섭이 특징이며, 이는 알고리즘의 강건성에 엄격한 요구 사항을 부과합니다. 둘째, 실시간 성능이 핵심 요구 사항이며, 알고리즘은 정확도를 유지하면서 고속 추론을 달성해야 합니다. 마지막으로, 기존 연구는 주로 단일 작업 탐지에 집중되어 있으며, 다중 소스 정보 융합 및 종합적 분석에 대한 탐구가 부족한 실정입니다30.
본 연구에서 제안하는 YOLOv11 및 CNN 융합 모델은 특성 추출 및 융합 능력을 강화함으로써 앞서 언급한 문제들을 해결하고, 생산 라인의 안전 위험에 대한 포괄적인 실시간 모니터링을 달성하는 것을 목표로 합니다.