이 프로토콜의 목표는 PPE 탐지를 위한 개선된 YOLOv11n 기반 모델 개발을 위한 단계별 가이드를 제공하는 것입니다. 이 보고서는 90.1% mAP라는 최첨단 정확도와 고유한 해석 가능성을 갖춘 경량 실시간 검출기를 구현한 아키텍처 및 학습 수정을 상세히 설명합니다.
이 콘텐츠를 보려면 JoVE 구독이 필요합니다. 로그인하거나 오늘 무료 평가판을 시작하세요.
이 프로토콜의 목표는 PPE 탐지를 위한 개선된 YOLOv11n 기반 모델 개발을 위한 단계별 가이드를 제공하는 것입니다. 이 보고서는 90.1% mAP라는 최첨단 정확도와 고유한 해석 가능성을 갖춘 경량 실시간 검출기를 구현한 아키텍처 및 학습 수정을 상세히 설명합니다.
지능형 전송선 검사에서 엣지 컴퓨팅 장치는 복잡한 운영 시나리오에서 개인 보호 장비 인식을 위한 실시간 성능과 탐지 정확도의 균형을 맞추는 중요한 과제에 직면해 있습니다. 본 연구는 경량이고 본질적으로 해석 가능한 탐지 알고리즘인 WTLS-YOLOv11n을 제안합니다. 이 방법론은 YOLOv11n 아키텍처에 세 가지 시너지 혁신을 통합합니다. 이산 웨이브릿 변환을 사용하는 C3K2-WTConv 모듈은 특징을 물리적으로 의미 있는 주파수 성분으로 분해하여 본질적으로 해석 가능한 견고한 다중 스케일 특징 추출을 가능하게 합니다. 경량 공유 복합재 검출 헤드는 전략적 중량 분담을 통해 상당한 매개변수 절감을 이루면서 다중 스케일 핵융합 능력을 유지합니다. MPDIoU 손실 함수는 작고 불규칙한 표적의 위치 정확도를 향상시킵니다. 실험적 검증 결과, 제안된 모델이 기준선에 비해 매개변수와 계산 복잡도를 크게 줄이면서도 엣지 하드웨어 플랫폼에서 실시간 추론 성능을 유지하면서 우수한 검출 정확도를 달성함을 입증했습니다. 정량적 해석 가능성 분석은 탐지 결정이 주로 저주파 구조적 특징에 의해 좌우된다는 것을 보여주며, 이는 모델의 추론 과정을 투명하게 이해할 수 있게 합니다. 주류 검출 모델과의 비교 실험은 제안된 접근법의 우수한 정확도-효율성 절충관계를 검증합니다. 이 연구는 전력 운영에서 자동화된 안전 감독을 위한 투명하고 효율적이며 신뢰할 수 있는 솔루션을 확립하며, 엣지 배치와 해석 가능한 의사결정이 필요한 안전 중요 탐지 작업에 더 폭넓게 적용할 수 있도록 합니다.
딥러닝은 산업 안전 프로토콜을 혁신하고 산업위험 관리에 새로운 접근법을 도입했습니다. 이러한 변화는 특히 전력 시스템 공학과 같은 고위험 분야에서 두드러집니다. 비전 기반 지능형 감독 시스템은 이제 YOLO(You Only Look Once)1 아키텍처를 활용하여 개인 보호 장비(PPE)2,3의 실시간 자동 탐지를 가능하게 합니다. 이 시스템들은 직장 내 안전 모니터링에 중요한 기술로 부상했으며, 전통적인 방법에 비해 탐지 정확도와 대응 속도에서 크게 향상되었습니다.
이 시스템들은 안전 기준 준수를 지속적으로 모니터링하여 인적 오류를 줄이고 복잡한 전력 운영 현장에서의 감독을 향상시킵니다. 그러나 이 시스템들의 심층 신경망은 상당한 도전 과제를 제시합니다: 의사결정 과정은 여전히 불투명합니다. 이러한 해석 가능성의 부재는 특히 신뢰 구축과 책임성 확보에 필수적인 안전 중요 응용 분야에서 산업 전반에 적용되는 주요 장애물입니다.
모델이 잘못된 판단을 내리거나, 비준수 근로자를 누락하거나, 불필요한 운영 중단을 유발할 경우, 불투명한 의사결정 과정은 안전 관리자에게 실행 가능한 정보를 제공하지 않습니다. 오류 진단, 시스템 추론 이해, 의사결정 검증 능력이 없으면, 이러한 시스템은 인간의 안전이 걸려 있는 환경에서 요구되는 신뢰성 기준을 충족할 수 없습니다. 이 격차는 정확성과 투명성을 모두 제공하는 설명 가능한 인공지능(XAI)4,5,6 접근법에 대한 수요를 증가시켰습니다. 목표는 안전 인력이 중요한 운영 상황에서 이해하고 검증하며 신뢰할 수 있는 시스템을 개발하는 것입니다.
투명성은 여전히 필수적이지만, 도전적인 운영 조건에서도 신뢰성 있게 작동하는 모델 위에 구축되어야 합니다. 전력 운영 부지는 견고한 탐지 능력이 필요한 독특한 기술적 요구를 제공합니다. 이 환경들은 강렬한 낮부터 완전한 어둠까지 극심한 조명 변화를 경험합니다. 복잡한 기계가 시야를 자주 가려 표준 검출 모델이 해결하기 어려운 폐쇄 문제를 만듭니다. 기상 조건은 다양한 운영 시나리오에서 가시성과 화질에 영향을 미치며 추가적인 변동성을 더합니다. 이러한 도전을 해결하려면 환경적 복잡성에도 불구하고 일관된 성능을 유지하는 모델이 필요합니다.
연구자들은 전력 사이트 애플리케이션에서 YOLO 성능을 최적화하기 위해 다양한 접근법을 추구해 왔습니다. 건축적 변형은 중요한 연구 방향 중 하나를 대표합니다. 여러 연구에서 경부 구조 내에 추가 검출 헤드를 포함시켜 YOLOv57 네트워크를 강화했습니다. 이 수정은 PPE 탐지에서 지속적으로 존재하는 도전 과제인 먼 거리나 복잡한 시야에서 작은 물체를 식별하는 어려움을 해결합니다. 추가 감지 계층은 표준 아키텍처가 놓칠 수 있는 더 세밀한 공간 세부사항을 포착할 수 있게 합니다.
두 번째 주요 연구 방향은 배포 환경을 위한 모델 최적화에 초점을 맞추고 있습니다. 전력 운영 현장은 제한된 컴퓨팅 자원으로 엣지 장치에서 동작하는 감지 시스템이 자주 필요합니다. 이러한 제약은 모델 압축과 효율성 개선 노력을 촉진했습니다. 연구진은 모델 크기와 추론 시간을 줄이면서도 탐지 정확도를 유지하는 기법을 개발하여, 처리 능력이 제한된 하드웨어에서 실시간 성능을 가능하게 했습니다 8,9.
최근의 최적화 노력은 모델 복잡도를 줄이기 위한 여러 유망한 기법을 도입했습니다. 연구진은 MobileNetv310 과 같은 효율적인 백본 네트워크를 YOLO-M11과 같은 아키텍처에 통합했습니다. 다른 연구자들은 모델 가지치기와 지식 정류를 적용해 Light-YOLOv412를 포함한 컴팩트 변형을 개발했습니다. 이러한 접근법들은 계산 효율성과 배포 실현 가능성에서 측정 가능한 개선을 입증했습니다.
그러나 이러한 최적화 방법들은 기존의 컨볼루션 아키텍처에 내재된 근본적인 제약에 직면해 있습니다. 표준 컨볼루션 연산은 수용 영역을 확장하기 위해 점점 더 깊은 네트워크 계층이나 더 큰 커널 크기를 요구하며, 이는 이미지 전반에 걸친 맥락 정보를 포착하는 데 필수적입니다. 이 아키텍처적 요구사항은 불가피한 상충관계를 만듭니다. 모델이 더 풍부한 특징을 추출하고 더 넓은 공간적 맥락을 이해할 수 있게 되면서, 매개변수 수와 계산 요구량이 크게 증가합니다. 결과적으로 생성된 모델들은 종종 엣지 장치의 처리 능력을 초과하여 실시간 운영 환경에서의 실질적 배포를 제한합니다.
특징 추출 능력과 계산 효율성 간의 이러한 긴장은 현재 접근법이 완전히 해결하지 못한 중요한 방법론적 도전 과제입니다. 이 분야는 기존 방법들이 요구하는 매개변수의 비례적 증가 없이 계층적 다중 규모 특징을 포착할 수 있는 근본적으로 다른 특징 추출 접근법을 요구한다. 이러한 접근법은 모델이 안전에 중요한 애플리케이션에 필요한 탐지 성능과 엣지 배포에 필요한 효율성을 모두 유지할 수 있게 할 것입니다. 이 격차를 해소하는 것은 전력 운영 환경에서 실용적인 PPE 탐지 시스템을 발전시키는 데 있어 중요한 연구 우선순위입니다.
현재 객체 탐지에 대한 설명 가능성 방법은 주로 Grad-CAM과 같은 사후 분석 접근법을 사용합니다. 이러한 방법들은 유용한 시각화를 제공하지만, 모델의 학습 과정과는 독립적으로 작동합니다. 또 다른 접근법은 운영 메커니즘을 통해 투명성을 제공하는 아키텍처 구성 요소를 설계하는 것입니다. 우리의 웨이블릿 기반 특징 추출은 어떤 주파수 성분이 검출에 기여하는지 이해하는 직관적인 방법을 제공하지만, 이 해석 가능성을 완전히 정량화하려면 추가 연구가 필요합니다.
본 연구는 PPE 탐지 시스템에서 세 가지 상호 연결된 도전 과제인 탐지 정확도, 계산 효율성, 모델 해석 가능성을 다룹니다. 이 작업은 YOLOv11n15 아키텍처를 세 가지 목표 설계 변경을 통해 수정합니다.
첫 번째 수정은 표준 컨볼루션을 웨이블릿에서 영감을 받은 특징 추출 프로세스로 대체하는 C3K2-WTConv 모듈을 도입합니다. 이 접근법은 시각 정보를 주파수 구성 요소로 분리합니다: 저주파 신호는 형태와 윤곽 정보를 담고, 고주파 신호는 질감과 가장자리 세부 정보를 인코딩합니다. 이 분리는 특징 품질을 향상시키고 추출 과정을 기존 컨볼루션 연산보다 더 투명하게 만듭니다.
두 번째 개량은 계산 요구량을 줄이기 위해 경량 공유 복합 검출 헤드(LSCD)를 구현합니다. 이 구성 요소는 검출 척도 간 매개변수 공유를 사용하여 모델 크기를 줄이면서 다중 척도 검출 기능을 유지합니다. 이 설계는 전력 운영 현장에서 사용되는 엣지 장치에서 흔히 발생하는 자원 제약을 겨냥합니다.
세 번째 수정은 표준 손실 함수를 MPDIoU 손실16 으로 대체하여 경계 박스의 정확도를 향상시킵니다. 이 변화는 작고 모양이 다양한 개인 보호 장비(PPE)에서 발생하는 위치 문제를 해결하기 위해 훈련 중 더 나은 경사 안정성을 제공합니다.
테스트 결과, 수정된 모델은 기준선보다 평균 정밀도가 3.8% 더 높고, 매개변수 수는 11.5% 적습니다. 이 결과는 이 접근법이 엣지 배포의 실용적 요구사항을 충족하면서도 탐지 성능을 향상시키고 있음을 보여줍니다. 이 연구는 전력 운영 시 안전 모니터링을 위한 기능적 해결책을 제공하지만, 시스템 신뢰성을 완전히 평가하기 위해서는 다양한 운영 조건에서의 추가 검증이 여전히 필요합니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 연구의 이미지 데이터는 필요한 허가를 받은 전력 운영 환경에서 수집되었습니다. 모든 이미지는 익명으로 처리되었으며 개인 식별 정보는 유지되지 않았습니다. 이 연구는 개인을 식별하기보다는 개인 보호 장비 탐지에 중점을 둡니다. 이 연구는 익명 데이터를 이용한 알고리즘 개발만을 포함하므로 윤리적 승인은 필요하지 않았습니다.
다음 프로토콜은 개인 보호 장비(PPE) 탐지용으로 경량화되고 고성능이며 본질적으로 해석 가능한 객체 탐지 모델인 WTLS-YOLOv11n을 설계, 훈련 및 평가하는 포괄적인 절차를 상세히 설명합니다. 이 연구에 사용된 소프트웨어는 재료표에 나열되어 있습니다.
전체 아키텍처 프레임워크
제안된 WTLS-YOLOv11n 모델은 YOLOv11n 기준선을 기반으로 구축되었습니다. 핵심 방법론은 성능, 효율성, 해석 가능성을 향상시키기 위해 백본과 헤드의 핵심 모듈을 체계적으로 교체하거나 강화하는 것을 포함합니다.
제안된 WTLS-YOLOv11n 모델은 YOLOv11n 기준선을 기반으로 구축되었습니다. 핵심 방법론은 성능, 효율성, 해석 가능성을 향상시키기 위해 백본과 헤드의 핵심 모듈을 체계적으로 교체하거나 강화하는 것을 포함합니다. YOLOv11n의 전체 아키텍처 패러다임인 척추, 목, 머리로 구성되어 제안된 모델에 유지되었습니다. 백본에서는 특정 C3K2 모듈이 제안된 C3K2-WTConv 모듈로 대체되어 특징 추출을 강화했습니다. 헤드에서는 모델의 복잡성을 줄이기 위해 원래의 검출 헤드가 제안된 경량 공유 복합 검출 헤드(LSCD)로 교체되었습니다. 제안된 WTLS-YOLOv11n 모델의 전체 아키텍처는 기본 모델과 대비되어 그림 1에 나와 있습니다.
C3K2-WTConv 모듈 설계
이 모듈은 YOLOv11n 백본 내의 표준 컨볼루션 모듈을 대체하도록 설계되었습니다. 설계는 두 가지 주요 목표에 의해 이끌립니다: (a) 매개변수 수나 계산 복잡도를 크게 증가시키지 않고 다중 규모 맥락 정보를 포착할 수 있도록 모델의 수용 필드를 효율적으로 확장하는 것, (b) 특징 맵을 명시적으로 주파수 영역으로 분해하여 보다 견고하고 본질적으로 해석 가능한 특징 표현을 학습하는 것.
코어 WTConv 계층 설계
기초적인 WTConv(웨이블릿 변환 컨볼루션) 계층은 2차원 이산 하르 웨이블릿 변환을 구현하도록 설계되었습니다. 이 과정은 특정 웨이브릿 커널 집합을 통해 이루어집니다:
웨이블릿 커널: 변환은 네 개의 고정된, 비훈련 가능한 깊이별 컨볼루션 커널(F_LL, F_LH, F_HL, F_HH) 을 통해 구현되며, 이는 하르 웨이브릿 기저 함수에 대응합니다. 이 커널들은 입력 특징 사상을 저주파 및 고주파 성분으로 분해하는 역할을 합니다.
분해 및 다운샘플링: 이 커널들은 입력 특징 사상(X)에 스트라이드 2로 적용됩니다. 이 단일 연산은 특징 분해와 공간 다운샘플링을 모두 효율적으로 수행하여 입력을 네 개의 뚜렷한 서브 밴드로 분리합니다.
출력 구성 요소의 물리적 해석
웨이블릿 분해로 생성된 네 가지 특징 하위 대역은 명확한 물리적 해석을 가진다. 그림 2에서 볼 수 있듯이, WTConv 계층은 입력을 다음 구성 요소로 재귀적으로 분해합니다:
저주파 성분(LL): 이 성분은 공간 해상도의 절반으로 대상의 전체 구조, 윤곽 및 기타 글로벌 정보를 보존합니다. 이는 모델이 목표물의 '형태'를 이해하는 기초 역할을 합니다.
고주파 성분(LH, HL, HH): 이 세 성분은 각각 수평, 수직, 대각선 모서리와 텍스처와 같은 세밀한 디테일을 포착합니다. 이들은 모델이 대상의 '세부 사항'에 집중할 수 있게 합니다.
C3K2 모듈 구조로의 통합
설계된 WTConv 계층은 YOLOv11n의 C3K2 병목 구조에 자연스럽게 통합됩니다.
대체 전략: 원래 C3K2 모듈 내에서 표준 3x3 합성곱 계층이 WTConv 계층으로 대체됩니다. 이 접근법은 C3K2 아키텍처의 효율적인 특징 재사용 메커니즘을 유지하면서 웨이블릿 변환의 장점을 도입하여 최종 C3K2-WTConv 모듈(상세 구조는 그림 3에 나타남)을 탄생시켰습니다.
계단 수용 필드 확장: WTConv 과정은 이전 단계의 저주파(LL) 출력에 재귀적으로 적용할 수 있습니다. 이 연쇄 분해 메커니즘은 최소한의 계산 오버헤드로 기하급수적으로 증가하는 수용 필드 위의 특징을 분석하여 효율적인 다중 규모 주파수 분해 경로를 생성할 수 있게 합니다.
경량 공유 복합 재킷 감지 헤드(LSCD) 설계
이 모듈은 원래의 YOLOv11n 감지 헤드를 대체하도록 설계되었으며, 주요 목표는 모델 복잡성과 계산 오버헤드를 대폭 줄여 자원이 제한된 엣지 장치에서 효율적으로 배포하는 것입니다. 이 설계는 표준 다중 스케일 검출 헤드( 그림 4에 상세 구조 참조)에서 발견되는 상당한 매개변수 중복성을 다룹니다.
근거와 설계 목표
원래 YOLOv11 헤드의 각 특징 척도(P3-P5)에 대한 독립적인 예측 분기는 높은 매개변수 수를 초래합니다. LSCD는 중요한 다중 규모 특징 융합 능력을 유지하면서 우수한 매개변수 효율성을 달성하기 위한 하이브리드 매개변수 공유 전략을 도입합니다.
매개변수 공유 및 특징 융합 메커니즘
LSCD의 핵심은 2단계 특징 처리 파이프라인에 있습니다:
스케일별 전처리: 목(P3, P4, P5)에서 입력된 각 특징 맵마다 비공유 1x1 합성곱 합성 후 그룹 정규화(GN) 계층이 적용됩니다. 이 초기 단계를 통해 네트워크는 스케일별 채널 변환을 학습할 수 있어, 융합 전에 각 특징 수준의 고유한 특성을 보존할 수 있습니다.
효율적인 크로스 스케일 융합: 전처리 후, 여러 개의 공유 3x3 컨볼루션-GN 모듈을 사용하여 다양한 스케일에서 핵심 특징 융합을 수행합니다. 가중치를 공유함으로써 이 모듈들은 매개변수 감소의 주요 원천인 일반화된 특징 융합 패턴을 학습합니다. 이 설계는 모델이 보다 견고하고 보편적인 핵융합 표현을 학습하도록 강요합니다.
동적 스케일 적응과 분기 최적화
체중 분담으로 인한 정보 손실을 보완하고 예측 정확도를 개선하기 위해 두 가지 추가 메커니즘이 도입되었습니다:
학습 가능한 스케일 레이어: 각 검출 스케일마다 학습 가능한 스케일 레이어가 추가됩니다. 이 계층은 융합된 특징을 동적으로 재가중치하는 스케일별 학습 가능한 스칼라를 도입하여, 모델이 해당 스케일에서 일반적인 대상 객체 크기에 따라 특징을 적응적으로 강조하거나 억제할 수 있게 합니다.
최적화된 분류 분기: 분류 분기는 확률 분포를 위한 Softmax 활성화 함수를 사용하고 그룹 정규화(GN) 계층을 통합하여 강화됩니다. 이로 인해 분류 과제의 훈련이 안정화되고, FCOS와 같은 아키텍처에서 효과적인 기법인 신뢰도 예측의 견고성을 향상시킵니다.
개선된 손실 함수 설계(MPDIoU)
손실 함수는 PPE 탐지 시나리오에서 흔히 볼 수 있는 작고 복잡하며 불규칙한 표적에 대한 정확한 경계 박스 회귀 문제를 해결하기 위해 재설계되었습니다.
전통적인 IOU 손실의 동기와 한계
표준 IoU 기반 손실은 이 맥락에서 몇 가지 치명적인 단점을 겪습니다:
사라지는 구배: 예측 박스와 그라운드 트루스 박스가 겹치지 않을 때, IoU는 0이 되고 손실 기울기가 사라져 학습 과정이 정체됩니다.
정렬에 대한 민감도가 낮다: 여러 경계 박스 구성이 동일한 IoU 점수를 낼 수 있어, 손실 함수는 정렬의 품질(예: 중심점 편차와 형태 불일치)에 둔감해집니다.
작은 물체에서의 낮은 성능: 작은 목표물의 경우 미세한 픽셀 편차도 상당할 수 있지만, 이는 종종 IoU 값에 미미한 변화를 초래하여 정확하지 않은 위치 파악을 초래합니다.
최소 점거리 IoU(MPDIoU) 손실 채택
앞서 언급한 한계를 극복하기 위해 프로토콜은 표준 손실을 최소 지점 거리 IoU(MPDIoU) 손실로 대체합니다. MPDIoU는 예측 박스와 실제 진실 박스 사이의 거리를 직접적으로 페널티 조건으로 포함시켜 표준 IoU 지표를 강화합니다. 심지어 겹치지 않더라도 말입니다.
핵심 메커니즘: 벌칙 항은 예측 상자(pred)와 진실 상자(gt)의 해당 모서리 점 사이의 유클리드 거리에서 도출됩니다. 구체적으로, 왼쪽 위 모서리
)와 오른쪽 아래 모서리
()의 제곱 거리를 계산합니다:
(1)
(2)
벌칙이 척도에 불변하도록 하기 위해, 이 거리는 예측 상자와 실제 진실 상자를 모두 포함하는 가장 작은 인클로잉 박스의 크기로 정규화됩니다. w 와 h 를 각각 이 포괄 상자의 너비와 높이라고 하자. MPDIoU 지표는 다음과 같이 공식화됩니다:
(3)
마지막으로, MPDIoU 손실 함수(LMPDIoU)는 다음과 같이 정의됩니다:
LMPDIoU = 1 - MPDIoU (4)
주요 장점: 이 기하학적 벌점 용어는 앞서 언급한 문제를 직접적으로 해결합니다: i) 박스가 겹치지 않아도 의미 있는 0이 아닌 구배를 제공하여 기울기가 사라지는 것을 방지하고 연속적인 모델 최적화를 보장함, ii) 위치, 크기, 종횡비 편차에 대한 민감도를 높여 작고 다양한 PPE 항목의 정확한 위치 지정에 필수적입니다. iii) 훈련 전반에 걸쳐 더 안정적이고 일관된 구배 신호를 전달하여 더 빠른 수렴을 촉진하고 우수한 위치 정확성을 가져옵니다.
데이터셋 및 실험 설정
자체 구축한 PPE 탐지 데이터셋
우리는 전력 송전선 작업에서 수집된 5,000장의 고해상도 이미지를 포함하고, LabelImg로 주석을 달고 YOLO TXT 형식으로 변환한 PPE 탐지 데이터셋을 구축했습니다. 데이터셋에는 안전 헬멧(1,245건), 안전 하네스(1,128건), 팔찌(892건), 고소 작업 상태(1,056건), 지상 상태 (1,124건)의 다섯 가지 범주가 포함되어 있습니다. 데이터는 훈련(4,000장), 검증(500장), 테스트(500장) 세트로 나뉩니다. 이미지는 극한 조명, 심한 가림(23% >50% 범위), 복잡한 산업 배경 등 도전적인 환경을 특징으로 합니다. 훈련 중에 표준 증강 기법(무작위 뒤집기, 회전, 색상 지터, 모자이크)이 적용되었습니다.
일반화 테스트를 위한 PASCAL VOC 데이터셋
모델 일반화 능력을 전력 운영 시나리오를 넘어 평가하기 위해, VOC2007와 VOC2012을 결합한 총 21,503장의 이미지를 수집한 PASCAL VOC 데이터셋을 사용했습니다. 표준 관행에 따라 학습 및 검증에 VOC2012에서 11,540장의 이미지를, 테스트에는 VOC2007에서 9,963장의 이미지를 사용했습니다. VOC 데이터셋은 다양한 실제 상황에서 20개의 객체 카테고리를 포함하고 있습니다. 특정 객체는 PPE 범주와 다르지만, 검출 과제(스케일 변동, 가림, 복잡한 배경)는 유사하여 모델의 일반적인 탐지 능력과 전이 가능성을 평가하기에 적합합니다.
구현 세부사항
이 프로토콜은 모델을 훈련하고 평가하는 절차를 설명합니다. 사용자가 소스 코드, 적합한 Python 환경, 준비된 데이터셋에 접근할 수 있다고 가정합니다.
시스템 및 환경 준비
학습을 위한 충분한 메모리를 확보하기 위해 최소 24GB VRAM을 탑재한 NVIDIA GPU가 탑재된 워크스테이션(예: NVIDIA GeForce RTX 4090)이 사용되었습니다. PyTorch 딥러닝 프레임워크(버전 1.12.0 이상)와 그에 해당하는 CUDA 툴킷이 워크스테이션에 설치되었습니다. 설치 여부는 터미널을 열고 "python -c 'import torch; "true"를 반환할 것으로 예상되는 print(torch.cuda.is_available())'". 필요한 Python 패키지는 프로젝트 루트 디렉터리로 이동해 "pip install -r requirements.txt" 명령을 실행하여 설치했습니다. 이 명령어는 numpy, opencv-python, pyyaml, tensorboard, torchvision 등 의존성을 자동으로 설치했습니다. 데이터셋 준비를 통해 학습 이미지가 /data/train/images/ 위치에 위치하고, 주석 파일이 YOLO 형식(클래스 x_center y_center 너비 높이)으로 /data/train/labels/ 형식으로 표시되도록 검증되었습니다. 동일한 검증 과정이 검증(/data/val/)과 테스트(/data/test/) 데이터셋에도 적용되었습니다.
훈련 구성
config 파일 config/wtls_yolov11n.yaml은 텍스트 편집기를 사용해 열어 훈련 매개변수를 설정했습니다. 데이터 경로는 'path' 매개변수를 찾아 데이터셋 루트 디렉터리에 설정하는 방식으로 구성되었으며, 'train', 'val', 'test' 매개변수가 올바른 하위 디렉터리를 가리키는지 검증되었습니다. 'nc' 매개변수(클래스 개수)는 PPE 탐지용으로 5로 설정된 데이터셋과 일치하는 것으로 확인되었습니다. 훈련 하이퍼파라미터는 전체 학습을 위한 에포크 수를 300으로 설정하고 배치 크기를 16으로 설정했으며, GPU 메모리 가용성에 따라 이 값은 조정될 수 있고 메모리 초과 오류가 발생하면 8로 줄일 수 있다는 점을 이해하고 있었습니다. 입력 이미지 크기(imgsz)는 640으로 설정되었고, 옵티마이저는 초기 학습률(lr0)이 0.01인 SGD로 확인되었습니다. 무게 감쇠는 0.0005로 확인되었고, 운동량은 0.937로 설정되었습니다. 데이터 증강 기법은 기본 설정 설정을 사용하여 활성화되었으며, 여기에는 모자이크 증강(모자이크: 1.0), 50% 확률의 무작위 수평 뒤집기, 그리고 hsvh: 0.015, hsvs: 0.7, hsvv : 0.4 파라미터의 색상 지터가 포함되었습니다. 하드웨어 활용 매개변수는 데이터 로딩에 사용되는 CPU 스레드의 워커 수를 8개로 설정하고, 첫 번째 GPU를 사용할 때 장치 매개변수를 0으로 설정했으며, 필요 시 다중 GPU 훈련을 위해 "0,1"으로 설정할 수 있었습니다.
모델 훈련 실행
모델 학습은 명령줄에서 "python train.py --cfg config/wtls_yolov11n.yaml --weights ''--data data.yaml"이라는 명령어를 실행하여 초기화되었으며, --cfg 매개변수는 모델 구성 파일을 지정하고, --weights 매개변수는 빈 문자열로 설정되어 처음부터 훈련했으며(또는 전이 학습에 yolov11n.pt 사용 가능), --data 매개변수는 데이터셋 구성을 지정했습니다. 훈련 중에는 모델 성능을 추적하기 위해 수렴 지표가 관찰되었습니다. 처음 50개 에포흐 동안 손실 감소가 관찰되었고, box_loss은 약 1.5에서 0.8로 감소했습니다. 50년과 150년 사이에는 box_loss가 약 0.8에서 0.5로 감소하며 꾸준한 개선이 관찰되었습니다. 150년에서 300년기까지는 미세 조정 단계가 진행되어 box_loss 약 0.4에서 0.5 사이에서 안정화되었습니다. 검증 mAP@0.5 지표는 200년 에포크까지 85% 이상에 도달할 것으로 예상되었습니다. 체크포인트 저장은 훈련이 10에포크마다 자동으로 체크포인트를 runs/train/exp/weights/ 디렉터리에 저장하도록 검증되었습니다. last.pt(가장 최근 체크포인트)와 best.pt(최고 mAP 체크포인트)의 존재가 확인되었으며, 각 체크포인트 파일 크기는 약 5MB에서 6MB 정도로 예상됩니다. 학습 진행 상황은 선택적으로 TensorBoard를 사용하여 새 터미널을 열고 "tensorboard --logdir runs/train" 명령을 실행한 후 브라우저로 http://localhost:6006 로 이동해 손실 곡선, 학습률 일정, mAP 추세의 실시간 그래프를 확인할 수 있었습니다. 일반적인 문제들은 문제 해결 절차를 통해 해결되었는데, CUDA 메모리 초과 오류는 배치 크기를 8개 또는 4개로 줄여 해결했고, NaN 손실 값은 학습률을 0.005로 낮춰 해결했으며, mAP 정체기는 주석 정확성 검증과 학습 에포크를 400으로 늘려 80% 미만으로 조사했습니다.
모델 평가 프로토콜
제안된 모델의 효과성, 효율성 및 해석 가능성을 포괄적으로 검증하기 위해 다면적인 평가 절차가 수행되었습니다.
정량적 성과 평가
성능 지표
평균 정밀도(mAP)를 사용하여 IoU 임계값 0.5(mAP@0.5), 정밀도, 회상 정확도를 평가합니다. 전체 매개변수(M)와 부동소수점 연산(FLOP, G)의 수를 측정하여 모델 효율성을 평가합니다. 서버급 GPU와 엣지 장치 모두에서 추론 속도를 프레임 분당 초(FPS) 단위로 측정할 수 있습니다. 엣지 디바이스 테스트에서는 전력 모드를 최대 성능으로 설정하고, 500장 이상의 테스트 이미지를 녹화하기 전에 100개의 더미 추론으로 모델을 워밍업하세요.
최첨단 모델과의 비교: 제안된 WTLS-YOLOv11n 모델을 직접 기준선(YOLOv11n) 및 주류 CNN 기반 YOLO 모델(YOLOv5n, YOLOv8n, YOLOv9s), 2단계 검출기(Faster R-CNN), 트랜스포머 기반 검출기(RT-DETR) 등 다양한 검출기와 비교해 벤치마킹합니다. 권장 기본 하이퍼파라미터를 사용해 300 에포흐 동안 모든 모델을 훈련시키세요. 자체 구축 PPE 데이터셋과 PASCAL VOC 데이터셋 모두에서 각 모델의 성능 지표 섹션에 정의된 모든 지표를 기록하세요. VOC 평가를 위해서는 VOC2012 트레인밸과 VOC2007 트레인밸 세트를 결합한 후 표준 프로토콜에 따라 VOC2007 테스트 세트에서 테스트하세요.
절제 연구: 제안된 구성 요소들의 개별 기여도를 분석하기 위해 체계적인 소작 연구를 수행합니다.
구성 요소 효과 분석: 기본 YOLOv11n 모델에서 시작하여 C3K2-WTConv 모듈, LSCD 헤드, MPDIoU 손실을 점진적으로 통합합니다. 각 구성에 대해 동일한 하이퍼파라미터(배치 크기 16, 학습률 0.01, SGD 최적화기)를 사용하여 300 에포크에 대해 모델을 재학습합니다. mAP, 정밀도, 리콜, 파라미터, FLOP, FPS의 변화를 기록하여 각 구성 요소의 효능을 검증합니다. 각 지표별로 기준선에 비해 개선 비율을 계산하세요.
배치 분석: C3K2-WTConv 모듈의 최적 위치를 결정하기 위해 네트워크 아키텍처의 여러 부분에 통합합니다. 세 가지 구성을 테스트합니다: (i) 백본 단일, (ii) 목 단일, (iii) 백본과 목 모두에서의 완전 통합. 각 구성을 300 에포크에 대해 훈련시키고, 결과 mAP@0.5 점수를 비교하여 가장 효과적인 통합 전략을 도출합니다. 이후 모든 실험에서 최적의 구성을 선택하세요.
정성적 성과 평가
검출 결과 시각화: 강한 백라이트, 심한 물체 가림, 복잡한 배경, 독특한 카메라 앵글 등 실제 상황을 대표하는 12-15장의 대표 이미지를 테스트 세트에서 선택하세요. 각 비교 모델(기준선, YOLOv5n, YOLOv8n, YOLOv9s, WTLS-YOLOv11n)에 대해 신뢰 임계값 0.25와 IoU 임계값 0.45를 사용하여 추론을 실행합니다. 이 이미지들에 검출 출력(클래스 라벨과 신뢰도 점수가 포함된 경계 상자)을 생성하고 렌더링합니다. 행은 서로 다른 시나리오를, 열은 서로 다른 모델을 나타내는 격자 형식으로 시각화를 배열합니다.
강건성 분석: 서로 다른 모델에서 렌더링된 감지 출력을 시각적으로 비교합니다. 제안된 모델의 견고성과 우수성을 평가하여 거짓 음성(놓친 물체), 위양성(잘못된 탐지), 중복 탐지(예측 간 IoU > 0.7인 단일 물체에 대해 여러 상자 발생)의 사례를 세고 표시합니다. 시각화 도표에서 문제 발견을 강조하는 데 빨간 원을 사용하세요. 선택한 테스트 이미지에서 모델별 거짓 음성률과 위양성 수를 계산합니다. 모델 간 진양성 검출의 평균 신뢰 점수를 추출하여 비교합니다.
해석 가능성 분석
C3K2-WTConv 모듈이 부여한 해석 가능성을 검증하기 위해, 선택된 입력 이미지에 대해 시각화 절차가 수행되었습니다. 훈련된 WTLS-YOLOv11n 모델이 로드되었고, 백본 4층에 위치한 C3K2-WTConv 모듈에 전방 후크가 등록되었습니다. 입력 이미지에 순방향 전파가 수행되었고, 출력 특징 텐서가 캡처되었습니다. 포착된 특징 텐서(형태 [배치, 채널, 높이, 폭]에서 서로 다른 주파수 성분에 대응하는 채널들이 분리되었습니다. 채널의 처음 25%는 저주파(LL) 구성요소로 지정되었고, 나머지 75%는 고주파(LH, HL, HH) 구성 요소로 지정되었습니다. 각 주파수 구성 요소 유형에 대해 해당 구성 요소 내 모든 채널의 평균을 계산하여 단일 채널 활성화 맵을 생성했습니다. 강한 활성화를 강조하기 위해 필요할 때 공간적 차원에 걸쳐 L2 정규를 적용하였다. 활성화 맵은 범위 [0, 1]로 정규화되었고, 색상 맵(예: '제트' 컬러맵)이 적용되었습니다. 히트맵은 이중 선형 보간을 사용해 원래 입력 이미지 해상도에 맞게 재조정되었습니다. 저주파 히트맵과 고주파 히트맵은 원본 이미지 위에 40% 투명도로 겹쳐져 모델이 구조적 특징과 텍스처적 특징 중 어디에 집중하는지 해석 가능한 시각화를 만들었습니다.
탐지 결정이 주파수 영역 특성에 의존한다는 것을 엄격히 검증하기 위해 정량적 분석이 수행되었습니다. 테스트 세트에서 성공한 발견(신뢰도가 0.5 이상)을 포함한 200장에서 300장의 이미지 하위 집합이 선정되었습니다. 이 하위 집합은 표본 편향을 피하기 위해 다양한 시나리오를 대표하도록 보장되었습니다. 서브셋의 각 이미지에 대해 순방향 전파가 수행되었고, 4번째 백본 계층에서 C3K2-WTConv 모듈의 출력이 추출되었습니다. 특징 텐서는 저주파(LL, 채널의 처음 25%)와 고주파(HF, 나머지 75%의 채널) 성분으로 분리되었습니다. 각 이미지에 대해 두 주파수 성분의 공간 차원(높이 및 너비)에 걸쳐 평균 절대 활성화 강도를 계산하였습니다. LL 강도는 모든 공간 위치에 걸친 LL 특징의 절대값의 평균으로, HF 강도는 모든 공간 위치에 걸친 HF 특징의 절대값 평균으로 계산되었습니다. 이 값들은 해당 이미지의 최대 검출 신뢰도 점수와 함께 기록되었습니다. 수집된 데이터(LL_strength, HF_strength, confidence_score)를 사용하여 모든 이미지에서 피어슨 상관계수를 계산했습니다. LL 강도와 신뢰 점수 간의 상관관계, HF 강도와 신뢰 점수 간의 상관관계를 계산하였습니다. 통계 소프트웨어나 파이썬의 scipy.stats.pearsonr 함수를 사용하여 상관계수(r)와 p-값을 모두 얻었습니다. 통계적 유의성은 p-값 임계값 0.05를 사용하여 평가되었으며, p-값이 0.05 미만이면 상관관계가 통계적으로 유의미함을 나타냅니다. 상관계수 크기와 비교하여 어떤 주파수 구성 요소가 검출 신뢰도와 더 강한 연관성을 가졌는지 확인하였습니다. 다음 지표들이 구조화된 형식으로 기록되었습니다: LL 상관계수(rLL) 및 p-값(pLL), HF 상관계수(rHF) 및 p-값(pHF), 평균 활성화 강도(meanLL, meanHF), 그리고 샘플 크기(분석된 이미지 수). 예상 결과는 저빈도 특징이 신뢰 점수(rLL 0.60 이상, p 0.001 미만)와 더 강한 양상관관계를 보였으며(rHF 약 0.40에서 0.50, p 0.01 미만), 이는 탐지 결정이 주로 LL 구성 요소에 포착된 구조 정보에 의해 좌우되었음을 나타냈다.
이 정량적 분석은 정성적 시각화의 한계를 넘어서는 해석 가능성을 확립했습니다. 상관관계 분석(통계적 연관성 입증)과 주파수 영역 시각화(공간적 주의력 보여줌)의 결합은 모델의 의사결정이 설계상 의도된 저주파 구조적 특징에 실제로 의존하고 있음을 엄밀한 실증적 증거로 제공했습니다.
예상 결과: 저주파 특징은 신뢰 점수(rLL > 0.60, p < 0.001)와 더 강한 양의 상관관계를 보여야 하며, 이는 고빈도 특징(rHF≈ 0.40-0.50, p < 0.01)보다 더 강하게 양의 상관관계를 보여야 하며, 이는 탐지 결정이 주로 LL 성분에 포착된 구조 정보에 의해 결정된다는 것을 시사한다.
이 정량적 분석은 정성적 시각화를 넘어선 해석 가능성을 확립합니다. 상관관계 분석(통계적 연관성 입증)과 주파수 영역 시각화(공간적 주의력 보여줌)의 결합은 모델의 의사결정이 설계상 의도된 저주파 구조적 특징에 실제로 의존한다는 엄격한 실증적 증거를 제공합니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
제안된 WTLS-YOLOv11n 모델의 성능을 평가하기 위해, 자체 구축한 PPE 데이터셋과 PASCAL VOC 2007+2012 데이터셋에서 실험을 수행하였습니다. 모든 지표는 별도의 명시가 없는 한 해당 테스트 세트에 보고됩니다.
최첨단 모델과의 비교
우리는 WTLS-YOLOv11n을 세 가지 아키텍처 패러다임에서 주류 객체 검출기와 비교해 벤치마킹했습니다: CNN 기반 YOLO 모델(YOLOv5n, YOLOv8n, YOLOv9t, YOLOv11n), 2단계 검출기(Faster R-CNN), 그리고 Transformer 기반 검출기(ResNet-18 백본 적용 RT-DETR). 종합적인 결과는 표 1에 제시되어 있습니다.
제안된 WTLS-YOLOv11n은 90.1%의 mAP@0.5를 달성하며 모든 비교 모델을 능가합...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
실험 결과는 WTLS-YOLOv11n이 YOLOv11n 기준선에 비해 매개변수를 11.5% 감소시키면서 90.1% mAP를 달성함을 보여줍니다. 이러한 정확도와 효율성 향상은 웨이블릿 기반 특징 추출, 경량 검출 헤드 설계, 개선된 위치 손실 세 가지 구성 요소의 시너지 통합에서 비롯됩니다.
소작 연구에 따르면 C3K2-WTConv 모듈이 개별 성능 향상 중 가장 큰 성능을 제공하며, mAP를 86.3%에서 89.1%로 끌어올렸습니다. 이는 주파수 영역 특징 분해가 구조 정보(저주파)와 텍스처 세부사항(고주파)을 분리하여 PPE 탐지에 이점을 제공함을 시사합니다. 이러한 분리는 모델이 견고한 객체 특성에 집중하는 데 도움을 주면서도 배경 복잡성과 기존의 합성곱 연산에 도전하는 조명 변화에 대한 민감도를 줄이는 데 도움을 줄 수 있습니다.
LSCD 구성 요소는 크로스 스케...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자들은 이해 상충이 없음을 선언합니다.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| CUDA 툴킷 | 엔비디아 코퍼레이션 | CUDA 툴킷 버전 11.7 | |
| 딥러닝 프레임워크 | 파이토치 재단 | 파이토치 버전 1.12.0 | |
| 그래픽 처리 장치 | 엔비디아 코퍼레이션 | GeForce RTX 4090 | |
| 넘버피 | 넘피 개발자들 | 넘버피 | |
| 오픈CV | OpenCV 팀 | OpenCV-Python | |
| 운영 체제 | 캐노니컬 주식회사 | Ubuntu 22.04 LTS (또는 운영체제를 지정하세요) | |
| 파이썬 | 파이썬 소프트웨어 재단 | 파이썬 버전 3.8 이상 | |
| 텐서보드 | 텐서플로우 저자들 | 텐서보드 | |
| 토치비전 | 파이토치 재단 | 토치비전 |
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.