절단 담배 정렬 질서를 실시간으로 감지하기 위해 개선된 단일 단계 회귀 모델이 개발되었습니다. 이 접근법은 세 가지 구조 최적화와 맞춤형 방향 예측 방법을 통합하여 탐지 정확도를 높이고 모델 매개변수와 계산 복잡도를 줄여, 산업 생산 환경에서 절단된 담배 정렬을 효율적으로 평가할 수 있게 합니다.
연구 논문
절단 담배 정렬 질서를 실시간으로 감지하기 위해 개선된 단일 단계 회귀 모델이 개발되었습니다. 이 접근법은 세 가지 구조 최적화와 맞춤형 방향 예측 방법을 통합하여 탐지 정확도를 높이고 모델 매개변수와 계산 복잡도를 줄여, 산업 생산 환경에서 절단된 담배 정렬을 효율적으로 평가할 수 있게 합니다.
절단 담배 질서성은 담배 축을 따라 정렬된 담배의 일관성을 의미하며, 생산 품질 최적화에 중요한 요소입니다. 복잡한 가닥 구조와 가변적인 영상 조건 때문에 이 특성의 정확하고 자동화된 평가는 여전히 어렵습니다. 절단 담배 정렬 질서를 신뢰성 있게 감지할 수 있도록 개선된 단일 단계 회귀 모델이 개발되었습니다. 이 접근법은 특징 정보를 보존하는 다중 주파수 상호 하향 샘플링 방법, 다중 스케일 특징 표현을 향상시키기 위한 삼중 보완 융합 전략, 그리고 다양한 규모에서 위치 파악을 개선하는 동적 검출 헤드 등 세 가지 아키텍처적 수정을 포함합니다. 또한, 정렬 질서를 정량화하기 위해 맞춤형 방향 예측 방법이 구현되었습니다. 이 모델은 산업용 이미지 데이터셋에서 평가되었으며, 평균 정확도는 89.9%, 정확도는 90.6%, 리콜율은 88.7%를 달성합니다. 기본 모델과 비교했을 때, 제안된 접근법은 모델 매개변수를 30.8%(2.6M에서 1.8M으로)하고 계산 복잡도를 21.5%(6.5G에서 5.1G로)줄이면서 성능을 향상시킵니다. 전반적으로 이 방법은 절단된 담배 정렬 질서를 효율적이고 정확하게 평가할 수 있게 하며, 실시간 산업 응용 적합성을 입증합니다.
절단 담배의 질서성은 담배 내에서 절단된 담배의 축 정렬 정도를 의미합니다. 담배 형태와 공압 이송 매개변수 등 이 특성에 영향을 미치는 요인을 이해하는 것은 절단 및 조립 공정을 최적화하는 데 필수적입니다. 따라서 이러한 영향 요인을 조사하는 것은 담배 기업들이 비용 절감과 생산 효율성을 향상시키려는 핵심 전략이 되었습니다. 전통적인 담배 질서 평가는 수작업 방법에 의존하는데, 이는 비효율적이고 일관성과 정확성이 부족한 경우가 많습니다. 따라서 산업 전반에는 생산 공정을 최적화할 수 있는 자동화되고 정밀하며 실시간 탐지 시스템이 시급히 필요합니다. 딥러닝의 빠른 발전으로 객체 감지를 기반으로 한 담배 질서 상태 자동 평가가 가능해졌습니다. 그러나 생산 라인에서의 이러한 평가 시스템 구현은 여전히 거의 탐구되지 않은 연구 주제입니다. 그럼에도 불구하고 머신 비전 기술은다른 분야의 검사 작업에 성공적으로 적용되어 본 연구에 귀중한 참고 자료를 제공합니다. 이와 관련해, 합성곱 신경망(CNN) 기반 검출기가 지배적인 패러다임으로 부상했으며, 일반적으로 Faster R-CNN2와 같은 2단계 접근법과 You Only Look Once(YOLO) 시리즈 3,4와 같은 단일 단계 프레임워크로 분류됩니다.
최근 몇 년간 딥러닝 기반 객체 탐지 알고리즘, 특히 Faster R-CNN 프레임워크는 다양한 분야에서 상당한 잠재력을 보여주고 있습니다. 그러나 특정 산업 및 전문 시나리오에 직접 적용하는 것은 복잡한 운영 환경과 독특한 작업 요구사항에 의해 제약받는 경우가 많습니다. 따라서 이러한 문제를 해결하기 위한 수많은 맞춤형 개선책이 제안되었습니다. 예를 들어 의료 영상 분석에서는 Su 등5가 폐 결절 검출에서 작고 중요한 표적의 정확도를 높이기 위해 매개변수 최적화와 네트워크 구조 개선에 집중했습니다 . 산업 결함 검출에서 Chen 등은 유전 알고리즘을 통해 최적화된 Gabor 필터를 Faster R-CNN 백본에 통합하여 복잡한 배경을 효과적으로 억제함으로써 직물 검사에서의 텍스처 간섭을 해결 했습니다. 수중 목표 탐지에서 데이터 부족과 환경 복잡성 문제를 극복하기 위해 Zeng 등은 적대적 차단 네트워크를 도입했습니다 . 이 네트워크는 훈련 중 검출기와 경쟁하여 모델이 더 견고한 특징을 학습하도록 유도하여 과적합을 완화합니다. 더 나아가, 특정 인스턴스 식별과 같은 미세한 검색 작업을 위해 Li 등은 특징층 연결 및 미세 조정 전략을 통해 Faster R-CNN을 향상 시켜 저해상도 이미지에서의 성능을 크게 향상시켰습니다. Wang 등은 최근 암호화 된 이미지와 모델 매개변수에 대해 안전한 나눗셈, 지수 계산, 로그 프로토콜을 통해 안전한 계산을 가능하게 하는 다자 프라이버시 보호 Faster R-CNN 프레임워크를 제안했습니다. Sun 등은 개선된 Faster R-CNN이 휠 허브의 여러 결함 유형을 인식하는 데 효과적임을 입증했으며 , 이는 R-CNN과 YOLOv3보다 더 높은 평균 정밀도(mAP)를 달성했습니다. 이러한 노력들은 Faster R-CNN이 다양한 실제 시나리오에서 더 높은 적응력, 견고함, 적용 가능성을 향해 계속 진화하고 있음을 강조합니다. 이러한 2단계 검출기 발전과 병행하여 YOLO 시리즈와 같은 단일 단계 프레임워크도 상당한 발전을 거쳤습니다.
2단계 검출기의 대표적인 대안으로서, YOLO 시리즈는 효율적인 아키텍처와 뛰어난 실시간 검출 성능 덕분에 산업 및 연구 분야에서 큰 인정을 받고 있습니다. 2016년Redmon 등에 의해 1세대 모델이 도입된 이후, 여러 차례의 반복을 통해 다양한 기술적 한계를 점차 해결해 왔으며, 연구자들은 도메인 특화 응용을 위한 특화된 적응을 개발하게 되었습니다. 예를 들어, 교통 모니터링 시스템에서 Jamtsho 등은 YOLOv2와 중심체 추적 알고리즘을 결합하여 영상 스트림에서 헬멧을 착용하지 않은 오토바이 운전자의 번호판을 정확히 식별하여 오탐을 효과적으로 줄이면서 98.52%의 높은 탐지율을 유지했습니다. 어려운 수중 환경을 위해 Neelamegam 등은 YOLO의 실시간 탐지 기능과 트랜스포머 기반 주의 메커니즘을 통합하여 맥락적 이해를 향상시키는 YOLO-Transformer 하이브리드 모델을 개발했습니다 . 탁도와 빛 수준과 같은 환경 요인에 대한 실시간 IoT 센서 데이터를 통합함으로써, 모델은 변화하는 조건에 동적으로 적응하여 97.5%의 탐지 정확도를 달성하고, 소음이 많고 시야가 적은 상황에서 기존 모델을 능가합니다. 마찬가지로 Zhang 등은 원격 탐사 응용을 위한 개선된 YOLO 모델을 제안했습니다 . 특징 표현 부족과 배경 혼동 문제를 해결하기 위해, 특징 향상, 다중 스케일 융합, 전역 맥락 인식을 위한 전문 모듈을 도입하여 작은 객체 탐지 정확도를 크게 향상시켰습니다. 이 연구들은 YOLO 시리즈가 다양한 실제 상황에서 더 높은 적응력, 견고성, 효과성을 향해 지속적으로 진화하고 있음을 보여줍니다.
이러한 발전에도 불구하고, YOLOv113과 같은 최근 YOLO 계열 버전은 산업 현장에서 절단된 담배의 특정 질감 및 구조적 복잡성에 본질적으로 최적화되어 있지 않습니다. 이들의 표준 다운샘플링 작업은 정렬된 담배와 무질서한 컷 담배를 구별하는 데 중요한 미세한 특징을 손실시킬 수 있습니다. 더불어, 고정 스케일 검출 헤드는 다양한 영상 조건에서 담배 특징의 다중 스케일 특성을 효과적으로 처리하는 데 어려움을 겪습니다.
이러한 도전 과제를 해결하기 위해, 본 논문은 YOLOv11n을 기반으로 한 개선된 단일 단계 회귀 모델과 맞춤형 방향 예측 방법을 결합하여 절단된 담배의 질서 있는 온라인 검출을 제안합니다. 이 논문의 주요 기여는 세 가지입니다. (1) 다주파수 상호 하향 샘플링(MFID) 방법이 제안됩니다. 표준 스트리드 컨볼루션 또는 풀링 연산은 미세한 정보를 버리지만, MFID는 하르 웨이블릿 변환을 사용하여 특징을 저주파와 고주파 성분으로 명시적으로 분해합니다. 이 방법은 더 많은 원본 정보를 보존하고 다운샘플링 중 정보 손실을 완화합니다. (2) 삼중 상보 융합(TCF) 방법은 얕은, 중간, 심부 의미 정보를 융합하여 특징 품질을 향상시키도록 설계되었습니다. 특징 융합에는 단순한 연결 또는 덧셈 연산이 흔히 사용되지만, TCF는 역가중치 분기를 가진 중간 계층 가이드 가중 융합을 도입하여 의미론적 정보와 상세 정보 간의 상보성을 달성합니다. (3) 동적 검출 헤드(DynamicHead)가 기존 검출 헤드를 대체하기 위해 도입됩니다. 원래 검출 헤드는 고정 스케일 컨볼루션 연산에 의존합니다; 반면, DynamicHead는 스케일-인지, 공간-인지, 작업 인식 주의 메커니즘을 통합합니다. 이로 인해 특징 중요성의 동적 조정과 보다 유연하고 효과적인 다중 규모 특징 융합이 가능해져, 질서 관련 특징을 정확히 위치화하고 분류하는 모델의 능력이 향상됩니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 연구는 인간 대상, 척추동물, 또는 조절된 조직을 포함하지 않았으며; 따라서 윤리적 승인이나 기관 심사 위원회의 승인이 필요하지 않았습니다. 이 연구에 사용된 데이터셋은 롱옌 담배산업(Longyan Tobacco Industry Co., Ltd.)에서 수집했으며, 이미지는 3개월간 5개의 독립 생산 배치에서 수집되었습니다. 샘플링은 생산량의 자연스러운 변화를 포착하기 위해 아침, 오후, 밤 등 다양한 시간에 무작위로 수행되었습니다. 데이터셋에는 담배 수분 12%–18% 범위, 절단 속도 1.5, 2.0, 2.5 m/s, 공압 이송 압력 0.4, 0.5, 0.6 MPa를 포함하는 샘플이 포함되어 있어 일반적인 생산 조건을 보장합니다.
데이터셋 획득 및 설정
하드웨어 구성
이미지 획득 시스템은 가열 불태우는 담배에서 절단된 담배의 질서 정연함을 감지하는 요구사항을 충족하도록 구성되었습니다. 주로 산업용 카메라, 산업용 렌즈, 비전 광원, 산업용 제어 장치로 구성되어 있었습니다. 이 시스템은 MV-CH120-10GC 산업용 카메라와 MVL-KF0818M-12MP 산업용 렌즈를 결합하여 단면화된 담배 막대 표면의 절단된 담배 영역을 고화질로 촬영했습니다. 카메라는 담배 막대 표면에서 150mm 떨어진 작업 거리에 위치했습니다. 스트립 LED 광원은 카메라와 동축 방식으로 목표물로부터 80mm 떨어진 곳에 장착되었으며, 입사각은 45°였다. 이미징은 주변 빛 간섭을 제거하기 위해 무광 검은색 인클로저 안에서 수행되었습니다. 인클로저는 내부 치수가 400mm(너비), 350mm(깊이)× 300mm(높이)× 무광 검은색 도장으로 마감되어 있으며, 내부 표면은 반사율을 최소화하고 조명 조건을 일정하게 유지하기 위해 무광 검은색 페인트(550nm에서 반사율 < 5%)로 코팅되어 있습니다. 영상 품질과 일관성을 보장하기 위해 MV-LRDS-H-95-30-W 광원을 사용하여 안정적인 조명 환경을 구축하여 주변 광 변화가 담배 가닥 윤곽 추출과 방향 인식에 미치는 영향을 최소화했습니다. 획득된 이미지는 PC1010-AX360 산업용 컴퓨터에 수신, 처리 및 저장되었으며, 이 컴퓨터는 이후 인식 알고리즘, 결과 계산, 인터페이스 출력도 수행했습니다. 산업용 카메라와 렌즈 조합은 896 × 1600 픽셀 내에서 이미지 가장자리에서 무시할 만한 반경 왜곡(0.5% 미만)을 보였기 때문에 명시적인 카메라 보정이나 왜곡 보정은 수행되지 않았습니다. 카메라와 광원은 이미지 획득 시 위치 안정성을 보장하기 위해 고정된 프레임에 단단히 장착되었습니다. 이미지 획득 전반에 걸쳐 광원 강도는 일정한 수준으로 유지되었습니다. 시야는 강철 지지 구조물 내 노출된 담배 절단 구역을 완전히 가리도록 설계되었습니다.
카메라 파라미터 설정
이미지 수집이 시작되었고, 샘플 담배를 위치시키고 단면화한 후 JPG 형식으로 저장한 후 이미지를 캡처했습니다. 획득한 이미지의 일관성을 보장하기 위해 획득 매개변수는 수동으로 설정되었습니다. 구체적으로, 이미지 해상도는 896 × 1600으로 설정되어 있었습니다. 노출 시간은 처음에 4000μs로 설정되었으며, 현장 밝기에 따라 3000에서 6000μs 범위 내에서 미세 조정할 수 있었습니다. 모든 파라미터 튜닝은 샘플을 위에서 설명한 무광 검은색 실내 공간에 넣고, 완전히 제어된 조명 조건 하에 수행되었습니다. 튜닝 중에는 외부 주변 조명이 없었는데, 이미징 시스템이 완전히 밀폐된 환경에서 작동하고 방 조명이 꺼져 있었기 때문입니다. 게인은 처음에 2 dB로 설정되었고, 잡음 수준에 따라 0에서 6 dB 범위 내에서 제어되었습니다. 감마 값은 0.8로 설정되었고, 화이트 밸런스는 고정된 파라미터로 구성되었습니다. 최종 획득 매개변수 는 다음과 같이 설정되었습니다: 노출 시간 = 4000 μs, 게인 = 2 dB, 감마 = 0.8, 화이트 밸런스 모드 = 고정, 이미지 해상도 = 896 × 1600 픽셀, 이미지 포맷 = JPG. 화이트 밸런스에는 고정 매개변수 모드가 사용되었습니다. 보정은 샘플 위치에 놓인 표준 흰색 참조 카드(X-Rite ColorChecker)를 사용하여 수행되었습니다. 빨간색과 파란색 채널 이득을 조정하여 흰색 카드의 RGB 값이 ±2% 편차 내에서 평형화되었습니다. 보정 후 화이트 밸런스 매개변수는 다음과 같이 고정되었습니다: 빨간 게인 = 1.2, 녹색 게인 = 1.0(고정), 블루 게인 = 1.5. 보정은 시스템 시작 후 또는 광원에 노화 징후가 나타나 색온도 드리프트가 발생할 수 있을 때마다 한 번씩 수행되었습니다. 이 설정들은 절단 담배의 명확한 경계와 안정적인 밝기 분포를 보장하는 동시에 이후 담배 가닥 세분화, 방향 계산, 질서 분석을 위한 처리 요구사항을 충족하는 데 도움을 주었습니다.
이미지 수집
이미지 획득은 절면 절단 후 가열-연소 방지 담배 막대 표면에 노출된 절단된 담배 부위를 목표로 했습니다. 검출 과정에서 담배 샘플은 먼저 검사소로 전달되었고, 샘플 위치 메커니즘에 의해 자세와 위치가 조정되고 고정되었습니다. 위치 조절 메커니즘은 V자형 정렬 가이드가 있는 공압식 클램프로 구성되어 있습니다. 이 시스템은 레이저 변위 센서 측정을 통해 1000회 연속 사이클 동안 ±0.5 mm의 위치 반복성을 달성합니다. 이후 절단 메커니즘으로 외부 포장재가 안정적으로 절단되어 표면에 절단된 담배가 시야 내에 완전히 노출되었습니다. 원형 회전 칼날(직경 50mm, 두께 0.3mm, 재료는 고속강)이 사용되었습니다. 절단 깊이는 1.5 mm로 설정되었으며, 회전 속도는 300 rpm이었습니다. 절단 일관성은 선형 인코더 피드백으로 모니터링되었으며, 두께 변화는 ±0.05 mm 내에서 유지되었습니다. 시료 위치가 안정되고 영상 영역이 명확히 정의되면, 광원이 제공하는 안정적인 조명 하에서 산업용 카메라를 사용해 이미지 획득이 수행되었습니다. 총 634장의 이미지가 수집되었으며; 일반적인 이미지는 그림 1에 나와 있습니다. 데이터셋 에는 세 가지 담배 밀도 수준(낮음, 중간, 높음; 약 180, 220, 260 mg/cm3), 가닥 방향은 −180°에서 180°, 그리고 일반 조명부터 저조도 가장자리 조건까지 다양한 조명 조건이 포함되어 있습니다. 조도는 보정된 디지털 럭스계(TA8133, 정확도±3%)를 사용하여 샘플 표면 위치에 센서를 위치시켜 측정했습니다. 측정된 정상 조명 범위는 200–800럭스로, 밀폐된 후드 내부의 스트립 LED 광원으로 제공되며 주변 빛 누출이 없습니다. 저한값(약 200 lux)은 모델의 견고성을 평가하기 위해 광원을 어둡게 하여 만들어진 예외 조건을 나타냅니다. 또한, 약 30%의 영상에서 담배 가닥의 부분 가림(10%에서 50% 범위)이 존재합니다. 이러한 변화는 실제 생산 라인의 다양성을 반영합니다.

그림 1. 시각 시스템이 획득한 절단 담배의 대표적인 원본 이미지. (아–아) 산업 현장 조건에서 이미지 획득 시스템을 사용해 촬영한 절단 담배의 원본 이미지 대표적 예시입니다. 이미지는 896 × 1600 픽셀의 해상도로 스트립 광원을 사용해 제어된 조명 하에서 균일한 밝기를 보장하고 환경 간섭을 최소화하도록 얻었습니다. 이 이미지들은 모델 처리 전 담배 가닥 분포, 밀도, 방향의 변화를 보여줍니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
이미지 주석
오픈소스 도구인 LabelImg를 사용해, 보이는 절단된 담배와 강철 지지 구조물 주위에 경계 상자를 그렸습니다. 각 경계 상자에 올바른 각도가 라벨로 할당되었습니다. 수평축(0°)은 이미지 하단 가장자리와 평행한 우측 방향으로 정의되었습니다. 각 담배 가닥마다 주석 도구의 각도 측정 함수를 사용해 가닥의 장축을 따라 선을 그렸습니다. 각도는 이 축과 수평 기준선 사이의 각도로 기록되었습니다(범위: −180°에서 180°). 주석은 표준 단일 단계 검출 형식으로 저장되었으며, 각 이미지마다 하나의 TXT 파일이 대응되었습니다. 각 .txt 파일은 class_id x_center y_center 너비 높이 형식으로 된 줄로 구성됩니다. 좌표는 이미지 크기에 대해 [0,1]로 정규화됩니다. 클래스 0 = 담배 가닥, 클래스 1 = 강철 지지대. 각도 라벨 은 주석 .txt 파일의 여섯 번째 열로 저장되며, 다섯 개의 표준 YOLO 필드 뒤에 덧붙여집니다. 한 줄당 정확한 형식은 다음과 같습니다: class_id x_center y_center 너비 높이 각도. 각도 값은 −180.0에서 180.0까지의 부동소수점 숫자로 저장되며, 소수점 두 자리(예: 45.75)가 있습니다. 예시 라인: 0 0.5230 0.4170 0.0850 0.0620 38.25.
품질 관리
두 번째 주석가는 무작위로 선정된 주석 이미지 중 20%를 검토했습니다. 무작위 선택은 파이썬 난수 라이브러리의 random.sample() 함수를 사용하여 고정된 무작위 시드를 2024로 수행했습니다. 모든 이미지 파일 이름 목록이 생성되었고, 이 시드 난수 생성기를 사용해 교체 없이 샘플링한 이미지의 20%를 샘플링하여 반복적인 품질 관리 절차 전반에 걸쳐 재현 가능한 선택을 보장했습니다. 불일치가 있으면 논의 및 해결되어 라벨 일관성을 보장했습니다. 주석자 간 일치는 각도 편차를 사용하여 평가되었으며, 두 주석자의 각도 라벨 간 평균 절대 차이는 2.8°(표준편차 = 1.5°)였습니다. 편차가 >5°인 주석은 검토 및 조정되었습니다.
담배 단기 질서 감지를 위한 단일 단계 회귀 모델
담배 절단 정렬 감지는 담배 생산 공정과 최종 제품 품질 모두를 향상시키는 데 매우 중요합니다. 그러나 이 검사 작업은 겹치는 절단 담배, 작은 표적 크기, 조명 불균형 등 여러 도전 과제에 직면해 있어 탐지 정확도와 견고성을 저해합니다. YOLOv11n을 기반으로 한 개선된 단일 단계 회귀 모델이 절단된 담배의 질서 상태를 온라인 탐지하는 데 사용되었습니다. 제안된 프레임워크는 담배 막대 형성 중 절단된 담배의 형태학적 특징을 정확히 식별하여 정렬 규칙성의 신뢰성 있는 탐지를 가능하게 하고 정확성, 견고성, 실시간 처리 능력을 향상시킵니다. 제안된 단일 단계 회귀 프레임워크의 전체 구성은 그림 2에 나타난다.

그림 2. 제안된 단일 단계 회귀 모델의 전체 구조. 도표는 백 본, 넥, 탐지 헤드를 포함한 전체 네트워크 구조를 보여줍니다. 이 백본은 다중 스케일 특징을 추출하며, 다중 주파수 상호 하향 샘플링(MFID) 모듈을 통합하여 특징 정보를 보존합니다. 넥은 삼중 상보 융합(TCF) 전략을 사용하여 다단계 표현을 강화하기 위해 특징을 통합합니다. 탐지 헤드는 DynamicHead 모듈을 채택하는데, 이 모듈은 스케일-인지(πL), 공간-인식(πS), 작업 인식(πC) 주의 메커니즘을 통합하여 위치 및 분류 성능을 향상시킵니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
다중 주파수 정보 다운샘플링 모듈(MFID)
YOLOv11의 백본 네트워크에서는 스트라이드 2의 합성곱 연산이 픽셀을 건너뛰어 다운샘플링을 수행합니다. 이 과정은 공간 정보의 절반을 직접 폐기하여 고주파 세부사항(예: 작은 객체의 가장자리와 텍스처)을 잃고 작은 목표물에 대한 상당한 정보 손실을 초래합니다. 더 나아가, 백본의 최대 풀링 및 평균 풀링 연산은 객체 영역 내 상세 정보를 폐기하고, 특징을 부드럽게 하며, 노이즈를 도입하여 특징 학습에 부정적인 영향을 미칩니다.
이러한 문제를 해결하기 위해 웨이블릿 계층적 분해개념에서 영감을 받은 MFID 모듈이 도입되었습니다. 이 모듈은 먼저 하르 웨이블릿 변환을 사용하여 특징을 두 개의 상호 보완적인 부분으로 분해합니다: 분류를 향상시키는 저주파 배경 정보와 작은 표적 탐지를 향상시키는 에지와 텍스처가 풍부한 고주파 세부 정보입니다. 작은 표적에 대한 인식을 더욱 강화하기 위해, MFID 모듈은 두 가지 추가 분기를 포함합니다: 작은 표적의 세분화된 특징을 보존하기 위해 번역 불변성을 활용하는 최대 풀링 분기와, 학습 가능한 매개변수를 활용해 더 강한 표상 능력과 풍부한 정보 구성을 달성하는 스트리드드 컨볼루션 분기입니다. 이 다중 분기 구조를 통해 MFID 모듈은 다운샘플링 중에 공간 및 주파수 정보를 보다 완전하게 보존합니다. MFID 모듈의 아키텍처는 그림 3에 나와 있습니다.

그림 3. MFID 모듈의 구조. MFID 모듈은 하르 웨이블릿 변환을 사용하여 입력 특징을 저주파와 고주파 구성 요소로 분리하여 다운샘플링 중 중요한 구조 정보를 보존합니다. HLL 은 저주파 근사 성분을 나타내며, HLH, HHL, HHH 는 각각 수평, 수직, 대각선 방향의 고주파 세부 성분을 나타냅니다. 기호 2↓는 2중 다운샘플링을 나타냅니다. 여러 분기의 특징 맵은 연결 및 게이팅 메커니즘을 통해 융합되어 특징 표현을 향상시킵니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
다운샘플링 중에는 하르 웨이브릿 변환을 사용하여 분해하는데, 이는 저주파 및 고주파 특징 분해에 효율적이고 단순하여 실시간 탐지 작업에 적합합니다. HL 과 HH 는 각각 저역 통과 및 고역 통과 분해 필터를 나타내며, 이미지에서 저주파 및 고주파 정보를 추출하는 데 사용됩니다. 1차 1차원 하르 변환의 웨이블릿 기저 함수와 스케일링 함수는 다음과 같이 방 정식 1 을 사용하여 정의됩니다:
(1)
하르 기저 함수는 방정식 2 를 사용하여 다음과 같이 정의됩니다:
(2)
여기서 매개변수 j 와 k 는 각각 하르 기저 함수의 스케일링 계수와 평행 이동량을 나타낸다. 구체적으로, 0차 하르 기저 함수는 방 정식 3 을 사용하여 다음과 같이 정의된다:
(3)
그림 3에서 기호 2↓는 2중 다운샘플링을 나타냅니다. 2단계 하르 웨이브릿 분해는 네 가지 성분을 산출합니다: 저주파 근사(HLL)와 수평(HLH), 수직(HHL), 대각선(HHH) 방향의 고주파 세부 성분입니다. HLL 성분은 윤곽, 배경, 전역 정보를 전달하는 반면, 고주파 성분(HLH,H HL, HHH)은 가장자리, 질감, 미세한 입자 특징을 포착합니다.
2중 다운샘플링 후 얻은 고주파 성분 HLH, HHL, HHH는 Concat 연산에 의해 연결되어, 다방향 상세 정보를 적분하여 식 4에 나타난 통합 고주파 상세 정보를
생성합니다.
(4)
이후 최대 풀링 분기에서 2차 정보 융합이 수행되어 상세 특징과 전역 특징을 통합하여, 방정식 5에서 볼 수 있듯이 재구성된 정보를
생성한다. 이 방 정식은 더 넓은 주요 특징 집합을 포함하고 고주파 상세 정보를 재활용하여 향상된 특징 표현을 한다.
(5)
그 후, 게이팅 메커니즘을 사용하여 정보 흐름을 동적으로 조절하고,
이는 소규모 표적 특징
을 식별하는 데 활용되어 유용한 특징을 보존하면서도 본질적인 무의미한 잡음 간헐을 억제합니다. 게이팅 메커니즘은 다음과 같이 정의됩니다: 게이팅(x) = Linear_2(ReLU(Linear_1(x))), 여기서 Linear_1는 채널 차원을 4의 축소 인수만큼 줄이고 Linear_2 원래 채널 차원으로 복원합니다. 게이팅 메커니즘의 출력은 시그모이드 활성화를 거쳐 [0,1] 범위의 변조 가중치를 생성합니다. 학습 가능한 매개변수에는 두 선형 층의 가중치 행렬과 바이어스 항이 포함되며, 이는 균일 초기화를 통해 초기화됩니다. 이렇게 하면 상세하고 중요한 특징 정보가 적절히 균형 잡혀 활용되어, 식6에 제시된 최종 상세 특징
이 산출됩니다.
(6)
마지막으로, 스트라이드-컨볼루션 다운샘플링 정보, 저주파 벡터, 최종 상세 특징을 Concat을 통해 연결하여 여러 차원과 주파수 대역에 걸쳐 특징 다운샘플링 상호작용을 확장하는데, 이는 방정식 7에서 보입니다.
(7)
행동-실행 단계
모듈 정의
프로젝트의 모델 정의 파일 내에 MFID라는 이름의 맞춤형 PyTorch 모듈이 정의되어야 합니다. 이 모듈의 구현은 네 개의 병렬 경로로 구성됩니다: (1) 웨이블릿 변환: 미리 정의된 하르 웨이블릿 필터를 사용하여 입력 특징 맵에 2단계 분해를 적용하여 수평, 수직, 대각선 방향에서 저주파 근사 성분과 고주파 세부 성분을 생성하고, 그 후 세 가지 고주파 성분을 연결합니다; (2) 맥스 풀링: 주요 특징을 보존하기 위해 입력에 최대 풀링이 적용됩니다; (3) 스트라이드 컨볼루션: 표준 다운샘플링은 스트라이드 2의 컨볼루션 층을 통해 수행됩니다; (4) 특징 재구성 및 융합: 첫째, 웨이블릿 변환에서 얻은 고주파 정보를 최대 풀링 분기의 특징과 융합한다; 이후 저주파 정보를 기반으로 한 게이팅 메커니즘이 사용되어 미세한 특징을 필터링합니다; 마지막으로, 처리된 미세 입자 특징, 저주파 성분, 스트라이드 합성곱 출력을 연계하여 최종 다운샘플링 특징 맵을 얻습니다.
구성 파일 편집
기본 모델 구성 파일(config.yaml)을 열어야 합니다. 백본 네트워크와 넥 네트워크 모두에서 표준 다운샘플링 모듈의 모든 인스턴스를 체계적으로 식별해야 합니다. 식별된 각 다운샘플링 모듈 항목은 MFID 모듈로 교체되어야 합니다.
설계 동기
MFID 모듈은 표준 다운샘플링 작업에서 정보 손실을 완화하도록 설계되었으며, 이는 특히 작은 물체 탐지에 불리합니다. 그 핵심 개념은 웨이브릿 계층적 분해에서 영감을 받았습니다. 이미지에서 저주파 글로벌 정보와 고주파 세부 정보를 명시적으로 분리하고 적절히 처리함으로써, 모듈은 다운샘플링 중 중요한 텍스처와 가장자리 특징을 보존합니다. 최대 풀링과 스트리드 컨볼루션 분기의 도입은 번역 불변성과 학습 가능한 표현 간의 상호 보완적 관점에서 특징을 추가로 포착하고 보완합니다. 멀티브랜치 퓨전을 통해 모듈은 후속 네트워크 계층에 보다 유익하고 견고한 다중 주파수 특징 표현을 제공합니다. 모든 명시되지 않은 아키텍처 매개변수와 계층 구성은 PyTorch 내 YOLOv11n 프레임워크의 기본 구현 설정을 따릅니다.
트리플 크로스 기능 융합 모듈(TCF)
YOLOv11 네트워크 아키텍처의 넥 특징 융합 단계에서는 동일한 척도의 특징 맵을 병합하기 위해 간단한 연결 연산이 일반적으로 사용됩니다. 그러나 이 직접적인 접근법에는 명확한 한계가 있습니다: 첫째, 서로 다른 수준에서 특징 간의 의미적 차이를 완전히 반영하지 못합니다; 둘째, 채널 간 상관관계의 명시적 모델링이 부족해 소표적 특징이 융합 과정에서 희석되거나 손실되기 쉬워 검출 성능이 저하됩니다. 이러한 문제를 해결하기 위해 TCF 모듈이라 불리는 보다 상호작용적인 융합방법이 도입되었습니다. 이 방법은 다단계 점진적 융합 전략을 사용하여 정보 흐름을 소규모 표적 탐지로 유도하여 계층 간 전송을 유도합니다. 또한 스케일을 넘어 심층 정보를 탐구하는 추가 비선형 연산을 포함하여, 다중 스케일 특징의 융합을 강화합니다. 단순 덧셈이나 평균 융합에 의존하는 기존 모듈과 달리, TCF는 가중 융합 방식을 채택합니다. 이를 통해 각 수준에서 상세한 정보를 적응적으로 학습하고, 정보 추출 경로를 동적으로 최적화하며, 가장 구별적인 특징에 집중하여 궁극적으로 탐지 정확도를 향상시킬 수 있습니다. TCF 모듈의 아키텍처는 그림 4에 나와 있습니다.

그림 4. TCF 모듈의 구조. TCF 모듈은 얕은, 중간, 심층을 넘어 다층 특징 융합을 수행하여 작은 표적의 표현을 향상시킵니다. P는 서로 다른 수준에서의 입력 특징 맵을 나타냅니다. Conv는 컨볼루션 연산을, Upsample은 특징 업샘플링을, AdaptiveAvgPool은 적응형 평균 풀링을 나타냅니다. 이 모듈은 가중 융합과 교차 계층 상호작용을 통해 보정된 특징을 통합하여 의미론적 및 공간적 특징 상보성을 향상시킵니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
물체 탐지 작업에서는 심층 특징 Pi+1과 얕은 층 특징 Pi-1에 포함된 정보가 크게 다릅니다. 교차 계층 정보의 융합을 강화하기 위해, 중간 계층 Pi가 최종 특징 융합 계층으로 도입되어 서로 다른 수준 간 특징 정보 간 차이를 균형 있게 조정합니다.
먼저, 얕은 층, 중간층, 깊은 층의 입력 정보를 시그모이드 활성화 함수를 사용해 가중치 특징
,
, ,
를 생성하며, 이는 주요 특징을 강화하고 중복 요소를 약화시키는 역할을 합니다. 이는 방정식 8에서 보여준 것입니다.
(8)
둘째, 얕은층, 중층층, 심층의 입력 정보를 원소별로 매핑된 가중 특징과 곱하여 보정된 특징
,
, ,
를 생성하는데, 이는 식9에 나타난 바와 같다. 특징의 중요성은 가중치 주의 메커니즘을 통해 동적으로 조정되어 적응형 특징 선택과 재보정을 달성합니다.
(9)
중간 계층 특징 융합 단계에서는 두 개의 역가중치 분기를 활용하여 각각 보정된 얕은 층과 깊은 층 특징과 융합하여, 얕은 층 특징에서 노이즈로 인한 허위 상세 정보와 심층 특징에서 편향된 관련 의미 정보를 걸러냅니다. 이후 다중 분기 정보가 통합되고, 이 층의 원래 특징, 보정된 특징, 상호작용 특징, 그리고 보정된 얕은 층과 심층 특징이 융합됩니다. 이로 인해 다중 스케일 특징 정보의 보존과 보완이 이루어지고, 소표적 정보 손실과 오판 문제를 완화하며, 최종적으로 중간 계층 융합 특징
를 산출하는데, 이는 식 10 을 사용하여 다음과 같이 공식화됩니다:
(10)
얕은 층, 깊은 층, 중간 층 간의 연관성은 식 11 과 12에서 나타난 것처럼 별도로 확립됩니다.
(11)
(12)
마지막으로, 세 가지 특징 융합 경로의 출력은 각 개별 경로의 특징 독립성을 유지하기 위해 Concat 연산을 통해 연결됩니다. 각 경로의 핵심 정보는 α, β, γ 가중치를 기반으로 동적으로 학습되며, 이는 학습 가능한 스칼라 매개변수로 정의되어 1.0으로 초기화되고 훈련 중 역전파를 통해 최적화되어 얕은, 중간, 심층 경로에서의 기여도를 동적으로 균형 있게 할 수 있습니다. 더 나아가, 컨볼루션 연산은 맥락 정보를 집계하고, 크로스 레이어 연결로 인한 일관성 없는 특징 경계 반응을 제거하며, 소규모 대상 상세 정보의 획득 및 정제된 표현을 최적화하는 데 사용됩니다. 이 과정은 다음과 같이 식 13 을 사용하여 공식화됩니다:
(13)
행동-실행 단계
모듈 정의
프로젝트의 모델 정의 파일 내에 TCF라는 이름의 맞춤형 PyTorch 모듈이 정의되어야 합니다. 이 모듈은 백본 네트워크의 여러 단계에서 추출한 얕은 층, 중간 층, 심층 특징 맵을 입력으로 받습니다. 내부 처리 흐름은 세 가지 주요 단계로 구성됩니다: (1) 특징 보정: 시그모이드 함수를 세 개의 입력 특징 계층 각각에 적용하여 가중치 맵을 생성하고, 이를 원소별로 원본 특징 맵과 곱하여 핵심 특징을 강화하고 중복 특성을 억제합니다; (2) 상호작용적 융합: 중간 계층 특징 융합 단계에서는 두 개의 역가중치 분기가 각각 보정된 얕은 층과 깊은 층 특징과 융합되어, 얕은 층 특징에서 발생하는 노이즈로 인한 허위 상세 정보와 심층 특징에서 편향된 관련 의미 정보를 걸러냅니다; (3) 다중 경로 집계: 원래의 특징, 보정된 특징, 인터랙티브 특징, 얕은 정보와 깊은 정보가 융합된 특징을 통합한 후, 교차 계층 연결로 인한 비일관성 특징 경계 반응을 제거하기 위해 합성곱 연산을 적용하여 궁극적으로 다중 스케일 정보가 풍부한 융합 특징을 출력합니다.
구성 파일 편집
모델 구성 파일(config.yaml)을 열어야 합니다. 목 네트워크의 특징 융합 구간, 특히 백본 네트워크의 서로 다른 단계의 특징들이 융합되는 층을 위치시켜야 합니다. 이 위치에서는 원래의 단순 연결 연산 계층을 TCF 모듈에 호출하는 것으로 대체하여 모듈 입력이 해당 얕은, 중간, 심부 지형에 올바르게 연결되도록 해야 합니다.
설계 동기
TCF 모듈의 설계는 기능 융합 과정에서 정보 격차와 정보 손실이라는 도전 과제에 의해 동기부여되었습니다. 얕은 특징은 세부 사항이 풍부하지만 상당한 잡음을 포함하며, 깊은 특징은 강한 의미론을 보이지만 해상도는 낮다. 이를 해결하기 위해 TCF 모듈은 정보 밸런서로 중간 계층 특징을 도입하고, 교차 수준 특징의 상호 보완적 이점을 극대화하기 위해 신중하게 설계된 보정, 상호작용, 집계 경로를 통합합니다. 근본적인 동기는 각 수준에서 특징의 중요성을 동적으로 평가하고 정보를 선택적으로 통합할 수 있는 보다 효과적인 융합 메커니즘을 확립하는 데 있습니다. 그 결과, 세부 정보와 의미론적 정보 모두 풍부한 고품질 특징 표현을 생성하여 작은 객체 인식에 특히 적합합니다.
다이내믹헤드 모듈
검출 헤드 구성 요소는 백본 네트워크와 피처 융합 네트워크에서 생성된 특징 표현에 대해 다중 스케일 객체 인식을 수행하는 근본적인 목적을 수행합니다. 이 과정은 탐지된 물체의 정확한 공간 위치 파악, 범주 할당, 경계 상자 예측의 신뢰성 추정을 가능하게 합니다. 시각적 데이터에서 목표 특징의 상당한 규모 변화와 특정 프레임에서 경계 상자 제안의 밀집 밀도를 고려할 때, 정밀한 절단 담배 식별은 다중 스케일 패턴의 분석이 필요합니다. 이를 해결하기 위해 이 방법은 YOLOv11n의 네이티브 탐지 헤드를 대체하는 DynamicHead 아키텍처18 을 채택하여, 스케일웨어, 공간웨어, 작업 인식 메커니즘을 통합하여 탐지 능력과 운영 효율성을 모두 향상시키는 셀프 어텐션 프레임워크를 구축합니다. DynamicHead 구성 요소의 구조 구성은 그림 5에 나타난다.

그림 5. 다이내믹헤드 감지 모듈의 구조. DynamicHead 모듈은 세 가지 순차적 주의 메커니즘을 통합합니다: 스케일-인지(πL), 공간-인지(πS), 그리고 작업 인지(πC). 이 구성 요소들은 규모, 공간 영역, 탐지 작업 전반에 걸쳐 특징 중요도를 동적으로 조정합니다. 이 설계는 탐지 헤드 내에서 적응적 특징 정제를 가능하게 하여 위치 정확도와 분류 성능을 모두 향상시킵니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
이 아키텍처는 세 가지 특수 주의 단위로 구성되어 있습니다: 스케일-인지(πL), 공간-인식(πS), 그리고 작업 인식(πC) 구성 요소. 스케일 인지 주의 메커니즘(πL)은 먼저 입력 특징 맵을 공간 및 채널 차원에서 평균화합니다. 결과는 선형 투영 층을 거친 후 하드 시그모이드 활성화를 거쳐 스케일 가중치를 생성하고, 원소별로 원본 특징 지도와 곱합니다. 공간 인식 주의 메커니즘(πS)은 K = 9개의 희소하게 선택된 샘플링 점에서 변형 가능한 합성곱을 사용합니다. 각 샘플링 포인트마다 오프셋 벡터 Δpk와 변조 스칼라 Δmk 를 예측한 후, 샘플링된 특징들을 집계하여 공간적 주의 가중치를 산출합니다. 과제 인식 주의 메커니즘(πC)은 두 집합의 매개변수(α1, β1 , α2, β2)를 사용하여 각 채널에 학습 가능한 선형 변환을 독립적으로 적용합니다. 이 도구는 두 변환된 표현 간의 최대 응답을 선택하여 특징을 분류 및 회귀 작업에 동적으로 적응시킵니다. 마지막으로, 이 세 가지 주의 메커니즘은 입력 특징 맵에 순차적으로 적용되며, F_out = πC(πS(πL(F) · F) · F) · F. 스케일 인식 메커니즘은 교차 스케일 특징 가중치를 사용하여 다중 해상도 표현을 적응적으로 결합하여 차원 변동에 대한 모델 민감도를 정교하게 조정합니다. 공간 인식 구성 요소는 특징 매핑 내에서 지역적 강조 가중치를 구현하여 계산 집중을 전경 엔티티에 집중시키고 무관한 배경 간섭을 억제합니다. 한편, 작업 인식 모듈은 특정 목표에 맞는 출력 표현을 동적으로 조절하여 분류 및 회귀 결과를 정교하게 조정하여 모델의 정밀도와 운영의 견고성을 강화합니다. 계산 절차는 방 정식 14–17에서 형식화되어 있습니다.
(14)
(15)
(16)
(17)
여기서 WL(F)는 주의 강화 특징 표현을 나타내며, πL(F), πS(F), πC(F)는 각각 규모, 공간, 과제 지향 주의 연산에 해당한다. 변환 f는 선형 투영층을 나타내며, σ(x)는 하드 시그모이드 활성화 처리를 나타내고, K 는 희소하게 선택된 공간 점의 수를 나타내며, pk+Δpk 는 판별적 영역을 강조하기 위한 위치 조정을 도입하고, Δmk 는 공간 점 pk에 대한 훈련 가능한 유의 척도이며, α(F)와 β(F))는 활성화 임계값을 지배하는 학습 가능한 모수 함수입니다. 그중 K 는 모든 실험에서 9로 설정되어 있는데, 이는 계산 효율성을 유지하면서 충분한 공간적 범위 확보를 제공하기 때문입니다.
행동-실행 단계
모듈 정의
프로젝트의 모델 정의 파일 내에 DynamicHead라는 커스텀 PyTorch 모듈이 정의되어야 합니다. 이 모듈의 구현은 세 가지 주의 단위를 순차적으로 적용하는 것으로 구성됩니다: (1) 스케일 인지 주의: 서로 다른 스케일의 특징 층이 학습 가능한 매개변수를 사용하여 동적으로 가중치를 부여합니다; (2) 공간 인식 주의: 변형 가능한 합성곱 개념에 기반하여, 특징 지도 내 희소하지만 구별력 있는 공간 위치에 초점을 맞춥니다; (3) 작업 인식 주의: 활성화 임계값은 분류 및 회귀 작업에 대해 특징 표현을 최적화하기 위해 동적으로 학습됩니다. 이 세 가지 주의 메커니즘은 입력 특징 피라미드에 순차적으로 적용되어 궁극적으로 예측을 위한 특징을 생성합니다. 모든 모듈은 위에서 설명한 합성 계층, 선형 계층, 활성화 함수, 주의 메커니즘 등 표준 PyTorch 연산을 사용하여 구현되었습니다.
구성 파일 편집
모델 구성 파일(config.yaml)을 열어야 합니다. 검출 헤드를 정의하는 섹션이 위치해야 합니다. 원래 분류 및 회귀를 위한 일련의 합성곱 계층으로 구성된 원래 검출 헤드 구성은 DynamicHead 모듈로 호출하여 입력이 넥 네트워크를 통해 피처 피라미드 출력에 연결되도록 해야 합니다.
설계 동기
전통적인 검출 헤드는 일반적으로 모든 특징 층, 공간 위치, 작업에 동일한 합성곱 매개변수를 적용하여 작업별 적응성이 부족합니다. DynamicHead 모듈의 도입은 탐지 작업의 복잡성에 의해 동기부여되었으며, 이러한 문제들을 통합된 주의 기반 아키텍처를 통해 분리되고 해결하려는 목적입니다. 설계 동기는 세 가지입니다: (1) 스케일 인지 모듈을 통해 서로 다른 크기의 타겟에 대응하는 특징층에 적응적으로 집중하는 것; (2) 공간 인식 모듈을 통해 배경이 아닌 전경 목표 영역에 계산 자원을 집중시키는 것; 그리고 (3) 작업 인식 모듈을 통해 분류와 회귀라는 뚜렷한 목표에 맞춰 특징 표현을 동적으로 최적화하는 것. 이러한 분리와 동적 최적화의 조합은 컷 담배와 같이 밀도가 높고 다중 규모의 표적에 대해 모델의 위치 정확도와 분류 신뢰성을 향상시킵니다.
담배 질서 정연을 위한 맞춤 평가 방법
모듈 설명 및 설계 원칙: 절단된 담배 정렬 질서성의 정량적 평가는 제조 공정 안정성 평가와 담배 생산 내 최종 제품 품질 예측에 필수적입니다. 전통적인 평가 방법은 수작업으로 시각적 검사를 의존하며, 이는 주관적이고 시간이 많이 소요되며 일관된 정량적 측정을 제공할 수 없습니다. 이러한 한계를 해결하기 위해 개선된 단일 단계 회귀 검출기와 통합된 맞춤형 각도 예측 방법이 사용됩니다. 이 방법의 기본 원리는 담배 막대 내부의 강철 지지 구조를 기하학적 기준점으로 사용하여 공간적 기준 프레임워크를 설정하는 것입니다. 강철 지지대는 제조 과정에서 고정된 방향을 유지하기 때문에, 개별 절단 담배의 상대적 방향을 계산하는 데 이상적인 기준선 역할을 합니다. 검출된 담배와 강철 지지대의 수평 기준선에 대한 절대적인 각도를 측정하고 그 상대적 각도 차이를 계산함으로써 정렬 질서의 정량적 평가를 제공합니다. 상대각이 0이면 가닥과 지지대 사이의 완벽한 평행성을 나타내며, 각도 편차가 증가할수록 정렬이 더 나쁘다는 뜻입니다. 수평 기준축은 이미지의 하단 가장자리와 평행한 왼쪽에서 오른쪽 방향의 선으로 정의됩니다. 이 축은 0°에 해당하며, 양의 각도는 반시계 방향으로, 음의 각도는 시계 방향으로 측정됩니다. 최종 질서 측정은 이미지 내 검출된 모든 가닥의 상대 각도를 평균하여 일관되고 객관적인 품질 등급을 가능하게 합니다.
행동-실행 단계
각도 계산 모듈 정의
개선된 단일 단계 회귀 모델의 검출 결과를 처리하는 후처리 모듈을 구현하세요. 각 감지된 객체(절단된 담배와 강철 지지대)마다 경계 상자 좌표를 추출합니다. 각 탐지된 물체의 중심점 좌표를 식 18을 사용하여 계산합니다. 방 정식 19을 사용하여 이미지 치수를 기반으로 이미지 중심점 좌표를 계산합니다.

(18)

(19)
여기서 x₁, x₂, y₁, y₂는 탐지된 경계 상자의 네 모서리 좌표를 나타내며, 담배 가닥이나 강철 지지대에 대해 나타낸다; CX 와 CY 는 검출 영역 내 각각의 중심점의 좌표를 나타냅니다; w 와 h 는 담배 이미지의 너비와 높이를 나타내며; DX 와 DY 는 이미지 중심점의 좌표를 정의합니다.
절대 각도 계산
각 검출된 담배 가닥과 강철 지지대에 대해 이미지 중심에서 물체 중심으로 가는 벡터를 계산합니다. 방정식 20에 명시된 아크탠젠트 함수를 사용하여 수평 기준선에 대한 절대 각도를 계산합니다. 각도는 atan2(d_y, d_x)를 사용하여 계산하며, 여기서 atan2는 파이썬 수학 라이브러리에서 제공하는 4사분면 역접선 함수입니다. 이 함수는 (−π, π] 라디안 범위의 값을 반환하며, 이를 도수로 변환하여 출력 각도가 (−180°, 180°) 범위로 나옵니다. 사분면 취급은 atan2로 자동 처리되며, d_y와 d_x의 신호에 따라 이루어집니다. 이로 인해 강철 지지대에는 A강, 각 담배 가닥마다 절삭이 생성됩니다.
(20)
상대 각도 계산
검출된 담배 가닥마다 강철 지지대의 절대각을 그 가닥의 절대각에서 빼서 상대 각도를 계산합니다. 이는 방정식 21에 나타난 것입니다. 절대값은 양의 각도 편차 측정을 보장합니다.
(21)
질서 측정 생성
검출된 모든 가닥의 상대 각도를 단일 이미지 내에 집계합니다. 방정식 22에 따라 모든 상대 각도 To 를 합산하고 검출된 가닥 총 수로 나누어 평균 상대 각도를 계산합니다. 이 평균 값은 해당 이미지의 정렬 질서성에 대한 정량적 척도가 됩니다.
(22)
품질 등급 구현
계산된 값을 미리 정의된 임계값에 기반한 정성적 등급에 매핑하는 분류 함수를 구현하라. 등급 기준(0°–30° = 우수, 30°–60° = 우수, >60° = 불량)은 롱옌 담배산업유한회사의 세 품질 관리 전문가와 협의하여 설정되었습니다. 이 전문가들은 독립적으로 200개의 샘플 이미지를 평가하고, 계산된 평균 상대 각도와 인지된 정렬 품질을 세 가지 범주 척도(우수, 좋음, 나쁨)를 사용해 상관관계를 분석했습니다. 전문가 간 합의가 90%를 초과하는 합의 기준선으로 30°와 60° 경계가 선정되었습니다. 이 등급은 품질 관리 인력이 정량적 결과를 직관적으로 해석할 수 있게 합니다.
(23)
구성 파일 편집
모델 구성 파일(config.yaml 또는 model.yaml)을 열어야 합니다. 구성 내의 후처리 섹션이나 추론 설정 부분이 있어야 합니다. 커스텀 각도 계산 모듈은 제대로 참조되고 활성화되어야 합니다. 출력 파싱 설정은 절단된 담배와 강철 지지대 모두에서 바운딩 박스 좌표를 올바르게 추출하도록 검증되어야 합니다. 이 평가 방법은 추가 레이어 삽입이 필요하지 않으며, 검출 헤드가 출력된 후 후처리 모듈로 작동합니다.
설계 동기
이 맞춤형 평가 방법의 설계는 주관적인 시각적 검사를 객관적이고 재현 가능한 정량적 측정으로 전환하려는 필요성에서 비롯되었습니다. 전통적인 수동 검사는 관찰자 간 변동성이 있어 공정 최적화를 위한 연속적인 수치 데이터를 제공할 수 없습니다. 강철 지지대를 담배 막대 내에서 자연스러운 기하학적 기준으로 활용함으로써 외부 보정 마커의 필요성을 없애고 서로 다른 이미지와 생산 배치 간에 측정 일관성을 보장합니다. 중심점 벡터와 아크탄젠트 계산의 사용은 수학적으로 견고하고 계산 효율적인 각도 추정 접근법을 제공하여 실시간 배포에 적합합니다. 이미지 중심에서 물체 중심으로의 벡터 기반 계산은 카메라 시야각과 담배 막대의 이미지 내 위치에 불변하도록 설계되어 다양한 촬영 조건에서 견고함을 보장합니다. 여러 가닥에 걸친 평균화 전략은 가닥 방향의 자연스러운 변화를 고려하여 통계적으로 신뢰할 수 있는 전체 질서 지표를 산출합니다. 3단계 등급 시스템은 연속적인 수치 측정을 실행 가능한 품질 범주로 변환하여 생산 라인 품질 관리에서 신속한 의사결정을 가능하게 합니다. 전반적으로 이 통합 접근법은 개선된 단일 단계 회귀 모델의 탐지 기능과 정밀한 기하학적 계산을 결합하여, 절단된 담배 정렬 질서에 대한 포괄적이고 자동화된 평가를 가능하게 합니다.
담배 절제 질서 감지를 위한 모델 훈련
PyTorch 2.1.0, Compute Unified Device Architecture(CUDA) 12.1, 그리고 모든 의존성이 제대로 설치되어 있어야 합니다. 구현은 표준 PyTorch YOLO 파이프라인을 따르며, 제공된 상세한 모듈 설명과 구성 단계를 기반으로 재현할 수 있습니다.
훈련 사령부
재학습 전에, 표준 단일 단계 검출 형식(예: 이미지당 .txt 파일 하나인 YOLO 형식)으로 분할된 이미지 데이터셋과 주석 파일을 준비해야 합니다. 이미지 경로, 클래스 수(절단 담배 및 강철 지지), 클래스 이름을 지정하는 데이터셋 구성 .yaml 파일을 만들어야 합니다. 앞서 설명한 모델 개선을 바탕으로, 원래의 검출기 .yaml 설정 파일은 MFID, TCF, DynamicHead 모듈을 포함하는 제안된 모델 .yaml 파일로 교체되어야 합니다. train.py 스크립트는 단일 단계 검출기 패키지를 가져오고, 훈련 모델과 데이터셋 구성을 로드하며, 다음 훈련 매개변수를 설정하도록 작성하거나 수정해야 합니다: imgsz=640, epochs=100, batch=4, workers=0, device='0', 옵티마이너='SGD', close_mosaic=10 등. 무작위 시드는 42로 고정되었고, 모델 가중치는 딥러닝 프레임워크가 제공하는 기본 초기화 전략으로 초기화되었습니다. 재현성을 보장하려면 torch.backends.cudnn.deterministic = True, torch.backends.cudnn.benchmark = False를 설정하여 보장했습니다.
하이퍼파라미터
학습을 위해 구성된 주요 하이퍼파라미터는 다음과 같습니다: 입력 이미지 해상도 896 × 1600 픽셀; 배치 크기는 4이고 GPU 메모리에 의해 제한됩니다; 점진적 감쇠를 위한 코사인 어닐링 스케줄러를 사용한 초기 학습률은 0.01; 수렴 가속화를 위한 운동량 0.912의 확률적 구배 하강(SGD) 최적화기; 정규화를 위한 무게 감쇠는 0.0004입니다. 이미지는 평균 [0.485, 0.456, 0.406]과 표준편차[0.229, 0.224, 0.225]를 사용하여 정규화되었습니다. 증강에는 무작위 수평 뒤집힘(50%), 무작위 밝기 조절(±20%), 무작위 회전(±15°)이 포함되었습니다. 모자이크 증강은 초기 훈련 시기에 기본적으로 활성화되어 다양한 객체 규모와 폐쇄에 대한 모델의 견고성을 향상시킵니다. 탐지 정확도를 개선하기 위해 마지막 10 에포크(close_mosaic = 10)에는 비활성화됩니다.
훈련 모니터링
교육 과정에서 프레임워크는 각 에포크마다 포괄적인 지표를 출력합니다. 손실 함수는 분류 손실(logits와 함께하는 이진 교차 엔트로피 [BCE]), 국소화 손실(합집합 손실 [IoU] 손실을 완전히 교차), 그리고 객체성 손실(BCE)이라는 세 가지 성분의 가중 합입니다. 총 감량 가중치는 λ_cls = 0.5, λ_box = 0.05, λ_obj = 1.0으로 설정되었습니다. 훈련 및 검증 손실 곡선을 모니터링하여 안정적인 수렴과 과적합 징후를 감지해야 합니다. 검증 세트에서 IoU 임계값 0.5(mAP@0.5)의 mAP가 절단된 담배 가닥 탐지의 주요 성능 지표로 사용됩니다. 데이터셋 크기와 모델 복잡도를 고려할 때, 100 에포크를 훈련하는 것이 수렴에 일반적으로 충분합니다. 검증 mAP를 기반으로 가장 성능이 좋은 모델 체크포인트가 자동으로 저장됩니다.
모델 평가 및 배포
평가
훈련이 완료된 후, 최적의 모델 가중치는 runs/train/exp/weights/best.pt로 저장됩니다. 학습된 모델은 전용 검증 세트에서 다음 명령어를 사용하여 평가해야 합니다: python val.py --data cigarette_dataset.yaml --weights runs/train/exp/weights/best.pt. 평가 스크립트는 두 감지 클래스(담배 절단 및 강철 지지) 모두에 대해 정밀도, 호출률, mAP@0.5 등 주요 성능 지표를 출력합니다. mAP는 산업용 배치에 필요한 임계값을 충족하는지 검증되어야 합니다(예: 가닥 감지 시 >95%). 배치 임계값(mAP>가닥 검출 시 95%)은 목표 산업 환경에 대한 내부 성능 요구를 나타냅니다. 보고된 결과는 도전적인 예외 사례를 포함한 다양한 테스트 세트에서의 성능을 반영합니다. 이상적인 조명과 최소한의 가림을 필터링한 부분집합에서 평가했을 때, 모델의 일상 생산 조건에서의 mAP는 96%를 초과합니다. 일상적인 생산 하위 집합은 다음과 같은 기준으로 정의되었습니다: 조명 범위 내에서 500–800럭스(최적 조명), 가림 비율 10% 미만(최소한의 겹침), 그리고 가시적인 반사가 없음. 이 하위 집합에는 427장의 이미지가 포함되어 있으며, 이는 테스트 세트의 약 67%를 차지합니다. 이 하위 집합은 정상 조명과 잘 배치된 가닥 배열 하에서의 표준 주간 생산 조건에 해당합니다.
추론 검증
보이지 않는 이미지에서 모델의 감지 성능을 시각적으로 검증하기 위해, 샘플 테스트 이미지에 대해 다음 명령어를 사용하여 추론이 수행됩니다: python detect.py --weights runs/train/exp/weights/best.pt --source path/to/test/images --conf 0.5. 이 명령어는 감지된 절단된 담배 및 강철 지지대 주위에 경계 상자가 있는 주석 이미지를 생성합니다. 추론 속도는 CUDA 12.1과 PyTorch 2.1.0을 사용하여 NVIDIA GeForce RTX 3080 Ti GPU(12GB VRAM)에서 측정되었습니다. 보고된 초당 프레임(FPS)은 50회의 워밍업 반복 후 100회 연속 순진을 평균 처리한 값으로 계산되었습니다. 또한, 추론 속도(초당 프레임 단위)는 배포 환경에 대한 실시간 적합성을 확인하기 위해 보고됩니다.
모델 배포
산업용 제어 시스템에서 실시간 배포를 가능하게 하기 위해, 학습된 PyTorch 모델(best.pt, 약 7–9MB)은 TensorRT 또는 Open Neural Network Exchange(ONNX)와 같은 최적화된 추론 형식으로 내보내야 합니다. 이 변환은 탐지 정확도를 유지하면서 추론 속도를 향상시킵니다. ONNX 내보내기에는 torch.onnx.export(model, dummy_input, "model.onnx", opset_version=11, input_names=["images"], output_names=["outputs"])를 사용하세요. TensorRT 변환을 위해서는 trtexec --onnx=model.onnx --saveEngine=model.trt --fp16 --workspace=4096을 사용하세요. FP16 정밀도 모드는 추론 속도를 최적화하기 위해 사용되었습니다. 최종 배치된 모델은 경계 상자 좌표, 클래스 라벨(절단된 담배 가닥 또는 강철 지지대), 그리고 각 검출된 물체에 대한 신뢰도 점수를 출력하며, 이는 절단된 담배의 질서를 정량화하는 맞춤형 각도 평가 방법의 입력 자료로 사용됩니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
실험 환경
모든 실험은 PyTorch 딥러닝 프레임워크를 사용하여 수행되었으며, 상세한 하드웨어 및 소프트웨어 구성은 표 1에 요약되어 있습니다. 총 634장의 이미지가 7:2:1 비율로 무작위로 훈련, 검증, 테스트 세트로 나뉘었습니다. 훈련 중에 입력 이미지는 1600 픽셀 896× 일관되게 크기 조정되었고, 초기 학습률은 0.01로 설정되었습니다. 운동량 계수가 0.912인 확률적 기울기 하강 최적화기가 과적합을 완화하기 위해 채택되었습니다. 각 모델은 4번의 배치 크기를 사용하여 100에포크에 대해 학습되었고, 데이터 로딩은 단일 워커 스레드(즉, 워커 = 0)로 수행되었습니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
담배 절단 질서 감지에서 제안된 모델의 주요 장점은 탐지 정확도와 계산 효율성 간의 균형입니다. 이 작업은 고해상도 이미지에서 수많은 미세 입자 담배를 실시간으로 처리해야 하며, 모델의 정밀도와 속도에 엄격한 요구를 부과합니다. 표 2에 나타난 것처럼, 제안된 모델은 비교된 단일 단계 검출기 중 절단된 담배 및 강철 지지대를 감지할 때 가장 높은 mAP@0.5(89.9%)를 달성하며, 매개변수가 가장 적은 1.8M과 가장 낮은 FLOP(5.1G)을 가졌습니다. 이러한 높은 효율성 특성은 실제 생산의 이점으로 직접적으로 이어집니다. 더 작은 모델은 온보드 시스템에 더 빠르게 배포할 수 있게 하며, 메모리를 적게 요구하고, 추론 지연 시간과 전력 소비가 더 적습니다. 따라서 자원이 제한된 산업 제어 플랫폼에 적합하며, 담배 질서 상태를 실시간으로 모니터링하는 동시에 하드웨어 비용과 시스템 통합 복잡성을 줄여줍니다
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자들은 직접적인 경쟁 재정 이해관계가 없다고 선언한다. 이 연구는 롱옌 담배 산업 주식회사에서 수행되었으며, 연구의 적용 시나리오와 현장 데이터를 제공했습니다. 학술 저자들은 이 연구 출판과 관련하여 재정적 또는 비재정적 이해 충돌이 없음을 선언합니다.
이 연구는 가열 불타는 담배 제품의 생산 측정 기술과 환경 온도 및 습도 조절 프로젝트(보조금 번호) 프로젝트의 지원을 받았습니다. FJZYKJJH2022YB014).
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| 코드 리더 | 하이크비전 | ID5050 | 팔레트의 바코드를 읽는 데 사용되었고; 24V 전원 공급 장치가 필요합니다 |
| 데이터셋 (절단된 담배 이미지) | 롱옌 담배 산업 유한회사. | 해당 없음 | 모델 학습, 검증 및 테스트에 사용되는 절단 담배의 맞춤형 이미지 데이터셋 |
| 딥러닝 프레임워크 (PyTorch 2.1.0) | 파이토치 재단 | 오픈 소스 소프트웨어 | 딥러닝 모델 개발 및 훈련에 사용됨 |
| 산업용 카메라 | 하이크비전 | MV-CH120-10GC | 이미지 획득에 사용; 24V 전원 공급 장치가 필요합니다 |
| 산업용 컴퓨터 | 옌즈 테크놀로지 | PC1010-AX360 | 이미지 처리, 모델 추론 및 데이터 저장에 사용됩니다 |
| LED 광원 | 히크로봇 | MV-LRDS-H-95-30-W | 영상 촬영을 위한 안정적인 조명을 제공하는 스트립 광원입니다 |
| 렌즈 | 하이크비전 | MVL-KF0818M-12MP | 초점 거리: 8 mm; 조리개 범위: F1.8– F16; 12 MP 결의안 |
| 금속 브래킷 | 롱옌 담배 산업 유한회사. | 7075-T6 알루미늄 합금 | 하드웨어 부품의 장착 및 안정화에 사용됩니다 |
| 네트워크 케이블 | 롱옌 담배 산업 유한회사. | RJ45 크리스탈 헤드 | 산업용 컴퓨터, 카메라, 네트워크 장치 연결에 사용됩니다 |
| 파이썬 (버전 3.9) | 파이썬 소프트웨어 재단 | 오픈 소스 소프트웨어 | 구현을 위한 프로그래밍 환경 |
| 스위치 | TP-링크 | TL-SH1005 | 이더넷 포트 8개; 220V 전원 공급 장치가 필요합니다 |
| 무선 액세스 포인트 (산업용 통신 모듈) | 산둥 화창 순련 | BH-ANT5158S-14HV; BH-MS-AC1600HWH | 카메라와 산업용 컴퓨터 간 무선 통신을 가능하게 합니다 |
| 카메라 제어 소프트웨어(MVS) | 하이크비전 | V4.5.1 | 카메라 디버깅, 파라미터 설정, 데이터 수집에 사용됩니다 |
| 비전 처리 소프트웨어 (비전 마스터) | 하이크비전 | V4.3.0 | 템플릿 매칭 및 이미지 결과 감지에 사용됩니다 |
| 통합 개발 환경 (PyCharm) | 제트브레인즈 | 2020.1.3 x64 | 모델 개발 및 시스템 구현에 사용됨 |
| CUDA 툴킷 (버전 12.1) | 엔비디아 | 소프트웨어 툴킷 (카탈로그 번호 없음) | 학습 및 추론을 위한 GPU 가속 활성화 |
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청