연구 논문

개선된 단일 단계 회귀 구조를 기반으로 한 담배 브랜드 식별을 위한 실시간 객체 감지 모델

DOI:

10.3791/69657

2026년 1월 9일

이 논문에서

요약

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

자동화된 창고에서의 가림 및 조명 변화와 같은 문제를 해결하기 위해, 본 논문은 담배 상자 브랜드 감지를 위한 개선된 단일 단계 회귀 아키텍처를 소개합니다. 적응형 다운샘플링, 역효과 다중 스케일 주의 메커니즘, 동적 탐지 헤드를 통합함으로써, 제안된 모델은 정확하고 실시간 지능형 재고 측정을 달성합니다.

초록

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

자동 담배 재고의 시각적 인식은 조명 변경, 다양한 박스 크기, 부분 기능 가림 등 브랜드 검증과 잘못된 박스 감지를 복잡하게 만드는 큰 장애물에 직면해 있습니다. 이 글은 이미지 인식 문제를 해결하고 정확도를 향상시키기 위한 향상된 실시간 탐지 모델을 제안합니다. 첫째, YOLO 시리즈의 백본 및 넥 네트워크 모두에서 다운샘플링 컨볼루션 모듈을 대체하기 위해 적응형 다운샘플링 모듈이 배치되어 기본 또는 원래 검출기로서 더 많은 특징 세부사항을 효과적으로 유지하고 모델의 경량성을 실현합니다. 둘째, 서로 다른 스케일의 공간 맥락 정보를 포착하고 보다 정확한 공간 주의 지도를 생성하는 반전 효율 다중 스케일 주의 모듈이 도입되어, 복잡한 특징과 가림 대상에 대한 기준선 모델의 예측 정확도를 향상시킵니다. 마지막으로, 동적 탐지 헤드 모듈이 기초 모델의 원래 검출 헤드를 대체하고, 백본 네트워크와 넥 네트워크에서 추출한 특징 지도에 대해 다중 스케일 객체 탐지를 수행하여 예측된 목표물의 정확한 위치 및 카테고리 분할을 달성합니다. 개선된 모델의 현장 성능을 평가하기 위해, 우리는 담배 상자 브랜드의 시각적 데이터셋을 구축했습니다. 데이터셋은 영역별 복사-붙여넣기 및 전통적인 증강 기법을 통해 보강되었으며, 얻은 데이터셋에는 복잡한 배경, 폐색, 겹침, 작은 표적 및 기타 요인들이 포함되어 있습니다. 이 실험은 이 글에서 제시한 개선된 모델이 현장에서의 실시간 탐지 요구사항을 효과적으로 충족함을 입증합니다. 제안된 모델은 97.9%의 mAP를 달성하며, 파라미터와 FLOP은 각각 1,849,679 G와 5.1 G입니다. 기본 모델과 비교했을 때, 제안된 모델은 mAP를 0.9% 개선하고 매개변수를 28.78% 감소시키고 부동소수점 연산을 1.4G로 줄였습니다. 또한 모델은 38.5 FPS의 추론 속도를 달성하여 실시간 산업 탐지 요구사항을 충족합니다.

서론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

현대 제조 및 물류는 고밀도 저장, 효율적인 자재 취급, 정확한 재고 관리를 달성하기 위해 자동화 저장 및 회수 시스템(AS/RS)1에 크게 의존하고 있습니다. AS/RS는 높은 효율성과 지능적인 특성 덕분에 기업이 창고 효율성을 높이고 비용을 절감하는 데 중요한 수단이 되었습니다. 다층 선반, 다양한 적하차 장비를 기반으로 한 AS/RS는 기계, 전자, 컴퓨터 과학, 통신, 네트워킹, 센서, 자동 제어 여러 기술을 통합한 컴퓨터 제어 메카트로닉스 시스템입니다. AS/RS는 선반, 스태커 크레인, 컨베이어 라인, 제어 시스템 및 기타 장비의 통합과 최적화를 통해 효율적이고 정확하며 안전한 화물 저장 및 취급을 실현하여 저장 효율성을 크게 향상시킵니다. 인더스트리 4.0의 핵심 요소인 AS/RS에 컴퓨터 비전을 통합함으로써, 시스템이 시각적 데이터를 바탕으로 보고 의사결정을 내릴 수 있게 하여 전례 없는 수준의 자동화와 지능을 가능하게 합니다.

담배 공장에서 AS/RS가 널리 적용됨에 따라배 상자 브랜드에 대한 새로운 재고 관리 요건이 제안되었습니다. 전통적인 수동 재고 정리 방식은 비효율, 높은 오탐지율, 그리고 AS/RS 요구를 충족하지 못하는 안전 위험 문제로 어려움을 겪습니다. 컴퓨터 비전 기술의 지속적인 발전에 따라, 머신 비전 솔루션은 산업 검사 분야에서 점점 더 많이 적용되고있습니다. 6, 7, 8. 각 담배 상자에 고유한 패턴과 텍스트가 인쇄된 브랜드 정보가 있기 때문에, 머신 비전 기반 이미지 인식 기술을 통해 담배 상자 브랜드 식별과 재고 정리가 가능해졌습니다.

2012년 이후 딥러닝 기반 객체 탐지 알고리즘은 이미지 인식 9,10,11 큰 돌파구를 가져왔습니다. 초기 2단계 객체 탐지 모델인 R-CNN12부터, YOLO 시리즈 모델이 기준선 또는 원래 검출기13, 14, 15를 지배하는 현대 단일 단계 객체 탐지 모델에 이르기까지, 이러한 접근법들은 객체 탐지 알고리즘 개발에 중요한 기여를 했습니다. 지능형 재고 분석 작업은 점점 더 객체 감지 모델을 사용하여 이미지나 영상에서 여러 대상을 정확히 식별하고 위치를 파악합니다. Li 등은 무게 센서와 영상 인식 기술을 통합한 지능형 재고 측정 방법을 제안하여 재고 효율성과 정확성을 향상시키려 하였습니다. Wang 등은 마스크 R-CNN을 사용해 책 등뼈 이미지에서 책장 번호와 제목 위치를 분할했습니다. Sun 등은 OpenCV를 사용해 재료와 선반의 2차원 코드를 다중 모드로 인식하는 통합 시각 인식 시스템을 설계했습니다. 그들은 C3CBAM 주의 메커니즘과 SimOTA 라벨 할당을 도입하여 원래의 검출기(v5s)를 최적화하여 손실 함수를 강화하여 정확한 다중 물질 검출을 가능하게 했습니다.

객체 탐지 분야에서, Faster R-CNN으로 대표되는 2단계 모델은 전통적인 탐지 정밀도 우수성을 가지고 있지만, 복잡한 영역 제안 생성 메커니즘 때문에 추론 속도가 상대적으로 느립니다. 그 결과, 산업 시나리오에서의 실시간 성능 요구사항을 충족하는 데 어려움을 겪고 있습니다. 반면, 회귀 기반 아키텍처는 객체 탐지를 단일 회귀 문제로 다루며, 입력 이미지로부터 목표 위치와 범주 확률을 직접 예측합니다. 이러한 아키텍처 설계는 추론 효율성, 경량화, 배포 유연성 면에서 대부분의 2단계 모델을 훨씬 능가하면서도 경쟁력 있는 정확도를 유지할 수 있게 합니다. 따라서 이 아키텍처는 실시간산업 탐지에 선호되는 솔루션이 되었습니다.

원래의 모델 생태계는 빠르게 진화하고 있으며, 최근에는 특정 과제를 해결하는 변형들이 등장합니다. 예를 들어, 원래 검출기(v12)22는 학습 시간 최적화와 아키텍처 정교화를 더욱 강화하여 정확도와 효율성의 균형을 개선하는 데 중점을 두고 있습니다. 한편, 원래 검출기(World)23은 시각 언어 모델링을 활용하여 학습 집합 범주를 넘어 방대한 객체를 실시간으로 추론할 수 있는 오픈 어휘 탐지 기능을 도입했습니다. 이러한 발전은 범용 객체 검출의 경계를 넓히지만, 이 연구는 부분 폐쇄나 조명 분산과 같은 특정 도전에 대한 견고성이 가장 중요하고, 범주 공간이 고정되어 사전에 알려진 특수한 산업 응용에 초점을 맞추고 있습니다. 이 모델 계열 중 가장 뜨거운 버전인 기본 모델24는 원래 검출기(v8)25,26의 장점을 계승합니다; 이는 모델 매개변수 수를 줄일 뿐만 아니라 탐지 효율성과 정확도 간의 균형도 고려합니다. 다른 객체 탐지 모델과 비교할 때, 시각 인식 작업에서 두드러집니다.

작거나 부분적으로 가려진 담배 상자를 감지하는 도전은 컴퓨터 비전 분야의 더 넓은 문제의 한 형태입니다. 작은 객체 탐지는 활발히 연구되어 왔으며, 특징 피라미드 네트워크(FPN)27 의 정제부터 다중 스케일 특성 처리의 통합을 촉진하는 맥락 인식 주의 메커니즘에 이르기까지 다양한 접근법이 있습니다. 더불어, 산업 환경에서 운영 효율성을 추구하기 위해서는 경량 모델 설계가 필요합니다. MobileNetV328 과 GhostNet29에서 탐구된 효율적인 아키텍처 개념에서 영감을 받아, 이 개념들은 심층 합성곱과 선형 변환을 사용하여 계산 복잡도를 줄이면서도 프레젠테이션 능력을 유지하므로, 모델을 개선하기 위해 경량 모듈을 선택했습니다. 따라서 담배 상자 브랜드의 재고 조사와 조명 변화, 브랜드별 특징 크기 차이, 담배 상자 내 부분 가림 등 재고 수집에 영향을 미치는 요인들을 다루기 위해, 본 글에서는 개선된 단일 단계 회귀 아키텍처 객체 감지 모델을 제안합니다.

제안된 모델의 주요 혁신은 세 가지입니다. 첫째, 적응형 다운샘플링(ADown)30모듈이 백본 및 넥 네트워크 모두에서 표준 컨볼루션 다운샘플링을 대체하기 위해 배포됩니다. 이 새로운 설계는 기능 압축 과정에서 발생하는 정보 손실을 완화하며, 이는 작은 브랜드 로고와 텍스트를 보존하는 데 매우 중요합니다. 둘째, 역방향 효율적 다중 스케일 주의(iEMA) 메커니즘을 도입하여 모델에 동적이고 다중 스케일의 맥락적 인식을 부여하여, 작고 부분적으로 가려진 담배 상자에서의 성능을 크게 향상시킵니다. 셋째, 원래의 탐지 헤드는 DynamicHead31 모듈로 대체되어, 규모, 공간, 작업 인식 주의를 통합하여 크기가 매우 다른 표적들 간에 보다 정밀한 위치 및 분류가 가능해졌습니다. 이러한 아키텍처 변경은 산업 환경에서 담배 브랜드 식별의 특정 문제를 해결하기 위해 일관되어 설계되었습니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 글에서 사용된 데이터셋은 롱옌 담배산업공사(Longyan Tobacco Industry Co., Ltd.) 물류부서의 AS/RS 분야에서 수집한 것입니다. 이 연구는 인간 참가자나 동물을 포함하지 않았습니다. 윤리적 승인은 필요하지 않았습니다.

데이터셋 획득 및 설정
하드웨어 구성: 8mm 초점 거리 렌즈(예: MVL-HF0828M-6MPE)가 장착된 산업용 카메라(예: MV-CA013-A0GM)를 스태커 크레인의 화물 플랫폼에 장착합니다. 카메라를 GigE 케이블과 무선 AP 장치(예: BH-ANT5158S-14HV, BH-MS-AC1600HWH)를 통해 제어 PC에 연결하세요. 카메라 주변에 스트립 LED 조명(예: MV-LLDS-1002-38-W)을 배치하여 균일한 조명을 확보하세요.

카메라 파라미터 설정: 제조사 소프트웨어(예: MVS)를 사용해 카메라를 구성하세요. 획득 해상도를 1280 x 1024 픽셀로 설정하세요. 트리거 모드를 하드웨어 트리거 로 설정하고 스태커 크레인의 위치 측정 시스템과 동기화하세요. 모션 블러와 노이즈를 최소화하기 위해 노출 시간을 100ms, 게인을 5dB로 설정하세요. 카메라와 담배 상자 사이의 작동 거리는 약 550mm입니다.

이미지 수집: 트리거가 있는 산업용 카메라는 담배 상자를 보관하고 회수할 때 트레이가 배치될 때마다 자동으로 이미지를 캡처합니다. 총 4,835장의 원본 이미지를 수집하세요; 일반적인 이미지는 그림 1에 나와 있습니다.

이미지 주석: 오픈소스 도구인 LabelImg를 사용하세요. 각 이미지마다 눈에 띄는 담배 브랜드 특징 주위에 경계 상자를 그려보세요. 각 경계 상자의 클래스 라벨로 올바른 브랜드명(예: 홍장, 구톈)을 지정하세요. 주석은 표준 단일 단계 검출 형식으로 저장하며, 이미지당 하나의 텍스트 파일로 저장하세요.

품질 관리: 두 번째 주석자가 무작위로 선정된 주석 이미지 중 20%를 검토합니다. 불일치가 있으면 논의되고 해결되어 라벨링의 일관성을 보장합니다.

데이터 증강 전략
이 섹션에서는 전통적 및 고급 증강 기법을 모두 데이터셋에 적용한 내용을 자세히 설명합니다. 초기 데이터와 증강 데이터는 새로운 데이터셋으로 결합되고, 이를 훈련 세트, 검증 세트, 테스트 세트로 나누어 평가의 공정성을 보장합니다.

전통적인 데이터 증강32: 이러한 변환은 학습 파이프라인(예: 알부젠테이션 또는 PyTorch 변환 라이브러리 사용)에 의해 각 배치에 대해 정의된 확률로 적용됩니다.

기하학적 변환: 회전: 이미지를 -45°에서 +45° 사이의 각도로 무작위로 회전시킵니다. 스케일링: 이미지를 0.8배에서 1.2 배 사이의 무작위 스케일링으로 조정합니다. 수평 뒤집기: 이미지를 무작위로 100% 확률로 수평으로 뒤집는 것. 무작위 크롭: 원본 이미지 영역의 80%에서 100% 사이의 구간을 무작위로 자르는 것입니다.

광도 변환: 밝기와 대비: [0.6, 1.4]에서 무작위로 선택된 인수로 밝기와 대비를 조정합니다. 가우시안 노이즈: [0, 0.01 * 255] 중에서 무작위로 선택한 표준 편차를 가우시안 노이즈로 이미지의 10%에 추가합니다. 가우시안 블러: 이미지의 10%에 3x3 크기의 가우시안 블러를 적용합니다.

오클루전 시뮬레이션: 이미지 위에 1개에서 3개의 직사각형 오클루전 패치(각 패치가 이미지 면적의 최대 5%를 커버)를 무작위로 배치합니다. 패치는 무작위 노이즈 또는 평균 이미지 픽셀 값으로 채워집니다.

고급 데이터 증강: 지역별 복사-붙여넣기
동기와 영향력: 이 목표 향상의 주요 동기는 중요한 데이터 문제를 해결하기 위함이었습니다: 여러 담배 브랜드가 극히 적은 사례(단 한 장의 이미지)를 기록했습니다. 표준 무작위 열차 검증 테스트 분할은 희귀 브랜드의 모든 인스턴스를 단일 집합(예: 모두 테스트 세트에 할당)할 수 있어, 모델이 그 브랜드를 학습하거나 검증할 기회를 잃게 됩니다. 이 방법은 인위적으로 소외된 브랜드의 샘플 크기를 늘려, 모든 브랜드가 학습, 검증, 테스트 세트에 충분한 인스턴스를 분산하도록 보장했습니다. 이 기본 단계는 희귀 카테고리에서 치명적인 실패를 방지하며, 브랜드 전체 세트에 대한 의미 있는 모델 성능과 일반화의 전제 조건입니다.

이 단계에서는 초기 데이터셋과 세그먼트 애니씽 모델(SAM)33에 대해 사전 학습된 세그먼트 베이스라인 모델이 필요합니다.

소스 객체 분할: 소외된 브랜드의 담배 상자 이미지의 경우, SAM 모델을 사용해 정밀한 세분화 마스크를 생성합니다. 포인트 프롬프트 모드를 사용하여 담배 상자의 브랜드 기능을 클릭하여 세분화를 시작하세요. 생성된 마스크를 수동으로 검증하고 정교하게 조정하여 정확성을 보장합니다. 투명 배경이 있는 세그먼트된 담배 상자 이미지를 PNG 파일로 저장하세요. 이로 인해 고립된 객체 인스턴스들의 라이브러리가 생성됩니다.

배경 마스크 생성: 사전 학습된 세그먼트 베이스라인 모델을 사용하여 배경 이미지 집합(여유 공간이 넉넉하거나 단순한 배경이 있는 이미지)에 대해 인스턴스 세분화를 수행합니다. 모델은 이미 객체가 점유한 영역을 나타내는 이진 마스크를 출력합니다.

마스크 처리 및 객체 붙여넣기: 각 배경 마스크에 대해 OpenCV 라이브러리('cv2.approxPolyDP' 함수, 엡실론 인자 0.02 * 윤곽 둘레)를 사용하여 곡선 맞춤과 마스크 가장자리의 선형화를 수행하여 자유 공간의 단순화된 폴리곤 표현을 얻습니다. 배경 마스크 내에서 가장 큰 연속된 폴리곤 영역을 목표 붙여온 영역으로 지정하세요. 라이브러리에서 무작위로 분할된 소스 객체를 선택하세요. 크기를 조정(종횡비 유지)하고 아핀 변환(-5°에서 +5° 사이의 미세 회전과 약간의 전단)을 적용하여 목표 페이스트 영역에 자연스럽게 맞춰 기존 객체의 경계와 겹치지 않도록 합니다. 알파 블렌딩을 사용해 변환된 객체를 계산된 위치의 배경 이미지에 매끄럽게 붙여넣으세요. 특정 영역에서 복사-붙여넣기 기법을 기반으로 한 데이터 증강 기술의 전체 프레임워크는 그림 2에 나와 있습니다. 붙여넣은 객체에 대해 해당 새로운 txt 주석 파일을 프로그래밍적으로 생성하고, 경계 박스 좌표와 클래스 라벨을 업데이트합니다.

최종 증강 데이터셋: 이 오프라인 프로세스는 600장의 새로운 합성 이미지를 생성합니다. 이들을 원래 4,835장의 이미지와 위에서 설명한 전통적인 증강 기법을 적용해 생성된 추가로 생성된 1,167장의 이미지를 결합하여 최종 6,602장의 이미지 데이터셋을 만듭니다. 최종 데이터셋을 학습(70%, 4,621장), 검증(20%, 1,320장), 테스트(10%, 661장) 세트로 나누어 동일한 원본 시퀀스의 이미지가 동일한 분할 내에 유지되도록 하여 데이터 누출을 방지합니다.

제안된 개선된 검출기 구축을 위한 모델 수정
객체 탐지34 의 최적화된 알고리즘은 최근 몇 년간 산업 검사에서 눈에 띄는 진전을 이루었습니다. 이 섹션에서는 제안된 모델을 만들기 위해 기본 모델 아키텍처를 수정하는 상세하고 단계별 절차를 제공합니다. 수정은 모델의 구성 파일(예: config.yaml)을 편집하고 해당 커스텀 모듈 정의가 코드베이스에 포함되도록 하여 구현됩니다. 각 수정의 근거는 특정 탐지 문제를 해결하는 데 있어 그 역할을 명확히 하기 위해 제시됩니다. 제안된 모델의 구조는 그림 3에 나타난다.

다운샘플링 모듈을 ADown 모듈로 대체하기: 다운샘플링에 사용되는 표준 컨볼루션-배치-노름-SiLU(CBS) 모듈은 단일 스트라이드 컨볼루션을 사용하며, 이는 정보 병목35 역할을 할 수 있어 작은 담배 상자와 상세한 브랜드 로고를 인식하는 데 중요한 미세화된 특징들을 버릴 수 있습니다. ADown 모듈은 공간 해상도 감소 시 더 풍부한 특징을 포착하고 보존하는 이중 분기 구조를 구현하여 이를 완화하도록 설계되었습니다. 한 부서는 고빈도 지역 세부 정보를 보존하는 데 우선순위를 두고, 다른 부서는 더 넓고 맥락이 풍부한 개요를 포착합니다. 이러한 상호 보완적 특징들의 융합은 이후 계층에 대한 보다 견고하고 유익한 표현을 가능하게 합니다.

행동-실행 단계
모듈 정의: 프로젝트의 모델 정의 파일 내에 ADown이라는 이름의 맞춤형 PyTorch 모듈이 정의되어 있는지 확인하세요. 이 모듈은 두 개의 병렬 분기를 포함해야 합니다. 첫 번째 분기는 3x3 커널과 2의 보행을 가진 2차원 컨볼루션 층으로 구성되어야 합니다. 두 번째 분기는 순차적으로 2x2 최대 풀링 계층(스트라이드 2)과 1x1 합성곱 층으로 구성되어야 합니다. 이 두 분기의 출력은 채널 차원을 따라 연결되고, 결과된 특징 맵은 최종 1x1 컨볼루션 층을 거쳐 채널을 적분하여 출력을 생성합니다. ADown 모듈의 구조는 그림 4에 나와 있습니다.

구성 파일 편집: 기본 모델 구성 파일(config.yaml)을 엽니다. 다운샘플링(즉, 스트라이드 매개변수가 2로 설정된 경우)으로 구성된 CBS 모듈의 모든 인스턴스를 체계적으로 식별합니다. 이 CBS 모듈 항목들을 새로운 ADown 모듈로 교체하세요.

설계 동기: ADown의 설계는 표준 스트라이드 컨볼루션에서 정보 손실을 완화해야 한다는 필요성에서 비롯되었으며, 이는 작은 객체에 해로울 수 있습니다. 이중 분기 구조는 고주파 공간 세부사항(컨볼루션을 통해)과 저주파 맥락 정보(풀링을 통해)를 모두 포착하는 병렬 처리 아이디어에서 영감을 받아 후속 계층에 대한 더 풍부한 다중 스케일 특징 표현을 제공합니다.

iEMA 모듈의 통합
근거 및 설계 원칙: 모델이 작은 목표물과 부분적으로 가려진 대상을 탐지하는 능력을 향상시키기 위해서는 다중 규모 공간 맥락을 효과적으로 모델링할 수 있는 메커니즘을 포함시키는 것이 필수적입니다. iEMA 모듈은 효율적인 다중 스케일 주의(EMA)36 구성 요소를 역잔차 블록(iRMB)37 구조 내에 내장함으로써 이를 달성합니다. iRMB는 깊이별 분리 가능한 컨볼루션을 사용하여 계산 효율적인 기반을 제공하며, EMA 구성 요소는 병렬 다중 분기 설계를 통해 교차 규모의 공간적 상호작용을 명시적으로 포착합니다. 이 통합은 모델이 특징 가중치를 동적으로 재보정하여 다양한 스케일에서 가장 구별적인 공간 영역에 집중할 수 있게 하여, 가림 상태와 작은 객체에 대한 인식을 향상시킵니다.

행동-실행 단계
모듈 정의: iEMA라는 이름의 맞춤형 PyTorch 모듈이 정의되었는지 확인하세요. 이 모듈은 먼저 역잔차 블록을 구현해야 합니다. 이 블록은 일반적으로 채널 확장을 위한 점별 컨볼루션으로 시작하고, 공간적 특징 추출을 위한 깊이별 컨볼루션(예: 3x3)을 거쳐 마지막으로 채널 투영을 위한 점별 컨볼루션으로 진행됩니다. 이 블록 직후에는 EMA 주의 메커니즘이 도입되어야 합니다. EMA 메커니즘은 일반적으로 집단 합성곱과 차원 간 상호작용을 사용하여 과도한 계산 오버헤드 없이 효율적으로 다중 스케일 공간 주의 지도를 생성합니다. iEMA 모듈의 구조는 그림 5에 나와 있습니다.

구성 파일 편집: config.yaml 구성 파일에서 넥 네트워크를 정의하는 섹션, 특히 C2f 모듈 바로 뒤의 계층을 찾아보세요. 이 전략적 위치에 iEMA 모듈을 호출하는 새로운 계층을 삽입합니다.

설계 동기: iEMA 모듈은 깊이별 합성곱을 통한 국소 특징 추출과 경량이지만 효과적인 전역 맥락 모델링 메커니즘(EMA)을 통합하여 특징 식별성을 향상시키는 원리에 기반합니다. 이 하이브리드 접근법은 모델이 다양한 규모의 정보 영역에 적응적으로 집중할 수 있게 하여, 부분적으로 보이는 브랜드 로고와 텍스트를 인식하는 데 매우 중요합니다.

DynamicHead 모듈로 감지 헤드 교체
근거 및 설계 원칙: 원래 탐지 헤드는 담배 상자의 상당한 규모 변화와 위치 파악 및 분류 작업 간의 복잡한 상호작용을 최적으로 처리하지 못할 수 있습니다. DynamicHead 모듈은 세 가지 주의 형태를 통합하여 규모 인식, 공간 인식, 과제 인식 주의를 통합하여 이를 해결합니다. 스케일 인지 구성 요소는 기능 피라미드의 다양한 수준의 특징들을 동적으로 융합하여 모든 크기의 객체가 효과적으로 표현되도록 보장합니다. 공간 인식 구성 요소는 희소 샘플링 전략을 사용하여 특징지도 내에서 가장 유익한 영역에 계산 자원을 집중합니다. 작업 인식 구성 요소는 경계 상자 회귀와 범주 분류라는 뚜렷한 목적에 맞게 특징 표현을 조정합니다. 이러한 통합된 접근법은 보다 정확하고 견고한 예측을 가능하게 합니다.

행동-실행 단계
모듈 정의: 이 모듈은 방정식 (1)부터 (4)까지 설명된 세 가지 주의 메커니즘을 포함하는 복잡한 모듈입니다. 내부 구조에는 스케일 가중치 계산, 변형 가능한 공간 주의 수행, 과제별 특징 변환 적용을 위한 계층이 포함될 것입니다.

방정식 1(1)

방정식 2(2)

방정식 3(3)

방정식 4(4)

여기서 WL(F)는 입력 특징 F에 스케일 인식 π L(F), 공간 인식 π S(F), 작업 인식 πC(F) 주의 메커니즘을 순차적으로 적용하여 얻은 최종 주의 정제된 특징 맵을 나타냅니다. 구체적으로, 식(2)에서 π L(F는 먼저 공간 (S) 차원과 채널 (C) 차원에서 평균을 내어 스케일 단위의 주의 가중치를 계산하고, 이를 선형 함수 f(⋅)와 하드 시그모이드 활성화 σ(⋅)를 거쳐 계산합니다. 식(3)에서 π S(F)는 샘플링된 핵심 지점 pk에서 특징을 집계하여 희소 공간 주의를 수행하며, 각 특징은 학습 가능한 오프셋 Δpk를 가지고 판별 영역에 집중하고 중요도 스칼라 Δmk를 둡니다. 식(4)에서 π C(F)는 각 채널에 학습된 매개변수(α1,β 1,α 2,β 2)에 의해 지배되는 선형 변환을 적용하고 최대 응답을 선택하여 분류 및 회귀 작업에 특화할 수 있도록 하여 작업 인식 주의를 구현합니다. DynamicHead 모듈의 구조는 그림 6에 나와 있습니다.

구성 파일 편집: config.yaml 파일에서 모델의 헤드를 정의하는 섹션을 찾으세요. 이 섹션에는 원래 Detect 모듈이 포함되어 있습니다. DynamicHead 모듈을 호출하는 새 항목으로 교체하세요.

설계 동기: DynamicHead 모듈은 객체 탐지 헤드가 규모, 공간 위치, 작업에 적응해야 한다는 관찰에 기반합니다. Its unified attention framework, formalized in Eqs. (1-4)는 모델이 이 세 차원을 기반으로 특징 응답을 동적으로 재보정하여 척도 변동과 배경 혼잡함에 대한 보다 강력한 예측을 가능하게 합니다.

모델 훈련
PyTorch 2.1.0, CUDA 12.1, 모든 의존성이 설치되어 있는지 확인하세요.

훈련 사령부
재학습 전에 분할된 이미지 데이터와 주석 데이터를 표준 단일 단계 검출 형식으로 준비하세요. 이미지 경로와 데이터 카테고리를 포함하는 .yaml 파일을 만듭니다. 모델 개선에 따르면, 원래의 탐지기 .yaml 파일은 제안된 모델 .yaml 파일로 대체됩니다. train.py 파일을 작성하고, 단일 단계 검출기 패키지를 가져오며, 훈련 모델과 데이터 경로를 불러오고, imgze=640, epochs=100, batch=4, workers=0, device='0', optimizer='SGD', close_mosaic=10 등 훈련 매개변수를 설정하세요.

하이퍼파라미터: 주요 매개변수는 입력 이미지 크기(640 x 640), 배치 크기(4), 코사인 어닐링 스케줄러 사용 초기 학습률(0.01), 운동량을 이용한 SGD 옵티마이저(0.937), 그리고 가중치 감쇠(0.0005)입니다. 모자이크 증강은 기본적으로 활성화되어 있습니다.

훈련 모니터링: 학습 과정은 각 시기별 지표를 출력합니다. 훈련/검증 손실과 mAP를 0.5로 모니터링하여 수렴을 확인하고 과적합을 방지하세요. 100에이포크의 훈련이면 보통 충분합니다.

모델 평가 및 배포
평가: 훈련 후 최적의 모델이 runs/training/exp/weights/best.pt로 저장됩니다. val 집합에서 다음과 같이 평가하세요: bash python val.py --data cigarette_dataset.yaml --weights runs/train/exp/weights/best.pt. 스크립트는 Precision, Recall, mAP 0.5 등을 출력합니다. mAP가 요구되는 기준치(예: 97.9%)를 충족하는지 확인하세요.

검증을 위한 추론: 샘플 이미지에 대한 추론을 실행하여 검출 결과를 시각적으로 검증합니다: bash, python detect.py --weights runs/train/exp/weights/best.pt --source path/to/test/images --conf 0.5. 추론을 검증함으로써 각 이미지의 검출 결과와 모델의 검출 속도를 얻을 수 있습니다.

배포: 스태커 크레인 시스템에서 실시간 배포를 위해 PyTorch 모델(best.pt, ~4.7MB)을 TensorRT 또는 ONNX와 같은 형식으로 변환하여 추론 속도를 최적화하세요. 최종 출력물은 클래스 라벨(브랜드명)과 신뢰도 점수가 포함된 경계 상자입니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

실험 환경 및 매개변수 설정
제안된 모델의 성능을 검증하기 위한 실험은 딥러닝 프레임워크 PyTorch에서 수행되었으며, 실험 환경의 세부 사항은 표 1에 나와 있습니다. 여기서는 6,602장의 이미지를 포함한 특수 데이터셋을 사용했으며, 이를 7:2:1 비율로 무작위로 학습, 검증, 테스트 세트로 나누었습니다. 모든 실험은 해상도 640 x 640의 입력 이미지를 사용했고, 초기 학습률은 0.01이었으며, 과적합을 방지하기 위해 0.937의 확률적 기울기 하강으로 최적화되었습니다. 훈련 중에는 모자이크 증강을 사용해 각 반복마다 네 개의 이미지를 처리하여 탐지에 필요한 배경을 다양화했습니다. 모든 모델은 100 에포크에 대해 학습되었으며, 배치 크기는 4개였고, 워커 스레드 수는 0으로 설정되었습니다.

평가 지표
다중 분류에 관심 있는 표본은 양성 분류로 지정되었고, 나머지 모...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

정확도와 효율성의 절충
이 모델의 핵심 성취는 정확성과 계산 효율성 간의 우수한 균형입니다. 표 2에서 알 수 있듯이, 제시된 모델은 단일 단계 검출기 모델 중 가장 낮은 매개변수 수와 두 번째로 낮은 FLOP을 가진 동시에 가장 높은 mAP를 달성합니다. 이는 실질적인 이점으로 직접적으로 이어집니다: 더 작은 모델은 배포가 더 빠르고 메모리를 덜 필요로 하며, GPU와 엣지 하드웨어 모두에서 추론 지연과 전력 소비가 더 적습니다. 이로 인해 계산 예산이 부족한 스태커 크레인의 온보드 컴퓨터와 같은 자원이 제한된 플랫폼에서의 실시간 응용에 매우 적합합니다.

한계
성능이 뛰어나지만, 향상된 모델은 여러 가지 한계가 있습니다. 정확도는 훈련 데이터의 대표성에 달려 있습니다. 극한 조명 조건(예: 강한 반사광)이나 담배 상자...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 직접적인 경쟁 재정 이해관계가 없다고 선언한다. 이 연구는 홍리 덩과 원젠 리가 근무하는 롱옌 담배 산업유한회사와 바오지 담배 공장(저자 바오빈 루오가 근무)과 협력하여 수행되었습니다. 이 제휴 기관들은 연구의 적용 시나리오와 현장 데이터를 제공했습니다. 학술 저자들(류준, 장광이, 펑양, 자오보)은 이 저작의 출판과 관련하여 금전적 또는 비금전적 이해충돌이 없음을 선언한다.

감사의 글

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 연구는 중국 저장성 자연과학기금 공동 기금으로 지원받은 전반사 및 다파장 주설 빌릿 주조 온도측정법(No.LZY24E050002)과 곡저우 과학기술기획사업이 지원하는 비폐쇄 및 비등온적 국자 공동의 온라인 온도 필드 측정법(번호 2023K231)의 재정 지원을 받았습니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
코드 리더하이크비전ID5050Hikvision 장비: 팔레트의 바코드를 읽는 데 사용됨, 24V 전원 공급 장치 연결 필요
산업용 카메라하이크비전MV-CA013-A0GM, MV-CS016-10GM24V 전원 공급 장치를 연결해야 합니다
LED 조명히크로봇MV-LLDS-1002-38-W1미터 스트립 광원은 카메라에 충분한 조명 조건을 제공합니다
렌즈하이크비전MVL-HF0828M-6MPE초점 거리: 8mm, 조리개 범위: F2.8~F16, 픽셀: 6백만
MVS하이크비전V4.5.1Hikvision 소프트웨어: 카메라 디버깅, 카메라 매개변수 설정 및 데이터 수집에 사용됩니다
파이참제트브레인즈2020.1.3 x64딥러닝 모델 훈련 및 탐지 시스템 개발에 사용됩니다
여러 개의 금속 브래킷롱옌 담배 산업 유한회사.7075-T6 알루미늄 합금카메라 및 코드 리더기 고정에 사용됩니다
여러 네트워크 케이블롱옌 담배 산업 유한회사.RJ45 크리스탈 헤드산업용 컴퓨터와 무선 AP에 베이스 스테이션을 연결하고, 카메라와 스위치를 연결하는 등
스위스TP-링크TL-SH1005220V 전원 공급이 필요한 이더넷 케이블 인터페이스는 8개 있습니다
비전 마스터하이크비전V4.3.0Hikvision 소프트웨어: 템플릿 매칭 및 이미지 결과 감지에 사용됩니다
무선 AP 장치산둥 화창쉰롄BH-ANT5158S-14HV, BH-MS-AC1600HWH스태커 크레인의 대규모 이동 때문에 네트워크 케이블이 카메라를 산업용 컴퓨터에 연결할 수 없으며, 카메라 네트워크의 원활한 작동을 보장하기 위해 무선 AP 장치가 필요합니다

참고문헌

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Chen, C., Liu, J., Yin, H., Huang, B. A Vision-Based Method for Detecting the Position of Stacked Goods in Automated Storage and Retrieval Systems. Sensors. 25 (10), 2623(2025).
  2. Yu, X., Liao, X., Li, W., Liu, X., Tao, Z. Logistics automation control based on machine learning algorithm. Cluster Comput. 22 (Suppl 4), 14003-14011 (2019).
  3. Liu, J., et al. Benders decomposition for the multi-agent location and scheduling problem on unrelated parallel machines. Soft Computing. 29 (1), 195-212 (2025).
  4. Haffner, O., Kuˇcera, E., Rosinová, D. Applications of Machine Learning and Computer Vision in Industry 4.0. Appl. Sci. 14 (6), 2431(2024).
  5. Bo, Q., et al. Formulation of receiving/retrieving strategy for automatic high rack finished cigarette warehouse. Tobacco Sci Technol. 57 (6), 92-98 (2024).
  6. Voulodimos, A., Doulamis, N., Doulamis, A., Protopapadakis, A. Deep learning for computer vision: A brief review. Computat Intell Neurosci. 2018 (1), 7068349(2018).
  7. Khan, A. I., Al-Habsi, S. Machine learning in computer vision. Proc Comp Sci. 167, 1444-1451 (2020).
  8. Xu, S., et al. Computer vision techniques in construction: a critical review. Arch Computat Meth Eng. 28 (5), 3383-3397 (2021).
  9. Xu, P. Progress of Object detection: Methods and future directions. Second IYSF Acad Sympos Artif Intell Comp Eng SPIE. 12079, 530-542 (2021).
  10. Sreelakshmi, P. R., Swaraj, K. P. Occlusion resilient object detection under various situations using deep learning techniques: A review. AIP Conf Proc AIP Publishing LLC. 3037 (1), 020042(2024).
  11. Rich feature hierarchies for accurate object detection and semantic segmentation. Girshick, R., Donahue, J., Darrell, T., Malik, J. Proc IEEE Conf Comp Vision Pattern Recognit, , 580-587 (2014).
  12. Fast R-CNN. Girshick, R. Proc IEEE Int Conf Comp Vision, , 1440-1448 (2015).
  13. You only look once: Unified, real-time object detection. Redmon, J., Divvala, S., Girshick, R., Farhadi, A. Proc IEEE Conf Comp Vision Pattern Recognit, , 779-788 (2016).
  14. Hussain, M. YOLO-v1 to YOLO-v8, the rise of YOLO and its complementary nature toward digital manufacturing and industrial defect detection. Machines. 11 (7), 677(2023).
  15. Li, C., et al. YOLOv6: A single-stage object detection framework for industrial applications. arxiv. , (2022).
  16. Li, D., Liu, Y., Hu, C., Wang, Y., Wen, X. Research and application of intelligent stocktaking method based on weighing and image recognition technology in publishing industry. Logistics Technol Applicat. 30 (1), 134-142 (2025).
  17. Wang, X., Qian, S., Zhang, J., Guo, J., Pan, C. Exploration and application of library book stocktaking system based on computer vision and artificial intelligence technology. Library J. 41 (7), 96(2022).
  18. Sun, H., Li, P. Design and development of intelligent warehouse stocktaking system based on multi pattern visual recognition technology. Construct Machinery Equip. 56 (4), 107-111 (2025).
  19. Ren, S., He, K., Girshick, R., Jian, S. Faster R-CNN: Towards real-time object detection with region proposal networks. IEEE Transact Pattern Anal Machine Intell. 39 (6), 1137-1149 (2016).
  20. Speed/Accuracy Trade-offs for Modern Convolutional Object Detectors. Huang, J., et al. Proc IEEE Conf Comput Vis Pattern Recognit. (CVPR), , 7310-7311 (2017).
  21. Bochkovskiy, A., Wang, C. Y., Liao, H. Y. M. YOLOv4: Optimal Speed and Accuracy of Object Detection. arXiv. , (2020).
  22. Tian, Y., Ye, Q., Doermann, D. YOLOv12: Attention-Centric Real-Time Object Detectors. arXiv. , (2025).
  23. Cheng, T., et al. YOLO-World: Real-Time Open-Vocabulary Object Detection. arXiv. , (2024).
  24. Khanam, R., Hussain, M. Yolov11: An overview of the key architectural enhancements. Arxiv. , (2024).
  25. YOLOv8: A Novel Object Detection Algorithm with Enhanced Performance and Robustness. Varghese, R., Sambath, M. 2024 Int Conf Adv Data Eng Intell Comput Sys (ADICS), , IEEE. 1-6 (2024).
  26. Wan, D., et al. YOLO-MIF: Improved YOLOv8 with Multi-Information fusion for object detection in Gray-Scale images. Adv Eng Info. 62, 102709(2024).
  27. Feature Pyramid Networks for Object Detection. Lin, T. Y., et al. Proc IEEE Conf Comp Vision Pattern Recognit (CVPR), , 2117-2125 (2017).
  28. Searching for MobileNetV3. Proc IEEE/CVF Int Conf Comp Vision (ICCV). Howard, A., et al. , 1314-1324 (2019).
  29. GhostNet: More Features from Cheap Operations. Han, K., et al. Proc IEEE/CVF Conf Comp Vision Pattern Recognit (CVPR), , 1580-1589 (2020).
  30. Yolov9: Learning what you want to learn using programmable gradient information. Wang, C. Y., Yeh, I. H., Mark Liao, H. Y. European conference on computer vision, , Cham Springer Nat Switzerland. 1-21 (2024).
  31. Dynamic head: Unifying object detection heads with attentions. Dai, X., et al. Proc IEEE/CVF Conf Comp Vision Pattern Recognit, , 7373-7382 (2021).
  32. Zhu, X., et al. Overview of Research on Image Data Enhancement Technology. Soft Guide. 20 (5), 1-5 (2021).
  33. Segment anything. Kirillov, A., et al. Proc IEEE/CVF Int Conf Comp Vision, , 4015-4026 (2023).
  34. Jiang, H., Wang, Y., Kang, J. Overview of object detection models and optimization methods. J Automatica Sinica. 47 (6), 1367-1393 (2021).
  35. Deep Residual Learning for Image Recognition. He, K., Zhang, X., Ren, S., Sun, J. Proc IEEE Conf Comput Vis Pattern Recognit (CVPR), , 770-778 (2016).
  36. Efficient multi-scale attention module with cross-spatial learning. ICASSP 2023-2023 IEEE Int Conf Acoustics Speech Signal Proc (ICASSP). Ouyang, D., et al. , IEEE. 1-5 (2023).
  37. Rethinking mobile block for efficient attention-based models. Zhang, J., et al. 2023 IEEE/CVF Int Conf Computer Vis (ICCV) IEEE Comp Soc, , 1389-1400 (2023).
  38. Wang, Y., et al. Multi-Type Ship Target Detection in Complex Marine Background Based on YOLOv11. Processes. 13 (1), 249(2025).
  39. Shao, X., et al. Multi-Scale Feature Pyramid Network: A Heavily Occluded Pedestrian Detection Network Based on ResNet. Sensors. 21 (5), 1820(2021).
  40. YOLOv7: Trainable Bag-of-Freebies Sets New State-of-the-Art for Real-Time Object Detectors. Wang, C. Y., Bochkovskiy, A., Liao, H. Y. M. Proc IEEE/CVF Conf Comput Vis Pattern Recognit (CVPR), , 7464-7475 (2023).

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

Object DetectionCigarette Brand IdentificationReal Time DetectionSingle Stage RegressionAdaptive DownsamplingMulti Scale AttentionDynamic Detection HeadVisual RecognitionModel LightweightOcclusion Detection
동영상 곧 제공

관련 논문