研究記事

改良された単一段階回帰モデルを用いた切断タバコの整合性のリアルタイム評価

DOI:

10.3791/71669

2026年5月29日

この記事について

サマリー

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

切断タバコの整列秩序をリアルタイムで検出するために、改良された単段階回帰モデルが開発されました。このアプローチは、3つの構造最適化とカスタムの向き予測手法を統合し、検出精度を高めつつモデルパラメータと計算複雑さを低減することで、工業生産環境におけるカットタバコのアライメントを効率的に評価することを可能にします。

要約

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

カットタバコの秩序性は、タバコ軸に沿ったカットタバコの整合性として定義され、生産品質最適化において重要な要素です。複雑な鎖構造や変動する画像条件のため、この特性の正確かつ自動化された評価は依然として困難です。切断タバコの整列性の秩序を信頼性のある検出可能にするために、改良された単段階回帰モデルが開発されました。このアプローチには、特徴情報を保持する多周波数インタラクティブダウンサンプリング法、マルチスケール特徴表現を強化するトリプル補完融合戦略、そして異なるスケール間での局在化を改善する動的検出ヘッドという3つのアーキテクチャ的修正が含まれています。さらに、アライメントの秩序性を定量化するためにカスタムの向き予測手法も実装されています。このモデルは産業用画像データセットで評価され、平均精度は89.9%、精度は90.6%、リコール率は88.7%に達しています。ベースラインモデルと比較して、提案されたアプローチはモデルパラメータを30.8%(2.6Mから1.8Mへ)削減し、計算複雑度を21.5%(6.5Gから5.1Gへ)削減しつつ、性能を向上させています。総じて、この手法はカットタバコの整列秩序性を効率的かつ正確に評価し、リアルタイムの産業応用への適合性を示しています。

概要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

カットタバコの秩序性とは、タバコ内でカットタバコの軸方向の整列度を指します。タバコの形態や空気圧輸送パラメータなど、この特性に影響を与える要因を理解することは、切断および組立工程の最適化に不可欠です。したがって、これらの影響要因の調査は、コスト削減と生産効率の向上を目指すたばこ企業にとって重要な戦略となっています。従来のカットタバコの秩序性の評価は手作業の手法に依存しており、非効率的で一貫性や正確性に欠けることが多いです。したがって、生産プロセスを最適化するための自動化され、精密かつリアルタイムな検知システムが業界に緊急に求められています。深層学習の急速な進歩により、物体検出に基づくカットタバコの秩序性を自動で評価することが可能になりました。しかし、生産ラインでのこのような評価システムの実装は、依然としてほとんど研究されていないテーマです。それにもかかわらず、機械視覚技術は他の分野の検査作業にも成功裏に応用されており、本研究に貴重な参考文献を提供しています。この文脈で、畳み込みニューラルネットワーク(CNN)ベースの検出器が主流のパラダイムとして登場し、一般的にFaster R-CNN2のような2段階アプローチと、You Only Look Once(YOLO)シリーズ3,4のようなシングルステージフレームワークに分類されます。

近年、特にFaster R-CNNフレームワークをはじめとする深層学習ベースのオブジェクト検出アルゴリズムは、さまざまな分野で大きな可能性を示しています。しかし、特定の産業や専門的シナリオへの直接適用は、複雑な運用環境や独自のタスク要件によって制約を受けることが多いです。そのため、これらの課題に対応するために多くのカスタマイズされた改善案が提案されています。例えば医療画像解析において、Suらはパラメータの最適化とネットワークアーキテクチャの改良に注力 し、肺結節検出における小さく重要な標的の検出精度を向上させました。産業的欠陥検出において、Chenら6は遺伝的アルゴリズムで最適化されたGaborフィルターをFaster R-CNNバックボーンに統合し、複雑な背景を効果的に抑制することで、織物検査におけるテクスチャ干渉に対処 しました。水中目標検出におけるデータ不足と環境の複雑さという課題を克服するため、Zengら7は敵対的遮蔽ネットワークを導入 しました。このネットワークは訓練中に検出器と競合し、モデルにより堅牢な特徴を学習させ、過学習を緩和します。さらに、特定のインスタンス同定などの細かな回収作業において、Liらは特徴層の連結と微調整戦略を通じてFaster R-CNNを強化し、 低解像度画像での性能を大幅に向上させました。Wangらは最近、 暗号化画像やモデルパラメータに対する安全な計算を可能にする多者プライバシー保護型Faster R-CNNフレームワークを提案しました。これは、安全な除算、指数化、対数の新規プロトコルを通じて、暗号化画像やモデルパラメータに対して安全に計算できます。Sunら10 は、ホイールハブの複数の欠陥タイプを認識する改良されたFaster R-CNNの有効性を示し、R-CNNやYOLOv3よりも高い平均精度(mAP)を実現しました。これらの取り組みは、Faster R-CNNが多様な現実世界での適応性、堅牢性、適用性向上に向けて進化し続けていることを強調しています。これらの二段検出器の進歩と並行して、YOLOシリーズのような単段フレームワークも大幅に開発されています。

二段検出器の代替として、YOLOシリーズはその効率的なアーキテクチャと優れたリアルタイム検出性能により、産業界および研究界の両方で高い評価を得ています。2016年にRedmonらが第1世代モデルを導入して以来、さまざまな技術的制約が段階的に解決され、研究者たちはドメイン固有の応用に特化した適応を開発しています。例えば交通監視システムでは、JamtshoらがYOLOv2と重心追跡アルゴリズムを組み合わせて 、ビデオストリーム中のヘルメットを着けていないオートバイ乗りのナンバープレートを正確に識別し、誤検知を効果的に減らしつつ98.52%の高い検出率を維持しました。厳しい水中環境向けに、NeelamegamらはYOLOのリアルタイム検出能力とトランスフォーマーベースの注意メカニズムを統合し、文脈理解を強化するYOLO-トランスフォーマーハイブリッドモデルを開発しました 。混濁度や光のレベルなどの環境要因に関するリアルタイムIoTセンサーデータを組み込むことで、モデルは変化する条件に動的に適応し、検出精度97.5%を達成し、騒音の多い低視界状況において従来のモデルを上回る性能を発揮します。同様に、Zhangら14 はリモートセンシング応用向けの改良型YOLOモデルを提案しました。特徴表現の不足や背景の混乱に対処するため、特徴強化、マルチスケール融合、グローバルコンテキスト認識のための専門モジュールを導入し、小物体検出の精度を大幅に向上させました。これらの研究は、YOLOシリーズが多様な現実世界シナリオにおいてより高い適応性、堅牢性、効果性へと進化し続けていることを示しています。

これらの進歩にもかかわらず、YOLOファミリーの最近のバージョン、例えばYOLOv113は、工業現場でのカットタバコの特定のテクスチャーや構造的複雑さに本質的に最適化されていません。標準的なダウンサンプリング操作では、整列したタバコと無秩序なカットタバコを区別する上で重要な細かい特徴が失われることがあります。さらに、固定スケールの検出ヘッドは、異なる画像条件下でタバコの特徴の多スケール特性に効果的に対応するのに苦労しています。

これらの課題に対応するため、本論文ではYOLOv11nを用いた改良型単段階回帰モデルとカスタムの向き予測法を組み合わせ、切断タバコの秩序の堅牢なオンライン検出を提案します。本論文の主な貢献は三つあります。(1) 多周波数インタラクティブダウンサンプリング(MFID)手法が提案されています。標準的なストリード畳み込み演算やプーリング演算は細粒度情報を破棄しますが、MFIDはハールウェーブレット変換を用いて特徴を明示的に低周波成分と高周波成分に分解します。この方法はよりオリジナルな情報を保存し、ダウンサンプリング時の情報損失を軽減します。(2) 三重補完融合(TCF)法は、浅い意味、中間、深い意味情報を融合させることで特徴の品質を向上させることを目的としています。特徴量融合には単純な連結や加算操作が一般的に用いられますが、TCFは中間層のガイド付き重み付き融合を逆重み分岐で導入し、意味情報と詳細情報の補完性を実現しています。(3) 元の検出ヘッドに代わって動的検出ヘッド(DynamicHead)が導入されます。元の検出ヘッドは固定スケール畳み込み演算に依存しています。これに対し、DynamicHeadはスケール認識、空間認識、タスク認識の注意メカニズムを統合しています。これにより特徴重要度の動的な調整が可能となり、より柔軟かつ効果的なマルチスケール特徴融合が可能となり、秩序に関連する特徴を正確に局所化・分類するモデルの能力が向上します。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

プロトコル

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

この研究はヒト被験者、脊椎動物、または規制された組織を対象としていません。したがって、倫理的承認や機関審査委員会の承認は必要ありませんでした。本研究で使用されたデータセットは龍岩たばこ工業有限公司から取得されました。画像は3か月間にわたり5つの独立した生産バッチから収集されました。サンプリングは、生産条件の自然な変化を捉えるために、朝、午後、夜の異なる時間帯にランダムに行われました。データセットには、タバコ水分12%〜18%の範囲、切断速度1.5、2.0、2.5 m/s、空気圧0.4、0.5、0.6 MPaのサンプルが含まれており、典型的な生産条件のカバーを確保しています。

データセット取得と設定
ハードウェア構成
画像取得システムは、加熱不燃焼タバコ中のカットタバコの秩序を検出する要件を満たすよう構成されました。主に産業用カメラ、産業用レンズ、視覚光源、産業用制御装置で構成されていました。このシステムはMV-CH120-10GC工業用カメラとMVL-KF0818M-12MP産業用レンズを組み合わせて、切断されたタバコロッド表面の切断されたタバコ地域の高精細画像を撮影しました。カメラはシガレットロッドの表面から150mmの作業距離に設置されていました。LED光源はカメラと同軸に、目標から80mmの距離で、入射角は45°でした。撮影はマットブラックのエンクロージャー内で行われ、周囲の光の干渉を除去しました。筐体はマットブラック塗装のアルミニウム製フードで、×内部寸法は幅400mm、奥行き350mm×高さ300mmで、内部はマットブラック塗装(550nmで反射率<5%)でコーティングされており、内部反射を最小限に抑え、照明条件を均一に保っています。画像品質と一貫性を確保するために、MV-LRDS-H-95-30-W光源を用いて安定した照明環境を確立し、周囲光の変化がタバコの茎の輪郭抽出や方向認識に与える影響を最小限に抑えました。取得した画像はPC1010-AX360の産業用コンピュータで受信、処理、保存され、その後の認識アルゴリズム、結果計算、インターフェース出力も行いました。産業用カメラとレンズの組み合わせは、896ピクセル×1600ピクセルの視野内で、画像エッジで0.5%未満の放射状歪みがほとんど見られなかったため、明示的なカメラキャリブレーションや歪み補正は行われませんでした。カメラと光源は、画像取得時の位置安定性を確保するため、固定フレームに剛性的に取り付けられていました。光源の強度は画像取得の間ずっと一定のレベルに保たれていました。視野は、鋼鉄支持構造内の露出した切断タバコ部分を完全に覆うように配置されていました。

カメラパラメータ設定
画像取得が行われ、サンプルタバコを位置決めて切断した後、画像をJPG形式で保存しました。取得画像の一貫性を確保するため、取得パラメータは手動で設定されました。具体的には、画像解像度が896 × 1600に設定されていました。露光時間は当初4000μsに設定され、現場の明るさに応じて3000〜6000μsの範囲で微調整可能でした。すべてのパラメータ調整は、上記のマットブラックのエンクロージャー内にサンプルを置き、完全に制御された照明条件下で行われました。調整中は外部の環境光はなく、イメージングシステムは完全に閉鎖された環境内で動作し、部屋の照明は消されていました。ゲインは当初2 dBに設定され、ノイズレベルに基づいて0〜6 dBの範囲内で制御されていました。ガンマ値は0.8に設定され、ホワイトバランスは固定パラメータで設定されていました。 最終的な取得パラメータは以下の通りに設定されました:露光時間=4000μs、ゲイン=2dB、ガンマ=0.8、ホワイトバランスモード=固定、画像解像度=1600ピクセル×896、画像フォーマット=JPG。ホワイトバランスには固定パラメータモードが使用されました。校正は標準の白色参照カード(X-Rite ColorChecker)をサンプル位置に置いて行いました。赤と青のチャンネルゲインを調整し、白カードのRGB値が±2%の偏差以内に均等化されました。キャリブレーション後、ホワイトバランスパラメータは次のように固定されました:赤ゲイン=1.2、緑ゲイン=1.0(固定)、ブルーゲイン=1.5。キャリブレーションは、システムの起動後や光源に色温度ドリフトの老化兆候が見られた際に一度ずつ行われました。 これらの設定により、切断タバコの境界と安定した明度分布を確保しつつ、その後のタバコストランドの分割、向き計算、秩序分析の処理要件も満たしました。

画像コレクション
画像取得は、切面後にヒート・ノー・バーン・タバコロッドの表面に露出した切断されたタバコ部分を対象としました。検出時、タバコサンプルはまず検査ステーションに届けられ、その姿勢と位置は試料の位置調整機構によって調整・固定されました。位置決め機構は、V字型のアライメントガイドを備えた空気圧クランプで構成されています。このシステムはレーザー変位センサーの測定により、1000サイクル連続で±0.5 mmの位置再現性を達成しています。 その後、外側の包装材は切断機構によって安定的に切断され、表面の切断されたタバコが視覚システムの視野内に完全に露出しました。直径50mm、厚さ0.3mm、高速鋼材の円形回転ブレードが使用されました。切削深度は1.5mm、回転速度は300rpmに設定されていました。切削の一貫性は線形エンコーダのフィードバックで監視され、厚さの変化は±0.05 mm以内に保たれました。試料の位置が安定し、イメージング領域が明確に定義されると、光源による安定した照明の下で産業用カメラを用いて画像取得が行われました。合計634枚の画像が収集されました。典型的な画像は図1に示されています。 データセットには、3つのタバコ密度レベル(低、中、高;約180、220、260 mg/cm³)、繊維の向きは−180°から180°に及び、照明条件は通常光から暗いエッジ状態まで幅広く含まれています。照度は、センサーを試料表面に位置させたキャリブレーション済みデジタルルクス計(TA8133、精度±3%)を用いて測定しました。測定される通常の照明範囲は200〜800ルクスで、密閉されたボンネット内のストリップLED光源によって提供され、周囲の光漏れはありません。低限値(約200ルクス)は、モデルの堅牢性を評価するために光源を暗くすることで生じるエッジケースの条件を表しています。さらに、約30%の画像でタバコの部分的な閉塞(10%から50%)が見られます。これらの変動は実際の生産ラインの多様性を反映しています。

figure-protocol-1
図1。視覚システムで取得された切断タバコの代表的な生画像。 (a–h)工業現場条件下で画像取得システムを用いて撮影したカットタバコの生画像の代表例。画像は、ストリップ光源を用いて制御された照明下で896ピクセル×1600ピクセルの解像度で取得され、均一な明るさを確保し環境干渉を最小限に抑えました。これらの画像は、モデル処理前のタバコの繊維分布、密度、向きの変化を示しています。 この図の拡大版はこちらをクリックしてご覧ください。

画像注釈
オープンソースツールLabelImgを使い、可視に見える切断されたタバコや鉄の支柱の周囲に境界ボックスを描きました。各バウンディングボックスのラベルには正しい角度が割り当てられました。水平軸(0°)は、画像の下端に平行な右向きの方向として定義されました。各タバコの糸ごとに、注釈ツールの角度測定関数を使って、その糸の長軸に沿って線を描きました。この角度は、この軸と水平基準点の間の角度として記録されました(範囲:−180°から180°)。 注釈は標準的な単段階検出形式で保存され、各画像に対応する1つのTXTファイルが用意されていました。各.txtファイルには、幅class_id x_center y_center高さの形式で書かれた行が含まれています。 座標は画像寸法に対して[0,1]に正規化されています。クラス0=タバコストランド、クラス1=鋼製支持体。角度ラベルは注釈.txtファイルの6列目として格納され、5つの標準YOLOフィールドの後に付加されます。1行あたりの正確なフォーマットは、class_id x_center y_center幅と高さ、角度です。角度値は、−180.0から180.0までの浮動小数点数として、小数点2桁(例:45.75)として格納されます。例行:0 0.5230 0.4170 0.0850 0.0620 38.25。

品質管理
2人目の注釈者は、注釈付き画像のランダムに選ばれた20%をレビューしました。ランダム選択はPythonのランダムライブラリのrandom.sample()関数を用いて、固定されたランダムシード2024で実施されました。すべての画像ファイル名のリストが作成され、このシードされた乱数生成器を用いて20%の画像を置き換えずにサンプリングし、繰り返しの品質管理手順を経て再現性のある選択を確保しました。不一致があれば話し合い、解決され、ラベルの一貫性が確保されました。アノテーション間の一致は角度偏差を用いて評価されました。2つのアノテーターの角度ラベルの平均絶対差は2.8°(標準偏差=1.5°)でした。偏差>5°の注釈はレビューされ、調整されました。

カットタバコの秩序検出のための単一段階回帰モデル
カットタバコの整列の検出は、製造プロセスと最終製品の品質向上に不可欠です。しかし、この検査作業には、切り離されたタバコの重複、ターゲットの小さ、照明の不均一など、検出精度や堅牢性が損なわれるいくつかの課題があります。YOLOv11nに基づく改良された単段階回帰モデルが、カットタバコの秩序性のオンライン検出に用いられています。提案されたフレームワークは、タバコ棒形成中の切断タバコの形態的特徴を正確に特定し、整列の規則性を信頼性の高い検出と同時に、精度、堅牢性、リアルタイム処理能力を向上させます。提案された単段階回帰フレームワークの全体的な構成は 図2に示されています。

figure-protocol-2
図2。提案された単段階回帰モデルの全体的なアーキテクチャ。図は 、背骨、首、検出ヘッドを含む完全なネットワーク構造を示しています。バックボーンはマルチスケール特徴を抽出し、多周波数インタラクティブダウンサンプリング(MFID)モジュールを組み込んで特徴情報を保持します。ネックは三重補完融合(TCF)戦略を用いて特徴を統合し、多層表現を強化します。検出ヘッドはDynamicHeadモジュールを採用しており、スケール認識(πL)、空間認識(πS)、タスク認識(π C)の注意メカニズムを統合し、定位および分類性能を向上させています。 この図の拡大版はこちらをクリックしてご覧ください。

多周波数情報ダウンサンプリングモジュール(MFID)
YOLOv11のバックボーンネットワークでは、歩幅2の畳み込み演算がピクセルをスキップしてダウンサンプリングを行います。この過程では空間情報の半分が直接破棄され、高周波の詳細(例えば小さな物体のエッジやテクスチャ)が失われ、小さなターゲットの情報損失が大きくなります。さらに、バックボーンの最大プーリングおよび平均プーリング操作は、オブジェクト領域内の詳細な情報を破棄し、特徴を滑らかにし、ノイズを導入し、特徴学習に悪影響を及ぼします。

これらの問題に対処するため、ウェーブレット階層分解の概念に触発されたMFIDモジュール15,16が導入されました。このモジュールはまず、ハールウェーブレット変換を用いて特徴を二つの補完的な部分に分解します。低周波の背景情報は分類を強化し、高周波の詳細はエッジやテクスチャが豊富で小ターゲットの検出を向上させます。小さなターゲットの知覚をさらに強化するために、MFIDモジュールには2つの追加部門が組み込まれています。すなわち、小さなターゲットの細かな特徴を保持するために翻訳不変性を活用する最大プーリング部門と、学習可能なパラメータを利用してより強力な表現能力と豊かな情報構成を実現するストライド畳み込み部門です。このマルチブランチ構造を通じて、MFIDモジュールはダウンサンプリング中により完全な空間および周波数情報を保持します。MFIDモジュールのアーキテクチャは図3に示されています。

figure-protocol-3
図3。MFIDモジュールの構造。 MFIDモジュールは、ハールウェーブレット変換を用いて入力特徴を低周波および高周波成分に分離し、ダウンサンプリング中に重要な構造情報を保持します。HLL は低周波近似成分を表し、HLH、HHL、HHH はそれぞれ水平方向、垂直方向、斜め方向の高周波詳細成分を表します。記号2↓は二重ダウンサンプリングを示します。複数の枝からの特徴マップは連結およびゲート機構によって融合され、特徴表現を強化します。 この図の拡大版はこちらをクリックしてご覧ください。

ダウンサンプリング中は、低周波および高周波の特徴分解が簡潔かつ効率的に行われるハールウェーブレット変換を用いて画像を分解し、リアルタイム検出タスクに適しています。 HLHH はそれぞれローパスおよびハイパス分解フィルターを示し、画像から低周波および高周波の情報を抽出するために用いられます。1次元ハール変換のウェーブレット基底関数とスケーリング関数は、 式1 を用いて次のように定義されます。

figure-protocol-4 (1)

ハール基底関数は式 2 を用いて次のように定義されます。

figure-protocol-5 (2)

ここでパラメータ jk は、それぞれハール基底関数のスケーリング係数と平行移動量を表します。具体的には、零位ハール基底関数は式 3 を用いて次のように定義されます。

figure-protocol-6 (3)

図3の記号2↓は2重ダウンサンプリングを示します。二準位のハールウェーブレット分解は、低周波近似(HLL)と水平方向(HLH)、垂直方向(HHL)、対角方向(HHH)の高周波詳細成分の4つの成分を得ます。HLL成分は輪郭、背景、グローバル情報を伝え、高周波成分(HLH、HHL、HHH)はエッジ、テクスチャ、細粒度の特徴を捉えます。

2重ダウンサンプリング後に得られる高周波成分HLH、HHL、HHH はConcat演算によって連結され、多方向の詳細情報を積分して高周波詳細情報 figure-protocol-7を生成します。これは 式4に示されています。

figure-protocol-8 (4)

その後、最大プーリング枝で二次情報融合が行われ、詳細な特徴とグローバル特徴を統合して再構築情報 figure-protocol-9生成されます。これは式 5に示されており、より広範な顕著な特徴を取り込み、高周波の詳細情報を再利用して特徴表現を強化しています。

figure-protocol-10 (5)

その後、ゲーティング機構を用いて情報フローを動的に調整し、figure-protocol-11を活用してfigure-protocol-12内の小さなターゲット特徴の識別を導き、有用な特徴を保持しつつ、無意味なノイズ干渉を抑制します。ゲート機構は次のように定義されます:ゲーティング(x) = Linear_2(ReLU(Linear_1(x))))。ここでLinear_1はチャネル次元を4の還元因子で減少させ、Linear_2元のチャネル次元に戻します。ゲート機構の出力はシグモイド活性化を通され、範囲[0,1]の変調重みを生成します。学習可能なパラメータには、両線形層の重み行列とバイアス項が含まれ、これらは一様初期化で初期化されます。これにより、詳細かつ重要な特徴情報が適切にバランスを取られ活用され、式6に示されるような最終的な詳細な特徴figure-protocol-13が得られます。

figure-protocol-14 (6)

最後に、ストライド畳み込みダウンサンプリング情報、低周波ベクトル、最終の詳細特徴がConcatを介して連結され、式 7に示されるように、複数次元および周波数帯にわたる特徴ダウンサンプリングの相互作用を拡張します。

figure-protocol-15 (7)

行動と実施のステップ
加群の定義
プロジェクトのモデル定義ファイル内にMFIDというカスタムPyTorchモジュールを定義する必要があります。このモジュールの実装は4つの並列経路で構成されています:(1) ウェーブレット変換:あらかじめ定義されたハールウェーブレットフィルターを用いて入力特徴マップに2段階分解を適用し、水平・垂直・斜め方向に低周波近似成分と高周波詳細成分を生成し、その後3つの高周波成分を連結します。(2) 最大プーリング:顕著な特徴を保持するために入力に最大プーリングを適用します。(3) ストライド畳み込み:標準的なダウンサンプリングはストライド2の畳み込み層を通じて行われます。(4) 特徴の再構成と融合:まず、ウェーブレット変換から得られる高周波情報を最大プーリング枝の特徴と融合します。その後、低周波情報に基づくゲート機構が用いられ、微粒子の特徴をフィルタリングします。最後に、処理された微粒特徴量、低周波成分、ストライド畳み込み出力を連結して最終的なダウンサンプリング特徴マップを得ます。

構成ファイルの編集
ベースラインモデルの設定ファイル(config.yaml)は開いておくべきです。バックボーンネットワークとネックネットワークの両方における標準的なダウンサンプリングモジュールのすべてのインスタンスは体系的に特定されるべきです。識別された各ダウンサンプリングモジュールエントリはMFIDモジュールに置き換えられます。

設計動機
MFIDモジュールは、標準的なダウンサンプリング操作における情報損失を軽減するよう設計されており、これは特に小さな物体検出に不利です。その核心概念はウェーブレットの階層分解に触発されています。画像内の低周波グローバル情報と高周波の詳細情報を明示的に分離し適切に処理することで、モジュールはダウンサンプリング中に重要なテクスチャやエッジの特徴を保持します。最大プーリングとストリード畳み込みの枝の組み込みは、補完的な視点、特に翻訳不変性と学習可能な表現の区別から特徴をさらに捉え、補完します。マルチブランチ融合を通じて、モジュールは次のネットワーク層により情報量が多く堅牢な多周波数特徴表現を提供します。すべての未指定のアーキテクチャパラメータおよびレイヤー構成は、PyTorch内のYOLOv11nフレームワークのデフォルト実装設定に従っています。

トリプルクロス・フィーチャー・フュージョンモジュール(TCF)
YOLOv11ネットワークアーキテクチャのネック特徴融合段階では、同じスケールの特徴マップを統合するために単純な連結操作が通常用いられます。しかし、この直接的なアプローチには明確な限界があります。まず、異なるレベルの特徴間の意味の違いを完全には考慮できていません。第二に、チャネル間相関の明示的なモデリングがないため、小ターゲットの特徴は融合時に希釈や損失を受けやすくなり、検出性能が低下します。これらの問題に対処するため、TCFモジュールと呼ばれるよりインタラクティブな融合法が導入されました。この手法は、多層次的漸進融合戦略を採用し、情報の流れを層間伝送を通じて小目標検出へと導きます。また、スケールを超えた深層情報を探求するための追加の非線形演算も組み込み、マルチスケール特徴の融合を促進します。単純な加算や平均融合に依存する従来のモジュールとは異なり、TCFは重み付き融合方式を採用しています。これにより、各レベルで詳細な情報を適応的に学習し、情報抽出経路を動的に最適化し、最も識別的な特徴に集中することで、最終的に検出精度の向上につながります。TCFモジュールのアーキテクチャは 図4に示されています。

figure-protocol-16
図4。TCFモジュールの構造。 TCFモジュールは浅層、中層層、深層の多層特徴融合を行い、小さなターゲットの表現を向上させます。Pは異なるレベルの入力特徴マップを表します。Convは畳み込み演算、Upsampleは特徴量アップサンプリング、AdaptiveAvgPoolは適応平均プーリングを表します。このモジュールは、重み付き融合と層間相互作用を通じてキャリブレーションされた特徴を統合し、意味的および空間的特徴の相補性を高めます。 この図の拡大版はこちらをクリックしてご覧ください。

物体検出の課題において、深層の特徴Pi+1と浅層の特徴Pi-1に含まれる情報は大きく異なります。クロスレイヤー情報の融合を促進するために、中間層Piが最終の特徴量融合層として導入され、異なるレベル間の特徴情報の違いをバランスさせます。

まず、浅層、中間層、深層の入力情報をシグモイド活性化関数を用いて処理し、重み付けされた特徴figure-protocol-17figure-protocol-18figure-protocol-19を生成します。これは重要な特徴を強化し、重複した特徴を弱める役割を果たします。これは 式8に示されています。

figure-protocol-20 (8)

次に、浅層、中間層、深層の入力情報を要素ごとに重み付けされた特徴量と掛け合わせて、式9に示されるように、figure-protocol-21figure-protocol-22figure-protocol-23の較正された特徴を生成します。特徴の重要度は重み注意機構によって動的に調整され、適応型特徴選択と再調整を実現します。

figure-protocol-24 (9)

中間層の特徴融合段階では、2つの逆重み分岐を活用して、それぞれ較正された浅層および深層の特徴と融合し、浅層の特徴でノイズによって誘導される偽の詳細情報や、深層の特徴におけるバイアスされた関連セマンティック情報をフィルタリングします。その後、マルチブランチ情報が統合され、この層の元の特徴、キャリブレーション済み特徴、インタラクティブな特徴、さらに較正された浅層および深層の特徴が融合されます。これにより、多スケール特徴情報の保存と補完が実現し、小ターゲット情報の損失や誤判の問題を軽減し、最終的に中間層融合特徴 figure-protocol-25が得られます。これは 式10 を用いて次のように表されます。

figure-protocol-26 (10)

浅層、深層、中間層の関係は別々に確立されており、式 11 および 12に示されています。

figure-protocol-27 (11)

figure-protocol-28 (12)

最後に、3つの特徴融合経路の出力はConcat演算によって連結され、各経路の特徴独立性を保ちます。各経路からの主要情報は、α、β、γの重みに基づいて動的に学習されます。これらは学習可能なスカラーパラメータとして定義され、1.0に初期化され、訓練中の逆伝播によって最適化され、浅い、中間、深い特徴経路からの寄与を動的にバランス付けすることを可能にします。さらに、畳み込み演算を用いて文脈情報を集約し、クロスレイヤー連結による非整合的な特徴境界応答を排除し、小規模ターゲットの詳細情報の取得と精緻化を最適化します。この過程は式 13 を用いて次のように表されます。

figure-protocol-29 (13)

行動と実施のステップ
加群の定義
プロジェクトのモデル定義ファイル内にTCFというカスタムPyTorchモジュールを定義する必要があります。このモジュールは、バックボーンネットワークの異なる段階から抽出された浅層、中間層、深層の特徴マップを入力として受け取ります。内部処理フローは主に3つのステップで構成されています:(1) 特徴キャリブレーション:Sigmoid関数を3つの入力特徴層それぞれに適用して重みマップを作成し、それを元の特徴マップと要素ごとに掛け合わせて主要な特徴を強調しつつ冗長な特徴を抑制します。(2) インタラクティブな融合:中間層の特徴融合段階では、2つの逆重み分岐が導入され、それぞれ較正された浅層および深層の特徴と融合し、浅層の特徴でノイズによって誘導される誤った詳細情報や、深層の特徴におけるバイアス関連の意味情報をフィルタリングします。(3) マルチパス集約:元の特徴、キャリブレーション済み特徴、インタラクティブな特徴、浅い情報と深い情報と融合した特徴を統合し、その後畳み込み演算を適用してクロスレイヤー連結による非整合的な特徴境界応答を除去し、最終的に多スケール情報に富んだ融合特徴を出力します。

構成ファイルの編集
モデル設定ファイル(config.yaml)は開くべきです。ネックネットワーク内の特徴融合セクション、特にバックボーンネットワークの異なる段階の特徴が融合する層は、その位置に位置付けられるべきです。これらの位置では、元の単純な連結操作層をTCFモジュールへの呼び出しに置き換え、モジュール入力が対応する浅い、中間、深い特徴に正しく接続されていることを保証します。

設計動機
TCFモジュールの設計は、機能融合時の情報格差や情報損失という課題に動機づけられています。浅い特徴は詳細に富みますが、かなりのノイズを含みます。一方、深い特徴は強い意味論を示しますが解像度は低いです。これに対応するため、TCFモジュールは情報バランサーとして中間層の特徴を導入し、クロスレベル特徴の補完的な利点を最大化するために慎重に設計されたキャリブレーション、相互作用、集約経路を組み込んでいます。根本的な動機は、各レベルでの特徴の重要性を動的に評価し、情報を選択的に統合できる、より効果的な融合メカニズムを確立することです。その結果、詳細な情報と意味情報の両方に富んだ高品質な特徴表現を後続の検出ヘッドに生成し、小さな物体認識に特に適しています。

ダイナミックヘッドモジュール
検出ヘッドコンポーネントは、バックボーンネットワークおよび特徴融合ネットワークによって生成された特徴表現に対してマルチスケールオブジェクト認識を行うという基本的な目的を果たします。このプロセスにより、検出された物体の正確な空間位置特定、カテゴリ割り当て、バウンディングボックス予測の信頼性推定が可能になります。視覚データにおけるターゲット特徴の大きなスケール変動や、特定のフレームにおけるバウンディングボックス提案の密集度を考慮すると、正確な切り離されたタバコ同定にはマルチスケールパターンの解析が必要です。これに対応するため、この手法はYOLOv11nのネイティブ検出ヘッドの代替としてDynamicHeadアーキテクチャ18 を採用し、スケール認識、空間認識、タスク認識メカニズムを統合して検出能力と運用効率の両方を向上させる自己注意フレームワークを構築しています。ダイナミックヘッドコンポーネントの構造構成は 図5に示されています。

figure-protocol-30
図5。DynamicHead検出モジュールの構造。 DynamicHeadモジュールは、スケール認識型(π L)、空間認識型(πS)、タスク型(π C)という3つの連続注意メカニズムを組み込んでいます。これらのコンポーネントはスケール、空間領域、検出タスク間で特徴の重要度を動的に調整します。この設計は、検出ヘッド内で適応型特徴の精緻化を可能にすることで、局所化精度と分類性能の両方を向上させます。 この図の拡大版はこちらをクリックしてご覧ください。

このアーキテクチャは、スケール認識型(πL)、空間認識型(πS)、タスク認識型(π C)コンポーネントの3つの専門的な注意ユニットで構成されています。スケール認識型注意機構(πL)は、まず入力特徴マップを空間次元およびチャネル次元で平均化します。結果は線形射影層を通過し、その後ハードシグモイド活性化でスケール重みを生成し、元の特徴マップと要素ごとに掛け合わせます。空間認識注意機構(πS)は、 K = 9個のまばらに選ばれたサンプリング点を持つ変形可能な畳み込みを用いています。各サンプリングポイントごとにオフセットベクトルΔpkと変調スカラーΔmk を予測し、サンプリングされた特徴を集約して空間注意の重みを生成します。タスク認識注意機構(πC)は、2つのパラメータセット(α1, β1 およびα2, β2)を用いて、各チャネルに対して学習可能な線形変換を独立して適用します。2つの変換表現間の最大応答を選択し、特徴を分類および回帰作業に動的に適応させます。最後に、これら3つの注意メカニズムは入力特徴写像に順次適用されます。F_out = πC(πS(πL(F) ·F) ·F) ·F.スケール認識メカニズムは、クロススケールの特徴重み付けを用いてマルチレゾリューション表現を適応的に組み合わせ、次元変動に対するモデル感度を洗練させます。空間認識コンポーネントは特徴マッピング内で地域重点の重み付けを実装し、計算の焦点を前景のエンティティに向け、無関係な背景干渉を抑制します。一方、タスク認識モジュールは特定の目標に対して出力表現を動的に調整し、分類と回帰の結果の両方を洗練させてモデルの精度と運用の堅牢性を強化します。計算手順は式 14–17で形式化されています。

figure-protocol-31 (14)

figure-protocol-32 (15)

figure-protocol-33 (16)

figure-protocol-34 (17)

ここで WL(F) は注意強化特徴表現を表し、πL(F)、πS(F)、πC(F) はそれぞれスケール、空間、タスク指向の注意演算に対応します。変換fは線形射影層を表し、σ(x)はハードシグモイド活性化処理を示し、Kはまばらに選択された空間点の数、pk+Δpkは識別領域を強調するための位置調整を導入し、Δmkは空間点pkの訓練可能な有意性測度を構成し、α(F)とβ(F)を表します。)は活性化しきい値を支配する学習可能なパラメトリック関数です。その中で、すべての実験でKは9に設定されており、この値は計算効率を維持しつつ十分な空間的カバレッジを提供します。

行動と実施のステップ
加群の定義
プロジェクトのモデル定義ファイル内にDynamicHeadというカスタムPyTorchモジュールを定義する必要があります。このモジュールの実装は、3つの注意ユニットを順次適用して構成します:(1) スケール認識注意:異なるスケールの特徴層が学習可能なパラメータを用いて動的に重み付けされます。(2) 空間認識型注意:変形可能な畳み込みの概念に基づき、特徴マップ内のまばらでありながら識別可能な空間位置に焦点を当てています。(3) タスク認識型注意:活性化閾値を動的に学習し、分類タスクと回帰タスクで特徴表現を最適化します。これら3つの注意メカニズムは入力特徴ピラミッドに順次適用され、最終的に予測のための特徴を生成します。すべてのモジュールは、畳み込み層、線形層、起動関数、注意機構などの標準的なPyTorch操作を用いて実装されました。

構成ファイルの編集
モデル設定ファイル(config.yaml)は開くべきです。検出ヘッドを定義するセクションは特定すべきです。元の検出ヘッド構成は、分類と回帰のための一連の畳み込み層で構成されており、DynamicHeadモジュールへの呼び出しに置き換え、その入力がネックネットワークを通じて特徴ピラミッド出力に接続されていることを確実にします。

設計動機
従来の検出ヘッドは通常、すべての特徴層、空間位置、タスクに同じ畳み込みパラメータを適用し、タスク固有の適応性に欠けます。DynamicHeadモジュールの導入は、検出タスクの複雑さに動機付けられており、これらの課題を分離し、統一された注意ベースのアーキテクチャで解決することを目指しています。その設計動機は三つあります。(1) スケール認識モジュールを通じて異なるサイズのターゲットに対応する特徴層に適応的に注目すること;(2) 空間認識モジュールを通じて背景ではなく前景のターゲット領域に計算資源を集中させること;(3)タスク認識モジュールを通じて分類と回帰という異なる目的に対して特徴表現を動的に最適化すること。このデカップリングと動的最適化の組み合わせにより、カットタバコのような密に配置された多スケールターゲットに対するモデルの定位精度と分類信頼性が向上します。

カットタバコの秩序性のためのカスタム評価方法
モジュールの説明と設計原理:カットタバコの整列性の定量的評価は、製造プロセスの安定性評価やたばこ生産における最終製品の品質予測に不可欠です。従来の評価方法は手動の目視検査に依存しており、これは主観的で時間がかかり、一貫した定量的測定を提供できません。これらの制約に対応するため、改良された単段回帰検出器と統合されたカスタム角度予測法が用いられています。この方法の基本原理は、タバコ棒内の鋼製支持構造を幾何学的な基準として空間参照枠組みを設定することです。鋼製支持体は製造中に一定の向きを維持するため、個々の切り離したタバコの相対的な向きを計算する理想的な基準線となります。検出された切断タバコと鋼材の支持体の絶対角度を水平基準線に対して測定し、その後それらの相対的な角度差を計算することで、整列の秩序性を定量的に評価できます。相対角がゼロであれば、糸と支持体の完全な平行性を示し、角度偏差が大きくなるほどアライメントが悪くなります。水平基準軸は、画像の下端に平行で、左から右へ向かう線として定義されます。この軸は0°に対応し、正の角度は反時計回りに、負の角度はこの軸から時計回りに測定されます。最終的な秩序性指標は、画像内で検出されたすべての糸の相対角度を平均することで得られ、一貫性のある客観的な品質評価を可能にします。

行動と実施のステップ
角度計算モジュールの定義
改良された単一段階回帰モデルの検出出力を処理するポストプロセッシングモジュールを実装します。検出された各オブジェクト(切断したタバコや鉄の支柱)に対して、バウンディングボックス座標を抽出します。各検出された天体の中心点座標を式 18を用いて計算します。式 19を用いて画像の寸法に基づいて画像中心点座標を計算します。

figure-protocol-35
figure-protocol-36(18)

figure-protocol-37
figure-protocol-38(19)

ここで x₁、 x₂、 y₁、 y₂は、検出されたバウンディングボックスの四隅の座標を表し、タバコの束か鋼製支持体のどちらかを表します。 CXCy は検出領域内のそれぞれの中心点の座標を表します。 wh はタバコの画像の幅と高さを示します。 DXDy は画像の中心点の座標を定義します。

絶対角度計算
検出されたタバコの糸と鋼の支持体について、画像中心から物体中心へのベクトルを計算します。方程式20で定式化されたアークタンジェント関数を用いて、水平基準線に対する絶対角を計算します。角度はatan2(d_y, d_x)を用いて計算されます。ここでatan2はPythonの数学ライブラリにある4象限逆接関数です。この関数は範囲(−π、π]ラジアンの値を返し、それを度に変換して出力角度を範囲(−180°、180°)に変換します。atan2では、d_yとd_xの信号に基づいてクアドラントハンドリングが自動的に行われます。これにより、鋼の支持部分としてA、各タバコの糸ごとにAのカットが生まれます。

figure-protocol-39 (20)

相対角度の計算
検出された各タバコの糸について、方 程式21に示すように、鋼の支持体の絶対角をその糸の絶対角から差し引いて相対角を計算します。絶対値により正の角度偏差測定が得られます。

figure-protocol-40 (21)

秩序性計量生成
検出されたすべての糸の相対角度を単一の画像内に集約します。式22に示された通り、すべての相対角Toを合計、検出された糸の総数nで割って平均相対角を計算します。この平均値は、その画像のアライメントの秩序性を定量的に測る指標となります。

figure-protocol-41 (22)

品質評価の実装
計算値をあらかじめ定義された閾値にマッピングする分類関数を実装します。これは式 23で定義されています。評価基準(0°–30°=優秀、30°–60°=良好、>60°=悪い)は、龍岩たばこ工業株式会社の品質管理専門家3名との協議に基づいて定められました。これらの専門家は独立して200枚のサンプル画像を評価し、計算された平均相対角度とアライメント品質の認識を3つのカテゴリースケール(優秀、良好、悪い)で相関させました。30°および60°の境界線が、専門家間合意が90%を超える合意のカットオフとして選ばれました。この等級付けにより、品質管理担当者が定量的な結果を直感的に解釈できるようになります。

figure-protocol-42 (23)

構成ファイルの編集
モデルの設定ファイル(config.yaml または model.yaml)を開くべきです。構成の後処理セクションや推論設定部分は特定すべきです。カスタム角度計算モジュールは適切に参照され、有効化されているべきです。出力解析設定は、切断タバコと鋼製支持体のバウンディングボックス座標を正しく抽出できるか検証する必要があります。この評価法は検出ヘッド出力後の後処理モジュールとして動作するため、追加のレイヤー挿入は不要です。

設計動機
このカスタム評価手法の設計は、主観的な視覚的検査を客観的かつ再現可能な定量的測定へと変換する必要性に動機づけられています。従来の手動検査は観測者間ばらつきがあり、プロセス最適化のための連続的な数値データを提供できません。この方法は、鋼製支持をタバコ棒内の自然な幾何学的基準として活用することで、外部のキャリブレーションマーカーを不要にし、異なる画像や生産バッチ間での測定の一貫性を確保します。中心点ベクトルとアークタンジェント計算の使用により、角度推定に数学的に堅牢かつ計算効率の高いアプローチが得られ、リアルタイムでの展開に適しています。この画像中心から物体中心へのベクトルベースの計算は、カメラの視野角やシガレットロッドの画像内での位置に不変であるよう設計されており、これにより異なる撮影条件下での堅牢性を確保しています。複数の検出されたストランドにまたがる平均化戦略は、ストランドの向きの自然な変動を考慮し、統計的に信頼性の高い全体的な秩序性指標を得ます。三段階の等級付けシステムは、連続した数値測定を実用的な品質カテゴリーに変換し、生産ラインの品質管理における迅速な意思決定を促進します。全体として、この統合アプローチは改良された単段階回帰モデルの検出能力と精密な幾何学的計算を組み合わせ、カットタバコの整合性の秩序性を包括的かつ自動化した評価を可能にします。

カットタバコの秩序検出のためのモデルトレーニング
PyTorch 2.1.0、Compute Unified Device Architecture(CUDA)12.1、そしてすべての依存関係は適切にインストールされている必要があります。実装は標準的なPyTorch YOLOパイプラインに従い、詳細なモジュール説明や設定手順に基づいて再現可能です。

訓練司令部
再学習前に、標準的な単段階検出形式(例:YOLO形式で画像1つの.txtファイル)で分割された画像データセットと注釈ファイルを準備しておく必要があります。画像パス、クラス数(カットタバコおよびスチールサポート)、クラス名を指定するデータセット設定の.yamlファイルを作成する必要があります。前述のモデル改良に基づき、元の検出器の.yaml設定ファイルは、MFID、TCF、DynamicHeadモジュールを組み込んだ提案モデルの.yamlファイルに置き換えるべきです。train.py スクリプトは、シングルステージ検出器パッケージのインポート、トレーニングモデルとデータセットの設定、そして以下のトレーニングパラメータを設定するために書かれるか修正する必要があります:imgsz=640、epochs=100、batch=4、workers=0、device='0'、optir='SGD'、close_mosaic=10など。ランダムシードは42に固定され、モデルの重みはディープラーニングフレームワークが提供するデフォルトの初期化戦略で初期化されました。再現性はtorch.backends.cudnn.deterministic = True、torch.backends.cudnn.benchmark = Falseを設定することで確保されました。

ハイパーパラメータ
訓練用に構成される主なハイパーパラメータは以下の通りです:入力画像解像度は896ピクセル×1600ピクセル;バッチサイズは4で、GPUメモリに制約されます。段階的な減衰のためのコサインアニーリングスケジューラを用いて初期学習率0.01。収束を加速させるための運動量0.912の確率的勾配降下(SGD)最適化器;正則化のための重量減衰は0.0004です。画像は平均[0.485, 0.456, 0.406]および標準偏差[0.229, 0.224, 0.225]で正規化されました。増強にはランダムな水平反転(50%)、ランダムな明るさ調整(±20%)、ランダムな回転(±15°)が含まれていました。モザイク増強は初期の訓練段階でデフォルトで有効化され、異なるオブジェクトスケールや遮蔽に対するモデルの堅牢性を高めます。検出精度を高めるために最後の10エポック(close_mosaic=10)で無効化されます。

トレーニングモニタリング
トレーニング中、フレームワークは各エポックで包括的な指標を出力します。損失関数は、分類損失(ロジットを用いた二値交差エントロピー[BCE])、局所化損失(完全交差点[IoU]損失)、および対象性損失(BCE)の3つの成分の加重和です。総損失重量はλ_cls=0.5、λ_box=0.05、λ_obj=1.0と設定されました。トレーニングおよび検証損失曲線は、安定した収束を確保し、過学習の兆候を検出するために監視されるべきです。検証セット上のIoU閾値0.5(mAP@0.5)でのmAPは、切断されたタバコストランド検出の主要な性能指標として使用されます。データセットの規模とモデルの複雑さを考慮すると、通常100エポックの訓練で収束には十分です。最も性能の良いモデルチェックポイントは、検証mAPに基づいて自動的に保存されます。

モデル評価と展開
評価
トレーニング完了後、最適なモデルの重みはruns/train/exp/weights/best.ptとして保存されます。訓練済みモデルは専用の検証セット上で以下のコマンドで評価されます:python val.py --data cigarette_dataset.yaml --weights runs/train/exp/weights/best.pt.評価スクリプトは、切断タバコとスチールサポートの両方の検出クラスに対して、精度、リコール率、mAP@0.5などの主要な性能指標を出力します。mAPは産業用展開に必要な閾値(>例:ストランド検出の95%)を満たすか検証されるべきです。展開閾値(mAP>ストランド検出の95%)は、対象産業環境における内部性能要件を表します。報告された結果は、難しいエッジケースを含む多様なテストセットでの性能を反映しています。理想的な照明と最小限の遮蔽をフィルタリングしたサブセットで評価した場合、モデルの日常生産条件下でのmAPは96%を超えます。通常の生産サブセットは以下の基準で定義されました:照明度が500〜800ルクスの範囲(最適照明)、遮蔽率が10%未満(重なりが最小)、そして鏡面反射が目に見えること。このサブセットには427枚の画像が含まれており、テストセットの約67%を占めています。このサブセットは、通常の照明と適切に配置されたストランド配置下の標準的な昼間の生産条件に対応します。

推論検証
未確認画像に対するモデル検出性能を視覚的に検証するために、サンプルテスト画像に対して以下のコマンドを用いて推論を行います:python detect.py --weights runs/train/exp/weights/best.pt --source path/to/test/images --conf 0.5。このコマンドは、検出された切断したタバコやスチールの支持体の周囲にバウンディングボックス付きの注釈付き画像を生成します。推論速度は、CUDA 12.1とPyTorch 2.1.0を使用したNVIDIA GeForce RTX 3080 Ti GPU(12GB VRAM)で測定されました。報告されたフレーム毎秒(FPS)は、50回のウォームアップ反復後の100回以上の連続前進パスの平均として計算されました。さらに、推論速度(フレーム毎秒)も報告され、展開環境へのリアルタイム適合性が確認されます。

モデル展開
産業用制御システムでのリアルタイム展開を可能にするために、訓練済みのPyTorchモデル(best.pt、約7〜9MB)をTensorRTやOpen Neural Network Exchange(ONNX)などの最適化された推論形式にエクスポートする必要があります。この変換により、検出精度を維持しつつ推論速度が向上します。ONNXのエクスポートには、torch.onnx.export(model, dummy_input, "model.onnx", opset_version=11, input_names=["images"], output_names=["outputs"])をご利用ください。TensorRT変換には、trtexec --onnx=model.onnx --saveEngine=model.trt --fp16 --workspace=4096 をご利用ください。FP16の精密モードは推論速度の最適化に用いられました。最終展開されたモデルは、バウンディングボックス座標、クラスラベル(カットタバコストランドまたはスチールサポート)、および検出された各オブジェクトの信頼度スコアを出力し、これらは切断されたタバコの秩序を定量化するカスタム角度評価法の入力となります。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

結果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

実験環境
すべての実験はPyTorchのディープラーニングフレームワークを用いて行われ、詳細なハードウェアおよびソフトウェア構成は 表1にまとめられています。合計634枚の画像が、7:2:1の比率でトレーニング、検証、テストセットにランダムに分割されました。トレーニング中、入力画像は1600ピクセル×896ピクセルに均一にリサイズされ、初期学習率は0.01に設定されました。過学習を軽減するために、運動量係数0.912の確率的勾配降下最適化器が採用されました。各モデルはバッチサイズ4で100エポック分の訓練を行い、データの読み込みは単一のワーカースレッド(すなわちワーカー=0)で行われました。

パラメータ

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

ディスカッション

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

カットタバコの秩序検出における提案モデルの大きな利点は、検出精度と計算効率のバランスにあります。この作業は、多数の細かくカットされたタバコを高解像度画像でリアルタイム処理する必要があり、モデルの精度と速度に厳しい要求を課します。表2に示されているように、提案モデルは比較された単段検出器の中で切断タバコおよび鋼材支持体の検出において最も高いmAP@0.5(89.9%)を達成し、パラメータが最も少なく(1.8M)、FLOPも最低(5.1G)です。この高効率な特性は、実用的な生産上の利点に直接結びついています。小型モデルはオンボードシステムへの展開速度を速め、メモリ消費量が少なく、推論遅延や消費電力も低くなります。したがって、資源制約の多い産業用制御プラットフォームに適しており、切断されたタバコの秩序性のためのリアルタイム監視精度を確保しつつ、ハードウェアコストやシステム統合の複雑さを削減します

カットタバコの秩序検出でのパフォーマンスが...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

開示事項

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者たちは直接的な競合する金融的利益を主張していない。この研究は龍岩たばこ工業有限公司で行われ、応用シナリオと現地データが提供されました。学術著者は本研究の出版に関して金銭的または非金銭的な利益相反を一切認めません。

謝辞

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

この研究は、加熱しないように燃やすたばこ製品の生産測定技術および環境温度・湿度制御に関するプロジェクト(助成金番号)によって資金提供されました。FJZYKJJH2022YB014)。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

材料

この記事で使用された材料の一覧
名前会社カタログ番号コメント
コードリーダーヒクビジョンID5050パレットのバーコードを読み取るために使われていました。24V電源が必要です
データセット(カットタバコ画像)龍岩たばこ工業有限公司該当なしモデルの学習、検証、テストに使用されるカットタバコのカスタム画像データセット
ディープラーニングフレームワーク(PyTorch 2.1.0)パイトーチ財団オープンソースソフトウェアディープラーニングモデルの開発とトレーニングに使用
産業用カメラヒクビジョンMV-CH120-10GC画像取得に使用されます。24V電源が必要です
産業用コンピュータ燕志テクノロジーPC1010-AX360画像処理、モデル推論、データ保存に使用
LED光源ヒックロボットMV-LRDS-H-95-30-Wストリップ光源は画像撮影に安定した照明を提供します
レンズヒクビジョンMVL-KF0818M-12MP焦点距離:8 mm;絞り範囲:F1.8–F16;12MP解像度
金属製ブラケット龍岩たばこ工業有限公司7075-T6 アルミニウム合金ハードウェア部品の取り付けおよび安定化に使用されます
ネットワークケーブル龍岩たばこ工業有限公司RJ45 クリスタルヘッド産業用コンピュータ、カメラ、ネットワーク機器の接続に使用されます
Python(バージョン3.9)Pythonソフトウェア財団オープンソースソフトウェア実装のためのプログラミング環境
スイッチTP-リンクTL-SH1005イーサネットポート8個、220V電源が必要です
無線アクセスポイント(産業用通信モジュール)山東華創順連BH-ANT5158S-14HV;BH-MS-AC1600HWHカメラと産業用コンピュータ間の無線通信を可能にします
カメラ制御ソフトウェア(MVS)ヒクビジョンV4.5.1カメラのデバッグ、パラメータ設定、データ取得に使用されます
ビジョンプロセッシングソフトウェア(Vision Master)ヒクビジョンV4.3.0テンプレートマッチングおよび画像結果検出に使用されます
統合開発環境(PyCharm)ジェットブレインズ2020.1.3 x64モデル開発およびシステム実装に使用
CUDA ツールキット(バージョン 12.1)NVIDIAソフトウェアツールキット(カタログ番号なし)GPUの加速を訓練と推論に有効化します

再版と許可

このJoVE記事のテキストまたは図の再利用許可をリクエスト

許可をリクエスト

タグ

関連記事