研究記事

改良された単一段階回帰アーキテクチャに基づく、タバコブランド識別のためのリアルタイムオブジェクト検出モデル

DOI:

10.3791/69657

2026年1月9日

この記事について

サマリー

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

自動化倉庫における遮蔽や照明の変化などの課題に対応するため、本論文ではタバコ箱のブランド検出のための改良されたシングルステージ回帰アーキテクチャを紹介します。適応的ダウンサンプリング、逆の効率的なマルチスケールアテンションメカニズム、動的検出ヘッドを統合することで、提案されたモデルは正確でリアルタイムのインテリジェント・ストックテイキングを実現します。

概要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

現代の製造および物流は、高密度保管、効率的な資材取り扱い、正確な在庫管理を実現するために、自動保管・回収システム(AS/RS)1に大きく依存しています。AS/RSは、その高い効率性とインテリジェントな特性により、企業が倉庫の効率を向上させ、コスト削減を助ける重要な手段となっています。多層シェルフ、各種積み下ろし機器を基盤としたAS/RSは、機械工学、電子工学、コンピュータサイエンス、通信、ネットワーク、センサー、自動制御2,3など複数の技術を統合したコンピュータ制御メカトロニクスシステムです。AS/RSは、棚、スタッカークレーン、コンベヤーライン、制御システムなどの機器の統合と最適化により、効率的かつ正確かつ安全な保管・取り扱いを実現し、保管効率を大幅に向上させます。インダストリー4.0の重要な側面であるAS/RSへのコンピュータビジョンの統合により、システムが視覚データに基づいて判断し判断できるようにすることで、かつてないレベルの自動化と知能を実現しました。

たばこ工場でのAS/RSの広範な適用に伴い、タバコ箱ブランドの新たな在庫管理義務が提案されました。従来の手動積み込み方法は非効率、誤検出率の高さ、安全上の危険性があり、AS/RSの要件を満たせていません。コンピュータビジョン技術の継続的な進歩により、機械ビジョンソリューションは産業検査分野でますます応用されています。6,7,8。各タバコの箱には独自のパターンやテキストでブランド情報が印刷されているため、機械ビジョンを用いた画像認識技術により、タバコの箱のブランド識別と在庫管理が可能になりました。

2012年以降、深層学習に基づく物体検出アルゴリズムは画像認識に大きな突破口をもたらしました。9,10,11。初期の2段階物体検出モデルであるR-CNN12から、YOLOシリーズモデルが基準または元の検出器131415を中心とした現代のシングルステージ物体検出モデルに至るまで、これらの手法は物体検出アルゴリズムの開発に大きく貢献してきました。インテリジェントなストックイキングタスクでは、画像や動画で複数のターゲットを正確に特定・位置特定するために、オブジェクト検出モデルがますます活用されています。Liらは、計量センサーと画像認識技術を統合した知能的な積み重み方法を提案し、清算の効率と精度を向上させました。WangらはマスクR-CNNを用いて、本の背表紙画像から本棚番号とタイトル位置を分割しました。Sunらは統合視覚認識システムを設計し、OpenCVを用いて材料や棚の二次元コードをマルチモードで認識しました。彼らはC3CBAMの注意機構とSimOTAラベル割り当てを導入することで、損失関数を強化して多材料間で正確な検出を行った。

物体検出の分野では、Faster R-CNNに代表される2段階モデルは検出精度において伝統的な利点を持っていますが、複雑な領域提案生成メカニズムにより推論速度は比較的遅くなります。その結果、産業用シナリオにおけるリアルタイム性能の厳しい要件を満たすのに苦労しています。対照的に、回帰ベースのアーキテクチャは物体検出を単一の回帰問題として扱い、入力画像からターゲットの位置やカテゴリ確率を直接予測します。このアーキテクチャ設計により、推論効率、軽量化、展開の柔軟性の面でモデルは多くの2段階モデルを大きく上回り、競争力のある精度を維持しつつも性能を発揮します。したがって、このアーキテクチャはリアルタイムの産業検出の好まれるソリューションとなっています。

元のモデルエコシステムは急速に進化を続けており、最近のバリアントは特定の課題に対応しています。例えば、元の検出器(v12)22は、学習時間の最適化とアーキテクチャの洗練をさらに強化し、精度と効率のトレードオフを向上させることに重点を置いています。一方、元の検出器(World)23はオープン語彙検出機能を導入し、視覚言語モデリングを活用することで、訓練セットのカテゴリーを超えた膨大なオブジェクトのリアルタイム推論を可能にします。これらの進歩は汎用物体検出の限界を押し広げますが、本研究は部分遮蔽や照明分散などの特定の課題に対する堅牢性が最重要であり、カテゴリ空間が固定かつ事前に知られている特殊な産業応用に焦点を当てています。このモデルファミリーの中で最も熱いバージョンとして、ベースラインモデル24は元の検出器(v8)25,26からの利点を受け継いでいます。モデルパラメータの数を減らすだけでなく、検出効率と精度のバランスも考慮します。他の物体検出モデルと比べて、視覚認識タスクで際立っています。

小さくて部分的に塞がれたタバコの箱を検出する課題は、コンピュータビジョンにおけるより広範な問題の表れです。小型物体検出は活発に研究されており、特徴ピラミッドネットワーク(FPN)の精緻化27 から、多スケール特徴処理の統合を促す文脈認識型注意メカニズムに至るまで多岐にわたるアプローチが挙げられています。さらに、産業現場での運用効率の追求には軽量モデル設計が必要です。MobileNetV328 およびGhostNet29で探求された効率的なアーキテクチャコンセプトに触発され、これらのコンセプトは深い畳み込みと線形変換を用いて計算複雑さを低減しつつ、プレゼンテーション能力を維持しているため、モデルを改善するために軽量なモジュールをいくつか選びました。したがって、たばこ箱ブランドの在庫管理と、照明の変化、ブランドごとの特徴サイズの違い、部分的な遮蔽など、在庫管理に影響を与える要因に対処するため、本記事では改良された単段階回帰アーキテクチャのオブジェクト検出モデルを提案します。

提案されたモデルの主な革新は三つあります。まず、Adaptive Downsampling(ADown)30モジュールが展開され、バックボーンネットワークとネックネットワークの両方で標準的な畳み込みダウンサンプリングを置き換えます。この新しい設計は、機能圧縮時の情報損失を軽減し、小さなブランドロゴやテキストを保存するために重要です。次に、逆型の効率的なマルチスケールアテンション(iEMA)機構を導入し、モデルに動的で多スケールの文脈知覚を付与し、小型で部分的に遮られたタバコ箱での性能を大幅に向上させます。第三に、元の検出ヘッドはDynamicHead31 モジュールに置き換えられ、スケール、空間、タスク認識の注意を統合し、大きく異なるターゲット間でより正確な位置特定と分類が可能になりました。これらのアーキテクチャ的改良は、産業現場におけるタバコブランド識別の特定の課題に対応するために一貫して設計されています。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

プロトコル

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本記事で使用されたデータセットは、龍岩たばこ工業株式会社物流部のAS/RS分野から取得したものです。この研究には人間の参加者や動物は含まれていません。倫理的な承認は必要ありませんでした。

データセットの取得と設定
ハードウェア構成:8mm焦点距離レンズ(例:MVL-HF0828M-6MPE)を搭載した産業用カメラ(例:MV-CA013-A0GM)をスタッカークレーンの貨物プラットフォームに取り付けます。カメラをGigEケーブルと無線APデバイス(例:BH-ANT5158S-14HV、BH-MS-AC1600HWH)で制御PCに接続します。カメラの周囲にストリップLEDライト(例:MV-LLDS-1002-38-W)を配置し、均一な照明を確保します。

カメラパラメータ設定:メーカーのソフトウェア(例:MVS)を使ってカメラを設定します。取得解像度を1280×1024ピクセルに設定してください。トリガーモードを ハードウェアトリガー に設定し、スタッカークレーンの位置決めシステムと同期させます。露出時間を100msに、ゲインを5dBに設定してモーションブラーやノイズを最小限に抑えましょう。カメラとタバコ箱の間の作業距離は約550mmです。

画像収集:トリガー付きの産業用カメラは、たばこ箱の保管および回収中にトレイを配置するたびに自動的に画像を撮影します。合計4,835枚の生画像を収集します。典型的な画像は 図1に示されています。

画像注釈:オープンソースツールLabelImgをご利用ください。各画像ごとに、見えるすべてのタバコブランドの特徴の周りにバウンディングボックスを描きます。各バウンディングボックスのクラスラベルとして正しいブランド名(例:洪荘、グティエン)を割り当てます。注釈は標準的な単段階検出形式で保存し、画像ごとに1つのtxtファイルを作成します。

品質管理:2つ目の注釈者がランダムに選ばれた注釈画像の20%を審査します。不一致があれば話し合い、解決され、ラベルの一貫性が確保されます。

データ拡張戦略
このセクションでは、従来の拡張技術と高度な拡張技術の両方をデータセットに適用して詳述します。初期データと拡張データを統合して新しいデータセットを作成し、その後トレーニングセット、検証セット、テストセットに分割して評価の公平性を確保します。

従来のデータ拡張32:これらの変換は、各バッチごとに定義された確率で訓練パイプラインによってリアルタイムで適用されます(例:アルブエンテーションやPyTorch Transformsライブラリを用い)。

幾何学的変換:回転:画像を-45°から+45°の角度でランダムに回転させます。スケーリング:画像を0.8倍から1.2倍のランダムにスケールします。水平反轉:画像をランダムに水平に100%の確率で反逆させる。ランダムトリミング:元の画像領域の80%から100%の間の部分をランダムにトリミングします。

光度変換:明るさとコントラスト:明るさとコントラストを[0.6, 1.4]からランダムに選ばれる係数で調整します。ガウスノイズ:標準偏差を[0, 0.01 * 255]からランダムに選んだガウスノイズを画像の10%に加えます。ガウスぼかし:核サイズが3×3のガウスぼかしを画像の10%に適用します。

遮蔽シミュレーション:画像に1〜3個の長方形閉塞パッチ(各幅の最大5%をカバー)をランダムに配置します。パッチはランダムなノイズや平均画像ピクセル値で満たされます。

このステップには、初期データセットとSegment Anything Model(SAM)33に対して事前学習済みのセグメントベースラインモデルが必要です。

ソースオブジェクトのセグメント化:過小評価されているブランドのタバコ箱画像については、SAMモデルを使って正確なセグメンテーションマスクを生成します。ポイントプロンプトモードを使用し、 シガレットボックスのブランド機能 をクリックしてセグメンテーションを開始してください。生成されたマスクを手動で検証・改良し、正確性を確保しましょう。透明な背景の区切りたシガレットボックス画像をPNGファイルとして保存してください。これにより、孤立したオブジェクトインスタンスのライブラリが作成されます。

背景マスクを生成する:事前学習済みのセグメントベースラインモデルを用いて、十分な余裕がある画像や単純な背景画像に対してインスタンスセグメンテーションを行います。モデルはすでにオブジェクトが占有している領域を示すバイナリマスクを出力します。

最終的な拡張データセット:このオフラインプロセスで600枚の新しい合成画像が生成されます。これらを元の4,835枚の画像と、上記の伝統的な増強技術を適用して生成された追加1,167枚の画像と組み合わせて、最終的な6,602枚の画像データセットを形成します。最終データセットをトレーニング(70%、4,621枚)、検証(20%、1,320枚)、テスト(10%、661枚)セットに分割し、同じ元の配列の画像が同じ分割内に収まるようにしてデータ漏洩を防ぎます。

提案された改良型検出器の構築のためのモデル修正
オブジェクト検出34 の最適化されたアルゴリズムは、近年産業検査において顕著な進展を遂げています。このセクションでは、提案モデルを作成するためにベースラインモデルアーキテクチャを修正するための詳細なステップバイステップ手順を提供します。これらの修正は、モデルの設定ファイル(例:config.yaml)を編集し、対応するカスタムモジュール定義がコードベースに含まれていることを確実にすることで実装されます。各修正の理由は、特定の検出課題に対応する役割を明確にするために示されています。提案されたモデルの構造は 図3に示されています。

ダウンサンプリングモジュールをADownモジュールに置き換える:標準的なConvolution-BatchNorm-SiLU(CBS)モジュールは単一のストライド畳み込みを用いており、情報ボトルネック35として機能し、小型タバコ箱や詳細なブランドロゴを認識するために必要な細かい特徴を除外する可能性があります。ADownモジュールは、空間解像度削減時により豊かな特徴を捕捉・保存するデュアルブランチ構造を実装することで、この問題を緩和するよう設計されています。一方は高頻度の局所的な詳細の保持を優先し、もう一方はより広く文脈に富んだ全体像を捉えています。これらの補完的特徴の融合により、後続のレイヤーに対してより堅牢で有益な表現が得られます。

行動と実施のステップ
モジュール定義:プロジェクトのモデル定義ファイル内にADownというカスタムPyTorchモジュールが定義されていることを確認してください。このモジュールは二つの並行した枝を含んでいなければなりません。最初の分岐は、3×3のカーネルと2のストライドを持つ二次元の畳み込み層で構成されるべきです。第2の分岐は、2x2の最大プーリング層(ストライド2)の後に1x1の畳み込み層で構成されます。これら2つの分岐の出力はチャネル次元に沿って連結され、得られる特徴マップは最終的な1x1畳み込みレイヤーを通してチャネルを積分し、出力を生成します。ADownモジュールの構造は 図4に示されています。

設定ファイルの編集:ベースラインモデルの設定ファイル(config.yaml)を開きます。ダウンサンプリングに設定されているCBSモジュールのすべてのインスタンス(すなわちストライドパラメータが2に設定されている)を体系的に特定します。これらのCBSモジュールエントリを新しいADownモジュールに置き換えてください。

設計動機:ADownの設計は、標準的なストリード畳み込みにおける情報損失を軽減する必要性から動機づけられており、これは小さなオブジェクトにとって不利となることがあります。その二重分岐構造は、高周波空間詳細(畳み込みによる)と低周波のコンテキスト情報(プーリングによる)の両方を捉える並列処理の考えに触発されており、これにより後続の層に対してより豊かな多スケール特徴表現を提供します。

iEMAモジュールの統合
理論と設計原則:モデルの小型目標や部分的に隠れた目標の検出能力を高めるためには、多スケール空間コンテキストを効果的にモデル化できる仕組みを組み込むことが不可欠です。iEMAモジュールは、効率的なマルチスケールアテンション(EMA)36 コンポーネントを逆残差ブロック(iRMB)37 構造に埋め込むことでこれを実現します。iRMBは深さごとに分離可能な畳み込みを用いて計算効率の良い基盤を提供し、EMAコンポーネントは並列な多分岐設計を通じてスケールを超えた空間的相互作用を明示的に捉えます。この統合により、モデルは特徴の重みを動的に再調整し、異なるスケールで最も識別力のある空間領域に注意を集中させることで、閉塞下や小さな物体の認識が向上します。

アクション・実装ステップ
モジュール定義:iEMAというカスタムPyTorchモジュールが定義されていることを確認してください。このモジュールはまず逆残差ブロックを実装します。このブロックは通常、チャネル展開のための点ごとの畳み込みから始まり、その後空間的特徴抽出のための深さ方向の畳み込み(例:3×3)、最後にチャネル射影のための点ごとの畳み込みを行います。このブロックの直後にEMA注意メカニズムを実装すべきです。EMAメカニズムは通常、グループ化された畳み込みや次元間相互作用を用いて、過剰な計算負荷なしにマルチスケールの空間注意マップを効率的に生成します。iEMAモジュールの構造は 図5に示されています。

構成ファイルの編集:config.yamlの設定ファイルで、ネックネットワークを定義するセクション、特にC2fモジュールの直後の層を見つけます。これらの戦略的な場所には、iEMAモジュールを呼び出す新しいレイヤーを挿入します。

設計動機:iEMAモジュールは、深さごとに巻込んだ局所特徴抽出と、軽量かつ効果的なグローバルコンテキストモデリング機構(EMA)を統合することで特徴識別性を高めるという原則に基づいています。このハイブリッドアプローチにより、モデルは異なるスケールにわたる情報領域に適応的に焦点を当てることができ、部分的に見えるブランドロゴやテキストを認識する上で非常に重要です。

検出ヘッドをDynamicHeadモジュールに置き換える
理論と設計原理:元の検出ヘッドは、タバコ箱の大きなスケール変動や位置特定と分類作業の複雑な相互作用に最適でない可能性があります。DynamicHeadモジュールは、スケール意識、空間認識、タスク認識注意力という3つの注意形態を一貫した構造に統合することでこの問題に対応します。スケール認識コンポーネントは、特徴ピラミッドの異なるレベルの特徴を動的に融合させ、あらゆるサイズのオブジェクトを効果的に表現できるようにします。空間認識コンポーネントは、特徴マップ内の最も情報量の高い領域に計算資源を集中させるために、スパースサンプリング戦略を用いています。タスク認識コンポーネントは、バウンディングボックス回帰とカテゴリ分類という異なる目的に特化した特徴表現を適応させます。この統一されたアプローチにより、より正確で堅牢な予測が可能になります。

アクション・実装ステップ
加群定義:これは式(1)から(4)で記述される三つの注意メカニズムを包含する複雑な加群です。内部構造には、スケールごとの重み計算、変形可能な空間的注意の実行、タスク固有の特徴変換の適用層が含まれます。

式1(1)

式2(2)

式3(3)

式4(4)

ここでWL(F)は、スケール認識π L(F)、空間認識π S(F)、タスク認識π C(F)の注意メカニズムを逐次適用して得られる最終的な注意精錬特徴マップを表します。具体的には、式(2)ではL(F)π)は、まず空間(S)次元とチャネル(C)次元で平均を取り、線形関数f(⋅)とハードシグモイド活性化σ(⋅)を通すことでスケール単位の注意重みを計算します。式(3)では、πS(F)は、識別領域に注目する学習可能なオフセット Δpk を付ける K 個のサンプリングされたキーポイント pk から特徴を集約し、識別領域に注目し、重要度スカラー Δmk を付けることで空間的注意を分散しています。式(4)では、C(F)π学習パラメータ(α1、β1,α 2、β2)に基づく線形変換を各チャネルに適用し、最大応答を選択することで、分類や回帰作業に特化できるようにタスク認識型注意を実装しています。DynamicHeadモジュールの構造は図6に示されています。

設定ファイルの編集:config.yamlファイルで、モデルのヘッドを定義するセクションを見つけます。そこには元々Detectモジュールが含まれています。DynamicHeadモジュールを呼び出す新しいエントリに置き換えてください。

設計動機:DynamicHeadモジュールは、物体検出ヘッドがスケール、空間位置、タスクに適応すべきだという観察に基づいています。Eqs.で正式に定められた統一注意の枠組み。(1-4)により、モデルはこれら3次元に基づいて特徴応答を動的に再調整でき、スケール変動や背景の混雑に対してより堅牢な予測が可能になります。

モデルトレーニング
PyTorch 2.1.0、CUDA 12.1、すべての依存関係がインストールされていることを確認してください。

訓練司令部
再学習前に、分割された画像データと注釈データを標準的な単段階検出形式で準備します。画像パスとデータカテゴリを含む.yamlファイルを作成します。モデル改良により、元の検出器の.yamlファイルは提案されたモデルの.yamlファイルに置き換えられます。train.py ファイルを書き込み、シングルステージ検出器パッケージをインポートし、トレーニングモデルとデータパスを読み込み、imgze=640、epochs=100、batch=4、workers=0、device='0'、optimizer='SGD'、close_mosaic=10など、いくつかのトレーニングパラメータを設定します。

ハイパーパラメータ:主なパラメータは、入力画像サイズ(640 x 640)、バッチサイズ(4)、コサインアニーリングスケジューラによる初期学習率(0.01)、運動量を用いたSGD最適化器(0.937)、およびウェイト減衰(0.0005)です。モザイクの強化はデフォルトで有効です。

トレーニングモニタリング:トレーニングプロセスは各エポックの指標を出力します。訓練・検証損失とmAPの曲線を0.5で監視し、収束を確保し過学習を避けましょう。100エポック分の訓練で通常は十分です。

モデル評価と展開
評価:トレーニング後、最良のモデルはruns/train/exp/weights/best.ptとして保存されます。val set上で bash Python val.py --data cigarette_dataset.yaml --weights runs/train/exp/weights/best.pt を使って評価してください。スクリプトはPrecision、Recall、mAPを0.5で出力します。mAPが必要な閾値(例:97.9%)を満たしているか確認してください。

検証のための推論:サンプル画像で推論を実行し、検出結果を視覚的に検証します:bash、python detect.py --weights runs/train/exp/weights/best.pt --source path/to/test/images --conf 0.5。推論を検証することで、各画像の検出結果とモデルの検出速度を得ることができます。

展開:スタッカークレーンのシステム上でリアルタイム展開するには、PyTorchモデル(best.pt、約4.7MB)をTensorRTやONNXのような形式に変換し、推論速度を最適化します。最終的な出力は、クラスラベル(ブランド名)と信頼度スコアを含む境界ボックスです。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

結果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

実験環境とパラメータ設定
提案されたモデルの性能を検証する実験は、ディープラーニングフレームワークPyTorch上で行われ、実験環境の詳細は 表1に記載されています。ここでは、6,602枚の画像を含む特別なデータセットを使用し、トレーニング、検証、テストセットにランダムに7:2:1の比率で分割しました。すべての実験は、解像度640 x 640の入力画像を用い、初期学習率0.01を用い、過学習を防ぐために0.937の確率勾配下降によって最適化されました。トレーニング中、モザイク増強を用いて各回の反復で4枚の画像を処理し、検出のために背景を多様化しました。すべてのモデルは100エポック向けに訓練され、バッチサイズは4で、ワーカースレッド数は0に設定されていました。

評価指標
多クラス分類に関心のあるサンプルは正のクラスとされ、他のすべてのサンプルは負のクラスとされました。真陽性(TP)は正当に陽性と予測されたサンプル数を表し、偽陽性(FP)は誤って陽性と予測されたサンプル、...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

ディスカッション

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

精度と効率のトレードオフ
このモデルの中心的な成果は、精度と計算効率の優れたバランスです。 表2に示されているように、提示されたモデルは単段検出器モデルの中で最も少ないパラメータ数と2番目に低いFLOPを有しつつ、最高のmAPを達成しています。これは実用的な利点につながります。小型モデルは展開が速く、メモリ消費が少なく、GPUとエッジハードウェアの両方で推論遅延と消費電力が低くなります。これにより、計算予算が厳しいスタッカークレーンのオンボードコンピュータのようなリソース制約のあるプラットフォームでのリアルタイムアプリケーションに非常に適しています。

制限
高性能であるにもかかわらず、強化モデルにはいくつかの制限があります。その精度は、訓練データの代表性に依存します。極端な照明条件(例えば強い鏡面反射)や、タバコ箱が70%以上遮られた場合など、このデータセットでは過小評価されていたシナリオで性能が低下す...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

開示事項

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者たちは直接的な競合する金融的利益を主張していない。この研究は、鄧洪利氏や李文燦氏が勤務する龍岩タバコ工業有限公司および羅宝斌氏が勤務する宝吉タバコ工場との共同研究で行われました。これらの提携が研究の適用シナリオと現地データを提供しました。学術著者(劉君、李建光、楊鳳、趙小波)は、本書の出版に関して金銭的または非金銭的な利益相反を一切認めていないと述べています。

謝辞

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

この研究は、浙江省自然科学基金共同基金の資金提供による「前置反射鏡および多波長鋳造ビレットの温度測定法(No.LZY24E050002)」および曲州科学技術計画プロジェクトの資金提供による非閉閉・非等温杓キャビティのオンライン温度場測定法(No.2023K231)によって資金提供されました。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

材料

この記事で使用された材料の一覧
名前会社カタログ番号コメント
コードリーダーヒクビジョンID5050Hikvision機器:パレットのバーコードを読み取るために使用、24V電源の接続が必要
産業用カメラヒクビジョンMV-CA013-A0GM、MV-CS016-10GM24V電源を接続する必要があります
LEDライトヒックロボットMV-LLDS-1002-38-W1メートルのストリップ光源でカメラに十分な照明条件を提供します
レンズヒクビジョンMVL-HF0828M-6MPE焦点距離:8mm、絞り範囲:F2.8~F16、ピクセル:600万
MVSヒクビジョンV4.5.1Hikvisionソフトウェア:カメラのデバッグ、カメラパラメータ設定、データ収集に使用されます
パイチャームジェットブレインズ2020.1.3 x64ディープラーニングモデルの訓練や検出システムの開発に使用されます
いくつかの金属製ブラケット龍岩たばこ工業有限公司7075-T6 アルミニウム合金カメラやコードリーダーの修理に使用
複数のネットワークケーブル龍岩たばこ工業有限公司RJ45 クリスタルヘッド産業用コンピュータと無線アクセスポイントの間にベースステーションを接続し、カメラとスイッチを接続します
スウィスTP-リンクTL-SH1005220V電源を必要とするイーサネットケーブルインターフェースは8つあります
ビジョンマスターヒクビジョンV4.3.0Hikvisionソフトウェア:テンプレートの照合および画像結果検出に使用
無線APデバイス山東華創順蓮BH-ANT5158S-14HV、BH-MS-AC1600HWHスタッカークレーンの大規模な移動のため、ネットワークケーブルはカメラと産業用コンピュータを接続できず、カメラネットワークの円滑な運用を確保するために無線AP機器が必要です

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Chen, C., Liu, J., Yin, H., Huang, B. A Vision-Based Method for Detecting the Position of Stacked Goods in Automated Storage and Retrieval Systems. Sensors. 25 (10), 2623(2025).
  2. Yu, X., Liao, X., Li, W., Liu, X., Tao, Z. Logistics automation control based on machine learning algorithm. Cluster Comput. 22 (Suppl 4), 14003-14011 (2019).
  3. Liu, J., et al. Benders decomposition for the multi-agent location and scheduling problem on unrelated parallel machines. Soft Computing. 29 (1), 195-212 (2025).
  4. Haffner, O., Kuˇcera, E., Rosinová, D. Applications of Machine Learning and Computer Vision in Industry 4.0. Appl. Sci. 14 (6), 2431(2024).
  5. Bo, Q., et al. Formulation of receiving/retrieving strategy for automatic high rack finished cigarette warehouse. Tobacco Sci Technol. 57 (6), 92-98 (2024).
  6. Voulodimos, A., Doulamis, N., Doulamis, A., Protopapadakis, A. Deep learning for computer vision: A brief review. Computat Intell Neurosci. 2018 (1), 7068349(2018).
  7. Khan, A. I., Al-Habsi, S. Machine learning in computer vision. Proc Comp Sci. 167, 1444-1451 (2020).
  8. Xu, S., et al. Computer vision techniques in construction: a critical review. Arch Computat Meth Eng. 28 (5), 3383-3397 (2021).
  9. Xu, P. Progress of Object detection: Methods and future directions. Second IYSF Acad Sympos Artif Intell Comp Eng SPIE. 12079, 530-542 (2021).
  10. Sreelakshmi, P. R., Swaraj, K. P. Occlusion resilient object detection under various situations using deep learning techniques: A review. AIP Conf Proc AIP Publishing LLC. 3037 (1), 020042(2024).
  11. Rich feature hierarchies for accurate object detection and semantic segmentation. Girshick, R., Donahue, J., Darrell, T., Malik, J. Proc IEEE Conf Comp Vision Pattern Recognit, , 580-587 (2014).
  12. Fast R-CNN. Girshick, R. Proc IEEE Int Conf Comp Vision, , 1440-1448 (2015).
  13. You only look once: Unified, real-time object detection. Redmon, J., Divvala, S., Girshick, R., Farhadi, A. Proc IEEE Conf Comp Vision Pattern Recognit, , 779-788 (2016).
  14. Hussain, M. YOLO-v1 to YOLO-v8, the rise of YOLO and its complementary nature toward digital manufacturing and industrial defect detection. Machines. 11 (7), 677(2023).
  15. Li, C., et al. YOLOv6: A single-stage object detection framework for industrial applications. arxiv. , (2022).
  16. Li, D., Liu, Y., Hu, C., Wang, Y., Wen, X. Research and application of intelligent stocktaking method based on weighing and image recognition technology in publishing industry. Logistics Technol Applicat. 30 (1), 134-142 (2025).
  17. Wang, X., Qian, S., Zhang, J., Guo, J., Pan, C. Exploration and application of library book stocktaking system based on computer vision and artificial intelligence technology. Library J. 41 (7), 96(2022).
  18. Sun, H., Li, P. Design and development of intelligent warehouse stocktaking system based on multi pattern visual recognition technology. Construct Machinery Equip. 56 (4), 107-111 (2025).
  19. Ren, S., He, K., Girshick, R., Jian, S. Faster R-CNN: Towards real-time object detection with region proposal networks. IEEE Transact Pattern Anal Machine Intell. 39 (6), 1137-1149 (2016).
  20. Speed/Accuracy Trade-offs for Modern Convolutional Object Detectors. Huang, J., et al. Proc IEEE Conf Comput Vis Pattern Recognit. (CVPR), , 7310-7311 (2017).
  21. Bochkovskiy, A., Wang, C. Y., Liao, H. Y. M. YOLOv4: Optimal Speed and Accuracy of Object Detection. arXiv. , (2020).
  22. Tian, Y., Ye, Q., Doermann, D. YOLOv12: Attention-Centric Real-Time Object Detectors. arXiv. , (2025).
  23. Cheng, T., et al. YOLO-World: Real-Time Open-Vocabulary Object Detection. arXiv. , (2024).
  24. Khanam, R., Hussain, M. Yolov11: An overview of the key architectural enhancements. Arxiv. , (2024).
  25. YOLOv8: A Novel Object Detection Algorithm with Enhanced Performance and Robustness. Varghese, R., Sambath, M. 2024 Int Conf Adv Data Eng Intell Comput Sys (ADICS), , IEEE. 1-6 (2024).
  26. Wan, D., et al. YOLO-MIF: Improved YOLOv8 with Multi-Information fusion for object detection in Gray-Scale images. Adv Eng Info. 62, 102709(2024).
  27. Feature Pyramid Networks for Object Detection. Lin, T. Y., et al. Proc IEEE Conf Comp Vision Pattern Recognit (CVPR), , 2117-2125 (2017).
  28. Searching for MobileNetV3. Proc IEEE/CVF Int Conf Comp Vision (ICCV). Howard, A., et al. , 1314-1324 (2019).
  29. GhostNet: More Features from Cheap Operations. Han, K., et al. Proc IEEE/CVF Conf Comp Vision Pattern Recognit (CVPR), , 1580-1589 (2020).
  30. Yolov9: Learning what you want to learn using programmable gradient information. Wang, C. Y., Yeh, I. H., Mark Liao, H. Y. European conference on computer vision, , Cham Springer Nat Switzerland. 1-21 (2024).
  31. Dynamic head: Unifying object detection heads with attentions. Dai, X., et al. Proc IEEE/CVF Conf Comp Vision Pattern Recognit, , 7373-7382 (2021).
  32. Zhu, X., et al. Overview of Research on Image Data Enhancement Technology. Soft Guide. 20 (5), 1-5 (2021).
  33. Segment anything. Kirillov, A., et al. Proc IEEE/CVF Int Conf Comp Vision, , 4015-4026 (2023).
  34. Jiang, H., Wang, Y., Kang, J. Overview of object detection models and optimization methods. J Automatica Sinica. 47 (6), 1367-1393 (2021).
  35. Deep Residual Learning for Image Recognition. He, K., Zhang, X., Ren, S., Sun, J. Proc IEEE Conf Comput Vis Pattern Recognit (CVPR), , 770-778 (2016).
  36. Efficient multi-scale attention module with cross-spatial learning. ICASSP 2023-2023 IEEE Int Conf Acoustics Speech Signal Proc (ICASSP). Ouyang, D., et al. , IEEE. 1-5 (2023).
  37. Rethinking mobile block for efficient attention-based models. Zhang, J., et al. 2023 IEEE/CVF Int Conf Computer Vis (ICCV) IEEE Comp Soc, , 1389-1400 (2023).
  38. Wang, Y., et al. Multi-Type Ship Target Detection in Complex Marine Background Based on YOLOv11. Processes. 13 (1), 249(2025).
  39. Shao, X., et al. Multi-Scale Feature Pyramid Network: A Heavily Occluded Pedestrian Detection Network Based on ResNet. Sensors. 21 (5), 1820(2021).
  40. YOLOv7: Trainable Bag-of-Freebies Sets New State-of-the-Art for Real-Time Object Detectors. Wang, C. Y., Bochkovskiy, A., Liao, H. Y. M. Proc IEEE/CVF Conf Comput Vis Pattern Recognit (CVPR), , 7464-7475 (2023).

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

再版と許可

このJoVE記事のテキストまたは図の再利用許可をリクエスト

許可をリクエスト

タグ

Object DetectionCigarette Brand IdentificationReal Time DetectionSingle Stage RegressionAdaptive DownsamplingMulti Scale AttentionDynamic Detection HeadVisual RecognitionModel LightweightOcclusion Detection
動画は近日公開

関連記事