Method Article

局所的特徴に基づく複雑なエレベーターシナリオにおける電動自転車の改良されたチャンク画像注釈法

DOI:

10.3791/69226

March 17th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

EBike-DETデータセットと主流の物体検出モデルを用いて、複雑なエレベーターシナリオにおける電動自転車検出を改善するために、局所的特徴に基づくチャンク画像注釈法を提示します。

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

住宅用エレベーターなどの閉鎖環境での電動自転車(EBikes)の使用増加は、深刻な安全上の懸念を引き起こし、特に頻繁な遮蔽物の発生により自動物体検出に大きな課題をもたらしています。主に全体的な注釈に依存する従来の検出手法は、視覚的に複雑なシーンで部分的に遮蔽されたEBikeを正確に認識できないことが多いです。これらの制約を克服するため、本研究は局所的特徴に基づく新しいチャンク注釈法を提案し、より解釈しやすい注釈戦略を提供します。EBikeを複数のキー領域に分解して独立したラベリングを行うことで、検出モデルは細かい構造情報を学習でき、閉塞が多い条件下での堅牢性を向上させます。さらに、現実的なエレベーターシナリオでの検出タスクを支援する専用データセット「EBike-DET」も開発されています。チャンク方式で注釈を付け、環境条件をシミュレーションしたもので補強することで、モデルのパフォーマンスと適応性の両方を向上させます。提案された手法は、物体検出をより透明かつ構造的に解釈可能にすることで、説明可能な人工知能(XAI)の開発を促進し、特に安全性が重要な応用において価値があります。3つの主流モデル(YOLOv5、YOLOv10、SSD)を用いて広範な実験が行われています。結果によると、ELOv5はチャンク注釈付きでEBike-DET上で訓練した場合、精度が3.7%、リコール率5.3%、F1スコアで4.5%、mAPが4.4%の向上を達成しました。公開データセットと比較して、EBike-DETは閉塞下での安定性と堅牢性がより高まります。この研究は検知精度の向上に寄与するだけでなく、実際の安全監視システムへの展開に向けたより解釈しやすく説明可能なAIソリューションへの一歩を示しています。

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

特に中国では、電動自転車(EBikes)が世界中で急速に普及し、2022年までに総台数が3億5千万台を超えたことで、EBikesは短距離輸送の主要な手段となっています。しかし、住宅用エレベーターのような狭い空間での頻繁な使用は、異常振動、機器の損傷、不快な臭い、火災の危険など深刻な安全リスクをもたらします。最近の研究では、EBikeに関連する火災事故の発生確率は約1.44%と推定されています1。これらのリスクは、エレベーター環境での安全性を高めるために効率的かつ正確なEBike検出方法の緊急性を浮き彫りにしています。

コンピュータビジョンやディープラーニングの進歩にもかかわらず、エレベーターでのEBike検出は依然として困難です。公開されているデータセットは希少で、EBikeモデル、色、閉塞条件の多様性に欠けていることが多いため、モデルの一般化が制限されていますさらに、エレベーターのシナリオでは複雑な閉塞が頻繁に起こり、EBikeが乗客や構造部品によって部分的に隠れているため、検出精度はさらに低下します。3,4,5。EBikeを単一のバウンディングボックスとして扱う既存のホリスティック注釈手法は、このような条件下でしばしば失敗し、注釈と検出戦略の改善が必要であることを示しています。表1に示されているように、ホリスティック注釈は性能を著しく低下させ、チャンク注釈と比較して交差点(IoU)閾値で平均平均精度が最大21.5%低下し、0.5(mAP@0.5)に減少します。

ディープラーニングに基づく検出の進展

ディープラーニング手法、特に畳み込みニューラルネットワーク(CNN)は、物体検出に広く応用されています。You Only Look Once(YOLO)ファミリーは強力なリアルタイムパフォーマンスを示しています。しかし、遮蔽された物体や重なり合う物体を検出すると、YOLOモデルは冗長なバウンディングボックスを生成する傾向があります。例えば、YOLOv5は深部畳み込みおよび特徴ピラミッドネットワーク6,7を通じてマルチスケール特徴抽出を強化し、YOLOv10は非最大抑制を排除し、パスアグリゲーションネットワークを用いて速度向上とマルチスケール融合を実現します8,9。これらの改善にもかかわらず、冗長なバウンディングボックスや閉塞感の強い環境での堅牢性の低下は未解決の問題です。しかし、主要なEBike構造が部分的に遮断されると、ホリスティック注釈は局所的な手がかりが限られているため、両者とも不利になります図1A-Cに示すように、この制限は冗長なバウンディングボックスや中程度または重度の閉塞時の検出信頼度の不安定さを引き起こしますこれに対し、チャンク注釈は車輪や後部領域などの別領域をモデルが検出できるため、遮蔽下での冗長なバウンディングボックスを減らすことでこの問題を緩和します。 1D-Fはさらに、チャンク注釈が特徴の局在化を改善し、部分的なEBike成分のみが見える場合の検出安定性を維持することを示しています。

同様に、VGG-16バックボーンを基盤としたシングルショットマルチボックス検出器(SSD)モデル10,11はスケールを超えて効率的な検出を提供し、小型物体12でも良好な性能を発揮します。しかし、SSDは重度の遮蔽によって機能の連続性が壊れ、検出漏れや不安定なボックス回帰が生じる場合も苦戦します。注意機構が導入されても13です。チャンク注釈はここでも利点を提供します。モデルは残った可視的な局所部分に依存できるため、マルチスケールや遮蔽条件下での検出安定性が向上します。

注釈戦略と局所特徴学習

現在のほとんどの検出手法はホリスティック注釈を採用しており、注釈を簡素化しますが、主にグローバル特徴量に依存しています14,15。この方法は、ホイール、前部、後部などの重要なEBike領域が部分的に欠損している場合に苦労します。最近の研究16では、対象を複数の注釈付き部分に分割する局所特徴学習が、困難なシナリオにおいて堅牢性と精度を向上させることが示されました。これと一致して、表2の結果は、特にホイール、前面、後部の注釈を付ける際、主要なEBikeコンポーネントの少なくとも40%〜60%が可視化されている場合、チャンク注釈が有効であることを示しています。対照的に、ホリスティックバウンディングボックスは、低遮蔽状況(例:<20%の閉鎖)や画像解像度≥1280×720で、完全なシルエットが保持される場合には十分です。遮蔽が≈70%を超える場合や、特徴レベルの領域が判別できる空間情報を提供できないほど小さくなる場合、チャンク化の利点は減少します。

ハリスコーナー検出の使用方法論的根拠

ハリスコーナー検出は、その決定論的な挙動、計算効率、訓練不要の特性から局所特徴抽出に選ばれており、これらはエレベーター環境での信頼性の高い注釈に不可欠です。SuperPointやLoFTRのような学習型キーポイント検出器とは異なり、追加の訓練を避け、限られた注釈データや強い遮蔽下でドメインシフトを低減します。CannyやSobelのようなエッジベースの演算子と比較すると、ハリスコーナーはノイズの多い背景エッジではなく幾何学的に意味のある接合部を強調し、車輪やフレーム交差を含むEBike構造の安定した局在化を可能にします。さらに、ハリスコーナー検出は解釈可能なハイパーパラメータを提供します。経験的定数 k はコーナー感度と安定性を制御します。セクション2.6.2.4および 図2に示されているように、 k の調整は堅牢性と過剰検出の制御されたバランスを支持し、提案されたルールベースのチャンク注釈戦略とよく整合しています。

ロバスト性のためのデータ拡張

データ拡張は検出モデルの多様性と適応性を高める上で効果的であることが証明されています。一般的な技術には、幾何学的変換(例:回転、スケーリング、トリミング)や色調整(例:グレースケーリング、輝度調整)があり、これらは現実世界の状況や光の変化をシミュレートします。これらの戦略を取り入れることで、検出モデルは変動性に対してより強靭になり、実際の展開により適しています。

前述の制限に対処するため、本研究は局所的特徴に基づく改良されたチャンク注釈法を提案します。この手法は、EBikeを複数の独立した注釈付き部分に分割することで特徴学習と堅牢性を高め、複雑な遮蔽下での検出をより効果的に可能にします。さらに、エレベーター環境に特化した専用の電動自転車検出(EBike-DET)データセットを構築し、多様なデータ拡張によってモデルの適応性を高めています。最後に、YOLOv5、YOLOv10、SSDで検証され、 表3 にまとめられたように、+5.69%から+39.81%のmAPの一貫した性能向上が示されました。貢献は以下のようにまとめられます:閉塞条件下で特徴学習を強化する改良されたチャンク注釈法、エレベーターシナリオ向けの専門的なEBike-DETデータセットの構築、複数の増強技術の統合、そして主流の検出モデルに対する実験的検証(ホリスティック注釈と比較して精度と堅牢性の向上)。

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究で使用されたEBike-DETデータセットは、著者らがエレベーター、駐車場、街路環境で現地撮影を行って収集した画像と、ウェブベースのプラットフォームから取得した公開されているEBike画像で構成されています。すべての現地画像収集は、EBike検出に関する安全性関連の技術的研究のため、非私的環境で行われました。画像は意図的に個人を標的にするものではなく、偶発的に撮影された人物は距離、遮蔽、背面からの視点、または顔の特徴やその他の個人識別子を除去する適切な処理により特定できません。ウェブソースの画像は、学術研究の再利用を許可するプラットフォームやオープンライセンスの下で公開されたリソースからのみ取得されました。すべての画像は非営利の研究および教育目的のみに使用されます。特定可能な個人データは収集されておらず、被験者との直接的な接触もなかったため、本研究は著者の機関ガイドラインに従い機関倫理委員会の承認を必要としませんでした。

1. データセット構築

  1. 画像解像度、色空間、ファイル形式
    1. 画像のネイティブ解像度を1280×720ピクセルに設定すると、さまざまなシーンでe-ikesの高品質なディテールを捉えることができます。
    2. 標準化後は、計算効率と機能保持のバランスを取るために画像を640×480ピクセルにリサイズします。
    3. カラースペースをRGBに設定することで、完全な色情報を保持し、異なる照明条件下で正確な特徴認識を確保します。
    4. 画像をJPEG形式で保存し、画質を大きく損なわずにストレージを最適化しましょう。
  2. トレーニング、検証、テストデータセットの定義と分割
    1. データセットをトレーニング、検証、テストセットに7:2:1の比率で分割し、モデルトレーニング、ハイパーパラメータ調整、パフォーマンス評価のために適切に分割します。
    2. ランダムシードを42に設定し、異なる実験間でデータを再現性を確保します。
    3. 階層化サンプリングを適用し、各データセット分割におけるEBikeモデルと閉塞レベルの分布を一貫させ、集合間のクラス不均衡を防ぎます。
    4. トレーニング、検証、テストセット間の漏れを防ぐために、複数のセットにebike画像が表示されないようにしてください。
  3. 公開データセット構築
    1. オープンソースプラットフォーム20,21,22,23から公開されているEBike検出データセットを選択してください。このデータセットにはパノラマシーンと部分的に遮蔽されたシーンの両方で210枚の画像が含まれています。
    2. 公開データセットの限界、例えば単一カメラアングル、低解像度、単純な背景シーンなどを認識し、特に複雑な遮蔽状況ではモデルの一般化能力を制限する可能性があります。
  4. EBike-DETデータセットの構築
    1. EBike-DETデータセットを構築し、シーンのカバレッジとサンプル多様性を強化します。ウェブベースのプラットフォームと現地写真からなる1,680枚の高品質画像で構成されています。
    2. エレベーター、駐車場、道路など多様な環境を含め、e-ikeが置かれているさまざまな状況を捉えましょう。
    3. 多様なカメラアングル(正面、横、上)を取り入れて、EBikeの全範囲の外見を捉え、検出モデルの堅牢なトレーニングを実現します。
    4. 色、サイズ、アクセサリーに変化のある複数のEBikeブランドやモデルを含めることで、サンプルの多様性を高めましょう。
    5. 歩行者や車両によって部分的に遮蔽され、エレベーターのような狭い空間での現実世界の状況をシミュレートする閉塞シナリオも含めてください。
    6. EBike-DETデータセットが多様かつ複雑なサンプルを含み、複雑な閉塞条件下でのターゲット検出に信頼できるデータセットであることを確認しましょう。
  5. ウェブおよびサイト内画像の包含および除外ルール
    1. ウェブ画像:公開されているもののみを含み、多様な環境で撮影されたもの、高解像度かつ多様な照明条件で撮影されたもののみを含みます。低解像度やシンプルな背景の画像は除外してください。
    2. 現地画像:エレベーター、駐車場、街路などの実際の環境で撮影した画像を含めましょう。画像は、遮蔽、背景の複雑さ、天候条件に変化があるリアルなEBikeシナリオを表現していることを確認しましょう。ノイズや歪み、非現実的な設定がある画像は除外しましょう。
    3. ウェブ画像と現地画像の両方が同じ解像度とカラースペースの基準に従っていることを確認し、データセット全体の一貫性を保ちましょう。
  6. データ拡張構築
    1. グレースケーリングや回転などの基本的な補強操作を適用して、サンプルの多様性を高め、さまざまな照明条件やカメラの向きをシミュレートします。
    2. EBikeのターゲットをホイールエリア、フロントエリア、リアエリアなど複数の独立したローカルリージョンに分割し、ローカルフィーチャー学習を強化します。
    3. 各領域を独立して注釈することで、閉塞下での検出精度を向上させ、異なるEBikeパート間での堅牢なモデル性能を確保しましょう。
    4. すべての拡張画像やチャンク注釈がEBikeの特徴と構造的一貫性を維持していることを確認し、不一致や無効な訓練データを防ぎます。

2. 局所特徴チャンク注釈

注:複雑なオクルージョンシナリオにおけるEBikes検出精度を高めるため、局所特徴の改善に基づくチャンク型注釈法を提案します。この方法はEBike領域の局所的特徴点を抽出してセグメント化し、対応する特徴領域の閉塞度に基づいて領域を注釈付けすべきかどうかを判断します。詳細な実験プロセスは 図3に示されています。

  1. 事前に構築されたトレーニング、検証、テストデータセットを活用します。
  2. 手動注釈:Python環境のLabelImgツールを使って手動注釈を付けてください。すべての画像をe-ikesとしてのみラベル付けし、ネガティブサンプルからの干渉を最小限に抑えてください。
  3. データ処理と拡張
    1. Yongjiangらが提案した方法を適用し、データセット全体で均一なサイズを確保するために画像のノイズ除去と標準化を行います。
    2. データ増強操作(例:回転、明るさ調整、グレースケーリング)を行い、サンプルの多様性を高めます。すべての拡張画像が画質を維持し、モデルの堅牢性を様々な背景に高めることを確認しましょう。
  4. EBike地域のクロップング
    1. ROIの局在化の再現性を確保するために、YOLOv10の推論パラメータを表 4 の推論パラメータ(yolov10x.pt 事前学習済み重みファイルを使用)を適用します。出力バウンディングボックスの座標は以下の通りです:
      ROI = [x1, y1, x2, y2] (1)
      式(1)はROI26 のバウンディングボックス座標[x1, y1, x2, y2]を定義し、ここで: x1, y1 = EBike ROIの左上角座標;x2, y2 = EBike ROI の右下座標。これらの座標はYOLOv10の生出力から導き出されており、検出された各天体に対して[cx, cy, w, h]のバウンディングボックスを予測します。変換式は以下の通りです:
      figure-protocol-1(2)
      figure-protocol-2(3)
      figure-protocol-3(4)
      figure-protocol-4(5)
      ここでcx、cyは予測されたバウンディングボックスの正規化された水平/垂直中心座標(入力画像サイズ640 x 480にスケール)です。 w、h は予測されるバウンディングボックスの正規化された幅/高さ(入力画像サイズにスケールした値)です。
    2. YOLOv10の出力を信頼度閾値(0.5)でフィルタリングし、EBike関連検出(電動自転車対応のクラスID)のみを保持し、NMS(IoU=0.45)で処理して冗長なボックスを除去します。残りのバウンディングボックスをROIクロップのために[x1, y1, x2, y2]に変換します。
    3. 複数検出の処理
      注:エレベーターシナリオ(EBike-DETデータセットのコアターゲット)では、EBikeは通常単一インスタンス(スペース制約)です。複数のEBike検出がある場合(例:混雑したエレベーターに2つのEBikeがある場合)、以下のルールが適用されます。
      1. 最も高い信頼優先度:最大信頼度スコアのバウンディングボックスを選択します(YOLOv10の出力信頼度は対象がEBikeであるというモデルの確信度を反映しています)。
      2. 空間妥当性チェック:複数の検出が信頼度スコア>0.7)であれば、エレベーターの構造境界との空間的重複を確認し(例:エレベーター壁を越えて拡張されたバウンディングボックスは避ける)、中心点cx,c yが画像中心に最も近い検出を保持します(エレベーターは通常、ターゲットを中央に置いた前方カメラで監視されます)。
      3. エッジケース処理:信頼度閾値を満たす有効な検出がなければ(例:重度の閉塞)、画像を手動ROI補正(EBike-DETデータセットの<3%)にマークします。
  5. グレースケール変換と正規化
    1. ROIからトリミングされたRGB画像に対してグレースケール変換を行います。換算には加重平均法を用い、次の式に従います。
      Igra = 0.299 × R + 0.587 × G + 0.114 × B(6)
      ここで、R、G、Bはそれぞれ赤、緑、青の各チャネルのピクセル値を表します。この方法は、人間の異なる色の明るさの知覚と一致しています。
    2. グレースケール画像のピクセル値を[0, 1]の範囲に正規化し、[0, 255]から線形スケーリングします。この正規化により数値計算の安定性が向上し、その後の勾配計算や閾値測定が異なる照明条件下で一貫して動作することを保証します。
  6. ハリスコーナー検出
    1. ハリスコーナー検出をグレースケールに適用し、EBike領域を正規化して局所の特徴点を抽出します。
      注:ハリスコーナー検出の基本原理は、 画像中のコーナーを正確に位置特定するために自己相関行列を計算することにあります。図 4Bに視覚的に示されています。これらの検出されたコーナーは、ホイール、フロントエリア、リアエリアなど、しばしばクリアなコーナー特徴を示す主要なEBikeコンポーネントに関連しています。
    2. 画像の勾配を計算し、以下に説明するような顕著な強度変化の領域を特定します。
      1. 画像平滑化:ノイズを抑制するためにグレースケール画像にガウスフィルタリングをかけ、以下のように滑らか化された画像が得られます。
        Is =σ G
        ここで * は畳み込み演算を表し、Gσ は標準偏差が σ の2次元ガウス核であり、平滑化レベルを制御します。典型的な値は1.0です。
      2. 画像勾配の計算:勾配演算子(ソーベル演算子など)を使って、平滑化された画像の水平(x)と垂直(y)勾配を計算します。
        Ix = Kx * Is , Iy=Ky * I y (8)
        ここで IxI y はそれぞれ x 方向と y 方向の勾配写像であり、Gx と Gy はソーベル演算子の畳み込み核です。
        figure-protocol-5figure-protocol-6 (9)
      3. 各ピクセル(x,y)を中心に3×3の局所ウィンドウWを用いて、既に計算された勾配に基づいて自己相関行列Mを構成する。
        figure-protocol-7(10)
        式において、Wは位置(x,y)の局所ウィンドウを指し、演算∑Wはこのウィンドウ内のすべての画像要素の総和を表します。A = ∑W Ix2 は、x 方向の W ウィンドウ内の勾配の二乗の和を表し、x 方向の変化の強さを反映しています。B=∑W Iy2は、y方向のW窓の勾配の二乗の和を表し、y方向の変化の強度を反映します。C = ∑WI xIy は 、W ウィンドウ内の x 方向と y 方向の勾配の積の和を表し、これら二方向の変化の相関を表します。
      4. x方向とy方向の両方の二乗勾配の和を計算し、各方向の変化の強度を反映します。勾配 Ix Iy の交差項は、x 方向と y 方向の相関を捉えています。
      5. コーナー応答関数:自己相関行列の行列式とトレースに基づいてコーナー応答関数Rを計算し、画像中のコーナーポイントを検出します。各ピクセルの応答値を計算し、 図2に示すように応答値の高い点を最終コーナーとして選びます。コーナー応答関数は次のように与えられます:
        det(M) = A ⋅ B - C2 (11)
        trace(M) = A + B (12)
        R = det(M) - k ⋅ (trace(M))2 (13)
        ここでdet(M)はMの行列式で、局所的特徴領域の全体的な変化を反映し、trace(M)は行列のトレースで、領域内の総勾配強度を反映します。経験定数kは通常0.04から0.06の範囲に設定されます。
        注:実験に基づき、kの選択が結果に大きな影響を与えることがわかりました:
        k=0.04のとき、応答値が高すぎて誤検出されたコーナーポイントが過剰に増加します。
        k=0.05の場合、応答値はよりバランスが取れ、真の角を正確に検出します。
        k=0.06の場合、応答値が低すぎてコーナーポイントの検出が難しくなります。
    3. ハリスコーナーポイント検出結果を用いてEBikeの局所領域を粗粒度分割します。 図4Cに示されるように、幾何学的構造と角点分布に基づいてEBikeを領域に分割することで、複雑な遮蔽シナリオでのモデルの堅牢性と検出性能を向上させます。
    4. ホイール面積:円形に沿って対称的に分布し、対称性スコアが少なくとも0.85である領域が有効とみなします。対称性スコアは式11に示されています。車輪の幅と高さの比率はおよそ1:1で、車輪の幾何学的特性を正確に反映するようにします。
    5. 前方領域:対称性スコアが0.80以上で、幅と高さの比率が1.2:1から1.5:1の間にある領域を含めると、前方エリアが期待される構造的特徴に対応していることを確認してください。
    6. 後方面積:少なくとも12個の角点を含む領域を含み、対称性スコアが0.75以上、幅高比が1.5:1から2:1の範囲であれば、後方領域が期待される幾何学的特性に適合するようにしてください。
  7. バウンディングボックスを用いた臨界EBike領域の表現
    1. 角点を長方形の境界ボックスに変換するには、DBSCANクラスタリングアルゴリズムを使用します。この方法は、近接する角点をクラスタにまとめ、領域を形成する角点がグループ化されることを保証します。クラスタ内の点間の最大距離を30ピクセルに設定します。
    2. 各角点の集まりについて、最小および最大xおよびy座標を決定します。これらの座標はバウンディングボックスの辺を表します。
    3. バウンディングボックスの周りに10ピクセルの余白を設けて、関連する特徴がすべて含まれるようにします。このマージンは、コーナーポイント検出における潜在的なずれやピクセルの不正確さを補正します。
    4. バウンディングボックスの座標を最も近い整数に丸めて、画像処理のための適切なピクセルアライメントを確保します。
    5. i番目の成分(例:車輪、前方領域、後方領域)の最終バウンディングボックス座標を以下に示します。
      1. 定義された領域(ホイールエリア、フロントエリア、リアエリア)を組み合わせ、EBikeのすべての重要な領域を長方形のバウンディングボックスで表現します。
      2. i成分のバウンディングボックス座標(例:車輪、前方領域、後方領域)を次のように定義します。
        figure-protocol-8(14)
        ここで Bi は第 i 番目の成分の境界ボックスを表し、 figure-protocol-9figure-protocol-10 はそれぞれ左上と右下の座標を表します。
  8. 部分閉塞の扱い
    1. 各領域のコーナー対称性スコアを評価します。対称性スコアが0.7以上であれば領域を受け入れます。
    2. 遮蔽処理では、角点の可視性を測定します。コーナーの少なくとも50%が見える領域を受け入れます。角の30%〜50%が見える場合は、そのエリアにフラグを立ててさらに確認してください。コーナーの30%未満が見える場合は、正確な検出に十分な視界がないため、その領域を除外してください。
  9. 局所的特徴領域の正確性判断
    1. 各局所特徴領域の精度を、対称性指標S、輪郭連続性指標C、接続構造指標Lの3つの定量的運用指標を用いて評価します。これらの指標を車輪面積、前方領域、後部領域に均一に適用します。
    2. すべての指標があらかじめ定められた閾値を満たした場合にのみ、リージョンを受け入れます。ある指標が許容範囲内であれば、ROIを拡大して再評価しましょう。2つ以上の指標が失敗した場合は、その地域を信頼性に欠けるとマークしてください。
  10. ホイール領域特徴精度解析
    1. 正面からの作戦検問所
      1. 対称性計量を計算します:
        figure-protocol-11(15)
        ここでnLとnRは左側と右側の角のカウントを表します。
      2. Sが0.85≥なら地域を受け入れます。 図5Aに示すように、車輪は対称性のある円形を示し、周囲のハリス角点は対称なパターンを形成しています。ですので、ホイール全体に注釈をつけてください。
      3. 0.70≤S<0.85の場合は、ROlを10〜20ピクセル拡大し、より多くの実際の特徴量が計算領域に再入るまで評価を繰り返し、再評価します。 図5Dに示すように、車輪の部分的な閉塞が生じるため、評価のためにEbikeのより多くの特徴を捉えるためにトリミング範囲を拡大する必要があります。
      4. S<0.70の場合は、その領域を信頼できないとラベル付けします。 図5Gに示すように、円形は乱れています。この領域を注釈から除外します。
    2. 側面図 作戦チェックポイント
      1. 以下を用いて等高線の連続性を測定します:
        figure-protocol-12 (16)
      2. Cが0.75≥時を受け入れます。 図5Bに示すように、実際の連続弧長と期待される弧長の比率は要件を満たし、輪郭線はエッジに完全に適合し、明らかな断線も見られません。
      3. 0.55≤C<0.75の場合は、輪郭抽出を細かくして再度確認してください。 図5Eに示すように、連続弧長と期待弧長の電流比は臨界域にあります。抽出アルゴリズムの閾値を調整することで、輪郭をより完全にする必要があります。
      4. Cが0.55<場合、幾何学的連続性が不十分であるため、その領域を却下します。 図5Hに示すように、解析要件は満たせません。
    3. 上図の運用チェックポイント
      1. 構造結合性を評価するには:
        figure-protocol-13 (17)
      2. Lが0.70≥で受け入れます。 図5Cに示すように、観測距離と期待距離の偏差は効果的にオフセットされ、構造的接続性は要件を満たし、車両とエレベーター環境間の相対位置接続は完了しています。
      3. Lが0.70<ならROIを拡大し、再評価します。 図5Fに示されているように、観測距離と期待距離の現在の偏差は比較的大きいです。解析範囲を拡大し、周囲の構造物を増やして連結性評価の精度を向上させる必要があります。
      4. 接続性が不安定なままであれば、その地域を信頼性の低いと分類します。 図5Iに示されているように、有効な解析領域としては使用できません。
  11. 前方面積の特徴精度解析
    1. EBike前方領域の特徴精度評価には、セクション2.10で定義された統一ルールベースフレームワークに従い、式15で定義された指標Sを用いた正面ビューでの対称性評価、式16で定義された指標Cを用いた側面ビューでの等高線連続性評価、式17で定義されたメトリックLを用いた上部ビューでの構造結合性検証が含まれます。
    2. 幾何学的な変動や前方の部分的な閉塞の頻繁なため、車輪領域と比べて適度に緩やかな閾値を採用してください。前線領域領域は、S ≥ 0.80、C ≥ 0.70、L ≥ 0.65 の時点で受け入れられます。図6A-C示されているように、これらの基準を満たす領域は左右の特徴分布のバランス、輪郭線、安定した構造的結合性を示します。
    3. もしどの指標もセクション2.10で指定された中間範囲に収まる場合は、関心領域を拡大し、図6D-Fに示されるように追加の文脈的特徴を取り入れるために再評価します。再評価後に最低基準を満たさない領域は、図6G-Iに示されるように信頼性が低い領域に分類されます。
  12. 後方面積特徴精度解析
    1. 後方面積の特徴精度解析については、セクション2.10で定義された評価プロトコルに従い、前方、側面、上部ビューでそれぞれ式15のS、式16のC、式17のLを用います。
    2. 後部は乗客、運搬物、エレベーター構造による閉塞により影響を受けやすいです。したがって、信頼性の低い注釈を避けるために、より厳格なリジェクション条件を適用してください。後部領域は、S ≥ 0.75、C ≥ 0.70、L ≥ 0.65 の時に受け入れられます。十分な対称性、輪郭連続性、連結性を持つ代表的な受け入れケースは図7A-Cに示されています。
    3. 指標値が境界線上にある地域については、図7D-Fに示されるようにROI拡大と再評価を行います。幾何学的な関係が曖昧なままであったり、計量が受け入れ基準を満たさない場合は、図7G-Iに示すように領域を信頼性に欠けるとマークしてください
  13. 後方面積特徴精度解析
    1. 後方面積特徴精度解析については、セクション2.10で定義された評価プロトコルに従い、式15で定義されたS、式16で定義されたC、式17で定義されたLをそれぞれの視点で用いてください。
    2. 前方と比べて、後方は乗客、運搬物、エレベーター内部構造による閉塞に弱いです。したがって、信頼性の低い注釈を防ぐために、やや厳格な拒否基準を適用してください。後部領域は、S ≥ 0.75、C ≥ 0.70、L ≥ 0.65 の時に受け入れられます。図7A-Cに示されているように、受け入れられた領域は十分な対称性、等高線の整合性、構造的結合性を保持しています。
    3. 指標値が境界にある地域については、図7D-F示すように、セクション2.10に従ってROIを拡大し再評価してください。再評価後に幾何学的一貫性が不十分であれば、図7G-Iに示すように領域を信頼性が低いとマークします。
  14. パイプラインの実装
    1. ファイルおよびフォルダ構造:実装は検出、局所特徴抽出、注釈判断を分離するモジュール式ディレクトリ構造に従っています。以下に示す代表的なフォルダー構成をご覧ください。中間結果はすべて専用のサブフォルダに保存し、各処理ステップを独立して確認できるようにします。
      project_root/

      ├── データ/
      │ ├── 画像/
      │ │ ├── 電車/
      │ │ ├── val/
      │ │ └── テスト/
      │ └── 注釈/

      ├── 探知/
      │ ├── detect_ebike.py
      │ └── yolov10_config.yaml

      ├── ROI/
      │ ├── crop_roi.py
      │ └── cropped_images/

      ├── ハリス/
      │ ├── harris_corner.py
      │ └── corner_visualization/

      ├── chunk_annotation/
      │ ├── region_partition.py
      │ ├── validity_judgment.py
      │ └── final_annotations/

      └── configs/
      └── thresholds.yaml
    2. 実行パイプラインとコマンドライン例
      1. EBike検出とROIの位置化:事前学習済みのオブジェクト検出モデルを用いてEBike領域をローカライズします。検出結果はバウンディングボックス座標として格納します。
        Python検出/detect_ebike.py \
        --入力データ/画像/テスト/ \
        --出力ROI/detections.json
      2. ROIクロップ:検出されたバウンディングボックスを使って、元の画像からEBike領域をトリミングします。
        Python ROI/crop_roi.py \
        --検出率/detections.json \
        --画像データ/画像/テスト/ \
        --ROI/cropped_images/
        各トリミング画像は命名形式で保存します:imageID_roi_xmin_ymin_xmax_ymax.jpg
      3. ハリスコーナー抽出:グレースケール変換後に各トリミングされたROIにハリスコーナー検出を適用します。コーナー応答マップや視覚的オーバーレイを保存して確認してください。
        パイソン・ハリス/harris_corner.py \
        --投資ROI/cropped_images/ \
        --出力ハリス/corner_visualization/ \
        --config configs/thresholds.yaml
      4. 粗粒度の分割とチャンク注釈:コーナーポイントの空間分布に基づいて、ローカル特徴領域をホイール、フロントエリア、リアエリアに分割します。幾何学的および特徴に基づく基準を用いて妥当性判断を適用します。
        Python chunk_annotation/region_partition.py \
        --コーナーズ ハリス/corner_visualization/ \
        --出力chunk_annotation/final_annotations/
    3. 予想される中間出力と視覚的チェックポイント:各処理段階で生成される中間出力は視覚的チェックポイントとして保存します。これらの中間出力により、ROIのローカライゼーション、コーナー抽出の品質、リージョンの分割、最終的な注釈決定の段階的な検証が可能になります。
      1. ROIクロップ出力:トリミングしたEBike画像をroi/cropped_images/で保存します。各画像は元のフレームから抽出された単一のEBike領域を含みます。
      2. ハリスコーナーの可視化:ハリス/corner_visualization/でコーナーオーバーレイを保存してください。有効な車輪領域では、円形リム構造に沿って密集した角点の集合が観測できます。この段階でコーナー応答が不十分な領域を識別できます。
      3. 地域分割結果:分割された領域(ホイール、フロントエリア、リアエリア)を独立して可視化します。あらかじめ定められた妥当性基準(例:十分な角密度や幾何学的整合性)を満たす領域のみを保持します。
      4. 最終注釈出力:chunk_annotation/final_annotations/に受け入れられた領域を構造化注釈ファイルとして保存します。妥当性判断に失敗した領域は除外し、それらを次の段階に進まないようにします。
        注:コーナー検出および領域妥当性判断に使用されるすべての閾値は設定ファイルに集中管理されています。パイプラインは時間依存なしの単一フレーム入力で動作し、各画像ごとに結果を独立して再現できます。同一の入力画像、設定ファイル、実行順序が与えられた場合、生成される中間出力および最終注釈は決定論的なままです。
  15. 最終決定のステップとデータセットの公開
    注:プロトコルが明確かつ再現可能な終了点で終了することを確実にするため、注釈保存、品質検証、データセットパッケージング、バージョンドキュメントを統合する最終段階が定義されています。
    1. 最終注釈保存:地域妥当性判断後、YOLOテキスト形式でchunk_annotation/final_annotations/にすべての受理注釈を保存し、各画像に対応する注釈ファイルを1つ付けます。最終注釈セットであらかじめ定義された幾何学的および特徴量ベースの基準を満たす領域のみを保持し、拒否されたまたは信頼性の低い領域は今後の使用から除外します。
    2. 注釈品質の検証:領域評価時に使用した対称性、等高線連続性、構造結合性指標などの有効性基準を再適用して最終注釈品質を検証します。この検証段階でこれらの基準を満たさない注釈を削除し、注釈生成と品質管理の整合性を確保します。
    3. データセットパッケージング:検証後、画像と注釈を定義されたデータセットパーティションに基づき固定の訓練、検証、テスト分割に整理します。この段階でディレクトリ構造とファイルリストは凍結され、パッケージ化されたデータセットはそれ以上の修正なしでトレーニングと評価のために準備されます。
    4. バージョンおよびシードドキュメント:コーナー検出パラメータや地域妥当性閾値を含む構成ファイルは、パッケージされたデータセットとともに保存されます。データ分割、アルゴリズムの修正、記録にはランダムシードを使いましょう。さらに、モデルの重み、設定ファイル、注釈ツールのバージョンも文書化してください。同一の入力データ、設定ファイル、記録されたシードが与えられた場合でも、最終的な注釈やデータセットの分割は決定論的なままです。

3. データ拡張

注:以前の研究では、十分な前処理やデータ拡張が欠けたトレーニングデータセットは、モデルのパフォーマンス低下を引き起こすことが多いことが示されています。これらの課題に対処するため、以下の手順が踏まれました。

  1. 照明
    1. 頻繁に照明が変わる場合、明るさ係数を0.6〜1.4の範囲で0.8の確率で調整して、エレベーター内の照明変動をシミュレートします。
    2. 明るい環境から薄暗い環境への移行に光の強度調整を加え、EBikeの動きによるぼやけをシミュレートします。この演算には確率0.7を用います。
    3. 照明条件を調整して増強サンプルを生成し、異なる照明レベルで安定した視界を確保します。
    4. これらの照明操作はオフラインで適用し、後処理のために保存してください。増強プロセスの再現性を確保するためにランダムシードを42に設定します。
  2. 閉塞
    1. 混雑したエレベーターの状態を反映した合成閉塞シナリオを作成します。オクルージョンマスク(例:人間のシルエット、オブジェクトブロック)を0.6の確率で適用します。
    2. エレベーターの出入り時にEBikesの部分的な閉塞を模倣するためにモザイク遮蔽を適用します。30%、50%、70%の閉鎖率を使い、画像の任意の象限(上下、左、右)にランダムに閉塞が適用されるようにしてください。
    3. 遮蔽されたサンプルを取り入れ、部分的に視認された環境下でも検出の堅牢性と安定性を高め、少なくとも1つの主要コンポーネント(例:車輪、前方、後方)が可視化されるようにします。
    4. オクルージョン増強をオフラインで行い、サンプルを検証して重要なEBikeの特徴が保持されていることを確認します。再現性のためにランダムシードを42に設定してください。
  3. 視点
    1. 事前に定められた±15°の範囲内で視角を調整し、異なるエレベーター環境での多様なカメラアングルをシミュレートできます。この演算は確率0.7で適用されるべきです。
    2. 歪み係数が0.0から0.2の間で異なるカメラ配置(例:高位置、横視点、斜め視点)を再現するために、透視変換を適用します。
    3. EBike領域を0.8〜1.2倍スケール・シフトして、カメラとターゲットの距離変化をシミュレートします。この変換を0.8の確率で適用します。
    4. すべての視点変換がEBikeの幾何学的整合性を保持し、重要な特徴が歪んでいないことを確認しましょう。
    5. オフラインで視点変換を行い、拡張画像を保存します。再現性のためにランダムシードを42に設定してください。
  4. 強化
    1. 画像の30%に0.3の確率でグレースケーリングをかけ、輝度による変動を導入し、低照度条件下でのモデルの堅牢性を高めます。
    2. サンプルの20%にヒストグラムイコライゼーションを用いて、厳しい照明条件下でEBikeの主要機能のコントラストと可視性を高めます。
    3. ライティング、オクルージョン、視点増強の戦略を順次組み合わせて高多様性サンプルを生成します。この多段階のプロセスには確率0.9を用いましょう。
    4. 拡張サンプルを最終データセットに統合する前に、EBikeの構造的完全性が維持されているか確認してください。
    5. 補正作業はオフラインで行い、画像を保存して後回の訓練使用に備えます。拡張プロセス全体の再現性を確保するためにランダムシードを42に設定してください。

4. 実験環境

  1. モデルの訓練およびテスト中に計算効率と安定性を確保するために実験環境を構成します。
  2. 最新のマルチコアプロセッサ、ディープラーニングアクセラレーション用の専用GPU、十分なメモリ、そして大規模なEBike画像データ処理をサポートする安定したストレージシステムを使用してください。
  3. ディープラーニングフレームワーク、GPUドライバー、アクセラレーションライブラリの互換性バージョンをインストールし、ソフトウェア環境とハードウェア構成をマッチさせ、訓練速度と推論性能を最適化します。
  4. 詳細なハードウェア仕様、ソフトウェア環境、モデル依存関係、イメージング機器の設定については、 表5、表6、表7、表8 を参照し、再現性を確保してください。
  5. 計算オーバーヘッドおよび実行時解析
    1. チャンク注釈戦略に伴う計算オーバーヘッドを注釈の複雑さと実行効率の観点から分析してください。ホリスティック注釈と比較し、チャンク注釈は車輪領域、前方領域、後部領域などの部分レベル領域を用いたEBikeを表します。これらの領域は、見えていて、あらかじめ定義された幾何学的および特徴に基づく妥当性基準を満たす場合にのみ注釈を付け、すべてのインスタンスに強制するのではなく。
      注:注釈の観点から見ると、ラベル数の増加は依然として限定的で構造的に制約されています。EBikeインスタンスは最大で3つのパーツレベルの注釈を寄与しますが、部分的な遮蔽(例えば前方領域のみが見える場合)では注釈が付けられる領域が少なくなります。その結果、画像あたりのラベル数はシーンの可視性や遮蔽条件によって異なり、平均ラベル数は表 9にまとめられたようにやや増加します。この設計は局所的な特徴表現と注釈の複雑さのバランスを取っています。推論の観点から見ると、チャンク注釈は後処理コストに比例した増加をもたらすわけではありません。パートレベルの検出は追加の候補バウンディングボックスを生成することがありますが、検出は最終評価のためにEBikeオブジェクトレベルで集約され、後処理前に信頼度に基づくフィルタリングが適用されます。この条件付きで可視性駆動の注釈戦略により、不要な検出候補が制限されます。YOLOv10のように従来の非最大抑制への依存を減らすモデルでは、チャンク化による追加オーバーヘッドは実際には限定的です。
    2. NVIDIA RTX 3090 GPUを用いて、典型的なエレベーター監視解像度(640×480ピクセル)での実行時性能を評価してください。 表9に示されているように、チャンク注釈はリアルタイムの推論能力を維持し、ホリスティック注釈と比べてフレーム数のわずかな削減のみです。これらの結果は、チャンク注釈戦略がエレベーター環境でのリアルタイムEBike監視に依然として適していることを示しています。

5. 評価指標

注:チャンク注釈はトレーニングや推論時に使用されますが、評価はeバイクのオブジェクトレベルで行われます。部分レベルの検知は、セクション2.4,3で定義されたルールに従い、単一のeバイクの判断に集約されます。

  1. ターゲット検出研究27 でよく用いられる標準的な評価指標を適用し、EBikeの遮蔽検出シナリオにおけるアルゴリズム性能を包括的に評価します。
  2. 検出精度(P)
    1. 式(8)を用いて検出精度を計算します。これは、予測されたすべての陽性サンプルの中で正しく特定されたEBikeの割合を測定します。
      figure-protocol-14 (18)
      ここでTPは真陽性、FPは偽陽性を示します。
    2. 予測されるバウンディングボックスがグラウンドトゥルースボックスと一致しているかどうかを判断するために、IoUの閾値を0.5に設定します。
    3. 非EBikeオブジェクトの誤識別による不必要なアラームを減らすモデルの能力を精密に評価します。
    4. この指標を生成するコマンド:関連する評価スクリプト(例:evaluate_precision.py)を使用します。結果はprecision_results.txtに保存して、さらなる分析に充ててください。
  3. リコール率(R)
    1. 式(9)を用いて、特に遮蔽が視認性に影響を与える場合に、モデルがエレベーター環境でどれだけ効果的にEBikesを識別できるかを判断します。
      figure-protocol-15(19)
      ここでFNは偽陰性を表します。
    2. 検出の精度を評価するためにIoUの閾値を0.5に設定します。リコールを用いて、モデルが検出漏れを最小限に抑える能力を評価し、部分的に遮られてもEBikesが正確に識別されるようにしましょう。
    3. コマンドを使ってこのメトリックを生成します:run evaluate_recall.py。セーブ結果はrecall_results.txt。
      注意:エレベーターの混雑状況では検知見逃しが非常に重要であり、安全のために最小限に抑える必要があります。見逃しは混雑したエレベーター内での安全上の懸念を引き起こし、最小限に抑える必要があります。
  4. F1スコア
    1. F1スコアを式(10)を用いて計算し、モデルの精度と記憶性能のバランスの取れた表現を得ます。
      figure-protocol-16(20)
    2. 特に、閉塞レベルが異なる場合に正確さと想起力にトレードオフが見られる状況では、F1スコアを活用して総合的な評価を行いましょう。
    3. コマンドを使って次の指標を生成します:evaluate_f1.pyを実行してF1スコアを計算してください。セーブ結果はf1_score_results.txt。
  5. 平均精度(mAP)
    1. 式(11)を用いて、EBikeの外観、遮蔽条件、照明の変化におけるモデル全体の検出能力を測定します。
      figure-protocol-17 (21)
      ここでAPcカテゴリーc の平均精度、Cはカテゴリーの数を表します。
    2. モデルの異なるカテゴリー間のパフォーマンスを評価するために、IoUの閾値を0.5に設定してください。
    3. mAP@0.5を使って、モデルがエレベーター環境の多様な視覚条件にどれだけ適応するかを判断し、検出性能の包括的な評価を確保します。
    4. 以下のコマンドを使ってこのメトリクスを生成します:指定されたパラメータで実行evaluate_map.py。セーブ結果はmap_results.txt。

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

公開データセットにおけるホリスティック注釈とチャンク注釈の比較

評価は、多様な照明条件、EBikeの色、遮蔽度の異なる公開監視および交通監視シーンから収集された210枚のEBike画像からなる公開データセットで実施されました。各画像は、ホリスティック法(単一のバウンディングボックス)と提案されたチャンク法(EBikeを車輪、前方、後方に分割)の両方で注釈付けされました。

定量的な結果は 表1にまとめられています。YOLOv5では、ホリスティック注釈で精度0.81、リコール率0.74を記録し、F1スコアは0.77、mAP@0.5は0.78となりました。チャンク注釈で訓練したところ、YOLOv5は精度0.86、リコール率0.79に向上し、F1スコアは0.82、mAP@0.5は0.84となりました。これは、ホリスティック注釈と比較して精度が0.05、リコールが0.05、mAPが0.06の絶対的な向上...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

重要なステップ

このプロトコルの重要なステップは、局所的特徴に基づくチャンク注釈法であり、EBikeはホイール、フロント、リアの各エリアに分割されます。この区分により、検出モデルは細かな表現を学習でき、これは閉塞感の強いエレベーター環境で不可欠となりました。例えば、EBike-DETデータセットでチャンクアノテーションを用いて訓練したYOLOv5は、mAP@0.5を0.925から0.966に向上させ、堅牢な性能のために正確な局所特徴分分割の必要性を強調しました。さらに、ハリスコーナー検出段階は局所特徴抽出のための重要な前処理ステップです。経験定数(k=0.05)の選択は、角検出結果の最適化に特に重要であり、偏差(k=0.04またはk=0.06)は偽陽性を増加させたり特徴感度を低下させたりしました。

方法の改良とトラブルシューティング

手...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者たちには利益相反はありません。

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究は、中国教育部の2025年人文社会科学研究計画基金(助成金番号25YJAZH002)、2024年広東省重点学科研究能力強化プロジェクト(助成金番号2024ZDJS086)、広東省2024年学部生イノベーション起業家訓練プログラム(助成金番号S202413714017)、および教育部の雇用・教育連携プログラムの支援を受けました。 「人工知能技術志向のコンピュータ応用専攻者のための人材育成メカニズムの革新と実践」(助成金第2025072869464号)。

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
h5py(SSD)HDFグループ2.10.0
matplotlib(SSD)Matplotlibコミュニティ3.1.2
matplotlib (YOLOv10)Matplotlibコミュニティ3.9.0
matplot lib (YOLOv5)Matplotlibコミュニティ3.8.4
matplotlib (YOLOv5+SAHI)Matplotlibコミュニティ3.8.4
matplotlib (YOLOv8-Seg)Matplotlibコミュニティ3.9.0
numpy(SSD)NumPyコミュニティ1.17.0
numpy(YOLOv10)NumPyコミュニティ1.26.3
numpy(YOLOv5)NumPyコミュニティ1.26.4
numpy(YOLOv5+SAHI)NumPyコミュニティ1.26.4
numpy (YOLOv8-Seg)NumPyコミュニティ1.26.3
onnx (YOLOv10)ONNX1.14.0
onnx (YOLOv5)ONNX1.14.0
onnx (YOLOv5+SAHI)ONNX1.14.0
onnxruntime (YOLOv10)マイクロソフト1.15.1
onnxruntime (YOLOv5)マイクロソフト1.15.1
onnxruntime (YOLOv5+SAHI)マイクロソフト1.15.1
opencv-python(SSD)OpenCV4.1.2.30
opencv-python (YOLOv10)OpenCV4.9.0.80
opencv-python (YOLOv5)OpenCV4.9.0.80
opencv-python (YOLOv5+SAHI)OpenCV4.9.0.80
opencv-python (YOLOv8-Seg)OpenCV4.9.0.80
パンダ(YOLOv10)パンダス・コミュニティ2.2.2
パンダ(YOLOv5)パンダス・コミュニティ2.2.2
パンダス(YOLOv5+SAHI)パンダス・コミュニティ2.2.2
pandas(YOLOv8-Seg)パンダス・コミュニティ2.2.2
ピロー(SSD)枕の開発者8.2.0
枕(YOLOv10)枕の開発者10.2.0
枕(YOLOv5)枕の開発者8.5.0
枕(YOLOv5+SAHI)枕の開発者8.5.0
枕(YOLOv8-Seg)枕の開発者10.2.0
psutil (YOLOv10)Psutil 開発者5.9.8
psutil (YOLOv5)Psutil 開発者5.9.8
psutil (YOLOv5+SAHI)Psutil 開発者5.9.8
pycocotools (YOLOv10)COCOコンソーシアム2.0.7
pycocotools (YOLOv5)COCOコンソーシアム2.0.7
pycocotools (YOLOv5+SAHI)COCOコンソーシアム2.0.7
pycocotools (YOLOv8-Seg)COCOコンソーシアム2.0.7
py-cpuinfo (YOLOv10)Py-CPUInfo 開発者9.0.0
py-cpuinfo (YOLOv5)Py-CPUInfo 開発者9.0.0
py-cpuinfo (YOLOv5+SAHI)Py-CPUInfo 開発者9.0.0
PyYAML (YOLOv10)PyYAMLです6.0.1
PyYAML (YOLOv5)PyYAMLです6.0.1
PyYAML (YOLOv5+SAHI)PyYAMLです6.0.1
PyYAML (YOLOv8-Seg)PyYAMLです6.0.1
リクエスト(SSD)Pythonリクエスト2.27.1
リクエスト(YOLOv10)Pythonリクエスト2.32.3
リクエスト(YOLOv5)Pythonリクエスト2.31.0
リクエスト(YOLOv5+SAHI)Pythonリクエスト2.31.0
サヒSAHI開発者0.3.4+
Scipy(SSD)サイピー・コミュニティ1.2.1
スキピー(YOLOv10)サイピー・コミュニティ1.13.0
スキピー(YOLOv5)サイピー・コミュニティ1.13.0
スキピー(YOLOv5+SAHI)サイピー・コミュニティ1.13.0
スキピー(YOLOv8-Seg)サイピー・コミュニティ1.13.0
シーボーン(YOLOv10)シーボーン・デベロッパーズ0.13.2
シーボーン(YOLOv5)シーボーン・デベロッパーズ0.13.2
シーボーン(YOLOv5+SAHI)シーボーン・デベロッパーズ0.13.2
シーボーン(YOLOv8-Seg)シーボーン・デベロッパーズ0.13.2
魅力的な(YOLOv5+SAHI)シェイプリー・デベロッパーズ2.0.4
SSDCaffe/オリジナルSSD著者Python 3.6.13+;PyTorch 1.2.0+;CUDA 10.0;CUDNN 7.4.1
テンソルボード(SSD)グーグル2.10.1
テンソルボード(YOLOv5)グーグル2.16.2
テンソルボード(YOLOv5+SAHI)グーグル2.16.2
トーチビジョン(SSD)パイトーチ0.4.0
トーチビジョン(YOLOv10)パイトーチ0.15.2
トーチビジョン(YOLOv5)パイトーチ0.17.2
トーチビジョン(YOLOv5+SAHI)パイトーチ0.17.2
トーチビジョン(YOLOv8-Seg)パイトーチ0.16.1+
tqdm(SSD)TQDM開発者4.60.0
tqdm (YOLOv10)TQDM開発者4.66.4
tqdm (YOLOv5)TQDM開発者4.66.2
tqdm (YOLOv5+SAHI)TQDM開発者4.66.2
ウルトラリティクス(YOLOv8-Seg)ウルトラリティクス8.2.99+
YOLOv10YOLOv10チームPython 3.8.0+;PyTorch 2.0.1+cu118;CUDA 11.8;CUDNN 8.7
YOLOv5ウルトラリティクスPython 3.8.0+;PyTorch 2.2.2+;CUDA 11.2;CUDNN 8.1.2
YOLOv5 + サヒウルトラライティクス+SAHI開発者Python 3.8.0+;PyTorch 2.2.2+;CUDA 11.2;CUDNN 8.1.2
YOLOv8-SegウルトラリティクスPython 3.8.0+;PyTorch 2.0.1+cu118;CUDA 11.8;CUDNN 8.6.0+

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Li, Y., Han, L., Ning, X., Xu, Y. Fire risk of electric bicycle based on fuzzy Bayesian network. J Phys Conf Ser. 1578 (1), 012153-012160 (2020).
  2. Cao, F., Sheng, G., Feng, Y. Detection dataset of electric bicycles for lift control. Alexandria Eng J. 105 (1), 736-742 (2024).
  3. Zhang, J., Mohd Yunos, Z., Haron, H. Interactivity recognition graph neural network model for improving human-object interaction detection. Electronics. 12 (2), 470-482 (2023).
  4. Yang, D., Su, C., Wu, H., Xu, X., Zhao, X. Shelter identification for shelter-transporting AGV based on improved YOLOv5. IEEE Access. 10 (1), 119132-119139 (2022).
  5. Wang, X., et al. LDS-YOLO: A lightweight small object detection method for dead trees. Comp Electron Agri. 198 (1), 107035-107044 (2022).
  6. Xu, R., Zhu, D., Chen, M. A novel underwater object detection enhanced algorithm based on YOLOv5-MH. IET Image Process. 18 (10), 3415-3429 (2024).
  7. Shang, J., Wang, J., Liu, S., Wang, C., Zheng, B. Small target detection algorithm for UAV aerial photography based on improved YOLOv5s. Electronics. 12 (11), 2434-2446 (2023).
  8. Wang, C. Y., Liao, H. Y. M. YOLOv1 to YOLOv10: The fastest and most accurate real-time object detection systems. APSIPA Trans Signal Inf Process. 13 (1), 1-18 (2024).
  9. Sapkota, R., et al. YOLO11 to its genesis: A decadal and comprehensive review of the YOLO series. Artif Intell Rev. 58 (2), 145-182 (2025).
  10. Huang, Z., Yin, Z., Ma, Y., Fan, C., Chai, A. Mobile phone component object detection based on improved SSD. Procedia Comp Sci. 183 (1), 107-114 (2021).
  11. Li, Y., Yang, F., Li, Y., Tan, C., Liu, Z. Circuit breaker identification based on SSD. J Phys Conf Ser. 2418 (1), 012080-012088 (2023).
  12. Deng, X., Li, S. Improved SSD object detection based on attention mechanism and feature fusion. J Phys Conf Ser. 2450 (1), 012088-012096 (2023).
  13. Huo, B., Li, C., Zhang, J., Xue, Y., Lin, Z. SAFF-SSD: Self-attention combined feature fusion SSD for small object detection. Remote Sens. 15 (12), 3027-3041 (2023).
  14. Murphy, K., Torralba, A., Eaton, D., Freeman, W. Object detection and localization using local and global features. Lect Notes Comp Sci. 4170 (1), 382-400 (2006).
  15. Mamat, N., Othman, M. F., Abdulghafor, R., Alwan, A. A., Gulzar, Y. Enhancing image annotation technique for fruit classification using deep learning. Sustainability. 15 (2), 901-915 (2023).
  16. Zhang, T., Jia, K., Xu, C., Ma, Y., Ahuja, N. Partial occlusion handling via robust part matching. Proc IEEE CVPR. 2014 (1), 1258-1265 (2014).
  17. Howard, A. G. Improvements on deep convolutional neural network based image classification. Tech Rep. 1 (1), 1-12 (2013).
  18. Zhang, H. Mixup: Beyond empirical risk minimization. arXiv. , (2017).
  19. Krizhevsky, A., Sutskever, I., Hinton, G. E. ImageNet classification with deep convolutional neural networks. Commun ACM. 60 (6), 84-90 (2017).
  20. Qin, J., Xu, N. Social distancing monitoring based on SSD. Procedia Comp Sci. 183 (1), 768-775 (2021).
  21. Zhong, P., Liu, Y., Zheng, H., Zhao, J. Detection of urban flood inundation using traffic images. Water Resour Manag. 38 (2), 287-301 (2024).
  22. Aamir, S. M., Ma, H., Khan, M. A. A., Aaqib, M. Real-time object detection in occluded environments with background clutter. Multimed Tools Appl. 83 (4), 11245-11261 (2024).
  23. Jia, K., Niu, Q., Wang, L., Niu, Y., Ma, W. Multi-object detection and size calculation for blended tobacco shreds. Sensors. 23 (18), 8380-8395 (2023).
  24. Sun, S., et al. Multi-YOLOv8 for infrared moving small object detection. Neurocomputing. 588 (1), 127685-127696 (2024).
  25. Sadik, M. N., Hossain, T., Sayeed, F. Real-time detection and analysis of vehicles and pedestrians using deep learning. Int J Comp Vis Robot. 14 (3), 215-229 (2024).
  26. Zhang, C., Jiao, P. YOLO series target detection algorithms for underwater environments. Ocean Eng. 279 (1), 114353-114366 (2023).
  27. Luo, B., Xiong, J., Xu, L., Pei, Z. Superpixel segmentation based on global similarity and contour region transform. IEICE Transac Info Sys. E103D (3), 716-719 (2020).
  28. Hosain, M. T., Jim, J. R., Mridha, M. F., Kabir, M. M. Explainable AI approaches in deep learning: Advancements, applications and challenges. Comp Electr Eng. 117 (1), 109246-109268 (2024).
  29. Khurshid, S., Basharat, S., Afzal, S. The magic of artificial intelligence-2. Artif Intell Hum Health Dis. 1 (1), 29-46 (2025).
  30. Pan, W., Chen, J., Lv, B., Peng, L. Improved YOLOv9s-UI for underwater object detection. Appl Sci. 14 (14), 7162-7175 (2024).
  31. Zhang, J., Yunos, Z. M., Haron, H. Parallel multi-head graph attention network for human-object interaction detection. IEEE Access. 11 (1), 131708-131725 (2023).
  32. Li, L., Gao, S., Wu, F., An, X. MBAN: Multi-branch attention network for small object detection. PeerJ Comp Sci. 10 (1), e1965-e1980 (2024).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Chunked Image AnnotationLocal Feature DetectionElectric Bike DetectionElevator Object DetectionOcclusion RobustnessEBike DET DatasetExplainable AIStructural AnnotationYOLOv5 DetectionSafety Monitoring
Video Coming Soon

Related Articles