EBike-DETデータセットと主流の物体検出モデルを用いて、複雑なエレベーターシナリオにおける電動自転車検出を改善するために、局所的特徴に基づくチャンク画像注釈法を提示します。
Method Article
EBike-DETデータセットと主流の物体検出モデルを用いて、複雑なエレベーターシナリオにおける電動自転車検出を改善するために、局所的特徴に基づくチャンク画像注釈法を提示します。
住宅用エレベーターなどの閉鎖環境での電動自転車(EBikes)の使用増加は、深刻な安全上の懸念を引き起こし、特に頻繁な遮蔽物の発生により自動物体検出に大きな課題をもたらしています。主に全体的な注釈に依存する従来の検出手法は、視覚的に複雑なシーンで部分的に遮蔽されたEBikeを正確に認識できないことが多いです。これらの制約を克服するため、本研究は局所的特徴に基づく新しいチャンク注釈法を提案し、より解釈しやすい注釈戦略を提供します。EBikeを複数のキー領域に分解して独立したラベリングを行うことで、検出モデルは細かい構造情報を学習でき、閉塞が多い条件下での堅牢性を向上させます。さらに、現実的なエレベーターシナリオでの検出タスクを支援する専用データセット「EBike-DET」も開発されています。チャンク方式で注釈を付け、環境条件をシミュレーションしたもので補強することで、モデルのパフォーマンスと適応性の両方を向上させます。提案された手法は、物体検出をより透明かつ構造的に解釈可能にすることで、説明可能な人工知能(XAI)の開発を促進し、特に安全性が重要な応用において価値があります。3つの主流モデル(YOLOv5、YOLOv10、SSD)を用いて広範な実験が行われています。結果によると、ELOv5はチャンク注釈付きでEBike-DET上で訓練した場合、精度が3.7%、リコール率5.3%、F1スコアで4.5%、mAPが4.4%の向上を達成しました。公開データセットと比較して、EBike-DETは閉塞下での安定性と堅牢性がより高まります。この研究は検知精度の向上に寄与するだけでなく、実際の安全監視システムへの展開に向けたより解釈しやすく説明可能なAIソリューションへの一歩を示しています。
特に中国では、電動自転車(EBikes)が世界中で急速に普及し、2022年までに総台数が3億5千万台を超えたことで、EBikesは短距離輸送の主要な手段となっています。しかし、住宅用エレベーターのような狭い空間での頻繁な使用は、異常振動、機器の損傷、不快な臭い、火災の危険など深刻な安全リスクをもたらします。最近の研究では、EBikeに関連する火災事故の発生確率は約1.44%と推定されています1。これらのリスクは、エレベーター環境での安全性を高めるために効率的かつ正確なEBike検出方法の緊急性を浮き彫りにしています。
コンピュータビジョンやディープラーニングの進歩にもかかわらず、エレベーターでのEBike検出は依然として困難です。公開されているデータセットは希少で、EBikeモデル、色、閉塞条件の多様性に欠けていることが多いため、モデルの一般化が制限されています。さらに、エレベーターのシナリオでは複雑な閉塞が頻繁に起こり、EBikeが乗客や構造部品によって部分的に隠れているため、検出精度はさらに低下します。3,4,5。EBikeを単一のバウンディングボックスとして扱う既存のホリスティック注釈手法は、このような条件下でしばしば失敗し、注釈と検出戦略の改善が必要であることを示しています。表1に示されているように、ホリスティック注釈は性能を著しく低下させ、チャンク注釈と比較して交差点(IoU)閾値で平均平均精度が最大21.5%低下し、0.5(mAP@0.5)に減少します。
ディープラーニングに基づく検出の進展
ディープラーニング手法、特に畳み込みニューラルネットワーク(CNN)は、物体検出に広く応用されています。You Only Look Once(YOLO)ファミリーは強力なリアルタイムパフォーマンスを示しています。しかし、遮蔽された物体や重なり合う物体を検出すると、YOLOモデルは冗長なバウンディングボックスを生成する傾向があります。例えば、YOLOv5は深部畳み込みおよび特徴ピラミッドネットワーク6,7を通じてマルチスケール特徴抽出を強化し、YOLOv10は非最大抑制を排除し、パスアグリゲーションネットワークを用いて速度向上とマルチスケール融合を実現します8,9。これらの改善にもかかわらず、冗長なバウンディングボックスや閉塞感の強い環境での堅牢性の低下は未解決の問題です。しかし、主要なEBike構造が部分的に遮断されると、ホリスティック注釈は局所的な手がかりが限られているため、両者とも不利になります。 図1A-Cに示すように、この制限は冗長なバウンディングボックスや中程度または重度の閉塞時の検出信頼度の不安定さを引き起こします。これに対し、チャンク注釈は車輪や後部領域などの別領域をモデルが検出できるため、遮蔽下での冗長なバウンディングボックスを減らすことでこの問題を緩和します。 図1D-Fはさらに、チャンク注釈が特徴の局在化を改善し、部分的なEBike成分のみが見える場合の検出安定性を維持することを示しています。
同様に、VGG-16バックボーンを基盤としたシングルショットマルチボックス検出器(SSD)モデル10,11はスケールを超えて効率的な検出を提供し、小型物体12でも良好な性能を発揮します。しかし、SSDは重度の遮蔽によって機能の連続性が壊れ、検出漏れや不安定なボックス回帰が生じる場合も苦戦します。注意機構が導入されても13です。チャンク注釈はここでも利点を提供します。モデルは残った可視的な局所部分に依存できるため、マルチスケールや遮蔽条件下での検出安定性が向上します。
注釈戦略と局所特徴学習
現在のほとんどの検出手法はホリスティック注釈を採用しており、注釈を簡素化しますが、主にグローバル特徴量に依存しています14,15。この方法は、ホイール、前部、後部などの重要なEBike領域が部分的に欠損している場合に苦労します。最近の研究16では、対象を複数の注釈付き部分に分割する局所特徴学習が、困難なシナリオにおいて堅牢性と精度を向上させることが示されました。これと一致して、表2の結果は、特にホイール、前面、後部の注釈を付ける際、主要なEBikeコンポーネントの少なくとも40%〜60%が可視化されている場合、チャンク注釈が有効であることを示しています。対照的に、ホリスティックバウンディングボックスは、低遮蔽状況(例:<20%の閉鎖)や画像解像度≥1280×720で、完全なシルエットが保持される場合には十分です。遮蔽が≈70%を超える場合や、特徴レベルの領域が判別できる空間情報を提供できないほど小さくなる場合、チャンク化の利点は減少します。
ハリスコーナー検出の使用方法論的根拠
ハリスコーナー検出は、その決定論的な挙動、計算効率、訓練不要の特性から局所特徴抽出に選ばれており、これらはエレベーター環境での信頼性の高い注釈に不可欠です。SuperPointやLoFTRのような学習型キーポイント検出器とは異なり、追加の訓練を避け、限られた注釈データや強い遮蔽下でドメインシフトを低減します。CannyやSobelのようなエッジベースの演算子と比較すると、ハリスコーナーはノイズの多い背景エッジではなく幾何学的に意味のある接合部を強調し、車輪やフレーム交差を含むEBike構造の安定した局在化を可能にします。さらに、ハリスコーナー検出は解釈可能なハイパーパラメータを提供します。経験的定数 k はコーナー感度と安定性を制御します。セクション2.6.2.4および 図2に示されているように、 k の調整は堅牢性と過剰検出の制御されたバランスを支持し、提案されたルールベースのチャンク注釈戦略とよく整合しています。
ロバスト性のためのデータ拡張
データ拡張は検出モデルの多様性と適応性を高める上で効果的であることが証明されています。一般的な技術には、幾何学的変換(例:回転、スケーリング、トリミング)や色調整(例:グレースケーリング、輝度調整)があり、これらは現実世界の状況や光の変化をシミュレートします。これらの戦略を取り入れることで、検出モデルは変動性に対してより強靭になり、実際の展開により適しています。
前述の制限に対処するため、本研究は局所的特徴に基づく改良されたチャンク注釈法を提案します。この手法は、EBikeを複数の独立した注釈付き部分に分割することで特徴学習と堅牢性を高め、複雑な遮蔽下での検出をより効果的に可能にします。さらに、エレベーター環境に特化した専用の電動自転車検出(EBike-DET)データセットを構築し、多様なデータ拡張によってモデルの適応性を高めています。最後に、YOLOv5、YOLOv10、SSDで検証され、 表3 にまとめられたように、+5.69%から+39.81%のmAPの一貫した性能向上が示されました。貢献は以下のようにまとめられます:閉塞条件下で特徴学習を強化する改良されたチャンク注釈法、エレベーターシナリオ向けの専門的なEBike-DETデータセットの構築、複数の増強技術の統合、そして主流の検出モデルに対する実験的検証(ホリスティック注釈と比較して精度と堅牢性の向上)。
Access restricted. Please log in or start a trial to view this content.
本研究で使用されたEBike-DETデータセットは、著者らがエレベーター、駐車場、街路環境で現地撮影を行って収集した画像と、ウェブベースのプラットフォームから取得した公開されているEBike画像で構成されています。すべての現地画像収集は、EBike検出に関する安全性関連の技術的研究のため、非私的環境で行われました。画像は意図的に個人を標的にするものではなく、偶発的に撮影された人物は距離、遮蔽、背面からの視点、または顔の特徴やその他の個人識別子を除去する適切な処理により特定できません。ウェブソースの画像は、学術研究の再利用を許可するプラットフォームやオープンライセンスの下で公開されたリソースからのみ取得されました。すべての画像は非営利の研究および教育目的のみに使用されます。特定可能な個人データは収集されておらず、被験者との直接的な接触もなかったため、本研究は著者の機関ガイドラインに従い機関倫理委員会の承認を必要としませんでした。
1. データセット構築
2. 局所特徴チャンク注釈
注:複雑なオクルージョンシナリオにおけるEBikes検出精度を高めるため、局所特徴の改善に基づくチャンク型注釈法を提案します。この方法はEBike領域の局所的特徴点を抽出してセグメント化し、対応する特徴領域の閉塞度に基づいて領域を注釈付けすべきかどうかを判断します。詳細な実験プロセスは 図3に示されています。
(2)
(3)
(4)
(5)
、
(9)
(10)
(14)
と
はそれぞれ左上と右下の座標を表します。
(15)
(16)
(17)3. データ拡張
注:以前の研究では、十分な前処理やデータ拡張が欠けたトレーニングデータセットは、モデルのパフォーマンス低下を引き起こすことが多いことが示されています。これらの課題に対処するため、以下の手順が踏まれました。
4. 実験環境
5. 評価指標
注:チャンク注釈はトレーニングや推論時に使用されますが、評価はeバイクのオブジェクトレベルで行われます。部分レベルの検知は、セクション2.4,3で定義されたルールに従い、単一のeバイクの判断に集約されます。
(18)
(19)
(20)
(21)Access restricted. Please log in or start a trial to view this content.
公開データセットにおけるホリスティック注釈とチャンク注釈の比較
評価は、多様な照明条件、EBikeの色、遮蔽度の異なる公開監視および交通監視シーンから収集された210枚のEBike画像からなる公開データセットで実施されました。各画像は、ホリスティック法(単一のバウンディングボックス)と提案されたチャンク法(EBikeを車輪、前方、後方に分割)の両方で注釈付けされました。
定量的な結果は 表1にまとめられています。YOLOv5では、ホリスティック注釈で精度0.81、リコール率0.74を記録し、F1スコアは0.77、mAP@0.5は0.78となりました。チャンク注釈で訓練したところ、YOLOv5は精度0.86、リコール率0.79に向上し、F1スコアは0.82、mAP@0.5は0.84となりました。これは、ホリスティック注釈と比較して精度が0.05、リコールが0.05、mAPが0.06の絶対的な向上...
Access restricted. Please log in or start a trial to view this content.
重要なステップ
このプロトコルの重要なステップは、局所的特徴に基づくチャンク注釈法であり、EBikeはホイール、フロント、リアの各エリアに分割されます。この区分により、検出モデルは細かな表現を学習でき、これは閉塞感の強いエレベーター環境で不可欠となりました。例えば、EBike-DETデータセットでチャンクアノテーションを用いて訓練したYOLOv5は、mAP@0.5を0.925から0.966に向上させ、堅牢な性能のために正確な局所特徴分分割の必要性を強調しました。さらに、ハリスコーナー検出段階は局所特徴抽出のための重要な前処理ステップです。経験定数(k=0.05)の選択は、角検出結果の最適化に特に重要であり、偏差(k=0.04またはk=0.06)は偽陽性を増加させたり特徴感度を低下させたりしました。
方法の改良とトラブルシューティング
手...
Access restricted. Please log in or start a trial to view this content.
著者たちには利益相反はありません。
本研究は、中国教育部の2025年人文社会科学研究計画基金(助成金番号25YJAZH002)、2024年広東省重点学科研究能力強化プロジェクト(助成金番号2024ZDJS086)、広東省2024年学部生イノベーション起業家訓練プログラム(助成金番号S202413714017)、および教育部の雇用・教育連携プログラムの支援を受けました。 「人工知能技術志向のコンピュータ応用専攻者のための人材育成メカニズムの革新と実践」(助成金第2025072869464号)。
Access restricted. Please log in or start a trial to view this content.
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| h5py(SSD) | HDFグループ | 2.10.0 | |
| matplotlib(SSD) | Matplotlibコミュニティ | 3.1.2 | |
| matplotlib (YOLOv10) | Matplotlibコミュニティ | 3.9.0 | |
| matplot lib (YOLOv5) | Matplotlibコミュニティ | 3.8.4 | |
| matplotlib (YOLOv5+SAHI) | Matplotlibコミュニティ | 3.8.4 | |
| matplotlib (YOLOv8-Seg) | Matplotlibコミュニティ | 3.9.0 | |
| numpy(SSD) | NumPyコミュニティ | 1.17.0 | |
| numpy(YOLOv10) | NumPyコミュニティ | 1.26.3 | |
| numpy(YOLOv5) | NumPyコミュニティ | 1.26.4 | |
| numpy(YOLOv5+SAHI) | NumPyコミュニティ | 1.26.4 | |
| numpy (YOLOv8-Seg) | NumPyコミュニティ | 1.26.3 | |
| onnx (YOLOv10) | ONNX | 1.14.0 | |
| onnx (YOLOv5) | ONNX | 1.14.0 | |
| onnx (YOLOv5+SAHI) | ONNX | 1.14.0 | |
| onnxruntime (YOLOv10) | マイクロソフト | 1.15.1 | |
| onnxruntime (YOLOv5) | マイクロソフト | 1.15.1 | |
| onnxruntime (YOLOv5+SAHI) | マイクロソフト | 1.15.1 | |
| opencv-python(SSD) | OpenCV | 4.1.2.30 | |
| opencv-python (YOLOv10) | OpenCV | 4.9.0.80 | |
| opencv-python (YOLOv5) | OpenCV | 4.9.0.80 | |
| opencv-python (YOLOv5+SAHI) | OpenCV | 4.9.0.80 | |
| opencv-python (YOLOv8-Seg) | OpenCV | 4.9.0.80 | |
| パンダ(YOLOv10) | パンダス・コミュニティ | 2.2.2 | |
| パンダ(YOLOv5) | パンダス・コミュニティ | 2.2.2 | |
| パンダス(YOLOv5+SAHI) | パンダス・コミュニティ | 2.2.2 | |
| pandas(YOLOv8-Seg) | パンダス・コミュニティ | 2.2.2 | |
| ピロー(SSD) | 枕の開発者 | 8.2.0 | |
| 枕(YOLOv10) | 枕の開発者 | 10.2.0 | |
| 枕(YOLOv5) | 枕の開発者 | 8.5.0 | |
| 枕(YOLOv5+SAHI) | 枕の開発者 | 8.5.0 | |
| 枕(YOLOv8-Seg) | 枕の開発者 | 10.2.0 | |
| psutil (YOLOv10) | Psutil 開発者 | 5.9.8 | |
| psutil (YOLOv5) | Psutil 開発者 | 5.9.8 | |
| psutil (YOLOv5+SAHI) | Psutil 開発者 | 5.9.8 | |
| pycocotools (YOLOv10) | COCOコンソーシアム | 2.0.7 | |
| pycocotools (YOLOv5) | COCOコンソーシアム | 2.0.7 | |
| pycocotools (YOLOv5+SAHI) | COCOコンソーシアム | 2.0.7 | |
| pycocotools (YOLOv8-Seg) | COCOコンソーシアム | 2.0.7 | |
| py-cpuinfo (YOLOv10) | Py-CPUInfo 開発者 | 9.0.0 | |
| py-cpuinfo (YOLOv5) | Py-CPUInfo 開発者 | 9.0.0 | |
| py-cpuinfo (YOLOv5+SAHI) | Py-CPUInfo 開発者 | 9.0.0 | |
| PyYAML (YOLOv10) | PyYAMLです | 6.0.1 | |
| PyYAML (YOLOv5) | PyYAMLです | 6.0.1 | |
| PyYAML (YOLOv5+SAHI) | PyYAMLです | 6.0.1 | |
| PyYAML (YOLOv8-Seg) | PyYAMLです | 6.0.1 | |
| リクエスト(SSD) | Pythonリクエスト | 2.27.1 | |
| リクエスト(YOLOv10) | Pythonリクエスト | 2.32.3 | |
| リクエスト(YOLOv5) | Pythonリクエスト | 2.31.0 | |
| リクエスト(YOLOv5+SAHI) | Pythonリクエスト | 2.31.0 | |
| サヒ | SAHI開発者 | 0.3.4+ | |
| Scipy(SSD) | サイピー・コミュニティ | 1.2.1 | |
| スキピー(YOLOv10) | サイピー・コミュニティ | 1.13.0 | |
| スキピー(YOLOv5) | サイピー・コミュニティ | 1.13.0 | |
| スキピー(YOLOv5+SAHI) | サイピー・コミュニティ | 1.13.0 | |
| スキピー(YOLOv8-Seg) | サイピー・コミュニティ | 1.13.0 | |
| シーボーン(YOLOv10) | シーボーン・デベロッパーズ | 0.13.2 | |
| シーボーン(YOLOv5) | シーボーン・デベロッパーズ | 0.13.2 | |
| シーボーン(YOLOv5+SAHI) | シーボーン・デベロッパーズ | 0.13.2 | |
| シーボーン(YOLOv8-Seg) | シーボーン・デベロッパーズ | 0.13.2 | |
| 魅力的な(YOLOv5+SAHI) | シェイプリー・デベロッパーズ | 2.0.4 | |
| SSD | Caffe/オリジナルSSD著者 | Python 3.6.13+;PyTorch 1.2.0+;CUDA 10.0;CUDNN 7.4.1 | |
| テンソルボード(SSD) | グーグル | 2.10.1 | |
| テンソルボード(YOLOv5) | グーグル | 2.16.2 | |
| テンソルボード(YOLOv5+SAHI) | グーグル | 2.16.2 | |
| トーチビジョン(SSD) | パイトーチ | 0.4.0 | |
| トーチビジョン(YOLOv10) | パイトーチ | 0.15.2 | |
| トーチビジョン(YOLOv5) | パイトーチ | 0.17.2 | |
| トーチビジョン(YOLOv5+SAHI) | パイトーチ | 0.17.2 | |
| トーチビジョン(YOLOv8-Seg) | パイトーチ | 0.16.1+ | |
| tqdm(SSD) | TQDM開発者 | 4.60.0 | |
| tqdm (YOLOv10) | TQDM開発者 | 4.66.4 | |
| tqdm (YOLOv5) | TQDM開発者 | 4.66.2 | |
| tqdm (YOLOv5+SAHI) | TQDM開発者 | 4.66.2 | |
| ウルトラリティクス(YOLOv8-Seg) | ウルトラリティクス | 8.2.99+ | |
| YOLOv10 | YOLOv10チーム | Python 3.8.0+;PyTorch 2.0.1+cu118;CUDA 11.8;CUDNN 8.7 | |
| YOLOv5 | ウルトラリティクス | Python 3.8.0+;PyTorch 2.2.2+;CUDA 11.2;CUDNN 8.1.2 | |
| YOLOv5 + サヒ | ウルトラライティクス+SAHI開発者 | Python 3.8.0+;PyTorch 2.2.2+;CUDA 11.2;CUDNN 8.1.2 | |
| YOLOv8-Seg | ウルトラリティクス | Python 3.8.0+;PyTorch 2.0.1+cu118;CUDA 11.8;CUDNN 8.6.0+ |
Access restricted. Please log in or start a trial to view this content.
Request permission to reuse the text or figures of this JoVE article
Request Permission