このプロトコルの目的は、PPE検出のための改良されたYOLOv11nモデルの開発のためのステップバイステップガイドを提供することです。アーキテクチャや訓練の修正を経て、90.1%のmAPという最先端精度と解釈可能性を持つ軽量リアルタイム検出器を実現しています。
このコンテンツを表示するには、JoVEへの購読が必要です。 または、無料トライアルをお申し込みください。
このプロトコルの目的は、PPE検出のための改良されたYOLOv11nモデルの開発のためのステップバイステップガイドを提供することです。アーキテクチャや訓練の修正を経て、90.1%のmAPという最先端精度と解釈可能性を持つ軽量リアルタイム検出器を実現しています。
インテリジェント伝送線路検査において、エッジコンピューティングデバイスは複雑な運用シナリオにおいて、個人用保護具認識のためのリアルタイム性能と検出精度のバランスという重要な課題に直面しています。本研究は、軽量で本質的に解釈可能な検出アルゴリズムであるWTLS-YOLOv11nを提案します。この手法は、YOLOv11nアーキテクチャに3つの相乗効果的な革新を統合しています。離散ウェーブレット変換を用いたC3K2-WTConvモジュールは、特徴を物理的に意味のある周波数成分に分解し、解釈可能性を持った堅牢なマルチスケール特徴抽出を可能にします。軽量な共有複合材料検出ヘッドは、戦略的な重量分配によりパラメータを大幅に削減しつつ、マルチスケールの融合能力を維持します。MPDIoU損失関数は、小さく不規則な形状のターゲットの位置特定精度を向上させます。実験的検証により、提案されたモデルはベースラインと比較してパラメータと計算複雑度を大幅に低減しつつ、エッジハードウェアプラットフォーム上でリアルタイム推論性能を維持しつつ、優れた検出精度を実現していることが示されました。定量的解釈可能性分析は、検出の意思決定が主に高周波のテクスチャーの詳細よりも低周波の構造的特徴によって左右されることを示し、モデルの推論過程を透明に示します。主流の検出モデルとの比較実験により、提案されたアプローチの優れた精度と効率のトレードオフが検証されました。この研究は、電力運用における自動化された安全監督のための透明で効率的かつ信頼できるソリューションを確立し、エッジ展開や解釈可能な意思決定を必要とする安全上重要な検出タスクに広く応用可能であることを示しています。
ディープラーニングは産業安全プロトコルを変革し、労働リスク管理の新たなアプローチを導入しました。この変革は特に、電力システム工学のようなリスクの高い分野で顕著です。現在、ビジョンベースのインテリジェント監督システムはYOLO(You Only Look Once)1アーキテクチャを活用し、個人防護具(PPE)2,3のリアルタイム自動検出を可能にします。これらのシステムは職場の安全監視において重要な技術として台頭し、従来の方法と比べて検知の精度と対応速度を大幅に向上させています。
これらのシステムは安全基準の遵守を継続的に監視し、人的ミスを減らし、複雑な電力運用現場での監督を向上させています。しかし、これらのシステムの基盤となる深層ニューラルネットワークは大きな課題を抱えています。意思決定プロセスは依然として不透明なままです。この解釈可能性の欠如は、特に安全が重要なアプリケーションにおいて、信頼構築と説明責任確保に不可欠な安全に重要な応用における最大の障害となっています。
モデルが誤った判断を生み出したり、非遵守の作業員を見逃したり、不必要な運用停止を引き起こした場合、不透明な意思決定プロセスは安全管理者にとって実行可能な情報を提供しません。エラーを診断したり、システムの推論を理解したり、意思決定を検証したりする能力がなければ、これらのシステムは人間の安全がかかっている環境で求められる信頼性基準を満たすことができません。このギャップは、正確性と透明性の両方を提供する説明可能な人工知能(XAI)4,5,6アプローチへの需要拡大を促進しています。目標は、安全担当者が重要な運用状況で理解し、検証し、信頼できるシステムを構築することです。
透明性は依然として不可欠ですが、厳しい運用環境でも確実に機能するモデルの上に構築されなければなりません。電力運用サイトは、堅牢な検知能力を必要とする独自の技術的要件を伴います。これらの環境は、強烈な昼間から完全な暗闇まで、極端な照明の変化を経験します。複雑な機械がしばしば視野を遮り、標準的な検出モデルでは対処できない閉塞の課題を生み出します。天候条件はさらに変動をもたらし、異なる運用シナリオで視認性や画質に影響を与えます。これらの課題に対応するには、環境の複雑さにもかかわらず一貫したパフォーマンスを維持するモデルが必要です。
研究者たちは、電力サイトアプリケーションにおけるYOLO性能の最適化のために複数のアプローチを追求しています。建築の改修は重要な研究方向の一つです。いくつかの研究により、YOLOv57 ネットワークは首の構造内に追加の検出ヘッドを組み込むことで強化されています。この修正は、PPE検出における長年の課題である、遠くや混沌とした視野で小さな物体を識別する困難さに対処しています。追加の検出層により、標準アーキテクチャでは見落とされがちなより細かい空間的ディテールをモデルが捉えることができます。
もう一つの主要な研究方向は、展開環境のモデル最適化に焦点を当てています。電力運用現場では、限られた計算資源を持つエッジデバイス上で動作するための検知システムが必要なことが多いです。この制約により、モデル圧縮や効率化の取り組みが促進されています。研究者たちは、検出精度を維持しつつモデルサイズと推論時間を削減する技術を開発し、処理能力が制限されたハードウェア上でリアルタイムの性能を実現しています8,9。
最近の最適化の取り組みでは、モデルの複雑さを低減するための有望な手法がいくつか導入されています。研究者たちはMobileNetv310 のような効率的なバックボーンネットワークをYOLO-M 11のようなアーキテクチャに統合しています。他の研究では、モデル剪定や知識抽出を応用し、Light-YOLOv412を含むコンパクトなバリアントを開発しています。これらの手法は計算効率と展開の実現可能性において測定可能な改善を示しています。
しかし、これらの最適化手法には従来の畳み込みアーキテクチャに内在する根本的な制約があります。標準的な畳み込み演算では、受容野を拡張するためにネットワーク層の深さやカーネルサイズ13 が必要であり、これは画像全体にわたる文脈情報を捉えるために不可欠です。このアーキテクチャ上の要件は避けられないトレードオフを生み出します。モデルがより豊かな特徴を抽出し、より広い空間的文脈を理解する能力を得られるにつれて、パラメータ数や計算負荷は大幅に増加します。その結果生まれたモデルは、エッジデバイスの処理能力をしばしば上回り、リアルタイム運用環境での実用的な展開を制限しています。
特徴抽出能力と計算効率とのこの緊張関係は、現行の手法が完全には解決されていない重大な方法論的課題を示しています。この分野は、従来の手法が課すパラメータの比例増加を伴わずに階層的なマルチスケール特徴を捉えられる、根本的に異なる特徴抽出のアプローチを必要としています。このようなアプローチにより、モデルは安全性が重要なアプリケーションに必要な検出性能とエッジ展開に必要な効率の両方を維持できます。このギャップを解消することは、電力運用環境における実用的なPPE検出システムの発展に向けた重要な研究課題です。
現在の物体検出の説明可能性手法は主にGrad-CAMなどのポストホック分析手法14 を用いています。これらの手法は有用な可視化を提供しますが、モデルの学習プロセスとは独立して動作します。別のアプローチとしては、運用メカニズムを通じて透明性を提供するアーキテクチャコンポーネントを設計することです。当社のウェーブレットベースの特徴抽出は、どの周波数成分が検出に寄与するかを簡単に理解できますが、この解釈可能性を完全に定量化するにはさらなる研究が必要です。
本研究は、PPE検出システムにおける3つの相互に関連する課題、すなわち検出精度、計算効率、モデル解釈可能性に取り組んでいます。この作業はYOLOv11n15 アーキテクチャを3つのターゲットを絞った設計変更を通じて修正しています。
最初の改良はC3K2-WTConvモジュールを導入し、標準的な畳み込みをウェーブレットに着想を得た特徴抽出プロセスに置き換えます。このアプローチは視覚情報を周波数成分に分けます。低周波信号は形状や輪郭情報を持ち、高周波信号はテクスチャやエッジの詳細を符号化します。この分離により特徴品質が向上し、従来の畳み込み操作よりも抽出プロセスがより透明になります。
2つ目の改良は、計算負荷を削減するために軽量共有複合検出ヘッド(LSCD)を実装しています。このコンポーネントは検出スケール間のパラメータ共有を利用し、モデルサイズを縮小しつつマルチスケール検出能力を維持します。この設計は、電力運用現場で使用されるエッジデバイスに典型的なリソース制約を対象としています。
3つ目の修正では、標準損失関数をMPDIoU損失16 に置き換え、バウンディングボックスの精度を向上させます。この変更は、小型で形状の多様なPPEアイテムに伴う局所化の課題に対処し、訓練中の勾配安定性を向上させます。
テストの結果、修正モデルは基準値より平均精度が3.8%高く、パラメータ数が11.5%少ないことが示されています。これらの結果は、エッジ展開の実用的な要件を満たしつつ、検出性能を向上させていることを示しています。この研究は電力運用における安全監視のための機能的ソリューションを提供しますが、システムの信頼性を完全に評価するためには多様な運用条件下でのさらなる検証が必要です。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
本研究の画像データは、必要な許可を得て電力運用環境から収集されました。すべての画像は匿名化されており、個人を特定できる情報は一切残されていません。本研究は個人の特定ではなく、個人用防護具の検出に焦点を当てています。この研究は匿名化されたデータを使ったアルゴリズム開発のみを含んでいたため、倫理的承認は必要ありませんでした。
以下のプロトコルは、個人用防護具(PPE)検出用の軽量で高性能かつ本質的に解釈可能な物体検出モデルWTLS-YOLOv11nの設計、訓練、評価のための包括的な手順を詳述します。本研究で使用されるソフトウェアは 材料表に記載されています。
全体的なアーキテクチャフレームワーク
提案されているWTLS-YOLOv11nモデルは、YOLOv11nの基準を基に構築されています。コア手法は、バックボーンやヘッドの主要モジュールを体系的に置き換えたり強化したりして、パフォーマンス、効率、解釈性を向上させることにあります。
提案されているWTLS-YOLOv11nモデルは、YOLOv11nの基準を基に構築されています。コア手法は、バックボーンやヘッドの主要モジュールを体系的に置き換えたり強化したりして、パフォーマンス、効率、解釈性を向上させることにあります。YOLOv11nの全体的なアーキテクチャパラダイムである背骨、首、頭部は提案モデルに引き継がれています。バックボーンでは、特定のC3K2モジュールが提案されたC3K2-WTConvモジュールに置き換えられ、特徴抽出を強化しました。ヘッドでは、元の検出ヘッドがモデルの複雑さを軽減するために提案された軽量共有複合検出ヘッド(LSCD)に置き換えられました。提案されたWTLS-YOLOv11nモデルの完全なアーキテクチャは、ベースラインと比較され、 図1に示されています。
C3K2-WTConvモジュール設計
このモジュールは、YOLOv11nバックボーン内の標準畳み込みモジュールを置き換えるよう設計されています。その設計は主に二つの目的に基づいています。すなわち、(a) パラメータ数や計算複雑さを大幅に増加させることなく、モデルの受容フィールドを効率的に拡大してマルチスケールの文脈情報を捉えること、(b) 特徴マップを明示的に周波数領域に分解することで、より堅牢で本質的に解釈可能な特徴表現を学習すること。
コアWTConv層の設計
基礎となるWTConv(ウェーブレット変換畳み込み)層は、2D離散ハールウェーブレット変換を実装するために設計されています。このプロセスは、特定のウェーブレット核の集合を通じて行われます。
ウェーブレット核:この変換は、4つの固定された非訓練可能な深度方向の畳み込みカーネル(F_LL、F_LH、F_HL、F_HH )によって 実装され、これらはハールウェーブレット基底関数に対応します。これらのカーネルは入力特徴マップを低周波成分と高周波成分に分解する役割を担います。
分解とダウンサンプリング:これらの核は入力特徴写像(X)にストライド2で適用されます。この単一の操作は特徴分解と空間的ダウンサンプリングの両方を効率的に行い、入力を4つの異なるサブバンドに分離します。
出力成分の物理的解釈
ウェーブレット分解によって生成される4つの特徴部分バンドは、明確な物理的解釈を持っています。 図2に示すように、WTConv層は入力を次の成分に再帰分解します。
低周波成分(LL):この成分は、対象の全体的な構造、輪郭、その他のグローバル情報を空間分解能の半分で保持します。これはモデルがターゲットの「形状」を理解するための基盤となります。
高周波成分(LH、HL、HH):これら3つの成分は、それぞれ水平、垂直、斜めのエッジやテクスチャなどの細かいディテールを捉えます。これによりモデルはターゲットの「詳細」に焦点を合わせることができます。
C3K2モジュール構造への統合
設計されたWTConvレイヤーは、YOLOv11nのC3K2ボトルネック構造にシームレスに統合されています。
置き換え戦略:元のC3K2モジュール内で、標準的な3x3畳み込み層をWTConv層に置き換えます。このアプローチはC3K2アーキテクチャの効率的な特徴再利用メカニズムを維持しつつ、ウェーブレット変換の利点を導入し、最終的なC3K2-WTConvモジュール(詳細な構造は 図3に示されています)を生み出しました。
カスケード受容野拡張:WTConvプロセスは、前段階の低周波(LL)出力に再帰的に適用できます。このカスケード分解メカニズムにより、モデルは指数関数的に増加する受容野上の特徴を最小限の計算負荷で解析し、効率的な多スケール周波数分解経路を作成できます。
軽量共有複合コンポジット検出ヘッド(LSCD)設計
このモジュールは、元のYOLOv11n検出ヘッドを置き換えるために設計されており、主な目的は、リソース制約のあるエッジデバイスでの効率的な展開のために、モデルの複雑さと計算負荷を大幅に削減することです。この設計は、標準的なマルチスケール検出ヘッドに見られる重要なパラメータ冗長性に対応しています(詳細な構造は 図4に示されています)。
設計の理由と目標
元のYOLOv11ヘッドの各特徴スケール(P3-P5)ごとに独立した予測分岐は、高いパラメータカウントをもたらします。LSCDは、重要なマルチスケール機能融合能力を維持しつつ、優れたパラメータ効率を達成するためのハイブリッドパラメータ共有戦略を導入します。
パラメータ共有と特徴融合メカニズム
LSCDの中核は、2段階の特徴処理パイプラインにあります。
スケール固有の前処理:ネックからの各入力特徴マップ(P3、P4、P5)に対して、共有されていない1x1畳み込みとグループ正規化(GN)レイヤーが適用されます。この初期ステップにより、ネットワークはスケール特有のチャネル変換を学習でき、各特徴レベルの固有の特性が融合前に保持されることを保証します。
効率的なスケール横断融合:前処理後、複数の共有3x3畳み込み-GNモジュールを用いて、異なるスケール間でコアフィーチャー融合を実行します。重みを共有することで、これらのモジュールはパラメータ削減の主な源となる一般化特徴融合パターンを学習します。この設計により、モデルはより堅牢で普遍的な融合表現を学習させられます。
動的スケール適応と分岐最適化
体重共有による情報損失の可能性を補い、予測精度を改善するために、さらに2つのメカニズムが導入されます。
学習可能なスケール層:各検出スケールごとに学習可能なスケールレイヤーが追加されます。このレイヤーは、フュージョンされた特徴を動的に再重み付けするスケールごとの学習可能なスカラーを導入し、モデルがそのスケールで一般的な対象オブジェクトサイズに基づいて適応的に特徴を強調したり抑制したりできるようにします。
最適化された分類分岐:分類分岐は、確率分布にSoftmax活性化関数を用い、グループ正規化(GN)レイヤーを組み込むことで強化されています。これにより分類タスクの訓練が安定し、信頼度予測の堅牢性が向上します。この手法はFCOSのようなアーキテクチャで効果的であることが証明されています。
改良損失関数設計(MPDIoU)
損失関数は、PPE検出シナリオでよく見られる小さく、雑多で形状が不規則なターゲットに対する正確なバウンディングボックス回帰の課題に特化して再設計されています。
伝統的なIoU喪失の動機と限界
標準的なIoUベースの損失は、この文脈でいくつかの重大な欠点を抱えています。
消滅勾配:予測ボックスとグラウンドトゥルースボックスが重複しない場合、IoUはゼロとなり、損失勾配が消えて学習プロセスが停滞します。
アライメントに対する感度の低さ:複数のバウンディングボックス構成は同じIoUスコアを生み出し、損失関数はアライメントの質(例:中心点のずれと形状の不一致)に無感化します。
小型物体での性能低下:小さなターゲットでは、わずかなピクセルのずれでも大きな影響を与えることがありますが、多くの場合、IoUの値にほとんど変化がなく、定位精度が不正確になります。
最小点距離IoU(MPDIoU)損失の採用
前述の制限を克服するため、プロトコルは標準損失を最小ポイント距離IoU(MPDIoU)損失に置き換えています。MPDIoUは、予測ボックスとグラウンドトゥルースボックスの距離を直接ペナルティするペナルティ項を組み込み、標準的なIoUメトリックを強化しています。たとえ重複していなくてもです。
コアメカニズム:ペナルティ項は、予測ボックス(pred)とグラウンドトゥルースボックス(gt)の対応する角点間のユークリッド距離から導出されます。具体的には、左上隅
)と右下隅(
)の二乗距離を計算します。
(1)
(2)
ペナルティがスケール不変であることを保証するために、この距離は予測ボックスとグラウンドトゥルースボックスの両方をカバーする最小の囲いボックスの寸法で正規化されます。wとhをそれぞれこの囲い箱の幅と高さとします。MPDIoU計量は次のように定式化されます。
(3)
最後に、MPDIoU損失関数(LMPDIoU)は次のように定義されます。
LMPDIoU = 1 - MPDIoU (4)
主な利点:この幾何学的ペナルティ項は、以下の点で前述の問題に直接対処します。i) ボックスが重なっていなくても意味のあるゼロでない勾配を提供し、勾配の消失を防ぎ、モデル最適化を連続させること、ii) 位置、サイズ、アスペクト比の偏差に対する感度を高め、小規模で多様なPPEアイテムの正確な位置特定に不可欠です。 iii) 訓練中により安定し一貫した勾配信号を届け、収束速度を促進し、定位精度の向上につながります。
データセットと実験セットアップ
自作PPE検出データセット
送電線運用からの高解像度画像5,000枚を含むPPE検出データセットを構築し、LabelImgで注釈を付け、YOLO TXT形式に変換しました。データセットには5つのカテゴリーが含まれています:安全ヘルメット(1,245件)、安全ハーネス(1,128件)、腕章(892件)、高所作業状況(1,056件)、地上レベル状態(1,124件)です。データはトレーニング(4,000枚)、検証(500枚)、テスト(500枚)セットに分けられています。画像は極端な照明、重度の遮蔽(23%、>50%のカバー)、複雑な工業背景など、厳しい条件を特徴としています。トレーニング中に標準的な増強技術(ランダムフリップ、回転、カラージッター、モザイク)が適用されました。
一般化テストのためのPASCAL VOCデータセット
電力運用シナリオを超えたモデルの一般化能力を評価するために、VOC2007とVOC2012を組み合わせたPASCAL VOCデータセットを使用し、合計21,503枚の画像を収集しました。標準的な慣行に従い、トレーニングと検証にはVOC2012から11,540枚、テストにはVOC2007から9,963枚の画像を使用しました。VOCデータセットには、さまざまな現実世界シナリオにおける20のオブジェクトカテゴリが含まれています。対象はPPEカテゴリーとは異なりますが、検出の課題(スケールの変動、遮蔽、複雑な背景)は類似しており、モデルの一般的な検出能力と伝達可能性を評価するのに適しています。
実装の詳細
このプロトコルは、モデルのトレーニングおよび評価の手順を概説しています。ユーザーがソースコード、適切なPython環境、準備済みデータセットにアクセスできると仮定されています。
システムと環境の準備
トレーニング用の十分なメモリを確保するために、少なくとも24GBのVRAMを持つNVIDIA GPUを搭載したワークステーション(例:NVIDIA GeForce RTX 4090)が使用されました。PyTorchのディープラーニングフレームワーク(バージョン1.12.0以降)と対応するCUDAツールキットがワークステーションにインストールされました。インストールはターミナルを開き、「python -c 'import torch」というコマンドを実行することで確認されました。print(torch.cuda.is_available())'""であり、これは「True」を返すことが期待されていました。必要なPythonパッケージは、プロジェクトのルートディレクトリにアクセスし、「pip install -r requirements.txt」コマンドを実行することでインストールされました。このコマンドはnumpy、opencv-python、pyyaml、tensorboard、torchvisionなどの依存関係を自動的にインストールします。データセットの準備は、訓練画像が/data/train/images/に、注釈ファイルがYOLO形式(クラスx_center y_center幅高さ)で/data/train/labels/に配置されていることを確認しました。検証(/data/val/)およびテスト(/data/test/)データセットにも同じ検証プロセスが適用されました。
訓練構成
設定ファイルconfig/wtls_yolov11n.yamlはテキストエディタで開いてトレーニングパラメータを設定しました。データパスは「path」パラメータを見つけてデータセットのルートディレクトリに設定し、その際に「train」「val」「test」パラメータが正しいサブディレクトリを指すか検証することで構成されました。「nc」パラメータ(クラス数)は、PPE検出用に5に設定されたデータセットと一致することが確認されました。訓練ハイパーパラメータは、完全な訓練のためにエポック数を300に、バッチサイズを16に設定しました。この値はGPUメモリの空き状況に応じて調整可能で、メモリ不足エラーが発生した場合は8に減らすことが理解されていました。入力画像サイズ(imgsz)は640に設定され、最適化装置はSGDで初期学習率(lr0)0.01であることが確認されました。重量減衰は0.0005と確認され、運動量は0.937に設定されました。データ増強技術は、デフォルト設定で有効化されており、モザイク増強(モザイク:1.0)、50%の確率でランダムな水平反転、そしてパラメータ HSVH: 0.015、 HSVS: 0.7、 hsvv : 0.4のカラージッターが含まれていました。ハードウェア利用パラメータは、データロードに使われるCPUスレッド用のワーカー数を8に設定し、最初のGPUを使用するデバイスパラメータは0に設定され、必要に応じてマルチGPUトレーニング用に「0,1」に設定するオプションがありました。
モデルトレーニングの実行
モデルトレーニングはコマンドラインから「python train.py --cfg config/wtls_yolov11n.yaml --weights '--data data.yaml」を実行することで初期化されました。--cfg パラメータはモデル設定ファイルを指定し、--weights パラメータは空文字列に設定してゼロから訓練し(または転移学習に使う yolov11n.pt)、--data パラメータはデータセットの設定を指定しました。トレーニング中には、モデルのパフォーマンスを追跡するために収束指標が観測されました。最初の50期では、box_lossが約1.5から0.8に急激に減少しました。エポック50から150の間には、box_lossが約0.8から0.5へと減少し、着実な改善が見られました。紀元150から300の間には微調整段階が行われ、box_lossは0.4から0.5の間で安定しました。検証mAP@0.5指標は、200年までに85%を超えると予想されていました。チェックポイント保存は、トレーニングが10エポックごとに自動的にチェックポイントをディレクトリruns/train/exp/weights/に保存するように検証されました。last.pt(最新のチェックポイント)と best.pt(最高mAPチェックポイント)の存在が確認され、各チェックポイントファイルのサイズは約5〜6MBと予想されました。トレーニング進捗は、TensorBoardを使って新しい端末を開き、「tensorboard --logdir runs/train」コマンドを実行し、ブラウザから http://localhost:6006 に切り替えて損失曲線、学習率スケジュール、mAPトレンドのリアルタイムプロットを閲覧することで、学習進捗を監視することも可能でした。一般的な問題はトラブルシューティング手順で解決され、CUDAのメモリ不足エラーはバッチサイズを8または4に減らし、NaN損失値は学習率を0.005に下げて対処し、mAPが80%未満の停滞は注釈の正確性検証と訓練エポックを400に増やして調査しました。
モデル評価プロトコル
提案されたモデルの有効性、効率性、解釈可能性を包括的に検証するために、多面的な評価手順が実施されました。
定量的業績評価
パフォーマンス指標
モデルの精度は、平均精度(mAP)を用いて、IoU閾値0.5(mAP@0.5)、精度、リコールを用いて評価します。パラメータ(M)と浮動小数点演算(FLOP、G)の総数を測定することでモデルの効率を評価します。サーバーグレードGPUとエッジデバイスの両方で、フレーム毎秒(FPS)で推論速度を測定できます。エッジデバイスのテストでは、パワーモードを最大パフォーマンスに設定し、100回のダミー推論でモデルをウォームアップしてから、500枚以上のテスト画像以上のFPSを記録します。
最先端モデルとの比較:提案されたWTLS-YOLOv11nモデルを、その直接ベースライン(YOLOv11n)および主流CNNベースのYOLOモデル(YOLOv5n、YOLOv8n、YOLOv9s)、2段検出器(Faster R-CNN)、トランスフォーマーベースの検出器(RT-DETR)など多様な検出器と比較してベンチマークします。推奨されるデフォルトのハイパーパラメータを使って、すべてのモデルを300エポック分のトレーニングに組み込みます。各モデルのパフォーマンス指標セクションで定義されたすべての指標を、自己構築PPEデータセットとPASCAL VOCデータセットの両方に記録してください。VOC評価では、VOC2012列車とVOC2007列車の集合セットで訓練し、その後標準プロトコルに従ってVOC2007テストセットで試験を行います。
アブレーション検査:提案された成分の個々の貢献を詳細に分析するために体系的なアブレーション検査を行います。
コンポーネント有効性分析:ベースラインYOLOv11nモデルから、C3K2-WTConvモジュール、LSCDヘッド、MPDIoU損失を段階的に積分します。各構成ごとに、同じハイパーパラメータ(バッチサイズ16、学習率0.01、SGDオプティマイザー)を使って300エポック分のモデルを再学習させます。mAP、精度、リコール、パラメータ、FLOP、FPSの変化を記録し、各コンポーネントの有効性を検証します。各指標の基準と比較して改善率を計算します。
配置解析:C3K2-WTConvモジュールの最適な配置を決定するために、ネットワークアーキテクチャの異なる部分に統合します。3つの構成をテストします:(i) 背骨のみの統合、(ii) 首のみの統合、(iii) 背骨と首の両方での完全な統合。各構成を300エポックで訓練し、得られたmAP@0.5スコアを比較して最も効果的な統合戦略を特定します。その後のすべての実験で最適な構成を選択します。
質的パフォーマンス評価
検出結果の可視化:テストセットから、強い逆光、重い物体の遮蔽、複雑な背景、そして型破りなカメラアングルなど、現実世界で難しいシナリオを持つ代表的な画像を12〜15枚選びます。各比較モデル(ベースライン、YOLOv5n、YOLOv8n、YOLOv9s、WTLS-YOLOv11n)に対して、信頼度0.25、IoU閾値0.45を用いてこれらの画像に対して推論を行います。検出出力(クラスラベルと信頼度スコアを含むバウンディングボックス)をこれらの画像に生成・レンダリングします。行が異なるシナリオを、列が異なるモデルを表すグリッド形式で可視化を配置します。
堅牢性分析:異なるモデルからのレンダリングされた検出出力を視覚的に比較します。偽陰性(見逃した物体)、偽陽性(誤検出)、重複検出(単一の物体に対して予測間0.7のIoU>の複数ボックス)のインスタンスをカウント・マークすることで、提案モデルの堅牢性と優位性を評価します。可視化図の問題点検出には赤い丸を使います。選択したテスト画像全体でモデルごとの偽陰性率と偽陽性数を計算します。モデル間で真陽性検出の平均信頼度スコアを抽出し比較します。
解釈可能性解析
C3K2-WTConvモジュールが持つ固有の解釈可能性を検証するため、選択された入力画像に対して可視化手順が実施されました。訓練済みのWTLS-YOLOv11nモデルがロードされ、バックボーンの第4層にあるC3K2-WTConvモジュールにフォワードフックが登録されました。入力画像に対して順方向伝搬が行われ、出力特徴テンソルがキャプチャされました。形状[バッチ、チャネル、高さ、幅]の特徴テンソルから、異なる周波数成分に対応するチャネルが分離されました。チャンネルの最初の25%は低周波(LL)成分に指定され、残りの75%は高周波(LH、HL、HH)成分として指定されました。各周波数成分タイプに対して、その成分内のすべてのチャンネルの平均を計算し、単一チャネルの活性化マップを作成しました。必要に応じて、強い活性化を強調するために空間的次元にわたってL2ノルムを適用しました。起動マップは範囲[0, 1]に正規化され、カラーマップ(例:「ジェット」カラーマップ)が適用されました。ヒートマップは、バイリニア補間を用いて元の入力画像解像度に合わせてリサイズされました。低周波ヒートマップと高周波ヒートマップは、元の画像に40%の透明性で重ねられ、モデルが構造的特徴とテクスチャー的特徴の焦点を合わせた解釈可能な可視化を作成しました。
検出決定が周波数領域の特徴に依存していることを厳密に検証するために、定量的分析が実施されました。検出に成功した画像(信頼度スコア0.5以上)を含む200枚から300枚の画像のサブセットが選ばれました。このサブセットは、サンプリングバイアスを避けるために多様なシナリオを表現するように確保されました。サブセット内の各画像に対して順方向伝搬が行われ、第4バックボーン層のC3K2-WTConvモジュールの出力が抽出されました。特徴テンソルは低周波(LL、チャネルの最初の25%)と高周波(HF、残りの75%チャネル)成分に分けられました。各画像に対して、両方の周波数成分の空間次元(高さと幅)で平均絶対活性化強度が計算されました。LL強度はすべての空間位置におけるLL特徴の絶対値の平均として計算され、HF強度はすべての空間位置におけるHF特徴の絶対値の平均として計算されました。これらの値は、その画像の最大検出信頼度スコアとともに記録されました。収集したデータ(LL_strength、HF_strength、confidence_score)を用いて、すべての画像にわたりピアソン相関係数を算出しました。LLの強さと自信スコアの相関、およびHFの強さと自信スコアの相関を計算しました。統計ソフトウェアまたはPythonのscipy.stats.pearsonr関数を用いて相関係数(r)とp値の両方を取得しました。統計的有意性はp値の閾値0.05を用いて評価され、p値が0.05未満の場合は相関が統計的に有意であることを示しました。相関係数の大きさを比較し、検出信頼度とより強い関連を示す周波数成分を特定しました。以下の指標が構造化された形式で記録されました:LL相関係数(rLL)およびp値(pLL)、HF相関係数(rHF)およびp値(pHF)、平均活性化強度(平均LL、平均HF)、およびサンプルサイズ(解析画像数)。予想される結果として、低周波特徴は信頼度スコア(rLLが0.60以上、pが0.001未満)と比べてより強い正の相関を示すことが高頻度の特徴(rHF約0.40から0.50、pが0.01未満)と比べられ、検出決定は主にLL成分で捉えられた構造情報によって左右されることを示しました。
この定量的分析により、定性的可視化の限界を超えた解釈可能性が確立されました。相関分析(統計的関連性の実証)と周波数領域可視化(空間的注意の示す)の組み合わせにより、モデルの意思決定が設計上意図された低周波構造的特徴に真に依拠していることの厳密な実証的証拠が得られました。
期待される結果:低周波特徴は信頼度スコア(rLL > 0.60、p < 0.001)<≈と比べてより強い正の相関を示すべきであり、検出判断は主にLL成分に捕捉された構造情報によって左右されることを示しています。
この定量的分析は、定性的可視化を超えた解釈可能性を確立します。相関分析(統計的関連性の実証)と周波数領域可視化(空間的注意の示し)の組み合わせは、モデルの意思決定が設計上意図された低周波構造的特徴に真に依存していることを厳密な実証的証拠として提供しています。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
提案されたWTLS-YOLOv11nモデルの性能を評価するため、自ら構築したPPEデータセットとPASCAL VOC 2007+2012データセットで実験を行いました。特に明記がない限り、すべての指標はそれぞれのテストセットで報告されます。
最先端モデルとの比較
私たちは、WTLS-YOLOv11nを3つのアーキテクチャパラダイムで主流の物体検出器と比較してベンチマークを行いました。すなわち、CNNベースのYOLOモデル(YOLOv5n、YOLOv8n、YOLOv9t、YOLOv11n)、2段階検出器(Faster R-CNN)、トランスを基盤とした検出器(ResNet-18バックボーンのRT-DETR)です。包括的な結果は 表1に示されています。
提案されているWTLS-YOLOv11nは90.1%のmAP@0.5を達成し、すべての比較モデルを上回る性能を発揮しています。特筆すべきは、YOLOv11n...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
実験結果は、WTLS-YOLOv11nがYOLOv11nベースラインと比較してパラメータを11.5%削減しつつ90.1%のmAPを達成していることを示しました。この精度と効率の向上は、ウェーブレットベースの特徴抽出、軽量検出ヘッド設計、そして位置特定損失の改善という3つの要素の相乗的統合によるものです。
アブレーション研究では、C3K2-WTConvモジュールが個別に最大のパフォーマンス向上をもたらし、mAPを86.3%から89.1%に向上させることが明らかになりました。これは、周波数領域特徴分解が構造情報(低周波)とテクスチャーの詳細(高周波)を分離することでPPE検出に利点をもたらすことを示唆しています。この分離により、モデルは堅牢なオブジェクト特性に集中しつつ、背景の複雑さや従来の畳み込み操作に挑戦する照明変動への感度を軽減するのに役立つかもしれません。
LSCDコンポーネントは、スケールを越えた重み共有を通じてパラメータの効率的な利用を示し、検出能力を...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
著者たちは利益相反を一切認めていない。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| CUDAツールキット | NVIDIAコーポレーション | CUDA ツールキット バージョン 11.7 | |
| ディープラーニングフレームワーク | パイトーチ財団 | PyTorch バージョン 1.12.0 | |
| グラフィックス処理ユニット | NVIDIAコーポレーション | GeForce RTX 4090 | |
| NumPy | NumPy 開発者 | NumPy | |
| OpenCV | OpenCVチーム | OpenCV-Python | |
| オペレーティング システム | キャノニカル社 | Ubuntu 22.04 LTS(またはOSを指定する) | |
| パイソン | Pythonソフトウェア財団 | Python バージョン 3.8 以降 | |
| テンソルボード | TensorFlowの著者 | テンソルボード | |
| トーチビジョン | パイトーチ財団 | トーチビジョン |
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。