本論文では、You Only Look Once version 11 (YOLOv11) と畳み込みニューラルネットワークを統合した生産ラインの安全監視手法を提案する。本手法は、グラフィックスプロセッシングユニットにおいて、IoU(intersection-over-union)しきい値0.5での平均適合率(mAP@0.5)0.91、mAP@0.5:0.95で0.82、および秒間120フレームを達成し、評価したベースラインモデルを上回る性能を示した。
本論文では、You Only Look Once version 11 (YOLOv11) と畳み込みニューラルネットワークを統合した生産ラインの安全監視手法を提案する。本手法は、グラフィックスプロセッシングユニットにおいて、IoU(intersection-over-union)しきい値0.5での平均適合率(mAP@0.5)0.91、mAP@0.5:0.95で0.82、および秒間120フレームを達成し、評価したベースラインモデルを上回る性能を示した。
インダストリー4.0の深化に伴い、生産ラインの自動化および知能化レベルが大幅に向上しており、モニタリングのリアルタイム性能、精度、および安全性に対する要求が高まっています。目視点検や単純なしきい値ベースの判定に依存する従来のモニタリングシステムは、一般に応答時間が遅く、誤報率が高く、知能化に限界があるという課題があります。そこで本論文では、You Only Look Once version 11 (YOLOv11) と畳み込みニューラルネットワーク (CNN) を統合した生産ライン安全モニタリングシステムを提案します。まず、取得した画像を前処理しました。次に、YOLOv11を用いて、作業員、設備、および潜在的な危険要因をリアルタイムで識別しました。続いて、小規模な対象物や遮蔽された対象物の特徴抽出能力を向上させるため、マルチスケール特徴融合とアテンションメカニズムを備えた拡張CNNネットワークを導入しました。最終的に、検出結果をCNNで強化された特徴と融合させ、安全状態を評価しました。自作の生産ライン安全データセットを用いて実験を行い、最適化アルゴリズムにはモメンタム0.9の確率的勾配降下法 (SGD) を採用し、初期学習率0.01、荷重減衰0.0005、コサインアニーリングによる学習率調整、バッチサイズ32、学習エポック数200として実施しました。評価指標としてmAP@0.5および1秒あたりのフレーム数 (FPS) による検出速度を用い、評価対象のベースラインアルゴリズムと比較しました。その結果、提案システムはmAP@0.5で0.91、検出速度で120 FPSを達成しました。また、遮蔽や変動する照明などの複雑な条件下でも堅牢な性能を示し、生産ラインの安全モニタリングにおける有効性と実用的な適用可能性が裏付けられました。
現代の工業生産において、安全性は生産効率の確保と人員の健康維持の根幹をなすものです。生産ラインの環境には、通常、高速機械設備、複雑な技術プロセス、および複数のタスクを伴う協調作業が含まれます。いかなる小さな潜在的な安全上のリスクであっても、重大な生産事故につながる可能性があり、その結果、多大な経済的損失や、場合によっては死に至る事故を招く恐れがあります。したがって、工業生産における安全性を高めるためには、効率的かつインテリジェントなリアルタイム安全監視システムを構築することが極めて重要です1,2.
従来の安全監視方法は、主に手動のビデオ監視とさまざまなセンサー(赤外線、煙、振動センサーなど)に依存しています3。手動監視は効率が低いだけでなく、監視員の疲労による検知漏れが発生しやすく、継続的かつ包括的なカバー範囲を提供することができません。センサーはある程度の早期警告機能を提供できますが、検知範囲が限られており、環境干渉に敏感であるため、誤報という顕著な問題が生じます4。そのため、インテリジェント監視システムが研究の焦点となっています。ディープラーニングアルゴリズムを用いてビデオストリームをリアルタイムで分析することで、異常事象、不安全行動、潜在的な危険性を自動的に特定でき、これにより監視システムのインテリジェンスを大幅に向上させることが可能です4,5。
物体検出は、インテリジェントモニタリングにおける中核技術です。シングルステージ物体検出器の代表格であるYou Only Look Once (YOLO) シリーズのアルゴリズムは、大きな優位性を示しています。YOLOv1からYOLOv8に至るまで、このアルゴリズム群は、ネットワークアーキテクチャ、損失関数、トレーニング手法などの側面において継続的な開発と改良が行われてきました6,7。特にYOLOv11は、複雑な背景や密集したターゲットに直面した場合でも、高いフレームレートを維持しつつ、より高い検出精度を達成しています8。
しかしながら、一般的な物体検出タスクにおいて優れた性能を示すYOLOv11であっても、特定の製造ラインにおける安全監視シナリオでは依然として課題が存在します9。例えば、作業員が設備によって部分的に遮られていたり、安全標識が小さく背景色と酷似していたりする場合、YOLOv11の検出精度が低下することがあります。そのため、モデルにはより強力な特徴抽出能および意味理解能力が求められます10。
畳み込みニューラルネットワーク(CNN)は、画像特徴抽出において強力な能力を備えています11。より深く複雑なネットワークアーキテクチャを設計することで、CNNはより豊かで抽象的な画像特徴を学習することが可能です。CNNをYOLOv11と組み合わせることで、YOLOv11の高速な検出能力とCNNの深い特徴抽出能を活用でき、それにより、より堅牢でインテリジェントな安全監視システムを構築できます。
これに基づき、本論文ではYOLOv11とCNNを用いた生産ラインの安全監視システムを提案します。本研究の革新的な点は以下の通りです。(1) YOLOv11と改良されたCNNの深層融合アーキテクチャを提案したこと、(2) 重要な安全機能の認識精度を向上させるために、マルチスケール特徴融合と複合アテンションメカニズムを導入したこと、(3) 自作の複雑なシーンデータセットを用いてモデルの性能上の優位性を検証したことです。
YOLOシリーズアルゴリズムの開発
2015年にRedmonらによって初めて導入されて以来12、You Only Look Once (YOLO) アルゴリズムは大きな関心を集めてきました。リージョンプロポーザルに依存する2ステージ検出器とは異なり、YOLOは物体検出を回帰タスクとして処理します。画像内の物体のクラスと位置を直接予測することで、YOLOは検出速度を著しく向上させ、リアルタイムでの利用に適したものとなっています13.
本シリーズの先駆的な研究であるYOLOv1は、初めてエンドツーエンドのターゲット検出を実現しました14。YOLOv1では、入力画像をグリッド構造に分割し、通常S × S形式で配置される各グリッドセルが、その境界内に含まれるオブジェクトを検出する役割を担います。
具体的に、YOLOv1の出力はテンソルです。S × S × (B × 5 + C) の中で、各バウンディングボックスの予測には、中心点座標(x,y)、幅 w、高さ h、および信頼度 c の5つの要素が含まれています。計算プロセスは式(1)に示されています:
(1)
そのうち、Pr(Object)はグリッド内にターゲットが存在する確率を表し、IOUは予測されたバウンディングボックスと正解ボックス(ground-truth box)との交差領域と結合領域の比率を表します。また、各グリッドはクラス確率の集合も予測し、Pr はターゲットが存在する場合にそのターゲットがi番目のクラスに属する確率を表します。YOLOv1の損失関数は、座標予測の損失、信頼度推定の損失、およびカテゴリ予測の損失という3つの主要な構成要素から成り立っています15。
YOLOv2では、バッチ正規化(Batch Normalization)、高解像度分類器、およびマルチスケール学習戦略が導入され、安定性と精度が向上しました16。YOLOv3は、バックボーンネットワークにDarknet-53を使用し、ターゲット検出を強化するためにFeature Pyramid Network(FPN)の概念から着想を得ています17。
YOLOv4はYOLOv3に基づいて数多くの最適化を行っており、モデルの性能をさらに向上させるために、Cross Stage Partial Network (CSPNet)18、Path Aggregation Network (PANet)19、およびMosaicデータ拡張などの技術を導入しています。YOLOv5はエンジニアリング面で大きな貢献を果たしており、より使いやすく効率的な実装を提供しています20。
近年、YOLOシリーズは進化を続けており、YOLOv6、YOLOv7、YOLOv8などのバージョンが次々とリリースされています。YOLOv7は、Extended Efficient Layer Aggregation Network(E-ELAN)構造とモデル再パラメータ化技術を導入することで、速度と精度の両面で新たなブレイクスルーを達成しました。これらの強化により、特徴学習の効率が向上しただけでなく、ネットワークの推論パフォーマンスが最適化され、YOLOv7は様々なリアルタイム物体検出タスクにおいて、以前のバージョンや多くの主要な検出器を凌駕しています。YOLOv8では、さらにネットワーク構造が最適化され、アンカーフリー設計の採用、モデルの簡素化、および汎化性能の向上が図られています21。
本研究で使用したYOLOv11は、以前のバージョンの利点を活かし、複雑な産業シナリオ向けに最適化されています。主な改良点として、特徴抽出ネットワーク、より効率的な特徴融合モジュール、およびより堅牢な損失関数の設計が挙げられます。これらの改善により、YOLOv11は製造環境における遮蔽物、小さなターゲット、および複雑な背景の処理において、より高い性能を発揮します。YOLOv11はUltralytics社によってリリースされたYOLOシリーズのバージョンです。YOLOv8と比較して、C3K2モジュールと特徴融合パスが改善されており、さらに適応的なアンカーボックス戦略が導入されたことで、産業シナリオにおける検出の堅牢性が向上しています。
畳み込みニューラルネットワーク(CNN)の基礎と進展
畳み込みニューラルネットワーク(CNN)は、コンピュータビジョンにおけるディープラーニングの成功に多大な影響を与えた極めて重要なモデルである。CNNは、畳み込み演算を通じて局所的な画像特徴を抽出し、続いてプーリング演算によって特徴量の次元を削減することで、階層的な画像抽象化を実現している22。
典型的なCNNは、複数の畳み込み層、プーリング層、および全結合層で構成されています。畳み込み層は、畳み込みカーネルを用いて入力画像を走査し、局所領域で内積を計算し、特徴マップを生成します。計算プロセスを式(2)に示します:
(2)
xを入力画像、wkおよびbkをそれぞれ畳み込みカーネルの重みとバイアスとし、
は位置(i,j)における出力特徴マップの値である。プーリング層では一般的に、マックスプーリング(Max Pooling)またはアベレージプーリング(Average Pooling)が使用される。全結合層は、特徴の抽出および分類確率の予測を担う。
これに基づき、本論文ではYOLOv11向けにCNN特徴量強化モジュールを設計した。これは2つの並列ブランチで構成されており、一つは3 × 3および5 × 5の畳み込みカーネルを用いてマルチスケール特徴を抽出するマルチスケール畳み込みブランチであり、もう一つはチャネルアテンション(Squeeze-and-Excitation)と空間アテンションモジュールを順次接続して主要ターゲットの識別的特徴を強化するアテンションブランチである。これら2つのブランチの出力は要素ごとの加算によって融合され、対応する特徴量強化損失関数を式(3)に示す。
(3)
Lcoordはバウンディングボックス座標回帰損失、Lconfはターゲット信頼度損失、Lclsはカテゴリ分類損失、Lfeatは特徴量強化損失であり、後者はCNN強化モジュールによって抽出された小規模ターゲットおよび遮蔽ターゲットの識別的特徴を制約するために使用されます。λcoord、λconf、λcls、λfeatは、対応する損失項の重み係数です。本タスクでは、λfeat = 0.05に設定し、残りの重みは検出タスクの要件に応じて調整しました。
VGGNet23やResNet24などの古典的なCNN構造は、画像分類タスクにおいて大きな成功を収めています。これらのアーキテクチャの中でも、ResNetは深層ネットワークの学習における勾配消失問題を効果的に緩和し、それによってより深く複雑なネットワーク構造の構築を可能にしています。
物体検出タスクにおいて、CNNは通常、特徴抽出器(バックボーン)として使用されます。例えば、YOLOシリーズのアルゴリズムにおけるDarknetやcross-stage partial Darknet(CSPDarknet)などは、すべてCNNに基づいて構築されています25。特徴抽出能力を向上させるため、研究者は数多くの改良されたCNN構造を提案してきました。例えば、Inceptionモジュールはマルチスケールの畳み込みカーネルを用いて並列に特徴を抽出します。DenseNetは密な接続(dense connections)により特徴の再利用性を高めています。Squeeze-and-Excitation Networkは、アテンションメカニズムを通じて特徴チャネルの重要度を適応的に調整します26。
本研究では、YOLOv11の特徴抽出能力を向上させるために、改良されたCNNモジュールを設計しました。このモジュールは、マルチスケール特徴融合とアテンションメカニズムを組み合わせることで、生産ラインのシナリオにおける重要な安全情報をより効果的にキャプチャします。
産業安全モニタリングにおけるディープラーニングの適用状況
産業安全モニタリングにおいて、ディープラーニングが大きな注目を集めています。CNNベースのアルゴリズムは、作業員が安全ヘルメットを適切に着用しているかの判定、危険区域への不正侵入の検知、および故障した設備の状況監視に採用されています27。
行動認識に関しては、3D CNNおよびリカレントニューラルネットワークを用いて作業者の操作行動を分析し、潜在的に危険な動作を特定します。例えば、作業者の姿勢シーケンスを分析することで、安全操作手順に違反しているかどうかを判断できます28。
YOLOおよびFaster R-CNNは、リアルタイム監視ビデオにおける人員および機器の検出に広く利用されています。例えば、文献ではYOLOv5に基づいたリアルタイムヘルメット検出システムが提案されており、建設現場の安全管理の知能化を効果的に向上させています29。
既存の研究である程度の進展は見られるものの、依然としていくつかの課題が残っている。第一に、産業現場では一般的に複雑な照明条件、遮蔽、および背景干渉が存在し、アルゴリズムに極めて高い堅牢性が求められる。第二に、リアルタイム性能が重要な要件であり、精度を維持しつつ高速な推論を実現しなければならない。最後に、既存の研究は主に単一タスクの検出に焦点を当てており、多ソース情報の融合や包括的な分析に関する探索が不足している30。
本研究で提案するYOLOv11とCNNの融合モデルは、上述の課題に対処し、特徴抽出および融合能力を向上させることで、製造ラインにおける安全リスクの包括的かつリアルタイムなモニタリングを実現することを目的としています。
YOLOv11およびCNNアルゴリズム
システム全体のアーキテクチャ
本論文で提案する生産ライン安全監視システムは、YOLOv11と改良型CNNを組み合わせたハイブリッドアーキテクチャを採用し、高精度かつ高速なリアルタイム安全監視を実現している。図1に示すように、本システムは主に、入力前処理モジュール、YOLOv11物体検出モジュール、CNN特徴強化モジュール、および融合決定モジュールの4つで構成される。まず、入力画像は前処理モジュールによって正規化および拡張され、モデルの汎化能力が向上する。その後、CSPDarknetバックボーンによって特徴が抽出され、空間ピラミッドプーリング-fast (SPPF) モジュールによって受容野が拡大される。アップサンプリング後にマルチスケール特徴が融合され、融合された特徴に対してチャネルアテンションと空間アテンションを順次適用することで、重要ターゲットの識別表現をさらに強化する。CNN特徴強化モジュールは、YOLOv11バックボーンネットワークのC3、C4、C5層の出力後に挿入され、それぞれ80 × 80 × 256、40 × 40 × 512、20 × 20 × 1,024のサイズのマルチスケール特徴マップを受け取る。このCNN特徴強化モジュールにより、小型のターゲットや遮蔽されたターゲットの特徴抽出がさらに強化される。最終的に、融合決定モジュールがYOLOv11の検出結果とCNNで強化された特徴を組み合わせ、設計された損失関数を通じて共同的に最適化することで、ターゲットの正確な位置、カテゴリ、および信頼度スコアを出力する。
YOLOv11検出フレームワーク
YOLOv11では、YOLOシリーズのシングルステージ検出フレームワークの強みを活かした、いくつかの重要な機能強化が導入されています。そのアーキテクチャは、バックボーンネットワーク、特徴融合ネットワーク、および検出ヘッドの3つの主要コンポーネントで構成されています。バックボーンネットワークには、強化されたCSPDarknet構造が採用されています。特徴融合ネットワークには、クロスステージ局部接続と深度別分離畳み込みが組み込まれており、特徴ピラミッドネットワーク(FPN)やパス集約ネットワーク(PAN)から着想を得て、マルチスケール特徴を効果的に統合しています。
特徴量強化モジュール
特徴量強化モジュールは、主要な安全特性に対するモデルの感度を向上させることを目的としている。本モジュールはYOLOv11バックボーンネットワークの各層から出力される特徴マップを処理し、アップサンプリングおよびダウンサンプリング操作を通じて異なるスケール間の情報を融合させる。具体的には、マルチスケールブランチが空間的なスケールの多様性を捉え、アテンションブランチが重要なチャネルおよび位置応答を動的に強化する。これら2つのブランチは独立して機能するのではなく、残差接続と特徴量再校正(feature recalibration)を通じて相補的に融合される。各スケールで強化モジュールによって処理された特徴マップは、1×1畳み込みを介して元の特徴マップのチャネル数と一致するように調整され、その後、要素ごとの加算(element-wise addition)によって元のYOLOv11特徴マップと融合される。融合された特徴マップは、次段階の特徴ピラミッドネットワーク(FPN)に供給されてマルチスケール融合が行われ、これにより階層的な安全特性表現が形成される。モジュール間のシームレスな統合を確実にするため、エンドツーエンドの共同トレーニング戦略が採用されており、損失関数はYOLOv11の検出損失とCNNモジュールの特徴量強化損失で構成される。

図1. YOLOv11-CNNアルゴリズム。 特徴強化モジュールは、重要な安全上の特徴に対するモデルの感度を高めることを目的としています。このモジュールはYOLOv11バックボーンのさまざまなレイヤーからの特徴マップを処理し、アップサンプリングおよびダウンサンプリング操作を通じて異なるスケールの特徴を融合させます。さらに、チャネル注意および空間注意メカニズムが組み込まれています。YOLOv11とCNNモジュールのシームレスな統合を確実にするため、共同学習戦略が採用されています。学習中、両モジュールのパラメータはエンドツーエンドで最適化されます。損失関数は、YOLOv11の検出損失とCNNモジュールの特徴強化損失を組み合わせたものです。こちらのリンクをクリックして、この図の拡大版を表示してください。
提案されたYOLOv11とCNNの融合モデルが生産ラインの安全監視において有効であることを検証するため、さまざまな安全上の危険シナリオを網羅したデータセットを構築した。このデータセットは12,000枚の生産ラインのシーン画像で構成されており、ランダムシードを42に固定し、訓練用、検証用、テスト用に7:1.5:1.5の比率で分割した。データセットには、標準的な照明、低照度、部分的な遮蔽、高度な遮蔽、モーションブラー、および複雑な背景を含む、さまざまな作業条件が含まれている。推論の信頼度しきい値は0.5に、非最大値抑制(NMS)のしきい値は0.45に設定した。すべての実験は3回繰り返し行い、結果を平均 ± 標準偏差として報告した。アノテーションのカテゴリは、作業員、安全ヘルメット、ロボットアーム、危険エリア、工具、および車両とし、PASCAL Visual Object Classes (VOC) 形式を用いた。Intersection-over-Union (IoU) のしきい値は0.5に設定し、アノテーションの一貫性は2名によるクロスバリデーションを通じて検証した。入力画像は一律に640 × 640にスケーリングし、Mosaicデータによる拡張を行った。学習はSGDオプティマイザを用い、初期学習率0.01、モーメンタム0.9、荷重減衰0.0005、バッチサイズ32で実施した。学習は200エポック行い、学習率の調整にはコサインアニーリングを用いた。
モデルの有効性を徹底的に評価するために、さまざまな評価指標を利用した。具体的には、平均適合率(mAP)、画像フレームの処理速度を測定するための1秒あたりのフレーム数(FPS)、陽性予測の正確性を評価するための適合率(precision)、真陽性を検出するモデルの能力を測定するための再現率(recall)、および受信者動作特性(ROC)曲線下の面積であり、モデルの総合的な分類能力を反映する曲線下面積(AUC)を用いた。計算式は式(4)、(5)、(6)、(7)、(8)、(9)、(10)、(11)に示す:
(4)
(5)
(6)
再現率
(7)
(8)
(9)
(10)
(11)
ここで、mAP@0.5はIoU閾値0.5における平均適合率(mean average precision)を示し、Nはカテゴリー数、APiはi番目のカテゴリーの平均適合率、mAP@[0.5:0.95]は0.5から0.95までのIoU閾値にわたって算出されたmAPの平均である。TP、FP、FN、およびTNは、それぞれ真陽性、偽陽性、偽陰性、および真陰性の数表す。Fは処理された総フレーム数、Tは総処理時間、TPRは真陽性率、FPRは偽陽性率である。
YOLOv11検出コンポーネントの損失関数を式(12)に示す:
(12)
ここで、Lcoordは予測フレームと実フレームの間の偏差を、Lconfは予測フレームの信頼度誤差を、Lclassはカテゴリ予測誤差を表し、λcoord、λconf、およびλclassは対応する損失をバランスさせるために使用される重み係数である。
表1のデータを分析すると、提案手法はmAP@0.5で0.91、mAP@0.5:0.95で0.82を達成しており、YOLOv5と比較してそれぞれ0.04および0.04の向上が見られます。F1スコアは0.935であり、これも比較モデルよりも高くなっています。検出速度は120 FPSであり、Faster R-CNNの4倍ですが、YOLOv10およびYOLOv11よりはわずかに低くなっています。パラメータ数は6.7Mであり、YOLOv11よりわずか1.5M多いだけで、mAP@0.5は0.03向上しています。計算コストが同程度であるEfficientDetと比較すると、精度は0.06高く、パラメータ数は56%少なくなっています。これらのデータは、導入したマルチスケール融合とアテンションメカニズムが小ターゲットの検出精度を効果的に向上させ、速度と精度の良好なバランスを実現していることを示しています。要約すると、提案手法は検出精度と速度のバランスを実現しています。mAP@0.5は2番目に優れたモデルより0.02高く、F1スコアは0.935に達し、6.7Mのパラメータ数は実用的展開に十分な量です。マルチスケール融合とアテンションメカニズムにより、複雑なシーンにおける小型および遮蔽されたターゲットの認識能力が向上しています。本モデルは精度と効率のバランスが取れており、産業安全監視などのリアルタイムシナリオに適しています。なお、すべての比較モデルでは、公式の学習済み重みを使用し、入力解像度を640 × 640、NMSしきい値を0.45、信頼度しきい値を0.5に統一しています。
| 方法 | mAP@0.5 | mAP@0.5:0.95 | F1スコア | FPS | パラメータ数 (M) |
| YOLOv5 | 0.87 | 0.78 | 0.89 | 130 | 7.1 |
| EfficientDet | 0.85 | 0.73 | 0.88 | 50 | 15.3 |
| RetinaNet | 0.82 | 0.68 | 0.85 | 45 | 37.6 |
| Faster R-CNN | 0.84 | 0.7 | 0.87 | 30 | 45.2 |
| YOLOv10 | 0.89 | 0.77 | 0.88 | 135 | 5.3 |
| YOLOv11 | 0.88 | 0.75 | 0.895 | 140 | 5.2 |
| 当社の | 0.91 | 0.82 | 0.935 | 120 | 6.7 |
表1:モデル性能の総合比較表。データの分析により、提案手法はmAP@0.5が0.91、mAP@0.5:0.95が0.82を達成し、YOLOv5と比較してそれぞれ0.04および0.04向上したことが示されました。F1スコアは0.935であり、これも比較モデルより高い値となっています。検出速度は120 FPSであり、Faster R-CNNの4倍ですが、YOLOv10およびYOLOv11よりはわずかに低くなっています。パラメータ数は6.7Mであり、YOLOv11よりわずか1.5M多いだけで、mAP@0.5は0.03向上しています。計算コストが同等のEfficientDetと比較すると、精度は0.06高く、パラメータ数は56%少なくなっています。これらのデータは、導入したマルチスケール融合とアテンションメカニズムが、小ターゲット検出の精度を効果的に向上させ、速度と精度の良好なバランスを実現していることを証明しています。要約すると、提案手法は検出精度と速度のバランスを達成しています。mAP@0.5は2番目に優れたモデルよりも0.02高く、F1スコアは0.935に達し、6.7Mのパラメータは実用的な展開に十分な量です。マルチスケール融合とアテンションメカニズムにより、複雑なシーンにおける小型ターゲットや遮蔽ターゲットの認識能力が向上しています。本モデルは精度と効率性のバランスが取れており、産業安全監視などのリアルタイムシナリオに適しています。なお、すべての比較モデルでは公式の学習済み重みを使用し、入力解像度を640 × 640、NMSしきい値を0.45、信頼度しきい値を0.5に統一しています。
図2は、モデルの誤検出タイプの詳細な分析を示しています。YOLOv11 + CNNは、背景の誤検出率が最も低く(10,000フレームあたり85回)、誤検出の多くは類似した物体(62回)および部分的に遮蔽されたシーン(48回)で発生しています。ROC曲線の分析では、FPRが0.1の時にモデルのTPRが0.9(AUC = 0.98)に達しており、曲線間の間隔が最も狭いことは検出信頼性の高さを示しています。これらの分析結果は、モデルの性能を裏付けるだけでなく、特に類似した物体の識別能力を強化するという、今後の誤検出最適化に向けた明確な技術的ロードマップを提供しています。

図2誤差解析。 モデルの誤検出タイプの分析。YOLOv11 + CNNは背景の誤検出率が最も低く(10,000フレームあたり85回)、誤検出の大部分は類似物体(62回)および部分的に遮蔽されたシーン(48回)に集中していた。ROC曲線分析では、FPRが0.1の時点でモデルのTPRは0.9(AUC = 0.98)に達し、曲線間の間隔が最も狭いことは検出信頼性の妥当性を裏付けている。これらの分析結果は、モデルの性能を裏付けるだけでなく、特に類似物体を識別する能力を強化することによる、今後の誤検出最適化に向けた明確な技術的ロードマップを提供するものである。 この図の拡大版を表示するには、ここをクリックしてください。
図 3は、さまざまなハードウェアプラットフォームにおけるモデルのパフォーマンスを比較したものである。YOLOv11 + CNNは、Edge tensor processing unit (TPU) 上で18 msという極めて低いレイテンシを実現し、変動幅はわずか±2 msであり、消費電力は15 Wに抑制されている。スループットテストでは、Jetson Xavierエッジコンピューティングデバイスにおいて70 FPSの処理速度を達成し、99パーセンタイルレイテンシは50 ms以内に制御されている。これらの展開パフォーマンス指標により、産業分野におけるさまざまなコンピューティングプラットフォームの展開ニーズに適応することが可能となる。さらに誤差分析により、本モデルがリソース制限のある環境においても安定したパフォーマンスを維持できることが示され、工学的な適用可能性が実証された。

図3展開パフォーマンス。 様々なハードウェアプラットフォームにおけるモデルの性能比較を行う。YOLOv11 + CNNは、Edge TPUにおいて18 msという極めて低いレイテンシ(変動幅はわずか±2 ms)を達成し、消費電力は15 Wに抑制されている。スループット試験では、Jetson Xavierエッジコンピューティングデバイスにおいて70 FPSの処理速度を達成し、99パーセンタイルレイテンシは50 ms以内に制御されている。これらのデプロイメント性能指標は、本モデルが産業分野における様々なコンピューティングプラットフォームの展開ニーズに適応可能であることを示している。さらに誤差分析により、本モデルがリソース制約のある環境下でも安定した性能を維持できることが明らかになり、工学的な適用性が実証された。 この図の拡大版を表示するには、ここをクリックしてください。
図 4は、6つのターゲットカテゴリにおける各モデルの検出性能の差を比較したものである。YOLOv11 + CNNは、安全ヘルメット認識タスクにおいて0.96の精度を達成し、ベンチマークモデルを4パーセントポイント上回った。点描プロットは、モデルがカテゴリ間で最小限の性能変動(±0.05)を示すことを示しており、その汎化能力を反映している。ヒートマップとして提示された混同行列からは、危険区域とロボットアームの間で15%の相互誤検出があることが明らかになった。この知見は、今後のモデル最適化に向けた明確な方向性を提供するものである。

図4カテゴリー検出解析。 6つのターゲットカテゴリにおける各モデルの検出性能の差を比較した。YOLOv11 + CNNは、安全ヘルメットの認識タスクにおいて0.96の精度を達成し、ベンチマークモデルを4パーセントポイント上回った。ドットプロットは、モデルがカテゴリ間で最小限の性能変動(±0.05)を示すことを示しており、これはその汎化能力を反映している。ヒートマップとして提示された混同行列からは、危険区域とロボットアームの間で15%の相互誤検出があることが明らかになった。この知見は、今後のモデル最適化に向けた明確な方向性を提供するものである。 この図の拡大版を表示するには、ここをクリックしてください。
図 5に、各モデルのトレーニングプロセスの包括的な記録を示す。YOLOv11 + CNNは最も速い収束率を示し、30エポック以内に損失が0.1まで低下し、検証セットのmAP曲線とトレーニングセットとの差は一貫して1%未満であった。エラーバンドプロットの解析では、モデルの最終的な検証mAP@0.5は0.94 ± 0.01で安定しており、その性能変動範囲はRetinaNetのわずか3分の1であった。これらの結果は、共同トレーニングプロトコルの有効性を裏付けている。本モデルはトレーニングの初期段階で性能上の優位性を示しており、そのアーキテクチャ設計によって特徴を迅速に学習できることが示唆される。

図 5トレーニングプロセスの解析。 各モデルの学習プロセスの記録。YOLOv11 + CNNは最も速い収束速度を示し(30エポック以内に損失が0.1まで低下)、検証セットのmAP曲線と学習セットとの乖離は常に1%未満である。エラーバンドプロットの分析によれば、モデルの最終的な検証mAP@0.5は0.94 ± 0.01で安定しており、性能の変動範囲はRetinaNetのわずか3分の1である。これらの結果は、共同学習プロトコルの有効性を裏付けている。本モデルは学習の初期段階で性能上の優位性を示しており、そのアーキテクチャ設計により特徴を迅速に学習できることが示唆される。 こちらの図の拡大表示をご覧になるには、ここをクリックしてください。
表 2は、複雑な環境における異なる検出モデルの定量的性能結果を示しています。標準的な照明条件およびさまざまな極端なシナリオにわたるテストデータは、YOLOv11 + CNNがあらゆる条件下で最適な性能を維持していることを示しています。標準的な照明条件下では、本モデルのmAP@0.5は0.91に達し、YOLOv5(0.87)およびFaster R-CNN(0.84)よりも大幅に優れた結果となりました。環境条件が悪化すると、各モデルの性能は程度に差があるものの低下しますが、YOLOv11 + CNNは最も強い環境堅牢性を示しました。低照度条件下(< 50 lux)では、性能の低下はわずか3%(0.88まで)にとどまり、比較モデルの5%の低下よりも良好でした。また、高度に遮蔽されたシナリオ(> 50%)においても、mAPを0.78に維持でき、性能低下率(13%)はYOLOv5(15%)やFaster R-CNN(16%)よりも有意に小さい結果となりました。これらの結果は、YOLOv11 + CNNが特徴融合とアテンションメカニズムの改善を通じて、照度変化や遮蔽などの複雑な要因に対するモデルの適応性を向上させ、産業シナリオにおける実用的な応用をサポートすることを実証しています。
| 試験条件 | YOLOv11 + CNN | YOLOv5 | Faster R-CNN | 性能変動 |
| 標準照明 | 0.91 | 0.87 | 0.84 | 0.01 |
| 低照度(< 50ルクス) | 0.88 (-3%) | 0.82 (-5%) | 0.79 (-5%) | 0.02 |
| 部分閉塞(30%–50%) | 0.85 (-6%) | 0.80 (-7%) | 0.76 (-8%) | 0.03 |
| 重度閉塞(> 50%) | 0.78 (-13%) | 0.72 (-15%) | 0.68 (-16%) | 0.04 |
| モーションブラー | 0.83 (-8%) | 0.77 (-10%) | 0.73 (-11%) | 0.05 |
表2:環境適応性の定量分析表。 定量分析による複雑な環境における異なる検出モデルの性能。標準的な照明条件からさまざまな極端なシナリオに至るテストデータは、すべてのテスト条件下でYOLOv11 + CNNが最高の性能を維持することを示している。標準的な照明条件下では、このモデルのmAP@0.5は0.91に達し、YOLOv5(0.87)およびFaster R-CNN(0.84)よりも有意に優れていた。環境条件が悪化するにつれて、各モデルの性能はさまざまな程度で低下したが、評価したモデルの中でYOLOv11 + CNNが最強の環境ロバスト性を示した。低照度条件(< 50 lux)では、性能の低下はわずか3%(0.88まで)にとどまり、比較モデルの5%の低下よりも良好であった。また、高度な遮蔽シナリオ(> 50%)においても、mAPを0.78に維持でき、性能劣化(13%)はYOLOv5(15%)およびFaster R-CNN(16%)よりも有意に小さかった。これらの結果は、YOLOv11 + CNNが、改善された特徴融合メカニズムとアテンション設計を通じて、照度変化や遮蔽干渉などの複雑な要因に対するモデルの適応性を高め、産業シナリオにおける実用的応用をサポートすることを実証している。
表 3 は、本実験でSGDオプティマイザが使用されたことを示しており、収束を加速させ振動を抑制するために0.9のモーメンタムが設定されました。初期学習率は0.01とし、コサインアニーリングを用いてトレーニング中に徐々に減衰させることで最適化を精緻化しました。また、L2正則化を適用し過学習を軽減するために、0.0005のウェイトディケイを導入しました。バッチサイズは32とし、計算効率と勾配推定の安定性のバランスを図りました。トレーニングエポック数は200回とし、十分な収束を確保しました。これらのパラメータは、トレーニング速度と精度のバランスを考慮し、シングルステージ検出タスクに適応させました。
| パラメータ | 値 |
| オプティマイザ | 確率的勾配降下法 |
| 初期学習率 | 0.01 |
| 運動量 | 0.9 |
| 荷重減衰 | 0.0005 |
| バッチサイズ | 32 |
| 学習エポック数 | 200 |
| 学習率スケジューリング | コサインアニーリング |
表3:トレーニングハイパーパラメータ表。 本実験ではSGDオプティマイザを使用し、収束の加速と振動の抑制のためにモメンタムを0.9に設定した。初期学習率として0.01を採用し、トレーニング中に徐々に減衰させて最適化を精緻化するコサインアニーリングを適用した。L2正則化を適用し過学習を抑制するため、0.0005のウェイトディケイを導入した。バッチサイズは、計算効率と勾配推定の安定性を両立させるため32とした。トレーニングエポック数を200回に設定することで、十分な収束を確保した。これらのパラメータは、トレーニング速度と精度のバランスを考慮し、シングルステージ検出タスクに合わせて調整した。
表4は、YOLOv11をベースラインとした場合、mAP@0.5が0.89であることを示しています。マルチスケール融合のみを導入すると、精度は0.88に低下します。さらにチャネルアテンションと空間アテンションを順次層状に追加することで、精度はそれぞれ0.90および0.89に向上します。すべてのモジュールを組み合わせた精度は0.91に達し、ベースラインから0.02の向上が見られました。これらのデータは、チャネルアテンションが直接的に精度を向上させること、およびマルチスケールとアテンションを組み合わせた性能が最適であることを示しています。
| 構成 | mAP@0.5 |
| YOLOv11 (ベースライン) | 0.89 |
| + マルチスケール融合 | 0.88 |
| + マルチスケール + チャネルアテンション | 0.9 |
| + マルチスケール + 空間アテンション | 0.89 |
| フルモジュール (YOLOv11 + CNN) | 0.91 |
表4:アブレーションテスト表。YOLOv11をベースラインとした場合、mAP@0.5は0.89である。マルチスケール融合のみを導入すると、精度は0.88に低下する。マルチスケール融合の後にチャネルアテンションまたは空間アテンションを追加すると、精度はそれぞれ0.90および0.89に向上する。すべてのモジュールを組み合わせた場合の精度は0.91に達し、ベースラインから0.02の向上が見られた。これらのデータは、本設定においてチャネルアテンションが空間アテンションよりも大きな改善をもたらすこと、およびマルチスケール融合とアテンションを組み合わせた性能が最適であることを示している。
図6では、極限環境におけるモデルの性能を体系的に評価しています。低照度条件下において、YOLOv11 + CNNのmAPはわずか6%(0.88まで)の低下に留まり、激しい遮蔽があるシーンにおいても0.78のmAP(ベンチマークを8%上回る)を維持しました。これらの結果は、本モデルが環境適応性を備えていることを示しており、産業現場における一般的な照明変化や局所的な遮蔽の問題に効果的に対処し、検出システムの安定した動作をサポートすることを証明しています。

図 6. 環境適応性。極限環境におけるモデル性能の系統的な評価。低照度条件下において、YOLOv11 + CNNのmAPはわずか6%(0.88まで)の低下にとどまり、激しい遮蔽があるシーンにおいても0.78のmAP(ベンチマークを8%上回る)を維持した。これらの結果は、本モデルが環境適応性を備えており、産業生産における一般的な照明変化や局所的な遮蔽の問題に効果的に対処でき、検出システムの安定した動作をサポートすることを実証している。こちらのリンクをクリックして、この図の拡大版を表示してください。
図 7 では、t-SNE次元削減を用いて、6種類の工業的ターゲットにおけるYOLOv11とYOLOv11 + CNNの特長量分布の違いを比較しています。左図では、基本モデルであるYOLOv11の特長量が、特に「危険区域(Danger Zone)」(赤)と「車両(Vehicle)」(紫)において顕著なクラス内分散(クラス内距離 2.34 ± 0.15)を示し、大幅に重複していることが分かります。これは、実験グループ3における15%の誤検出率と一致しています。右図では、改良されたYOLOv11 + CNNが、特長量強化モジュールを通じてクラス内コンパクト性を大幅に向上させ、各カテゴリ内のクラスター中心間の平均距離を1.8倍に増加させていることが示されています。

図7t-SNEによる特徴分布の比較 t-SNE次元削減を用いた、6種類の産業ターゲットにおけるYOLOv11とYOLOv11 + CNNの特長分布の差異の比較。左図は、基本モデルであるYOLOv11の特長が顕著なクラス内分散(クラス内距離 2.34 ± 0.15)を示しており、特に「Danger Zone(危険区域)」(赤)と「Vehicle(車両)」(紫)において大幅な重複が見られることを示しており、これは実験グループ3における15%の誤検出率と一致している。右図は、改良されたYOLOv11 + CNNが特長強化モジュールを通じてクラス内コンパクト性を大幅に向上させ、各カテゴリのクラスター中心間の平均距離が1.8倍に増加したことを示している。 この図の拡大版を表示するには、ここをクリックしてください。
図 8 は、系統的なアブレーション実験を通じて各モジュールの寄与を検証したものです。アブレーションの結果、マルチスケール融合後にチャネルアテンションを追加すると mAP@0.5 が 0.90 に向上し、空間アテンションを追加すると mAP@0.5 が 0.89 に向上することが示されました。フルモジュールでは、最高の mAP@0.5 である 0.91 を達成しています。ヒートマップの可視化により、複合アテンションメカニズムが、危険区域の中心(活性化値:+0.15)とエッジ部分の小ターゲット(+0.08)の両方に対する検出応答を同時に強化できることが示されました。実験データは、マルチスケール特徴融合とアテンションメカニズムに相乗効果があり、モデルが異なるスケールのターゲット検出要件を満たすことを可能にしていることを証明しています。

図8モジュール式アブレーション実験。 系統的なアブレーション実験による各モジュールの寄与の検証。アブレーションの結果、マルチスケール融合の後にチャネルアテンションを追加するとmAP@0.5は0.90に向上し、空間アテンションを追加するとmAP@0.5は0.89に向上した。フルモジュールでは、最高値となる0.91のmAP@0.5を達成した。ヒートマップによる可視化では、複合アテンションメカニズムが、危険領域の中心(活性化値:+0.15)とエッジにある小ターゲット(+0.08)に対する検出応答を同時に強化できることが示された。実験データは、マルチスケール特徴融合とアテンションメカニズムに相乗効果があり、これによりモデルが異なるスケールにわたるターゲット検出要件を満たすことが可能になることを実証している。 この図の拡大版を表示するには、ここをクリックしてください。
データの可用性:
量産ラインの生の画像およびビデオストリームの全データは、産業上の機密保持制限の対象となっており、公開されていません。補足データセット記述(Supplemental File 1)に、データセットの取得詳細、カテゴリおよびシナリオの分布、アノテーション仕様、品質管理手順、データ分割、前処理、およびデータ拡張の手順が記載されています。擬似コードおよび再現性フレームワーク(Supplemental File 2)に、擬似コードレベルのワークフロー、設定の説明、および再現のためのガイダンスが記載されています。非営利目的のアカデミック研究を対象として、機関および機密保持の制限に従い、匿名化されたサブセットおよび追加のサポート資料を責任著者に請求することができます。
補足ファイル 1. 補足データセットの説明。 このファイルでは、データセットの取得プロトコル、シナリオの網羅性、クラス分布、アノテーション仕様、品質管理手順、訓練/検証/テスト用データの分割、前処理、およびデータ拡張の手順について記述しています。こちらのリンクをクリックしてファイルをダウンロードしてください。
補足ファイル 2. 擬似コードおよび再現性フレームワーク。 このファイルでは、前処理、トレーニング、評価、およびデプロイのための擬似コードレベルのワークフローと設定の詳細を提供し、産業用生映像の制限およびサポート資料へのアクセスについて説明します。こちらをクリックしてファイルをダウンロードしてください。
実験結果により、提案されたYOLOv11–CNN融合モデルが、生産ラインの安全監視における検出精度とリアルタイム性を向上させることが示されました。YOLOv11の効率的なシングルステージ検出とCNNモジュールの特徴強化を活用することで、本システムは複雑な照明条件や遮蔽条件下においても、作業員、設備、および危険区域を特定しました。マルチスケール特徴融合とアテンションメカニズムにより、重要な安全要素への注目能力が向上し、早期警告のための解釈可能な視覚的根拠が提供されました。
本システムは、自動車製造や電子機器の組み立てなどの生産ラインにおいて実用的な価値を持ち、リアルタイムモニタリングによって目視検査への依存を減らし、潜在的な安全上の危険への対応時間を短縮できます。ネジや工具などの小型のターゲットや、ロボットアームやその他の設備によって部分的に遮蔽された作業員のターゲットに対しては、マルチスケール特徴融合とアテンションメカニズムにより、安全に関連する特徴を抽出および強調するモデルの能力が向上します。これらの改善は、ターゲットのサイズや視認性が多様な生産環境において有用です。
しかしながら、本研究には依然として明確な限界がある。激しい遮蔽や極めて低い照度下では、ターゲットの特徴情報が不完全となり、既存の畳み込み特徴が不十分になるため、モデルの性能が低下する可能性がある。新たに追加したCNN特徴強化モジュールにより1.5Mのパラメータが増加しており、低コストのエッジデバイスにおける計算負荷が増大し、リソース制限のある環境での展開が制限される可能性がある。また、本研究では可視光画像データを使用しており、赤外線サーモグラフィーやミリ波レーダーなどのマルチモーダルセンサー情報を統合していないため、完全な暗闇や煙の中などの極端な工業現場では性能が制限される可能性がある。
今後の研究では、以下の方向に重点を置く。検出性能を維持しつつパラメータ負荷を軽減するための、構造化プルーニングおよび知識蒸留に基づくモデルの軽量化。極端な照明条件下や煙の中での検出能力を向上させるための、可視光・赤外線マルチモーダル融合検出フレームワークの構築。一部の畳み込み層を置き換えて遠距離のコンテキスト特徴抽出を強化するための、軽量Transformerモジュールの導入。そして、ターゲット検出から行動の早期警告に至る全ワークフローをサポートするための、エンドツーエンドの異常行動認識サブシステムの開発である。
結論として、本研究では、YOLOv11とCNNアルゴリズムを融合させ、複雑な産業環境における潜在的な安全上の危険をリアルタイムで検出し、早期警告を可能にする生産ライン安全監視システムに焦点を当てました。実験的な検証を通じて、この融合モデルは物体検出精度と推論速度において性能上の優位性を示しました。効率的なシングルステージ検出アーキテクチャと最適化された特徴抽出を備えたYOLOv11は、作業員、設備、危険区域の迅速な識別に優れた性能を発揮し、生産ラインのシナリオにおける重要な安全要素を正確に捉えました。同時に、改良されたCNNモジュールの導入により、特徴抽出能力と遮蔽されたターゲットの検出能力がさらに向上しました。生産ラインの安全監視において、本モデルは視覚的分析を通じて画像内の重要な安全領域に自動的に注目し、安全警告のための解釈可能な根拠を提供します。この融合モデルは、加工、組立、倉庫管理を含むさまざまな生産ラインのシナリオにおいて、強力な適応性と安定性を実証しました。本論文の主な内容は以下の通りです。
(1) 検出速度と精度のバランスを最適化するため、YOLOv11とCNNを組み合わせたディープフュージョンアーキテクチャを設計した。
(2) 複雑なシナリオにおける重要な安全要素への注目能力を高めるため、マルチスケール特徴融合およびアテンション最適化メカニズムを構築した。
(3) 自作の生産ライン安全データセットを用いた実験の結果、本モデルはmAP@0.5で0.91、検出速度で120 FPSを達成した。また、クロスシナリオテストにおいても安定した性能を示した。
代表的なケーススタディでは、標準的な照明条件下において、露出度が40%に過ぎない安全ヘルメットが、マルチスケール融合とチャネルアテンションによって正確に検出された一方で(信頼度0.93)、ベースラインモデルはそれを背景として誤認したことが示されました。低照度シナリオにおいて作業員が危険区域に進入した際、空間アテンションは方向線を用いてターゲットを正常に境界設定できましたが、比較手法では検出に失敗しました。失敗例としては、激しい遮蔽下で背景とのテクスチャの類似性によりレンチが工具として誤検出されたケースや、低照度条件下での遠距離撮影時に信号対雑音比が低いために安全ヘルメットが見逃されたケースがあり、極端な条件下における特徴表現の限界が明らかになりました。これらの結果は、本モデルが通常および中程度の複雑なシナリオにおいて堅牢である一方で、極端な条件下では依然として改善が必要であることを示しています。
著者に開示すべき利益相反はありません。
本研究は、台州市大学高度人材科学研究財団「インテリジェント製造のための精密検出における基幹技術の研究」(TZXY2020QDJJ006)より一部助成を受けています。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| COCO API | N/A | ターゲット検出精度の評価および統計分析に使用した評価ツール。 | |
| CUDA 11.4 | NVIDIA | N/A | PyTorch 1.12フレームワークと共に使用した並列コンピューティングプラットフォーム。 |
| Edge TPU | N/A | レイテンシおよび消費電力のテストに使用したデプロイプラットフォーム。報告されたレイテンシは18 ms、消費電力は15 Wであった。 | |
| Jetson Xavier エッジコンピューティングデバイス | NVIDIA | スループットテストに使用したエッジコンピューティングデバイス。報告された処理速度は70 FPSであり、99パーセンタイルレイテンシは50 ms以内であった。 | |
| NVIDIA Tesla V100 GPU | NVIDIA | トレーニング/評価サーバーに使用したGPU。 | |
| PyTorch 1.12 | N/A | モデルのトレーニングおよび評価に使用したディープラーニングフレームワーク。 | |
| scikit-learn | N/A | モデル評価に使用した評価/統計分析ツール。 | |
| 自作生産ライン安全データセット | N/A | N/A | VOC形式の生産ラインシーン画像12,000枚からなるデータセット。標準照明、低照度、部分的遮蔽、高度な遮蔽、モーションブラー、複雑な背景を網羅しており、アノテーションカテゴリは作業員、安全ヘルメット、ロボットアーム、危険区域、工具、車両の6種類である。 |
| トレーニングサーバー | NVIDIA Tesla V100 GPUとUbuntu 20.04オペレーティングシステムを搭載したサーバー。 | ||
| Ubuntu 20.04 オペレーティングシステム | N/A | トレーニング/評価サーバーに使用したオペレーティングシステム。 | |
| VOCアノテーション形式 | N/A | N/A | 自作生産ライン安全データセットに使用したアノテーション形式。 |
| YOLOv11物体検出モデル | Ultralytics | N/A | 作業員、設備、および潜在的な危険をリアルタイムで検出するために使用した物体検出モデル。 |