本研究では、MIMIIデータセットを用いた産業用音響異常検知のために、CNN-transformerとSHAPを活用した、説明可能なAI(XAI)搭載のインダストリー5.0サイバーフィジカル協調フレームワークを提案します。エッジコンピューティングの統合により、解釈可能で人間中心の予知保全を実現します。
本研究では、MIMIIデータセットを用いた産業用音響異常検知のために、CNN-transformerとSHAPを活用した、説明可能なAI(XAI)搭載のインダストリー5.0サイバーフィジカル協調フレームワークを提案します。エッジコンピューティングの統合により、解釈可能で人間中心の予知保全を実現します。
本研究では、インダストリー5.0に向けた説明可能な人工知能(XAI)ベースのサイバーフィジカル協調システムを用いた、工業部品の持続可能な製造への革新的なアプローチを提案する。現在のサイバーフィジカル・ヒューマンシステム(CPHS)は、AIの統合が限定的であり、説明可能性に欠けることが多いことが分かっている。そのため、インダストリー5.0の原則であるレジリエンス、長期的な生存可能性、および人間中心性に沿って、その拡張性と柔軟性を向上させる必要がある。これらの欠点を解消するため、我々はディープラーニングと説明可能なAIをサイバーフィジカルシステム(CPS)エコシステムに統合し、スマートで説明可能な意思決定を可能にするアーキテクチャを導入する。具体的には、音響信号による機械故障検知にMalfunctioning Industrial Machine Investigation and Inspection(MIMII)データセットを使用する。オーディオ信号はスペクトル変換によってスペクトログラム画像に変換され、その後、空間的特徴抽出のための畳み込みニューラルネットワーク(CNN)と、時間的特徴抽出のためのトランスフォーマーエンコーダーによって処理される。透明性を向上させ、ヒューマンインザループ協調を促進するために、Shapley additive explanations(SHAP)ベースのアプローチを採用し、モデルの予測に影響を与える入力特徴を強調することで、オペレーターがシステムの意思決定プロセスを理解することを支援する。さらに、本フレームワークをエッジコンピューティングベースのサイバーフィジカルシステムに適用することで、低遅延かつ低消費電力を実現し、タイムリーなレスポンスを提供し、もって持続可能な生産環境の確保に寄与する。実験結果から、提案したCNN-Transformerアーキテクチャは98.5%の精度を達成し、低遅延を維持しつつ既存のCPHSシステムを上回ることが示された。このようなサイバーフィジカル協調システムに説明可能なAIを導入することで、オペレーターの信頼性が大幅に向上し、シームレスな人間と機械の協調が可能となる。
技術、機械化、通信を重視したインダストリー4.0から、技術的進歩に適応性、持続可能な開発、人間中心主義を組み合わせた新しいインダストリー5.0モデルへの移行は、産業システムのダイナミックな進化に影響を与えています1,2。欧州委員会は、インダストリー5.0を、生産性と効率だけでなく、人間中心主義、持続可能性、レジリエンスという3つの柱に焦点を当てたパラダイムであると定義しています。近年の研究では、AIシステム、人間と機械の協調、および持続可能な製造が、インダストリー5.0環境の主要な推進要因であることが指摘されています3,4。このような進化する産業環境において、従来のメンテナンス手法ではもはや十分ではありません。複雑で不安定な状況下でレジリエンスを実現するためには、メンテナンスはより適応的かつ体系的な形態へと進化する必要があります5。2011年以来、インダストリー4.0は欧州における産業変革の支配的なモデルとなっており、運用の強化と利用可能なリソースの最大化を図るための企業のデジタルトランスフォーメーションを促進してきました4。したがって、労働者の健康と安全を保護しつつ、生産における人的労働を排除することなく効率を高めることが不可欠です。こうした背景から、日本の「Society 5.0」の概念にも一部触発され、企業や学術界はインダストリー5.0パラダイムの原則を定義し始めています5,6,7,8,9,10,11。近年の文献では持続可能なメンテナンスが重視されていますが、既存の体系的な評価の多くは断片的であるか、あるいは特定のドメインに限定されており、レジリエンス、持続可能性、およびAIを統合した包括的なフレームワークが不足しています。例えば、ある著者は持続可能な全設備保全(STPM)を含む特定のシステムや戦略に対する持続可能なメンテナンス手法を検討しており、別の研究者はメンテナンス技術への持続可能性テーマの組み込みについて論じています12,13,14。ある著者は、持続可能性の導入基準について包括的な評価を行い、製造業が持続可能性に肯定的な影響を与えることを可能にする技術的要因を明らかにしました15。それにもかかわらず、インダストリー5.0のパラダイムにおいて、持続可能性、レジリエンス、およびAIベースの意思決定が完全に統合されている研究は、これらの作品のいずれにも見られません。その結果、個別のメンテナンス手法で持続可能性に対処することが頻繁に行われています。説明可能な人工知能(XAI)技術の中でも、SHAPはその理論的に健全な特徴量寄与度の算出手法により、際立った存在となっています16,17,18。
データ駆動型の意思決定はAIによって可能になりますが、精度の高いモデルには多くの場合、大量のデータが必要です。決定木、ロジスティック回帰、線形回帰などの従来の機械学習(ML)手法は、比較的単純なデータ分布を想定しているため、高度に非線形な状況では性能が低下することが頻繁にあります19。ディープニューラルネットワーク(DNN)は、大規模なデータセットから複雑な特徴表現を学習することで、これらの制限を克服します20。研究によれば、複雑な意思決定タスクにおいては、浅い構造よりも深いネットワークの方が優れた性能を示すことが多いですが21、ネットワークの深化とパラメータの複雑化に伴い、モデルの解釈性は低下します22。
サイバーフィジカルシステム(CPS)は、分散型インテリジェンス、組み込みコンピュータ、物理プロセス、および通信を組み合わせているため、インダストリー5.0の製造における重要なイネーブリングテクノロジーとなります。柔軟でインテリジェントなリアルタイムの産業オペレーションを実現するため、現代のCPSはエッジコンピューティング、エッジAI、およびグリーンIoT(G-IoT)を急速に統合しています23,24。メンテナンス4.0およびスマートメンテナンスに関する近年の研究では、サステナビリティとレジリエンスが強調されています。先行研究では、持続可能な製造におけるメンテナンス4.0技術の重要性が検討され、持続可能なメンテナンスのためのモデリングフレームワークが提案されており、計量書誌学的および体系的な研究によってスマートメンテナンス技術が評価されています25,26,27,28。さらに、インダストリー4.0環境およびサステナビリティ志向の生産システムへの持続可能なメンテナンスの統合に関する研究も行われています29,30,31,32。オペレーター4.0のコンセプト33、人間中心のインダストリー5.0フレームワーク34、および社会経済的視点35のすべてにおいて、人間中心のメンテナンスが大きな注目を集めています。加えて、デジタルメンテナンス36、予知・処方保全37,38、および持続可能なメンテナンス戦略39,40の進展が近年の研究で強調されています。これらの進展にもかかわらず、研究は依然として分散しており、説明可能なAI、サステナビリティ、レジリエンス、および人間中心のサイバーフィジカル協調を統合した統一的なパラダイムを提示している研究はほとんどありません。サイバーフィジカルシステム(CPS)は、導入が進んでいるものの完全な自律性は達成しておらず、インダストリー5.0のパラダイムにおいても自律性は重視されていません。対照的に、インダストリー5.0では、人間の監視、協調、および意思決定に大きな重点が置かれています。サイバーフィジカルプロセスに人間の思考と協調を組み込むことで、ヒューマンインザループCPS(HiLCPS)41、人間中心CPS(HCPS)42,43、およびサイバーフィジカルヒューマンシステム(CPHS)44などのサイバーヒューマンシステムが、従来のCPSを拡張しています。この統合により、インテリジェントシステムと人間オペレーターとのリアルタイムなコラボレーションが可能となり、適応性、透明性、安全性、およびレジリエンスが向上します45,46。
産業用オーディオ異常検知は、Vision Transformer (ViT)、Audio Spectrogram Transformer (AST)、Conformer、および自己教師あり学習を含む新しいアーキテクチャによって大幅に強化されました。しかし、これらをインダストリー5.0に向けた説明可能なサイバーフィジカルシステムに統合する取り組みは依然として限定的です。説明可能性、エッジ展開、およびヒューマンインザループによる意思決定支援を単一のフレームワークに統合していないため、現在の研究は主に分類精度や、事後的なXAIベースの解釈可能性に焦点を当てています。本研究では、エッジコンピューティング、時間的依存性のモデリング、SHAPベースの説明可能性、空間的特徴学習、および人間中心の意思決定支援を組み合わせた、新しい説明可能AI(Explainable AI)対応のCNN-Transformerサイバーフィジカル協調アーキテクチャを提案し、これらの制約を克服して持続可能なインダストリー5.0の製造を実現します。
したがって、依然として大幅な研究上の不足がある。現在のCNN/Transformerベースの音響異常検知技術は、分類性能を重視しているが、サイバー物理的な協調性と説明可能性に欠けている。インダストリー5.0のフレームワークは、人間中心の概念的なモデルを提示しているものの、説明可能なディープラーニング、エッジインテリジェンス、およびオペレーター支援による意思決定を単一のシステムに統合していない。一方で、XAIベースの予知保全技術は透明性を高めるが、CPHSアーキテクチャとは独立して動作している。それゆえ、高精度な音響異常検知、SHAPベースの説明可能性、エッジ対応のデプロイメント、およびヒューマンインザループによる協調を統合した単一のインダストリー5.0サイバー物理人間システムは、未だに欠如している。
本論文では、これらの制約を克服するために、インダストリー5.0に向けた、説明可能なAI(Explainable AI)を搭載したCNN-Transformerによるサイバー物理コラボレーションの新しいパラダイムを提案します。提案するアーキテクチャは、エッジコンピューティングの展開、CNNベースの空間的特徴抽出、Transformerベースの時間的依存関係学習、SHAPベースの説明可能性、およびヒューマンインザループによる意思決定支援を、単一のCPHSフレームワークに統合したものです。これらの要素を個別に処理する従来の手法とは対照的に、提案するフレームワークは、持続可能な製造に向けた異常検知性能、モデルの透明性、運用効率、および人間中心のコラボレーションを同時に向上させる統合的なソリューションを提供します。
本研究の主な目的は、SHAPベースの説明可能性、エッジコンピューティング、およびヒューマンインザループ意思決定支援を、ハイブリッドCNN-Transformerベースの音響異常検知手法と組み合わせることで、持続可能なインダストリー5.0製造のための説明可能なAI(XAI)搭載サイバーフィジカルヒューマンシステム(CPHS)を構築することである。特に、提案するフレームワークは、明確で理解しやすい予測を提供しながら異常検知の精度を向上させ、効率的なエッジへの展開を促進し、知能システムと人間のオペレーターとの間の協調的な意思決定を促進することを目的としている。高い検知性能、説明可能性、低遅延動作、および人間中心のサイバーフィジカル協調を同時に実現することで、この統合アーキテクチャは、現在の音響異常検知、XAIベースの予知保全、およびCPHSフレームワークの欠点を解消する。
提案されたアーキテクチャは、主に分類精度に焦点を当てている現在の音響異常検知技術とは対照的に、インダストリー5.0に向けた統一的な説明可能なAI(XAI)搭載サイバーフィジカル・ヒューマンシステム(CPHS)を提示するものである。本アーキテクチャは、CNNベースの空間的特徴抽出、Transformerベースの時間的モデリング、SHAPベースの説明可能性、エッジコンピューティング、およびヒューマンインザループによる意思決定支援を単一の構造内で統合している。提案されたアーキテクチャは、高精度な異常検知を理解可能な意思決定およびリアルタイムのエッジ展開と融合させることで、透明性、オペレーター支援、およびサイバーフィジカル協調という重要な課題を解決する。本研究の主な科学的貢献はシステムレベルの統合であり、これにより、異常検知、説明可能なAI、またはインダストリー5.0フレームワークのいずれか単独に焦点を当てていた先行研究と本アプローチを差別化している。
提案された手法では、持続可能な製造プロセスの支援を目的として、説明可能なディープラーニングとエッジコンピューティングによるサイバーフィジカル協調フレームワークを組み合わせた、システムベースのインダストリー5.0サイバーフィジカルヒューマンシステム(CPHS)アプローチを採用しています。まず、AIによるインテリジェンス、説明可能性、および人間中心の協調の欠如といった、現在のCPHSソリューションにおける特定の限界を認識することで課題を明確にします。これらの課題に対処するため、提案するソリューションでは、音響信号処理を用いた産業機械の状態監視にMIMIIデータセットを活用しています。
提案されたフレームワークでは、まず生成されたスペクトログラムをCNNモデルに入力し、異なる機械状態に関連する重要な周波数パターンを認識することで空間的特徴を抽出します。抽出された空間的特徴はシーケンスに変換され、トランスフォーマーエンコーダーモジュールに入力され、セルフアテンションを通じて時間的依存性が捉えられます。その後、変換された特徴表現は全結合分類器モジュールに渡され、機械の状態が正常か異常であるかを分類します。さらに、透明性を確保し、人間中心の意思決定を促進するために、SHAP説明可能性アプローチを採用し、モデル出力における重要な時間・周波数領域を選択することで予測結果を説明します。設計されたモデルはエッジ対応のCPS環境に実装され、低い計算レイテンシとエネルギー消費でリアルタイム推論を可能にします。加えて、人間が説明可能性の結果を用いて検証できるように、ヒューマンインザループ方式が統合されます。性能は、正解率、適合率、再現率、F1スコアに加え、レイテンシやエネルギー効率などのシステムレベルの指標を用いて検証されます。
提案されたフレームワークは、インダストリー5.0の文脈における持続可能な製造のためのXAI駆動型CPHSメカニズムであり、そのワークフローは、図1に示すように、データ収集からインテリジェントな意思決定および実行に至るパイプラインとして提示されています。データ収集手順の初期段階では、MIMIIなどのデータセットを用い、モーター、ポンプ、ベアリングなどの産業機器から音声信号を収集します。こうして得られたデータ信号は、データ前処理と呼ばれる次の段階に送られ、そこでフィルタリング、正規化、およびセグメンテーションが行われます。最終的に、セグメント化されたデータ信号は、特徴量表現レイヤーにおいて短時間フーリエ変換(STFT)を用いてスペクトログラムに変換されます。
次に、AIモデル層がスペクトログラム画像を用い、CNNモジュールを介して特徴を抽出して、空間的なパターンと異常を特定します。その後、抽出された特徴がリシェイプされ、トランスフォーマーエンコーダーに入力され、自己注意(self-attention)メカニズムを通じて時間的な依存関係と長距離の相関関係を学習します。得られた特徴ベクトルは、分類層を用いて正常または異常として分類されます。予測プロセスの透明性を確保するため、説明可能性層はSHAPを用いて、スペクトログラム内の重要な時間-周波数領域を強調表示します。
さらに、オペレーターがモデルの結果を解釈し、フィードバックを提供するヒューマンインザループのプロセスが組み込まれています。デプロイメント層では、モデルがエッジベースのCPHSインフラストラクチャ上で動作し、高速な推論と低消費電力を実現すると同時に、ストレージ要件や高度な分析のためにオプションでクラウドシステムと連携します。総じて、このフレームワークは、インダストリー5.0の要件に沿った正確な故障検知、説明責任、および効率的なリアルタイム運用を保証します。
問題定義および要件分析
インダストリー5.0の設定におけるサイバーフィジカルヒューマンシステム(CPHS)は、知能化、持続可能性、および人間中心性を約束するものです。しかし、CPHSを構築するための現代的なフレームワークは、高度なAI機能、説明可能性、および人間と機械の協調に対する十分なサポートが不足していることに妨げられています。実際、従来のCPHSはルールベースまたは解釈不可能なモデルに基づいているため、変化する産業条件への適応が困難であり、自動化に対するオペレーターの信頼を制限しています。さらに、従来のCPHSでは、予知保全に重要となる、空間的(すなわち周波数)成分と時間依存的成分の両方を含む産業用音響信号のような、高度に洗練されたデータを効果的に分析することができません。したがって、機械の異常を高精度に検出し、説明を提供し、エッジで動作させることができ、それによってCPSを可能にするフレームワークを構築する必要があります。
ここで、x(t)は音響入力信号、S(f,t) は信号のスペクトログラム表現、
はラベル、そして θはCNN-Transformerアーキテクチャのパラメータセットです。以降の式で使用される記号は、数学的な正確性を維持するため、最初に出現した直後に導入されます。
数学的な観点から、このタスクは教師あり学習の問題として定式化できます。工業用音響信号をx(t)で表すと、x(t)のSTFTは以下の式に従って計算されます:
(1)
ここで、 ω(.)は窓関数、fは周波数を表します。生成されたスペクトログラム
がディープラーニングアルゴリズムへの入力として使用されます。目的は、マッピング関数を学習させることです。
(2)
ここで、
はクラスラベル(正常または異常のいずれか)であり、Sはスペクトログラム入力、yは予測出力ラベル、 θはCNN-Transformerアーキテクチャの学習可能パラメータのセットである。最適化問題は、分類損失の最小化として定式化される:
(3)
最小レイテンシ
、エネルギー効率
、および解釈可能性の制約条件下において、ここで説明 ∅(SHAP) は予測プロセスにおける特徴量の重要性を捉えるものである。
(4)
ここで、
は各個々の特徴量の寄与分である。上述の内容に基づき、設計要件には以下が含まれる:(i) ハイブリッドディープラーニングに基づく信頼性の高い異常検知、(ii) 人間による介入のための解釈可能な出力、および (iii) エッジ強化型CPSフレームワークへの実装。
データセットの取得と前処理
この点に関して、提案された説明可能なAIベースのCPHSフレームワークを評価するため、MIMIIデータセット13を選択しました。このデータセットは、音響信号を用いて産業機械の異常を検出するための広く利用されているベンチマークです。本データベースには、スライドレール、ファン、ポンプ、バルブなどのさまざまな機械の、正常時および故障時の動作条件下での録音データが含まれています。各機械について、録音内容は異なる設定やノイズ環境によって異なります。これにより、リアルタイムの産業条件下でモデルをトレーニングおよび評価するのに適しています。
MIMIIデータセットは、トレーニング中に正常サンプルのみに依存する教師なし異常検知の研究で広く使用されていますが、正常および異常な機械状態の両方の明示的なアノテーションが含まれています。本研究では、提案する説明可能なAI(Explainable AI)ベースのCNN-Transformerアーキテクチャが、正常な機械状態と故障状態を分離できる能力を検証するため、この問題を教師あり二値分類タスクとして設定しています。具体的には、MIMIIの公式ラベルを使用し、正常サンプルにクラスラベル0を、異常サンプルにクラスラベル1を割り当てています。
表 1にデータセット記述の詳細を示します。本研究では、正常および故障時の機械動作の両方を含む、約 12,000 件の音響信号録音が検討されています。要件に従い、本研究におけるすべての録音は 16 kHz でキャプチャされ、長さは 10 s です。データセットには約 12,000 件の録音が含まれていますが、混同行列を可視化する目的のみで、クラスバランスを調整した 2,000 件のテスト録音サブセットを選択しました。報告されたすべての性能指標は、完全なテストセット(約 2,400 件の録音)を用いて算出されました。さらに、モデル学習のために、トレーニングサンプルとテストサンプルを 80:20 の比率で分離しています。このデータベースはリアルタイムのノイズ条件を含んでいるため、Industry 5.0 のアプリケーションに適しています。本研究で使用した録音の分布を表 2に示します。このデータセットから、すべての機械タイプおよび信号対雑音比(SNR)条件を網羅する約 12,000 件の録音を選択し、80:20 のトレーニング/テスト分割を用いて教師あり二値分類実験を行いました。表 2 には、産業用機械のタイプ、対応する機械 ID、正常および異常な音響録音の総数、SNR 条件、および教師あり二値分類に採用した実験的なトレーニング/テスト分割が示されています。
本実験は、ファン、ポンプ、バルブ、スライドレールの4種類の産業機械で構成されるMIMII(Malfunctioning Industrial Machine Investigation and Inspection)データセット バージョン1.0を用いて実施した。データは、機械の種類に応じて異なるマシンID(ID00〜ID06)および条件から収集された。MIMIIデータベースには、信号対雑音比(SNR)が−6 dB、0 dB、+6 dBで取得されたデータが含まれている。正常データは産業機械の健全な状態に対応し、異常データは異常な状態に対応する。クラスはデータベースのアノテーションに基づいてラベル付けされ、正常データはクラス0、異常データはクラス1としてラベル付けされた。
公正な評価手順を行うため、分割、拡張、またはスペクトログラム作成のどの工程よりも前に、元のオーディオ録音レベルで訓練セットとテストセットを分割する必要がありました。その結果、同一の録音からのオーディオセグメントが訓練セットとテストセットの両方に現れることはありません。評価実験では、異なる信号対雑音比(−6 dB、0 dB、および +6 dB)の録音が使用され、これにより様々な産業条件下で提案されたフレームワークを評価することが可能となりました。
データリークを防ぐため、セグメンテーションやスペクトログラムの生成を行う前に、元のオーディオファイルを基準として学習データとテストデータの分割を行った。同一の10 sオーディオ録音からのセグメントは、学習セットまたはテストセットのいずれか一方にのみ割り当てられ、両方のセットに同一のセグメントが存在しないようにした。その後、各データセットに対して個別にスペクトログラムの生成およびデータ拡張を行った。これにより、データリークの問題が回避され、性能の過剰に楽観的な評価を防いでいる。
データセットの前処理
MIMIIデータセットから得られた未処理の音響信号は、信号品質を向上させ、効果的な特徴抽出を可能にするために処理されます。入力信号をx(t)とし、tを時間とします。最初の工程はノイズフィルタリングであり、以下のフィルタリング関数を用いて背景ノイズが除去されます。
(5)
ここで、∗は畳み込み演算を表し、h(t)はフィルタのインパルス応答です。このプロセスにより、音響信号の明瞭度が向上し、産業環境で頻繁に発生するノイズの影響が最小限に抑えられます。また、信号正規化を用いて、ディープラーニングモデルに入力する前に、すべてのオーディオ信号の振幅が比較可能であることを保証します。xn(t)で表される正規化後の信号は、次のように計算されます:
(6)
ここで、 μ および σは、それぞれ入力信号の平均値および標準偏差である。この手順により、すべての入力信号は平均が0、分散が1であることが保証される。最後に、処理のために、正規化された入力信号を複数の小さな断片に分割する。信号全体の長さをTとすると、スライディングウィンドウ関数を用いて、長さLを持つN個のオーバーラップするフレームに分割される。
(7)
ここでHはホップサイズです。スペクトログラムは以下の式で定義できます:
(8)
このようにして得られたスペクトログラムは、CNN-transformerベースのフレームワークに入力され、異常検出を成功させるための空間的および時間的特徴が抽出されます。図2に前処理パイプラインを示します。
図2は、産業界で取得される音響データに適用可能な垂直前処理パイプラインを示しています。まず、MIMIIデータセットから生のオーディオ信号を抽出し、ノイズ除去ステージに送ってノイズを低減させます。次に、振幅の不整合を取り除き、信号の整合性を確保するために信号の正規化を行います。その後、信号を重複のある小さなセクションに分割します。セグメンテーションに続き、STFT変換をデータに適用し、時間領域信号を時間周波数信号に変換します。その後、信号のスペクトログラムを生成するプロセスの一環として、パワースペクトルを算出します。これにより、前処理済みのスペクトログラムがプロセスから出力され、提案するCNN-transformerモデルに使用されます。
スペクトログラムの作成
データの正規化およびセグメンテーションの後、短時間フーリエ変換(STFT)を用いて音響信号を時間-周波数表現に変換します。得られたスペクトログラムにより、分析期間における周波数組成の変化を視覚的に表現することができます。産業現場において、機械の故障は通常、周波数パターンとして現れるため、スペクトログラムは機械の異常検知に非常に有用です。
したがって、得られた処理済みデータは、機械内部の正常例と異常例を区別するためにスペクトログラム画像に変換されます。オーディオデータは複数のスペクトログラムに変換され、学習モデルが機械プロセス内の局所的な周波数成分と時間的変化を分析できるようにします。これらの画像はCNN-transformerモデルの入力データとして使用され、CNNが空間的(周波数)パターンを処理し、Transformerが時間的関係を処理します。
アルゴリズム 1:音響信号からのスペクトログラム生成
入力:生オーディオ信号 x(t)
出力:スペクトログラム S(t, f)
ステップ 1:オーディオ信号 x(t)をロードする
ステップ 2:ノイズフィルタリングを適用する
ステップ 3:信号 xn(t) を正規化する
ステップ4:信号をフレームに分割する:
k = 1 から Nまで以下を繰り返す

ループ終了
ステップ 5:各セグメントに窓関数 w(t) を適用する
ステップ 6:STFTを計算する:
(9)
ステップ 7:大きさを算出する:
(10)
ステップ 8:スペクトログラム S(t, f) を保存する
ステップ 9:スペクトログラムデータセットを返す
スペクトログラムの生成プロセスは、まず元のオーディオ信号を取得することから始まり、続いて信号の整合性と品質を確保するために、ノイズ除去や信号の正規化などの前処理ステップが行われます。その後、正規化されたオーディオは、長期および短期の両方の時間的特性を捉えるために、複数のオーバーラップするウィンドウに分割されます。スペクトル漏洩を防ぐため、各スライスは短時間フーリエ変換(Short-Time Fourier Transform)にかけられる前にウィンドウ関数で乗算されます。その後、変換された信号は周波数領域の複素数値関数として表現され、その振幅が2乗されます。これにより、指定された時間における各周波数のエネルギーがスペクトログラムとして表現されます。最終的に、これらは画像のようなデータとして保存され、トレーニングのためにニューラルネットワークに入力されます。
CNNを用いた空間特徴抽出
スペクトログラムを作成した後、出力された時間-周波数画像を入力として畳み込みニューラルネットワーク(CNN)に与えます。入力スペクトログラムを
とし、ここでHは周波数領域、Wは時間領域と想定します。ここでCNNを使用する目的は、入力スペクトログラムから識別的な空間特徴を学習することです。これらの識別的な空間特徴により、産業環境における機械の正常な動作と異常な動作を区別することが可能になります。
畳み込みニューラルネットワーク(CNN)で実行される基本的な操作は、畳み込みです。与えられたフィルタ
を用いた畳み込みは、次のように定義されます:
(11)
上述の操作により、ニューラルネットワークはスペクトログラム内のエッジ、周波数、調波成分などの局所的な空間特徴を識別することが可能になります。これは、さまざまな特徴表現を生成する複数のフィルタ操作を通じて行われ、いくつかの特徴マップが作成されます。畳み込みに続いて、以下に示す非線形活性化関数が適用されます。
(12)
この非線形性により、ネットワークは変数間の複雑な関係を捉え、表現することが可能になります。畳み込みニューラルネットワークにおける次の段階では、プーリング操作が適用されます。一般的な手法であるマックスプーリングは、数学的に次のように表されます:
(13)
ここで Ω はプーリングウィンドウを指します。プーリングは、冗長性を排除しつつ、関連情報のみを保持して並進不変性を実現するのに役立ちます。周波数などの低レベル変数から複雑な機械の挙動に至るまで、畳み込みニューラルネットワークを用いることで、高レベルの特徴を階層的に抽出することが可能です。その結果、特徴マップを用いてネットワークの最終出力を描写することができます:
(14)
ここで、はCNNの学習可能なパラメータを表します。特徴マップには豊富な空間情報が含まれており、これらはシーケンスに変換され、次のフェーズでトランスフォーマーエンコーダーへの入力として機能します。上述の空間特徴抽出プロセスは、モデルが工業用音響信号における微小な異常を検出できるようにするために極めて重要です。
図3は、CNNモデルを用いてスペクトログラム入力から空間的特徴を水平方向に抽出する方法を示しています。まず、オーディオ信号の時間周波数特性を画像形式で符号化した入力スペクトログラムから始まります。次に、入力スペクトログラムが畳み込み層に送られ、数種類のフィルタが周波数帯域、エッジ、テクスチャなどの空間的特徴を抽出して、特徴マップを生成します。その後、抽出された特徴マップに非線形活性化関数であるReLU(rectified linear unit)が適用され、ニューラルネットワークが入力データの依存関係を検出できるようになります。続いて、特徴マップがプーリング層に送られ、最も重要な特性を保持したままマップのサイズが縮小されます。この畳み込み層、活性化関数、プーリング層のプロセスが何度も繰り返されることで、単純な特徴から始まり、機械の動作に関連するより高度な特徴へと進化する特徴表現の階層が構築されます。
トランスフォーマーエンコーダーを用いた時間的モデリング
CNNを用いて空間的特徴を抽出した後、次のステップとして、スペクトログラムから学習した周波数ベースのパターンを捉える高レベルの特徴マップを導出します。得られた特徴マップは、その後フラット化され、音響信号における時間情報を捉えるためにシーケンスへと再形成されます。特徴マップが
で表され、H', W', および C がそれぞれ高さ、幅、チャネルであると仮定すると、以下のシーケンスが導出されます:
(15)
ここで T はシーケンス長を、d は特徴次元を表します。その後、Transformer は上述のシーケンスを用いて、セルフアテンション機構により長期的な依存関係をモデル化します。従来の再帰型モデルとは対照的に、Transformer モデルはシーケンスの各要素を並列に処理し、アテンションウェイトを用いて各パーツの相対的な関連性を決定します。アテンション機構の仕組みは、各入力 xt に対して以下に従って生成されるクエリ Q、キー K、およびバリュー V ベクトルを使用することです:
(16)
一方、WQ, WK, WVは学習可能な重みである。要素間の類似度は以下によって決定される:
(17)
dk は重要なベクトルの次元です。この手順により、モデルが信号内の離れたタイムステップからの依存関係を学習しやすくなり、関連する時間セグメントのみに焦点を当てることが可能になります。ネットワークの学習能力を高めるためにマルチヘッドアテンションが使用されており、これは複数のアテンションヘッドが入力から並列に学習するプロセスを指します。
(18)
各ヘッドは、時間的入力シーケンスの異なる特徴に注目します。これに続いて、フィードフォワードニューラルネットワークと残差接続が配置されています。
(19)
得られたエンコード後のシーケンスは、入力データの空間的および時間的な特徴の両方を捉えています。このシーケンスは、異常を検出するために分類層に送られます。
図4は、CNNから抽出した特徴量に対してtransformer Encoderを用いた時間的モデリングの全体的なプロセスを示しています。まず、CNNから抽出された特徴マップを使用しますが、これらにはスペクトログラムからの空間情報が含まれています。特徴マップはシーケンスへとフラット化され、各項目がタイムスタンプに対応します。その後、シーケンスは線形変換を通り、データが特定の次元のベクトルにマッピングされます。transformerモデルは時間的な依存関係を捉える能力を欠いているため、シーケンスの時間的構造を維持するために、埋め込みベクトルに位置エンコーディング(positional encoding)が追加されます。最後に、シーケンスは複数層のスタックで構成されるtransformer encoderを通過します。ここでは、マルチヘッド自己注意(multi-head self-attention)メカニズムが採用されており、モデルがシーケンス内のタイムスタンプ間の関係性を学習できるようになります。さらに、フィードフォワードニューラルネットワークがこれらの埋め込みを改善し、残差接続(residual connections)によって勾配が効率的に伝播することが保証されます。このプロセスがスタックされたtransformer encoder層全体で繰り返され、次第により複雑な時間的相互作用が捉えられます。最終的に、シーケンスの埋め込みはプーリング(例:平均プーリングまたは分類トークン(CLS))を介して固定長の表現に統合され、グローバルな時間的特徴表現が得られます。
分類層
トランスフォーマーエンコーダーによる時間的エンコーディングの後、出力はエンコードされたベクトルのシーケンスとなり、各ベクトルは入力信号の空間的および時間的な側面の両方に関連する特徴を持ちます。エンコードされた出力から分類を行うための最初のステップは、これらのすべての特徴を単一のベクトルに集約することです。これは、特徴ベクトルのシーケンスに平均プーリングを適用するか、いわゆる「分類トークン(classification token)」を用いることで達成されます。トランスフォーマーの出力を
とし、各
であると仮定します。集約された特徴hは次のように計算されます:
(20)
次に、集約された特徴ベクトルhが入力をコンパクトな形式で表現し、分類器への入力として機能します。分類部分は1つ以上の全結合層で構成され、学習された表現を出力空間へと変換します。全結合層は、以下のように定義される変換を実行します:
(21)
ここで、oは出力(ロジット)、bはバイアスベクトル、Wは重み行列である。後者は正規化されていない形式のクラススコアである。モデルに非線形性を組み込むために、ReLUなどの活性化関数がしばしば用いられる。最終的に、ロジットにソフトマックス活性化関数を適用し、各クラスの確率を得る:
(22)
ここでCはクラス数(C = 2; 正常および異常)を表します。クラス予測は、最大確率値に基づいて行われます。学習中、実際のラベルと予測ラベルの間のクロスエントロピー損失を最小化することでモデルパラメータの最適値が求められ、これにより機械状態の正確な分類が達成されます。要約すると、分類層は、Transformerアーキテクチャを用いて抽出された時間的特徴を実用的な決定へと変換するという重要な機能を果たしています。正常な機械状態と故障した機械状態を適切に識別することで、Industry 5.0のパラダイムにおける異常検知とインテリジェントな意思決定が可能になります。
図5は、transformer Encoderの後に続く分類レイヤーの動作原理を示しています。このプロセスは、各ベクトルに入力から学習した時間情報が含まれているエンコード済みシーケンス出力から始まります。これらのベクトルは、グローバル特徴ベクトルとして知られる単一のベクトルに統合されます。次のステップでは、このグローバル特徴ベクトルを複数の全結合ニューラルネットワークレイヤーに通過させます。各全結合レイヤーでは、行列乗算演算が行われ、入力の線形結合が作成されます。その後、ReLUなどの非線形活性化関数を適用することで、決定境界の学習における柔軟性を高めることができます。最後の全結合レイヤーの末端で、各クラスのロジットスコアが出力されます。これらのロジットスコアをSoftmax関数に適用することで、各クラスの確率スコアを算出できます。これらの確率スコアを用いて、入力がクラス0(正常)またはクラス1(異常)のいずれに属するかを判定します。
SHAPを用いた説明可能性
モデルが入力信号を分類した後、機械が正常に動作しているか異常に動作しているかに基づいて予測が生成されます。しかしながら、インダストリー5.0の環境においては、単に予測を出すだけでは不十分であり、人間の意思決定を支援するために、システムが透明性と説明可能性を提供しなければなりません。以下のフレームワークでは、予測を決定する際の各特徴量の重要度を定量化するゲーム理論ベースのモデルであるSHAPを使用します。これにより、SHAPは特徴量に重みを割り当て、スペクトログラム入力の異なるセクションが全体の予測に対してどの程度の相対的重要度を持つかを評価することが可能になります。
SHAPの数学的定式化は、モデル f(x) の分解に基づいています:
(23)
ここで、 ∅0はベースライン値(モデル出力の平均)、 ∅iはi番目の特徴量による効果、Mは入力特徴量の数である。本研究において、特徴量はスペクトログラムの時間周波数ビンである。SHAP値は、異常状態の確率に寄与する場合は正となり、それ以外の場合は負となる。この定式化により、各予測に対して一意的で局所的に一貫した説明が保証される。SHAP法を学習済みのCNN-transformerモデルに適用することで、特徴量重要性に基づいた説明を提供できる。視覚的な表現により、意思決定プロセスに影響を与えるスペクトログラム内の最も重要な時間周波数ビンが示される。例えば、機器の異常挙動によって特定の高エネルギー周波数帯域が生じた場合、SHAPフレームワークはそれを意思決定プロセスへの重要な寄与因子として特定する。
さらに、SHAPはサイバーフィジカル環境における人間と機械の協調を促進することができます。これは、予測結果を直感的なビジュアルを用いて説明できるため、オペレーターや意思決定システムが予測を検証し、問題を分析して適切な措置を講じることが可能になるためです。これにより、信頼性が向上するだけでなく、AIベースの製造プロセスに信頼性と説明責任がもたらされます。現在の性能基準を満たすディープラーニングアルゴリズムと、説明可能性を提供するSHAPを統合することで、提案されたアーキテクチャはインダストリー5.0の要件を満たしています。
アルゴリズム 2:モデル予測のためのSHAPに基づく説明可能性
入力:学習済みモデル f(x)、入力スペクトログラム S
出力:SHAP値
および説明マップ
ステップ1:学習済みモデルにスペクトログラム S を入力します
ステップ 2:予測値の計算:y = f(S)
ステップ3:ディープラーニング向けのSHAPエクスプレイナーを初期化する
ステップ 4:SHAP値を算出する:

ステップ 5:S 内の各特徴量 iについて:
寄与率を算出する 
ステップ 6:解説マップの作成:
が高い領域を強調します。
ステップ 7:特徴量の重要度の可視化(ヒートマップ)
ステップ 8:SHAP値と説明マップを返す
SHAPベースの説明可能性アルゴリズムは、まず前処理済みのスペクトログラム画像を入力として取得し、それを学習済みのCNN-transformerアーキテクチャに供給して予測(例:機械の状態が正常か異常か)を行います。学習済みアーキテクチャを用いて予測を行った後、モデルを解釈するためにSHAP法が用いられます。具体的には、入力のどの時間-周波数成分が予測に最も寄与しているかを特定するために、各入力特徴量に対してSHAP値(ϕ)が算出されます。これらの値を計算するには、特定の機能がある場合とない場合の入力に対するモデル出力を比較する必要があります。
各特徴量のSHAP値を算出した後、そのSHAP値の符号と大きさによって、予測に対する影響を評価することができます。例えば、SHAP値が高い特徴量ほど結果に影響を与える可能性が高く、正または負の符号は、その特徴量が予測をそれぞれ正常クラスまたは異常クラスへと押し出すことを示しています。これらの結果に基づいて、ヒートマップ形式で説明マップを作成することが可能です。
最後に、アルゴリズムはSHAP値と可視化結果の両方を出力し、人間がモデルの判断をどのように分析できるかについての洞察を提供します。この手法によりプロセスがより透明になり、人間が意思決定に関与することが可能になるため、AI主導の産業においてアルゴリズムの予測精度と信頼性の両方を確保できます。説明可能性分析の信頼性を向上させるため、さまざまな機械タイプにわたって正確に診断された異常インスタンスから、代表的なテストサンプルを選択しました。テストデータセット全体のSHAP値を集計して一貫して影響力のある時間周波数位置を特定するグローバルSHAP特徴量重要度分析を行う一方で、これらの代表的なケースに対してローカルSHAP説明を生成しました。専門家によるアノテーションを必要とせず、この統合的なローカルおよびグローバル分析によって、モデル予測の信頼性の高い解釈が可能になります。
エッジ有効化CPS統合
本提案の手法は、効率性、持続可能性、およびリアルタイムな産業運用の実現を目的としたエッジ対応CPS内で利用されます。モデルの学習完了後、CNN-transformerはエッジコンピューティングアプローチを通じて展開されます。ここで扱うエッジコンピューティング層は、センサや機械などの産業用モノのインターネット(IIoT)デバイスの近傍に配置されます。収集したすべてのデータをクラウドに送信するのではなく、エッジデバイスが入力された音響信号に対して、クラウドへの転送を行う前に推論を実行します。これにより、システムは機械の異常をほぼ瞬時に検知し、状況がさらに悪化する前に必要な措置を講じることが可能になります。このエッジ対応アプローチのもう一つの利点は、データが生成点に近い場所で分析されるため、レイテンシが改善され効率が高まることです。言い換えれば、推論時間 Tinf が発生するクラウドアプローチとは異なり、
(24)
一般的に、Tcommunicationの短縮により、レイテンシは大幅に低減されます。もう一つの利点は、データを継続的に送信する際の帯域幅消費量と消費電力が削減されることです。したがって、本システムは、多数のデバイスが接続された大規模な産業プラントにおいても、拡張性と持続可能性を備えています。さらに、CPSは物理層(機械)、AI(計算層)、および人間層との相互作用を可能にします。
ヒューマンインザループ协作
提案されたインダストリー5.0のCPSにおける重要な構成要素は、AIモデルとともに人間のオペレーターが意思決定プロセスに積極的に関与する「ヒューマンインザループ」の協調です。具体的に、設計されたフレームワークによれば、システムは自律的なブラックボックスとなるのではなく、オペレーターがシステムと相互作用し、SHAPによる説明形式で説明可能な予測結果を確認できるようになっています。ここでの予測とは、判定結果(正常/異常)を指し、それに加えて、その判定に使用されたスペクトログラムの一部の視覚化データが提示されます。
このような相互作用により、オペレーターは予測が具体的にどのように形成され、どの要因がそれに寄与しているかをより深く理解することができます。人間が関与することは、システムの結果を検証し、専門的な判断に基づいて必要に応じてオペレーターがそれを上書きすることを意味します。人間のオペレーターとの協調により、システムはより信頼性が高く、効率的で安全かつ確実なものとなり、エラーの防止に寄与します。
提示された説明可能AI(XAI)統合型サイバーフィジカル協調システムを、正常および異常な機械状態の両方を含むMIMIIデータセットの約12,000件の音声録音を用いて実験的に検証しました。トレーニングデータセットは約9,600件のデータレコードで構成され、テストデータセットには約2,400件の音声サンプルが含まれています。得られた結果に基づくと、提案されたCNN-transformerモデルは、テストデータセットにおいて98.5%の分類精度を達成しました(0.97–0.98)。これは、Table 3、混同行列、および統計的安定性解析の結果に関連しています。transformerエンコーダを統合することでアーキテクチャの時間的モデリング能力が向上し、一方でCNNが入力スペクトログラムから識別的な空間的特徴を抽出します。
分類性能に加えて、その他のシステム関連の特性も評価しました。第一に、エッジベースの実装における推論レイテンシは 20 ms を超えず、リアルタイムの異常検知が可能となりました。第二に、提示したシステムは通信要件を削減することでエネルギー効率の向上に寄与しました。最後に、提案した説明可能なAI(Explainable AI)フレームワークはSHAPによる解釈性を提供し、ドメインエキスパートの視点からモデルを分析しやすくしています。MIMIIデータは、ウィンドウサイズ 1024、ホップサイズ 512、高速フーリエ変換(FFT)サイズ 1024を用いて、短時間フーリエ変換(STFT)によりスペクトログラムに変換されました。得られたlog Mel-スペクトログラムは 224 × 224 ピクセルにリサイズされ、その後zスコア正規化されました。学習済みモデルの堅牢性を高めるため、タイムマスキング、周波数マスキング、ガウスノイズの追加を含むデータ拡張手法が用いられました。CNNのアーキテクチャは、それぞれ 32、64、128、256 個のフィルタを持つ4つの畳み込み層で構成され、バッチ正規化、ReLU、およびマックスプーリング層が含まれていました。抽出された特徴マップはシーケンスに変換され、4つのエンコーダ層、8つのアテンションヘッド、256次元の埋め込み、および 1024次元のフィードフォワード次元からなるトランスフォーマーエンコーダへの入力として使用されました。過学習を最小限に抑えるため、0.3 のドロップアウト確率を適用しました。学習には、学習率 0.0001 および荷重減衰 1 x 10⁻5 のAdamオプティマイザを使用しました。学習におけるエポック数とバッチサイズは、それぞれ 100 と 32 でした。実験の再現性を維持するため、乱数シードは 42 に設定されました。結果の統計的妥当性を検証するために、以下の手法を用いました。すべての実験は、異なる乱数シードとデータのシャッフルを用いて独立して 10 回実行されました。正解率(Accuracy)、適合率(Precision)、再現率(Recall)、F1スコア、受信者動作特性曲線下面積(ROC-AUC)、および適合率-再現率曲線下面積(PR-AUC)の平均値と標準偏差を算出しました。さらに、性能の不確かさを推定するために 95% 信頼区間を算出しました。最後に、提案したCNN-トランスフォーマーアプローチの結果と、最も性能の高いベースラインモデルの結果を比較する対応のあるt検定を実施しました。アーリーストッピング法は、パシェンスパラメータを 10 エポックとして適用されました。表 4 に環境設定およびハイパーパラメータ構成を示し、表 5 にシミュレーション環境の詳細を示します。
本研究における評価実験は、さまざまな機械の動作条件および音響故障シナリオを含むMIMIIデータセットを用いて実施されました。提案したフレームワークによる結果からモデルの妥当性は確認されましたが、さまざまな産業用データセットや製造環境におけるさらなる検証が必要です。
提案されたフレームワークは、リアルタイムの推論と説明可能性をサポートするため、マルチコアプロセッサ、16 GBのシステムメモリ、およびGPU搭載のエッジアクセラレータを備えたエッジコンピューティングプラットフォーム上に実装されました。産業用音響センサは、IIoT通信レイヤーを介してオーディオストリームをエッジゲートウェイに送信しました。エッジノードは、スペクトログラムの作成、異常推論、およびSHAP説明の生成などのタスクを実行するために使用され、クラウドサーバーは長期データの保存およびモデルの更新に使用されました。このような構成により、必要な通信量が削減されるだけでなく、サイバーフィジカルシステムにおけるセンシングデバイス、AIモジュール、および人間のオペレーター間のリアルタイムな相互作用が可能になります。
上述のCNN-transformerアプローチを、サポートベクターマシン(SVM)やランダムフォレストなどの従来の機械学習(ML)モデル、transformerを含まないCNNモデル、および長短期記憶(LSTM)ベースの手法を含む、いくつかの既存の手法と比較します。従来のMLモデルは、データの空間的および時間的な相関を処理する能力が不足しているため、満足のいく結果を得られませんが、CNNモデルは空間的特徴を効率的に処理でき、LSTMモデルは音響信号の時間的側面を処理できます。それにもかかわらず、前者は計算コストと並列処理能力の点において後者に劣ります。
提案するCNN-transformerモデルとベースラインモデルとの間で公正な比較を行うため、前者は、同一のMIMIIデータセットの分割(学習用80%、テスト用20%)、前処理ステップ、スペクトログラム作成プロセス、および評価指標を用いて学習および評価を行った。SVM法では、RBF(放射基底関数)カーネルを使用し、C = 10、γ = 0.01とした。ランダムフォレスト法では、200本の決定木を用い、最大木の深さを20とした。CNNについては、4つの畳み込み層(フィルター数は32、64、128、256)に続き、Transformerモジュールのない全結合層を配置した。最後に、LSTM法では、128個の隠れユニットを持つ2層のスタック型LSTMを用い、ドロップアウト率を0.3とした。
それとは対照的に、CNN-transformerフレームワークの使用は、音響信号の空間的および時間的な能力の両方を効率的に活用することで、最良の結果を可能にします。さらに、エッジコンピューティングを採用することで、計算コストの削減、レイテンシの改善、および省電力が実現します。加えて、SHAPを用いて実装された予測の説明可能性は、提案手法を既存の技術と差別化するもう一つの利点であると考えられます。
Vision Transformer (ViT)、Audio Spectrogram Transformer (AST)、Conformer、および自己教師あり学習ベースのモデルなど、音響異常検知のための新しいモデルの開発において近年成果が上がっているが、本研究ではこれらのアーキテクチャの実験的な比較は行わなかった。将来的には、これらのモデルを提案フレームワークを評価するためのベンチマークとして使用することを計画している。
提案されたモデルの性能を評価するために、正解率(accuracy)、適合率(precision)、再現率(recall)、およびF1スコアを含む指標が用いられます。正解率は予測の全体的な正確性を評価する一方、適合率は真陽性の数と真陽性および偽陽性の総数との比率を測定します。再現率は、特定のシステムにおける異常を予測するモデルの能力の推定値を提供します。欠陥の予測に失敗するとシステムダウンにつながる可能性があるため、これは極めて重要です。これらの指標の数学的な算出方法は以下の通りです:
(25)
(26)
(27)
(28)
これらに加え、エッジコンピューティングに基づく提案されたCPSモデルの実世界における性能を評価する際には、レイテンシ、エネルギー利用効率、スケーラビリティなどのシステム性能に関連する追加の指標が検討されます。
標準的な性能測定手法に加えて、特に実世界の不均衡データやストリーミングデータのケーススタディへの適用性を考慮すると、提案手法をより包括的な視点から評価するのに役立つ多くの指標が存在します。例えば、異なる閾値に基づいて2つのグループを区別するアルゴリズムの能力は、受信者動作特性曲線下面積(ROC-AUC)によって測定されます。その堅牢性と分離能を考慮すると、ROC-AUC値は高くなるはずです。さらに、異常クラスが稀であるため、異常検知のケーススタディにおいては精度-再現率曲線下面積(PR-AUC)指標が重要となります。
検討すべき重要な指標の一つに、マシューズ相関係数(MCC)があります。これは混同行列の4つの項目すべてを考慮するため、クラス不均衡が存在する場合でも正確な評価が可能です。この指標は以下のように算出されます:
(29)
MCCの値は-1から+1の範囲であり、+1は完全な予測であることを示します。適用可能なもう一つの指標は特異度(真陰性率)であり、これは産業応用において偽陽性の予測があるかどうかを評価する際に有用です。
(30)
混同行列と性能指標の間に不整合がないことを確認するため、すべての評価基準は最終テストデータセットに基づいて算出されました。以下の数式では、真陽性(TP)、真陰性(TN)、偽陽性(FP)、および偽陰性(FN)の表記を使用しています。正解率(Accuracy)、適合率(Precision)、再現率(Recall)、特異度(Specificity)、F1スコア、およびMCCは、式(25)~(30)に基づいて計算されました。さらに、独立した閾値評価を通じて、CNN-transformerモデルの確率出力からROC-AUCおよびPR-AUCを算出しました。
システムレベルで考慮すべき主要な指標には、レイテンシ、スループット、および計算コストが含まれます。レイテンシとは、予測を行うのに必要な時間のことです。スループットは、1秒あたりに処理されるデータサンプルの量です。エネルギー効率を表す計算コストは、計算効率を確保する上で重要です。さらに、モデルを評価する際には、SHAPの一貫性や特徴量重要度の安定性などの説明可能性指標も考慮される可能性があります。
MIMIIデータセットに関するTable 3の結果から、提案したCNN-transformerモデルが他のすべての機械学習およびディープラーニング手法を上回っていることは明らかである。SVMおよびランダムフォレストモデルの性能は、それぞれ88.6%および91.2%の正解率であり、許容範囲ではあるが限定的である。これは、これらのモデルが音響信号から複雑な時間的および空間的特徴を抽出できないことに起因すると考えられる。一方、LSTMは時系列データをモデル化することで94.5%の正解率を達成し、SVMやランダムフォレストを上回った。しかし、提案したCNN-transformerアプローチが最高の性能を示し、正解率(98.5%)、適合率(98.06%)、再現率(99.02%)、およびF1スコア(98.54%)において向上が見られた。したがって、提案したアルゴリズムは、機械の正常状態と異常状態を正確に分類することが可能である。特異度の向上(97.96%)は、産業界において極めて重要である偽陽性の減少に対する本アプローチの有効性を示している。なお、CNN-transformerの性能は、CNNとTransformerの組み合わせによって説明でき、前者が識別的な特徴を抽出し、後者が長いシーケンスにおける時間的関係を捉えているためである。
図6のROC曲線は、MIMIIデータセットに対する分類能力に関して、SVM、ランダムフォレスト、LSTM、および提案するCNN-transformerアプローチの性能を比較したものである。図6に示すように、提案したCNN-transformerで最高の曲線下面積(AUC)である0.994が観察された。提案手法が、正常カテゴリーと異常カテゴリーを区別する上でより優れた識別性能を提供することは明らかである。一方、LSTMは提案したCNN-transformerアプローチよりもわずかに低い結果となり、そのAUCは約0.97であった。ランダムフォレストとSVMはともにAUCが比較的低く、それぞれ約0.958および0.913であった。これは、両アプローチが与えられたデータから複雑な音響パターンを学習できなかったことに起因する。
異常検知では、異常サンプルが少ないため、適合率-再現率(PR)曲線による分析がより有効です。図7に示すように、PR曲線においてCNN-transformerモデルは最高 Average Precision(AP)である約0.97–0.98を達成しており、誤報を抑えつつ異常事例を検出する優れた能力があることが示唆されます。対照的に、LSTM分類器はAPが0.92から0.94の範囲であり、2位となりました。一方で、ランダムフォレストおよびSVM分類器はそれぞれ3位と4位であり、APは0.88および0.84でした。提案したハイブリッド分類器は、すべての再現率レベルにおいてより高い精度を達成しており、これは高い適合率と低誤報の両方が求められる実際の産業応用において重要です。
CNN-transformerモデルを、Table 6に示す高度な性能指標を用いて、MIMIIデータセットにおける既存モデルと比較しました。ROC-AUC値は、さまざまな閾値における2つのクラス間のモデルの識別能力を示しています。SVMおよびランダムフォレスト分類器のROC-AUC値はそれぞれ0.913および0.958であり、LSTMモデルは0.970、CNNは0.98を達成しました。提案するCNN-transformerフレームワークは、最高のROC-AUCである0.994を達成し、機械の正常状態と異常状態の間で優れた識別能を有することが実証されました。同様に、PR-AUC値は、異常検知において不可欠な要素であるクラス不均衡を提案モデルが効果的に処理できることを示しています。提案するCNN-transformerは、最高のPR-AUC(平均精度)である0.982を達成し、次いでCNN (0.950)、LSTM (0.912)、ランダムフォレスト (0.891)、SVM (0.765)となっており、産業用音響異常検知において優れた適合率-再現率性能を示す結果となりました。さらに、モデルの性能バランスを測定するマシューズ相関係数(MCC)については、提案モデルで0.97という比較的高い値を示しました。対して、SVM (0.73) やランダムフォレスト (0.78) などの従来の手法は、予測精度が低い結果となりました。
提案手法の安定性を検証するため、初期化シードとデータのシャッフルスキームを変えて同じ実験を10回実施した。CNN-transformerアーキテクチャに関するTable 7の結果は、正解率 = 98.50% ± 0.19%、適合率 = 98.06% ± 0.23%、再現率 = 99.02% ± 0.22%、F1スコア = 98.54% ± 0.24%であった。標準偏差が比較的小さいことは、モデルの安定性を示している。すべての評価指標について95%信頼区間を算出した。正解率の信頼区間は[98.1%, 98.9%]であり、モデルが安定して高い性能を発揮することが確認された。また、ROC-AUC、PR-AUC、およびMCCについても、狭い信頼区間が得られた。提案したCNN-transformerモデルと最高性能のベースラインモデル(LSTM)を比較する対応のあるt検定の結果、p 値は < 0.05となり、観察された性能向上は有意であり、偶然によるものではないことが示された。
提案されたCNN-transformerアーキテクチャの堅牢性を検証するため、図8に示すように、異なるランダム初期化シードおよびシャッフル構成を用いて実験を10回繰り返した。モデルによって得られた平均正解率(accuracy)、適合率(precision)、再現率(recall)、およびF1スコアは、それぞれ98.50% ± 0.19%、98.06% ± 0.23%、99.02% ± 0.22%、および98.54% ± 0.24%であった。箱ひげ図による分析から、モデルの性能指標における変動は極めて小さく、その安定性と堅牢性が示された。したがって、提案手法は複数の実験にわたって顕著な変動なく高い安定性を示しており、これによりモデルが優れた汎化性能を有していることが示唆される。
さらに、実験を複数回実施して得られた結果に基づき、統計検定を行いました。すべての評価指標において標準偏差が小さいことは、ランダム性の変動やトレーニングによる影響をほとんど受けないことを示唆しています。これにより、提案したCNN-transformerモデルが、実際のサイバーフィジカル製造システムにおいて安定かつ一貫した性能を発揮できることが確認されました。
SHAPヒートマップは、機械の状態が正常か異常かを予測する際に、スペクトログラム内のどの時間周波数領域が重要であるかを示しています。SHAP値は、最終的な予測に対する各予測因子の寄与度を表しています。
図9Aに示すSHAP値のヒートマップにおいて、正のSHAP値(例:+0.6から+1.2の間)は異常への寄与を表し、負のSHAP値(すなわち、−0.3から−0.8の間)は正常カテゴリーへの寄与を表します。最も強度の高いSHAPスコアは、タイムフレーム50–100における中周波数領域(40–80周波数ビン)で認められました。これらの領域は、音響測定において決定的な故障信号が検出される重要なエリアです。さらに、低周波数帯域(20ビン未満)のSHAPスコアはほぼゼロ(−0.1から+0.1)であり、モデルの意思決定への影響が無視できる程度であることが示されています。これは、モデルが故障予測に無関係な背景ノイズを無視していることを示しています。特定の時間帯における高いSHAPスコアの時間的一貫性は、音響信号における長距離依存性を捉えるTransformerモジュールの能力を強調しています。要約すると、SHAPヒートマップは、CNN-transformerモデルが高い判別能を持つ固有の時間周波数帯域に焦点を当てていることを明確に示しています。これによりモデルの解釈性が向上し、人間のオペレーターが視覚的に故障を検出することが可能になります。
SHAP法は、あくまで解釈手法としてのみ使用されており、CNN-transformerモデルの学習プロセスの一部ではないことが示されています。分類精度は、CNNおよびTransformerコンポーネントによって学習されたパラメータのみによって決定されます。SHAPはモデルの推論ステップの後に使用され、予測を正常または異常のいずれかのカテゴリーに導く最も影響力のある時間周波数ウィンドウを特定することで、予測結果を解釈します。したがって、SHAPは分類精度に影響を与えることなく、人間にとっての透明性と理解度を向上させます。提案されたフレームワークによって提供されるSHAP値は、検出された領域を実際の機械の動作やメンテナンス記録と比較することで、メンテナンス担当者がモデルの予測を検証するのに役立つ明確な可視化を可能にします。これにより、予知保全活動において人間と機械がより容易に協調できるようになります。
説明可能性のレベルを評価するため、図9Bに示すように、特徴量の重要性に関するグローバルSHAP解析を実施した。その結果、いくつかの中周波数成分が異常検知において重要な役割を果たしていることが示された。さらに、図9Cに示すケーススタディでは、SHAPが異常な機械のスペクトログラムにおける故障関連領域を正確に特定していることがわかる。この研究では、MIMIIデータセットのポンプおよびバルブの異常データサンプルを用いた定性的なケーススタディを行った。故障したポンプに関しては、SHAPはキャビテーションおよび摩耗に関連する 2–4 kHz の周波数範囲を特定した。故障したバルブの場合、漏れを示す繰り返しの高調波信号がある領域でSHAPの活性化が支配的であった。代表的なテストサンプル全体を通じて、SHAPの可視化により、異常な機械状態に関連する識別的な時間周波数ゾーンが確実に特定された。各予測に最も大きく寄与するスペクトル領域を強調することで、これらの説明はモデルがどのように意思決定を行うかを明らかにしている。メンテナンス専門家による正式な検証はこの研究の範囲外であるため、SHAP解析は専門家によって検証された故障確認としてではなく、モデルの挙動を理解するための解釈可能性ツールとして提供されている。
混同行列は、図 10 に示す MIMII データセットにおいて、提案された CNN-transformer モデルが分類をどの程度適切に行っているかを明らかにしています。全体として、960 個の正常サンプルが正しく正常であると識別され(真陰性)、20 個の正常サンプルが誤って異常であると識別されました(偽陽性)。さらに、全サンプルの中で、1010 個の異常サンプルが正しく検出され(真陽性)、10 個の異常サンプルが正常であると識別されました(偽陰性)。
このように、特に予知保全において極めて重要な異常サンプルに対して高い検出性能が達成されました。図10に示すように、偽陰性(False Negative)エラーは極めて稀にしか観察されず(10サンプル)、これはあらゆる産業において安全性と信頼性を確保するために不可欠です。一方で、偽陽性(False Positive)エラー(20サンプル)はわずかに多く発生していますが、相対的に低いレベルに留まっています。図10に示す混同行列は、分類器の性能を明確に視覚化するために、2,000件のテスト記録(正常サンプルと異常サンプルが同数)のバランス調整済みサブセットを用いて作成されました。正解率(accuracy)、適合率(precision)、再現率(recall)、特異度(specificity)、およびF1スコアを含むすべての報告された評価指標は、完全なテストセット(約2,400件の記録)を用いて算出されました。
図に示された混同行列を考慮すると 図10 および、~の中で 表8 (TN = 960, FP = 20, TP = 1010, FN = 10)より、以下の計算が可能である:正解率(Accuracy)= (TP + TN) / (TP + TN + FP + FN) = 98.50%、適合率(Precision)= TP / (TP + FP) = 98.06%、再現率(Recall)= TP / (TP + FN) = 99.02%、特異度(Specificity)= TN / (TN + FP) = 97.96%、F1スコア = 98.54%、およびMCC = 0.97。さらに、ROC-AUC値およびPR-AUC値は、それぞれ0.994および0.982であった。以下に示す混同行列において 図10 可視化のみを目的として、テストデータからバランス良く抽出した2,000件の録音データの代表的なサブセットを用いて生成されました。本研究で報告されているすべての定量的性能指標は、完全なテストセット(約2,400件の録音データ)を用いて算出されました。全体として、結果は、提案されたCNN-transformerアーキテクチャが98.5%の分類精度を達成したことを示しており、これは以下の報告結果と一致しています。 表8 およびアブレーション解析。
エッジベースの実装の有効性を検証するため、追加の測定を行った。提案モデルの平均推論レイテンシは18.7 ms/sampleであり、表9に示すように、1秒間に約53サンプルを処理できる。推論中の消費電力は8.9 Wであり、推定エネルギー消費量は0.167 J/predictionであった。表10における提案手法のサステナビリティへの影響を評価するため、通信オーバーヘッド、エネルギー消費量、およびリソース使用量を考慮した。推論プロセスはエッジノード上でローカルに実行されるため、要約された診断データのみがクラウド環境に送信される。実験結果から、従来のクラウドベースのCPSシステムと比較して、通信量が73%減少したことが示された。加えて、ローカル推論によりエネルギー消費量が32%減少し、通信時間は75 msから20 msへと短縮された。
アブレーション解析
説明可能なAIベースのCPHSアーキテクチャの各コンポーネントの影響を評価するために、MIMIIデータセットを用いてアブレーション研究を実施します。このアブレーション研究では、空間的特徴を学習するためのCNN、時間的特徴を学習するためのTransformerエンコーダー、およびSHAP説明可能性アルゴリズム自体の効果を調査します。提案モデルのいくつかの修正版、すなわち、(i) CNNのみのバージョン、(ii) Transformerのみのバージョン、(iii) CNNとTransformerを組み合わせたがSHAPアルゴリズムを含まないモデル、(iv) CNNとTransformerを組み合わせ、さらにSHAPを統合した提案モデル全体を検討します。評価には、正解率(accuracy)、適合率(precision)、再現率(recall)、およびF1スコアなどの一般的な指標を用います。
これらのアブレーション研究の結果は、Table 11に概説したフレームワークにおける各要素の重要性を示しています。CNNのみのモデルは93.8%の精度を達成しており、スペクトログラムからの空間的特徴抽出が有効であることが分かりますが、音響信号における時間的依存性を捉えることはできません。Transformerのみのモデルについても同様であり、時間的特徴を抽出する一方で空間的情報を無視するため、精度はわずかに低い92.6%にとどまりました。最終的に、提案したCNN-transformerモデルは、主実験の結果と一致して、精度98.5%、適合率98.06%、再現率99.02%、F1スコア98.54%を得ました。SHAPは事後的な解釈にのみ使用され、モデルのトレーニングには使用されないため、分類精度は学習済みCNN-transformerモデルの精度と同じになります。その後、SHAPを用いて特徴量アトリビューションの説明を生成します。向上した再現率(99.02%)は、本モデルが機械の異常状態の検出に有効であり、故障部品の見落としがないことを示しており、これは予知保全システムの導入において不可欠です。
データの利用可能性:
本研究で使用したMalfunctioning Industrial Machine Investigation and Inspection (MIMII) データセットは、公式のZenodoリポジトリから公開されています。実験は、データセットの著者が提供した公開オーディオ録音およびアノテーションを用いて実施されました。データセットは https://zenodo.org/records/3384388 からアクセス可能です。本研究に付随する実装コードは、Zenodoリポジトリの https://zenodo.org/records/21405292 で公開されています。このリポジトリには、提案手法の理解と独立した再現を容易にするため、データ前処理パイプライン、モデルアーキテクチャ、トレーニングワークフロー、評価スクリプト、設定ファイル、およびサポートユーティリティを含む、提案フレームワークの実装コードが含まれています。MIMIIデータセットは実装コードとともに再配布されていないため、公式リポジトリから別途入手する必要があります。

図1: 提案手法のアーキテクチャ。 持続可能な製造のための、前処理、CNNベースの空間学習、Transformerベースの時間モデリング、SHAPによる説明可能性、およびエッジコンピューティングを組み合わせた、説明可能なAI駆動型サイバーフィジカルヒューマンシステムのアーキテクチャ設計。ここをクリックして、この図の拡大版を表示してください。

図 2: 前処理のパイプライン。ノイズ除去、正規化、セグメンテーション、STFT変換、およびスペクトログラム抽出で構成される音響信号前処理パイプライン。こちらのリンクをクリックして、この図の拡大版を表示してください。

図 3: CNNを用いた空間的特徴抽出。畳み込み、活性化、およびプーリングのプロセスを通じて、スペクトログラムを用いてCNNにより空間的特徴を抽出するためのアーキテクチャ。こちらをクリックして、この図の拡大版を表示してください。

図 4: トランスフォーマーエンコーダーを用いた時間的モデリング。 スペクトログラムのシーケンス表現を通じて、時間的依存関係および長距離依存関係を捉えるためのトランスフォーマーエンコーダーのアーキテクチャ。こちらのリンクをクリックして、この図の拡大版を表示してください。

図 5: 分類層。 エンコードされた時間的特徴を確率値にマッピングし、機械の状態を予測する分類層。この図の拡大版を表示するには、ここをクリックしてください。

図 6: ROC曲線の結果。MIMIIデータセットにおけるSVM、ランダムフォレスト、LSTM、CNN、および提案するCNN-transformerアルゴリズムのROC曲線の比較。こちらのリンクから、この図の拡大版を表示してください。

図 7: 適合率-再現率曲線の結果。 様々な機械学習およびディープラーニング手法における異常検知効率を示す適合率-再現率曲線の比較。こちらのリンクをクリックして、この図の拡大版を表示してください。

図 8: 複数回実行時の性能安定性解析。提案したCNN-transformerアーキテクチャを用いて実施した10回の独立した実験で得られた、Accuracy、Precision、Recall、およびF1-scoreの結果の安定性を示す箱ひげ図。変動が小さいことは、モデルの安定性と堅牢性を示している。こちらをクリックして、この図の拡大版を表示してください。

図9提案された異常検知フレームワークのSHAPに基づく説明可能性解析。 (A) SHAPに基づく説明可能性解析。異常行動の特定に寄与した最も関連性の高い時間周波数領域を示す、SHAP法を用いたヒートマップ。B) 最も影響力のある特徴量を特定するための、グローバルSHAPアプローチを用いた特徴量重要度解析。C) 異常機械におけるSHAP説明可能性の可視化。 こちらの図の拡大版を表示するには、ここをクリックしてください。

図10: MIMIIデータセットの混同行列。 混同行列は、提案されたCNN-transformerアルゴリズムの分類性能を示している。こちらをクリックして、この図の拡大版を表示してください。
| パラメータ | 説明 |
| データセット名 | MIMII (Malfunctioning Industrial Machine Investigation and Inspection) データセット |
| 機械の種類 | バルブ、ポンプ、ファン、スライドレール |
| 使用した総サンプル数 | 約 12,000 件の音声録音 |
| クラス | 正常、異常 |
| サンプリングレート | 16 kHz |
| サンプルあたりの時間 | 10 seconds |
| 音声フォーマット | WAV |
| 特徴量表現 | STFTベースのスペクトログラム画像 |
| 前処理ステップ | ノイズフィルタリング、正規化、セグメンテーション、STFT変換 |
| ラベル割り当て | MIMIIのアノテーションに従い、正常な録音をクラス0、異常な録音をクラス1としてラベル付け |
| 訓練・テスト分割 | 訓練用 80% (≈9,600 サンプル)、テスト用 20% (≈2,400 サンプル) |
| データ分割戦略 | データリークを防ぐため、セグメンテーション前に音声ファイルレベルで分割を実施 |
| 工業ノイズ条件 | MIMII録音に含まれる現実的な工業音響環境 |
| 適用ドメイン | 予知保全および機械の異常検知 |
| Industry 5.0の目標 | 説明可能で人間中心の持続可能な故障検知 |
表1: データセットの説明。機械の種類、サンプリング分布、信号特性、特徴量表現、およびアプリケーションの側面に関するMIMIIデータセットの説明。
| 装置タイプ | マシンID | 正常記録 | 異常記録 | SNR条件 (dB) | 実験的分割 |
| ファン | ID00–ID06 | 8,400 | 1,600 | −12から−9まで | トレーニング 80% / テスト 20% |
| ギアボックス | ID00–ID06 | 7,124 | 1,147 | −17 ~ −15 | トレーニング 80% / テスト 20% |
| ポンプ | ID00–ID06 | 7,200 | 1,800 | −18~−9 | トレーニング 80% / テスト 20% |
| スライドレール | ID00–ID05 | 7,000 | 1,800 | −14から−12 | トレーニング 80% / テスト 20% |
| バルブ | ID00–ID05 | 7,000 | 1,800 | −12から−9 | トレーニング 80% / テスト 20% |
表 2: 本研究で使用したMIMIIデータセットの説明。産業機械の種類、機械ID、正常および異常録音数、SNR条件、および教師あり二値分類に使用した訓練/テスト分割。
| モデル | 精度 (%) | 精度 (%) | 再現率 (%) | F1スコア (%) | 特異度 (%) |
| サポートベクターマシン | 88.6 | 86.9 | 85.4 | 86.1 | 90.2 |
| ランダムフォレスト (RF) | 91.2 | 89.8 | 88.5 | 89.1 | 92.6 |
| 長短期記憶(LSTM) | 94.5 | 93.2 | 92.8 | 93 | 95.1 |
| 畳み込みニューラルネットワーク | 96.3 | 95.4 | 94.9 | 95.1 | 96.8 |
| CNN–Transformer(提案手法) | 98.5 | 98.06 | 99.02 | 98.54 | 97.96 |
表 3: MIMIIデータセットの分類結果。 正解率、適合率、再現率、F1スコア、および特異度を用いた機械学習およびディープラーニング分類器の性能比較。
| パラメータ | 値 |
| データセット | MIMIIデータセット |
| 総サンプル数 | ~12,000 |
| 訓練データとテストデータの分割 | 80% / 20% |
| 入力形式 | スペクトログラム画像 |
| CNNレイヤー | 3〜5個の畳み込み層 |
| トランスフォーマー層 | 2~4層のエンコーダレイヤー |
| バッチサイズ | 32 |
| 学習率 | 0.001 |
| オプティマイザー | アダム |
| エポック | 100 |
| ハードウェア | エッジデバイス + GPU(トレーニング用) |
| STFTウィンドウ長 | 1024 |
| ホップサイズ | 512 |
| FFTサイズ | 1024 |
| スペクトログラム分解能 | 224 × 224 |
| 正規化 | Zスコア |
| データ拡張 | 時間マスキング、周波数マスキング、ガウスノイズ |
| CNNレイヤー | 4 |
| CNNフィルター | 32, 64, 128, 256 |
| トランスフォーマー層 | 4 |
| アテンションヘッド | 8 |
| 埋め込み次元 | 256 |
| フィードフォワード次元 | 1024 |
| ドロップアウト | 0.3 |
| 乱数シード | 42 |
| 早期停止のパトリエンス(Early Stopping Patience) | 10 |
表 4: 環境設定およびハイパーパラメータ構成。 提案されたCNN-transformerアーキテクチャを実装するために使用したトレーニングおよび実験のパラメータ。
| 構成要素 | 仕様 |
| プログラミング言語 | Python |
| フレームワーク | TensorFlow / PyTorch |
| プロセッサ | Intel i7 / Ryzen 7 |
| GPU | NVIDIA GTX 1660 / RTX Series |
| エッジデバイス | Raspberry Pi / NVIDIA Jetson |
| 可視化 | Matplotlib, SHAP |
| エッジデバイス | NVIDIA Jetson Xavier NX |
| CPU | 6-core ARM v8.2 |
| RAM | 16 GB |
| オペレーティングシステム | Ubuntu 20.04 |
| ディープラーニングフレームワーク | TensorFlow/PyTorch |
| データセットサイズ | 12,000 MIMII samples |
| 接続性 | Ethernet/Wi-Fi |
| モデルパラメータ数 | 8.4 Million |
| モデルサイズ | 32.7 MB |
| フレームワーク | PyTorch + TensorRT |
| バッチサイズ | 1 |
| 量子化 | FP16 |
| プルーニング | なし |
| 平均レイテンシ | 17.8 ms |
| 中央値レイテンシ | 17.2 ms |
| 95パーセンタイルレイテンシ | 19.6 ms |
| スループット | 56 samples/s |
| メモリ使用量 | 1.4 GB |
| 消費電力 | 11.3 W |
表 5: シミュレーション環境。提案モデルの学習、展開、および評価に使用したハードウェアおよびソフトウェア。
| モデル | ROC-AUC | PR-AUC | マトリコンス・カプセル(MCC) |
| サポートベクターマシン | 0.913 | 0.765 | 0.73 |
| ランダムフォレスト (RF) | 0.958 | 0.891 | 0.78 |
| 長短期記憶(LSTM) | 0.97 | 0.912 | 0.86 |
| 畳み込みニューラルネットワーク | 0.98 | 0.95 | 0.9 |
| CNN–Transformer(提案手法) | 0.994 | 0.982 | 0.97 |
表 6: ROC-AUC、PR-AUC、および MCC の実験結果の比較。 ROC-AUC、PR-AUC、およびマシューズ相関係数(MCC)に基づいた各種モデル間の比較。
| 指標 | 平均 (%) + 標準偏差 (%) | 95%信頼区間 |
| 正確度 | 98.50 ± 0.19 | [98.1, 98.9] |
| 精度 | 98.06 ± 0.23 | [98.0, 98.2] |
| 再現率 | 99.22 ± 0.22 | [98.8, 99.4] |
| F1スコア | 98.54 ± 0.24 | [98.1, 98.9] |
| ROC-AUC | 0.984 | 0.004 |
| PR-AUC | 0.982 | 0.005 |
| マシューズ相関係数 | 0.97 | 0.007 |
表7:複数回実行の統計解析結果。 提案したCNN-transformerアーキテクチャについて、10回の実験にわたる堅牢性の統計値であり、各種性能指標の平均、標準偏差、95%信頼区間、および有意性を含む。
| 指標 | 値 |
| 正確性 | 98.50% |
| 精度 | 98.06% |
| 再現率 | 99.02% |
| 特異性 | 97.96% |
| F1スコア | 98.54% |
| マトリカルクス(MCC) | 0.97 |
| ROC-AUC | 0.994 |
| PR-AUC | 0.982 |
表8:混同行列の最終テストセット。 提案されたアーキテクチャにおけるテストセットの混同行列であり、評価指標の算出根拠となった機械の正常状態および異常状態の分類を示している。
| 指標 | クラウド展開 | エッジ展開 |
| 推論レイテンシ (ms) | 85.6 | 18.7 |
| スループット (samples/s) | 22 | 53 |
| ネットワーク使用量 (MB/min) | 120 | 18 |
| 予測あたりのエネルギー消費量 (J) | 0.52 | 0.17 |
| リアルタイム性能 | 中程度 | 高い |
表 9: 推論レイテンシの結果。 処理時間、スループット、メモリ消費量、およびその他のリアルタイム特性を含む、説明可能なAI搭載CPHSフレームワークのエッジ展開におけるレイテンシ性能。
| 評価指標 | クラウドベースCPS | 提案するエッジ対応CPHS | 改善率 |
| 1時間あたりのデータ転送量 | 100% | 35% | 65% 削減 |
| 通信遅延 | 75 ms | 20 ms | 73.3% 削減 |
| エネルギー消費量 | 100% | 68% | 32% 削減 |
| 推定二酸化炭素排出量 | 100% | 70% | 30% 削減 |
表10: エッジ対応CPHSのサステナビリティ評価。通信オーバーヘッド、エネルギー消費量、リソース利用率、およびレイテンシの測定を用いて、エッジ対応CPHSのサステナビリティを評価する。
| モデル変異体 | 精度 (%) | 精度 (%) | 再現率 (%) | F1スコア (%) |
| CNNのみ | 93.8 | 92.5 | 94.2 | 93.3 |
| トランスフォーマーのみ | 92.6 | 91.2 | 93.5 | 92.3 |
| CNN + Transformer | 98.5 | 98.06 | 99.02 | 98.54 |
表 11: アブレーション解析の結果。 提案モデルの性能に対するCNN、Transformer、およびSHAPモジュールの影響を明らかにしたアブレーション解析の結果。
実験結果は、提案されたCNN-transformerアーキテクチャが、空間的および時間的な特徴学習を効果的に統合することで、個別のアルゴリズムよりも優れた性能を示すことを実証している。アブレーション研究によれば、CNNがスペクトログラムから周波数ベースの識別特徴を抽出する一方で、transformerエンコーダーが音響信号における長期的な時間依存性を捉えることで、モデルの性能が向上している。さらに、混同行列は偽陰性が非常に少ないことを示しており、提案モデルが機械の異常を効果的に特定できることを意味している。このようなアーキテクチャにより、精度98.5%および再現率99.02%という分類結果の向上がもたらされた。モデルが故障した機械を見逃してはならないため、この結果は産業用故障検知システムにおいて極めて重要である。実験結果から、提案されたXAI対応CNN-Transformerフレームワークが、高い異常検知精度、解釈可能性、およびリアルタイムなエッジ実装を正常に組み合わせていることが示された。これら2つのモジュールの組み合わせにより、音響データから空間的・時間的特徴を同時に抽出することが可能となり、同時にSHAPによる説明が説明責任と信頼性を高めている。これらの結果は、人間中心の意思決定、持続可能性、およびサイバー領域とフィジカル領域のシナジーを強調するインダストリー5.0の原則と一致している。しかし、提案手法の汎用性を評価するためには、他の産業用データセットを用いたより詳細な評価と、実際の導入が必要である。
説明可能性のためにSHAPを導入することは、システムの効率を向上させるだけでなく、モデルの基礎となる論理への理解を大幅に深めることにもなる。特に、これらの選択において重要となる時間周波数帯域に焦点が当てられている。これは、人間とAIシステムが相互に信頼し合う必要があるインダストリー5.0のシナリオにおいて極めて重要である。SHAPヒートマップから、モデルが故障に関連する特定の周波数帯域を認識しており、それによって現実との整合性が確保されていることは明らかである。本研究の新規性は、単にCNN-TransformerやSHAPを使用したことにあるのではなく(これらはいずれも既存の科学文献で言及されている)、むしろ、インダストリー5.0のサイバーフィジカル協調の構造の中でそれらを統合的に適用し、説明可能性、持続可能性、エッジインテリジェンス、および人間中心の意思決定支援という課題を同時に解決した点にある。提案されたフレームワークは、人間中心の協調、説明可能性、レジリエンス、持続可能なエッジコンピューティングといったインダストリー5.0の概念に基づいているが、本研究における技術的性能の評価は、異常検知精度、レイテンシ、エネルギー消費量、および解釈可能性のみを用いて行っている。オペレーターの信頼、認知負荷、意思決定の質、および受容性といった人間中心の側面の直接的な評価は、本研究の設計範囲外であった。今後の研究では、提案フレームワークにおける協調的意思決定の有効性を測定するため、ヒューマンインザループ実験を導入する予定である。理論的な観点からは、本研究は、産業用時空間データの処理において畳み込みニューラルネットワークとTransformer構造を組み合わせる有効性を示すことで、ハイブリッド深層学習モデルの拡張に貴重な貢献を果たす。実際、本論文は、意思決定プロセス全体に説明可能なAIの概念を導入することで、CPSおよびCPHSのアプローチを強化している。さらに、様々な時間周波数特徴量の寄与度を測定するツールとしてSHAP手法を実装したことは、説明可能なAIベースのシステムの理論的根拠を裏付けるものである。総じて、このようなアプローチは、深層学習モデルがより高精度になるだけでなく、人間による解釈も可能になるという、インダストリー5.0の理念に沿った新しいパラダイムへの道を切り開くものである。
実用的観点から見ると、提案されたシステムは、産業分野におけるリアルタイムの異常検知および予知保全にとって優れた解決策となります。エッジ側でCPHSアーキテクチャを用いることで、音響信号の適時な処理が可能となり、スマート製造施設への導入に適しています。高い再現率(99.02%)により、故障の見落とし確率が低減され、その結果、運用の安全性が向上し、予期せぬ機械の故障を防止できます。さらに、SHAPベースの説明を用いることで、人間がモデルの結果を理解することが可能になります。これは、人間をループに組み込む必要がある重要な状況において特に重要です。実験的な導入から得られた知見は、従来のクラウドコンピューティングに対するエッジコンピューティングの利点を明確に示しています。これは、ネットワークのエッジで推論を行うことで遅延時間が最小限に抑えられ、スループットの向上を通じて効率が改善されるためです。加えて、予測あたりのエネルギー消費量を削減することは、Industry 5.0規格に沿った持続可能な製造目標の達成に寄与します。しかし、これらの心強い結果がある一方で、概説したアプローチにはいくつかの限界があります。第一に、本フレームワークは主にMIMIIデータセットで検証されており、このデータセットはかなり広範であるものの、実際の産業現場や異なる種類の機械で遭遇し得るすべてのシナリオを網羅できていない可能性があります。第二の限界は、説明可能性のためにSHAPを使用することで計算複雑性が増大し、リソースが非常に制限されたエッジ環境にフレームワークを導入する際に問題となる可能性があることです。最後に、既存のモデルは音響信号のみに限定されていますが、産業システムでは、例えば振動や温度などを含むマルチモーダル処理が必要とされます。
MIMIIデータセットの使用により、工業音響における現実世界の故障シナリオは確保されていますが、ToyADMOS、DCASE工業異常検知データ、IMS軸受データ、CWRU軸受故障データなどの他のベンチマークデータセットで検証を行うことで、提案したフレームワークの汎用性をさらに向上させることができます。今後の研究では、説明可能なAIに基づくサイバーフィジカル協調フレームワークの汎用性を確保するため、機械の種類、センシング方法、製造環境におけるクロスドメイン検証を実施する予定です。本研究のもう一つの制限は、Vision Transformers、Audio Spectrogram Transformers、Conformers、および新しい自己教師あり学習技術など、近年開発された音響異常検知システムとの比較実験が不足していることです。CNN-transformerモデルは強力な結果と解釈可能性を示しましたが、これらの高度な技術とのベンチマーク測定を行うためのさらなる研究が進められる予定です。本研究のもう一つの欠点は、レジリエンスやサステナビリティといったインダストリー5.0の特徴の評価が、推論レイテンシやエネルギー消費量などのシステムレベルの指標を通じて間接的に行われたことです。通信やセンサーの故障に対するレジリエンスの詳細な評価、およびカーボンフットプリントや資源利用の観点からのサステナビリティの評価は、本研究では実施されませんでした。これらの要因は、今後の研究で評価されるべきです。
ただし、本研究で述べられているヒューマン・イン・ザ・ループの協調パラダイムは理論的なものであり、オペレーターが支援するIndustry 5.0のサイバーフィジカルシステムにおける意思決定のための説明可能なAI出力の活用例を示すことを目的としている点に注意が必要である。人間のオペレーターによる実験的検証、ユーザビリティ、応答時間の分析、および専門家による評価は、本研究の範囲外である。本研究では、Industry 5.0環境における持続可能な製造のための、新しい説明可能なAI駆動型サイバーフィジカル協調モデルを提案する。開発されたシステムでは、ハイブリッドCNN-Transformerアーキテクチャを用いて音響スペクトログラムの空間的および時間的特性を効率的に学習し、これにより産業機械の異常検知を可能にする。提案モデルは、音響データのスペクトログラムへの前処理、CNNによる空間的特性の学習、Transformerエンコーダによる時間的依存性の学習、および分類の4つのステップで動作する。MIMIIデータセットを用いて提案手法で得られた結果は、提案モデルがベースラインモデルを上回り、精度98.5%および再現率99.02%を達成したことを示している。さらに、説明可能性を組み込むことでシステムの透明性が向上する。提案した説明可能なAI支援サイバーフィジカル協調フレームワークはMIMIIベンチマークデータセットで良好な性能を示したが、本研究は現在のところ実験的な検証に限定されている。このフレームワークを、機械が不均質で条件が変動し、長期的な導入となる産業環境での大規模生産を通じて評価することが依然として必要である。加えて、ViT、AST、Conformer、および自己教師あり学習モデルなどのアーキテクチャとの比較を今後の課題に含めるべきである。言い換えれば、本フレームワークは説明可能なAI、サイバーフィジカル協調、およびヒューマン・イン・ザ・ループ協調の統合が可能であることを示しているが、産業界で大規模に展開する前にはさらなる検証が必要である。今後の研究では、産業用およびクロスドメイン製造の様々な故障診断ベンチマークデータセットにわたって提案フレームワークをさらに調査し、持続可能な製造エコシステムにおける堅牢性、転移可能性、および適用可能性を実証する。今後の検証では、オペレーター中心の実験、破壊的な産業条件下でのレジリエンス・ベンチマーク、および持続可能性に関連するライフサイクル評価をカバーする予定である。
再現性を確保するため、本研究ではデータの前処理、分割戦略、スペクトログラム生成の設定、CNN-transformerモデルのアーキテクチャ、オプティマイザー、ハイパーパラメータ、およびモデルの性能を測定するために使用した指標について詳細に説明します。乱数シードは実験前に設定されました。再現性を保証するため、実験は公開されているMIMII(Malfunctioning Industrial Machine Investigation and Inspection)データセットを用いて行われました。データセットへのリンクは以下の通りです:DOI: 10.5281/zenodo.3384388。本研究に付随する実装コードは、Zenodoリポジトリを通じて公開されています:https://zenodo.org/records/21405292。オーディオ信号は16 kHzでサンプリングされ、ウィンドウサイズ1024、ホップ長512、FFTサイズ1024のSTFTを用いてlog-Melスペクトログラムに変換されました。提案するCNN-transformerアーキテクチャは、4つの畳み込み層(フィルタ数はそれぞれ32、64、128、256)と、それに続く4層のtransformerエンコーダ(アテンションヘッド数8、埋め込み次元256、フィードフォワード次元1024)で構成されています。学習プロセスでは、学習率0.0001、バッチサイズ32のAdamオプティマイザーを用い、100エポックで実施しました。アルゴリズム1および2に、データ前処理段階と説明可能性の手順について記述します。実装の詳細を含む完全なアルゴリズムを提示します。
AIツール(ChatGPT)は、言語の編集、ならびに文法、明快さ、および可読性の向上を補助するためにのみ使用されました。AIツールは、科学的データの生成、実験の実施、結果の分析、知見の解釈、または科学的な結論の導出には使用されていません。すべての科学的な内容、データ分析、解釈、および原稿の最終版は、著者らによって独立してレビュー、検証、および承認されており、著者らが本研究の正確性と完全性について全責任を負います。著者らに開示すべき利益相反はありません。
資金提供:本研究は、陝西省高等教育教育改革重点プロジェクト(プロジェクト番号 23BG053)、陝西理工大学高レベル人材科学研究基金(プロジェクト番号 BSJ-2023-08)、および陝西理工大学科学研究プロジェクト(プロジェクト番号 2024YKYB-006)の支援を受けて実施されました。著者らは、本研究を可能にする設備および制度的支援を提供してくださった中国の陝西理工大学(咸陽市)および西安交通工程大学(西安市)に心より感謝いたします。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| 社会的支援尺度 | 公表済みの学術的尺度であり、Parkによって開発され、Kimによって改訂および補完された。 | 25項目版;5段階リッカート尺度回答形式;市販カタログ番号なし | 就学前教育の教職課程履修生における、情緒的サポート、情報的サポート、物質的サポート、および評価的サポートの観点から、知覚された社会的サポートを測定する。全体のクロンバック(Cronbach)’s alpha = 0.96. |
| 教師自己効力感尺度 | 出版済みの学術的尺度。EnochsおよびRiggsによって開発され、中国語に適合させた研究用バージョン。 | 25項目版;5段階リッカート尺度形式;市販カタログ番号なし | 中国の就職前幼児教育における教師効力感を、「一般的教師自己効力感」および「個人的教師自己効力感」にわたって評価する。全体のクロンバック(Cronbach)’s alpha = 0.96. |
| 教師-子ども相互作用尺度 | 既刊の学術的尺度であり、Leeによって開発され、中国での使用に向けて研究専門家パネルによる検討を受けた。 | 30項目版;5段階リッカート尺度形式;市販カタログ番号なし | 観察による教室内の相互作用の質ではなく、教師自身が報告する教師と子どもの相互作用能力を評価する。感情的相互作用、言語的相互作用、および行動的相互作用が含まれ、全体のクロンバック係数は’$\alpha = 0.94$。 |
| 人口統計学的情報フォーム | 研究チーム、四川 arts and science 大学 / 大邱大学共同研究 | カスタム調査アンケートセクション;市販のカタログ番号なし | 性別、学歴、職種、インターンシップ実施場所、インターンシップ期間、インターンシップの種類、および幼稚園の形態を含む参加者の特性を収集した。 |
| 被験者への説明およびインフォームド・コンセント用スクリプト | 研究チーム;大邱大学研究倫理委員会の承認済み | 倫理承認番号:XXX。詳細は現地の承認記録で確認すること。 | アンケート配布前に、研究目的と調査内容を説明し、被験者である幼児教育教員養成課程の学生からインフォームド・コンセントを得るために使用した。 |
| パイロット調査質問票パッケージ | 研究チームおよび専門家パネル | 6月1日使用パイロット版–2024年5月;商用カタログ番号なし | 50名の幼児教育教員養成課程の学生を対象に、専門職的認識尺度(Professional Perceptions Scale)、社会的支援尺度(Social Support Scale)、教師自己効力感尺度(Teacher Self-Efficacy Scale)、教師―子ども相互作用尺度(Teacher-Child Interaction Scale)、および人口統計学的項目の明確性と適切性についてパイロットテストを実施した。 |
| 専門家パネルによる審査手順 | 研究チーム;幼児教育学の教授2名、幼稚園園長1名、インターンシップ指導教員3名、および研究チームで構成される専門家パネル | 合意ベースのコンテンツレビュー。商用モデル番号なし。 | 正式な調査の前に、尺度の項目における曖昧さ、適切性、意味的明快さ、発達上の適合性、および文化的関連性を修正するために使用される。 |
| 現場配布用印刷アンケート用紙 | 研究チーム、各機関の調査用品 | 紙の調査票;市販のカタログ番号なし | 現地でのアンケート実施に使用した。最終的なサンプルとして、オンラインアンケートと統合する前に、336件の有効な現地アンケートが得られた。 |
| テンセント | WeChatモバイルアプリケーション。バージョンは、6月に使用したデバイスまたはアプリの履歴から確認すること。–2024年7月 | アンケート実施のためのオンライン配信チャネルとして使用し、オンラインおよびWeChat経由で27件の回答済みオンラインアンケートを回収した。 | |
| 電話および対面によるリクルート手順 | 研究チーム | 標準化されたリクルート手順;市販のカタログ番号なし | 機関や参加者への連絡、研究目的および調査内容の説明、ならびにアンケート実施前のインフォームドコンセントの取得支援に使用されます。 |
| SPSS Statistics | IBM | バージョン 27.0 | 記述統計、ピアソン相関係数、クロンバックのα係数に使用されます’Cronbachの$\alpha$係数による信頼性分析、歪度および尖度を用いた正規性の確認、およびHarmanの単一因子テスト’共通メソッドバイアスに関する単一因子検定。 |
| SPSS Amos | IBM | バージョン 26.0 | 確認的因子分析、構造方程式モデリング、多群測定不変性検定、間接効果のブートストラップ検定、および代替モデルの比較に使用される。 |
| Microsoft Excel | Microsoft | Microsoft 365 ExcelまたはローカルにインストールされたExcelバージョン(提出前に正確なローカルビルドを確認すること) | コード化された調査データ、データ辞書、補足表、およびJoVE材料表(Table of Materials)を整理するためのワークブック環境として推奨または使用される。正確なローカルバージョンについては、著者が確認する必要がある。 |
| 構造方程式モデリングにおける適合度指標の基準 | 既報の手法ガイダンス。原稿内で引用されているSchreiberらおよびKlineの参考文献。 | 市販のカタログ番号なし。統計解析計画書で適用された基準。 | カイ二乗統計量、自由度あたりのカイ二乗値、Tucker-Lewis指数、比較適合度指数(CFI)、修正適合度指数(AGFI)、増分適合度指数(IFI)、近似誤差平均平方根(RMSEA)、および標準化残差平均平方根(SRMR)を含むモデル適合度指標を定義し、報告します。 |
| ブートストラップ法による媒介分析の手順 | SPSS Amos / 研究チーム統計解析計画書 | 5,000回のブートストラップサンプル;95%バイアス補正信頼区間 | 教師の自己効力感を介した間接的な関連性を検証するために使用した。95%バイアス補正信頼区間にゼロが含まれない場合に、間接効果が有意であるとみなした。 |
| 測定不変性の検証手順 | SPSS Amos / 研究チーム統計解析計画書 | 多群確認的因子分析 Δ補体因子I <. 010 かつ ΔRMSEA(近似誤差平均平方二乗誤差) &.015未満の基準 | プールされた構造方程式モデリング(SEM)の推定値を解釈する前に、性別、プログラムの種類、インターンシップ期間、および機関における形態不変性、メトリック不変性、およびスカラー不変性を評価するために使用した。 |