本研究は、cGAN前処理、セグメンテーション、GCN、ASFO、トランスモデリングを用いて術中顕微鏡映像から手術リスクを予測するディープラーニングパイプラインを提供します。CaDISおよびSICS-105データセットでは高い性能が達成されていますが、臨床妥当性は間接的なラベル付けによって制限されています。
研究記事
本研究は、cGAN前処理、セグメンテーション、GCN、ASFO、トランスモデリングを用いて術中顕微鏡映像から手術リスクを予測するディープラーニングパイプラインを提供します。CaDISおよびSICS-105データセットでは高い性能が達成されていますが、臨床妥当性は間接的なラベル付けによって制限されています。
硝子体切除術では術後の合併症が依然として大きな課題であり、しばしば視力障害や繰り返しの介入を引き起こします。本研究は、術中の顕微鏡映像から時空間的特徴を抽出することで手術リスクを予測するためのディープラーニングフレームワークを提示します。前処理中には、動作の手ぶれ、照明正規化、cGANベースのアーティファクト抑制などの映像強調技術が適用され、入力品質の向上が図られます。輪郭適応セグメンテーションを用いて関連する外科領域を区画し、その後、構造認識型特徴抽出のためのグラフ畳み込みネットワークが用いられます。適応型ヒマワリ最適化手法を統合して特徴選択を精緻化し、トランスを使ったモデルが時間的依存性を捉えて最終リスク予測を行います。このフレームワークは、CaDISとSICS-105という2つの公開データセットで評価されています。モデルはCaDISデータセットで98.9%の精度、97.5%の精度、98.2%の想起率、97.9%のF1スコア、98.1%のAUCを記録しました。さらに、セグメンテーションモジュールは98.9%のピクセル精度、クラスごとの98.5%の精度、96.6%のmIoUを達成しました。モデルはSICS-105データセットにおいて99.1%の精度、98.5%のF1スコア、98.7%の感度、98.7%の特異度、および99.10%のROC AUCを達成しました。これらの結果は、ベースラインモデルに対して一貫した改善を示しています。全体として、GAN強化された前処理、グラフベースの特徴学習、最適化、トランスモデリングの統合により、予測信頼性が向上します。このアプローチは、術中ビデオ解析がリアルタイムの臨床意思決定支援や術後リスク層化の改善に役立つ可能性を強調しています。
Pars plana vitrectomy(PPV)は、網膜剥離、糖尿病性網膜症、黄斑洞、硝子体出血1型など、さまざまな硝子体網膜疾患の管理における外科的手技の基礎です。手術器具や可視化の進歩にもかかわらず、術後合併症は依然として重要な罹患要因であり、軽度の視覚障害から、再発性網膜剥離、眼内視管炎、制御不能な眼圧などの視力を脅かす事態まで多岐にわたります。これらの合併症のリスクが高い患者の特定は臨床実践における重要な未充足の必要性であり、より情報に基づいた手術計画、個別化された術後ケア、迅速な介入を可能にします3。従来、PPVのリスク評価は、合併症や術前眼疾患などの静的な術前要因と、外科医による主観的な術中判断(4,5,6,7)に依存してきました。さらに、最近の硝子体切除術は高解像度の外科顕微鏡映像で詳細に記録されており、豊富ながらも十分に活用されていないデータ源を提供しています。これらの記録は解剖学的および病理学的特徴だけでなく、外科医と組織の相互作用、術中の出来事、手術の動きも捉えており、さらなる合併症を予測する可能性がある8,9,10,11。
ディープラーニングは眼底画像分類、自動手術スキル評価、光コヒーレンス断層撮影(OCT)解析など、眼科の多様な分野で顕著な性能を示しています12。さらに、一部の研究では術中のビデオデータを体系的に活用して術後転帰を予測しています。手術ビデオの時空間的性質は独自の課題をもたらします。高次元データ、外科医間のばらつき、時間的依存性、患者の解剖学、そしてデバイス13、14、15、16です。しかし、臨床領域を雄弁に統合するには、正確かつ正確な予測だけでなく、リアルタイムでの外科的環境間での堅牢性、解釈可能性、一般化可能性も求められます17。
眼科学および外科データサイエンスの分野では、機械学習(ML)やディープラーニング(DL)が近年かなり人気を集めています。その応用例には、転帰予測、外科技術評価、診断画像診断19が含まれます。術中の手術状況を理解するためのDLベースの枠組みは、いくつかの研究で検討されています。例えば、Nespolo20 は硝子体網膜手術における組織や器具の意味解釈のためのDLパイプラインを提案することで、課題全体での一般化可能性を示しました。客観的なパフォーマンス評価を促進するために、手術技術や器具と組織の相互作用に関する包括的なデータの抽出が可能になりました。同様に、Nespoloらは術中顕微鏡とインスタンスセグメンテーションネットワーク(YOLACT++)を用いたリアルタイム検出・分割モデルを開発し、手術指導の実現可能性を示しました 。
さらに、AI駆動の手法はワークフロー、トレーニング、手術評価の改善に役立つツールとして認識されています22,23。これらの技術により、位相分割、リアルタイムの器具追跡、眼科顕微鏡手術における安全性向上が可能となります。Muellerらによるシステマティックレビュー23では、臨床翻訳と信頼性に関する現在の課題も浮き彫りに、術中手術記録の分析における機械学習(ML)の利用拡大が示されました。いくつかの研究では、画像診断や臨床データを用いてDLモデルを用いて術後転帰を予測しています。例えば、OCTおよび臨床的特徴に基づくモデルが特発性網膜前膜症例の視覚転帰予測に用いられており、同様の手法は多施設データセットにわたる黄斑洞患者の術後転帰予測において有効であることが示されています25。他の研究では、マルチモーダルDLフレームワークを用いて増殖性硝子体閉膜症の重症度を明らかにし、超広視野イメージングを用いて網膜剥離再発を予測することに焦点を当てています27。さらに、硝子体網膜疾患の視覚的転帰および基礎病因は、人口統計学的、臨床的、外科的変数を組み込んだ機械学習モデルを用いて予測されています 28,29,30。
これらの進展にもかかわらず、現在の多くの手法は術中の動態にほとんど重点を置かず、主に術前データや静的な術後画像に依拠しています。一部の研究では手術用ビデオ解析をセグメンテーションや評価に用いていますが、合併症の可能性を予測するために時空間的術中データを直接組み込むことはありません。その結果、術中の顕微鏡ビデオデータを予測モデリングに利用することには依然として大きなギャップがあります。術後の硝子体切除術合併症を予測するための正確かつ臨床的に重要な枠組みを作るためには、このギャップを埋める必要があります。
本研究では、術中硝子体切除術ビデオから抽出された時空間的特徴と、術後合併症リスクを予測するための構造化された臨床メタデータを統合した新しいマルチモーダルDLフレームワークを提示します。高度なビデオエンコーダ(畳み込み型やトランス型アーキテクチャなど)とメタデータ融合戦略18を組み合わせることで、このスキームは高リスクの術中イベントを認識し、調整された合併症確率を提供し、医師が解釈可能な可視化を生成することを目指しています。多施設推定、解釈可能性分析、比較研究により、術中ビデオを手術結果の予測バイオマーカーとして利用する可能性が示されました。術中の顕微鏡記録の時空間データを用いて硝子体切除術の術後合併症を予測する強力なDLフレームワークの開発が本プロジェクトの主な目標です。予測精度と一般化の観点から、cGANベースの前処理、GCN駆動の特徴抽出、ASFOベースの最適化、トランスモデリングを組み合わせた提案された統合アプローチは、既存の手法を上回ると期待されています。
本研究は術中顕微鏡映像を効率的に活用し、術後硝子体切除術の問題予測のための包括的なDLフレームワークを提示しています。現在の手法が主に静的画像診断や術前臨床データに依存しているのに対し、提案された手法は高度な機械学習技術と時空間的ビデオ解析を斬新に組み合わせています。特に、この手法はグラフ畳み込みネットワーク(GCN)を用いて手術シーン内の構造的および関係性を捉え、正確な領域区分のための輪郭適応セグメンテーション(CAS)、そしてアーティファクト抑制のためのcGANベースのビデオ強化モジュールを用いています。さらに、モデルの収束性と判別力を向上させるために、特徴選択における探索と活用のバランスを取るために、適応型ひまわり最適化(ASFO)アルゴリズムが用いられています。最後に、手術シーケンス間の時間的ダイナミクスは、時空間的な注意プーリングを用いたトランス構成アーキテクチャを用いてモデル化されます。現在のパイプラインに比べて大きな改善となったこの包括的な統合により、前処理、セグメンテーション、グラフベースの特徴学習、最適化、注意駆動型予測が統合され、より正確で信頼性が高く、臨床的に意味のあるリスク予測が可能になります。CaDISおよびSICS-105データセットは、白内障手術解析を主な目的とするものの、術中の時空間的特徴を学習するための代理視覚データセットとして本研究で用いられています。明示的に示された合併症ラベルの代わりに、これらの形質を用いて術後硝子体切除術の問題のリスクをモデル化し、推定します。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
本研究で使用されたCaDISおよびSICS-105データセットは公開されており、事前の機関審査委員会の承認とインフォームドコンセントのもとで収集されており、それぞれの出版物で報告されています。本研究は完全に匿名化されたデータの二次分析のみを含み、追加の倫理的承認やインフォームド・コンセントは必要ありません。
提案されたモデルは、術中の顕微鏡ビデオから時空間的パターンを活用して術後の硝子体切除合併症を予測するよう設計されました。パイプラインは、前処理、セグメンテーション、特徴抽出、特徴最適化、分類の4つの主要な段階で構成されており、 図1に示されています。
術後合併症のリスクの術中評価が本研究の予測目標です。CaDISおよびSICS-105データセットには縦断的な追跡データがないため、モデルは特定の時間窓内で臨床的に検証された術後事象を予測できません。むしろ、術中の手術パターンを用いて問題の可能性を推測します。この文脈での「合併症」の運用上の定義には、不規則な相転移、異常な器具と組織の相互作用、そして手術の複雑さの増加に伴う手術ワークフローの変動が含まれます。解釈可能性と信頼性の高い評価を確保するために、予測ジョブはケースを低リスクグループと高リスクグループに分類する二項分類問題として設計されています。この定式化は、直接的な臨床診断システムとして機能するのではなく、提案された枠組みを術中の意思決定支援ツールとして機能させることを可能にします。
データセットの説明:
提案モデルは、データセットA(CaDIS、画像セグメンテーション用白内障データセット)とSICS-105(小切開白内障手術)データセットの2つのデータセットで評価されました。
(i) CaDIS31:このデータセットは白内障手術動画のセグメンテーションタスクのために開発されました。これは公開されているCATARACTSチャレンジデータセットを補完するために導入され、手術映像解析のためのDLスキームの開発を推進することを目的としています。このデータセットは、白内障手術の複数の段階を描いた25本のビデオ記録、合計4,670フレームの注釈付きフレームで構成されています(補足図1)。各フレームには綿密に注釈が付けられ、セグメンテーションスキームの学習や推定に必要なピクセル単位のラベルが提供されます。これはDLモデルの手術映像のパフォーマンスを評価するベンチマークとして機能します。
(ii) SICS-105(小切開白内障手術)データセット32:このデータセットは、2023年から2024年の6か月間にわたり、外科医が実施し、4名の眼科医によって注釈付きで行われた105件の記録を含み、20のフェーズをカバーしています(補足図2)。動画の総再生時間は22時間39分で、解像度は1920×1080ピクセル(ダウンサンプリング960×540ピクセル)、30fpsです。平均的な動画の長さは12分57秒(σ=4分31秒)です。データセットはZenodoリポジトリのURLで公開されています:https://doi.org/10.5281/zenodo.13847781。代表的な入力サンプルは 補足図1 および補 足図2 に示されています。CaDISおよびSICS-105データセットはもともと白内障手術における外科的相認識および分割のために設計されましたが、術後硝子体切除術合併症に関する情報は限られています。術後の硝子体切除合併症に関する情報不足に対応するため、術中の視覚パターンやビデオシーケンス内のイベントに基づくリスク情報の代理ラベルセットを提案します。データセット内のフレームおよびビデオシーケンスには、臨床的理解に基づくヒューリスティック(器具と組織の相互作用の複雑さ、手術時間の異常、閉塞、不安定性、異常運動など)に基づく3段階のリスク情報(低、中、高)が注釈付けられました。提案された処方は臨床アウトカムをラベルとして用いず、術後合併症のリスク情報の代理ラベルとして扱っています。
cGANアプローチを用いた前処理
通常、生のフレームは照明の変動、ぼかし、鏡面アーティファクトによって劣化することが多いです。これに対処するために、条件付き生成敵対ネットワーク(cGAN)が用いられ、映像を強化します。生フレームとは、補正や正規化の前に、術中の顕微鏡ビデオ記録から直接抽出された元の未処理フレームのことです。これらのフレームには、照明の変動、モーションブラー、鏡面反射、手術器具やカメラの動きによるノイズなどのアーティファクトが通常含まれています。ジェネレーターはクリーンなフレームを復元し、判別器は視覚的なリアリズムを強制します。ピクセル再構成、敵対的、時間的整合性損失を統合し、アーティファクトのない安定した映像シーケンスを後回解析のために確保する目的関数です。
タイムステップtでの劣化フレームItが生成元の入力であり、改良されたフレームYt = G(It)が出力となります。入力 It に条件付けられ、判別器は生成された出力とグラウンドトゥルースのクリーンなフレーム Yt を区別するように訓練されます。訓練目的には、高品質な再構築を保証するためにいくつかの損失関数が組み込まれています:(i) 現実性を強制するための敵対的損失;(ii) 強度忠実度を維持するためのピクセル単位の再構成損失(L1損失);(iii) 構造的一貫性を保つために深い特徴表現を用いた知覚損失;(iv) 連続フレーム間の滑らかなトランジションを確保し、ちらつきアーティファクトを防ぐための時間的一貫性の喪失。
特徴抽出のための高品質な入力を確保するため、術中の顕微鏡ビデオは最初にcGANを用いて強調されます。生のフレームI*はクリーンフレームの劣化観察とみなされます。生成元 G は強化フレームの復元のために写像 G(It) = It を学習する一方、判別子 D は実際のサンプルと生成されたサンプルを区別します。訓練目的は、敵対的損失 Lアドv, , 知覚損失 Lピクセルベースの再構築損失 Ll1、時間的整合性 Ltemp. を統合します。このモデルは、時間的および構造的な整合性を維持しつつ、ぼかし、鏡面アーティファクト、ノイズを抑制し、安定したアーティファクトのないビデオシーケンスを下流解析に提供します。GANの定式化は補足ファイル1の方程式[1-6]に表されています。
輪郭適応分割(CAS)を用いたセグメンテーション
この中で、セグメンテーションは等高線適応セグメンテーションモデルを用いて行われます。これにより顕微鏡画像における影響を受けた硝子体切除画像のセグメント化の予備的輪郭が定義され、補 足ファイル1の式[7-12]に示されているようにエネルギー関数を低減します。低いエネルギー値により、リスクのある地域の正確な表現と局所的な評価が保証されます。これにより、影響を受けた領域の正確なセグメンテーションが可能となり、次のセクションでの特徴抽出が容易になります。
動的時空GCN(dGCN)を用いた特徴抽出
前処理段階が完了すると、次のステップは識別可能な時空間的特徴を抽出することです。このため、構造化された依存関係を捉えるのに効果的であるため、グラフ畳み込みネットワーク(GCN)が用いられます。採用されたモデルは、非線形活性化を持つ積層GCN層で構成されており、オーバーフィッティングを緩和し、正規化機構を通じて勾配消失問題に対処しています。GCNの定式化はグラフ畳み込みの一階スペクトル近似に依存しており、大規模な半教師あり学習課題に適しています。さらに、線形化表現は最適化を簡素化し、効果的なパラメータ学習を保証します。簡略化GCNの操作は 補足ファイル1の方程式[13–15]に表現されています。GCNを適用すると、術中の映像データから高次の構造表現を効率的に抽出します。その後、最適化支援選択機構によって、最も重要なまたは適切な特徴のみが保持されます。これは次の節で説明します。
適応型ヒマワリ型特徴最適化(ASFO)を用いた特徴最適化
適応型ひまわり最適化アルゴリズム(ASFO)は、古典的ひまわり最適化アプローチ(SFOA)の強化版です。提案モデルでは、この生物学的に駆動されるプロセスが高次元データセットにおける精緻化と特徴選択に対応するために数学的にモデル化されています。具体的には、このアプローチは収束速度の向上、探索と活用のバランスを取って解の多様性を保ち、早期収束を緩和するために最適化されています。ASFOの数学的定式化は 補足ファイル1の方程式[16–21]に記載されています。この方式は、解が最適に近い時点で収束を加速させます。詳細なアルゴリズムは 補足ファイル1に記載されています。提案されたパイプラインでは、トランスベースの融合後に特徴ベクトルを精緻化するためにASFOが用いられます。選ばれた特徴は、質感ベース、色と強度、形態的および構造的、運動的および時間的、高次元、注意重み付けの領域記述子です。目的は特徴関連損失関数を最小化し、冗長性を減らすことで分類精度を高める特徴を選択・重み付けすることです。
時空間的注意プーリングを用いたトランスフォーマーベースの分類ヘッド
トランスを用いるモデルを用いて、手術用ビデオシーケンス間の時間的依存性を捉えます。モデルはマルチヘッドセルフアテンション、位置符号化、最終リスク予測のための完全連結層で構成されています。ハイパーパラメータ最適化はASFOを用いて行われます。統合パイプラインは、前処理、特徴抽出、最適化、トランスによる分類を組み合わせ、正確な外科的リスク予測を可能にします。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
提案モデルの有効性を評価するため、実際の硝子体切除データセットを用いて広範な実験が実施されました。前処理、特徴抽出の有効性、予測精度の各面でパフォーマンスが評価されました。
パフォーマンス分析と比較推定
提案された方法論は、正確さ、精度、リコール率、F1スコア、mIoU、ピクセル精度(PA)、クラスごとの精度(PAC)、感度、特異度、ROC、AUCなどの指標を用いてベースラインモデルと比較されました。分類アウトカムの解釈には真陽性(TP)、真陰性(TN)、偽陽性(FP)、偽陰性(FN)率が用いられ、TPは正しく特定された高リスク症例、FNは臨床現場で重要な見逃された高リスク症例を示します。
時空間的注意プーリングを用いたトランス型分類ヘッド - データセットAのパフォーマンス比較
パ...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
CaDISおよびSICS-105データセットでの実験的評価により、提案モデルの堅牢性と従来の手法に対する優位性が確認されました。ResNet-50、LSTM-CNN、セグメンテーション駆動型ネットワーク(UNet、DeepLabV3+、UPerNet、HRNetV2)などのベースラインモデルは比較的良好に動作しますが、照明の変化、遮蔽、モーションブラー、工具と組織の相互作用など、術中の映像変動性によって妨げられています(22,23)。これらの制限により、マイノリティクラスでは精度の低下、低い記憶力、不安定な予測が生まれました。高度な前処理戦略(動作安定化、照明正規化、GANベースのアーティファクト抑制)を統合することで、提案されたスキームは一貫性のある高品質な入力を確保し、その後の段階でのエラー蓄積を大幅に減少させます。グラフ依存時空間的...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
著者には開示すべき利益相反はありません。
著者らは、必要な機関的支援と資源を提供してくれた四川北医科大学に感謝の意を表します。術中の顕微鏡撮影の撮影に協力してくださった広元中央病院の臨床スタッフに特別な感謝を申し上げます。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| 高性能ワークステーション | NVIDIA社、アメリカ | RTX-A6000 | モデルトレーニングに使用され、48GBのVRAM搭載CPU、Intel Core i9 CPU、128GB RAMを搭載 |
| Python (v3.10) | Pythonソフトウェア財団 | オープンソース | モデル開発と実験のためのコアプログラミング言語 |
| テンソルフロー(v2.15) | Googleリサーチ | オープンソース | cGAN前処理およびトランスフォーマー分類器の実装に使用されるフレームワーク |
| PyTorch(バージョン2.2.0) | メタAI | オープンソース | GCNおよび適応型ヒマワリ最適化モジュールの実装に使用されます |
| CUDA ツールキット(v12.1) | NVIDIAコーポレーション | CUDA-12.1 | すべての深層学習計算に対してGPUアクセラレーションを提供します |
| 条件付き生成対抗ネットワーク(cGAN) | Pix2Pix フレームワークからの適応 | 該当なし | 映像の強調や前処理中のアーティファクト除去に使用 |
| 光フロー推定器(RAFT) | ティード&デン(ECCV 2020) | 該当なし | 前処理中のフレーム間の時間的整合性を確保する |
| 輪郭適応セグメンテーション(CAS)モデル | カスタム実装 | 該当なし | 硝子体切除術動画における正確な境界分割のための修正アクティブ輪郭モデル |
| 動的グラフ畳み込みネットワーク(GCN) | カスタム実装(Kipf &ウェリング、2017年) | 該当なし | ビデオ特徴ノード間の時空間的関係を抽出します |
| 適応型ひまわり最適化アルゴリズム(ASFO) | カスタム実装 | 該当なし | 特徴選択の最適化および次元削減に使用 |
| トランスフォーマーエンコーダモデル | カスタム実装(Vaswani ら、2017年に基づく) | 該当なし | 時空間的注意プーリングを用いた最終術後合併症分類に使用されます |
| Matplotlib(v3.8) | Pythonソフトウェア財団 | オープンソース | パフォーマンス指標やプロットの可視化に使用されます |
| シーボーン(v0.13) | Pythonソフトウェア財団 | オープンソース | 高度な可視化および統計グラフィックスに使用 |
| アダム・オプティマイザー | TensorFlow組み込み | 該当なし | モデルトレーニングに使用され、学習率 = 1e-4、ベータ;1=0.9, β2=0.999 |
| 損失関数スイート(L_adv、L_l1、L_perc、L_temp、L_G) | カスタム実装 | 該当なし | GANトレーニングにおける敵対的損失、知覚損失、ピクセル損失、時間損失を定義します |
| オペレーティングシステム | Ubuntu Linux 22.04 LTS | 該当なし | ディープラーニング実験のための基盤環境 |
| 評価指標パッケージ | scikit-learn(v1.5.0) | オープンソース | 精度、精度、リコール率、F1スコア、AUC、mIoUの計算に使用されます |
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト