مقالة بحثية

تحليل التصوير الزماني القائم على التعلم العميق لفيديوهات جراحة الماء الأبيض لتقييم المخاطر الجراحية

DOI:

10.3791/70025

مايو 15, 2026

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تقدم هذه الدراسة خط أنابيب تعلم عميق للتنبؤ بالمخاطر الجراحية من فيديوهات المجهر أثناء العمليات باستخدام cGAN المعالجة المسبقة، والتقسيم، وGCN، وASFO، ونمذجة المحول. يتم تحقيق أداء عال على مجموعات بيانات CaDIS وSICS-105، رغم أن الصلاحية السريرية محدودة بسبب التصنيف غير المباشر.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تظل المضاعفات بعد العملية تحديا كبيرا في جراحة استئصال الجسم الزجاجي، وغالبا ما تؤدي إلى ضعف في النتائج البصرية وتدخلات متكررة. تقدم هذه الدراسة إطار تعلم عميق للتنبؤ بالمخاطر الجراحية عن طريق استخراج ميزات مكانية وزمانية من فيديوهات المجهر أثناء العملية. خلال المعالجة المسبقة، يتم تطبيق تقنيات تعزيز الفيديو، بما في ذلك تثبيت الحركة، وتطبيع الإضاءة، وقمع التشويش المعتمد على cGAN، لتحسين جودة الإدخال. يستخدم التقسيم التكيفي للخطوط لتحديد المناطق الجراحية ذات الصلة، يليه الشبكات الالتفافية البيانية لاستخراج الميزات الواعية للبنية. يتم دمج نهج تحسين عباد الشمس التكيفي لتحسين اختيار الميزات، ويرصد نموذج قائم على المحول الاعتماديات الزمنية للتنبؤ النهائي بالمخاطر. يتم تقييم الإطار بناء على مجموعتين بيانات عامتين، CaDIS وSICS-105. حقق النموذج دقة 98.9٪، ودقة 97.5٪، و98.2٪ استرجاع، و97.9٪ في F1، و98.1٪ AUC على مجموعة بيانات CaDIS. علاوة على ذلك، حققت وحدة التقسيم دقة بكسل 98.9٪، ودقة 98.5٪ لكل فئة، و96.6٪ mIoU. حقق النموذج دقة 99.1٪، و98.5٪ في درجة F1، وحساسية 98.7٪، وخصوصية 98.7٪، وتقييم ROC AUC بنسبة 99.10٪ في مجموعة بيانات SICS-105. تظهر هذه النتائج تحسنا مستمرا مقارنة بالنماذج الأساسية. بشكل عام، يعزز دمج المعالجة المسبقة المحسنة ب GAN، وتعلم الميزات المعتمد على الرسوم البيانية، والتحسين، ونمذجة المحولات من الموثوقية التنبؤية. يبرز هذا النهج إمكانات تحليل الفيديو أثناء العمليات لدعم اتخاذ القرار السريري في الوقت الحقيقي وتحسين تصنيف المخاطر بعد العملية.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

استئصال الجسم الزجاجي (PPV) هو أساس للإجراءات الجراحية في إدارة مختلف أمراض الجسم الزجاجي الشبكية، بما في ذلك انفصال الشبكية، واعتلال الشبكية السكري، وثقب البقعة، ونزيف الجسم الزجاجي1. على الرغم من التقدم في الأجهزة الجراحية والتصوير، تظل المضاعفات بعد العملية مصدرا مهما للمراضة، مع نتائج تتراوح بين اضطرابات بصرية طفيفة إلى أحداث تهدد الرؤية مثل انفصال الشبكية المتكرر، التهاب الغف الداخلي، أو الضغط داخل العين غير المسيطرعليه. تحديد المرضى المعرضين لخطر أعلى لهذه المضاعفات هو حاجة حيوية غير ملباة في الممارسة السريرية، حيث يتيح تخطيطا جراحيا أكثر وعيا، ورعاية شخصية بعد العمليات، وتدخلات في الوقت المناسب3. تقليديا، اعتمد تقييم المخاطر في PPV على عوامل ثابتة قبل العملية (مثل الأمراض المصاحبة وحالات العين قبل العملية) والحكم الذاتي أثناء العملية من قبل الجراح4،5،6،7. علاوة على ذلك، تم توثيق جراحة استئصال الجسم الزجاجي الحديثة بشكل واسع عبر فيديو مجهر جراحي عالي الدقة، مما يوفر مصدرا غنيا لكنه غير مستغل للبيانات. لذا تلتقط هذه التسجيلات ليس فقط السمات التشريحية والمرضية، بل أيضا التفاعلات بين الجراح والأنسجة، والأحداث أثناء العملية، والحركات الجراحية التي قد تتنبأ بمضاعفات إضافية 8,9,10,11.

أظهر التعلم العميق أداء ملحوظا في مجالات مختلفة في طب العيون، بما في ذلك تصنيف صور القاع، وتقييم المهارات الجراحية الآلي، وتحليل التصوير المقطعي التماسكي البصري (OCT)12. علاوة على ذلك، استفادت بعض الدراسات بشكل منهجي من بيانات الفيديو أثناء العملية للتنبؤ بنتائج ما بعد العملية. الطبيعة الزمانية المكانية لمقاطع الفيديو الجراحية تطرح تحديات فريدة: البيانات عالية الأبعاد، التفاوت بين الجراحين، الاعتمادات الزمنية، تشريح المريض، والأجهزة 13,14,15,16. ومع ذلك، فإن التكامل البليغ للمجال السريري يتطلب ليس فقط التنبؤات الدقيقة أو الدقيقة، بل أيضا المتانة، وقابلية التفسير، والتعميم عبر البيئات الجراحية في الوقت الحقيقي17.

في مجالي طب العيون وعلم البيانات الجراحي18، أصبح التعلم الآلي (ML) والتعلم العميق (DL) شائعين جدا مؤخرا. تشمل تطبيقاتها التنبؤ بالنتائج، وتقييم المهارات الجراحية، والتصوير التشخيصي19. تم دراسة الأطر المعتمدة على DL لفهم الحالات الجراحية أثناء العمليات في عدة دراسات. على سبيل المثال، أظهر نيسبولو20 قابلية التعميم عبر المهام من خلال اقتراح خط أنابيب DL لتفسير الدلالة للأنسجة والأدوات في جراحة الجسم الزجاجي الشبكية. ولتسهيل تقييم الأداء الموضوعي، تم توسيع هذا التقييم لتمكين استخراج بيانات شاملة حول تقنيات الجراحة وتفاعلات الأدوات والأنسجة. وبنفس السياق، أظهر نسبولو وآخرون جدوى التوجيه الجراحي من خلال تطوير نموذج كشف وتقسيم في الوقت الحقيقي باستخدام المجهر أثناء العمليات وشبكة تقسيم العينات (YOLACT++).

بالإضافة إلى ذلك، تم الاعتراف بالطرق المدعومة بالذكاء الاصطناعي كأدوات مفيدة لتحسين سير العمل، والتدريب، والتقييم الجراحي22,23. تمكن هذه التقنيات من تقسيم الأطوار، وتتبع الأجهزة في الوقت الحقيقي، وزيادة السلامة في جراحة العيون الدقيقة. وقد أظهر الاستخدام المتزايد للتعلم الآلي (ML) في تحليل التسجيلات الجراحية أثناء العمليات من خلال مراجعة منهجية أجراها مولر وآخرون، والتي سلطت الضوء أيضا على المشكلات الحالية المتعلقة بالترجمة السريرية والموثوقية. استخدمت عدة دراسات نماذج DL مع التصوير والبيانات السريرية للتنبؤ بنتائج ما بعد العملية. على سبيل المثال، تم استخدام نماذج تعتمد على OCT والخصائص السريرية للتنبؤ بالنتائج البصرية في حالات الغشاء فوق الشبكي مجهول السبب24، وأظهرت طرق مماثلة فعالية في التنبؤ بالنتائج بعد العملية لدى مرضى الثقب البقعي عبر مجموعات بيانات متعددة المراكز25. ركزت دراسات أخرى على تحديد شدة اعتلال الجسم الزجاجي التكاثفي باستخدام أطر DL متعددة الوسائط26 والتنبؤ بتكرار انفصال الشبكية باستخدام التصوير فائق المجال27. علاوة على ذلك، تم التنبؤ بالنتائج البصرية والأسباب الكامنة وراء أمراض الجسم الزجاجي الشبكية باستخدام نماذج تعلم آلي تدمج المتغيرات الديموغرافية والسريرية والجراحية 28,29,30.

على الرغم من هذه التطورات، فإن غالبية الطرق الحالية لا تركز كثيرا على الديناميكيات أثناء العملية وتعتمد بشكل أساسي على بيانات ما قبل العملية أو التصوير الثابت بعد العملية. على الرغم من أن بعض الدراسات تستخدم تحليل الفيديو الجراحي للتقسيم والتقييم 20,21,22,23، إلا أنها لا تدمج مباشرة بيانات المكان-زمان أثناء العملية للتنبؤ باحتمالية حدوث مضاعفات. ونتيجة لذلك، لا يزال هناك فجوة كبيرة في استخدام بيانات الفيديو المجهرية أثناء العمليات للنمذجة التنبؤية. لإنشاء أطر دقيقة وذات أهمية سريرية للتنبؤ بمضاعفات استئصال الجسم الزجاجي بعد العملية، يجب سد هذه الفجوة.

في هذه الدراسة، تم تقديم إطار عمل جديد متعدد الوسائط لاستئصال الجسم الزجاجي يدمج الميزات الزمانية المكانية المستخرجة من فيديوهات استئصال الجسم الزجاجي أثناء العملية مع بيانات وصفية سريرية منظمة للتنبؤ بخطر المضاعفات بعد العملية. من خلال استخدام مشفرات فيديو متقدمة (مثل البنى الالفافية والمحولات) إلى جانب استراتيجيات دمج البيانات الوصفية18، يهدف هذا النظام إلى التعرف على الأحداث عالية المخاطر أثناء العملية، وتوفير احتمالات مضاعفات معايرة، وتوليد تصورات قابلة للتفسير للأطباء. من خلال التقديرات متعددة المراكز، وتحليلات قابلية التفسير، والدراسات المقارنة، تم إثبات جدوى استخدام الفيديو أثناء العملية كمؤشر حيوي تنبؤي للنتيجة الجراحية18. الهدف الأساسي لهذا المشروع هو تطوير إطار قوي لاستئصال الجسم البصري يستخدم بيانات الزمان المكاني من تسجيلات المجهر داخل العمليات للتنبؤ بالمضاعفات بعد العملية في جراحة استئصال الجسم الزجاجي. من حيث الدقة التنبؤية والتعميم، من المتوقع أن يتجاوز النهج المتكامل المقترح، الذي يجمع بين المعالجة المسبقة المعتمدة على cGAN، واستخراج الميزات المدفوعة ب GCN، والتحسين القائم على ASFO، والنمذجة القائمة على المحولات، الطرق الحالية.

يستفيد هذا العمل بكفاءة من مقاطع الفيديو داخل المجهر الجراحية لتقديم إطار عمل شامل لاستئصال الجسم الزجاجي للتنبؤ بمشاكل استئصال الجسم الزجاجي بعد العملية. على عكس الطرق الحالية التي تعتمد غالبا على أساليب التصوير الثابت أو البيانات السريرية قبل العملية، تجمع المنهجية المقترحة بين تقنيات التعلم الآلي المتقدمة وتحليلات الفيديو الزماني المكاني بطريقة مبتكرة. على وجه الخصوص، تستخدم المنهجية شبكات الالتفاف البيانية (GCNs) لالتقاط العلاقات الهيكلية والعلائقية داخل المشاهد الجراحية، وتقسيم التكيف بالشكل (CAS) لتحديد المناطق بدقة، ووحدة تعزيز الفيديو المبنية على cGAN لقمع الآثار الأثرية. علاوة على ذلك، لتحسين تقارب النماذج والقدرة التمييزية، يستخدم خوارزمية تحسين عباد الشمس التكيفي (ASFO) لموازنة الاستكشاف والاستغلال في اختيار الميزات. أخيرا، يتم نمذجة الديناميكيات الزمنية عبر التسلسلات الجراحية باستخدام بنية قائمة على المحول مع تجميع انتباه مكاني وزماني. يعد هذا التكامل الشامل للمعالجة المسبقة، والتقسيم، وتعلم الميزات المعتمد على الرسوم البيانية، والتحسين، والتنبؤ المدفوع بالانتباه، تحسنا كبيرا مقارنة بخطوط الأنابيب الحالية، مما يتيح توقعا للمخاطر بدقة وموثوقية ومعنى سريري. تستخدم مجموعات بيانات CaDIS وSICS-105 في هذه الدراسة كمجموعات بيانات بصرية بديلة لتعلم ميزات الزمان والمكان، رغم أن الغرض الأساسي منها هو تحليل جراحة المياه البيضاء. بدلا من استخدام علامات مضاعفات محددة بشكل صريح، تستخدم هذه الصفات لنمذجة واستنتاج خطر الإصابة بمشاكل استئصال الجسم الزجاجي بعد العملية.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

مجموعات بيانات CaDIS وSICS-105 المستخدمة في هذه الدراسة متاحة للجمهور، وقد جمعت في الأصل بموافقة مسبقة من لجنة المراجعة المؤسسية وموافقة مستنيرة، كما ورد في منشوراتهم. تتضمن هذه الدراسة فقط تحليلا ثانويا للبيانات المجهولة بالكامل الهوية الكاملة، ولذلك لم تكن هناك حاجة لموافقة أخلاقية إضافية أو موافقة مستنيرة إضافية.

تم تصميم النموذج المقترح للتنبؤ بمضاعفات استئصال الجسم الزجاجي بعد العملية من خلال الاستفادة من أنماط التصوير الزماني والمكاني من فيديوهات المجهر أثناء العملية. يتكون خط الأنابيب من أربع مراحل رئيسية: المعالجة المسبقة، التقسيم، استخراج الميزات، تحسين الميزات، والتصنيف، كما هو موضح في الشكل 1.

التقييم أثناء العملية لمخاطر المضاعفات بعد العملية هو هدف التنبؤ في الدراسة. لا يمكن للنموذج التنبؤ بالأحداث التي تم التحقق منها سريريا بعد العملية ضمن فترة زمنية محددة لأن مجموعتي بيانات CaDIS وSICS-105 تفتقران إلى بيانات المتابعة الطولية. بل يستخدم أنماط الجراحة أثناء العملية لاستنتاج احتمال حدوث مشاكل محتملة. تشمل التعريفات التشغيلية ل "المضاعفات" في هذا السياق انتقالات الطور غير المنتظمة، والتفاعلات غير الطبيعية بين الأدوات والأنسجة، والتغيرات في سير العمل الجراحي المرتبطة بتعقيد الجراحة الأعلى. لضمان قابلية التفسير والتقييم الموثوق، تم تصميم وظيفة التنبؤ كمسألة تصنيف ثنائية تصنف الحالات إلى مجموعات منخفضة وعالية الخطورة. بدلا من أن تكون نظاما تشخيصيا سريريا مباشرا، تسمح هذه الصياغة للإطار المقترح بأن يكون أداة دعم اتخاذ القرار أثناء العملية.

وصف مجموعة البيانات:

تم تقييم النموذج المقترح على مجموعتين بياناتي: مجموعة البيانات A (CaDIS، مجموعة بيانات الماء الأبيض لتقسيم الصور) ومجموعة بيانات SICS-105 (جراحة الماء الأبيض بشق صغير).

(i) CaDIS31: تم تطوير هذه المجموعة من البيانات لمهمة التقسيم في فيديوهات جراحة المياه البيضاء. تم تقديم هذا النظام ليكمل مجموعة بيانات تحدي CATARACTS المتاحة للجمهور، ويهدف إلى تطوير أنظمة DL لتحليل مقاطع الفيديو الجراحية. تتكون مجموعة البيانات من 25 تسجيلا فيديو بإجمالي 4,670 إطارا مشروحا، وتظهر عدة مراحل من جراحة الساد (الشكل التكميلي 1). يتم توضيح كل إطار بدقة، مما يوفر تسميات على مستوى البكسل اللازمة للتدريب وتقدير مخطط التقسيم. ويعد هذا النموذج معيارا لتقييم أداء نموذج DL في فيديوهات الجراحة.

(2) مجموعة بيانات SICS-105 (جراحة الماء الأبيض بشق صغير)32: تتكون هذه المجموعة من 105 تسجيلات أجراها الجراحون وتم تعليق عليها من قبل أربعة أطباء عيون خلال فترة 6 أشهر خلال الفترة 2023–2024، تغطي 20 مرحلة (الشكل التكميلي 2). مدة الفيديو الإجمالية هي 22 ساعة و39 دقيقة، بدقة 1920 × 1080 بكسل (تم تقليل العينة إلى 960 × 540) و30 إطار في الثانية. متوسط طول الفيديو هو 12 دقيقة و57 ثانية (σ=4:31 دقيقة). مجموعة بيانات متاحة للجمهور في مستودع زينودو على الرابط: https://doi.org/10.5281/zenodo.13847781. تظهر عينات المدخلات الممثلة في الشكل التكميلي 1 والشكل التكميلي 2. على الرغم من أن مجموعتي بيانات CaDIS وSICS-105 صممت في الأصل للتعرف على الطور الجراحي وتقسيمها في جراحة المياه البيضاء، إلا أن المعلومات حول مضاعفات استئصال الجسم الزجاجي بعد العملية محدودة. لمعالجة نقص المعلومات حول مضاعفات استئصال الجسم الزجاجي بعد العملية، نقترح مجموعة من العلامات البديلة لمعلومات المخاطر بناء على الأنماط البصرية أثناء العملية والأحداث في تسلسل الفيديو. تم تعليق الإطارات وتسلسلات الفيديو في مجموعات البيانات بمعلومات مخاطر ثلاثية المستويات (منخفضة، متوسطة، عالية) وفقا لمجموعة من القواعد الاستدلالية المستوحاة من الفهم السريري، بما في ذلك تعقيد تفاعل الأدوات والأنسجة، واضطرابات مدة الجراحة، والانسداد، وعدم الاستقرار، والحركة غير الطبيعية. الصياغة المقترحة لا تستخدم النتائج السريرية كتصنيفات، بل تعالجها كتسميات بديلة لمعلومات المخاطر في المضاعفات المحتملة بعد العملية.

المعالجة المسبقة باستخدام نهج cGAN

عادة، غالبا ما تتدهور الإطارات الخام بسبب تغير الإضاءة، والتشويه، والعيوب المرآتية. لمعالجة ذلك، يستخدم شبكة خصومة توليدية شرطية (cGAN) لتعزيز الفيديو. الإطارات الخام هي الإطارات الأصلية غير المعالجة التي يتم استخراجها مباشرة من تسجيلات الفيديو المجهرية أثناء العملية، قبل أي تحسين أو تطبيئ. عادة ما تحتوي هذه الإطارات على تشوهات مثل تغير الإضاءة، وضبابية الحركة، وانعكاسات مرآتية، وضوضاء ناتجة عن الأدوات الجراحية وحركة الكاميرا. يقوم المولد باستعادة الإطارات النظيفة بينما يفرض المميز الواقعية البصرية. دالة الهدف التي تدمج إعادة بناء البكسلات، وخسائر الاتساق العدائي، والزمنية، لضمان تسلسلات فيديو خالية من الآثار ومستقرة للتحليل الإضافي.

الإطار المتدهور It عند الخطوة الزمنية t هو مدخل المولد، بينما الإطار المحسن Yt = G(It) هو مخرجه. مشروطا بالإدخال It، يتم تدريب المميز على التمييز بين الناتج الناتج وإطار الحقيقة النظيفة Yt. يتضمن هدف التدريب عدة وظائف خسارة لضمان إعادة بناء عالية الجودة: (1) خسارة خصمية لفرض الواقعية؛ (2) فقدان إعادة البناء حسب البكسل (فقدان L1) للحفاظ على دقة الشدة؛ (3) فقدان الإدراك للحفاظ على الاتساق البنيوي باستخدام تمثيلات الخصائص العميقة؛ و(4) فقدان الاتساق الزمني لضمان انتقالات سلسة عبر الإطارات المتتالية ومنع الوميض من الآثار الزائدة.

لضمان جودة عالية لاستخراج الميزات، يتم تحسين فيديوهات المجهر أثناء العمليات في البداية باستخدام cGAN. كل إطار خام I*t* يعتبر ملاحظة متدهورة لإطار نظيف. يتعلم المولد G تعيين G(It) = It لاستعادة الإطارات المحسنة، بينما يميز المميز D بين العينات الحقيقية والمولدة. هدف التدريب يدمج الخسارة العدائية Ladv، والخسارة الإدراكية Lperc وخسارة إعادة البناء المعتمدة على البكسل Ll1، والاتساق الزمني L درجة الحرارة. يقوم هذا النموذج بقمع الضبابية، والعيوب المرآتية، والضوضاء مع الحفاظ على التماسك الزمني والبنيوي، مما ينتج تسلسلات فيديو مستقرة وخالية من العيوب للتحليل في المرحلة اللاحقة. يتم التعبير عن صياغة GAN في المعادلات [1-6] من الملف التكميلي 1.

التقسيم باستخدام التقسيم التكيفي للكنتور (CAS)

في هذا، يتم تنفيذ التقسيم باستخدام نموذج تقسيم تكيفي للكنتور. يحدد هذا مخططا أوليا لتقسيم الصور المتأثرة باستئصال الجسم الزجاجي في صور المجهر، مما يقلل من دالة الطاقة، كما هو موضح في المعادلات [7-12] في الملف التكميلي 1. تضمن القيمة المنخفضة للطاقة تمثيلات دقيقة وتقييما محليا للمناطق المعرضة للخطر. وهذا بدوره يسمح بتقسيم دقيق للمناطق المتأثرة، مما يسهل لاحقا استخراج الميزات في القسم التالي.

استخراج الميزات باستخدام GCN الزماني الديناميكي (dGCN)

بمجرد اكتمال مرحلة المعالجة المسبقة، تكون الخطوة التالية هي استخراج الميزات الزمنية الفضائية التمييزية. لهذا السبب، تستخدم شبكة الالتفاف البيانية (GCN)، لأنها فعالة في التقاط التبعيات المنظمة. يتكون النموذج المعتمد من طبقات GCN مكدسة مع تفعيلات غير خطية تقلل من الإفراط في التركيب وتعالج مشكلة اختفاء التدرج من خلال آلية تطبيع (NORMAL). تعتمد صياغة GCN على تقريب طيفي من الدرجة الأولى لتداخلات الرسوم البيانية، مما يجعلها مناسبة لمهام التعلم شبه المراقبة واسعة النطاق. علاوة على ذلك، يبسط التمثيل الخطي التحسين، مما يضمن التعلم الفعال للمعلمات. يتم التعبير عن عملية GCN المبسط في المعادلات [13–15] من الملف التكميلي 1. عند تطبيقه، يستخرج GCN بكفاءة تمثيلات هيكلية أعلى مستوى من بيانات الفيديو أثناء العملية. وبالتالي، يتم الاحتفاظ فقط بالميزات الأكثر صلة أو ملاءمة بدلا من آلية اختيار بمساعدة التحسين، والتي يتم وصفها في القسم التالي.

تحسين الميزات باستخدام تحسين الميزات القائم على عباد الشمس التكيفي (ASFO)

خوارزمية تحسين عباد الشمس التكيفية (ASFO) هي نسخة محسنة من النهج الكلاسيكي لتحسين عباد الشمس (SFOA). في النموذج المقترح، يتم نمذجة هذه العملية البيولوجية رياضيا لمعالجة التنقيح واختيار الميزات في مجموعة بيانات عالية الأبعاد. على وجه التحديد، تم تصميم هذا النهج لتحسين سرعة التقارب، وموازنة الاستكشاف والاستغلال للحفاظ على تنوع الحلول، والتخفيف من التقارب المبكر. الصياغة الرياضية ل ASFO مذكورة في المعادلات [16–21] من الملف التكميلي 1. هذا المخطط يسرع التقارب عندما تكون الحلول قريبة من المثالية. الخوارزمية التفصيلية مقدمة في الملف التكميلي 1. في خط الأنابيب المقترح، يستخدم ASFO لتحسين متجه الميزة بعد الاندماج القائم على المحولات. الميزات المختارة هي واصفات المناطق القائمة على النسيج، اللون والشدة، المورفولوجية والهيكلية، الحركة والزمنية، عالية الأبعاد، والوزن الوزني بالانتباه. الهدف هو تقليل دالة فقدان الصلة بالميزات، وبالتالي اختيار ووزن الميزات التي تعزز دقة التصنيف من خلال تقليل التكرار.

رأس تصنيف قائم على المحول مع تجميع انتباه في الزمان والمكان

يستخدم نموذج قائم على المحول لالتقاط الاعتمادات الزمنية عبر تسلسلات الفيديو الجراحية. تم تكوين النموذج مع تركيز ذاتي متعدد الرؤوس، وترميز موضعي، وطبقات متصلة بالكامل للتنبؤ بالمخاطر النهائية. يتم تنفيذ تحسين المعلمات الفائقة باستخدام ASFO. يجمع خط الأنابيب المتكامل بين المعالجة المسبقة، واستخراج الميزات، والتحسين، والتصنيف المعتمد على المحولات لتمكين التنبؤ الدقيق بالمخاطر الجراحية.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

لتقييم فعالية النموذج المقترح، أجريت تجارب موسعة باستخدام مجموعات بيانات استئصال الجسم الزجاجي في العالم الحقيقي. تم تقييم الأداء عبر المعالجة المسبقة، وفعالية استخراج الميزات، ودقة التنبؤ.

تحليل الأداء والتقدير المقارن

تمت مقارنة المنهجية المقترحة مع نماذج الأساس باستخدام مقاييس تشمل الدقة، الدقة، الاسترجاع، درجة F1، mIoU، دقة البكسل (PA)، الدقة لكل فئة (PAC)، الحساسية، النوعية، ROC، وAUC. تم استخدام معدلات الإيجاب...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يؤكد التقييم التجريبي لمجموعتي بيانات CaDIS وSICS-105 متانة وتفوق النموذج المقترح على الأساليب التقليدية. النماذج الأساسية مثل ResNet-50، LSTM-CNN، والشبكات المدفوعة بالتقسيم (UNet، DeepLabV3+، UPerNet، HRNetV2) تؤدي أداء جيدا إلى حد معقول لكنها تعاني من التغيرات الجوهرية في الفيديو أثناء العملية، بما في ذلك التغيرات في الإضاءة، والحواجز، وضباب الحركة، وتفاعلات الأداة والأنسجة22،23. أدت هذه القيود إلى انخفاض الدقة، وانخفاض الاستد...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

لا يوجد لدى المؤلفين تضارب مصالح للكشف عنها.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يرغب المؤلفون في شكر كلية شمال سيتشوان الطبية على توفير الدعم المؤسسي والموارد اللازمة. شكر خاص للطاقم السريري في مستشفى غوانغيوان المركزي على مساعدتهم في جمع مقاطع الفيديو أثناء العملية.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
محطة العمل عالية الأداءشركة NVIDIA، الولايات المتحدة الأمريكيةRTX-A6000يستخدم لتدريب النماذج؛ بطاقة رسومات بذاكرة VRAM بسعة 48 جيجابايت مع معالج Intel Core i9 وذاكرة RAM بسعة 128 جيجابايت
بايثون (الإصدار 3.10)مؤسسة بايثون للبرمجياتالمصدر المفتوحلغة البرمجة الأساسية لتطوير النماذج والتجريب
TensorFlow (الإصدار 2.15)أبحاث جوجلالمصدر المفتوحإطار عمل يستخدم لتنفيذ معالجة cGAN المسبقة ومصنف المحول
بايتورش (الإصدار 2.2.0)الذكاء الاصطناعي الضخمالمصدر المفتوحيستخدم لتنفيذ وحدات GCN وتحسين عباد الشمس التكيفي
مجموعة أدوات CUDA (الإصدار 12.1)شركة NVIDIACUDA-12.1يوفر تسريع وحدة معالجة الرسومات لجميع حسابات التعلم العميق
الشبكة العدائية التولدية الشرطية (cGAN)مقتبس من إطار عمل Pix2Pixلا يوجديستخدم لتحسين الفيديو وإزالة العيوب أثناء المعالجة المسبقة
مقدر التدفق البصري (RAFT)تيد & دينغ (ECCV 2020)لا يوجديضمن الاتساق الزمني عبر الإطارات أثناء المعالجة المسبقة
نموذج تقسيم الخطوط التكيفية (CAS)تنفيذ مخصصلا يوجدنموذج الكونتور النشط المعدل لتقسيم الحدود بدقة في فيديوهات استئصال الجسم الزجاجي
شبكة الالتفاف الديناميكي للرسم البياني (GCN)تنفيذ مخصص (مبني على Kipf و Kipf ويلينغ، 2017)لا يوجديستخرج العلاقات الزمانية المكانية بين عقد ميزات الفيديو
خوارزمية تحسين عباد الشمس التكيفية (ASFO)تنفيذ مخصصلا يوجديستخدم لاختيار الميزات الأمثل وتقليل الأبعاد
نموذج مشفر المحولاتالتنفيذ المخصص (استنادا إلى فاسواني وآخرين، 2017)لا يوجديستخدم في التصنيف النهائي للمضاعفات بعد العملية مع تجميع الانتباه الزماني المكاني
ماتبلوتليب (الإصدار 3.8)مؤسسة بايثون للبرمجياتالمصدر المفتوحيستخدم لتصوير مقاييس الأداء والمخططات
Seaborn (v0.13)مؤسسة بايثون للبرمجياتالمصدر المفتوحيستخدم للتصوير المتقدم والرسومات الإحصائية
آدم أوبسينسرTensorFlow المدمجلا يوجديستخدم لتدريب النماذج؛ معدل التعلم = 1e-4، &بيتا؛ 1=0.9، β 2=0.999
مجموعة وظائف الخسارة (L_adv، L_l1، L_perc، L_temp، L_G)تنفيذ مخصصلا يوجديحدد الخسائر العدائية، الإدراكية، البكسلية، والزمنية لتدريب GAN
نظام التشغيلأوبونتو لينكس 22.04 LTSلا يوجدالبيئة الأساسية لتجارب التعلم العميق
حزمة مقاييس التقييمSCIKIT-Learn (الإصدار 1.5.0)المصدر المفتوحيستخدم لحساب الدقة، والدقة، والاسترجاع، ودرجة F1، وAUC، وmIoU

المراجع

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhang, Z. R., Li, J. J., Li, K. R. Artificial intelligence in individualized retinal disease management. Int. J. Ophthalmol. 17, 1519(2024).
  2. Liu, Y., et al. Automated detection of nine infantile fundus diseases and conditions in retinal images using a deep learning system. EPMA J. 15, 39-51 (2024).
  3. Wang, X. N., et al. A deep learning system for detection of optic disc neovascularization in diabetic retinopathy. Vis. Comput. 41, 1293-1302 (2025).
  4. Ni, L., et al. Prediction of postoperative macular hole status by automated preoperative retinal OCT analysis. Ophthalmic Surg. Lasers Imaging Retina. 56, 355-360 (2025).
  5. Mathews, M. R., Anzar, S. M. Advancing computer-assisted diabetic retinopathy grading. Int. J. Imaging Syst. Technol. 35, e70152(2025).
  6. Wu, X. Y., et al. Bibliometric analysis of global myopia research. Int. J. Ophthalmol. 17, 940(2024).
  7. Rahat, S. R. U. I., et al. Advancing diabetic retinopathy detection with AI and deep learning. Br. J. Nurs. Stud. 5, 1-13 (2025).
  8. Rezaei, A., et al. Automated multimodal severity assessment of diabetic retinopathy. SSRN. , (2024).
  9. Suzue, M., et al. Predicting visual outcomes after vitrectomy. Graefes Arch. Clin. Exp. Ophthalmol. 263, 2505-2513 (2025).
  10. Sabeena, A. S., Jeyakumar, M. K. Ensemble deep learning for diabetic retinopathy classification. Biomater. Devices. , (2025).
  11. Gencer, K., et al. GAN-based approach for diabetic retinopathy detection. Photodiagn. Photodyn. Ther. 53, 104552(2025).
  12. Huang, Z., et al. Risk prediction model for neovascular glaucoma. Front. Cell Dev. Biol. 13, 1604832(2025).
  13. Wang, Y., Liu, L., Wang, C. Trends in deep learning for biomedical prediction. Front. Neurosci. 17, 1256351(2023).
  14. Tang, J., et al. Ectopic inner foveal layer as prognostic predictor. Sci. Rep. 15, 25066(2025).
  15. Shamsan, A., et al. Predicting diabetic retinopathy stages using deep learning. PLoS One. 18, e0289555(2023).
  16. Baldi, P. F., et al. Vitreoretinal surgical instrument tracking. Transl. Vis. Sci. Technol. 12, 20(2023).
  17. Yuan, S., et al. Risk factors after vitrectomy with silicone oil. Sci. Rep. 13, 10423(2023).
  18. Wei, Y., et al. DRDB platform for diabetic retinopathy. Oxid. Med. Cell Longev. 2022, 1718353(2022).
  19. Yagin, F. H., et al. Explainable AI for metabolomics analysis. Diagnostics. 14, 1364(2024).
  20. Nespolo, R. G. Intraoperative artificial intelligence in ophthalmology. , University of Illinois Chicago. Doctoral dissertation (2024).
  21. Nespolo, R. G., et al. Real-time segmentation in vitreoretinal surgery. Ophthalmol. Retina. 7, 236-242 (2023).
  22. Mishra, K., Leng, T. Artificial intelligence and ophthalmic surgery. Curr. Opin. Ophthalmol. 32, 425-430 (2021).
  23. Mueller, S., et al. AI in cataract surgery: systematic review. Transl. Vis. Sci. Technol. 13, 20(2024).
  24. Wen, D., et al. Postoperative visual acuity prediction. BMC Ophthalmol. 23, 361(2023).
  25. Hu, Y., et al. Prediction of macular hole status. Ann. Transl. Med. 9, 51(2021).
  26. Catania, F., et al. Deep learning for retinal detachment recurrence. Acta Ophthalmol. 102, e984-e993 (2024).
  27. Gan, F., et al. AI-PVR Insight system. Quant. Imaging Med. Surg. 15, 2774(2025).
  28. Lee, S. S., et al. Prediction after diabetic vitrectomy. Transl. Vis. Sci. Technol. 11, 25(2022).
  29. Kamnig, R., et al. Neural network for visual acuity prediction. Ophthalmol. Sci. 5, 100762(2025).
  30. Kim, J., et al. Prediction of vitreous hemorrhage causes. Diagnostics. 15, 371(2025).
  31. Flouty, E., et al. CaDIS dataset. CoRR. abs/1905.08993, (2019).
  32. Mueller, S., et al. Phase recognition in cataract surgery. Sci. Rep. 15, 16886(2025).
  33. Aravinda, C. V., et al. Hybrid architecture for video frame prediction. J. Real-Time Image Process. 22, 50(2025).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

Deep Learning FrameworkIntraoperative Video AnalysisVideo EnhancementContour Adaptive SegmentationGraph Convolutional NetworksTransformer ModelClinical Decision Support

مقالات ذات صلة