Araştırma makalesi

Cerrahi Risk Değerlendirmesi İçin Katarakt Cerrahisi Videolarının Derin Öğrenme Tabanlı Uzaylı-Zamansal Analizi Videoları

DOI:

10.3791/70025

15 Mayıs 2026

Bu makalede

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma, cGAN ön işleme, segmentasyon, GCN, ASFO ve transformator modelleme kullanarak ameliyat dışı mikroskopik videolardan cerrahi riski tahmin etmek için derin öğrenme boru hattı sunmaktadır. CaDIS ve SICS-105 veri setlerinde yüksek performans sağlanır, ancak klinik geçerlilik dolaylı etiketlemeyle sınırlıdır.

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Vitrektomi cerrahisinde ameliyat sonrası komplikasyonlar önemli bir zorluk olmaya devam etmekte olup, genellikle görsel sonuçların bozulmasına ve tekrarlanan müdahalelere yol açmaktadır. Bu çalışma, ameliyat dışı mikroskopi videolarından uzaylı-zamansal özellikleri çıkararak cerrahi riski tahmin etmek için derin öğrenme çerçevesi sunmaktadır. Ön işleme sırasında, giriş kalitesini artırmak için hareket stabilizasyonu, aydınlatma normalizasyonu ve cGAN tabanlı artefakt bastırma gibi video geliştirme teknikleri uygulanır. İlgili cerrahi bölgeleri belirlemek için kontur-adaptif segmentasyon kullanılır, ardından yapıya duyarlı özellik çıkarımı için Grafik Konvolüsyon Ağlar uygulanır. Özellik seçimini geliştirmek için Adaptif Günçiçeği Optimizasyonu yaklaşımı entegre edilir ve transformator tabanlı bir model, nihai risk tahmini için zamansal bağımlılıkları yakalar. Çerçeve, CaDIS ve SICS-105 olmak üzere iki kamuya açık veri seti üzerinde değerlendirilmektedir. Model, CaDIS veri setinde %98,9 doğruluk, %97,5 hassasiyet, %98,2 hatırlama, %97,9 F1 puanı ve %98,1 AUC elde etti. Ayrıca, segmentasyon modülü %98,9 piksel doğruluğu, %98,5 sınıf başına doğruluk ve %96,6 mIoU elde etti. Model, SICS-105 veri setinde %99,1 doğruluk, %98,5 F1 puanı, %98,7 hassasiyet, %98,7 özgüllük ve %99,10 ROC AUC elde etti. Bu sonuçlar, temel modellere göre tutarlı iyileşmeler göstermektedir. Genel olarak, GAN ile geliştirilmiş ön işleme, grafik tabanlı özellik öğrenme, optimizasyon ve transformator modellemenin entegrasyonu, tahmin güvenilirliğini artırır. Bu yaklaşım, ameliyat içi video analizinin gerçek zamanlı klinik karar desteği ve operasyon sonrası risk tabakalaşmasını iyileştirme potansiyelini vurgulamaktadır.

Giriş

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Pars plana vitrektomi (PPV), retina ayrılması, diyabetik retinopati, makula deliği ve vitreus kanama gibi çeşitli vitreoretinal hastalıkların yönetiminde cerrahi işlemler için bir tebnedir. Cerrahi enstrümantasyon ve görselleştirmedeki ilerlemelere rağmen, ameliyat sonrası komplikasyonlar önemli bir morbidite kaynağı olmaya devam etmektedir; sonuçlar küçük görsel bozukluklardan tekrarlayan retina ayrılması, endoftalmit veya kontrolsüz göz içi basıncı gibi görme tehlikesi oluşturanolaylara kadar uzanmaktadır. Bu komplikasyonlara daha yüksek risk taşıyan hastaların tespit edilmesi, klinik uygulamada daha bilinçli cerrahi planlama, kişiselleştirilmiş ameliyat sonrası bakım ve zamanında müdahaleler mümkün kıldığı için kritik bir karşılanmamış ihtiyaçolarak görülür. Geleneksel olarak, PPV'de risk değerlendirmesi statik preoperatif faktörlere (örneğin eş hastalıkları ve ameliyat öncesi göz hastalıkları) ve cerrahın öznel intraoperatifyargısına dayanmıştır 4,5,6,7. Ayrıca, son vitrektomi ameliyatı, yüksek çözünürlüklü cerrahi mikroskopi videosu üzerinden kapsamlı şekilde belgelenmiş ve zengin ama az kullanılan bir veri kaynağı sunmaktadır. Bu kayıtlar böylece sadece anatomik ve patolojik özellikleri değil, aynı zamanda cerrah-doku etkileşimlerini, ameliyat içi olayları ve cerrahi hareketleri de yakalıyor; bunlar da daha fazla komplikasyonu öngörebilir; 8,9,10,11.

Derin Öğrenme, fundus görüntü sınıflandırması, otomatik cerrahi beceri değerlendirmesi ve Optik Koherens Tomografi (OCT) analizi dahil olmak üzere oftalmolojide çeşitli alanlarda olağanüstü performansgöstermiştir. Ayrıca, bazı çalışmalar ameliyat sonrası sonuçları tahmin etmek için sistematik olarak ameliyat içi video verilerini kullanmıştır. Cerrahi videoların mekansal-zamansal doğası benzersiz zorluklar yaratır: yüksek boyutlu veriler, cerrahlar arasındaki değişkenlik, zaman bağımlılıkları, hasta anatomisi ve cihazlar 13,14,15,16. Ancak, klinik alanın etkili bir entegrasyonu yalnızca doğru veya kesin tahminler değil, aynı zamanda gerçek zamanlı cerrahi ortamlarda sağlamlık, yorumlanabilirlik vegenellenebilirlik gerektirir 17.

Oftalmoloji ve cerrahi veribilimi alanlarında 18, makine öğrenimi (ML) ve derin öğrenme (DL) son zamanlarda oldukça popüler hale geldi. Uygulamaları arasında sonuç tahmini, cerrahi beceri değerlendirmesi ve tanısal görüntülemeyer alır 19. Ameliyat içi cerrahi durumları anlamak için DL tabanlı çerçeveler birçok çalışmada incelenmiştir. Örneğin, Nespolo20 , vitreoretinal cerrahideki dokular ve aletlerin anlamsal yorumlanması için bir DL boru hattı önererek görevler arasında genellenebilirlik göstermiştir. Nesnel performans değerlendirmesini kolaylaştırmak için, cerrahi teknikler ve enstrüman-doku etkileşimleri hakkında kapsamlı verilerin çıkarılmasını mümkün kılacak şekilde bu daha da genişletildi. Benzer bir açıda, Nespolo ve ark.21 , intraoperatif mikroskopi ve örnek segmentasyon ağı (YOLACT++) kullanarak gerçek zamanlı bir tespit ve segmentasyon modeli geliştirerek cerrahi rehberliğin uygulanabilirliğini göstermiştir.

Ayrıca, yapay zeka odaklı yöntemler, iş akışını, eğitimi ve cerrahi değerlendirmeyi iyileştirmek için faydalı araçlarolarak kabul edilmiştir 22,23. Bu teknikler, faz segmentasyonu, gerçek zamanlı enstrüman takibi ve oftalmik mikrocerrahide güvenliğin artmasını sağlar. Ameliyat dışı cerrahi kayıtların analizinde makine öğreniminin (ML) genişleyen kullanımı, Mueller ve ark.23 tarafından yapılan sistematik bir incelemeyle de gösterilmiştir; bu inceleme, klinik çeviri ve güvenilirlikle ilgili güncel sorunları da vurgulamaktadır. Birçok çalışma, ameliyat sonrası sonuçları tahmin etmek için görüntüleme ve klinik verilerle DL modelleri kullanmıştır. Örneğin, OCT ve klinik özelliklere dayalı modeller, idiopatik epiretinal membran24 vakalarında görsel sonuçları tahmin etmek için kullanılmıştır ve benzer yöntemler, çok merkezli veri setlerinde makula deliği hastalarında ameliyat sonrası sonuçların tahmin edilmesinde etkililikgöstermiştir 25. Diğer çalışmalar, multimodal DL çerçeveleriyle proliferatif vitreoretinopati'nin şiddetini belirlemeye ve ultra-geniş alan görüntüleme ile retina ayrılmasının tekrarını tahmin etmeyeodaklanmıştır 27. Ayrıca, vitreoretinal hastalıklarda görsel sonuçlar ve altta yatan etiyolojiler, demografik, klinik ve cerrahi değişkenleri içeren makine öğrenimimodelleri kullanılarak tahmin edilmiştir 28,29,30.

Bu gelişmelere rağmen, mevcut yöntemlerin çoğu intraoperatif dinamiklere çok az önem verir ve esas olarak ameliyat öncesi verilere veya statik ameliyat sonrası görüntülemeye dayanır. Bazı çalışmalar segmentasyon ve değerlendirme için cerrahi videoanalizi kullansa da, komplikasyon olasılığını tahmin etmek için doğrudan mekani-zaman intraoperatif verileri dahil etmezler. Sonuç olarak, öngörücü modelleme için ameliyat içi mikroskobik video verilerinin kullanılmasında hâlâ önemli bir boşluk vardır. Postoperatif vitrektomi komplikasyonlarını tahmin etmek için kesin, klinik açıdan önemli çerçeveler oluşturmak için bu boşluk doldurulmalıdır.

Bu çalışmada, ameliyat sonrası komplikasyon riskini tahmin etmek için intraoperatif vitrektomi videolarından çıkarılan uzaylı-zamansal özellikleri yapılandırılmış klinik meta verilerle birleştiren yeni bir multimodal DL çerçevesi sunulmaktadır. Gelişmiş video kodlayıcıları (örneğin konvolüsyon ve transformasyon tabanlı mimariler) ve metaveri birleştirmestratejileri 18 kullanarak, bu şema yüksek riskli ameliyat içi olayları tanımayı, kalibre edilmiş komplikasyon olasılıkları sağlamayı ve doktorlar için yorumlanabilir görselleştirmeler üretmeyi amaçlar. Çok merkezli tahmin, yorumlanabilirlik analizleri ve karşılaştırmalı çalışmalarla, ameliyat içi videonun cerrahi sonuç için öngörülü bir biyobelirteç olarak kullanılmasının mümkünlüğü gösterilmiştir18. Ameliyat içi mikroskop kayıtlarından alınan uzaylı-zamansal verileri kullanarak vitrektomi ameliyatındaki ameliyat sonrası komplikasyonları tahmin eden güçlü bir DL çerçevesi geliştirmek bu projenin birincil hedefidir. Tahmin doğruluğu ve genelleme açısından, cGAN tabanlı ön işleme, GCN tabanlı özellik çıkarımı, ASFO tabanlı optimizasyon ve transformatör tabanlı modellemeyi birleştiren önerilen entegre yaklaşımın mevcut yöntemleri aşması beklenmektedir.

Bu çalışma, ameliyat içi mikroskop videolarını verimli bir şekilde kullanarak ameliyat sonrası vitrektomi problemi tahmini için kapsamlı bir DL çerçevesi sunar. Mevcut yöntemlerin aksine, çoğunlukla statik görüntüleme yöntemleri veya ameliyat öncesi klinik verilere dayanırken, önerilen metodoloji, gelişmiş makine öğrenimi tekniklerini uzaylı-zamansal video analitiği ile yenilikçi bir şekilde birleştiriyor. Özellikle, metodoloji, cerrahi sahnelerde yapısal ve ilişkisel ilişkileri yakalamak için Grafik Konvolüsyon Ağlar (GCN), doğru bölge ayırımı için Kontur Adaptif Segmentasyonu (CAS) ve artefakt baskısı için cGAN tabanlı video geliştirme modülü kullanır. Ayrıca, model yakınsamasını ve ayırt etme gücünü artırmak için, özellik seçiminde keşif ve sömürü dengelemek için Adaptif Ayçiçeği Optimizasyonu (ASFO) algoritması kullanılır. Son olarak, cerrahi diziler arasındaki zaman dinamikleri, uzamsal zaman dikkat havuzu ile transformator tabanlı bir mimari kullanılarak modellenir. Mevcut boru hatlarına göre büyük bir gelişme olan bu kapsamlı ön işleme, segmentasyon, grafik tabanlı özellik öğrenimi, optimizasyon ve dikkat odaklı tahmin entegrasyonu, daha kesin, güvenilir ve klinik olarak anlamlı risk tahminlerini mümkün kılar. CaDIS ve SICS-105 veri setleri, birincil amaçları katarakt cerrahisi analizi olmasına rağmen, bu çalışmada intraoperatif uzamsal özellikleri öğrenmek için vekil görsel veri setleri olarak kullanılmıştır. Açıkça belirtilmiş komplikasyon etiketleri kullanılmak yerine, bu özellikler ameliyat sonrası vitrektomi sorunlarının riskini modellemek ve çıkarmak için kullanılır.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Protokol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışmada kullanılan CaDIS ve SICS-105 veri setleri kamuya açık olup, ilgili yayınlarında bildirildiği üzere önceden kurumsal inceleme kurulu onayı ve bilgilendirilmiş onayı ile toplanmıştır. Bu çalışma, tamamen anonimleştirilmiş verilerin yalnızca ikincil analizini içeriyor ve bu nedenle ek etik onay veya bilgilendirilmiş onay gerekmemektedir.

Önerilen model, ameliyat sonrası vitrektomi komplikasyonlarını, intraoperatif mikroskopi videolarından alınan mekansal zamansal desenlerden yararlanarak tahmin etmek üzere tasarlandı. Pipeline dört ana aşamadan oluşur: ön işleme, segmentasyon, özellik çıkarma, özellik optimizasyonu ve sınıflandırma, Şekil 1'de gösterildiği gibi.

Ameliyat sonrası komplikasyon riskinin intraoperatif değerlendirmesi, çalışmanın tahmin hedefidir. Model, CaDIS ve SICS-105 veri setlerinde uzunlamasına takip verisi bulunmadığı için klinik olarak doğrulanmış ameliyat sonrası olayları belirli bir zaman aralığında tahmin edemez. Bunun yerine, olası sorunların olasılığını çıkarmak için ameliyat içi cerrahi kalıplar kullanır. Bu bağlamda "komplikasyon"un operasyonel tanımları arasında düzensiz faz geçişleri, anormal enstrüman-doku etkileşimleri ve cerrahi karmaşıklıkla ilişkili cerrahi iş akışındaki değişiklikler yer alır. Yorumlanabilirlik ve güvenilir değerlendirme sağlamak için, tahmin işi vakaları düşük ve yüksek riskli gruplara ayıran ikili bir sınıflandırma problemi olarak tasarlanmıştır. Bu formülasyon, doğrudan bir klinik tanı sistemi olarak hizmet vermek yerine, önerilen çerçevenin ameliyat sırasında bir karar destek aracı olarak hizmet vermesine olanak tanır.

Veri Seti Açıklaması:

Önerilen model iki veri seti üzerinde değerlendirildi: veri seti A (CaDIS, Görüntü Segmentasyonu için Katarakt Veri Seti) ve SICS-105 (Küçük İnsüzyonlu Katarakt Cerrahisi) veri seti.

(i) CaDIS31: Bu veri seti, katarakt ameliyatı videolarında segmentasyon görevi için geliştirilmiştir. Bu, kamuya açık CATARACTS challenge veri setini tamamlamak için tanıtılmış ve böylece cerrahi videoların analizi için DL şemalarının geliştirilmesini ilerletmeyi amaçlamaktadır. Veri seti, katarakt ameliyatının birkaç aşamasını gösteren toplam 4.670 annotlu çerçeveye sahip 25 video kaydından oluşmaktadır (Ek Şekil 1). Her kare titizlikle notlanmıştır; bu da eğitim ve segmentasyon şemasının tahmini için gereken piksel düzeyinde etiketler sağlar. DL modelinin cerrahi videolardaki performansını değerlendirmek için bir kıyastır görevi görür.

(ii) SICS-105 (küçük kesili katarakt cerrahisi) veriseti 32: Bu veri seti, 2023–2024 yılları arasında 6 aylık bir dönemde cerrahlar tarafından yapılan ve dört göz doktoru tarafından notasyonlanmış 105 kayıttan oluşmakta olup, 20 aşamayı kapsar (Ek Şekil 2). Toplam video süresi 22 saat 39 dakika olup, çözünürlük 1920 × 1080 piksel (960 × 540'a düşürülmüş) ve 30 fps çözünürlüktür. Ortalama bir video süresi 12 dakika 57 saniyedir (σ=4:31 dakika). Bir veri seti, Zenodo deposunda şu URL'de kamuya açık erişilebilir: https://doi.org/10.5281/zenodo.13847781. Temsilci giriş örnekleri Ek Şekil 1 ve Ek Şekil 2'de gösterilmiştir. CaDIS ve SICS-105 veri setleri başlangıçta katarakt cerrahisinde cerrahi faz tanıma ve segmentasyon için tasarlanmış olsa da, ameliyat sonrası vitrektomi komplikasyonları hakkında sınırlı bilgi bulunmaktadır. Postoperatif vitrektomi komplikasyonları hakkında bilgi eksikliğini gidermek için, video dizisindeki intraoperatif görsel desenlere ve olaylara dayanarak risk bilgisi için bir dizi vekil etiket öneriyoruz. Veri setlerindeki çerçeveler ve video dizileri klinik anlayıştan ilham alan sezgisel yöntemlere göre üç seviyeli risk bilgisi (düşük, orta, yüksek) ile notlandı; bunlar arasında enstrümant-doku etkileşim karmaşıklığı, cerrahi süre anormallikleri, tıkanma, kararsızlık ve anormal hareket dahil. Önerilen formülasyon, klinik sonuçları etiket olarak kullanmaz, aksine, ameliyat sonrası komplikasyonlara ilişkin risk bilgisi için vekil etiketler olarak ele alır.

cGAN yaklaşımıyla ön işleme

Genellikle, ham kareler genellikle aydınlatma varyasyonu, bulanıklık ve sözel artefaktlar nedeniyle bozulur. Bunu çözmek için, videoyu geliştirmek için koşullu Üretken Karşıt Ağ (cGAN) kullanılır. Ham kareler, herhangi bir geliştirme veya normalizasyon öncesinde, ameliyat içi mikroskopik video kayıtlarından doğrudan çıkarılan orijinal, işlenmemiş karelerdir. Bu çerçeveler genellikle aydınlatma değişkenliği, hareket bulanıklığı, sözel yansımalar ve cerrahi aletler ile kamera hareketinden kaynaklanan gürültü gibi artefaktlar içerir. Bir jeneratör temiz çerçeveleri geri getirirken, ayrımcı görsel gerçekçiliği sağlar. Piksel yeniden yapılandırma, karşıt ve zamansal tutarlılık kayıplarını entegre eden hedef fonksiyon, daha fazla analiz için artefaktsız ve kararlı video dizilerini sağlar.

Zaman adımı t'de kare I t olarak azalan bir kare jeneratörün girişidir, geliştirilmiş bir kare ise Yt = G(It) onun çıktısıdır. Giriş It ile koşullu olan ayrımcı, üretilen çıktı ile zemin gerçekliği temiz çerçevesi Yt arasındaki ayrımı yapacak şekilde eğitilir. Eğitim amacı, yüksek kaliteli yeniden yapıyı garanti etmek için birkaç kayıp fonksiyonunu içermektedir: (i) gerçekçiliği sağlamak için rakip kayıplar; (ii) yoğunluk doğruluğunu korumak için piksel bazında yeniden yapılandırma kaybı (L1 kaybı); (iii) derin özellik temsilleri kullanılarak yapısal tutarlılığı korumak için algısal kaybı; ve (iv) ardışık kareler arasında akıcı geçişler sağlamak ve titreme artefaktlarını önlemek için zaman tutarlılığı kaybı.

Özellik çıkarımı için yüksek kaliteli girdi sağlamak amacıyla, ameliyat sırasında mikroskopik videolar başlangıçta cGAN kullanılarak geliştirilir. Her ham çerçeve, temiz bir çerçevenin bozulmuş bir gözlemi olarak kabul edilir. Bir üreteç G, geliştirilmiş çerçeveleri geri yüklemek için G(It) = It eşleme yaparken, ayrımcı D gerçek ve üretilmiş örnekleri ayırt eder. Bir eğitim amacı, düşmanca kayıp Ladv, , algısal kayıp L perc piksel tabanlı yeniden yapılandırma kaybıL1 ve zamansal tutarlılık Ltemp.. Bu model, bulanıklık, speküler artefaktları ve gürültüyü bastırırken, zamansal ve yapısal tutarlılığı korurken, sonraki analiz için stabil, artefaktsız video dizileri sağlar. GAN'ın formülasyonu, Ek Dosya 1'in [1-6] Denklemlerinde ifade edilmiştir.

Kontur Adaptif Segmentasyon (CAS) kullanılarak segmentasyon

Bu yöntemde, segmentasyon kontur-adaptif segmentasyon modeli kullanılarak gerçekleştirilir. Bu, etkilenen vitrektomi görüntülerini mikroskopik görüntülerde segmente ayırmak için ön önsüretler tanımlar; böylece enerji fonksiyonu azalır; bu, Ek dosya 1'deki [7-12] denklemlerinde gösterildiği gibi. Düşük enerji değeri, risk altındaki bölgelerin kesin temsillerini ve yerel değerlendirmelerini sağlar. Bu da etkilenen bölgelerin kesin segmentasyonuna olanak tanır ve bu da sonraki bölümde özelliklerin çıkarılmasını kolaylaştırır.

Dinamik uzaylı-zamansal GCN(dGCN) kullanılarak Özellik Çıkarımı

Ön işleme aşaması tamamlandıktan sonra, bir sonraki adım ayırt edici uzaylı-zaman özelliklerini çıkarmaktır. Bu nedenle, yapılandırılmış bağımlılıkları yakalamada etkili olduğu için Grafik Konvolüsyon Ağı (GCN) kullanılır. Benimsenen model, aşırı uyumu azaltan ve gradyan yok olma sorununu normalizasyon mekanizmasıyla ele alan doğrusal olmayan aktivasyonlara sahip üst üste yığılmış GCN katmanlarından oluşur. GCN formülasyonu, grafik konvolüsyonlarının birinci dereceden spektral yaklaşımına dayanır ve bu da onu büyük ölçekli yarı denetimli öğrenme görevleri için uygun kılar. Ayrıca, doğrusal temsil optimizasyonu basitleştirerek etkili parametre öğrenimini sağlar. Basitleştirilmiş GCN'nin işletilmesi Ek Dosya 1'in [13–15] Denklemlerinde ifade edilir. Uygulandığında, GCN operasyon içi video verilerinden daha yüksek seviyeli yapısal temsilleri verimli bir şekilde çıkarır. Sonuç olarak, yalnızca en ilgili veya uygun özellikler, sonraki bölümde açıklanan optimizasyon destekli bir seçim mekanizması üzerinden korunur.

Uyarlanabilir Ayçiçeği tabanlı özellik optimizasyonu (ASFO) kullanarak özellik optimizasyonu

Adaptif Ayçiçeği Optimizasyon Algoritması (ASFO), Klasik Ayçiçeği Optimizasyon Yaklaşımı'nın (SFOA) geliştirilmiş bir versiyonudur. Önerilen modelde, bu biyolojik olarak yönlendirilen süreç, yüksek boyutlu bir veri setinde iyileştirme ve özellik seçimini ele almak için matematiksel olarak modellenmiştir. Özellikle, bu yaklaşım yakınsama hızını artırmak, çözüm çeşitliliğini korumak ve erken yakınsamayı azaltmak için keşif ve sömürü dengelemek için tasarlanmıştır. ASFO'nun matematiksel formülasyonu, Ek Dosya 1'in [16–21] Denklemlerinde belirtilmiştir. Bu şema, çözümler optimale yaklaştığında yakınsamayı hızlandırır. Detaylı algoritma Ek Dosya 1'de sunulmaktadır. Önerilen boru hattında, transformatör tabanlı füzyondan sonra özellik vektörünü iyileştirmek için ASFO kullanılır. Seçilen özellikler doku tabanlı, renk ve yoğunluk, morfolojik ve yapısal, hareket ve zamansal, yüksek boyutlu ve dikkat ağırlıklı bölge tanımlayıcılarıdır. Amaç, özellik-alaka kaybı fonksiyonunu en aza indirmek, böylece tekrarı azaltarak sınıflandırma doğruluğunu artıran özellikleri seçip ağırlıklandırmaktır.

Uzaylı-zaman dikkat havuzlu transformator tabanlı sınıflandırma başlığı

Cerrahi video dizileri boyunca zamansal bağımlılıkları yakalamak için transformator tabanlı bir model kullanılır. Model, son risk tahmini için çok başlı öz-dikkat, konumsal kodlama ve tamamen bağlı katmanlarla yapılandırılmıştır. Hiperparametre optimizasyonu ASFO kullanılarak gerçekleştirilir. Entegre boru hattı, ön işleme, özellik çıkarma, optimizasyon ve transformatör tabanlı sınıflandırmayı birleştirerek doğru cerrahi risk tahminini mümkün kılar.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Sonuçlar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Önerilen modelin etkinliğini değerlendirmek için, gerçek dünya vitrektomi veri setleri kullanılarak kapsamlı deneyler yapıldı. Performans, ön işleme, özellik çıkarma etkinliği ve tahmin doğruluğu açısından değerlendirildi.

Performans analizi ve karşılaştırmalı tahmin

Önerilen metodoloji, doğruluk, hassasiyet, hatırlama, F1-puanı, mIoU, piksel doğruluğu (PA), sınıf başına doğruluk (PAC), hassasiyet, özgüllük, ROC ve ...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Tartışma

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

CaDIS ve SICS-105 veri setleri üzerinde yapılan deneysel değerlendirme, önerilen modelin geleneksel yaklaşımlara göre dayanıklılığını ve üstünlüğünü doğrulamaktadır. ResNet-50, LSTM-CNN gibi temel modeller ve segmentasyon odaklı ağlar (UNet, DeepLabV3+, UPerNet, HRNetV2) makul derecede iyi performans gösterir, ancak aydınlatma, tıkanmalar, hareket bulanıklığı ve alet-doku etkileşimlerindeki değişiklikler gibi doğal intraoperatif video değişkenliğinedeniyle engellenir 22...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Açıklamalar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarların açıklamak zorunda kalacak bir çıkar çatışması yoktur.

Teşekkürler

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarlar, gerekli kurumsal destek ve kaynakları sağladığı için Kuzey Sichuan Tıp Fakültesi'ne teşekkür etmek isterler. Ameliyat dışı mikroskopi videolarının toplanmasında yardımcı olan Guangyuan Merkez Hastanesi klinik personeline özel teşekkürler.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
Yüksek Performanslı İş İstasyonuNVIDIA Corporation, ABDRTX-A6000Model eğitimi için kullanılıyor; Intel Core i9 CPU ve 128 GB RAM ile 48 GB VRAM GPU
Python (v3.10)Python Yazılım VakfıAçık KaynakModel geliştirme ve deney için temel programlama dili
TensorFlow (v2.15)Google AraştırmasıAçık KaynakcGAN ön işleme ve Transformer sınıflandırıcısının uygulanması için kullanılan çerçeve
PyTorch (v2.2.0)Meta AIAçık KaynakGCN ve Adaptif Sunflower Optimizasyon modüllerinin uygulanmasında kullanılır
CUDA Araç Seti (v12.1)NVIDIA CorporationCUDA-12.1Tüm derin öğrenme hesaplamaları için GPU hızlandırma sağlar
Koşullu Üretken Karşı Düşman Ağı (cGAN)Pix2Pix Framework'ten uyarlanmıştırYokVideo geliştirme ve ön işleme sırasında artefakt kaldırma için kullanılır
Optik Akış Tahmincisi (RAFT)Teed & Deng (ECCV 2020)YokÖn işlem sırasında çerçeveler arasında zamansal tutarlılığı sağlar
Kontur Adaptif Segmentasyon (CAS) ModeliÖzel UygulamaYokVitrektomi videolarında doğru sınır segmentasyonu için değiştirilmiş aktif kontur modeli
Dinamik Grafik Konvolüsyon Ağ (GCN)Özel Uygulama (Kipf & Welling, 2017)YokVideo özellik düğümleri arasındaki uzaylı-zamansal ilişkileri çıkarır
Uyarlanabilir Ayçiçeği Optimizasyon Algoritması (ASFO)Özel UygulamaYokOptimize edilmiş özellik seçimi ve boyut küçültmesi için kullanılır
Transformatör Kodlayıcı ModeliÖzel Uygulama (Vaswani ve ark., 2017 temelinde)YokUzaylı-zamansal dikkat havuzu ile nihai ameliyat sonrası komplikasyon sınıflandırması için kullanılır
Matplotlib (v3.8)Python Yazılım VakfıAçık KaynakPerformans metrikleri ve grafiklerin görselleştirilmesi için kullanılır
Seaborn (v0.13)Python Yazılım VakfıAçık Kaynakİleri görselleştirme ve istatistiksel grafikler için kullanılır
Adam OptimizerTensorFlow DahiliYokModel eğitimi için kullanılıyor; öğrenme hızı = 1e-4, β 1=0.9, β 2=0.999
Kayıp Fonksiyon Paketi (L_adv, L_l1, L_perc, L_temp, L_G)Özel UygulamaYokGAN eğitimi için düşman, algısal, piksel ve zaman kayıplarını tanımlar
İşletim SistemiUbuntu Linux 22.04 LTSYokDerin öğrenme deneyleri için temel ortam
Değerlendirme Metrikleri Paketiscikit-learn (v1.5.0)Açık KaynakDoğruluk, hassasiyet, hatırlama, F1 puanı, AUC ve mIoU hesaplamalarında kullanılır

Kaynaklar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhang, Z. R., Li, J. J., Li, K. R. Artificial intelligence in individualized retinal disease management. Int. J. Ophthalmol. 17, 1519(2024).
  2. Liu, Y., et al. Automated detection of nine infantile fundus diseases and conditions in retinal images using a deep learning system. EPMA J. 15, 39-51 (2024).
  3. Wang, X. N., et al. A deep learning system for detection of optic disc neovascularization in diabetic retinopathy. Vis. Comput. 41, 1293-1302 (2025).
  4. Ni, L., et al. Prediction of postoperative macular hole status by automated preoperative retinal OCT analysis. Ophthalmic Surg. Lasers Imaging Retina. 56, 355-360 (2025).
  5. Mathews, M. R., Anzar, S. M. Advancing computer-assisted diabetic retinopathy grading. Int. J. Imaging Syst. Technol. 35, e70152(2025).
  6. Wu, X. Y., et al. Bibliometric analysis of global myopia research. Int. J. Ophthalmol. 17, 940(2024).
  7. Rahat, S. R. U. I., et al. Advancing diabetic retinopathy detection with AI and deep learning. Br. J. Nurs. Stud. 5, 1-13 (2025).
  8. Rezaei, A., et al. Automated multimodal severity assessment of diabetic retinopathy. SSRN. , (2024).
  9. Suzue, M., et al. Predicting visual outcomes after vitrectomy. Graefes Arch. Clin. Exp. Ophthalmol. 263, 2505-2513 (2025).
  10. Sabeena, A. S., Jeyakumar, M. K. Ensemble deep learning for diabetic retinopathy classification. Biomater. Devices. , (2025).
  11. Gencer, K., et al. GAN-based approach for diabetic retinopathy detection. Photodiagn. Photodyn. Ther. 53, 104552(2025).
  12. Huang, Z., et al. Risk prediction model for neovascular glaucoma. Front. Cell Dev. Biol. 13, 1604832(2025).
  13. Wang, Y., Liu, L., Wang, C. Trends in deep learning for biomedical prediction. Front. Neurosci. 17, 1256351(2023).
  14. Tang, J., et al. Ectopic inner foveal layer as prognostic predictor. Sci. Rep. 15, 25066(2025).
  15. Shamsan, A., et al. Predicting diabetic retinopathy stages using deep learning. PLoS One. 18, e0289555(2023).
  16. Baldi, P. F., et al. Vitreoretinal surgical instrument tracking. Transl. Vis. Sci. Technol. 12, 20(2023).
  17. Yuan, S., et al. Risk factors after vitrectomy with silicone oil. Sci. Rep. 13, 10423(2023).
  18. Wei, Y., et al. DRDB platform for diabetic retinopathy. Oxid. Med. Cell Longev. 2022, 1718353(2022).
  19. Yagin, F. H., et al. Explainable AI for metabolomics analysis. Diagnostics. 14, 1364(2024).
  20. Nespolo, R. G. Intraoperative artificial intelligence in ophthalmology. , University of Illinois Chicago. Doctoral dissertation (2024).
  21. Nespolo, R. G., et al. Real-time segmentation in vitreoretinal surgery. Ophthalmol. Retina. 7, 236-242 (2023).
  22. Mishra, K., Leng, T. Artificial intelligence and ophthalmic surgery. Curr. Opin. Ophthalmol. 32, 425-430 (2021).
  23. Mueller, S., et al. AI in cataract surgery: systematic review. Transl. Vis. Sci. Technol. 13, 20(2024).
  24. Wen, D., et al. Postoperative visual acuity prediction. BMC Ophthalmol. 23, 361(2023).
  25. Hu, Y., et al. Prediction of macular hole status. Ann. Transl. Med. 9, 51(2021).
  26. Catania, F., et al. Deep learning for retinal detachment recurrence. Acta Ophthalmol. 102, e984-e993 (2024).
  27. Gan, F., et al. AI-PVR Insight system. Quant. Imaging Med. Surg. 15, 2774(2025).
  28. Lee, S. S., et al. Prediction after diabetic vitrectomy. Transl. Vis. Sci. Technol. 11, 25(2022).
  29. Kamnig, R., et al. Neural network for visual acuity prediction. Ophthalmol. Sci. 5, 100762(2025).
  30. Kim, J., et al. Prediction of vitreous hemorrhage causes. Diagnostics. 15, 371(2025).
  31. Flouty, E., et al. CaDIS dataset. CoRR. abs/1905.08993, (2019).
  32. Mueller, S., et al. Phase recognition in cataract surgery. Sci. Rep. 15, 16886(2025).
  33. Aravinda, C. V., et al. Hybrid architecture for video frame prediction. J. Real-Time Image Process. 22, 50(2025).

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Yeniden basım ve izinler

Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste

İzin iste

Etiketler

Deep Learning FrameworkIntraoperative Video AnalysisVideo EnhancementContour Adaptive SegmentationGraph Convolutional NetworksTransformer ModelClinical Decision Support

İlgili makaleler