تقدم هذه الدراسة متغيرا خفيف الوزن U-Net مع دقة تجزئة محسنة باستخدام الالتفاف الهجين وانتباه القناة ، مما يحقق أحدث النتائج على MoNuseg و GlaS مع معلمات أقل.
مقالة منهجية
تقدم هذه الدراسة متغيرا خفيف الوزن U-Net مع دقة تجزئة محسنة باستخدام الالتفاف الهجين وانتباه القناة ، مما يحقق أحدث النتائج على MoNuseg و GlaS مع معلمات أقل.
تطورت تقنية معالجة الصور الحاسوبية القائمة على الشبكة العصبية الاصطناعية بسرعة في السنوات الأخيرة ووجدت تطبيقات واسعة النطاق في مجالات متعددة. في معالجة الصور الطبية ، أظهرت UNet ومتغيراتها نجاحا كبيرا في اكتشاف الآفات وتجزئة الخلايا ومهام تجزئة الأورام الحميدة. يقدم هذا البحث شبكة معدلة على شكل حرف U مع معلمات شبكة مخفضة يتم تحقيقها عن طريق تقليل عمق الشبكة وزيادة قنوات الشبكة لتعزيز قدرة النموذج على التعلم. لمواجهة الانخفاض في قدرة التعلم الناجم عن ضغط العمق ، يتم إدخال وحدة تلافيفية للقناة الهجينة لتحل محل الوحدة التلافيفية للشبكة الأصلية. يقدم النموذج آلية انتباه القناة بين الطبقة وطبقة الالتفاف النقطي لتحسين قدرة استخراج ميزة القناة العملية. وخلصت المقالة أيضا إلى أن استخدام الالتفاف مختلط العمق يمكن أن يحل بشكل فعال مدى حجم هدف التجزئة ، مما يجعل من الصعب على نموذج واحد أن يكون مناسبا لمجموعات بيانات متعددة. يحقق النموذج المقترح أحدث النتائج على مجموعتي بيانات عامتين شائعتين ، MoNuseg و GlaS ، بمتوسط زيادة في النرد بنسبة 1.0٪ و 1.37٪ على التوالي. تم تقليل المعلمات الإجمالية للنموذج المعدل إلى 1.71 مليون ، وهو ما يمثل انخفاضا بمقدار 38.6 ضعفا مقارنة ب UCtransNet ، مع 65.6 مليون معلمة.
يعد تجزئة الصور الطبية أمرا بالغ الأهمية في مختلف التطبيقات السريرية ، بما في ذلك التشخيص وتخطيط العلاج ومراقبة المرض. لم تعد طرق معالجة الصور التقليدية القائمة على خوارزميات هندسة الميزات مناسبة للتعامل مع الكميات الكبيرة من البيانات التي تم إنشاؤها في بيئات الرعاية الصحية الحديثة. لحسن الحظ ، فإن تقدم تكنولوجيا الشبكة العصبية الاصطناعية والتحسينات في قدرات أجهزة الكمبيوتر جعل من الممكن تدريب ونشر نماذج الشبكات العصبية واسعة النطاق. نتيجة لذلك ، يتم تطوير خوارزميات معالجة رؤية الكمبيوتر القائمة على نماذج التعلم الآلي وتطبيقها باستمرار في مختلف المجالات.
وهيكل النموذج الأكثر تمثيلا في التجزئة الدلالية للصور الطبية هو UNet1 مع بنية فك التشفير. يستخدم النموذج أولا برنامج تشفير متعدد المستويات لاستخراج ميزات بمقاييس مختلفة من صورة الإدخال. بعد ذلك ، يقوم وحدة فك التشفير بأخذ عينات خطوة بخطوة مع دمج إخراج الميزات الدلالية بواسطة برنامج التشفير للمستوى المقابل كاتصال تخطي. ومع ذلك، يمكن زيادة تحسين أداء هيكل UNet بتطبيق عدة أساليب. على سبيل المثال ، ثبت أن آليات الانتباه فعالة في تحسين أداء الشبكات العصبية التلافيفية. يمكن لهذه الآليات أن تؤكد بشكل انتقائي على الميزات الأساسية في بيانات الإدخال ، مما يؤدي إلى تحسين تعلم التمثيل ودقة التجزئة.
في الوقت الحاضر ، يركز العديد من الباحثين على دمج الميزات المستخرجة بواسطة المشفر بشكل فعال في مرحلة فك التشفير. وتشمل بعض المتغيرات الأكثر شيوعا في UNet الانتباهUNet 2 و Recurrent UNet3 و V-Net4. تستخدم هذه الأساليب آليات الانتباه5 ، مثل الانتباه المكاني ، لتسليط الضوء على المناطق الإعلامية في خرائط الميزات وقمع المناطق غير الإعلامية. بالإضافة إلى ذلك ، تتضمن بعض المتغيرات شبكات عصبية متكررة لنمذجة الطبيعة المتسلسلة للصور الطبية وتحسين تمثيلات الميزات. تم استخدام نماذج ما قبل التدريب ، مثل VGG6 و ResNet7 و DenseNet8 ، على نطاق واسع لتحسين أداء الشبكات على شكل حرف U من خلال الاستفادة من معرفتها الغنية المستفادة من مجموعات البيانات واسعة النطاق. بالإضافة إلى ذلك ، تم إدخال آليات المحولات ، مثل الانتباه الذاتي والانتباه متعدد الرؤوس ، إلى تبعيات النماذج طويلة المدى والتقاط المعلومات السياقية العالمية ، مما يؤدي إلى أداء أفضل للتجزئة.
ومع ذلك ، في حين أن هذه المتغيرات قد تحسنت مقارنة ب UNet1 الأصلي ، إلا أنها لا تزال تواجه قيودا معينة في التعامل مع الصور الطبية المعقدة بمقاييس وأشكال مختلفة. علاوة على ذلك ، غالبا ما يؤدي التعقيد المتزايد لهذه المتغيرات إلى ارتفاع التكاليف الحسابية وأوقات التدريب الأطول ، مما يحد من قابليتها للتطبيق في السياقات العملية.
ولتعزيز بنية UNet1 ، يقترح نموذج معدل يسمى MixKNet (شبكة Mix Kernel Size U-shaped Net)، مما يقلل من عمق الشبكة مع زيادة عدد القنوات لتحسين القدرة على التعلم. ومع ذلك ، يمكن أن يؤدي انخفاض العمق إلى انخفاض الأداء العام. للتخفيف من هذه المشكلة ، يتم تقديم وحدة تلافيفية ذات قناة هجينة ، لتحل محل الوحدة العصبية التلافيفية الأصلية. تتضمن هذه الوحدة آلية انتباه القناة بين طبقات الالتواء العميقة والنقطية ، بهدف تعزيز قدرة النموذج على استخراج ميزات القناة الفعالة.
لتوجيه قابلية التطبيق العملي ، من المهم ملاحظة أن الطريقة المقترحة تم تقييمها على مجموعات بيانات الصور الطبية صغيرة نسبيا ، مع دقة صور فردية تتراوح من 500 × 500 إلى 1000 × 1000 بكسل. للتدريب على النموذج ، تم تغيير حجم جميع الصور إلى 224 × 224 بكسل. تم تنفيذ التنفيذ باستخدام PyTorch على وحدة معالجة رسومات NVIDIA RTX 3090 واحدة. تشير هذه المعلمات التشغيلية إلى أن الطريقة مجدية حسابيا للإعدادات التجريبية المعتدلة وقابلة للتكيف مع أحجام مجموعات البيانات المحدودة.
في الختام ، تقدم هذه المقالة تعديلا جديدا على هيكل الشبكة على شكل حرف U وتقدم وحدة الالتفاف الهجينة للقناة جنبا إلى جنب مع آلية انتباه القناة ، وكلاهما يحسن أداء التجزئة على مجموعات بيانات الصور الطبية. المساهمات الرئيسية لهذا العمل هي كما يلي: (1) اقتراح هيكل شبكة معدل على شكل حرف U مع وحدة الالتفاف الهجينة ذات النسيج العميق التي تحل محل الوحدة العصبية التلافيفية الأصلية. (2) إدخال آلية انتباه القناة بين طبقة الالتفاف ذات النسيج العميق والطبقة النقطية لتحسين قدرة النموذج على استخراج ميزة القناة الفعالة. (3) تحقيق أحدث النتائج في وقت واحد على مجموعتي بيانات عامتين شائعتين في مجموعة بيانات التجزئة النووية MoNuseg9 مع معلمات نموذج أقل بكثير (مقارنة ب UCtransNet10 مع معلمات 64M) وتحسين الأداء على مجموعة بيانات تجزئة الغدة GlaS11 .
يتم تنظيم بقية هذه المقالة على النحو التالي. تقدم الخطوة 2 استعراضا شاملا للدراسات السابقة حول UNet1 وأشكاله في تجزئة الصور الطبية. يتم فحص مواطن القوة والقيود في النهج القائمة، إلى جانب العمل ذي الصلة بآليات الانتباه، والشبكات التلافيفية المختلطة العمقة، وتطبيقاتها في نماذج التجزئة. تفصل الخطوة 3 معمارية نموذج MixKNet المقترح ، بما في ذلك التعديلات على هيكل UNet ، ودمج آلية انتباه القناة ، واستخدام الالتفاف المختلط العمق. تبلغ الخطوة 4 عن نتائج التجارب المكثفة ، مصحوبة بمناقشة ودراسة استئصال لتقييم مساهمات كل مكون. أخيرا ، تختتم الخطوة 5 الورقة البحثية وتحدد الاتجاهات المحتملة للبحث المستقبلي.
يبدأ هذا القسم باستعراض الدراسات السابقة حول UNet ومتغيرات Ut في تجزئة الصور الطبية ، مع تحديد نقاط القوة والقيود في الأساليب الحالية. بالإضافة إلى ذلك ، تمت مناقشة البحوث ذات الصلة حول آليات الانتباه وتطبيقاتها في نماذج التجزئة. كما يتم فحص التطورات الأخيرة التي تنطوي على تقنيات الالتفاف العميق لتعزيز أداء التجزئة. يتم تقديم تحليل مقارن ل MixKNet (c) المقترحة والنماذج الأخرى في الشكل 1 ، حيث تشير الخطوط المتقطعة إلى اتصالات التخطي.
UNet وأشكاله المختلفة
تم اقتراح بنية UNet لأول مرة بواسطة Ronneberger et al. في عام 20151 ومنذ ذلك الحين تم استخدامها على نطاق واسع في تجزئة الصور الطبية. يتكون النموذج من مسار تشفير ومسار فك تشفير. يستخرج برنامج التشفير ميزات عالية المستوى من صورة الإدخال بينما يقوم وحدة فك التشفير بأخذ عينات من الميزات وجمعها لإنشاء خريطة تجزئة. ومنذ ذلك الحين، أدخلت تعديلات مختلفة على بنية UNet لتحسين أدائها في تجزئة الصور الطبية. أحد التعديلات الأكثر شيوعا هو إدخال اتصالات التخطي ، والتي ثبت أنها تعمل على تحسين دقة التجزئة. اقترح Zhou et al.12 متغير UNet يستخدم وصلات تخطي كثيفة ، مما يسمح للنموذج بالحفاظ على المعلومات المكانية بشكل أفضل.
ومن التعديلات الشائعة الأخرى على بنية UNet إضافة آليات الاهتمام. يمكن أن تساعد هذه الآليات النموذج في التأكيد بشكل انتقائي على أهم الميزات ، مما يؤدي إلى تحسين تعلم التمثيل ودقة التجزئة. وتشمل بعض الأمثلة على المتغيرات ذات آليات الانتباه الانتباهUNet 2 و ResUNet مع بوابات الانتباه13 و Dense-UNet مع بوابات الانتباه14. بالإضافة إلى التعديلات المذكورة أعلاه ، تم اقتراح العديد من المتغيرات الأخرى لبنية UNet لتجزئة الصور الطبية. UCTransNet10 هو نوع مختلف من بنية U-Net التي تتضمن اتصالات تخطي ووحدة محول. تتم إعادة التفكير في اتصالات التخطي في UCTransNet10 من منظور القناة ، مما يسمح بإعادة استخدام الميزات بشكل أفضل ويقلل من عدد المعلمات. تمت إضافة وحدة المحولات لالتقاط التبعيات بعيدة المدى وتحسين جودة الترجمة. لقد ثبت أن UCTransNet10 يحقق أحدث النتائج في العديد من معايير الترجمة الآلية. اقترح Zihan et al. نموذج التعلم العميق المسمى LViT15 ، والذي قاموا بتطبيقه على مهام تحليل الصور الطبية. لتوسيع الإصدار شبه الخاضع للإشراف من LViT15 والتعويض عن نقص الجودة في بيانات الصورة ، اقترحوا آلية تكرار التسمية الزائفة الأسية (EPI). بالإضافة إلى ذلك ، للحفاظ على الميزات المحلية للصور ، اقترحوا وحدة الانتباه على مستوى البكسل (PLAM) ، والتي تركز بشكل انتقائي على ميزات الصورة المهمة.
آلية الانتباه
تمت دراسة آليات الانتباه على نطاق واسع في التعلم الآلي ، لا سيما في معالجة اللغة الطبيعية ورؤية الكمبيوتر. في السنوات الأخيرة ، تم تطبيق آليات الانتباه أيضا على مهام تحليل الصور الطبية ، بما في ذلك تجزئة الصور. قدم Bahdanau et al.16 آلية انتباه في الترجمة الآلية العصبية لتحسين جودة الترجمة. تسمح الآلية للنموذج بالتركيز بشكل انتقائي على الأجزاء ذات الصلة من تسلسل الإدخال ، مما يحسن جودة الترجمة. منذ ذلك الحين ، تم اقتراح آليات اهتمام مختلفة لمهام تحليل الصور. أحد الأنواع الشائعة لآلية الانتباه هو آلية الانتباه المكاني ، والتي تتضمن تطبيق وزن على كل بكسل في خريطة المعالم بناء على أهميتها. على سبيل المثال ، اقترح Guo et al.17 آلية انتباه مكاني لمهمة تجزئة الأوعية الشبكية. تستخدم الآلية آلية بوابات لضبط وزن الميزات المكانية ، مما يحسن قدرة النموذج على التمييز بين وحدات البكسل في السفينة وغير السفينة. نوع آخر من آلية الانتباه هو انتباه القناة ، والذي يركز على ضبط أوزان خرائط الميزات عبر القنوات. اقترح Hu et al.18 شبكة الضغط والإثارة (SENet) التي تطبق اهتماما بالقناة على خرائط الميزات ، مما يحسن أداء مهمة تصنيف الصور. في الآونة الأخيرة ، تم دمج آليات الانتباه مع الشبكات العصبية التلافيفية (CNNs) لمهام تجزئة الصور. على سبيل المثال ، اقترح Chen et al.19 شبكة موجهة نحو الانتباه لتجزئة أورام الدماغ تجمع بين آليات الانتباه المكانية والقناة.
أظهرت التطورات الحديثة في التعلم شبه الخاضع للإشراف والمتعدد الوسائط لتحليل الصور الطبية والاستشعار عن بعد تحسينات واعدة في الأداء. اقترح يانغ وآخرون 20 UMSCS ، وهو إطار جديد للتجزئة متعددة الوسائط غير متزاوجة يستفيد من التعلم التوليدي متعدد الوسائط والاستراتيجيات شبه الخاضعة للإشراف. قدم Zhang et al. العديد من التقنيات المتطورة: نموذج تناسق ثلاثي الفروع محسن بالأدلة للتجزئة شبه الخاضعة للإشراف21 ، وإطار التعلم النموذجي الواعي الذاتي وعبر العينة لتجزئة الصور الطبية22 ، ونهج تحسين الميزة الهرمية المدركة للتردد الزمني للتعرف على تشويش رادار الفتحة الاصطناعية (SAR) في مجال الفضاء23. تسلط هذه الأعمال الضوء بشكل جماعي على أهمية الإشراف الهجين ونمذجة الميزات المدركة للمجال في كل من مهام التصوير الطبي والهندسي.
الالتفاف العميق
تم تصميم الالتواء العميق لالتقاط الارتباطات على مستوى القناة في خرائط ميزات الإدخال وقد ثبت أنه يحسن كفاءة ودقة الشبكات العصبية التلافيفية.
يعد MobileNet24 أحد أقدم نماذج الالتواء وأكثرها تأثيرا في العمق ، الذي اقترحه Howard et al. في عام 2017. تستخدم MobileNet الالتفاف القابل للفصل من حيث العمق ، والذي يطبق التواء عميقا متبوعا بالتفاف نقطي ، لتقليل عدد المعلمات والحساب المطلوب للطبقات التلافيفية. يسمح ذلك ل MobileNet بتحقيق دقة حديثة في مهام تصنيف الصور مع استخدام معلمات أقل بكثير من الشبكات العصبية التلافيفية التقليدية. منذ إدخال MobileNet ، تم اقتراح عدد من بنى الالتواء الأخرى من حيث العمق ، بما في ذلك ShuffleNet25 و Xception26 و ResNeXt27. تختلف هذه النماذج في تنفيذها المحدد للالتفاف العميق ، ولكن جميعها تشترك في هدف تقليل التعقيد الحسابي للطبقات التلافيفية مع الحفاظ على الدقة أو تحسينها. كما تم تطبيق الالتفاف العميق على مهمة التجزئة الدلالية ، مع نماذج مثل PSPNet28 تستخدم الالتواء القابل للفصل بالعمق لتقليل متطلبات الحساب والذاكرة للطبقات التلافيفية واسعة النطاق. يوسع MixNet29 فكرة الالتفاف العميق من خلال تقديم الالتفاف المختلط من حيث العمق ، والذي يستخدم أحجام نواة متعددة لالتقاط الميزات بمقاييس مختلفة. لقد ثبت أنه يتفوق على النماذج الحديثة الأخرى مع الحفاظ على المعلمات و FLOPs القابلة للمقارنة. أظهرت هذه النماذج تحسينات كبيرة في الدقة والكفاءة مقارنة بالشبكات العصبية التلافيفية التقليدية في مهام التجزئة الدلالية المختلفة.
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
يصف هذا القسم بنية MixKNet المقترحة لتجزئة الصور الطبية. يوسع نموذج MixKNet بنية UNet ، حيث يتضمن آليات الانتباه وطبقات الالتفاف المختلطة العمقية. البرنامج المستخدم في هذه الدراسة مدرج في جدول المواد.
1. الهندسة المعمارية الشاملة
2. على شكل حرف U بالارض
ملاحظة: تقليل عمق بنية الشبكة العصبية لتقليل التعقيد الحسابي وحجم النموذج، مع إدراك أن هذا قد يقلل من القدرة على تعلم تمثيلات البيانات المعقدة.
3. امزج حجم النواة لجهاز التشفير
4. قناة الانتباه
5. مجموعات البيانات
ملاحظة: يتم استخدام مجموعتين من مجموعات بيانات الصور الطبية المتاحة للجمهور ، كما هو موضح في الجدول 1 والجدول 2 ، في هذه الدراسة: GlaS (Sirinukunwattana et al.11) و MoNuSeg (Kumar et al.9).
6. تفاصيل التنفيذ
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
مقارنة مع أحدث الأساليب
تم تقييم بنية MixKNet على مجموعتي بيانات تجزئة الصور الطبية ، GlaS و MoNuSeg ، ومقارنتها بأحدث الأساليب في هذا المجال. تم إجراء التقييم من خلال الإبلاغ عن درجات النرد وإنترنت الأشياء للطريقة المقترحة والعديد من النماذج المماثلة ، كما هو موضح في الجدول 3. تشير النتائج إلى أن بنية MixKNet تتفوق على النماذج الأخرى ، حيث تحقق أعلى درجات متوسط النرد وإنترنت الأشياء في كلتا مجموعتي البيانات. في مجموعة بيانات GlaS11 ، حققت MixKNet المق...
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
تقدم هذه الدراسة MixKNet ، وهو تعديل جديد لبنية UNet1 لتجزئة الصور الطبية ، يدمج الالتواء المختلط العمق وآلية انتباه القناة لتعزيز أداء التجزئة مع تقليل التعقيد الحسابي بشكل كبير. يجمع الالتفاف القناة الهجينة بين نواة تلافيفية متعددة تعمل على مجموعات قنوات منفصلة. يسمح هذا التصميم للشبكة بالتقاط ميزات مكانية وسياقية متنوعة بمقاييس مجال استقبالية مختلفة داخل نفس الطبقة ، مما يحسن قدرة النموذج على تمثيل كل من الهياكل المحلية والعالمية. على عكس الالتواءات القياسية ، ...
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
ويعلن أصحاب البلاغ عدم وجود مصالح مالية متنافسة أو أي تضارب في المصالح.
الدفعة الثانية من مشاريع أبحاث الرعاية الاجتماعية لعام 2023 في مدينة نينغبو: البحث وتطبيق التقنيات الرئيسية لتحديد الاحتيال في شبكات الاتصالات بناء على الأنطولوجيا والبرمجة اللغوية العصبية (2023S169).
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
| الاسم | الشركة | رقم فهرسي | التعليقات |
|---|---|---|---|
| نظام التشغيل Linux (Ubuntu 22.04) | مختلف (مجتمع مفتوح المصدر) | N / A (الإصدار 22.04 LTS) نظام | تشغيل مفتوح المصدر للتطوير https://releases.ubuntu.com/22.04/ |
| NVIDIA RTX 3090 GPU | NVIDIA | 3090 | وحدة معالجة الرسومات عالية الأداء للتعلم العميق https://www.nvidia.com/en-us/geforce/graphics-cards/30-series/rtx-3090/ |
| Python | Python Software Foundation | N / A (الإصدار > 3.8) | لغة برمجة لتطوير الذكاء الاصطناعي / ML https://www.python.org/ |
| PyTorch | Meta الذكاء الاصطناعي | N / A (الإصدار 1.13) إطار | عمل التعلم الآلي مفتوح المصدر https://pytorch.org/ |
| Visual Studio Code (VS Code) Microsoft | N / A | محرر كود خفيف الوزن وقوي https://code.visualstudio.com/ |
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه
طلب إذن