مقالة بحثية

نهج جديد باستخدام محول الرؤية الذكاء الاصطناعي لتحليل الأشعة المقطعية للكشف عن سرطان الرئة

DOI:

10.3791/69302

نوفمبر 28, 2025

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يسمح استخدام محولات الرؤية في هذه الدراسة بتصنيف سرطان الرئة من خلال صور الأشعة المقطعية، محققا دقة تبلغ 98.18٪، عند 1,190 فحصا. حافظ النموذج على مستوى مرض من المتانة، مع مستويات دقة تتراوح بين (80-88٪) مع الصور الضوضاء والمشوشة، مقارنة بنماذج الشبكة العصبية الالفافية القياسية (CNN) في تطبيقات التشخيص الصحي الاستهلاكي.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

لا يزال تشخيص سرطان الرئة تحديا بسبب الفروق الدقيقة بين الأمراض الحميدة والخبيثة في الدراسات التصويرية. بينما كانت الشبكات العصبية الالفافية التقليدية (CNNs) الركيزة الأساسية لتحليل التصوير الطبي، إلا أنها لا تزال ذات قابلية تطبيق ومتانة محدودة مع تنوع طرق التصوير. تقدم التعلم الآلي يغير طرق التشخيص التقليدية في تقنيات الرعاية الصحية الموجهة للمستهلك، ويغير عمليات الوصول والرعاية الشخصية للمرضى. تصف هذه الورقة استخدام محولات الرؤية (ViTs) لمهمة تصنيف سرطان الرئة باستخدام الأشعة المقطعية، المرتبطة بتطبيقات صحة المستهلك. تم تدريب نموذج محول الرؤية على مجموعة بيانات كاملة من 1,190 صورة CT، وحقق معدل تصنيف 98.18٪ مع معامل ارتباط ماثيوز 0.9676. بالإضافة إلى ذلك، تم التحقق من صحة أداء النموذج في سيناريوهات محاكاة في الوقت الحقيقي باستخدام ضوضاء في الوقت الحقيقي ومجموعات بيانات مشوشة. على الرغم من الحفاظ على طرق التحقق بدقة تشخيصية قوية، إلا أن نموذج ViT تفوق على الطريقة التقليدية المعتمدة عبر مجموعة البيانات بأكملها من خلال إظهار دقة تتراوح بين 80-88٪ للتمييز بين الصور الصاخبة والصور الضبابية، حتى في هذه الظروف. بينما توفر النتائج الأولية معلومات واعدة حول متانة ViTs عند التعامل مع تباين الصور، يجب اتباع نهج حذر في وضع النتائج في سياقها، حيث تم إجراء دراسات التقييم ضمن مجموعة بيانات صغيرة نسبيا وبيئات محاكاة. سيكون من المفيد للدراسات البحثية المستقبلية استخدام مجموعات بيانات أكبر تمثل الحالات السريرية الحقيقية ومجموعات بيانات تم التحقق منها سريريا لتحديد ما إذا كانت ViTs مفيدة للتعرف السريري على تشخيص الأورام وتحسين الكشف المبكر.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

سرطان الرئة يحمل عبئا عالميا كبيرا، يؤثر على ملايين الأرواح كل عام. نظرا للطبيعة العدوانية للسرطان وحالته المتكررة في ظهور المرض المتأخر، فإن معدل الوفيات المرتبط بسرطان الرئة مرتفع. الكشف المبكر ضروري لأن التدخل يمكن أن يحسن فعالية العلاج ومعدلات البقاء بشكل كبير.1. النهج التقليدي للفحص الأولي والتشخيص لا يزال يعتمد على استخدام التصوير المقطعي المحوسب (CT) للسماح برؤية أكثر تفصيلا لهياكل الرئة. ومع ذلك، فإن تقييم صور الأشعة المقطعية معقد ويعتمد كليا على المراجعين كأخصائيين أشعة. كما أن تباين الأورام في خصائص مثل الحجم والشكل والكثافة يقلل أيضا من موثوقية أي ملاحظة بشرية. يمكن للعوامل البيئية أن تتحدى دقة وقابلية إعادة إنتاج اتخاذ القرار بناء على التحليل البشري.
مع وضع هذه العوامل المحددة في الاعتبار، بذلت الأدبيات الحديثة دفعا قويا لتطبيق الذكاء الاصطناعي (الذكاء الاصطناعي) في التصوير الطبي، مع تركيز أكبر على نماذج التعلم العميق (DL). لقد أخطأ DL، خاصة مع الشبكات العصبية الالتفاوية (CNNs)، في نمط الملاحظات في التصوير الطبي من خلال تغيير تحليلات الصور2. لقد حسنت شبكات CNN عمليات تشخيصية بشكل كبير في علم الأورام، مما أظهر القدرة على تحديد الميزات الدقيقة والمعقدة في بيانات التصوير التي غالبا ما تكون غير قابلة للتمييز للعين البشرية. على الرغم من هذه التطورات، تواجه شبكات CNN قيودا في الإفراط في التكييف على مجموعات البيانات الصغيرة، وانخفاض المتانة تحت ظروف الاستحواذ المتغيرة، والاعتماد على الحقول المحلية المستقبلية التي قد تفوت الاعتماديات العالمية. بينما تحاول الأساليب الهجينة بين CNN والمحول دمج النماذج الاللوحية السابقة مع آليات الانتباه، إلا أنها لا تزال ترث تحيزات من البنى الالتفافية. يوضح الشكل 1 بعض الحالات من مجموعة البيانات التي تعرض فئات مختلفة.

figure-introduction-1
الشكل 1: رسم بصري لفئات مختلفة تظهر شرائح تصوير مقطعي ممثلة من رئتين طبيعيتين وحميدتين وخبيثتين، مع إبراز أوجه التشابه والاختلافات. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

تعرض صور الأشعة المقطعية النموذجية للحالات الطبيعية والحميدة والخبيثة. بينما يساعد التمييزات الصريحة للمناطق التمييزية في التفسير البصري، فإن التعليق اليدوي يتطلب خبراء في الأشعة وكان خارج نطاق هذه الدراسة.

Vision Transformers (ViTs)، التي تم تقديمها أصلا لتصنيف الصورالطبيعية 3، تقدم بديلا واعدا. على عكس شبكات CNN أو الهجين بين CNN-Transform، تستخدم ViTs إطارا قائما بالكامل على الانتباه يلتقط المعلومات السياقية العالمية عبر الصورة بأكملها. تعد هذه الدراسة ذات صلة خاصة بالتصوير المقطعي، حيث يمكن أن تمتد الخصائص المنتشرة وغير المنتظمة لخصائص الورم عبر المناطق بدلا من أن تقتصر على الحقول الاستقبالية المحلية فقط. بينما تستقر شبكات CNN-Transformer الهجينة التحيز الحثي الالتفافي، تنفذ محولات الرؤية (ViTs) بنية تعتمد بالكامل على الانتباه، مما يسمح لنموذج ViT بالتقاط الاعتماديات طويلة المدى عبر صور الأشعة المقطعية بالكامل - وهو فائدة عند تقييم سمات الورم الرئوي المنتشرة أو غير المنتظمة.

ظهور النماذج القائمة على المحولات في مجال التصوير الطبي حديث، مع بعض الأمثلة في الأشعة اللينة وعلم الأمراض النسيجي،4,5,6 التي أظهرت مزايا ملحوظة في متانة الضوضاء والضبابية والتغير بين الماسحات مقارنة بأنظمة CNN التقليدية، وذلك في دعم تبرير ViT في مثل هذا السياق السريري دون المبالغة في التأكيد على الجدة. وبالنظر إلى نهج أكثر صرامة في تصوير سرطان الرئة مقارنة بالتطبيقات الصحية للمستهلكين، تهدف هذه الدراسة إلى تبرير العملية في مجال قوي من الطب المبني على الأدلة، مع وضع نفسها ضمن الأدبيات المتوفرة مؤخرا المتعلقة بالمحولات وتطبيقاتها. أظهرت الأدبيات السابقة أن الدقة في طرق تشخيص CNN تنخفض بشكل كبير بسبب تباين الاكتساب7، حيث يؤدي ViT المقابل أداء أفضل مع نفس الاضطرابات،8 مما يمنح مصداقية لمفهوم استخدام ViT في أساليب التقييم وتقديم خيار لزيادة قابلية التكرار في سير العمل التشخيصي. علاوة على ذلك، تطرح قضايا عملية مثل حجم مجموعة البيانات المطلوبة، العبء الحاسوبي، وقابلية التعميم على بيئات سريرية مختلفة بوضوح في الدراسة باستخدام طرق مثل تعزيز البيانات، والتعلم التحويلي، ومتغيرات ViT الفعالة 9,10 لمعالجة هذه التحديات المحتملة في الاستخدام الواقعي.

تبني هذه الدراسة هذا التقدم من خلال تطبيق ViTs لمرحلة سرطان الرئة باستخدام بيانات صور الأشعة المقطعية وفحص متانة وقابلية التعميم للنموذج في ظل وجود مشاكل تصوير واقعية. بيانات التصوير المقطعي المحوسب قد تشمل التشوه، والضوضاء، والتمويه إلى حد شائع قد يخفي ملامح ذات معنى للأطباء السريريين. من خلال دراسة القدرة على الصمود أمام هذه التغيرات في التصوير، تهدف هذه الدراسة إلى تقديم إطار إضافي للمرحلة يمكن الاعتماد عليه عمليا عند اتخاذ قرارات تتعلق بالرعاية والعلاج.

تشمل مساهمات هذه الدراسة: 1) تحديد سرطان الرئة تحديدا من خلال صور الأشعة المقطعية في مجموعة بيانات IQ-OTH/NCCD باستخدام وفحص أداء نموذج محول الرؤية؛ ii) تقييم أداء النموذج في سيناريوهات التصوير السريري الواقعية الشائعة في بيانات التصوير المقطعي، مثل الضوضاء والضبابية؛ 3) مقارنة الدقة والحساسية والخصوصية لنماذج ViTs كبديل لنماذج CNN التقليدية.

تنظيم بقية هذه الورقة هو كما يلي: يتناول القسم الثاني مراجعة الأدبيات التي تقدم أعمالا سابقة تتعلق بالكشف عن سرطان الرئة باستخدام تقنيات التعلم العميق وتطور الشبكات العصبية إلى البنى الأكثر تقدما مثل ViTs. يقدم القسم الثالث النهج المتبنى لهذا العمل والذي يشمل معالجة البيانات المسبقة، ومعلومات هندسة النموذج، وتفاصيل إجراءات التدريب. يعرض القسم الرابع النتائج التي تتناول بشكل خاص الخصائص الوصفية لاختبارات ViTs كطريقة سريرية وكيف يمكن أن تعزز دقة وموثوقية فحوصات سرطان الرئة. يلخص القسم الخامس النتائج والمساهمات في الممارسة ويناقش الاتجاهات المستقبلية في سياق التعلم العميق في بيئة طبية.

أعمال ذات صلة:

لقد أحدث التعلم العميق (DL) ثورة في التصوير الطبي خلال السنوات العشر الماضية، خاصة في تشخيص سرطان الرئة. في البداية، اعتمدت هذه التخصص على تقنيات التعلم الآلي التقليدية مثل آلات الدعم المتجهة (SVMs) وأشجار القرار، التي كانت مقيدة بالحاجة إلى ميزات مبنية بشكل جيد ومكتسبة بشكل صحيح. تعاملت هذه الميزات بشكل سيء مع تعقيدات الصور الطبية وغالبا ما كانت تضخ الذاتية.

حدث تغيير كبير مع اختراع الشبكات العصبية الالفافية (CNNs)، التي جعلت من الممكن استخراج الخصائص الهرمية تلقائيا من البيانات11. تم استخدام شبكات CNN على نطاق واسع في مراحل السرطان المعتمدة على الأشعة المقطعية، واكتشاف العقدات، وتصنيفها كحميدة أو خبيثة. شبكات CNN ناجحة، لكن لها حدود. تشمل هذه الاختلافات في إعدادات جمع الصور والحاجة إلى مجموعات بيانات كبيرة مشروحة، والتي يصعب الحصول عليها بسبب قضايا الخصوصية والطبيعة المكثفة للتعليق الطبي. يقدم الجدول 1: 12، 12، 13، 14، 15، 16، 17، 18، 19، 20 ملخصا للدراسات الحديثة التي أجريت في مجال تشخيص سرطان الرئة.

كراستا، لافينا جين، روبال نيما، وألوين روشان بايس (2024) [20]تقديم إطار تعليمي عميق جديد للكشف عن سرطان الرئة وتصنيفه باستخدام صور التصوير المقطعي [20].تقدم الورقة تقنية 3D-VNet للتقسيم وشبكة 3D-ResNet للتصنيف، مما يبرز تحسينات في الدقة والمتانة مقارنة بالطرق السابقة.
كراستا، لافينا جين، روبال نيما، وألوين روشان بايس (2024) [20]تقديم إطار تعليمي عميق جديد للكشف عن سرطان الرئة وتصنيفه باستخدام صور التصوير المقطعي [20].تقدم الورقة تقنية 3D-VNet للتقسيم وشبكة 3D-ResNet للتصنيف، مما يبرز تحسينات في الدقة والمتانة مقارنة بالطرق السابقة.

الجدول 1: ملخص الدراسات الحديثة التي توضح التقنيات المستخدمة والأداء المبلغ عنها للسياق.

من خلال استخدام عمليات الانتباه الذاتي التي تأخذ سياق الصورة بالكامل في الاعتبار دفعة واحدة، بدأت محولات الرؤية (ViTs) في الظهور كبديل تنافسي لشبكات CNN في المهام المتعلقة بالصورة. تعد ViTs واعدة بشكل خاص للتصوير الطبي، لأن أهمية بعض المناطق قد تعتمد على أجزاء أبعد من الصورة بسبب قدرتها على المعالجة العالمية. ومع ذلك، وعلى الرغم من قدرتها على التعامل مع المهام المعقدة مثل التعرف على الروابط بين العديد من مؤشرات المرض في الفحوصات، إلا أن أجهزة ViTs لا تزال غير مدروسة جيدا في مجال التصوير الطبي.

لم يتم استكشاف ViTs بشكل كبير في مجال أجهزة الرعاية الصحية التي تركز على المستهلك. تهدف هذه الدراسة إلى سد الفجوة بين الدقة العالية وتقليل التأخير في أجهزة الرعاية الصحية التي تركز على المستهلك حيث يمكنها الأداء بشكل جيد وتقديم توقعات دقيقة في الوقت الحقيقي.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تتضمن مجموعة البيانات ما مجموعه 1,190 شريحة تصوير مقطعي من 110 حالة، مقسمة إلى ثلاث فئات: طبيعية (55 حالة)، حميدة (15 حالة)، وخبيثة (40 حالة). كل حالة تتكون من عدة شرائح أشعة مقطعية (تتراوح بين حوالي 80 إلى 200 شريحة لكل حالة)، مما يوفر رؤية محورية متنوعة لمنطقة الصدر. تم الحصول على صور الأشعة المقطعية في DICOM باستخدام ماسح SOMATOM مع معايير تصوير قياسية: جهد الأنبوب = 120 كيلوفولت، سمك الشريحة = 1 مم، عرض النافذة = 350–1200 وحدة هونسفيلد (HU)، وقيم مركز النافذة = 50–600 وحدة هو، أثناء حبس النفس الكامل للاستنباهات.

تم إزالة الهوية الكاملة لجميع الصور قبل التحليل لإزالة أي معلومات شخصية قابلة للتعريف (PII). تمت الموافقة على مجموعة البيانات أخلاقيا من قبل لجان المراجعة المؤسسية للمراكز الطبية المشاركة، مع تنازل عن موافقة كتابية من قبل لجنة مراجعة الرقابة. شملت الحالات أفرادا من خلفيات متنوعة مثل موظفي الحكومة والمزارعين وسكان من عدة محافظات عراقية (بما في ذلك بغداد، ووسط، وديالى، وصلاح الدين، وبابل) مع تنوع في الجنس والعمر والمستوى التعليمي والحالة المعيشية.

وبما أن مجموعة البيانات متاحة للجمهور وغير محددة، لم تكن هناك حاجة لأي موافقة أخلاقية إضافية لاستخدامها في هذه الدراسة. تلتزم مجموعة البيانات بالشروط والأحكام التي يحددها المساهمون الأصليون ومنصة الاستضافة.

تستخدم منهجية هذا البحث عملية متعددة المراحل مصممة لإنشاء نموذج تنبؤ بمساعدة مجموعة بيانات سرطان الرئة IQ-OTH/NCCD رقم 21. تضع هذه المنهجية أسارا قويا لأجهزة الرعاية الصحية التي تركز على المستهلك حيث يتطلب زمن استجابة أقل، مما يوفر دقة أفضل. يوضح الشكل 2 آلية عمل النموذج المقترح.

figure-protocol-1
الشكل 2: مخطط سير العمل للنموذج المقترح الذي يوضح خطوات المعالجة المسبقة، والتعزيز، وتصنيف محول الرؤية، وخطوات التقييم. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

1. وصف مجموعة البيانات

تم جمع مجموعة بيانات سرطان الرئة IQ-OTH/NCCD في مستشفى العراق-الأورام التعليمي/المركز الوطني لأمراض السرطان خلال خريف 2019. احتوى جزء التدريب من مجموعة البيانات المستخدمة على 1,097 صورة تم وصفها في الجدول 2، الذي يوضح عدد عينات العينات من فئات مختلفة.

فصلعدد الصور
عادي416
حميده120
خبيث561

الجدول 2: عينات من صور الأشعة المقطعية الطبيعية، الحميدة، والخبيثة من مجموعة البيانات.

تم اختيار مجموعة بيانات سرطان الرئة IQ-OTH/NCCD لتمثيلها الشامل لصور الأشعة المقطعية الطبيعية والحميدة والخبيثة. بينما تتوفر مجموعات بيانات أخرى مثل LIDC-IDRI وNSCLC-Radiomics، إلا أنها إما تركز بشكل أساسي على اكتشاف العقد أو تفتقر إلى عينات كافية من الحالات الحميدة. تعد مجموعة بيانات IQ-OTH/NCCD مناسبة بشكل خاص لدراستنا لأنها تتيح لمحول الرؤية تعلم الميزات المميزة عبر الفئات الثلاث، مما يتيح تصنيفا قويا للأنماط الدقيقة في صور الأشعة المقطعية للرئة.

2. معالجة البيانات المسبقة

تعد المعالجة المسبقة خطوة مهمة لتحسين أداء النموذج من خلال الاتساق والتعديلات المناسبة على البيانات التي ستتم معالجتها عبر الشبكة العصبية. لضمان الاتساق في حجم الإدخال للشبكة العصبية، قمنا بتصغير جميع الصور إلى نفس البعد وهو 256 × 256 بكسل، وقمت بتطبيع البيانات إلى قيمة بكسل بين 0 و1 على أمل تحسين تدريب النماذج والتقارب. يحتوي الجدول 3 على قيم تقنيات التعزيز.

تقنيهقيمة
التطبيع-
ريسيزينجimage_size x image_size
الدوران العشوائيالعامل = 0.02
راندوم زوومheight_factor=0.2، width_factor=0.2

الجدول 3: تقنيات التعزيز التطبيقية مع نطاقات المعلمات.

لزيادة متانة النموذج ضد الإفراط في التركيب وتحسين قدرته على التعميم، يتم تطبيق تقنيات تعزيز البيانات مثل الدوران العشوائي والتكبير، لمحاكاة زوايا وأحجام مختلفة لظهور ظهور سرطان الرئة في مرضى مختلفين. تم تطبيق دورانات عشوائية بزوايا مأخوذة بشكل موحد من 0.02 راديان وتحويلات تكبير عشوائية مع عوامل ارتفاع وعرض مختلفة في هذه الدراسة. الصور التي تلي التعزيز معروضة في الشكل 3.

figure-protocol-2
الشكل 3: صور CT بعد التعزيز تظهر الدوران، والتكبير، والتطبيع لتحسين تعميم النموذج. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

هذه التقنيات المبدئية مطلوبة، وقد تم استخدام التعزيز عبر جميع الفئات لضمان متانة النموذج.

3. بنية النماذج

من خلال تكييف إطار عمل محول الرؤية (ViT) الجديد للتعامل بفعالية مع بيانات الصور المعقدة، تهدف بنية النموذج إلى تصنيف فحوصات الأشعة المقطعية إلى ثلاث فئات: طبيعية، حميدة، وخبيثة. بهذه الطريقة، تتم معالجة صور إدخال بحجم 256 × 256 بكسل. لضمان الاتساق وتعزيز تعلم النماذج بشكل أكثر كفاءة، تخضع كل صورة لعدة عمليات معالجة مسبقة، مثل إعادة الحجم والتطبيع. لتحسين قدرة النموذج على تحمل تغيرات مقياس الصورة واتجاهها، يبدأ التصميم بطبقة تعزيز البيانات تستخدم طرقا تشمل التطبيع، وتغيير الحجم، والدورانات العشوائية بمقدار 0.02 راديان، وتكبير عشوائي يصل إلى 20٪. بعد التعزيز، يأخذ النموذج 16 رقعة بحجم 16 بكسل من كل صورة، وبالتالي كل صورة تحتوي على 256 رقعة.

تحدد الخوارزمية 1 سير العمل، وكيفية بنائه، والضبط الدقيق الذي يتم بالنسبة للنموذج.

الخوارزمية 1: تصنيف سرطان الرئة باستخدام محولات الرؤية
الإدخال: مجموعة صور CT I من مجموعة بيانات IQ-OTH/NCCD
المخرج: نتائج التصنيف C إلى فئات: طبيعي، حميد، خبيث
تجهيزها:
   for each image i in I do
i <- Resize(i, 256 x 256)         // Normalize and resize images
i <- Normalize(i)
i <- DataAugmentation(i)        // Apply random rotations and zooms
   end for

إعداد النماذج:
  Initialize Vision Transformer (ViT) Model
  Set number of patches P = 16 x 16
  Set number of heads H = 6 in multi-head attention

تدريب:
  for epoch = 1 to MaxEpochs do
    for each batch b in I do
      Patches <- ExtractPatches(b, P)
      EncodedPatches <- PatchEncoder(Patches)
      AttentionWeights <- MultiHeadAttention(EncodedPatches, H)
      ClassLogits <- TransformerEncoder(AttentionWeights)
      Loss <- ComputeLoss(ClassLogits, TrueLabels)
      UpdateModelWeights(Loss)
    end for
    if EarlyStoppingCriteriaMet (Val_Loss No Improvement Patience = 5 Epochs) then
      break
    end if
  end for

التحقق:
  Split data into TrainingSet (80%) and ValidationSet (20%)
  ComputeValidationMetrics(ValidationSet)

تقييم:
  C <- Classify(I)
  ComputePerformanceMetrics(C)
  Return C

للحفاظ على العلاقات المكانية بين الرقع، يتم تسطيح هذه الرقع (المعادلة 1) إلى متجهات ذات 768 بعدا (لأن كل رقعة تحتوي على 16 × 16 × 3 = 768) ثم ترسل عبر طبقة ترميز الرقعة، التي تسقط كل متجه إلى فضاء 64 بعدا من خلال دمج التضمينات الموضعية. يتكون جوهر البنية من ثماني طبقات محولات، كل منها يتميز بآلية انتباه متعددة الرؤوس بستة رؤوس، مما يسمح للنموذج بالتركيز على أجزاء مختلفة من الصورة في نفس الوقت والتقاط مجموعة واسعة من الميزات. يتم تمثيله باستخدام المعادلات 2 و3 و4.

figure-protocol-3

حيث μ هو المتوسط و σ2 هو تباين المدخل x، و ε هو ثابت صغير لمنع القسمة على صفر.

figure-protocol-4

حيث Q هي مصفوفة الاستعلام، وK هي مصفوفة المفتاح، وV هي مصفوفة القيم، وdk هو بعد المتجهات الرئيسية.

figure-protocol-5
figure-protocol-6

حيث WiQ، WiK، و WiV هي مصفوفات الوزن المتعلمة للاستعلامات والمفاتيح والقيم على التوالي، وWO هي مصفوفة الوزن المخرج.

تم عرض مخطط الكتل للنموذج المقترح في الشكل 4.

figure-protocol-7
الشكل 4: مخطط كتلي لنموذج محول الرؤية مع رأس MLP، يوضح طبقات المعالجة الرئيسية والهندسة المعمارية. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

تتضمن كل طبقة محول إدراكا متعدد الطبقات (MLP) مع وحدات مخفية يتم تكبيرها أولا إلى 128 ثم تعود إلى 64، مما يوسع ويضغط تدفق المعلومات لالتقاط التبعيات المعقدة.

يتم تطبيق التسرب بشكل استراتيجي بمعدل 0.1 ضمن آليات الانتباه وMLPs لمنع الإفراط في التوافق. يتم معالجة مخرجات مشفر المحول عبر رأس MLP يتكون من طبقتين كثيفتين بحجم 2,048 و1,024 وحدة على التوالي، باستخدام وحدات الخط الخطي لخطأ غاوسي (GELU) للتفعيل، وقد ثبت أن ذلك أداءه الجيد في تطبيقات التعلم العميق. يتم تحقيق ذلك باستخدام المعادلة 5.

figure-protocol-8

حيث أن W1 و W2 هما مصفوفات وزن، وb1 و b2 هما انحيازات، وGELU هي دالة التنشيط المستخدمة.

تم استخدام انقطاع 0.1 في طبقات المحولات لمنع الإفراط في التركيب دون فقدان معلومات الميزات المهمة. تم استخدام دالة تنشيط GELU لخصائصها السلسة غير الخطية، التي تعزز تدفق التدرج والتقارب في النماذج القائمة على المحولات. يتم تنظيم الخروج باستخدام المعادلة 6.figure-protocol-9

حيث p هو معدل الانسحاب (مثلا 0.1 أو 0.5)، وطبقة الانسحاب تضبط عشوائيا جزءا من وحدات الإدخال إلى صفر أثناء التدريب.

معدل التساقط البالغ 0.5 في هذه الطبقات يساعد أكثر في التخفيف من الإفراط في التركيب. الطبقة الأخيرة من النموذج هي طبقة لوجيتس (المعادلة 7) التي تنتج ثلاث لوجيتات فئية تتوافق مع فئات الطبيعي، والحميد، والخبيث، باستخدام دالة فقدان إنتروبيا عرضية متفرقة (المعادلة 8) المناسبة لهذا الإعداد متعدد الفئات.

figure-protocol-10

figure-protocol-11

حيث zi هو متجه لوجيتس للفئة i، وSoftMax(zi)) يمثل الاحتمالات المتوقعة، وyi هو تسمية الفئة الحقيقية.

يتم تجميع النموذج باستخدام محسن AdamW (المعادلات 9، 10، 11، 12، و13)، وهو امتداد لمحسن آدم يتعامل بشكل أكثر فعالية مع فقدان الوزن، مع معدل تعلم 0.001 وفقدان الوزن 0.0001، مما يحسن سرعة التعلم واستقرار النموذج.

figure-protocol-12

figure-protocol-13
figure-protocol-14
figure-protocol-15
figure-protocol-16

حيث أن mt و vt هما اللحظات الأولى والثانية للتدرجات، figure-protocol-17 وهما figure-protocol-18 اللحظات المصححة بالتحيز، η هو معدل التعلم، و ε هو ثابت صغير لمنع القسمة على الصفر.

عند تدريب النموذج، يستخدم حجم دفعة 32 للاستفادة من تسريع وحدة معالجة الرسومات للحسابات الأسرع وتم تهيئته للتدريب لمدة 100 عصر.

لكن التدريب لديه آلية توقف مبكرة لفقدان التحقق للحد من التدريب عندما يتوقف النموذج عن التحسن لتوفير الموارد الحاسوبية وتجنب الإفراط في التدريب لخمس فترات متتالية. يتم تتبع أداء النموذج من خلال مقاييس مثل الدقة التصنيفية المتناثرة والدقة المصنفة الأولى، والتي تفيد بقدرة النموذج على التصنيف عبر الفئات الأكثر احتمالا المتوقعة. تشمل الاستدعاءات لتدريب النماذج نقاط التحقق التي ستنقذ النموذج الأعلى أداء وفقا لدقة التحقق لضمان الحفاظ على أنجح نسخة من النموذج بعد انتهاء عملية التدريب. تستفيد هذه البنية القوية والمخططة جيدا من قدرات المحولات لمعالجة بيانات التصوير الطبي بنهج متقدم للغاية لاستخدام طرق الذكاء الاصطناعي المعاصرة لتطبيقات رئيسية في تشخيص الرعاية الصحية.

4. التدريب والتحقق

تم تدريب النموذج في بيئة كاجل باستخدام وحدة معالجة رسومات NVIDIA P100، وتم استخدام هبوط تدرج صغير الدفعة بحجم دفعة 32 خلال عملية التدريب. المحسن المستخدم أثناء التدريب كان AdamW بمعدل تعلم 0.001 وفقدان الوزن 0.0001؛ كان هذا توازنا جيدا بين التقارب السريع وبعض التنظيم. تم تدريب النموذج لمدة 100 عصر، ومع ذلك، تم استخدام التوقف المبكر عند فقدان التحقق مع صبر 5 فترات. ببساطة، إذا لم يحسن التدريب فقدان التحقق لخمس فترات مستمرة، فسيتوقف التدريب بسبب التركيب الزائد والكفاءة الحاسوبية. في معظم الحالات، كان هذا النموذج يستعيد الأوزان من الحقبة التي كانت أقل خسارة في التحقق، مما يدل على أنه كان يؤدي بشكل مثالي ولم يكن بحاجة لتشغيل كامل 100 حقبة. حوالي 32 دقيقة لتدريب النموذج.

خلال التدريب، شملت المقاييس دقة تصنيفية متفرقة ودقة أعلى 2، وتمت مراقبتها على مجموعات التدريب والتحقق. توفر هذه المقاييس نظرة حول مدى تكرار توقع النموذج للفئة الصحيحة وما إذا كانت الفئة الصحيحة ضمن أعلى توقعين، وهو أمر مهم في التطبيقات الطبية لأن التصنيفات الخاطئة عالية الثقة قد يكون لها عواقب كبيرة. يتم عرض منحنيات التعلم للخسارة والدقة في الشكل 5.

.figure-protocol-19

الشكل 5: منحنيات دقة وفقدان التدريب والتحقق عبر 50 حقبة تظهر التعلم المستقر وتقليل التكييف الزائد. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

لم يتم إجراء أي تحقق متبادل في هذه الدراسة. سمح هذا الإعداد بتجربة فعالة في بنية النموذج، بما في ذلك تعديلات طبقات المحولات وأحجام رؤوس MLP، مع ضمان تعميم النموذج بشكل جيد على بيانات التحقق غير المرئية.

5. التحليل الإحصائي

تم تحليل أداء نموذج محول الرؤية إحصائيا بناء على مجموعة بيانات سرطان الرئة IQ-OTH/NCCD. تم حساب الدقة، والاسترجاع، ودرجة F1، والدقة باستخدام المعادلات 14، 15، 16، 17 على التوالي. تعتبر هذه الأربعة المقاييس التقليدية المستخدمة في مهام التصنيف، حيث يمكنها الكشف عن معلومات عن أداء النموذج في التصنيف والتصنيف على أساس كل فئة لكل فئة.

figure-protocol-20
figure-protocol-21
figure-protocol-22
figure-protocol-23

الاستدعاء هو مقياس لقدرة النموذج على تحديد جميع الحالات ذات الصلة في الفئة، بينما الدقة هي نسبة التحديدات الإيجابية التي كانت صحيحة فعليا. توازن نتيجة الفورمولا 1 بين الاستدعاء والدقة عندما يكون كلاهما مهما.
كانت مقاييس الأداء المستخدمة في هذا التعيين هي معادلة معامل الارتباط ماثيوز (MCC) رقم 18 ومعادلة كابا لكوهين 19.

figure-protocol-24
figure-protocol-25

حيث P0 هو الاتفاق المرصود بينما Pe هو الاتفاق المتوقع.

يعد MCC مقياسا شاملا لأداء التصنيف، يأخذ في الاعتبار كل من الإيجابيات الحقيقية والسلبية، والإيجابيات الكاذبة، والسلبية الكاذبة. يمكن أن تكون قيمته بين -1 و1، حيث 1 هو التنبؤ الكامل، و0 هو التنبؤ العشوائي، و-1 هو اختلاف تام بين التسميات المتوقعة والحقيقية. كان MCC ذا قيمة للمقارنات عبر أداء النماذج المختلفة عند تطبيقه على مجموعات بيانات غير متوازنة وتوفير مقياس متوازن بغض النظر عن اختلاف أحجام الفئات.

كجزء من تحليل إحصائي إضافي، تم حساب درجة F2، مع إعطاء الأولوية للاسترجاع، كما هو موضح في المعادلة 20.

figure-protocol-26

كما تم قياس أداء النموذج باستخدام متوسط التربيع للخطأ (MSE)، ومتوسط المربع الجذري (RMSE)، ومتوسط الخطأ المطلق (MAE) - والتي عادة ما تكون قياسات لمهام الانحدار لكنها معدلة هنا لمهمة التصنيف لقياس حجم الخطأ في المتوسط دون اعتبار الاتجاه.

لتحديد ما إذا كان من العملي دمج ViTs داخل أجهزة الرعاية الصحية التي تركز على المستهلك، أجرينا نتائج تقييم أداء شاملة تركز فقط على الكفاءة الزمنية للنموذج. أنشأنا وظائف للإبلاغ عن الوقت المستغرق للتنبؤ بصورة واحدة أو فقط عدة صور، حيث يصبح ذلك ذا صلة خاصة بالتطبيقات اللحظية. لكل صورة، قبل بدء التنبؤ، تتم معالجة البيانات مسبقا لتكون في شكل الصورة المدخلة التي يريدها النموذج. سجلنا وقت بدء التنبؤ والوقت الذي اكتمل فيه للحصول على نتائج الزمن والكمون. تم حساب الوقت ومتوسط الكمون باستخدام المعادلة 21 والمعادلة 22 على التوالي.

figure-protocol-27
figure-protocol-28

أين:

  • N هو عدد الصور (العينات).
  • الميل هو الوقت المسجل بعد التنبؤ بالصورة من الرقم i.
  • Tstart هو الوقت المسجل قبل التنبؤ بالصورة الثانوية (i-th).

أجريت تجارب إضافية لتقييم متانة نموذج محول الرؤية الذي اقترحناه من خلال إدخال ضوضاء إضافية وضبابية بشكل منهجي إلى الصور. تمت إضافة ضوضاء غاوسية لكل بكسل بعامل ضوضاء 0.4 مع قص قيم البكسلات في نطاق [0,1]. تم تقليل عامل الضبابية عبر الضباب الغاوسي بحجم نواة 45× 45. تم تصميم هذه التجارب لتقييم النموذج بشكل شامل تحت تدهور جودة الصورة الإدراكي المحاكى.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

أظهر نموذج محول الرؤية نتائج استثنائية على مقاييس تقييم متعددة على مجموعات بيانات سرطان الرئة IQ-OTH/NCCD، مما أدى إلى تمييز فعال بين صور الأشعة المقطعية الطبيعية والحميدة والخبيثة. بلغ الأداء العام للنموذج دقة عالية بلغت 98.18٪ عبر مجموعة بيانات الاختبار التي تتكون من 220 صورة. تشير هذه الدقة العالية جدا إلى أن النموذج قادر على التعميم بشكل فعال جدا، وبالتالي يمكن استخدامه في بيئة سريرية.

فيما ...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

حقق نتائج ملحوظة في تقييم وتنفيذ نموذج محول الرؤية على مجموعة بيانات سرطان الرئة IQ-OTH/NCCD بدقة عالية. الدقة العامة لتصنيف الأشعة المقطعية على أنها طبيعية، حميدة، وخبيثة هي 98.18٪ باستخدام هذا النموذج.

تثبت هذه الدقة الفائقة أكثر من خلال أداء النموذج في الدرجات الرئيسية الأخرى، مثل دقة 100٪ في كشف الحالات الخبيثة، وهو أمر مهم جدا في التشخيص المبكر والإدارة.

أظهر التحليل المتعمق أن النموذج لا يؤدي فقط دقة عالية، بل يظهر أيضا استدعا...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يعلن المؤلفون أنهم لا يملكون تضارب مصالح.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

وقد دعم هذا العمل مشروع دعم الباحثين من جامعة الأميرة نورة بنت عبد الرحمن رقم (PNURSP2025R432)، جامعة الأميرة نورة بنت عبد الرحمن، الرياض، المملكة العربية السعودية.  يشكر المؤلفون عميد الدراسات العليا والبحث العلمي في جامعة نجران على تمويلهم هذا العمل ضمن رمز منحة برنامج تمويل النمو (NU/GP/SERC/13/575-6).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
وحدة معالجة رسومات A100 (CUDA)NVIDIAإصدار CUDA 11.6تسريع وحدة معالجة الرسومات (GPU) لتدريب وتقييم النماذج.
معالج AMD EPYC-7502PAMDلا يوجدالمعالج المستخدم في الحوسبة عالية الأداء.
إيثرنت جيجابتإنتللا يوجدالشبكات للتواصل الآمن بين الأقران في CPS.
ماتبلوتليبمؤسسة بايثون للبرمجياتالإصدار 3.5مكتبة التصور لرسم النتائج.
نظام بايييه للتشفيرالمصدر المفتوح (تم تنفيذه عبر TenSEAL)لا يوجديتيح التشفير الجمعي المتماثل على التدرجات.
باي سيفتOpenMinedالإصدار 0.6.0الخصوصية التفاضلية ومكتبة التعلم الفيدرالي.
بايثون (توزيع أناكوندا)شركة أناكونداالإصدار 3.9يتضمن حزم مثبتة مسبقا وأدوات إدارة البيئة، ويستخدم للبرمجة البرمجية وتطوير الأطر.
بايتورشالذكاء الاصطناعي الذكاء الاصطناعي الفوقيالإصدار 1.12إطار عمل للتعلم العميق لنماذج التدريب.
ذاكرة RAMكورسير256 جيجابايت (GB) دعم ذاكرة عالية للتدريب المكثف.
سكيت-لرنمؤسسة بايثون للبرمجياتالإصدار 1.1أدوات تعلم الآلة لتقييم الأداء.
سيبورنمؤسسة بايثون للبرمجياتالإصدار 0.11مكتبة تصور البيانات الإحصائية.
تخزين SSDسيغيت1 تيرابايت (TB)لتخزين البيانات بسرعة واسترجاعها.
TenSEALOpenMinedالإصدار 0.3مكتبة تشفير متجانسة للتجميع الآمن.
تنسور فلوجوجلالإصدار 2.9إطار عمل التعلم العميق لنماذج الانتشار.
نظام تشغيل أوبونتوالقانونيالإصدار 20.04 LTSنظام التشغيل المستخدم في جميع التجارب.

المراجع

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Wang, L., et al. Transformer-based deep learning model for the diagnosis of suspected lung cancer in primary care based on electronic health record data. EBioMedicine. 110, 105442(2024).
  2. Kshatri, S. S., Singh, D. Convolutional neural network in medical image analysis: a review. Arch. Comput. Methods Eng. 30 (4), 2793-2810 (2023).
  3. Atabansi, C. C., et al. A survey of transformer applications for histopathological image analysis: new developments and future directions. Biomed. Eng. Online. 22 (1), 1-26 (2023).
  4. Xu, H., et al. Vision transformers for computational histopathology. IEEE Rev. Biomed. Eng. 17, 63-79 (2024).
  5. Xia, K., Wang, J. Recent advances of transformers in medical image analysis: a comprehensive review. MedComm Future Med. 2 (1), e38(2023).
  6. Kim, J. W., et al. Systematic review of hybrid vision transformer architectures for radiological image analysis. J. Imaging Inform. Med. , (2025).
  7. Suresh, S., Mohan, S. ROI-based feature learning for efficient true positive prediction using convolutional neural network for lung cancer diagnosis. Neural Comput. Appl. 32 (20), 15989-16009 (2020).
  8. Fanizzi, A., et al. Comparison between vision transformers and convolutional neural networks to predict non-small lung cancer recurrence. Sci. Rep. 13 (1), 48004(2023).
  9. Alijani, S., et al. Vision transformers in domain adaptation and domain generalization: a study of robustness. Neural Comput. Appl. 36 (29), 17979-18007 (2024).
  10. Rane, N. Transformers for medical image analysis: applications, challenges, and future scope. SSRN Electron. J. , (2023).
  11. Taye, M. M. Theoretical understanding of convolutional neural network: concepts, architectures, applications, future directions. Computation. 11 (3), 52(2023).
  12. Mothkur, R., Veerappa, B. N. Classification of lung cancer using lightweight deep neural networks. Procedia Comput. Sci. 218, 1869-1877 (2023).
  13. Alsadoon, A., et al. DFCV: a framework for evaluation deep learning in early detection and classification of lung cancer. Multimed. Tools Appl. , (2023).
  14. Mohamed, T. I. A., et al. Automatic detection and classification of lung cancer CT scans based on deep learning and ebola optimization search algorithm. PLoS ONE. 18 (8), e0285796(2023).
  15. Sangeetha, S. K. B., et al. An enhanced multimodal fusion deep learning neural network for lung cancer classification. Syst. Soft Comput. 6, 200068(2024).
  16. Raza, R., et al. Lung-EffNet: lung cancer classification using EfficientNet from CT-scan images. Eng. Appl. Artif. Intell. 126, 106902(2023).
  17. Dunn, B., et al. Automated classification of lung cancer subtypes using deep learning and CT-scan based radiomic analysis. Bioengineering. 10 (6), 690(2023).
  18. Wani, N. A., et al. DeepXplainer: an interpretable deep learning based approach for lung cancer detection using explainable artificial intelligence. Comput. Methods Programs Biomed. 243, 107879(2024).
  19. Subash, J., Kalaivani, S. Dual-stage classification for lung cancer detection and staging using hybrid deep learning techniques. Neural Comput. Appl. 36 (14), 8141-8161 (2024).
  20. Yin, P., et al. Imaging of tumor boundary based on multielements and molecular fragments heterogeneity in lung cancer. IEEE Trans. Instrum. Meas. 70, 1-7 (2021).
  21. AL-Huseiny, M. S., Sajit, A. S. Transfer learning with GoogLeNet for detection of lung cancer. Indones. J. Electr. Eng. Comput. Sci. 22 (2), 1078-1086 (2021).
  22. Gupta, A., et al. UDCT: lung cancer detection and classification using U-net and DARTS for medical CT images. Multimed. Tools Appl. 84 (18), 19065-19085 (2024).
  23. Bagheri Tofighi, A., et al. Improving lung cancer detection via MobileNetV2 and stacked-GRU with explainable AI. Int. J. Inf. Technol. 17 (2), 1189-1196 (2024).
  24. Kareem, H. F., et al. Evaluation of SVM performance in the detection of lung cancer in marked CT scan dataset. Indones. J. Electr. Eng. Comput. Sci. 21 (3), 1731-1738 (2021).
  25. Lung tumor detection and recognition using deep convolutional neural networks. Solyman, S., Schwenker, F. Pan-Afr. Conf. Artif. Intell, , 79-91 (2023).
  26. Das, S., et al. Automated prediction of lung cancer using deep learning algorithms. Applied Artificial Intelligence. , 93-120 (2023).
  27. Abe, A. A., et al. A robust deep learning algorithm for lung cancer detection from computed tomography images. SSRN Electron. J. , (2023).
  28. Mathews, A. B., Karani, K. P. Lung cancer segmentation and classification using integration of convolutional neural network & U-net network over CT images: a deep learning approach. Int. J. Manag. Technol. Soc. Sci. , 520-534 (2022).
  29. MAT-VIT: a vision transformer with MAE-based self-supervised auxiliary task for medical image classification. Han, Y., et al. 27th Int. Conf. Comput. Support Coop. Work Des. (CSCWD), , 2046-2052 (2024).
  30. Ko, J., et al. Optimization of vision transformer-based detection of lung diseases from chest X-ray images. BMC Med. Inform. Decis. Mak. 24 (1), 1-15 (2024).
  31. Apostolidis, K. D., Papakostas, G. A. A survey on adversarial deep learning robustness in medical image analysis. Electronics. 10 (17), 2132(2021).
  32. Hybrid design of CNN and vision transformer: a review. Long, H. 7th Int. Conf. Comput. Inf. Sci. Artif. Intell, , 121-127 (2024).
  33. Papanastasiou, G., et al. Is attention all you need in medical image analysis? A review. IEEE J. Biomed. Health Inform. 28 (3), 1398-1411 (2024).
  34. Advancing healthcare in low-resource environments through an optimization and deployment framework for medical multimodal large language models. El Mir, A., et al. 2024 IEEE EMBS Int. Conf. Biomed. Health Inform. (BHI), , 1-8 (2024).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

مقالات ذات صلة