$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
تتضمن مجموعة البيانات ما مجموعه 1,190 شريحة تصوير مقطعي من 110 حالة، مقسمة إلى ثلاث فئات: طبيعية (55 حالة)، حميدة (15 حالة)، وخبيثة (40 حالة). كل حالة تتكون من عدة شرائح أشعة مقطعية (تتراوح بين حوالي 80 إلى 200 شريحة لكل حالة)، مما يوفر رؤية محورية متنوعة لمنطقة الصدر. تم الحصول على صور الأشعة المقطعية في DICOM باستخدام ماسح SOMATOM مع معايير تصوير قياسية: جهد الأنبوب = 120 كيلوفولت، سمك الشريحة = 1 مم، عرض النافذة = 350–1200 وحدة هونسفيلد (HU)، وقيم مركز النافذة = 50–600 وحدة هو، أثناء حبس النفس الكامل للاستنباهات.
تم إزالة الهوية الكاملة لجميع الصور قبل التحليل لإزالة أي معلومات شخصية قابلة للتعريف (PII). تمت الموافقة على مجموعة البيانات أخلاقيا من قبل لجان المراجعة المؤسسية للمراكز الطبية المشاركة، مع تنازل عن موافقة كتابية من قبل لجنة مراجعة الرقابة. شملت الحالات أفرادا من خلفيات متنوعة مثل موظفي الحكومة والمزارعين وسكان من عدة محافظات عراقية (بما في ذلك بغداد، ووسط، وديالى، وصلاح الدين، وبابل) مع تنوع في الجنس والعمر والمستوى التعليمي والحالة المعيشية.
وبما أن مجموعة البيانات متاحة للجمهور وغير محددة، لم تكن هناك حاجة لأي موافقة أخلاقية إضافية لاستخدامها في هذه الدراسة. تلتزم مجموعة البيانات بالشروط والأحكام التي يحددها المساهمون الأصليون ومنصة الاستضافة.
تستخدم منهجية هذا البحث عملية متعددة المراحل مصممة لإنشاء نموذج تنبؤ بمساعدة مجموعة بيانات سرطان الرئة IQ-OTH/NCCD رقم 21. تضع هذه المنهجية أسارا قويا لأجهزة الرعاية الصحية التي تركز على المستهلك حيث يتطلب زمن استجابة أقل، مما يوفر دقة أفضل. يوضح الشكل 2 آلية عمل النموذج المقترح.

الشكل 2: مخطط سير العمل للنموذج المقترح الذي يوضح خطوات المعالجة المسبقة، والتعزيز، وتصنيف محول الرؤية، وخطوات التقييم. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
1. وصف مجموعة البيانات
تم جمع مجموعة بيانات سرطان الرئة IQ-OTH/NCCD في مستشفى العراق-الأورام التعليمي/المركز الوطني لأمراض السرطان خلال خريف 2019. احتوى جزء التدريب من مجموعة البيانات المستخدمة على 1,097 صورة تم وصفها في الجدول 2، الذي يوضح عدد عينات العينات من فئات مختلفة.
| فصل | عدد الصور |
| عادي | 416 |
| حميده | 120 |
| خبيث | 561 |
الجدول 2: عينات من صور الأشعة المقطعية الطبيعية، الحميدة، والخبيثة من مجموعة البيانات.
تم اختيار مجموعة بيانات سرطان الرئة IQ-OTH/NCCD لتمثيلها الشامل لصور الأشعة المقطعية الطبيعية والحميدة والخبيثة. بينما تتوفر مجموعات بيانات أخرى مثل LIDC-IDRI وNSCLC-Radiomics، إلا أنها إما تركز بشكل أساسي على اكتشاف العقد أو تفتقر إلى عينات كافية من الحالات الحميدة. تعد مجموعة بيانات IQ-OTH/NCCD مناسبة بشكل خاص لدراستنا لأنها تتيح لمحول الرؤية تعلم الميزات المميزة عبر الفئات الثلاث، مما يتيح تصنيفا قويا للأنماط الدقيقة في صور الأشعة المقطعية للرئة.
2. معالجة البيانات المسبقة
تعد المعالجة المسبقة خطوة مهمة لتحسين أداء النموذج من خلال الاتساق والتعديلات المناسبة على البيانات التي ستتم معالجتها عبر الشبكة العصبية. لضمان الاتساق في حجم الإدخال للشبكة العصبية، قمنا بتصغير جميع الصور إلى نفس البعد وهو 256 × 256 بكسل، وقمت بتطبيع البيانات إلى قيمة بكسل بين 0 و1 على أمل تحسين تدريب النماذج والتقارب. يحتوي الجدول 3 على قيم تقنيات التعزيز.
| تقنيه | قيمة |
| التطبيع | - |
| ريسيزينج | image_size x image_size |
| الدوران العشوائي | العامل = 0.02 |
| راندوم زووم | height_factor=0.2، width_factor=0.2 |
الجدول 3: تقنيات التعزيز التطبيقية مع نطاقات المعلمات.
لزيادة متانة النموذج ضد الإفراط في التركيب وتحسين قدرته على التعميم، يتم تطبيق تقنيات تعزيز البيانات مثل الدوران العشوائي والتكبير، لمحاكاة زوايا وأحجام مختلفة لظهور ظهور سرطان الرئة في مرضى مختلفين. تم تطبيق دورانات عشوائية بزوايا مأخوذة بشكل موحد من 0.02 راديان وتحويلات تكبير عشوائية مع عوامل ارتفاع وعرض مختلفة في هذه الدراسة. الصور التي تلي التعزيز معروضة في الشكل 3.

الشكل 3: صور CT بعد التعزيز تظهر الدوران، والتكبير، والتطبيع لتحسين تعميم النموذج. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
هذه التقنيات المبدئية مطلوبة، وقد تم استخدام التعزيز عبر جميع الفئات لضمان متانة النموذج.
3. بنية النماذج
من خلال تكييف إطار عمل محول الرؤية (ViT) الجديد للتعامل بفعالية مع بيانات الصور المعقدة، تهدف بنية النموذج إلى تصنيف فحوصات الأشعة المقطعية إلى ثلاث فئات: طبيعية، حميدة، وخبيثة. بهذه الطريقة، تتم معالجة صور إدخال بحجم 256 × 256 بكسل. لضمان الاتساق وتعزيز تعلم النماذج بشكل أكثر كفاءة، تخضع كل صورة لعدة عمليات معالجة مسبقة، مثل إعادة الحجم والتطبيع. لتحسين قدرة النموذج على تحمل تغيرات مقياس الصورة واتجاهها، يبدأ التصميم بطبقة تعزيز البيانات تستخدم طرقا تشمل التطبيع، وتغيير الحجم، والدورانات العشوائية بمقدار 0.02 راديان، وتكبير عشوائي يصل إلى 20٪. بعد التعزيز، يأخذ النموذج 16 رقعة بحجم 16 بكسل من كل صورة، وبالتالي كل صورة تحتوي على 256 رقعة.
تحدد الخوارزمية 1 سير العمل، وكيفية بنائه، والضبط الدقيق الذي يتم بالنسبة للنموذج.
الخوارزمية 1: تصنيف سرطان الرئة باستخدام محولات الرؤية
الإدخال: مجموعة صور CT I من مجموعة بيانات IQ-OTH/NCCD
المخرج: نتائج التصنيف C إلى فئات: طبيعي، حميد، خبيث
تجهيزها:
for each image i in I do
i <- Resize(i, 256 x 256) // Normalize and resize images
i <- Normalize(i)
i <- DataAugmentation(i) // Apply random rotations and zooms
end for
إعداد النماذج:
Initialize Vision Transformer (ViT) Model
Set number of patches P = 16 x 16
Set number of heads H = 6 in multi-head attention
تدريب:
for epoch = 1 to MaxEpochs do
for each batch b in I do
Patches <- ExtractPatches(b, P)
EncodedPatches <- PatchEncoder(Patches)
AttentionWeights <- MultiHeadAttention(EncodedPatches, H)
ClassLogits <- TransformerEncoder(AttentionWeights)
Loss <- ComputeLoss(ClassLogits, TrueLabels)
UpdateModelWeights(Loss)
end for
if EarlyStoppingCriteriaMet (Val_Loss No Improvement Patience = 5 Epochs) then
break
end if
end for
التحقق:
Split data into TrainingSet (80%) and ValidationSet (20%)
ComputeValidationMetrics(ValidationSet)
تقييم:
C <- Classify(I)
ComputePerformanceMetrics(C)
Return C
للحفاظ على العلاقات المكانية بين الرقع، يتم تسطيح هذه الرقع (المعادلة 1) إلى متجهات ذات 768 بعدا (لأن كل رقعة تحتوي على 16 × 16 × 3 = 768) ثم ترسل عبر طبقة ترميز الرقعة، التي تسقط كل متجه إلى فضاء 64 بعدا من خلال دمج التضمينات الموضعية. يتكون جوهر البنية من ثماني طبقات محولات، كل منها يتميز بآلية انتباه متعددة الرؤوس بستة رؤوس، مما يسمح للنموذج بالتركيز على أجزاء مختلفة من الصورة في نفس الوقت والتقاط مجموعة واسعة من الميزات. يتم تمثيله باستخدام المعادلات 2 و3 و4.

حيث μ هو المتوسط و σ2 هو تباين المدخل x، و ε هو ثابت صغير لمنع القسمة على صفر.

حيث Q هي مصفوفة الاستعلام، وK هي مصفوفة المفتاح، وV هي مصفوفة القيم، وdk هو بعد المتجهات الرئيسية.


حيث WiQ، WiK، و WiV هي مصفوفات الوزن المتعلمة للاستعلامات والمفاتيح والقيم على التوالي، وWO هي مصفوفة الوزن المخرج.
تم عرض مخطط الكتل للنموذج المقترح في الشكل 4.

الشكل 4: مخطط كتلي لنموذج محول الرؤية مع رأس MLP، يوضح طبقات المعالجة الرئيسية والهندسة المعمارية. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
تتضمن كل طبقة محول إدراكا متعدد الطبقات (MLP) مع وحدات مخفية يتم تكبيرها أولا إلى 128 ثم تعود إلى 64، مما يوسع ويضغط تدفق المعلومات لالتقاط التبعيات المعقدة.
يتم تطبيق التسرب بشكل استراتيجي بمعدل 0.1 ضمن آليات الانتباه وMLPs لمنع الإفراط في التوافق. يتم معالجة مخرجات مشفر المحول عبر رأس MLP يتكون من طبقتين كثيفتين بحجم 2,048 و1,024 وحدة على التوالي، باستخدام وحدات الخط الخطي لخطأ غاوسي (GELU) للتفعيل، وقد ثبت أن ذلك أداءه الجيد في تطبيقات التعلم العميق. يتم تحقيق ذلك باستخدام المعادلة 5.

حيث أن W1 و W2 هما مصفوفات وزن، وb1 و b2 هما انحيازات، وGELU هي دالة التنشيط المستخدمة.
تم استخدام انقطاع 0.1 في طبقات المحولات لمنع الإفراط في التركيب دون فقدان معلومات الميزات المهمة. تم استخدام دالة تنشيط GELU لخصائصها السلسة غير الخطية، التي تعزز تدفق التدرج والتقارب في النماذج القائمة على المحولات. يتم تنظيم الخروج باستخدام المعادلة 6.
حيث p هو معدل الانسحاب (مثلا 0.1 أو 0.5)، وطبقة الانسحاب تضبط عشوائيا جزءا من وحدات الإدخال إلى صفر أثناء التدريب.
معدل التساقط البالغ 0.5 في هذه الطبقات يساعد أكثر في التخفيف من الإفراط في التركيب. الطبقة الأخيرة من النموذج هي طبقة لوجيتس (المعادلة 7) التي تنتج ثلاث لوجيتات فئية تتوافق مع فئات الطبيعي، والحميد، والخبيث، باستخدام دالة فقدان إنتروبيا عرضية متفرقة (المعادلة 8) المناسبة لهذا الإعداد متعدد الفئات.


حيث zi هو متجه لوجيتس للفئة i، وSoftMax(zi)) يمثل الاحتمالات المتوقعة، وyi هو تسمية الفئة الحقيقية.
يتم تجميع النموذج باستخدام محسن AdamW (المعادلات 9، 10، 11، 12، و13)، وهو امتداد لمحسن آدم يتعامل بشكل أكثر فعالية مع فقدان الوزن، مع معدل تعلم 0.001 وفقدان الوزن 0.0001، مما يحسن سرعة التعلم واستقرار النموذج.





حيث أن mt و vt هما اللحظات الأولى والثانية للتدرجات،
وهما
اللحظات المصححة بالتحيز، η هو معدل التعلم، و ε هو ثابت صغير لمنع القسمة على الصفر.
عند تدريب النموذج، يستخدم حجم دفعة 32 للاستفادة من تسريع وحدة معالجة الرسومات للحسابات الأسرع وتم تهيئته للتدريب لمدة 100 عصر.
لكن التدريب لديه آلية توقف مبكرة لفقدان التحقق للحد من التدريب عندما يتوقف النموذج عن التحسن لتوفير الموارد الحاسوبية وتجنب الإفراط في التدريب لخمس فترات متتالية. يتم تتبع أداء النموذج من خلال مقاييس مثل الدقة التصنيفية المتناثرة والدقة المصنفة الأولى، والتي تفيد بقدرة النموذج على التصنيف عبر الفئات الأكثر احتمالا المتوقعة. تشمل الاستدعاءات لتدريب النماذج نقاط التحقق التي ستنقذ النموذج الأعلى أداء وفقا لدقة التحقق لضمان الحفاظ على أنجح نسخة من النموذج بعد انتهاء عملية التدريب. تستفيد هذه البنية القوية والمخططة جيدا من قدرات المحولات لمعالجة بيانات التصوير الطبي بنهج متقدم للغاية لاستخدام طرق الذكاء الاصطناعي المعاصرة لتطبيقات رئيسية في تشخيص الرعاية الصحية.
4. التدريب والتحقق
تم تدريب النموذج في بيئة كاجل باستخدام وحدة معالجة رسومات NVIDIA P100، وتم استخدام هبوط تدرج صغير الدفعة بحجم دفعة 32 خلال عملية التدريب. المحسن المستخدم أثناء التدريب كان AdamW بمعدل تعلم 0.001 وفقدان الوزن 0.0001؛ كان هذا توازنا جيدا بين التقارب السريع وبعض التنظيم. تم تدريب النموذج لمدة 100 عصر، ومع ذلك، تم استخدام التوقف المبكر عند فقدان التحقق مع صبر 5 فترات. ببساطة، إذا لم يحسن التدريب فقدان التحقق لخمس فترات مستمرة، فسيتوقف التدريب بسبب التركيب الزائد والكفاءة الحاسوبية. في معظم الحالات، كان هذا النموذج يستعيد الأوزان من الحقبة التي كانت أقل خسارة في التحقق، مما يدل على أنه كان يؤدي بشكل مثالي ولم يكن بحاجة لتشغيل كامل 100 حقبة. حوالي 32 دقيقة لتدريب النموذج.
خلال التدريب، شملت المقاييس دقة تصنيفية متفرقة ودقة أعلى 2، وتمت مراقبتها على مجموعات التدريب والتحقق. توفر هذه المقاييس نظرة حول مدى تكرار توقع النموذج للفئة الصحيحة وما إذا كانت الفئة الصحيحة ضمن أعلى توقعين، وهو أمر مهم في التطبيقات الطبية لأن التصنيفات الخاطئة عالية الثقة قد يكون لها عواقب كبيرة. يتم عرض منحنيات التعلم للخسارة والدقة في الشكل 5.
.
الشكل 5: منحنيات دقة وفقدان التدريب والتحقق عبر 50 حقبة تظهر التعلم المستقر وتقليل التكييف الزائد. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
لم يتم إجراء أي تحقق متبادل في هذه الدراسة. سمح هذا الإعداد بتجربة فعالة في بنية النموذج، بما في ذلك تعديلات طبقات المحولات وأحجام رؤوس MLP، مع ضمان تعميم النموذج بشكل جيد على بيانات التحقق غير المرئية.
5. التحليل الإحصائي
تم تحليل أداء نموذج محول الرؤية إحصائيا بناء على مجموعة بيانات سرطان الرئة IQ-OTH/NCCD. تم حساب الدقة، والاسترجاع، ودرجة F1، والدقة باستخدام المعادلات 14، 15، 16، 17 على التوالي. تعتبر هذه الأربعة المقاييس التقليدية المستخدمة في مهام التصنيف، حيث يمكنها الكشف عن معلومات عن أداء النموذج في التصنيف والتصنيف على أساس كل فئة لكل فئة.




الاستدعاء هو مقياس لقدرة النموذج على تحديد جميع الحالات ذات الصلة في الفئة، بينما الدقة هي نسبة التحديدات الإيجابية التي كانت صحيحة فعليا. توازن نتيجة الفورمولا 1 بين الاستدعاء والدقة عندما يكون كلاهما مهما.
كانت مقاييس الأداء المستخدمة في هذا التعيين هي معادلة معامل الارتباط ماثيوز (MCC) رقم 18 ومعادلة كابا لكوهين 19.


حيث P0 هو الاتفاق المرصود بينما Pe هو الاتفاق المتوقع.
يعد MCC مقياسا شاملا لأداء التصنيف، يأخذ في الاعتبار كل من الإيجابيات الحقيقية والسلبية، والإيجابيات الكاذبة، والسلبية الكاذبة. يمكن أن تكون قيمته بين -1 و1، حيث 1 هو التنبؤ الكامل، و0 هو التنبؤ العشوائي، و-1 هو اختلاف تام بين التسميات المتوقعة والحقيقية. كان MCC ذا قيمة للمقارنات عبر أداء النماذج المختلفة عند تطبيقه على مجموعات بيانات غير متوازنة وتوفير مقياس متوازن بغض النظر عن اختلاف أحجام الفئات.
كجزء من تحليل إحصائي إضافي، تم حساب درجة F2، مع إعطاء الأولوية للاسترجاع، كما هو موضح في المعادلة 20.

كما تم قياس أداء النموذج باستخدام متوسط التربيع للخطأ (MSE)، ومتوسط المربع الجذري (RMSE)، ومتوسط الخطأ المطلق (MAE) - والتي عادة ما تكون قياسات لمهام الانحدار لكنها معدلة هنا لمهمة التصنيف لقياس حجم الخطأ في المتوسط دون اعتبار الاتجاه.
لتحديد ما إذا كان من العملي دمج ViTs داخل أجهزة الرعاية الصحية التي تركز على المستهلك، أجرينا نتائج تقييم أداء شاملة تركز فقط على الكفاءة الزمنية للنموذج. أنشأنا وظائف للإبلاغ عن الوقت المستغرق للتنبؤ بصورة واحدة أو فقط عدة صور، حيث يصبح ذلك ذا صلة خاصة بالتطبيقات اللحظية. لكل صورة، قبل بدء التنبؤ، تتم معالجة البيانات مسبقا لتكون في شكل الصورة المدخلة التي يريدها النموذج. سجلنا وقت بدء التنبؤ والوقت الذي اكتمل فيه للحصول على نتائج الزمن والكمون. تم حساب الوقت ومتوسط الكمون باستخدام المعادلة 21 والمعادلة 22 على التوالي.


أين:
- N هو عدد الصور (العينات).
- الميل هو الوقت المسجل بعد التنبؤ بالصورة من الرقم i.
- Tstart هو الوقت المسجل قبل التنبؤ بالصورة الثانوية (i-th).
أجريت تجارب إضافية لتقييم متانة نموذج محول الرؤية الذي اقترحناه من خلال إدخال ضوضاء إضافية وضبابية بشكل منهجي إلى الصور. تمت إضافة ضوضاء غاوسية لكل بكسل بعامل ضوضاء 0.4 مع قص قيم البكسلات في نطاق [0,1]. تم تقليل عامل الضبابية عبر الضباب الغاوسي بحجم نواة 45× 45. تم تصميم هذه التجارب لتقييم النموذج بشكل شامل تحت تدهور جودة الصورة الإدراكي المحاكى.