يتطلب اشتراك JoVE لعرض هذا المحتوى. تسجيل الدخول أو ابدأ نسخة تجريبية مجانية

مقالة بحثية

توليد تسمية الصورة باستخدام أساليب التعلم العميق

155 مشاهدات

DOI:

10.3791/71528

يونيو 12, 2026

في هذه المقالة

ملخص

يستخدم هذا البروتوكول شبكات CNN وRNNs وResNets لترجمة الصور، واستخراج أوصاف أنشطة الصور، والأشخاص، والأشياء، والعناصر الأخرى. وقد تم تبرير ذلك بدرجات BLUE وCIDEr وMETEOR وROUGE.

الملخص

توليد تعليق الصور هو محاولة لتقديم وصف نصي ذي معنى يتضمن صورة. المعلومات المستخرجة ذات صلة بالأنشطة الموجودة في الصور. تشتهر شبكة ResNet (Residual Network) بقدرته على تصنيف الصور، حيث طورت تمثيلات هرمية عميقة. تهدف هذه الورقة إلى استخدام ResNet مع عدة مرشحات ذكية لتصنيف الصور بشكل أعمق، مما يمكن من توليد أوصاف حقيقية وذات معنى دقيقة للغاية بالنسبة للتعليقات المرجعية. هنا، يستخدم العمل تقنية تصفية ذكية لتحسين الصور، وشبكة CNN لترميز الميزات، وتدريب النماذج، ثم شبكة عصبية متكررة (RNN) لفك ترميز الميزات. يعد ResNet نموذجا فعالا جدا لمهام رؤية الحاسوب، خاصة تصنيف الكائنات والتحليل الدلالي. تشتهر ريزنت بالاتصالات المتبقية، والتي تعرف أيضا بالاتصالات المتخطية التي تحل مشكلة تدرج الاختفاء، وهي مشكلة حاسمة في التعلم العميق. هنا، يستخدم معيار MSCOCO (كائن مايكروسوفت المشترك في السياق) لتدريب النموذج، وهو مجموعة بيانات كبيرة مع تعليقات مرجعية مفيدة لمهام رؤية الحاسوب المختلفة. يساعد ResNet في تعزيز قدرة التعميم، وهو أمر مفيد بشكل خاص للصور المتنوعة. وفقا للنتائج التي تم الحصول عليها، درجات BLUE هي B1: 0.579، B2: 0.404، B3: 0.279، B4: 0.191؛ النيزك: 0.195; روج: 0.396; وCIDEr: 0.6.

المقدمة

في مجالات الرؤية الحاسوبية ومعالجة اللغة الطبيعية، يعد كتابة الترجمة مهمة حيوية تستخرج وصفا للصورة والإجراءات التي تظهرها. هدف النموذج هو فهم الصور وترجمة المعلومات إلى جمل أو تعليقات ذات معنى1. يتكون الإجراء بأكمله من مرحلتين مهمتين: الأولى هي استخراج الميزات، حيث يستخدم نموذج CNN؛ الثاني هو وصف الصورة باستخدام RNN & بينهما، يستخدم ResNet للتحليل الدلالي، وتوليد التسلسلات، وآلية الانتباه. ResNet يختلف كثيرا عن الطرق المعتمدة على القوالب أو الوحدات المبنية على DenseNet لأنه يستخدم اتصالات تخطي تقلل من وقت التنفيذ مع تحسين الأداء. هناك العديد من تطبيقات الترجمة التوضيحية للصور التي تشمل مساعدة الأشخاص ضعاف البصر، وتعزيز منصات التواصل الاجتماعي، ....

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

البروتوكول

تم تنفيذ النموذج الرئيسي وهو ResNet-152، مع مشفر كCNN، وفك ترميز ك RNN، وموارد جدول المواد.

ريزنت-152
يعتبر ResNet العمود الفقري لاستخراج الميزات بشكل أكثر كفاءة في ترجمة الصور. قدم ريزنت أداء تدريبيا أفضل من النماذج الأخرى، حيث عالج مشكلة التدرج الاختفائي وحلها بكفاءة. قد تظهر أشياء مختلفة في الصور، ويحتاج النموذج إلى فهم علاقاتها لتحسين الترجمة. لهذا السبب يمكن اعتباره استخراجا هرميا للميزات. يمكن ل ResNet-152 التعامل مع مهام رؤية الحاسوب المعقدة. الميزة الرئيسية لهذا النموذج هي الاستخدام الفعال للاتصالات المتبقية أو التخطي. وهو فعال للغاية في معالجة مشكلة تدرج التدرج المتلاشي. يمكنه تعلم ميزات معقدة و....

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

النتائج

مواصفات البرمجيات والبيئة
كانت بايثون 3.10 هي لغة البرمجة الرئيسية المستخدمة في التجارب. تم استخدام كود فيجوال ستوديو لإعداد بيئة التطوير (VS Code). تشمل المكتبات المهمة المستخدمة في هذا البحث Pickle لتسلسل البيانات، والمعالجة المتعددة للمعالجة المتوازية، وGlob لمعالجة الملفات، وPyTorch لتطوير نماذج التعلم العميق. تضمن تكوين الأجهزة 256 جيجابايت من التخزين، و8 جيجابايت من الذاكرة، وبطاقة رسومات من سلسلة NVIDIA GTX مع دعم CUDA للحوسبة السريعة. تم استخدام حاسوب يعمل إما بمعالج AMD Ryzen 5000 أو معالج In.......

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المناقشة

في مجال الذكاء الاصطناعي، يعد كتابة الصور مهمة صعبة. لقد كانت ترجمة الصور موضوعا للعديد من الدراسات، ولا تزال الترجمة الحادة أو الدقيقة تتطلب أعلى مستوى من الدقة. يمكن استخدام العديد من تقنيات تعلم الآلة لتحقيق هدف الترجمة التوضيحية للصور، وقد استخدمت العديد من الدراسات CNN وRNN وResNet-152. ومع ذلك، فإن زيادة الدقة وتقليل وقت المعالجة ضرورية. النظام المقترح مبني باستخدام CNN كمشفر، وRNN كجهاز فك الترميز، وTorch Vision كمكتبة، وResNet كنموذج تدريب أساسي. يستخدم ResNet تقنية تخطي الاتصال .......

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

يعلن المؤلفون أنه لا توجد مصالح مالية متنافسة أو علاقات شخصية قد تكون أثرت على العمل المبلغ عنه في هذه الورقة.

شكر وتقدير

نشكر مبتكري مجموعات بيانات MSCOCO على توفير المعايير المستخدمة في هذه الدراسة. يعلن المؤلفون أنه لم يتم تلقي أي تمويل خارجي لهذه الدراسة.

....

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
AMD Ryzen 5000 seriesAMD100-100000059WOFسلسلة AMD Ryzen 5000 هي مجموعة من المعالجات عالية الأداء التي طورتها AMD، وتستند إلى بنية Zen 3. تُستخدم هذه المعالجات على نطاق واسع في أجهزة الكمبيوتر المكتبية والمحمولة لكل من الحوسبة العامة والمهام المتطلبة مثل معالجة البيانات وورش عمل التعلم الآلي.
GPUNVIDIA 4.71933E+12NVIDIA GeForce GTX هي سلسلة من وحدات معالجة الرسومات (GPUs) التي طورتها NVIDIA، وتستخدم على نطاق واسع للألعاب وكذلك مهام الحوسبة العامة مثل التعلم العميق ومعالجة الصور.
Intel Core i5IntelBX8071514400FIntel Core i5 هي سلسلة معالجات متوسطة المدى طورتها Intel، وتستخدم على نطاق واسع في أجهزة الكمبيوتر الشخصية لكل من المهام العامة والحسابية.
Python 3.10Python Software FoundationPEP 619Python هي لغة برمجة تفسيرية عالية المستوى تستخدم على نطاق واسع في الحوسبة العلمية، وتحليل البيانات، والتعلم الآلي. وهي معروفة ببساطتها، وقابليتها للقراءة، والنظام البيئي الشامل من المكتبات.
PyTorchFacebook26.03-py3PyTorch هو إطار عمل تعلم عميق مفتوح المصدر طورته Meta Platforms (سابقًا Facebook)، ويستخدم على نطاق واسع لبناء وتدريب الشبكات العصبية في البحث والصناعة.
Visual Studio CodeMicrosoftNoneVisual Studio Code (VS Code) هو محرر كود خفيف الوزن ومفتوح المصدر طورته Microsoft. ويستخدم على نطاق واسع لتطوير البرمجيات، بما في ذلك مشاريع التعلم الآلي والتعلم العميق.
Windows 11MicrosoftKB5083631Windows 11 هو نظام تشغيل طورته Microsoft، ويستخدم على نطاق واسع للحوسبة العامة وكذلك مهام تطوير البرمجيات والتعلم الآلي.

إعادة الطباعة والأذونات

الوسوم

ResNet CNN RNN MSCOCO