يتطلب اشتراك JoVE لعرض هذا المحتوى. تسجيل الدخول أو ابدأ نسخة تجريبية مجانية

مقالة منهجية

تصنيف نصوص التوظيف على مرحلتين عبر التوجيه الموجه بالمعجم ونماذج اللغة الكبيرة المعززة بالاسترجاع

136 مشاهدات

DOI:

10.3791/70153

مايو 8, 2026

في هذه المقالة

ملخص

يتم وصف سير عمل من مرحلتين لتصنيف نصوص التوظيف إلى ذكاء اصطناعي، حماية البيئة، أو غيرها. يقوم الفرز الموجه بالمعجم بتعيين الحالات الروتينية، بينما يقوم الاستنتاج الكبير المحسن بالإرجاع والمحسن بالإعجاب بحل الحالات الغامضة، مما يتيح تصنيفا دقيقا واسع النطاق وتلخيص سوق العمل الوصفي لاحقا.

الملخص

نصوص التوظيف غير متجانسة، وتتغير مصطلحات المجال مع مرور الوقت، مما يجعل وضع العلامات على نطاق واسع صعبا مع قدرة محدودة على التعليق اليدوي. يوفر هذا البروتوكول سير عمل من مرحلتين قابل للتكرار لتصنيف نصوص التجنيد الصيني إلى الذكاء الاصطناعي، حماية البيئة، أو غيرها. المرحلة الأولى تقوم بفرز موجه بالمعجم باستخدام قائمتين مفتاحيتين منسقاتين للنطاق. المنشورات التي تتطابق فقط مع معجم نطاق واحد يتم تسميتها مباشرة. المنشورات التي لا تتطابق مع أي من المعجمين تصنف كأخرى، بينما يتم توجيه منشورات المطابقتين إلى المرحلة الثانية. المرحلة الثانية تطبق استنتاج نموذج اللغة الكبير المعزز بالاسترجاع. يتم تحويل قاعدة معرفة مجمعة من 12 وثيقة نطاق موثوق إلى نص، وتنقسم إلى أجزاء من حوالي 1000 حرف مع تداخل من 20 حرفا، وتدمج باستخدام MiniLM-L6-v2 بالكامل، ومفهرسة في LanceDB. لكل نشر غير مؤكد، يعيد استرجاع k-أقرب جار بتشابه جيب تمام القطع المرشحة المصفاة بحد أدنى للتشابه (τ)، ويتم حقن ما يصل إلى أربع قطع في قالب موجه ثابت يحدد حدود التسمية ويقيد الناتج على تسمية واحدة. يتم التحقق يدويا من مجموعة مرجعية مكونة من 3,000 منشور، مع 1,000 منشور لكل فئة، وتحقق اتفاقية بين المعلقين بنسبة 95.0٪ وكابا كوهين (κ) حوالي 0.93. يقارن التقييم عدة نماذج لغوية كبيرة مفتوحة المصدر عبر إعداد مخصص فقط للمطالبات وإعداد معزز بالاسترجاع باستخدام Qwen2.5-7B-Instruct. يحقق التكوين المعزز بالاسترجاع دقة 98.47٪ ويدعم تصنيف المدرج على مقياس المجموعات لحوالي 6.93 مليون منشور للتجميع الوصفي في مرحلة لاحقة.

المقدمة

في السنوات الأخيرة، ومع التطور السريع للذكاء الاصطناعي والتقنيات البيئية، ظهرت العديد من المهن الناشئة. من ناحية، سوق العمل العالمي مليء بالعديد من الوظائف الجديدة التي تعتمد على الذكاء الاصطناعي والاستدامة. توثق الأدلة القائمة على الشواغر التوسع السريع في الطلب على المهارات المتعلقة بالذكاء الاصطناعي، مما يزيد من تنوع نصوص التوظيف ويحفز بروتوكول وسم المجالات القابل للتكراروالتوسع 1. من ناحية أخرى، شهدت المراجعة الأخيرة في الصين لقاموس تصنيف المهن (OCD) نموا قويا مماثلا في المهن الجديدة في مجالات الإبلاغ التوظيفي والزراعة الخضراء ومنخفضة الكربون، مع زيادة صافية قدرها 158 مهنة جديدة في مراجعة 2022 مقارنة بإصدار 2015 من القاموس، بإجمالي 97 مهنة رقمية. أو 6٪ من إجمالي عدد المهن، مع 134 مهنة خضراء، أو 8٪ من إجمالي عدد المهن.

مع استمرار ظهور هذه المهن الجديدة، أصبح محتوى وشكل إعلانات الوظائف من قبل الشركات أكثر تعقيدا، حيث تتضمن أوصاف الوظائف غالبا معرفة موضوعية ومتطلبات مهارات متنوعة، وتشمل مجالات منظمة مثل المسميات الوظيفية وقوائم المهارات، بالإضافة إلى عدد كبير من الوصف الحر غير المنظم، مما يؤدي إلى هياكل إعلانات الوظائف المعقدة بشكل متزايد. عادة ما تحتوي هذه الإعلانات المعقدة على عناصر منظمة واضحة (مثل المسميات الوظيفية، قوائم المهارات المطلوبة) إلى جانب أوصاف واسعة غير منظمة للنصوص الحرة. على سبيل المثال، قد يدرج إعلان وظيفة مهندس ذكاء اصطناعي مصطلحات تقنية مثل 'الكفاءة في إطار التعلم العميق' و'الخبرة في تحسين خوارزميات الانتشار العكسي' كجزء من قائمة المهارات، مع تضمين سرد مفصل للمسؤوليات؛ وبالمثل، قد يشير إعلان مهندس بيئي إلى معايير تنظيمية وشهادات محددة. هذا المزيج من المحتوى المنظم وغير المنظم يؤدي إلى أوصاف وظائف متخصصة ومعقدة للغاية.

يتم اختيار الذكاء الاصطناعي وحماية البيئة لتقييم البروتوكول ضمن غموض واقعي عبر المجالات في تصنيف التوظيف. في الواقع، تحدد الموارد المهنية الرئيسية مثل O*NET ولوحات الوظائف علامات خشنة، مما يجعل من الصعب التمييز بين الأدوار عبر الصناعات باستخدام الكلمات المفتاحية فقط. تمثل حماية البيئة مجالا واسعا يتداخل مع عدة مجالات علمية، بينما يعكس الذكاء الاصطناعي شريحة أدق في الحوسبة غالبا ما يتم الخلط بينها وأدوار البرمجيات العامة. يلتقط هذا الاقتران بيئات واسعة وضيقة عبر المجالات مع مصطلحات مميزة ووثائق موثوقة مناسبة لبناء قاعدة المعرفة، مع السماح بالتكيف مع صناعات أخرى من خلال استبدال مجموعة المجالات دون تغيير سير العمل الأساسي.

شهدت السنوات الأخيرة زيادة في الأبحاث حول تصنيف إعلانات الوظائف. يستفيد الباحثون بشكل متزايد من النماذج الكبيرة المدربة مسبقا لتحسين تصنيف المهن. شكل تقديم BERT في عام 2019 اختراقا مكن من فهم اللغة بعمق في السياق وحسن أداء تصنيف النصوصبشكل كبير. على سبيل المثال، استكشف كلافي وآخرون (2023) استخدام نموذج لغوي كبير مضبوط بالتعليمات (LLM) لتصنيف الوظائف، ووجدوا أن هندسة التوجيه المناسبة مكنت النموذج من التفوق على النماذج الخاضعة للإشراف الحديثة في مهمة تصنيف الوظائفللخريجين 4. وبالمثل، اقترح لي وآخرون (2023) نهجا لوظائف LLM4 يجمع بين تلخيص نماذج اللغة الكبيرة ومطابقة رموز الوظائف، مما يحسن بشكل كبير دقة التصنيف في أوصاف الوظائف الطويلة من خلال استخراج الملخصات أولا ثم محاذاتها مع رموز الوظائف القياسية5. بالإضافة إلى ذلك، يوثق استطلاع أجرته سينجر وآخرون عام 2024 التطورات الحديثة في التعلم العميق للموارد البشرية، مشيرا إلى أن استخراج المهارات وتصنيف الوظائف أصبحا مهام أساسية في تحليل سوق العمل الحاسوبي6. عزز كافاس وآخرون (2024) تصنيف إعلانات الوظائف من خلال دمج تضمين النصوص متعددة اللغات مع التصنيف القائم على نماذج اللغة الكبيرة (LLM)، محققين مكاسب ملحوظة في الدقة7. على الصعيد التقليدي، تراوحت الأنظمة السابقة من القواعد القائمة على الكلمات المفتاحية مع مجموعات فئات خشنة نسبيا إلى أطر عمل قائمة على التصنيف مثل كاروتين، الذي استخدم تسلسلا هرميا لأكثر من 4000 مسمى وظيفي 89. قدم جاويد وآخرون (2016) إطارا مبكرا لتصنيف المسمى الوظيفي، مما شكل واحدة من أولى الخطوات نحو تصنيف الوظائف المنهجي10. ومع ذلك، تتطلب هذه الأساليب الخاضعة للإشراف بيانات موسومة واسعة النطاق وتكافح للتكيف مع ظهور أدوار الوظائف الجديدة السريعة، حيث تتطور تصنيفات التصنيف غالبا بشكل أبطأ من سوق العمل4.

لمعالجة هذه القيود، اتجهت الأعمال الحديثة إلى استراتيجيات هجينة تدمج المعرفة الخارجية؛ على سبيل المثال، قدم لويس وآخرون (2020) إطار عمل التوليد المعزز بالاسترجاع (RAG)، الذي يجمع بين نماذج لغوية مدربة مسبقا مع جهاز استرجاع لحقن المعرفة ذات الصلة، محققا دقة أعلى ومخرجات أكثر واقعية في المهام المكثفةللمعرفة 11. أظهر ليستر وآخرون أن الضبط الفوري يؤدي إلى مكاسب أداء أكبر مع زيادة حجم النموذج12، مما يعزز استخدام نموذج قاعدة كبيرة قوي. على سبيل المثال، أظهر هان وآخرون أن استخدام المحفزات الموجهة بالقواعد يمكن أن يعزز دقة تصنيف النصوص من خلال تركيز النموذج على الميزات الرئيسية13. علاوة على ذلك، أظهر براون وآخرون (2020) بشكل شهير أن نموذج لغوي كبير يمكنه أداء مهام جديدة من خلال عدد قليل من الأمثلة أو التعليمات فقط، مما يبرز قوة التعلم المحدود المدفوع بالمحفزات14. ومن الجدير بالذكر أن استطلاعا حديثا لتقنيات معالجة اللغة الطبيعية المعتمدة على الأوامر يؤكد أن صياغة التعليمات يمكن أن ترفع بشكل كبير نتائج النماذج15. وفي الوقت نفسه، تعزز التحولات على المستوى الكلي وعدم اليقين في سوق العمل الحاجة إلى بروتوكولات تصنيف قابلة للتوسع وسهلة التحديث يمكن تحديثها مع ظهور أدوار جديدة.16. في مجال معالجة اللغة الطبيعية في سوق العمل، تم استكشاف التدريب المسبق متعدد اللغات المعتمد على التصنيف لمواءمة التمثيلات بشكل أفضل مع الهياكل المهنية والتباين عبر اللغات17. مجتمعة، تساعد هذه الدراسات في توجيه النهج وتظهر إمكانات استخدام نماذج لغوية كبيرة مع تحسين الاسترجاع وتحسين السرعات للتعرف بشكل أكثر فعالية على سياقات الوظائف الناشئة والتكيف معها.

في هذه الدراسة، يتم اختيار معرفة المجال فقط للذكاء الاصطناعي وحماية البيئة، حيث تمثل بناء المجموعة والتحقق والصيانة التكاليف التشغيلية الأساسية لتصنيف التوظيف عبر المجالات. وبناء عليه، فإن "أخرى" تعمل كفئة رفض خارج النطاق بدلا من كونها فئة صناعية جوهرية. يجب تفسير الدقة العالية المبلغ عنها بحذر، حيث أن إعداد الثلاثة تسميات يبسط وضع العلامات وقد يزيد الأداء مقارنة بالتصنيفات الدقيقة الدقيقة. يقصد البروتوكول أن يكون طبقة وسم خفيفة الوزن قائمة على المعرفة للمجالات المستهدفة، وليس كبديل لأنظمة التصنيف متعددة الفئات الشاملة. قد يؤدي توسيع مجموعة الملصقات إلى تقليل الدقة بسبب زيادة التداخل، والغموض، ومتطلبات تغطية الكوربوس الأكثر صرامة. في الواقع، يمكن تحسين مجموعة الرفض تدريجيا من خلال توسيع مجموعة المجالات ودمج قواعد المعرفة الداخلية. لذا، يظهر تكوين الثلاثة تسميات نموذجا قابلا لإعادة الاستخدام بدلا من تصنيف مهني شامل.

تجمع مجموعة البيانات بين المصادر المهيكلة وغير المهيكلة. تم جمع وتنسيق المجموعة المنظمة من قبل المؤلفين من إعلانات الوظائف التي نشرتها شركات مدرجة علنا على منصات التوظيف الإلكترونية الكبرى في الصين بين عامي 2014 و2023. بعد إزالة التكرار والتنظيف الأساسي، تحتوي المجموعة المنظمة على حوالي 6.93 مليون إعلان. تم استخدام وثائق النطاق غير المنظمة التي أصدرتها السلطات المختصة لتعريف معرفة المجال ومعايير التصنيف. من هذه المصادر، تم إنشاء ثلاث مجموعات فرعية مرجعية يدويا، تحتوي كل منها على 1000 منشور للذكاء الاصطناعي وحماية البيئة والمجالات غير ذات الصلة على التوالي، وتم التحقق منها للتقييم.

يتم تقييم أعمدة النماذج باستخدام الدقة، والدقة، والاسترجاع، وF1 (المتوسط التوافقي للدقة والاسترجاع، F1 = 2PR/(P+R)) لاختيار الأساس الأمثل لسير العمل المعزز بالاسترجاع. يتم تجميع مستندات النطاق الموثوق في قاعدة معرفة لتوليد الاسترجاع المعزز (RAG). يتم استرجاع المقاطع ذات الصلة وحقنها في قالب مطالبة ثابت لدعم التصنيف. يتم اختبار متغيرات الأوامر بشكل منهجي، ويتم تطبيق استراتيجية تحسين كلمة إشارة لتحديد التكوين النهائي. يتم تصفية الأدلة المسترجعة لتناسب ملاءمتها لتقليل الضوضاء ودعم الاستنتاج الدقيق والفعال.

لتمكين التصنيف واسع النطاق، يعتمد سير العمل خط أنابيب مرحلي: الفرز الموجه بالمعجم يحل الحالات الروتينية بكفاءة، بينما يستنتاج نماذج اللغة الكبيرة المدعوم بالاسترجاع والمحسن بالفورات يتعامل مع المنشورات الغامضة، ويوازن بين قابلية التوسع والدقة (الشكل 1).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

البروتوكول

لم تشمل هذه الدراسة مشاركين بشريين أو مواضيع حيوانية. لذلك، لم تكن الموافقة الأخلاقية والموافقة المستنيرة مطلوبة. تم تنفيذ سير العمل في بيئة بايثون 3.10 على نظام تشغيل ويندوز 64-بت باستخدام الأجهزة والأدوات والبرمجيات المدرجة في جدول المواد.

1. النمذجة

  1. بناء قاعدة البيانات والمعرفة
    1. جمع وتنظيم مجموعة إعلانات الوظائف المنظمة الداخلية للشركات المدرجة في البورصة من كبرى منصات التوظيف عبر الإنترنت في الصين (2014–2023)، لضمان الامتثال لسياسات المنصة واللوائح المعمول بها. لكل إعلان، سجل المسمى الوظيفي، ووصف الوظيفة، واسم الشركة، وتاريخ النشر، والمعرف الفريد (مثل معرف الإعلان أو الرابط إذا كان متاحا). قم بإزالة المكررات والسجلات غير الصالحة، وتحقق من أن المجموعة النهائية تحتوي على حوالي 6.93 مليون سجل.
    2. جمع الوثائق المتعلقة بمجال الصلاحيات المتعلقة بالذكاء الاصطناعي وحماية البيئة، بما في ذلك الوثائق المدرجة في الملف التكميلي 1. تأكد من أن الوثائق تحدد الكفاءات، ومعايير التأهيل، ونطاق المهام، أو الإجراءات المنظمة.
  2. بناء مجموعة بيانات المعيار
    1. فحص مجموعة البيانات المنظمة يدويا. اختر الوظائف، التي تمثل بوضوح الذكاء الاصطناعي، وحماية البيئة، والمجالات غير ذات الصلة. أدرج الحالات الحدية لتحسين التغطية.
    2. قم بتصنيف كل إعلان باستخدام المسمى الوظيفي، ووصف الوظيفة، ومعلومات صاحب العمل.
    3. قم بإنشاء ثلاث مجموعات فرعية مرجعية تحتوي على 1,000 إعلان لكل منها للذكاء الاصطناعي، وحماية البيئة، وأخرى.
    4. قم بإجراء تعليق مزدوج. خصص معلقا واحدا لتسمية كل منشور ومعلق ثان للتحقق من التسمية باستخدام إرشادات مكتوبة.
    5. حل الخلافات من خلال النقاش والفصل من قبل معلق ثالث.
    6. حساب اتفاقية بين التعليقات. سجل نسبة الاتفاق وκ.
    7. حافظ على مجموعة بيانات المعيار المعتمد لتقييم النموذج.
  3. تقييم العمود الفقري للنماذج
    1. قيم العمود الفقري لنماذج اللغة الكبيرة المضبوطة بالتعليمات باستخدام نفس قالب التوجيه ومجموعة بيانات المعيار.
    2. قم بتعطيل تعزيز الاسترجاع أثناء مقارنة العمود الفقري.
    3. حافظ على صياغة الطلبات، وفك الترميز، وتعيين التسميات متطابقة عبر النماذج.
    4. احسب الدقة العامة، والدقة لكل فئة، والاستدعاء، وF1.
    5. اختر العمود الفقري الأفضل أداء وسجل تكوينه في الجدول 1.
    6. أبلغ عن نتائج التقييم الكاملة في الجدول 2.
  4. أداء تدريب المشفر التكيفي مع المجال
    1. ابن مجموعة غير معنونة باستخدام الوثائق الموثوقة فقط المدرجة في الملف التكميلي 1.
    2. استخرج نصا عاديا من جميع المستندات.
    3. قسم النص إلى تسلسلات بطول أقصى 512 وخطوة 492.
    4. تخلص من المقاطع التي تقل عن 50 حرفا.
    5. تأكد من استبعاد الإعلانات المعيارية من هذا المجموعة.
    6. قم بتهيئة نقاط تفتيش قاعدة BERT الصينية.
    7. قم بإجراء تدريب مسبق على نموذج اللغة المقنعة مع احتمال الإخفاء 0.15.
    8. تدرب لمدة 3 فترات باستخدام AdamW مع معدل تعلم 5e-5 وحجم دفعة 2.
    9. احفظ نقطة التفتيش المدربة مسبقا.
    10. قم بضبط المشفر لتصنيف الثلاث فئات باستخدام معدل تعلم من 2e-5، وحجم دفعة 2، وطول تسلسل أقصى 512.
    11. ثبت البذرة العشوائية إلى 42 وطبق تقسيم التحقق الطبقي من القطارات.
    12. دقة التقارير، الدقة المتوسطة الكبيرة، الاستدعاء المتوسط الكلي، متوسط F1 الكبير، مقاييس لكل فئة، ومصفوفة الالتباس.
    13. احفظ مخرجات التقييم للتحقق.
  5. بناء خط أنابيب التصنيف المعزز بالاسترجاع
    1. ابن قاعدة المعرفة
      1. اجمع 12 نطاقا موثوقا.
      2. قم بإزالة النسخ المكررة أو القديمة.
      3. حول المستندات إلى نص عادي.
      4. سجل بيانات الوثائق الوصفية، بما في ذلك المصدر وسنة النشر.
      5. قسم النص إلى أجزاء من حوالي 1000 حرف مع تداخل 20 حرفا.
      6. سجل العدد الكلي للقطع وتوزيع طول القطع.
        ملاحظة: أعد التحقق من أداء الاسترجاع إذا تم توسيع قاعدة المعرفة.
    2. ترميز وتخزين التضمينات
      1. ترميز جميع الأجزاء باستخدام نموذج التضمين وتخزين التضمينات في قاعدة بيانات المتجه.
      2. معرفات قطع الأرشيف وبيانات المصدر الوصفية.
      3. تحقق من أن عدد المتجهات المخزنة يتطابق مع عدد القطع.
    3. قم بالاسترجاع.
      1. قم بتضمين كل إعلان وظيفة باستخدام نفس نموذج التضمين.
      2. قم بإجراء بحث k-أقرب جار باستخدام تشابه جيب تمام.
      3. تطبيق عتبة التشابه τ لتصفية التطابقات منخفضة الصلة.
      4. أصلح τ و top-κ بعد ضبط مجموعة فرعية مثبتة.
      5. تم استرجاع السجلات معرفات القطع ودرجات التشابه.
    4. قم بالاستدلال المعزز بالاسترجاع
      1. أدرج حتى أربع قطع تم استرجاعها في قسم الأدلة في قالب التوجيه (الملف التكميلي 2).
      2. قم بربط نص إعلان الوظيفة مع الأدلة المسترجعة.
      3. توليد التسمية النهائية ذات الثلاث فئات باستخدام نموذج اللغة الكبير المختار.
      4. احفظ سجلات الاسترجاع، والمحفزات، ومخرجات النماذج.
  6. إجراء الفرز الموجه بالمعجم
    1. بناء معجم الكلمات المفتاحية
      1. قم بجمع معجمين للكلمات المفتاحية: واحد للذكاء الاصطناعي وواحد لحماية البيئة (الملف التكميلي 3).
      2. استخرج مصطلحات المرشحين من إعلانات الوظائف والوثائق الرسمية.
      3. قم بترميز النص باستخدام مكتبة الترميز المحددة.
      4. احسب إحصائيات تكرار المصطلحات وتباين المجال وأزل المصطلحات الغامضة أو العامة بشكل مفرط.
      5. أنهي وأرشفة المعجميات.
    2. إعلانات المسارات
      1. طبق مطابقة دقيقة على مستوى السلسلة والرمز.
      2. الإعلانات التي تحتوي فقط على كلمات مفتاحية للذكاء الاصطناعي إلى فرع الذكاء الاصطناعي.
      3. إعلانات المسارات التي تحتوي فقط على كلمات مفتاحية لحماية البيئة لفرع حماية البيئة.
      4. صنف المنشورات غير المتطابقة كأخرى.
      5. وجه الإعلانات المزدوجة إلى خطوة الاسترجاع المعززة.
      6. سجل إحصائيات التوجيه ونسخ المعجم.
    3. تصنيف المنشورات الغامضة
      1. استرجع الأجزاء ذات الصلة تحت إعدادات ثابتة علوية κ و τ.
      2. حقن الأدلة المسترجعة في قالب الطلب.
      3. قم بإنشاء التسمية النهائية وحفظ سجلات كل حالة.

2. إعادة تصنيف النتائج

  1. بناء قاموس المرادفات
    1. قم بإنشاء قاموس مرادفات لمصطلحات الذكاء الاصطناعي (الملف التكميلي 4). يشمل مصطلحات من تعلم الآلة، ومعالجة اللغة الطبيعية، ورؤية الحاسوب، والروبوتات، والمجالات الفرعية ذات الصلة. نظم مصطلحات مفصلة تحت كل فئة.
    2. ابن معجمة منفصلة لمصطلحات حماية البيئة. تشمل أساسيات العلوم البيئية، المراقبة والتحليل البيئي، التحكم في التلوث وإدارته، والتخطيط والإدارة البيئية.
    3. أضف جميع مصطلحات الذكاء الاصطناعي وحماية البيئة إلى قاموس الترميز. تأكد من أن هذه المصطلحات معترف بها كوحدات كاملة أثناء تقسيم النصوص.
  2. النص المسبق للمعالجة
    1. قم بإزالة علامات الترقيم والأحرف الخاصة باستخدام التعبيرات المنتظمة. احتفظ فقط بالنص والمسافات.
    2. قم بتقسيم الكلمات لتقسيم النص المستمر إلى رموز فردية.
  3. إجراء مطابقة وتصنيف الميزات
    1. قم بمعالجة نص الإدخال مسبقا للحصول على قائمة بالرموز المقسمة.
    2. اختر القاموس المناسب وفقا للتصنيف الأولي.
    3. امسح الرموز المقسمة وقم بمطابقة دقيقة مع مصطلحات القاموس بعد التطبيع. طبق الشكل الصغير ووحيد المتغيرات المحددة مسبقا قبل المطابقة.
    4. سجل كل مصطلح مطابقة وفرع القاموس المقابل له.
      ملاحظة: إذا تطابقت عدة فروع، حل التعادل باستخدام قاعدة ثابتة (مثل أعلى عدد مطابقة يليه أقدم حدوث).
    5. تصدير قائمة الشروط المتطابقة والعلامة النهائية داخل النطاق للتجميع في المراحل النهائية.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

النتائج

أربعة نماذج لغوية كبيرة مفتوحة المصدر مضبوطة حسب التعليمات (Backbone A–D) مدرجة في جدول المواد يتم تقييمها على مهمة تصنيف الوظائف ذات الثلاث فئات. يتم إجراء التقييم باستخدام نفس بروتوكول الاختبار، وإجراءات المعالجة المسبقة، والمقاييس عبر جميع الركائز، بما في ذلك الدقة العامة، والدقة، والاستدعاء، وF1. يتم تطبيق التنقيح الفوري والتوليد المعزز بالسحب (RAG) لاحقا على العمود الفقري B وإعادة تقييمه تحت ظروف متطابقة. تلخص نتائج الأداء في الجدول 2.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المناقشة

وقد طبقت الأعمال السابقة تعلم الآلة والنماذج العصبية الكلاسيكية على تصنيف نصوص التوظيف، بما في ذلك تصنيف السيرة الذاتية ووصف الوظيفة، لكن هذه الأساليب غالبا ما تتطلب بيانات معنونة كبيرة وقد تتدهور عند تغير مصطلحات المجال. اقترح علي وآخرون نظام تصنيف السيرة الذاتية باستخدام معالجة اللغة الطبيعية وتقنيات التعلم الآلي18. استكشف جليلي وآخرون تصنيف السيرة الذاتية المبنية على BiLSTM19. قام بال وآخرون بتقييم تصنيف السيرة الذاتية باستخدام طرق تعلم ...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

المؤلفون ليس لديهم ما يكشفون عنه.

شكر وتقدير

يشكر المؤلفون زملاءهم على الدعم الفني والتغذية الراجعة البناءة أثناء تنسيق البيانات وإعداد المخطوطات. لم يحصل هذا المشروع على تمويل خارجي.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
All-MiniLM-L6-v2 (مشفر جمل)وجه العناق (محولات الجمل)https://huggingface.co/sentence-transformers/all-MiniLM-L6-v2نموذج تضمين الجمل المستخدم في التوجيه.
بيرت-بيس-صينية (مشفر الأساس)وجه العناق (جوجل-بيرت)https://huggingface.co/google-bert/bert-base-chineseمشفر القاعدة (قاعدة BERT الصينية).
ذاكرة DDR5، 16 جيجابايتتكوين محطة العمل/اللابتوبلا يوجدذاكرة النظام (16 جيجابايت DDR5)؛ رقم البائع/القطعة غير محدد.
ديب سيك-آر1-ديستيل-كوين-7بي (العمود الفقري أ)وجه العناق (deepseek-ai)https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-7Bالماجستير الأساسي للديانة العمود الفقري أ.
GLM-4-9B-Chat (العمود الفقري C)وجه العناق (زاي-أورغ)https://huggingface.co/zai-org/glm-4-9b-chat-hfالعمود الفقري لماجستير القانون C.
معالج Intel Core i5-13500HXإنتلhttps://www.intel.com/content/www/us/en/products/sku/232156/intel-core-i513500hx-processor-24m-cache-up-to-4-70-ghz/specifications.htmlوحدة معالجة مركزية محطة العمل تستخدم في التجارب.
InternLM2.5-7B-Chat (العمود الفقري D)وجه العناق (داخلي)https://huggingface.co/internlm/internlm2_5-7b-chatالماجستير في القانون الأساسي D.
جيبا (رمزي صيني)PyPI (جيبا)https://pypi.org/project/jieba/مكتبة الترميز/التقسيم الصينية؛ النسخة غير محددة.
مكتبات الكلمات المفتاحية (الذكاء الاصطناعي و بيئي) (ملف الملحق 3)هذه الدراسةملف الملحق 3معجم الكلمات المفتاحية في المجال المستخدم في التصفية الموجهة بالمعاجم؛ أرشفة النسخة الدقيقة المستخدمة في كل جولة.
لانس دي بي (قاعدة بيانات متجهة)لانس دي بيلا يوجدقاعدة بيانات متجهة لتخزين/البحث في التضمينات؛ النسخة غير محددة.
بطاقة رسومات لابتوب NVIDIA GeForce RTX 4060 (ذاكرة فيديو 8 جيجابايت)NVIDIAhttps://www.nvidia.com/en-us/geforce/laptops/40-series/تستخدم وحدة معالجة الرسوميات في الاستنتاج/التجارب.
إعلانات وظائف على منصات التوظيف عبر الإنترنت (2014&ndash؛ 2023)منصات التوظيف الصينية الرئيسية (بيانات الويب العامة)لا يوجدإعلانات وظائف منشورة علنا جمعها وجمعها المؤلفون؛ ~6.93 مليون منشور بعد التنظيف.
pip (مثبت حزمة بايثون)باي بالا يوجدتم استخدام مثبت الحزمة لتثبيت التبعيات وتصدير لقطة البيئة باستخدام pip freeze.
تطور قالب الأوامر (ملف الملحق 2)هذه الدراسةملف الملحق 2متغيرات الأوامر المتتالية والمحفز النهائي المستخدم للتقييم.
بايثون 3.10مؤسسة بايثون للبرمجياتلا يوجدمفسر وقت التشغيل (بايثون 3.10)؛ لم يتم تحديد نسخة التحديث.
Qwen2.5-7B-Instruct (العمود الفقري B)وجه العناق (كوين)https://huggingface.co/Qwen/Qwen2.5-7B-Instructالعمود الفقري لماجستير اللغة الكبير B.
أوصاف/فهرس قاعدة معرفية RAG (ملف الملحق 1)هذه الدراسةملف الملحق 1ملاحظات المخطط/الحقل وفهرس المستندات لقاعدة المعرفة المستخدمة في الاستدلال المعزز بالاسترجاع.
قاموس المرادفات (الذكاء الاصطناعي والصندوق) بيئي) (ملف الملحق 4)هذه الدراسةملف الملحق 4قواميس المصطلحات المستخدمة في إعادة التصنيف والتحليل؛ أرشفة النسخة الدقيقة المستخدمة في كل جولة.
ويندوز 11 (64-بت)مايكروسوفتلا يوجدنظام التشغيل (ويندوز 11، 64-بت)؛ البناء/الإصدار غير محدد.

المراجع

  1. Alekseeva, L., et al. The demand for AI skills in the labor market. Labour Economics. 71, 102002(2021).
  2. Ministry updates official dictionary of careers. , Ministry of Human Resources and Social Security of the People’s Republic of China. Available at: https://english.www.gov.cn/statecouncil/ministries/202209/30/content_WS633647bbc6d0a757729e0bb6.html (2022).
  3. BERT: Pre-training of deep bidirectional transformers for language understanding. Devlin, J., Chang, M. W., Lee, K., Toutanova, K. 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (NAACL-HLT), Minneapolis, MN, USA, , 4171-4186 (2019).
  4. Large language models in the workplace: A case study on prompt engineering for job type classification. Clavié, B., et al. 28th International Conference on Applications of Natural Language to Information Systems (NLDB 2023); , Derby, UK, , Springer. Natural Language Processing and Information Systems. Lecture Notes in Computer Science 3-17 (2023).
  5. Li, N., Kang, B., De Bie, T. LLM4Jobs: Unsupervised occupation extraction and standardization leveraging large language models. arXiv. , Available at: https://arxiv.org/abs/2309.09708 (2023).
  6. Deep learning-based computational job market analysis: A survey on skill extraction and classification from job postings. Senger, E., Zhang, M., van der Goot, R., Plank, B. 1st Workshop on Natural Language Processing for Human Resources (NLP4HR 2024), St. Julian’s, Malta, , 1-15 (2024).
  7. Enhancing job posting classification with multilingual embeddings and large language models. Kavas, H., Serra-Vidal, M., Wanner, L. 10th Italian Conference on Computational Linguistics (CLiC-it 2024), Pisa, Italy, , 440-450 (2024).
  8. JobBERT: Understanding job titles through skills. Decorte, J. J., Van Hautte, J., Demeester, T., Develder, C. International Workshop on Fair, Effective and Sustainable Talent Management using Data Science (FEAST 2021) at ECML-PKDD 2021, , (2021).
  9. Carotene: A job title classification system for the online recruitment domain. Javed, F., et al. IEEE First International Conference on Big Data Computing Service and Applications (BigDataService), , 286-293 (2015).
  10. Javed, F., McNair, M., Jacob, F., Zhao, M. Towards a job title classification system. arXiv. , Available at: https://arxiv.org/abs/1606.00917 (2016).
  11. Lewis, P., et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Presented at: Advances in Neural Information Processing Systems. NeurIPS. , (2020).
  12. The power of scale for parameter-efficient prompt tuning. Lester, B., Al-Rfou, R., Constant, N. 2021 Conference on Empirical Methods in Natural Language Processing (EMNLP), , 3045-3059 (2021).
  13. Han, X., et al. PTR: Prompt tuning with rules for text classification. AI Open. 3, 182-192 (2022).
  14. Brown, T. B., et al. Language models are few-shot learners. Presented at: Advances in Neural Information Processing Systems. NeurIPS. , (2020).
  15. Liu, P., et al. predict: A systematic survey of prompting methods in natural language processing. ACM Comput Surv. 55 (9), 195:1-195:35 (2023).
  16. Blue, A. The outlook for 2023 is uncertain, but here’s what we know about the global labour market. World Economic Forum (Agenda). , Available at: https://www.weforum.org/agenda/2023/01/the-outlook-for-2023-is-uncertain-but-here-s-what-we-know-about-the-global-labour-market-davos23 (2023).
  17. ESCOXLM-R: Multilingual taxonomy-driven pre-training for the job market domain. Zhang, M., van der Goot, R., Plank, B. 61st Annual Meeting of the Association for Computational Linguistics (ACL 2023), Toronto, Canada, , 11871-11890 (2023).
  18. Ali, I., et al. Resume classification system using natural language processing and machine learning techniques. Mehran Univ Res J Eng Technol. 41 (1), 65-79 (2022).
  19. BiLSTM for resume classification. Jalili, A., Tabrizchi, H., Razmara, J., Mosavi, A. 22nd IEEE International Symposium on Applied Machine Intelligence and Informatics (SAMI 2024), Stará Lesná, Slovakia, , (2024).
  20. Pal, R., Shaikh, S., Satpute, S., Bhagwat, S. Resume classification using various machine learning algorithms. ITM Web Conf. 44, 03011(2022).
  21. Convolutional neural network with word embedding based approach for resume classification. Nasser, S., Sreejith, C., Irshad, M. 2018 International Conference on Emerging Trends and Innovations in Engineering and Technological Research (ICETIETR 2018), , Ernakulam (Cochin), India. (2018).
  22. Real-time resume classification system using LinkedIn profile descriptions. Ramraj, S., Sivakumar, V. 2020 International Conference on Computational Intelligence for Smart Power Systems and Sustainable Energy (CISPSSE 2020), Keonjhar, Odisha, India, , (2020).
  23. Heakl, A., et al. ResumeAtlas: Revisiting resume classification with large-scale datasets and large language models. arXiv. , Available at: https://arxiv.org/abs/2406.18125 (2024).
  24. Skondras, P., Zervas, P., Tzimas, G. Generating synthetic resume data with large language models for enhanced job description classification. Future Internet. 15 (11), 363(2023).
  25. Chen, Z. Ethics and discrimination in artificial intelligence-enabled recruitment practices. Humanit Soc Sci Commun. 10, 567(2023).
  26. Retrieval-augmented few-shot text classification. Yu, G., et al. Findings of the Association for Computational Linguistics: EMNLP 2023, Singapore, , 6721-6735 (2023).
  27. Izacard, G., et al. Atlas: Few-shot learning with retrieval augmented language models. J Mach Learn Res. 24 (251), 1-43 (2023).
  28. KW-ATTN: Knowledge infused attention for accurate and interpretable text classification. Jang, H., et al. Deep Learning Inside Out (DeeLIO): 2nd Workshop on Knowledge Extraction and Integration for Deep Learning Architectures, , 96-107 (2021).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

إعادة الطباعة والأذونات

الوسوم