הרשמה ל-JoVE נדרשת לצפייה בתוכן זה. התחברו או התחילו בגרסת ניסיון בחינם.

מאמר שיטה

תיוג טקסט בגיוס דו-שלבי באמצעות ניתוב מונחה לקסיקון ומודלים לשוניים גדולים מוגברים בשחזור

136 צפיות

DOI:

10.3791/70153

8 במאי 2026

במאמר זה

סיכום

תהליך עבודה דו-שלבי מתואר לסיווג ספרי גיוס לבינה מלאכותית, הגנה על הסביבה או אחר. מיון מונחה לקסיקון מקצה מקרים שגרתיים, בעוד שהסקת מודל שפה גדול המוגברת על ידי שליפה ואופטימלית במהירות פותרת מקרים דו-משמעיים, ומאפשרת תיוג מדויק בקנה מידה גדול וסיכום תיאורי בשוק העבודה בהמשך הזרם.

תקציר

טקסטים לגיוס הם הטרוגניים, ומונחי התחום משתנים עם הזמן, מה שמקשה על תיוג בקנה מידה גדול עם יכולת מוגבלת של הערות ידניות. פרוטוקול זה מספק תהליך עבודה דו-שלבי שניתן לשחזר לסיווג טקסטים של גיוס סיני לבינה מלאכותית, הגנה על הסביבה או אחר. השלב הראשון מבצע מיון מונחה לקסיקונים באמצעות שתי רשימות מילות מפתח בדומיין שנבחרו במיוחד. פרסומים התואמים רק לקסיקון דומיין אחד מתויגים ישירות. פרסומים שאינם תואמים אף אחד מהלקסיקונים מסומנים כ'אחר', בעוד שפרסומים של התאמה כפולה מנותבים לשלב השני. השלב השני מיישם הסקת מודל שפה גדול מוגבר בשחזור. בסיס ידע שמורכב מ-12 מסמכי דומיין סמכותיים מומר לטקסט, מחולק לכ-1,000 תווים עם חפיפה של 20 תווים, מוטמע באמצעות כל MiniLM-L6-v2, ומאונדקס ב-LanceDB. לכל פרסום לא ודאי, שליפה של k-nearest-neighbor עם דמיון קוסינוס מחזירה מקטעים מועמדים המסוננים על ידי סף דמיון מינימלי (τ), ועד ארבעה מקטעים מוזרקים לתבנית פרומפט קבועה שמגדירה גבולות תוויות ומגבילה את הפלט לתווית אחת. סט בנצ'מרק של 3,000 פוסטים מאומת ידנית, עם 1,000 פרסומים בכל מחלקה, ומגיע להסכמה בין המפרשים של 95.0% וקאפה של כהן (κ) של כ-0.93. Evaluation משווה בין מספר מודלים גדולים בקוד פתוח לשפה בהגדרה שמונעת רק לבין הגדרה מוגברת באמצעות שליפה באמצעות Qwen2.5-7B-Instruct. הקונפיגורציה המורחבת בשליפה משיגה דיוק של 98.47% ותומכת בתיוג בקנה מידה של כ-6.93 מיליון פוסטים לאגרגציה תיאורית במורד הזרם.

מבוא

בשנים האחרונות, עם ההתפתחות המהירה של בינה מלאכותית וטכנולוגיות סביבתיות, צצו מספר רב של קריירות מתפתחות. מצד אחד, שוק העבודה העולמי מוצף במשרות חדשות רבות המבוססות על בינה מלאכותית וקיימות. ראיות מבוססות משרות פנויות מתעדות התרחבות מהירה בביקוש למיומנויות הקשורות לבינה מלאכותית, מה שמגביר את ההטרוגניות של טקסטי הגיוס ומניע פרוטוקול תיוג דומיין שניתן לשחזורוניתן להרחבה 1. מצד שני, התיקון האחרון של מילון סיווג התעסוקה (OCD) בסין רשם צמיחה דומה במקצועות חדשים בתחומי אינפורמטיזציה תעסוקתית וירוק ודל-פחמן, עם עלייה נטו של 158 מקצועות חדשים בתיקון 2022 לעומת מהדורת 2015 של המילון, עם סך של 97 מקצועות דיגיטליים. או 6% מכלל המקצועות, מסומנים, יחד עם 134 מקצועות ירוקים, או 8% מסך המקצועות2.

ככל שהמקצועות החדשים הללו ממשיכים להופיע, התוכן והצורה של מודעות הדרושים בחברות הופכים למורכבים יותר, כאשר תיאורי המשרות כוללים לעיתים ידע בנושא ודרישות מיומנות מגוונות, הכוללים תחומים מובנים כמו כותרות תפקידים ורשימות מיומנויות, וכן מספר רב של תיאורים חופשיים לא מובנים, מה שמוביל למבני מודעות דרושים מורכבים יותר ויותר. מודעות דרושים מורכבות כאלה בדרך כלל מכילות אלמנטים מובנים מוגדרים (למשל, כותרות משרה, רשימות מיומנויות נדרשות) לצד תיאורים נרחבים ובלתי מובנים בטקסט חופשי. לדוגמה, מודעת משרה למהנדס בינה מלאכותית עשויה לכלול מונחים טכניים כמו 'שליטה במסגרת למידה עמוקה' ו'ניסיון באופטימיזציה של אלגוריתמים לאחור' כחלק מרשימת מיומנויות, תוך הוספת סיפור מפורט של אחריות; באופן דומה, פרסום מהנדס סביבה עשוי להתייחס לסטנדרטים רגולטוריים ותעודות ספציפיות. השילוב הזה של תוכן מובנה ולא מובנה מוביל לתיאורי תפקיד ייחודיים ומסובכים מאוד.

בינה מלאכותית והגנה על הסביבה נבחרות להערכת הפרוטוקול תחת עמימות ריאלית חוצת תחומים בסיווג הגיוס. בפועל, משאבים מקצועיים מרכזיים כמו O*NET ולוחות דרושים מעניקים תגיות גסות, מה שמקשה על הבחנה בין תפקידים בין-תעשייתיים באמצעות מילות מפתח בלבד. הגנת הסביבה מייצגת תחום רחב החופף למספר תחומים מדעיים, בעוד שבינה מלאכותית משקפת חלק מפורט יותר במחשוב שלעיתים מתערבב עם תפקידים כלליים בתוכנה. שילוב זה תופס גם הגדרות רחבות וגם צרות בין תחומים עם מונחים מובחנים ומסמכים סמכותיים מתאימים לבניית בסיס ידע, תוך מתן אפשרות להתאמה לתעשיות אחרות על ידי החלפת קורפוס התחום מבלי לשנות את זרימת העבודה המרכזית.

בשנים האחרונות נרשמה עלייה במחקר על סיווג משרות. חוקרים מנצלים יותר ויותר מודלים גדולים שהוכשרו מראש כדי לשפר את סיווג המקצועות. ההצגה של BERT ב-2019 סימנה פריצת דרך שאפשרה הבנה לשפה בהקשרית עמוקה ושיפרה משמעותית את ביצועי סיווג הטקסט3. לדוגמה, Clavié ואח' (2023) חקרו שימוש במודל שפה גדול (LLM) המותאם להוראות לסיווג משרות, ומצאו כי הנדסת פרומפט נכונה אפשרה למודל להציג ביצועים טובים יותר ממודלים מפוקחים מתקדמים במשימת סיווג משרה4. באופן דומה, Li ואח' (2023) הציעו גישת LLM4Jobs שמשלבת סיכום מודל בשפה גדולה עם התאמת קודי מקצוע, ומשפרת משמעותית את דיוק הסיווג בתיאורי משרות ארוכים על ידי חילוץ סיכומים ואז יישורם לקודי משרה סטנדרטיים5. בנוסף, סקר משנת 2024 של סנגר ואחרים מתעד התקדמות אחרונה בלמידה עמוקה במשאבי אנוש, ומציין כי חילוץ מיומנויות וסיווג משרות הפכו למשימות מרכזיות בניתוח שוק עבודה חישובי6. Kavas ואח' (2024) שיפרו את סיווג מודעות המשרות על ידי שילוב הטמעות-טקסט רב-לשוניות עם סיווג מבוסס LLM, והשיגו שיפורי דיוק משמעותיים7. במישור המסורתי, מערכות מוקדמות נעו מהיוריסטיקות מבוססות מילות מפתח עם קבוצות קטגוריות גסות יחסית למסגרות מונחות טקסונומיה כמו Carotene, שהשתמשה בהיררכיה על פני יותר מ-4,000 תפקידים 8,9. ג'אווד ואח' (2016) הציגו מסגרת סיווג מוקדמת לתפקידים, שסימנה אחד הצעדים הראשונים לסיווג שיטתי של מקצוע10. גישות מפוקחות אלו, עם זאת, דורשות נתונים מתויגים נרחבים ומתקשים להסתגל להופעה המהירה של תפקידים חדשים, שכן טקסונומיות סיווג מתפתחות לעיתים לאט יותר מאשר שוק העבודה4.

כדי להתמודד עם מגבלות אלו, עבודות עדכניות פנו לאסטרטגיות היברידיות המשלבות ידע חיצוני; לדוגמה, לואיס ואח' (2020) הציגו את מסגרת Retrieval-Augmented Generation (RAG), שמשלבת מודלים של שפה מאומנים מראש עם רטריבר כדי להזריק ידע תחומי רלוונטי, ולהשיג דיוק עליון ותוצאות עובדתיות יותר במשימות עתירות ידע11. לסטר ואחרים הראו כי כיוון מהיר מניב שיפור ביצועים גדול יותר ככל שגודל המודל גדלב-12, מה שמחזק את השימוש במודל בסיס חזק. לדוגמה, Han ואחרים הראו ששימוש בהנחיות מונחות כללים יכול לשפר את דיוק סיווג הטקסט על ידי התמקדות המודל בתכונות מפתח13. יתרה מזאת, בראון ואח' (2020) הראו מפורסם שמודל שפה גדול יכול לבצע משימות חדשות רק מכמה דוגמאות או הוראות, מה שמדגיש את כוחו של למידה מונעת הנחיית הנחיית מספר קצר14. ראוי לציין כי סקר עדכני של טכניקות NLP מבוססות הנחיה מדגיש שניסוח בהנחיה יכול להוביל משמעותית את תוצרי המודל15. במקביל, שינויים ברמת המאקרו ואי-ודאות בשוק העבודה מחזקים את הצורך בפרוטוקולי תיוג ניתנים להרחבה וידידותיים לעדכונים שניתן לרענן אותם כאשר מופיעים תפקידים חדשים. בתחום ה-NLP בשוק העבודה, נבחנה גם הכשרה מקדימה רב-לשונית, מונעת טקסונומיה, כדי ליישר טוב יותר ייצוגים עם מבני תעסוקה ושונות בין-לשונית. יחד, מחקרים אלו מעשירים את הגישה ומדגימים את הפוטנציאל של שימוש במודלים לשוניים גדולים עם אופטימיזציה של שליפה ומהירות כדי לזהות ולהסתגל בצורה יעילה יותר להקשרים של מקצועות מתפתחים.

במחקר זה, הידע התחום נערך רק עבור בינה מלאכותית והגנה על הסביבה, שכן בניית קורפוס, אימות ותחזוקה מהווים את העלויות התפעוליות העיקריות של סיווג גיוס חוצה תחומים. בהתאם לכך, Other משמש כקטגוריית דחייה מחוץ לתחום ולא כקטגוריה מהותית בתעשייה. יש לפרש בזהירות את הדיוק הגבוה המדווח, שכן הגדרת שלוש התוויות מפשטת את התיוג ועלולה להגדיל את הביצועים בהשוואה לטקסונומיות מדויקות יותר. הפרוטוקול מיועד להיות שכבת תיוג קלה ומבוססת על ידע עבור תחומים ממוקדים, ולא כתחליף למערכות סיווג מקיפות רב-קטגוריות. הרחבת מערך התוויות עלולה להפחית את הדיוק עקב חפיפה מוגברת, עמימות ודרישות מחמירות יותר לכיסוי קורפוס. בפועל, ניתן לחדד בהדרגה את מערך הדחייה על ידי הרחבת קורפוס התחום ושילוב בסיסי ידע פנימיים. לכן, תצורת שלוש התוויות מדגימה פרדיגמה רב-פעמית ולא טקסונומיה מקצועית ממצה.

מערך הנתונים משלב מקורות מובנים ולא מובנים. הקורפוס המובנה נאסף ונערך על ידי המחברים מתוך מודעות דרושים שפורסמו על ידי חברות ציבוריות בפלטפורמות גיוס מקוונות מרכזיות בסין בין השנים 2014 ל-2023. לאחר הסרת שכפול וניקוי בסיסי, הקורפוס המובנה מכיל כ-6.93 מיליון פרסומים. מסמכי דומיין לא מובנים שפורסמו על ידי הרשויות הרלוונטיות שימשו להגדרת קריטריוני ידע ותיווג תחום. ממקורות אלו, נבנו ידנית שלושה תתי-קבוצות בנצ'מרק, שכל אחד מהם כלל 1,000 פוסטים בבינה מלאכותית, הגנה על הסביבה ותחומים לא קשורים, בהתאמה, ואומתו להערכה.

עמודי השדרה של המודל מוערכים באמצעות דיוק, דיוק, שחזור ו-F1 (הממוצע ההרמוני של דיוק ושליטה, F1 = 2PR/(P+R)) כדי לבחור את הבסיס האופטימלי לזרימת העבודה המוגברת בשחזור. מסמכי דומיין סמכותיים מקורבים למאגר ידע ליצירת שליפה-מוגברת (RAG). קטעים רלוונטיים נשלפים ומוזרקים לתבנית פרומפט קבועה לתמיכה בסיווג. וריאציות ההנחיות נבדקות באופן שיטתי, ומיושמת אסטרטגיית אופטימיזציה של מילת רמזים כדי לקבוע את התצורה הסופית. הראיות שנאספו מסוננות לצורך רלוונטיות כדי לצמצם רעש ולתמוך בהסקה מדויקת ויעילה.

כדי לאפשר סיווג בקנה מידה גדול, זרימת העבודה מאמצת צינור מדורג: מיון מונחה לקסיקונים פותר ביעילות מקרים שגרתיים, בעוד שהסקת מודעות שפה גדולה, מותאמת לצורך הזמנה, מטפלת בפרסומים עמומים, מאזנת בין יכולת הרחבה לדיוק (איור 1).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

מחקר זה לא כלל משתתפים אנושיים או נבדקים של בעלי חיים. לכן, לא נדרשו אישור אתי והסכמה מדעת. תהליך העבודה בוצע בסביבת פייתון 3.10 על מערכת הפעלה Windows 64 ביט, תוך שימוש בחומרה, כלים ותוכנה המפורטים בטבלת החומרים.

1. דוגמנות

  1. בניית בסיס הנתונים והידע
    1. לאסוף ולארגן מאגר מובנה פנימי של מודעות דרושים לחברות ציבוריות מפלטפורמות גיוס מקוונות מרכזיות בסין (2014–2023), תוך הבטחת עמידה במדיניות הפלטפורמה והתקנות החלות. לכל מודעה, יש לרשום את כותרת המשרה, תיאור המשרה, שם החברה, תאריך הפרסום ומזהה ייחודי (למשל, מזהה פרסום או כתובת URL, אם קיים). הסר כפילויות ורשומות לא תקפות, ואמת שהקורפוס הסופי מכיל כ-6.93 מיליון רשומות.
    2. אסוף מסמכי תחום סמכותיים הקשורים לבינה מלאכותית והגנה על הסביבה, כולל המסמכים המפורטים בתיק המשלים 1. ודא שהמסמכים מגדירים מיומנויות, תקני הסמכה, תחומי משימות או נהלים מפוקחים.
  2. בניית מערך הנתונים של הבנצ'מרק
    1. סינון ידנית של מערך הנתונים המובנה. בחרו משרות שמייצגות בבירור בינה מלאכותית, הגנה על הסביבה ותחומים לא קשורים. כלול מקרים גבוליים כדי לשפר את הכיסוי.
    2. סמן כל מודעה לפי שם התפקיד, תיאור התפקיד ומידע המעסיק.
    3. בנה שלושה תתי-קבוצות מדד הכוללות 1,000 פוסטים כל אחד עבור בינה מלאכותית, הגנה על הסביבה ואחרים.
    4. בצע הערות כפולות. הקצה למפרש אחד לתייג כל פוסט ומסמן שני לאימות התווית באמצעות הנחיות כתובות.
    5. לפתור מחלוקות באמצעות דיון והכרעה על ידי מעריך שלישי.
    6. חישב הסכם בין-מפרש. רשום את אחוז ההסכמה ו-κ.
    7. שמור את מאגר הנתונים המאומת של הבנצ'מרק להערכת המודלים.
  3. הערכת עמוד השדרה של המודל
    1. העריכו את עמודי השדרה של LLM המכוונים לפי הוראות באמצעות אותה תבנית פרומפט ומאגר נתונים של מדד ביצועים.
    2. כבה את שדרוג השליפה במהלך השוואת עמוד שדרה.
    3. שמור על ניסוח ההנחיות, פרמטרי הפענוח ומיפוי תוויות זהים בין המודלים.
    4. חשב דיוק כללי, דיוק לכל מחלקה, שחזור ו-F1.
    5. בחר את עמוד השדרה המבצע הטוב ביותר ורשום את הקונפיגורציה שלו בטבלה 1.
    6. דווח על תוצאות ההערכה המלאות בטבלה 2.
  4. ביצוע אימון מקודד אדפטיבי-דומיין
    1. בנה קורפוס לא מסומן רק באמצעות המסמכים הסמכותיים המפורטים בתיק המשלים 1.
    2. חלץ טקסט פשוט מכל המסמכים.
    3. חלקו את הטקסט לרצפים עם אורך מקסימלי של 512 וצעד של 492.
    4. להשליך קטעים קצרים מ-50 תווים.
    5. ודאו שפרסומי בנצ'מרק לא ייכללו בקורפוס זה.
    6. אתחול את נקודות הביקורת הסיניות של BERT.
    7. בצע הכשרה מוקדמת למודל שפה מוסכה עם הסתברות הסתרה 0.15.
    8. התאמן ל-3 אפוקים עם AdamW עם קצב למידה 5e-5 וגודל אצווה 2.
    9. שמור את נקודת הביקורת המאומנת מראש.
    10. כוונן את המקודד לסיווג של שלוש מחלקות באמצעות קצב למידה של 2e-5, גודל אצווה של 2, ואורך רצף מקסימלי של 512.
    11. קבע את הזרע האקראי ל-42 והחל פיצול של אימות רכבות בשכבות.
    12. דיוק דוח, דיוק ממוצע מאקרו, שחזור ממוצע מאקרו, ממוצע מאקרו של F1, מדדים לכל מחלקה, ומטריצת בלבול.
    13. שמור את פלטי ההערכה לאימות.
  5. בניית צינור הסיווג המורחב לשליפה
    1. בנה את בסיס הידע
      1. רכיב 12 דומיינים סמכותיים.
      2. הסר גרסאות כפולות או מיושנות.
      3. המור מסמכים לטקסט רגיל.
      4. רשם מטא-דאטה של מסמך, כולל המנפיק ושנת הפרסום.
      5. חלק את הטקסט לקטעים של כ-1,000 תווים עם חפיפה של 20 תווים.
      6. רשמו את סך כל הקטעים ואת התפלגות אורך המקטעים.
        הערה: לאמת מחדש את ביצועי השליפה אם בסיס הידע מורחב.
    2. קידוד ואחסון הטבעות
      1. קודד את כל החלקים באמצעות מודל ההטמעה ואחסן אותם במסד הנתונים הווקטורי.
      2. מזהי מקטעי ארכיון ומטא-דאטה למקור.
      3. ודאו שמספר הווקטורים המאוחסנים תואם למספר הקטעים.
    3. בצע שליפה.
      1. הטמע כל מודעה דרושית באמצעות אותו מודל הטמעה.
      2. בצע חיפוש שכן k-הקרוב ביותר באמצעות דמיון קוסינוס.
      3. החלו סף דמיון τ כדי לסנן התאמות בעלות רלוונטיות נמוכה.
      4. תקבע τ ו-top-κ לאחר כיוון תת-קבוצה שהוחזקה.
      5. רשומה שלפה מזהי מקטעים וציוני דמיון.
    4. ביצוע הסקה משודרגת בשחזור
      1. הכנס עד ארבעה קטעים שנאספו לחלק הראיות בתבנית ההנחה (קובץ משלים 2).
      2. לאחד את טקסט מודעת המשרה עם ראיות שנאספו.
      3. יצר את התווית הסופית בת שלוש מחלקות באמצעות ה-LLM שנבחר.
      4. שמור יומני שליפה, פקודות ויציאות מודל.
  6. ביצוע מיון מונחה על ידי לקסיקונים
    1. בניית מילולי מפתח
      1. הרכיבו שני מילולי מפתח: אחד לבינה מלאכותית ואחד להגנת הסביבה (קובץ משלים 3).
      2. חלץ מונחים של מועמד ממודעות דרושים וממסמכים מוסמכים.
      3. טוקניזציה של טקסט באמצעות ספריית הטוקניזציה שצוינה.
      4. חשב סטטיסטיקות של תדירות מונחים וסטטיסטיקות ניגודיות תחום והסרת מונחים עמומים או כלליים מדי.
      5. לסיים ולארכב את הלקסיקונים.
    2. פרסומים במסלול
      1. הפעילו התאמה מדויקת ברמת המחרוזות והטוקנים.
      2. נתב מודעות הכוללות רק מילות מפתח של בינה מלאכותית לסניף הבינה המלאכותית.
      3. מודעות מסלול הכוללות רק מילות מפתח להגנת הסביבה לענף הגנת הסביבה.
      4. תייגו פרסומים ללא התאמה כאחרים.
      5. נתב פרסומים בהתאמה כפולה לשלב המשודרג בשחזור.
      6. רשם סטטיסטיקות ניתוב וגרסאות לקסיקונים.
    3. סיווג פרסומים מעורפלים
      1. שלפו את החלקים הרלוונטיים תחת הגדרות קבועות למעלה κ ו-τ.
      2. הזריק ראיות שנאספו לתבנית ההנחיה.
      3. יצר את התווית הסופית ושמור יומנים לכל מופע.

2. סיווג מחדש של תוצאות

  1. בניית מילון התרונים
    1. בנה תזאורוס של מונחי בינה מלאכותית (קובץ משלים 4). כלול מונחים מלמידת מכונה, עיבוד שפה טבעית, ראיית מחשב, רובוטיקה ותת-תחומים קשורים. ארגן מונחים מפורטים תחת כל קטגוריה.
    2. בנה תזאורוס נפרד של מונחי הגנת הסביבה. כולל יסודות מדעי הסביבה, ניטור וניתוח סביבתי, שליטה וניהול זיהום, ותכנון וניהול סביבתי.
    3. הוסף את כל מונחי הבינה המלאכותית והגנת הסביבה למילון הטוקניזציה. ודא שמונחים אלו מוכרים כיחידות שלמות במהלך חלוקת הטקסט.
  2. טקסט קדם-עיבוד
    1. הסר סימני פיסוק ותווים מיוחדים באמצעות ביטויים רגולריים. שמור רק טקסט ורווחים.
    2. בצע סגמנטציה של מילים כדי לחלק טקסט רציף לטוקנים בודדים.
  3. ביצוע התאמת תכונות וסיווג
    1. עיבוד מוקדם של טקסט הקלט כדי לקבל רשימה של טוקנים מחולקים.
    2. בחר את המיוז המתאים לפי הסיווג הראשוני.
    3. חצו את הטוקנים המחולקים ומבצעים התאמה מדויקת למונחי מילון התזאורוס לאחר הנרמליזציה. יש להחיל קייס קטן ולאחד וריאנטים מוגדרים מראש לפני ההתאמה.
    4. רשום כל מונח תואם ואת ענף המישור המתאים לו.
      הערה: אם מספר ענפים תואמים, פתרו תיקו באמצעות כלל קבוע (למשל, מספר ההתאמות הגבוה ביותר ואחריו הופעה מוקדמת ביותר).
    5. ייצא את רשימת המונחים התואמים ואת התג הסופי בתוך הדומיין לאגרגציה במורד הזרם.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

ארבעה עמודי שלד גדולים של מודלים גדולים בקוד פתוח, מותאמים לפי הוראות (עמוד שדרה A–D) המופיעים בטבלת החומרים מדורגים על משימת סיווג פרסום משרות בת שלוש מחלקות. ההערכה מתבצעת באמצעות אותו פרוטוקול בדיקה, פרוצדורות עיבוד מוקדם ומדדים בכל תחומי השדרה, כולל דיוק כללי, דיוק, שליפה ו-F1. שיפור מהיר ויצירת שחזור מוגבר (RAG) מיושמים לאחר מכן על עמוד השדרה B ומוערכים מחדש בתנאים זהים. תוצאות הביצועים מסוכמות בטבלה 2.

בפרוטוקול קבוע בן ...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

עבודות קודמות יישמו מודלים קלאסיים של למידת מכונה ומודלים עצביים לסיווג טקסטים של גיוס, כולל סיווג קורות חיים ותיאור תפקיד, אך גישות כאלה דורשות לעיתים קרובות נתונים מתויגים משמעותיים ועלולות להידרדר כאשר המונחים מתחילים להשתנות. עלי ואח' הציעו מערכת סיווג קורות חיים באמצעות NLP וטכניקות למידת מכונה18. ג'לילי ואחרים חקרו סיווג קורות חיים מבוסס BiLSTM19. פאל ואחרים העריכו סיווג קורות חיים באמצעות שיטות קלאסיות של למידת מכונה

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

למחברים אין מה לחשוף.

תודות

המחברים מודים לעמיתיהם על תמיכה טכנית ומשוב בונה במהלך איסוף הנתונים והכנת כתב היד. הפרויקט הזה לא קיבל מימון חיצוני.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
all-MiniLM-L6-v2 (מקודד משפטים)חיבוק פנים (משני משפטים)https://huggingface.co/sentence-transformers/all-MiniLM-L6-v2מודל הטמעת משפטים המשמש לווקטוריזציה.
ברט-בסיס-סינית (מקודד בסיס)חיבוק פנים (גוגל-ברט)https://huggingface.co/google-bert/bert-base-chineseמקודד בסיס (בסיס BERT סיני).
זיכרון DDR5, 16GBתצורת תחנת עבודה/מחשב ניידלא זמיןזיכרון מערכת (16GB DDR5); מספר הספק/החלק לא צוין.
DeepSeek-R1-Distill-Qwen-7B (Backbone A)חיבוק פנים (deepseek-ai)https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-7Bעמוד השדרה של LLM A.
GLM-4-9B-Chat (עמוד שדרה C)חיבוק פנים (זאי-אורג)https://huggingface.co/zai-org/glm-4-9b-chat-hfLLM עמוד שדרה C.
מעבד Intel Core i5-13500HXאינטלhttps://www.intel.com/content/www/us/en/products/sku/232156/intel-core-i513500hx-processor-24m-cache-up-to-4-70-ghz/specifications.htmlמעבד תחנת עבודה ששימש לניסויים.
אינטרןLM2.5-7B-צ'אט (עמוד שדרה D)חיבוק פנים (פנימית)https://huggingface.co/internlm/internlm2_5-7b-chatLLM עמוד שדרה D.
ג'יבה (טוקנייזר סיני)PyPI (ג'יבה)https://pypi.org/project/jieba/ספריית טוקניזציה/סגמנטציה בסינית; גרסה לא צוינה.
ספריות מילות מפתח (בינה מלאכותית ו-AI) סביבתי) (קובץ תוספת 3)מחקר זהקובץ תוספת 3מילות מפתח דומיין המשמשים לסינון מוקדם מונחה על ידי לקסיקונים; גרסה מדויקת של ארכיון לשימוש בכל ריצה.
LanceDB (מסד נתונים וקטורי)LanceDBלא זמיןמאגר וקטורי לאחסון/חיפוש הטמעות; גרסה לא צוינה.
כרטיס גרפי למחשב נייד NVIDIA GeForce RTX 4060 (8GB VRAM)NVIDIAhttps://www.nvidia.com/en-us/geforce/laptops/40-series/GPU משמש להסקת מסקנות/ניסויים.
מודעות דרושים לפלטפורמות גיוס מקוונות (2014– 2023)פלטפורמות גיוס מרכזיות בסין (נתוני אינטרנט ציבוריים)לא זמיןמודעות דרושים שפורסמו לציבור שנאספו ונאספו על ידי המחברים; ~6.93 מיליון פוסטים לאחר ניקוי.
pip (מתקין חבילות בפייתון)PyPAלא זמיןמתקין החבילה משמש להתקנת תלותיות ולייצוא תמונת מצב סביבה באמצעות pip freeze.
התפתחות תבנית ההנחה (קובץ תוספת 2)מחקר זהקובץ תוספת 2גרסאות הנחיה עוקבות וההנחיות הסופיות המשמשת להערכה.
פייתון 3.10קרן התוכנה של פייתוןלא זמיןמפרש זמן ריצה (Python 3.10); גרסת התיקון לא צוינה.
Qwen2.5-7B-Instruct (עמוד שדרה B)פנים חיבוק (קוון)https://huggingface.co/Qwen/Qwen2.5-7B-Instructעמוד השדרה של LLM B.
תיאורי שדה/אינדקס בסיס ידע של RAG (קובץ תוספת 1)מחקר זהקובץ תוספת 1הערות סכימה/שדה ואינדקס מסמכים לבסיס הידע המשמש בהסקה מוגברת בשחזור.
מילון תזאורוס (בינה מלאכותית ו-AI) סביבתי) (קובץ תוספת 4)מחקר זהקובץ תוספת 4מילוני מונחים המשמשים לסיווג מחדש וניתוח; גרסה מדויקת של ארכיון לשימוש בכל ריצה.
Windows 11 (64 ביט)מיקרוסופטלא זמיןמערכת הפעלה (Windows 11, 64 ביט); הבנייה/הגרסה לא צוינה.

מקורות

  1. Alekseeva, L., et al. The demand for AI skills in the labor market. Labour Economics. 71, 102002(2021).
  2. Ministry updates official dictionary of careers. , Ministry of Human Resources and Social Security of the People’s Republic of China. Available at: https://english.www.gov.cn/statecouncil/ministries/202209/30/content_WS633647bbc6d0a757729e0bb6.html (2022).
  3. BERT: Pre-training of deep bidirectional transformers for language understanding. Devlin, J., Chang, M. W., Lee, K., Toutanova, K. 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (NAACL-HLT), Minneapolis, MN, USA, , 4171-4186 (2019).
  4. Large language models in the workplace: A case study on prompt engineering for job type classification. Clavié, B., et al. 28th International Conference on Applications of Natural Language to Information Systems (NLDB 2023); , Derby, UK, , Springer. Natural Language Processing and Information Systems. Lecture Notes in Computer Science 3-17 (2023).
  5. Li, N., Kang, B., De Bie, T. LLM4Jobs: Unsupervised occupation extraction and standardization leveraging large language models. arXiv. , Available at: https://arxiv.org/abs/2309.09708 (2023).
  6. Deep learning-based computational job market analysis: A survey on skill extraction and classification from job postings. Senger, E., Zhang, M., van der Goot, R., Plank, B. 1st Workshop on Natural Language Processing for Human Resources (NLP4HR 2024), St. Julian’s, Malta, , 1-15 (2024).
  7. Enhancing job posting classification with multilingual embeddings and large language models. Kavas, H., Serra-Vidal, M., Wanner, L. 10th Italian Conference on Computational Linguistics (CLiC-it 2024), Pisa, Italy, , 440-450 (2024).
  8. JobBERT: Understanding job titles through skills. Decorte, J. J., Van Hautte, J., Demeester, T., Develder, C. International Workshop on Fair, Effective and Sustainable Talent Management using Data Science (FEAST 2021) at ECML-PKDD 2021, , (2021).
  9. Carotene: A job title classification system for the online recruitment domain. Javed, F., et al. IEEE First International Conference on Big Data Computing Service and Applications (BigDataService), , 286-293 (2015).
  10. Javed, F., McNair, M., Jacob, F., Zhao, M. Towards a job title classification system. arXiv. , Available at: https://arxiv.org/abs/1606.00917 (2016).
  11. Lewis, P., et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Presented at: Advances in Neural Information Processing Systems. NeurIPS. , (2020).
  12. The power of scale for parameter-efficient prompt tuning. Lester, B., Al-Rfou, R., Constant, N. 2021 Conference on Empirical Methods in Natural Language Processing (EMNLP), , 3045-3059 (2021).
  13. Han, X., et al. PTR: Prompt tuning with rules for text classification. AI Open. 3, 182-192 (2022).
  14. Brown, T. B., et al. Language models are few-shot learners. Presented at: Advances in Neural Information Processing Systems. NeurIPS. , (2020).
  15. Liu, P., et al. predict: A systematic survey of prompting methods in natural language processing. ACM Comput Surv. 55 (9), 195:1-195:35 (2023).
  16. Blue, A. The outlook for 2023 is uncertain, but here’s what we know about the global labour market. World Economic Forum (Agenda). , Available at: https://www.weforum.org/agenda/2023/01/the-outlook-for-2023-is-uncertain-but-here-s-what-we-know-about-the-global-labour-market-davos23 (2023).
  17. ESCOXLM-R: Multilingual taxonomy-driven pre-training for the job market domain. Zhang, M., van der Goot, R., Plank, B. 61st Annual Meeting of the Association for Computational Linguistics (ACL 2023), Toronto, Canada, , 11871-11890 (2023).
  18. Ali, I., et al. Resume classification system using natural language processing and machine learning techniques. Mehran Univ Res J Eng Technol. 41 (1), 65-79 (2022).
  19. BiLSTM for resume classification. Jalili, A., Tabrizchi, H., Razmara, J., Mosavi, A. 22nd IEEE International Symposium on Applied Machine Intelligence and Informatics (SAMI 2024), Stará Lesná, Slovakia, , (2024).
  20. Pal, R., Shaikh, S., Satpute, S., Bhagwat, S. Resume classification using various machine learning algorithms. ITM Web Conf. 44, 03011(2022).
  21. Convolutional neural network with word embedding based approach for resume classification. Nasser, S., Sreejith, C., Irshad, M. 2018 International Conference on Emerging Trends and Innovations in Engineering and Technological Research (ICETIETR 2018), , Ernakulam (Cochin), India. (2018).
  22. Real-time resume classification system using LinkedIn profile descriptions. Ramraj, S., Sivakumar, V. 2020 International Conference on Computational Intelligence for Smart Power Systems and Sustainable Energy (CISPSSE 2020), Keonjhar, Odisha, India, , (2020).
  23. Heakl, A., et al. ResumeAtlas: Revisiting resume classification with large-scale datasets and large language models. arXiv. , Available at: https://arxiv.org/abs/2406.18125 (2024).
  24. Skondras, P., Zervas, P., Tzimas, G. Generating synthetic resume data with large language models for enhanced job description classification. Future Internet. 15 (11), 363(2023).
  25. Chen, Z. Ethics and discrimination in artificial intelligence-enabled recruitment practices. Humanit Soc Sci Commun. 10, 567(2023).
  26. Retrieval-augmented few-shot text classification. Yu, G., et al. Findings of the Association for Computational Linguistics: EMNLP 2023, Singapore, , 6721-6735 (2023).
  27. Izacard, G., et al. Atlas: Few-shot learning with retrieval augmented language models. J Mach Learn Res. 24 (251), 1-43 (2023).
  28. KW-ATTN: Knowledge infused attention for accurate and interpretable text classification. Jang, H., et al. Deep Learning Inside Out (DeeLIO): 2nd Workshop on Knowledge Extraction and Integration for Deep Learning Architectures, , 96-107 (2021).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

הדפסות חוזרות והרשאות

תגיות

K