בשנים האחרונות, עם ההתפתחות המהירה של בינה מלאכותית וטכנולוגיות סביבתיות, צצו מספר רב של קריירות מתפתחות. מצד אחד, שוק העבודה העולמי מוצף במשרות חדשות רבות המבוססות על בינה מלאכותית וקיימות. ראיות מבוססות משרות פנויות מתעדות התרחבות מהירה בביקוש למיומנויות הקשורות לבינה מלאכותית, מה שמגביר את ההטרוגניות של טקסטי הגיוס ומניע פרוטוקול תיוג דומיין שניתן לשחזורוניתן להרחבה 1. מצד שני, התיקון האחרון של מילון סיווג התעסוקה (OCD) בסין רשם צמיחה דומה במקצועות חדשים בתחומי אינפורמטיזציה תעסוקתית וירוק ודל-פחמן, עם עלייה נטו של 158 מקצועות חדשים בתיקון 2022 לעומת מהדורת 2015 של המילון, עם סך של 97 מקצועות דיגיטליים. או 6% מכלל המקצועות, מסומנים, יחד עם 134 מקצועות ירוקים, או 8% מסך המקצועות2.
ככל שהמקצועות החדשים הללו ממשיכים להופיע, התוכן והצורה של מודעות הדרושים בחברות הופכים למורכבים יותר, כאשר תיאורי המשרות כוללים לעיתים ידע בנושא ודרישות מיומנות מגוונות, הכוללים תחומים מובנים כמו כותרות תפקידים ורשימות מיומנויות, וכן מספר רב של תיאורים חופשיים לא מובנים, מה שמוביל למבני מודעות דרושים מורכבים יותר ויותר. מודעות דרושים מורכבות כאלה בדרך כלל מכילות אלמנטים מובנים מוגדרים (למשל, כותרות משרה, רשימות מיומנויות נדרשות) לצד תיאורים נרחבים ובלתי מובנים בטקסט חופשי. לדוגמה, מודעת משרה למהנדס בינה מלאכותית עשויה לכלול מונחים טכניים כמו 'שליטה במסגרת למידה עמוקה' ו'ניסיון באופטימיזציה של אלגוריתמים לאחור' כחלק מרשימת מיומנויות, תוך הוספת סיפור מפורט של אחריות; באופן דומה, פרסום מהנדס סביבה עשוי להתייחס לסטנדרטים רגולטוריים ותעודות ספציפיות. השילוב הזה של תוכן מובנה ולא מובנה מוביל לתיאורי תפקיד ייחודיים ומסובכים מאוד.
בינה מלאכותית והגנה על הסביבה נבחרות להערכת הפרוטוקול תחת עמימות ריאלית חוצת תחומים בסיווג הגיוס. בפועל, משאבים מקצועיים מרכזיים כמו O*NET ולוחות דרושים מעניקים תגיות גסות, מה שמקשה על הבחנה בין תפקידים בין-תעשייתיים באמצעות מילות מפתח בלבד. הגנת הסביבה מייצגת תחום רחב החופף למספר תחומים מדעיים, בעוד שבינה מלאכותית משקפת חלק מפורט יותר במחשוב שלעיתים מתערבב עם תפקידים כלליים בתוכנה. שילוב זה תופס גם הגדרות רחבות וגם צרות בין תחומים עם מונחים מובחנים ומסמכים סמכותיים מתאימים לבניית בסיס ידע, תוך מתן אפשרות להתאמה לתעשיות אחרות על ידי החלפת קורפוס התחום מבלי לשנות את זרימת העבודה המרכזית.
בשנים האחרונות נרשמה עלייה במחקר על סיווג משרות. חוקרים מנצלים יותר ויותר מודלים גדולים שהוכשרו מראש כדי לשפר את סיווג המקצועות. ההצגה של BERT ב-2019 סימנה פריצת דרך שאפשרה הבנה לשפה בהקשרית עמוקה ושיפרה משמעותית את ביצועי סיווג הטקסט3. לדוגמה, Clavié ואח' (2023) חקרו שימוש במודל שפה גדול (LLM) המותאם להוראות לסיווג משרות, ומצאו כי הנדסת פרומפט נכונה אפשרה למודל להציג ביצועים טובים יותר ממודלים מפוקחים מתקדמים במשימת סיווג משרה4. באופן דומה, Li ואח' (2023) הציעו גישת LLM4Jobs שמשלבת סיכום מודל בשפה גדולה עם התאמת קודי מקצוע, ומשפרת משמעותית את דיוק הסיווג בתיאורי משרות ארוכים על ידי חילוץ סיכומים ואז יישורם לקודי משרה סטנדרטיים5. בנוסף, סקר משנת 2024 של סנגר ואחרים מתעד התקדמות אחרונה בלמידה עמוקה במשאבי אנוש, ומציין כי חילוץ מיומנויות וסיווג משרות הפכו למשימות מרכזיות בניתוח שוק עבודה חישובי6. Kavas ואח' (2024) שיפרו את סיווג מודעות המשרות על ידי שילוב הטמעות-טקסט רב-לשוניות עם סיווג מבוסס LLM, והשיגו שיפורי דיוק משמעותיים7. במישור המסורתי, מערכות מוקדמות נעו מהיוריסטיקות מבוססות מילות מפתח עם קבוצות קטגוריות גסות יחסית למסגרות מונחות טקסונומיה כמו Carotene, שהשתמשה בהיררכיה על פני יותר מ-4,000 תפקידים 8,9. ג'אווד ואח' (2016) הציגו מסגרת סיווג מוקדמת לתפקידים, שסימנה אחד הצעדים הראשונים לסיווג שיטתי של מקצוע10. גישות מפוקחות אלו, עם זאת, דורשות נתונים מתויגים נרחבים ומתקשים להסתגל להופעה המהירה של תפקידים חדשים, שכן טקסונומיות סיווג מתפתחות לעיתים לאט יותר מאשר שוק העבודה4.
כדי להתמודד עם מגבלות אלו, עבודות עדכניות פנו לאסטרטגיות היברידיות המשלבות ידע חיצוני; לדוגמה, לואיס ואח' (2020) הציגו את מסגרת Retrieval-Augmented Generation (RAG), שמשלבת מודלים של שפה מאומנים מראש עם רטריבר כדי להזריק ידע תחומי רלוונטי, ולהשיג דיוק עליון ותוצאות עובדתיות יותר במשימות עתירות ידע11. לסטר ואחרים הראו כי כיוון מהיר מניב שיפור ביצועים גדול יותר ככל שגודל המודל גדלב-12, מה שמחזק את השימוש במודל בסיס חזק. לדוגמה, Han ואחרים הראו ששימוש בהנחיות מונחות כללים יכול לשפר את דיוק סיווג הטקסט על ידי התמקדות המודל בתכונות מפתח13. יתרה מזאת, בראון ואח' (2020) הראו מפורסם שמודל שפה גדול יכול לבצע משימות חדשות רק מכמה דוגמאות או הוראות, מה שמדגיש את כוחו של למידה מונעת הנחיית הנחיית מספר קצר14. ראוי לציין כי סקר עדכני של טכניקות NLP מבוססות הנחיה מדגיש שניסוח בהנחיה יכול להוביל משמעותית את תוצרי המודל15. במקביל, שינויים ברמת המאקרו ואי-ודאות בשוק העבודה מחזקים את הצורך בפרוטוקולי תיוג ניתנים להרחבה וידידותיים לעדכונים שניתן לרענן אותם כאשר מופיעים תפקידים חדשים. בתחום ה-NLP בשוק העבודה, נבחנה גם הכשרה מקדימה רב-לשונית, מונעת טקסונומיה, כדי ליישר טוב יותר ייצוגים עם מבני תעסוקה ושונות בין-לשונית. יחד, מחקרים אלו מעשירים את הגישה ומדגימים את הפוטנציאל של שימוש במודלים לשוניים גדולים עם אופטימיזציה של שליפה ומהירות כדי לזהות ולהסתגל בצורה יעילה יותר להקשרים של מקצועות מתפתחים.
במחקר זה, הידע התחום נערך רק עבור בינה מלאכותית והגנה על הסביבה, שכן בניית קורפוס, אימות ותחזוקה מהווים את העלויות התפעוליות העיקריות של סיווג גיוס חוצה תחומים. בהתאם לכך, Other משמש כקטגוריית דחייה מחוץ לתחום ולא כקטגוריה מהותית בתעשייה. יש לפרש בזהירות את הדיוק הגבוה המדווח, שכן הגדרת שלוש התוויות מפשטת את התיוג ועלולה להגדיל את הביצועים בהשוואה לטקסונומיות מדויקות יותר. הפרוטוקול מיועד להיות שכבת תיוג קלה ומבוססת על ידע עבור תחומים ממוקדים, ולא כתחליף למערכות סיווג מקיפות רב-קטגוריות. הרחבת מערך התוויות עלולה להפחית את הדיוק עקב חפיפה מוגברת, עמימות ודרישות מחמירות יותר לכיסוי קורפוס. בפועל, ניתן לחדד בהדרגה את מערך הדחייה על ידי הרחבת קורפוס התחום ושילוב בסיסי ידע פנימיים. לכן, תצורת שלוש התוויות מדגימה פרדיגמה רב-פעמית ולא טקסונומיה מקצועית ממצה.
מערך הנתונים משלב מקורות מובנים ולא מובנים. הקורפוס המובנה נאסף ונערך על ידי המחברים מתוך מודעות דרושים שפורסמו על ידי חברות ציבוריות בפלטפורמות גיוס מקוונות מרכזיות בסין בין השנים 2014 ל-2023. לאחר הסרת שכפול וניקוי בסיסי, הקורפוס המובנה מכיל כ-6.93 מיליון פרסומים. מסמכי דומיין לא מובנים שפורסמו על ידי הרשויות הרלוונטיות שימשו להגדרת קריטריוני ידע ותיווג תחום. ממקורות אלו, נבנו ידנית שלושה תתי-קבוצות בנצ'מרק, שכל אחד מהם כלל 1,000 פוסטים בבינה מלאכותית, הגנה על הסביבה ותחומים לא קשורים, בהתאמה, ואומתו להערכה.
עמודי השדרה של המודל מוערכים באמצעות דיוק, דיוק, שחזור ו-F1 (הממוצע ההרמוני של דיוק ושליטה, F1 = 2PR/(P+R)) כדי לבחור את הבסיס האופטימלי לזרימת העבודה המוגברת בשחזור. מסמכי דומיין סמכותיים מקורבים למאגר ידע ליצירת שליפה-מוגברת (RAG). קטעים רלוונטיים נשלפים ומוזרקים לתבנית פרומפט קבועה לתמיכה בסיווג. וריאציות ההנחיות נבדקות באופן שיטתי, ומיושמת אסטרטגיית אופטימיזציה של מילת רמזים כדי לקבוע את התצורה הסופית. הראיות שנאספו מסוננות לצורך רלוונטיות כדי לצמצם רעש ולתמוך בהסקה מדויקת ויעילה.
כדי לאפשר סיווג בקנה מידה גדול, זרימת העבודה מאמצת צינור מדורג: מיון מונחה לקסיקונים פותר ביעילות מקרים שגרתיים, בעוד שהסקת מודעות שפה גדולה, מותאמת לצורך הזמנה, מטפלת בפרסומים עמומים, מאזנת בין יכולת הרחבה לדיוק (איור 1).