Ces dernières années, avec le développement rapide de l’IA et des technologies environnementales, un grand nombre de carrières émergentes ont émergé. D’une part, le marché mondial de l’emploi est saturé de nombreux nouveaux postes basés sur l’IA et la durabilité. Les preuves basées sur les vacances documentent une expansion rapide de la demande de compétences liées à l’IA, ce qui augmente l’hétérogénéité des textes de recrutement et motive un protocole de domain taging reproductibleet évolutif 1. En revanche, la dernière révision chinoise du Dictionnaire de classification des professions (OCD) a vu une croissance tout aussi robuste des nouvelles professions dans les domaines de l’informatisation de l’emploi et des professions vertes et bas carbone, avec une augmentation nette de 158 nouvelles professions lors de la révision de 2022 par rapport à l’édition 2015 du dictionnaire, soit un total de 97 professions numériques. soit 6 % du nombre total de professions, indiquées, avec 134 professions vertes, soit 8 % du nombre total d’occupations2.
À mesure que ces nouvelles professions continuent d’apparaître, le contenu et la forme des offres d’emploi par les entreprises deviennent plus complexes, car les descriptions de poste impliquent souvent des connaissances disciplinaires et des exigences de compétences diverses, comprenant à la fois des domaines structurés tels que les titres de poste et les listes de compétences, ainsi qu’un grand nombre de descriptions libres non structurées, ce qui aboutit à des structures d’offres d’emploi de plus en plus complexes. Ces offres d’emploi complexes contiennent généralement des éléments structurés clairement définis (par exemple, des titres de poste, des listes de compétences requises) accompagnés de descriptions longues en texte libre non structuré. Par exemple, une offre d’emploi pour ingénieur IA pourrait lister des termes techniques comme « maîtrise d’un cadre d’apprentissage profond » et « expérience d’optimisation des algorithmes de rétropropagation » dans une liste de compétences, tout en incluant un récit détaillé des responsabilités ; De même, une offre d’ingénieur environnemental peut faire référence à des normes réglementaires et certifications spécifiques. Cette combinaison de contenu structuré et non structuré aboutit à des descriptions de poste très spécialisées et complexes.
L’intelligence artificielle et la protection de l’environnement sont sélectionnées pour évaluer le protocole dans une ambiguïté réaliste interdisciplinaire dans la classification du recrutement. En pratique, les ressources professionnelles courantes telles que O*NET et les sites d’offres d’emploi attribuent des tags grossiers, rendant difficile la distinction des rôles intersectoriels uniquement avec des mots-clés. La protection de l’environnement représente un vaste domaine chevauchant plusieurs domaines scientifiques, tandis que l’intelligence artificielle reflète une tranche plus fine de l’informatique, souvent confondue avec des rôles logiciels généraux. Cette association capture à la fois des contextes inter-domaines larges et étroits, avec une terminologie distincte et des documents faisant autorité adaptés à la construction d’une base de connaissances, tout en permettant une adaptation à d’autres secteurs en remplaçant le corpus de domaines sans modifier le flux de travail central.
Ces dernières années, la recherche sur la classification des offres d’emploi a connu une forte montée. Les chercheurs utilisent de plus en plus de grands modèles pré-entraînés pour améliorer la classification des professions. L’introduction de BERT en 2019 a marqué une avancée qui a permis une compréhension profondément contextuelle du langage et a considérablement amélioré les performances en classificationdes textes 3. Par exemple, Clavié et al. (2023) ont exploré l’utilisation d’un grand modèle de langage (LLM) ajusté par instruction pour la classification des postes, constatant que la bonne ingénierie des prompts permettait au LLM de surpasser les modèles supervisés de pointe lors d’une tâche de classification d’emploipour diplômés 4. De même, Li et al. (2023) ont proposé une approche LLM4Jobs qui combine la synthèse des modèles en grand langage avec la correspondance des codes métiers, améliorant significativement la précision de la classification sur les descriptions de poste longues en extrayant d’abord des résumés puis en les alignant avec les codes de postestandards 5. De plus, une enquête de 2024 menée par Senger et al. recense les avancées récentes en apprentissage profond pour les RH, notant que l’extraction de compétences et la classification des postes sont devenues des tâches clés dans l’analyse computationnelle du marchéde l’emploi 6. Kavas et al. (2024) ont amélioré la classification des offres d’emploi en combinant des insertions de texte multilingues avec une catégorisation basée sur LLM, obtenant des gains de précisionnotables 7. Sur le plan traditionnel, les systèmes antérieurs allaient des heuristiques basées sur des mots-clés avec des ensembles de catégories relativement grossiers à des cadres axés sur la taxonomie tels que le carotène, qui utilisait une hiérarchie sur plus de 4 000 titres de poste 8,9. Javed et al. (2016) ont présenté un cadre précoce de classification des titres d’emploi, marquant l’une des premières étapes vers une catégorisation systématique desprofessions 10. Cependant, ces approches supervisées nécessitent des données étiquetées étendues et peinent à s’adapter à l’émergence rapide de nouveaux postes, car les taxonomies de classification évoluent souvent plus lentement que le marchédu travail 4.
Pour remédier à ces limitations, les travaux récents se sont tournés vers des stratégies hybrides intégrant des connaissances externes ; par exemple, Lewis et al. (2020) ont introduit le cadre Retrieval-Augmented Generation (RAG), qui combine des modèles de langage pré-entraînés avec un retriever pour injecter des connaissances pertinentes du domaine, obtenant une précision supérieure et des résultats plus factuels sur des tâches à forte intensitéen connaissances 11. Lester et al. ont démontré que le réglage prompt entraîne des gains de performance plus importants lorsque la taille du modèleaugmente de 12, renforçant l’utilisation d’un LLM de base solide. Par exemple, Han et al. ont montré que l’utilisation d’invites guidées par règles peut améliorer la précision de la classification des textes en concentrant le modèle sur les caractéristiquesclés 13. De plus, Brown et al. (2020) ont démontré de manière célèbre qu’un grand modèle de langage peut effectuer de nouvelles tâches à partir de seulement quelques exemples ou instructions, soulignant la puissance de l’apprentissage à quelques coups pilotépar les prompts 14. Notamment, une enquête récente sur les techniques de NLP basées sur les prompts souligne que la formulation des prompts peut influencer significativement les résultats dumodèle 15. Parallèlement, les évolutions macroéconomiques et l’incertitude sur le marché du travail renforcent le besoin de protocoles d’étiquetage évolutifs et adaptés à la mise à jour, qui pourront être rafraîchis à mesure que de nouveaux postesémergent 16. Dans le domaine du NLP sur le marché de l’emploi, la pré-formation multilingue axée sur la taxonomie a également été explorée afin de mieux aligner les représentations avec les structures professionnelles et la variabilité interlinguistique17. Collectivement, ces études éclairent l’approche et démontrent le potentiel d’utiliser de grands modèles de langage avec récupération et optimisation des prompts afin de mieux reconnaître et s’adapter aux contextes professionnels émergents.
Dans cette étude, la connaissance du domaine est sélectionnée uniquement pour l’intelligence artificielle et la protection de l’environnement, car la construction, la validation et la maintenance de corpus représentent les principaux coûts opérationnels de la classification du recrutement inter-domaines. En conséquence, Autre sert plutôt de catégorie de rejet hors champ que de classe industrielle substantielle. La grande précision rapportée doit être interprétée avec prudence, car le réglage à trois labels simplifie l’étiquetage et peut gonfler les performances par rapport aux taxonomies plus fines. Le protocole est conçu comme une couche d’etiquetage légère et fondée sur les connaissances pour les domaines ciblés, et non comme un remplacement des systèmes de classification multi-catégories complets. L’élargissement de l’ensemble d’étiquettes peut réduire la précision en raison d’un chevauchement accru, de l’ambiguïté et d’exigences plus strictes en matière de couverture de corpus. En pratique, l’ensemble de rejets peut être progressivement affiné en étendant le corpus de domaines et en incorporant des bases de connaissances internes. La configuration à trois étiquettes démontre donc un paradigme réutilisable plutôt qu’une taxonomie professionnelle exhaustive.
L’ensemble de données combine des sources structurées et non structurées. Le corpus structuré a été collecté et sélectionné par les auteurs à partir d’offres d’emploi publiées publiquement par des entreprises cotées sur les principales plateformes de recrutement en ligne en Chine entre 2014 et 2023. Après déduplication et nettoyage de base, le corpus structuré contient environ 6,93 millions d’annonces. Les documents de domaine non structurés publiés par les autorités compétentes ont été utilisés pour définir les connaissances du domaine et les critères d’étiquetage. À partir de ces sources, trois sous-ensembles de benchmarks ont été construits manuellement, chacun contenant respectivement 1 000 offres pour l’intelligence artificielle, la protection de l’environnement et des domaines non liés, et vérifiés pour évaluation.
Les dorsales de modèles sont évaluées à l’aide de la précision, de la précision, du rappel et de F1 (la moyenne harmonique de la précision et du rappel, F1 = 2PR/(P+R)) afin de sélectionner la base optimale pour le flux de travail augmenté par la récupération. Les documents de domaine faisant autorité sont compilés dans une base de connaissances pour la génération augmentée par récupération (RAG). Les passages pertinents sont récupérés et injectés dans un modèle de prompt fixe pour soutenir la classification. Les variantes d’invite sont testées systématiquement, et une stratégie d’optimisation par mot d’indication est appliquée pour déterminer la configuration finale. Les preuves récupérées sont filtrées pour leur pertinence afin de minimiser le bruit et de soutenir des inférences précises et efficaces.
Pour permettre une classification à grande échelle, le flux de travail adopte un pipeline par étapes : le triage guidé par lexique résout efficacement les cas routiniers, tandis que l’inférence LLM optimisée pour la recherche et optimisée pour prompts gère les publications ambiguës, équilibrant scalabilité et précision (Figure 1).