Un abonnement JoVE est requis pour visualiser ce contenu. Connectez-vous ou commencez votre période d'essai gratuite.

Article de méthode

Étiquetage textuel de recrutement en deux étapes via routage guidé par lexique et grands modèles de langage augmentés par la récupération

136 vues

DOI :

10.3791/70153

8 mai 2026

Dans cet article

Résumé

Un flux de travail en deux étapes est décrit pour classer les textes de recrutement en Intelligence Artificielle, Protection de l’Environnement ou Autre. Le triage guidé par lexique assigne les cas de routine, tandis que l’inférence de grands modèles de langage augmentée par la récupération et optimisée pour les prompts résout les cas ambigus, permettant un étiquetage précis à grande échelle et un résumé descriptif du marché du travail en aval.

Résumé

Les textes de recrutement sont hétérogènes, et la terminologie du domaine évolue avec le temps, rendant l’étiquetage à grande échelle difficile avec une capacité d’annotation manuelle limitée. Ce protocole offre un flux de travail reproductible en deux étapes pour classer les textes de recrutement chinois en intelligence artificielle, protection de l’environnement ou autre. La première étape effectue un triage guidé par lexique à l’aide de deux listes de mots-clés de domaine sélectionnées. Les publications correspondant à un seul lexique de domaine sont directement identifiées. Les publications qui ne correspondent à aucun des deux lexiques sont étiquetées comme Autre, tandis que celles en double correspondance sont dirigées vers l’étape deux. La deuxième étape applique une inférence de grands modèles de langage augmentée par la récupération. Une base de connaissances compilée à partir de 12 documents de domaine faisant autorité est convertie en texte, divisée en morceaux d’environ 1 000 caractères avec un chevauchement de 20 caractères, intégrée à l’aide de MiniLM-L6-v2, et indexée dans LanceDB. Pour chaque publication incertaine, la récupération de k-voisins le plus proche par similarité cosinus renvoie des chunks candidats filtrés par un seuil minimal de similarité (τ), et jusqu’à quatre chunks sont injectés dans un modèle d’invite fixe qui définit les limites des étiquettes et contraint la sortie à une seule étiquette. Un ensemble de référence de 3 000 annonces est vérifié manuellement, avec 1 000 annonces par classe, et atteint un accord inter-annotateurs de 95,0 % et un kappa de Cohen (κ) d’environ 0,93. L’évaluation compare plusieurs grands modèles de langage open source dans un cadre à invite seule et à un environnement augmenté par récupération en utilisant Qwen2.5-7B-Instruct. La configuration augmentée par récupération atteint une précision de 98,47 % et supporte l’étiquetage à l’échelle de corpus d’environ 6,93 millions de publications pour l’agrégation descriptive en aval.

Introduction

Ces dernières années, avec le développement rapide de l’IA et des technologies environnementales, un grand nombre de carrières émergentes ont émergé. D’une part, le marché mondial de l’emploi est saturé de nombreux nouveaux postes basés sur l’IA et la durabilité. Les preuves basées sur les vacances documentent une expansion rapide de la demande de compétences liées à l’IA, ce qui augmente l’hétérogénéité des textes de recrutement et motive un protocole de domain taging reproductibleet évolutif 1. En revanche, la dernière révision chinoise du Dictionnaire de classification des professions (OCD) a vu une croissance tout aussi robuste des nouvelles professions dans les domaines de l’informatisation de l’emploi et des professions vertes et bas carbone, avec une augmentation nette de 158 nouvelles professions lors de la révision de 2022 par rapport à l’édition 2015 du dictionnaire, soit un total de 97 professions numériques. soit 6 % du nombre total de professions, indiquées, avec 134 professions vertes, soit 8 % du nombre total d’occupations2.

À mesure que ces nouvelles professions continuent d’apparaître, le contenu et la forme des offres d’emploi par les entreprises deviennent plus complexes, car les descriptions de poste impliquent souvent des connaissances disciplinaires et des exigences de compétences diverses, comprenant à la fois des domaines structurés tels que les titres de poste et les listes de compétences, ainsi qu’un grand nombre de descriptions libres non structurées, ce qui aboutit à des structures d’offres d’emploi de plus en plus complexes. Ces offres d’emploi complexes contiennent généralement des éléments structurés clairement définis (par exemple, des titres de poste, des listes de compétences requises) accompagnés de descriptions longues en texte libre non structuré. Par exemple, une offre d’emploi pour ingénieur IA pourrait lister des termes techniques comme « maîtrise d’un cadre d’apprentissage profond » et « expérience d’optimisation des algorithmes de rétropropagation » dans une liste de compétences, tout en incluant un récit détaillé des responsabilités ; De même, une offre d’ingénieur environnemental peut faire référence à des normes réglementaires et certifications spécifiques. Cette combinaison de contenu structuré et non structuré aboutit à des descriptions de poste très spécialisées et complexes.

L’intelligence artificielle et la protection de l’environnement sont sélectionnées pour évaluer le protocole dans une ambiguïté réaliste interdisciplinaire dans la classification du recrutement. En pratique, les ressources professionnelles courantes telles que O*NET et les sites d’offres d’emploi attribuent des tags grossiers, rendant difficile la distinction des rôles intersectoriels uniquement avec des mots-clés. La protection de l’environnement représente un vaste domaine chevauchant plusieurs domaines scientifiques, tandis que l’intelligence artificielle reflète une tranche plus fine de l’informatique, souvent confondue avec des rôles logiciels généraux. Cette association capture à la fois des contextes inter-domaines larges et étroits, avec une terminologie distincte et des documents faisant autorité adaptés à la construction d’une base de connaissances, tout en permettant une adaptation à d’autres secteurs en remplaçant le corpus de domaines sans modifier le flux de travail central.

Ces dernières années, la recherche sur la classification des offres d’emploi a connu une forte montée. Les chercheurs utilisent de plus en plus de grands modèles pré-entraînés pour améliorer la classification des professions. L’introduction de BERT en 2019 a marqué une avancée qui a permis une compréhension profondément contextuelle du langage et a considérablement amélioré les performances en classificationdes textes 3. Par exemple, Clavié et al. (2023) ont exploré l’utilisation d’un grand modèle de langage (LLM) ajusté par instruction pour la classification des postes, constatant que la bonne ingénierie des prompts permettait au LLM de surpasser les modèles supervisés de pointe lors d’une tâche de classification d’emploipour diplômés 4. De même, Li et al. (2023) ont proposé une approche LLM4Jobs qui combine la synthèse des modèles en grand langage avec la correspondance des codes métiers, améliorant significativement la précision de la classification sur les descriptions de poste longues en extrayant d’abord des résumés puis en les alignant avec les codes de postestandards 5. De plus, une enquête de 2024 menée par Senger et al. recense les avancées récentes en apprentissage profond pour les RH, notant que l’extraction de compétences et la classification des postes sont devenues des tâches clés dans l’analyse computationnelle du marchéde l’emploi 6. Kavas et al. (2024) ont amélioré la classification des offres d’emploi en combinant des insertions de texte multilingues avec une catégorisation basée sur LLM, obtenant des gains de précisionnotables 7. Sur le plan traditionnel, les systèmes antérieurs allaient des heuristiques basées sur des mots-clés avec des ensembles de catégories relativement grossiers à des cadres axés sur la taxonomie tels que le carotène, qui utilisait une hiérarchie sur plus de 4 000 titres de poste 8,9. Javed et al. (2016) ont présenté un cadre précoce de classification des titres d’emploi, marquant l’une des premières étapes vers une catégorisation systématique desprofessions 10. Cependant, ces approches supervisées nécessitent des données étiquetées étendues et peinent à s’adapter à l’émergence rapide de nouveaux postes, car les taxonomies de classification évoluent souvent plus lentement que le marchédu travail 4.

Pour remédier à ces limitations, les travaux récents se sont tournés vers des stratégies hybrides intégrant des connaissances externes ; par exemple, Lewis et al. (2020) ont introduit le cadre Retrieval-Augmented Generation (RAG), qui combine des modèles de langage pré-entraînés avec un retriever pour injecter des connaissances pertinentes du domaine, obtenant une précision supérieure et des résultats plus factuels sur des tâches à forte intensitéen connaissances 11. Lester et al. ont démontré que le réglage prompt entraîne des gains de performance plus importants lorsque la taille du modèleaugmente de 12, renforçant l’utilisation d’un LLM de base solide. Par exemple, Han et al. ont montré que l’utilisation d’invites guidées par règles peut améliorer la précision de la classification des textes en concentrant le modèle sur les caractéristiquesclés 13. De plus, Brown et al. (2020) ont démontré de manière célèbre qu’un grand modèle de langage peut effectuer de nouvelles tâches à partir de seulement quelques exemples ou instructions, soulignant la puissance de l’apprentissage à quelques coups pilotépar les prompts 14. Notamment, une enquête récente sur les techniques de NLP basées sur les prompts souligne que la formulation des prompts peut influencer significativement les résultats dumodèle 15. Parallèlement, les évolutions macroéconomiques et l’incertitude sur le marché du travail renforcent le besoin de protocoles d’étiquetage évolutifs et adaptés à la mise à jour, qui pourront être rafraîchis à mesure que de nouveaux postesémergent 16. Dans le domaine du NLP sur le marché de l’emploi, la pré-formation multilingue axée sur la taxonomie a également été explorée afin de mieux aligner les représentations avec les structures professionnelles et la variabilité interlinguistique17. Collectivement, ces études éclairent l’approche et démontrent le potentiel d’utiliser de grands modèles de langage avec récupération et optimisation des prompts afin de mieux reconnaître et s’adapter aux contextes professionnels émergents.

Dans cette étude, la connaissance du domaine est sélectionnée uniquement pour l’intelligence artificielle et la protection de l’environnement, car la construction, la validation et la maintenance de corpus représentent les principaux coûts opérationnels de la classification du recrutement inter-domaines. En conséquence, Autre sert plutôt de catégorie de rejet hors champ que de classe industrielle substantielle. La grande précision rapportée doit être interprétée avec prudence, car le réglage à trois labels simplifie l’étiquetage et peut gonfler les performances par rapport aux taxonomies plus fines. Le protocole est conçu comme une couche d’etiquetage légère et fondée sur les connaissances pour les domaines ciblés, et non comme un remplacement des systèmes de classification multi-catégories complets. L’élargissement de l’ensemble d’étiquettes peut réduire la précision en raison d’un chevauchement accru, de l’ambiguïté et d’exigences plus strictes en matière de couverture de corpus. En pratique, l’ensemble de rejets peut être progressivement affiné en étendant le corpus de domaines et en incorporant des bases de connaissances internes. La configuration à trois étiquettes démontre donc un paradigme réutilisable plutôt qu’une taxonomie professionnelle exhaustive.

L’ensemble de données combine des sources structurées et non structurées. Le corpus structuré a été collecté et sélectionné par les auteurs à partir d’offres d’emploi publiées publiquement par des entreprises cotées sur les principales plateformes de recrutement en ligne en Chine entre 2014 et 2023. Après déduplication et nettoyage de base, le corpus structuré contient environ 6,93 millions d’annonces. Les documents de domaine non structurés publiés par les autorités compétentes ont été utilisés pour définir les connaissances du domaine et les critères d’étiquetage. À partir de ces sources, trois sous-ensembles de benchmarks ont été construits manuellement, chacun contenant respectivement 1 000 offres pour l’intelligence artificielle, la protection de l’environnement et des domaines non liés, et vérifiés pour évaluation.

Les dorsales de modèles sont évaluées à l’aide de la précision, de la précision, du rappel et de F1 (la moyenne harmonique de la précision et du rappel, F1 = 2PR/(P+R)) afin de sélectionner la base optimale pour le flux de travail augmenté par la récupération. Les documents de domaine faisant autorité sont compilés dans une base de connaissances pour la génération augmentée par récupération (RAG). Les passages pertinents sont récupérés et injectés dans un modèle de prompt fixe pour soutenir la classification. Les variantes d’invite sont testées systématiquement, et une stratégie d’optimisation par mot d’indication est appliquée pour déterminer la configuration finale. Les preuves récupérées sont filtrées pour leur pertinence afin de minimiser le bruit et de soutenir des inférences précises et efficaces.

Pour permettre une classification à grande échelle, le flux de travail adopte un pipeline par étapes : le triage guidé par lexique résout efficacement les cas routiniers, tandis que l’inférence LLM optimisée pour la recherche et optimisée pour prompts gère les publications ambiguës, équilibrant scalabilité et précision (Figure 1).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Cette étude n’a pas impliqué de participants humains ni de sujets animaux. Par conséquent, l’approbation éthique et le consentement éclairé n’étaient pas requis. Le flux de travail était exécuté dans un environnement Python 3.10 sur un système d’exploitation Windows 64 bits en utilisant le matériel, les outils et les logiciels listés dans le tableau des matériaux.

1. Mannequinat

  1. Construction de la base de données et de connaissances
    1. Rassembler et organiser un corpus structuré interne d’offres d’emploi pour des entreprises cotées en bourse provenant des principales plateformes de recrutement en ligne en Chine (2014–2023), en veillant au respect des politiques de la plateforme et des réglementations applicables. Pour chaque annonce, notez le titre de poste, la description du poste, le nom de l’entreprise, la date de publication et un identifiant unique (par exemple, identifiant ou URL de l’annonce, si disponible). Supprimez les doublons et les entrées invalides, et vérifiez que le corpus final contient environ 6,93 millions d’enregistrements.
    2. Rassemblez des documents de domaine faisant autorité liés à l’intelligence artificielle et à la protection de l’environnement, y compris les documents listés dans le Fichier Supplémentaire 1. Assurez-vous que les documents définissent les compétences, les normes de qualification, les périmètres des tâches ou les procédures réglementées.
  2. Construction de l’ensemble de données de référence
    1. Examinez manuellement l’ensemble de données structuré. Sélectionnez des offres qui représentent clairement l’intelligence artificielle, la protection de l’environnement et des domaines non liés. Incluez les cas limites pour améliorer la couverture.
    2. Étiquetez chaque offre en utilisant le titre de poste, la description du poste et les informations de l’employeur.
    3. Construisez trois sous-ensembles de benchmarks contenant chacun 1 000 offres pour l’intelligence artificielle, la protection de l’environnement et autres.
    4. Effectuez une double annotation. Assignez un annoteur pour étiqueter chaque publication et un second annotateur pour vérifier l’étiquette à l’aide d’une directive écrite.
    5. Résoudre les désaccords par discussion et jugement par un troisième annotateur.
    6. Calculer l’accord inter-annotateurs. Notez l’accord en pourcentage et κ.
    7. Conservez le jeu de données de référence vérifié pour l’évaluation du modèle.
  3. Évaluation des dorsales de modèles
    1. Évaluez les backbones LLM orientés en instruction en utilisant le même modèle de prompt et le même jeu de données de benchmark.
    2. Désactivez l’augmentation de récupération lors de la comparaison de la colonne vertébrale.
    3. Gardez la formulation des invites, les paramètres de décodage et la correspondance des étiquettes identiques entre les modèles.
    4. Calculer la précision globale, la précision par classe, le rappel et la F1.
    5. Sélectionnez la colonne vertébrale la plus performante et enregistrez sa configuration dans le tableau 1.
    6. Rapportez les résultats complets de l’évaluation dans le tableau 2.
  4. Réalisation d’entraînement encodeur adaptatif de domaine
    1. Construisez un corpus non étiqueté en utilisant uniquement les documents faisant autorité listés dans le Fichier Supplémentaire 1.
    2. Extraire le texte clair de tous les documents.
    3. Segmentez le texte en séquences d’une longueur maximale de 512 et d’une foulée de 492.
    4. Supprimer les segments de moins de 50 caractères.
    5. Assurez-vous que les publications de benchmark sont exclues de ce corpus.
    6. Initialisez les points de contrôle de la base BERT chinoise.
    7. Effectuer un préentraînement du modèle de langage masqué avec une probabilité de masquage de 0,15.
    8. Entraînez-vous pendant 3 époques avec AdamW avec un taux d’apprentissage 5e-5 et une taille de lot 2.
    9. Sauvez le point de contrôle préentraîné.
    10. Ajustez finement l’encodeur pour la classification en trois classes en utilisant un taux d’apprentissage de 2e-5, une taille de lot de 2, et une longueur maximale de séquence de 512.
    11. Fixez la graine aléatoire à 42 et appliquez une division stratifiée de validation de train.
    12. Rapport précis, précision macro-moyenne, rappel macro-moyenné, F1 macro-moyenné, métriques par classe et la matrice de confusion.
    13. Sauvegardez les résultats d’évaluation pour vérification.
  5. Construction de la chaîne de classification augmentée par récupération
    1. Construis ta base de connaissances
      1. Compiler 12 domaines d’autorité.
      2. Supprimez les versions en double ou obsolètes.
      3. Convertir les documents en texte brut.
      4. Enregistrer les métadonnées des documents, y compris l’année de publication de l’émetteur et de la publication.
      5. Divisez le texte en morceaux d’environ 1 000 caractères avec un chevauchement de 20 caractères.
      6. Notez le nombre total de chunks et la distribution de la longueur des chunks.
        REMARQUE : Revalidez la performance de récupération si la base de connaissances est étendue.
    2. Encodage et stockage des embeddings
      1. Codez tous les blocs en utilisant le modèle d’intégration et stockez les embeddings dans la base de données vectorielle.
      2. Identifiants de blocs d’archives et métadonnées de provenance.
      3. Vérifiez que le nombre de vecteurs stockés correspond au nombre de morceaux.
    3. Effectuer la récupération.
      1. Intégrez chaque offre d’emploi en utilisant le même modèle d’intégration.
      2. Effectuer la recherche de k plus proches voisins en utilisant la similarité cosinus.
      3. Appliquez le seuil de similarité τ pour filtrer les correspondances à faible pertinence.
      4. Fixer τ et top-κ après avoir accordé sur un sous-ensemble tendu.
      5. Enregistrer les identifiants de chunk récupérés et les scores de similarité.
    4. Effectuer l’inférence augmentée par récupération
      1. Insérez jusqu’à quatre extraits récupérés dans la section preuves du modèle de prompt (Fichier supplémentaire 2).
      2. Concatenez le texte de l’offre d’emploi avec les preuves récupérées.
      3. Générez l’étiquette finale de trois classes à l’aide du LLM sélectionné.
      4. Sauvegardez les journaux de récupération, les invites et les sorties de modèles.
  6. Réalisation d’un triage guidé par le lexique
    1. Lexiques de mots-clés constructifs
      1. Compilez deux lexics mots-clés : un pour l’intelligence artificielle et un pour la protection de l’environnement (fichier supplémentaire 3).
      2. Extraire les conditions des candidats à partir des offres d’emploi et des documents faisant autorité.
      3. Tokenisez le texte à l’aide de la bibliothèque de tokenisation spécifiée.
      4. Calculez les statistiques de contraste de fréquence et de domaine des termes et supprimez les termes ambigus ou trop génériques.
      5. Finaliser et archiver les lexiques.
    2. Affectations des itinéraires
      1. Appliquez une correspondance exacte de chaînes et de niveaux de jetons.
      2. Orientez les publications contenant uniquement des mots-clés d’intelligence artificielle vers la branche Intelligence Artificielle.
      3. Annonces de routes contenant uniquement des mots-clés de la Protection de l’environnement vers la branche Protection de l’environnement.
      4. Étiquetez les annonces sans correspondance comme Autres.
      5. Orientez les publications de double correspondance vers l’étape augmentée par récupération.
      6. Statistiques de routage d’enregistrements et versions lexiques.
    3. Classifier les publications ambiguës
      1. Récupérez les chunks pertinents sous des réglages fixes de top κ et τ.
      2. Injectez les preuves récupérées dans le modèle de requête.
      3. Générez l’étiquette finale et enregistrez les journaux par instance.

2. Reclassification des résultats

  1. Construction du thésaurus
    1. Construisez un thésaurus de termes d’intelligence artificielle (Fichier supplémentaire 4). Incluez des termes issus de l’apprentissage automatique, du traitement du langage naturel, de la vision par ordinateur, de la robotique et des sous-domaines connexes. Organisez les termes détaillés sous chaque catégorie.
    2. Construisez un thésaurus séparé des termes de protection de l’environnement. Incluez les bases des sciences de l’environnement, le suivi et l’analyse environnementaux, le contrôle et la gestion de la pollution, ainsi que la planification et la gestion environnementales.
    3. Ajoutez tous les termes d’intelligence artificielle et de protection de l’environnement au dictionnaire de tokenisation. Assurez-vous que ces termes sont reconnus comme des unités complètes lors de la segmentation de texte.
  2. Prétraitement du texte
    1. Supprimez les signes de ponctuation et les caractères spéciaux à l’aide d’expressions régulières. Ne conservez que le texte et les espaces.
    2. Effectuez la segmentation des mots pour diviser le texte continu en jetons individuels.
  3. Réalisation de correspondance de caractéristiques et de catégorisation
    1. Pré-traiter le texte d’entrée pour obtenir une liste de jetons segmentés.
    2. Sélectionnez le thésaurus approprié selon la classification préliminaire.
    3. Parcourez les jetons segmentés et effectuez une correspondance exacte avec les termes du thésaurus après normalisation. Appliquez le lowercase et unifiez les variantes prédéfinies avant de faire correspondre.
    4. Notez chaque terme correspondant ainsi que sa branche correspondante.
      REMARQUE : Si plusieurs branches correspondent, résoudre les égalités en utilisant une règle fixe (par exemple, le nombre de correspondances le plus élevé suivi de la plus ancienne occurrence).
    5. Exportez la liste des termes correspondants et le tag final dans le domaine pour l’agrégation en aval.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Quatre grandes dorsales de grands modèles de langage open source et ajustées aux instructions (Backbone A–D) listées dans le Table of Materials sont évaluées sur la tâche de classification des offres d’emploi en trois classes. L’évaluation est réalisée en utilisant le même protocole de test, les mêmes procédures de prétraitement et les mêmes métriques pour tous les piliers dorsales, incluant la précision globale, la précision, le rappel et la F1. Le raffinement rapide et...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Des travaux antérieurs ont appliqué l’apprentissage automatique classique et les modèles neuronaux à la catégorisation des textes de recrutement, y compris la classification des CV et des descriptions de poste, mais ces approches nécessitent souvent des données étiquetées substantielles et peuvent se dégrader lorsque la terminologie du domaine évolue. Ali et al. ont proposé un système de classification des CV utilisant des techniques de NLP et d’apprentissageautomatique...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Les auteurs n’ont rien à divulguer.

Remerciements

Les auteurs remercient leurs collègues pour leur soutien technique et leurs retours constructifs lors de la curation des données et de la préparation des manuscrits. Ce projet n’a reçu aucun financement externe.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
all-MiniLM-L6-v2 (encodeur de phrases)Visage Étreint (transformateurs de phrases)https://huggingface.co/sentence-transformers/all-MiniLM-L6-v2Modèle d’inclusion de phrases utilisé pour la vectorisation.
Bert-base-chinois (encodeur de base)Visage Câlin (google-bert)https://huggingface.co/google-bert/bert-base-chineseEncodeur de base (base BERT chinoise).
Mémoire DDR5, 16 GoConfiguration de poste de travail/ordinateur portableN/Amémoire système (16 Go de DDR5) ; Numéro de fournisseur/pièce non spécifié.
DeepSeek-R1-Distill-Qwen-7B (Épine dorsale A)Visage Étreint (deepseek-ai)https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-7BLLM backbone A.
GLM-4-9B-Chat (Épine dorsale C)Visage Câlin (zai-org)https://huggingface.co/zai-org/glm-4-9b-chat-hfLLM backbone C.
Intel Core i5-13500HX CPUIntelhttps://www.intel.com/content/www/us/en/products/sku/232156/intel-core-i513500hx-processor-24m-cache-up-to-4-70-ghz/specifications.htmlCPU de station de travail utilisé pour les expériences.
InternLM2.5-7B-Chat (Backbone D)Visage Câlin (interne)https://huggingface.co/internlm/internlm2_5-7b-chatLLM backbone D.
jieba (tokeniseur chinois)PyPI (jieba)https://pypi.org/project/jieba/bibliothèque chinoise de tokenisation/segmentation ; version non spécifiée.
Bibliothèques de mots-clés (IA & Environnemental) (Fichier complémentaire 3)Cette étudeFichier Supplément 3Les lexiques de mots-clés de domaine utilisés pour le préfiltrage guidé par lexique ; Archiver la version exacte utilisée par partie.
LanceDB (base de données vectorielle)LanceDBN/ABase de données vectorielle pour stocker/rechercher des embeddings ; version non spécifiée.
GPU portable NVIDIA GeForce RTX 4060 (8 Go de VRAM)NVIDIAhttps://www.nvidia.com/en-us/geforce/laptops/40-series/GPU utilisé pour l’inférence/expériences.
Offres d’emploi sur plateforme de recrutement en ligne (2014&ndash ; 2023)Principales plateformes de recrutement chinoises (données web publiques)N/AAnnonces d’emploi publiées collectées et sélectionnées par les auteurs ; ~6,93 millions d’annonces après nettoyage.
pip (installateur de paquets Python)PyPAN/AL’installateur de paquets utilisait pour installer des dépendances et exporter un instantané d’environnement en utilisant pip freeze.
Évolution du modèle de prompt (Fichier Supplément 2)Cette étudeFichier Supplément 2Variantes successives de prompts et la dernière invite utilisée pour l’évaluation.
Python 3.10Fondation Python SoftwareN/AInterprète d’exécution (Python 3.10) ; Version du patch non spécifiée.
Qwen2.5-7B-Instruct (Backbone B)Visage Câlin (Qwen)https://huggingface.co/Qwen/Qwen2.5-7B-InstructLLM backbone B.
Descriptions/index des champs de la base de connaissances RAG (Fichier supplémentaire 1)Cette étudeFichier Supplément 1Notes de schéma/terrain et index de documents pour la base de connaissances utilisée dans l’inférence augmentée par la récupération.
Thésaurus (IA & ; Environnemental) (Fichier complémentaire 4)Cette étudeFichier Supplément 4Dictionnaires de termes utilisés en reclassification et analyse ; Archiver la version exacte utilisée par partie.
Windows 11 (64 bits)MicrosoftN/ASystème d’exploitation (Windows 11, 64 bits) ; Version/Build non spécifiée.

Références

  1. Alekseeva, L., et al. The demand for AI skills in the labor market. Labour Economics. 71, 102002(2021).
  2. Ministry updates official dictionary of careers. , Ministry of Human Resources and Social Security of the People’s Republic of China. Available at: https://english.www.gov.cn/statecouncil/ministries/202209/30/content_WS633647bbc6d0a757729e0bb6.html (2022).
  3. BERT: Pre-training of deep bidirectional transformers for language understanding. Devlin, J., Chang, M. W., Lee, K., Toutanova, K. 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (NAACL-HLT), Minneapolis, MN, USA, , 4171-4186 (2019).
  4. Large language models in the workplace: A case study on prompt engineering for job type classification. Clavié, B., et al. 28th International Conference on Applications of Natural Language to Information Systems (NLDB 2023); , Derby, UK, , Springer. Natural Language Processing and Information Systems. Lecture Notes in Computer Science 3-17 (2023).
  5. Li, N., Kang, B., De Bie, T. LLM4Jobs: Unsupervised occupation extraction and standardization leveraging large language models. arXiv. , Available at: https://arxiv.org/abs/2309.09708 (2023).
  6. Deep learning-based computational job market analysis: A survey on skill extraction and classification from job postings. Senger, E., Zhang, M., van der Goot, R., Plank, B. 1st Workshop on Natural Language Processing for Human Resources (NLP4HR 2024), St. Julian’s, Malta, , 1-15 (2024).
  7. Enhancing job posting classification with multilingual embeddings and large language models. Kavas, H., Serra-Vidal, M., Wanner, L. 10th Italian Conference on Computational Linguistics (CLiC-it 2024), Pisa, Italy, , 440-450 (2024).
  8. JobBERT: Understanding job titles through skills. Decorte, J. J., Van Hautte, J., Demeester, T., Develder, C. International Workshop on Fair, Effective and Sustainable Talent Management using Data Science (FEAST 2021) at ECML-PKDD 2021, , (2021).
  9. Carotene: A job title classification system for the online recruitment domain. Javed, F., et al. IEEE First International Conference on Big Data Computing Service and Applications (BigDataService), , 286-293 (2015).
  10. Javed, F., McNair, M., Jacob, F., Zhao, M. Towards a job title classification system. arXiv. , Available at: https://arxiv.org/abs/1606.00917 (2016).
  11. Lewis, P., et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Presented at: Advances in Neural Information Processing Systems. NeurIPS. , (2020).
  12. The power of scale for parameter-efficient prompt tuning. Lester, B., Al-Rfou, R., Constant, N. 2021 Conference on Empirical Methods in Natural Language Processing (EMNLP), , 3045-3059 (2021).
  13. Han, X., et al. PTR: Prompt tuning with rules for text classification. AI Open. 3, 182-192 (2022).
  14. Brown, T. B., et al. Language models are few-shot learners. Presented at: Advances in Neural Information Processing Systems. NeurIPS. , (2020).
  15. Liu, P., et al. predict: A systematic survey of prompting methods in natural language processing. ACM Comput Surv. 55 (9), 195:1-195:35 (2023).
  16. Blue, A. The outlook for 2023 is uncertain, but here’s what we know about the global labour market. World Economic Forum (Agenda). , Available at: https://www.weforum.org/agenda/2023/01/the-outlook-for-2023-is-uncertain-but-here-s-what-we-know-about-the-global-labour-market-davos23 (2023).
  17. ESCOXLM-R: Multilingual taxonomy-driven pre-training for the job market domain. Zhang, M., van der Goot, R., Plank, B. 61st Annual Meeting of the Association for Computational Linguistics (ACL 2023), Toronto, Canada, , 11871-11890 (2023).
  18. Ali, I., et al. Resume classification system using natural language processing and machine learning techniques. Mehran Univ Res J Eng Technol. 41 (1), 65-79 (2022).
  19. BiLSTM for resume classification. Jalili, A., Tabrizchi, H., Razmara, J., Mosavi, A. 22nd IEEE International Symposium on Applied Machine Intelligence and Informatics (SAMI 2024), Stará Lesná, Slovakia, , (2024).
  20. Pal, R., Shaikh, S., Satpute, S., Bhagwat, S. Resume classification using various machine learning algorithms. ITM Web Conf. 44, 03011(2022).
  21. Convolutional neural network with word embedding based approach for resume classification. Nasser, S., Sreejith, C., Irshad, M. 2018 International Conference on Emerging Trends and Innovations in Engineering and Technological Research (ICETIETR 2018), , Ernakulam (Cochin), India. (2018).
  22. Real-time resume classification system using LinkedIn profile descriptions. Ramraj, S., Sivakumar, V. 2020 International Conference on Computational Intelligence for Smart Power Systems and Sustainable Energy (CISPSSE 2020), Keonjhar, Odisha, India, , (2020).
  23. Heakl, A., et al. ResumeAtlas: Revisiting resume classification with large-scale datasets and large language models. arXiv. , Available at: https://arxiv.org/abs/2406.18125 (2024).
  24. Skondras, P., Zervas, P., Tzimas, G. Generating synthetic resume data with large language models for enhanced job description classification. Future Internet. 15 (11), 363(2023).
  25. Chen, Z. Ethics and discrimination in artificial intelligence-enabled recruitment practices. Humanit Soc Sci Commun. 10, 567(2023).
  26. Retrieval-augmented few-shot text classification. Yu, G., et al. Findings of the Association for Computational Linguistics: EMNLP 2023, Singapore, , 6721-6735 (2023).
  27. Izacard, G., et al. Atlas: Few-shot learning with retrieval augmented language models. J Mach Learn Res. 24 (251), 1-43 (2023).
  28. KW-ATTN: Knowledge infused attention for accurate and interpretable text classification. Jang, H., et al. Deep Learning Inside Out (DeeLIO): 2nd Workshop on Knowledge Extraction and Integration for Deep Learning Architectures, , 96-107 (2021).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Mots-clés

Mod les r cup ration augment eListes de mots cl s de domaineConstruction de base de connaissancesR cup ration par similarit cosinusK plus proches voisinsClassification de textes chinoisAccord inter annotateurs