Se requiere una suscripción a JoVE para ver este contenido. Inicie sesión o comience su prueba gratuita.

Artículo de método

Etiquetado de texto de reclutamiento en dos etapas mediante enrutamiento guiado por léxico y modelos de lenguaje grandes aumentados con recuperación

136 vistas

DOI:

10.3791/70153

8 de mayo de 2026

En este artículo

Resumen

Se describe un flujo de trabajo en dos etapas para clasificar los textos de reclutamiento en Inteligencia Artificial, Protección Ambiental u Otros. La triaje guiada por Lexicon asigna casos rutinarios, mientras que la inferencia de modelos de lenguaje grandes optimizados para la recuperación y prompts resuelve casos ambiguos, permitiendo un etiquetado preciso a gran escala y una síntesis descriptiva posterior del mercado laboral.

Resumen

Los textos de reclutamiento son heterogéneos y la terminología de los dominios evoluciona con el tiempo, dificultando el etiquetado a gran escala debido a la capacidad limitada de anotación manual. Este protocolo proporciona un flujo de trabajo reproducible en dos etapas para clasificar textos de reclutamiento chinos en Inteligencia Artificial, Protección Ambiental u Otros. La primera etapa realiza una triaje guiada por léxico utilizando dos listas de palabras clave de dominio seleccionadas. Las publicaciones que coinciden con un solo léxico de dominio están etiquetadas directamente. Las publicaciones que coinciden con ninguno de los dos léxicos se etiquetan como Otros, mientras que las de doble coincidencia se redirigen a la segunda fase. La segunda etapa aplica la inferencia de grandes modelos de lenguaje aumentados por recuperación. Una base de conocimiento compilada a partir de 12 documentos de dominio autorizados se convierte en texto, se divide en fragmentos de unos 1.000 caracteres con solapamiento de 20 caracteres, se incrusta usando todo MiniLM-L6-v2 e indexa en LanceDB. Para cada publicación incierta, la recuperación de k-vecinos más cercanos con similitud coseno-devuelve bloques candidatos filtrados por un umbral mínimo de similitud (τ), y hasta cuatro fragmentos se inyectan en una plantilla fija de prompt que define los límites de la etiqueta y limita la salida a una sola etiqueta. Un conjunto de referencia de 3.000 publicaciones se verifica manualmente, con 1.000 publicaciones por clase, y logra un acuerdo interanotador del 95,0 % y un kappa de Cohen (κ) de aproximadamente 0,93. La evaluación compara múltiples modelos de lenguaje grandes de código abierto en un entorno solo con prompts y en un entorno aumentado de recuperación usando Qwen2.5-7B-Instruct. La configuración aumentada por recuperación alcanza un 98,47 % de precisión y soporta etiquetado a escala de corpus de aproximadamente 6,93 millones de publicaciones para agregación descriptiva posterior.

Introducción

En los últimos años, con el rápido desarrollo de la IA y las tecnologías medioambientales, han surgido numerosas carreras emergentes. Por un lado, el mercado laboral global está saturado de muchos puestos nuevos basados en la IA y la sostenibilidad. La evidencia basada en vacantes documenta una rápida expansión de la demanda de habilidades relacionadas con IA, lo que incrementa la heterogeneidad de los textos de reclutamiento y motiva un protocolo de etiquetado de dominio reproducibley escalable 1. Por otro lado, la última revisión china del Diccionario de Clasificación Ocupacional (OCD) ha visto un crecimiento igualmente robusto de nuevas ocupaciones en los campos de la informatización del empleo y de las emisiones verdes y bajas en carbono, con un aumento neto de 158 nuevas ocupaciones en la revisión de 2022 en comparación con la edición de 2015 del Diccionario, con un total de 97 ocupaciones digitales. o el 6% del número total de ocupaciones, etiquetadas, junto con 134 ocupaciones verdes, o el 8% del total deocupaciones 2.

A medida que estas nuevas ocupaciones siguen surgiendo, el contenido y la forma de las ofertas de empleo por parte de las empresas se vuelven más complejos, ya que las descripciones de trabajo suelen incluir conocimientos de la materia y diversos requisitos de habilidades, incluyendo tanto campos estructurados como títulos de puesto y listas de habilidades, como un gran número de descripciones libres no estructuradas, lo que resulta en estructuras de ofertas cada vez más complejas. Estas ofertas de trabajo complejas suelen contener elementos estructurados claramente definidos (por ejemplo, títulos de puesto, listas de habilidades requeridas) junto con extensas descripciones libres no estructuradas. Por ejemplo, un anuncio de trabajo para ingeniero de IA podría incluir jerga técnica como 'competencia en un marco de aprendizaje profundo' y 'experiencia optimizando algoritmos de retropropagación' como parte de una lista de habilidades, además de incluir una narración detallada de responsabilidades; De manera similar, una oferta de ingeniero ambiental podría hacer referencia a normas y certificaciones regulatorias específicas. Esta combinación de contenido estructurado y no estructurado da lugar a descripciones de puesto altamente especializadas y enrevesadas.

Se seleccionan Inteligencia Artificial y Protección Ambiental para evaluar el protocolo bajo ambigüedad realista entre dominios en la clasificación de reclutamiento. En la práctica, los recursos ocupacionales convencionales como O*NET y los portales de empleo asignan etiquetas groseras, lo que dificulta distinguir roles intersectoriales solo con palabras clave. La Protección Ambiental representa un dominio amplio que se solapa con múltiples campos científicos, mientras que la Inteligencia Artificial refleja una parte más detallada dentro de la informática que a menudo se confunde con roles generales de software. Este emparejamiento captura tanto entornos multidominio amplios como estrechos con terminología distinta y documentos autorizados adecuados para la construcción de bases de conocimiento, permitiendo la adaptación a otras industrias reemplazando el corpus de dominio sin alterar el flujo de trabajo central.

En los últimos años se ha visto un aumento en la investigación sobre la clasificación de ofertas de empleo. Los investigadores están aprovechando cada vez más grandes modelos preentrenados para mejorar la clasificación de las ocupaciones. La introducción de BERT en 2019 supuso un avance que permitió una comprensión profunda del lenguaje contextual y mejoró significativamente el rendimiento en la clasificaciónde textos. Por ejemplo, Clavié et al. (2023) exploraron el uso de un modelo de lenguaje grande (LLM) ajustado por instrucciones para la clasificación de puestos, encontrando que la ingeniería de prompts adecuada permitía al LLM superar a modelos supervisados de última generación en una tarea4 de clasificación de puestos para graduados. De manera similar, Li et al. (2023) propusieron un enfoque LLM4Jobs que combina la resumen de modelos de lenguaje grande con la coincidencia de códigos de ocupación, mejorando significativamente la precisión de clasificación en descripciones de puesto extensas al extraer primero resúmenes y luego alinearlos con los códigos estándarde trabajo 5. Además, una encuesta de 2024 realizada por Senger et al. cataloga los avances recientes en aprendizaje profundo para RRHH, señalando que la extracción de habilidades y la clasificación de puestos se han convertido en tareas clave en el análisis computacional del mercadolaboral 6. Kavas et al. (2024) mejoraron la clasificación de ofertas de empleo combinando incrustaciones de texto multilingües con categorización basada en LLM, logrando notables mejoras de precisión7. En el ámbito tradicional, los sistemas anteriores iban desde heurísticas basadas en palabras clave con conjuntos de categorías relativamente gruesas hasta marcos basados en taxonomías como el caroteno, que utilizaba una jerarquía sobre más de 4.000 títulos de puesto 8,9. Javed et al. (2016) presentaron un marco temprano de clasificación de títulos de puesto, marcando uno de los primeros pasos hacia la categorización sistemática deocupaciones 10. Sin embargo, estos enfoques supervisados requieren datos etiquetados extensos y tienen dificultades para adaptarse a la rápida aparición de nuevos puestos laborales, ya que las taxonomías de clasificación suelen evolucionar más lentamente que el mercadolaboral 4.

Para abordar estas limitaciones, el trabajo reciente se ha centrado en estrategias híbridas que incorporan conocimientos externos; por ejemplo, Lewis et al. (2020) introdujeron el marco de Generación Aumentada por Recuperación (RAG), que combina modelos de lenguaje preentrenados con un recuperador para inyectar conocimiento relevante del dominio, logrando una precisión superior y resultados más fácticos en tareas intensivas en conocimiento11. Lester et al. demostraron que el ajuste rápido produce mayores mejoras de rendimiento a medida que el tamaño del modeloaumenta 12, reforzando el uso de un LLM base fuerte. Por ejemplo, Han et al. demostraron que el uso de prompts guiados por reglas puede aumentar la precisión de la clasificación de texto al centrar el modelo en características clave13. Además, Brown et al. (2020) demostraron de forma célebre que un modelo de lenguaje grande puede realizar nuevas tareas a partir de solo unos pocos ejemplos o instrucciones, destacando el poder del aprendizaje poco-shot impulsado porprompts 14. Cabe destacar que una encuesta reciente sobre técnicas de PLN basadas en prompts subraya que la redacción de prompts puede orientar significativamente los resultados delmodelo 15. Al mismo tiempo, los cambios a nivel macro y la incertidumbre en el mercado laboral refuerzan la necesidad de protocolos de etiquetado escalables y amigables para actualizaciones que puedan actualizarse a medida que surjan nuevosroles 16. En el ámbito de la PLN en el mercado laboral, también se ha explorado la preformación multilingüe basada en la taxonomía para alinear mejor las representaciones con las estructuras ocupacionales y la variabilidadinterlingüe 17. En conjunto, estos estudios informan el enfoque y demuestran el potencial de utilizar grandes modelos de lenguaje con recuperación y optimización por prompts para reconocer y adaptarse de forma más eficaz a contextos laborales emergentes.

En este estudio, el conocimiento del dominio está curado únicamente para la Inteligencia Artificial y la Protección Ambiental, ya que la construcción, validación y mantenimiento de corpus representan los principales costes operativos de la clasificación de reclutamiento entre dominios. Por tanto, Otros sirve como una categoría de rechazo fuera del alcance más que como una clase industrial sustantiva. La alta precisión reportada debe interpretarse con cautela, ya que el ajuste de tres etiquetas simplifica el etiquetado y puede inflar el rendimiento en comparación con taxonomías de grano más fino. El protocolo está pensado como una capa ligera y basada en conocimiento para dominios específicos, no como un sustituto de sistemas completos de clasificación multicategoría. Ampliar el conjunto de etiquetas puede reducir la precisión debido a un mayor solapamiento, ambigüedad y requisitos más estrictos de cobertura de corpus. En la práctica, el conjunto de rechazos puede refinarse progresivamente ampliando el corpus de dominio e incorporando bases de conocimiento internas. Por tanto, la configuración de tres etiquetas demuestra un paradigma reutilizable más que una taxonomía ocupacional exhaustiva.

El conjunto de datos combina fuentes estructuradas y no estructuradas. El corpus estructurado fue recopilado y seleccionado por los autores a partir de anuncios de empleo publicados públicamente por empresas cotizadas en las principales plataformas de reclutamiento online de China entre 2014 y 2023. Tras la deduplicación y la limpieza básica, el corpus estructurado contiene aproximadamente 6,93 millones de anuncios. Se utilizaron documentos de dominio no estructurados publicados por las autoridades competentes para definir el conocimiento del dominio y los criterios de etiquetado. A partir de estas fuentes, se construyeron manualmente tres subconjuntos de referencia, cada uno con 1.000 ofertas para Inteligencia Artificial, Protección Ambiental y campos no relacionados, respectivamente, y verificadas para su evaluación.

Los esqueletes de modelos se evalúan usando precisión, precisión, recuerdo y F1 (la media armónica de precisión y recuerdo, F1 = 2PR/(P+R)) para seleccionar la base óptima para el flujo de trabajo aumentado por recuperación. Los documentos de dominio autorizados se compilan en una base de conocimiento para la generación aumentada por recuperación (RAG). Los pasajes relevantes se recuperan e inyectan en una plantilla fija de prompt para soportar la clasificación. Las variantes de prompt se prueban sistemáticamente y se aplica una estrategia de optimización por palabra señal para determinar la configuración final. La evidencia recuperada se filtra para su relevancia y minimizar el ruido y apoyar inferencias precisas y eficientes.

Para permitir una clasificación a gran escala, el flujo de trabajo adopta una cadena de procesos por etapas: la triaje guiada por léxico resuelve eficientemente los casos rutinarios, mientras que la inferencia LLM optimizada para la recuperación y prompt gestiona publicaciones ambiguas, equilibrando escalabilidad y precisión (Figura 1).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Este estudio no incluyó participantes humanos ni sujetos animales. Por lo tanto, no se requería la aprobación ética ni el consentimiento informado. El flujo de trabajo se ejecutaba en un entorno Python 3.10 en un sistema operativo Windows de 64 bits utilizando el hardware, las herramientas y el software listados en la Tabla de Materiales.

1. Modelaje

  1. Construcción de la base de datos y conocimiento
    1. Recopilar y curar un corpus estructurado interno de anuncios de empleo para empresas cotizadas en bolsa procedentes de las principales plataformas de reclutamiento online en China (2014–2023), asegurando el cumplimiento de las políticas de la plataforma y la normativa aplicable. Para cada oferta, registra el título del puesto, la descripción del puesto, el nombre de la empresa, la fecha de publicación y un identificador único (por ejemplo, ID o URL, si está disponible). Elimina duplicados y entradas inválidas, y verifica que el corpus final contiene aproximadamente 6,93 millones de registros.
    2. Recopilar documentos de dominio autorizados relacionados con Inteligencia Artificial y Protección Ambiental, incluidos los documentos listados en el Archivo Suplementario 1. Asegúrate de que los documentos definan competencias, estándares de cualificación, ámbitos de tareas o procedimientos regulados.
  2. Construcción del conjunto de datos de referencia
    1. Filtra manualmente el conjunto de datos estructurado. Selecciona ofertas que representen claramente Inteligencia Artificial, Protección Ambiental y campos no relacionados. Incluye casos límite para mejorar la cobertura.
    2. Etiqueta cada oferta usando el título del puesto, la descripción del puesto y la información del empleador.
    3. Construye tres subconjuntos de referencia que contengan 1.000 ofertas cada uno para Inteligencia Artificial, Protección Ambiental y Otros.
    4. Realiza anotación dual. Asigna un anotador para etiquetar cada publicación y un segundo para verificar la etiqueta usando una guía escrita.
    5. Resuelve los desacuerdos mediante la discusión y la resolución por un tercer anotador.
    6. Calcular el acuerdo entre anotadores. Anota el porcentaje de concordancia y κ.
    7. Conserva el conjunto de datos de referencia verificado para la evaluación del modelo.
  3. Evaluación de los esqueletes de modelos
    1. Evalúa los backbones de los LLM ajustados a instrucciones usando la misma plantilla de prompts y conjunto de datos de referencia.
    2. Desactiva la mejora de recuperación durante la comparación de la columna vertebral.
    3. Mantén la redacción de los prompts, los parámetros de decodificación y el mapeo de etiquetas idénticos entre modelos.
    4. Calcula la precisión general, la precisión por clase, la recuperación y la F1.
    5. Selecciona la columna vertebral que mejor rinde y registra su configuración en la Tabla 1.
    6. Informe los resultados completos de la evaluación en la Tabla 2.
  4. Realización de entrenamiento de codificadores adaptativos de dominio
    1. Construye un corpus sin etiqueta usando únicamente los documentos autorizados listados en el Archivo Suplementario 1.
    2. Extrae texto plano de todos los documentos.
    3. Segmenta el texto en secuencias con una longitud máxima de 512 y una zancada de 492.
    4. Descarta segmentos de menos de 50 caracteres.
    5. Asegúrate de que las publicaciones de referencia estén excluidas de este corpus.
    6. Inicializar los puntos de control de la base BERT china.
    7. Realizar el preentrenamiento del modelo de lenguaje enmascarado con probabilidad de enmascaramiento 0,15.
    8. Entrena durante 3 épocas usando AdamW con tasa de aprendizaje 5e-5 y tamaño de lote 2.
    9. Guarda el punto de control preentrenado.
    10. Ajusta finamente el codificador para la clasificación de tres clases usando una tasa de aprendizaje de 2e-5, un tamaño de lote de 2 y una longitud máxima de secuencia de 512.
    11. Fija la semilla aleatoria a 42 y aplica la división estratificada de validación de trenes.
    12. Precisión del informe, precisión macropromediada, recuerdo macropromediado, F1 macropromediada, métricas por clase y la matriz de confusión.
    13. Guarda los resultados de la evaluación para verificación.
  5. Construcción de la cadena de Clasificación Aumentada por Recuperación
    1. Construye la base de conocimientos
      1. Compila 12 dominios autorizados.
      2. Elimina versiones duplicadas o desactualizadas.
      3. Convierte documentos a texto plano.
      4. Registrar los metadatos del documento, incluyendo el emisor y el año de publicación.
      5. Divide el texto en fragmentos de aproximadamente 1.000 caracteres con solapamiento de 20 caracteres.
      6. Registra el número total de bloques y la distribución de la longitud de los fragmentos.
        NOTA: Revalida el rendimiento de recuperación si se amplía la base de conocimiento.
    2. Incrustaciones de codificación y almacenamiento
      1. Codifica todos los chunks usando el modelo de incrustación y almacena los embeddings en la base de datos vectorial.
      2. Identificadores de fragmentos de archivo y metadatos de procedencia.
      3. Verifica que el número de vectores almacenados coincida con el número de fragmentos.
    3. Realiza la recuperación.
      1. Incrusta cada oferta de empleo usando el mismo modelo de incrustación.
      2. Realiza la búsqueda de k vecinos más cercanos usando similitud coseno.
      3. Aplica el umbral de similitud τ para filtrar coincidencias de baja relevancia.
      4. Fija τ y top-κ tras afinar en un subconjunto extendido.
      5. Registro de identificadores de fragmentos recuperados y puntuaciones de similitud.
    4. Realizar inferencia aumentada por recuperación
      1. Inserta hasta cuatro fragmentos recuperados en la sección de evidencia de la plantilla de prompt (Archivo Suplementario 2).
      2. Concatena el texto de la oferta de trabajo con la evidencia recuperada.
      3. Genera la etiqueta final de tres clases usando el LLM seleccionado.
      4. Guarda registros de recuperación, prompts y salidas de modelos.
  6. Realización de triaje guiado por el léxico
    1. Léxicos de palabras clave constructos
      1. Compila dos léxicos de palabras clave: uno para Inteligencia Artificial y otro para Protección Ambiental (Archivo Suplementario 3).
      2. Extrae términos de candidatos de ofertas de empleo y documentos autorizados.
      3. Tokeniza texto usando la biblioteca de tokenización especificada.
      4. Calcular las estadísticas de contraste de frecuencia y dominio de los términos y eliminar términos ambiguos o demasiado genéricos.
      5. Finaliza y archiva los léxicos.
    2. Asignaciones de rutas
      1. Aplica coincidencia exacta de cadenas y niveles de token.
      2. Enruta las publicaciones que contienen solo palabras clave de Inteligencia Artificial a la rama de Inteligencia Artificial.
      3. Publicaciones de ruta que contienen solo palabras clave de Protección Ambiental a la rama de Protección Ambiental.
      4. Etiqueta las ofertas sin coincidencia como Otros.
      5. Enruta las publicaciones de doble coincidencia al paso con recuperación aumentada.
      6. Estadísticas de enrutamiento de registros y versiones del léxico.
    3. Clasificar publicaciones ambiguas
      1. Recuperar los fragmentos relevantes bajo ajustes fijos de top-κ y τ.
      2. Inyecta la evidencia recuperada en la plantilla de prompt.
      3. Genera la etiqueta final y guarda los registros por instancia.

2. Reclasificación de resultados

  1. Construcción del tesauro
    1. Construye un tesauro de términos de Inteligencia Artificial (Archivo Suplementario 4). Incluye términos de aprendizaje automático, procesamiento de lenguaje natural, visión por ordenador, robótica y subcampos relacionados. Organiza los términos detallados bajo cada categoría.
    2. Construye un tesauro separado de términos de Protección Ambiental. Incluye fundamentos de ciencias ambientales, monitorización y análisis ambiental, control y gestión de la contaminación, y planificación y gestión ambiental.
    3. Añade todos los términos de Inteligencia Artificial y Protección Ambiental al diccionario de tokenización. Asegúrate de que estos términos sean reconocidos como unidades completas durante la segmentación de texto.
  2. Preprocesamiento de texto
    1. Elimina signos de puntuación y caracteres especiales usando expresiones normales. Conserva solo el texto y los espacios.
    2. Realiza segmentación de palabras para dividir el texto continuo en tokens individuales.
  3. Realización de coincidencias de características y categorización
    1. Preprocesa el texto de entrada para obtener una lista de tokens segmentados.
    2. Selecciona el diccionario de sinónimos adecuado según la clasificación preliminar.
    3. Recorren los tokens segmentados y realizan coincidencias exactas con los términos del tesauro tras la normalización. Aplica lowermining y unifica variantes predefinidas antes de emparejar.
    4. Registra cada término emparejado y su rama correspondiente del tesauro.
      NOTA: Si varias ramas coinciden, resuelve los empates usando una regla fija (por ejemplo, el mayor número de coincidencias seguido de la aparición más temprana).
    5. Exporta la lista de términos emparejados y la etiqueta final dentro del dominio para la agregación downstream.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Cuatro grandes esquemas de grandes modelos de lenguaje de código abierto y ajustados a instrucciones (Backbone A–D) listados en la Tabla de Materiales se comparan en la tarea de clasificación de ofertas de empleo de tres clases. La evaluación se realiza utilizando el mismo protocolo de prueba, procedimientos de preprocesamiento y métricas en todas las columnas, incluyendo precisión general, exactitud, recuperación y F1. Posteriormente, se aplican refinamientos rápidos y ...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Trabajos previos han aplicado modelos clásicos de aprendizaje automático y neuronales a la categorización de textos de reclutamiento, incluyendo la clasificación de currículums y descripciones de puesto, pero estos enfoques suelen requerir datos etiquetados sustanciales y pueden degradarse cuando la terminología del dominio cambia. Ali et al. propusieron un sistema de clasificación de currículums utilizando PNL y técnicas de aprendizaje automático18. Jalili et al....

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Los autores no tienen nada que revelar.

Agradecimientos

Los autores agradecen a sus colegas el apoyo técnico y la respuesta constructiva durante la curación de datos y la preparación de manuscritos. Este proyecto no recibió financiación externa.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
all-MiniLM-L6-v2 (codificador de frase)Cara Abrazando (transformadores de frase)https://huggingface.co/sentence-transformers/all-MiniLM-L6-v2Modelo de incrustación de oraciones utilizado para vectorización.
Bert-base-chino (codificador de línea base)Cara de Abrazo (google-bert)https://huggingface.co/google-bert/bert-base-chineseCodificador de línea base (base BERT china).
Memoria DDR5, 16 GBConfiguración de estaciones de trabajo/portátilesN/Amemoria del sistema (16 GB DDR5); Número de proveedor o de pieza no especificado.
DeepSeek-R1-Distill-Qwen-7B (Columna vertebral A)Cara de Abrazo (deepseek-ai)https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-7BLLM backbone A.
GLM-4-9B-Chat (Columna vertebral C)Cara de Abrazo (zai-org)https://huggingface.co/zai-org/glm-4-9b-chat-hfColumna vertebral de LLM C.
Intel Core i5-13500HX CPUIntelhttps://www.intel.com/content/www/us/en/products/sku/232156/intel-core-i513500hx-processor-24m-cache-up-to-4-70-ghz/specifications.htmlCPU de estación de trabajo usada para experimentos.
InternLM2.5-7B-Chat (Backbone D)Cara de Abrazo (interior)https://huggingface.co/internlm/internlm2_5-7b-chatLLM backbone D.
jieba (tokenizador chino)PyPI (jieba)https://pypi.org/project/jieba/biblioteca china de tokenización/segmentación; Versión no especificada.
Bibliotecas de palabras clave (IA y Medioambiental) (Archivo de suplementos 3)Este estudioArchivo de Suplemento 3Léxicos de palabras clave de dominio usados para el prefiltrado guiado por léxicos; Archivar versión exacta usada por partida.
LanceDB (base de datos vectorial)LanceDBN/ABase de datos vectorial para almacenar/buscar incrustaciones; Versión no especificada.
GPU para portátil NVIDIA GeForce RTX 4060 (8 GB de VRAM)NVIDIAhttps://www.nvidia.com/en-us/geforce/laptops/40-series/GPU usada para inferencias/experimentos.
Ofertas de empleo en plataformas de reclutamiento online (2014– 2023)Principales plataformas chinas de reclutamiento (datos web públicos)N/AAnuncios de empleo publicados y recopilados por los autores; ~6,93 millones de anuncios tras limpiar.
pip (instalador de paquetes en Python)PyPAN/AInstalador de paquetes utilizado para instalar dependencias y exportar una instantánea del entorno usando pip freeze.
Evolución de plantillas de prompts (Archivo de suplemento 2)Este estudioArchivo Suplemento 2Variantes sucesivas de la indicación y la última consigna utilizada para la evaluación.
Python 3.10Fundación de Software PythonN/AIntérprete de ejecución (Python 3.10); Versión del parche no especificada.
Qwen2.5-7B-Instruct (Columna B B)Cara de Abrazo (Qwen)https://huggingface.co/Qwen/Qwen2.5-7B-InstructLLM columna vertebral B.
Descripciones/índice de campos de la base de conocimiento RAG (Archivo Suplemento 1)Este estudioArchivo Suplemento 1Notas de esquema/campo e índice de documentos para la base de conocimiento utilizada en la inferencia aumentada por recuperación.
Tesauro (IA y I; Ambiental) (Archivo Suplemento 4)Este estudioArchivo de suplemento 4Diccionarios de términos usados en la reclasificación y análisis; Archivar versión exacta usada por partida.
Windows 11 (64 bits)MicrosoftN/ASistema operativo (Windows 11, 64 bits); Construcción/versión no especificada.

Referencias

  1. Alekseeva, L., et al. The demand for AI skills in the labor market. Labour Economics. 71, 102002(2021).
  2. Ministry updates official dictionary of careers. , Ministry of Human Resources and Social Security of the People’s Republic of China. Available at: https://english.www.gov.cn/statecouncil/ministries/202209/30/content_WS633647bbc6d0a757729e0bb6.html (2022).
  3. BERT: Pre-training of deep bidirectional transformers for language understanding. Devlin, J., Chang, M. W., Lee, K., Toutanova, K. 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (NAACL-HLT), Minneapolis, MN, USA, , 4171-4186 (2019).
  4. Large language models in the workplace: A case study on prompt engineering for job type classification. Clavié, B., et al. 28th International Conference on Applications of Natural Language to Information Systems (NLDB 2023); , Derby, UK, , Springer. Natural Language Processing and Information Systems. Lecture Notes in Computer Science 3-17 (2023).
  5. Li, N., Kang, B., De Bie, T. LLM4Jobs: Unsupervised occupation extraction and standardization leveraging large language models. arXiv. , Available at: https://arxiv.org/abs/2309.09708 (2023).
  6. Deep learning-based computational job market analysis: A survey on skill extraction and classification from job postings. Senger, E., Zhang, M., van der Goot, R., Plank, B. 1st Workshop on Natural Language Processing for Human Resources (NLP4HR 2024), St. Julian’s, Malta, , 1-15 (2024).
  7. Enhancing job posting classification with multilingual embeddings and large language models. Kavas, H., Serra-Vidal, M., Wanner, L. 10th Italian Conference on Computational Linguistics (CLiC-it 2024), Pisa, Italy, , 440-450 (2024).
  8. JobBERT: Understanding job titles through skills. Decorte, J. J., Van Hautte, J., Demeester, T., Develder, C. International Workshop on Fair, Effective and Sustainable Talent Management using Data Science (FEAST 2021) at ECML-PKDD 2021, , (2021).
  9. Carotene: A job title classification system for the online recruitment domain. Javed, F., et al. IEEE First International Conference on Big Data Computing Service and Applications (BigDataService), , 286-293 (2015).
  10. Javed, F., McNair, M., Jacob, F., Zhao, M. Towards a job title classification system. arXiv. , Available at: https://arxiv.org/abs/1606.00917 (2016).
  11. Lewis, P., et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Presented at: Advances in Neural Information Processing Systems. NeurIPS. , (2020).
  12. The power of scale for parameter-efficient prompt tuning. Lester, B., Al-Rfou, R., Constant, N. 2021 Conference on Empirical Methods in Natural Language Processing (EMNLP), , 3045-3059 (2021).
  13. Han, X., et al. PTR: Prompt tuning with rules for text classification. AI Open. 3, 182-192 (2022).
  14. Brown, T. B., et al. Language models are few-shot learners. Presented at: Advances in Neural Information Processing Systems. NeurIPS. , (2020).
  15. Liu, P., et al. predict: A systematic survey of prompting methods in natural language processing. ACM Comput Surv. 55 (9), 195:1-195:35 (2023).
  16. Blue, A. The outlook for 2023 is uncertain, but here’s what we know about the global labour market. World Economic Forum (Agenda). , Available at: https://www.weforum.org/agenda/2023/01/the-outlook-for-2023-is-uncertain-but-here-s-what-we-know-about-the-global-labour-market-davos23 (2023).
  17. ESCOXLM-R: Multilingual taxonomy-driven pre-training for the job market domain. Zhang, M., van der Goot, R., Plank, B. 61st Annual Meeting of the Association for Computational Linguistics (ACL 2023), Toronto, Canada, , 11871-11890 (2023).
  18. Ali, I., et al. Resume classification system using natural language processing and machine learning techniques. Mehran Univ Res J Eng Technol. 41 (1), 65-79 (2022).
  19. BiLSTM for resume classification. Jalili, A., Tabrizchi, H., Razmara, J., Mosavi, A. 22nd IEEE International Symposium on Applied Machine Intelligence and Informatics (SAMI 2024), Stará Lesná, Slovakia, , (2024).
  20. Pal, R., Shaikh, S., Satpute, S., Bhagwat, S. Resume classification using various machine learning algorithms. ITM Web Conf. 44, 03011(2022).
  21. Convolutional neural network with word embedding based approach for resume classification. Nasser, S., Sreejith, C., Irshad, M. 2018 International Conference on Emerging Trends and Innovations in Engineering and Technological Research (ICETIETR 2018), , Ernakulam (Cochin), India. (2018).
  22. Real-time resume classification system using LinkedIn profile descriptions. Ramraj, S., Sivakumar, V. 2020 International Conference on Computational Intelligence for Smart Power Systems and Sustainable Energy (CISPSSE 2020), Keonjhar, Odisha, India, , (2020).
  23. Heakl, A., et al. ResumeAtlas: Revisiting resume classification with large-scale datasets and large language models. arXiv. , Available at: https://arxiv.org/abs/2406.18125 (2024).
  24. Skondras, P., Zervas, P., Tzimas, G. Generating synthetic resume data with large language models for enhanced job description classification. Future Internet. 15 (11), 363(2023).
  25. Chen, Z. Ethics and discrimination in artificial intelligence-enabled recruitment practices. Humanit Soc Sci Commun. 10, 567(2023).
  26. Retrieval-augmented few-shot text classification. Yu, G., et al. Findings of the Association for Computational Linguistics: EMNLP 2023, Singapore, , 6721-6735 (2023).
  27. Izacard, G., et al. Atlas: Few-shot learning with retrieval augmented language models. J Mach Learn Res. 24 (251), 1-43 (2023).
  28. KW-ATTN: Knowledge infused attention for accurate and interpretable text classification. Jang, H., et al. Deep Learning Inside Out (DeeLIO): 2nd Workshop on Knowledge Extraction and Integration for Deep Learning Architectures, , 96-107 (2021).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Etiquetas

Modelos con Recuperaci n AumentadaListas de Palabras Clave de DominioConstrucci n de Bases de ConocimientosRecuperaci n por Similitud del CosenoK Vecinos M s CercanosClasificaci n de Textos en ChinoAcuerdo Inter Anotador