É necessária uma assinatura do JoVE para visualizar este conteúdo. Faça login ou inicie seu teste gratuito.

Artigo de método

Rotulagem de texto de recrutamento em dois estágios via roteamento guiado por léxico e modelos de linguagem grandes aumentados por recuperação

136 vistas

DOI:

10.3791/70153

8 de maio de 2026

Neste artigo

Resumo

Um fluxo de trabalho em duas etapas é descrito para classificar textos de recrutamento em Inteligência Artificial, Proteção Ambiental ou Outros. A triagem guiada por léxico atribui casos rotineiros, enquanto a inferência de grandes modelos de linguagem otimizada para prompts e aprimorada por recuperação resolve casos ambíguos, permitindo rotulagem precisa em larga escala e resumo descritivo do mercado de trabalho a jusante.

Resumo

Os textos de recrutamento são heterogêneos, e a terminologia dos domínios evolui com o tempo, dificultando a rotulagem em larga escala devido à capacidade limitada de anotação manual. Esse protocolo oferece um fluxo de trabalho reproduzível em duas etapas para classificar textos de recrutamento chineses em Inteligência Artificial, Proteção Ambiental ou Outros. A primeira etapa realiza triagem guiada por léxico usando duas listas de palavras-chave de domínio selecionadas. Anúncios que correspondem a apenas um léxico de domínio são diretamente rotulados. As postagens que não correspondem a nenhum dos léxicos são rotuladas como Outros, enquanto as de dupla correspondência são encaminhadas para a segunda etapa. A segunda etapa aplica inferência de grandes modelos de linguagem aumentados por recuperação. Uma base de conhecimento compilada a partir de 12 documentos de domínio autoritativos é convertida em texto, dividida em blocos de cerca de 1.000 caracteres com sobreposição de 20 caracteres, incorporada usando todo o MiniLM-L6-v2 e indexada em LanceDB. Para cada postagem incerta, a recuperação de k-vizinhos mais próximos com similaridade cosseno retorna chunks candidatos filtrados por um limiar mínimo de similaridade (τ), e até quatro chunks são injetados em um template fixo de prompt que define limites de rótulos e restringe a saída a um único rótulo. Um conjunto de referência de 3.000 postagens é verificado manualmente, com 1.000 postagens por classe, alcançando um acordo inter-anotadores de 95,0% e um kappa de Cohen (κ) de cerca de 0,93. A avaliação compara múltiplos modelos de linguagem grandes de código aberto em um cenário apenas de prompt e em um cenário aumentado por recuperação usando Qwen2.5-7B-Instruct. A configuração aumentada por recuperação alcança 98,47% de precisão e suporta rotulagem em escala de corpus de cerca de 6,93 milhões de postagens para agregação descritiva downstream.

Introdução

Nos últimos anos, com o rápido desenvolvimento da IA e das tecnologias ambientais, surgiu um grande número de carreiras emergentes. Por um lado, o mercado de trabalho global está inundado com muitas novas vagas baseadas em IA e sustentabilidade. Evidências baseadas em vagas documentam uma rápida expansão na demanda por habilidades relacionadas à IA, o que aumenta a heterogeneidade dos textos de recrutamento e motiva um protocolo de marcação de domínioreproduzível e escalável 1. Por outro lado, a última revisão chinesa do Dicionário de Classificação Ocupacional (OCD) apresentou um crescimento igualmente robusto em novas ocupações nas áreas de informatização do emprego e de sustentabilidade verde e baixo carbono, com um aumento líquido de 158 novas ocupações na revisão de 2022 em comparação com a edição de 2015 do Dicionário, totalizando 97 ocupações digitais. ou 6% do total de ocupações, rotuladas, junto com 134 ocupações verdes, ou 8% do total de ocupações2.

À medida que essas novas ocupações continuam a surgir, o conteúdo e a forma das vagas de emprego das empresas estão se tornando mais complexos, já que as descrições de vagas frequentemente envolvem conhecimento por matéria e diversos requisitos de habilidades, contendo tanto áreas estruturadas como títulos de cargos e listas de habilidades, quanto um grande número de descrições não estruturadas em texto livre, resultando em estruturas de anúncios cada vez mais complexas. Essas vagas complexas normalmente contêm elementos estruturados claramente definidos (por exemplo, cargos, listas de habilidades exigidas) junto com extensas descrições não estruturadas em texto livre. Por exemplo, um anúncio de emprego para engenheiro de IA pode listar jargões técnicos como 'proficiência em um framework de deep learning' e 'experiência otimizando algoritmos de retropropagação' como parte de uma lista de habilidades, além de incluir uma narrativa detalhada de responsabilidades; Da mesma forma, uma vaga de engenheiro ambiental pode fazer referência a padrões regulatórios e certificações específicas. Essa combinação de conteúdo estruturado e não estruturado resulta em descrições de cargos altamente especializadas e complexas.

Inteligência Artificial e Proteção Ambiental são selecionadas para avaliar o protocolo sob ambiguidade realista entre domínios na classificação de recrutamento. Na prática, recursos ocupacionais tradicionais como O*NET e portais de emprego atribuem tags grosseiras, tornando difícil distinguir papéis intersetores apenas com palavras-chave. A Proteção Ambiental representa um domínio amplo que se sobrepõe a múltiplos campos científicos, enquanto a Inteligência Artificial reflete uma fatia mais detalhada dentro da computação frequentemente confundida com papéis gerais de software. Esse emparelhamento captura tanto contextos amplos quanto restritos entre domínios, com terminologia distinta e documentos autoritativos adequados para a construção de bases de conhecimento, permitindo a adaptação a outras indústrias ao substituir o corpus de domínio sem alterar o fluxo de trabalho principal.

Nos últimos anos, houve um aumento nas pesquisas sobre classificação de vagas de emprego. Pesquisadores estão cada vez mais utilizando grandes modelos pré-treinados para melhorar a classificação das ocupações. A introdução do BERT em 2019 marcou um avanço que permitiu uma compreensão profunda da linguagem contextual e melhorou significativamente o desempenho na classificaçãode textos 3. Por exemplo, Clavié et al. (2023) exploraram o uso de um modelo de linguagem grande (LLM) ajustado por instruções para classificação de tarefas, descobrindo que a engenharia adequada de prompts permitia que o LLM superasse modelos supervisionados de última geração em uma tarefa de classificação de cargosde graduado 4. De forma semelhante, Li et al. (2023) propuseram uma abordagem LLM4Jobs que combina sumarização de modelos em linguagem grande com correspondência de códigos de ocupação, melhorando significativamente a precisão da classificação em descrições de cargos longas ao primeiro extrair resumos e depois alinhá-los com códigos padrãode cargo 5. Além disso, uma pesquisa de 2024 realizada por Senger et al. cataloga avanços recentes em deep learning para RH, observando que a extração de habilidades e a classificação de cargos se tornaram tarefas centrais na análise computacional do mercadode trabalho 6. Kavas et al. (2024) aprimoraram a classificação de anúncios de emprego combinando embeddings de texto multilíngue com categorização baseada em LLM, alcançando ganhos notáveisde precisão 7. No campo tradicional, sistemas anteriores iam desde heurísticas baseadas em palavras-chave com conjuntos de categorias relativamente grosseiras até estruturas baseadas em taxonomia, como o Caroteno, que usava uma hierarquia sobre mais de 4.000 cargos 8,9. Javed et al. (2016) apresentaram um marco inicial de classificação de títulos de cargo, marcando um dos primeiros passos para a categorização sistemática deocupações 10. Essas abordagens supervisionadas, no entanto, exigem dados rotulados extensos e têm dificuldade para se adaptar ao rápido surgimento de novos cargos, já que as taxonomias de classificação frequentemente evoluem mais lentamente do que o mercadode trabalho 4.

Para enfrentar tais limitações, trabalhos recentes passaram a buscar estratégias híbridas que incorporam conhecimento externo; por exemplo, Lewis et al. (2020) introduziram o framework Retrieval-Augmented Generation (RAG), que combina modelos de linguagem pré-treinados com um retriever para injetar conhecimento relevante do domínio, alcançando precisão superior e resultados mais factuais em tarefas intensivas em conhecimento11. Lester et al. demonstraram que o ajuste rápido gera ganhos de desempenho maiores à medida que o tamanho do modelo aumenta12, reforçando o uso de um LLM base forte. Por exemplo, Han et al. mostraram que o uso de prompts guiados por regras pode aumentar a precisão da classificação de texto ao focar o modelo emcaracterísticas-chave 13. Além disso, Brown et al. (2020) mostraram de forma famosa que um grande modelo de linguagem pode realizar novas tarefas a partir de apenas alguns exemplos ou instruções, destacando o poder do aprendizado de poucos shots guiado porprompts 14. Notavelmente, uma pesquisa recente sobre técnicas de PLN baseadas em prompts destaca que a redação dos prompts pode direcionar significativamente os resultados domodelo 15. Ao mesmo tempo, mudanças em nível macro e a incerteza no mercado de trabalho reforçam a necessidade de protocolos de rotulagem escaláveis e amigáveis à atualização, que podem ser atualizados à medida que novos cargossurgem 16. No domínio da PLN no mercado de trabalho, o pré-treinamento multilíngue orientado por taxonomia também foi explorado para melhor alinhar representações com estruturas ocupacionais e variabilidadeinterlinguística 17. Coletivamente, esses estudos informam a abordagem e demonstram o potencial do uso de grandes modelos de linguagem com otimização de recuperação e prompts para reconhecer e se adaptar de forma mais eficaz a contextos de ocupação emergentes.

Neste estudo, o conhecimento do domínio é curado apenas para Inteligência Artificial e Proteção Ambiental, já que a construção, validação e manutenção de corpus representam os principais custos operacionais da classificação de recrutamento entre domínios. Assim, Outros serve como uma categoria de rejeição fora do escopo, e não como uma classe de indústria substantiva. A alta precisão relatada deve ser interpretada com cautela, pois a configuração de três rótulos simplifica a rotulagem e pode inflar o desempenho em comparação com taxonomias de granulação mais fina. O protocolo é projetado como uma camada leve e baseada no conhecimento para domínios específicos, e não como um substituto para sistemas abrangentes de classificação multicategoria. Expandir o conjunto de rótulos pode reduzir a precisão devido ao aumento da sobreposição, ambiguidade e requisitos mais rigorosos de cobertura de corpus. Na prática, o conjunto de rejeição pode ser progressivamente refinado ao expandir o corpus de domínio e incorporar bases de conhecimento internas. A configuração de três rótulos, portanto, demonstra um paradigma reutilizável em vez de uma taxonomia ocupacional exaustiva.

O conjunto de dados combina fontes estruturadas e não estruturadas. O corpus estruturado foi coletado e curado pelos autores a partir de anúncios de emprego publicados publicamente por empresas de capital aberto em grandes plataformas de recrutamento online na China entre 2014 e 2023. Após a deduplicação e limpeza básica, o corpus estruturado contém aproximadamente 6,93 milhões de anúncios. Documentos de domínio não estruturados divulgados pelas autoridades relevantes foram usados para definir o conhecimento do domínio e critérios de rotulagem. A partir dessas fontes, três subconjuntos de referência foram construídos manualmente, cada um contendo 1.000 vagas para Inteligência Artificial, Proteção Ambiental e áreas não relacionadas, respectivamente, e verificadas para avaliação.

As espinhas dorsuais do modelo são avaliadas usando precisão, precisão, recordação e F1 (a média harmônica de precisão e recordação, F1 = 2PR/(P+R)) para selecionar a base ideal para o fluxo de trabalho aumentado por recuperação. Documentos de domínio autoritativos são compilados em uma base de conhecimento para geração aumentada por recuperação (RAG). Trechos relevantes são recuperados e inseridos em um modelo fixo de prompt para suportar a classificação. Variantes de prompt são testadas sistematicamente, e uma estratégia de otimização por palavra de indicação é aplicada para determinar a configuração final. As evidências recuperadas são filtradas quanto à relevância para minimizar o ruído e apoiar inferências precisas e eficientes.

Para possibilitar uma classificação em larga escala, o fluxo de trabalho adota um pipeline em etapas: a triagem guiada por léxico resolve eficientemente casos rotineiros, enquanto inferência LLM otimizada para prompts e aprimorada para recuperação lida com postagens ambíguas, equilibrando escalabilidade e precisão (Figura 1).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

Este estudo não envolveu participantes humanos nem animais envolvidos. Portanto, aprovação ética e consentimento informado não eram necessários. O fluxo de trabalho era executado em um ambiente Python 3.10 em um sistema operacional Windows de 64 bits, utilizando o hardware, ferramentas e softwares listados na Tabela de Materiais.

1. Modelagem

  1. Construção do banco de dados e conhecimento
    1. Coletar e curar um corpus estruturado interno de anúncios de vagas para empresas de capital aberto provenientes das principais plataformas de recrutamento online na China (2014–2023), garantindo conformidade com as políticas da plataforma e regulamentos aplicáveis. Para cada anúncio, registre o título do cargo, descrição do cargo, nome da empresa, data de lançamento e um identificador único (por exemplo, ID ou URL da vaga, se disponível). Remova duplicados e entradas inválidas, e verifique se o corpus final contém aproximadamente 6,93 milhões de registros.
    2. Colete documentos de domínio autoritativos relacionados a Inteligência Artificial e Proteção Ambiental, incluindo os documentos listados no Arquivo Suplementar 1. Certifique-se de que os documentos definam competências, padrões de qualificação, escopos de tarefas ou procedimentos regulados.
  2. Construção do conjunto de dados de benchmark
    1. Faça uma triagem manual do conjunto de dados estruturado. Selecione anúncios que representem claramente Inteligência Artificial, Proteção Ambiental e áreas não relacionadas. Inclua casos borderline para melhorar a cobertura.
    2. Rotule cada vaga usando o título do cargo, descrição do cargo e informações do empregador.
    3. Construa três subconjuntos de referência contendo 1.000 vagas cada para Inteligência Artificial, Proteção Ambiental e Outros.
    4. Realize anotação dupla. Atribua um anotador para rotular cada postagem e um segundo anotador para verificar o rótulo usando uma diretriz escrita.
    5. Resolver desentendimentos por meio de discussão e julgamento por um terceiro anotador.
    6. Calcule o acordo entre anotadores. Registre a concordância percentual e κ.
    7. Preserve o conjunto de dados de referência verificado para avaliação do modelo.
  3. Avaliação das colunas dorsuais dos modelos
    1. Avalie as backbones do LLM ajustadas para instruções usando o mesmo modelo de prompt e conjunto de dados de benchmark.
    2. Desative o aumento de recuperação durante a comparação da espinha dorsal.
    3. Mantenha a redação de prompts, parâmetros de decodificação e mapeamento de rótulos idênticos entre os modelos.
    4. Calcule a precisão geral, precisão por classe, recall e F1.
    5. Selecione a espinha dorsal de melhor desempenho e registre sua configuração na Tabela 1.
    6. Relate os resultados completos da avaliação na Tabela 2.
  4. Realização do treinamento de codificador adaptativo ao domínio
    1. Construa um corpus não rotulado usando apenas os documentos autoritativos listados no Arquivo Suplementar 1.
    2. Extraia texto simples de todos os documentos.
    3. Segmente o texto em sequências com comprimento máximo de 512 e passo de 492.
    4. Descarte segmentos com menos de 50 caracteres.
    5. Certifique-se de que as publicações de benchmark sejam excluídas deste corpus.
    6. Inicialize os postos de controle da base BERT chinesa.
    7. Realize o pré-treinamento do modelo de linguagem mascarado com probabilidade de mascaramento 0,15.
    8. Treine para 3 épocas usando AdamW com taxa de aprendizado 5e-5 e tamanho de lote 2.
    9. Salve o checkpoint pré-treinado.
    10. Ajuste fino o codificador para classificação em três classes usando uma taxa de aprendizado de 2e-5, tamanho de lote de 2 e comprimento máximo de sequência de 512.
    11. Fixe a semente aleatória em 42 e aplique a divisão estratificada de validação de trens.
    12. Precisão do relato, precisão macro-média, recordação macro-média, macro-média F1, métricas por classe e a matriz de confusão.
    13. Salve os resultados das avaliações para verificação.
  5. Construindo o pipeline de Classificação Aumentada por Recuperação
    1. Construa a base de conhecimento
      1. Compile 12 domínios autoritativos.
      2. Remova versões duplicadas ou desatualizadas.
      3. Converter documentos para texto simples.
      4. Registre metadados do documento, incluindo o emissor e o ano de publicação.
      5. Divida o texto em blocos de aproximadamente 1.000 caracteres com sobreposição de 20 caracteres.
      6. Registre o número total de blocos e a distribuição do comprimento dos blocos.
        NOTA: Revalide o desempenho da recuperação se a base de conhecimento for expandida.
    2. Codificação e armazenamento de embeddings
      1. Codifique todos os chunks usando o modelo de embedding e armazene os embeddings no banco de dados vetorial.
      2. Identificadores de blocos do arquivo e metadados de proveniência.
      3. Verifique se o número de vetores armazenados corresponde à contagem de blocos.
    3. Realize a recuperação.
      1. Incorpore cada vaga usando o mesmo modelo de incorporação.
      2. Realize a busca por k-vizinho mais próximo usando similaridade cosseno.
      3. Aplique o limiar de similaridade τ para filtrar correspondências de baixa relevância.
      4. Fixe τ e top-κ após afinar em um subconjunto estendido.
      5. Registro de identificadores de blocos recuperados e pontuações de similaridade.
    4. Realizar Inferência Aumentada por Recuperação
      1. Insira até quatro blocos recuperados na seção de evidências do modelo de prompt (Arquivo Suplementar 2).
      2. Concatene o texto da vaga com as evidências recuperadas.
      3. Gerar o rótulo final de três classes usando o LLM selecionado.
      4. Salve logs de recuperação, prompts e saídas de modelos.
  6. Realização de triagem guiada por léxico
    1. Léxicos de Construção de Palavras-chave
      1. Compile dois léxicos-chave: um para Inteligência Artificial e outro para Proteção Ambiental (Arquivo Suplementar 3).
      2. Extraia os termos dos candidatos de vagas e documentos autorizados.
      3. Tokenize texto usando a biblioteca de tokenização especificada.
      4. Calcule estatísticas de frequência e contraste de domínio dos termos e remova termos ambíguos ou excessivamente genéricos.
      5. Finalize e arquive os léxicos.
    2. Rotas de designação
      1. Aplique correspondência exata de string e nível de token.
      2. Direcione as vagas contendo apenas palavras-chave de Inteligência Artificial para o ramo de Inteligência Artificial.
      3. Roteie anúncios contendo apenas palavras-chave de Proteção Ambiental para o ramo de Proteção Ambiental.
      4. Rotule as vagas sem correspondência como Outros.
      5. Direcione as postagens de duplo match para a etapa aumentada de recuperação.
      6. Estatísticas de roteamento de registros e versões do léxico.
    3. Classificar publicações ambíguas
      1. Recupere os blocos relevantes sob configurações fixas de top-κ e τ.
      2. Injete as evidências recuperadas no modelo de prompt.
      3. Gerar o rótulo final e salvar os logs por instância.

2. Reclassificação dos resultados

  1. Construção do dicionário de sinônimos
    1. Construa um dicionário de sinônimos de termos de Inteligência Artificial (Arquivo Suplementar 4). Inclua termos de aprendizado de máquina, processamento de linguagem natural, visão computacional, robótica e subáreas relacionadas. Organize os termos detalhados sob cada categoria.
    2. Construa um dicionário de sinônimos separado com termos de Proteção Ambiental. Inclui fundamentos das ciências ambientais, monitoramento e análise ambiental, controle e gestão da poluição, e planejamento e gestão ambiental.
    3. Adicione todos os termos de Inteligência Artificial e Proteção Ambiental ao dicionário de tokenização. Certifique-se de que esses termos sejam reconhecidos como unidades completas durante a segmentação de texto.
  2. Texto de pré-processamento
    1. Remova sinais de pontuação e caracteres especiais usando expressões regulares. Retenha apenas texto e espaços.
    2. Realize segmentação de palavras para dividir texto contínuo em tokens individuais.
  3. Realização de correspondência de características e categorização
    1. Pré-processe o texto de entrada para obter uma lista de tokens segmentados.
    2. Selecione o dicionário de sinônimos apropriado de acordo com a classificação preliminar.
    3. Percorra os tokens segmentados e realize a correspondência exata com os termos do dicionário de sinônimos após a normalização. Aplique lowermaiúsculas e unifique-se as variantes predefinidas antes de combinar.
    4. Registre cada termo correspondente e seu respectivo ramo de dicionário.
      NOTA: Se múltiplos ramos coincidirem, resolva empates usando uma regra fixa (por exemplo, maior número de correspondências seguido pela ocorrência mais antiga).
    5. Exporte a lista de termos combinados e a tag final dentro do domínio para agregação downstream.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Quatro grandes backbones de grandes modelos de linguagem de código aberto e ajustados por instruções (Backbone A–D) listados na Tabela de Materiais são avaliados na tarefa de classificação de três classes de anúncios de emprego. A avaliação é realizada utilizando o mesmo protocolo de teste, procedimentos de pré-processamento e métricas em todas as espinhas dorsales, incluindo precisão geral, exatidão, recall e F1. Refinamento rápido e geração aumentada por recuperação (R...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

Trabalhos anteriores aplicaram aprendizado de máquina clássico e modelos neurais à categorização de textos de recrutamento, incluindo classificação de currículos e descrições de cargos, mas tais abordagens frequentemente exigem dados rotulados substanciais e podem se degradar quando a terminologia do domínio muda. Ali et al. propuseram um sistema de classificação de currículos usando NLP e técnicas de aprendizadode máquina 18. Jalili et al. exploraram a classifica...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Os autores não têm nada a revelar.

Agradecimentos

Os autores agradecem aos colegas pelo suporte técnico e pelo feedback construtivo durante a curadoria de dados e a preparação do manuscrito. Esse projeto não recebeu financiamento externo.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
all-MiniLM-L6-v2 (codificador de frase)Rosto Abraçado (transformadores de frase)https://huggingface.co/sentence-transformers/all-MiniLM-L6-v2Modelo de embutimento de sentenças usado para vetorização.
Bert-base-chinês (codificador de linha base)Abraçando o Rosto (google-bert)https://huggingface.co/google-bert/bert-base-chineseCodificador de linha de base (base BERT chinesa).
Memória DDR5, 16 GBConfiguração de estação de trabalho/laptopN/AMemória do sistema (16 GB DDR5); Número do fornecedor/peça não especificado.
DeepSeek-R1-Distill-Qwen-7B (Espinha A)Abraçando o Rosto (deepseek-ai)https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-7BLLM backbone A.
GLM-4-9B-Chat (Backbone C)Rosto Abraçado (zai-org)https://huggingface.co/zai-org/glm-4-9b-chat-hfLLM backbone C.
Intel Core i5-13500HX CPUIntelhttps://www.intel.com/content/www/us/en/products/sku/232156/intel-core-i513500hx-processor-24m-cache-up-to-4-70-ghz/specifications.htmlCPU de estação de trabalho usado para experimentos.
InternLM2.5-7B-Chat (Backbone D)Rosto Abraçado (interno)https://huggingface.co/internlm/internlm2_5-7b-chatLLM backbone D.
jieba (tokenizador chinês)PyPI (jieba)https://pypi.org/project/jieba/biblioteca chinesa de tokenização/segmentação; Versão não especificada.
Bibliotecas de palavras-chave (IA & Ambiental) (Arquivo Suplementar 3)Este estudoArquivo Suplementar 3Léxicos de palavras-chave de domínio usados para pré-filtragem guiada por léxicos; Arquivo da versão exata usada por execução.
LanceDB (banco de dados vetorial)LanceDBN/ABanco de dados vetorial para armazenamento/busca de embeddings; Versão não especificada.
NVIDIA GeForce RTX 4060 Laptop GPU (8 GB VRAM)NVIDIAhttps://www.nvidia.com/en-us/geforce/laptops/40-series/GPU usada para inferência/experimentos.
Anúncios de vagas em plataformas de recrutamento online (2014– 2023)Principais plataformas chinesas de recrutamento (dados públicos na web)N/AAnúncios de emprego publicados coletados e curados pelos autores; ~6,93 milhões de postagens após a limpeza.
pip (instalador de pacotes em Python)PyPAN/AO instalador de pacotes era usado para instalar dependências e exportar um snapshot do ambiente usando pip freeze.
Evolução do template de prompt (Arquivo Suplementar 2)Este estudoArquivo Suplemento 2Variantes sucessivas do prompt e o prompt final usado para avaliação.
Python 3.10Fundação de Software PythonN/AInterpretador em tempo de execução (Python 3.10); Versão do patch não especificada.
Qwen2.5-7B-Instrução (Espinha Vertebral B)Rosto Abraçado (Qwen)https://huggingface.co/Qwen/Qwen2.5-7B-InstructLLM backbone B.
Descrições/índice de campo da base de conhecimento RAG (Arquivo Suplementar 1)Este estudoArquivo Suplementar 1Anotações de esquema/campo e índice de documentos para a base de conhecimento usada na inferência aumentada por recuperação.
Dicionário de Sinônimos (IA & Ambiental) (Arquivo de Suplemento 4)Este estudoArquivo Suplemento 4Dicionários de termos usados em reclassificação e análise; Arquivo da versão exata usada por execução.
Windows 11 (64 bits)MicrosoftN/ASistema operacional (Windows 11, 64 bits); Build/versão não especificada.

Referências

  1. Alekseeva, L., et al. The demand for AI skills in the labor market. Labour Economics. 71, 102002(2021).
  2. Ministry updates official dictionary of careers. , Ministry of Human Resources and Social Security of the People’s Republic of China. Available at: https://english.www.gov.cn/statecouncil/ministries/202209/30/content_WS633647bbc6d0a757729e0bb6.html (2022).
  3. BERT: Pre-training of deep bidirectional transformers for language understanding. Devlin, J., Chang, M. W., Lee, K., Toutanova, K. 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (NAACL-HLT), Minneapolis, MN, USA, , 4171-4186 (2019).
  4. Large language models in the workplace: A case study on prompt engineering for job type classification. Clavié, B., et al. 28th International Conference on Applications of Natural Language to Information Systems (NLDB 2023); , Derby, UK, , Springer. Natural Language Processing and Information Systems. Lecture Notes in Computer Science 3-17 (2023).
  5. Li, N., Kang, B., De Bie, T. LLM4Jobs: Unsupervised occupation extraction and standardization leveraging large language models. arXiv. , Available at: https://arxiv.org/abs/2309.09708 (2023).
  6. Deep learning-based computational job market analysis: A survey on skill extraction and classification from job postings. Senger, E., Zhang, M., van der Goot, R., Plank, B. 1st Workshop on Natural Language Processing for Human Resources (NLP4HR 2024), St. Julian’s, Malta, , 1-15 (2024).
  7. Enhancing job posting classification with multilingual embeddings and large language models. Kavas, H., Serra-Vidal, M., Wanner, L. 10th Italian Conference on Computational Linguistics (CLiC-it 2024), Pisa, Italy, , 440-450 (2024).
  8. JobBERT: Understanding job titles through skills. Decorte, J. J., Van Hautte, J., Demeester, T., Develder, C. International Workshop on Fair, Effective and Sustainable Talent Management using Data Science (FEAST 2021) at ECML-PKDD 2021, , (2021).
  9. Carotene: A job title classification system for the online recruitment domain. Javed, F., et al. IEEE First International Conference on Big Data Computing Service and Applications (BigDataService), , 286-293 (2015).
  10. Javed, F., McNair, M., Jacob, F., Zhao, M. Towards a job title classification system. arXiv. , Available at: https://arxiv.org/abs/1606.00917 (2016).
  11. Lewis, P., et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Presented at: Advances in Neural Information Processing Systems. NeurIPS. , (2020).
  12. The power of scale for parameter-efficient prompt tuning. Lester, B., Al-Rfou, R., Constant, N. 2021 Conference on Empirical Methods in Natural Language Processing (EMNLP), , 3045-3059 (2021).
  13. Han, X., et al. PTR: Prompt tuning with rules for text classification. AI Open. 3, 182-192 (2022).
  14. Brown, T. B., et al. Language models are few-shot learners. Presented at: Advances in Neural Information Processing Systems. NeurIPS. , (2020).
  15. Liu, P., et al. predict: A systematic survey of prompting methods in natural language processing. ACM Comput Surv. 55 (9), 195:1-195:35 (2023).
  16. Blue, A. The outlook for 2023 is uncertain, but here’s what we know about the global labour market. World Economic Forum (Agenda). , Available at: https://www.weforum.org/agenda/2023/01/the-outlook-for-2023-is-uncertain-but-here-s-what-we-know-about-the-global-labour-market-davos23 (2023).
  17. ESCOXLM-R: Multilingual taxonomy-driven pre-training for the job market domain. Zhang, M., van der Goot, R., Plank, B. 61st Annual Meeting of the Association for Computational Linguistics (ACL 2023), Toronto, Canada, , 11871-11890 (2023).
  18. Ali, I., et al. Resume classification system using natural language processing and machine learning techniques. Mehran Univ Res J Eng Technol. 41 (1), 65-79 (2022).
  19. BiLSTM for resume classification. Jalili, A., Tabrizchi, H., Razmara, J., Mosavi, A. 22nd IEEE International Symposium on Applied Machine Intelligence and Informatics (SAMI 2024), Stará Lesná, Slovakia, , (2024).
  20. Pal, R., Shaikh, S., Satpute, S., Bhagwat, S. Resume classification using various machine learning algorithms. ITM Web Conf. 44, 03011(2022).
  21. Convolutional neural network with word embedding based approach for resume classification. Nasser, S., Sreejith, C., Irshad, M. 2018 International Conference on Emerging Trends and Innovations in Engineering and Technological Research (ICETIETR 2018), , Ernakulam (Cochin), India. (2018).
  22. Real-time resume classification system using LinkedIn profile descriptions. Ramraj, S., Sivakumar, V. 2020 International Conference on Computational Intelligence for Smart Power Systems and Sustainable Energy (CISPSSE 2020), Keonjhar, Odisha, India, , (2020).
  23. Heakl, A., et al. ResumeAtlas: Revisiting resume classification with large-scale datasets and large language models. arXiv. , Available at: https://arxiv.org/abs/2406.18125 (2024).
  24. Skondras, P., Zervas, P., Tzimas, G. Generating synthetic resume data with large language models for enhanced job description classification. Future Internet. 15 (11), 363(2023).
  25. Chen, Z. Ethics and discrimination in artificial intelligence-enabled recruitment practices. Humanit Soc Sci Commun. 10, 567(2023).
  26. Retrieval-augmented few-shot text classification. Yu, G., et al. Findings of the Association for Computational Linguistics: EMNLP 2023, Singapore, , 6721-6735 (2023).
  27. Izacard, G., et al. Atlas: Few-shot learning with retrieval augmented language models. J Mach Learn Res. 24 (251), 1-43 (2023).
  28. KW-ATTN: Knowledge infused attention for accurate and interpretable text classification. Jang, H., et al. Deep Learning Inside Out (DeeLIO): 2nd Workshop on Knowledge Extraction and Integration for Deep Learning Architectures, , 96-107 (2021).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Reimpressões e permissões

Etiquetas

Modelos de Recupera o AumentadaListas de Palavras chave de Dom nioConstru o de Base de ConhecimentosRecupera o por Similaridade de CossenoK Vizinhos Mais Pr ximosClassifica o de Texto em Chin sConcord ncia Interavaliadores