Nos últimos anos, com o rápido desenvolvimento da IA e das tecnologias ambientais, surgiu um grande número de carreiras emergentes. Por um lado, o mercado de trabalho global está inundado com muitas novas vagas baseadas em IA e sustentabilidade. Evidências baseadas em vagas documentam uma rápida expansão na demanda por habilidades relacionadas à IA, o que aumenta a heterogeneidade dos textos de recrutamento e motiva um protocolo de marcação de domínioreproduzível e escalável 1. Por outro lado, a última revisão chinesa do Dicionário de Classificação Ocupacional (OCD) apresentou um crescimento igualmente robusto em novas ocupações nas áreas de informatização do emprego e de sustentabilidade verde e baixo carbono, com um aumento líquido de 158 novas ocupações na revisão de 2022 em comparação com a edição de 2015 do Dicionário, totalizando 97 ocupações digitais. ou 6% do total de ocupações, rotuladas, junto com 134 ocupações verdes, ou 8% do total de ocupações2.
À medida que essas novas ocupações continuam a surgir, o conteúdo e a forma das vagas de emprego das empresas estão se tornando mais complexos, já que as descrições de vagas frequentemente envolvem conhecimento por matéria e diversos requisitos de habilidades, contendo tanto áreas estruturadas como títulos de cargos e listas de habilidades, quanto um grande número de descrições não estruturadas em texto livre, resultando em estruturas de anúncios cada vez mais complexas. Essas vagas complexas normalmente contêm elementos estruturados claramente definidos (por exemplo, cargos, listas de habilidades exigidas) junto com extensas descrições não estruturadas em texto livre. Por exemplo, um anúncio de emprego para engenheiro de IA pode listar jargões técnicos como 'proficiência em um framework de deep learning' e 'experiência otimizando algoritmos de retropropagação' como parte de uma lista de habilidades, além de incluir uma narrativa detalhada de responsabilidades; Da mesma forma, uma vaga de engenheiro ambiental pode fazer referência a padrões regulatórios e certificações específicas. Essa combinação de conteúdo estruturado e não estruturado resulta em descrições de cargos altamente especializadas e complexas.
Inteligência Artificial e Proteção Ambiental são selecionadas para avaliar o protocolo sob ambiguidade realista entre domínios na classificação de recrutamento. Na prática, recursos ocupacionais tradicionais como O*NET e portais de emprego atribuem tags grosseiras, tornando difícil distinguir papéis intersetores apenas com palavras-chave. A Proteção Ambiental representa um domínio amplo que se sobrepõe a múltiplos campos científicos, enquanto a Inteligência Artificial reflete uma fatia mais detalhada dentro da computação frequentemente confundida com papéis gerais de software. Esse emparelhamento captura tanto contextos amplos quanto restritos entre domínios, com terminologia distinta e documentos autoritativos adequados para a construção de bases de conhecimento, permitindo a adaptação a outras indústrias ao substituir o corpus de domínio sem alterar o fluxo de trabalho principal.
Nos últimos anos, houve um aumento nas pesquisas sobre classificação de vagas de emprego. Pesquisadores estão cada vez mais utilizando grandes modelos pré-treinados para melhorar a classificação das ocupações. A introdução do BERT em 2019 marcou um avanço que permitiu uma compreensão profunda da linguagem contextual e melhorou significativamente o desempenho na classificaçãode textos 3. Por exemplo, Clavié et al. (2023) exploraram o uso de um modelo de linguagem grande (LLM) ajustado por instruções para classificação de tarefas, descobrindo que a engenharia adequada de prompts permitia que o LLM superasse modelos supervisionados de última geração em uma tarefa de classificação de cargosde graduado 4. De forma semelhante, Li et al. (2023) propuseram uma abordagem LLM4Jobs que combina sumarização de modelos em linguagem grande com correspondência de códigos de ocupação, melhorando significativamente a precisão da classificação em descrições de cargos longas ao primeiro extrair resumos e depois alinhá-los com códigos padrãode cargo 5. Além disso, uma pesquisa de 2024 realizada por Senger et al. cataloga avanços recentes em deep learning para RH, observando que a extração de habilidades e a classificação de cargos se tornaram tarefas centrais na análise computacional do mercadode trabalho 6. Kavas et al. (2024) aprimoraram a classificação de anúncios de emprego combinando embeddings de texto multilíngue com categorização baseada em LLM, alcançando ganhos notáveisde precisão 7. No campo tradicional, sistemas anteriores iam desde heurísticas baseadas em palavras-chave com conjuntos de categorias relativamente grosseiras até estruturas baseadas em taxonomia, como o Caroteno, que usava uma hierarquia sobre mais de 4.000 cargos 8,9. Javed et al. (2016) apresentaram um marco inicial de classificação de títulos de cargo, marcando um dos primeiros passos para a categorização sistemática deocupações 10. Essas abordagens supervisionadas, no entanto, exigem dados rotulados extensos e têm dificuldade para se adaptar ao rápido surgimento de novos cargos, já que as taxonomias de classificação frequentemente evoluem mais lentamente do que o mercadode trabalho 4.
Para enfrentar tais limitações, trabalhos recentes passaram a buscar estratégias híbridas que incorporam conhecimento externo; por exemplo, Lewis et al. (2020) introduziram o framework Retrieval-Augmented Generation (RAG), que combina modelos de linguagem pré-treinados com um retriever para injetar conhecimento relevante do domínio, alcançando precisão superior e resultados mais factuais em tarefas intensivas em conhecimento11. Lester et al. demonstraram que o ajuste rápido gera ganhos de desempenho maiores à medida que o tamanho do modelo aumenta12, reforçando o uso de um LLM base forte. Por exemplo, Han et al. mostraram que o uso de prompts guiados por regras pode aumentar a precisão da classificação de texto ao focar o modelo emcaracterísticas-chave 13. Além disso, Brown et al. (2020) mostraram de forma famosa que um grande modelo de linguagem pode realizar novas tarefas a partir de apenas alguns exemplos ou instruções, destacando o poder do aprendizado de poucos shots guiado porprompts 14. Notavelmente, uma pesquisa recente sobre técnicas de PLN baseadas em prompts destaca que a redação dos prompts pode direcionar significativamente os resultados domodelo 15. Ao mesmo tempo, mudanças em nível macro e a incerteza no mercado de trabalho reforçam a necessidade de protocolos de rotulagem escaláveis e amigáveis à atualização, que podem ser atualizados à medida que novos cargossurgem 16. No domínio da PLN no mercado de trabalho, o pré-treinamento multilíngue orientado por taxonomia também foi explorado para melhor alinhar representações com estruturas ocupacionais e variabilidadeinterlinguística 17. Coletivamente, esses estudos informam a abordagem e demonstram o potencial do uso de grandes modelos de linguagem com otimização de recuperação e prompts para reconhecer e se adaptar de forma mais eficaz a contextos de ocupação emergentes.
Neste estudo, o conhecimento do domínio é curado apenas para Inteligência Artificial e Proteção Ambiental, já que a construção, validação e manutenção de corpus representam os principais custos operacionais da classificação de recrutamento entre domínios. Assim, Outros serve como uma categoria de rejeição fora do escopo, e não como uma classe de indústria substantiva. A alta precisão relatada deve ser interpretada com cautela, pois a configuração de três rótulos simplifica a rotulagem e pode inflar o desempenho em comparação com taxonomias de granulação mais fina. O protocolo é projetado como uma camada leve e baseada no conhecimento para domínios específicos, e não como um substituto para sistemas abrangentes de classificação multicategoria. Expandir o conjunto de rótulos pode reduzir a precisão devido ao aumento da sobreposição, ambiguidade e requisitos mais rigorosos de cobertura de corpus. Na prática, o conjunto de rejeição pode ser progressivamente refinado ao expandir o corpus de domínio e incorporar bases de conhecimento internas. A configuração de três rótulos, portanto, demonstra um paradigma reutilizável em vez de uma taxonomia ocupacional exaustiva.
O conjunto de dados combina fontes estruturadas e não estruturadas. O corpus estruturado foi coletado e curado pelos autores a partir de anúncios de emprego publicados publicamente por empresas de capital aberto em grandes plataformas de recrutamento online na China entre 2014 e 2023. Após a deduplicação e limpeza básica, o corpus estruturado contém aproximadamente 6,93 milhões de anúncios. Documentos de domínio não estruturados divulgados pelas autoridades relevantes foram usados para definir o conhecimento do domínio e critérios de rotulagem. A partir dessas fontes, três subconjuntos de referência foram construídos manualmente, cada um contendo 1.000 vagas para Inteligência Artificial, Proteção Ambiental e áreas não relacionadas, respectivamente, e verificadas para avaliação.
As espinhas dorsuais do modelo são avaliadas usando precisão, precisão, recordação e F1 (a média harmônica de precisão e recordação, F1 = 2PR/(P+R)) para selecionar a base ideal para o fluxo de trabalho aumentado por recuperação. Documentos de domínio autoritativos são compilados em uma base de conhecimento para geração aumentada por recuperação (RAG). Trechos relevantes são recuperados e inseridos em um modelo fixo de prompt para suportar a classificação. Variantes de prompt são testadas sistematicamente, e uma estratégia de otimização por palavra de indicação é aplicada para determinar a configuração final. As evidências recuperadas são filtradas quanto à relevância para minimizar o ruído e apoiar inferências precisas e eficientes.
Para possibilitar uma classificação em larga escala, o fluxo de trabalho adota um pipeline em etapas: a triagem guiada por léxico resolve eficientemente casos rotineiros, enquanto inferência LLM otimizada para prompts e aprimorada para recuperação lida com postagens ambíguas, equilibrando escalabilidade e precisão (Figura 1).