È richiesta un abbonamento a JoVE per visualizzare questo contenuto. Accedi o inizia la tua prova gratuita.

Articolo metodologico

Etichettatura del testo per il reclutamento in due fasi tramite instradamento guidato da lessico e grandi modelli di linguaggio aumentati con recupero

136 visualizzazioni

DOI:

10.3791/70153

8 maggio 2026

In questo articolo

Sommario

Viene descritto un flusso di lavoro in due fasi per classificare i testi di reclutamento in Intelligenza Artificiale, Protezione Ambientale o Altro. Il triage guidato da lessico assegna casi di routine, mentre l'inferenza di grandi modelli linguistici ottimizzati per prompt e aumentata dal recupero risolve casi ambigui, consentendo un'etichettatura accurata su larga scala e una sintesi descrittive a valle del mercato del lavoro.

Abstract

I testi di reclutamento sono eterogenei e la terminologia del dominio evolve nel tempo, rendendo difficile l'etichettatura su larga scala a causa della capacità limitata di annotazione manuale. Questo protocollo fornisce un flusso di lavoro riproducibile in due fasi per classificare i testi di reclutamento cinesi in Intelligenza Artificiale, Protezione Ambientale o Altro. La prima fase esegue un triage guidato dal lessico utilizzando due liste di parole chiave di dominio selezionate. Gli annunci che corrispondono a un solo lessico di dominio sono etichettati direttamente. Le pubblicazioni che corrispondono a nessuno dei due lessici sono etichettate come Altro, mentre quelle con doppia corrispondenza vengono indirizzate alla seconda fase. La seconda fase applica l'inferenza di grandi modelli linguistici potenziati con recupero. Una base di conoscenza compilata da 12 documenti di dominio autorevoli viene convertita in testo, suddivisa in blocchi di circa 1.000 caratteri con sovrapposizione di 20 caratteri, incorporata utilizzando tutto MiniLM-L6-v2 e indicizzata in LanceDB. Per ogni postazione incerta, il recupero di k-vicini più vicini con coseno-similitudine restituisce chunk candidati filtrati da una soglia minima di similarità (τ), e fino a quattro chunk vengono iniettati in un template di prompt fisso che definisce i confini dell'etichetta e limita l'output a una singola etichetta. Un set di riferimento di 3.000 annunci viene verificato manualmente, con 1.000 annunci per classe, e raggiunge un accordo inter-annotatori del 95,0% e un kappa di Cohen (κ) di circa 0,93. La valutazione confronta più grandi modelli di linguaggio open source in un'impostazione solo prompt e in un'impostazione potenziata al recupero utilizzando Qwen2.5-7B-Instruct. La configurazione aumentata al recupero raggiunge il 98,47% di accuratezza e supporta l'etichettatura su scala corpus di circa 6,93 milioni di annunci per aggregazione descrittiva a valle.

Introduzione

Negli ultimi anni, con il rapido sviluppo dell'IA e delle tecnologie ambientali, sono emerse numerose carriere emergenti. Da un lato, il mercato del lavoro globale è invaso da molte nuove posizioni basate su IA e sostenibilità. Le evidenze basate sulle vacanze documentano una rapida espansione della domanda di competenze legate all'IA, che aumenta l'eterogeneità dei testi di reclutamento e motiva un protocollo di domaintagging 1 riproducibile e scalabile. D'altra parte, l'ultima revisione cinese del Dizionario della Classificazione Professionale (OCD) ha visto una crescita altrettanto robusta di nuove occupazioni nei campi dell'informatizzazione dell'occupazione e delle posizioni green e a basse emissioni di carbonio, con un aumento netto di 158 nuove occupazioni nella revisione del 2022 rispetto all'edizione 2015 del Dizionario, per un totale di 97 occupazioni digitali. oppure il 6% del numero totale di occupazioni, etichettate, insieme a 134 occupazioni verdi, ovvero l'8% del numero totale dioccupazioni 2.

Con l'emergere di queste nuove professioni, il contenuto e la forma degli annunci di lavoro delle aziende diventano più complessi, poiché le descrizioni di lavoro spesso coinvolgono conoscenze specifiche e requisiti di competenze diversificati, contenendo sia campi strutturati come titoli di lavoro e liste di competenze, sia un gran numero di descrizioni libere non strutturate, portando a strutture di annunci sempre più complesse. Annunci di lavoro così complessi tipicamente contengono elementi strutturati chiaramente definiti (ad esempio, titoli di lavoro, liste di competenze richieste) insieme a ampie descrizioni non strutturate in testo libero. Ad esempio, un annuncio di lavoro per ingegnere AI potrebbe elencare gergo tecnico come 'competenza in un framework di deep learning' e 'esperienza nell'ottimizzazione degli algoritmi di backpropagation' come parte di una lista di competenze, includendo anche una narrazione dettagliata delle responsabilità; Allo stesso modo, un annuncio per ingegnere ambientale potrebbe fare riferimento a standard normativi e certificazioni specifiche. Questa combinazione di contenuti strutturati e non strutturati porta a descrizioni di lavoro altamente specializzate e complicate.

Intelligenza Artificiale e Protezione Ambientale sono selezionate per valutare il protocollo sotto realistica ambiguità trasversale nella classificazione del reclutamento. In pratica, le risorse professionali mainstream come O*NET e i bacheche di offerte assegnano tag grossolani, rendendo difficile distinguere i ruoli intersectoriali usando solo parole chiave. La Protezione Ambientale rappresenta un ampio dominio che si sovrappone a molteplici campi scientifici, mentre l'Intelligenza Artificiale riflette una sezione più dettagliata all'interno dell'informatica spesso confusa con ruoli software generali. Questa associazione cattura sia contesti ampi che stretti cross-domain con terminologia distinta e documenti autorevoli adeguati per la costruzione di una base di conoscenza, consentendo al contempo l'adattamento ad altri settori sostituendo il corpus di dominio senza alterare il flusso di lavoro core.

Negli ultimi anni si è registrato un aumento delle ricerche sulla classificazione degli annunci di lavoro. I ricercatori stanno sempre più sfruttando grandi modelli pre-addestrati per migliorare la classificazione delle professioni. L'introduzione di BERT nel 2019 ha rappresentato una svolta che ha permesso una comprensione profondamente contestuale del linguaggio e ha migliorato significativamente le prestazioni nella classificazionedei testi 3. Ad esempio, Clavié et al. (2023) hanno esplorato l'uso di un modello di linguaggio di grandi dimensioni (LLM) ottimizzato per istruzioni per la classificazione dei lavori, scoprendo che una corretta ingegneria dei prompt permetteva all'LLM di superare modelli supervisionati all'avanguardia in uncompito 4 di classificazione del lavoro per graduati. Analogamente, Li et al. (2023) hanno proposto un approccio LLM4Jobs che combina la sintesi dei modelli in grandi linguaggi con il matching dei codici occupazionali, migliorando significativamente l'accuratezza della classificazione nelle descrizioni di lavoro lunghe estraendo prima i riassunti e poi allineandoli ai codici standard5. Inoltre, un sondaggio del 2024 condotto da Senger et al. cataloga i recenti progressi nel deep learning per le risorse umane, osservando che l'estrazione delle competenze e la classificazione dei lavori sono diventate compiti fondamentali nell'analisi computazionale del mercatodel lavoro 6. Kavas et al. (2024) hanno migliorato la classificazione degli annunci di lavoro combinando incorporamenti di testo multilingue con categorizzazioni basate su LLM, ottenendo notevoli miglioramentidi accuratezza 7. Sul fronte tradizionale, i sistemi precedenti spaziavano da euristiche basate su parole chiave con insiemi di categorie relativamente grossolani a framework guidati dalla tassonomia come il Carotene, che utilizzava una gerarchia su oltre 4.000 titoli di lavoro 8,9. Javed et al. (2016) hanno presentato un primo quadro di classificazione dei titoli di lavoro, segnando uno dei primi passi verso la categorizzazione sistematica delleoccupazioni 10. Questi approcci supervisionati, tuttavia, richiedono dati etichettati estesi e faticano ad adattarsi alla rapida emergere di nuovi ruoli lavorativi, poiché le tassonomie di classificazione spesso evolvono più lentamente rispetto al mercatodel lavoro 4.

Per affrontare tali limitazioni, i lavori recenti si sono orientati verso strategie ibride che incorporano conoscenze esterne; ad esempio, Lewis et al. (2020) hanno introdotto il framework Retrieval-Augmented Generation (RAG), che combina modelli linguistici pre-addestrati con un retriever per iniettare conoscenze rilevanti del dominio, ottenendo una precisione superiore e risultati più fattuali su compiti ad alta intensità di conoscenza11. Lester et al. hanno dimostrato che la messa a punto prompt produce maggiori aumenti di prestazioni man mano che la dimensione del modelloaumenta di 12, rafforzando l'uso di un solido LLM base. Ad esempio, Han et al. hanno dimostrato che l'uso di prompt guidati da regole può aumentare l'accuratezza della classificazione del testo concentrando il modello sulle caratteristiche chiave13. Inoltre, Brown et al. (2020) hanno dimostrato in modo famoso che un grande modello linguistico può svolgere nuovi compiti da pochi esempi o istruzioni, evidenziando la potenza dell'apprendimento poche shot guidato dai prompt14. In particolare, un recente sondaggio sulle tecniche di NLP basate su prompt sottolinea che la formulazione dei prompt può influenzare significativamente i risultati delmodello 15. Allo stesso tempo, i cambiamenti a livello macro e l'incertezza nel mercato del lavoro rafforzano la necessità di protocolli di etichettatura scalabili e accessibili all'aggiornamento, che possano essere aggiornati man mano che emergono nuoviruoli 16. Nel dominio NLP del mercato del lavoro, è stata inoltre esplorata la pre-formazione multilingue guidata dalla tassonomia per allineare meglio le rappresentazioni con le strutture occupazionali e la variabilitàinterlingue 17. Collettivamente, questi studi informano l'approccio e dimostrano il potenziale dell'utilizzo di grandi modelli linguistici con recupero e ottimizzazione dei prompt per riconoscere e adattarsi più efficacemente ai contesti lavorativi emergenti.

In questo studio, la conoscenza del dominio è curata solo per l'Intelligenza Artificiale e la Protezione Ambientale, poiché la costruzione dei corpus, la validazione e la manutenzione rappresentano i principali costi operativi della classificazione del reclutamento cross-domain. Di conseguenza, Other rappresenta una categoria di rifiuto fuori ambito piuttosto che una classe industriale sostanziale. L'elevata accuratezza riportata deve essere interpretata con cautela, poiché l'impostazione a tre etichette semplifica l'etichettatura e può gonfiare le prestazioni rispetto alle tassonomie a grana più fine. Il protocollo è pensato come uno strato di etichettatura leggero e basato sulla conoscenza per domini target, non come sostituto di sistemi di classificazione multi-categoria completi. L'espansione del set di etichette può ridurre l'accuratezza a causa di una maggiore sovrapposizione, ambigì e requisiti più rigorosi di copertura del corpus. In pratica, l'insieme di rifiuti può essere progressivamente raffinato estendendo il corpus di dominio e incorporando le basi di conoscenza interne. La configurazione a tre etichette, quindi, dimostra un paradigma riutilizzabile piuttosto che una tassonomia professionale esaustiva.

Il dataset combina fonti strutturate e non strutturate. Il corpus strutturato è stato raccolto e curato dagli autori a partire dagli annunci di lavoro pubblicati da società quotate in borsa sulle principali piattaforme di reclutamento online in Cina tra il 2014 e il 2023. Dopo la deduplicazione e la pulizia di base, il corpus strutturato contiene circa 6,93 milioni di incarichi. I documenti di dominio non strutturati rilasciati dalle autorità competenti sono stati utilizzati per definire la conoscenza del dominio e i criteri di etichettatura. Da queste fonti, sono stati costruiti manualmente tre sottoinsiemi di benchmark, ciascuno contenente 1.000 annunci per Intelligenza Artificiale, Protezione Ambientale e campi non correlati, rispettivamente, e verificati per la valutazione.

Le dorsale dei modelli vengono valutate utilizzando accuratezza, precisione, richiamo e F1 (la media armonica di precisione e richiamo, F1 = 2PR/(P+R)) per selezionare la base ottimale per il flusso di lavoro aumentato dal recupero. I documenti di dominio autorevoli vengono compilati in una base di conoscenza per la generazione aumentata al recupero (RAG). I passaggi rilevanti vengono recuperati e inseriti in un modello di prompt fisso per supportare la classificazione. Le varianti di prompt vengono testate sistematicamente e viene applicata una strategia di ottimizzazione con parole di segnale per determinare la configurazione finale. Le prove recuperate vengono filtrate per la loro rilevanza al fine di minimizzare il rumore e supportare inferenze accurate ed efficienti.

Per consentire una classificazione su larga scala, il flusso di lavoro adotta una pipeline a fasi: il triage guidato da lessico risolve in modo efficiente i casi di routine, mentre l'inferenza LLM ottimizzata per il recupero e ottimizzata per prompt gestisce le pubblicazioni ambigue, bilanciando scalabilità e accuratezza (Figura 1).

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

Questo studio non ha coinvolto partecipanti umani né soggetti animali. Pertanto, non erano necessarie approvazioni etiche e consenso informato. Il flusso di lavoro veniva eseguito in un ambiente Python 3.10 su un sistema operativo Windows a 64 bit utilizzando hardware, strumenti e software elencati nella Tabella dei Materiali.

1. Modellazione

  1. Costruzione della base dati e della conoscenza
    1. Raccogliere e curare un corpus strutturato interno di annunci di lavoro per aziende quotate in borsa dalle principali piattaforme di reclutamento online in Cina (2014–2023), garantendo il rispetto delle politiche della piattaforma e delle normative applicabili. Per ogni annuncio, registra il titolo del lavoro, la descrizione del lavoro, il nome dell'azienda, la data di pubblicazione e un identificatore unico (ad esempio, ID o URL dell'annuncio, se disponibili). Rimuovere duplicati e voci non valide e verificare che il corpus finale contenga circa 6,93 milioni di registri.
    2. Raccogliere documenti di dominio autorevoli relativi all'Intelligenza Artificiale e alla Protezione Ambientale, inclusi i documenti elencati nel File Supplementare 1. Assicurati che i documenti definiscano competenze, standard di qualifica, ambiti di compito o procedure regolamentate.
  2. Costruzione del dataset di benchmark
    1. Seleziona manualmente il dataset strutturato. Seleziona annunci che rappresentino chiaramente Intelligenza Artificiale, Protezione Ambientale e campi non correlati. Includere casi borderline per migliorare la copertura.
    2. Etichetta ogni annuncio usando il titolo del lavoro, la descrizione del lavoro e le informazioni sul datore di lavoro.
    3. Costruisci tre sottoinsiemi di benchmark contenenti ciascuno 1.000 annunci per Intelligenza Artificiale, Protezione Ambientale e Altro.
    4. Esegui l'annotazione doppia. Assegna un annotatore per etichettare ogni post e un secondo annotattore per verificare l'etichetta usando una linea guida scritta.
    5. Risolvere i disaccordi tramite discussione e decisione da parte di un terzo annotatore.
    6. Calcolare l'accordo tra gli annotatori. Annota la percentuale di concordanza e κ.
    7. Conservare il dataset di benchmark verificato per la valutazione del modello.
  3. Valutazione delle backbone dei modelli
    1. Valuta le backbone LLM ottimizzate per istruzioni utilizzando lo stesso template di prompt e dataset di benchmark.
    2. Disabilita l'aumento del recupero durante il confronto della spina dorsale.
    3. Mantieni la formulazione dei prompt, i parametri di decodifica e la mappatura delle etichette identici tra i modelli.
    4. Calcolare l'accuratezza complessiva, la precisione per classe, il richiamo e la F1.
    5. Seleziona la backbone con le migliori prestazioni e registra la sua configurazione nella Tabella 1.
    6. Riporta i risultati completi della valutazione nella Tabella 2.
  4. Esecuzione dell'addestramento di encoder adattivo al dominio
    1. Costruisci un corpus non etichettato utilizzando solo i documenti autorevoli elencati nel Supplementary File 1.
    2. Estrai il testo semplice da tutti i documenti.
    3. Segmenta il testo in sequenze con una lunghezza massima di 512 e un passo di 492.
    4. Scartare i segmenti più brevi di 50 caratteri.
    5. Assicurati che le pubblicazioni di benchmark siano escluse da questo corpus.
    6. Inizializza i posti di blocco della base BERT cinesi.
    7. Eseguire il preaddestramento del modello linguistico mascherato con probabilità di mascheramento 0,15.
    8. Allenati per 3 epoche usando AdamW con tasso di apprendimento 5e-5 e batch dimensione 2.
    9. Salva il checkpoint pre-addestrato.
    10. Ottimizzare il codificatore per la classificazione in tre classi utilizzando un tasso di apprendimento di 2e-5, una dimensione di batch di 2 e una lunghezza massima di sequenza di 512.
    11. Fissa il seed casuale a 42 e applica la divisione stratificata per la validazione del treno.
    12. Accuratezza del rapporto, precisione macro-mediata, richiamo macro-mediato, macro-media F1, metriche per classe e la matrice di confusione.
    13. Salva gli output delle valutazioni per la verifica.
  5. Costruzione della pipeline di Classificazione Potenziata al Recupero
    1. Costruisci la base di conoscenze
      1. Compila 12 domini autorevoli.
      2. Rimuovi versioni duplicate o obsolete.
      3. Converti i documenti in testo semplice.
      4. Registra i metadati dei documenti, inclusi l'anno dell'emittente e di pubblicazione.
      5. Dividere il testo in blocchi di circa 1.000 caratteri con sovrapposizione di 20 caratteri.
      6. Registra il numero totale di chunk e la distribuzione della lunghezza dei chunk.
        NOTA: Riconvalidare le prestazioni di recupero se la base di conoscenza viene ampliata.
    2. Codifica e archiviazione degli embeddings
      1. Codifica tutti i chunk utilizzando il modello di embedding e memorizza gli embeddings nel database vettoriale.
      2. Identificatori di chunk dell'archivio e metadati di provenienza.
      3. Verifica che il numero di vettori memorizzati corrisponda al conteggio dei blocchi.
    3. Esegui il recupero.
      1. Incorpora ogni annuncio di lavoro usando lo stesso modello di embedding.
      2. Esegui la ricerca del k-vicino più prossimo usando la similarità coseno.
      3. Applicare la soglia di similarità τ per filtrare le corrispondenze a bassa rilevanza.
      4. Fissare τ e top-κ dopo aver accordato su un sottoinsieme esteso.
      5. Registra gli identificatori di chunk recuperati e i punteggi di somiglianza.
    4. Eseguire inferenza aumentata al recupero
      1. Inserisci fino a quattro blocchi recuperati nella sezione prove del modello di prompt (File Supplementare 2).
      2. Concatena il testo dell'annuncio di lavoro con le prove recuperate.
      3. Genera l'etichetta finale di tre classi usando il LLM selezionato.
      4. Salva log di recupero, prompt e output dei modelli.
  6. Esecuzione di triage guidato dal lessico
    1. Lexici delle parole chiave costruite
      1. Compila due lessici per parole chiave: uno per l'Intelligenza Artificiale e uno per la Protezione dell'Ambiente (File Supplementare 3).
      2. Estrai i termini dei candidati dagli annunci di lavoro e dai documenti autorevoli.
      3. Tokenizzare il testo utilizzando la libreria di tokenizzazione specificata.
      4. Calcolare le statistiche di contrasto di frequenza e dominio dei termini e rimuovere termini ambigui o eccessivamente generici.
      5. Finalizza e archivia i lessici.
    2. Assegnazioni dei percorsi
      1. Applica l'abbinamento esatto di stringhe e livelli di token.
      2. Instradare gli annunci contenenti solo parole chiave di Intelligenza Artificiale al ramo di Intelligenza Artificiale.
      3. Instradare gli annunci contenenti solo parole chiave per la Protezione Ambientale al ramo Protezione Ambientale.
      4. Etichetta gli annunci senza corrispondenza come Altro.
      5. Instrada le assegnazioni di doppia corrispondenza al passaggio con recupero aumentato.
      6. Statistiche di instradamento dei record e versioni del lessico.
    3. Classifica le pubblicazioni ambigue
      1. Recupera i chunk rilevanti sotto impostazioni fisse di top-κ e τ.
      2. Inserisci le prove recuperate nel modello di prompt.
      3. Genera l'etichetta finale e salva i log per istanza.

2. Riclassificazione dei risultati

  1. Costruzione del thesaurus
    1. Costruisci un thesaurus di termini di Intelligenza Artificiale (File Supplementare 4). Includere termini come machine learning, elaborazione del linguaggio naturale, computer vision, robotica e sottocampi correlati. Organizza i termini dettagliati sotto ogni categoria.
    2. Costruisci un thesaurus separato di termini per la Protezione Ambientale. Includere i fondamenti delle scienze ambientali, il monitoraggio e l'analisi ambientale, il controllo e la gestione dell'inquinamento, e la pianificazione e gestione ambientale.
    3. Aggiungi tutti i termini di Intelligenza Artificiale e Protezione Ambientale al dizionario di tokenizzazione. Assicurati che questi termini siano riconosciuti come unità complete durante la segmentazione del testo.
  2. Preprocessing testo
    1. Rimuovere i segni di punteggiatura e i caratteri speciali usando espressioni regolari. Conserva solo testo e spazi.
    2. Esegui la segmentazione delle parole per dividere il testo continuo in singoli token.
  3. Esecuzione di abbinamento delle caratteristiche e categorizzazione
    1. Pre-elabora il testo di input per ottenere una lista di token segmentati.
    2. Seleziona il thesaurus appropriato in base alla classificazione preliminare.
    3. Attraversa i token segmentati ed esegui un matching esatto con i termini del thesaurus dopo la normalizzazione. Applica il lowercase e unifica le varianti predefinite prima di abbinare.
    4. Registra ogni termine corrispondente e il relativo ramo del thesaurus.
      NOTA: Se più rami corrispondono, risolvere i pareggi usando una regola fissa (ad esempio, il numero più alto di corrispondenze seguito dalla prima ocorrenza).
    5. Esporta la lista a termini abbinati e il tag finale all'interno del dominio per l'aggregazione a valle.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Quattro grandi backbone open source e ottimizzati per istruzioni (Backbone A–D) elencate nella Tabella dei Materiali sono valutate nel compito di classificazione delle offerte di lavoro a tre classi. La valutazione viene condotta utilizzando lo stesso protocollo di test, procedure di preelaborazione e metriche su tutte le spine dorsale, inclusi accuratezza complessiva, precisione, richiamo e F1. Il raffinamento rapido e la generazione aumentata al recupero (RAG) vengono ...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

Lavori precedenti hanno applicato il classico machine learning e modelli neurali alla categorizzazione dei testi di reclutamento, inclusa la classificazione di curriculum e descrizioni di lavoro, ma tali approcci spesso richiedono dati etichettati sostanziali e possono degradarsi quando la terminologia del dominio cambia. Ali et al. hanno proposto un sistema di classificazione dei curriculum utilizzando tecniche di NLP e apprendimentoautomatico 18. Jalili et al. h...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Gli autori non hanno nulla da rivelare.

Ringraziamenti

Gli autori ringraziano i colleghi per il supporto tecnico e i feedback costruttivi durante la cura dei dati e la preparazione dei manoscritti. Questo progetto non ricevette finanziamenti esterni.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
all-MiniLM-L6-v2 (codificatore di frasi)Faccia abbracciante (trasformatori di frase)https://huggingface.co/sentence-transformers/all-MiniLM-L6-v2Modello di inserimento delle frasi utilizzato per la vettorizzazione.
Bert-base-cinese (codificatore di base)Abbracciare il volto (google-bert)https://huggingface.co/google-bert/bert-base-chineseCodificatore di base (base BERT cinese).
Memoria DDR5, 16 GBConfigurazione workstation/laptopN/AMemoria di sistema (16 GB DDR5); Fornitore o numero di parte non specificato.
DeepSeek-R1-Distill-Qwen-7B (Spina Dorsale A)Abbracciare il volto (deepseek-ai)https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-7BLLM backbone A.
GLM-4-9B-Chat (Backbone C)Faccia Abracante (zai-org)https://huggingface.co/zai-org/glm-4-9b-chat-hfLLM backbone C.
Intel Core i5-13500HX CPUIntelhttps://www.intel.com/content/www/us/en/products/sku/232156/intel-core-i513500hx-processor-24m-cache-up-to-4-70-ghz/specifications.htmlCPU da workstation usata per esperimenti.
InternLM2.5-7B-Chat (Backbone D)Faccia abbracciante (interno)https://huggingface.co/internlm/internlm2_5-7b-chatLLM backbone D.
jieba (tokenizzatore cinese)PyPI (jieba)https://pypi.org/project/jieba/libreria cinese di tokenizzazione/segmentazione; Versione non specificata.
Librerie di parole chiave (AI & Ambientale) (Fascicolo Supplemento 3)Questo studioSupplemento File 3Lessici di parola chiave di dominio utilizzati per il pre-filtraggio guidato dal lessico; Archive versione esatta usata per ogni run.
LanceDB (database vettoriale)LanceDBN/ADatabase vettoriale per memorizzazione/ricerca di embedding; Versione non specificata.
NVIDIA GeForce RTX 4060 Laptop GPU (8 GB VRAM)NVIDIAhttps://www.nvidia.com/en-us/geforce/laptops/40-series/GPU usata per inferenze/esperimenti.
Annunci di lavoro online sulla piattaforma di reclutamento (2014– 2023)Principali piattaforme di reclutamento cinesi (dati web pubblici)N/AAnnunci di lavoro pubblicati raccolti e curati dagli autori; ~6,93 milioni di annunci dopo la pulizia.
pip (installatore di pacchetti Python)PyPAN/AL'installer del pacchetto veniva utilizzato per installare le dipendenze ed esportare uno snapshot dell'ambiente usando pip freeze.
Evoluzione del modello di prompt (File supplementare 2)Questo studioSupplemento File 2Varianti successive del prompt e il prompt finale utilizzato per la valutazione.
Python 3.10Python Software FoundationN/AInterprete runtime (Python 3.10); Versione della patch non specificata.
Qwen2.5-7B-Istruzione (Spina Dorsale B)Faccia abbracciante (Qwen)https://huggingface.co/Qwen/Qwen2.5-7B-InstructLLM backbone B.
Descrizioni/indice dei campi della knowledge base RAG (File Supplement 1)Questo studioFascicolo Supplemento 1Schema/appunti di campo e indice documentale per la knowledge base utilizzata nell'inferenza aumentata al recupero.
Thesaurus (AI & I; Ambientale) (Supplemento File 4)Questo studioSupplemento File 4Dizionari di termini usati nella riclassificazione e nell'analisi; Archive versione esatta usata per ogni run.
Windows 11 (64 bit)MicrosoftN/ASistema operativo (Windows 11, 64 bit); Build/versione non specificata.

Riferimenti

  1. Alekseeva, L., et al. The demand for AI skills in the labor market. Labour Economics. 71, 102002(2021).
  2. Ministry updates official dictionary of careers. , Ministry of Human Resources and Social Security of the People’s Republic of China. Available at: https://english.www.gov.cn/statecouncil/ministries/202209/30/content_WS633647bbc6d0a757729e0bb6.html (2022).
  3. BERT: Pre-training of deep bidirectional transformers for language understanding. Devlin, J., Chang, M. W., Lee, K., Toutanova, K. 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (NAACL-HLT), Minneapolis, MN, USA, , 4171-4186 (2019).
  4. Large language models in the workplace: A case study on prompt engineering for job type classification. Clavié, B., et al. 28th International Conference on Applications of Natural Language to Information Systems (NLDB 2023); , Derby, UK, , Springer. Natural Language Processing and Information Systems. Lecture Notes in Computer Science 3-17 (2023).
  5. Li, N., Kang, B., De Bie, T. LLM4Jobs: Unsupervised occupation extraction and standardization leveraging large language models. arXiv. , Available at: https://arxiv.org/abs/2309.09708 (2023).
  6. Deep learning-based computational job market analysis: A survey on skill extraction and classification from job postings. Senger, E., Zhang, M., van der Goot, R., Plank, B. 1st Workshop on Natural Language Processing for Human Resources (NLP4HR 2024), St. Julian’s, Malta, , 1-15 (2024).
  7. Enhancing job posting classification with multilingual embeddings and large language models. Kavas, H., Serra-Vidal, M., Wanner, L. 10th Italian Conference on Computational Linguistics (CLiC-it 2024), Pisa, Italy, , 440-450 (2024).
  8. JobBERT: Understanding job titles through skills. Decorte, J. J., Van Hautte, J., Demeester, T., Develder, C. International Workshop on Fair, Effective and Sustainable Talent Management using Data Science (FEAST 2021) at ECML-PKDD 2021, , (2021).
  9. Carotene: A job title classification system for the online recruitment domain. Javed, F., et al. IEEE First International Conference on Big Data Computing Service and Applications (BigDataService), , 286-293 (2015).
  10. Javed, F., McNair, M., Jacob, F., Zhao, M. Towards a job title classification system. arXiv. , Available at: https://arxiv.org/abs/1606.00917 (2016).
  11. Lewis, P., et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Presented at: Advances in Neural Information Processing Systems. NeurIPS. , (2020).
  12. The power of scale for parameter-efficient prompt tuning. Lester, B., Al-Rfou, R., Constant, N. 2021 Conference on Empirical Methods in Natural Language Processing (EMNLP), , 3045-3059 (2021).
  13. Han, X., et al. PTR: Prompt tuning with rules for text classification. AI Open. 3, 182-192 (2022).
  14. Brown, T. B., et al. Language models are few-shot learners. Presented at: Advances in Neural Information Processing Systems. NeurIPS. , (2020).
  15. Liu, P., et al. predict: A systematic survey of prompting methods in natural language processing. ACM Comput Surv. 55 (9), 195:1-195:35 (2023).
  16. Blue, A. The outlook for 2023 is uncertain, but here’s what we know about the global labour market. World Economic Forum (Agenda). , Available at: https://www.weforum.org/agenda/2023/01/the-outlook-for-2023-is-uncertain-but-here-s-what-we-know-about-the-global-labour-market-davos23 (2023).
  17. ESCOXLM-R: Multilingual taxonomy-driven pre-training for the job market domain. Zhang, M., van der Goot, R., Plank, B. 61st Annual Meeting of the Association for Computational Linguistics (ACL 2023), Toronto, Canada, , 11871-11890 (2023).
  18. Ali, I., et al. Resume classification system using natural language processing and machine learning techniques. Mehran Univ Res J Eng Technol. 41 (1), 65-79 (2022).
  19. BiLSTM for resume classification. Jalili, A., Tabrizchi, H., Razmara, J., Mosavi, A. 22nd IEEE International Symposium on Applied Machine Intelligence and Informatics (SAMI 2024), Stará Lesná, Slovakia, , (2024).
  20. Pal, R., Shaikh, S., Satpute, S., Bhagwat, S. Resume classification using various machine learning algorithms. ITM Web Conf. 44, 03011(2022).
  21. Convolutional neural network with word embedding based approach for resume classification. Nasser, S., Sreejith, C., Irshad, M. 2018 International Conference on Emerging Trends and Innovations in Engineering and Technological Research (ICETIETR 2018), , Ernakulam (Cochin), India. (2018).
  22. Real-time resume classification system using LinkedIn profile descriptions. Ramraj, S., Sivakumar, V. 2020 International Conference on Computational Intelligence for Smart Power Systems and Sustainable Energy (CISPSSE 2020), Keonjhar, Odisha, India, , (2020).
  23. Heakl, A., et al. ResumeAtlas: Revisiting resume classification with large-scale datasets and large language models. arXiv. , Available at: https://arxiv.org/abs/2406.18125 (2024).
  24. Skondras, P., Zervas, P., Tzimas, G. Generating synthetic resume data with large language models for enhanced job description classification. Future Internet. 15 (11), 363(2023).
  25. Chen, Z. Ethics and discrimination in artificial intelligence-enabled recruitment practices. Humanit Soc Sci Commun. 10, 567(2023).
  26. Retrieval-augmented few-shot text classification. Yu, G., et al. Findings of the Association for Computational Linguistics: EMNLP 2023, Singapore, , 6721-6735 (2023).
  27. Izacard, G., et al. Atlas: Few-shot learning with retrieval augmented language models. J Mach Learn Res. 24 (251), 1-43 (2023).
  28. KW-ATTN: Knowledge infused attention for accurate and interpretable text classification. Jang, H., et al. Deep Learning Inside Out (DeeLIO): 2nd Workshop on Knowledge Extraction and Integration for Deep Learning Architectures, , 96-107 (2021).

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Ristampe e permessi

Tag

Modelli con recupero aumentatoElenchi di parole chiave di dominioCostruzione di basi di conoscenzaRecupero tramite similarit cosinusoideK vicini pi prossimiClassificazione di testi cinesiAccordo tra annotatori