Negli ultimi anni, con il rapido sviluppo dell'IA e delle tecnologie ambientali, sono emerse numerose carriere emergenti. Da un lato, il mercato del lavoro globale è invaso da molte nuove posizioni basate su IA e sostenibilità. Le evidenze basate sulle vacanze documentano una rapida espansione della domanda di competenze legate all'IA, che aumenta l'eterogeneità dei testi di reclutamento e motiva un protocollo di domaintagging 1 riproducibile e scalabile. D'altra parte, l'ultima revisione cinese del Dizionario della Classificazione Professionale (OCD) ha visto una crescita altrettanto robusta di nuove occupazioni nei campi dell'informatizzazione dell'occupazione e delle posizioni green e a basse emissioni di carbonio, con un aumento netto di 158 nuove occupazioni nella revisione del 2022 rispetto all'edizione 2015 del Dizionario, per un totale di 97 occupazioni digitali. oppure il 6% del numero totale di occupazioni, etichettate, insieme a 134 occupazioni verdi, ovvero l'8% del numero totale dioccupazioni 2.
Con l'emergere di queste nuove professioni, il contenuto e la forma degli annunci di lavoro delle aziende diventano più complessi, poiché le descrizioni di lavoro spesso coinvolgono conoscenze specifiche e requisiti di competenze diversificati, contenendo sia campi strutturati come titoli di lavoro e liste di competenze, sia un gran numero di descrizioni libere non strutturate, portando a strutture di annunci sempre più complesse. Annunci di lavoro così complessi tipicamente contengono elementi strutturati chiaramente definiti (ad esempio, titoli di lavoro, liste di competenze richieste) insieme a ampie descrizioni non strutturate in testo libero. Ad esempio, un annuncio di lavoro per ingegnere AI potrebbe elencare gergo tecnico come 'competenza in un framework di deep learning' e 'esperienza nell'ottimizzazione degli algoritmi di backpropagation' come parte di una lista di competenze, includendo anche una narrazione dettagliata delle responsabilità; Allo stesso modo, un annuncio per ingegnere ambientale potrebbe fare riferimento a standard normativi e certificazioni specifiche. Questa combinazione di contenuti strutturati e non strutturati porta a descrizioni di lavoro altamente specializzate e complicate.
Intelligenza Artificiale e Protezione Ambientale sono selezionate per valutare il protocollo sotto realistica ambiguità trasversale nella classificazione del reclutamento. In pratica, le risorse professionali mainstream come O*NET e i bacheche di offerte assegnano tag grossolani, rendendo difficile distinguere i ruoli intersectoriali usando solo parole chiave. La Protezione Ambientale rappresenta un ampio dominio che si sovrappone a molteplici campi scientifici, mentre l'Intelligenza Artificiale riflette una sezione più dettagliata all'interno dell'informatica spesso confusa con ruoli software generali. Questa associazione cattura sia contesti ampi che stretti cross-domain con terminologia distinta e documenti autorevoli adeguati per la costruzione di una base di conoscenza, consentendo al contempo l'adattamento ad altri settori sostituendo il corpus di dominio senza alterare il flusso di lavoro core.
Negli ultimi anni si è registrato un aumento delle ricerche sulla classificazione degli annunci di lavoro. I ricercatori stanno sempre più sfruttando grandi modelli pre-addestrati per migliorare la classificazione delle professioni. L'introduzione di BERT nel 2019 ha rappresentato una svolta che ha permesso una comprensione profondamente contestuale del linguaggio e ha migliorato significativamente le prestazioni nella classificazionedei testi 3. Ad esempio, Clavié et al. (2023) hanno esplorato l'uso di un modello di linguaggio di grandi dimensioni (LLM) ottimizzato per istruzioni per la classificazione dei lavori, scoprendo che una corretta ingegneria dei prompt permetteva all'LLM di superare modelli supervisionati all'avanguardia in uncompito 4 di classificazione del lavoro per graduati. Analogamente, Li et al. (2023) hanno proposto un approccio LLM4Jobs che combina la sintesi dei modelli in grandi linguaggi con il matching dei codici occupazionali, migliorando significativamente l'accuratezza della classificazione nelle descrizioni di lavoro lunghe estraendo prima i riassunti e poi allineandoli ai codici standard5. Inoltre, un sondaggio del 2024 condotto da Senger et al. cataloga i recenti progressi nel deep learning per le risorse umane, osservando che l'estrazione delle competenze e la classificazione dei lavori sono diventate compiti fondamentali nell'analisi computazionale del mercatodel lavoro 6. Kavas et al. (2024) hanno migliorato la classificazione degli annunci di lavoro combinando incorporamenti di testo multilingue con categorizzazioni basate su LLM, ottenendo notevoli miglioramentidi accuratezza 7. Sul fronte tradizionale, i sistemi precedenti spaziavano da euristiche basate su parole chiave con insiemi di categorie relativamente grossolani a framework guidati dalla tassonomia come il Carotene, che utilizzava una gerarchia su oltre 4.000 titoli di lavoro 8,9. Javed et al. (2016) hanno presentato un primo quadro di classificazione dei titoli di lavoro, segnando uno dei primi passi verso la categorizzazione sistematica delleoccupazioni 10. Questi approcci supervisionati, tuttavia, richiedono dati etichettati estesi e faticano ad adattarsi alla rapida emergere di nuovi ruoli lavorativi, poiché le tassonomie di classificazione spesso evolvono più lentamente rispetto al mercatodel lavoro 4.
Per affrontare tali limitazioni, i lavori recenti si sono orientati verso strategie ibride che incorporano conoscenze esterne; ad esempio, Lewis et al. (2020) hanno introdotto il framework Retrieval-Augmented Generation (RAG), che combina modelli linguistici pre-addestrati con un retriever per iniettare conoscenze rilevanti del dominio, ottenendo una precisione superiore e risultati più fattuali su compiti ad alta intensità di conoscenza11. Lester et al. hanno dimostrato che la messa a punto prompt produce maggiori aumenti di prestazioni man mano che la dimensione del modelloaumenta di 12, rafforzando l'uso di un solido LLM base. Ad esempio, Han et al. hanno dimostrato che l'uso di prompt guidati da regole può aumentare l'accuratezza della classificazione del testo concentrando il modello sulle caratteristiche chiave13. Inoltre, Brown et al. (2020) hanno dimostrato in modo famoso che un grande modello linguistico può svolgere nuovi compiti da pochi esempi o istruzioni, evidenziando la potenza dell'apprendimento poche shot guidato dai prompt14. In particolare, un recente sondaggio sulle tecniche di NLP basate su prompt sottolinea che la formulazione dei prompt può influenzare significativamente i risultati delmodello 15. Allo stesso tempo, i cambiamenti a livello macro e l'incertezza nel mercato del lavoro rafforzano la necessità di protocolli di etichettatura scalabili e accessibili all'aggiornamento, che possano essere aggiornati man mano che emergono nuoviruoli 16. Nel dominio NLP del mercato del lavoro, è stata inoltre esplorata la pre-formazione multilingue guidata dalla tassonomia per allineare meglio le rappresentazioni con le strutture occupazionali e la variabilitàinterlingue 17. Collettivamente, questi studi informano l'approccio e dimostrano il potenziale dell'utilizzo di grandi modelli linguistici con recupero e ottimizzazione dei prompt per riconoscere e adattarsi più efficacemente ai contesti lavorativi emergenti.
In questo studio, la conoscenza del dominio è curata solo per l'Intelligenza Artificiale e la Protezione Ambientale, poiché la costruzione dei corpus, la validazione e la manutenzione rappresentano i principali costi operativi della classificazione del reclutamento cross-domain. Di conseguenza, Other rappresenta una categoria di rifiuto fuori ambito piuttosto che una classe industriale sostanziale. L'elevata accuratezza riportata deve essere interpretata con cautela, poiché l'impostazione a tre etichette semplifica l'etichettatura e può gonfiare le prestazioni rispetto alle tassonomie a grana più fine. Il protocollo è pensato come uno strato di etichettatura leggero e basato sulla conoscenza per domini target, non come sostituto di sistemi di classificazione multi-categoria completi. L'espansione del set di etichette può ridurre l'accuratezza a causa di una maggiore sovrapposizione, ambigì e requisiti più rigorosi di copertura del corpus. In pratica, l'insieme di rifiuti può essere progressivamente raffinato estendendo il corpus di dominio e incorporando le basi di conoscenza interne. La configurazione a tre etichette, quindi, dimostra un paradigma riutilizzabile piuttosto che una tassonomia professionale esaustiva.
Il dataset combina fonti strutturate e non strutturate. Il corpus strutturato è stato raccolto e curato dagli autori a partire dagli annunci di lavoro pubblicati da società quotate in borsa sulle principali piattaforme di reclutamento online in Cina tra il 2014 e il 2023. Dopo la deduplicazione e la pulizia di base, il corpus strutturato contiene circa 6,93 milioni di incarichi. I documenti di dominio non strutturati rilasciati dalle autorità competenti sono stati utilizzati per definire la conoscenza del dominio e i criteri di etichettatura. Da queste fonti, sono stati costruiti manualmente tre sottoinsiemi di benchmark, ciascuno contenente 1.000 annunci per Intelligenza Artificiale, Protezione Ambientale e campi non correlati, rispettivamente, e verificati per la valutazione.
Le dorsale dei modelli vengono valutate utilizzando accuratezza, precisione, richiamo e F1 (la media armonica di precisione e richiamo, F1 = 2PR/(P+R)) per selezionare la base ottimale per il flusso di lavoro aumentato dal recupero. I documenti di dominio autorevoli vengono compilati in una base di conoscenza per la generazione aumentata al recupero (RAG). I passaggi rilevanti vengono recuperati e inseriti in un modello di prompt fisso per supportare la classificazione. Le varianti di prompt vengono testate sistematicamente e viene applicata una strategia di ottimizzazione con parole di segnale per determinare la configurazione finale. Le prove recuperate vengono filtrate per la loro rilevanza al fine di minimizzare il rumore e supportare inferenze accurate ed efficienti.
Per consentire una classificazione su larga scala, il flusso di lavoro adotta una pipeline a fasi: il triage guidato da lessico risolve in modo efficiente i casi di routine, mentre l'inferenza LLM ottimizzata per il recupero e ottimizzata per prompt gestisce le pubblicazioni ambigue, bilanciando scalabilità e accuratezza (Figura 1).