In de afgelopen jaren, met de snelle ontwikkeling van AI- en milieutechnologieën, zijn er een groot aantal opkomende carrières ontstaan. Aan de ene kant wordt de wereldwijde arbeidsmarkt overspoeld met veel gloednieuwe functies gebaseerd op AI en duurzaamheid. Vacature-gebaseerd bewijs documenteert een snelle toename van de vraag naar AI-gerelateerde vaardigheden, wat de heterogeniteit van wervingsteksten vergroot en motiveert tot een reproduceerbaar, schaalbaar domeintaggingprotocol1. Aan de andere kant heeft China's laatste herziening van het Occupational Classification Dictionary (OCD) een vergelijkbare sterke groei gezien in nieuwe beroepen op het gebied van werkgelegenheidsinformatisatie en groene en koolstofarme beroepen, met een netto toename van 158 nieuwe beroepen in de herziening van 2022 ten opzichte van de editie van 2015 van het Woordenboek, met in totaal 97 digitale beroepen. of 6% van het totale aantal beroepen, aangeduid, samen met 134 groene beroepen, of 8% van het totale aantal beroepen2.
Naarmate deze nieuwe beroepen blijven ontstaan, worden de inhoud en vorm van vacatures door bedrijven complexer, omdat functiebeschrijvingen vaak vakkennis en diverse vaardigheidsvereisten bevatten, met zowel gestructureerde vakgebieden zoals functietitels en vaardigheidslijsten, als een groot aantal ongestructureerde vrije tekstbeschrijvingen, wat resulteert in steeds complexere vacaturestructuren. Dergelijke complexe vacatures bevatten doorgaans duidelijk gedefinieerde gestructureerde elementen (bijvoorbeeld functietitels, lijsten van vereiste vaardigheden) naast uitgebreide ongestructureerde vrije tekstbeschrijvingen. Bijvoorbeeld, een vacature voor een AI-engineer kan technische jargon als 'vaardigheid in een deep learning-framework' en 'ervaring met het optimaliseren van backpropagatiealgoritmen' als onderdeel van een vaardigheidslijst vermelden, terwijl er ook een gedetailleerd verhaal van verantwoordelijkheden wordt opgenomen; Op dezelfde manier kan een vacature voor milieutechnisch ingenieur verwijzen naar specifieke regelgevende normen en certificeringen. Deze combinatie van gestructureerde en ongestructureerde inhoud resulteert in zeer gespecialiseerde en ingewikkelde functiebeschrijvingen.
Kunstmatige intelligentie en milieubescherming worden geselecteerd om het protocol te evalueren onder realistische cross-domain ambiguïteit in de wervingsclassificatie. In de praktijk geven gangbare beroepsbronnen zoals O*NET en vacaturebanken grove tags toe, waardoor cross-industrierollen moeilijk te onderscheiden zijn met alleen trefwoorden. Milieubescherming vertegenwoordigt een breed domein dat overlapt met meerdere wetenschappelijke vakgebieden, terwijl Kunstmatige Intelligentie een fijnmazigere indeling binnen de informatica weerspiegelt, vaak verward met algemene softwarerollen. Deze combinatie omvat zowel brede als smalle cross-domain settings met duidelijke terminologie en geschikte gezaghebbende documenten voor kennisbasisconstructie, terwijl aanpassing aan andere industrieën mogelijk is door het domeincorpus te vervangen zonder de kernworkflow te wijzigen.
De afgelopen jaren is er een toename geweest van onderzoek naar vacatureclassificaties. Onderzoekers maken steeds vaker gebruik van grote voorgetrainde modellen om de classificatie van beroepen te verbeteren. De introductie van BERT in 2019 betekende een doorbraak die diepgaand contextueel taalbegrip mogelijk maakte ende tekstclassificatieprestaties aanzienlijk verbeterde. Zo onderzochten Clavié et al. (2023) het gebruik van een instruction-tuned large language model (LLM) voor functieclassificatie, waarbij ze ontdekten dat goede prompt engineering de LLM in staat stelde om beter te presteren dan state-of-the-art supervised modellen op een graduate job classification-taak4. Evenzo stelden Li et al. (2023) een LLM4Jobs-benadering voor die samenvatting van grote taalmodellen combineert met beroepscodematching, waardoor de classificatienauwkeurigheid van lange functiebeschrijvingen aanzienlijk verbetert door eerst samenvattingen te extraheren en deze vervolgens uit te lijnen met standaard functiecodes5. Daarnaast catalogiseert een enquête uit 2024 van Senger et al. recente ontwikkelingen in deep learning voor HR, waarbij wordt opgemerkt dat vaardigheidsextractie en functieclassificatie kerntaken zijn geworden in computationele arbeidsmarktanalyse6. Kavas et al. (2024) verbeterden de classificatie van vacatures door meertalige tekstinbeddingen te combineren met LLM-gebaseerde categorisatie, waarmee aanzienlijke nauwkeurigheidswinsten werden behaald7. Op traditioneel vlak varieerden eerdere systemen van op trefwoorden gebaseerde heuristieken met relatief grove categorieën tot taxonomie-gedreven kaders zoals Carotene, dat een hiërarchie gebruikte over meer dan 4.000 functietitels 8,9. Javed et al. (2016) presenteerden een vroeg kader voor classificatie van functietitels, waarmee een van de eerste stappen naar systematische beroepscategoriseringmarkeerde 10. Deze begeleide benaderingen vereisen echter uitgebreide gelabelde data en hebben moeite zich aan te passen aan de snelle opkomst van nieuwe functies, aangezien classificatietaxonomieën vaak langzamer evolueren dan dearbeidsmarkt.
Om dergelijke beperkingen aan te pakken, is recent werk gericht op hybride strategieën die externe kennis integreren; zo introduceerden Lewis et al. (2020) het Retrieval-Augmented Generation (RAG) raamwerk, dat voorgetrainde taalmodellen combineert met een retriever om relevante domeinkennis te injecteren, waardoor superieure nauwkeurigheid en feitelijkere resultaten worden behaald op kennisintensieve taken11. Lester et al. toonden aan dat prompt tuning grotere prestatiewinsten oplevert naarmate de modelgrootte12 toeneemt, wat het gebruik van een sterke basis-LLM versterkt. Zo toonden Han et al. aan dat het gebruik van regelgestuurde prompts de nauwkeurigheid van tekstclassificatie kan verbeteren door het model te richten op sleutelkenmerken13. Bovendien toonden Brown et al. (2020) beroemd aan dat een groot taalmodel nieuwe taken kan uitvoeren op basis van slechts enkele voorbeelden of instructies, waarmee ze de kracht van prompt-gedreven few-shot learning14 benadrukten. Opmerkelijk is dat een recente enquête naar prompt-gebaseerde NLP-technieken benadrukt dat promptformulering modeloutput15 aanzienlijk kan sturen. Tegelijkertijd versterken verschuivingen op macroniveau en onzekerheid op de arbeidsmarkt de noodzaak van schaalbare en update-vriendelijke labelingsprotocollen die kunnen worden vernieuwd zodra nieuwe functies ontstaan16. Op het gebied van NLP op de arbeidsmarkt is ook taxonomie-gedreven meertalige vooropleiding onderzocht om de vertegenwoordiging beter af te stemmen op beroepsstructuren en cross-linguale variabiliteit17. Gezamenlijk informeren deze studies de aanpak en tonen ze het potentieel aan van het gebruik van grote taalmodellen met retrieval- en promptoptimalisatie om opkomende bezettingscontexten effectiever te herkennen en aan te passen.
In deze studie wordt domeinkennis uitsluitend gecureerd voor Kunstmatige Intelligentie en Milieubescherming, aangezien corpusconstructie, validatie en onderhoud de belangrijkste operationele kosten vormen van cross-domain wervingsclassificatie. Dienovereenkomstig dient Other als een afwijzingscategorie buiten de scope in plaats van als een substantiële brancheklasse. De gerapporteerde hoge nauwkeurigheid moet met voorzichtigheid worden geïnterpreteerd, omdat de drie-label-instelling etikettering vereenvoudigt en de prestaties kan verhogen in vergelijking met fijnmazigere taxonomieën. Het protocol is bedoeld als een lichtgewicht, kennisgebaseerd labellaag voor doelgerichte domeinen, niet als vervanging voor uitgebreide multi-categorie classificatiesystemen. Het uitbreiden van de labelset kan de nauwkeurigheid verminderen door meer overlap, ambiguïteit en strengere vereisten voor corpusdekking. In de praktijk kan de afwijzingsset geleidelijk worden verfijnd door het domeincorpus uit te breiden en interne kennisbases te integreren. De drie-label-configuratie toont daarom een herbruikbaar paradigma in plaats van een uitputtende beroepstaxonomie.
De dataset combineert gestructureerde en ongestructureerde bronnen. Het gestructureerde corpus werd verzameld en samengesteld door de auteurs uit vacatures die tussen 2014 en 2023 door beursgenoteerde bedrijven op grote online wervingsplatforms in China werden geplaatst. Na deduplicatie en basisreiniging bevat het gestructureerde corpus ongeveer 6,93 miljoen postingen. Ongestructureerde domeindocumenten die door relevante autoriteiten zijn vrijgegeven, werden gebruikt om criteria voor domeinkennis en etikettering te definiëren. Uit deze bronnen werden handmatig drie benchmark-subsets samengesteld, elk met 1.000 vacatures voor respectievelijk Kunstmatige Intelligentie, Milieubescherming en niet-gerelateerde vakgebieden, en geverifieerd voor evaluatie.
Modelbackbones worden geëvalueerd met behulp van nauwkeurigheid, precisie, recall en F1 (het harmonisch gemiddelde van precisie en recall, F1 = 2PR/(P+R)) om de optimale basis te kiezen voor de ophaal-augmented workflow. Gezaghebbende domeindocumenten worden gecompileerd in een kennisbank voor retrieval-augmented generatie (RAG). Relevante passages worden opgehaald en in een vaste prompttemplate geïnjecteerd ter ondersteuning van classificatie. Promptvarianten worden systematisch getest en een cueword-optimalisatiestrategie wordt toegepast om de uiteindelijke configuratie te bepalen. Teruggevonden bewijs wordt gefilterd op relevantie om ruis te minimaliseren en nauwkeurige, efficiënte inferentie te ondersteunen.
Om grootschalige classificatie mogelijk te maken, hanteert de workflow een gefaseerde pijplijn: door lexicon geleide triage lost routinezaken efficiënt op, terwijl ophaal-uitgebreide, prompt-geoptimaliseerde LLM-inferentie dubbelzinnige berichten afhandelt, waarbij schaalbaarheid en nauwkeurigheid in balans zijn (Figuur 1).