Een abonnement op JoVE is vereist om deze inhoud te bekijken. Log in of start vandaag met uw gratis proefperiode.

Methodenartikel

Tweefasige wervingstekstlabeling via lexicon-geleide routering en ophaal-geaugmenteerde grote taalmodellen

136 weergaven

DOI:

10.3791/70153

8 mei 2026

In dit artikel

Samenvatting

Er wordt een tweefasige workflow beschreven voor het classificeren van wervingsteksten in Kunstmatige Intelligentie, Milieubescherming of Overige. Lexicon-geleide triage wijst routinezaken toe, terwijl retrieval-augmentated, prompt-geoptimaliseerde inferentie van grote taalmodellen dubbelzinnige gevallen oplost, waardoor nauwkeurige grootschalige etikettering en downstream beschrijvende arbeidsmarktsamenvatting mogelijk wordt.

Samenvatting

Rekruteringsteksten zijn heterogeen en domeinterminologie evolueert in de loop van de tijd, waardoor grootschalige etikettering moeilijk wordt met beperkte handmatige annotatiecapaciteit. Dit protocol biedt een reproduceerbare tweefasige workflow voor het classificeren van Chinese wervingsteksten in Kunstmatige Intelligentie, Milieubescherming of Overige. Fase één voert lexicon-geleide triage uit met behulp van twee gecureerde domein-zoekwoordenlijsten. Berichten die slechts overeenkomen met één domeinlexicon zijn direct gelabeld. Berichten die aan geen van beide lexicons voldoen, worden als Overig gelabeld, terwijl dual-match postings naar fase twee worden gestuurd. Fase twee past retrieval-augmented large language model inferentie toe. Een kennisbank, samengesteld uit 12 gezaghebbende domeindocumenten, wordt omgezet in tekst, opgesplitst in ongeveer 1.000-tekens blokken met overlap van 20 tekens, ingebed met all-MiniLM-L6-v2, en geïndexeerd in LanceDB. Voor elke onzekere post levert cosinus-similarity k-naaste-neighbor retrieval kandidaatchunks terug die gefilterd zijn door een minimale similariteitsdrempel (τ), en tot vier chunks worden geïnjecteerd in een vaste prompttemplate die labelgrenzen definieert en de output beperkt tot één label. Een benchmarkset van 3.000 berichten wordt handmatig geverifieerd, met 1.000 vacatures per klasse, en bereikt een overeenkomst tussen de annotators van 95,0% en een Cohen's kappa (κ) van ongeveer 0,93. Evaluatie vergelijkt meerdere open-source grote taalmodellen in een prompt-only setting en een retrieval-augmented setting met behulp van Qwen2.5-7B-Instruct. De ophaal-augmented configuratie bereikt een nauwkeurigheid van 98,47 % en ondersteunt corpusschaal-labeling van ongeveer 6,93 miljoen berichten voor downstream beschrijvende aggregatie.

Inleiding

In de afgelopen jaren, met de snelle ontwikkeling van AI- en milieutechnologieën, zijn er een groot aantal opkomende carrières ontstaan. Aan de ene kant wordt de wereldwijde arbeidsmarkt overspoeld met veel gloednieuwe functies gebaseerd op AI en duurzaamheid. Vacature-gebaseerd bewijs documenteert een snelle toename van de vraag naar AI-gerelateerde vaardigheden, wat de heterogeniteit van wervingsteksten vergroot en motiveert tot een reproduceerbaar, schaalbaar domeintaggingprotocol1. Aan de andere kant heeft China's laatste herziening van het Occupational Classification Dictionary (OCD) een vergelijkbare sterke groei gezien in nieuwe beroepen op het gebied van werkgelegenheidsinformatisatie en groene en koolstofarme beroepen, met een netto toename van 158 nieuwe beroepen in de herziening van 2022 ten opzichte van de editie van 2015 van het Woordenboek, met in totaal 97 digitale beroepen. of 6% van het totale aantal beroepen, aangeduid, samen met 134 groene beroepen, of 8% van het totale aantal beroepen2.

Naarmate deze nieuwe beroepen blijven ontstaan, worden de inhoud en vorm van vacatures door bedrijven complexer, omdat functiebeschrijvingen vaak vakkennis en diverse vaardigheidsvereisten bevatten, met zowel gestructureerde vakgebieden zoals functietitels en vaardigheidslijsten, als een groot aantal ongestructureerde vrije tekstbeschrijvingen, wat resulteert in steeds complexere vacaturestructuren. Dergelijke complexe vacatures bevatten doorgaans duidelijk gedefinieerde gestructureerde elementen (bijvoorbeeld functietitels, lijsten van vereiste vaardigheden) naast uitgebreide ongestructureerde vrije tekstbeschrijvingen. Bijvoorbeeld, een vacature voor een AI-engineer kan technische jargon als 'vaardigheid in een deep learning-framework' en 'ervaring met het optimaliseren van backpropagatiealgoritmen' als onderdeel van een vaardigheidslijst vermelden, terwijl er ook een gedetailleerd verhaal van verantwoordelijkheden wordt opgenomen; Op dezelfde manier kan een vacature voor milieutechnisch ingenieur verwijzen naar specifieke regelgevende normen en certificeringen. Deze combinatie van gestructureerde en ongestructureerde inhoud resulteert in zeer gespecialiseerde en ingewikkelde functiebeschrijvingen.

Kunstmatige intelligentie en milieubescherming worden geselecteerd om het protocol te evalueren onder realistische cross-domain ambiguïteit in de wervingsclassificatie. In de praktijk geven gangbare beroepsbronnen zoals O*NET en vacaturebanken grove tags toe, waardoor cross-industrierollen moeilijk te onderscheiden zijn met alleen trefwoorden. Milieubescherming vertegenwoordigt een breed domein dat overlapt met meerdere wetenschappelijke vakgebieden, terwijl Kunstmatige Intelligentie een fijnmazigere indeling binnen de informatica weerspiegelt, vaak verward met algemene softwarerollen. Deze combinatie omvat zowel brede als smalle cross-domain settings met duidelijke terminologie en geschikte gezaghebbende documenten voor kennisbasisconstructie, terwijl aanpassing aan andere industrieën mogelijk is door het domeincorpus te vervangen zonder de kernworkflow te wijzigen.

De afgelopen jaren is er een toename geweest van onderzoek naar vacatureclassificaties. Onderzoekers maken steeds vaker gebruik van grote voorgetrainde modellen om de classificatie van beroepen te verbeteren. De introductie van BERT in 2019 betekende een doorbraak die diepgaand contextueel taalbegrip mogelijk maakte ende tekstclassificatieprestaties aanzienlijk verbeterde. Zo onderzochten Clavié et al. (2023) het gebruik van een instruction-tuned large language model (LLM) voor functieclassificatie, waarbij ze ontdekten dat goede prompt engineering de LLM in staat stelde om beter te presteren dan state-of-the-art supervised modellen op een graduate job classification-taak4. Evenzo stelden Li et al. (2023) een LLM4Jobs-benadering voor die samenvatting van grote taalmodellen combineert met beroepscodematching, waardoor de classificatienauwkeurigheid van lange functiebeschrijvingen aanzienlijk verbetert door eerst samenvattingen te extraheren en deze vervolgens uit te lijnen met standaard functiecodes5. Daarnaast catalogiseert een enquête uit 2024 van Senger et al. recente ontwikkelingen in deep learning voor HR, waarbij wordt opgemerkt dat vaardigheidsextractie en functieclassificatie kerntaken zijn geworden in computationele arbeidsmarktanalyse6. Kavas et al. (2024) verbeterden de classificatie van vacatures door meertalige tekstinbeddingen te combineren met LLM-gebaseerde categorisatie, waarmee aanzienlijke nauwkeurigheidswinsten werden behaald7. Op traditioneel vlak varieerden eerdere systemen van op trefwoorden gebaseerde heuristieken met relatief grove categorieën tot taxonomie-gedreven kaders zoals Carotene, dat een hiërarchie gebruikte over meer dan 4.000 functietitels 8,9. Javed et al. (2016) presenteerden een vroeg kader voor classificatie van functietitels, waarmee een van de eerste stappen naar systematische beroepscategoriseringmarkeerde 10. Deze begeleide benaderingen vereisen echter uitgebreide gelabelde data en hebben moeite zich aan te passen aan de snelle opkomst van nieuwe functies, aangezien classificatietaxonomieën vaak langzamer evolueren dan dearbeidsmarkt.

Om dergelijke beperkingen aan te pakken, is recent werk gericht op hybride strategieën die externe kennis integreren; zo introduceerden Lewis et al. (2020) het Retrieval-Augmented Generation (RAG) raamwerk, dat voorgetrainde taalmodellen combineert met een retriever om relevante domeinkennis te injecteren, waardoor superieure nauwkeurigheid en feitelijkere resultaten worden behaald op kennisintensieve taken11. Lester et al. toonden aan dat prompt tuning grotere prestatiewinsten oplevert naarmate de modelgrootte12 toeneemt, wat het gebruik van een sterke basis-LLM versterkt. Zo toonden Han et al. aan dat het gebruik van regelgestuurde prompts de nauwkeurigheid van tekstclassificatie kan verbeteren door het model te richten op sleutelkenmerken13. Bovendien toonden Brown et al. (2020) beroemd aan dat een groot taalmodel nieuwe taken kan uitvoeren op basis van slechts enkele voorbeelden of instructies, waarmee ze de kracht van prompt-gedreven few-shot learning14 benadrukten. Opmerkelijk is dat een recente enquête naar prompt-gebaseerde NLP-technieken benadrukt dat promptformulering modeloutput15 aanzienlijk kan sturen. Tegelijkertijd versterken verschuivingen op macroniveau en onzekerheid op de arbeidsmarkt de noodzaak van schaalbare en update-vriendelijke labelingsprotocollen die kunnen worden vernieuwd zodra nieuwe functies ontstaan16. Op het gebied van NLP op de arbeidsmarkt is ook taxonomie-gedreven meertalige vooropleiding onderzocht om de vertegenwoordiging beter af te stemmen op beroepsstructuren en cross-linguale variabiliteit17. Gezamenlijk informeren deze studies de aanpak en tonen ze het potentieel aan van het gebruik van grote taalmodellen met retrieval- en promptoptimalisatie om opkomende bezettingscontexten effectiever te herkennen en aan te passen.

In deze studie wordt domeinkennis uitsluitend gecureerd voor Kunstmatige Intelligentie en Milieubescherming, aangezien corpusconstructie, validatie en onderhoud de belangrijkste operationele kosten vormen van cross-domain wervingsclassificatie. Dienovereenkomstig dient Other als een afwijzingscategorie buiten de scope in plaats van als een substantiële brancheklasse. De gerapporteerde hoge nauwkeurigheid moet met voorzichtigheid worden geïnterpreteerd, omdat de drie-label-instelling etikettering vereenvoudigt en de prestaties kan verhogen in vergelijking met fijnmazigere taxonomieën. Het protocol is bedoeld als een lichtgewicht, kennisgebaseerd labellaag voor doelgerichte domeinen, niet als vervanging voor uitgebreide multi-categorie classificatiesystemen. Het uitbreiden van de labelset kan de nauwkeurigheid verminderen door meer overlap, ambiguïteit en strengere vereisten voor corpusdekking. In de praktijk kan de afwijzingsset geleidelijk worden verfijnd door het domeincorpus uit te breiden en interne kennisbases te integreren. De drie-label-configuratie toont daarom een herbruikbaar paradigma in plaats van een uitputtende beroepstaxonomie.

De dataset combineert gestructureerde en ongestructureerde bronnen. Het gestructureerde corpus werd verzameld en samengesteld door de auteurs uit vacatures die tussen 2014 en 2023 door beursgenoteerde bedrijven op grote online wervingsplatforms in China werden geplaatst. Na deduplicatie en basisreiniging bevat het gestructureerde corpus ongeveer 6,93 miljoen postingen. Ongestructureerde domeindocumenten die door relevante autoriteiten zijn vrijgegeven, werden gebruikt om criteria voor domeinkennis en etikettering te definiëren. Uit deze bronnen werden handmatig drie benchmark-subsets samengesteld, elk met 1.000 vacatures voor respectievelijk Kunstmatige Intelligentie, Milieubescherming en niet-gerelateerde vakgebieden, en geverifieerd voor evaluatie.

Modelbackbones worden geëvalueerd met behulp van nauwkeurigheid, precisie, recall en F1 (het harmonisch gemiddelde van precisie en recall, F1 = 2PR/(P+R)) om de optimale basis te kiezen voor de ophaal-augmented workflow. Gezaghebbende domeindocumenten worden gecompileerd in een kennisbank voor retrieval-augmented generatie (RAG). Relevante passages worden opgehaald en in een vaste prompttemplate geïnjecteerd ter ondersteuning van classificatie. Promptvarianten worden systematisch getest en een cueword-optimalisatiestrategie wordt toegepast om de uiteindelijke configuratie te bepalen. Teruggevonden bewijs wordt gefilterd op relevantie om ruis te minimaliseren en nauwkeurige, efficiënte inferentie te ondersteunen.

Om grootschalige classificatie mogelijk te maken, hanteert de workflow een gefaseerde pijplijn: door lexicon geleide triage lost routinezaken efficiënt op, terwijl ophaal-uitgebreide, prompt-geoptimaliseerde LLM-inferentie dubbelzinnige berichten afhandelt, waarbij schaalbaarheid en nauwkeurigheid in balans zijn (Figuur 1).

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

Deze studie betrof geen menselijke deelnemers of dierlijke proefpersonen. Daarom waren ethische goedkeuring en geïnformeerde toestemming niet vereist. De workflow werd uitgevoerd in een Python 3.10-omgeving op een 64-bits Windows-besturingssysteem met behulp van de hardware, tools en software die in de Table of Materials zijn vermeld.

1. Modelleren

  1. Het opbouwen van de data en kennisbank
    1. Verzamel en cureer een intern gestructureerd corpus van vacatures voor beursgenoteerde bedrijven van grote online wervingsplatforms in China (2014–2023), waarbij wordt gewaarborgd dat je voldoet aan het platformbeleid en de toepasselijke regelgeving. Voor elke vacature noteer je de functietitel, functiebeschrijving, bedrijfsnaam, plaatsingsdatum en een unieke identificatie (bijvoorbeeld vacature-ID of URL, indien beschikbaar). Verwijder duplicaten en ongeldige vermeldingen en verifieer dat het uiteindelijke corpus ongeveer 6,93 miljoen records bevat.
    2. Verzamel gezaghebbende domeindocumenten met betrekking tot Kunstmatige Intelligentie en Milieubescherming, inclusief de documenten die in Aanvullend Dossier 1 zijn vermeld. Zorg ervoor dat de documenten competenties, kwalificatienormen, takenscopes of gereguleerde procedures definiëren.
  2. Het construeren van de benchmarkdataset
    1. Screen de gestructureerde dataset handmatig. Selecteer vacatures die duidelijk betrekking hebben op Kunstmatige Intelligentie, Milieubescherming en niet-gerelateerde vakgebieden. Neem borderline gevallen op om de dekking te verbeteren.
    2. Label elke vacature met functietitel, functiebeschrijving en werkgeversinformatie.
    3. Stel drie benchmark-subsets samen met elk 1.000 berichten voor Kunstmatige Intelligentie, Milieubescherming en Overige.
    4. Voer dubbele annotatie uit. Wijs één annotator toe om elke post te labelen en een tweede annotator om het label te verifiëren met behulp van een geschreven richtlijn.
    5. Los meningsverschillen op door overleg en beoordeling door een derde annotator.
    6. Bereken inter-annotator overeenkomst. Noteer de procentuele overeenkomst en κ.
    7. Bewaar de geverifieerde benchmarkdataset voor modelevaluatie.
  3. Evaluatie van modelbackbones
    1. Evalueer de instructie-afgestemde LLM-backbones met dezelfde prompttemplate en benchmarkdataset.
    2. Schakel retrieval augmentation uit tijdens de backbone-vergelijking.
    3. Houd promptformuleringen, codeerparameters en labelmapping identiek over modellen heen.
    4. Bereken de algehele nauwkeurigheid, precisie per klasse, terugroeping en F1.
    5. Selecteer de best presterende backbone en noter de configuratie in Tabel 1.
    6. Rapporteer de volledige evaluatieresultaten in Tabel 2.
  4. Uitvoeren van domeinadaptieve encodertraining
    1. Bouw een niet-gelabeld corpus op met alleen de gezaghebbende documenten die in Supplementair Bestand 1 zijn vermeld.
    2. Haal platte tekst uit alle documenten.
    3. Deel tekst op in reeksen met een maximale lengte van 512 en een pas van 492.
    4. Gooi segmenten korter dan 50 tekens weg.
    5. Zorg ervoor dat benchmark-advertenties uit dit corpus worden uitgesloten.
    6. Initialiseer de Chinese BERT-basiscontroleposten.
    7. Voer voortraining voor gemaskerde taalmodellen uit met maskeringskans 0,15.
    8. Train voor 3 epochs met AdamW met leersnelheid 5e-5 en batchgrootte 2.
    9. Bewaar het vooraf getrainde controlepunt.
    10. Fijn de encoder voor drie-klassen classificatie met een leersnelheid van 2e-5, een batchgrootte van 2 en een maximale sequentielengte van 512.
    11. Zet de willekeurige seed vast op 42 en pas gestratificeerde trainvalidatiesplitsing toe.
    12. Rapportagenauwkeurigheid, macro-gemiddelde precisie, macro-gemiddelde recall, macro-gemiddelde F1, per-klasse metrics en de verwarringsmatrix.
    13. Sla evaluatie-uitkomsten op voor verificatie.
  5. Het construeren van de Retrieval-Augmented Classificatiepijplijn
    1. Bouw de kennisbank op
      1. Verzamel 12 gezaghebbende domeinen.
      2. Verwijder dubbele of verouderde versies.
      3. Zet documenten om naar platte tekst.
      4. Registreer metadata van documenten, inclusief uitgevende en publicatiejaar.
      5. Splits tekst op in stukken van ongeveer 1.000 tekens met overlap van 20 tekens.
      6. Noteer het totale aantal chunks en de chunk-lengte verdeling.
        OPMERKING: Valideer de ophaalprestaties opnieuw als de kennisbank is uitgebreid.
    2. Codeer en sla embeddings op
      1. Codeer alle chunks met het embeddingmodel en sla embeddings op in de vectordatabase.
      2. Archiveer chunk-identificaties en herkomstmetadata.
      3. Controleer of het aantal opgeslagen vectoren overeenkomt met het aantal chunks.
    3. Voer de ophaalactie uit.
      1. Embed elke vacature met hetzelfde embeddingmodel.
      2. Voer k-dichtstbijzijnde burenzoektocht uit met cosinusgelijkenis.
      3. Pas gelijkenisdrempel τ toe om laag-relevante matches te filteren.
      4. Fix τ en top-κ na het afstemmen op een vastgehouden subset.
      5. Record, opgehaalde chunk-identificaties en gelijkenisscores.
    4. Voer Retrieval-Augmented Inferentie uit
      1. Voeg tot vier opgehaalde chunks in in het bewijsgedeelte van het prompttemplate (Supplementary File 2).
      2. Koppel de vacaturetekst aan met opgevraagd bewijs.
      3. Genereer het uiteindelijke drie-klassenlabel met behulp van de geselecteerde LLM.
      4. Sla ophaallogboeken, prompts en modeluitvoeren op.
  6. Lexicon-geleide triage uitvoeren
    1. Construct-trefwoordlexiconen
      1. Stel twee trefwoordlexicons samen: één voor Kunstmatige Intelligentie en één voor Milieubescherming (Aanvullend Bestand 3).
      2. Haal kandidatentermen uit vacatures en gezaghebbende documenten.
      3. Tokeniseer tekst met behulp van de gespecificeerde tokenisatiebibliotheek.
      4. Bereken termfrequentie- en domeincontraststatistieken en verwijder dubbelzinnige of te generieke termen.
      5. Voltooi en archiveer de lexicons.
    2. Route-advertenties
      1. Pas exacte string- en token-niveau matching toe.
      2. Doorstuuradvertenties die alleen Artificial Intelligence-trefwoorden bevatten naar de Artificial Intelligence-afdeling.
      3. Route-advertenties bevatten alleen Milieubeschermingszoekwoorden voor de afdeling Milieubescherming.
      4. Label no-match berichten als Overig.
      5. Routeer dual-match postings naar de ophaal-augmenteerde stap.
      6. Recordroute-statistieken en lexiconversies.
    3. Classificeer ambigue berichten
      1. Haal relevante chunks op onder vaste top-κ en τ-instellingen.
      2. Injecteer het opgehaalde bewijs in het prompttemplate.
      3. Genereer het uiteindelijke label en sla logs per instantie op.

2. Herclassificatie van de resultaten

  1. Thesaurusconstructie
    1. Bouw een thesaurus van termen van Kunstmatige Intelligentie (Supplementair Bestand 4). Neem termen op uit machine learning, natuurlijke taalverwerking, computer vision, robotica en aanverwante subgebieden. Organiseer gedetailleerde termen onder elke categorie.
    2. Stel een aparte thesaurus op van termen voor milieubescherming. Omvatten milieuwetenschappelijke basisprincipes, milieumonitoring en -analyse, vervuilingsbeheer, en milieuplanning en -beheer.
    3. Voeg alle termen over Kunstmatige Intelligentie en Milieubescherming toe aan het tokenisatiewoordenboek. Zorg ervoor dat deze termen als volledige eenheden worden herkend tijdens tekstsegmentatie.
  2. Voorbewerking van tekst
    1. Verwijder leestekens en speciale tekens met reguliere expressies. Behou alleen tekst en spaties zelf.
    2. Voer woordsegmentatie uit om continue tekst op te splitsen in individuele tokens.
  3. Het uitvoeren van feature-matching en categorisatie
    1. Verwerk de invoertekst vooraf om een lijst van gesegmenteerde tokens te verkrijgen.
    2. Kies het juiste thesaurus volgens de voorlopige classificatie.
    3. Doorloop de gesegmenteerde tokens en voer exacte matching uit met thesaurustermen na normalisatie. Pas een kleine letter toe en verenig vooraf gedefinieerde varianten voordat je matcht.
    4. Noteer elke overeenkomende term en de bijbehorende thesaurus-tak.
      OPMERKING: Als meerdere takken overeenkomen, los je gelijke stand op met een vaste regel (bijvoorbeeld het hoogste aantal matches gevolgd door het vroegste voorkomen).
    5. Exporteer de matched-term lijst en de laatste binnen-domein tag voor downstream aggregatie.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

Vier open-source, instructie-getunten grote taalmodelbackbones (Backbone A–D) die in de Table of Materials worden vermeld, worden gebenchmarkt op de drie-klassen vacatureclassificatietaak. De evaluatie wordt uitgevoerd met hetzelfde testprotocol, preprocessingprocedures en metrics over alle backbones, waaronder algehele nauwkeurigheid, precisie, terugroep en F1. Prompt refinement en retrieval-augmented generation (RAG) worden vervolgens toegepast op Backbone B en opnieuw...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Eerder werk heeft klassieke machine learning en neurale modellen toegepast op de categorisering van wervingsteksten, waaronder classificatie van cv's en functiebeschrijvingen, maar dergelijke benaderingen vereisen vaak aanzienlijke gelabelde data en kunnen verslechteren wanneer de domeinterminologie verandert. Ali et al. stelden een cv-classificatiesysteem voor met NLP en machine learning-technieken18. Jalili et al. onderzochten BiLSTM-gebaseerde cv-classificatie<...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

De auteurs hebben niets te onthullen.

Dankbetuigingen

De auteurs bedanken collega's voor technische ondersteuning en constructieve feedback tijdens datacuratie en het voorbereiden van manuscripten. Dit project kreeg geen externe financiering.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
all-MiniLM-L6-v2 (sentence encoder)Hugging Face (sentence-transformers)https://huggingface.co/sentence-transformers/all-MiniLM-L6-v2Zininembeddingmodel gebruikt voor vectorisatie.
bert-base-chinese (baseline encoder)Hugging Face (google-bert)https://huggingface.co/google-bert/bert-base-chineseBasisencoder (Chinese BERT base).
DDR5 memory, 16 GBWorkstation/laptop configuratieN/ASysteemgeheugen (16 GB DDR5); leverancier/onderdeelnummer niet gespecificeerd.
DeepSeek-R1-Distill-Qwen-7B (Backbone A)Hugging Face (deepseek-ai)https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-7BLLM backbone A.
GLM-4-9B-Chat (Backbone C)Hugging Face (zai-org)https://huggingface.co/zai-org/glm-4-9b-chat-hfLLM backbone C.
Intel Core i5-13500HX CPUIntelhttps://www.intel.com/content/www/us/en/products/sku/232156/intel-core-i513500hx-processor-24m-cache-up-to-4-70-ghz/specifications.htmlWorkstation CPU gebruikt voor experimenten.
InternLM2.5-7B-Chat (Backbone D)Hugging Face (internlm)https://huggingface.co/internlm/internlm2_5-7b-chatLLM backbone D.
jieba (Chinese tokenizer)PyPI (jieba)https://pypi.org/project/jieba/Chinese tokenisatie/segmentatiebibliotheek; versie niet gespecificeerd.
Keyword libraries (AI & Environmental) (Supplement File 3)Deze studieSupplement File 3Domeinen trefwoordlexicons gebruikt voor lexicon-geleide pre-filtering; archief exacte versie gebruikt per run.
LanceDB (vector database)LanceDBN/AVectordatabase voor het opslaan/zoeken van embeddings; versie niet gespecificeerd.
NVIDIA GeForce RTX 4060 Laptop GPU (8 GB VRAM)NVIDIAhttps://www.nvidia.com/en-us/geforce/laptops/40-series/GPU gebruikt voor inferens/experimenten.
Online recruitment platform vacatures (2014–2023)Grote Chinese wervingsplatforms (openbare webgegevens)N/APubliek geplaatste vacatures verzameld en samengesteld door de auteurs; ~6,93 miljoen vacatures na opschoning.
pip (Python package installer)PyPAN/APakket-installer gebruikt om afhankelijkheden te installeren en een omgevingssnapshot te exporteren met behulp van pip freeze.
Prompt template evolutie (Supplement File 2)Deze studieSupplement File 2Opeenvolgende promptvarianten en de uiteindelijke prompt gebruikt voor evaluatie.
Python 3.10Python Software FoundationN/ARuntime-interpreter (Python 3.10); patchversie niet gespecificeerd.
Qwen2.5-7B-Instruct (Backbone B)Hugging Face (Qwen)https://huggingface.co/Qwen/Qwen2.5-7B-InstructLLM backbone B.
RAG kennisbasisveldbeschrijvingen/index (Supplement File 1)Deze studieSupplement File 1Schema/veldnotities en documentindex voor de kennisbasis gebruikt in retrieval-augmented inferens.
Thesaurus (AI & Environmental) (Supplement File 4)Deze studieSupplement File 4Termenwoordenboeken gebruikt in reclassificatie en analyse; archief exacte versie gebruikt per run.
Windows 11 (64-bit)MicrosoftN/ABesturingssysteem (Windows 11, 64-bit); build/versie niet gespecificeerd.

Referenties

  1. Alekseeva, L., et al. The demand for AI skills in the labor market. Labour Economics. 71, 102002(2021).
  2. Ministry updates official dictionary of careers. , Ministry of Human Resources and Social Security of the People’s Republic of China. Available at: https://english.www.gov.cn/statecouncil/ministries/202209/30/content_WS633647bbc6d0a757729e0bb6.html (2022).
  3. BERT: Pre-training of deep bidirectional transformers for language understanding. Devlin, J., Chang, M. W., Lee, K., Toutanova, K. 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (NAACL-HLT), Minneapolis, MN, USA, , 4171-4186 (2019).
  4. Large language models in the workplace: A case study on prompt engineering for job type classification. Clavié, B., et al. 28th International Conference on Applications of Natural Language to Information Systems (NLDB 2023); , Derby, UK, , Springer. Natural Language Processing and Information Systems. Lecture Notes in Computer Science 3-17 (2023).
  5. Li, N., Kang, B., De Bie, T. LLM4Jobs: Unsupervised occupation extraction and standardization leveraging large language models. arXiv. , Available at: https://arxiv.org/abs/2309.09708 (2023).
  6. Deep learning-based computational job market analysis: A survey on skill extraction and classification from job postings. Senger, E., Zhang, M., van der Goot, R., Plank, B. 1st Workshop on Natural Language Processing for Human Resources (NLP4HR 2024), St. Julian’s, Malta, , 1-15 (2024).
  7. Enhancing job posting classification with multilingual embeddings and large language models. Kavas, H., Serra-Vidal, M., Wanner, L. 10th Italian Conference on Computational Linguistics (CLiC-it 2024), Pisa, Italy, , 440-450 (2024).
  8. JobBERT: Understanding job titles through skills. Decorte, J. J., Van Hautte, J., Demeester, T., Develder, C. International Workshop on Fair, Effective and Sustainable Talent Management using Data Science (FEAST 2021) at ECML-PKDD 2021, , (2021).
  9. Carotene: A job title classification system for the online recruitment domain. Javed, F., et al. IEEE First International Conference on Big Data Computing Service and Applications (BigDataService), , 286-293 (2015).
  10. Javed, F., McNair, M., Jacob, F., Zhao, M. Towards a job title classification system. arXiv. , Available at: https://arxiv.org/abs/1606.00917 (2016).
  11. Lewis, P., et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Presented at: Advances in Neural Information Processing Systems. NeurIPS. , (2020).
  12. The power of scale for parameter-efficient prompt tuning. Lester, B., Al-Rfou, R., Constant, N. 2021 Conference on Empirical Methods in Natural Language Processing (EMNLP), , 3045-3059 (2021).
  13. Han, X., et al. PTR: Prompt tuning with rules for text classification. AI Open. 3, 182-192 (2022).
  14. Brown, T. B., et al. Language models are few-shot learners. Presented at: Advances in Neural Information Processing Systems. NeurIPS. , (2020).
  15. Liu, P., et al. predict: A systematic survey of prompting methods in natural language processing. ACM Comput Surv. 55 (9), 195:1-195:35 (2023).
  16. Blue, A. The outlook for 2023 is uncertain, but here’s what we know about the global labour market. World Economic Forum (Agenda). , Available at: https://www.weforum.org/agenda/2023/01/the-outlook-for-2023-is-uncertain-but-here-s-what-we-know-about-the-global-labour-market-davos23 (2023).
  17. ESCOXLM-R: Multilingual taxonomy-driven pre-training for the job market domain. Zhang, M., van der Goot, R., Plank, B. 61st Annual Meeting of the Association for Computational Linguistics (ACL 2023), Toronto, Canada, , 11871-11890 (2023).
  18. Ali, I., et al. Resume classification system using natural language processing and machine learning techniques. Mehran Univ Res J Eng Technol. 41 (1), 65-79 (2022).
  19. BiLSTM for resume classification. Jalili, A., Tabrizchi, H., Razmara, J., Mosavi, A. 22nd IEEE International Symposium on Applied Machine Intelligence and Informatics (SAMI 2024), Stará Lesná, Slovakia, , (2024).
  20. Pal, R., Shaikh, S., Satpute, S., Bhagwat, S. Resume classification using various machine learning algorithms. ITM Web Conf. 44, 03011(2022).
  21. Convolutional neural network with word embedding based approach for resume classification. Nasser, S., Sreejith, C., Irshad, M. 2018 International Conference on Emerging Trends and Innovations in Engineering and Technological Research (ICETIETR 2018), , Ernakulam (Cochin), India. (2018).
  22. Real-time resume classification system using LinkedIn profile descriptions. Ramraj, S., Sivakumar, V. 2020 International Conference on Computational Intelligence for Smart Power Systems and Sustainable Energy (CISPSSE 2020), Keonjhar, Odisha, India, , (2020).
  23. Heakl, A., et al. ResumeAtlas: Revisiting resume classification with large-scale datasets and large language models. arXiv. , Available at: https://arxiv.org/abs/2406.18125 (2024).
  24. Skondras, P., Zervas, P., Tzimas, G. Generating synthetic resume data with large language models for enhanced job description classification. Future Internet. 15 (11), 363(2023).
  25. Chen, Z. Ethics and discrimination in artificial intelligence-enabled recruitment practices. Humanit Soc Sci Commun. 10, 567(2023).
  26. Retrieval-augmented few-shot text classification. Yu, G., et al. Findings of the Association for Computational Linguistics: EMNLP 2023, Singapore, , 6721-6735 (2023).
  27. Izacard, G., et al. Atlas: Few-shot learning with retrieval augmented language models. J Mach Learn Res. 24 (251), 1-43 (2023).
  28. KW-ATTN: Knowledge infused attention for accurate and interpretable text classification. Jang, H., et al. Deep Learning Inside Out (DeeLIO): 2nd Workshop on Knowledge Extraction and Integration for Deep Learning Architectures, , 96-107 (2021).

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Herprints en machtigingen

Trefwoorden

Retrieval Augmented ModellenDomeinspecifieke TrefwoordenlijstenConstructie van KennisbankenCosinusgelijkenis opvraagK dichtstbijzijnde BurenChinese TekstclassificatieInterbeoordelaarsconsistentie