Ein Abonnement von JoVE ist erforderlich, um diesen Inhalt anzuzeigen. Melden Sie sich an oder beginnen Sie noch heute mit einer kostenlosen Testphase.

Methodenartikel

Zweistufige Rekrutierungstextbeschriftung mittels lexikongesteuerter Routing und abruf-augmentierten großen Sprachmodellen

136 Ansichten

DOI:

10.3791/70153

8. Mai 2026

In diesem Artikel

Zusammenfassung

Ein zweistufiger Workflow wird beschrieben, um Rekrutierungstexte in Künstliche Intelligenz, Umweltschutz oder Andere zu klassifizieren. Lexicon-gesteuerte Triage weist routinemäßige Fälle zu, während abrufverstärkte, promptoptimierte Inferenz großer Sprachmodelle mehrdeutige Fälle auflöst, was eine genaue großflächige Kennzeichnung und nachgelagerte beschreibende Arbeitsmarktzusammenfassung ermöglicht.

Zusammenfassung

Rekrutierungstexte sind heterogen, und die Domänenterminologie entwickelt sich im Laufe der Zeit weiter, was großflächige Beschriftung mit begrenzter manueller Annotationskapazität erschwert. Dieses Protokoll bietet einen reproduzierbaren zweistufigen Workflow zur Klassifizierung chinesischer Rekrutierungstexte in Künstliche Intelligenz, Umweltschutz oder andere. Stufe eins führt lexikongesteuerte Triage mit zwei kuratierten Schlüsselwortlisten der Domänen durch. Beiträge, die nur einem Domain-Lexikon entsprechen, sind direkt gekennzeichnet. Beiträge, die keinem der Wörter entsprechen, werden als Andere gekennzeichnet, während Doppel-Match-Beiträge an Stufe zwei weitergeleitet werden. Phase zwei wendet retrieval-augmentierte Inferenz des großen Sprachmodells an. Eine Wissensdatenbank, zusammengestellt aus 12 autoritativen Domänendokumenten, wird in Text umgewandelt, in etwa 1.000-Zeichen-Abschnitte mit 20-Zeichen-Überschneidung aufgeteilt, mit All-MiniLM-L6-v2 eingebettet und in LanceDB indexiert. Für jeden unsicheren Beitrag liefert die Cosinus-Ähnlichkeit k-nächste-Nachbar-Abfrage Kandidaten-Chunks zurück, die durch eine minimale Ähnlichkeitsschwelle (τ) gefiltert sind, und bis zu vier Chunks werden in eine feste Prompt-Vorlage eingespeist, die Labelgrenzen definiert und die Ausgabe auf ein einziges Label beschränkt. Ein Benchmark-Set von 3.000 Beiträgen wird manuell verifiziert, mit 1.000 Beiträgen pro Klasse, und erreicht eine Übereinstimmung zwischen den Annotatoren von 95,0 % sowie eine Cohen's kappa (κ) von etwa 0,93. Evaluation vergleicht mehrere Open-Source-Modelle großer Sprachen in einem Prompt-Only-Setting und einem Retrieval-Augmented-Setting mit Qwen2.5-7B-Instruct. Die retrieval-augmentierte Konfiguration erreicht eine Genauigkeit von 98,47 % und unterstützt Korpusskal-Labeling von etwa 6,93 Millionen Beiträgen für die nachgelagerte beschreibende Aggregation.

Einleitung

In den letzten Jahren sind mit der rasanten Entwicklung von KI- und Umwelttechnologien zahlreiche aufstrebende Karrieren entstanden. Einerseits ist der globale Arbeitsmarkt mit vielen brandneuen Stellen auf Basis von KI und Nachhaltigkeit überschwemmt. Vacancy-basierte Evidenz dokumentiert eine rasche Ausweitung der KI-bezogenen Fähigkeitsnachfrage, was die Heterogenität von Recruiting-Texten erhöht und ein reproduzierbares, skalierbares Domain-Tagging-Protokollmotiviert 1. Andererseits verzeichnete Chinas jüngste Überarbeitung des Berufsklassifikationswörterbuchs (OCD) ein ähnlich starkes Wachstum neuer Berufe in den Bereichen Beschäftigungsinformatisierung sowie grüne und kohlenstoffarme Tätigkeiten, mit einem Nettoanstieg von 158 neuen Berufen in der Überarbeitung 2022 im Vergleich zur Ausgabe 2015 des Wörterbuchs, insgesamt 97 digitale Berufe. oder 6 % der Gesamtzahl der beschrifteten Berufe, zusammen mit 134 grünen Berufen, also 8 % der Gesamtzahl der Berufe2.

Da diese neuen Berufe weiterhin entstehen, werden Inhalte und Form von Stellenanzeigen durch Unternehmen immer komplexer, da Stellenbeschreibungen oft Fachwissen und vielfältige Qualifikationsanforderungen beinhalten, die sowohl strukturierte Bereiche wie Stellenbezeichnungen und Qualifikationslisten als auch eine große Anzahl unstrukturierter Freitextbeschreibungen enthalten, was zu immer komplexeren Stellenausschreibungsstrukturen führt. Solche komplexen Stellenanzeigen enthalten typischerweise klar definierte strukturierte Elemente (z. B. Jobtitel, Listen der erforderlichen Fähigkeiten) sowie umfangreiche unstrukturierte Freitextbeschreibungen. Zum Beispiel könnte eine Stellenanzeige für KI-Ingenieure Fachjargon wie 'Kompetenz in einem Deep-Learning-Framework' und 'Erfahrung in der Optimierung von Backpropagation-Algorithmen' als Teil einer Fähigkeitsliste aufführen, während gleichzeitig eine detaillierte Darstellung der Verantwortlichkeiten enthalten ist; Ähnlich könnte eine Anzeige als Umweltingenieur auf bestimmte regulatorische Standards und Zertifizierungen verweisen. Diese Kombination aus strukturierten und unstrukturierten Inhalten führt zu hochspezialisierten und verworrenen Stellenbeschreibungen.

Künstliche Intelligenz und Umweltschutz werden ausgewählt, um das Protokoll unter realistischer domänenübergreifender Mehrdeutigkeit bei der Rekrutierungsklassifikation zu bewerten. In der Praxis weisen gängige Berufsressourcen wie O*NET und Jobbörsen grobe Tags zu, was es schwierig macht, branchenübergreifende Rollen allein anhand von Schlüsselwörtern zu unterscheiden. Umweltschutz stellt einen breiten Bereich dar, der sich mit mehreren wissenschaftlichen Bereichen überschneidet, während Künstliche Intelligenz einen feinkörnigeren Bereich innerhalb der Informatik widerspiegelt, der oft mit allgemeinen Softwarerollen vermischt wird. Diese Kombination erfasst sowohl breite als auch enge bereichsübergreifende Settings mit eigenständiger Terminologie und geeigneten autoritativen Dokumenten für den Aufbau von Wissensbasen und ermöglicht eine Anpassung an andere Branchen, indem das Domänenkorpus ersetzt wird, ohne den Kernworkflow zu verändern.

In den letzten Jahren gab es einen Anstieg der Forschung zur Klassifizierung von Stellenausschreibungen. Forscher nutzen zunehmend große, vortrainierte Modelle, um die Klassifikation von Berufen zu verbessern. Die Einführung von BERT im Jahr 2019 markierte einen Durchbruch, der ein tiefgehendes kontextuelles Sprachverständnis ermöglichte und die Textklassifikationsleistung deutlich verbesserte3. So untersuchten Clavié et al. (2023) beispielsweise die Verwendung eines instruktionsoptimierten großen Sprachmodells (LLM) zur Jobklassifikation und stellten fest, dass ein richtiges Prompt-Engineering es dem LLM ermöglichte, die modernsten überwachten Modelle bei einer Graduierten-Jobklassifikationsaufgabe4 zu übertreffen. Ähnlich schlugen Li et al. (2023) einen LLM4Jobs-Ansatz vor, der Zusammenfassung großer Sprachmodelle mit Berufscode-Abgleich kombiniert und die Klassifikationsgenauigkeit bei langen Stellenbeschreibungen deutlich verbessert, indem zunächst Zusammenfassungen extrahiert und anschließend mit Standard-Jobcodes5 abgestimmt werden. Darüber hinaus katalogisiert eine Umfrage von Senger et al. aus dem Jahr 2024 jüngste Fortschritte im Bereich Deep Learning für HR und stellt fest, dass Fähigkeitsextraktion und Jobklassifizierung zu Kernaufgaben in der computergestützten Arbeitsmarktanalyse geworden sind6. Kavas et al. (2024) verbesserten die Klassifikation von Stellenanzeigen durch die Kombination mehrsprachiger Texteinbettungen mit LLM-basierter Kategorisierung und erzielten bemerkenswerte Genauigkeitssteigerungen7. Auf traditioneller Ebene reichten frühere Systeme von schlüsselwortbasierten Heuristiken mit relativ groben Kategoriensätzen bis hin zu taxonomiebasierten Frameworks wie Carotene, das eine Hierarchie über mehr als 4.000Jobtitel verwendete. Javed et al. (2016) präsentierten einen frühen Rahmen für die Klassifikation von Berufsbezeichnungen, der einen der ersten Schritte zur systematischen Kategorisierung des Berufsmarkierte. Diese überwachten Ansätze erfordern jedoch umfangreiche, markierte Daten und haben Schwierigkeiten, sich an das schnelle Entstehen neuer Berufsrollen anzupassen, da sich Klassifikationstaxonomien oft langsamer entwickeln als der Arbeitsmarkt4.

Um solche Einschränkungen zu beheben, hat sich die jüngste Arbeit auf hybride Strategien konzentriert, die externes Wissen einbeziehen; so führten beispielsweise Lewis et al. (2020) das Retrieval-Augmented Generation (RAG)-Framework ein, das vortrainierte Sprachmodelle mit einem Retriever kombiniert, um relevantes Domänenwissen einzubringen und so überlegene Genauigkeit und sachlichere Ergebnisse bei wissensintensiven Aufgaben zu erzielen11. Lester et al. zeigten, dass Prompt-Tuning größere Leistungsgewinne bringt, wenn die Modellgrößeum 12 wächst, was die Verwendung eines starken Basis-LLM verstärkt. Zum Beispiel zeigten Han et al., dass die Verwendung regelgesteuerter Eingaben die Genauigkeit der Textklassifikation verbessern kann, indem das Modell auf Schlüsselmerkmalefokussiert wird. Darüber hinaus zeigten Brown et al. (2020) berühmt, dass ein großes Sprachmodell neue Aufgaben anhand weniger Beispiele oder Anweisungen ausführen kann, was die Kraft des promptgesteuerten Few-Shot Learning14 hervorhebt. Bemerkenswert ist, dass eine aktuelle Untersuchung promptbasierter NLP-Techniken unterstreicht, dass Prompt-Formulierungen Modellausgaben15 erheblich beeinflussen können. Gleichzeitig verstärken makroökonomische Veränderungen und Unsicherheit auf dem Arbeitsmarkt den Bedarf an skalierbaren und update-freundlichen Kennzeichnungsprotokollen, die aufgefrischt werden können, sobald neue Rollenentstehen. Im Bereich der Arbeitsmarkt-NLP wurde auch taxonomiegetriebene mehrsprachige Vorschulung untersucht, um die Repräsentation besser an Berufsstrukturen und interlinguale Variabilität anzupassen17. Gemeinsam informieren diese Studien den Ansatz und zeigen das Potenzial der Verwendung großer Sprachmodelle mit Abruf und prompter Optimierung, um aufkommende Besatzungskontexte effektiver zu erkennen und anzupassen.

In dieser Studie wird Domänenwissen ausschließlich für Künstliche Intelligenz und Umweltschutz ausgewählt, da Korpusaufbau, Validierung und Pflege die primären Betriebskosten der bereichsübergreifenden Rekrutierungsklassifizierung darstellen. Dementsprechend dient Other als eine außerhalb des Rahmenbereichs liegende Ablehnungskategorie und nicht als substanzielle Branchenklasse. Die berichtete hohe Genauigkeit sollte vorsichtig interpretiert werden, da die Drei-Label-Einstellung die Kennzeichnung vereinfacht und die Leistung im Vergleich zu feinkörnigeren Taxonomien erhöhen kann. Das Protokoll ist als leichte, wissensbasierte Kennzeichnungsschicht für Zielbereiche gedacht und nicht als Ersatz für umfassende Multikategorien-Klassifikationssysteme. Eine Erweiterung des Labelsets kann die Genauigkeit verringern, da es zu mehr Überschneidungen, Mehrdeutigkeiten und strengeren Anforderungen an die Korpusabdeckung kommt. In der Praxis kann das Ablehnungsset schrittweise verfeinert werden, indem das Domänenkorpus erweitert und interne Wissensbasen integriert werden. Die Drei-Label-Konfiguration zeigt daher ein wiederverwendbares Paradigma statt einer erschöpfenden beruflichen Taxonomie.

Der Datensatz kombiniert strukturierte und unstrukturierte Quellen. Der strukturierte Korpus wurde von den Autoren aus Stellenanzeigen gesammelt und kuratiert, die von börsennotierten Unternehmen auf großen Online-Rekrutierungsplattformen in China zwischen 2014 und 2023 veröffentlicht wurden. Nach Deduplizierung und grundlegender Reinigung enthält der strukturierte Korpus etwa 6,93 Millionen Beiträge. Unstrukturierte Domänendokumente, die von den zuständigen Behörden veröffentlicht wurden, wurden verwendet, um Kriterien für Domänenwissen und Kennzeichnung zu definieren. Aus diesen Quellen wurden drei Benchmark-Untergruppen manuell erstellt, die jeweils 1.000 Beiträge für Künstliche Intelligenz, Umweltschutz und nicht verwandte Bereiche enthielten und zur Bewertung überprüft wurden.

Die Modellrückgrate werden mittels Genauigkeit, Präzision, Rückruf und F1 (dem harmonischen Mittelwert von Präzision und Rückruf, F1 = 2PR/(P+R)) bewertet, um die optimale Grundlage für den abrufaugierten Workflow zu bestimmen. Autoritative Domänendokumente werden in eine Wissensdatenbank für die Retrieval-Augmented-Generierung (RAG) kompiliert. Relevante Passagen werden abgerufen und in eine feste Eingabevorlage eingefügt, um die Klassifikation zu unterstützen. Prompt-Varianten werden systematisch getestet, und eine Cueword-Optimierungsstrategie wird angewandt, um die endgültige Konfiguration zu bestimmen. Abgerufene Beweise werden auf Relevanz gefiltert, um Rauschen zu minimieren und eine genaue, effiziente Schlussfolgerung zu unterstützen.

Um eine groß angelegte Klassifikation zu ermöglichen, verwendet der Workflow eine gestufte Pipeline: Lexikongesteuerte Triage löst routinemäßige Fälle effizient, während abrufverstärkte, promptoptimierte LLM-Inferenz mehrdeutige Beiträge behandelt und so Skalierbarkeit und Genauigkeit ausbalanciert (Abbildung 1).

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Protokoll

Diese Studie umfasste weder menschliche Teilnehmer noch tierische Proben. Daher waren keine ethische Genehmigung und informierte Zustimmung erforderlich. Der Workflow wurde in einer Python-3.10-Umgebung auf einem 64-Bit-Windows-Betriebssystem unter Verwendung der in der Materialtabelle aufgeführten Hardware, Werkzeuge und Software ausgeführt.

1. Modeln

  1. Aufbau der Daten- und Wissensdatenbank
    1. Sammeln und kuratieren Sie einen internen strukturierten Korpus von Stellenanzeigen für börsennotierte Unternehmen von großen Online-Rekrutierungsplattformen Chinas (2014–2023), um die Einhaltung der Plattformrichtlinien und geltenden Vorschriften sicherzustellen. Für jede Ausschreibung tragen Sie den Stellentitel, die Stellenbeschreibung, den Firmennamen, das Veröffentlichungsdatum und eine eindeutige Kennung (z. B. Anzeige-ID oder URL, falls verfügbar) an. Entfernen Sie Duplikate und ungültige Einträge und überprüfen Sie, ob das endgültige Korpus etwa 6,93 Millionen Datensätze enthält.
    2. Sammeln Sie autoritative Domänendokumente zu Künstlicher Intelligenz und Umweltschutz, einschließlich der in Ergänzenden Akte 1 aufgeführten Dokumente. Stellen Sie sicher, dass die Dokumente Kompetenzen, Qualifikationsstandards, Aufgabenbereiche oder regulierte Verfahren definieren.
  2. Erstellung des Benchmark-Datensatzes
    1. Überprüfen Sie den strukturierten Datensatz manuell. Wählen Sie Stellen aus, die eindeutig Künstliche Intelligenz, Umweltschutz und nicht verwandte Bereiche repräsentieren. Fügen Sie Borderline-Fälle hinzu, um die Abdeckung zu verbessern.
    2. Beschrifte jede Ausschreibung mit Stellentitel, Stellenbeschreibung und Arbeitgeberinformationen.
    3. Erstellen Sie drei Benchmark-Subsets mit jeweils 1.000 Beiträgen für Künstliche Intelligenz, Umweltschutz und andere.
    4. Führen Sie eine duale Annotation durch. Weisen Sie jedem Beitrag einen Annotator zu, der das Etikett kennzeichnet, und einen zweiten, der das Label mit einer schriftlichen Richtlinie überprüft.
    5. Lösen Sie Meinungsverschiedenheiten durch Diskussion und Beurteilung durch einen dritten Annotator.
    6. Berechnen Sie die Vereinbarung zwischen den Annotatoren. Protokollieren Sie die prozentuale Übereinstimmung und κ.
    7. Bewahren Sie den verifizierten Benchmark-Datensatz für die Modellbewertung auf.
  3. Bewertung von Modellrückgraten
    1. Bewerten Sie die instruktionsoptimierten LLM-Backbones mit derselben Prompt-Vorlage und demselben Benchmark-Datensatz.
    2. Deaktiviere die Rückhol-Augmentation während des Backbone-Vergleichs.
    3. Halte Prompt-Formulierungen, Dekodierungsparameter und Label-Mapping modellübergreifend identisch.
    4. Berechnen Sie die Gesamtgenauigkeit, Präzision pro Klasse, Rückruf und F1.
    5. Wählen Sie das leistungsfähigste Backbone aus und notieren Sie dessen Konfiguration in Tabelle 1.
    6. Berichte die vollständigen Evaluationsergebnisse in Tabelle 2.
  4. Durchführung von domänenadaptivem Encoder-Training
    1. Bauen Sie einen unbeschrifteten Korpus nur mit den maßgeblichen Dokumenten, die in Supplementary File 1 aufgeführt sind.
    2. Extrahieren Sie den Klartext aus allen Dokumenten.
    3. Segmentieren Sie den Text in Sequenzen mit einer maximalen Länge von 512 und einem Schritt von 492.
    4. Verwerfe Segmente, die kürzer als 50 Zeichen sind.
    5. Stellen Sie sicher, dass Benchmark-Beiträge aus diesem Korpus ausgeschlossen werden.
    6. Initialisieren Sie die chinesischen BERT-Basiskontrollpunkte.
    7. Führen Sie das Vortraining eines maskierten Sprachmodells mit einer Maskierungswahrscheinlichkeit von 0,15 durch.
    8. Trainiere für 3 Epochen mit AdamW mit Lernrate 5e-5 und Batch-Größe 2.
    9. Speichere den vortrainierten Kontrollpunkt.
    10. Feinjustieren Sie den Encoder für die Drei-Klassen-Klassifikation mit einer Lernrate von 2e-5, einer Batchgröße von 2 und einer maximalen Sequenzlänge von 512.
    11. Setze den zufälligen Seed auf 42 fest und wende stratifizierte Train-Validierungs-Splitting an.
    12. Berichtsgenauigkeit, makrogemittelte Präzision, makrogemittelter Rückruf, makrogemittelter F1-Metrik, pro-Klasse-Metriken und die Verwirrungsmatrix.
    13. Speichere die Auswertungsausgaben zur Verifikation.
  5. Aufbau der Retrieval-Augmented-Klassifikationspipeline
    1. Erweitern Sie die Wissensdatenbank
      1. Kompiliere 12 autoritative Domänen.
      2. Entferne doppelte oder veraltete Versionen.
      3. Dokumente in Klartext umwandeln.
      4. Dokumentenmetadaten aufzeichnen, einschließlich Emittenz- und Veröffentlichungsjahr.
      5. Teilen Sie den Text in Abschnitte von etwa 1.000 Zeichen mit 20 Zeichenüberschneidungen auf.
      6. Erzeuge die Gesamtzahl der Chunks und die Chunk-Länge-Verteilung.
        HINWEIS: Überprüfen Sie die Abrufleistung erneut, wenn die Wissensdatenbank erweitert wird.
    2. Einbettungen kodieren und speichern
      1. Kodiere alle Chunks mit dem Embedding-Modell und speichere die Embeddings in der Vektordatenbank.
      2. Archiv-Chunk-Kennungen und Herkunftsmetadaten.
      3. Überprüfen Sie, ob die Anzahl der gespeicherten Vektoren mit der Chunk-Anzahl übereinstimmt.
    3. Entnahme durchführen.
      1. Jede Stellenanzeige mit demselben Embedding-Modell einbetten.
      2. Führen Sie eine k-nächstgelegene Nachbarsuche mit Kosinusähnlichkeit durch.
      3. Wenden Sie den Ähnlichkeitsschwellenwert τ an, um geringe Relevanzübereinstimmungen zu filtern.
      4. Fixiere τ und Top-κ nach der Abstimmung auf einer ausgegliederten Teilmenge.
      5. Aufzeichnen Sie abgerufene Chunk-Identifikatoren und Ähnlichkeitswerte.
    4. Führen Sie Rückruf-Augmentiert-Inferenz aus
      1. Fügen Sie bis zu vier abgerufene Chunks in den Beweisabschnitt der Eingabevorlage ein (Supplementary File 2).
      2. Verkette den Text der Stellenanzeige mit beschafften Beweisen.
      3. Generiere das endgültige Drei-Klassen-Label mit dem ausgewählten LLM.
      4. Speichere Abrufprotokolle, Eingabeaufforderungen und Modellausgaben.
  6. Durchführung von lexikongesteuerter Triage
    1. Konstrukt-Schlüsselwort-Lexikone
      1. Stellen Sie zwei Schlüsselwortlexikone zusammen: eines für Künstliche Intelligenz und eines für Umweltschutz (Supplementary File 3).
      2. Entnehmen Sie Kandidatenbegriffe aus Stellenanzeigen und maßgeblichen Dokumenten.
      3. Tokenisieren Sie Text mit der angegebenen Tokenisierungsbibliothek.
      4. Berechnen Sie Termfrequenz- und Domänenkontraststatistiken und entfernen Sie mehrdeutige oder zu allgemeine Begriffe.
      5. Die Lexikone finalisieren und archivieren.
    2. Streckenausschreibungen
      1. Wende exakte String- und Token-Level-Matching an.
      2. Leite Beiträge mit ausschließlich Stichwörtern zur Künstlichen Intelligenz an die Abteilung Künstliche Intelligenz weiter.
      3. Routenausschreibungen, die nur Umweltschutz-Schlüsselwörter für die Umweltschutzabteilung enthalten.
      4. Beschrifte No-Match-Beiträge als Andere.
      5. Routen Sie Dual-Match-Postings zum Retrieval-Augmented-Schritt.
      6. Trage Routing-Statistiken und Lexikon-Versionen auf.
    3. Klassifiziere mehrdeutige Beiträge
      1. Relevante Chunks unter festen Top-κ- und τ-Einstellungen abrufen.
      2. Fügen Sie abgerufene Beweise in die Prompt-Vorlage ein.
      3. Generiere das endgültige Label und speichere die Protokolle pro Instanz.

2. Neuklassifizierung der Ergebnisse

  1. Thesaurus-Konstruktion
    1. Erstelle einen Thesaurus mit Begriffen der Künstlichen Intelligenz (Supplementary File 4). Beziehen Sie Begriffe aus maschinellem Lernen, natürlicher Sprachverarbeitung, Computer Vision, Robotik und verwandten Teilbereichen ein. Organisieren Sie detaillierte Begriffe unter jeder Kategorie.
    2. Erstellen Sie einen separaten Thesaurus mit Begriffen zum Umweltschutz. Beinhaltet Umweltwissenschaftsgrundlagen, Umweltüberwachung und -analyse, Umweltschutz und -management sowie Umweltplanung und -management.
    3. Fügen Sie alle Begriffe zu Künstlicher Intelligenz und Umweltschutz dem Tokenisierungswörterbuch hinzu. Stellen Sie sicher, dass diese Begriffe während der Textsegmentierung als vollständige Einheiten erkannt werden.
  2. Vorbearbeitung des Textes
    1. Entfernen Sie Satzzeichen und Sonderzeichen mit regulären Ausdrücken. Behalten Sie nur Text und Leerzeichen bei.
    2. Führen Sie Wortsegmentierung durch, um kontinuierlichen Text in einzelne Token zu unterteilen.
  3. Durchführung von Merkmalsabgleich und Kategorisierung
    1. Verarbeiten Sie den Eingabetext vor, um eine Liste segmentierter Tokens zu erhalten.
    2. Wählen Sie den entsprechenden Thesaurus gemäß der vorläufigen Klassifikation aus.
    3. Durchqueren Sie die segmentierten Token und führen Sie nach der Normalisierung exakte Abgleiche mit Thesaurus-Begriffen durch. Wende Kleinbuchstaben an und vereinheitliche vordefinierte Varianten vor dem Matching.
    4. Notieren Sie jeden passenden Begriff und den entsprechenden Thesaurus-Zweig.
      HINWEIS: Wenn mehrere Zweige übereinstimmen, wird Gleichstand mit einer festen Regel gelöst (z. B. höchste Anzahl an Treffer, gefolgt vom frühesten Vorkommen).
    5. Exportiere die Matched-Term-Liste und das letzte In-Domain-Tag für die nachgelagerte Aggregation.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Ergebnisse

Vier Open-Source-, instruktionsoptimierte Großsprachmodell-Backbones (Backbone A–D), die in der Materialtabelle aufgeführt sind, werden auf der dreiklassigen Stellenanzeige-Klassifikations-Aufgabe benchmarket. Die Bewertung erfolgt unter Verwendung desselben Testprotokolls, Vorverarbeitungsverfahren und Kennzahlen über alle Backbones hinweg, einschließlich Gesamtgenauigkeit, Präzision, Rückruf und F1. Prompt Refinement und retrieval-augmentierte Generierung (RAG) werden ...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Diskussion

Frühere Arbeiten haben klassische maschinelle Lern- und neuronale Modelle auf die Kategorisierung von Rekrutierungstexten angewandt, einschließlich der Klassifizierung von Lebensläufen und Stellenbeschreibungen, aber solche Ansätze erfordern oft umfangreiche beschriftete Daten und können sich verschlechtern, wenn sich die Domänenterminologie ändert. Ali et al. schlugen ein Klassifikationssystem für Lebensläufe mit NLP und Machine-Learning-Techniken vor18. Jalili e...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Offenlegungen

Die Autoren haben nichts offenzulegen.

Danksagungen

Die Autoren danken den Kollegen für technische Unterstützung und konstruktives Feedback während der Datenkuratierung und Manuskriptvorbereitung. Dieses Projekt erhielt keine externe Finanzierung.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Materialien

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
all-MiniLM-L6-v2 (Satzencoder)Hugging Face (Satzveränderer)https://huggingface.co/sentence-transformers/all-MiniLM-L6-v2Satzeinbettungsmodell zur Vektorisierung verwendet.
Bert-Base-Chinese (Baseline-Encoder)Umarmungsgesicht (google-bert)https://huggingface.co/google-bert/bert-base-chineseBaseline-Encoder (chinesische BERT-Basis).
DDR5-Speicher, 16 GBArbeitsplatz-/Laptop-KonfigurationN/ASystemspeicher (16 GB DDR5); Händler-/Teilenummer nicht angegeben.
DeepSeek-R1-Distill-Qwen-7B (Rückgrat A)Umarmungsgesicht (deepseek-ai)https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-7BLLM-Rückgrat A.
GLM-4-9B-Chat (Rückgrat C)Umarmungsgesicht (zai-org)https://huggingface.co/zai-org/glm-4-9b-chat-hfLLM-Rückgrat C.
Intel Core i5-13500HX CPUIntelhttps://www.intel.com/content/www/us/en/products/sku/232156/intel-core-i513500hx-processor-24m-cache-up-to-4-70-ghz/specifications.htmlWorkstation-CPU für Experimente verwendet.
PraktikantLM2.5-7B-Chat (Rückgrat D)Umarmendes Gesicht (intern)https://huggingface.co/internlm/internlm2_5-7b-chatLLM-Rückgrat D.
jieba (chinesischer Tokenizer)PyPI (jieba)https://pypi.org/project/jieba/Chinesische Tokenisierungs-/Segmentierungsbibliothek; Version nicht spezifiziert.
Schlüsselwortbibliotheken (KI & Umwelt) (Ergänzungsakte 3)Diese StudieErgänzungsakte 3Domänen-Schlüsselwörter-Lexikone, die für lexikongesteuerte Vorfilterung verwendet werden; Archivexakte Version pro Durchlauf verwendet.
LanceDB (Vektordatenbank)LanceDBN/AVektordatenbank zum Speichern/Durchsuchen von Embeddings; Version nicht spezifiziert.
NVIDIA GeForce RTX 4060 Laptop-GPU (8 GB VRAM)NVIDIAhttps://www.nvidia.com/en-us/geforce/laptops/40-series/GPU wird für Inferenz/Experimente verwendet.
Online-Stellenanzeigen für Rekrutierungsplattformen (2014 & Dash; 2023)Wichtige chinesische Rekrutierungsplattformen (öffentliche Webdaten)N/AÖffentlich veröffentlichte Stellenanzeigen, die von den Autoren gesammelt und kuratiert wurden; ~6,93 Millionen Beiträge nach der Reinigung.
pip (Python-Paket-Installer)PyPAN/APaket-Installer wird verwendet, um Abhängigkeiten zu installieren und ein Umgebungssnapshot mit Pip Freeze zu exportieren.
Entwicklung der Eingabevorlage (Supplement-Datei 2)Diese StudieErgänzungsakte 2Aufeinanderfolgende Prompt-Varianten und der letzte Prompt, der zur Bewertung verwendet wird.
Python 3.10Python Software FoundationN/ALaufzeit-Interpreter (Python 3.10); Patch-Version nicht spezifiziert.
Qwen2.5-7B-Instruktion (Rückgrat B)Umarmungsgesicht (Qwen)https://huggingface.co/Qwen/Qwen2.5-7B-InstructLLM-Rückgrat B.
RAG Knowledge Base Feldbeschreibungen/Index (Ergänzungsdatei 1)Diese StudieErgänzungsakte 1Schema-/Feldnotizen und Dokumentindex für die Wissensbasis, die bei der Retrieval-Augmented Inferenz verwendet wird.
Thesaurus (KI & Umweltschutz) (Ergänzungsakte 4)Diese StudieErgänzungsdatei 4Begriffswörterbücher für die Umklassifikation und Analyse; Archivexakte Version pro Durchlauf verwendet.
Windows 11 (64-Bit)MicrosoftN/ABetriebssystem (Windows 11, 64-Bit); Bau/Version nicht spezifiziert.

Referenzen

  1. Alekseeva, L., et al. The demand for AI skills in the labor market. Labour Economics. 71, 102002(2021).
  2. Ministry updates official dictionary of careers. , Ministry of Human Resources and Social Security of the People’s Republic of China. Available at: https://english.www.gov.cn/statecouncil/ministries/202209/30/content_WS633647bbc6d0a757729e0bb6.html (2022).
  3. BERT: Pre-training of deep bidirectional transformers for language understanding. Devlin, J., Chang, M. W., Lee, K., Toutanova, K. 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (NAACL-HLT), Minneapolis, MN, USA, , 4171-4186 (2019).
  4. Large language models in the workplace: A case study on prompt engineering for job type classification. Clavié, B., et al. 28th International Conference on Applications of Natural Language to Information Systems (NLDB 2023); , Derby, UK, , Springer. Natural Language Processing and Information Systems. Lecture Notes in Computer Science 3-17 (2023).
  5. Li, N., Kang, B., De Bie, T. LLM4Jobs: Unsupervised occupation extraction and standardization leveraging large language models. arXiv. , Available at: https://arxiv.org/abs/2309.09708 (2023).
  6. Deep learning-based computational job market analysis: A survey on skill extraction and classification from job postings. Senger, E., Zhang, M., van der Goot, R., Plank, B. 1st Workshop on Natural Language Processing for Human Resources (NLP4HR 2024), St. Julian’s, Malta, , 1-15 (2024).
  7. Enhancing job posting classification with multilingual embeddings and large language models. Kavas, H., Serra-Vidal, M., Wanner, L. 10th Italian Conference on Computational Linguistics (CLiC-it 2024), Pisa, Italy, , 440-450 (2024).
  8. JobBERT: Understanding job titles through skills. Decorte, J. J., Van Hautte, J., Demeester, T., Develder, C. International Workshop on Fair, Effective and Sustainable Talent Management using Data Science (FEAST 2021) at ECML-PKDD 2021, , (2021).
  9. Carotene: A job title classification system for the online recruitment domain. Javed, F., et al. IEEE First International Conference on Big Data Computing Service and Applications (BigDataService), , 286-293 (2015).
  10. Javed, F., McNair, M., Jacob, F., Zhao, M. Towards a job title classification system. arXiv. , Available at: https://arxiv.org/abs/1606.00917 (2016).
  11. Lewis, P., et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Presented at: Advances in Neural Information Processing Systems. NeurIPS. , (2020).
  12. The power of scale for parameter-efficient prompt tuning. Lester, B., Al-Rfou, R., Constant, N. 2021 Conference on Empirical Methods in Natural Language Processing (EMNLP), , 3045-3059 (2021).
  13. Han, X., et al. PTR: Prompt tuning with rules for text classification. AI Open. 3, 182-192 (2022).
  14. Brown, T. B., et al. Language models are few-shot learners. Presented at: Advances in Neural Information Processing Systems. NeurIPS. , (2020).
  15. Liu, P., et al. predict: A systematic survey of prompting methods in natural language processing. ACM Comput Surv. 55 (9), 195:1-195:35 (2023).
  16. Blue, A. The outlook for 2023 is uncertain, but here’s what we know about the global labour market. World Economic Forum (Agenda). , Available at: https://www.weforum.org/agenda/2023/01/the-outlook-for-2023-is-uncertain-but-here-s-what-we-know-about-the-global-labour-market-davos23 (2023).
  17. ESCOXLM-R: Multilingual taxonomy-driven pre-training for the job market domain. Zhang, M., van der Goot, R., Plank, B. 61st Annual Meeting of the Association for Computational Linguistics (ACL 2023), Toronto, Canada, , 11871-11890 (2023).
  18. Ali, I., et al. Resume classification system using natural language processing and machine learning techniques. Mehran Univ Res J Eng Technol. 41 (1), 65-79 (2022).
  19. BiLSTM for resume classification. Jalili, A., Tabrizchi, H., Razmara, J., Mosavi, A. 22nd IEEE International Symposium on Applied Machine Intelligence and Informatics (SAMI 2024), Stará Lesná, Slovakia, , (2024).
  20. Pal, R., Shaikh, S., Satpute, S., Bhagwat, S. Resume classification using various machine learning algorithms. ITM Web Conf. 44, 03011(2022).
  21. Convolutional neural network with word embedding based approach for resume classification. Nasser, S., Sreejith, C., Irshad, M. 2018 International Conference on Emerging Trends and Innovations in Engineering and Technological Research (ICETIETR 2018), , Ernakulam (Cochin), India. (2018).
  22. Real-time resume classification system using LinkedIn profile descriptions. Ramraj, S., Sivakumar, V. 2020 International Conference on Computational Intelligence for Smart Power Systems and Sustainable Energy (CISPSSE 2020), Keonjhar, Odisha, India, , (2020).
  23. Heakl, A., et al. ResumeAtlas: Revisiting resume classification with large-scale datasets and large language models. arXiv. , Available at: https://arxiv.org/abs/2406.18125 (2024).
  24. Skondras, P., Zervas, P., Tzimas, G. Generating synthetic resume data with large language models for enhanced job description classification. Future Internet. 15 (11), 363(2023).
  25. Chen, Z. Ethics and discrimination in artificial intelligence-enabled recruitment practices. Humanit Soc Sci Commun. 10, 567(2023).
  26. Retrieval-augmented few-shot text classification. Yu, G., et al. Findings of the Association for Computational Linguistics: EMNLP 2023, Singapore, , 6721-6735 (2023).
  27. Izacard, G., et al. Atlas: Few-shot learning with retrieval augmented language models. J Mach Learn Res. 24 (251), 1-43 (2023).
  28. KW-ATTN: Knowledge infused attention for accurate and interpretable text classification. Jang, H., et al. Deep Learning Inside Out (DeeLIO): 2nd Workshop on Knowledge Extraction and Integration for Deep Learning Architectures, , 96-107 (2021).

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Nachdrucke und Genehmigungen

Schlagwörter

Retrieval Augmented ModelsDom nen Schl sselwortlistenAufbau von WissensbasenCosine Similarity RetrievalK Nearest Neighborchinesische TextklassifizierungInter Annotator Agreement