Subskrypcja JoVE jest wymagana do oglądania tego materiału. Zaloguj się lub rozpocznij bezpłatny okres próbny.

Artykuł metodologiczny

Dwuetapowe oznaczanie tekstów rekrutacyjnych za pomocą routowania prowadzonego leksykonem oraz dużych modeli językowych rozszerzonych o wyszukiwanie

136 wyświetleń

DOI:

10.3791/70153

8 maja 2026

W tym artykule

Podsumowanie

Opisany jest dwuetapowy workflow klasyfikujący teksty rekrutacyjne na Sztuczną Inteligencję, Ochronę Środowiska lub Inne. Triage sterowana leksykonem przypisuje przypadki rutynowe, podczas gdy wnioskowanie z dużymi modelami językowymi wspierane przez wyszukiwanie i optymalizację promptów rozwiązuje niejednoznaczne przypadki, umożliwiając dokładne etykietowanie na dużą skalę oraz opisowe podsumowanie rynku pracy.

Streszczenie

Teksty rekrutacyjne są zróżnicowane, a terminologia dziedzinowa ewoluuje z czasem, co utrudnia znaczenie na dużą skalę i ogranicza możliwości ręcznego adnotowania. Protokół ten zapewnia powtarzalny, dwuetapowy workflow do klasyfikacji chińskich tekstów rekrutacyjnych na Sztuczną Inteligencję, Ochronę Środowiska lub Inne. Etap pierwszy przeprowadza triażę sterowaną leksykonem, wykorzystując dwie wyselekcjonowane listy słów kluczowych domen. Ogłoszenia odpowiadające tylko jednej leksykonowi domeny są bezpośrednio oznaczane. Ogłoszenia nie pasujące do żadnego z tych słowników są oznaczane jako Inne, natomiast ogłoszenia z podwójnym dopasowaniem kierowane są do etapu drugiego. Etap drugi stosuje wnioskowanie dużych modeli językowych z wykorzystaniem wyszukiwania. Baza wiedzy skompilowana z 12 autorytatywnych dokumentów domenowych jest przekształcana w tekst, podzielona na około 1000-znakowe fragmenty z nakładem 20 znaków, osadzona w całości MiniLM-L6-v2 i indeksowana w LanceDB. Dla każdego niepewnego wpisu, wyszukiwanie k-najbliższego sąsiada o podobieństwie cosinusowym zwraca kandydujące fragmenty filtrowane minimalnym progiem podobieństwa (τ), a do czterech fragmentów jest wstrzykiwanych do stałego szablonu promptu, który definiuje granice etykiet i ogranicza wyjście do jednej etykiety. Ręcznie weryfikowany jest zestaw benchmarkowy 3 000 ogłoszeń, z 1 000 ogłoszeń na klasę, co pozwala na porozumienie między adnotatorami na poziomie 95,0% oraz kappa Cohena (κ) na poziomie około 0,93. Ewaluacja porównuje wiele dużych modeli językowych open-source w środowisku tylko z promptami oraz w trybie uzupełnionym pobieraniem przy użyciu Qwen2.5-7B-Instruct. Konfiguracja uzupełniona wyszukiwaniem osiąga dokładność 98,47% i obsługuje oznakowanie na skalę korpusu około 6,93 miliona ogłoszeń dla agregacji opisowej w dalszej fazie.

Wprowadzenie

W ostatnich latach, wraz z szybkim rozwojem AI i technologii środowiskowych, pojawiło się wiele nowych zawodów. Z jednej strony globalny rynek pracy jest zalany wieloma zupełnie nowymi stanowiskami opartymi na AI i zrównoważonym rozwoju. Dowody oparte na wakatach dokumentują szybki wzrost zapotrzebowania na umiejętności związane z AI, co zwiększa heterogeniczność tekstów rekrutacyjnych i motywuje do powstania powtarzalnego, skalowalnego protokołu tagowania domen1. Z drugiej strony, najnowsza rewizja Słownika Klasyfikacji Zawodowej (OCD) w Chinach odnotowała równie silny wzrost nowych zawodów w dziedzinach informatyzacji zatrudnienia oraz zielonej i niskoemisyjnej, z netto wzrostem o 158 nowych zawodów w rewizji z 2022 roku w porównaniu z edycją słownika z 2015 roku, łącznie 97 zawodów cyfrowych. czyli 6% wszystkich zawodów, oznaczonych, wraz ze 134 zielonymi zawodami, czyli 8% z całkowitej liczby zawodów2.

W miarę jak te nowe zawody stale się pojawiają, treść i forma ogłoszeń o pracę przez firmy stają się coraz bardziej złożone, ponieważ opisy stanowisk często obejmują wiedzę przedmiotową i różnorodne wymagania umiejętności, zawierając zarówno ustrukturyzowane obszary takie jak nazwy stanowisk i listy umiejętności, jak i dużą liczbę nieustrukturyzowanych opisów w formie wolnego tekstu, co skutkuje coraz bardziej złożonymi strukturami ogłoszeń. Takie złożone ogłoszenia o pracę zazwyczaj zawierają jasno zdefiniowane elementy strukturalne (np. nazwy stanowisk, listy wymaganych umiejętności) wraz z obszernymi, nieustrukturyzowanymi opisami w formie wolnego tekstu. Na przykład ogłoszenie o pracę inżyniera AI może zawierać techniczne określenia takie jak "biegłość w frameworku deep learning" czy "doświadczenie w optymalizacji algorytmów backpropagation" jako część listy umiejętności, a także szczegółową narrację obowiązków; Podobnie, ogłoszenie na stanowisko inżyniera środowiska może odnosić się do konkretnych norm regulacyjnych i certyfikatów. To połączenie ustrukturyzowanych i nieustrukturyzowanych treści skutkuje wysoce wyspecjalizowanymi i zawiłymi opisami stanowisk.

Sztuczna inteligencja i ochrona środowiska są wybierane do oceny protokołu w realistycznej niejednoznaczności międzydziedzinowej klasyfikacji rekrutacyjnej. W praktyce główne zasoby zawodowe, takie jak O*NET i tablice ogłoszeń, przypisują grube tagi, co utrudnia rozróżnienie ról międzybranżowych wyłącznie za pomocą słów kluczowych. Ochrona środowiska to szeroki obszar pokrywający się z wieloma dziedzinami naukowymi, podczas gdy sztuczna inteligencja odzwierciedla bardziej szczegółowy segment informatyki, często mylony z ogólnymi rolami programistycznymi. To zestawienie obejmuje zarówno szerokie, jak i wąskie środowiska międzydziedzinowe z odrębną terminologią i odpowiednimi autorytatywnymi dokumentami do budowy bazy wiedzy, jednocześnie umożliwiając adaptację do innych branż poprzez zastąpienie korpusu domenowego bez zmiany podstawowego przepływu pracy.

W ostatnich latach wzrosła liczba badań nad klasyfikacją ofert pracy. Naukowcy coraz częściej wykorzystują duże, wcześniej wytrenowane modele do poprawy klasyfikacji zawodów. Wprowadzenie BERT w 2019 roku oznaczało przełom, który umożliwił głębokie zrozumienie języka kontekstowego i znacząco poprawił wydajność klasyfikacji tekstu3. Na przykład Clavié i in. (2023) badali wykorzystanie instrukcji dostosowanego do dużych modeli językowych (LLM) do klasyfikacji stanowisk, odkrywając, że właściwa inżynieria promptów pozwala LLM przewyższać nowoczesne modele nadzorowane w zadaniu klasyfikacji stanowiskabsolwentów 4. Podobnie Li i in. (2023) zaproponowali podejście LLM4Jobs, które łączy streszczanie dużych modeli językowych z dopasowaniem kodów zawodów, znacząco poprawiając dokładność klasyfikacji w długich opisach stanowisk poprzez najpierw wyodrębnianie streszczeń, a następnie dopasowywanie ich do standardowych kodów stanowisk5. Ponadto badanie z 2024 roku przeprowadzone przez Sengera i in. kataloguje najnowsze osiągnięcia w głębokim uczeniu dla HR, zauważając, że ekstrakcja umiejętności i klasyfikacja stanowisk stały się kluczowymi zadaniami w obliczeniowej analizie rynku pracy6. Kavas i in. (2024) ulepszyli klasyfikację ogłoszeń o pracę poprzez połączenie wielojęzycznych osadzeń tekstowych z kategoryzacją opartą na LLM, osiągając znaczące poprawy dokładności7. Na tradycyjnym froncie wcześniejsze systemy obejmowały heurystyki oparte na słowach kluczowych z relatywnie grubymi zestawami kategorii oraz ramy oparte na taksonomii, takie jak karoten, który wykorzystywał hierarchię ponad 4 000 stanowisk 8,9. Javed i in. (2016) przedstawili wczesne ramy klasyfikacji stanowisk, co stanowi jeden z pierwszych kroków w kierunku systematycznej kategoryzacji zawodów10. Te podejścia nadzorowane wymagają jednak obszernych, oznakowanych danych i mają trudności z dostosowaniem się do szybkiego pojawiania się nowych stanowisk, ponieważ klasyfikacje często ewoluują wolniej niż rynek pracy4.

Aby rozwiązać te ograniczenia, ostatnie badania zwróciły się ku strategiom hybrydowym, które uwzględniają wiedzę zewnętrzną; na przykład Lewis i in. (2020) wprowadzili ramy Retrieval-Augmented Generation (RAG), które łączą wcześniej wytrenowane modele językowe z retrieverem, aby wprowadzać odpowiednią wiedzę domenową, osiągając wyższą dokładność i bardziej faktyczne wyniki w zadaniach wymagających dużej ilości wiedzy11. Lester i in. wykazali, że szybkie dostrojenie przynosi większe zyski wydajnościowe wraz ze wzrostem rozmiaru modeluo 12, co wzmacnia użycie silnie bazowego LLM. Na przykład Han i in. wykazali, że stosowanie promptów sterowanych regułami może zwiększyć dokładność klasyfikacji tekstu, koncentrując model na kluczowych cechach13. Ponadto Brown i in. (2020) słynnie wykazali, że duży model językowy może wykonywać nowe zadania na podstawie zaledwie kilku przykładów lub instrukcji, podkreślając siłę uczenia kilku strzałów opartego na promptach14. Warto zauważyć, że niedawne badanie technik NLP opartych na promptach podkreśla, że formułowanie promptu może znacząco wpływać na wyniki modelu15. Jednocześnie zmiany na poziomie makro i niepewność na rynku pracy wzmacniają potrzebę skalowalnych i przyjaznych aktualizacji protokołów etykietowania, które można odświeżać wraz z pojawianiem się nowych stanowisk16. W dziedzinie NLP na rynku pracy badane było również taksonomiczne wielojęzyczne przygotowanie wstępne, aby lepiej dopasować reprezentacje do struktur zawodowych i zmienności międzyjęzykowej17. Łącznie te badania kształtują podejście i pokazują potencjał wykorzystania dużych modeli językowych z optymalizacją wyszukiwania i promptu, aby skuteczniej rozpoznawać i dostosowywać się do nowych kontekstów zawodowych.

W tym badaniu wiedza domenowa jest kuratorowana wyłącznie dla sztucznej inteligencji i ochrony środowiska, ponieważ budowa, walidacja i utrzymanie korpusu stanowią główne koszty operacyjne klasyfikacji rekrutacji międzydomenowej. W związku z tym Inne służy jako kategoria odrzuceń poza zakresem działalności, a nie jako merytoryczna klasa branżowa. Zgłaszana wysoka dokładność powinna być interpretowana ostrożnie, ponieważ ustawienie trzech etykiet upraszcza oznaczanie i może zawyżać wyniki w porównaniu z bardziej szczegółowymi taksonomiami. Protokół ma być lekką, opartą na wiedzy warstwą etykietowania dla domen docelowych, a nie zastępcą kompleksowych systemów klasyfikacji wielokategoriowej. Rozszerzenie zestawu etykiet może obniżyć dokładność ze względu na większe nakładanie się, niejednoznaczność oraz bardziej rygorystyczne wymagania dotyczące pokrycia korpusu. W praktyce zbiór odrzuceń można stopniowo udoskonalać poprzez rozszerzenie korpusu dziedziny i włączenie wewnętrznych baz wiedzy. Konfiguracja trzech etykiet pokazuje zatem paradygmat wielokrotnego użytku, a nie wyczerpującą taksonomię zawodową.

Zbiór danych łączy źródła strukturalne i nieustrukturyzowane. Ustrukturyzowany korpus został zebrany i wyselekcjonowany przez autorów na podstawie ogłoszeń o pracę publicznych opublikowanych przez notowane firmy na głównych platformach rekrutacyjnych w Chinach w latach 2014–2023. Po deduplikacji i podstawowym oczyszczeniu korpus strukturalny zawiera około 6,93 miliona ogłoszeń. Nieustrukturyzowane dokumenty domenowe opublikowane przez odpowiednie organy służyły do określenia kryteriów wiedzy domenowej i etykietowania. Z tych źródeł ręcznie skonstruowano trzy podzbiory benchmarków, z których każdy zawierał 1000 ogłoszeń dotyczących sztucznej inteligencji, ochrony środowiska i niepowiązanych dziedzin, i zweryfikowano ich do oceny.

Szkielety modelu ocenia się przy użyciu dokładności, precyzji, przypominania oraz F1 (harmoniczna średnia precyzji i przywołania, F1 = 2PR/(P+R)), aby wybrać optymalną podstawę dla przepływu pracy uzupełnionego wyszukiwaniem. Autorytatywne dokumenty domenowe są kompilowane w bazę wiedzy dla generowania uzupełnionego wyszukiwaniem (RAG). Odpowiednie fragmenty są pobierane i wstrzykiwane do stałego szablonu promptu, aby wspierać klasyfikację. Systematycznie testowane są warianty promptów, a do określenia ostatecznej konfiguracji stosuje się strategię optymalizacji słów sygnałowych. Uzyskane dowody są filtrowane pod kątem istotności, aby zminimalizować szum i wspierać dokładne, efektywne wnioskowanie.

Aby umożliwić klasyfikację na dużą skalę, workflow stosuje etapowy pipeline: triage sterowany leksykonem efektywnie rozwiązuje rutynowe przypadki, podczas gdy wnioskowanie LLM z uzupełnieniem wyszukiwania i optymalizacją promptów obsługuje niejednoznaczne publikacje, równoważąc skalowalność i dokładność (Rysunek 1).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Badanie to nie obejmowało uczestników ludzkich ani zwierząt. Dlatego nie wymagano etycznego zatwierdzenia ani świadomej zgody. Workflow został wykonany w środowisku Python 3.10 na 64-bitowym systemie operacyjnym Windows, wykorzystując sprzęt, narzędzia i oprogramowanie wymienione w Tabeli Materiałów.

1. Modelowanie

  1. Budowa bazy danych i wiedzy
    1. Zbieraj i kuratoruj wewnętrzny, ustrukturyzowany korpus ogłoszeń o pracę dla spółek notowanych na giełdzie z głównych platform rekrutacyjnych online w Chinach (2014–2023), zapewniając zgodność z politykami platformy i obowiązującymi przepisami. Dla każdego ogłoszenia zapisz tytuł stanowiska, opis stanowiska, nazwę firmy, datę publikacji oraz unikalny identyfikator (np. identyfikator ogłoszenia lub adres URL, jeśli jest dostępny). Usuń duplikaty i nieprawidłowe wpisy oraz sprawdź, czy ostateczny korpus zawiera około 6,93 miliona rekordów.
    2. Zbieraj autorytatywne dokumenty domenowe związane ze sztuczną inteligencją i ochroną środowiska, w tym dokumenty wymienione w Pliku Uzupełniającym 1. Upewnij się, że dokumenty definiują kompetencje, standardy kwalifikacji, zakres zadań lub regulowane procedury.
  2. Konstrukcja zestawu danych benchmarkowych
    1. Przefiltruj ręcznie zbiór danych strukturalnych. Wybierz ogłoszenia, które wyraźnie reprezentują sztuczną inteligencję, ochronę środowiska oraz niepowiązane dziedziny. Uwzględnij przypadki borderline, aby poprawić zakres ochrony.
    2. Oznacz każdą ofertę według nazwy stanowiska, opisu stanowiska oraz informacji o pracodawcy.
    3. Skonstruuj trzy podzbiory referencyjne, zawierające po 1000 ogłoszeń każdy dla Sztucznej Inteligencji, Ochrony Środowiska i Innych.
    4. Wykonaj podwójną adnotację. Przydziel jednego adnotatora do oznaczania każdego wpisu oraz drugiego, aby zweryfikował etykietę według pisemnych wytycznych.
    5. Rozwiązuj spory poprzez dyskusję i rozstrzyganie przez trzeciego adnotatora.
    6. Oblicz umowę między anotatorami. Zanotuj procentową zgodę i κ.
    7. Zachowaj zweryfikowany zbiór danych benchmarkowych do oceny modelu.
  3. Ocena szkieletów modelu
    1. Oceniaj szkielet LLM dostosowany do instrukcji, używając tego samego szablonu promptu i zestawu danych benchmark.
    2. Wyłącz augmentację pobierania podczas porównania kręgosłupa.
    3. Zachowaj identyczne sformułowania promptów, parametry dekodowania i mapowanie etykiet na różnych modelach.
    4. Oblicz ogólną dokładność, precyzję w każdej klasie, przywołanie i F1.
    5. Wybierz najlepiej działający szkielet i zapisz jego konfigurację w Tabeli 1.
    6. Pełne wyniki oceny przedstawiamy w Tabeli 2.
  4. Wykonywanie trenowania enkodera adaptacyjnego do dziedziny
    1. Zbuduj nieoznaczony korpus, korzystając wyłącznie z autorytatywnych dokumentów wymienionych w Pliku Uzupełniającym 1.
    2. Wyodrębniaj zwykły tekst ze wszystkich dokumentów.
    3. Tekst podziel się na sekwencje o maksymalnej długości 512 i kroku 492.
    4. Odrzucaj segmenty krótsze niż 50 znaków.
    5. Upewnij się, że publikacje benchmarków są wyłączone z tego korpusu.
    6. Zainicjuj chińskie punkty kontrolne bazy BERT.
    7. Wykonaj wstępne trenowanie modeli językowych z maskowaniem i prawdopodobieństwem maskowania 0,15.
    8. Trenuj przez 3 epoki używając AdamW z tempem uczenia się 5e-5 i rozmiarem partii 2.
    9. Zachowaj wstępnie wytrenowany punkt kontrolny.
    10. Dostosuj enkoder do klasyfikacji trzyklasowej, stosując szybkość uczenia 2e-5, rozmiar partii 2 oraz maksymalną długość sekwencji 512.
    11. Ustaw losowe ziarno do 42 i zastosuj stratyfikowane podziały walidacji pociągów.
    12. Dokładność raportów, makro-średnia precyzja, makro-średnia przypominanie, makro-średnia F1, metryki dla klasy oraz macierz zamieszania.
    13. Zapisuj wyniki oceny do weryfikacji.
  5. Konstruowanie potoku klasyfikacji z rozszerzeniem wyszukiwania
    1. Buduj bazę wiedzy
      1. Skompiluj 12 domen autorytatywnych.
      2. Usuń zduplikowane lub przestarzałe wersje.
      3. Konwertuj dokumenty na zwykły tekst.
      4. Rejestruj metadane dokumentów, w tym emitenta i rok publikacji.
      5. Podziel tekst na fragmenty po około 1000 znaków z nakładaniem się 20 znaków.
      6. Zanotuj łączną liczbę chunków oraz rozkład długości chunków.
        UWAGA: Ponownie zweryfikować wydajność wyszukiwania, jeśli baza wiedzy zostanie rozszerzona.
    2. Kodowanie i przechowywanie osadzeń
      1. Zakoduj wszystkie fragmenty za pomocą modelu osadzenia i przechowuj je w bazie wektorowej.
      2. Identyfikatory chunków archiwum i metadane pochodzenia.
      3. Sprawdź, czy liczba zapisanych wektorów odpowiada liczbie bloków.
    3. Wykonaj pobieranie.
      1. Osadz każde ogłoszenie o pracę w tym samym modelu osadzania.
      2. Przeprowadź przeszukanie k-najbliższego sąsiada za pomocą współsinusowego podobieństwa.
      3. Zastosowanie progu podobieństwa τ do filtrowania dopasowania o niskiej releencji.
      4. Ustaw τ i top-κ po strojeniu na podzbiorze z wyciągniętym przyciskiem (sustained).
      5. Rekord pozyskał identyfikatory bloków i wyniki podobieństwa.
    4. Wykonaj wnioskowanie z wykorzystaniem wyszukiwania
      1. Wstaw do sekcji dowodów szablonu promptu do czterech pobranych fragmentów (Plik Uzupełniający 2).
      2. Połącz tekst ogłoszenia o pracę z uzyskanymi dowodami.
      3. Wygeneruj ostateczną etykietę trzech klas za pomocą wybranego LLM.
      4. Zapisz logi pobierania, prompty i wyjścia modelu.
  6. Przeprowadzanie triage sterowanej leksykonem
    1. Skonstruuj leksykony słów kluczowych
      1. Opracuj dwa leksykony słów kluczowych: jeden dla sztucznej inteligencji i jeden dla ochrony środowiska (Plik uzupełniający 3).
      2. Wyodrębniaj terminy kandydatów z ogłoszeń o pracę i autorytatywnych dokumentów.
      3. Tokenizuj tekst za pomocą określonej biblioteki tokenizacyjnej.
      4. Oblicz statystyki częstotliwości i kontrastu dziedziny oraz usuń niejednoznaczne lub zbyt ogólne wyrazy.
      5. Sfinalizuj i archiwizuj leksykony.
    2. Oznaczenia tras
      1. Zastosuj dokładne dopasowanie na poziomie łańcucha i tokenów.
      2. Ogłoszenia o trasowaniu wyłącznie słów kluczowych związanych ze sztuczną inteligencją do gałęzi sztucznej inteligencji.
      3. Ogłoszenia o trasach zawierające wyłącznie słowa kluczowe związane z ochroną środowiska dla oddziału ochrony środowiska.
      4. Oznacz ogłoszenia bez dopasowania jako Inne.
      5. Przekieruj zgłoszenia z podwójnym dopasowaniem do etapu uzupełnionego pobieraniem.
      6. Rejestruj statystyki routingu i wersje leksykonu.
    3. Klasyfikacja niejednoznacznych ogłoszeń
      1. Pobierz odpowiednie fragmenty przy stałych ustawieniach górnych κ i τ.
      2. Wstrzyknij pobrane dowody do szablonu promptu.
      3. Wygeneruj ostateczną etykietę i zapisz logi podane dla każdej instancji.

2. Reklasyfikacja wyników

  1. Konstrukcja tezaurusa
    1. Skonstruuj tezaurus terminów związanych ze sztuczną inteligencją (Plik Uzupełniający 4). Uwzględnij terminy z uczenia maszynowego, przetwarzania języka naturalnego, widzenia komputerowego, robotyki oraz pokrewnych poddziedzin. Zorganizuj szczegółowe terminy w każdej kategorii.
    2. Stwórz osobny tezaurus z terminami ochrony środowiska. Obejmuje podstawy nauk o środowisku, monitorowanie i analizę środowiskową, kontrolę i zarządzanie zanieczyszczeniami oraz planowanie i zarządzanie środowiskiem.
    3. Dodaj wszystkie terminy związane ze sztuczną inteligencją i ochroną środowiska do słownika tokenizacji. Upewnij się, że te terminy są rozpoznawane jako kompletne jednostki podczas segmentacji tekstu.
  2. Wstępne przetwarzanie tekstu
    1. Usuń znaki interpunkcyjne i znaki specjalne za pomocą wyrażeń regularnych. Zachowuj tylko tekst i spacji.
    2. Wykonaj segmentację słów, aby podzielić ciągły tekst na pojedyncze tokeny.
  3. Dopasowanie cech i kategoryzacja
    1. Wstępnie przetworz tekst wejściowy, aby uzyskać listę podziałowych tokenów.
    2. Wybierz odpowiedni tezaurus zgodnie z wstępną klasyfikacją.
    3. Przejrzyj segmentowane tokeny i wykonaj dokładne dopasowanie do terminów tezaurusa po normalizacji. Zastosuj małe litery i zjednocz zdefiniowane warianty przed dopasowaniem.
    4. Zapisz każdy dopasowany termin oraz odpowiadającą mu gałąź tezaurusa.
      UWAGA: Jeśli wiele gałęzi się pokrywa, rozstrzygnij remisy według stałej reguły (np. najwyższa liczba dopasowań, a następnie najwcześniejsze wystąpienie).
    5. Eksportuj listę dopasowanych terminów oraz ostatni tag wewnątrzdomenowy do agregacji dalej.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Cztery otwartoźródłowe, instrukcjonowane duże szkielety językowe (Backbone A–D) wymienione w Tabeli Materiałów są testowane w zadaniu klasyfikacyjnym ogłoszeń o pracę w trzech klasach. Ocena przeprowadza się przy użyciu tego samego protokołu testowego, procedur wstępnego przetwarzania oraz metryk we wszystkich kręgosłupach, w tym ogólnej dokładności, precyzji, przypominania i F1. Do Backbone B stosuje się następnie szybkie udoskonalanie i generowanie z dodatkiem wyszukiwania (RAG) i ponownie oceniane w i...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Wcześniejsze prace stosowały klasyczne modele uczenia maszynowego i neuronalne do kategoryzacji tekstów rekrutacyjnych, w tym klasyfikacji CV i opisów stanowisk, jednak takie podejścia często wymagają obszernych danych oznaczonych i mogą ulegać degradacji wraz ze zmianą terminologii domeny. Ali i in. zaproponowali system klasyfikacji CV wykorzystujący techniki NLP i uczenia maszynowego18. Jalili i in. badali klasyfikację CV opartą na BiLSTM19. Pal i in. oceniali kategoryzac...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Autorzy nie mają nic do ujawnienia.

Podziękowania

Autorzy dziękują kolegom za wsparcie techniczne i konstruktywne opinie podczas kuracji danych i przygotowywania manuskryptów. Projekt ten nie otrzymał żadnego zewnętrznego finansowania.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
all-MiniLM-L6-v2 (enkoder zdań)Przytulająca Twarz (transformatory zdań)https://huggingface.co/sentence-transformers/all-MiniLM-L6-v2Model osadzania zdań stosowany do wektoryzacji.
Bert-Base-Chinese (enkoder bazowy)Przytulająca się twarz (google-bert)https://huggingface.co/google-bert/bert-base-chineseEnkoder bazowy (chińska baza BERT).
Pamięć DDR5, 16 GBKonfiguracja stacji roboczej/laptopaNie mapamięć systemowa (16 GB DDR5); Numer dostawcy/części nie jest podany.
DeepSeek-R1-Destylacja-Qwen-7B (Szkielet A)Przytulająca Twarz (deepseek-ai)https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-7BSzkielet LLM A.
GLM-4-9B-Chat (Backbone C)Przytulająca Twarz (zai-org)https://huggingface.co/zai-org/glm-4-9b-chat-hfKręgosłup LLM C.
Procesor Intel Core i5-13500HXIntelhttps://www.intel.com/content/www/us/en/products/sku/232156/intel-core-i513500hx-processor-24m-cache-up-to-4-70-ghz/specifications.htmlProcesor stacji roboczej używany do eksperymentów.
InternLM2.5-7B-Chat (Backbone D)Przytulająca Twarz (internlm)https://huggingface.co/internlm/internlm2_5-7b-chatLLM backbone D.
jieba (chiński tokenizer)PyPI (jieba)https://pypi.org/project/jieba/Chińska biblioteka tokenizacji/segmentacji; wersja nie określona.
Biblioteki słów kluczowych (AI i Środowiskowe) (Plik suplementacyjny 3)To badaniePlik suplementu 3Domenowe leksykony słów kluczowych używane do wstępnego filtrowania sterowanego leksykonem; Dokładna wersja archiwum używana na każdą rundę.
LanceDB (baza wektorowa)LanceDBNie maBaza wektorowa do przechowywania/wyszukiwania osadzeń; wersja nie określona.
Karta graficzna NVIDIA GeForce RTX 4060 do laptopa (8 GB VRAM)NVIDIAhttps://www.nvidia.com/en-us/geforce/laptops/40-series/GPU używane do wnioskowania/eksperymentów.
Oferty pracy na platformach rekrutacyjnych online (2014 i nie; 2023)Główne chińskie platformy rekrutacyjne (dane z publicznego internetu)Nie maPublicznie publikowane ogłoszenia o pracę zebrane i kuratorowane przez autorów; ~6,93 miliona ogłoszeń po sprzątaniu.
pip (instalator pakietów w Pythonie)PyPANie maInstalator pakietów używany do instalacji zależności i eksportu snapshota środowiska za pomocą pip freeze.
Ewolucja szablonu promptu (Plik suplementu 2)To badaniePlik suplementu 2Kolejne warianty promptu oraz końcowy prompt używany do oceny.
Python 3.10Python Software FoundationNie maInterpreter wykonawczy (Python 3.10); Wersja poprawki nie podana.
Qwen2.5-7B-Instruct (Szkielet B)Przytulająca Twarz (Qwen)https://huggingface.co/Qwen/Qwen2.5-7B-InstructKręgosłup LLM B.
Opisy/indeks pól bazy wiedzy RAG (Plik uzupełniający 1)To badaniePlik suplementu 1Notatki do schematów/terenów oraz indeks dokumentów dla bazy wiedzy wykorzystywanej w wnioskowaniu uzupełnionym wyszukiwaniem.
Tezaurus (AI & Środowiskowe) (Plik Suplementu 4)To badaniePlik suplementacyjny 4Terminy słowniki używane w reklasyfikacji i analizie; Dokładna wersja archiwum używana na każdą rundę.
Windows 11 (64-bitowy)MicrosoftNie maSystem operacyjny (Windows 11, 64-bitowy); Wersja lub budowa nie są określone.

Bibliografia

  1. Alekseeva, L., et al. The demand for AI skills in the labor market. Labour Economics. 71, 102002(2021).
  2. Ministry updates official dictionary of careers. , Ministry of Human Resources and Social Security of the People’s Republic of China. Available at: https://english.www.gov.cn/statecouncil/ministries/202209/30/content_WS633647bbc6d0a757729e0bb6.html (2022).
  3. BERT: Pre-training of deep bidirectional transformers for language understanding. Devlin, J., Chang, M. W., Lee, K., Toutanova, K. 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (NAACL-HLT), Minneapolis, MN, USA, , 4171-4186 (2019).
  4. Large language models in the workplace: A case study on prompt engineering for job type classification. Clavié, B., et al. 28th International Conference on Applications of Natural Language to Information Systems (NLDB 2023); , Derby, UK, , Springer. Natural Language Processing and Information Systems. Lecture Notes in Computer Science 3-17 (2023).
  5. Li, N., Kang, B., De Bie, T. LLM4Jobs: Unsupervised occupation extraction and standardization leveraging large language models. arXiv. , Available at: https://arxiv.org/abs/2309.09708 (2023).
  6. Deep learning-based computational job market analysis: A survey on skill extraction and classification from job postings. Senger, E., Zhang, M., van der Goot, R., Plank, B. 1st Workshop on Natural Language Processing for Human Resources (NLP4HR 2024), St. Julian’s, Malta, , 1-15 (2024).
  7. Enhancing job posting classification with multilingual embeddings and large language models. Kavas, H., Serra-Vidal, M., Wanner, L. 10th Italian Conference on Computational Linguistics (CLiC-it 2024), Pisa, Italy, , 440-450 (2024).
  8. JobBERT: Understanding job titles through skills. Decorte, J. J., Van Hautte, J., Demeester, T., Develder, C. International Workshop on Fair, Effective and Sustainable Talent Management using Data Science (FEAST 2021) at ECML-PKDD 2021, , (2021).
  9. Carotene: A job title classification system for the online recruitment domain. Javed, F., et al. IEEE First International Conference on Big Data Computing Service and Applications (BigDataService), , 286-293 (2015).
  10. Javed, F., McNair, M., Jacob, F., Zhao, M. Towards a job title classification system. arXiv. , Available at: https://arxiv.org/abs/1606.00917 (2016).
  11. Lewis, P., et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Presented at: Advances in Neural Information Processing Systems. NeurIPS. , (2020).
  12. The power of scale for parameter-efficient prompt tuning. Lester, B., Al-Rfou, R., Constant, N. 2021 Conference on Empirical Methods in Natural Language Processing (EMNLP), , 3045-3059 (2021).
  13. Han, X., et al. PTR: Prompt tuning with rules for text classification. AI Open. 3, 182-192 (2022).
  14. Brown, T. B., et al. Language models are few-shot learners. Presented at: Advances in Neural Information Processing Systems. NeurIPS. , (2020).
  15. Liu, P., et al. predict: A systematic survey of prompting methods in natural language processing. ACM Comput Surv. 55 (9), 195:1-195:35 (2023).
  16. Blue, A. The outlook for 2023 is uncertain, but here’s what we know about the global labour market. World Economic Forum (Agenda). , Available at: https://www.weforum.org/agenda/2023/01/the-outlook-for-2023-is-uncertain-but-here-s-what-we-know-about-the-global-labour-market-davos23 (2023).
  17. ESCOXLM-R: Multilingual taxonomy-driven pre-training for the job market domain. Zhang, M., van der Goot, R., Plank, B. 61st Annual Meeting of the Association for Computational Linguistics (ACL 2023), Toronto, Canada, , 11871-11890 (2023).
  18. Ali, I., et al. Resume classification system using natural language processing and machine learning techniques. Mehran Univ Res J Eng Technol. 41 (1), 65-79 (2022).
  19. BiLSTM for resume classification. Jalili, A., Tabrizchi, H., Razmara, J., Mosavi, A. 22nd IEEE International Symposium on Applied Machine Intelligence and Informatics (SAMI 2024), Stará Lesná, Slovakia, , (2024).
  20. Pal, R., Shaikh, S., Satpute, S., Bhagwat, S. Resume classification using various machine learning algorithms. ITM Web Conf. 44, 03011(2022).
  21. Convolutional neural network with word embedding based approach for resume classification. Nasser, S., Sreejith, C., Irshad, M. 2018 International Conference on Emerging Trends and Innovations in Engineering and Technological Research (ICETIETR 2018), , Ernakulam (Cochin), India. (2018).
  22. Real-time resume classification system using LinkedIn profile descriptions. Ramraj, S., Sivakumar, V. 2020 International Conference on Computational Intelligence for Smart Power Systems and Sustainable Energy (CISPSSE 2020), Keonjhar, Odisha, India, , (2020).
  23. Heakl, A., et al. ResumeAtlas: Revisiting resume classification with large-scale datasets and large language models. arXiv. , Available at: https://arxiv.org/abs/2406.18125 (2024).
  24. Skondras, P., Zervas, P., Tzimas, G. Generating synthetic resume data with large language models for enhanced job description classification. Future Internet. 15 (11), 363(2023).
  25. Chen, Z. Ethics and discrimination in artificial intelligence-enabled recruitment practices. Humanit Soc Sci Commun. 10, 567(2023).
  26. Retrieval-augmented few-shot text classification. Yu, G., et al. Findings of the Association for Computational Linguistics: EMNLP 2023, Singapore, , 6721-6735 (2023).
  27. Izacard, G., et al. Atlas: Few-shot learning with retrieval augmented language models. J Mach Learn Res. 24 (251), 1-43 (2023).
  28. KW-ATTN: Knowledge infused attention for accurate and interpretable text classification. Jang, H., et al. Deep Learning Inside Out (DeeLIO): 2nd Workshop on Knowledge Extraction and Integration for Deep Learning Architectures, , 96-107 (2021).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Tagi

Modele z rozszerzonym wyszukiwaniemlisty s w kluczowych dziedzinybudowa bazy wiedzywyszukiwanie z wykorzystaniem podobie stwa cosinusowegok najbli szych s siad wklasyfikacja tekst w w j zyku chi skimzgodno mi dzy adnotatorami