W ostatnich latach, wraz z szybkim rozwojem AI i technologii środowiskowych, pojawiło się wiele nowych zawodów. Z jednej strony globalny rynek pracy jest zalany wieloma zupełnie nowymi stanowiskami opartymi na AI i zrównoważonym rozwoju. Dowody oparte na wakatach dokumentują szybki wzrost zapotrzebowania na umiejętności związane z AI, co zwiększa heterogeniczność tekstów rekrutacyjnych i motywuje do powstania powtarzalnego, skalowalnego protokołu tagowania domen1. Z drugiej strony, najnowsza rewizja Słownika Klasyfikacji Zawodowej (OCD) w Chinach odnotowała równie silny wzrost nowych zawodów w dziedzinach informatyzacji zatrudnienia oraz zielonej i niskoemisyjnej, z netto wzrostem o 158 nowych zawodów w rewizji z 2022 roku w porównaniu z edycją słownika z 2015 roku, łącznie 97 zawodów cyfrowych. czyli 6% wszystkich zawodów, oznaczonych, wraz ze 134 zielonymi zawodami, czyli 8% z całkowitej liczby zawodów2.
W miarę jak te nowe zawody stale się pojawiają, treść i forma ogłoszeń o pracę przez firmy stają się coraz bardziej złożone, ponieważ opisy stanowisk często obejmują wiedzę przedmiotową i różnorodne wymagania umiejętności, zawierając zarówno ustrukturyzowane obszary takie jak nazwy stanowisk i listy umiejętności, jak i dużą liczbę nieustrukturyzowanych opisów w formie wolnego tekstu, co skutkuje coraz bardziej złożonymi strukturami ogłoszeń. Takie złożone ogłoszenia o pracę zazwyczaj zawierają jasno zdefiniowane elementy strukturalne (np. nazwy stanowisk, listy wymaganych umiejętności) wraz z obszernymi, nieustrukturyzowanymi opisami w formie wolnego tekstu. Na przykład ogłoszenie o pracę inżyniera AI może zawierać techniczne określenia takie jak "biegłość w frameworku deep learning" czy "doświadczenie w optymalizacji algorytmów backpropagation" jako część listy umiejętności, a także szczegółową narrację obowiązków; Podobnie, ogłoszenie na stanowisko inżyniera środowiska może odnosić się do konkretnych norm regulacyjnych i certyfikatów. To połączenie ustrukturyzowanych i nieustrukturyzowanych treści skutkuje wysoce wyspecjalizowanymi i zawiłymi opisami stanowisk.
Sztuczna inteligencja i ochrona środowiska są wybierane do oceny protokołu w realistycznej niejednoznaczności międzydziedzinowej klasyfikacji rekrutacyjnej. W praktyce główne zasoby zawodowe, takie jak O*NET i tablice ogłoszeń, przypisują grube tagi, co utrudnia rozróżnienie ról międzybranżowych wyłącznie za pomocą słów kluczowych. Ochrona środowiska to szeroki obszar pokrywający się z wieloma dziedzinami naukowymi, podczas gdy sztuczna inteligencja odzwierciedla bardziej szczegółowy segment informatyki, często mylony z ogólnymi rolami programistycznymi. To zestawienie obejmuje zarówno szerokie, jak i wąskie środowiska międzydziedzinowe z odrębną terminologią i odpowiednimi autorytatywnymi dokumentami do budowy bazy wiedzy, jednocześnie umożliwiając adaptację do innych branż poprzez zastąpienie korpusu domenowego bez zmiany podstawowego przepływu pracy.
W ostatnich latach wzrosła liczba badań nad klasyfikacją ofert pracy. Naukowcy coraz częściej wykorzystują duże, wcześniej wytrenowane modele do poprawy klasyfikacji zawodów. Wprowadzenie BERT w 2019 roku oznaczało przełom, który umożliwił głębokie zrozumienie języka kontekstowego i znacząco poprawił wydajność klasyfikacji tekstu3. Na przykład Clavié i in. (2023) badali wykorzystanie instrukcji dostosowanego do dużych modeli językowych (LLM) do klasyfikacji stanowisk, odkrywając, że właściwa inżynieria promptów pozwala LLM przewyższać nowoczesne modele nadzorowane w zadaniu klasyfikacji stanowiskabsolwentów 4. Podobnie Li i in. (2023) zaproponowali podejście LLM4Jobs, które łączy streszczanie dużych modeli językowych z dopasowaniem kodów zawodów, znacząco poprawiając dokładność klasyfikacji w długich opisach stanowisk poprzez najpierw wyodrębnianie streszczeń, a następnie dopasowywanie ich do standardowych kodów stanowisk5. Ponadto badanie z 2024 roku przeprowadzone przez Sengera i in. kataloguje najnowsze osiągnięcia w głębokim uczeniu dla HR, zauważając, że ekstrakcja umiejętności i klasyfikacja stanowisk stały się kluczowymi zadaniami w obliczeniowej analizie rynku pracy6. Kavas i in. (2024) ulepszyli klasyfikację ogłoszeń o pracę poprzez połączenie wielojęzycznych osadzeń tekstowych z kategoryzacją opartą na LLM, osiągając znaczące poprawy dokładności7. Na tradycyjnym froncie wcześniejsze systemy obejmowały heurystyki oparte na słowach kluczowych z relatywnie grubymi zestawami kategorii oraz ramy oparte na taksonomii, takie jak karoten, który wykorzystywał hierarchię ponad 4 000 stanowisk 8,9. Javed i in. (2016) przedstawili wczesne ramy klasyfikacji stanowisk, co stanowi jeden z pierwszych kroków w kierunku systematycznej kategoryzacji zawodów10. Te podejścia nadzorowane wymagają jednak obszernych, oznakowanych danych i mają trudności z dostosowaniem się do szybkiego pojawiania się nowych stanowisk, ponieważ klasyfikacje często ewoluują wolniej niż rynek pracy4.
Aby rozwiązać te ograniczenia, ostatnie badania zwróciły się ku strategiom hybrydowym, które uwzględniają wiedzę zewnętrzną; na przykład Lewis i in. (2020) wprowadzili ramy Retrieval-Augmented Generation (RAG), które łączą wcześniej wytrenowane modele językowe z retrieverem, aby wprowadzać odpowiednią wiedzę domenową, osiągając wyższą dokładność i bardziej faktyczne wyniki w zadaniach wymagających dużej ilości wiedzy11. Lester i in. wykazali, że szybkie dostrojenie przynosi większe zyski wydajnościowe wraz ze wzrostem rozmiaru modeluo 12, co wzmacnia użycie silnie bazowego LLM. Na przykład Han i in. wykazali, że stosowanie promptów sterowanych regułami może zwiększyć dokładność klasyfikacji tekstu, koncentrując model na kluczowych cechach13. Ponadto Brown i in. (2020) słynnie wykazali, że duży model językowy może wykonywać nowe zadania na podstawie zaledwie kilku przykładów lub instrukcji, podkreślając siłę uczenia kilku strzałów opartego na promptach14. Warto zauważyć, że niedawne badanie technik NLP opartych na promptach podkreśla, że formułowanie promptu może znacząco wpływać na wyniki modelu15. Jednocześnie zmiany na poziomie makro i niepewność na rynku pracy wzmacniają potrzebę skalowalnych i przyjaznych aktualizacji protokołów etykietowania, które można odświeżać wraz z pojawianiem się nowych stanowisk16. W dziedzinie NLP na rynku pracy badane było również taksonomiczne wielojęzyczne przygotowanie wstępne, aby lepiej dopasować reprezentacje do struktur zawodowych i zmienności międzyjęzykowej17. Łącznie te badania kształtują podejście i pokazują potencjał wykorzystania dużych modeli językowych z optymalizacją wyszukiwania i promptu, aby skuteczniej rozpoznawać i dostosowywać się do nowych kontekstów zawodowych.
W tym badaniu wiedza domenowa jest kuratorowana wyłącznie dla sztucznej inteligencji i ochrony środowiska, ponieważ budowa, walidacja i utrzymanie korpusu stanowią główne koszty operacyjne klasyfikacji rekrutacji międzydomenowej. W związku z tym Inne służy jako kategoria odrzuceń poza zakresem działalności, a nie jako merytoryczna klasa branżowa. Zgłaszana wysoka dokładność powinna być interpretowana ostrożnie, ponieważ ustawienie trzech etykiet upraszcza oznaczanie i może zawyżać wyniki w porównaniu z bardziej szczegółowymi taksonomiami. Protokół ma być lekką, opartą na wiedzy warstwą etykietowania dla domen docelowych, a nie zastępcą kompleksowych systemów klasyfikacji wielokategoriowej. Rozszerzenie zestawu etykiet może obniżyć dokładność ze względu na większe nakładanie się, niejednoznaczność oraz bardziej rygorystyczne wymagania dotyczące pokrycia korpusu. W praktyce zbiór odrzuceń można stopniowo udoskonalać poprzez rozszerzenie korpusu dziedziny i włączenie wewnętrznych baz wiedzy. Konfiguracja trzech etykiet pokazuje zatem paradygmat wielokrotnego użytku, a nie wyczerpującą taksonomię zawodową.
Zbiór danych łączy źródła strukturalne i nieustrukturyzowane. Ustrukturyzowany korpus został zebrany i wyselekcjonowany przez autorów na podstawie ogłoszeń o pracę publicznych opublikowanych przez notowane firmy na głównych platformach rekrutacyjnych w Chinach w latach 2014–2023. Po deduplikacji i podstawowym oczyszczeniu korpus strukturalny zawiera około 6,93 miliona ogłoszeń. Nieustrukturyzowane dokumenty domenowe opublikowane przez odpowiednie organy służyły do określenia kryteriów wiedzy domenowej i etykietowania. Z tych źródeł ręcznie skonstruowano trzy podzbiory benchmarków, z których każdy zawierał 1000 ogłoszeń dotyczących sztucznej inteligencji, ochrony środowiska i niepowiązanych dziedzin, i zweryfikowano ich do oceny.
Szkielety modelu ocenia się przy użyciu dokładności, precyzji, przypominania oraz F1 (harmoniczna średnia precyzji i przywołania, F1 = 2PR/(P+R)), aby wybrać optymalną podstawę dla przepływu pracy uzupełnionego wyszukiwaniem. Autorytatywne dokumenty domenowe są kompilowane w bazę wiedzy dla generowania uzupełnionego wyszukiwaniem (RAG). Odpowiednie fragmenty są pobierane i wstrzykiwane do stałego szablonu promptu, aby wspierać klasyfikację. Systematycznie testowane są warianty promptów, a do określenia ostatecznej konfiguracji stosuje się strategię optymalizacji słów sygnałowych. Uzyskane dowody są filtrowane pod kątem istotności, aby zminimalizować szum i wspierać dokładne, efektywne wnioskowanie.
Aby umożliwić klasyfikację na dużą skalę, workflow stosuje etapowy pipeline: triage sterowany leksykonem efektywnie rozwiązuje rutynowe przypadki, podczas gdy wnioskowanie LLM z uzupełnieniem wyszukiwania i optymalizacją promptów obsługuje niejednoznaczne publikacje, równoważąc skalowalność i dokładność (Rysunek 1).