Son yıllarda, yapay zeka ve çevre teknolojilerinin hızla gelişmesiyle birlikte, çok sayıda yeni kariyer ortaya çıktı. Bir yandan, küresel iş piyasası yapay zeka ve sürdürülebilirlik temelli birçok yepyeni pozisyonla dolup taşıyor. Vakant tabanlı kanıtlar, yapay zeka ile ilgili beceri talebinde hızlı bir artışı belgeler; bu da işe alım metinlerinin heterojenliğini artırır ve tekrarlanabilir, ölçeklenebilir bir alan etiketlemeprotokolünü motive eder 1. Öte yandan, Çin'in Mesleki Sınıflandırma Sözlüğü'nün (OKB) son revizyonu da istihdam informatizasyonu ve yeşil ile düşük karbonlu alanlarda da benzer şekilde güçlü bir artış gördü; 2022 revizyonunda 2015 baskısına kıyasla toplam 97 dijital meslek artışı sağlandı. veya toplam meslek sayısının %6'sı, etiketlenmiş ile birlikte 134 yeşil meslek veya toplam meslek sayısının %8'i 2.
Bu yeni meslekler ortaya çıkmaya devam ettikçe, şirketlerin iş ilanlarının içeriği ve biçimi daha karmaşık hale gelmektedir; çünkü iş tanımları genellikle konu bilgisi ve çeşitli beceri gereksinimleri içerir; iş unvanları ve yetenek listeleri gibi yapılandırılmış alanları ile çok sayıda yapılandırılmamış serbest metin tanımını içerir ve bu da giderek daha karmaşık iş ilan yapılarına yol açar. Böyle karmaşık iş ilanları genellikle açıkça tanımlanmış yapılandırılmış öğeler (örneğin, iş unvanları, gerekli beceri listeleri) ile birlikte kapsamlı yapılandırılmamış serbest metin açıklamaları içerir. Örneğin, bir yapay zeka mühendisi ilanında 'derin öğrenme çerçevesinde yeterlilik' ve 'geri yayılma algoritmalarını optimize etme deneyimi' gibi teknik jargonlar bir yetenek listesinin parçası olarak listelenebilir, ayrıca sorumlulukların ayrıntılı bir anlatımını da içerebilir; Benzer şekilde, bir çevre mühendisi ilanında belirli düzenleyici standartlar ve sertifikalar referans verilebilir. Yapılandırılmış ve yapılandırılmamış içeriğin bu birleşimi, son derece uzmanlaşmış ve karmaşık iş tanımları ortaya çıkarır.
Yapay Zeka ve Çevre Koruma, işe alım sınıflandırmasında gerçekçi alanlar arası belirsizlik altında protokolü değerlendirmek üzere seçilmiştir. Pratikte, O*NET ve iş panoları gibi ana akım mesleki kaynaklar kaba etiketler atar, bu da sektörler arası rolleri sadece anahtar kelimelerle ayırt etmeyi zorlaştırır. Çevre Koruma, birden fazla bilimsel alanla örtüşen geniş bir alanı temsil ederken, Yapay Zeka ise genellikle genel yazılım rolleriyle karıştırılan bilişim içinde daha ince bir kesimi yansıtır. Bu eşleşme, hem geniş hem dar çapraz alan ortamlarını farklı terimlerle ve bilgi tabanı oluşturma için uygun yetkili belgelerle kaplarken, alan korpusunu değiştirerek çekirdek iş akışını değiştirmeden diğer sektörlere uyum sağlamayı sağlar.
Son yıllarda iş ilanı sınıflandırması üzerine yapılan araştırmalarda bir artış yaşandı. Araştırmacılar, mesleklerin sınıflandırılmasını geliştirmek için giderek daha fazla büyük önceden eğitilmiş modellerden yararlanıyor. BERT'in 2019'daki tanıtımı, derin bağlamsal dil anlayışını sağlayan ve metin sınıflandırma performansını önemli ölçüde artıran bir atılımnoktası oldu 3. Örneğin, Clavié ve ark. (2023), iş sınıflandırması için öğretime ayarlanmış büyük dil modeli (LLM) kullanmayı araştırmış ve doğru yönlendirme mühendisliğinin LLM'nin lisansüstü iş sınıflandırma görevinde son teknoloji denetli modelleri geride bırakmasını sağladığınıbulmuştur. Benzer şekilde, Li ve ark. (2023), büyük dil modeli özetini meslek kodu eşleştirme ile birleştiren bir LLM4Jobs yaklaşımı önermiştir; bu yaklaşım, önce özetler çıkarıp ardından standart iş kodlarıyla hizalanarak uzun iş tanımlarında sınıflandırma doğruluğunu önemli ölçüde artırır. Ayrıca, Senger ve ark. tarafından 2024 yılında yapılan bir anket, İK için derin öğrenmedeki son gelişmeleri kataloglar; beceri çıkarımı ve iş sınıflandırmasının hesaplamalı iş piyasası analizinde temel görevler haline geldiğinibelirtir. Kavas ve ark. (2024), çok dilli metin gömülmelerini LLM tabanlı kategorilendirmeyle birleştirerek iş ilan sınıflandırmasını geliştirerek kayda değer doğrulukkazanımları sağlamıştır 7. Geleneksel cephede, önceki sistemler nispeten kaba kategori setlerine sahip anahtar kelime tabanlı sezgisel yöntemlerden, 4.000'den fazla iş unvanı üzerinde hiyerarşi kullanan Carotene gibi taksonomi odaklıçerçevelere kadar uzanıyordu (8,9). Javed ve ark. (2016), erken bir iş unvanı sınıflandırma çerçevesi sunmuş, sistematik meslek kategorizasyonuna doğru ilk adımlardanbirini işaret etmiştir 10. Ancak bu denetimli yaklaşımlar, kapsamlı etiketlenmiş veri gerektirir ve yeni iş rollerinin hızla ortaya çıkışına uyum sağlamakta zorlanır; çünkü sınıflandırma taksonomileri genellikle işgücü piyasasından daha yavaş evrilir4.
Bu sınırlamaları ele almak için son çalışmalar, dış bilgiyi içeren hibrit stratejilere yönelmiştir; örneğin, Lewis ve ark. (2020), önceden eğitilmiş dil modellerini bir alıcı ile birleştirerek ilgili alan bilgisini enjekte ederek üstün doğruluk ve bilgi yoğun görevlerde daha fazla gerçek çıktı elde eden Retrieval-Augmented Generation (RAG) çerçevesinitanıtmıştır 11. Lester ve ark., hızlı ayarın model boyutu12 arttıkça daha büyük performans kazançları sağladığını ve güçlü bir temel LLM kullanımını pekiştirdiğini göstermiştir. Örneğin, Han ve ark. kural rehberli istemlerin kullanılmasının, modeli temel özelliklere odaklayarak metin sınıflandırma doğruluğunuartırabileceğini göstermiştir 13. Ayrıca, Brown ve ark. (2020), büyük bir dil modelinin sadece birkaç örnek veya talimattan yeni görevler yapabildiğini ünlü şekilde göstererek, prompt odaklı birkaç atış öğrenmenin gücünüvurgulamıştır 14. Özellikle, prompt tabanlı NLP tekniklerine yönelik yakın tarihli bir anket, prompt ifadesinin model çıktılarını önemli ölçüde yönlendirebileceğinivurguluyor 15. Aynı zamanda, makro düzeyde değişimler ve işgücü piyasasındaki belirsizlik, yeni roller ortaya çıktıkça yenilenebilecek ölçeklenebilir ve güncellenebilir etiketleme protokollerine olan ihtiyacıpekiştiriyor 16. İş piyasası NLP alanında, taksonomi odaklı çok dilli ön eğitim de mesleki yapılar ve dillerarası değişkenlikle temsilleri daha iyi hizalamak içinaraştırılmıştır 17. Bu çalışmalar toplu olarak, yaklaşımı bilgilendirir ve ortaya çıkan meslek bağlamlarını daha etkili tanımak ve uyum sağlamak için geri dönüş ve prompt optimizasyonu ile büyük dil modellerinin potansiyelini gösterir.
Bu çalışmada, alan bilgisi yalnızca Yapay Zeka ve Çevre Koruma için seçilmiştir; çünkü korpus oluşturma, doğrulama ve bakım, alanlararası işe alım sınıflandırmasının birincil operasyonel maliyetlerini temsil etmektedir. Buna göre, Diğer kategorisi, kapsam dışı bir reddetme kategorisi olarak hizmet veriyor, önemli bir endüstri sınıfı değil. Bildirilen yüksek doğruluk temkinli yorumlanmalıdır; çünkü üç etiketli ayar etiketlemeyi basitleştirir ve daha ince taneli taksonomilere kıyasla performansı şişirebilir. Protokol, hedeflenen alanlar için hafif, bilgiye dayalı bir etiketleme katmanı olarak tasarlanmıştır; kapsamlı çok kategorili sınıflandırma sistemlerinin yerine geçmez. Etiket setinin genişletilmesi, artan örtüşme, belirsizlik ve daha sıkı korpus kapsama gereksinimleri nedeniyle doğruluğu azaltabilir. Pratikte, reddetme kümesi, alan korpusunu genişleterek ve iç bilgi tabanlarının dahil edilmesiyle kademeli olarak geliştirilebilir. Bu nedenle, üç etiketli yapılandırma, kapsamlı bir mesleki taksonomi yerine yeniden kullanılabilir bir paradigma gösterir.
Veri seti, yapılandırılmış ve yapılandırılmamış kaynakları birleştirir. Yapılandırılmış korpus, 2014 ile 2023 yılları arasında Çin'deki büyük çevrimiçi işe alım platformlarında halka açık şirketler tarafından kamuya açık olarak yayınlanan iş ilanlarından yazarlar tarafından toplanıp küratörlüğü yapılmıştır. Deduplication ve temel temizlikten sonra, yapılandırılmış korpus yaklaşık 6,93 milyon ilan içerir. İlgili otoriteler tarafından yayımlanan yapılandırılmamış alan alan belgeleri, alan bilgisi ve etiketleme kriterlerini tanımlamak için kullanıldı. Bu kaynaklardan, her biri sırasıyla Yapay Zeka, Çevre Koruma ve alakasız alanlar için 1.000 ilan içeren üç kıyaslama alt kümesi manuel olarak oluşturuldu ve değerlendirme için doğrulandı.
Model omurgaları, doğruluk, hassasiyet, geri çağırma ve F1 (hassasiyet ve geri çağırmanın harmonik ortalaması, F1 = 2PR/(P+R)) kullanılarak değerlendirilir; böylece geri alma ile artırılmış iş akışı için optimal temel seçilir. Yetkili alan belgeleri, geri alınma ile artırılmış üretim (RAG) için bir bilgi tabanına derlenir. İlgili pasajlar alınır ve sınıflandırmayı desteklemek için sabit bir prompt şablonuna enjekte edilir. İstem varyantları sistematik olarak test edilir ve nihai konfigürasyonu belirlemek için bir işaretli kelime optimizasyon stratejisi uygulanır. Elde edilen kanıtlar, gürültüyü en aza indirmek ve doğru, verimli çıkarımı desteklemek için önemlilik açısından filtrelenir.
Büyük ölçekli sınıflandırmayı mümkün kılmak için iş akışı aşamalı bir boru hattı benimser: sözlük yönlendirmeli triaj, rutin vakaları verimli şekilde çözerken, geri alma ile artırılmış, prompt optimize edilmiş LLM çıkarımı belirsiz gönderileri yöneterek ölçeklenebilirlik ve doğruluğu dengeler (Şekil 1).