Bu içeriği görüntülemek için JoVE aboneliğiniz gereklidir. Giriş yapın veya ücretsiz denemenizi bugün başlatın.

Yöntem makalesi

İki aşamalı işe alım metin etiketlemesi ve sözlük yönlendirmeli yönlendirme ve geri dönüş destekli büyük dil modelleri ile

136 görüntüleme

DOI:

10.3791/70153

8 Mayıs 2026

Bu makalede

Özet

Yapay Zeka, Çevre Koruma veya Diğer kategorilere dahil olmak için işe alım metinlerini sınıflandırmak için iki aşamalı bir iş akışı tanımlanır. Sözlük yönlendirmeli triaj, rutin vakalar atarken, geri alma ile artırılmış, prompt optimize edilmiş büyük dil modeli çıkarımı belirsiz vakaları çözerek doğru büyük ölçekli etiketleme ve sonraki betimleyici işgücü piyasası özetini sağlar.

Özet

Işe alım metinleri heterojendir ve alan terminolojisi zamanla evrilir; bu da sınırlı manuel açıklama kapasitesiyle büyük ölçekli etiketlemeleri zorlaştırır. Bu protokol, Çin işe alım metinlerini Yapay Zeka, Çevre Koruma veya Diğer olarak sınıflandırmak için tekrarlanabilir iki aşamalı bir iş akışı sağlar. Birinci aşama, iki seçilmiş alan anahtar kelime listesi kullanarak sözlük odaklı triage gerçekleştirir. Sadece bir alan sözlüğüne uyan ilanlar doğrudan etiketlenir. Her iki sözlüğe uymayan gönderiler Diğer olarak etiketlenirken, çift maçlı paylaşımlar ikinci aşamaya yönlendirilir. İkinci aşama, geri alma ile artırılmış büyük dil modeli çıkarımı uygular. 12 yetkili alan belgesinden derlenen bir bilgi tabanı, metne dönüştürülür, yaklaşık 1.000 karakterlik parçalara bölünür ve 20 karakterlik örtüşmelerle tamamlayıcı MiniLM-L6-v2 kullanılarak gömülür ve LanceDB'de indekslenir. Her belirsiz gönderi için, kosinus-benzerlik k-nearest-neighbor retrieval, minimum benzerlik eşiği (τ) ile filtrelenmiş aday parçalar döndürür ve en fazla dört parça, etiket sınırlarını tanımlayan ve çıktıyı tek bir etiketle sınırlayan sabit bir prompt şablonuna enjekte edilir. 3.000 ilan içeren bir kıyaslama seti manuel olarak doğrulanır; her sınıf başına 1.000 ilan bulunur ve %95,0 oranında bir annotator arası anlaşma ile yaklaşık 0,93 Cohen's kappa (κ) elde edilir. Değerlendirme, Qwen2.5-7B-Instruct kullanılarak yalnızca istem içeren bir ayar ve geri alma ile artırılmış bir ayar arasında birden fazla açık kaynaklı büyük dil modelini karşılaştırır. Geri alım ile artırılmış yapılandırma, %98,47 doğruluk sağlar ve yaklaşık 6,93 milyon gönderinin korpus ölçeğinde etiketlenmesini destekler; bu açıklama sonrası tanımlayıcı toplama için destekler.

Giriş

Son yıllarda, yapay zeka ve çevre teknolojilerinin hızla gelişmesiyle birlikte, çok sayıda yeni kariyer ortaya çıktı. Bir yandan, küresel iş piyasası yapay zeka ve sürdürülebilirlik temelli birçok yepyeni pozisyonla dolup taşıyor. Vakant tabanlı kanıtlar, yapay zeka ile ilgili beceri talebinde hızlı bir artışı belgeler; bu da işe alım metinlerinin heterojenliğini artırır ve tekrarlanabilir, ölçeklenebilir bir alan etiketlemeprotokolünü motive eder 1. Öte yandan, Çin'in Mesleki Sınıflandırma Sözlüğü'nün (OKB) son revizyonu da istihdam informatizasyonu ve yeşil ile düşük karbonlu alanlarda da benzer şekilde güçlü bir artış gördü; 2022 revizyonunda 2015 baskısına kıyasla toplam 97 dijital meslek artışı sağlandı. veya toplam meslek sayısının %6'sı, etiketlenmiş ile birlikte 134 yeşil meslek veya toplam meslek sayısının %8'i 2.

Bu yeni meslekler ortaya çıkmaya devam ettikçe, şirketlerin iş ilanlarının içeriği ve biçimi daha karmaşık hale gelmektedir; çünkü iş tanımları genellikle konu bilgisi ve çeşitli beceri gereksinimleri içerir; iş unvanları ve yetenek listeleri gibi yapılandırılmış alanları ile çok sayıda yapılandırılmamış serbest metin tanımını içerir ve bu da giderek daha karmaşık iş ilan yapılarına yol açar. Böyle karmaşık iş ilanları genellikle açıkça tanımlanmış yapılandırılmış öğeler (örneğin, iş unvanları, gerekli beceri listeleri) ile birlikte kapsamlı yapılandırılmamış serbest metin açıklamaları içerir. Örneğin, bir yapay zeka mühendisi ilanında 'derin öğrenme çerçevesinde yeterlilik' ve 'geri yayılma algoritmalarını optimize etme deneyimi' gibi teknik jargonlar bir yetenek listesinin parçası olarak listelenebilir, ayrıca sorumlulukların ayrıntılı bir anlatımını da içerebilir; Benzer şekilde, bir çevre mühendisi ilanında belirli düzenleyici standartlar ve sertifikalar referans verilebilir. Yapılandırılmış ve yapılandırılmamış içeriğin bu birleşimi, son derece uzmanlaşmış ve karmaşık iş tanımları ortaya çıkarır.

Yapay Zeka ve Çevre Koruma, işe alım sınıflandırmasında gerçekçi alanlar arası belirsizlik altında protokolü değerlendirmek üzere seçilmiştir. Pratikte, O*NET ve iş panoları gibi ana akım mesleki kaynaklar kaba etiketler atar, bu da sektörler arası rolleri sadece anahtar kelimelerle ayırt etmeyi zorlaştırır. Çevre Koruma, birden fazla bilimsel alanla örtüşen geniş bir alanı temsil ederken, Yapay Zeka ise genellikle genel yazılım rolleriyle karıştırılan bilişim içinde daha ince bir kesimi yansıtır. Bu eşleşme, hem geniş hem dar çapraz alan ortamlarını farklı terimlerle ve bilgi tabanı oluşturma için uygun yetkili belgelerle kaplarken, alan korpusunu değiştirerek çekirdek iş akışını değiştirmeden diğer sektörlere uyum sağlamayı sağlar.

Son yıllarda iş ilanı sınıflandırması üzerine yapılan araştırmalarda bir artış yaşandı. Araştırmacılar, mesleklerin sınıflandırılmasını geliştirmek için giderek daha fazla büyük önceden eğitilmiş modellerden yararlanıyor. BERT'in 2019'daki tanıtımı, derin bağlamsal dil anlayışını sağlayan ve metin sınıflandırma performansını önemli ölçüde artıran bir atılımnoktası oldu 3. Örneğin, Clavié ve ark. (2023), iş sınıflandırması için öğretime ayarlanmış büyük dil modeli (LLM) kullanmayı araştırmış ve doğru yönlendirme mühendisliğinin LLM'nin lisansüstü iş sınıflandırma görevinde son teknoloji denetli modelleri geride bırakmasını sağladığınıbulmuştur. Benzer şekilde, Li ve ark. (2023), büyük dil modeli özetini meslek kodu eşleştirme ile birleştiren bir LLM4Jobs yaklaşımı önermiştir; bu yaklaşım, önce özetler çıkarıp ardından standart iş kodlarıyla hizalanarak uzun iş tanımlarında sınıflandırma doğruluğunu önemli ölçüde artırır. Ayrıca, Senger ve ark. tarafından 2024 yılında yapılan bir anket, İK için derin öğrenmedeki son gelişmeleri kataloglar; beceri çıkarımı ve iş sınıflandırmasının hesaplamalı iş piyasası analizinde temel görevler haline geldiğinibelirtir. Kavas ve ark. (2024), çok dilli metin gömülmelerini LLM tabanlı kategorilendirmeyle birleştirerek iş ilan sınıflandırmasını geliştirerek kayda değer doğrulukkazanımları sağlamıştır 7. Geleneksel cephede, önceki sistemler nispeten kaba kategori setlerine sahip anahtar kelime tabanlı sezgisel yöntemlerden, 4.000'den fazla iş unvanı üzerinde hiyerarşi kullanan Carotene gibi taksonomi odaklıçerçevelere kadar uzanıyordu (8,9). Javed ve ark. (2016), erken bir iş unvanı sınıflandırma çerçevesi sunmuş, sistematik meslek kategorizasyonuna doğru ilk adımlardanbirini işaret etmiştir 10. Ancak bu denetimli yaklaşımlar, kapsamlı etiketlenmiş veri gerektirir ve yeni iş rollerinin hızla ortaya çıkışına uyum sağlamakta zorlanır; çünkü sınıflandırma taksonomileri genellikle işgücü piyasasından daha yavaş evrilir4.

Bu sınırlamaları ele almak için son çalışmalar, dış bilgiyi içeren hibrit stratejilere yönelmiştir; örneğin, Lewis ve ark. (2020), önceden eğitilmiş dil modellerini bir alıcı ile birleştirerek ilgili alan bilgisini enjekte ederek üstün doğruluk ve bilgi yoğun görevlerde daha fazla gerçek çıktı elde eden Retrieval-Augmented Generation (RAG) çerçevesinitanıtmıştır 11. Lester ve ark., hızlı ayarın model boyutu12 arttıkça daha büyük performans kazançları sağladığını ve güçlü bir temel LLM kullanımını pekiştirdiğini göstermiştir. Örneğin, Han ve ark. kural rehberli istemlerin kullanılmasının, modeli temel özelliklere odaklayarak metin sınıflandırma doğruluğunuartırabileceğini göstermiştir 13. Ayrıca, Brown ve ark. (2020), büyük bir dil modelinin sadece birkaç örnek veya talimattan yeni görevler yapabildiğini ünlü şekilde göstererek, prompt odaklı birkaç atış öğrenmenin gücünüvurgulamıştır 14. Özellikle, prompt tabanlı NLP tekniklerine yönelik yakın tarihli bir anket, prompt ifadesinin model çıktılarını önemli ölçüde yönlendirebileceğinivurguluyor 15. Aynı zamanda, makro düzeyde değişimler ve işgücü piyasasındaki belirsizlik, yeni roller ortaya çıktıkça yenilenebilecek ölçeklenebilir ve güncellenebilir etiketleme protokollerine olan ihtiyacıpekiştiriyor 16. İş piyasası NLP alanında, taksonomi odaklı çok dilli ön eğitim de mesleki yapılar ve dillerarası değişkenlikle temsilleri daha iyi hizalamak içinaraştırılmıştır 17. Bu çalışmalar toplu olarak, yaklaşımı bilgilendirir ve ortaya çıkan meslek bağlamlarını daha etkili tanımak ve uyum sağlamak için geri dönüş ve prompt optimizasyonu ile büyük dil modellerinin potansiyelini gösterir.

Bu çalışmada, alan bilgisi yalnızca Yapay Zeka ve Çevre Koruma için seçilmiştir; çünkü korpus oluşturma, doğrulama ve bakım, alanlararası işe alım sınıflandırmasının birincil operasyonel maliyetlerini temsil etmektedir. Buna göre, Diğer kategorisi, kapsam dışı bir reddetme kategorisi olarak hizmet veriyor, önemli bir endüstri sınıfı değil. Bildirilen yüksek doğruluk temkinli yorumlanmalıdır; çünkü üç etiketli ayar etiketlemeyi basitleştirir ve daha ince taneli taksonomilere kıyasla performansı şişirebilir. Protokol, hedeflenen alanlar için hafif, bilgiye dayalı bir etiketleme katmanı olarak tasarlanmıştır; kapsamlı çok kategorili sınıflandırma sistemlerinin yerine geçmez. Etiket setinin genişletilmesi, artan örtüşme, belirsizlik ve daha sıkı korpus kapsama gereksinimleri nedeniyle doğruluğu azaltabilir. Pratikte, reddetme kümesi, alan korpusunu genişleterek ve iç bilgi tabanlarının dahil edilmesiyle kademeli olarak geliştirilebilir. Bu nedenle, üç etiketli yapılandırma, kapsamlı bir mesleki taksonomi yerine yeniden kullanılabilir bir paradigma gösterir.

Veri seti, yapılandırılmış ve yapılandırılmamış kaynakları birleştirir. Yapılandırılmış korpus, 2014 ile 2023 yılları arasında Çin'deki büyük çevrimiçi işe alım platformlarında halka açık şirketler tarafından kamuya açık olarak yayınlanan iş ilanlarından yazarlar tarafından toplanıp küratörlüğü yapılmıştır. Deduplication ve temel temizlikten sonra, yapılandırılmış korpus yaklaşık 6,93 milyon ilan içerir. İlgili otoriteler tarafından yayımlanan yapılandırılmamış alan alan belgeleri, alan bilgisi ve etiketleme kriterlerini tanımlamak için kullanıldı. Bu kaynaklardan, her biri sırasıyla Yapay Zeka, Çevre Koruma ve alakasız alanlar için 1.000 ilan içeren üç kıyaslama alt kümesi manuel olarak oluşturuldu ve değerlendirme için doğrulandı.

Model omurgaları, doğruluk, hassasiyet, geri çağırma ve F1 (hassasiyet ve geri çağırmanın harmonik ortalaması, F1 = 2PR/(P+R)) kullanılarak değerlendirilir; böylece geri alma ile artırılmış iş akışı için optimal temel seçilir. Yetkili alan belgeleri, geri alınma ile artırılmış üretim (RAG) için bir bilgi tabanına derlenir. İlgili pasajlar alınır ve sınıflandırmayı desteklemek için sabit bir prompt şablonuna enjekte edilir. İstem varyantları sistematik olarak test edilir ve nihai konfigürasyonu belirlemek için bir işaretli kelime optimizasyon stratejisi uygulanır. Elde edilen kanıtlar, gürültüyü en aza indirmek ve doğru, verimli çıkarımı desteklemek için önemlilik açısından filtrelenir.

Büyük ölçekli sınıflandırmayı mümkün kılmak için iş akışı aşamalı bir boru hattı benimser: sözlük yönlendirmeli triaj, rutin vakaları verimli şekilde çözerken, geri alma ile artırılmış, prompt optimize edilmiş LLM çıkarımı belirsiz gönderileri yöneterek ölçeklenebilirlik ve doğruluğu dengeler (Şekil 1).

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Protokol

Bu çalışma insan katılımcıları veya hayvan denekleri içermedi. Bu nedenle, etik onay ve bilgilendirilmiş onay gerekmiyordu. İş akışı, Materyaller Tablosu'nda listelenen donanım, araçlar ve yazılımlar kullanılarak 64-bit Windows işletim sisteminde Python 3.10 ortamında yürütüldü.

1. Modellik

  1. Veri ve bilgi tabanının oluşturulması
    1. Çin'deki büyük çevrimiçi işe alım platformlarından halka açık şirketler için (2014–2023) halka açık şirketler için iç yapılandırılmış bir iş ilanları koleksiyonunu toplamak ve küratörlüğünü yapmak için platform politikaları ve geçerli düzenlemelere uyumu sağlamak. Her ilan için iş unvanı, iş tanımı, şirket adı, ilan tarihi ve benzersiz bir tanımlayıcı (örneğin, görev kimliği veya URL, varsa) kaydedin. Kopyaları ve geçersiz kayıtları kaldırın ve nihai korpusun yaklaşık 6,93 milyon kayıt içerdiğini doğrulayın.
    2. Yapay Zeka ve Çevre Koruma ile ilgili yetkili alan belgelerini toplayın; bunlar arasında Ek Dosya 1'de listelenen belgeler de var. Belgelerin yetkinlikleri, yeterlilik standartlarını, görev alanlarını veya düzenlenmiş prosedürleri tanımladığından emin olun.
  2. Kıyaslama veri setinin oluşturulması
    1. Yapılandırılmış veri setini manuel olarak tarayın. Yapay Zeka, Çevre Koruma ve alakasız alanları açıkça temsil eden ilanları seçin. Kapsamı artırmak için sınırda vakalar ekleyin.
    2. Her ilanı, iş tanımı ve işveren bilgileriyle etiketleyin.
    3. Yapay Zeka, Çevre Koruma ve Diğer bölümler için her biri 1.000 ilan içeren üç kıyaslama alt kümesi oluşturun.
    4. Çift açıklama yapın. Her gönderiyi etiketlemek için bir anlatıcı, yazılı bir kılavuz kullanarak etiketi doğrulamak için ise ikinci bir anlatıcı atanın.
    5. Anlaşmazlıkları üçüncü bir anlatıcı tarafından tartışma ve yargı yoluyla çöz.
    6. Hesap annotatörler arası anlaşma. Yüzde anlaşmayı kaydedin ve κ.
    7. Model değerlendirmesi için doğrulanmış kıyaslama veri setini koruyun.
  3. Model omurgalarının değerlendirilmesi
    1. Aynı prompt şablonu ve kıyaslama veri seti kullanarak komut ayarlı LLM omurgalarını değerlendirin.
    2. Omurga karşılaştırması sırasında geri alma artırma devre dışı bırakın.
    3. İstem ifadesi, parametreleri çözme ve etiket eşlemesi modeller arasında aynı şekilde devam edin.
    4. Genel doğruluğu, sınıf başına hassasiyeti, geri çağırmayı ve F1'i hesaplayın.
    5. En iyi performans gösteren omurga bonu'nu seçin ve yapılandırmasını Tablo 1'e kaydedin.
    6. Tam değerlendirme sonuçlarını Tablo 2'de bildirin.
  4. Alan-adaptif kodlayıcı eğitimi gerçekleştirme
    1. Yalnızca Ek Dosya 1'de listelenen yetkili belgeleri kullanarak etiketsiz bir korpus oluşturun.
    2. Tüm belgelerden düz metin çıkar.
    3. Metni maksimum 512 uzunluğunda ve 492 adım olan dizilere böl.
    4. 50 karakterden kısa bölümleri at.
    5. Kıyaslama ilanlarının bu derejeden çıkarılmasını sağla.
    6. Çin BERT üs kontrol noktalarını başlatın.
    7. Maskeli dil modeli ön eğitimi ile 0.15 maskeleme olasılığı ile gerçekleştirilin.
    8. AdamW ile 3 dönem boyunca antrenman yapın, öğrenme hızı 5e-5 ve parti boyutu 2.
    9. Önceden eğitilmiş kontrol noktasını kaydet.
    10. Üç sınıf sınıflandırması için kodlayıcıyı 2e-5 öğrenme hızı, 2 parti boyutu ve maksimum dizis uzunluğu 512 kullanarak ince ayar yapın.
    11. Rastgele tohumu 42'ye sabitleyin ve stratifikasyonlu tren doğrulama bölmesi uygulayın.
    12. Rapor doğruluğu, makro ortalamalı hassasiyet, makro ortalamalı geri çağırma, makro ortalamalı F1, sınıf başına metrikler ve karışıklık matrisi.
    13. Değerlendirme çıktılarını doğrulama için kaydet.
  5. Retrieval-Augmented Sınıflandırma Hattının İnşası
    1. Bilgi tabanını oluştur
      1. 12 yetkili alan derleyin.
      2. Tekrarlanan veya eski sürümleri kaldırın.
      3. Belgeleri düz metne dönüştürün.
      4. Belge meta verilerini, yayımlayan ve yayın yılı dahil olmak üzere kaydedin.
      5. Metni yaklaşık 1.000 karakterlik parçalara bölerek 20 karakterlik örtüşmeleri yapın.
      6. Toplam parça sayısını ve parça uzunluğu dağılımını kaydedin.
        NOT: Bilgi tabanı genişletilirse alma performansını yeniden doğrulayın.
    2. Gömülmeleri kodlayın ve depolayın
      1. Tüm parçaları gömü modeli kullanarak kodlayın ve gömmeleri vektör veritabanında depolayın.
      2. Parça tanımlayıcılarını ve kaynak meta verilerini arşivleyin.
      3. Depolanan vektör sayısının parça sayısıyla eşleşip eşleşmediğini doğrulayın.
    3. Geri alma işlemi gerçekleştirin.
      1. Her iş ilanını aynı göme modeliyle gömleyin.
      2. Kosinüs benzerliği kullanarak k-en yakın komşu araması yapın.
      3. Düşük alakalı eşleşmeleri filtrelemek için benzerlik eşiği τ uygulanır.
      4. Tutulan bir alt kümede akort yaptıktan sonra τ ve top-κ sabitleyin.
      5. Kayda alınan parça tanımlayıcıları ve benzerlik puanları.
    4. Geri Getirme Artırılmış Çıkarım Gerçekleştirin
      1. İstem şablonunun kanıt bölümüne en fazla dört alınan parça ekleyin (Ek Dosya 2).
      2. İş ilan metnini alınan kanıtlarla birleştirin.
      3. Seçilen LLM kullanarak son üç sınıflı etiketi oluşturun.
      4. Geri alma günlüklerini, istmenleri ve model çıktılarını kaydedin.
  6. Sözlük rehberli triaj yapmak
    1. Anahtar Kelime Sözlüğü Oluştur
      1. İki anahtar kelime sözlüğü derleyin: biri Yapay Zeka için, diğeri Çevre Koruma için (Ek Dosya 3).
      2. İş ilanlarından ve yetkili belgelerden aday terimlerini çıkarın.
      3. Metni belirtilen tokenizasyon kütüphanesi kullanarak tokenize edin.
      4. Terim sıklığı ve alan kontrast istatistiklerini hesaplayın ve belirsiz veya aşırı genel terimleri çıkarın.
      5. Sözlükleri tamamlayıp arşivleyin.
    2. Güzergah Paylaşımları
      1. Tam olarak string ve jeton seviyesinde eşleştirme uygula.
      2. Yalnızca Yapay Zeka anahtar kelimeleri içeren ilanları Yapay Zeka şubesine yönlendirin.
      3. Çevre Koruma şubesine yalnızca Çevre Koruma anahtar kelimeleri içeren rota ilanları.
      4. Eşleşmeyen ilanları Diğer olarak etiketleyin.
      5. Çift eşleşme gönderileri geri alma artırılmış adıma yönlendirin.
      6. Yönlendirme istatistiklerini ve sözlük sürümlerini kaydedin.
    3. Belirsiz paylaşımları sınıflandır
      1. Sabit üst-κ ve τ ayarlarında ilgili parçaları alın.
      2. Alınan kanıtı prompt şablonuna enjekte edin.
      3. Son etiketi oluştur ve örnek başına kayıtları kaydet.

2. Sonuçların yeniden sınıflandırılması

  1. Sözlülük Sözlüğü Yapısı
    1. Yapay Zeka terimlerinden oluşan bir tezaurus oluşturun (Ek Dosya 4). Makine öğrenimi, doğal dil işleme, bilgisayar görme, robotik ve ilgili alt alanlardan terimleri dahil edin. Her kategori altında ayrıntılı terimler düzenleyin.
    2. Çevre Koruma terimlerinin ayrı bir tezaurusunu oluştur. Çevre bilimi temellerini, çevresel izleme ve analizi, kirlilik kontrolü ve yönetimini, ayrıca çevresel planlama ve yönetimi dahil edin.
    3. Tüm Yapay Zeka ve Çevre Koruma terimlerini tokenizasyon sözlüğüne ekleyin. Bu terimlerin metin segmentasyonu sırasında tam birimler olarak tanındığından emin olun.
  2. Metnin ön işlemesi
    1. Düzenli ifadeler kullanarak noktalama işaretlerini ve özel karakterleri kaldırın. Sadece metin ve boşlukları kalın.
    2. Sürekli metni bireysel tokenlara bölmek için kelime segmentasyonu yapın.
  3. Özellik eşleştirme ve kategorize etme
    1. Giriş metnini önceden işleyerek segmentlenmiş tokenların listesini elde edin.
    2. Ön sınıflandırmaya göre uygun sözlük sözlüğünü seçin.
    3. Segmentlenmiş tokenları dolaştırın ve normalizasyondan sonra sözlük terimleriyle tam eşleştirme yapın. Küçük harfler uygulayın ve önceden tanımlanmış varyantları birleştirin, eşleştirmeden önce.
    4. Her eşleşen terimi ve ilgili tezaurus dalını kaydedin.
      NOT: Birden fazla dal eşleşirse, beraberlikleri sabit bir kuralla çözün (örneğin, en yüksek eşleşme sayısı ve en erken oluşum).
    5. Eşleştirilmiş terimler listesini ve nihai alan içi etiketi aşağı akış toplama için dışa aktarın.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Sonuçlar

Materyaller Tablosu'nda listelenen dört açık kaynaklı, komut ayarlı büyük dil model omurgası (Backbone A–D), üç sınıflı iş ilan sınıflandırma görevinde kıyaslanmıştır. Değerlendirme, tüm omurga boğucularında aynı test protokolü, ön işleme prosedürleri ve metrikler kullanılarak yapılır; genel doğruluk, hassasiyet, geri çağırma ve F1 dahil. Hızlı iyileştirme ve geri kazanma ile artırılmış üretim (RAG) daha sonra Backbone B'ye uygulanır ve aynı koşullarda yeniden değerlendi...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Tartışma

Önceki çalışmalar, işe alım metni kategorizasyonuna klasik makine öğrenimi ve sinir modelleri uygulamış, özgeçmiş ve iş tanımı sınıflandırması dahil, ancak bu yaklaşımlar genellikle önemli etiketlenmiş veriler gerektirir ve alan terminolojisi değiştiğinde zayıflayabilir. Ali ve ark., NLP ve makine öğrenimi teknikleri kullanarak bir özgeçmiş sınıflandırma sistemiönermiştir 18. Jalili ve ark. BiLSTM tabanlı özgeçmiş sınıflandırmasınıincelemiştir 19...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Açıklamalar

Yazarların açıklayacak hiçbir şeyi yok.

Teşekkürler

Yazarlar, veri kürasyonu ve makale hazırlığı sırasında teknik destek ve yapıcı geri bildirimler için meslektaşlarına teşekkür ediyor. Bu proje dış bir fon almadı.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
all-MiniLM-L6-v2 (cümle kodlayıcı)Sarılma Yüzü (cümle dönüştürücüleri)https://huggingface.co/sentence-transformers/all-MiniLM-L6-v2Vektörleştirme için kullanılan cümle göme modeli.
Bert-base-Chinese (temel kodlayıcı)Yüzü Kucaklamak (google-bert)https://huggingface.co/google-bert/bert-base-chineseTemel kodlayıcı (Çince BERT tabanı).
DDR5 bellek, 16 GBİş istasyonu/dizüstü bilgisayar yapılandırmasıYokSistem belleği (16 GB DDR5); Satıcı/parça numarası belirtilmemiş.
DeepSeek-R1-Distill-Qwen-7B (Omurga A)Sarılma Yüzü (deepseek-ai)https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-7BLLM omurgası A.
GLM-4-9B-Chat (Backbone C)Sarılma Yüzü (zai-org)https://huggingface.co/zai-org/glm-4-9b-chat-hfLLM omurgası C.
Intel Core i5-13500HX CPUIntelhttps://www.intel.com/content/www/us/en/products/sku/232156/intel-core-i513500hx-processor-24m-cache-up-to-4-70-ghz/specifications.htmlDeneyler için kullanılan iş istasyonu CPU'su.
InternLM2.5-7B-Chat (Backbone D)Embrace Face (internlm)https://huggingface.co/internlm/internlm2_5-7b-chatLLM backbone D.
jieba (Çin tokenizer)PyPI (jieba)https://pypi.org/project/jieba/Çin tokenizasyon/segmentasyon kütüphanesi; Versiyonu belirtilmedi.
Anahtar kelime kütüphaneleri (AI & Çevre) (Ek Dosya 3)Bu çalışmaEk Dosya 3Sözlük yönlendirilmeli ön filtreleme için kullanılan alan anahtar kelime sözlükleri; Arşiv: Tam olarak kullanılan versiyon her koşu.
LanceDB (vektör veritabanı)LanceDBYokGömülü depolama/arama için vektör veritabanı; Versiyonu belirtilmedi.
NVIDIA GeForce RTX 4060 Dizüstü Bilgisayar GPU (8 GB VRAM)NVIDIAhttps://www.nvidia.com/en-us/geforce/laptops/40-series/Çıkarım/deneyler için kullanılan GPU.
Çevrimiçi işe alım platformu iş ilanları (2014 & ndash; 2023)Büyük Çin işe alım platformları (kamuya açık web verileri)YokYazarlar tarafından toplanmış ve küratörlük edilen kamuya açık iş ilanları; ~6,93 milyon ilan temizlikten sonra.
pip (Python paket yükleyicisi)PyPAYokPaket kurulumcusu, bağımlılıkları kurmak ve pip freeze kullanarak ortam anlık görüntüsünü dışa aktarmak için kullanılır.
İstem şablonunun evrimi (Ek Dosya 2)Bu çalışmaEk Dosya 2Ardışık prompt varyantları ve değerlendirme için kullanılan son istem.
Python 3.10Python Yazılım VakfıYokÇalışma zamanı yorumlayıcısı (Python 3.10); Yama sürümü belirtilmedi.
Qwen2.5-7B-Instruct (Backbone B)Sarılma Yüzü (Qwen)https://huggingface.co/Qwen/Qwen2.5-7B-InstructLLM omurga B.
RAG bilgi tabanı alanı tanımları/indeksi (Ek Dosya 1)Bu çalışmaEk Dosya 1Buluşma ile artırılmış çıkarımda kullanılan bilgi tabanı için şema/alan notları ve belge indeksi.
Thesaurus (AI & Çevre) (Ek Dosya 4)Bu çalışmaEk Dosya 4Yeniden sınıflandırma ve analizde kullanılan terim sözlükleri; Arşiv: Tam olarak kullanılan versiyon her koşu.
Windows 11 (64-bit)MicrosoftYokİşletim sistemi (Windows 11, 64-bit); Yapı/versiyon belirtilmemiş.

Kaynaklar

  1. Alekseeva, L., et al. The demand for AI skills in the labor market. Labour Economics. 71, 102002(2021).
  2. Ministry updates official dictionary of careers. , Ministry of Human Resources and Social Security of the People’s Republic of China. Available at: https://english.www.gov.cn/statecouncil/ministries/202209/30/content_WS633647bbc6d0a757729e0bb6.html (2022).
  3. BERT: Pre-training of deep bidirectional transformers for language understanding. Devlin, J., Chang, M. W., Lee, K., Toutanova, K. 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (NAACL-HLT), Minneapolis, MN, USA, , 4171-4186 (2019).
  4. Large language models in the workplace: A case study on prompt engineering for job type classification. Clavié, B., et al. 28th International Conference on Applications of Natural Language to Information Systems (NLDB 2023); , Derby, UK, , Springer. Natural Language Processing and Information Systems. Lecture Notes in Computer Science 3-17 (2023).
  5. Li, N., Kang, B., De Bie, T. LLM4Jobs: Unsupervised occupation extraction and standardization leveraging large language models. arXiv. , Available at: https://arxiv.org/abs/2309.09708 (2023).
  6. Deep learning-based computational job market analysis: A survey on skill extraction and classification from job postings. Senger, E., Zhang, M., van der Goot, R., Plank, B. 1st Workshop on Natural Language Processing for Human Resources (NLP4HR 2024), St. Julian’s, Malta, , 1-15 (2024).
  7. Enhancing job posting classification with multilingual embeddings and large language models. Kavas, H., Serra-Vidal, M., Wanner, L. 10th Italian Conference on Computational Linguistics (CLiC-it 2024), Pisa, Italy, , 440-450 (2024).
  8. JobBERT: Understanding job titles through skills. Decorte, J. J., Van Hautte, J., Demeester, T., Develder, C. International Workshop on Fair, Effective and Sustainable Talent Management using Data Science (FEAST 2021) at ECML-PKDD 2021, , (2021).
  9. Carotene: A job title classification system for the online recruitment domain. Javed, F., et al. IEEE First International Conference on Big Data Computing Service and Applications (BigDataService), , 286-293 (2015).
  10. Javed, F., McNair, M., Jacob, F., Zhao, M. Towards a job title classification system. arXiv. , Available at: https://arxiv.org/abs/1606.00917 (2016).
  11. Lewis, P., et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Presented at: Advances in Neural Information Processing Systems. NeurIPS. , (2020).
  12. The power of scale for parameter-efficient prompt tuning. Lester, B., Al-Rfou, R., Constant, N. 2021 Conference on Empirical Methods in Natural Language Processing (EMNLP), , 3045-3059 (2021).
  13. Han, X., et al. PTR: Prompt tuning with rules for text classification. AI Open. 3, 182-192 (2022).
  14. Brown, T. B., et al. Language models are few-shot learners. Presented at: Advances in Neural Information Processing Systems. NeurIPS. , (2020).
  15. Liu, P., et al. predict: A systematic survey of prompting methods in natural language processing. ACM Comput Surv. 55 (9), 195:1-195:35 (2023).
  16. Blue, A. The outlook for 2023 is uncertain, but here’s what we know about the global labour market. World Economic Forum (Agenda). , Available at: https://www.weforum.org/agenda/2023/01/the-outlook-for-2023-is-uncertain-but-here-s-what-we-know-about-the-global-labour-market-davos23 (2023).
  17. ESCOXLM-R: Multilingual taxonomy-driven pre-training for the job market domain. Zhang, M., van der Goot, R., Plank, B. 61st Annual Meeting of the Association for Computational Linguistics (ACL 2023), Toronto, Canada, , 11871-11890 (2023).
  18. Ali, I., et al. Resume classification system using natural language processing and machine learning techniques. Mehran Univ Res J Eng Technol. 41 (1), 65-79 (2022).
  19. BiLSTM for resume classification. Jalili, A., Tabrizchi, H., Razmara, J., Mosavi, A. 22nd IEEE International Symposium on Applied Machine Intelligence and Informatics (SAMI 2024), Stará Lesná, Slovakia, , (2024).
  20. Pal, R., Shaikh, S., Satpute, S., Bhagwat, S. Resume classification using various machine learning algorithms. ITM Web Conf. 44, 03011(2022).
  21. Convolutional neural network with word embedding based approach for resume classification. Nasser, S., Sreejith, C., Irshad, M. 2018 International Conference on Emerging Trends and Innovations in Engineering and Technological Research (ICETIETR 2018), , Ernakulam (Cochin), India. (2018).
  22. Real-time resume classification system using LinkedIn profile descriptions. Ramraj, S., Sivakumar, V. 2020 International Conference on Computational Intelligence for Smart Power Systems and Sustainable Energy (CISPSSE 2020), Keonjhar, Odisha, India, , (2020).
  23. Heakl, A., et al. ResumeAtlas: Revisiting resume classification with large-scale datasets and large language models. arXiv. , Available at: https://arxiv.org/abs/2406.18125 (2024).
  24. Skondras, P., Zervas, P., Tzimas, G. Generating synthetic resume data with large language models for enhanced job description classification. Future Internet. 15 (11), 363(2023).
  25. Chen, Z. Ethics and discrimination in artificial intelligence-enabled recruitment practices. Humanit Soc Sci Commun. 10, 567(2023).
  26. Retrieval-augmented few-shot text classification. Yu, G., et al. Findings of the Association for Computational Linguistics: EMNLP 2023, Singapore, , 6721-6735 (2023).
  27. Izacard, G., et al. Atlas: Few-shot learning with retrieval augmented language models. J Mach Learn Res. 24 (251), 1-43 (2023).
  28. KW-ATTN: Knowledge infused attention for accurate and interpretable text classification. Jang, H., et al. Deep Learning Inside Out (DeeLIO): 2nd Workshop on Knowledge Extraction and Integration for Deep Learning Architectures, , 96-107 (2021).

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Yeniden basım ve izinler

Etiketler

Eri imle G lendirilmi ModellerAlan Anahtar Kelime ListeleriBilgi Taban Olu turmaKosin s Benzerli i Eri imiK En Yak n Kom uince Metin S n fland rmaAnotat rler Aras Uyum