このコンテンツを表示するには、JoVEへの購読が必要です。 または、無料トライアルをお申し込みください。

方法論記事

語彙ガイド付きルーティングおよび検索拡張による大規模言語モデルによる2段階のリクルートテキストラベリング

136 閲覧数

DOI:

10.3791/70153

2026年5月8日

この記事について

サマリー

採用テキストを人工知能、環境保護、その他に分類するための2段階のワークフローが説明されています。レキシコンガイド型トリアージは日常的なケースを割り当て、検索拡張・プロンプト最適化された大規模言語モデル推論は曖昧なケースを解決し、正確な大規模ラベル付けや下流の記述的労働市場要約を可能にします。

要約

リクルートテキストは異種であり、ドメイン用語も時間とともに進化するため、手書き注釈能力が限られて大規模なラベリングが困難です。このプロトコルは、中国の採用文書を人工知能、環境保護、その他に分類するための再現可能な二段階ワークフローを提供します。第1段階では、2つの厳選ドメインキーワードリストを用いて辞書ガイドによるトリアージを行います。1つのドメイン辞典のみに一致する投稿は直接ラベル付けされます。どちらの語彙にも一致しない投稿は「その他」とラベル付けされ、デュアルマッチの投稿はステージ2にルーティングされます。第2段階では、検索拡張型大規模言語モデル推論を適用します。12の権威あるドメイン文書からまとめられたナレッジベースはテキストに変換され、約1,000文字のチャンクに分割され、20文字の重複が加わり、all-MiniLM-L6-v2で埋め込み、LanceDBでインデックス化されます。不確実な投稿ごとに、余弦類似度k-最近傍検索は最小類似度閾値(τ)でフィルタリングされた候補チャンクを返し、最大4つのチャンクがラベル境界を定義し出力を単一のラベルに制約する固定プロンプトテンプレートに注入されます。3,000件の投稿を手作業で検証し、クラスごとに1,000件の投稿が行われ、95.0%の注釈者間合意率と約0.93のコーエンズカッパ(κ)を達成しています。評価は、Qwen2.5-7B-Instructを用いたプロンプトのみの設定と検索拡張設定で複数のオープンソース大規模言語モデルを比較します。検索拡張構成は98.47%の精度を達成し、約693万件の投稿のコーパススケールのラベル付けを下流の記述集約に用いています。

概要

近年、AIや環境技術の急速な発展により、多くの新興キャリアが登場しています。一方で、世界の求人市場はAIやサステナビリティに基づく多くの新規職で溢れています。欠員に基づくエビデンスは、AI関連スキル需要の急速な拡大を記録しており、それが採用テキストの異質性を高め、再現可能でスケーラブルなドメインタグ付けプロトコルの導入を促しています一方、中国の最新の職業分類辞典(OCD)改訂では、雇用情報化やグリーン・低炭素分野でも同様に堅調な職業増加が見られ、2022年版の改訂では2015年版と比べて158の新規職種が純増し、デジタル職種は合計97種となりました。 または134の緑色職業とともにラベル付けされた職業数の6%、つまり全体の職業数の8%です2.

これらの新しい職業が次々と登場する中で、求人情報の内容や形式はより複雑になっています。求人記述書はしばしば専門分野の知識や多様なスキル要件を含み、職名やスキルリストなどの構造化されたフィールドだけでなく、多数の非構造化のフリーテキスト説明も含まれているため、求人情報の構造はますます複雑になっています。このような複雑な求人情報には、明確に定義された構造化要素(例:職種名、必要スキルのリスト)と、広範な非構造化のフリーテキスト説明が含まれています。例えば、AIエンジニアの求人広告には「ディープラーニングフレームワークの習熟」や「バックプロパゲーションアルゴリズムの最適化経験」といった専門用語をスキルリストに記載し、詳細な責任内容も含めて記載することがあります。同様に、環境エンジニアの求人では特定の規制基準や認証を参照することがあります。構造化と非構造化のコンテンツの組み合わせにより、非常に専門的で複雑な職務記述書が作成されます。

人工知能と環境保護が、採用分類における現実的なクロスドメイン曖昧さのもとでプロトコルを評価するために選定されます。実際には、O*NETや求人掲示板などの主流の職業資源は粗いタグを割り当てており、キーワードだけでは業界横断的な役割を区別しにくくしています。環境保護は複数の科学分野と重なる広範な領域を表し、人工知能はコンピューティングのより細かい分野を反映し、しばしば一般的なソフトウェアの役割と混同されています。この組み合わせは、広範なおよび狭いドメインの両領域を異なる用語と適切な権威ある文書でナレッジベース構築に適用し、コアワークフローを変更することなくドメインコーパスを置き換えることで他業界への適応を可能にします。

近年、求人情報の分類に関する研究が急増しています。研究者たちは職業分類の改善のために大規模で事前学習済みモデルをますます活用しています。2019年のBERT導入は、深い文脈に基づく言語理解を可能にし、テキスト分類性能を大幅に向上させる画期的なものでした例えば、Claviéら(2023)は、命令チューニングされた大規模言語モデル(LLM)をジョブ分類に用いることを探り、適切なプロンプトエンジニアリングによりLLMが最新鋭の教師ありモデルを上回る大学院のジョブ分類タスク4で優れた性能を発揮できることを発見しました。同様に、Liら(2023)は、大規模言語モデルの要約と職業コードマッチングを組み合わせたLLM4Jobsアプローチを提案し、まず要約を抽出し、標準的な職務コード5に整合させることで、長大な職務記述書の分類精度を大幅に向上させました。さらに、Sengerらによる2024年の調査では、人事分野のディープラーニングの最近の進展が記録されており、スキル抽出と職務分類が計算的雇用市場分析の中核課題となっていることが指摘されていますKavasら(2024)は、多言語テキスト埋め込みとLLMベースの分類を組み合わせることで求人情報分類を強化し、顕著な精度向上を達成しました従来のシステムでは、比較的粗いカテゴリセットを用いたキーワードベースのヒューリスティックから、4,000以上の職種名に階層を用いるCaroteneのような分類主導のフレームワークまで多岐にわたりました。Javedら(2016)は、初期の職種分類フレームワークを提示し、体系的な職業分類への最初の一歩を示しました。しかし、これらの監督付きアプローチは広範なラベル付きデータを必要とし、分類分類法は労働市場よりも進化が遅いことが多いため、新しい職種の急速な出現に適応するのに苦労します。

こうした制約に対処するため、最近の研究では外部知識を取り入れたハイブリッド戦略が検討されています。例えば、Lewisら(2020)は、事前学習済み言語モデルとリトリーバーを組み合わせて関連ドメイン知識を注入し、知識集約型タスクにおいてより高い精度とより事実に近い出力を実現するRetrieval-Augmented Generation(RAG)フレームワークを導入しました。Lesterらは、モデルサイズが12倍増加するほど、プロンプトチューニングがより大きな性能向上をもたらすことを示し、強力な基礎LLMの使用を強化しました。例えば、Hanらはルールガイド付きプロンプトの使用により、モデルを主要な特徴に集中させることでテキスト分類の精度を高めることができることを示しました13。さらに、ブラウンら(2020)は、大規模な言語モデルがわずかな例や命令から新しいタスクを遂行できることを有名に示し、プロンプト駆動の少ショット学習の力を強調しました14。特に、プロンプトベースのNLP技術に関する最近の調査では、プロンプトの表現がモデルの出力を大きく左右することが強調されています15。同時に、マクロレベルの変化や労働市場の不確実性は、新たな役割の出現に合わせて刷新可能なスケーラブルで更新に適したラベリングプロトコルの必要性を強調しています。就職市場NLPの分野では、分類学に基づく多言語前訓練も、職業構造や言語間変動性との表現をより良く整合させるために探求されています17。これらの研究は、検索とプロンプト最適化を備えた大規模言語モデルを用いることで、新たな職業文脈をより効果的に認識し適応する可能性を示し、アプローチを整えています。

本研究では、ドメイン知識は人工知能および環境保護のみを対象としており、コーパスの構築、検証、保守がクロスドメインリクルート分類の主な運用コストを占めています。したがって、その他は実質的な業界クラスというよりも、範囲外の拒否カテゴリーとして機能します。報告された高い正確性は慎重に解釈されるべきであり、3ラベル設定はラベリングを簡素化し、より細かい分類法と比べて性能を過大評価する可能性がある。このプロトコルは、対象ドメインに対する軽量で知識に基づくラベリング層として意図されており、包括的なマルチカテゴリ分類システムの代替ではありません。ラベルセットの拡大は、重複や曖昧さの増加、コーパスカバレッジ要件の厳しさにより精度が低下する可能性があります。実際には、ドメインコーパスを拡張し内部の知識ベースを組み込むことで、リジェクションセットを段階的に洗練させることが可能です。したがって、3ラベル構成は、網羅的な職業分類ではなく、再利用可能なパラダイムを示しています。

このデータセットは構造化ソースと非構造化ソースを組み合わせています。構造化されたコーパスは、2014年から2023年にかけて中国の主要なオンライン採用プラットフォームに上場企業が公開した求人広告から著者自身が収集・キュレーションしました。重複除去と基本的なクレンジングを経て、構造化されたコーパスには約693万件の投稿が含まれています。関連権威が公開した非構造化ドメイン文書を用いてドメイン知識やラベリング基準を定義しました。これらのソースから、人工知能、環境保護、その他関連分野の各1,000件の投稿を含む3つのベンチマークサブセットが手動で構築され、評価のために検証されました。

モデルのバックボーンは、精度、精度、リコール率、およびF1(精度とリコール率の調和平均F1 = 2PR/(P+R))を用いて評価され、検索拡張ワークフローの最適な基盤を選定します。権威あるドメイン文書は、検索拡張生成(RAG)用にナレッジベースにまとめられます。関連する文章は取得され、分類を支援するために固定されたプロンプトテンプレートに注入されます。プロンプトのバリエーションは体系的にテストされ、最終的な構成を決定するためにキューワード最適化戦略が適用されます。取得した証拠はノイズを最小限に抑え、正確かつ効率的な推論を支援するために関連性を絞り込みます。

大規模な分類を可能にするため、ワークフローは段階的なパイプラインを採用しています。レキシコンガイド付きトリアージはルーチンケースを効率的に解決し、検索拡張・プロンプト最適化型LLM推論は曖昧な投稿を処理し、スケーラビリティと精度のバランスを取っています(図1)。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

プロトコル

この研究は人間参加者や動物被験者を含みませんでした。したがって、倫理的な承認やインフォームド・コンセントは必要ありませんでした。ワークフローは、 Table of Materialsに記載されたハードウェア、ツール、ソフトウェアを用いて、64ビットWindowsオペレーティングシステムのPython 3.10環境で実行されました。

1. モデル活動

  1. データと知識ベースの構築
    1. 中国の主要オンライン採用プラットフォーム(2014–2023年)から上場企業向けの求人広告の構造化されたコーパスを収集・キュレーションし、プラットフォームの方針や関連規制の遵守を確保します。各求人には、職種名、職務内容、会社名、掲載日、そして一意の識別子(例:掲載IDやURLがあれば)を記載してください。重複や無効なエントリーを削除し、最終コーパスに約693万件のレコードが含まれていることを確認します。
    2. 足ファイル1に記載されている文書を含む、人工知能および環境保護に関連する権威あるドメイン文書を収集してください。文書には能力、資格基準、業務範囲、または規制された手続きが定義されていることを確認してください。
  2. ベンチマークデータセットの構築
    1. 構造化データセットは手動でスクリーニングしてください。人工知能、環境保護、その他関連分野を明確に代表する投稿を選びます。境界性の症例を含めてカバレッジを改善しましょう。
    2. 各求人には職種名、職務内容、雇用主情報を使ってラベルを付けてください。
    3. 人工知能、環境保護、その他それぞれ1,000件の投稿を含む3つのベンチマークサブセットを構築します。
    4. 二重注釈を実行してください。各投稿にラベルを付けるアノテーターを1人、書面のガイドラインを使ってラベルを検証するアノテーターをもう一人割り当てます。
    5. 意見の相違は、第三者の注釈者による議論と裁定によって解決します。
    6. アノテーター間合意を計算します。割合合意とκを記録します。
    7. モデル評価のために検証済みのベンチマークデータセットを保存してください。
  3. モデルバックボーンの評価
    1. 同じプロンプトテンプレートとベンチマークデータセットを用いて、命令調整されたLLMバックボーンを評価してください。
    2. バックボーン比較中に検索拡張を無効にしてください。
    3. プロンプトの表現、パラメータのデコード、ラベルマッピングはモデル間で同一に保ちましょう。
    4. 全体の精度、クラスごとの精度、リコール率、F1を計算します。
    5. 最も性能の良いバックボーンを選択し、その構成を 表1に記録します。
    6. 評価結果は 表2に報告してください。
  4. ドメイン適応エンコーダトレーニングの実施
    1. 補足ファイル1に記載されている権威ある文書のみを使って、ラベルなしのコーパスを作成します。
    2. すべての文書からプレーンテキストを抽出してください。
    3. テキストを最大長さ512、歩幅492のシーケンスに分割します。
    4. 50文字未満のセグメントは廃止します。
    5. ベンチマーク投稿はこのコーパスから除外するようにしてください。
    6. 中国のBERT基地チェックポイントを初期化してください。
    7. マスキング確率0.15でマスク言語モデルの事前学習を行います。
    8. AdamWを使って3エポックを学習速度5e-5、バッチサイズ2で訓練します。
    9. 事前学習済みのチェックポイントを保存してください。
    10. 学習率2e-5、バッチサイズ2、最大シーケンス長512を用いて、3クラス分類用にエンコーダを微調整します。
    11. ランダムシードを42に固定し、階層化された列車検証分割を適用します。
    12. 報告書の正確性、マクロ平均精度、マクロ平均リコール率、マクロ平均F1、クラスごとの指標、そして混乱行列。
    13. 評価出力は検証用に保存してください。
  5. 検索・拡張分類パイプラインの構築
    1. 知識基盤を構築する
      1. 12の権威あるドメインをまとめる。
      2. 重複または古いバージョンを削除してください。
      3. 文書をプレーンテキストに変換する。
      4. 発行者や発行年を含む文書メタデータを記録します。
      5. テキストを約1,000文字の塊に分割し、20文字の重複を含みます。
      6. チャンクの総数とチャンク長分布を記録します。
        注意:知識ベースが拡張された場合は検索性能を再検証してください。
    2. エンコードとストア埋め込み
      1. すべてのチャンクを埋め込みモデルでエンコードし、埋め込みをベクターデータベースに保存します。
      2. チャンク識別子と出所メタデータのアーカイブ。
      3. 保存されたベクトルの数がチャンク数と一致しているか確認してください。
    3. 回収を実行してください。
      1. すべての求人情報を同じ埋め込みモデルで埋め込みましょう。
      2. 余弦類似性を用いてk近傍探索を行います。
      3. 関連性の低いマッチをフィルタリングするために類似度閾値τを適用します。
      4. 保留された部分集合でチューニングした後、tとtop-κを固定します。
      5. 取得したチャンク識別子と類似度スコアを記録します。
    4. 検索拡張推論の実行
      1. プロンプトテンプレートの証拠セクション(補足ファイル2)に最大4つの取得したチャンクを挿入します。
      2. 求人情報のテキストと取得した証拠を連結してください。
      3. 選択したLLMを使って最終的な3クラスラベルを生成します。
      4. 検索ログ、プロンプト、モデル出力を保存します。
  6. 辞書ガイドによるトリアージの実施
    1. 構成キーワード語彙
      1. 人工知能用と環境保護用2つのキーワードレキシコンをまとめます(補足ファイル3)。
      2. 求人情報や権威ある文書から候補者の用語を抽出します。
      3. 指定されたトークン化ライブラリを使ってテキストをトークン化します。
      4. 用語の頻度およびドメインのコントラスト統計を計算し、曖昧または過度に一般的な用語を削除します。
      5. 辞書を最終化し、アーカイブしてください。
    2. 路線の掲示
      1. 正確な文字列とトークンレベルのマッチングを適用してください。
      2. 人工知能キーワードのみを含む投稿は人工知能部門へ誘導してください。
      3. 環境保護部門へのルート投稿は環境保護のキーワードのみを含みます。
      4. マッチなしの投稿は「その他」とラベル付けしてください。
      5. デュアルマッチ投稿を回収強化ステップにルーティングしてください。
      6. ルーティング統計と辞書のバージョンを記録します。
    3. 曖昧な投稿を分類する
      1. 固定されたtop-κおよびτ設定で関連するチャンクを取得します。
      2. 取得した証拠をプロンプトテンプレートに注入します。
      3. 最終ラベルを作成し、インスタンスごとのログを保存します。

2. 結果の再分類

  1. シソーラスの構築
    1. 人工知能用語の類語辞典を作成する(補足ファイル4)。機械学習、自然言語処理、コンピュータビジョン、ロボティクスおよび関連分野の用語を含めてください。各カテゴリーごとに詳細な用語を整理してください。
    2. 環境保護用語の別個の類語辞典を構築しましょう。環境科学の基礎、環境モニタリングと分析、汚染の制御と管理、環境計画と管理を含めます。
    3. すべての人工知能および環境保護用語をトークン化辞書に追加してください。テキストセグメンテーションの際に、これらの用語が完全な単位として認識されていることを確認してください。
  2. 前処理テキスト
    1. 正則表現を使って句読点や特殊文字を削除します。テキストとスペースだけを残してください。
    2. 連続したテキストを個別のトークンに分割するためにワードセグメンテーションを行います。
  3. 特徴照合と分類の実施
    1. 入力テキストを前処理して、分割されたトークンのリストを取得します。
    2. 予備分類に基づいて適切なシソーラスを選択してください。
    3. 分割トークンをトラバースし、正規化後にシソーラス用語と正確にマッチングします。下縮ケースを適用し、マッチング前にあらかじめ定義されたバリアントを統一してください。
    4. 一致した各語とその対応するシソーラスの枝を記録します。
      注意:複数の分岐が一致した場合、固定ルール(例:最も高いマッチ数の後に最も早い出現順)で同点を決着します。
    5. マッチングされた用語リストと、下流集約用の最終ドメイン内タグをエクスポートします。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

結果

Table of Materialsに掲載されている4つのオープンソースの命令調整型大規模言語モデルのバックボーン(Backbone A–D)は、3クラスの求人分類タスクでベンチマークされています。評価は、全体的な精度、精度、リコール率、F1を含むすべてのバックボーンで同じテストプロトコル、前処理手順、指標を用いて行われます。迅速な精緻化と検索拡張生成(RAG)がバックボーンBに適用され、同じ条件下で再評価されます。パフォーマンス結果は表2にまとめられています。

固定された3クラスプロトコルと共有評価インターフェースの下で、Backbone Bに基づくプロンプト最適化検索拡張構成は、ベンチマークテストセットで98.47%の精度と98.47%のマクロF1を達成し、 表2 の最も強力なバックボーンのみベースラインを4.47ポイント上回る精度を達成しています。マクロ平均精度とリコール率はそれぞれ98.50%と98.47%...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

ディスカッション

これまでの研究では、履歴書や職務記述書の分類を含む採用テキストの分類に古典的な機械学習やニューラルモデルが適用されてきましたが、これらの手法は大量のラベル付きデータを必要とし、ドメイン用語の変化により劣化することがあります。AliらはNLPおよび機械学習手法を用いた履歴書分類システムを提案しました。JaliliらはBiLSTMに基づく履歴書分類19を探求しました。Palらは古典的な機械学習手法を用いて履歴書の分類を評価しました。Nasserらは、単語埋め込みを用いた畳み込みニューラルネットワークを用いて履歴書21を分類しました。RamrajらはLinkedInのプロフィール説明を活用したリアルタイム履歴書分類システムを開発しました。最近の研究では、リクルート関連のテキスト処理のための大規模言語モデルも探求されており、下流分類を支援する...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

開示事項

著者たちは何も明かすことはありません。

謝辞

著者たちは、データキュレーションや原稿準備中の技術サポートや建設的なフィードバックをいただいた同僚に感謝しています。このプロジェクトは外部からの資金提供を受けていません。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

材料

この記事で使用された材料の一覧
名前会社カタログ番号コメント
all-MiniLM-L6-v2(文エンコーダー)ハギングフェイス(文変換器)https://huggingface.co/sentence-transformers/all-MiniLM-L6-v2ベクトル化に用いられる文埋め込みモデル。
バートベース中国語(ベースラインエンコーダ)ハグフェイス(google-bert)https://huggingface.co/google-bert/bert-base-chineseベースラインエンコーダー(中国製BERTベース)。
DDR5メモリ、16GBワークステーション/ノートパソコンの設定該当なしシステムメモリ(16GB DDR5);ベンダー/部品番号は指定されていません。
DeepSeek-R1-Distill-Qwen-7B(バックボーンA)ハグフェイス(deepsee-ai)https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-7BLLMのバックボーンA。
GLM-4-9B-チャット(バックボーンC)ハギングフェイス(zai-org)https://huggingface.co/zai-org/glm-4-9b-chat-hfLLMのバックボーンC。
Intel Core i5-13500HX CPUインテルhttps://www.intel.com/content/www/us/en/products/sku/232156/intel-core-i513500hx-processor-24m-cache-up-to-4-70-ghz/specifications.html実験に使われるワークステーションCPUです。
InternLM2.5-7B-Chat(バックボーンD)ハギングフェイス(内部)https://huggingface.co/internlm/internlm2_5-7b-chatLLMの骨格D。
jieba(中国語のトークン化)PyPI(jieba)https://pypi.org/project/jieba/中国語のトークン化/セグメンテーションライブラリ;バージョンは特定されていません。
キーワードライブラリ(AI&環境)(補足ファイル3)この研究補足ファイル3レキシコンガイド付きプリフィルタリングに使われるドメインキーワードレキシコン;各ランごとに正確に使われるバージョンをアーカイブ。
LanceDB(ベクターデータベース)LanceDB該当なし埋め込みの保存・検索用ベクターデータベース;バージョンは特定されていません。
NVIDIA GeForce RTX 4060 ノートパソコン GPU(8 GB VRAM)NVIDIAhttps://www.nvidia.com/en-us/geforce/laptops/40-series/推論や実験に使われるGPUです。
オンライン採用プラットフォームの求人情報(2014年–2023)主要な中国の採用プラットフォーム(公開ウェブデータ)該当なし著者自身が収集・キュレーションした公開求人広告;清掃後の投稿数は~693万件。
pip (Python package installer)PyPA該当なし依存関係をインストールし、pip freezeを使って環境スナップショットをエクスポートするためのパッケージインストーラーです。
プロンプトテンプレートの進化(サプリメントファイル2)この研究補足ファイル2連続したプロンプトのバリエーションと、評価に使われる最終プロンプト。
Python 3.10Pythonソフトウェア財団該当なしランタイムインタプリタ(Python 3.10);パッチのバージョンは指定されていません。
Qwen2.5-7B-インストラクト(バックボーンB)ハギングフェイス(クウェン)https://huggingface.co/Qwen/Qwen2.5-7B-InstructLLMの骨格B。
RAGナレッジベースのフィールド記述/索引(補足ファイル1)この研究補足ファイル1検索拡張推論で使用される知識ベースのスキーマ/フィールドノートおよび文書索引。
シソーラス(AI&環境)(補足ファイル4)この研究補足ファイル4再分類および分析で使用される用語辞書;各ランごとに正確に使われるバージョンをアーカイブ。
Windows 11(64ビット)マイクロソフト該当なしオペレーティングシステム(Windows 11、64ビット);ビルドやバージョンは指定されていません。

参考文献

  1. Alekseeva, L., et al. The demand for AI skills in the labor market. Labour Economics. 71, 102002(2021).
  2. Ministry updates official dictionary of careers. , Ministry of Human Resources and Social Security of the People’s Republic of China. Available at: https://english.www.gov.cn/statecouncil/ministries/202209/30/content_WS633647bbc6d0a757729e0bb6.html (2022).
  3. BERT: Pre-training of deep bidirectional transformers for language understanding. Devlin, J., Chang, M. W., Lee, K., Toutanova, K. 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (NAACL-HLT), Minneapolis, MN, USA, , 4171-4186 (2019).
  4. Large language models in the workplace: A case study on prompt engineering for job type classification. Clavié, B., et al. 28th International Conference on Applications of Natural Language to Information Systems (NLDB 2023); , Derby, UK, , Springer. Natural Language Processing and Information Systems. Lecture Notes in Computer Science 3-17 (2023).
  5. Li, N., Kang, B., De Bie, T. LLM4Jobs: Unsupervised occupation extraction and standardization leveraging large language models. arXiv. , Available at: https://arxiv.org/abs/2309.09708 (2023).
  6. Deep learning-based computational job market analysis: A survey on skill extraction and classification from job postings. Senger, E., Zhang, M., van der Goot, R., Plank, B. 1st Workshop on Natural Language Processing for Human Resources (NLP4HR 2024), St. Julian’s, Malta, , 1-15 (2024).
  7. Enhancing job posting classification with multilingual embeddings and large language models. Kavas, H., Serra-Vidal, M., Wanner, L. 10th Italian Conference on Computational Linguistics (CLiC-it 2024), Pisa, Italy, , 440-450 (2024).
  8. JobBERT: Understanding job titles through skills. Decorte, J. J., Van Hautte, J., Demeester, T., Develder, C. International Workshop on Fair, Effective and Sustainable Talent Management using Data Science (FEAST 2021) at ECML-PKDD 2021, , (2021).
  9. Carotene: A job title classification system for the online recruitment domain. Javed, F., et al. IEEE First International Conference on Big Data Computing Service and Applications (BigDataService), , 286-293 (2015).
  10. Javed, F., McNair, M., Jacob, F., Zhao, M. Towards a job title classification system. arXiv. , Available at: https://arxiv.org/abs/1606.00917 (2016).
  11. Lewis, P., et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Presented at: Advances in Neural Information Processing Systems. NeurIPS. , (2020).
  12. The power of scale for parameter-efficient prompt tuning. Lester, B., Al-Rfou, R., Constant, N. 2021 Conference on Empirical Methods in Natural Language Processing (EMNLP), , 3045-3059 (2021).
  13. Han, X., et al. PTR: Prompt tuning with rules for text classification. AI Open. 3, 182-192 (2022).
  14. Brown, T. B., et al. Language models are few-shot learners. Presented at: Advances in Neural Information Processing Systems. NeurIPS. , (2020).
  15. Liu, P., et al. predict: A systematic survey of prompting methods in natural language processing. ACM Comput Surv. 55 (9), 195:1-195:35 (2023).
  16. Blue, A. The outlook for 2023 is uncertain, but here’s what we know about the global labour market. World Economic Forum (Agenda). , Available at: https://www.weforum.org/agenda/2023/01/the-outlook-for-2023-is-uncertain-but-here-s-what-we-know-about-the-global-labour-market-davos23 (2023).
  17. ESCOXLM-R: Multilingual taxonomy-driven pre-training for the job market domain. Zhang, M., van der Goot, R., Plank, B. 61st Annual Meeting of the Association for Computational Linguistics (ACL 2023), Toronto, Canada, , 11871-11890 (2023).
  18. Ali, I., et al. Resume classification system using natural language processing and machine learning techniques. Mehran Univ Res J Eng Technol. 41 (1), 65-79 (2022).
  19. BiLSTM for resume classification. Jalili, A., Tabrizchi, H., Razmara, J., Mosavi, A. 22nd IEEE International Symposium on Applied Machine Intelligence and Informatics (SAMI 2024), Stará Lesná, Slovakia, , (2024).
  20. Pal, R., Shaikh, S., Satpute, S., Bhagwat, S. Resume classification using various machine learning algorithms. ITM Web Conf. 44, 03011(2022).
  21. Convolutional neural network with word embedding based approach for resume classification. Nasser, S., Sreejith, C., Irshad, M. 2018 International Conference on Emerging Trends and Innovations in Engineering and Technological Research (ICETIETR 2018), , Ernakulam (Cochin), India. (2018).
  22. Real-time resume classification system using LinkedIn profile descriptions. Ramraj, S., Sivakumar, V. 2020 International Conference on Computational Intelligence for Smart Power Systems and Sustainable Energy (CISPSSE 2020), Keonjhar, Odisha, India, , (2020).
  23. Heakl, A., et al. ResumeAtlas: Revisiting resume classification with large-scale datasets and large language models. arXiv. , Available at: https://arxiv.org/abs/2406.18125 (2024).
  24. Skondras, P., Zervas, P., Tzimas, G. Generating synthetic resume data with large language models for enhanced job description classification. Future Internet. 15 (11), 363(2023).
  25. Chen, Z. Ethics and discrimination in artificial intelligence-enabled recruitment practices. Humanit Soc Sci Commun. 10, 567(2023).
  26. Retrieval-augmented few-shot text classification. Yu, G., et al. Findings of the Association for Computational Linguistics: EMNLP 2023, Singapore, , 6721-6735 (2023).
  27. Izacard, G., et al. Atlas: Few-shot learning with retrieval augmented language models. J Mach Learn Res. 24 (251), 1-43 (2023).
  28. KW-ATTN: Knowledge infused attention for accurate and interpretable text classification. Jang, H., et al. Deep Learning Inside Out (DeeLIO): 2nd Workshop on Knowledge Extraction and Integration for Deep Learning Architectures, , 96-107 (2021).

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

再版と許可

タグ

K