採用テキストを人工知能、環境保護、その他に分類するための2段階のワークフローが説明されています。レキシコンガイド型トリアージは日常的なケースを割り当て、検索拡張・プロンプト最適化された大規模言語モデル推論は曖昧なケースを解決し、正確な大規模ラベル付けや下流の記述的労働市場要約を可能にします。
このコンテンツを表示するには、JoVEへの購読が必要です。 または、無料トライアルをお申し込みください。
採用テキストを人工知能、環境保護、その他に分類するための2段階のワークフローが説明されています。レキシコンガイド型トリアージは日常的なケースを割り当て、検索拡張・プロンプト最適化された大規模言語モデル推論は曖昧なケースを解決し、正確な大規模ラベル付けや下流の記述的労働市場要約を可能にします。
リクルートテキストは異種であり、ドメイン用語も時間とともに進化するため、手書き注釈能力が限られて大規模なラベリングが困難です。このプロトコルは、中国の採用文書を人工知能、環境保護、その他に分類するための再現可能な二段階ワークフローを提供します。第1段階では、2つの厳選ドメインキーワードリストを用いて辞書ガイドによるトリアージを行います。1つのドメイン辞典のみに一致する投稿は直接ラベル付けされます。どちらの語彙にも一致しない投稿は「その他」とラベル付けされ、デュアルマッチの投稿はステージ2にルーティングされます。第2段階では、検索拡張型大規模言語モデル推論を適用します。12の権威あるドメイン文書からまとめられたナレッジベースはテキストに変換され、約1,000文字のチャンクに分割され、20文字の重複が加わり、all-MiniLM-L6-v2で埋め込み、LanceDBでインデックス化されます。不確実な投稿ごとに、余弦類似度k-最近傍検索は最小類似度閾値(τ)でフィルタリングされた候補チャンクを返し、最大4つのチャンクがラベル境界を定義し出力を単一のラベルに制約する固定プロンプトテンプレートに注入されます。3,000件の投稿を手作業で検証し、クラスごとに1,000件の投稿が行われ、95.0%の注釈者間合意率と約0.93のコーエンズカッパ(κ)を達成しています。評価は、Qwen2.5-7B-Instructを用いたプロンプトのみの設定と検索拡張設定で複数のオープンソース大規模言語モデルを比較します。検索拡張構成は98.47%の精度を達成し、約693万件の投稿のコーパススケールのラベル付けを下流の記述集約に用いています。
近年、AIや環境技術の急速な発展により、多くの新興キャリアが登場しています。一方で、世界の求人市場はAIやサステナビリティに基づく多くの新規職で溢れています。欠員に基づくエビデンスは、AI関連スキル需要の急速な拡大を記録しており、それが採用テキストの異質性を高め、再現可能でスケーラブルなドメインタグ付けプロトコルの導入を促しています。一方、中国の最新の職業分類辞典(OCD)改訂では、雇用情報化やグリーン・低炭素分野でも同様に堅調な職業増加が見られ、2022年版の改訂では2015年版と比べて158の新規職種が純増し、デジタル職種は合計97種となりました。 または134の緑色職業とともにラベル付けされた職業数の6%、つまり全体の職業数の8%です2.
これらの新しい職業が次々と登場する中で、求人情報の内容や形式はより複雑になっています。求人記述書はしばしば専門分野の知識や多様なスキル要件を含み、職名やスキルリストなどの構造化されたフィールドだけでなく、多数の非構造化のフリーテキスト説明も含まれているため、求人情報の構造はますます複雑になっています。このような複雑な求人情報には、明確に定義された構造化要素(例:職種名、必要スキルのリスト)と、広範な非構造化のフリーテキスト説明が含まれています。例えば、AIエンジニアの求人広告には「ディープラーニングフレームワークの習熟」や「バックプロパゲーションアルゴリズムの最適化経験」といった専門用語をスキルリストに記載し、詳細な責任内容も含めて記載することがあります。同様に、環境エンジニアの求人では特定の規制基準や認証を参照することがあります。構造化と非構造化のコンテンツの組み合わせにより、非常に専門的で複雑な職務記述書が作成されます。
人工知能と環境保護が、採用分類における現実的なクロスドメイン曖昧さのもとでプロトコルを評価するために選定されます。実際には、O*NETや求人掲示板などの主流の職業資源は粗いタグを割り当てており、キーワードだけでは業界横断的な役割を区別しにくくしています。環境保護は複数の科学分野と重なる広範な領域を表し、人工知能はコンピューティングのより細かい分野を反映し、しばしば一般的なソフトウェアの役割と混同されています。この組み合わせは、広範なおよび狭いドメインの両領域を異なる用語と適切な権威ある文書でナレッジベース構築に適用し、コアワークフローを変更することなくドメインコーパスを置き換えることで他業界への適応を可能にします。
近年、求人情報の分類に関する研究が急増しています。研究者たちは職業分類の改善のために大規模で事前学習済みモデルをますます活用しています。2019年のBERT導入は、深い文脈に基づく言語理解を可能にし、テキスト分類性能を大幅に向上させる画期的なものでした。例えば、Claviéら(2023)は、命令チューニングされた大規模言語モデル(LLM)をジョブ分類に用いることを探り、適切なプロンプトエンジニアリングによりLLMが最新鋭の教師ありモデルを上回る大学院のジョブ分類タスク4で優れた性能を発揮できることを発見しました。同様に、Liら(2023)は、大規模言語モデルの要約と職業コードマッチングを組み合わせたLLM4Jobsアプローチを提案し、まず要約を抽出し、標準的な職務コード5に整合させることで、長大な職務記述書の分類精度を大幅に向上させました。さらに、Sengerらによる2024年の調査では、人事分野のディープラーニングの最近の進展が記録されており、スキル抽出と職務分類が計算的雇用市場分析の中核課題となっていることが指摘されています。Kavasら(2024)は、多言語テキスト埋め込みとLLMベースの分類を組み合わせることで求人情報分類を強化し、顕著な精度向上を達成しました。従来のシステムでは、比較的粗いカテゴリセットを用いたキーワードベースのヒューリスティックから、4,000以上の職種名に階層を用いるCaroteneのような分類主導のフレームワークまで多岐にわたりました。Javedら(2016)は、初期の職種分類フレームワークを提示し、体系的な職業分類への最初の一歩を示しました。しかし、これらの監督付きアプローチは広範なラベル付きデータを必要とし、分類分類法は労働市場よりも進化が遅いことが多いため、新しい職種の急速な出現に適応するのに苦労します。
こうした制約に対処するため、最近の研究では外部知識を取り入れたハイブリッド戦略が検討されています。例えば、Lewisら(2020)は、事前学習済み言語モデルとリトリーバーを組み合わせて関連ドメイン知識を注入し、知識集約型タスクにおいてより高い精度とより事実に近い出力を実現するRetrieval-Augmented Generation(RAG)フレームワークを導入しました。Lesterらは、モデルサイズが12倍増加するほど、プロンプトチューニングがより大きな性能向上をもたらすことを示し、強力な基礎LLMの使用を強化しました。例えば、Hanらはルールガイド付きプロンプトの使用により、モデルを主要な特徴に集中させることでテキスト分類の精度を高めることができることを示しました13。さらに、ブラウンら(2020)は、大規模な言語モデルがわずかな例や命令から新しいタスクを遂行できることを有名に示し、プロンプト駆動の少ショット学習の力を強調しました14。特に、プロンプトベースのNLP技術に関する最近の調査では、プロンプトの表現がモデルの出力を大きく左右することが強調されています15。同時に、マクロレベルの変化や労働市場の不確実性は、新たな役割の出現に合わせて刷新可能なスケーラブルで更新に適したラベリングプロトコルの必要性を強調しています。就職市場NLPの分野では、分類学に基づく多言語前訓練も、職業構造や言語間変動性との表現をより良く整合させるために探求されています17。これらの研究は、検索とプロンプト最適化を備えた大規模言語モデルを用いることで、新たな職業文脈をより効果的に認識し適応する可能性を示し、アプローチを整えています。
本研究では、ドメイン知識は人工知能および環境保護のみを対象としており、コーパスの構築、検証、保守がクロスドメインリクルート分類の主な運用コストを占めています。したがって、その他は実質的な業界クラスというよりも、範囲外の拒否カテゴリーとして機能します。報告された高い正確性は慎重に解釈されるべきであり、3ラベル設定はラベリングを簡素化し、より細かい分類法と比べて性能を過大評価する可能性がある。このプロトコルは、対象ドメインに対する軽量で知識に基づくラベリング層として意図されており、包括的なマルチカテゴリ分類システムの代替ではありません。ラベルセットの拡大は、重複や曖昧さの増加、コーパスカバレッジ要件の厳しさにより精度が低下する可能性があります。実際には、ドメインコーパスを拡張し内部の知識ベースを組み込むことで、リジェクションセットを段階的に洗練させることが可能です。したがって、3ラベル構成は、網羅的な職業分類ではなく、再利用可能なパラダイムを示しています。
このデータセットは構造化ソースと非構造化ソースを組み合わせています。構造化されたコーパスは、2014年から2023年にかけて中国の主要なオンライン採用プラットフォームに上場企業が公開した求人広告から著者自身が収集・キュレーションしました。重複除去と基本的なクレンジングを経て、構造化されたコーパスには約693万件の投稿が含まれています。関連権威が公開した非構造化ドメイン文書を用いてドメイン知識やラベリング基準を定義しました。これらのソースから、人工知能、環境保護、その他関連分野の各1,000件の投稿を含む3つのベンチマークサブセットが手動で構築され、評価のために検証されました。
モデルのバックボーンは、精度、精度、リコール率、およびF1(精度とリコール率の調和平均F1 = 2PR/(P+R))を用いて評価され、検索拡張ワークフローの最適な基盤を選定します。権威あるドメイン文書は、検索拡張生成(RAG)用にナレッジベースにまとめられます。関連する文章は取得され、分類を支援するために固定されたプロンプトテンプレートに注入されます。プロンプトのバリエーションは体系的にテストされ、最終的な構成を決定するためにキューワード最適化戦略が適用されます。取得した証拠はノイズを最小限に抑え、正確かつ効率的な推論を支援するために関連性を絞り込みます。
大規模な分類を可能にするため、ワークフローは段階的なパイプラインを採用しています。レキシコンガイド付きトリアージはルーチンケースを効率的に解決し、検索拡張・プロンプト最適化型LLM推論は曖昧な投稿を処理し、スケーラビリティと精度のバランスを取っています(図1)。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
この研究は人間参加者や動物被験者を含みませんでした。したがって、倫理的な承認やインフォームド・コンセントは必要ありませんでした。ワークフローは、 Table of Materialsに記載されたハードウェア、ツール、ソフトウェアを用いて、64ビットWindowsオペレーティングシステムのPython 3.10環境で実行されました。
1. モデル活動
2. 結果の再分類
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
Table of Materialsに掲載されている4つのオープンソースの命令調整型大規模言語モデルのバックボーン(Backbone A–D)は、3クラスの求人分類タスクでベンチマークされています。評価は、全体的な精度、精度、リコール率、F1を含むすべてのバックボーンで同じテストプロトコル、前処理手順、指標を用いて行われます。迅速な精緻化と検索拡張生成(RAG)がバックボーンBに適用され、同じ条件下で再評価されます。パフォーマンス結果は表2にまとめられています。
固定された3クラスプロトコルと共有評価インターフェースの下で、Backbone Bに基づくプロンプト最適化検索拡張構成は、ベンチマークテストセットで98.47%の精度と98.47%のマクロF1を達成し、 表2 の最も強力なバックボーンのみベースラインを4.47ポイント上回る精度を達成しています。マクロ平均精度とリコール率はそれぞれ98.50%と98.47%...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
これまでの研究では、履歴書や職務記述書の分類を含む採用テキストの分類に古典的な機械学習やニューラルモデルが適用されてきましたが、これらの手法は大量のラベル付きデータを必要とし、ドメイン用語の変化により劣化することがあります。AliらはNLPおよび機械学習手法を用いた履歴書分類システムを提案しました。JaliliらはBiLSTMに基づく履歴書分類19を探求しました。Palらは古典的な機械学習手法を用いて履歴書の分類を評価しました。Nasserらは、単語埋め込みを用いた畳み込みニューラルネットワークを用いて履歴書21を分類しました。RamrajらはLinkedInのプロフィール説明を活用したリアルタイム履歴書分類システムを開発しました。最近の研究では、リクルート関連のテキスト処理のための大規模言語モデルも探求されており、下流分類を支援する...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
著者たちは何も明かすことはありません。
著者たちは、データキュレーションや原稿準備中の技術サポートや建設的なフィードバックをいただいた同僚に感謝しています。このプロジェクトは外部からの資金提供を受けていません。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| all-MiniLM-L6-v2(文エンコーダー) | ハギングフェイス(文変換器) | https://huggingface.co/sentence-transformers/all-MiniLM-L6-v2 | ベクトル化に用いられる文埋め込みモデル。 |
| バートベース中国語(ベースラインエンコーダ) | ハグフェイス(google-bert) | https://huggingface.co/google-bert/bert-base-chinese | ベースラインエンコーダー(中国製BERTベース)。 |
| DDR5メモリ、16GB | ワークステーション/ノートパソコンの設定 | 該当なし | システムメモリ(16GB DDR5);ベンダー/部品番号は指定されていません。 |
| DeepSeek-R1-Distill-Qwen-7B(バックボーンA) | ハグフェイス(deepsee-ai) | https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-7B | LLMのバックボーンA。 |
| GLM-4-9B-チャット(バックボーンC) | ハギングフェイス(zai-org) | https://huggingface.co/zai-org/glm-4-9b-chat-hf | LLMのバックボーンC。 |
| Intel Core i5-13500HX CPU | インテル | https://www.intel.com/content/www/us/en/products/sku/232156/intel-core-i513500hx-processor-24m-cache-up-to-4-70-ghz/specifications.html | 実験に使われるワークステーションCPUです。 |
| InternLM2.5-7B-Chat(バックボーンD) | ハギングフェイス(内部) | https://huggingface.co/internlm/internlm2_5-7b-chat | LLMの骨格D。 |
| jieba(中国語のトークン化) | PyPI(jieba) | https://pypi.org/project/jieba/ | 中国語のトークン化/セグメンテーションライブラリ;バージョンは特定されていません。 |
| キーワードライブラリ(AI&環境)(補足ファイル3) | この研究 | 補足ファイル3 | レキシコンガイド付きプリフィルタリングに使われるドメインキーワードレキシコン;各ランごとに正確に使われるバージョンをアーカイブ。 |
| LanceDB(ベクターデータベース) | LanceDB | 該当なし | 埋め込みの保存・検索用ベクターデータベース;バージョンは特定されていません。 |
| NVIDIA GeForce RTX 4060 ノートパソコン GPU(8 GB VRAM) | NVIDIA | https://www.nvidia.com/en-us/geforce/laptops/40-series/ | 推論や実験に使われるGPUです。 |
| オンライン採用プラットフォームの求人情報(2014年–2023) | 主要な中国の採用プラットフォーム(公開ウェブデータ) | 該当なし | 著者自身が収集・キュレーションした公開求人広告;清掃後の投稿数は~693万件。 |
| pip (Python package installer) | PyPA | 該当なし | 依存関係をインストールし、pip freezeを使って環境スナップショットをエクスポートするためのパッケージインストーラーです。 |
| プロンプトテンプレートの進化(サプリメントファイル2) | この研究 | 補足ファイル2 | 連続したプロンプトのバリエーションと、評価に使われる最終プロンプト。 |
| Python 3.10 | Pythonソフトウェア財団 | 該当なし | ランタイムインタプリタ(Python 3.10);パッチのバージョンは指定されていません。 |
| Qwen2.5-7B-インストラクト(バックボーンB) | ハギングフェイス(クウェン) | https://huggingface.co/Qwen/Qwen2.5-7B-Instruct | LLMの骨格B。 |
| RAGナレッジベースのフィールド記述/索引(補足ファイル1) | この研究 | 補足ファイル1 | 検索拡張推論で使用される知識ベースのスキーマ/フィールドノートおよび文書索引。 |
| シソーラス(AI&環境)(補足ファイル4) | この研究 | 補足ファイル4 | 再分類および分析で使用される用語辞書;各ランごとに正確に使われるバージョンをアーカイブ。 |
| Windows 11(64ビット) | マイクロソフト | 該当なし | オペレーティングシステム(Windows 11、64ビット);ビルドやバージョンは指定されていません。 |
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。