本文描述了一种两阶段工作流程,用于将招聘文本分类为人工智能、环境保护或其他类别。基于词典引导的初步筛选可处理常规案例,而通过检索增强和提示优化的大型语言模型推理则用于解决模糊案例,从而实现大规模的准确标注以及后续劳动力市场的描述性汇总。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
本文描述了一种两阶段工作流程,用于将招聘文本分类为人工智能、环境保护或其他类别。基于词典引导的初步筛选可处理常规案例,而通过检索增强和提示优化的大型语言模型推理则用于解决模糊案例,从而实现大规模的准确标注以及后续劳动力市场的描述性汇总。
招聘文本具有异质性,且领域术语随时间不断演变,导致在人工标注能力有限的情况下难以进行大规模标注。本方案提供了一种可重复的两阶段工作流程,用于将中文招聘文本分类为人工智能、环境保护或其他类别。第一阶段采用词典引导的分诊方法,使用两个经过整理的领域关键词列表进行分类。仅匹配其中一个领域词典的招聘文本直接赋予对应标签;未匹配任一词典的文本标记为“其他”;同时匹配两个词典的文本则进入第二阶段。第二阶段应用基于检索增强的大语言模型推理。知识库由12份权威领域文献汇编而成,转换为文本后以约1000字符为单位进行分块,块间重叠20个字符,使用all-MiniLM-L6-v2模型嵌入,并在LanceDB中建立索引。对于每一条不确定的招聘文本,通过余弦相似度k近邻检索返回候选文本块,并根据最小相似度阈值(τ)进行过滤,最多选取四个文本块注入固定的提示模板中,该模板明确定义了标签边界并限制模型输出单一标签。构建了一个包含3000条招聘文本的基准测试集,每类各1000条,经人工验证后,标注者间一致率达到95.0%,Cohen's kappa(κ)约为0.93。评估部分比较了多种开源大语言模型在仅使用提示和结合检索增强两种设置下的表现,实验采用Qwen2.5-7B-Instruct模型。检索增强配置的准确率达到98.47%,并支持对约693万条招聘文本进行语料库规模的标注,用于后续描述性汇总分析。
近年来,随着人工智能和环境技术的快速发展,大量新兴职业不断涌现。一方面,全球就业市场涌现出许多基于人工智能和可持续发展的全新岗位。基于职位空缺的证据表明,与人工智能相关的技能需求迅速增长,这增加了招聘文本的异质性,并推动了可重复、可扩展的领域标签标注协议的发展1。另一方面,中国最新修订的《职业分类大典》在就业信息化以及绿色低碳领域也呈现出显著的职业增长趋势:与2015年版相比,2022年版《大典》净增158个新职业,其中标注的数字职业共计97个,占职业总数的6%;绿色职业共计134个,占职业总数的8%2。
随着这些新兴职业的不断涌现,企业发布的招聘信息在内容和形式上正变得愈发复杂。职位描述通常涉及专业知识和多样化的技能要求,既包含职位名称、技能列表等结构化字段,也包含大量非结构化的自由文本描述,导致招聘信息的结构日益复杂。这类复杂的职位描述通常既包含明确定义的结构化要素(例如职位名称、所需技能列表),也包含大量非结构化的自由文本描述。例如,一份人工智能工程师的招聘广告可能在技能列表中列出“熟练掌握深度学习框架”和“具有优化反向传播算法的经验”等技术术语,同时还会附带详细的职责叙述;类似地,环境工程师的职位招聘可能提及特定的法规标准和认证要求。这种结构化与非结构化内容的结合,使得职位描述高度专业化且错综复杂。
选择人工智能与环境保护领域,以评估在招聘分类中存在真实跨领域歧义情况下的协议性能。在实际应用中,主流职业资源(如 O*NET 和招聘网站)仅提供粗粒度标签,导致仅依靠关键词难以区分跨行业的职位。环境保护代表一个广泛领域,与多个科学学科存在重叠;而人工智能则是计算领域中一个更细粒度的分支,常与通用软件职位相混淆。这一组合涵盖了术语差异显著、具备权威参考文献的宽泛与精细跨领域场景,可用于构建知识库,同时可通过更换领域语料库而不改变核心工作流程的方式,适应其他行业应用。
近年来,职位招聘信息分类的研究显著增加。研究人员越来越多地利用大规模预训练模型来提升职业分类的准确性。2019年BERT的提出标志着一项突破,实现了深层次的上下文语言理解,并显著提升了文本分类的性能3。例如,Clavié等人(2023)探索了使用经过指令微调的大语言模型(LLM)进行职位分类,发现通过适当的提示工程,该LLM在毕业生职位分类任务上的表现优于当前最先进的监督模型4。类似地,Li等人(2023)提出了一种LLM4Jobs方法,将大语言模型的摘要生成能力与职业代码匹配相结合,通过首先提取职位描述的摘要,再将其与标准职业代码对齐,显著提高了对长篇职位描述的分类准确率5。此外,Senger等人(2024)的一项综述总结了深度学习在人力资源领域的最新进展,指出技能提取和职位分类已成为计算型劳动力市场分析中的核心任务6。Kavas等人(2024)通过结合多语言文本嵌入与基于LLM的分类方法,进一步提升了职位信息分类的准确性,取得了显著的性能提升7。在传统方法方面,早期系统从基于关键词的启发式方法(类别集合相对粗糙)发展到由分类体系驱动的框架,例如Carotene系统,该系统基于超过4000个职位名称构建了层级结构8,9。Javed等人(2016)提出了一种早期的职位名称分类框架,标志着系统性职业分类的重要初步进展10。然而,这些监督学习方法需要大量标注数据,且难以适应新兴职位的快速出现,因为职业分类体系的更新往往滞后于劳动力市场的变化4。
为解决这些局限性,近期研究转向了融合外部知识的混合策略;例如,Lewis 等人(2020)提出了检索增强生成(Retrieval-Augmented Generation, RAG)框架,该框架将预训练语言模型与检索器相结合,以注入相关领域知识,在知识密集型任务上实现了更高的准确性以及更符合事实的输出11。Lester 等人证明,随着模型规模的增大,提示调优(prompt tuning)带来的性能提升更为显著12,这进一步支持了使用强大基础大语言模型(LLM)的必要性。例如,Han 等人表明,采用规则引导的提示语可使模型聚焦于关键特征,从而提升文本分类的准确性13。此外,Brown 等人(2020)著名地展示了大型语言模型仅凭少量示例或指令即可执行新任务,突显了基于提示的少样本学习(few-shot learning)的强大能力14。值得注意的是,近期一项关于基于提示的自然语言处理(NLP)技术的综述强调,提示语的措辞可显著引导模型输出15。与此同时,劳动力市场的宏观变化与不确定性也强化了对可扩展且易于更新的标注协议的需求,以便在新职业不断涌现时及时刷新标注体系16。在就业市场 NLP 领域,研究者还探索了基于分类体系的多语言预训练方法,以更好地使模型表征与职业结构及跨语言差异保持一致17。总体而言,这些研究为本方法提供了依据,并展示了结合检索机制与提示优化的大语言模型在更有效识别和适应新兴职业语境方面的潜力。
本研究中,领域知识仅针对人工智能和环境保护两个领域进行整理,因为语料库的构建、验证与维护是跨领域招聘分类的主要运营成本。因此,“其他”类别作为超出范围的拒绝类别,而非实质性的行业分类。报告中较高的准确率应谨慎解读,因为三标签设置简化了标注过程,与更细粒度的分类体系相比,可能导致性能被高估。该方案旨在为目标领域提供一种轻量级、基于知识的标注层级,而非取代全面的多类别分类系统。扩展标签集可能会因类别间重叠增加、歧义性增强以及对语料覆盖范围要求更严格而降低准确率。在实际应用中,可通过扩展领域语料库并整合内部知识库,逐步优化拒绝类别集合。因此,三标签配置展示的是一种可复用的范式,而非详尽的职业分类体系。
该数据集结合了结构化和非结构化来源。结构化语料库由作者从2014年至2023年间中国主要在线招聘平台上的上市公司公开发布的招聘信息收集并整理而成。经过去重和基本清洗后,结构化语料库包含约693万条招聘启事。相关主管部门发布的非结构化领域文档被用于定义领域知识和标注标准。基于这些来源,人工构建了三个基准子集,分别包含1,000条关于人工智能、环境保护以及无关领域的招聘启事,并经过验证以用于评估。
采用准确率、精确率、召回率和 F1 分数(精确率和召回率的调和平均数,F1 = 2PR/(P+R))对模型主干网络进行评估,以选择最适合检索增强工作流的基础模型。将权威领域文献汇编成知识库,用于支持检索增强生成(RAG)。检索出相关段落并注入固定的提示模板,以辅助分类任务。系统性地测试多种提示变体,并应用提示词优化策略,以确定最终配置。对检索到的证据进行相关性筛选,以减少噪声干扰,支持准确且高效的推理过程。
为了实现大规模分类,该工作流程采用分阶段的流水线:基于词典引导的分诊可高效处理常规案例,而结合检索增强与提示优化的大型语言模型推理则用于处理模糊的帖子,在可扩展性与准确性之间实现平衡(图1)。
访问受限。请登录或开始试用以查看此内容。
本研究未涉及人类参与者或动物实验对象,因此无需伦理审批和知情同意。实验流程在64位Windows操作系统上的Python 3.10环境中执行,所用硬件、工具和软件详见材料表。
1. 建模
2. 结果的重新分类
访问受限。请登录或开始试用以查看此内容。
四个开源的、经过指令调优的大型语言模型骨干网络(骨干网络 A–D)如下所列 材料表 在三类职位发布分类任务上对模型进行了基准测试。所有主干模型均采用相同的测试协议、预处理流程和评估指标进行评估,包括总体准确率、精确率、召回率和 F1 分数。随后在主干模型 B 上应用提示优化和检索增强生成(RAG),并在相同条件下重新评估。性能结果汇总如下 表 2.
在固定的三分类协议和共享评估界面下,基于主干网络B的提示优化检索增强配置在基准测试集上达到了98.47%的准确率和98.47%的宏平均F1分数,准确率比表2中最强的仅主干网络基线高出4.47个百分点。宏平均精确率和召回率分别提升至98.50%和98.47%,表明性能提升并非集中在单一类别上。因此选择该配置进行后续的语料库规模运行,所有下游聚合均使用相同的固定提示模板和检索设置完成。
表2 还报告了两种参考配置,以阐明该流程的操作模式。仅使用提示(p...
访问受限。请登录或开始试用以查看此内容。
先前的研究已将经典机器学习和神经网络模型应用于招聘文本分类,包括简历和职位描述的分类,但这些方法通常需要大量标注数据,且在领域术语发生变化时性能可能下降。Ali 等人提出了一种基于自然语言处理(NLP)和机器学习技术的简历分类系统18。Jalili 等人探索了基于 BiLSTM 的简历分类方法19。Pal 等人评估了使用经典机器学习方法进行简历分类的效果20。Nasser 等人应用带有词嵌入的卷积神经网络对简历进行分类21。Ramraj 等人开发了一种利用 LinkedIn 个人资料描述的实时简历分类系统22。最近的研究还探讨了使用大语言模型处理与招聘相关的文本,包括生成合成数据以支持下游分类任务23,24。预训练语言模型(如 BERT)通过从大规模语料库中迁移学习来提升文本分类性能<...
访问受限。请登录或开始试用以查看此内容。
作者无任何利益冲突需要披露。
作者感谢同事在数据整理和稿件准备过程中提供的技术支持和建设性意见。本项目未获得外部资金资助。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| all-MiniLM-L6-v2(句子编码器) | Hugging Face(sentence-transformers) | https://huggingface.co/sentence-transformers/all-MiniLM-L6-v2 | 用于向量化处理的句子嵌入模型。 |
| bert-base-chinese(基线编码器) | Hugging Face(google-bert) | https://huggingface.co/google-bert/bert-base-chinese | 基线编码器(中文 BERT 基础模型)。 |
| DDR5内存,16 GB | 工作站/笔记本电脑配置 | N/A | 系统内存(16 GB DDR5);供应商/部件编号未指定。 |
| DeepSeek-R1-Distill-Qwen-7B(骨干 A) | Hugging Face(deepseek-ai) | https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-7B | LLM backbone A |
| GLM-4-9B-Chat(骨干 C) | Hugging Face (zai-org) | https://huggingface.co/zai-org/glm-4-9b-chat-hf | 大语言模型骨干 C. |
| Intel Core i5-13500HX CPU | 英特尔 | https://www.intel.com/content/www/us/en/products/sku/232156/intel-core-i513500hx-processor-24m-cache-up-to-4-70-ghz/specifications.html | 用于实验的工作站 CPU |
| InternLM2.5-7B-Chat(骨干 D) | Hugging Face(internlm) | https://huggingface.co/internlm/internlm2_5-7b-chat | LLM backbone D. |
| 结巴(中文分词器) | PyPI(jieba) | https://pypi.org/project/jieba/ | 中文分词库;版本未指定。 |
| 关键词库(AI && 环境)(补充文件 3) | 本研究 | 补充文件 3 | 用于词典引导预过滤的领域关键词词典;存档每次运行所使用的精确版本。 |
| LanceDB(向量数据库) | LanceDB | N/A | 用于存储和搜索嵌入向量的向量数据库;版本未指定。 |
| NVIDIA GeForce RTX 4060 笔记本电脑 GPU(8 GB VRAM) | NVIDIA | https://www.nvidia.com/zh-cn/geforce/laptops/40-series/ | 用于推理/实验的 GPU。 |
| 在线招聘平台职位发布(2014–2023) | 中国主要招聘平台(公共网页数据) | N/A | 作者收集并整理的公开发布的招聘信息;清理后约693万条招聘信息。 |
| pip(Python 包安装工具) | PyPA | N/A | 使用 pip freeze 安装依赖项并导出环境快照的包安装程序。 |
| 提示模板进化(补充文件 2) | 本研究 | 补充文件 2 | 连续的提示词变体及用于评估的最终提示词 |
| Python 3.10 | Python 软件基金会 | N/A | 运行时解释器(Python 3.10);未指定补丁版本。 |
| Qwen2.5-7B-Instruct(骨干 B) | Hugging Face(Qwen) | https://huggingface.co/Qwen/Qwen2.5-7B-Instruct | 大语言模型骨干 B |
| RAG 知识库字段描述/索引(补充文件 1) | 本研究 | 补充文件 1 | 用于检索增强推理的知识库的模式/现场记录和文档索引 |
| Thesaurus(AI) && 环境)(补充文件 4) | 本研究 | 补充文件 4 | 用于重新分类和分析的术语词典;存档每次运行所使用的精确版本。 |
| Windows 11(64 位) | 微软 | N/A | 操作系统(Windows 11,64 位);未指定版本/构建号。 |
访问受限。请登录或开始试用以查看此内容。