需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

基于词典引导的路由与检索增强型大语言模型的两阶段招募文本标注

136 次观看

DOI:

10.3791/70153

2026年5月8日

本文内容

摘要

本文描述了一种两阶段工作流程,用于将招聘文本分类为人工智能、环境保护或其他类别。基于词典引导的初步筛选可处理常规案例,而通过检索增强和提示优化的大型语言模型推理则用于解决模糊案例,从而实现大规模的准确标注以及后续劳动力市场的描述性汇总。

摘要

招聘文本具有异质性,且领域术语随时间不断演变,导致在人工标注能力有限的情况下难以进行大规模标注。本方案提供了一种可重复的两阶段工作流程,用于将中文招聘文本分类为人工智能、环境保护或其他类别。第一阶段采用词典引导的分诊方法,使用两个经过整理的领域关键词列表进行分类。仅匹配其中一个领域词典的招聘文本直接赋予对应标签;未匹配任一词典的文本标记为“其他”;同时匹配两个词典的文本则进入第二阶段。第二阶段应用基于检索增强的大语言模型推理。知识库由12份权威领域文献汇编而成,转换为文本后以约1000字符为单位进行分块,块间重叠20个字符,使用all-MiniLM-L6-v2模型嵌入,并在LanceDB中建立索引。对于每一条不确定的招聘文本,通过余弦相似度k近邻检索返回候选文本块,并根据最小相似度阈值(τ)进行过滤,最多选取四个文本块注入固定的提示模板中,该模板明确定义了标签边界并限制模型输出单一标签。构建了一个包含3000条招聘文本的基准测试集,每类各1000条,经人工验证后,标注者间一致率达到95.0%,Cohen's kappa(κ)约为0.93。评估部分比较了多种开源大语言模型在仅使用提示和结合检索增强两种设置下的表现,实验采用Qwen2.5-7B-Instruct模型。检索增强配置的准确率达到98.47%,并支持对约693万条招聘文本进行语料库规模的标注,用于后续描述性汇总分析。

引言

近年来,随着人工智能和环境技术的快速发展,大量新兴职业不断涌现。一方面,全球就业市场涌现出许多基于人工智能和可持续发展的全新岗位。基于职位空缺的证据表明,与人工智能相关的技能需求迅速增长,这增加了招聘文本的异质性,并推动了可重复、可扩展的领域标签标注协议的发展1。另一方面,中国最新修订的《职业分类大典》在就业信息化以及绿色低碳领域也呈现出显著的职业增长趋势:与2015年版相比,2022年版《大典》净增158个新职业,其中标注的数字职业共计97个,占职业总数的6%;绿色职业共计134个,占职业总数的8%2

随着这些新兴职业的不断涌现,企业发布的招聘信息在内容和形式上正变得愈发复杂。职位描述通常涉及专业知识和多样化的技能要求,既包含职位名称、技能列表等结构化字段,也包含大量非结构化的自由文本描述,导致招聘信息的结构日益复杂。这类复杂的职位描述通常既包含明确定义的结构化要素(例如职位名称、所需技能列表),也包含大量非结构化的自由文本描述。例如,一份人工智能工程师的招聘广告可能在技能列表中列出“熟练掌握深度学习框架”和“具有优化反向传播算法的经验”等技术术语,同时还会附带详细的职责叙述;类似地,环境工程师的职位招聘可能提及特定的法规标准和认证要求。这种结构化与非结构化内容的结合,使得职位描述高度专业化且错综复杂。

选择人工智能与环境保护领域,以评估在招聘分类中存在真实跨领域歧义情况下的协议性能。在实际应用中,主流职业资源(如 O*NET 和招聘网站)仅提供粗粒度标签,导致仅依靠关键词难以区分跨行业的职位。环境保护代表一个广泛领域,与多个科学学科存在重叠;而人工智能则是计算领域中一个更细粒度的分支,常与通用软件职位相混淆。这一组合涵盖了术语差异显著、具备权威参考文献的宽泛与精细跨领域场景,可用于构建知识库,同时可通过更换领域语料库而不改变核心工作流程的方式,适应其他行业应用。

近年来,职位招聘信息分类的研究显著增加。研究人员越来越多地利用大规模预训练模型来提升职业分类的准确性。2019年BERT的提出标志着一项突破,实现了深层次的上下文语言理解,并显著提升了文本分类的性能3。例如,Clavié等人(2023)探索了使用经过指令微调的大语言模型(LLM)进行职位分类,发现通过适当的提示工程,该LLM在毕业生职位分类任务上的表现优于当前最先进的监督模型4。类似地,Li等人(2023)提出了一种LLM4Jobs方法,将大语言模型的摘要生成能力与职业代码匹配相结合,通过首先提取职位描述的摘要,再将其与标准职业代码对齐,显著提高了对长篇职位描述的分类准确率5。此外,Senger等人(2024)的一项综述总结了深度学习在人力资源领域的最新进展,指出技能提取和职位分类已成为计算型劳动力市场分析中的核心任务6。Kavas等人(2024)通过结合多语言文本嵌入与基于LLM的分类方法,进一步提升了职位信息分类的准确性,取得了显著的性能提升7。在传统方法方面,早期系统从基于关键词的启发式方法(类别集合相对粗糙)发展到由分类体系驱动的框架,例如Carotene系统,该系统基于超过4000个职位名称构建了层级结构8,9。Javed等人(2016)提出了一种早期的职位名称分类框架,标志着系统性职业分类的重要初步进展10。然而,这些监督学习方法需要大量标注数据,且难以适应新兴职位的快速出现,因为职业分类体系的更新往往滞后于劳动力市场的变化4

为解决这些局限性,近期研究转向了融合外部知识的混合策略;例如,Lewis 等人(2020)提出了检索增强生成(Retrieval-Augmented Generation, RAG)框架,该框架将预训练语言模型与检索器相结合,以注入相关领域知识,在知识密集型任务上实现了更高的准确性以及更符合事实的输出11。Lester 等人证明,随着模型规模的增大,提示调优(prompt tuning)带来的性能提升更为显著12,这进一步支持了使用强大基础大语言模型(LLM)的必要性。例如,Han 等人表明,采用规则引导的提示语可使模型聚焦于关键特征,从而提升文本分类的准确性13。此外,Brown 等人(2020)著名地展示了大型语言模型仅凭少量示例或指令即可执行新任务,突显了基于提示的少样本学习(few-shot learning)的强大能力14。值得注意的是,近期一项关于基于提示的自然语言处理(NLP)技术的综述强调,提示语的措辞可显著引导模型输出15。与此同时,劳动力市场的宏观变化与不确定性也强化了对可扩展且易于更新的标注协议的需求,以便在新职业不断涌现时及时刷新标注体系16。在就业市场 NLP 领域,研究者还探索了基于分类体系的多语言预训练方法,以更好地使模型表征与职业结构及跨语言差异保持一致17。总体而言,这些研究为本方法提供了依据,并展示了结合检索机制与提示优化的大语言模型在更有效识别和适应新兴职业语境方面的潜力。

本研究中,领域知识仅针对人工智能和环境保护两个领域进行整理,因为语料库的构建、验证与维护是跨领域招聘分类的主要运营成本。因此,“其他”类别作为超出范围的拒绝类别,而非实质性的行业分类。报告中较高的准确率应谨慎解读,因为三标签设置简化了标注过程,与更细粒度的分类体系相比,可能导致性能被高估。该方案旨在为目标领域提供一种轻量级、基于知识的标注层级,而非取代全面的多类别分类系统。扩展标签集可能会因类别间重叠增加、歧义性增强以及对语料覆盖范围要求更严格而降低准确率。在实际应用中,可通过扩展领域语料库并整合内部知识库,逐步优化拒绝类别集合。因此,三标签配置展示的是一种可复用的范式,而非详尽的职业分类体系。

该数据集结合了结构化和非结构化来源。结构化语料库由作者从2014年至2023年间中国主要在线招聘平台上的上市公司公开发布的招聘信息收集并整理而成。经过去重和基本清洗后,结构化语料库包含约693万条招聘启事。相关主管部门发布的非结构化领域文档被用于定义领域知识和标注标准。基于这些来源,人工构建了三个基准子集,分别包含1,000条关于人工智能、环境保护以及无关领域的招聘启事,并经过验证以用于评估。

采用准确率、精确率、召回率和 F1 分数(精确率和召回率的调和平均数,F1 = 2PR/(P+R))对模型主干网络进行评估,以选择最适合检索增强工作流的基础模型。将权威领域文献汇编成知识库,用于支持检索增强生成(RAG)。检索出相关段落并注入固定的提示模板,以辅助分类任务。系统性地测试多种提示变体,并应用提示词优化策略,以确定最终配置。对检索到的证据进行相关性筛选,以减少噪声干扰,支持准确且高效的推理过程。

为了实现大规模分类,该工作流程采用分阶段的流水线:基于词典引导的分诊可高效处理常规案例,而结合检索增强与提示优化的大型语言模型推理则用于处理模糊的帖子,在可扩展性与准确性之间实现平衡(图1)。

访问受限。请登录或开始试用以查看此内容。

方案

本研究未涉及人类参与者或动物实验对象,因此无需伦理审批和知情同意。实验流程在64位Windows操作系统上的Python 3.10环境中执行,所用硬件、工具和软件详见材料表

1. 建模

  1. 构建数据与知识库
    1. 从中国主要在线招聘平台收集并整理上市公司发布的职位招聘信息(2014–2023年),构建内部结构化语料库,确保符合平台政策及相关法规要求。对每条招聘信息,记录其职位名称、职位描述、公司名称、发布日期以及唯一标识符(例如发布ID或URL,如可获取)。去除重复及无效条目,并验证最终语料库包含约693万条记录。
    2. 收集与人工智能和环境保护相关的权威领域文档,包括补充文件1中列出的文档。确保这些文档定义了能力要求、资格标准、任务范围或受监管的流程。
  2. 构建基准数据集
    1. 人工筛选结构化数据集,选取明确代表人工智能、环境保护以及无关领域的职位信息,并包含边界案例以提高覆盖范围。
    2. 利用职位名称、职位描述和雇主信息对每条招聘信息进行标注。
    3. 构建三个基准子集,分别包含1,000条关于人工智能、环境保护和其他领域的招聘信息。
    4. 进行双重标注:指派一名标注员进行标注,另一名标注员依据书面指南进行验证。
    5. 通过讨论并由第三名标注员裁决解决标注分歧。
    6. 计算标注者间一致性,记录百分比一致性和κ值。
    7. 保留经验证的基准数据集用于模型评估。
  3. 评估模型主干网络
    1. 使用相同的提示模板和基准数据集,评估经过指令微调的大语言模型主干网络。
    2. 在主干网络比较过程中禁用检索增强功能。
    3. 保持各模型间的提示词表述、解码参数和标签映射完全一致。
    4. 计算整体准确率、每个类别的精确率、召回率和F1分数。
    5. 选择性能最佳的主干网络,并将其配置记录于表1中。
    6. 表2中报告完整的评估结果。
  4. 执行领域自适应编码器训练
    1. 仅使用补充文件1中列出的权威文档构建无标签语料库。
    2. 从所有文档中提取纯文本内容。
    3. 将文本分割为最大长度为512、步长为492的序列。
    4. 丢弃少于50个字符的文本片段。
    5. 确保基准数据集中的招聘信息不包含在该语料库中。
    6. 初始化中文BERT base检查点。
    7. 以0.15的掩码概率进行掩码语言模型预训练。
    8. 使用AdamW优化器,学习率为5e-5,批量大小为2,训练3个周期。
    9. 保存预训练检查点。
    10. 使用学习率2e-5、批量大小2和最大序列长度512,对编码器进行三分类微调。
    11. 固定随机种子为42,并采用分层的训练-验证集划分方法。
    12. 报告准确率、宏平均精确率、宏平均召回率、宏平均F1分数、每个类别的指标以及混淆矩阵。
    13. 保存评估输出结果以供验证。
  5. 构建检索增强分类流程
    1. 构建知识库
      1. 汇总12个权威领域文档。
      2. 删除重复或过时的版本。
      3. 将文档转换为纯文本格式。
      4. 记录文档元数据,包括发布机构和出版年份。
      5. 将文本切分为约1,000个字符的文本块,相邻文本块间保留20个字符的重叠部分。
      6. 记录文本块总数及块长度分布。
        注:若知识库扩展,需重新验证检索性能。
    2. 编码并存储嵌入向量
      1. 使用嵌入模型对所有文本块进行编码,并将嵌入向量存入向量数据库。
      2. 归档文本块标识符及来源元数据。
      3. 验证存储的向量数量与文本块数量一致。
    3. 执行检索
      1. 使用相同的嵌入模型对每条职位信息进行嵌入。
      2. 基于余弦相似度执行k近邻搜索。
      3. 应用相似度阈值τ以过滤低相关性匹配项。
      4. 在保留子集上完成调优后,固定τ和top-κ值。
      5. 记录检索到的文本块标识符及相似度得分。
    4. 执行检索增强推理
      1. 将最多四个检索到的文本块插入提示模板的证据部分(补充文件2)。
      2. 将职位信息文本与检索到的证据进行拼接。
      3. 使用选定的大语言模型生成最终的三分类标签。
      4. 保存检索日志、提示词和模型输出。
  6. 执行词典引导的分类分流
    1. 构建关键词词典
      1. 构建两个关键词词典:一个用于人工智能,另一个用于环境保护(补充文件3)。
      2. 从职位信息和权威文档中提取候选术语。
      3. 使用指定的分词库对文本进行分词处理。
      4. 计算术语频率和领域对比统计量,剔除模糊或过于通用的术语。
      5. 确定最终词典并归档。
    2. 分流职位信息
      1. 应用精确字符串匹配和词元级匹配。
      2. 将仅包含人工智能关键词的职位信息路由至人工智能分支。
      3. 将仅包含环境保护关键词的职位信息路由至环境保护分支。
      4. 将无匹配关键词的职位信息标注为“其他”。
      5. 将同时匹配两类关键词的职位信息路由至检索增强步骤。
      6. 记录分流统计信息和词典版本。
    3. 分类模糊职位信息
      1. 在固定的top-κ和τ设置下检索相关文本块。
      2. 将检索到的证据注入提示模板。
      3. 生成最终标签,并保存每个实例的日志。

2. 结果的重新分类

  1. 构建词库
    1. 构建人工智能术语词库(补充文件 4)。包含机器学习、自然语言处理、计算机视觉、机器人学及相关子领域的术语。在每个类别下列出详细术语。
    2. 单独构建环境保护术语词库。包括环境科学基础、环境监测与分析、污染控制与管理、环境规划与管理等类别。
    3. 将所有人工智能和环境保护术语添加到分词词典中,确保这些术语在文本切分过程中被识别为完整单元。
  2. 文本预处理
    1. 使用正则表达式去除标点符号和特殊字符,仅保留文本和空格。
    2. 进行分词处理,将连续文本切分为独立的词元。
  3. 执行特征匹配与分类
    1. 对输入文本进行预处理,得到分词后的词元列表。
    2. 根据初步分类选择相应的词库。
    3. 遍历分词后的词元,在归一化后与词库术语进行精确匹配。匹配前需统一转换为小写,并合并预定义的变体形式。
    4. 记录每个匹配到的术语及其对应的词库分支。
      ​注意:若多个分支匹配,应采用固定规则解决冲突(例如,优先选择匹配次数最多者,其次按首次出现顺序)。
    5. 导出匹配术语列表及最终的领域内标签,用于后续汇总分析。

访问受限。请登录或开始试用以查看此内容。

结果

四个开源的、经过指令调优的大型语言模型骨干网络(骨干网络 A–D)如下所列 材料表 在三类职位发布分类任务上对模型进行了基准测试。所有主干模型均采用相同的测试协议、预处理流程和评估指标进行评估,包括总体准确率、精确率、召回率和 F1 分数。随后在主干模型 B 上应用提示优化和检索增强生成(RAG),并在相同条件下重新评估。性能结果汇总如下 表 2.

在固定的三分类协议和共享评估界面下,基于主干网络B的提示优化检索增强配置在基准测试集上达到了98.47%的准确率和98.47%的宏平均F1分数,准确率比表2中最强的仅主干网络基线高出4.47个百分点。宏平均精确率和召回率分别提升至98.50%和98.47%,表明性能提升并非集中在单一类别上。因此选择该配置进行后续的语料库规模运行,所有下游聚合均使用相同的固定提示模板和检索设置完成。

表2 还报告了两种参考配置,以阐明该流程的操作模式。仅使用提示(p...

访问受限。请登录或开始试用以查看此内容。

讨论

先前的研究已将经典机器学习和神经网络模型应用于招聘文本分类,包括简历和职位描述的分类,但这些方法通常需要大量标注数据,且在领域术语发生变化时性能可能下降。Ali 等人提出了一种基于自然语言处理(NLP)和机器学习技术的简历分类系统18。Jalili 等人探索了基于 BiLSTM 的简历分类方法19。Pal 等人评估了使用经典机器学习方法进行简历分类的效果20。Nasser 等人应用带有词嵌入的卷积神经网络对简历进行分类21。Ramraj 等人开发了一种利用 LinkedIn 个人资料描述的实时简历分类系统22。最近的研究还探讨了使用大语言模型处理与招聘相关的文本,包括生成合成数据以支持下游分类任务23,24。预训练语言模型(如 BERT)通过从大规模语料库中迁移学习来提升文本分类性能<...

访问受限。请登录或开始试用以查看此内容。

披露

作者无任何利益冲突需要披露。

致谢

作者感谢同事在数据整理和稿件准备过程中提供的技术支持和建设性意见。本项目未获得外部资金资助。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
all-MiniLM-L6-v2(句子编码器)Hugging Face(sentence-transformers)https://huggingface.co/sentence-transformers/all-MiniLM-L6-v2用于向量化处理的句子嵌入模型。
bert-base-chinese(基线编码器)Hugging Face(google-bert)https://huggingface.co/google-bert/bert-base-chinese基线编码器(中文 BERT 基础模型)。
DDR5内存,16 GB工作站/笔记本电脑配置N/A系统内存(16 GB DDR5);供应商/部件编号未指定。
DeepSeek-R1-Distill-Qwen-7B(骨干 A)Hugging Face(deepseek-ai)https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-7BLLM backbone A
GLM-4-9B-Chat(骨干 C)Hugging Face (zai-org)https://huggingface.co/zai-org/glm-4-9b-chat-hf大语言模型骨干 C.
Intel Core i5-13500HX CPU英特尔https://www.intel.com/content/www/us/en/products/sku/232156/intel-core-i513500hx-processor-24m-cache-up-to-4-70-ghz/specifications.html用于实验的工作站 CPU
InternLM2.5-7B-Chat(骨干 D)Hugging Face(internlm)https://huggingface.co/internlm/internlm2_5-7b-chatLLM backbone D.
结巴(中文分词器)PyPI(jieba)https://pypi.org/project/jieba/中文分词库;版本未指定。
关键词库(AI && 环境)(补充文件 3)本研究补充文件 3用于词典引导预过滤的领域关键词词典;存档每次运行所使用的精确版本。
LanceDB(向量数据库)LanceDBN/A用于存储和搜索嵌入向量的向量数据库;版本未指定。
NVIDIA GeForce RTX 4060 笔记本电脑 GPU(8 GB VRAM)NVIDIAhttps://www.nvidia.com/zh-cn/geforce/laptops/40-series/用于推理/实验的 GPU。
在线招聘平台职位发布(2014–2023)中国主要招聘平台(公共网页数据)N/A作者收集并整理的公开发布的招聘信息;清理后约693万条招聘信息。
pip(Python 包安装工具)PyPAN/A使用 pip freeze 安装依赖项并导出环境快照的包安装程序。
提示模板进化(补充文件 2)本研究补充文件 2连续的提示词变体及用于评估的最终提示词
Python 3.10Python 软件基金会N/A运行时解释器(Python 3.10);未指定补丁版本。
Qwen2.5-7B-Instruct(骨干 B)Hugging Face(Qwen)https://huggingface.co/Qwen/Qwen2.5-7B-Instruct大语言模型骨干 B
RAG 知识库字段描述/索引(补充文件 1)本研究补充文件 1用于检索增强推理的知识库的模式/现场记录和文档索引
Thesaurus(AI) && 环境)(补充文件 4)本研究补充文件 4用于重新分类和分析的术语词典;存档每次运行所使用的精确版本。
Windows 11(64 位)微软N/A操作系统(Windows 11,64 位);未指定版本/构建号。

参考文献

  1. Alekseeva, L., et al. The demand for AI skills in the labor market. Labour Economics. 71, 102002(2021).
  2. Ministry updates official dictionary of careers. , Ministry of Human Resources and Social Security of the People’s Republic of China. Available at: https://english.www.gov.cn/statecouncil/ministries/202209/30/content_WS633647bbc6d0a757729e0bb6.html (2022).
  3. BERT: Pre-training of deep bidirectional transformers for language understanding. Devlin, J., Chang, M. W., Lee, K., Toutanova, K. 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (NAACL-HLT), Minneapolis, MN, USA, , 4171-4186 (2019).
  4. Large language models in the workplace: A case study on prompt engineering for job type classification. Clavié, B., et al. 28th International Conference on Applications of Natural Language to Information Systems (NLDB 2023); , Derby, UK, , Springer. Natural Language Processing and Information Systems. Lecture Notes in Computer Science 3-17 (2023).
  5. Li, N., Kang, B., De Bie, T. LLM4Jobs: Unsupervised occupation extraction and standardization leveraging large language models. arXiv. , Available at: https://arxiv.org/abs/2309.09708 (2023).
  6. Deep learning-based computational job market analysis: A survey on skill extraction and classification from job postings. Senger, E., Zhang, M., van der Goot, R., Plank, B. 1st Workshop on Natural Language Processing for Human Resources (NLP4HR 2024), St. Julian’s, Malta, , 1-15 (2024).
  7. Enhancing job posting classification with multilingual embeddings and large language models. Kavas, H., Serra-Vidal, M., Wanner, L. 10th Italian Conference on Computational Linguistics (CLiC-it 2024), Pisa, Italy, , 440-450 (2024).
  8. JobBERT: Understanding job titles through skills. Decorte, J. J., Van Hautte, J., Demeester, T., Develder, C. International Workshop on Fair, Effective and Sustainable Talent Management using Data Science (FEAST 2021) at ECML-PKDD 2021, , (2021).
  9. Carotene: A job title classification system for the online recruitment domain. Javed, F., et al. IEEE First International Conference on Big Data Computing Service and Applications (BigDataService), , 286-293 (2015).
  10. Javed, F., McNair, M., Jacob, F., Zhao, M. Towards a job title classification system. arXiv. , Available at: https://arxiv.org/abs/1606.00917 (2016).
  11. Lewis, P., et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Presented at: Advances in Neural Information Processing Systems. NeurIPS. , (2020).
  12. The power of scale for parameter-efficient prompt tuning. Lester, B., Al-Rfou, R., Constant, N. 2021 Conference on Empirical Methods in Natural Language Processing (EMNLP), , 3045-3059 (2021).
  13. Han, X., et al. PTR: Prompt tuning with rules for text classification. AI Open. 3, 182-192 (2022).
  14. Brown, T. B., et al. Language models are few-shot learners. Presented at: Advances in Neural Information Processing Systems. NeurIPS. , (2020).
  15. Liu, P., et al. predict: A systematic survey of prompting methods in natural language processing. ACM Comput Surv. 55 (9), 195:1-195:35 (2023).
  16. Blue, A. The outlook for 2023 is uncertain, but here’s what we know about the global labour market. World Economic Forum (Agenda). , Available at: https://www.weforum.org/agenda/2023/01/the-outlook-for-2023-is-uncertain-but-here-s-what-we-know-about-the-global-labour-market-davos23 (2023).
  17. ESCOXLM-R: Multilingual taxonomy-driven pre-training for the job market domain. Zhang, M., van der Goot, R., Plank, B. 61st Annual Meeting of the Association for Computational Linguistics (ACL 2023), Toronto, Canada, , 11871-11890 (2023).
  18. Ali, I., et al. Resume classification system using natural language processing and machine learning techniques. Mehran Univ Res J Eng Technol. 41 (1), 65-79 (2022).
  19. BiLSTM for resume classification. Jalili, A., Tabrizchi, H., Razmara, J., Mosavi, A. 22nd IEEE International Symposium on Applied Machine Intelligence and Informatics (SAMI 2024), Stará Lesná, Slovakia, , (2024).
  20. Pal, R., Shaikh, S., Satpute, S., Bhagwat, S. Resume classification using various machine learning algorithms. ITM Web Conf. 44, 03011(2022).
  21. Convolutional neural network with word embedding based approach for resume classification. Nasser, S., Sreejith, C., Irshad, M. 2018 International Conference on Emerging Trends and Innovations in Engineering and Technological Research (ICETIETR 2018), , Ernakulam (Cochin), India. (2018).
  22. Real-time resume classification system using LinkedIn profile descriptions. Ramraj, S., Sivakumar, V. 2020 International Conference on Computational Intelligence for Smart Power Systems and Sustainable Energy (CISPSSE 2020), Keonjhar, Odisha, India, , (2020).
  23. Heakl, A., et al. ResumeAtlas: Revisiting resume classification with large-scale datasets and large language models. arXiv. , Available at: https://arxiv.org/abs/2406.18125 (2024).
  24. Skondras, P., Zervas, P., Tzimas, G. Generating synthetic resume data with large language models for enhanced job description classification. Future Internet. 15 (11), 363(2023).
  25. Chen, Z. Ethics and discrimination in artificial intelligence-enabled recruitment practices. Humanit Soc Sci Commun. 10, 567(2023).
  26. Retrieval-augmented few-shot text classification. Yu, G., et al. Findings of the Association for Computational Linguistics: EMNLP 2023, Singapore, , 6721-6735 (2023).
  27. Izacard, G., et al. Atlas: Few-shot learning with retrieval augmented language models. J Mach Learn Res. 24 (251), 1-43 (2023).
  28. KW-ATTN: Knowledge infused attention for accurate and interpretable text classification. Jang, H., et al. Deep Learning Inside Out (DeeLIO): 2nd Workshop on Knowledge Extraction and Integration for Deep Learning Architectures, , 96-107 (2021).

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

K