Для просмотра этого контента требуется подписка на JoVE. Войдите или начните свой бесплатный пробный период.

Методическая статья

Двухступенчатая маркировка текста для рекрутинга с использованием маршрутизации с лексиконом и расширенные с поиском больших языковых моделей

136 просмотров

DOI:

10.3791/70153

8 мая 2026 г.

В этой статье

Краткое содержание

Описывается двухэтапный рабочий процесс для классификации учебников по направлению по искусственному интеллекту, охране окружающей среды или другим. Сортировка, управляемая лексиконом, присваивает рутинные случаи, тогда как вывод с помощью поиска и оптимизированной для подсказок вывод по моделям больших языков разрешает неоднозначные случаи, обеспечивая точное масштабное маркировку и последующем описательное резюме рынка труда.

Аннотация

Рекрутинговые тексты неоднородны, а терминология предметной области эволюционирует со временем, что затрудняет масштабное маркировку при ограниченной возможности ручного аннотирования. Этот протокол обеспечивает воспроизводимый двухэтапный рабочий процесс для классификации китайских учебников по набору в области искусственного интеллекта, охраны окружающей среды или других. Первый этап проводит сортировку с помощью лексиконного руководства, используя два кураторских списка ключевых слов домена. Публикации, соответствующие только одному доменному лексикону, напрямую маркированы. Объявления, не соответствующие ни одному из лексиконов, обозначены как «Другие», а публикации с двойным совпадением направляются на второй этап. Второй этап применяет вывод по моделям большого языка с помощью поиска. База знаний, скомпилированная из 12 авторитетных документов домена, преобразуется в текст, делится примерно на 1000-символьные блоки с перекрытием 20 символов, встраивается с использованием полностью MiniLM-L6-v2 и индексируется в LanceDB. Для каждой неопределённой публикации поиск по косинусоидальности k-ближайшего соседа возвращает кандидатные блоки, отфильтрованные по минимальному порогу сходства (τ), и до четырёх чанков вводятся в фиксированный шаблон запроса, который определяет границы меток и ограничивает выход одной меткой. Эталонный набор из 3000 публикаций проверяется вручную, с 1000 публикаций на класс, и достигает межаннотаторского согласия в размере 95,0 % и каппы Коэна (κ) примерно 0,93. Evaluation сравнивает несколько открытых крупных языковых моделей в настройках только запросов и в настройках с дополненным поиском с помощью Qwen2.5-7B-Instruct. Конфигурация, дополненная поиском, достигает точности 98,47 % и поддерживает маркировку корпуса примерно 6,93 миллиона публикаций для нижней описательной агрегации.

Введение

В последние годы, благодаря стремительному развитию ИИ и экологических технологий, появилось множество новых профессий. С одной стороны, мировой рынок труда переполнен множеством совершенно новых вакансий, основанных на ИИ и устойчивом развитии. Доказательства, основанные на вакансиях, свидетельствуют о быстром росте спроса на навыки, связанные с ИИ, что увеличивает гетерогенность текстов для найма и мотивирует воспроизводимый, масштабируемый протокол меткидоменов 1. С другой стороны, последняя редакция Словаря классификации профессий (ОКР) в Китае показала столь же устойчивый рост новых профессий в сферах информатизации занятости, а также экологичного и низкоуглеродного сектора, с чистым увеличением на 158 новых профессий в редакции 2022 года по сравнению с редакцией 2015 года, всего 97 цифровых профессий. или 6% от общего числа помеченных занятий, вместе с 134 зелёными занятиями, или 8% от общего числазанятий 2.

По мере появления новых профессий содержание и форма вакансий в компаниях становятся всё более сложными, поскольку описания вакансий часто включают знания по предмету и разнообразные требования к навыкам, включая как структурированные области, такие как названия должностей и списки навыков, так и большое количество неструктурированных свободных текстовых описаний, что приводит к всё более сложным структурам вакансий. Такие сложные вакансии обычно содержат чётко очерченные структурированные элементы (например, названия должностей, списки необходимых навыков) наряду с обширными неструктурированными свободными текстовыми описаниями. Например, в объявлении о вакансии инженера по ИИ могут быть указаны технические термины, такие как «владение фреймворком глубокого обучения» и «опыт оптимизации алгоритмов обратного распространения» в списке навыков, а также подробный перечень обязанностей; Аналогично, вакансия экологического инженера может ссылаться на конкретные нормативные стандарты и сертификаты. Такое сочетание структурированного и неструктурированного контента приводит к высокоспециализированным и запутанным описаниям должностей.

Искусственный интеллект и охрана окружающей среды выбираются для оценки протокола при реалистичной межотраслевой неоднозначности в классификации набора. На практике основные профессиональные ресурсы, такие как O*NET и доски вакансий, присваивают грубые теги, что затрудняет различие между отраслевыми ролями только по ключевым словам. Охрана окружающей среды представляет собой широкую область, пересекающуюся с несколькими научными областями, тогда как искусственный интеллект отражает более тонкий сегмент вычислительной техники, часто смешиваемый с общими ролями программного обеспечения. Такое сочетание охватывает как широкие, так и узкие междоменные среды с уникальной терминологией и подходящими авторитетными документами для построения базы знаний, при этом позволяя адаптироваться к другим отраслям, заменяя доменный корпус без изменения основного рабочего процесса.

В последние годы наблюдается всплеск исследований по классификации вакансий. Исследователи всё чаще используют крупные предварительно обученные модели для улучшения классификации профессий. Введение BERT в 2019 году стало прорывом, позволившим глубоко контекстуальное понимание языка и значительно улучшив качество классификациитекста 3. Например, Clavié и др. (2023) исследовали использование модели большого языка, настроенного на инструкцию (LLM) для классификации профессий, выяснив, что правильная инженерия запросов позволяет LLM превосходить современные контролируемые модели взадаче классифицирования должностей выпускников 4. Аналогично, Ли и др. (2023) предложили подход LLM4Jobs, который сочетает суммирование крупноязычных моделей с сопоставлением кода профессии, значительно повышая точность классификации длинных описаний должностей, сначала извлекая сводки, а затем выравнивая их со стандартными кодамидолжностей 5. Кроме того, опрос 2024 года, проведённый Сенгером и соавторами, каталогизирует последние достижения в области глубокого обучения для HR, отмечая, что извлечение навыков и классификация рабочих мест стали ключевыми задачами в анализе вычислительного рынкатруда 6. Kavas и др. (2024) улучшили классификацию вакансий, объединив многоязычные текстовые вложения с категоризацией на основе LLM, что привело к заметному ростуточности 7. В традиционном плане более ранние системы варьировались от эвристик на основе ключевых слов с относительно грубыми наборами категорий до таксономически ориентированных фреймворков, таких как Carotene, которые использовали иерархию более чем 4000 должностныхназваний 8,9. Джавед и др. (2016) представили раннюю систему классификации должностей, став одним из первых шагов к систематической классификациипрофессий 10. Однако такие контролируемые подходы требуют обширных маркированных данных и испытывают трудности с адаптацией к быстрому появлению новых должностей, поскольку классификационные таксономии часто развиваются медленнее, чем рыноктруда 4.

Для решения этих ограничений последние исследования переключились на гибридные стратегии, включающие внешние знания; например, Льюис и др. (2020) представили фреймворк Retrieval-Augmented Generation (RAG), который сочетает предварительно обученные языковые модели с ретривером для внедрения релевантных предметных знаний, достигая высшей точности и более достоверных результатов по задачам, требующимзнаний 11. Лестер и др. показали, что prompt tuning даёт больший прирост производительности по мере увеличения размера моделина 12, что подтверждает использование сильного базового LLM. Например, Хан и др. показали, что использование подсказок, ориентированных на правила, может повысить точность классификации текста, сосредоточив модель на ключевыхпризнаках 13. Кроме того, Браун и др. (2020) прославились, что большая языковая модель может выполнять новые задачи всего на основе нескольких примеров или инструкций, подчёркивая силу обучения на подсказкахс несколькими выстрелами 14. Примечательно, что недавний обзор методов NLP, основанного на подсказках, подчёркивает, что формулировка подсказок может существенно влиять на результаты модели15. В то же время макроуровневые сдвиги и неопределённость на рынке труда усиливают необходимость масштабируемых и удобных для обновления протоколов маркировки, которые можно обновлять по мере появления новыхролей 16. В области НЛП на рынке труда также исследована многоязычная подготовка, основанная на таксономии, для лучшего согласования представлений с профессиональной структурой и кросс-лингвальнойвариабельностью 17. В совокупности эти исследования формируют подход и демонстрируют потенциал использования больших языковых моделей с поиском и оптимизацией подсказок для более эффективного распознавания и адаптации к новым профессийным контекстам.

В данном исследовании предметные знания курируются исключительно для искусственного интеллекта и охраны окружающей среды, поскольку создание корпуса, валидация и обслуживание являются основными операционными затратами на классификацию кросс-доменного найма. Соответственно, Other служит категорией отклонения вне сферы компетенции, а не существенной отраслевой категорией. Заявленная высокая точность следует интерпретировать с осторожностью, так как настройка с тремя метками упрощает маркировку и может повысить производительность по сравнению с более мелкими таксономиями. Протокол предназначен как лёгкий, основанный на знаниях слой маркировки для целевых доменов, а не как замена комплексным многокатегорийным системам классификации. Расширение набора меток может снизить точность из-за увеличения пересечения, неоднозначности и более строгих требований к покрытию корпусов. На практике множество отклонения можно постепенно уточнять, расширяя корпус доменов и включая внутренние базы знаний. Таким образом, конфигурация с тремя метками демонстрирует повторно используемую парадигму, а не исчерпывающую профессиональную таксономию.

Набор данных сочетает структурированные и неструктурированные источники. Структурированный корпус был собран и отобран авторами из объявлений о вакансиях, публично размещённых публичными компаниями на крупных онлайн-платформах для рекрутинга в Китае в период с 2014 по 2023 год. После удаления дупликации и базовой очистки структурированный корпус содержит примерно 6,93 миллиона объявлений. Неструктурированные доменные документы, опубликованные соответствующими органами, использовались для определения критериев знаний и маркировки. Из этих источников вручную были составлены три поднабора эталона, каждое из которых содержало 1000 объявлений по искусственному интеллекту, охране окружающей среды и несвязанным областям соответственно, и проверено для оценки.

Магистрали модели оцениваются с использованием точности, точности, отзыва и F1 (гармоническое среднее точности и отзыва, F1 = 2PR/(P+R)) для выбора оптимальной основы для рабочего процесса, дополненного поиском. Авторитарные доменные документы компилируются в базу знаний для генерации с расширением поиска (RAG). Соответствующие отрывки извлекаются и вставляются в фиксированный шаблон подсказок для поддержки классификации. Варианты подсказок систематически тестируются, а для определения конечной конфигурации применяется стратегия оптимизации с помощью подсказок. Полученные доказательства фильтруются по релевантности для минимизации шума и поддержки точных, эффективных выводов.

Для обеспечения масштабной классификации рабочий процесс использует поэтапный конвейер: сортировка, управляемая лексиконом, эффективно решает рутинные случаи, а оптимизированный для запросов вывод LLM обрабатывает неоднозначные публикации, балансируя масштабируемость и точность (см. рисунок 1).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

В этом исследовании не участвовали люди или животные. Поэтому этическое одобрение и информированное согласие не требовались. Рабочий процесс выполнялся в среде Python 3.10 на 64-битной операционной системе Windows с использованием аппаратного обеспечения, инструментов и программного обеспечения, указанных в Таблице материалов.

1. Моделинг

  1. Построение базы данных и знаний
    1. Собирать и курировать внутренний структурированный корпус объявлений о вакансиях для публичных компаний с ведущих онлайн-платформ для найма в Китае (2014–2023), обеспечивая соблюдение политики платформы и применимых нормативных актов. Для каждой вакансии указывайте название должности, описание должности, название компании, дату публикации и уникальный идентификатор (например, идентификатор или URL, если он доступен). Удалить дубликаты и недействительные записи и убедиться, что окончательный корпус содержит примерно 6,93 миллиона записей.
    2. Собирать авторитетные доменные документы, связанные с искусственным интеллектом и охраной окружающей среды, включая документы, перечисленные в Дополнительном файле 1. Убедитесь, что документы определяют компетенции, стандарты квалификации, объем задач или регулируемые процедуры.
  2. Построение эталонного набора данных
    1. Проверьте структурированный набор данных вручную. Выбирайте публикации, которые явно отражают искусственный интеллект, охрану окружающей среды и несвязанные области. Включайте пограничные случаи для улучшения покрытия.
    2. Маркируйте каждую вакансию по названию должности, описанию должности и информации о работодателе.
    3. Создайте три эталонных поднабора по 1000 вакансий по искусственному интеллекту, охране окружающей среды и другим.
    4. Выполните двойную аннотацию. Назначьте одного аннотатора для маркировки каждого сообщения и второго аннотатора для проверки метки с помощью письменных инструкций.
    5. Разрешайте разногласия посредством обсуждения и решения с третьим аннотатором.
    6. Вычислите межаннотаторное соглашение. Запишите процентное согласование и κ.
    7. Сохраняйте проверенный набор бенчмарков для оценки модели.
  3. Оценка основ модели
    1. Оценивайте LLM-магистрали, настроенные на инструкции, используя тот же шаблон запросов и набор данных для бенчмарка.
    2. Отключите дополнение для извлечения при сравнении Backbone.
    3. Сохраняйте одинаковые формулировки запросов, параметры декодирования и отображение меток между моделями.
    4. Вычислите общую точность, точность по классам, отзыв и F1.
    5. Выберите наиболее эффективную магистраль и запишите его конфигурацию в Таблице 1.
    6. Полные результаты оценки передайте в таблице 2.
  4. Выполнение обучения энкодеров с адаптивным доменом
    1. Создайте немаркированный корпус, используя только авторитетные документы, перечисленные в Дополнительном файле 1.
    2. Извлечь открытый текст из всех документов.
    3. Разделите текст на последовательности с максимальной длиной 512 и шагом 492.
    4. Сбросьте сегменты короче 50 символов.
    5. Убедитесь, что публикации бенчмарков исключены из этого корпуса.
    6. Инициализировать контрольные пункты базы китайской базы BERT.
    7. Выполните предварительное обучение модели маскированного языка с вероятностью маскировки 0,15.
    8. Тренируйтесь 3 эпохи с использованием AdamW с частотой обучения 5e-5 и размером партии 2.
    9. Сохраните заранее обученный контрольный пункт.
    10. Тонко настройте кодировщик для трёхклассовой классификации с использованием скорости обучения 2e-5, размера партии 2 и максимальной длины последовательности 512.
    11. Зафиксируйте случайное начало на 42 и примените стратифицированное разделение валидации поездов.
    12. Точность отчёта, макро-усреднённая точность, макро-усреднённый отзыв, макро-усреднённая F1, метрики по классам и матрица путаницы.
    13. Сохраняйте результаты оценки для проверки.
  5. Построение конвейера Retrieval-Augmented Classification
    1. Создайте базу знаний
      1. Скомпилировать 12 авторитетных доменов.
      2. Удалите дублирующиеся или устаревшие версии.
      3. Конвертируйте документы в обычный текст.
      4. Фиксируйте метаданные документа, включая эмитента и год публикации.
      5. Разделите текст на части примерно по 1 000 символов с перекрытием на 20 символов.
      6. Запишите общее количество чанков и распределение по длине чанков.
        ПРИМЕЧАНИЕ: Перепроверьте производительность поиска, если база знаний расширена.
    2. Кодирование и сохранение вложений
      1. Кодировать все чанки с помощью модели вложения и хранить вложения в векторную базу данных.
      2. Идентификаторы чанков архива и метаданные происхождения.
      3. Проверьте, что количество сохранённых векторов совпадает с количеством чанков.
    3. Проведите извлечение.
      1. Встраивайте каждую вакансию с помощью одной и той же модели встраивания.
      2. Выполните поиск по k-ближайшему соседу с использованием косинусного сходства.
      3. Примените порог сходства τ для фильтрации совпадений с низкой релевантностью.
      4. Фиксируйте τ и top-κ после настройки на выдерживаемом подмножестве.
      5. Запись была извлечена по идентификаторам фрагментов и показателям сходства.
    4. Выполнить извлечение-дополненное вывод
      1. Вставьте до четырёх полученных фрагментов в раздел доказательств шаблона запроса (Дополнительный файл 2).
      2. Соедините текст вакансии с полученными доказательствами.
      3. Сгенерируйте финальную метку из трёх классов с использованием выбранного LLM.
      4. Сохраняйте логи поиска, подсказки и выходы моделей.
  6. Проведение сортировки с лексиконным руководством
    1. Конструировать лексиконы ключевых слов
      1. Составьте два лексикона ключевых слов: один для искусственного интеллекта и один для охраны окружающей среды (дополнительный файл 3).
      2. Извлекайте термины кандидатов из вакансий и авторитетных документов.
      3. Токенизуйте текст с помощью указанной библиотеки токенизации.
      4. Вычислите статистику частоты терминов и контраста области, а также устраните неоднозначные или чрезмерно общие термины.
      5. Завершить и архивировать лексиконы.
    2. Маршруты
      1. Применяйте точное сопоставление на уровне строк и жетонов.
      2. Маршрутные публикации, содержащие только ключевые слова искусственного интеллекта, в ветку искусственного интеллекта.
      3. Объявления о маршрутах, содержащие только ключевые слова по охране окружающей среды, в отдел охраны окружающей среды.
      4. Обозначьте объявления без совпадений как «Другое».
      5. Направьте посты двойного совпадения на шаг с улучшением поиска.
      6. Записывайте статистику маршрутизации и версии лексикона.
    3. Классифицировать неоднозначные публикации
      1. Получить соответствующие части в настройках с фиксированными верхними κ и τ.
      2. Введите полученные доказательства в шаблон запроса.
      3. Сгенерируйте финальную метку и сохраните логи по экземпляру.

2. Переклассификация результатов

  1. Конструкция тезауруса
    1. Постройте тезаурус терминов искусственного интеллекта (Дополнительный файл 4). Включайте термины из машинного обучения, обработки естественного языка, компьютерного зрения, робототехники и смежных областей. Организуйте подробные термины в каждой категории.
    2. Постройте отдельный тезаурус терминов по охране окружающей среды. Включают основы экологической науки, экологический мониторинг и анализ, контроль и управление загрязнением, а также экологическое планирование и управление.
    3. Добавьте все термины искусственного интеллекта и охраны окружающей среды в словарь токенизации. Убедитесь, что эти термины распознаются как полные единицы при сегментации текста.
  2. Текст предварительной обработки
    1. Удалять знаки препинания и специальные символы с помощью регулярных выражений. Сохраняйте только текст и пробелы.
    2. Выполните сегментацию слов, чтобы разделить непрерывный текст на отдельные токени.
  3. Выполнение сопоставления признаков и категоризации
    1. Предварительно обработайте входный текст, чтобы получить список сегментированных токенов.
    2. Выберите подходящий тезаурус согласно предварительной классификации.
    3. Пройдите сегментированные жетоны и выполните точное сопоставление с терминами тезауруса после нормализации. Применяйте нижние регистры и унифицируйте заранее определённые варианты перед сопоставлением.
    4. Запишите каждый совпадающий член и соответствующую ветвь тезауруса.
      ПРИМЕЧАНИЕ: Если совпадает несколько ответвлений, решайте ничьи по фиксированному правилу (например, наибольшее количество совпадений за последующим самым ранним появлением).
    5. Экспортируйте список сопоставленных терминов и последний внутридоменный тег для агрегации вниз.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Четыре открытых исходного кода, настраиваемых на инструкции крупных языковых моделей (Backbone A–D), перечисленных в Таблице материалов , проводятся в трёхклассной задаче классификации вакансий. Оценка проводится с использованием одного и того же протокола тестирования, процедур предварительной обработки и метрик по всем магистралям, включая общую точность, точность, отзыв и F1. Впоследствии к Магистрали B применяются оперативная доработка и генерация с дополнительной до...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Предыдущие работы применяли классические модели машинного обучения и нейронных моделей для категоризации текстов при наборе, включая классификацию резюме и описания вакансий, но такие подходы часто требуют значительных меченых данных и могут ухудшаться при смене терминологии. Али и др. предложили систему классификации резюме с использованием NLP и методов машинногообучения 18. Джалили и др. исследовали классификацию резюме на основеBiLSTM 19

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Авторам нечего раскрывать.

Благодарности

Авторы благодарят коллег за техническую поддержку и конструктивную обратную связь во время курирования данных и подготовки рукописей. Этот проект не получил внешнего финансирования.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
all-MiniLM-L6-v2 (кодировщик предложений)Обнимающее лицо (трансформеры предложений)https://huggingface.co/sentence-transformers/all-MiniLM-L6-v2Модель вложения предложений, используемая для векторизации.
Bert-базовый китайский (базовый кодировщик)Обнимающее лицо (google-bert)https://huggingface.co/google-bert/bert-base-chineseБазовый кодировщик (китайский базовый BERT).
Память DDR5, 16 ГБКонфигурация рабочей станции/ноутбукаН/ДСистемная память (16 ГБ DDR5); Поставщик/номер детали не указан.
DeepSeek-R1-Distill-Qwen-7B (Backbone A)Обнимающее лицо (deepseeek-ai)https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-7BОсновная основа LLM A.
GLM-4-9B-Chat (Backbone C)Обнимающее лицо (зай-орг)https://huggingface.co/zai-org/glm-4-9b-chat-hfОсновная основа LLM C.
Процессор Intel Core i5-13500HXIntelhttps://www.intel.com/content/www/us/en/products/sku/232156/intel-core-i513500hx-processor-24m-cache-up-to-4-70-ghz/specifications.htmlПроцессор рабочей станции, используемый для экспериментов.
InternLM2.5-7B-Chat (Backbone D)Обнимающее лицо (интернм)https://huggingface.co/internlm/internlm2_5-7b-chatLLM backbone D.
цзеба (китайский токенизатор)PyPI (jieba)https://pypi.org/project/jieba/китайскую библиотеку токенизации/сегментации; версия не указана.
Библиотеки ключевых слов (ИИ и Экологические) (Дополнительный файл 3)Это исследованиеДополнительный файл 3Доменные лексиконы ключевых слов, используемые для предварительной фильтрации, ориентированной на лексикон; Точная версия архива, использованная для каждого запуска.
LanceDB (векторная база данных)LanceDBН/ДВекторная база данных для хранения/поиска встраиваний; версия не указана.
Видеокарта ноутбука NVIDIA GeForce RTX 4060 (8 ГБ видеопамяти)NVIDIAhttps://www.nvidia.com/en-us/geforce/laptops/40-series/GPU используется для выводов и экспериментов.
Объявления о вакансиях на онлайн-платформах для найма (2014– 2023)Основные китайские платформы для найма (публичные веб-данные)Н/ДПублично размещённые объявления о работе, собранные и кураторские авторами; ~6,93 миллиона объявлений после уборки.
pip (установщик пакетов на Python)PyPAН/ДУстановщик пакетов использовался для установки зависимостей и экспорта снимка среды с помощью pip freeze.
Эволюция шаблона запросов (Файл дополнения 2)Это исследованиеДополнительный файл 2Последовательные варианты подсказок и последний запрос, используемый для оценки.
Python 3.10Фонд программного обеспечения PythonН/Динтерпретатор во время выполнения (Python 3.10); Версия патча не указана.
Qwen2.5-7B — Инструкт (Магистраль B)Обнимающее лицо (Qwen)https://huggingface.co/Qwen/Qwen2.5-7B-InstructОсновная основа LLM B.
Описания/указатели полей базы знаний RAG (Дополнительный файл 1)Это исследованиеДополнительный файл 1Схемы/полевые заметки и индекс документов для базы знаний, используемой для поиска дополняемого вывода.
Тезаурус (ИИ и Экологические) (Дополнительный файл 4)Это исследованиеДополнительный файл 4Терминологические словари, используемые при переклассификации и анализе; Точная версия архива, использованная для каждого запуска.
Windows 11 (64-битная)MicrosoftН/Доперационная система (Windows 11, 64-битная); Сборка/версия не указана.

Ссылки

  1. Alekseeva, L., et al. The demand for AI skills in the labor market. Labour Economics. 71, 102002(2021).
  2. Ministry updates official dictionary of careers. , Ministry of Human Resources and Social Security of the People’s Republic of China. Available at: https://english.www.gov.cn/statecouncil/ministries/202209/30/content_WS633647bbc6d0a757729e0bb6.html (2022).
  3. BERT: Pre-training of deep bidirectional transformers for language understanding. Devlin, J., Chang, M. W., Lee, K., Toutanova, K. 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (NAACL-HLT), Minneapolis, MN, USA, , 4171-4186 (2019).
  4. Large language models in the workplace: A case study on prompt engineering for job type classification. Clavié, B., et al. 28th International Conference on Applications of Natural Language to Information Systems (NLDB 2023); , Derby, UK, , Springer. Natural Language Processing and Information Systems. Lecture Notes in Computer Science 3-17 (2023).
  5. Li, N., Kang, B., De Bie, T. LLM4Jobs: Unsupervised occupation extraction and standardization leveraging large language models. arXiv. , Available at: https://arxiv.org/abs/2309.09708 (2023).
  6. Deep learning-based computational job market analysis: A survey on skill extraction and classification from job postings. Senger, E., Zhang, M., van der Goot, R., Plank, B. 1st Workshop on Natural Language Processing for Human Resources (NLP4HR 2024), St. Julian’s, Malta, , 1-15 (2024).
  7. Enhancing job posting classification with multilingual embeddings and large language models. Kavas, H., Serra-Vidal, M., Wanner, L. 10th Italian Conference on Computational Linguistics (CLiC-it 2024), Pisa, Italy, , 440-450 (2024).
  8. JobBERT: Understanding job titles through skills. Decorte, J. J., Van Hautte, J., Demeester, T., Develder, C. International Workshop on Fair, Effective and Sustainable Talent Management using Data Science (FEAST 2021) at ECML-PKDD 2021, , (2021).
  9. Carotene: A job title classification system for the online recruitment domain. Javed, F., et al. IEEE First International Conference on Big Data Computing Service and Applications (BigDataService), , 286-293 (2015).
  10. Javed, F., McNair, M., Jacob, F., Zhao, M. Towards a job title classification system. arXiv. , Available at: https://arxiv.org/abs/1606.00917 (2016).
  11. Lewis, P., et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Presented at: Advances in Neural Information Processing Systems. NeurIPS. , (2020).
  12. The power of scale for parameter-efficient prompt tuning. Lester, B., Al-Rfou, R., Constant, N. 2021 Conference on Empirical Methods in Natural Language Processing (EMNLP), , 3045-3059 (2021).
  13. Han, X., et al. PTR: Prompt tuning with rules for text classification. AI Open. 3, 182-192 (2022).
  14. Brown, T. B., et al. Language models are few-shot learners. Presented at: Advances in Neural Information Processing Systems. NeurIPS. , (2020).
  15. Liu, P., et al. predict: A systematic survey of prompting methods in natural language processing. ACM Comput Surv. 55 (9), 195:1-195:35 (2023).
  16. Blue, A. The outlook for 2023 is uncertain, but here’s what we know about the global labour market. World Economic Forum (Agenda). , Available at: https://www.weforum.org/agenda/2023/01/the-outlook-for-2023-is-uncertain-but-here-s-what-we-know-about-the-global-labour-market-davos23 (2023).
  17. ESCOXLM-R: Multilingual taxonomy-driven pre-training for the job market domain. Zhang, M., van der Goot, R., Plank, B. 61st Annual Meeting of the Association for Computational Linguistics (ACL 2023), Toronto, Canada, , 11871-11890 (2023).
  18. Ali, I., et al. Resume classification system using natural language processing and machine learning techniques. Mehran Univ Res J Eng Technol. 41 (1), 65-79 (2022).
  19. BiLSTM for resume classification. Jalili, A., Tabrizchi, H., Razmara, J., Mosavi, A. 22nd IEEE International Symposium on Applied Machine Intelligence and Informatics (SAMI 2024), Stará Lesná, Slovakia, , (2024).
  20. Pal, R., Shaikh, S., Satpute, S., Bhagwat, S. Resume classification using various machine learning algorithms. ITM Web Conf. 44, 03011(2022).
  21. Convolutional neural network with word embedding based approach for resume classification. Nasser, S., Sreejith, C., Irshad, M. 2018 International Conference on Emerging Trends and Innovations in Engineering and Technological Research (ICETIETR 2018), , Ernakulam (Cochin), India. (2018).
  22. Real-time resume classification system using LinkedIn profile descriptions. Ramraj, S., Sivakumar, V. 2020 International Conference on Computational Intelligence for Smart Power Systems and Sustainable Energy (CISPSSE 2020), Keonjhar, Odisha, India, , (2020).
  23. Heakl, A., et al. ResumeAtlas: Revisiting resume classification with large-scale datasets and large language models. arXiv. , Available at: https://arxiv.org/abs/2406.18125 (2024).
  24. Skondras, P., Zervas, P., Tzimas, G. Generating synthetic resume data with large language models for enhanced job description classification. Future Internet. 15 (11), 363(2023).
  25. Chen, Z. Ethics and discrimination in artificial intelligence-enabled recruitment practices. Humanit Soc Sci Commun. 10, 567(2023).
  26. Retrieval-augmented few-shot text classification. Yu, G., et al. Findings of the Association for Computational Linguistics: EMNLP 2023, Singapore, , 6721-6735 (2023).
  27. Izacard, G., et al. Atlas: Few-shot learning with retrieval augmented language models. J Mach Learn Res. 24 (251), 1-43 (2023).
  28. KW-ATTN: Knowledge infused attention for accurate and interpretable text classification. Jang, H., et al. Deep Learning Inside Out (DeeLIO): 2nd Workshop on Knowledge Extraction and Integration for Deep Learning Architectures, , 96-107 (2021).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Теги

k