Для просмотра этого контента требуется подписка на JoVE. Войдите или начните свой бесплатный пробный период.

Методическая статья

Двухступенчатая маркировка текста для рекрутинга с использованием маршрутизации с лексиконом и расширенные с поиском больших языковых моделей

164 просмотров

⸱

DOI:

10.3791/70153

⸱

8 мая 2026 г.

В этой статье

Краткое содержание

Описывается двухэтапный рабочий процесс для классификации учебников по направлению по искусственному интеллекту, охране окружающей среды или другим. Сортировка, управляемая лексиконом, присваивает рутинные случаи, тогда как вывод с помощью поиска и оптимизированной для подсказок вывод по моделям больших языков разрешает неоднозначные случаи, обеспечивая точное масштабное маркировку и последующем описательное резюме рынка труда.

Аннотация

Рекрутинговые тексты неоднородны, а терминология предметной области эволюционирует со временем, что затрудняет масштабное маркировку при ограниченной возможности ручного аннотирования. Этот протокол обеспечивает воспроизводимый двухэтапный рабочий процесс для классификации китайских учебников по набору в области искусственного интеллекта, охраны окружающей среды или других. Первый этап проводит сортировку с помощью лексиконного руководства, используя два кураторских списка ключевых слов домена. Публикации, соответствующие только одному доменному лексикону, напрямую маркированы. Объявления, не соответствующие ни одному из лексиконов, обозначены как «Другие», а публикации с двойным совпадением направляются на второй этап. Второй этап применяет вывод по моделям большого языка с помощью поиска. База знаний, скомпилированная из 12 авторитетных документов домена, преобразуется в текст, делится примерно на 1000-символьные блоки с перекрытием 20 символов, встраивается с использованием полностью MiniLM-L6-v2 и индексируется в LanceDB. Для каждой неопределённой публикации поиск по косинусоидальности k-ближайшего соседа возвращает кандидатные блоки, отфильтрованные по минимальному порогу сходства (τ), и до четырёх чанков вводятся в фиксированный шаблон запроса, который определяет границы меток и ограничивает выход одной меткой. Эталонный набор из 3000 публикаций проверяется вручную, с 1000 публикаций на класс, и достигает межаннотаторского согласия в размере 95,0 % и каппы Коэна (κ) примерно 0,93. Evaluation сравнивает несколько открытых крупных языковых моделей в настройках только запросов и в настройках с дополненным поиском с помощью Qwen2.5-7B-Instruct. Конфигурация, дополненная поиском, достигает точности 98,47 % и поддерживает маркировку корпуса примерно 6,93 миллиона публикаций для нижней описательной агрегации.

Введение

В последние годы, благодаря стремительному развитию ИИ и экологических технологий, появилось множество новых профессий. С одной стороны, мировой рынок труда переполнен множеством совершенно новых вакансий, основанных на ИИ и устойчивом развитии. Доказательства, основанные на вакансиях, свидетельствуют о быстром росте спроса на навыки, связанные с ИИ, что увеличивает гетерогенность текстов для найма и мотивирует воспроизводимый, масштабируемый протокол меткидоменов 1. С другой стороны, последняя редакция Словаря классификации профессий (ОКР) в Китае показала столь же устойчивый рост новых профессий в сферах инфо....

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

В этом исследовании не участвовали люди или животные. Поэтому этическое одобрение и информированное согласие не требовались. Рабочий процесс выполнялся в среде Python 3.10 на 64-битной операционной системе Windows с использованием аппаратного обеспечения, инструментов и программного обеспечения, указанных в Таблице материалов.

1. Моделинг

  1. Построение базы данных и знаний
    1. Собирать и курировать внутренний структурированный корпус объявлений о вакансиях для публичных компаний с ведущих онлайн-платформ для найма в Китае (2014–2023), обеспечивая соблюдение п....

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Четыре открытых исходного кода, настраиваемых на инструкции крупных языковых моделей (Backbone A–D), перечисленных в Таблице материалов , проводятся в трёхклассной задаче классификации вакансий. Оценка проводится с использованием одного и того же протокола тестирования, процедур предварительной обработки и метрик по всем магистралям, включая общую точность, точность, отзыв и F1. Впоследствии к Магистрали B применяются оперативная доработка и генерация с дополнительной до.......

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Предыдущие работы применяли классические модели машинного обучения и нейронных моделей для категоризации текстов при наборе, включая классификацию резюме и описания вакансий, но такие подходы часто требуют значительных меченых данных и могут ухудшаться при смене терминологии. Али и др. предложили систему классификации резюме с использованием NLP и методов машинногообучения 18. Джалили и др. исследовали классификацию резюме на основеBiLSTM 19

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Авторам нечего раскрывать.

Благодарности

Авторы благодарят коллег за техническую поддержку и конструктивную обратную связь во время курирования данных и подготовки рукописей. Этот проект не получил внешнего финансирования.

....

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
all-MiniLM-L6-v2 (кодировщик предложений)Обнимающее лицо (трансформеры предложений)https://huggingface.co/sentence-transformers/all-MiniLM-L6-v2Модель вложения предложений, используемая для векторизации.
Bert-базовый китайский (базовый кодировщик)Обнимающее лицо (google-bert)https://huggingface.co/google-bert/bert-base-chineseБазовый кодировщик (китайский базовый BERT).
Память DDR5, 16 ГБКонфигурация рабочей станции/ноутбукаН/ДСистемная память (16 ГБ DDR5); Поставщик/номер детали не указан.
DeepSeek-R1-Distill-Qwen-7B (Backbone A)Обнимающее лицо (deepseeek-ai)https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-7BОсновная основа LLM A.
GLM-4-9B-Chat (Backbone C)Обнимающее лицо (зай-орг)https://huggingface.co/zai-org/glm-4-9b-chat-hfОсновная основа LLM C.
Процессор Intel Core i5-13500HXIntelhttps://www.intel.com/content/www/us/en/products/sku/232156/intel-core-i513500hx-processor-24m-cache-up-to-4-70-ghz/specifications.htmlПроцессор рабочей станции, используемый для экспериментов.
InternLM2.5-7B-Chat (Backbone D)Обнимающее лицо (интернм)https://huggingface.co/internlm/internlm2_5-7b-chatLLM backbone D.
цзеба (китайский токенизатор)PyPI (jieba)https://pypi.org/project/jieba/китайскую библиотеку токенизации/сегментации; версия не указана.
Библиотеки ключевых слов (ИИ и Экологические) (Дополнительный файл 3)Это исследованиеДополнительный файл 3Доменные лексиконы ключевых слов, используемые для предварительной фильтрации, ориентированной на лексикон; Точная версия архива, использованная для каждого запуска.
LanceDB (векторная база данных)LanceDBН/ДВекторная база данных для хранения/поиска встраиваний; версия не указана.
Видеокарта ноутбука NVIDIA GeForce RTX 4060 (8 ГБ видеопамяти)NVIDIAhttps://www.nvidia.com/en-us/geforce/laptops/40-series/GPU используется для выводов и экспериментов.
Объявления о вакансиях на онлайн-платформах для найма (2014– 2023)Основные китайские платформы для найма (публичные веб-данные)Н/ДПублично размещённые объявления о работе, собранные и кураторские авторами; ~6,93 миллиона объявлений после уборки.
pip (установщик пакетов на Python)PyPAН/ДУстановщик пакетов использовался для установки зависимостей и экспорта снимка среды с помощью pip freeze.
Эволюция шаблона запросов (Файл дополнения 2)Это исследованиеДополнительный файл 2Последовательные варианты подсказок и последний запрос, используемый для оценки.
Python 3.10Фонд программного обеспечения PythonН/Динтерпретатор во время выполнения (Python 3.10); Версия патча не указана.
Qwen2.5-7B — Инструкт (Магистраль B)Обнимающее лицо (Qwen)https://huggingface.co/Qwen/Qwen2.5-7B-InstructОсновная основа LLM B.
Описания/указатели полей базы знаний RAG (Дополнительный файл 1)Это исследованиеДополнительный файл 1Схемы/полевые заметки и индекс документов для базы знаний, используемой для поиска дополняемого вывода.
Тезаурус (ИИ и Экологические) (Дополнительный файл 4)Это исследованиеДополнительный файл 4Терминологические словари, используемые при переклассификации и анализе; Точная версия архива, использованная для каждого запуска.
Windows 11 (64-битная)MicrosoftН/Доперационная система (Windows 11, 64-битная); Сборка/версия не указана.

Ссылки

  1. Alekseeva, L., et al. The demand for AI skills in the labor market. Labour Economics. 71, 102002(2021).
  2. Ministry updates official dictionary of careers. , Ministry of Human Resources and Social Security of the People’s Republic of China. Available at: https://english.www.gov.cn/statecouncil/ministries/202209/30/content_WS633647bbc6d0a75....

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Теги

Модели с дополненным поискомсписки ключевых слов предметной областипостроение базы знанийпоиск по косинусному сходствуметод k-ближайших соседейклассификация китайских текстовсогласованность аннотаторов