В последние годы, благодаря стремительному развитию ИИ и экологических технологий, появилось множество новых профессий. С одной стороны, мировой рынок труда переполнен множеством совершенно новых вакансий, основанных на ИИ и устойчивом развитии. Доказательства, основанные на вакансиях, свидетельствуют о быстром росте спроса на навыки, связанные с ИИ, что увеличивает гетерогенность текстов для найма и мотивирует воспроизводимый, масштабируемый протокол меткидоменов 1. С другой стороны, последняя редакция Словаря классификации профессий (ОКР) в Китае показала столь же устойчивый рост новых профессий в сферах информатизации занятости, а также экологичного и низкоуглеродного сектора, с чистым увеличением на 158 новых профессий в редакции 2022 года по сравнению с редакцией 2015 года, всего 97 цифровых профессий. или 6% от общего числа помеченных занятий, вместе с 134 зелёными занятиями, или 8% от общего числазанятий 2.
По мере появления новых профессий содержание и форма вакансий в компаниях становятся всё более сложными, поскольку описания вакансий часто включают знания по предмету и разнообразные требования к навыкам, включая как структурированные области, такие как названия должностей и списки навыков, так и большое количество неструктурированных свободных текстовых описаний, что приводит к всё более сложным структурам вакансий. Такие сложные вакансии обычно содержат чётко очерченные структурированные элементы (например, названия должностей, списки необходимых навыков) наряду с обширными неструктурированными свободными текстовыми описаниями. Например, в объявлении о вакансии инженера по ИИ могут быть указаны технические термины, такие как «владение фреймворком глубокого обучения» и «опыт оптимизации алгоритмов обратного распространения» в списке навыков, а также подробный перечень обязанностей; Аналогично, вакансия экологического инженера может ссылаться на конкретные нормативные стандарты и сертификаты. Такое сочетание структурированного и неструктурированного контента приводит к высокоспециализированным и запутанным описаниям должностей.
Искусственный интеллект и охрана окружающей среды выбираются для оценки протокола при реалистичной межотраслевой неоднозначности в классификации набора. На практике основные профессиональные ресурсы, такие как O*NET и доски вакансий, присваивают грубые теги, что затрудняет различие между отраслевыми ролями только по ключевым словам. Охрана окружающей среды представляет собой широкую область, пересекающуюся с несколькими научными областями, тогда как искусственный интеллект отражает более тонкий сегмент вычислительной техники, часто смешиваемый с общими ролями программного обеспечения. Такое сочетание охватывает как широкие, так и узкие междоменные среды с уникальной терминологией и подходящими авторитетными документами для построения базы знаний, при этом позволяя адаптироваться к другим отраслям, заменяя доменный корпус без изменения основного рабочего процесса.
В последние годы наблюдается всплеск исследований по классификации вакансий. Исследователи всё чаще используют крупные предварительно обученные модели для улучшения классификации профессий. Введение BERT в 2019 году стало прорывом, позволившим глубоко контекстуальное понимание языка и значительно улучшив качество классификациитекста 3. Например, Clavié и др. (2023) исследовали использование модели большого языка, настроенного на инструкцию (LLM) для классификации профессий, выяснив, что правильная инженерия запросов позволяет LLM превосходить современные контролируемые модели взадаче классифицирования должностей выпускников 4. Аналогично, Ли и др. (2023) предложили подход LLM4Jobs, который сочетает суммирование крупноязычных моделей с сопоставлением кода профессии, значительно повышая точность классификации длинных описаний должностей, сначала извлекая сводки, а затем выравнивая их со стандартными кодамидолжностей 5. Кроме того, опрос 2024 года, проведённый Сенгером и соавторами, каталогизирует последние достижения в области глубокого обучения для HR, отмечая, что извлечение навыков и классификация рабочих мест стали ключевыми задачами в анализе вычислительного рынкатруда 6. Kavas и др. (2024) улучшили классификацию вакансий, объединив многоязычные текстовые вложения с категоризацией на основе LLM, что привело к заметному ростуточности 7. В традиционном плане более ранние системы варьировались от эвристик на основе ключевых слов с относительно грубыми наборами категорий до таксономически ориентированных фреймворков, таких как Carotene, которые использовали иерархию более чем 4000 должностныхназваний 8,9. Джавед и др. (2016) представили раннюю систему классификации должностей, став одним из первых шагов к систематической классификациипрофессий 10. Однако такие контролируемые подходы требуют обширных маркированных данных и испытывают трудности с адаптацией к быстрому появлению новых должностей, поскольку классификационные таксономии часто развиваются медленнее, чем рыноктруда 4.
Для решения этих ограничений последние исследования переключились на гибридные стратегии, включающие внешние знания; например, Льюис и др. (2020) представили фреймворк Retrieval-Augmented Generation (RAG), который сочетает предварительно обученные языковые модели с ретривером для внедрения релевантных предметных знаний, достигая высшей точности и более достоверных результатов по задачам, требующимзнаний 11. Лестер и др. показали, что prompt tuning даёт больший прирост производительности по мере увеличения размера моделина 12, что подтверждает использование сильного базового LLM. Например, Хан и др. показали, что использование подсказок, ориентированных на правила, может повысить точность классификации текста, сосредоточив модель на ключевыхпризнаках 13. Кроме того, Браун и др. (2020) прославились, что большая языковая модель может выполнять новые задачи всего на основе нескольких примеров или инструкций, подчёркивая силу обучения на подсказкахс несколькими выстрелами 14. Примечательно, что недавний обзор методов NLP, основанного на подсказках, подчёркивает, что формулировка подсказок может существенно влиять на результаты модели15. В то же время макроуровневые сдвиги и неопределённость на рынке труда усиливают необходимость масштабируемых и удобных для обновления протоколов маркировки, которые можно обновлять по мере появления новыхролей 16. В области НЛП на рынке труда также исследована многоязычная подготовка, основанная на таксономии, для лучшего согласования представлений с профессиональной структурой и кросс-лингвальнойвариабельностью 17. В совокупности эти исследования формируют подход и демонстрируют потенциал использования больших языковых моделей с поиском и оптимизацией подсказок для более эффективного распознавания и адаптации к новым профессийным контекстам.
В данном исследовании предметные знания курируются исключительно для искусственного интеллекта и охраны окружающей среды, поскольку создание корпуса, валидация и обслуживание являются основными операционными затратами на классификацию кросс-доменного найма. Соответственно, Other служит категорией отклонения вне сферы компетенции, а не существенной отраслевой категорией. Заявленная высокая точность следует интерпретировать с осторожностью, так как настройка с тремя метками упрощает маркировку и может повысить производительность по сравнению с более мелкими таксономиями. Протокол предназначен как лёгкий, основанный на знаниях слой маркировки для целевых доменов, а не как замена комплексным многокатегорийным системам классификации. Расширение набора меток может снизить точность из-за увеличения пересечения, неоднозначности и более строгих требований к покрытию корпусов. На практике множество отклонения можно постепенно уточнять, расширяя корпус доменов и включая внутренние базы знаний. Таким образом, конфигурация с тремя метками демонстрирует повторно используемую парадигму, а не исчерпывающую профессиональную таксономию.
Набор данных сочетает структурированные и неструктурированные источники. Структурированный корпус был собран и отобран авторами из объявлений о вакансиях, публично размещённых публичными компаниями на крупных онлайн-платформах для рекрутинга в Китае в период с 2014 по 2023 год. После удаления дупликации и базовой очистки структурированный корпус содержит примерно 6,93 миллиона объявлений. Неструктурированные доменные документы, опубликованные соответствующими органами, использовались для определения критериев знаний и маркировки. Из этих источников вручную были составлены три поднабора эталона, каждое из которых содержало 1000 объявлений по искусственному интеллекту, охране окружающей среды и несвязанным областям соответственно, и проверено для оценки.
Магистрали модели оцениваются с использованием точности, точности, отзыва и F1 (гармоническое среднее точности и отзыва, F1 = 2PR/(P+R)) для выбора оптимальной основы для рабочего процесса, дополненного поиском. Авторитарные доменные документы компилируются в базу знаний для генерации с расширением поиска (RAG). Соответствующие отрывки извлекаются и вставляются в фиксированный шаблон подсказок для поддержки классификации. Варианты подсказок систематически тестируются, а для определения конечной конфигурации применяется стратегия оптимизации с помощью подсказок. Полученные доказательства фильтруются по релевантности для минимизации шума и поддержки точных, эффективных выводов.
Для обеспечения масштабной классификации рабочий процесс использует поэтапный конвейер: сортировка, управляемая лексиконом, эффективно решает рутинные случаи, а оптимизированный для запросов вывод LLM обрабатывает неоднозначные публикации, балансируя масштабируемость и точность (см. рисунок 1).