Рекрутинговые тексты неоднородны, а терминология предметной области эволюционирует со временем, что затрудняет масштабное маркировку при ограниченной возможности ручного аннотирования. Этот протокол обеспечивает воспроизводимый двухэтапный рабочий процесс для классификации китайских учебников по набору в области искусственного интеллекта, охраны окружающей среды или других. Первый этап проводит сортировку с помощью лексиконного руководства, используя два кураторских списка ключевых слов домена. Публикации, соответствующие только одному доменному лексикону, напрямую маркированы. Объявления, не соответствующие ни одному из лексиконов, обозначены как «Другие», а публикации с двойным совпадением направляются на второй этап. Второй этап применяет вывод по моделям большого языка с помощью поиска. База знаний, скомпилированная из 12 авторитетных документов домена, преобразуется в текст, делится примерно на 1000-символьные блоки с перекрытием 20 символов, встраивается с использованием полностью MiniLM-L6-v2 и индексируется в LanceDB. Для каждой неопределённой публикации поиск по косинусоидальности k-ближайшего соседа возвращает кандидатные блоки, отфильтрованные по минимальному порогу сходства (τ), и до четырёх чанков вводятся в фиксированный шаблон запроса, который определяет границы меток и ограничивает выход одной меткой. Эталонный набор из 3000 публикаций проверяется вручную, с 1000 публикаций на класс, и достигает межаннотаторского согласия в размере 95,0 % и каппы Коэна (κ) примерно 0,93. Evaluation сравнивает несколько открытых крупных языковых моделей в настройках только запросов и в настройках с дополненным поиском с помощью Qwen2.5-7B-Instruct. Конфигурация, дополненная поиском, достигает точности 98,47 % и поддерживает маркировку корпуса примерно 6,93 миллиона публикаций для нижней описательной агрегации.