Это исследование было проведено в соответствии с институциональными этическими стандартами и одобрено Этическим комитетом Главного госпиталя Восточного театрального командования (Одобрение No DZQH-KYLLFS-25-38). Письменное информированное согласие было получено от всех участников до включения. Все данные пациентов были анонимизированы и сняты с идентификации для обеспечения защиты конфиденциальности. Исследовательские инструменты для этого протокола перечислены в Таблице материалов.
1. Построение графа знаний
Граф знаний был построен с использованием стратегии интеграции данных с несколькими источниками. Сбор данных и аннотация выполнялись обученными специалистами с формальным образованием в области традиционной китайской медицины (ТКМ) и акупунктуры. Источники данных включали классические учебники по акупунктуре, китайскую литературу от CNKI, англоязычную литературу из Web of Science Core Collection, клинические данные из репродуктивных центров третичных больниц и стандартизированные базы знаний (подробный список классических текстов доступен в Дополнительном файле 1). Эти источники были выбраны для обеспечения как исторической глубины, так и современной клинической значимости. Всего было включено 400 клинических случаев для поддержки выявления диагностических и терапевтических моделей. Общий рабочий процесс построения графов знаний иллюстрируется на рисунке 1.

Рисунок 1: Рабочий процесс построения графов знаний. Обзор процесса сбора, извлечения и интеграции данных, используемого для построения графа знаний. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Критерии включения требовали, чтобы все данные были напрямую связаны с диагностикой и лечением акупунктуры с полным и чётко структурированным содержанием, подходящим для извлечения сущностей и отношений. Классические тексты должны были критически сопоставлены и не содержать очевидных ошибок, тогда как современная литература ограничивалась рецензируемыми публикациями или документами, издаваемыми авторитетными учреждениями. Клинические данные должны были быть сняты с идентификации и этически утверждены. Критерии исключения включали дублирующиеся записи, неполные текстовые фрагменты, содержание, не связанное с диагностикой и лечением акупунктуры, а также необоснованные или ошибочные заявления.
Был реализован гибридный подход к извлечению знаний, сочетающий ручное аннотирование и автоматизированное извлечение. Около 30% данных, включая классические тексты и семантически сложный контент, были вручную аннотированы экспертами в области с использованием стандартизированной платформы аннотаций. Оставшиеся 70% данных были обработаны с помощью крупных языковых моделей (LLM) для автоматизированной экстракции, включая распознавание сущностей, извлечение связей и нормализацию терминологии. Все автоматически сгенерированные результаты были проверены и исправлены экспертами для обеспечения точности и согласованности.
Автоматизированное извлечение осуществлялось с использованием структурированных шаблонов подсказок, предназначенных для руководства поведением LLM (примеры шаблонов приведены в дополнительном файле 2). Эти шаблоны определяли роль модели как эксперта по извлечению знаний, специфическим для конкретной области, и включали примеры обучения с несколькими выстрелами в формате JSON триплетов для повышения эффективности извлечения. Предварительно обработанные рефераты литературы передавались через интерфейсы прикладного программирования (API), а стратегии параллельной обработки были реализованы для повышения вычислительной эффективности. Выходы экстракции были проанализированы и валидированы с помощью инструментов JSON для обеспечения структурной целостности. Проверенные триплеты знаний сериализовались в независимые JSON-файлы, названные в соответствии с исходными документами для поддержания прослеживаемости.
Окончательный граф знаний хранился в базе данных и реализовывался с использованием фреймворков на основе Python. Визуализация выполнялась с помощью встроенных инструментов базы данных графов для поддержки инспекции и валидации.
Объекты в графе знаний были разделены на семь типов: болезни, симптомы, паттерны синдромов, акупунктурные точки, меридианы, методы лечения, а также эффекторные вещества и биологические механизмы. Взаимосвязи между объектами были построены с учётом клинической диагностической и терапевтической логики, поддерживающей многохоповое рассуждение и структурированный вывод. Онтология и структура отношений показаны на рисунке 2. Подробная схема графов знаний и примеры ограничений отношений приведены в Дополнительном файле 3 и Дополнительном файле 4.

Рисунок 2: Онтология графов знаний и модель отношений. Схематическое представление типов сущностей и отношений внутри графа знаний. Основные структуры включают заболевания, симптомы, синдромы, акупунктурные точки и методы лечения, а также иллюстрируют диагностические и терапевтические взаимосвязи.
Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
2. Разработка прикладных систем
Система применения была разработана на основе построенного графа знаний для поддержки клинических решений. Система обрабатывает вводные данные пользователя и проводит структурированный анализ с помощью обработки естественного языка и рассуждения на основе графов знаний.
Понимание естественного языка было реализовано с использованием модели BiLSTM-CRF для распознавания именованных сущностей и их связывания; архитектура модели показана на рисунке 3. Архитектура модели состояла из слоя вложения, обученного на доменно-специфических корпусах, двустороннего слоя долгосрочной краткосрочной памяти для захвата контекстной информации и условного случайного поля для обеспечения оптимальной маркировки последовательностей. Модель была обучена на вручную аннотированных клинических и литературных данных, при этом аннотация выполнялась независимыми экспертами в области. Согласование между аннотаторами оценивалось с использованием коэффициента каппа Коэна с порогом ≥0,85. Расхождения устранялись на основе консенсуса экспертов.

Рисунок 3: Архитектура модели BiLSTM-CRF. Схематическая диаграмма модели BiLSTM-CRF, используемой для распознавания именованных сущностей, включая вложение, BiLSTM и CRF-слои.
Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
В процессе вывода модель извлекала структурированные объекты, включая симптомы, заболевания и паттерны синдромов, из клинических входных данных. Эти сущности были сопоставлены со стандартизированными узлами графа знаний с помощью нормализации терминологии, сопоставления векторов на основе косинусного сходства и контекстного разъяснения.
Поиск знаний проводился с использованием стратегии двойного режима, сочетающей ключевые слова и семантические подходы. Поиск по ключевым словам использовал полнотекстовое индексирование для точного сопоставления структурированных сущностей, тогда как семантический поиск использовал векторные представления для выявления релевантных неструктурированных знаний. Полученные результаты объединялись, дедупликацировались и структурированы для дальнейшей обработки. Была применена многомерная стратегия ранжирования для приоритизирования результатов на основе точного совпадения, семантического сходства и релевантности ключевых слов, с учетом гинекологических и связанных с DOR контекстами.
Система генерировала диагностические и терапевтические результаты с использованием методов генерации естественного языка, преобразуя структурированные знания в клинически интерпретируемые ответы.
3. Клиническое применение и оценка
Разработанная система применялась в клинических условиях для оценки её практической эффективности. Участниками исследования были пациенты с диагнозом снижения яичникового резерва в третьей больнице Нанкина, которые согласились на лечение акупунктурой.
Участники допускались, если им было от 20 до 40 лет и они соответствовали диагностическим критериям снижения яичникового резерва согласно критериям POSEIDON 2016 года и Китайскому экспертному консенсусу 2020 года. Диагностические показатели включали снижение уровня антимюллеровских гормонов и количество антральных фолликулов < 5. Пациенты исключались, если у них были заболевания, влияющие на фертильность, серьёзные сопутствующие заболевания или если они проходили лечение акупунктурой для повышения фертильности в течение предыдущих трёх месяцев. Блок-схема включения и исключения пациентов показана на рисунке 4.

Рисунок 4: Блок-схема включения и исключения пациентов. Блок-схема, показывающая отбор пациентов. Всего 127 пациентов соответствовали критериям включения, а 90 пациентов были включены после применения критериев исключения и учета неполных данных. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Данные о пациентах, включая демографическую и клиническую информацию, собирались и фиксировались в структурированном формате. Участники заполняли стандартизированные анкеты для получения информации о симптомах и клинической практике (подробная анкета приведена в дополнительном файле 5). Система генерировала диагностические выводы и назначения на акупунктуру на основе входных данных.
Производительность системы оценивалась с использованием точности диагностики и целесообразности лечения. Диагностическая точность оценивалась путём сравнения результатов дифференцировки синдромов, вызванных системой, с результатами, предоставленными тремя старшими гинекологическими врачами по ТКМ, которые выступали в качестве эталонного стандарта. Показатель диагностического согласования рассчитывался как доля последовательных случаев среди всех случаев.
Целесообразность лечения оценивалась комиссией из трёх старших акупунктуристов с не менее пяти летами клинического опыта и профессиональными должностями. Эксперты независимо оценивали системные рецепты с помощью 5-балльной шкалы Ликерта. Межоценочное согласование оценивалось с использованием коэффициента согласованности Кендалла (W).