Este estudio se llevó a cabo conforme a los estándares éticos institucionales y fue aprobado por el Comité de Ética del Hospital General del Mando del Teatro Oriental (Aprobación nº DZQH-KYLLFS-25-38). Se obtuvo el consentimiento informado por escrito de todos los participantes antes de su inclusión. Todos los datos de los pacientes fueron anonimizados y desidentificados para garantizar la protección de la privacidad. Las herramientas de investigación para este protocolo se han listado en la Tabla de Materiales.
1. Construcción de grafos de conocimiento
El grafo de conocimiento se construyó utilizando una estrategia de integración de datos multifuente. La recopilación y anotación de datos fue realizada por personal formado con formación formal en Medicina Tradicional China (MTC) y acupuntura. Las fuentes de datos incluían textos clásicos de acupuntura, literatura en chino del CNKI, literatura en inglés de la Web of Science Core Collection, datos clínicos de centros reproductivos en hospitales terciarios y bases de conocimiento estandarizadas (la lista detallada de textos clásicos está disponible en el Archivo Suplementario 1). Estas fuentes fueron seleccionadas para garantizar tanto la profundidad histórica como la relevancia clínica contemporánea. Se incluyeron un total de 400 casos clínicos para apoyar la identificación de patrones diagnósticos y terapéuticos. El flujo de trabajo general de construcción de grafos de conocimiento se ilustra en la Figura 1.

Figura 1: Flujo de trabajo de construcción de grafos de conocimiento. Resumen del proceso de recopilación, extracción e integración de datos utilizado para construir el grafo de conocimiento. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Los criterios de inclusión requerían que todos los datos estuvieran directamente relacionados con el diagnóstico y tratamiento de la acupuntura, con contenido completo y claramente estructurado adecuado para la extracción de entidades y relaciones. Los textos clásicos debían ser recopilados críticamente y libres de errores evidentes, mientras que la literatura moderna se limitaba a publicaciones revisadas por pares o documentos publicados por instituciones autorizadas. Se requería que los datos clínicos fueran desidentificados y aprobados éticamente. Los criterios de exclusión incluían registros duplicados, fragmentos de texto incompletos, contenido no relacionado con el diagnóstico y tratamiento de la acupuntura, y afirmaciones sin fundamento o erróneas.
Se implementó un enfoque híbrido de extracción de conocimiento, que combinaba anotación manual y extracción automatizada. Aproximadamente el 30% de los datos, incluidos textos clásicos y contenido semánticamente complejo, fueron anotados manualmente por expertos del dominio utilizando una plataforma de anotación estandarizada. El 70% restante de los datos se procesó utilizando grandes modelos de lenguaje (LLMs) para su extracción automatizada, incluyendo reconocimiento de entidades, extracción de relaciones y normalización terminológica. Todos los resultados generados automáticamente fueron revisados y corregidos por expertos para garantizar la precisión y la coherencia.
La extracción automatizada se realizó utilizando plantillas estructuradas de prompts diseñadas para guiar el comportamiento de los LLM (los ejemplos de plantillas se presentan en el Archivo Suplementario 2). Estas plantillas definían el rol del modelo como un experto en extracción de conocimiento específico de dominio e incorporaban ejemplos de aprendizaje de pocos disparos en formato JSON triplet para mejorar el rendimiento de extracción. Los resúmenes de la literatura preprocesada se enviaron mediante interfaces de programación de aplicaciones (APIs), y se implementaron estrategias de procesamiento paralelo para mejorar la eficiencia computacional. Las salidas de extracción se analizaban y validaban utilizando herramientas de validación JSON para garantizar la integridad estructural. Los tripletes de conocimiento validados se serializaban en archivos JSON independientes, nombrados según sus documentos fuente para mantener la trazabilidad.
El grafo de conocimiento finalizado se almacenaba en una base de datos de grafos e implementaba utilizando frameworks basados en Python. La visualización se realizó utilizando herramientas integradas de bases de datos de grafos para facilitar la inspección y validación.
Las entidades en el grafo de conocimiento se categorizaron en siete tipos: enfermedades, síntomas, patrones de síndrome, puntos de acupuntura, meridianos, métodos de tratamiento y sustancias efectoras y mecanismos biológicos. Se construyeron relaciones entre entidades para reflejar la lógica diagnóstica y terapéutica clínica, apoyando el razonamiento multi-saltos y la inferencia estructurada. La ontología y la estructura de relaciones se ilustran en la Figura 2. El esquema detallado del grafo de conocimiento y ejemplos de restricciones de relaciones se proporcionan en el Archivo Suplementario 3 y el Archivo Suplementario 4.

Figura 2: Ontología de grafos de conocimiento y modelo de relaciones. Representación esquemática de tipos de entidades y relaciones dentro del grafo de conocimiento. Las entidades centrales incluyen enfermedad, síntoma, síndrome, punto de acupuntura y método de tratamiento, y ilustran las relaciones diagnósticas y terapéuticas.
Por favor, haz clic aquí para ver una versión ampliada de esta figura.
2. Desarrollo de sistemas de aplicaciones
El sistema de aplicación se desarrolló a partir del grafo de conocimiento construido para permitir el apoyo a la decisión clínica. El sistema procesa datos de entrada de usuario y realiza análisis estructurados mediante procesamiento de lenguaje natural y razonamiento con grafos de conocimiento.
La comprensión del lenguaje natural se implementó utilizando el modelo BiLSTM-CRF para el reconocimiento y enlace de entidades nombradas; la arquitectura del modelo se muestra en la Figura 3. La arquitectura del modelo consistía en una capa de incrustación entrenada con corpus específicos de dominio, una capa bidireccional de memoria a corto plazo largo para capturar información contextual, y una capa condicional de campo aleatorio para asegurar el etiquetado óptimo de secuencias. El modelo se entrenó con datos clínicos y literarios anotados manualmente, con anotaciones realizadas de forma independiente por expertos del dominio. El acuerdo entre anotadores se evaluó usando el coeficiente kappa de Cohen, con un umbral de ≥0,85. Las discrepancias se resolvieron mediante consenso de expertos.

Figura 3: Arquitectura del modelo BiLSTM-CRF. Diagrama esquemático del modelo BiLSTM-CRF utilizado para el reconocimiento de entidades nombradas, incluyendo incrustaciones, capas BiLSTM y CRF.
Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Durante la inferencia, el modelo extrajo entidades estructuradas, incluyendo síntomas, enfermedades y patrones de síndromes, a partir de datos clínicos de entrada. Estas entidades se mapearon a nodos estandarizados en el grafo de conocimiento usando normalización terminológica, coincidencia vectorial basada en similitud coseno y desambiguación contextual.
La recuperación de conocimiento se realizó utilizando una estrategia de doble modo que combinaba enfoques basados en palabras clave y semántica. La recuperación por palabras clave utilizó la indexación de texto completo para la coincidencia precisa de entidades estructuradas, mientras que la recuperación semántica empleó representaciones vectoriales para identificar el conocimiento no estructurado relevante. Los resultados recuperados se fusionaron, deduplicaron y estructuraron para el procesamiento posterior. Se aplicó una estrategia de clasificación multidimensional para priorizar los resultados basándose en la coincidencia exacta, la similitud semántica y la relevancia de palabras clave, ajustando la ponderación para contextos ginecológicos y relacionados con la DOR.
El sistema generaba resultados diagnósticos y de tratamiento utilizando técnicas de generación de lenguaje natural, convirtiendo el conocimiento estructurado en respuestas clínicamente interpretables.
3. Aplicación clínica y evaluación
El sistema desarrollado se aplicó en un entorno clínico para evaluar su desempeño práctico. Los participantes del estudio fueron pacientes diagnosticados con reserva ovárica disminuida en un hospital terciario de Nankín que consintieron recibir tratamiento de acupuntura.
Los participantes eran elegibles si tenían entre 20 y 40 años y cumplían los criterios diagnósticos para la disminución de la reserva ovárica según los criterios POSEIDON de 2016 y el Consenso de Expertos Chinos de 2020. Los indicadores diagnósticos incluyeron una reducción de los niveles hormonales anti-Müllerianas y el recuento de folículos antrales < 5. Se excluyeron pacientes si presentaban condiciones que afectaban la fertilidad, comorbilidades graves o si habían recibido tratamiento de acupuntura para la fertilidad en los tres meses previos. El diagrama de flujo de inclusión y exclusión del paciente se muestra en la Figura 4.

Figura 4: Diagrama de flujo de inclusión y exclusión de pacientes. Diagrama de flujo que muestra la selección de pacientes. Un total de 127 pacientes cumplieron los criterios de inclusión, y 90 pacientes fueron incluidos tras aplicar criterios de exclusión y tener en cuenta los datos incompletos. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Los datos de los pacientes, incluyendo información demográfica y clínica, se recopilaron y registraron en un formato estructurado. Los participantes completaron cuestionarios estandarizados para recoger la información de síntomas e clínica (el cuestionario detallado se proporciona en el Archivo Suplementario 5). El sistema generaba resultados diagnósticos y prescripciones de acupuntura basándose en los datos de entrada.
El rendimiento del sistema se evaluó utilizando la precisión diagnóstica y la adecuación del tratamiento. La precisión diagnóstica se evaluó comparando los resultados de diferenciación del síndrome generados por el sistema con los proporcionados por tres médicos senior de MTC ginecológica, que sirvieron como estándar de referencia. La tasa de concordancia diagnóstica se calculó como la proporción de casos consistentes entre todos los casos.
La idoneidad del tratamiento fue evaluada por un panel de tres acupuntores senior con al menos cinco años de experiencia clínica y títulos profesionales superiores. Los expertos evaluaron de forma independiente las prescripciones generadas por el sistema utilizando una escala de Likert de 5 puntos. El acuerdo entre evaluadores se evaluó utilizando el coeficiente de concordancia (W) de Kendall.